资讯详情

元学习介绍

📅 2026/10/10 1:15:16 | 华诺云谱 👁 阅读
元学习介绍
元学习起源于 2017 年 NIPS 会议上加利福尼亚大学伯克利分校教授彼得·阿贝尔Pieter Abbeel的一场报告报告的专题是【元学习】提出元学习可以大大缩短训练时间可以解决一些非常棘手的学习问题。元学习是让 AI 学习很多类似的任务使用已经在许多其他非常类似的任务中训练的模型在面对类似的新任务时仅仅使用少量训练样例就可有效地学习。它通常用于解决「One Shot Learning」问题即在训练样本很少甚至只有一个样本的情况下依旧能进行预测。元学习系统中通常有两种学习者基础学习者或快速学习者和元学习者或慢学习者。基础学习者在快速更新的任务中接受训练元学习者在与任务无关的多元空间中运行其目标是跨任务传递知识「知识迁移」。在许多情况下基础学习者和元学习者可以使用相同的学习算法。通过这种双层架构元学习能够学会「如何学习」。具体办法就是先用各种各样的任务训练网络当它学会了几百个任务如识别了 500 幅不同主题的图片再做下一个任务如识别第 501 幅图片时就十分容易了。用这 500 幅图片进行识别任务训练时要做完一个丢弃一个相当于遗忘一个。神经网络不是学习具体某个知识而是学会这些任务的共同特征。例如让 AI 解决许多迷宫问题学会走出迷宫之后即使再进入新的迷宫也可以很快计算出如何快速离开。元学习将学习任务视为学习范例。下面介绍两种比较典型的元学习算法。模型不可知元学习深度强化学习是基于强化学习的很有前景的算法已经被有效地用于机器人智能操作但是在算法实现时反应速度还太慢。为了缩短深度强化学习的学习时间加利福尼亚大学伯克利分校的研究人员在 2017 年提出了一种模型不可知元学习Model-Agnostic Meta-LearningMAML [198] 方法。通过引用多个任务来对相同结构的神经网络进行训练如果只学习几次即可获得权重的初始值则该权重就成为训练完成后每个不同任务的神经网络的权重。使用这种方法时可以根据情况将神经网络的权重初始值设置为可以对应于具有轻微变化的不同任务的值成为在不同任务中共同使用的动作元素。这种元学习方法适用于任何用梯度下降法训练的模型其关键思路是训练模型的初始参数值。对于新任务来说有个相对于参数的损失函数要把这个损失函数的灵敏度提高。高灵敏度意味着参数的微小变化可能导致损失的明显改善。通过这些参数可以简单地模拟模型从而在只具有少量训练样例的新任务中表现良好。元学习方法后来也有了不少改进版本如元网络可以在不同的时间尺度上更新权重。元学习方法中的元级别信息缓慢更新而任务级权重在每个任务的范围内进行更新。MAML 方法已经用在了真实的机器人身上。研究人员对机器人先进行多次跑步训练然后它们得到「初始值」就是机器人在原地跑步即它知道如何跑只是不知朝哪个方向跑。一旦新任务下达它就会马上朝新任务定义的方向跑。这就大大增强了学习的速度和系统敏捷度。元学习共享分层另一种元学习算法是元学习共享分层Meta Learning Shared HierarchiesMLSH [199] 其架构如图 11.2 所示分为主策略和子策略两个层次主策略针对单个任务子策略针对任务共有的动作元素。MLSH 方法的子策略学习各种任务通用的动作要素把一组子策略先训练好以供挑选。当处理新任务的学习时主策略根据传感器值输出子策略选择概率可立即找出一组强大的子策略然后通过更新主策略来处理新任务的学习。因此子策略相当于一组工具而主策略借助一组工具即可完成新任务。这是基于分层强化学习的思想智能体将复杂的操作表示为一个高级操作的简短序列。这样的智能体可以解决更难的任务解决方案可能需要 1000 个低级别的操作但分层策略将其转换为 10 个高级操作的序列这比搜索 1000 步序列的效率高多了。因此它可以达到快速学习的目标仅凭主策略的学习即可快速解决问题。快速学习是人类智能的标志无论是从几个例子中识别物体还是在几分钟内快速学习新技能。真正的 AI 应该能够做同样的事情只从几个例子中快速学习和适应并在更多数据可用的时候能够继续适应和处理。这种快速、灵活的学习具有挑战性因为必须将其先前的经验与很少量的新信息相结合同时避免过度使用新数据。此外先前经验和新数据的形式将取决于任务。因此为了达到最大的适用性学习或元学习的机制应该具备任务形式和计算形式的通用性。与 MAML 类似MLSH 也已在机器人领域得到应用。走入迷宫的 MLSH 机器人能发现各种子策略即向前、向后、向左、向右这 4 个不同的移动方向然后自己导航走出迷宫。如果让机器人再走一遍另外的迷宫它同样可以很快走出来。最近几年在最初的元学习算法基础上又有很多研究人员发表了改进的元学习版本及相关论文。这些改进包括从存储器访问的架构上改进元学习、把优化问题看作「元优化」来作为元学习的一种类别、使用 LSTM 来实现元学习、扩展型 MAML 等。这些研究成果和论文反映了在 DNN 的背景下学术界对元学习有了新的认识和创新。元学习有点类似于 AI 进化算法见第 9 章。大自然的生物通过一代代的进化来优化物种基于这种思路的 AI 算法曾经广泛应用在优化领域。元学习也是通过一次次的训练来达到优化算法的目的但它是有引导的精准训练而不是进化算法里使用的随机方法这是一个最大的区别。终身学习在最新的 AI 算法中与元学习密切相关的是终身学习Life-long Learning算法。该算法通过积累过去获得的知识而不断学习然后用在未来的学习和问题解决中。然而当前主流的深度学习范式是孤立学习的给定训练数据集在此数据集上运行深度学习算法以生成模型然后将其用于所需要的应用。它不试图保留所学到的知识并将其用于后续学习。与深度学习 AI 系统不同人类仅通过几个例子就能进行有效的学习这恰恰是因为人类的学习是知识驱动的过去所学的知识可以帮助人类以很少的数据或精力来学习新事物。终身学习算法的目的就是模仿人类的这种学习功能从而使 AI 系统的智力水平有所提高。在现实生活中大多数时候人们会期望许多新任务从根本上与旧任务不同。而终身学习没有这个假设它会选择适用于新任务的先前知识。终身学习方法是持续学习过程明确进行知识保留和积累并使用先前学到的知识来帮助学习新任务。此外终身学习还能够发现新任务并逐步学习它们并在现实应用中学习其他知识以改进模型。其他比较受关注的还有迁移学习和多任务学习范式。这两种范式都涉及跨领域或跨任务的知识迁移但它们不会持续学习也不会明确地保留或积累学到的知识构建可以处理数百万个任务并学会自动完成新任务的深度学习系统要面临巨大的挑战。而元学习通过大量任务训练元模型只需几个例子即可快速适应新任务。但是大多数元学习技术的一个重要前提是新任务要与所训练过的任务来自同一类别如训练识别猫、狗的图片之后新任务也是识别图片这是一个致命的弱点限制了其应用范围。用类脑芯片实现元学习如前所述元学习是一种带有「学会如何学习」功能的算法这种功能已经被奥地利和德国的大学研究人员使用类脑芯片见第 5 章实现 [200] 。通常类脑芯片的超参数和学习算法需要人工选择以适应新的特定任务。相比之下大脑神经元网络是通过广泛的进化和发展过程进行优化的可以在一系列计算和学习任务中发挥作用。这个过程有时可以通过遗传算法模拟但需要人工设计细节并只能提供有限的改进。元学习这种「学会如何学习」的功能特别适合类脑芯片架构。在类脑芯片上模拟的脉冲神经元通常表现出会加速的动态特性。研究人员采用了强大的无梯度优化工具如交叉熵方法和进化策略将生物优化过程的功能移植到类脑芯片中。结果显示这些优化算法使神经形态智能体能够非常有效地从奖励中学习。特别要指出的是所谓的元可塑性即算法所使用的学习规则的优化这实质上增强了硬件基于奖励的学习能力。奥地利和德国的大学研究人员首次展示了从这种芯片中「学习如何学习」的好处特别是从先前的学习经验中提取抽象知识的能力这加速了对新的相关任务的学习。同时「学会如何学习」的功能本身也可以加速类脑芯片因为这样它可以执行所需的大量网络计算从而释放类脑芯片的全部潜力。这种元学习 AI 芯片采用一种数模混合信号设计具有用于神经元和突触、基于脉冲的连续时间通信的模拟电路以及一个嵌入式微处理器由台积电以 65nm 工艺的 CMOS 来实现。它把 32 个神经元连接到 32×32 的突触交叉开关阵列使每个神经元可以接收来自 32 个突触列的输入。突触权重设置为 6 位精度并且可以按行配置以提供兴奋性或抑制性输入。突触具有局部短期可塑性和长期可塑性由嵌入式微处理器实现。这类利用元可塑性设计的类脑芯片的成功为今后更好地实现元学习、迁移学习、终身学习等范式的 AI 芯片作了一次很好的尝试。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。

↑