具身智能(EAI)是指将人工智能嵌入机械人等有形实体,,,,,,,,使其具备感知、学习和动态加入周围情形的能力。。。。。。。。在本文中,,,,,,,,我们将深入探讨为 EAI 系统构建基础模子的手艺偏向选择。。。。。。。。相关于预训练好的天下模子系统,,,,,,,,我们以为元学习 + GPICL(通用上下文学习)要领为具身智能系统提供更好的学习能力,,,,,,,,具有更好的恒久顺应性和泛化能力,,,,,,,,因此有可能是最适合具身智能系统基础模子手艺蹊径。。。。。。。。
配景知识
- 元学习
元学习(Meta-Learning)是一种机械学习要领,,,,,,,,其目的是使模子能够快速顺应新使命并提高学习效率。。。。。。。。元学习的焦点头脑是通过学习怎样学习,,,,,,,,从而在面临新使命时能够迅速举行调解和顺应。。。。。。。。与古板的机械学习要领差别,,,,,,,,元学习不但关注模子在简单使命上的体现,,,,,,,,还关注模子在多个使命上的泛化能力。。。。。。。。
在元学习中,,,,,,,,模子通常通过在多个使命上的训练来学习共享知识。。。。。。。。每个使命可以被视为一个自力的学习历程,,,,,,,,模子通过这些使命来提高其元学习能力。。。。。。。。这种训练方法使得模子能够捕获到使命之间的共性,,,,,,,,从而在遇到新使命时能够使用这些共性举行快速学习和调解。。。。。。。。
元学习的一个要害组件是元训练(Meta-Training),,,,,,,,在这一阶段,,,,,,,,模子通过大宗差别使命的训练来学习元知识。。。。。。。。这些使命可以是相似的,,,,,,,,也可以是完全差别的。。。。。。。。通过在差别使命上的重复训练,,,,,,,,模子可以提取出能够在种种使命中使用的通用模式和战略。。。。。。。。在元学习历程中,,,,,,,,模子通常包括两个主要部分:快速顺应和元知识。。。。。。。。?????焖偎秤Σ糠秩险嬖诿扛鱿晗甘姑械难昂偷鹘猓,,,,,,,而元知识部分则生涯和治理从所有使命中提取的共性知识。。。。。。。。这种结构使得模子既能够举行详细使命的快速学习,,,,,,,,又能从多个使命中获取和使用元知识。。。。。。。。
元学习的一个主要应用是具身智能(Embodied AI),,,,,,,,例如机械人手艺。。。。。。。。在这些应用中,,,,,,,,模子需要一直顺应转变的情形和使命,,,,,,,,通过元学习,,,,,,,,机械人能够在差别情形和使命中快速调解和优化其行为,,,,,,,,而不需要每次都从零最先举行学习。。。。。。。。
元学习的要领有多种实现方法,,,,,,,,包括基于梯度的元学习、基于影象的元学习和基于模子的元学习。。。。。。。。;;;;;;谔荻鹊脑耙欤,,,,,,,如 MAML(Model-Agnostic Meta-Learning),,,,,,,,通过对多个使命的梯度信息举行优化,,,,,,,,使模子能够快速顺应新使命。。。。。。。。;;;;;;谟跋蟮脑耙焱ü娲⒑图焖魇姑喙氐男畔ⅲ,,,,,,,来提高模子的学习效率。。。。。。。。;;;;;;谀W拥脑胺焦嬖蛲ü杓铺囟ǖ哪W咏峁梗,,,,,,,使其能够更好地举行元学习。。。。。。。。
- 上下文学习
上下文学习(In-Context Learning)旨在使模子能够使用目今输入的上下文信息举行即时学习和推理。。。。。。。。与古板的训练-测试疏散的学习方法差别,,,,,,,,上下文学习允许模子在推理历程中动态地使用输入数据举行调解和刷新,,,,,,,,从而更好地明确和处置惩罚目今使命。。。。。。。。
在上下文学习中,,,,,,,,模子通过吸收一系列上下文信息(例如,,,,,,,,输入的句子、对话或使命形貌)来调解其内部状态和参数。。。。。。。。这种要领使得模子能够在不需要特殊训练的情形下,,,,,,,,使用上下文中的信息来举行推理和决议。。。。。。。。这种即时学习的能力使得模子能够在处置惩罚新的和未见过的使命时体现出更高的无邪性和顺应性。。。。。。。。上下文学习的焦点机制是模子使用输入序列中的信息来举行推理和调解。。。。。。。。详细来说,,,,,,,,模子会在处置惩罚每一个输入时,,,,,,,,团结之前的上下文信息,,,,,,,,对目今输入举行剖析和明确。。。。。。。。这种要领依赖于模子的内部影象机制,,,,,,,,如自注重力机制(Self-Attention),,,,,,,,来捕获和使用上下文中的要害信息。。。。。。。。
上下文学习在大规模预训练语言模子中获得了普遍应用。。。。。。。。例如,,,,,,,,GPT 系列模子(如 GPT-3)通过大宗的文本数据举行预训练,,,,,,,,学习到富厚的语言体现和知识。。。。。。。。在现实应用中,,,,,,,,这些模子可以通过输入一段上下文(如问题和相关信息),,,,,,,,即时天生相关的回覆或解决计划,,,,,,,,而不需要举行特另外微调。。。。。。。。这种能力使得上下文学习在自然语言处置惩罚、对话系统和其他需要动态顺应的使命中体现精彩。。。。。。。。
上下文学习的一个主要特征是其高效性和无邪性。。。。。。。。模子能够凭证上下文中的提醒和示例,,,,,,,,迅速调解其推理战略和行为,,,,,,,,从而在面临差别使命和场景时体现出更好的顺应性。。。。。。。。别的,,,,,,,,上下文学习还可以有用阻止古板学习要领中的灾难性遗忘问题,,,,,,,,由于它不依赖于长时间的训练和微调,,,,,,,,而是通过即时使用上下文信息举行推理和调解。。。。。。。。
在上下文学习的实现中,,,,,,,,自注重力机制起到了要害作用。。。。。。。。自注重力机制允许模子在处置惩罚每一个输入时,,,,,,,,关注和使用之前输入中的相关信息,,,,,,,,从而在上下文中建设起重大的依赖关系和模式。。。。。。。。这种机制使得模子能够捕获到上下文中的长程依赖关系,,,,,,,,并在推理历程中无邪应用。。。。。。。。
- 模子预训练
模子预训练(Model Pretraining)通过在大规模数据集上训练模子,,,,,,,,使其学习到普遍的特征体现和通用知识。。。。。。。。预训练的目的是通过在多种使命和大宗数据上训练模子,,,,,,,,使其具备强盛的泛化能力和富厚的知识储备。。。。。。。。
在模子预训练历程中,,,,,,,,通常;;;;;;嵫≡褚桓龃笮褪菁,,,,,,,这些数据集涵盖了差别领域和主题,,,,,,,,确保模子能够学习到多样化的信息。。。。。。。。常见的数据集包括文本、图像和音频等,,,,,,,,差别类型的数据集对应差别的预训练使命。。。。。。。。例如,,,,,,,,文本数据集可以用于训练语言模子,,,,,,,,图像数据集可以用于训练卷积神经网络(CNN)。。。。。。。。
预训练模子通常接纳无监视学习或自监视学习的要领举行训练。。。。。。。。在无监视学习中,,,,,,,,模子通过对数据的内在结构举行建模来学习特征体现,,,,,,,,而不依赖于人工标注的数据。。。。。。。。在自监视学习中,,,,,,,,模子通过天生部分标签或使用数据自己的结构信息来举行训练。。。。。。。。例如,,,,,,,,语言模子可以通过展望句子中的下一个词来举行自监视学习。。。。。。。。预训练历程通常包括以下几个办法:
首先,,,,,,,,选择适当的数据集举行预处置惩罚。。。。。。。。预处置惩罚办法包括数据洗濯、去除噪声、名堂转换等,,,,,,,,确保数据质量和一致性。。。。。。。。
接下来,,,,,,,,界说预训练使命和模子结构。。。。。。。。关于语言模子,,,,,,,,常见的预训练使命包括语言模子使命(展望下一个词)、掩码语言模子使命(展望被掩饰的词)和序列到序列使命(机械翻译、文本天生等)。。。。。。。。关于图像模子,,,,,,,,常见的预训练使命包括图像分类、目的检测和图像天生等。。。。。。。。
然后,,,,,,,,使用大规模数据集举行训练。。。。。。。。预训练历程中通常;;;;;;峤幽纱笈垦盗泛吐衍式盘算,,,,,,,,以加速逊з度。。。。。。。。通过反向撒播算法,,,,,,,,一直调解模子参数,,,,,,,,使其在预训练使命上抵达最优体现。。。。。。。。
在预训练完成后,,,,,,,,模子会具备强盛的特征提取能力和富厚的知识储备,,,,,,,,这为后续的特定使命提供了优异的基础。。。。。。。。例如,,,,,,,,预训练的语言模子可以在较小的特定使命数据集上举行微调,,,,,,,,从而快速顺应新使命,,,,,,,,提高模子的性能。。。。。。。。模子预训练的优势在于通过在大规模数据上学习,,,,,,,,使模子具备强盛的泛化能力和富厚的知识储备,,,,,,,,镌汰了对特定使命数据的依赖,,,,,,,,提高了模子的训练效率和效果。。。。。。。。别的,,,,,,,,预训练模子还可以迁徙到差别的使命和领域,,,,,,,,实现跨使命和跨领域的知识共享。。。。。。。。
- 模子微调
模子微调(Model Fine-Tuning)通过在预训练模子的基础上,,,,,,,,进一步使用特定使命的数据举行训练,,,,,,,,从而使模子在特定使命上抵达更高的性能。。。。。。。。微调的目的是使预训练模子顺应特定应用场景,,,,,,,,提高模子在特定使命上的体现。。。。。。。。预训练模子通常是在大规模数据集上举行训练的,,,,,,,,这些数据集涵盖了普遍的主题和领域。。。。。。。。通过这种方法,,,,,,,,模子能够学习到富厚的特征体现和通用知识。。。。。。。。然而,,,,,,,,在特定使命中,,,,,,,,通常需要越发详尽和专门化的能力,,,,,,,,这就需要通过微调来实现。。。。。。。。在微调历程中,,,,,,,,需要先将预训练模子的参数作为初始值,,,,,,,,然后使用特定使命的数据举行进一步训练。。。。。。。。这个历程通常涉及以下几个办法:
首先,,,,,,,,网络并准备特定使命的数据集。。。。。。。。这些数据通常是与特定应用场景相关的,,,,,,,,并且比预训练数据集要小得多。。。。。。。。数据集需要举行预处置惩罚,,,,,,,,包括洗濯、标注和名堂转换等办法。。。。。。。。
接下来,,,,,,,,将预训练模子加载到微调框架中。。。。。。。。预训练模子的参数已经在大规模数据上学习到了一样平常性的特征体现,,,,,,,,因此在微调历程中,,,,,,,,可以快速顺应特定使命的数据。。。。。。。。然后,,,,,,,,使用特定使命的数据举行训练。。。。。。。。在这个阶段,,,,,,,,通过反向撒播算法,,,,,,,,逐程序整模子的参数,,,,,,,,使其在特定使命上的体现一直提升。。。。。。。。训练历程中的学习率通常较低,,,,,,,,以阻止对预训练参数举行过大的调解,,,,,,,,导致模子过拟合。。。。。。。。在微调历程中,,,,,,,,经常;;;;;;峤幽梢恍┱蚧忠眨,,,,,,,如权重衰减和 Dropout,,,,,,,,以避免模子过拟合。。。。。。。。别的,,,,,,,,还可能使用早停法(Early Stopping)来监控验证集上的性能,,,,,,,,以决议训练何时阻止。。。。。。。。微调的最终目的是使模子在特定使命上具有较高的性能,,,,,,,,同时保存预训练模子所学到的通用知识。。。。。。。。这种要领的优势在于,,,,,,,,通过使用预训练模子的已有知识,,,,,,,,可以在较小的数据集上快速抵达优异的效果,,,,,,,,而不需要重新最先训练一个新模子。。。。。。。。
模子微调普遍应用于种种自然语言处置惩罚使命,,,,,,,,如文天职类、情绪剖析、问答系统和机械翻译等。。。。。。。。通过微调,,,,,,,,预训练模子可以有用地顺应差别的应用场景,,,,,,,,提高其在特定使命上的准确性和鲁棒性。。。。。。。。
具身智能的基础模子
在此之前,,,,,,,,我们已经概述了开发具身人工智能(EAI)系统的三个指导原则[1]。。。。。。。。EAI 系统不应依赖预界说的重大逻辑来处置惩罚特定场景。。。。。。。。相反,,,,,,,,它们必需团结进化学习机制,,,,,,,,从而能够一直顺应运行情形。。。。。。。。别的,,,,,,,,情形不但会严重影响物理行为,,,,,,,,还会影响认知结构。。。。。。。。第三项原则着重于模拟仿真,,,,,,,,而前两项原则则强调建设能够从 EAI 系统运行情形中学习的 EAI 基础模子。。。。。。。。
EAI 基础模子的常见要领是直接使用预训练的大型模子。。。。。。。。例如,,,,,,,,预训练的 GPT 模子可以作为基线,,,,,,,,然后通过微协调上下文学习(ICL)来提高性能[2]。。。。。。。。这些大型模子通常拥有大宗参数来编码普遍的天下知识,,,,,,,,并具有较小的上下文窗口以实现快速响应时间。。。。。。。。这种普遍的预编码使这些模子能够提供精彩的 Zero-shot 性能。。。。。。。。然而,,,,,,,,它们有限的上下文窗口给从 EAI 系统的运行情形中一连学习和毗连种种使用场景带来了挑战。。。。。。。。
另一种要领是使用参数少得多但上下文窗口更大的模子。。。。。。。。这些模子并不编码周全的天下知识,,,,,,,,而是专注于学习怎样学习,,,,,,,,即元学习[3]。。。。。。。。有了大的上下文窗口,,,,,,,,这些模子就可以执行通用上下文学习(GPICL),,,,,,,,从而能够从其运行情形中一直学习,,,,,,,,并在普遍的上下文中建设联系。。。。。。。。
图 1 EAI 的基础模子选项
图 1 展示了这两种差别的要领。。。。。。。。元训练 + GPICL 要领虽然 Zero-shot 性能较差,,,,,,,,模子规模较。。。。。。。。,,,,,,,但在一直从情形中学习方面体现精彩,,,,,,,,最终使 EAI 系统专门用于特定使命。。。。。。。。相比之下,,,,,,,,预训练 + 微调 + ICL 要领的特点是模子规模较大,,,,,,,,上下文窗口较。。。。。。。。,,,,,,,Zero-shot 性能优越,,,,,,,,但学习能力较差。。。。。。。。
GPT-3 论文中的履历证据支持了这一点,,,,,,,,在该论文中,,,,,,,,7B 少量学习模子优于 175B Zero-shot 学习模子[4]。。。。。。。。若是用较长的上下文窗口来取代 Few-shot 学习,,,,,,,,使 EAI 系统能够从其运行情形中学习,,,,,,,,性能可能会进一步提高。。。。。。。。
我们设想的 EAI 理想基础模子应切合几个要害标准。。。。。。。。首先,,,,,,,,它应该能够从重大的指令、演示和反响中普遍学习,,,,,,,,而无需依赖全心设计的优化手艺。。。。。。。。其次,,,,,,,,它在学习和顺应历程中应体现出较高的样本效率。。。。。。。。第三,,,,,,,,它必需具备通过上下文信息一连学习的能力,,,,,,,,有用阻止灾难性遗忘问题。。。。。。。。因此,,,,,,,,我们以为元学习 + GPICL 要领适用于 EAI 系统。。。。。。。。不过,,,,,,,,在决议接纳这种要领之前,,,,,,,,我们先来看看这两种要领之间的权衡。。。。。。。。
构建具身智能基础模子的要害权衡
在本节中,,,,,,,,我们将回首以通用上下文学习为基础的 EAI 预训练大模子计划和现有主流手艺计划的差别。。。。。。。。该手艺计划配景可以参考“Benchmarking General-Purpose In-Context Learning”[5]。。。。。。。。这篇论文受元学习和大语言模子训练流程启发,,,,,,,,提出以元学习(Meta-training)+ 通用上下文学习(GPICL)替换预训练(Pre-training)+ 微调(Fine-Tuning)+ 上下文学习(ICL)的学习范式以实现更好的泛化性息争决更多样的使命,,,,,,,,可以应用于大语言模子,,,,,,,,也可以被应用到被以为是具身智能的基石的天下模子和决议模子类使命。。。。。。。。
在 Zero-shot 能力方面,,,,,,,,预训练 + 微调 + ICL 要领具有很高的性能,,,,,,,,可以让模子很好地泛化到新使命中,,,,,,,,而不需要任何特定使命的微调[2]。。。。。。。。相比之下,,,,,,,,元训练 + GPICL 要领的 Zero-shot 泛化能力较低,,,,,,,,由于该要领的重点是通过上下文学习来顺应种种使命,,,,,,,,而不是 Zero-shot 泛化。。。。。。。。
在泛化能力方面,,,,,,,,预训练 + 微调 + ICL 要领在漫衍内使命中体现精彩,,,,,,,,但在训练数据集漫衍外使命中能力有限。。。。。。。。另一方面,,,,,,,,元训练 + GPICL 由于强调在差别情境下举行元训练,,,,,,,,因此在训练数据集漫衍外使命中体现出多样化和重大的泛化能力。。。。。。。。
预训练 + 微调 + ICL 的可扩展性增强要领包括扩展参数和预训练数据集,,,,,,,,以提高性能。。。。。。。。元训练 + GPICL 通过扩大元训练使命、上下文长度、内存和隐藏状态来提高模子的顺应性,,,,,,,,从而增强可扩展性。。。。。。。。
在使命顺应方面,,,,,,,,预训练 + 微调 + ICL 依赖于数据网络和微调,,,,,,,,这可能效率不高。。。。。。。。相比之下,,,,,,,,元训练 + GPICL 使用很是重大的指令,,,,,,,,自动从差别的语境中学习。。。。。。。。
在预训练或元训练阶段,,,,,,,,预训练 + 微调 + ICL 着重于天下知识和对硬件的明确。。。。。。。。元训练 + GPICL 强调学习、影象和笼统种种使命的能力。。。。。。。。
在训练后阶段,,,,,,,,预训练 + 微调 + ICL 涉及将模子与以人为中心的详细使命相匹配,,,,,,,,强调人机匹配和使命特定知识。。。。。。。。元训练 + GPICL 继续强调天下知识、人类对齐和特定使命知识。。。。。。。。
预训练 + 微调 + ICL 的推理延迟一样平常较低,,,,,,,,由于模子参数在训练后是牢靠的。。。。。。。。然而,,,,,,,,关于元训练 + GPICL,,,,,,,,由于需要动态地使用和更新内存和隐藏状态,,,,,,,,推理速率可能较慢。。。。。。。。
预训练 + 微调 + ICL 所需的内存容量很。。。。。。。。,,,,,,,由于大部分知识都包括在牢靠的模子参数中。。。。。。。。相反,,,,,,,,元训练 + GPICL 需要大宗内存来处置惩罚重大指令、扩展上下文和隐藏状态。。。。。。。。
元训练 + GPICL 的优势在于能让系统通过情境一直学习种种使命,,,,,,,,即学会一直学习[6]。。。。。。。。这主要要求系统能够在不遗忘旧使命的情形下学习新使命,,,,,,,,这通常;;;;;;岣谔荻鹊奈⒌鞔粗卮筇粽剑–atastrophic forgetting[7]),,,,,,,,但关于情境内学习来说,,,,,,,,挑战可能较小。。。。。。。。
表 1 预训练大型模子与元训练 + GPICL 的利弊权衡
战胜盘算和内存瓶颈
从上述较量中可以看出,,,,,,,,元训练与 GPICL 的团结可在种种重大使命中提供卓越的顺应性和泛化能力。。。。。。。。然而,,,,,,,,这种要领对资源的要求较高,,,,,,,,对大大都 EAI 系统组成了挑战,,,,,,,,由于这些系统通常是盘算能力和内存有限的实时边沿装备。。。。。。。。这种要领所需的大型上下文窗口会大大增添推理时间和内存占用,,,,,,,,可能会阻碍其在 EAI 基础模子中的可行性。。。。。。。。
幸运的是,,,,,,,,最近的前进为基于变换器的大型语言模子(LLM)的扩展提供了立异解决计划,,,,,,,,使其能够处置惩罚无限长的输入,,,,,,,,同时坚持有限的内存和盘算效率。。。。。。。。一个值得注重的立异是 Infini-attention(无限注重)机制,,,,,,,,它在单个变换器块中集成了遮蔽局部注重和恒久线性注重[8]。。。。。。。。这样就能高效处置惩罚短程和远程上下文依赖关系。。。。。。。。别的,,,,,,,,压缩影象系统允许模子以有限的存储和盘算本钱维护和检索信息,,,,,,,,重复使用旧的键值(KV)状态,,,,,,,,以提高影象效率,,,,,,,,实现快速流推理。。。。。。。。实验效果批注,,,,,,,,Infini-attention 模子在长语境语言建模;;;;;;疾馐灾械奶逑钟庞诨吣W樱,,,,,,,在涉及超长输入序列(多达 100 万个词组)的使命中体现出卓越的性能,,,,,,,,并显著提高了内存效率和疑心度得分。。。。。。。。
同样,,,,,,,,StreamingLLM 框架能让使用有限注重力窗口训练的大型模子泛化到无限序列长度,,,,,,,,而无需举行微调[9]。。。。。。。。这是通过保存作为注重力汇的初始标记的键和值(KV)状态以及最新标记来实现的,,,,,,,,从而稳固注重力盘算,,,,,,,,并在扩展文本中坚持性能。。。。。。。。StreamingLLM 善于对多达 400 万个标记的文本举行建模,,,,,,,,速率显著提高了 22.2 倍。。。。。。。。
结论
总之,,,,,,,,我们以为从情形中学习是 EAI 系统的基本特征,,,,,,,,因此元训练 + GPICL 要领具有更好的恒久顺应性和泛化能力,,,,,,,,有望用于构建 EAI 基础模子。。。。。。。。虽然现在这种要领在盘算和内存使用方面面临重大挑战,,,,,,,,但我们信托,,,,,,,,Infini-attention 和 StreamingLLM 等立异手艺将很快使这种要领在资源受限的实时情形中变得可行。。。。。。。。
参考资料
1.A Brief History of Embodied Artificial Intelligence, and its Outlook, Communications of the ACM, https://cacm.acm.org/blogcacm/a-brief-history-of-embodied-artificial-intelligence-and-its-future-outlook/
2.Ouyang, Long, et al. "Training language models to follow instructions with human feedback." Advances in neural information processing systems 35 (2022): 27730-27744.
3.Kirsch, L., Harrison, J., Sohl-Dickstein, J. and Metz, L., 2022. General-purpose in-context learning by meta-learning transformers. arXiv preprint arXiv:2212.04458.
4.Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J.D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A. and Agarwal, S., 2020. Language models are few-shot learners. Advances in neural information processing systems, 33, pp.1877-1901.
5.Wang, F., Lin, C., Cao, Y. and Kang, Y., 2024. Benchmarking General Purpose In-Context Learning. arXiv preprint arXiv:2405.17234.
6.Beaulieu, Shawn, et al. "Learning to continually learn." ECAI 2020. IOS Press, 2020. 992-1001.
7.French, Robert M. "Catastrophic forgetting in connectionist networks." Trends in cognitive sciences 3.4 (1999): 128-135.
8.Munkhdalai, T., Faruqui, M. and Gopal, S., 2024. Leave no context behind: Efficient infinite context transformers with infini-attention. arXiv preprint arXiv:2404.07143.
9.Xiao, G., Tian, Y., Chen, B., Han, S. and Lewis, M., 2023. Efficient streaming language models with attention sinks. arXiv preprint arXiv:2309.17453.
作者 | 刘少山、叮嘱
责编 | 唐小引
出品丨AI 科技大本营
本文经授权转载自微信公众号「AI科技大本营」(ID:rgznai100)
