人类对物理纪律的明确并非与生俱来,,,,,,,,而是通过一连视察、影象与总结,,,,,,,,逐步构建对情形的认知,,,,,,,,并据此做出展望与决议。。。。。。。。人工智能若要复现这一历程,,,,,,,,要害依赖于“天下模子”。。。。。。。。现在,,,,,,,,天下模子被视为通用人工智能(AGI)与具身智能的基石。。。。。。。。然而,,,,,,,,一个被恒久忽视的问题始终保存:仅靠碎片化数据训练出的静态天下模子,,,,,,,,真的足以支持通用智能吗?????
目今大大都天下模子看似掌握了物理纪律,,,,,,,,实则犹如填鸭式影象——它们能展望出切合知识概率漫衍的效果,,,,,,,,却缺乏长时影象、一连修正认知、刷新自身的能力。。。。。。。。相比之下,,,,,,,,人类面临生疏、未知或不切合预期的情境时,,,,,,,,会本能地集中注重力,,,,,,,,通过视察一直修正认知。。。。。。。。这种自动学习与影象更新的能力,,,,,,,,正是人类智能可塑性的焦点。。。。。。。。这一能力的缺失,,,,,,,,严重限制了目今静态天下模子的现实应用。。。。。。。。这可以通过两个例子来说明:
- 空间认知的局限:当模子首次“进入”某个房间前,,,,,,,,只能给出模糊的“可能结构”展望;;;;;;;而人类虽无法像机械般穷举所有可能性,,,,,,,,却能通过一次真实造访,,,,,,,,在再次造访时做出精准预判。。。。。。。。相反,,,,,,,,缺乏影象机制的智能体,,,,,,,,无法像人类那样使用上下文履历实现认知跃迁。。。。。。。。
- 动态纪律的盲区:物理纪律并非静态公式,,,,,,,,如地面与外太空的重力差别、未知质料的特征转变等,,,,,,,,都无法用既有模子简朴外推。。。。。。。。更深条理看,,,,,,,,关于宇宙物理纪律的认知,,,,,,,,从牛顿定律到相对论,,,,,,,,人类的知识也在一直修正。。。。。。。。人类会先视察推理新情形下的物理纪律,,,,,,,,再将其运用于后续盘算,,,,,,,,而古板天下模子却容易陷入“用旧地图走新大陆”的逆境。。。。。。。。
智能的通用性和泛化性,,,,,,,,不在于记着几多纪律,,,,,,,,而在于像人类一样——永远坚持对未知的好奇,,,,,,,,在视察中进化,,,,,,,,在影象中生长。。。。。。。。从上述意义上看,,,,,,,,目今绝大部分天下模子无法知足这样的需要,,,,,,,,从理论上也不可能仅仅通过数据规模和参数规模解决。。。。。。。。
优德官网具身智能中心王凡博士等人的最新研究《Context and Diversity Matter: The Emergence of In-Context Learning in World Models》直指这一“房间里的大象”。。。。。。。。研究发明,,,,,,,,当天下模子在具备足够多样的情形、长序列数据上训练,,,,,,,,并具备长上下文建模能力时,,,,,,,,就能引发出类似人类的上下文学习(In-Context Learning, ICL)能力,,,,,,,,从而挣脱“死记硬背”,,,,,,,,实现真正的情形顺应。。。。。。。。
理论剖析:天下模子的上下文学习涌现的数据纪律
天下模子的上下文学习需要知足哪些条件?????只管上下文学习已在大语言模子领域获得充分研究,,,,,,,,但在天下模子领域,,,,,,,,相关研究仍不充分。。。。。。。。优德官网的研究着眼于天下模子训练数据的漫衍,,,,,,,,并基于贝叶斯假设,,,,,,,,针对马尔科夫决议或隐马尔科夫决议历程的天下模子,,,,,,,,提出至少保存两类上下文学习模式:
- 情形辨识(ER, 参数影象 + 上下文区分):在预训练历程中,,,,,,,,模子参数保存了所有训练情形相关的影象和知识。。。。。。。。上下文信息主要起区分作用。。。。。。。。
- 情形学习 (EL,,,,,,,,真正上下文学习):在预训练历程中,,,,,,,,模子参数只管少保存先验假设,,,,,,,,完全依赖上下文举行推理。。。。。。。。
该研究从理论层面剖析了这两种模式的误差上界,,,,,,,,并发明了以下有趣的特征:
- 两类学习模式的误差上界都与上下文长度T的平方根成反比,,,,,,,,即包括T^{-1/2}项。。。。。。。。这意味着,,,,,,,,长上下文是天下模子具备学习能力、降低误差的先决条件。。。。。。。。
- ER模式的误差上界受预训练情形和推理情形之间的最小误差(BME)影响,,,,,,,,而EL模式则不受影响。。。。。。。。这批注,,,,,,,,为了降低预训练数据漫衍引入的内在偏倚,,,,,,,,必需尽可能引发EL模式。。。。。。。。
- EL模式在情形荟萃多样性强、情形数目多、序列长,,,,,,,,且单个情形自身重漂后较低的条件下,,,,,,,,更容易被引发。。。。。。。。
基于上述特征,,,,,,,,可以进一步推断:越是重大的情形,,,,,,,,为了有用引发上下文学习能力,,,,,,,,越需要更多样化、规模更大的情形荟萃。。。。。。。。 这也展现了当宿天下模子面临的重大数据逆境。。。。。。。。
实验验证
基于上述理论,,,,,,,,短序列天下模子保存先天局限,,,,,,,,且无法验证该理论自己。。。。。。。。为此,,,,,,,,团队设计了一种轻量级线性注重力架构L2World(Linear-attention Long-context World Model),,,,,,,,其具备无限外推能力,,,,,,,,能在推理历程中通过更新隐状态影象来一连提升自身能力。。。。。。。。

本文选取了两个具有代表性的决议控制问题举行实验:
- 异构倒立摆:模子需要顺应差别的物理参数,,,,,,,,例如重力和质量。。。。。。。。
- 异构房间导航:模子需要在具有多样化结构的迷宫或房间中一连探索、影象并优化行进路径。。。。。。。。

L2World在两类问题和差别数据漫衍下举行了训练,,,,,,,,使用了凌驾 3 亿帧的图片数据。。。。。。。。研究比照了相同数据量下,,,,,,,,差别情形数目和多样性(漫衍规模)的影响,,,,,,,,并验证了相关理论的有用性。。。。。。。。
例如,,,,,,,,在130个差别倒立摆情形下的测试批注,,,,,,,,当上下文长度足够时,,,,,,,,天下模子展望误差的上界与BME重合。。。。。。。。随着情形多样性增添,,,,,,,,误差上界逐渐下降并偏离BME,,,,,,,,证实晰EL和ER两种模式的保存。。。。。。。。
别的,,,,,,,,随着上下文增添,,,,,,,,L2World的展望误差一连下降,,,,,,,,恒久影象的优势逐渐展现,,,,,,,,最终逾越了以单帧清晰度为优势的扩散模子(如NWM)。。。。。。。。实验还证实了数据漫衍对情形学习的要害作用:纵然使用相同的数据量,,,,,,,,由于数据漫衍的差别,,,,,,,,天下模子的上下文学习能力也爆发了显著差别。。。。。。。。相比于基于扩散模子的NWM等模子,,,,,,,,L2World在单帧展望清晰度上保存较大差别,,,,,,,,但随着上下文增添,,,,,,,,其长时影象能力逐渐施展优势,,,,,,,,使L2World具备更优异的展望性能。。。。。。。。

最后,,,,,,,,论文还剖析发明EL/ER模式与人类"展望编码"能力具有配合特征,,,,,,,,并发明模子的影象空间在推理历程中自然构建出差别迷宫的结构。。。。。。。。这种认知在网络的较高层级才逐渐形成,,,,,,,,证实晰天下模子的上下文学习可能完全替换SLAM等人工建模要领。。。。。。。。

结论与意义
这项事情首次系统论证了“长上下文 + 多样性”对天下模子一连学习能力的决议性作用,,,,,,,,为破解静态模子自主进化和一连学习的逆境提供了可行路径。。。。。。。。它不但让天下模子从“知识库”迈向“智能体”,,,,,,,,更为具身智能涤讪真正的认知基石:能影象、能学习、能进化。。。。。。。。
论文链接:https://arxiv.org/abs/2509.22353
相关代码:https://github.com/airs-cuhk/airsoul/tree/main/projects/MazeWorld
