超越视频的世界模型,游戏和机器人为何是AGI真正的试验场
从DeepMind的Genie到AMI Labs,世界模型正在悄然成为真正理解物理的AI的基础。5000亿美元的游戏市场可能是它们首先证明自己的地方。

当Yann LeCun宣布离开Meta并推出获得5亿欧元资金支持的AMI Labs时,他表达了许多研究者多年来默默相信的观点。尽管大型语言模型具有令人印象深刻的能力,但它们在通往通用人工智能的道路上是一条死胡同。它们预测词语而不理解现实。
那么替代方案是什么,世界模型。学习模拟物理世界如何运作的系统。
语言模型的根本局限
世界模型学习预测视觉环境中接下来会发生什么,而不仅仅是文本中接下来会出现什么词。这需要理解物理、物体永久性和因果关系。
语言模型擅长跨文本的模式匹配。它们可以写诗、调试代码、进行感觉上非常人类化的对话。但要求GPT-4预测掉落球会发生什么,它会依赖于记忆的描述而不是真正的物理直觉。
这很重要,因为我们在生物世界中体验的智能从根本上是建立在物理现实之上的。一个学习堆积木块的幼儿会在学习语言之前,就已经对重力、平衡和材料属性有了直观的理解。这种具身认知,这种对世界如何运作的感觉,恰好是当前AI系统所缺乏的。
世界模型的目标是弥补这一差距。它们不是预测下一个词,而是预测下一帧、下一个物理状态、一个动作的下一个后果。
三种世界理解方法
建立世界理解AI的竞赛已经分裂成三个不同的范例,各有不同的优势。
在大规模视频数据集上训练以学习隐式物理。例子包括Sora和Veo。擅长生成合理的延续但在交互场景中苦苦挣扎。
构建显式物理引擎并训练AI导航它们。需要昂贵的手动环境构造但提供精确的物理精度。
第三种方法,也许最有前景的方法,结合两者:从视频中学习世界动力学,同时保持与环境交互和操纵的能力。这就是游戏变得必不可少的地方。
游戏,完美的训练场
电子游戏提供了独特的东西:具有一致物理规则的交互式环境、无限变化和清晰的成功指标。与需要昂贵硬件并存在安全问题的真实世界机器人不同,游戏提供无限失败而无后果。
DeepMind很早就认识到了这种潜力。他们的Genie系统可以从单个图像生成全新的可玩环境。给它一个平台游戏关卡的草图,它会创建一个物理一致的世界,其中角色可以跳跃、跌落并适当地与物体交互。
Genie之所以引人注目,不仅是因为生成,还因为理解。该系统学习可跨越不同视觉风格和游戏类型转移的可概括物理概念。一个在Mario风格平台游戏上训练的模型会开发对重力和碰撞的直觉,同样适用于手绘独立游戏和逼真的3D环境。
从游戏到机器人
游戏到机器人的管道不是理论性的。公司已经在使用它。
识别仿真差距
研究表明纯粹在仿真中训练的模型在真实世界的混乱中苦苦挣扎:变化的光照、不完美的传感器、意外的物体。
混合方法出现
团队将游戏训练的世界模型与有限的真实世界微调相结合,大大减少机器人训练所需的数据。
商业部署开始
第一批使用世界模型骨干的仓库机器人进入生产,在没有明确编程的情况下处理新物体。
推动这一转变的见解很简单:物理就是物理。一个真正理解物体如何在电子游戏中坠落、滑动和碰撞的模型,经过适当调整,应该理解真实世界中的相同原理。视觉外观改变,但底层动力学保持不变。
特斯拉在他们的Optimus机器人中追求了这个策略的一个版本,先在仿真中训练,然后在受控的工厂环境中部署。限制因素一直是模拟物理和真实物理之间的差距。在多样化视频数据上训练的世界模型最终可能会弥合这一差距。
AMI Labs的赌注
Yann LeCun的新企业AMI Labs代表了迄今为止对世界模型研究最大的单笔投资。有5亿欧元的欧洲资金和从Meta、DeepMind和学术实验室招募的团队,他们正在追求LeCun所称的"目标驱动AI"。
与预测词的LLM不同,AMI的方法侧重于学习世界的表示,使规划和推理物理后果成为可能。
技术基础建立在联合嵌入预测架构(JEPA)上,这是LeCun多年来倡导的框架。JEPA不是生成像素级预测(这需要巨大的计算资源),而是学习捕捉物理系统本质结构的抽象表示。
想象是这样的:人类看着球滚向悬崖时,不会模拟球轨迹的每个像素。相反,我们识别抽象情况(球、边缘、重力)并预测结果(坠落)。JEPA的目标是捕捉这种高效的抽象推理。
对AI视频生成的影响
这一研究轨迹对创意应用意义深远。目前的AI视频生成器产生了令人印象深刻的结果,但受到时间不一致的困扰。角色变形、物理破裂、物体出现和消失。
世界模型提供了一个潜在的解决方案。一个真正理解物理的生成器应该产生物体遵守一致规则的视频,掉落的物品可预测地坠落,反射正确地表现。
模型生成视觉上合理的帧而不强制物理一致性。适用于短片段但在较长时间内崩溃。
物理一致性来自学习的世界动力学。更长、更连贯的视频成为可能,因为模型保持世界的内部状态。
我们已经看到这一转变的早期迹象。Runway的GWM-1代表了他们对世界模型的赌注,而Veo 3.1改进的物理仿真表明Google正在融合类似的原理。
AGI的连接
为什么这一切对人工通用智能很重要,因为真正的智能需要的远不止语言操纵。它需要理解因果关系、预测后果和在物理世界中规划行动。
具身认知
真正的智能可能需要建立在物理现实之上,而不仅仅是文本中的统计模式。
交互式学习
游戏提供了完美的测试平台:丰富的物理、清晰的反馈、无限的迭代。
机器人应用
在游戏中训练的世界模型可以以最少的适应转移到真实世界机器人。
推动这项工作的研究人员小心翼翼地不声称他们在构建AGI。但他们令人信服地辩称,没有世界理解,我们无法构建真正思考而不仅仅是自动完成的系统。
接下来会怎样
接下来的两年将至关重要。要观察的几个发展:
- ✓AMI Labs首次公开演示(预计中期2026)
- ✓世界模型集成到主要视频生成器中
- ✓游戏引擎公司(Unity、Unreal)添加世界模型API
- ✓第一批使用游戏训练的世界模型的消费者机器人
游戏市场预计到2030年将超过5000亿美元,代表世界模型部署的沃土。投资者将世界模型视为不仅是研究好奇,而是交互式娱乐、仿真和机器人的基础技术。
静悄悄的革命
与ChatGPT周围的爆炸性炒作不同,世界模型革命在研究室和游戏工作室中悄然进行。没有病毒式演示,没有关于最新突破的日常新闻循环。
但影响可能更深远。语言模型改变了我们与文本互动的方式。世界模型可能改变AI与现实的互动方式。
对于我们在AI视频生成中工作的人来说,这项研究既代表威胁也代表机会。我们目前的工具在回顾中可能看起来很原始,就像早期CGI与现代视觉效果相比。但生成视觉内容的基本原理,通过学习模型,只会随着这些模型开始真正理解它们创造的世界而变得更强大。
从电子游戏物理到人工通用智能的路径可能看起来很迂回。但智能无论我们在哪里找到它,都来自理解其环境并能预测其行动后果的系统。游戏为我们提供了一个安全的空间来构建和测试这样的系统。机器人、创意工具,也许还有真正的机器理解将随之而来。
相关文章
继续探索这些相关文章

Runway GWM-1: 实时世界模型模拟现实
GWM-1从视频生成转向世界模拟。创建可探索的环境、虚拟形象和机器人训练数据。

视频语言模型:大语言模型和AI智能体之后的下一个前沿
世界模型正在教导AI理解物理现实,使机器人能够在移动任何执行器之前规划行动并模拟结果。

Runway融资3.15亿美元跨越视频时代:为什么最大的AI视频公司押注世界模型
Runway的3.15亿美元C轮融资给了该公司53亿美元的估值,标志着从视频生成向世界仿真的战略转变。这对创作者和整个行业意味着什么。
