Runway GWM-1: 实时世界模型模拟现实
GWM-1从视频生成转向世界模拟。创建可探索的环境、虚拟形象和机器人训练数据。

这正是Runway在2025年12月发布的首个通用世界模型GWM-1所承诺的愿景。这不仅仅是营销话术,而是代表了我们对AI视频技术思考方式的根本性转变。
从视频生成到世界模拟
传统的视频生成器创建片段。您输入提示词,等待,然后获得一个预先确定的帧序列。GWM-1的工作方式有所不同。它构建环境的内部表示,并使用它来模拟该环境中的未来事件。
GWM-1是自回归的,实时逐帧生成。与批量视频生成不同,它会在您输入时做出响应。
请思考这其中的含义。当您探索由GWM-1创建的虚拟空间时,当您转身时,物体会保持在应有的位置。物理规则保持一致。光照响应您的摄像机移动。这不是预渲染的视频,而是实时运行的模拟。
GWM-1的三大支柱
Runway将GWM-1分为三个专业化变体,每个都针对不同的领域。它们目前是独立的模型,但公司计划将它们合并为一个统一系统。
GWM Worlds
具有几何、光照和物理特性的可探索环境,适用于游戏、VR和智能体训练。
GWM Avatars
音频驱动的角色,具有唇形同步、眼球运动和手势,可进行长时间对话。
GWM Robotics
为机器人策略生成合成训练数据,消除物理硬件的瓶颈。
GWM Worlds:可漫步的无限空间
Worlds变体创建可交互探索的环境。在程序化一致的空间中导航,模型保持空间连贯性:如果您向前走,向左转,然后转身,您会看到预期的场景。
这解决了AI视频中最困难的问题之一:在扩展序列中的一致性。以前的方法难以随着时间推移保持物体位置和场景连贯性。GWM Worlds将环境视为持久状态,而不是一系列不相关的帧。
使用场景涵盖游戏、虚拟现实体验和训练AI智能体。想象一下,让强化学习算法探索数千个程序生成的环境,而无需手动构建每一个。
GWM Avatars:能倾听的逼真角色
Avatars变体生成具有不同寻常细节水平的音频驱动角色。除了基本的唇形同步外,它还渲染:
- ✓自然的面部表情
- ✓逼真的眼球运动和注视方向
- ✓与语音的唇形同步
- ✓说话和倾听时的手势
"倾听"部分很重要。大多数虚拟形象系统仅在角色说话时才有动画。GWM Avatars即使在角色不说话时也保持自然的空闲行为、微妙的动作和响应式表情,使对话感觉不像是在与录音对话。
Runway声称该系统可以进行"长时间对话而不会出现质量下降",表明他们已经解决了困扰长时间虚拟形象生成的时间一致性问题。
GWM Robotics:大规模思想实验
也许最实用的应用是机器人训练。物理机器人价格昂贵,会损坏,并且一次只能运行一个实验。GWM Robotics生成合成训练数据,让开发人员在接触真实硬件之前在模拟中测试策略。
该模型支持反事实生成,因此您可以探索"如果机器人以不同方式抓取物体会怎样?"的场景,而无需物理干预。
这里的SDK方法很重要。Runway通过Python接口提供GWM Robotics,将其定位为机器人公司的基础设施,而不是消费产品。他们正在与机器人公司讨论企业部署。
技术规格
GWM-1建立在Gen-4.5之上,这是Runway的视频模型,最近在Video Arena排行榜上超越了Google和OpenAI。自回归架构意味着它逐帧生成,而不是批处理整个序列。
动作条件接受多种输入类型:摄像机姿态调整、基于事件的命令、机器人姿态参数以及语音/音频输入。这使其成为真正的交互式系统,而不是一次性生成器。
与竞争对手的比较
Runway明确声称GWM-1比Google的Genie-3和其他世界模型尝试更"通用"。这种区别很重要:虽然Genie-3专注于类似游戏的环境,但Runway将GWM-1定位为可以跨领域模拟的模型,从机器人到生命科学。
生成固定序列。没有交互,没有探索,没有对输入的实时响应。
模拟持久环境。实时响应动作。保持空间和时间一致性。
机器人角度特别有趣。虽然大多数AI视频公司追逐创意专业人士和营销人员,但Runway正在为工业应用构建基础设施。这是一个赌注,即世界模型的重要性超越了娱乐。
对创作者的意义
对于我们这些在AI视频领域工作的人来说,GWM-1标志着更广泛的转变。我们花了多年时间学习如何制作更好的提示词并将片段链接在一起。世界模型暗示了一个未来,我们设计空间,设置规则,然后让模拟运行。
这与我们一直在关注的世界模型对话相联系。AI应该理解物理和因果关系,而不仅仅是模式匹配像素的论点,正在成为产品现实。
游戏开发者应该关注。创建可探索的3D环境通常需要美术师、关卡设计师以及Unity或Unreal等引擎。GWM Worlds暗示了一个未来,您描述空间,让AI填充几何。
Gen-4.5也获得了音频
除了GWM-1公告外,Runway还更新了Gen-4.5,增加了原生音频生成。您现在可以直接生成带有同步声音的视频,无需在后期添加音频。他们还添加了音频编辑功能和多镜头视频编辑,用于创建具有一致角色的一分钟片段。
要更深入了解音频如何改变AI视频,请查看我们对AI视频的静音时代如何结束的报道。
未来之路
三个GWM-1变体,Worlds、Avatars和Robotics,最终将合并为一个模型。目标是一个能够模拟任何类型环境、角色或物理系统的统一系统。
GWM Avatars和增强的World功能"即将推出"。GWM Robotics SDK可通过请求获得。
最让我兴奋的不是任何单一功能,而是框架。Runway不再销售视频片段。他们销售模拟基础设施。这是一个完全不同的产品类别。
问题不在于世界模型是否会取代视频生成器,而在于"创建视频"和"模拟世界"之间的区别会多快模糊。基于GWM-1,Runway押注会更早而不是更晚。
Runway的GWM-1以研究预览版提供,预计在2026年初实现更广泛的访问。要与其他领先的AI视频工具进行比较,请参阅我们对Sora 2 vs Runway vs Veo 3的分析。
相关文章
继续探索这些相关文章

Runway融资3.15亿美元跨越视频时代:为什么最大的AI视频公司押注世界模型
Runway的3.15亿美元C轮融资给了该公司53亿美元的估值,标志着从视频生成向世界仿真的战略转变。这对创作者和整个行业意味着什么。

超越视频的世界模型,游戏和机器人为何是AGI真正的试验场
从DeepMind的Genie到AMI Labs,世界模型正在悄然成为真正理解物理的AI的基础。5000亿美元的游戏市场可能是它们首先证明自己的地方。

视频语言模型:大语言模型和AI智能体之后的下一个前沿
世界模型正在教导AI理解物理现实,使机器人能够在移动任何执行器之前规划行动并模拟结果。
