Meta Pixel跳到主要内容
HenryHenry· AI 作者,经人工审核
10 min read
143

Runway GWM-1: 实时世界模型模拟现实

GWM-1从视频生成转向世界模拟。创建可探索的环境、虚拟形象和机器人训练数据。

Runway GWM-1: 实时世界模型模拟现实

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

如果AI不仅仅能生成视频,而是能模拟整个世界供您探索,能创建可对话的角色,还能实时训练机器人,会怎么样呢?

这正是Runway在2025年12月发布的首个通用世界模型GWM-1所承诺的愿景。这不仅仅是营销话术,而是代表了我们对AI视频技术思考方式的根本性转变。

从视频生成到世界模拟

传统的视频生成器创建片段。您输入提示词,等待,然后获得一个预先确定的帧序列。GWM-1的工作方式有所不同。它构建环境的内部表示,并使用它来模拟该环境中的未来事件。

💡

GWM-1是自回归的,实时逐帧生成。与批量视频生成不同,它会在您输入时做出响应。

请思考这其中的含义。当您探索由GWM-1创建的虚拟空间时,当您转身时,物体会保持在应有的位置。物理规则保持一致。光照响应您的摄像机移动。这不是预渲染的视频,而是实时运行的模拟。

GWM-1的三大支柱

Runway将GWM-1分为三个专业化变体,每个都针对不同的领域。它们目前是独立的模型,但公司计划将它们合并为一个统一系统。

🌍

GWM Worlds

具有几何、光照和物理特性的可探索环境,适用于游戏、VR和智能体训练。

👤

GWM Avatars

音频驱动的角色,具有唇形同步、眼球运动和手势,可进行长时间对话。

🤖

GWM Robotics

为机器人策略生成合成训练数据,消除物理硬件的瓶颈。

GWM Worlds:可漫步的无限空间

Worlds变体创建可交互探索的环境。在程序化一致的空间中导航,模型保持空间连贯性:如果您向前走,向左转,然后转身,您会看到预期的场景。

这解决了AI视频中最困难的问题之一:在扩展序列中的一致性。以前的方法难以随着时间推移保持物体位置和场景连贯性。GWM Worlds将环境视为持久状态,而不是一系列不相关的帧。

使用场景涵盖游戏、虚拟现实体验和训练AI智能体。想象一下,让强化学习算法探索数千个程序生成的环境,而无需手动构建每一个。

GWM Avatars:能倾听的逼真角色

Avatars变体生成具有不同寻常细节水平的音频驱动角色。除了基本的唇形同步外,它还渲染:

  • 自然的面部表情
  • 逼真的眼球运动和注视方向
  • 与语音的唇形同步
  • 说话和倾听时的手势

"倾听"部分很重要。大多数虚拟形象系统仅在角色说话时才有动画。GWM Avatars即使在角色不说话时也保持自然的空闲行为、微妙的动作和响应式表情,使对话感觉不像是在与录音对话。

Runway声称该系统可以进行"长时间对话而不会出现质量下降",表明他们已经解决了困扰长时间虚拟形象生成的时间一致性问题。

GWM Robotics:大规模思想实验

也许最实用的应用是机器人训练。物理机器人价格昂贵,会损坏,并且一次只能运行一个实验。GWM Robotics生成合成训练数据,让开发人员在接触真实硬件之前在模拟中测试策略。

💡

该模型支持反事实生成,因此您可以探索"如果机器人以不同方式抓取物体会怎样?"的场景,而无需物理干预。

这里的SDK方法很重要。Runway通过Python接口提供GWM Robotics,将其定位为机器人公司的基础设施,而不是消费产品。他们正在与机器人公司讨论企业部署。

技术规格

720p
分辨率
24 fps
帧率
2分钟
最大长度
实时
生成速度

GWM-1建立在Gen-4.5之上,这是Runway的视频模型,最近在Video Arena排行榜上超越了Google和OpenAI。自回归架构意味着它逐帧生成,而不是批处理整个序列。

动作条件接受多种输入类型:摄像机姿态调整、基于事件的命令、机器人姿态参数以及语音/音频输入。这使其成为真正的交互式系统,而不是一次性生成器。

与竞争对手的比较

Runway明确声称GWM-1比Google的Genie-3和其他世界模型尝试更"通用"。这种区别很重要:虽然Genie-3专注于类似游戏的环境,但Runway将GWM-1定位为可以跨领域模拟的模型,从机器人到生命科学。

传统视频生成器

生成固定序列。没有交互,没有探索,没有对输入的实时响应。

GWM-1世界模型

模拟持久环境。实时响应动作。保持空间和时间一致性。

机器人角度特别有趣。虽然大多数AI视频公司追逐创意专业人士和营销人员,但Runway正在为工业应用构建基础设施。这是一个赌注,即世界模型的重要性超越了娱乐。

对创作者的意义

对于我们这些在AI视频领域工作的人来说,GWM-1标志着更广泛的转变。我们花了多年时间学习如何制作更好的提示词并将片段链接在一起。世界模型暗示了一个未来,我们设计空间,设置规则,然后让模拟运行。

这与我们一直在关注的世界模型对话相联系。AI应该理解物理和因果关系,而不仅仅是模式匹配像素的论点,正在成为产品现实。

游戏开发者应该关注。创建可探索的3D环境通常需要美术师、关卡设计师以及Unity或Unreal等引擎。GWM Worlds暗示了一个未来,您描述空间,让AI填充几何。

Gen-4.5也获得了音频

除了GWM-1公告外,Runway还更新了Gen-4.5,增加了原生音频生成。您现在可以直接生成带有同步声音的视频,无需在后期添加音频。他们还添加了音频编辑功能和多镜头视频编辑,用于创建具有一致角色的一分钟片段。

要更深入了解音频如何改变AI视频,请查看我们对AI视频的静音时代如何结束的报道。

未来之路

三个GWM-1变体,Worlds、Avatars和Robotics,最终将合并为一个模型。目标是一个能够模拟任何类型环境、角色或物理系统的统一系统。

💡

GWM Avatars和增强的World功能"即将推出"。GWM Robotics SDK可通过请求获得。

最让我兴奋的不是任何单一功能,而是框架。Runway不再销售视频片段。他们销售模拟基础设施。这是一个完全不同的产品类别。

问题不在于世界模型是否会取代视频生成器,而在于"创建视频"和"模拟世界"之间的区别会多快模糊。基于GWM-1,Runway押注会更早而不是更晚。


Runway的GWM-1以研究预览版提供,预计在2026年初实现更广泛的访问。要与其他领先的AI视频工具进行比较,请参阅我们对Sora 2 vs Runway vs Veo 3的分析。

Henry
HenryCreative TechnologistAI Author

来自洛桑的创意技术专家,探索 AI 与艺术的交汇点。他在电子音乐创作间隙试验生成式模型。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。