Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
13 min read
177

AI视频中的物理模拟:模型终于学会尊重现实法则

从瞬移的篮球到真实的弹跳,AI视频模型现已理解重力、动量和材质动力学。我们将探索实现这一切的技术突破。

AI视频中的物理模拟:模型终于学会尊重现实法则

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

多年来,AI生成的视频一直存在物理问题。篮球投偏了却会瞬移进篮筐。水会向上流。物体会像幽灵一样互相穿过。在2025年至2026年初,情况发生了变化。最新一代视频模型已经学会尊重物理世界的基本法则。

篮球问题

OpenAI在发布Sora 2时完美地描述了这个问题:在早期模型中,如果篮球没投进篮筐,它会直接出现在网里。模型知道叙事结果(球进篮筐),但对支配这一过程的物理约束毫无概念。

这不是一个小错误,而是根本性架构局限的症状。早期的视频生成模型擅长视觉模式匹配,能生成单独看起来合理但连续观看时物理上不连贯的帧。

💡

OpenAI明确将"物体变形"限制列为Sora 2要解决的关键问题。这一架构缺口一直困扰着研究人员和创作者。

物理理解的三大支柱

物理模拟的突破建立在三个相互关联的进展之上:世界模型、思维链推理和改进的时间注意力机制。

世界模型 vs 帧预测

传统视频生成将任务视为顺序帧预测:给定第1帧到第N帧,预测第N+1帧。这种方法本质上难以处理物理问题,因为它没有对底层物理状态的显式表示。

世界模型采用根本不同的方法。它们不直接预测像素,而是首先构建场景物理状态的内部表示,包括物体位置、速度、材质和交互。然后才将这种状态渲染成视觉帧。我们在世界模型分析中深入探讨的这种方法,代表了视频生成思维方式的范式转变。

帧预测

从像素预测像素。无显式物理。容易出现瞬移、穿透错误和重力违反。速度快但物理上不连贯。

世界模型

首先模拟物理状态。显式物体跟踪。遵守守恒定律和碰撞动力学。计算量更大但有物理基础。

视频的思维链

2025年底发布的Kling O1将思维链推理引入视频生成。在生成帧之前,模型会明确推理场景中应该发生什么物理现象。

对于玻璃杯从桌子上掉落的场景,模型首先推理:

  • 玻璃杯初始速度为零,位置在桌边
  • 重力以9.8 m/s²向下加速玻璃杯
  • 大约0.45秒后玻璃杯接触地面
  • 玻璃材质易碎,地面是硬质表面
  • 冲击力超过破裂阈值,玻璃杯碎裂
  • 碎片按动量守恒散开

这个显式推理步骤发生在模型的潜在空间中,在任何像素生成之前。结果是不仅尊重视觉美学,还尊重因果链的视频。

大规模时间注意力

支撑这些进展的架构基础是时间注意力,这是视频模型保持帧间一致性的机制。驱动现代视频模型的扩散Transformer架构将视频作为时空块处理,允许注意力在帧内空间流动和帧间时间流动。

现代视频模型每个视频处理数百万个时空块,配备专门用于物理一致性的注意力头。这种规模使模型能够跨数百帧跟踪物体身份和物理状态,保持早期架构无法实现的连贯性。

真实物理基准测试

我们实际上如何衡量物理模拟质量?该领域已开发出几个标准化测试:

基准测试测试内容领先者
物体永久性被遮挡时物体持续存在Sora 2, Veo 3
重力一致性自由落体加速度均匀Kling O1, Runway Gen-4.5
碰撞真实性物体适当弹跳、变形或破碎Sora 2, Veo 3.1
流体动力学水、烟和布料真实模拟Kling 2.6
动量守恒物体间运动正确传递Sora 2

Kling模型在流体动力学方面一直表现出色,尤其是水模拟和布料物理令人印象深刻。OpenAI的Sora 2在碰撞真实性和动量守恒方面领先,以令人印象深刻的准确度处理复杂的多物体交互。

💡

对于水、烟和布料模拟,Kling模型目前提供最真实的物理效果。对于复杂的多体碰撞和运动场景,Sora 2是更强的选择。

体操运动员测试

最具挑战性的物理基准测试之一涉及奥运体操。翻滚的体操运动员经历复杂的旋转动力学:角动量守恒、四肢伸展和收缩时的转动惯量变化,以及起跳和落地时力量应用的精确时机。

早期视频模型能生成令人印象深刻的空中体操运动员单帧,但在物理方面完全失败。旋转会随机加速或减速。落地发生在不可能的位置。身体以违反解剖学约束的方式变形。

Sora 2明确强调奥运体操作为其现已正确处理的基准测试。模型在整个动作过程中跟踪体操运动员的角动量,当四肢收紧时旋转加速(花样滑冰旋转效应),伸展时减速。

材质理解

物理模拟不仅涉及运动,还涉及材质属性。模型如何知道玻璃会碎裂而橡胶会弹跳?水会溅起而油会积聚?金属会塑性变形而木头会折断?

答案在于训练数据和模型学到的先验知识。通过在数百万个展示材质与世界交互的视频上训练,模型发展出隐式材质理解。玻璃杯落在混凝土上与落在地毯上会产生不同结果,现代模型能捕捉这种区别。

🧱

材质分类

模型现在隐式地按材质属性对物体分类:脆性vs延性、弹性vs塑性、可压缩vs不可压缩。

💨

流体类型

不同的流体粘度和表面张力得到正确处理:水飞溅、蜂蜜滴落、烟雾升腾。

🔥

燃烧物理

火焰和爆炸遵循真实的热传播和气体动力学,而非简单的粒子效果。

局限性和边缘情况

尽管取得了这些进展,AI视频中的物理模拟仍不完美。存在几个已知的局限性:

长期稳定性:物理在5-10秒内保持准确,但在更长时间内可能会漂移。延长的视频可能逐渐违反守恒定律。

复杂多体系统:两个物体碰撞效果良好,但包含数十个交互物体的场景(如倒塌的积木塔)可能产生错误。

非常规材质:由于训练数据偏差,常见材质(水、玻璃、金属)比非常规材质(非牛顿流体、磁性材料)模拟得更好。

极端条件:非常小尺度(分子)、非常大尺度(天文)或极端条件(接近光速)下的物理通常会失败。

⚠️

对于超过30秒的视频,物理模拟准确度会显著下降。对于长视频内容,请考虑使用视频延长技术,并注意边界处的物理连续性。

对创作者的影响

改进的物理模拟对视频创作者意味着什么?

首先,大大减少了后期制作修正的需要。以前需要仔细编辑来纠正物理不可能性的场景,现在第一次就能正确生成。

其次,开启了新的创作可能性。准确的物理模拟意味着可以生成鲁布·戈德堡机器、体育序列和动作场景,无需费力的手动修正。

第三,改善了观众感知。观众会下意识地检测物理违反,使物理准确的视频感觉更真实,即使很难说清楚具体差异在哪里。

未来之路

物理模拟将沿着几个方向继续改进:

更长的时间一致性:当前模型维持几秒的物理一致性,未来模型将维持几分钟。

更复杂的交互:包含数百个交互物体的场景将变得可行。

学习型物理引擎:未来模型可能不再依赖训练数据中的隐式物理,而是将显式物理模拟作为组件纳入。

实时物理:目前物理感知生成较慢,但优化可能实现具有物理准确性的实时生成。

从瞬移的篮球到真实的弹跳,这一历程代表了AI视频生成中最重要的进展之一。模型已经学会了尊重物理约束,即使它们理解物理的方式与人类不同。对于创作者来说,这意味着更少的修正、更多的可能性,以及感觉更真实的视频。

亲自体验:Bonega.ai使用Veo 3,它融合了先进的物理模拟以实现真实的物体动力学。生成包含复杂物理的场景,看看模型如何处理重力、碰撞和材质交互。

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。