AI视频中的物理模拟:模型终于学会尊重现实法则
从瞬移的篮球到真实的弹跳,AI视频模型现已理解重力、动量和材质动力学。我们将探索实现这一切的技术突破。

多年来,AI生成的视频一直存在物理问题。篮球投偏了却会瞬移进篮筐。水会向上流。物体会像幽灵一样互相穿过。在2025年至2026年初,情况发生了变化。最新一代视频模型已经学会尊重物理世界的基本法则。
篮球问题
OpenAI在发布Sora 2时完美地描述了这个问题:在早期模型中,如果篮球没投进篮筐,它会直接出现在网里。模型知道叙事结果(球进篮筐),但对支配这一过程的物理约束毫无概念。
这不是一个小错误,而是根本性架构局限的症状。早期的视频生成模型擅长视觉模式匹配,能生成单独看起来合理但连续观看时物理上不连贯的帧。
OpenAI明确将"物体变形"限制列为Sora 2要解决的关键问题。这一架构缺口一直困扰着研究人员和创作者。
物理理解的三大支柱
物理模拟的突破建立在三个相互关联的进展之上:世界模型、思维链推理和改进的时间注意力机制。
世界模型 vs 帧预测
传统视频生成将任务视为顺序帧预测:给定第1帧到第N帧,预测第N+1帧。这种方法本质上难以处理物理问题,因为它没有对底层物理状态的显式表示。
世界模型采用根本不同的方法。它们不直接预测像素,而是首先构建场景物理状态的内部表示,包括物体位置、速度、材质和交互。然后才将这种状态渲染成视觉帧。我们在世界模型分析中深入探讨的这种方法,代表了视频生成思维方式的范式转变。
从像素预测像素。无显式物理。容易出现瞬移、穿透错误和重力违反。速度快但物理上不连贯。
首先模拟物理状态。显式物体跟踪。遵守守恒定律和碰撞动力学。计算量更大但有物理基础。
视频的思维链
2025年底发布的Kling O1将思维链推理引入视频生成。在生成帧之前,模型会明确推理场景中应该发生什么物理现象。
对于玻璃杯从桌子上掉落的场景,模型首先推理:
- 玻璃杯初始速度为零,位置在桌边
- 重力以9.8 m/s²向下加速玻璃杯
- 大约0.45秒后玻璃杯接触地面
- 玻璃材质易碎,地面是硬质表面
- 冲击力超过破裂阈值,玻璃杯碎裂
- 碎片按动量守恒散开
这个显式推理步骤发生在模型的潜在空间中,在任何像素生成之前。结果是不仅尊重视觉美学,还尊重因果链的视频。
大规模时间注意力
支撑这些进展的架构基础是时间注意力,这是视频模型保持帧间一致性的机制。驱动现代视频模型的扩散Transformer架构将视频作为时空块处理,允许注意力在帧内空间流动和帧间时间流动。
现代视频模型每个视频处理数百万个时空块,配备专门用于物理一致性的注意力头。这种规模使模型能够跨数百帧跟踪物体身份和物理状态,保持早期架构无法实现的连贯性。
真实物理基准测试
我们实际上如何衡量物理模拟质量?该领域已开发出几个标准化测试:
| 基准测试 | 测试内容 | 领先者 |
|---|---|---|
| 物体永久性 | 被遮挡时物体持续存在 | Sora 2, Veo 3 |
| 重力一致性 | 自由落体加速度均匀 | Kling O1, Runway Gen-4.5 |
| 碰撞真实性 | 物体适当弹跳、变形或破碎 | Sora 2, Veo 3.1 |
| 流体动力学 | 水、烟和布料真实模拟 | Kling 2.6 |
| 动量守恒 | 物体间运动正确传递 | Sora 2 |
Kling模型在流体动力学方面一直表现出色,尤其是水模拟和布料物理令人印象深刻。OpenAI的Sora 2在碰撞真实性和动量守恒方面领先,以令人印象深刻的准确度处理复杂的多物体交互。
对于水、烟和布料模拟,Kling模型目前提供最真实的物理效果。对于复杂的多体碰撞和运动场景,Sora 2是更强的选择。
体操运动员测试
最具挑战性的物理基准测试之一涉及奥运体操。翻滚的体操运动员经历复杂的旋转动力学:角动量守恒、四肢伸展和收缩时的转动惯量变化,以及起跳和落地时力量应用的精确时机。
早期视频模型能生成令人印象深刻的空中体操运动员单帧,但在物理方面完全失败。旋转会随机加速或减速。落地发生在不可能的位置。身体以违反解剖学约束的方式变形。
Sora 2明确强调奥运体操作为其现已正确处理的基准测试。模型在整个动作过程中跟踪体操运动员的角动量,当四肢收紧时旋转加速(花样滑冰旋转效应),伸展时减速。
材质理解
物理模拟不仅涉及运动,还涉及材质属性。模型如何知道玻璃会碎裂而橡胶会弹跳?水会溅起而油会积聚?金属会塑性变形而木头会折断?
答案在于训练数据和模型学到的先验知识。通过在数百万个展示材质与世界交互的视频上训练,模型发展出隐式材质理解。玻璃杯落在混凝土上与落在地毯上会产生不同结果,现代模型能捕捉这种区别。
材质分类
模型现在隐式地按材质属性对物体分类:脆性vs延性、弹性vs塑性、可压缩vs不可压缩。
流体类型
不同的流体粘度和表面张力得到正确处理:水飞溅、蜂蜜滴落、烟雾升腾。
燃烧物理
火焰和爆炸遵循真实的热传播和气体动力学,而非简单的粒子效果。
局限性和边缘情况
尽管取得了这些进展,AI视频中的物理模拟仍不完美。存在几个已知的局限性:
长期稳定性:物理在5-10秒内保持准确,但在更长时间内可能会漂移。延长的视频可能逐渐违反守恒定律。
复杂多体系统:两个物体碰撞效果良好,但包含数十个交互物体的场景(如倒塌的积木塔)可能产生错误。
非常规材质:由于训练数据偏差,常见材质(水、玻璃、金属)比非常规材质(非牛顿流体、磁性材料)模拟得更好。
极端条件:非常小尺度(分子)、非常大尺度(天文)或极端条件(接近光速)下的物理通常会失败。
对于超过30秒的视频,物理模拟准确度会显著下降。对于长视频内容,请考虑使用视频延长技术,并注意边界处的物理连续性。
对创作者的影响
改进的物理模拟对视频创作者意味着什么?
首先,大大减少了后期制作修正的需要。以前需要仔细编辑来纠正物理不可能性的场景,现在第一次就能正确生成。
其次,开启了新的创作可能性。准确的物理模拟意味着可以生成鲁布·戈德堡机器、体育序列和动作场景,无需费力的手动修正。
第三,改善了观众感知。观众会下意识地检测物理违反,使物理准确的视频感觉更真实,即使很难说清楚具体差异在哪里。
未来之路
物理模拟将沿着几个方向继续改进:
更长的时间一致性:当前模型维持几秒的物理一致性,未来模型将维持几分钟。
更复杂的交互:包含数百个交互物体的场景将变得可行。
学习型物理引擎:未来模型可能不再依赖训练数据中的隐式物理,而是将显式物理模拟作为组件纳入。
实时物理:目前物理感知生成较慢,但优化可能实现具有物理准确性的实时生成。
从瞬移的篮球到真实的弹跳,这一历程代表了AI视频生成中最重要的进展之一。模型已经学会了尊重物理约束,即使它们理解物理的方式与人类不同。对于创作者来说,这意味着更少的修正、更多的可能性,以及感觉更真实的视频。
亲自体验:Bonega.ai使用Veo 3,它融合了先进的物理模拟以实现真实的物体动力学。生成包含复杂物理的场景,看看模型如何处理重力、碰撞和材质交互。
相关文章
继续探索这些相关文章

Runway融资3.15亿美元跨越视频时代:为什么最大的AI视频公司押注世界模型
Runway的3.15亿美元C轮融资给了该公司53亿美元的估值,标志着从视频生成向世界仿真的战略转变。这对创作者和整个行业意味着什么。

Grok xAI 图像转视频能力:2026 年 6 月 API 指南
2026 年 6 月的 Grok xAI image-to-video 能力:Grok Imagine 如何处理图像、提示词、原生音频、API 工作流、安全、定价逻辑,以及与 Sora/Veo 的对比。

SkyReels V4:首个能同时看与听的AI模型
Skywork AI的SkyReels V4引入了双流扩散架构,可在一次生成过程中同步产出视频和音频。这对创作者意味着什么?
