AI影片中的物理模擬:模型終於學會尊重現實法則
從瞬移的籃球到真實的彈跳,AI影片模型現已理解重力、動量和材質動力學。我們將探索實現這一切的技術突破。

多年來,AI生成的影片一直存在物理問題。籃球投偏了卻會瞬移進籃框。水會向上流。物體會像幽靈一樣互相穿過。在2025年至2026年初,情況發生了變化。最新一代影片模型已經學會尊重物理世界的基本法則。
籃球問題
OpenAI在發布Sora 2時完美地描述了這個問題:在早期模型中,如果籃球沒投進籃框,它會直接出現在網裡。模型知道敘事結果(球進籃框),但對支配這一過程的物理約束毫無概念。
這不是一個小錯誤,而是根本性架構局限的症狀。早期的影片生成模型擅長視覺模式匹配,能生成單獨看起來合理但連續觀看時物理上不連貫的幀。
OpenAI明確將「物體變形」限制列為Sora 2要解決的關鍵問題。這一架構缺口一直困擾著研究人員和創作者。
物理理解的三大支柱
物理模擬的突破建立在三個相互關聯的進展之上:世界模型、思維鏈推理和改進的時間注意力機制。
世界模型 vs 幀預測
傳統影片生成將任務視為順序幀預測:給定第1幀到第N幀,預測第N+1幀。這種方法本質上難以處理物理問題,因為它沒有對底層物理狀態的顯式表示。
世界模型採用根本不同的方法。它們不直接預測像素,而是首先構建場景物理狀態的內部表示,包括物體位置、速度、材質和交互。然後才將這種狀態渲染成視覺幀。我們在世界模型分析中深入探討的這種方法,代表了影片生成思維方式的範式轉變。
從像素預測像素。無顯式物理。容易出現瞬移、穿透錯誤和重力違反。速度快但物理上不連貫。
首先模擬物理狀態。顯式物體追蹤。遵守守恆定律和碰撞動力學。計算量更大但有物理基礎。
影片的思維鏈
2025年底發布的Kling O1將思維鏈推理引入影片生成。在生成幀之前,模型會明確推理場景中應該發生什麼物理現象。
對於玻璃杯從桌子上掉落的場景,模型首先推理:
- 玻璃杯初始速度為零,位置在桌邊
- 重力以9.8 m/s²向下加速玻璃杯
- 大約0.45秒後玻璃杯接觸地面
- 玻璃材質易碎,地面是硬質表面
- 衝擊力超過破裂閾值,玻璃杯碎裂
- 碎片按動量守恆散開
這個顯式推理步驟發生在模型的潛在空間中,在任何像素生成之前。結果是不僅尊重視覺美學,還尊重因果鏈的影片。
大規模時間注意力
支撐這些進展的架構基礎是時間注意力,這是影片模型保持幀間一致性的機制。驅動現代影片模型的擴散Transformer架構將影片作為時空區塊處理,允許注意力在幀內空間流動和幀間時間流動。
現代影片模型每個影片處理數百萬個時空區塊,配備專門用於物理一致性的注意力頭。這種規模使模型能夠跨數百幀追蹤物體身份和物理狀態,保持早期架構無法實現的連貫性。
真實物理基準測試
我們實際上如何衡量物理模擬品質?該領域已開發出幾個標準化測試:
| 基準測試 | 測試內容 | 領先者 |
|---|---|---|
| 物體永久性 | 被遮擋時物體持續存在 | Sora 2, Veo 3 |
| 重力一致性 | 自由落體加速度均勻 | Kling O1, Runway Gen-4.5 |
| 碰撞真實性 | 物體適當彈跳、變形或破碎 | Sora 2, Veo 3.1 |
| 流體動力學 | 水、煙和布料真實模擬 | Kling 2.6 |
| 動量守恆 | 物體間運動正確傳遞 | Sora 2 |
Kling模型在流體動力學方面一直表現出色,尤其是水模擬和布料物理令人印象深刻。OpenAI的Sora 2在碰撞真實性和動量守恆方面領先,以令人印象深刻的準確度處理複雜的多物體交互。
對於水、煙和布料模擬,Kling模型目前提供最真實的物理效果。對於複雜的多體碰撞和運動場景,Sora 2是更強的選擇。
體操運動員測試
最具挑戰性的物理基準測試之一涉及奧運體操。翻滾的體操運動員經歷複雜的旋轉動力學:角動量守恆、四肢伸展和收縮時的轉動慣量變化,以及起跳和落地時力量應用的精確時機。
早期影片模型能生成令人印象深刻的空中體操運動員單幀,但在物理方面完全失敗。旋轉會隨機加速或減速。落地發生在不可能的位置。身體以違反解剖學約束的方式變形。
Sora 2明確強調奧運體操作為其現已正確處理的基準測試。模型在整個動作過程中追蹤體操運動員的角動量,當四肢收緊時旋轉加速(花式滑冰旋轉效應),伸展時減速。
材質理解
物理模擬不僅涉及運動,還涉及材質屬性。模型如何知道玻璃會碎裂而橡膠會彈跳?水會濺起而油會積聚?金屬會塑性變形而木頭會折斷?
答案在於訓練資料和模型學到的先驗知識。透過在數百萬個展示材質與世界交互的影片上訓練,模型發展出隱式材質理解。玻璃杯落在混凝土上與落在地毯上會產生不同結果,現代模型能捕捉這種區別。
材質分類
模型現在隱式地按材質屬性對物體分類:脆性vs延性、彈性vs塑性、可壓縮vs不可壓縮。
流體類型
不同的流體黏度和表面張力得到正確處理:水飛濺、蜂蜜滴落、煙霧升騰。
燃燒物理
火焰和爆炸遵循真實的熱傳播和氣體動力學,而非簡單的粒子效果。
局限性和邊緣情況
儘管取得了這些進展,AI影片中的物理模擬仍不完美。存在幾個已知的局限性:
長期穩定性:物理在5-10秒內保持準確,但在更長時間內可能會漂移。延長的影片可能逐漸違反守恆定律。
複雜多體系統:兩個物體碰撞效果良好,但包含數十個交互物體的場景(如倒塌的積木塔)可能產生錯誤。
非常規材質:由於訓練資料偏差,常見材質(水、玻璃、金屬)比非常規材質(非牛頓流體、磁性材料)模擬得更好。
極端條件:非常小尺度(分子)、非常大尺度(天文)或極端條件(接近光速)下的物理通常會失敗。
對於超過30秒的影片,物理模擬準確度會顯著下降。對於長影片內容,請考慮使用影片延長技術,並注意邊界處的物理連續性。
對創作者的影響
改進的物理模擬對影片創作者意味著什麼?
首先,大大減少了後製修正的需要。以前需要仔細編輯來糾正物理不可能性的場景,現在第一次就能正確生成。
其次,開啟了新的創作可能性。準確的物理模擬意味著可以生成魯布·哥德堡機器、體育序列和動作場景,無需費力的手動修正。
第三,改善了觀眾感知。觀眾會下意識地檢測物理違反,使物理準確的影片感覺更真實,即使很難說清楚具體差異在哪裡。
未來之路
物理模擬將沿著幾個方向繼續改進:
更長的時間一致性:當前模型維持幾秒的物理一致性,未來模型將維持幾分鐘。
更複雜的交互:包含數百個交互物體的場景將變得可行。
學習型物理引擎:未來模型可能不再依賴訓練資料中的隱式物理,而是將顯式物理模擬作為組件納入。
即時物理:目前物理感知生成較慢,但最佳化可能實現具有物理準確性的即時生成。
從瞬移的籃球到真實的彈跳,這一歷程代表了AI影片生成中最重要的進展之一。模型已經學會了尊重物理約束,即使它們理解物理的方式與人類不同。對於創作者來說,這意味著更少的修正、更多的可能性,以及感覺更真實的影片。
親自體驗:Bonega.ai使用Veo 3,它融合了先進的物理模擬以實現真實的物體動力學。生成包含複雜物理的場景,看看模型如何處理重力、碰撞和材質交互。
相關文章
繼續探索這些相關文章

Runway融資3.15億美元跨越影片時代:為什麼最大的AI影片公司押注世界模型
Runway的3.15億美元C輪融資給了該公司53億美元的估值,標誌著從影片生成向世界模擬的戰略轉變。這對創作者和整個行業意味著什麼。

Grok xAI 圖像轉影片功能:2026 年 6 月 API 指南
2026 年 6 月的 Grok xAI 圖像轉影片功能:Grok Imagine 如何處理圖像、prompt、原生音訊、API 工作流程、安全性、定價邏輯,以及與 Sora/Veo 的比較。

SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?
