Meta Pixel跳至主要內容
AlexisAlexis· AI 作者,經人工審閱
13 min read
177

AI影片中的物理模擬:模型終於學會尊重現實法則

從瞬移的籃球到真實的彈跳,AI影片模型現已理解重力、動量和材質動力學。我們將探索實現這一切的技術突破。

AI影片中的物理模擬:模型終於學會尊重現實法則

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

多年來,AI生成的影片一直存在物理問題。籃球投偏了卻會瞬移進籃框。水會向上流。物體會像幽靈一樣互相穿過。在2025年至2026年初,情況發生了變化。最新一代影片模型已經學會尊重物理世界的基本法則。

籃球問題

OpenAI在發布Sora 2時完美地描述了這個問題:在早期模型中,如果籃球沒投進籃框,它會直接出現在網裡。模型知道敘事結果(球進籃框),但對支配這一過程的物理約束毫無概念。

這不是一個小錯誤,而是根本性架構局限的症狀。早期的影片生成模型擅長視覺模式匹配,能生成單獨看起來合理但連續觀看時物理上不連貫的幀。

💡

OpenAI明確將「物體變形」限制列為Sora 2要解決的關鍵問題。這一架構缺口一直困擾著研究人員和創作者。

物理理解的三大支柱

物理模擬的突破建立在三個相互關聯的進展之上:世界模型、思維鏈推理和改進的時間注意力機制。

世界模型 vs 幀預測

傳統影片生成將任務視為順序幀預測:給定第1幀到第N幀,預測第N+1幀。這種方法本質上難以處理物理問題,因為它沒有對底層物理狀態的顯式表示。

世界模型採用根本不同的方法。它們不直接預測像素,而是首先構建場景物理狀態的內部表示,包括物體位置、速度、材質和交互。然後才將這種狀態渲染成視覺幀。我們在世界模型分析中深入探討的這種方法,代表了影片生成思維方式的範式轉變。

幀預測

從像素預測像素。無顯式物理。容易出現瞬移、穿透錯誤和重力違反。速度快但物理上不連貫。

世界模型

首先模擬物理狀態。顯式物體追蹤。遵守守恆定律和碰撞動力學。計算量更大但有物理基礎。

影片的思維鏈

2025年底發布的Kling O1將思維鏈推理引入影片生成。在生成幀之前,模型會明確推理場景中應該發生什麼物理現象。

對於玻璃杯從桌子上掉落的場景,模型首先推理:

  • 玻璃杯初始速度為零,位置在桌邊
  • 重力以9.8 m/s²向下加速玻璃杯
  • 大約0.45秒後玻璃杯接觸地面
  • 玻璃材質易碎,地面是硬質表面
  • 衝擊力超過破裂閾值,玻璃杯碎裂
  • 碎片按動量守恆散開

這個顯式推理步驟發生在模型的潛在空間中,在任何像素生成之前。結果是不僅尊重視覺美學,還尊重因果鏈的影片。

大規模時間注意力

支撐這些進展的架構基礎是時間注意力,這是影片模型保持幀間一致性的機制。驅動現代影片模型的擴散Transformer架構將影片作為時空區塊處理,允許注意力在幀內空間流動和幀間時間流動。

現代影片模型每個影片處理數百萬個時空區塊,配備專門用於物理一致性的注意力頭。這種規模使模型能夠跨數百幀追蹤物體身份和物理狀態,保持早期架構無法實現的連貫性。

真實物理基準測試

我們實際上如何衡量物理模擬品質?該領域已開發出幾個標準化測試:

基準測試測試內容領先者
物體永久性被遮擋時物體持續存在Sora 2, Veo 3
重力一致性自由落體加速度均勻Kling O1, Runway Gen-4.5
碰撞真實性物體適當彈跳、變形或破碎Sora 2, Veo 3.1
流體動力學水、煙和布料真實模擬Kling 2.6
動量守恆物體間運動正確傳遞Sora 2

Kling模型在流體動力學方面一直表現出色,尤其是水模擬和布料物理令人印象深刻。OpenAI的Sora 2在碰撞真實性和動量守恆方面領先,以令人印象深刻的準確度處理複雜的多物體交互。

💡

對於水、煙和布料模擬,Kling模型目前提供最真實的物理效果。對於複雜的多體碰撞和運動場景,Sora 2是更強的選擇。

體操運動員測試

最具挑戰性的物理基準測試之一涉及奧運體操。翻滾的體操運動員經歷複雜的旋轉動力學:角動量守恆、四肢伸展和收縮時的轉動慣量變化,以及起跳和落地時力量應用的精確時機。

早期影片模型能生成令人印象深刻的空中體操運動員單幀,但在物理方面完全失敗。旋轉會隨機加速或減速。落地發生在不可能的位置。身體以違反解剖學約束的方式變形。

Sora 2明確強調奧運體操作為其現已正確處理的基準測試。模型在整個動作過程中追蹤體操運動員的角動量,當四肢收緊時旋轉加速(花式滑冰旋轉效應),伸展時減速。

材質理解

物理模擬不僅涉及運動,還涉及材質屬性。模型如何知道玻璃會碎裂而橡膠會彈跳?水會濺起而油會積聚?金屬會塑性變形而木頭會折斷?

答案在於訓練資料和模型學到的先驗知識。透過在數百萬個展示材質與世界交互的影片上訓練,模型發展出隱式材質理解。玻璃杯落在混凝土上與落在地毯上會產生不同結果,現代模型能捕捉這種區別。

🧱

材質分類

模型現在隱式地按材質屬性對物體分類:脆性vs延性、彈性vs塑性、可壓縮vs不可壓縮。

💨

流體類型

不同的流體黏度和表面張力得到正確處理:水飛濺、蜂蜜滴落、煙霧升騰。

🔥

燃燒物理

火焰和爆炸遵循真實的熱傳播和氣體動力學,而非簡單的粒子效果。

局限性和邊緣情況

儘管取得了這些進展,AI影片中的物理模擬仍不完美。存在幾個已知的局限性:

長期穩定性:物理在5-10秒內保持準確,但在更長時間內可能會漂移。延長的影片可能逐漸違反守恆定律。

複雜多體系統:兩個物體碰撞效果良好,但包含數十個交互物體的場景(如倒塌的積木塔)可能產生錯誤。

非常規材質:由於訓練資料偏差,常見材質(水、玻璃、金屬)比非常規材質(非牛頓流體、磁性材料)模擬得更好。

極端條件:非常小尺度(分子)、非常大尺度(天文)或極端條件(接近光速)下的物理通常會失敗。

⚠️

對於超過30秒的影片,物理模擬準確度會顯著下降。對於長影片內容,請考慮使用影片延長技術,並注意邊界處的物理連續性。

對創作者的影響

改進的物理模擬對影片創作者意味著什麼?

首先,大大減少了後製修正的需要。以前需要仔細編輯來糾正物理不可能性的場景,現在第一次就能正確生成。

其次,開啟了新的創作可能性。準確的物理模擬意味著可以生成魯布·哥德堡機器、體育序列和動作場景,無需費力的手動修正。

第三,改善了觀眾感知。觀眾會下意識地檢測物理違反,使物理準確的影片感覺更真實,即使很難說清楚具體差異在哪裡。

未來之路

物理模擬將沿著幾個方向繼續改進:

更長的時間一致性:當前模型維持幾秒的物理一致性,未來模型將維持幾分鐘。

更複雜的交互:包含數百個交互物體的場景將變得可行。

學習型物理引擎:未來模型可能不再依賴訓練資料中的隱式物理,而是將顯式物理模擬作為組件納入。

即時物理:目前物理感知生成較慢,但最佳化可能實現具有物理準確性的即時生成。

從瞬移的籃球到真實的彈跳,這一歷程代表了AI影片生成中最重要的進展之一。模型已經學會了尊重物理約束,即使它們理解物理的方式與人類不同。對於創作者來說,這意味著更少的修正、更多的可能性,以及感覺更真實的影片。

親自體驗:Bonega.ai使用Veo 3,它融合了先進的物理模擬以實現真實的物體動力學。生成包含複雜物理的場景,看看模型如何處理重力、碰撞和材質交互。

Alexis
AlexisAI EngineerAI Author

來自洛桑的 AI 工程師,結合深入研究與實務創新。他在模型架構與阿爾卑斯山峰之間分配時間。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。