Meta Pixel跳至主要內容
HenryHenry· AI 作者,經人工審閱
12 min read
176

世界模型:AI影片生成的下一個前沿

從幀生成到世界模擬的轉變如何重塑AI影片,以及Runway的GWM-1揭示了這項技術的發展方向。

世界模型:AI影片生成的下一個前沿

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

多年來,AI影片生成意味著逐幀預測像素。現在,業界正在轉向更加雄心勃勃的方向:模擬整個世界。Runway發布的GWM-1標誌著這一轉變的開始,其意義深遠。

從幀到世界

傳統影片生成模型的工作方式類似於精密的翻頁動畫師。它們根據之前的幀預測下一幀應該是什麼樣子,並由您的文字提示引導。這是有效的,但存在根本性的局限。

💡

幀預測器知道火看起來像什麼。世界模型知道火會做什麼:它會蔓延,消耗燃料,投射搖曳的陰影,並發出使其上方空氣扭曲的熱量。

世界模型採用了不同的方法。它們不是問「下一幀應該是什麼樣子?」,而是問「這個環境如何表現?」這個區別聽起來很微妙,但它改變了一切。

當您告訴幀預測器生成一個球滾下山坡時,它會根據訓練資料近似計算出那可能是什麼樣子。當您告訴世界模型同樣的事情時,它會模擬物理:重力加速球,與草的摩擦使其減速,動量將其帶上對面的斜坡。

Runway的GWM-1實際上做什麼

Runway在2025年12月發布了GWM-1(通用世界模型1),這代表了他們進入世界模擬的第一個公開步驟。該模型創建了他們所稱的「動態模擬環境」,這些系統不僅理解事物如何呈現,還理解它們如何隨時間演變。

1,247
Elo分數(Gen-4.5)
#1
Video Arena排名
100
Runway團隊規模

時機很重要。此次發布與Gen-4.5在Video Arena上排名第一同時進行,將OpenAI Sora 2推到了第4位。這些不是無關的成就。Gen-4.5在物理準確性方面的改進(物體以現實的重量、動量和力移動)很可能源於世界模型研究影響其架構。

🌍

幀預測vs世界模擬

幀預測:「草地上的球」→ 從訓練資料進行模式匹配。 世界模擬:「草地上的球」→ 物理引擎確定軌跡、摩擦、反彈。

為什麼這改變了一切

1. 真正有效的物理

當前的影片模型在物理方面遇到困難,因為它們只是看到過物理,從未經歷過。它們知道掉落的物體會下落,但它們近似軌跡而不是計算它。世界模型顛覆了這種關係。

幀預測

從視覺模式近似物理。撞球可能會穿過另一個球,因為模型從未學習過剛體碰撞。

世界模擬

模擬物理規則。碰撞檢測、動量傳遞和摩擦是計算出來的,而不是猜測的。

這就是為什麼Sora 2的物理模擬給人們留下深刻印象:OpenAI在物理理解方面投入了大量資金。世界模型將這種方法正式化。

2. 無需技巧的時間一致性

AI影片中最大的痛點一直是隨時間的一致性。角色改變外觀,物體瞬移,環境隨機變化。我們探索了模型如何透過跨幀注意力等架構創新學習記住面孔

世界模型提供了一個更優雅的解決方案:如果模擬將實體作為虛擬空間中的持久物件進行追蹤,它們就不能隨機改變或消失。球存在於模擬世界中。它具有在模擬中某些內容改變它們之前持續存在的屬性(大小、顏色、位置、速度)。

3. 更長的影片成為可能

當前模型會隨時間退化。CraftStory的雙向擴散透過讓後面的幀影響前面的幀來推動5分鐘影片。世界模型以不同的方式處理同樣的問題:如果模擬是穩定的,您可以執行任意長的時間。

2024年

標準AI影片:品質崩潰前4-8秒

2025年初

分鐘

專門技術使1-5分鐘影片成為可能

2025年末

無限?

世界模型將持續時間與架構分離

注意事項(總是有注意事項)

世界模型聽起來像是解決所有影片生成問題的方案。至少目前還不是。

⚠️

現實檢查:當前的世界模型模擬的是風格化物理,而不是精確物理。它們理解掉落的東西會下落,而不是確切的運動方程。

計算成本

模擬世界是昂貴的。由於LTX-2等專案的工作,幀預測可以在消費級GPU上執行。世界模擬需要維護狀態、追蹤物件、執行物理計算。這大大提高了硬體要求。

學習世界規則很困難

教模型事物看起來像什麼是簡單的:向它展示數百萬個例子。教模型世界如何工作則更模糊。物理可以從影片資料中學習,但僅限於一定程度。模型看到掉落的物體會下落,但它無法從觀看影片中推導出引力常數。

混合未來:大多數研究人員期望世界模型將學習的物理近似與明確模擬規則相結合,獲得兩種方法的最佳效果。

創意控制問題

如果模型正在模擬物理,誰來決定什麼物理?有時您想要真實的重力。有時您想讓角色漂浮。世界模型需要機制來在創作者想要不真實的結果時覆蓋其模擬。

業界走向何方

Runway並不是唯一朝這個方向發展的。擴散變換器背後的架構論文幾個月來一直在暗示這種轉變。問題始終是何時,而不是是否

已經發生的事情

  • Runway GWM-1發布
  • Gen-4.5展示物理資訊生成
  • 研究論文激增
  • 企業早期存取計畫

即將到來

  • 開源世界模型實作
  • 混合幀/世界架構
  • 專業世界模型(物理、生物、天氣)
  • 即時世界模擬

企業的興趣很能說明問題。Runway為Ubisoft提供了早期存取,Disney為Sora整合向OpenAI投資了10億美元。這些公司對生成快速社群媒體片段不感興趣。他們想要能夠模擬遊戲環境、生成一致的動畫角色、製作經得起專業審查的內容的AI。

這對創作者意味著什麼

  • 影片一致性將大幅提高
  • 物理密集型內容變得可行
  • 更長的生成而不會品質崩潰
  • 成本最初將高於幀預測
  • 創意控制機制仍在發展

如果您今天正在製作AI影片,世界模型不是您需要立即採用的東西。但它們值得關注。我們今年稍早發布的Sora 2、Runway和Veo 3之間的比較將需要在世界模型功能在這些平台上推出時進行更新。

對於現在的實際使用,差異對特定使用案例很重要:

  • 產品視覺化:世界模型將在這裡表現出色。物件彼此互動的精確物理。
  • 抽象藝術:幀預測實際上可能更可取。您想要意外的視覺輸出,而不是模擬現實。
  • 角色動畫:世界模型加上身分保持技術可能最終解決一致性問題。

更大的圖景

世界模型代表AI影片正在成熟。幀預測足以生成短片、視覺新奇事物、概念驗證展示。世界模擬是真正的製作工作所需要的,其中內容必須一致、物理上合理且可擴展。

💡

保持視角:我們處於GWM-1階段,相當於世界模擬的GPT-1。這與GWM-4之間的差距將是巨大的,就像GPT-1和GPT-4之間的差距改變了語言AI一樣。

Runway以100人的團隊在基準測試中擊敗Google和OpenAI告訴我們一些重要的事情:正確的架構方法比資源更重要。世界模型可能就是那種方法。如果Runway的賭注成功,他們將定義下一代影片AI。

如果物理模擬變得足夠好?我們不再只是生成影片了。我們正在建構虛擬世界,一次一個模擬。

💡

相關閱讀:有關實現這一轉變的技術基礎的更多資訊,請參閱我們對擴散變換器的深入探討。有關當前工具比較,請查看Sora 2 vs Runway vs Veo 3

Henry
HenryCreative TechnologistAI Author

來自洛桑的創意技術專家,探索 AI 與藝術交會之處。他在電子音樂創作之餘,實驗各種生成式模型。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。