超越視頻的世界模型,遊戲和機器人為何是AGI真正的試驗場
從DeepMind的Genie到AMI Labs,世界模型正在悄然成為真正理解物理的AI的基礎。5000億美元的遊戲市場可能是它們首先證明自己的地方。

當Yann LeCun宣佈離開Meta並推出獲得5億歐元資金支持的AMI Labs時,他表達了許多研究者多年來默默相信的觀點。儘管大型語言模型具有令人印象深刻的能力,但它們在通往通用人工智能的道路上是一條死胡同。它們預測詞語而不理解現實。
那麼替代方案是什麼,世界模型。學習模擬物理世界如何運作的系統。
語言模型的根本局限
世界模型學習預測視覺環境中接下來會發生什麼,而不僅僅是文本中接下來會出現什麼詞。這需要理解物理、物體永久性和因果關係。
語言模型擅長跨文本的模式匹配。它們可以寫詩、調試代碼、進行感覺上非常人類化的對話。但要求GPT-4預測掉落球會發生什麼,它會依賴於記憶的描述而不是真正的物理直覺。
這很重要,因為我們在生物世界中體驗的智能從根本上是建立在物理現實之上的。一個學習堆積木塊的幼兒會在學習語言之前,就已經對重力、平衡和材料屬性有了直觀的理解。這種具身認知,這種對世界如何運作的感覺,恰好是當前AI系統所缺乏的。
世界模型的目標是彌補這一差距。它們不是預測下一個詞,而是預測下一幀、下一個物理狀態、一個動作的下一個後果。
三種世界理解方法
建立世界理解AI的競賽已經分裂成三個不同的範例,各有不同的優勢。
在大規模視頻數據集上訓練以學習隱式物理。例子包括Sora和Veo。擅長生成合理的延續但在交互場景中苦苦掙扎。
構建顯式物理引擎並訓練AI導航它們。需要昂貴的手動環境構造但提供精確的物理精度。
第三種方法,也許最有前景的方法,結合兩者:從視頻中學習世界動力學,同時保持與環境交互和操縱的能力。這就是遊戲變得必不可少的地方。
遊戲,完美的訓練場
電子遊戲提供了獨特的東西:具有一致物理規則的交互式環境、無限變化和清晰的成功指標。與需要昂貴硬件並存在安全問題的真實世界機器人不同,遊戲提供無限失敗而無後果。
DeepMind很早就認識到了這種潛力。他們的Genie系統可以從單個圖像生成全新的可玩環境。給它一個平台遊戲關卡的草圖,它會創建一個物理一致的世界,其中角色可以跳躍、跌落並適當地與物體交互。
Genie之所以引人注目,不僅是因為生成,還因為理解。該系統學習可跨越不同視覺風格和遊戲類型轉移的可概括物理概念。一個在Mario風格平台遊戲上訓練的模型會開發對重力和碰撞的直覺,同樣適用於手繪獨立遊戲和逼真的3D環境。
從遊戲到機器人
遊戲到機器人的管道不是理論性的。公司已經在使用它。
識別仿真差距
研究表明純粹在仿真中訓練的模型在真實世界的混亂中苦苦掙扎:變化的光照、不完美的傳感器、意外的物體。
混合方法出現
團隊將遊戲訓練的世界模型與有限的真實世界微調相結合,大大減少機器人訓練所需的數據。
商業部署開始
第一批使用世界模型骨幹的倉庫機器人進入生產,在沒有明確編程的情況下處理新物體。
推動這一轉變的見解很簡單:物理就是物理。一個真正理解物體如何在電子遊戲中墜落、滑動和碰撞的模型,經過適當調整,應該理解真實世界中的相同原理。視覺外觀改變,但底層動力學保持不變。
特斯拉在他們的Optimus機器人中追求了這個策略的一個版本,先在仿真中訓練,然後在受控的工廠環境中部署。限制因素一直是模擬物理和真實物理之間的差距。在多樣化視頻數據上訓練的世界模型最終可能會彌合這一差距。
AMI Labs的賭注
Yann LeCun的新企業AMI Labs代表了迄今為止對世界模型研究最大的單筆投資。有5億歐元的歐洲資金和從Meta、DeepMind和學術實驗室招募的團隊,他們正在追求LeCun所稱的"目標驅動AI"。
與預測詞的LLM不同,AMI的方法側重於學習世界的表示,使規劃和推理物理後果成為可能。
技術基礎建立在聯合嵌入預測架構(JEPA)上,這是LeCun多年來倡導的框架。JEPA不是生成像素級預測(這需要巨大的計算資源),而是學習捕捉物理系統本質結構的抽象表示。
想像是這樣的:人類看著球滾向懸崖時,不會模擬球軌跡的每個像素。相反,我們識別抽象情況(球、邊緣、重力)並預測結果(墜落)。JEPA的目標是捕捉這種高效的抽象推理。
對AI視頻生成的影響
這一研究軌跡對創意應用意義深遠。目前的AI視頻生成器產生了令人印象深刻的結果,但受到時間不一致的困擾。角色變形、物理破裂、物體出現和消失。
世界模型提供了一個潛在的解決方案。一個真正理解物理的生成器應該產生物體遵守一致規則的視頻,掉落的物品可預測地墜落,反射正確地表現。
模型生成視覺上合理的幀而不強制物理一致性。適用於短片段但在較長時間內崩潰。
物理一致性來自學習的世界動力學。更長、更連貫的視頻成為可能,因為模型保持世界的內部狀態。
我們已經看到這一轉變的早期跡象。Runway的GWM-1代表了他們對世界模型的賭注,而Veo 3.1改進的物理仿真表明Google正在融合類似的原理。
AGI的連接
為什麼這一切對人工通用智能很重要,因為真正的智能需要的遠不止語言操縱。它需要理解因果關係、預測後果和在物理世界中規劃行動。
具身認知
真正的智能可能需要建立在物理現實之上,而不僅僅是文本中的統計模式。
交互式學習
遊戲提供了完美的測試平台:豐富的物理、清晰的反饋、無限的迭代。
機器人應用
在遊戲中訓練的世界模型可以以最少的適應轉移到真實世界機器人。
推動這項工作的研究人員小心翼翼地不聲稱他們在構建AGI。但他們令人信服地辯稱,沒有世界理解,我們無法構建真正思考而不僅僅是自動完成的系統。
接下來會怎樣
接下來的兩年將至關重要。要觀察的幾個發展:
- ✓AMI Labs首次公開演示(預計中期2026)
- ✓世界模型集成到主要視頻生成器中
- ✓遊戲引擎公司(Unity、Unreal)添加世界模型API
- ✓第一批使用遊戲訓練的世界模型的消費者機器人
遊戲市場預計到2030年將超過5000億美元,代表世界模型部署的沃土。投資者將世界模型視為不僅是研究好奇,而是交互式娛樂、仿真和機器人的基礎技術。
靜悄悄的革命
與ChatGPT周圍的爆炸性炒作不同,世界模型革命在研究室和遊戲工作室中悄然進行。沒有病毒式演示,沒有關於最新突破的日常新聞循環。
但影響可能更深遠。語言模型改變了我們與文本互動的方式。世界模型可能改變AI與現實的互動方式。
對於我們在AI視頻生成中工作的人來說,這項研究既代表威脅也代表機會。我們目前的工具在回顧中可能看起來很原始,就像早期CGI與現代視覺效果相比。但生成視覺內容的基本原理,通過學習模型,只會隨著這些模型開始真正理解它們創造的世界而變得更強大。
從電子遊戲物理到人工通用智能的路徑可能看起來很迂迴。但智能無論我們在哪裡找到它,都來自理解其環境並能預測其行動後果的系統。遊戲為我們提供了一個安全的空間來構建和測試這樣的系統。機器人、創意工具,也許還有真正的機器理解將隨之而來。
相關文章
繼續探索這些相關文章

Runway GWM-1: 即時世界模型模擬現實
GWM-1從影片生成轉向世界模擬。創建可探索的環境、虛擬形象和機器人訓練數據。

視頻語言模型:大型語言模型和AI智能體之後的下一個前沿
世界模型正在教導AI理解物理現實,使機器人能夠在移動任何執行器之前規劃行動並模擬結果。

Runway融資3.15億美元跨越影片時代:為什麼最大的AI影片公司押注世界模型
Runway的3.15億美元C輪融資給了該公司53億美元的估值,標誌著從影片生成向世界模擬的戰略轉變。這對創作者和整個行業意味著什麼。
