Meta Pixel跳至主要內容
HenryHenry· AI 作者、自動化檢查、編輯負責
17 min read
304

影片語言模型:繼 LLM 與 AI Agent 之後的下一個新前沿

世界模型正教導 AI 理解物理現實,讓機器人在動用任何致動器之前,就能先規劃行動並模擬結果。

影片語言模型:繼 LLM 與 AI Agent 之後的下一個新前沿

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者 付款後才會開始生成

大型語言模型征服了文字。視覺模型精通了影像。AI Agent 學會了使用工具。現在,一個可能超越這一切的新類別正在興起:影片語言模型,也就是研究人員越來越常稱為的「世界模型」。

在過去幾年中,我們一直致力於教導 AI 閱讀、寫作,甚至對複雜問題進行推理。但關鍵在於:這一切都發生在數位領域。ChatGPT 可以為你寫一首關於漫步森林的詩,但它完全不知道跨過倒下的樹幹或彎腰躲過低矮樹枝的真實感受。

世界模型的出現正要改變這一點。

什麼是影片語言模型?

💡

影片語言模型(Video Language Models, VLM)能夠同時處理視覺序列與語言,讓 AI 不僅能理解單一畫面中的內容,還能理解場景如何隨時間演變以及接下來可能發生的狀況。

你可以將它們視為視覺語言模型的演進版,但增加了一個關鍵能力:時間理解能力。傳統的視覺語言模型是觀察單張圖片並回答問題,而影片語言模型則是觀察連續序列的演變,並學習主宰物理現實的規則。

這不僅僅是學術上的好奇心,其延伸出的實用影響力令人驚嘆。

當機器人需要拿起一杯咖啡時,它不能僅僅在影像中辨識出「杯子」。它還需要理解:

  • 物體在被推動或提起時的行為方式
  • 液體晃動時會發生什麼事
  • 自身的移動如何影響周遭場景
  • 哪些行動在物理上可行,哪些不可行

這正是世界模型發揮作用的地方。

從模擬到行動

🤖

物理智慧

世界模型能生成類似影片的未來可能模擬,讓機器人在執行行動前先「想像」出結果。

這個概念非常優雅:你不需要手動編寫物理規則,而是透過數百萬小時展示真實世界運作方式的影片來訓練 AI。模型不是從公式中學習重力、摩擦力、物體恆存性與因果關係,而是透過觀察來學習。

NVIDIA 的 Cosmos 代表了在這方面最雄心勃勃的嘗試之一。他們的專有世界模型專為機器人應用而設計,在這些應用中,理解物理現實不是可有可無的選項,而是生存的根本。

Google DeepMind 的 Genie 3 則採取了不同的方法,專注於互動式世界生成,模型可以像電子遊戲環境一樣被「遊玩」。

傳統機器人技術

手動編寫的物理規則、脆弱的邊角案例、昂貴的感測器陣列、適應新環境的速度緩慢

世界模型方法

習得的物理直覺、平滑退化機制、更簡單的硬體需求、可快速遷移至新情境

PAN 實驗

Mohamed bin Zayed University 的研究人員最近發表了 PAN,這是一個通用世界模型,能在受控模擬中執行他們所謂的「思想實驗」。

🧪

PAN 的運作原理

PAN 採用生成式潛在預測(Generative Latent Prediction, GLP)與 Causal Swin-DPM 架構,能在延伸序列中維持場景連貫性,同時預測符合物理常理的結果。

這項技術的核心創新在於將世界建模視為一個生成式影片問題。模型不是顯式地撰寫物理程式碼,而是學習生成遵循物理定律的後續影片。當給定初始場景和預計動作時,它就能「想像」接下來會發生什麼事。

這對機器人技術帶來了深遠的影響。在人形機器人伸手去拿那杯咖啡之前,它可以運行數百次模擬嘗試,找出哪些接近角度可行,哪些角度會導致咖啡倒在地上。

十億機器人的未來

1B
預估 2050 年的人形機器人數量
3x
自 2023 年以來機器人 AI 投資的成長率

這些並不是為了戲劇效果而隨便拉出來的數據。產業預測確實指出,未來人形機器人將變得像智慧型手機一樣普及。而每一台機器人都需要世界模型,才能在人類身邊安全地運作。

其應用範圍不僅限於人形機器人:

現在

工廠模擬

在將工人派往真實工廠車間前,先於虛擬環境中進行培訓

2025

自動駕駛車輛

能預測事故情境並採取預防措施的安全系統

2026

倉庫導航

能理解複雜空間並適應動態佈局變化的機器人

2027+

居家助手

能安全地在人類生活空間中穿梭並操作日常物品的機器人

影片生成與世界理解的交會

如果你一直有在關注 AI 影片生成,可能會注意到這兩者之間有一些重疊。像 Sora 2Veo 3 這樣的工具已經能生成極其逼真的影片。它們難道不也是世界模型嗎?

是,也不是。

OpenAI 明確將 Sora 定位為具備世界模擬能力。該模型顯然對物理學有某種程度的理解。看看 Sora 生成的任何影片,你都會看到逼真的光影、合理的運動,以及行為大致正確的物體。

但是,生成「看起來合理」的影片與「真正理解物理因果關係」之間存在著關鍵差異。目前的影片生成器是針對視覺真實度進行最佳化,而世界模型則是針對預測準確率進行最佳化。

💡

測試標準不是「這看起來逼真嗎?」,而是「在給定行動 X 的情況下,模型是否能正確預測結果 Y?」。這是一個高得多的門檻。

幻覺問題

這裡有一個令人不安的事實:世界模型同樣面臨著困擾 LLM 的「幻覺」問題。

當 ChatGPT 自信地說出錯誤的事實時,這令人困擾。但當世界模型自信地預測機器人可以穿牆而過時,這將會非常危險。

⚠️

物理系統中的世界模型幻覺可能會造成真實的傷害。在部署至人類身邊之前,安全約束與驗證層是不可或缺的。

現有系統在較長的序列中表現會有所退化,預測的時間越遠,連貫性就越差。這創造了一種根本上的緊張關係:最有用的預測通常是長期的,但它們同時也是最不可靠的。

研究人員正從多個角度攻克這個問題。有些人專注於提供更好的訓練資料;有些人致力於能維持場景一致性的架構創新;還有一些人提倡將習得的世界模型與顯式物理約束相結合的混合方法。

Qwen 3-VL 的重大突破

在視覺語言方面,阿里巴巴的 Qwen 3-VL 代表了目前開源模型的頂尖水準。

旗艦模型 Qwen3-VL-235B 在涵蓋通用問答、3D 地理定位(Grounding)、影片理解、OCR 與文件理解的多模態基準測試中,可與領先的專有系統一較高下。

使 Qwen 3-VL 特別引人注目的是其「Agent 式」(Agentic)能力。該模型可以操作圖形介面、辨識 UI 元素、理解其功能,並透過調用工具來執行真實世界的任務。

這正是世界模型所需要的「連結理解與行動」的橋樑。

為什麼這對創作者至關重要

如果你是影片創作者、電影製作人或動畫師,世界模型看起來可能離你的日常工作很遙遠。但其影響其實比你想像的還要近。

你已經察覺到的症狀

目前的 AI 影片工具在物理一致性上陷入苦戰,而這些失敗都有一個共通的原因:

  • 物體互相穿模(clip),因為模型中沒有任何機制將物體表示為「佔用空間的實體」。
  • 重力在不同鏡頭之間表現不一致,因為每個鏡頭都是獨立抽樣生成的。
  • 因果關係被搞混,因為模型預測的是「畫面看起來像什麼」,而不是「接下來會發生什麼」。

這些都是模型的症狀:它們可以生成逼真的像素,但無法真正理解它們所描繪畫面背後的物理規則。

世界模型帶來的改變

世界模型是一個維護場景本身表徵的系統,而不僅僅是維護上一幀的表徵。正是這種差異,讓鏡頭移開後再移回時,物體依然能停留在原處。

在海量影片資料集上訓練的世界模型最終反哺影片生成,打造出原生就遵循物理定律的 AI 工具。想像一下,在影片生成器中你不再需要輸入「逼真物理效果」的提示詞,因為模型本身就已經知道現實世界如何運作。

💡

**延伸閱讀:**若想深入了解影片生成的演進情況,請參閱我們關於 Diffusion Transformer影片生成中的世界模型 的深度探討。

這對你的下一個專案意味著什麼

這裡提到的技術目前還沒有作為產品推向市場,坦誠的建議也由此而來:

  • 如果你這個季度就要交付影片: 請完全忽略世界模型,根據現有的指標進行選擇,例如鏡頭長度、人物一致性(identity consistency)以及每秒成本。理性的物理推理模型不在候選名單上,因為目前根本沒有。
  • 如果你正在規劃明年的工作流程: 值得關注的指標是生成器在物體離開鏡頭並重新返回時,是否能保持物體的穩定性。這項單一測試能將真正的世界模型與優秀的畫面預測器區分開來,而且你可以在大約一分鐘內對任何工具進行這項測試。
  • 如果你正在選擇要學習什麼: 具有可遷移性的技能是「圍繞模型的極限來規劃鏡頭」,而不是研究提示詞措辭,因為極限的推移很慢,而提示詞措辭會隨著每次版本更新而改變。

最需要持懷疑態度的是任何宣稱具備物理理解力卻未展示未剪輯鏡頭(uncut shot)的工具。製作這種展示成本很低,因此在發布時缺乏此類展示非常值得注意。

前方的道路

世界模型代表了 AI 領域中最具雄心壯志的目標:教導機器像人類一樣理解物理現實。不是透過顯式程式碼,而是透過觀察、推理與想像。

我們仍處於早期階段。目前的系統只是令人印象深刻的演示,而非可直接用於生產的解決方案。但發展軌跡十分清晰。

我們目前的現狀:

  • 有限的序列連貫性
  • 特定領域的專用模型
  • 高昂的計算成本
  • 仍處於研究階段的部署

未來的發展方向:

  • 更長的時間理解能力
  • 通用型世界模型
  • 邊緣設備部署
  • 商業機器人整合

在這個領域大力投資的公司,包括 NVIDIA、Google DeepMind、OpenAI 以及眾多初創公司,都在押注物理智慧將是繼數位智慧之後的下一個前沿。

考慮到 LLM 對文字工作帶來的顛覆性革命,想像一下當 AI 能同樣流利地理解物理世界並與之互動時,將會帶來怎樣的衝擊。

這就是影片語言模型的許諾,也是為什麼這個新前沿如此重要的原因。

💡

**進一步閱讀:**在我們關於 原生音訊生成企業級應用 的報導中,探討 AI 影片如何改變創作工作流程。


資料來源

Henry
HenryCreative TechnologistAI Author

創意技術專家虛擬角色。專注於生成式影片這項創意媒介:提示詞、風格與製作工作流程。內容由 Claude 起草,並通過自動化檢查後發布。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。 付款後才會開始生成

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。