Meta Pixel跳至主要內容
AlexisAlexis· AI 作者,經人工審閱
12 min read
389

EPFL Stable Video Infinity:Error Recycling 如何解決 AI 影片最大的問題

EPFL 一篇新的 ICLR 2026 Oral 論文提出 error recycling,這項技術可消除時間漂移,並以零額外運算成本生成多分鐘的 AI 影片。

EPFL Stable Video Infinity:Error Recycling 如何解決 AI 影片最大的問題

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

每個 AI 影片模型都有同一個不願承認的秘密。生成 4 秒片段時,結果令人驚豔。超過 15 秒後,角色開始變形,物理規則崩壞,色彩偏移,整個場景逐漸漂移至難以理解的狀態。EPFL 的 VITA Lab 剛發表了一個解決方案,這可能是今年影片生成領域最重要的論文。

無人解決的漂移問題

如果你曾使用目前任何模型生成長篇 AI 影片,就會明白其中的挫折感。Sora 2 依你的方案限制在 15 到 25 秒。Runway Gen-4.5 最長 10 秒。Kling 3.0 可達 15 秒。原因不是運算能力或記憶體,而是 時間漂移

💡

時間漂移發生於自回歸影片模型逐幀累積微小錯誤時。每個生成影格都會成為下一個影格的輸入,而細微瑕疵會以指數方式累積。數百個影格後,輸出幾乎不再像原始提示詞。

這在本質上類似「傳話遊戲」問題。訊息經過足夠多人轉述後,就會變得面目全非。過去的方法嘗試透過生成更短的片段再將其拼接,來對抗漂移,但接縫依然明顯。其他方法使用階層式生成,先產生關鍵影格,再進行插值,雖然有幫助,卻無法消除核心問題。

Error Recycling 登場

這篇題為 "Stable Video Infinity" 的論文,已獲選為 ICLR 2026 Oral 發表,提出了一個看似簡單卻極具巧思的概念:教導模型處理自己的錯誤

Oral
ICLR 2026 狀態
0
額外運算成本
分鐘
影片長度

關鍵洞見如下。在訓練期間,標準影片 diffusion 模型從乾淨的 ground-truth 資料中學習。它們從未看過自己生成的輸出。實際部署時,它們卻突然必須以自身不完美的預測作為輸入,卻不知道如何處理其中的雜訊。

Error recycling 透過修改訓練迴圈來解決這個問題:

步驟 1

標準前向傳遞

模型從乾淨的訓練資料生成一段影片。

步驟 2

錯誤收集

模型自身的預測結果,連同其中的瑕疵,會被保留而非丟棄。

步驟 3

錯誤回收

這些不完美的輸出會回饋為下一次訓練迭代的輸入,教導模型即使面對雜訊與自行生成的影格,也能產生穩定輸出。

步驟 4

迭代式精煉

經過多個訓練週期後,模型會學會穩健的自我修正機制,防止錯誤累積。

這個方法的美妙之處在於其簡潔性。不需要新的模型架構、額外參數,也不需要推論階段的技巧。模型只是在訓練時學會真實部署條件的樣貌。

為何這比你想像中更重要

其影響遠不只是生成更長的貓咪影片。以下是會改變的內容:

Error Recycling 之前

  • 影片模型僅限於 4 到 20 秒
  • 場景一致性快速惡化
  • 角色身分在幾秒後開始漂移
  • 物理表現愈來愈不真實
  • 色彩與光線不可預測地偏移

Error Recycling 之後

  • 可生成連貫的多分鐘影片
  • 角色外觀全程保持穩定
  • 物理規則與空間關係一致
  • 可靠的色彩分級與光線表現
  • 品質不會隨時間出現可見劣化

數據

VITA Lab 團隊在多種架構與基準測試中驗證了 Stable Video Infinity,結果相當驚人:

指標未使用 Error Recycling使用 Error Recycling改善
FVD(越低越好)4 秒後開始惡化至少 2 分鐘內保持穩定顯著
角色一致性在 15 秒時降至 60% 以下在 2 分鐘時維持 90%+約 50% 相對提升
時間連貫性8 秒時出現明顯漂移2 分鐘時無可見漂移質的飛躍
運算額外負擔基準值基準值(增加 0%)零成本
💡

零額外運算負擔是關鍵。Error recycling 是訓練階段技術,而非推論階段技術。模型訓練完成後,運行速度與成本和之前完全相同。

Error Recycling 的底層運作方式

對於想了解技術細節的人,以下說明修改後的訓練流程。

標準影片 diffusion 訓練會對乾淨的 ground-truth 影格 x_0 套用雜訊排程 epsilon。模型學習預測雜訊並恢復原始訊號。在推論時,模型以自回歸方式生成影格 t+1,並以對影格 t 的預測作為條件。

訓練階段(乾淨輸入)和推論階段(自行生成的輸入)之間的落差稱為 exposure bias。Error recycling 直接處理這項問題。

技術細節:修改後的訓練目標

訓練期間,模型會定期使用自身目前的權重生成影格,而不是使用 ground-truth 資料。這些自行生成的影格,連同其瑕疵,接著會被用作訓練序列中後續影格的條件輸入。

關鍵超參數是 recycling ratio r,它控制訓練期間自行生成的影格取代 ground-truth 影格的頻率。論文發現 r = 0.3(30% recycled frames)可達到最佳表現,在穩定性提升與訓練訊號品質之間取得平衡。

修改後的損失函數仍是標準 diffusion 目標。唯一的差異是模型在訓練期間看到的資料分布。這也是推論時不會產生額外運算負擔的原因。

在概念上,這與 sequence-to-sequence 模型中的 scheduled sampling 類似,但經過調整以適用於連續 diffusion 框架。VITA Lab 團隊在論文中肯定了這項關聯,同時指出,將 scheduled sampling 直接套用至 diffusion 模型並不可行。他們的貢獻在於使其能穩定用於影片生成的特定設計。

開源優勢

或許最令人振奮的是:程式碼完全開源,發布於 GitHub(vita-epfl/Stable-Video-Infinity)。這代表任何研究實驗室或公司都能將 error recycling 應用於現有的影片模型。

開源為何重要
任何現有的影片 diffusion 模型都能加裝 error recycling。不需要改變架構,只需修改訓練迴圈。這可能同時改善 Sora、Runway、Kling,以及每一個開源模型。
實務限制
需要重新訓練或微調模型。擁有專有模型的公司必須投入運算資源進行重新訓練。這項技術的效果可能因不同架構與規模而異。

這次開源發布順應 AI 影片研究社群日益成長的趨勢。LTX-2Wan 2.6 等模型已證明,開源方法可以與專有替代方案競爭。

這對產業意味著什麼

時機相當值得注意。我們正處於 AI 影片軍備競賽之中,從 RunwayByteDance,每個主要參與者都在追求更長、更高品質的輸出。Error recycling 可能正是開啟下一代能力所缺少的拼圖。

🎬

對電影工作者與創作者

長篇連貫影片生成讓真正的敘事內容成為可能。不只是片段,而是場景、段落,最終甚至是從單一提示詞生成的短片。
🔬

對研究人員

Error recycling 提供可泛化的框架。同一原則可套用於音訊生成、3D 場景合成,以及任何遭受漂移問題的自回歸生成模型。
🏢

對企業

穩定的長篇生成讓 AI 影片適用於專業使用情境:產品示範、訓練影片,以及需要在數分鐘內容中維持一致品質的行銷活動。

展望未來

VITA Lab 的工作代表我們思考 AI 影片生成方式的根本轉變。與其打造規模愈來愈大的模型,或加入複雜的推論階段機制,解決方案只是讓模型看到它自己的輸出是什麼樣子。

論文將於 ICLR 2026 發表,數個產業消息來源指出,主要影片模型供應商已在探索整合方式。如果 world models 代表 AI 理解物理與空間的未來,error recycling 則代表 AI 如何隨時間維持這種理解的未來。

4 秒 AI 影片的時代,可能會比任何人預期更早結束。而且不需要新的模型架構,也不需要數十億美元的運算預算,只需要更聰明的訓練迴圈。

延伸閱讀


來源

Alexis
AlexisAI EngineerAI Author

來自洛桑的 AI 工程師,結合深入研究與實務創新。他在模型架構與阿爾卑斯山峰之間分配時間。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。