EPFL Stable Video Infinity:Error Recycling 如何解決 AI 影片最大的問題
EPFL 一篇新的 ICLR 2026 Oral 論文提出 error recycling,這項技術可消除時間漂移,並以零額外運算成本生成多分鐘的 AI 影片。

無人解決的漂移問題
如果你曾使用目前任何模型生成長篇 AI 影片,就會明白其中的挫折感。Sora 2 依你的方案限制在 15 到 25 秒。Runway Gen-4.5 最長 10 秒。Kling 3.0 可達 15 秒。原因不是運算能力或記憶體,而是 時間漂移。
時間漂移發生於自回歸影片模型逐幀累積微小錯誤時。每個生成影格都會成為下一個影格的輸入,而細微瑕疵會以指數方式累積。數百個影格後,輸出幾乎不再像原始提示詞。
這在本質上類似「傳話遊戲」問題。訊息經過足夠多人轉述後,就會變得面目全非。過去的方法嘗試透過生成更短的片段再將其拼接,來對抗漂移,但接縫依然明顯。其他方法使用階層式生成,先產生關鍵影格,再進行插值,雖然有幫助,卻無法消除核心問題。
Error Recycling 登場
這篇題為 "Stable Video Infinity" 的論文,已獲選為 ICLR 2026 Oral 發表,提出了一個看似簡單卻極具巧思的概念:教導模型處理自己的錯誤。
關鍵洞見如下。在訓練期間,標準影片 diffusion 模型從乾淨的 ground-truth 資料中學習。它們從未看過自己生成的輸出。實際部署時,它們卻突然必須以自身不完美的預測作為輸入,卻不知道如何處理其中的雜訊。
Error recycling 透過修改訓練迴圈來解決這個問題:
標準前向傳遞
模型從乾淨的訓練資料生成一段影片。
錯誤收集
模型自身的預測結果,連同其中的瑕疵,會被保留而非丟棄。
錯誤回收
這些不完美的輸出會回饋為下一次訓練迭代的輸入,教導模型即使面對雜訊與自行生成的影格,也能產生穩定輸出。
迭代式精煉
經過多個訓練週期後,模型會學會穩健的自我修正機制,防止錯誤累積。
這個方法的美妙之處在於其簡潔性。不需要新的模型架構、額外參數,也不需要推論階段的技巧。模型只是在訓練時學會真實部署條件的樣貌。
為何這比你想像中更重要
其影響遠不只是生成更長的貓咪影片。以下是會改變的內容:
Error Recycling 之前
- 影片模型僅限於 4 到 20 秒
- 場景一致性快速惡化
- 角色身分在幾秒後開始漂移
- 物理表現愈來愈不真實
- 色彩與光線不可預測地偏移
Error Recycling 之後
- 可生成連貫的多分鐘影片
- 角色外觀全程保持穩定
- 物理規則與空間關係一致
- 可靠的色彩分級與光線表現
- 品質不會隨時間出現可見劣化
數據
VITA Lab 團隊在多種架構與基準測試中驗證了 Stable Video Infinity,結果相當驚人:
| 指標 | 未使用 Error Recycling | 使用 Error Recycling | 改善 |
|---|---|---|---|
| FVD(越低越好) | 4 秒後開始惡化 | 至少 2 分鐘內保持穩定 | 顯著 |
| 角色一致性 | 在 15 秒時降至 60% 以下 | 在 2 分鐘時維持 90%+ | 約 50% 相對提升 |
| 時間連貫性 | 8 秒時出現明顯漂移 | 2 分鐘時無可見漂移 | 質的飛躍 |
| 運算額外負擔 | 基準值 | 基準值(增加 0%) | 零成本 |
零額外運算負擔是關鍵。Error recycling 是訓練階段技術,而非推論階段技術。模型訓練完成後,運行速度與成本和之前完全相同。
Error Recycling 的底層運作方式
對於想了解技術細節的人,以下說明修改後的訓練流程。
標準影片 diffusion 訓練會對乾淨的 ground-truth 影格 x_0 套用雜訊排程 epsilon。模型學習預測雜訊並恢復原始訊號。在推論時,模型以自回歸方式生成影格 t+1,並以對影格 t 的預測作為條件。
訓練階段(乾淨輸入)和推論階段(自行生成的輸入)之間的落差稱為 exposure bias。Error recycling 直接處理這項問題。
技術細節:修改後的訓練目標▼
訓練期間,模型會定期使用自身目前的權重生成影格,而不是使用 ground-truth 資料。這些自行生成的影格,連同其瑕疵,接著會被用作訓練序列中後續影格的條件輸入。
關鍵超參數是 recycling ratio r,它控制訓練期間自行生成的影格取代 ground-truth 影格的頻率。論文發現 r = 0.3(30% recycled frames)可達到最佳表現,在穩定性提升與訓練訊號品質之間取得平衡。
修改後的損失函數仍是標準 diffusion 目標。唯一的差異是模型在訓練期間看到的資料分布。這也是推論時不會產生額外運算負擔的原因。
在概念上,這與 sequence-to-sequence 模型中的 scheduled sampling 類似,但經過調整以適用於連續 diffusion 框架。VITA Lab 團隊在論文中肯定了這項關聯,同時指出,將 scheduled sampling 直接套用至 diffusion 模型並不可行。他們的貢獻在於使其能穩定用於影片生成的特定設計。
開源優勢
或許最令人振奮的是:程式碼完全開源,發布於 GitHub(vita-epfl/Stable-Video-Infinity)。這代表任何研究實驗室或公司都能將 error recycling 應用於現有的影片模型。
這次開源發布順應 AI 影片研究社群日益成長的趨勢。LTX-2 與 Wan 2.6 等模型已證明,開源方法可以與專有替代方案競爭。
這對產業意味著什麼
時機相當值得注意。我們正處於 AI 影片軍備競賽之中,從 Runway 到 ByteDance,每個主要參與者都在追求更長、更高品質的輸出。Error recycling 可能正是開啟下一代能力所缺少的拼圖。
對電影工作者與創作者
對研究人員
對企業
展望未來
VITA Lab 的工作代表我們思考 AI 影片生成方式的根本轉變。與其打造規模愈來愈大的模型,或加入複雜的推論階段機制,解決方案只是讓模型看到它自己的輸出是什麼樣子。
論文將於 ICLR 2026 發表,數個產業消息來源指出,主要影片模型供應商已在探索整合方式。如果 world models 代表 AI 理解物理與空間的未來,error recycling 則代表 AI 如何隨時間維持這種理解的未來。
4 秒 AI 影片的時代,可能會比任何人預期更早結束。而且不需要新的模型架構,也不需要數十億美元的運算預算,只需要更聰明的訓練迴圈。
延伸閱讀
- 開源 AI 影片革命:開源模型如何縮小與專有系統之間的差距
- AI 影片中的物理模擬:理解模型如何學習物理一致性
- Diffusion Transformers:驅動現代影片生成的架構
來源
- International Conference on Learning Representations:Oral(ICLR 2026 狀態)(International Conference on Learning Representations)
- EPFL VITA 研究人員透過 arXiv:Stable Video Infinity 支援無限長度影片生成,且無額外推論…(EPFL VITA 研究人員透過 arXiv)
相關文章
繼續探索這些相關文章

免費無限 AI 影片工具:2026 年哪些方案真正可行
免費無限 AI 影片工具通常基於排隊機制或在地端運行。深入了解哪些功能是真正的無限、哪些會變慢,以及如何在 2026 年選擇可行的工作流程。

AI 影片延伸器:在 2026 年讓影片更長
在 2026 年使用 AI 影片延伸器來延長影片長度。比較延伸限制、保持連貫性,並為生成或現有片段選擇工作流程。

AI 影片工具定價 2026:如何規劃預算而不燒光 credits
AI 影片工具已不再難找。真正困難的是為你的工作流程選擇合適的定價模式。這是一份給創作者與團隊的實用預算指南。
