Meta Pixelメインコンテンツへスキップ
AlexisAlexis· AI著、専門家がレビュー済み
15 min read
268

EPFL Stable Video Infinity: Error RecyclingがAI動画最大の問題を解決する方法

EPFLによる新しいICLR 2026 Oral論文は、時間的ドリフトを排除し、追加の計算コストなしで数分にわたるAI動画生成を可能にするError Recyclingという技術を紹介しています。

EPFL Stable Video Infinity: Error RecyclingがAI動画最大の問題を解決する方法

自分だけのAI動画を作る準備はできましたか?

Bonega.aiを利用する数千人のクリエイターに参加しましょう

あらゆるAI動画モデルには、同じ都合の悪い秘密があります。4秒のクリップなら驚くほど美しく生成できます。しかし15秒を超えると、キャラクターは変形し始め、物理法則は崩れ、色はずれ、シーン全体が一貫性を失っていきます。EPFLのVITA Labが解決策を発表しました。これは今年の動画生成分野で最も重要な論文になるかもしれません。

誰も解決できなかったドリフト問題

現在のどのモデルでも長尺AI動画を生成したことがあれば、その苛立ちを知っているでしょう。Sora 2はプランに応じて15~25秒が上限です。Runway Gen-4.5は最大10秒、Kling 3.0は15秒までです。理由は計算能力やメモリではありません。時間的ドリフトです。

💡

時間的ドリフトは、自己回帰型動画モデルがフレームごとに小さな誤差を蓄積すると発生します。生成された各フレームが次のフレームの入力となり、わずかな不完全さが指数関数的に積み重なります。数百フレーム後には、出力は元のプロンプトとほとんど似ていません。

これは本質的に「伝言ゲーム」の問題に似ています。十分な人数を介してメッセージを伝えると、元の内容は認識できなくなります。従来のアプローチは、短いクリップを生成してつなぎ合わせることでドリフトに対抗しようとしましたが、継ぎ目は目立ちます。ほかには階層的生成(最初にキーフレーム、次に補間)を使う手法もありました。これは役立ちますが、核心的な問題を取り除くものではありません。

Error Recyclingの登場

"Stable Video Infinity" と題され、ICLR 2026 Oral presentationとして採択されたこの論文は、意外なほどシンプルなアイデアを提示します。モデル自身の誤りに対処できるよう学習させることです。

Oral
ICLR 2026 ステータス
0
追加計算コスト
Minutes
動画の長さ

重要な洞察は次のとおりです。学習時、標準的な動画拡散モデルはクリーンな正解データから学習します。自身が生成した出力を見ることはありません。本番環境では、突然、自身の不完全な予測を入力として扱わなければならなくなりますが、そのノイズへの対処方法を知りません。

Error Recyclingは、学習ループを変更することでこれを解決します。

ステップ 1

標準のForward Pass

モデルはクリーンな学習データから動画セグメントを生成します。

ステップ 2

誤差の収集

モデル自身の予測は、不完全さを含めて破棄されるのではなく取得されます。

ステップ 3

Error Recycling

これらの不完全な出力を次の学習反復の入力として戻し、ノイズを含む自己生成フレームからでも安定した出力を生成するようモデルに学習させます。

ステップ 4

反復的な改善

多数の学習サイクルを通じて、モデルは誤差の蓄積を防ぐ堅牢な自己修正メカニズムを学習します。

このアプローチの素晴らしさは、そのエレガンスにあります。新しいモデルアーキテクチャも、追加パラメータも、推論時のトリックも必要ありません。モデルは単に、実際のデプロイ環境がどのようなものかを学習時に学ぶだけです。

思っている以上に重要な理由

その影響は、より長い猫動画の生成をはるかに超えます。変わることは次のとおりです。

Error Recycling以前

  • 動画モデルは4~20秒に制限
  • シーンの一貫性が急速に低下
  • 数秒後にキャラクターのアイデンティティが変化
  • 物理表現が次第に非現実的に
  • 色と照明が予測不能に変化

Error Recycling以後

  • 数分間にわたる一貫した動画生成
  • 全編を通じて安定したキャラクター外観
  • 一貫した物理法則と空間的関係
  • 信頼できるカラーグレーディングと照明
  • 時間経過による目に見える品質低下なし

数値

VITA Labチームは、複数のアーキテクチャとベンチマークでStable Video Infinityをテストしました。その結果は注目に値します。

指標Error RecyclingなしError Recyclingあり改善
FVD(低いほど良い)4秒後に悪化2分以上にわたり安定大幅
キャラクターの一貫性15秒時点で60%未満に低下2分時点で90%以上を維持約50%相対的改善
時間的な一貫性8秒時点で目に見えるドリフト2分時点で目に見えるドリフトなし質的飛躍
計算オーバーヘッドベースラインベースライン(0%増加)コストゼロ
💡

計算オーバーヘッドがゼロである点は重要です。Error Recyclingは推論時の技術ではなく、学習時の技術です。一度学習が完了すれば、モデルは以前とまったく同じ速度とコストで動作します。

Error Recyclingの内部動作

技術的な詳細に関心がある方向けに、変更された学習パイプラインで何が起こるかを説明します。

標準的な動画拡散学習では、クリーンな正解フレーム x_0 に適用されるノイズスケジュール epsilon を使用します。モデルはノイズを予測し、元の信号を復元することを学習します。推論時には、モデルはフレーム t の予測を条件として、フレーム t+1 を自己回帰的に生成します。

学習時(クリーンな入力)と推論時(自己生成された入力)の隔たりは、exposure biasと呼ばれます。Error Recyclingはこれに直接対処します。

技術的詳細: 変更された学習目的

学習中、モデルは正解データを使う代わりに、現在の自身の重みを使用して定期的にフレームを生成します。こうした自己生成フレームは、不完全さを含めて、学習シーケンス内の後続フレームの条件付け入力として使われます。

重要なハイパーパラメータはrecycling ratio rです。これは、学習時に自己生成フレームが正解フレームをどの頻度で置き換えるかを制御します。論文では、r = 0.3(30%のリサイクルフレーム)が、安定性の改善と学習信号の品質のバランスを取り、最適な性能を達成するとしています。

変更された損失関数は、標準的な拡散目的のままです。唯一の違いは、モデルが学習時に見るデータ分布です。これが、推論時に計算オーバーヘッドが発生しない理由です。

これは、sequence-to-sequenceモデルにおけるscheduled samplingと概念的に似ていますが、連続的な拡散フレームワーク向けに適応されています。VITA Labチームは論文内でこの関連性を認めつつ、scheduled samplingを拡散モデルに単純適用しても機能しないと指摘しています。彼らの貢献は、動画生成において安定して機能する特定の定式化です。

オープンソースの優位性

おそらく最も期待できる点は、コードがGitHub上で完全にオープンソースであることです(vita-epfl/Stable-Video-Infinity)。つまり、あらゆる研究室や企業が、既存の動画モデルにError Recyclingを適用できます。

オープンソースが重要な理由
既存のあらゆる動画拡散モデルにError Recyclingを後付けできます。必要なのはアーキテクチャの変更ではなく、学習ループの修正だけです。Sora、Runway、Kling、そしてすべてのオープンソースモデルを同時に改善できる可能性があります。
実用上の制約
モデルの再学習またはファインチューニングが必要です。独自モデルを持つ企業は、再学習のための計算資源に投資する必要があります。この技術の有効性は、異なるアーキテクチャや規模によって変わる可能性があります。

このオープンソースでの公開は、AI動画研究コミュニティで広がるトレンドに続くものです。LTX-2Wan 2.6のようなモデルは、オープンソースのアプローチが独自仕様の代替手段と競争できることを示しています。

業界にとっての意味

タイミングは注目に値します。現在はAI動画の軍拡競争の真っただ中にあり、RunwayからByteDanceまで、すべての主要プレイヤーがより長く、より高品質な出力を目指しています。Error Recyclingは、次世代の能力を解放する欠けていたピースかもしれません。

🎬

映画制作者とクリエイター向け

長尺で一貫した動画生成により、本格的な物語コンテンツが可能になります。単なるクリップではなく、シーン、シーケンス、そして最終的には単一のプロンプトから生成される短編映画です。
🔬

研究者向け

Error Recyclingは汎用化可能なフレームワークを提供します。同じ原則は、音声生成、3Dシーン合成、そしてドリフトに悩むあらゆる自己回帰型生成モデルに適用できる可能性があります。
🏢

企業向け

安定した長尺生成により、AI動画はプロフェッショナルなユースケースで実用的になります。製品デモ、研修動画、数分にわたるコンテンツで一貫した品質が必要なマーケティングキャンペーンなどです。

今後の展望

VITA Labの研究は、AI動画生成に対する考え方の根本的な転換を表しています。これまで以上に大きなモデルを構築したり、複雑な推論時メカニズムを追加したりするのではなく、解決策は単に、モデル自身の出力がどのように見えるかを示すことでした。

この論文はICLR 2026で発表される予定で、複数の業界情報源は、大手動画モデル提供企業がすでに統合を検討していると示唆しています。world modelsがAIによる物理と空間の理解の未来を表すなら、Error RecyclingはAIがその理解を時間の経過にわたって維持する未来を表しています。

4秒のAI動画の時代は、誰もが予想したより早く終わるかもしれません。そして、新しいモデルアーキテクチャも、数十億ドル規模の計算予算も必要ありません。より賢い学習ループだけで実現できます。

関連記事


出典

Alexis
AlexisAI EngineerAI Author

ローザンヌ出身のAIエンジニア。研究の深さと実践的なイノベーションを融合させています。モデルアーキテクチャとアルプスの山々の間で時間を過ごしています。

View profile →

記事を気に入っていただけましたか?

アイデアを数分で長さ無制限のAI動画に変えましょう。

関連記事

これらの関連記事を引き続きお楽しみください

この記事はいかがでしたか?

さらに多くのインサイトを発見し、最新コンテンツをチェックしましょう。