EPFL Stable Video Infinity: Wéi Error Recycling de gréisste Problem vun AI-Videoe léist
En neien ICLR 2026 Oral-Pabeier vun der EPFL stellt Error Recycling vir, eng Technik déi temporär Drift eliminéiert a méiminuteg AI-Videogeneratioun ouni zousätzlech Rechekäschten erméiglecht.

Prett, Är eege KI-Videoen ze kreéieren?
Schléisst Iech Dausende vu Creatoren un, déi Bonega.ai benotzen
De Drift-Problem, dee kee geléist huet
Wann Dir probéiert hutt, Laangform-AI-Videoe mat engem aktuelle Modell ze generéieren, kennt Dir d'Frustratioun. Sora 2 ass, jee no Ärem Plang, op 15 bis 25 Sekonne limitéiert. Runway Gen-4.5 geet maximal op 10. Kling 3.0 geet bis 15. De Grond ass net Recheleeschtung oder Erënnerung. Et ass temporär Drift.
Temporär Drift entsteet, wann autoregressiv Videomodeller kleng Feeler Bild fir Bild usammelen. All generéiert Bild gëtt den Input fir dat nächst, a kleng Onvollkommenheete multiplizéieren sech exponentiell. No e puer honnert Biller gläicht d'Resultat kaum nach dem urspréngleche Prompt.
Dat ass am Fong ähnlech wéi de Problem vum "Telefonspill". Flüstert e Message duerch genuch Leit, an e gëtt onerkennbar. Vireg Usätz hu probéiert, Drift ze bekämpfen, andeems se méi kuerz Clips generéiert an zesummegesat hunn, mee d'Verbindungsstellen si siichtbar. Anerer hu hierarchesch Generatioun benotzt (als éischt Schlësselbiller, duerno Interpolatioun), wat hëlleft, awer de Kärproblem net eliminéiert.
Error Recycling kënnt an d'Spill
De Pabeier, mam Titel "Stable Video Infinity", deen als ICLR 2026 Oral presentation ugeholl gouf, stellt eng täuschend einfach Iddi vir: de Modell léieren, mat sengen eegene Feeler ëmzegoen.
Hei ass déi wichtegst Erkenntnis. Wärend dem Training léieren Standard-Video-Diffusiounsmodeller aus propperen Ground-Truth-Donnéeën. Si gesinn ni hiren eegene generéierten Output. Wann se agesat ginn, musse si op eemol mat hiren eegene onvollstännege Prognosen als Input schaffen, a si wëssen net, wéi se mam Kaméidi ëmgoe sollen.
Error Recycling léist dat, andeems d'Trainingsschleif geännert gëtt:
Standard Forward Pass
De Modell generéiert e Videosegment aus propperen Trainingsdaten.
Feelersammlung
Déi eege Prognose vum Modell (mat hiren Onvollkommenheeten) gëtt erfaasst, amplaz verworf ze ginn.
Error Recycling
Dës onvollstänneg Outputs ginn als Input fir déi nächst Trainingsiteratioun zréckgespeist, sou datt de Modell léiert, stabilen Output och aus kaméidegen, selwer generéierte Biller ze produzéieren.
Iterativ Verfeinerung
Iwwer vill Trainingszyklen léiert de Modell e robuste Selbstkorrekturmechanismus, deen d'Usammlung vu Feeler verhënnert.
D'Schéinheet vun dësem Usaz läit a senger Eleganz. Et gi keng nei Modellarchitekturen, keng zousätzlech Parameteren, keng Tricks zur Inferenzzäit. De Modell léiert wärend dem Training einfach, wéi reell Asazbedéngunge ausgesinn.
Firwat dat méi wichteg ass, wéi Dir mengt
D'Konsequenze ginn däitlech iwwer d'Generatioun vu méi laange Kazevideoen eraus. Hei ass, wat sech ännert:
Virum Error Recycling
- Videomodeller op 4-20 Sekonne limitéiert
- D'Konsistenz vun der Zeen verschlechtert sech séier
- D'Identitéit vu Personnagen drift no e puer Sekonnen of
- D'Physik gëtt ëmmer méi onrealistesch
- Faarwen a Beliichtung verréckele sech onberechenbar
Nom Error Recycling
- Kohärent Videogeneratioun iwwer e puer Minutten
- Stabille Look vun de Personnagen iwwerall
- Konsistent Physik a raimlech Bezéiungen
- Zouverlässeg Faarfkorrektur a Beliichtung
- Keng siichtbar Qualitéitsverschlechterung mat der Zäit
D'Zuelen
D'Equipe vum VITA Lab huet Stable Video Infinity iwwer verschidden Architekturen a Benchmarks getest. D'Resultater si markant:
| Moosswäert | Ouni Error Recycling | Mat Error Recycling | Verbesserung |
|---|---|---|---|
| FVD (méi niddreg ass besser) | Verschlechtert sech no 4s | Stabil bis 2min+ | Bedeitend |
| Charakterkonsistenz | Fält ënner 60% bei 15s | Bleift bei 90%+ bei 2min | ~50% relativ |
| Temporär Kohärenz | Siichtbar Drift bei 8s | Keng siichtbar Drift bei 2min | Qualitative Sprong |
| Rechen-Overhead | Baseline | Baseline (0% Erhéijung) | Null Käschten |
Den Aspekt vun null zousätzlecher Recheleeschtung ass entscheedend. Error Recycling ass eng Trainingstechnik, net eng Technik zur Inferenzzäit. Nom Training leeft de Modell genee mat derselwechter Geschwindegkeet a fir déiselwecht Käschte wéi virdrun.
Wéi Error Recycling ënnert der Kapott funktionéiert
Fir déi, déi technesch Detailer wëllen, hei ass wat an der geännerter Trainingspipeline geschitt.
Standard-Training fir Video-Diffusioun benotzt en Noise-Schedule epsilon, deen op propper Ground-Truth-Biller x_0 ugewannt gëtt. De Modell léiert, de Kaméidi virauszesoen an dat ursprénglecht Signal erëmzefannen. Zur Inferenzzäit generéiert de Modell autoregressiv Bild t+1, bedéngt duerch seng Prognos vu Bild t.
Den Ënnerscheed tëscht Training (propper Inputs) an Inferenz (selwer generéiert Inputs) gëtt exposure bias genannt. Error Recycling geet dat direkt un.
Technesch Detailer: Geännert Trainingszil▼
Wärend dem Training generéiert de Modell periodesch Biller mat sengen eegene aktuelle Gewiichter, amplaz Ground-Truth-Donnéeën ze benotzen. Dës selwer generéiert Biller, inklusiv hiren Onvollkommenheeten, ginn dann als bedéngend Inputs fir weider Biller an der Trainingssequenz benotzt.
De wichtegsten Hyperparameter ass de recycling ratio r, deen steiert, wéi dacks selwer generéiert Biller Ground-Truth-Biller beim Training ersetzen. De Pabeier stellt fest, datt r = 0.3 (30% recycléiert Biller) optimal Leeschtung erreecht, andeems et Stabilitéitsverbesserung mat der Qualitéit vum Trainingssignal ausbalancéiert.
Déi geännert Loss-Funktioun bleift dat standard Diffusiounszil. Deen eenzegen Ënnerscheed ass d'Dateverdeelung, déi de Modell beim Training gesäit. Dofir gëtt et kee computational overhead zur Inferenzzäit.
Dëst ass konzeptuell ähnlech wéi scheduled sampling bei Sequence-to-Sequence-Modeller, awer un de kontinuéierlechen Diffusiouns-Framework ugepasst. D'Equipe vum VITA Lab erkennt dës Verbindung an hirem Pabeier un, weist awer drop hin, datt déi naiv Uwendung vu scheduled sampling op Diffusiounsmodeller net funktionéiert. Hire Bäitrag ass déi spezifesch Formuléierung, déi et fir Videogeneratioun stabil mécht.
De Virdeel vun Open Source
Vläicht dee spannendsten Aspekt: de Code ass komplett open-source op GitHub (vita-epfl/Stable-Video-Infinity). Dat bedeit, datt all Fuerschungslabor oder Firma Error Recycling op hir bestehend Videomodeller uwende kann.
D'Open-Source-Verëffentlechung follegt engem wuessenden Trend an der AI-Video-Fuerschungsgemeinschaft. Modeller wéi LTX-2 an Wan 2.6 hunn gewisen, datt Open-Source-Usätz mat proprietären Alternativen konkurréiere kënnen.
Wat dat fir d'Industrie bedeit
Den Zäitpunkt ass bemierkenswäert. Mir sinn an der Mëtt vun enger AI-Video-Wafferace, an där all grousse Spiller, vu Runway bis ByteDance, op méi laangen Output mat méi héijer Qualitéit drängt. Error Recycling kéint dat feelend Stéck sinn, dat déi nächst Generatioun vu Fäegkeeten fräischalt.
Fir Filmemacher a Creatoren
Fir Fuerscher
Fir Entreprisen
Ausbléck
D'Aarbecht vum VITA Lab stellt eng fundamental Verrécklung duer an der Aart a Weis, wéi mir iwwer AI-Videogeneratioun denken. Amplaz ëmmer méi grouss Modeller ze bauen oder komplex Mechanismen zur Inferenzzäit derbäizesetzen, war d'Léisung, dem Modell einfach ze weisen, wéi säin eegenen Output ausgesäit.
De Pabeier gëtt op ICLR 2026 presentéiert, a verschidden Industriequellen deiten un, datt grouss Ubidder vu Videomodeller schonn un enger Integratioun schaffen. Wann world models d'Zukunft duerstellen, wéi AI Physik a Raum versteet, da stellt Error Recycling d'Zukunft duer, wéi AI dëst Verständnis iwwer Zäit erhält.
D'Ära vun 4-Sekonnen-AI-Videoe kéint méi séier op en Enn goen, wéi iergendeen erwaart huet. An et brauch weder eng nei Modellarchitektur nach e Rechebudget vun enger Milliard Dollar. Nëmmen eng méi intelligent Trainingsschleif.
Weider Lektür
- D'Open-Source-AI-Video-Revolutioun: Wéi oppe Modeller den Ënnerscheed zu proprietäre Systemer verklengeren
- Physiksimulatioun an AI-Video: Verstoen, wéi Modeller physikalesch Konsistenz léieren
- Diffusion Transformers: D'Architektur hannert moderner Videogeneratioun
Quellen
- International Conference on Learning Representations: Oral (ICLR 2026 Status) (International Conference on Learning Representations)
- EPFL VITA researchers via arXiv: Stable Video Infinity supports infinite-length video generation with no additional inference… (EPFL VITA researchers via arXiv)

KI-Ingenieur vu Lausanne, deen déifgräifend Fuerschung mat praktescher Innovatioun verbënnt. Hie deelt seng Zäit tëscht Modellarchitekturen an Alpegipfelen op.
View profile →Gefält Iech wat Dir gelies hutt?
Verwandelt Är Iddien a KI-Videoen ouni Längtelimit an e puer Minutten.
Verwandt Artikelen
Entdeckt weider mat dëse verwandten Artikelen

AI Video Extender: Maacht Video méi laang am Joer 2026
Benotzt en AI Video Extender fir e Video am Joer 2026 méi laang ze maachen. Vergläicht d'Verlängerungslimiten, behält d'Kontinuitéit a wielt e Workflow fir generéiert oder existent Clips.

Grok xAI Bild-zu-Video-Fäegkeeten: API-Guide Juni 2026
Grok xAI Bild-zu-Video-Fäegkeeten am Juni 2026: wéi Grok Imagine Biller, Prompts, nativen Audio, API-Workflows, Sécherheet, Präislogik a Vergläicher mat Sora/Veo behandelt.

Präisser fir AI-Video-Tools 2026: Wéi een e Budget plangt, ouni Credits ze verbrennen
AI-Video-Tools sinn net méi schwéier ze fannen. De schwéieren Deel ass, de richtege Präismodell fir däin Workflow ze wielen. Hei ass e praktesche Budgetsguide fir Creatoren an Teams.