EPFL Stable Video Infinity: Kako Error Recycling Rješava Najveći Problem AI Video Generiranja
Novi ICLR 2026 Oral rad iz EPFL-a predstavlja error recycling, tehniku koja eliminira vremenski drift i omogućava generiranje multiminutnih AI videa bez dodatnih računalnih troškova.

Problem Drifta Koji Nitko Nije Riješio
Ako si ikad pokušao generirati dugačko AI video s bilo kojim trenutnim modelom, znaš to razočaranje. Sora 2 je ograničena na 15 do 25 sekundi ovisno o vašem planu. Runway Gen-4.5 ima maksimalno 10 sekundi. Kling 3.0 dostiže 15 sekundi. Razlog nije računalna moć ili memorija. To je vremenski drift.
Vremenski drift se javlja kada autoregresivni video modeli akumuliraju male greške okvir za okvir. Svaki generirani okvir postaje ulaz za sljedeći, a malene nesavršenosti se eksponencijalno kombiniraju. Nakon nekoliko stotina okvira, izlaz gotovo ne podsjeta na izvorni upis.
To je fundamentalno slično problemu "telefonske igre". Šapni poruku kroz dovoljan broj ljudi i postaje neprepoznatljiva. Prethodni pristupi pokušali su boriti se s driftom generiranjem kraćih klipova i njihovim zaljepljivanjem, ali šavovi su vidljivi. Ostali su koristili hijerarhijsko generiranje (prvo ključni okviri, zatim interpolacija), što pomaže, ali ne eliminiše temeljni problem.
Dolazi Error Recycling
Rad s naslovom "Stable Video Infinity" i prihvaćen kao ICLR 2026 Oral prezentacija, uvodi prevario jednostavnu ideju: nauči model da se nosi sa svojom greškama.
Evo ključnog uvida. Tijekom treniranja, standardni video difuzijski modeli uče se iz čistih referentnih podataka. Nikad ne vide svoj vlastiti generirani izlaz. Kada se implementiraju, odjednom moraju raditi sa svojim vlastitis nedokonalim predikcijama kao ulazom, i ne znaju kako se suočiti s bukom.
Error recycling to ispravlja modifikacijom petlje treniranja:
Standardni Prolazak Unaprijed
Model generira segment videa iz čistih podataka treniranja.
Prikupljanje Grešaka
Vlastite predviđanja modela (sa njihovim nesavršenostima) su uhvaćena umjesto odbijanja.
Error Recycling
Ovi nedoskonali izlazi se vraćaju kao ulaz za sljedeću iteraciju treniranja, učeći model da generiraj stabilan izlaz čak i iz bučnih, vlastito generiranih okvira.
Iterativno Poboljšavanje
Tijekom mnogo ciklusa treniranja, model uči robustan mehanizam samoispravke koji sprječava akumulaciju greške.
Ljepota ovog pristupa leži u njegovoj eleganciji. Nema novih arhitektura modela, nema dodatnih parametara, nema trikova tijekom izvršavanja. Model se tijekom treniranja jednostavno uči kako izgledaju stvarni uvjeti implementacije.
Zašto To Значи Više Nego Misliš
Implikacije se proširuju daleko šire od generiranja dužih video-zapisa s mačkama. Evo što se mijenja:
Prije Error Recycling
- Video modeli ograničeni na 4-20 sekundi
- Konzistentnost scene brzo degradira
- Identitet lika drifta nakon nekoliko sekundi
- Fizika postaje sve nerealnija
- Boje i osvjetljenje se pomiče nepredvidivo
Nakon Error Recycling
- Generiranje koherentnog videa duljeg više minuta
- Stabilniji izgled likova kroz cijelo vrijeme
- Dosljedna fizika i prostorni odnosi
- Pouzdano bojanje i osvjetljenje
- Nema vidljive degradacije kvalitete tijekom vremena
Brojevi
VITA Lab tim je testirao Stable Video Infinity na više arhitektura i benchmarka. Rezultati su uistinu zapanjujući:
| Metrika | Bez Error Recycling | S Error Recycling | Poboljšanje |
|---|---|---|---|
| FVD (niže je bolje) | Degradira se nakon 4s | Stabilno kroz 2min+ | Značajno |
| Konzistentnost Lika | Pada ispod 60% pri 15s | Održava 90%+ pri 2min | ~50% relativno |
| Vremenska Koherencija | Vidljivi drift pri 8s | Nema vidljive drifta pri 2min | Kvalitativni skok |
| Računalni Opterećenje | Baseline | Baseline (0% povećanje) | Nulti trošak |
Aspekt nultih računalnih troškova je kritičan. Error recycling je tehnika treniranja, a ne izvršavanja. Jednom kada je model treniran, radi se izvršava tačno istom brzinom i troškom kao prije.
Kako Error Recycling Funkcionira Ispod Haube
Za one koji žele tehnijske detalje, evo što se dešava u modificiranom procesu treniranja.
Standardno treniranje difuzije videa koristi raspored šuma epsilon primijenjen na čiste referentne podatke x_0. Model se uči predvidjeti buku i oporaviti originalni signal. Tijekom izvršavanja, model autoregressivno generira okvir t+1 uvjetovan svojom predikcijom okvira t.
Jaz između treniranja (čisti ulazi) i izvršavanja (vlastito generirani ulazi) naziva se exposure bias. Error recycling to izravno rješava.
Tehnički Detalji: Modificirani Cilj Treniranja▼
Tijekom treniranja, model povremeno generira okvire koristeći svoje trenutne težine umjesto korištenja referentnih podataka. Ti vlastito generirani okviri, zajedno sa njihovim nesavršenostima, tada se koriste kao uslovna ulaza za sljedeće okvire u treningu sekvencije.
Ključni hiperparametar je recycling ratio r, koji kontrolira kako često vlastito generirani okviri zamjenjuju referentne okvire tijekom treniranja. Rad nalazi da r = 0.3 (30% reciklirani okviri) postiže optimalnu performansu, balancirajući poboljšanje stabilnosti s kvalitetom signala treniranja.
Modificirana funkcija gubitka ostaje standardni cilj difuzije. Jedina razlika je raspodjela podataka koju model vidi tijekom treniranja. Zato nema računalnog opterećenja tijekom izvršavanja.
To je konceptualno slično scheduled sampling u modelima niza-u-niz, ali prilagođeno za kontinuirani okvir difuzije. VITA Lab tim priznaje ovu vezu u svom radu, dok napominje da naivna primjena zakazanog uzorkovanja na difuzijske modele ne funkcionira. Njihov doprinos je specifična formulacija koja to stabilizira za video generiranje.
Prednost Otvorenog Koda
Možda najuzbudljiviji aspekt: kod je potpuno otvorenog koda na GitHubu (vita-epfl/Stable-Video-Infinity). To znači da bilo koje istraživačko laboratorij ili tvrtka može primijeniti error recycling na svoje postojeće video modele.
Otpuštanje otvorenog koda slijedi rastući trend u AI video istraživačkoj zajednici. Modeli kao što su LTX-2 i Wan 2.6 su pokazali da pristupi otvorenog koda mogu konkurirati vlastitim alternativama.
Što To Znači za Industriju
Vrijeme je izvanredno. Nalazimo se usred AI video utrke gdje svaki veliki igrač, od Runway do ByteDance, gura za duljim, visokom kvalitetnim izlazima. Error recycling bi mogao biti komad koji nedostaje i otvara sljedeću generaciju mogućnosti.
Za Filmske Redatelje i Tvorce
Za Istraživače
Za Poduzeće
Pogled u Budućnost
Rad VITA Lab-a predstavlja temeljnu promjenu u tome kako razmišljamo o AI video generiranju. Umjesto gradnje sve većih modela ili dodavanja složenih mehanizama tijekom izvršavanja, rješenje je bilo jednostavno pokazati modelu kako izgledaju njegovi vlastiti izlazi.
Rad će biti predstavljen na ICLR 2026, a nekoliko industrijskih izvora sugerira da su glavni davatelji video modela već istraživanju integraciju. Ako world models predstavljaju budućnost kako AI razumije fiziku i prostor, error recycling predstavlja budućnost kako AI održava to razumijevanje tijekom vremena.
Doba 4-sekundnih AI videa može se završiti brže nego što je itko očekivao. I neće trebati novu arhitekturu modela niti milijardni proračun. Samo pametnija petlja treniranja.
Daljnje Čitanje
- Revolucija Otvorenog AI Videa: Kako otvoreni modeli zatvaraju jaz sa vlastitim sustavima
- Simulacija Fizike u AI Videu: Razumijevanje kako se modeli uče fizičke konzistentnosti
- Diffusion Transformers: Arhitektura koja pokreće moderno video generiranje

AI inženjer iz Lausanne koji spaja dubinu istraživanja s praktičnim inovacijama. Dijeli vrijeme između arhitektura modela i alpskih vrhova.
View profile →Sviđa vam se ono što ste pročitali?
Pretvorite svoje ideje u AI videozapise neograničene duljine u nekoliko minuta.
Povezani članci
Nastavite istraživati uz ove povezane objave

Cijene AI video alata 2026: kako planirati budžet bez rasipanja kredita
AI video alate više nije teško pronaći. Teži dio je odabrati pravi model cijena za vaš tijek rada. Evo praktičnog vodiča za budžetiranje za kreatore i timove.

SkyReels V4: Prvi AI Model Koji Istovremeno Vidi i Čuje
Skywork AI predstavlja SkyReels V4 s dvostruko strujnom difuzijskom arhitekturom koja u jednom prolazu generira video i sinkronizirani zvuk. Evo što to znači za autore.

AI generatori videozapisa proizvoda: Potpuni vodič za e-trgovinu i marketing u 2026.
AI generatori videozapisa proizvoda mijenjaju način na koji brandovi stvaraju sadržaj. Od pipeline URL-u-video do 27% viših stopa dodavanja u košaricu, evo što svaki marketar treba znati u 2026.