EPFL Stable Video Infinity: Kako Error Recycling Reši Največji Problem AI Video Generiranja
Novi ICLR 2026 Oral članek iz EPFL predstavlja error recycling, tehniko, ki odpravi časovni drift in omogoča generiranje večminutnih AI videoposnetkov brez dodatnih računskih stroškov.

Ste pripravljeni ustvariti svoje AI videe?
Pridružite se tisočim ustvarjalcem, ki uporabljajo Bonega.ai
Problem Drifta, Ki Ga Nihče Ni Rešil
Če si kdaj poskušal generirati dolgoročne AI videoposnetek z katerim koli trenutnim modelom, poznaš to razočaranje. Sora 2 je omejena na 15 do 25 sekund glede na tvoj načrt. Runway Gen-4.5 doseže največ 10 sekund. Kling 3.0 doseže 15 sekund. Razlog ni računska moč ali spomin. To je časovni drift.
Časovni drift se pojavi, ko avtoregresivni modeli videoposnetkov akumulirajo majhne napake kadra za kadrom. Vsak generirani kadar postane vhod za naslednjega, majhne napake pa se eksponentno kombinirajo. Po nekaj sto kadrov je izhodna slika komaj podobna izvirnemu navodilu.
To je v bistvu podobno problemu "telefonske igre". Šepetaj sporočilo skozi dovolj ljudi in postane neprepoznavno. Prejšnji pristopi so poskušali boriti se s driftom z generiranjem krajših odsekov in njihovim lepljenim, vendar so šivi vidni. Drugi so uporabili hierarhično generiranje (najprej ključne kadrove, nato interpolacijo), kar pomaga, vendar ne odpravi osnovnega problema.
Prihaja Error Recycling
Članek z naslovom "Stable Video Infinity" in sprejet kot ICLR 2026 Oral prezentacija, predstavlja prevaranto preprosto idejo: nauči model, da se spopade s svojimi lastnimi napakami.
Evo ključnega vpogleda. Med usposabljanjem standardni modeli difuzije videoposnetkov spoznavajo iz čistih referenčnih podatkov. Nikoli ne vidijo svojega lastnega generiranega izhoda. Ko se deployajo, morajo nenadno delati s svojimi lastnimi nepopolnimi napovedmi kot vhodom, pa ne vedo, kako se spopasti s šumom.
Error recycling to popravi s spremembo usposabljalne zanke:
Standardni Napredni Prehod
Model generira segment videoposnetka iz čistih podatkov usposabljanja.
Zbiranje Napak
Lastne napovedi modela (s njihovimi nepopolnostmi) so zajete namesto zavrnitve.
Error Recycling
Ti nepopolni izhodi se vrnejo kot vhod za naslednjo iteracijo usposabljanja, kar nauči model generirati stabilen izhodnik tudi iz hrumičnih, lastno generiranih kadrov.
Iterativno Izboljšanje
Preko mnogih usposabljalnih ciklov se model nauči robustnega mehanizma samopopravke, ki preprečuje akumulacijo napak.
Lepota tega pristopa je v njegovi eleganci. Ni novih modelnih arhitektur, ni dodatnih parametrov, ni trikov med izvajanjem. Model se med usposabljanjem preprosto nauči, kako izgledajo resnični razmeri deployanja.
Zakaj To Pomeni Več Kot Misliš
Posledice se razširijo daleč onkraj generiranja daljših videoposnetkov s mačkami. Evo kaj se spremeni:
Pred Error Recycling
- Modeli videoposnetkov omejeni na 4-20 sekund
- Konsistentnost scene se hitro poslabša
- Identiteta lika se odmika po nekaj sekundah
- Fizika postaja čedalje bolj nerealistična
- Barve in osvetlitev se premikajo nepredvidljivo
Po Error Recycling
- Generiranje koherentnega videoposnetka dolgega več minut
- Stabilnež videza likov skozi vso dobo
- Dosledna fizika in prostorski odnosi
- Zanesljivo barvanje in osvetlitev
- Brez vidne degradacije kakovosti skozi čas
Številke
Ekipa VITA Lab je preizkušala Stable Video Infinity na več arhitekturah in benchmark. Rezultati so resnično osupljivi:
| Metrika | Brez Error Recycling | S Error Recycling | Izboljšanje |
|---|---|---|---|
| FVD (nižje je bolje) | Degradira se po 4s | Stabilno skozi 2min+ | Znatno |
| Konsistentnost Lika | Pade pod 60% pri 15s | Ohranja 90%+ pri 2min | ~50% relativno |
| Časovna Koherenca | Vidljiv drift pri 8s | Brez vidnega drifta pri 2min | Kakovostni skok |
| Računsko Breme | Baseline | Baseline (0% povečanje) | Ničelni stroški |
Vidik ničelnih računskih stroškov je kritičen. Error recycling je tehnika usposabljanja, ne izvajanja. Ko je model usposobljen, teče z enako hitrostjo in stroški kot prej.
Kako Error Recycling Deluje Pred Pokrovom
Za tiste, ki si želijo tehnične podrobnosti, evo kaj se dogaja v spremenjeni usposabljalni cevovod.
Standardna usposabljanja difuzije videoposnetkov uporablja razpored hrupa epsilon, primenjen na čiste referenčne podatke x_0. Model se nauči napovedati šum in okrevati izvirni signal. Med izvajanjem model avtoregresivno generira kadar t+1, ki je pogojovan s svojo napovedjo kadra t.
Razkorak med usposabljanjem (čisti vhodi) in izvajanjem (lastno generirani vhodi) se imenuje exposure bias. Error recycling to neposredno rešava.
Tehnične Podrobnosti: Spremenjen Usposabljalni Cilj▼
Med usposabljanjem model občasno generira kadre s svojimi trenutnimi utežmi namesto uporabe referenčnih podatkov. Ti lastno generirani kadri skupaj z njihovimi nepopolnostmi se nato uporabijo kot pogojni vhodi za naslednje kadre v usposabljalni sekvenci.
Ključni hiperparameter je recycling ratio r, ki kontrolira, kako pogosto lastno generirani kadri nadomestijo referenčne kadre med usposabljanjem. Članek ugotavlja, da r = 0.3 (30% reciklirani kadri) dosega optimalno zmogljivost, ki uravnoteži izboljšanje stabilnosti s kakovostjo usposabljalnega signala.
Spremenjena izgubna funkcija ostane standardni cilj difuzije. Edina razlika je porazdelitev podatkov, ki jih model vidi med usposabljanjem. Zato ni računskega bremena med izvajanjem.
To je konceptualno podobno scheduled sampling v modelih niza-v-niz, vendar prilagojeno za neprekinjen okvir difuzije. Ekipa VITA Lab priznava to povezavo v svojem članku, hkrati pa ugotavlja, da naivna uporaba načrtovanega vzorčenja na modelih difuzije ne deluje. Njihov prispevek je posebna formulacija, ki to stabilizira za generiranje videoposnetkov.
Prednost Odprtokodnega
Morda najbolj vznemirljivi vidik: kod je popolnoma odprtokoden na GitHubu (vita-epfl/Stable-Video-Infinity). To pomeni, da lahko katero koli raziskovalno laboratorij ali podjetje uporabi error recycling na svoje obstoječe modele videoposnetkov.
Odpustitev odprtokodnega se drži naraščajočega trenda v raziskovalni skupnosti AI videoposnetkov. Modeli kot so LTX-2 in Wan 2.6 so pokazali, da se pristopi odprtokodnega koda lahko konkurirajo lastniškimi alternative.
Kaj To Pomeni za Industrijo
Čas je izjemen. Smo sredi dirke AI videoposnetkov, kjer vsak veliki igralec, od Runway do ByteDance, potisne k daljšim, bolj kakovostnim rezultatom. Error recycling bi lahko bil manjkajoči del, ki odpira naslednjo generacijo sposobnosti.
Za Filmarje in Ustvarjalce
Za Raziskovalce
Za Podjetje
Pogled v Prihodnost
Delo laboratorija VITA predstavlja temeljni premik v tem, kako razmišljamo o generiranju AI videoposnetkov. Namesto gradnje vedno večjih modelov ali dodajanja zapletenih mehanizmov med izvajanjem je bila rešitev preprosto pokazati modelu, kako izgledajo njegovi lastni izhodi.
Članek bo predstavljen na ICLR 2026, več industrijskih virov pa kaže, da že večji dobavitelji modelov videoposnetkov preiskujejo integracijo. Če world models predstavljajo prihodnost, kako AI razume fiziko in prostor, error recycling predstavlja prihodnost, kako si AI ohrani to razumevanje skozi čas.
Doba 4-sekundnih AI videoposnetkov se lahko konča prej, kot je kdo pričakoval. In ne bo zahtevala nove modelne arhitekture ali milijard dolarjev proračuna. Le pametnejšo usposabljalno zanko.
Dodatno Branje
- Revolucija Odprtkodnega AI Videa: Kako odprtokodni modeli zaprirajo vrzel z lastniškimi sistemi
- Simulacija Fizike v AI Videu: Razumevanje, kako se modeli učijo fizične doslednosti
- Diffusion Transformers: Arhitektura, ki poganja sodobno generiranje videoposnetkov

Inženir umetne inteligence iz Lozane, ki združuje raziskovalno globino s praktičnimi inovacijami. Svoj čas deli med arhitekture modelov in alpske vrhove.
View profile →Povezani članki
Nadaljujte raziskovanje s temi povezanimi objavami

AI podaljševalnik videa: Podaljšajte video v letu 2026
Uporabite AI podaljševalnik videa za podaljšanje videa v letu 2026. Primerjajte omejitve podaljšanja, ohranite kontinuiteto in izberite potek dela za generirane ali obstoječe posnetke.

Najboljša brezplačna AI-orodja za pretvorbo besedila v video: vodnik za 2026
Primerjajte najboljša brezplačna AI-orodja za pretvorbo besedila v video v letu 2026, vključno z njihovimi dejanskimi omejitvami kreditov, vodnimi žigi, kompromisi pri lokalni namestitvi in praktičnim načrtom testiranja.

Zmožnosti Grok xAI za pretvorbo slik v video: API-vodnik za junij 2026
Zmožnosti Grok xAI za pretvorbo slik v video v juniju 2026: kako Grok Imagine obravnava slike, pozive, izvorni zvok, API-delovne tokove, varnost, cenovno logiko ter primerjave s Sora/Veo.