Meta PixelPreskoči na glavni sadržaj
AlexisAlexis· Autor AI, pregledano od strane čovjeka
7 min read
1273 riječi

EPFL Stable Video Infinity: Kako Error Recycling Rješava Najveći Problem AI Video Generiranja

Novi ICLR 2026 Oral rad iz EPFL-a predstavlja error recycling, tehniku koja eliminira vremenski drift i omogućava generiranje multiminutnih AI videa bez dodatnih računalnih troškova.

EPFL Stable Video Infinity: Kako Error Recycling Rješava Najveći Problem AI Video Generiranja

Spremni za izradu vlastitih AI videozapisa?

Pridružite se tisućama autora koji koriste Bonega.ai

Svaki AI video model ima istu prljavu tajnu. Generiraj 4-sekundni klip i rezultati izgledaju zapanjujuće. Prođi preko 15 sekundi i likovi počinju mutirati, fizika se razara, boje se pomičući, a cijela scena drifta u nekoherentnost. EPFL-ov VITA Lab je upravo objavio rješenje, i to može biti najvažniji rad u video generiranju ove godine.

Problem Drifta Koji Nitko Nije Riješio

Ako si ikad pokušao generirati dugačko AI video s bilo kojim trenutnim modelom, znaš to razočaranje. Sora 2 je ograničena na 15 do 25 sekundi ovisno o vašem planu. Runway Gen-4.5 ima maksimalno 10 sekundi. Kling 3.0 dostiže 15 sekundi. Razlog nije računalna moć ili memorija. To je vremenski drift.

💡

Vremenski drift se javlja kada autoregresivni video modeli akumuliraju male greške okvir za okvir. Svaki generirani okvir postaje ulaz za sljedeći, a malene nesavršenosti se eksponencijalno kombiniraju. Nakon nekoliko stotina okvira, izlaz gotovo ne podsjeta na izvorni upis.

To je fundamentalno slično problemu "telefonske igre". Šapni poruku kroz dovoljan broj ljudi i postaje neprepoznatljiva. Prethodni pristupi pokušali su boriti se s driftom generiranjem kraćih klipova i njihovim zaljepljivanjem, ali šavovi su vidljivi. Ostali su koristili hijerarhijsko generiranje (prvo ključni okviri, zatim interpolacija), što pomaže, ali ne eliminiše temeljni problem.

Dolazi Error Recycling

Rad s naslovom "Stable Video Infinity" i prihvaćen kao ICLR 2026 Oral prezentacija, uvodi prevario jednostavnu ideju: nauči model da se nosi sa svojom greškama.

Oral
Status ICLR 2026
0
Dodatni Računalni Troškovi
Minute
Duljina Videa

Evo ključnog uvida. Tijekom treniranja, standardni video difuzijski modeli uče se iz čistih referentnih podataka. Nikad ne vide svoj vlastiti generirani izlaz. Kada se implementiraju, odjednom moraju raditi sa svojim vlastitis nedokonalim predikcijama kao ulazom, i ne znaju kako se suočiti s bukom.

Error recycling to ispravlja modifikacijom petlje treniranja:

Korak 1

Standardni Prolazak Unaprijed

Model generira segment videa iz čistih podataka treniranja.

Korak 2

Prikupljanje Grešaka

Vlastite predviđanja modela (sa njihovim nesavršenostima) su uhvaćena umjesto odbijanja.

Korak 3

Error Recycling

Ovi nedoskonali izlazi se vraćaju kao ulaz za sljedeću iteraciju treniranja, učeći model da generiraj stabilan izlaz čak i iz bučnih, vlastito generiranih okvira.

Korak 4

Iterativno Poboljšavanje

Tijekom mnogo ciklusa treniranja, model uči robustan mehanizam samoispravke koji sprječava akumulaciju greške.

Ljepota ovog pristupa leži u njegovoj eleganciji. Nema novih arhitektura modela, nema dodatnih parametara, nema trikova tijekom izvršavanja. Model se tijekom treniranja jednostavno uči kako izgledaju stvarni uvjeti implementacije.

Zašto To Значи Više Nego Misliš

Implikacije se proširuju daleko šire od generiranja dužih video-zapisa s mačkama. Evo što se mijenja:

Prije Error Recycling

  • Video modeli ograničeni na 4-20 sekundi
  • Konzistentnost scene brzo degradira
  • Identitet lika drifta nakon nekoliko sekundi
  • Fizika postaje sve nerealnija
  • Boje i osvjetljenje se pomiče nepredvidivo

Nakon Error Recycling

  • Generiranje koherentnog videa duljeg više minuta
  • Stabilniji izgled likova kroz cijelo vrijeme
  • Dosljedna fizika i prostorni odnosi
  • Pouzdano bojanje i osvjetljenje
  • Nema vidljive degradacije kvalitete tijekom vremena

Brojevi

VITA Lab tim je testirao Stable Video Infinity na više arhitektura i benchmarka. Rezultati su uistinu zapanjujući:

MetrikaBez Error RecyclingS Error RecyclingPoboljšanje
FVD (niže je bolje)Degradira se nakon 4sStabilno kroz 2min+Značajno
Konzistentnost LikaPada ispod 60% pri 15sOdržava 90%+ pri 2min~50% relativno
Vremenska KoherencijaVidljivi drift pri 8sNema vidljive drifta pri 2minKvalitativni skok
Računalni OpterećenjeBaselineBaseline (0% povećanje)Nulti trošak
💡

Aspekt nultih računalnih troškova je kritičan. Error recycling je tehnika treniranja, a ne izvršavanja. Jednom kada je model treniran, radi se izvršava tačno istom brzinom i troškom kao prije.

Kako Error Recycling Funkcionira Ispod Haube

Za one koji žele tehnijske detalje, evo što se dešava u modificiranom procesu treniranja.

Standardno treniranje difuzije videa koristi raspored šuma epsilon primijenjen na čiste referentne podatke x_0. Model se uči predvidjeti buku i oporaviti originalni signal. Tijekom izvršavanja, model autoregressivno generira okvir t+1 uvjetovan svojom predikcijom okvira t.

Jaz između treniranja (čisti ulazi) i izvršavanja (vlastito generirani ulazi) naziva se exposure bias. Error recycling to izravno rješava.

Tehnički Detalji: Modificirani Cilj Treniranja

Tijekom treniranja, model povremeno generira okvire koristeći svoje trenutne težine umjesto korištenja referentnih podataka. Ti vlastito generirani okviri, zajedno sa njihovim nesavršenostima, tada se koriste kao uslovna ulaza za sljedeće okvire u treningu sekvencije.

Ključni hiperparametar je recycling ratio r, koji kontrolira kako često vlastito generirani okviri zamjenjuju referentne okvire tijekom treniranja. Rad nalazi da r = 0.3 (30% reciklirani okviri) postiže optimalnu performansu, balancirajući poboljšanje stabilnosti s kvalitetom signala treniranja.

Modificirana funkcija gubitka ostaje standardni cilj difuzije. Jedina razlika je raspodjela podataka koju model vidi tijekom treniranja. Zato nema računalnog opterećenja tijekom izvršavanja.

To je konceptualno slično scheduled sampling u modelima niza-u-niz, ali prilagođeno za kontinuirani okvir difuzije. VITA Lab tim priznaje ovu vezu u svom radu, dok napominje da naivna primjena zakazanog uzorkovanja na difuzijske modele ne funkcionira. Njihov doprinos je specifična formulacija koja to stabilizira za video generiranje.

Prednost Otvorenog Koda

Možda najuzbudljiviji aspekt: kod je potpuno otvorenog koda na GitHubu (vita-epfl/Stable-Video-Infinity). To znači da bilo koje istraživačko laboratorij ili tvrtka može primijeniti error recycling na svoje postojeće video modele.

Zašto Otvoreni Kod Računal
Bilo koji postojeći video difuzijski model može se modernizirati s error recyclingom. Nema potrebe za arhitektonskim promjenama, samo modificirana petlja treniranja. To bi moglo poboljšati Soru, Runway, Kling i sve modele otvorenog koda istovremeno.
Praktična Ograničenja
Zahtijeva ponovno treniranje ili fino uravnotežavanje modela. Tvrtke sa svojinama modelima trebaju investirati računalnu snagu u ponovno treniranje. Učinkovitost tehnike može se razlikovati između različitih arhitektura i ljestvica.

Otpuštanje otvorenog koda slijedi rastući trend u AI video istraživačkoj zajednici. Modeli kao što su LTX-2 i Wan 2.6 su pokazali da pristupi otvorenog koda mogu konkurirati vlastitim alternativama.

Što To Znači za Industriju

Vrijeme je izvanredno. Nalazimo se usred AI video utrke gdje svaki veliki igrač, od Runway do ByteDance, gura za duljim, visokom kvalitetnim izlazima. Error recycling bi mogao biti komad koji nedostaje i otvara sljedeću generaciju mogućnosti.

🎬

Za Filmske Redatelje i Tvorce

Generiranje koherentnog videa duljeg više minuta omogućava stvarni narativni sadržaj. Ne samo klipove, već scene, sekvencije i konačno kratke filmove generirane iz jednog upita.
🔬

Za Istraživače

Error recycling pruža poopćljiv okvir. Ista se zásada mogla primijeniti na generiranje zvuka, sintezu 3D scena i bilo koji autoregresivni generativni model koji pati od drifta.
🏢

Za Poduzeće

Stabilno dugoformno generiranje čini AI video održivim za profesionalne slučajeve korištenja: demonstracije proizvoda, treniraničke videozapise, marketinške kampanje koje zahtijevaju dosljednu kvalitetu tijekom minuta sadržaja.

Pogled u Budućnost

Rad VITA Lab-a predstavlja temeljnu promjenu u tome kako razmišljamo o AI video generiranju. Umjesto gradnje sve većih modela ili dodavanja složenih mehanizama tijekom izvršavanja, rješenje je bilo jednostavno pokazati modelu kako izgledaju njegovi vlastiti izlazi.

Rad će biti predstavljen na ICLR 2026, a nekoliko industrijskih izvora sugerira da su glavni davatelji video modela već istraživanju integraciju. Ako world models predstavljaju budućnost kako AI razumije fiziku i prostor, error recycling predstavlja budućnost kako AI održava to razumijevanje tijekom vremena.

Doba 4-sekundnih AI videa može se završiti brže nego što je itko očekivao. I neće trebati novu arhitekturu modela niti milijardni proračun. Samo pametnija petlja treniranja.

Daljnje Čitanje

Alexis
AlexisAI EngineerAI Author

AI inženjer iz Lausanne koji spaja dubinu istraživanja s praktičnim inovacijama. Dijeli vrijeme između arhitektura modela i alpskih vrhova.

View profile →

Sviđa vam se ono što ste pročitali?

Pretvorite svoje ideje u AI videozapise neograničene duljine u nekoliko minuta.

Povezani članci

Nastavite istraživati uz ove povezane objave

Svidio vam se ovaj članak?

Otkrijte više uvida i ostanite u tijeku s našim najnovijim sadržajem.