EPFL Stable Video Infinity: kako prerada grešaka rešava glavni problem AI videa
Novi radovi EPFL za ICLR 2026 (usmena prezentacija) predstavlja preredu grešaka, tehniku koja uklanja vremenski drejf i omogućava generisanje video snimaka od više minuta bez dodatnih računarskih troškova.

Spremni da kreirate sopstvene AI videozapise?
Pridružite se hiljadama kreatora koji koriste Bonega.ai
Problem drejfa koji niko nije rešio
Ako si ikad pokušao da generišeš video dugog trajanja sa bilo kojim od postojećih modela, znaš to razočaranje. Sora 2 je ograničena na 15-25 sekundi u zavisnosti od plana. Runway Gen-4.5 maksimalno 10 sekundi. Kling 3.0 dostiže 15 sekundi. Razlog nije računarska moć niti memorija. To je vremenski drejf.
Vremenski drejf se javlja kada autregresivni video modeli akumuliraju male greške kadar po kadar. Svaki generisan kadar postaje ulaz za sledeći, a mali nedostaci se eksponencijalno uvećavaju. Posle nekoliko stotina kadara, rezultat edva podseća na originalnu komandu.
Ovo je u suštini slično problemu "telefonske igre". Prosleđi poruku kroz dovoljno ljudi i ona postaje nerazumljiva. Prethodni pristupi su pokušali da bore drejf generisanjem kraćih klipova i lepljenjem ih zajedno, ali šivovi su vidljivi. Drugi su koristili hijerarhijsku generaciju (prvo ključni kadari, zatim interpolacija), što pomaže, ali ne uklanja suštinski problem.
Uvođenje prerebe grešaka
Radovi pod naslovom "Stable Video Infinity" i prihvaćeni kao usmena prezentacija na ICLR 2026 predstavlja, na prvi pogled, jednostavnu ideju: nauči model da rukovodi svojim greškama.
Evo ključne ideje. Tokom obučavanja, standardni video modeli difuzije se obučavaju na čistim podaci ground-truth. Nikada ne vide svoj generisan izlaz. Pri pokretanju, odjednom moraju da rade sa svojim nesavršenim predviđanjima kao ulazom, i ne znaju kako da se suoče s bukom.
Prerada grešaka rešava ovo modifikacijom ciklusa obučavanja:
Standard Forward Pass
Model generiše video segment iz čistih obučavajućih podataka.
Error Collection
Vlastita predviđanja modela (sa svim njihovim nesavršenostima) su uhvaćena umesto da budu odbačena.
Error Recycling
Ovi nesavršeni rezultati se vraćaju kao ulazi za sledeću iteraciju obučavanja, obučavajući model da generiše stabilan izlaz čak i iz bučnih, samogenerisanih kadara.
Iterative Refinement
Kroz mnogih ciklusa obučavanja, model nauči pouzdanog mehanizma za samoispravljanje koji sprečava akumulaciju grešaka.
Lepota ovog pristupa je u njegovoj eleganciji. Nema novih arhitektura modela, nema dodatnih parametara, nema trikova u vreme generisanja. Model jednostavno uči tokom obučavanja kako izgledaju pravi uslovi pokretanja.
Zašto je ovo važnije nego što misliš
Implikacije idu daleko izvan generisanja dužih videa od mačaka. Evo šta se menja:
Pre prerebe grešaka
- Video modeli ograničeni na 4-20 sekundi
- Konzistentnost scene brzo degradira
- Identitet lika driftuje posle nekoliko sekundi
- Fizika postaje sve nerealnija
- Boja i osvetljenje se nepredvido kreću
Posle prerebe grešaka
- Generisanje videa od više minuta sa konzistentnošću
- Stabilan izgled lika kroz ceo video
- Konzistentna fizika i prostorni odnosi
- Pouzdana korekcija boje i osvetljenje
- Nema vidljivog pada kvaliteta sa vremenom
Brojevi
VITA Lab tim je testirao Stable Video Infinity na različitim arhitekturama i merilima. Rezultati su čudesni:
| Metrika | Bez prerebe grešaka | Sa prerebom grešaka | Poboljšanje |
|---|---|---|---|
| FVD (niža je bolja) | Degradira posle 4s | Stabilna kroz 2min+ | Značajna |
| Konzistentnost lika | Pada ispod 60% na 15s | Održava 90%+ na 2min | ~50% relativna |
| Vremenska konzistentnost | Vidljivi drejf na 8s | Bez vidljivog drejfa na 2min | Kvalitativni skok |
| Compute Overhead | Baseline | Baseline (0% porasta) | Nula troškova |
Aspekt nula računarskih troškova je kritičan. Prerada grešaka je tehnika vremena obučavanja, ne generisanja. Jednom obučena, model radi sa istom brzinom i ceno kao pre.
Kako prerada grešaka funkcioniše ispod kape
Za one koji žele tehničke detalje, evo šta se dešava u modifikovanom konvejeru obučavanja.
Standardno video obučavanje difuzije koristi raspored buka epsilon primenjen na čistim kadrima ground-truth x_0. Model uči da predvidi buku i da vrati originalnu signal. U vreme generisanja, model autregresivno generiše kadar t+1 uslovljen njenim predviđanjem kadra t.
Jaz između obučavanja (čisti ulazi) i generisanja (samogenerisani ulazi) naziva se predubeđenje ekspozicije. Prerada grešaka direktno to rešava.
Technical Details: Modified Training Objective▼
Tokom obučavanja, model periodično generiše kadare koristeći svoju postojeću težinu, umesto upotrebe ground-truth podataka. Ovi samogenerisani kadari, sa svim njihovim nesavršenostima, se zatim koriste kao uslovni ulazi za sledeće kadare u nizu obučavanja.
Ključni hiper parametar je koeficijent prerebe r, koji kontroliše koliko često samogenerisani kadari zamenjuju ground-truth kadare tokom obučavanja. Radovi otkriva da r = 0.3 (30% prerebenih kadara) postiže optimalne performanse, balansirajući poboljšanje stabilnosti sa kvalitetom signala obučavanja.
Modifikovana funkcija gubitka ostaje standardni cilj difuzije. Jedina razlika je distribucija podataka koju model vidi tokom obučavanja. Evo zašto nema računarskih troškova u vreme generisanja.
Ovo je konceptualno slično scheduled sampling u redos-na-redos modelima, ali adaptirano za neprekidnu difuzijsku ramku. VITA Lab tim priznaje ovu vezu u svojim radovima, istovremeno napominjući da naivna primena scheduled sampling-a na difuzijske modele ne funkcioniše. Njihov doprinos je specifična formulacija koja je čini stabilnom za generisanje videa.
Prednost otvorenog koda
Možda su najuzbudljiviji aspekt: kod je u potpunosti otvorenog koda na GitHub-u (vita-epfl/Stable-Video-Infinity). To znači da bilo koja istraživačka laboratorija ili kompanija može primeniti preredu grešaka na svoje postojeće video modele.
Izdanje otvorenog koda sledi rastući trend u zajednici istraživača AI videa. Modeli kao LTX-2 i Wan 2.6 pokazali su da pristupi otvorenog koda mogu konkurirati sa vlasničkim alternativama.
Šta ovo znači za industriju
Vreme je zanimljivo. Nalazimo se u sredini AI video trke gde svaki glavni igrač, od Runway do ByteDance, pokušava da dobije duži, veći kvalitet. Prerada grešaka bi mogla biti nedostajuća detal koja otklanja sledeću generaciju sposobnosti.
Za filmske umetnike i tvorce
Za istraživače
Za preduzeća
Pogled u budućnost
Rad VITA Lab-a predstavlja fundamentalnu promenu u tome kako mislimo o generisanju AI videa. Umesto izgradnje sve većih modela ili dodavanja složenih mehanizama u vreme generisanja, rešenje je bila jednostavno pokazivanje modela kako njegov izlaz izgleda.
Radovi će biti predstavljeni na ICLR 2026, i nekoliko industrijskih izvora predlažu da su glavni dobavljači video modela već istraživanje integracije. Ako world models predstavljaju budućnost kako AI razume fiziku i prostor, prerada grešaka predstavlja budućnost kako AI održava to razumevanje kroz vreme.
Razdoblje 4-sekundnih AI videa moglo bi završiti ranije nego što bilo ko očekuje. I neće zahtevati novu arhitekturu modela niti budžeta od milijardi za računare. Samo pametniji ciklus obučavanja.
Dalja čitanja
- Revolucija AI videa sa otvornim kodom: Kako otvoreni modeli zatvaraju jaz sa vlasničkim sistemima
- Simulacija fizike u AI videu: Razumevanje kako modeli uči fizičku konzistentnost
- Diffusion Transformers: Arhitektura koja napaja moderno generisanje videa

AI inženjer iz Lozane koji kombinuje dubinu istraživanja sa praktičnim inovacijama. Deli vreme između arhitektura modela i alpskih vrhova.
View profile →Sviđa vam se ono što ste pročitali?
Pretvorite svoje ideje u AI videozapise neograničene dužine za nekoliko minuta.
Povezani članci
Nastavite istraživanje uz ove povezane objave

AI Video Produživač: Produžite video u 2026.
Koristite AI video produživač da produžite video u 2026. Uporedite ograničenja produženja, očuvajte kontinuitet i odaberite tok rada za generisane ili postojeće klipove.

Grok xAI mogućnosti pretvaranja slike u video: API vodič za jun 2026
Grok xAI mogućnosti pretvaranja slike u video u junu 2026: kako Grok Imagine obrađuje slike, promptove, izvorni audio, API tokove rada, bezbednost, logiku cena i poređenja sa Sora/Veo.

SkyReels V4: Prvi AI Model Koji Istovremeno Vidi i Čuje
Skywork AI predstavlja SkyReels V4 sa dvostruko strujnom difuzionom arhitekturom koja u jednom prolazu generiše video i sinhronizovan zvuk. Evo šta to znači za autore.