Meta PixelPreskoči na glavni sadržaj
AlexisAlexis· Autor je veštačka inteligencija, pregledao čovek
7 min read
1278 reči

EPFL Stable Video Infinity: kako prerada grešaka rešava glavni problem AI videa

Novi radovi EPFL za ICLR 2026 (usmena prezentacija) predstavlja preredu grešaka, tehniku koja uklanja vremenski drejf i omogućava generisanje video snimaka od više minuta bez dodatnih računarskih troškova.

EPFL Stable Video Infinity: kako prerada grešaka rešava glavni problem AI videa

Spremni da kreirate sopstvene AI videozapise?

Pridružite se hiljadama kreatora koji koriste Bonega.ai

Svaki AI video model čuva istu nečistu tajnu. Generiši 4-sekundni klip i rezultati izgledaju spektakularno. Idi dalje od 15 sekundi i likovi počinju da se deformišu, fizika se razlaže, boje se pomeraju, čitava scena driftuje u haos. VITA Lab u EPFL-u upravo je objavio rešenje, i to može biti najvažnija novina u generisanju videa ove godine.

Problem drejfa koji niko nije rešio

Ako si ikad pokušao da generišeš video dugog trajanja sa bilo kojim od postojećih modela, znaš to razočaranje. Sora 2 je ograničena na 15-25 sekundi u zavisnosti od plana. Runway Gen-4.5 maksimalno 10 sekundi. Kling 3.0 dostiže 15 sekundi. Razlog nije računarska moć niti memorija. To je vremenski drejf.

💡

Vremenski drejf se javlja kada autregresivni video modeli akumuliraju male greške kadar po kadar. Svaki generisan kadar postaje ulaz za sledeći, a mali nedostaci se eksponencijalno uvećavaju. Posle nekoliko stotina kadara, rezultat edva podseća na originalnu komandu.

Ovo je u suštini slično problemu "telefonske igre". Prosleđi poruku kroz dovoljno ljudi i ona postaje nerazumljiva. Prethodni pristupi su pokušali da bore drejf generisanjem kraćih klipova i lepljenjem ih zajedno, ali šivovi su vidljivi. Drugi su koristili hijerarhijsku generaciju (prvo ključni kadari, zatim interpolacija), što pomaže, ali ne uklanja suštinski problem.

Uvođenje prerebe grešaka

Radovi pod naslovom "Stable Video Infinity" i prihvaćeni kao usmena prezentacija na ICLR 2026 predstavlja, na prvi pogled, jednostavnu ideju: nauči model da rukovodi svojim greškama.

Oral
ICLR 2026 Status
0
Extra Compute Cost
Minutes
Video Length

Evo ključne ideje. Tokom obučavanja, standardni video modeli difuzije se obučavaju na čistim podaci ground-truth. Nikada ne vide svoj generisan izlaz. Pri pokretanju, odjednom moraju da rade sa svojim nesavršenim predviđanjima kao ulazom, i ne znaju kako da se suoče s bukom.

Prerada grešaka rešava ovo modifikacijom ciklusa obučavanja:

Step 1

Standard Forward Pass

Model generiše video segment iz čistih obučavajućih podataka.

Step 2

Error Collection

Vlastita predviđanja modela (sa svim njihovim nesavršenostima) su uhvaćena umesto da budu odbačena.

Step 3

Error Recycling

Ovi nesavršeni rezultati se vraćaju kao ulazi za sledeću iteraciju obučavanja, obučavajući model da generiše stabilan izlaz čak i iz bučnih, samogenerisanih kadara.

Step 4

Iterative Refinement

Kroz mnogih ciklusa obučavanja, model nauči pouzdanog mehanizma za samoispravljanje koji sprečava akumulaciju grešaka.

Lepota ovog pristupa je u njegovoj eleganciji. Nema novih arhitektura modela, nema dodatnih parametara, nema trikova u vreme generisanja. Model jednostavno uči tokom obučavanja kako izgledaju pravi uslovi pokretanja.

Zašto je ovo važnije nego što misliš

Implikacije idu daleko izvan generisanja dužih videa od mačaka. Evo šta se menja:

Pre prerebe grešaka

  • Video modeli ograničeni na 4-20 sekundi
  • Konzistentnost scene brzo degradira
  • Identitet lika driftuje posle nekoliko sekundi
  • Fizika postaje sve nerealnija
  • Boja i osvetljenje se nepredvido kreću

Posle prerebe grešaka

  • Generisanje videa od više minuta sa konzistentnošću
  • Stabilan izgled lika kroz ceo video
  • Konzistentna fizika i prostorni odnosi
  • Pouzdana korekcija boje i osvetljenje
  • Nema vidljivog pada kvaliteta sa vremenom

Brojevi

VITA Lab tim je testirao Stable Video Infinity na različitim arhitekturama i merilima. Rezultati su čudesni:

MetrikaBez prerebe grešakaSa prerebom grešakaPoboljšanje
FVD (niža je bolja)Degradira posle 4sStabilna kroz 2min+Značajna
Konzistentnost likaPada ispod 60% na 15sOdržava 90%+ na 2min~50% relativna
Vremenska konzistentnostVidljivi drejf na 8sBez vidljivog drejfa na 2minKvalitativni skok
Compute OverheadBaselineBaseline (0% porasta)Nula troškova
💡

Aspekt nula računarskih troškova je kritičan. Prerada grešaka je tehnika vremena obučavanja, ne generisanja. Jednom obučena, model radi sa istom brzinom i ceno kao pre.

Kako prerada grešaka funkcioniše ispod kape

Za one koji žele tehničke detalje, evo šta se dešava u modifikovanom konvejeru obučavanja.

Standardno video obučavanje difuzije koristi raspored buka epsilon primenjen na čistim kadrima ground-truth x_0. Model uči da predvidi buku i da vrati originalnu signal. U vreme generisanja, model autregresivno generiše kadar t+1 uslovljen njenim predviđanjem kadra t.

Jaz između obučavanja (čisti ulazi) i generisanja (samogenerisani ulazi) naziva se predubeđenje ekspozicije. Prerada grešaka direktno to rešava.

Technical Details: Modified Training Objective

Tokom obučavanja, model periodično generiše kadare koristeći svoju postojeću težinu, umesto upotrebe ground-truth podataka. Ovi samogenerisani kadari, sa svim njihovim nesavršenostima, se zatim koriste kao uslovni ulazi za sledeće kadare u nizu obučavanja.

Ključni hiper parametar je koeficijent prerebe r, koji kontroliše koliko često samogenerisani kadari zamenjuju ground-truth kadare tokom obučavanja. Radovi otkriva da r = 0.3 (30% prerebenih kadara) postiže optimalne performanse, balansirajući poboljšanje stabilnosti sa kvalitetom signala obučavanja.

Modifikovana funkcija gubitka ostaje standardni cilj difuzije. Jedina razlika je distribucija podataka koju model vidi tokom obučavanja. Evo zašto nema računarskih troškova u vreme generisanja.

Ovo je konceptualno slično scheduled sampling u redos-na-redos modelima, ali adaptirano za neprekidnu difuzijsku ramku. VITA Lab tim priznaje ovu vezu u svojim radovima, istovremeno napominjući da naivna primena scheduled sampling-a na difuzijske modele ne funkcioniše. Njihov doprinos je specifična formulacija koja je čini stabilnom za generisanje videa.

Prednost otvorenog koda

Možda su najuzbudljiviji aspekt: kod je u potpunosti otvorenog koda na GitHub-u (vita-epfl/Stable-Video-Infinity). To znači da bilo koja istraživačka laboratorija ili kompanija može primeniti preredu grešaka na svoje postojeće video modele.

Zašto je otvoreni kod važan
Svaki postojeći video model difuzije može biti prerebriran sa prebrebom grešaka. Bez arhitekturnih promena, samo modifikovan ciklus obučavanja. Ovo bi moglo poboljšati Sora, Runway, Kling i svak model sa otvornim kodom istovremeno.
Praktična ograničenja
Zahteva ponovno obučavanje ili fine-tuning modela. Kompanije sa vlasničkim modelima moraju investirati računare u ponovno obučavanje. Efikasnost tehnike može varirati među različitim arhitekturama i skalama.

Izdanje otvorenog koda sledi rastući trend u zajednici istraživača AI videa. Modeli kao LTX-2 i Wan 2.6 pokazali su da pristupi otvorenog koda mogu konkurirati sa vlasničkim alternativama.

Šta ovo znači za industriju

Vreme je zanimljivo. Nalazimo se u sredini AI video trke gde svaki glavni igrač, od Runway do ByteDance, pokušava da dobije duži, veći kvalitet. Prerada grešaka bi mogla biti nedostajuća detal koja otklanja sledeću generaciju sposobnosti.

🎬

Za filmske umetnike i tvorce

Dugroformatno generisanje videa jačinovog obezbeđuje pravi narativni sadržaj. Ne samo klipovi, već scene, nizovi i, konačno, kratki filmovi generisani iz jedne komande.
🔬

Za istraživače

Prerada grešaka obezbeđuje opšte okvire. Isti princip mogao bi da se primeni na generisanje zvuka, sintezu 3D scena i bilo kom autregresivnom generativnom modelu koji pati od drejfa.
🏢

Za preduzeća

Stabilno generisanje videa dugog trajanja AI video žiznensposobnim za profesionalne slučajeve upotrebe: demonstracije proizvoda, obučavajući video, marketinške kampanje koje zahtevaju konzistentan kvalitet kroz minute sadržaja.

Pogled u budućnost

Rad VITA Lab-a predstavlja fundamentalnu promenu u tome kako mislimo o generisanju AI videa. Umesto izgradnje sve većih modela ili dodavanja složenih mehanizama u vreme generisanja, rešenje je bila jednostavno pokazivanje modela kako njegov izlaz izgleda.

Radovi će biti predstavljeni na ICLR 2026, i nekoliko industrijskih izvora predlažu da su glavni dobavljači video modela već istraživanje integracije. Ako world models predstavljaju budućnost kako AI razume fiziku i prostor, prerada grešaka predstavlja budućnost kako AI održava to razumevanje kroz vreme.

Razdoblje 4-sekundnih AI videa moglo bi završiti ranije nego što bilo ko očekuje. I neće zahtevati novu arhitekturu modela niti budžeta od milijardi za računare. Samo pametniji ciklus obučavanja.

Dalja čitanja

Alexis
AlexisAI EngineerAI Author

AI inženjer iz Lozane koji kombinuje dubinu istraživanja sa praktičnim inovacijama. Deli vreme između arhitektura modela i alpskih vrhova.

View profile →

Sviđa vam se ono što ste pročitali?

Pretvorite svoje ideje u AI videozapise neograničene dužine za nekoliko minuta.

Povezani članci

Nastavite istraživanje uz ove povezane objave

Da li vam se dopao ovaj članak?

Otkrijte više uvida i budite u toku sa našim najnovijim sadržajem.