EPFL Stable Video Infinity: kuidas vigade taaskasutus lahendab AI-video suurima probleemi
EPFL-i uus ICLR 2026 suuline ettekanne tutvustab vigade taaskasutust, tehnikat, mis kõrvaldab ajalise triivi ja võimaldab luua mitmeminutilisi AI-videoid ilma lisaarvutuskuluta.

Triiviprobleem, mida keegi ei lahendanud
Kui oled proovinud luua pika vormiga AI-videot mõne praeguse mudeliga, tead seda frustratsiooni. Sora 2 piir on sõltuvalt paketist 15 kuni 25 sekundit. Runway Gen-4.5 maksimaalne pikkus on 10. Kling 3.0 ulatub 15-ni. Põhjus ei ole arvutusvõimsus ega mälu. See on ajaline triiv.
Ajaline triiv tekib siis, kui autoregressiivsed videomudelid kuhjavad kaadrist kaadrisse väikeseid vigu. Iga loodud kaader muutub järgmise sisendiks ning pisikesed ebatäpsused võimenduvad eksponentsiaalselt. Mõnesaja kaadri järel meenutab väljund algset viipa vaevu.
See sarnaneb põhimõtteliselt „telefonimängu” probleemiga. Sosista sõnum piisavalt paljude inimeste kaudu ja see muutub äratundmatuks. Varasemad lähenemised proovisid triivi vastu võidelda, luues lühemaid klippe ja ühendades need kokku, kuid ühenduskohad on nähtavad. Teised kasutasid hierarhilist genereerimist (esmalt võtmekaadrid, seejärel interpolatsioon), mis aitab, kuid ei kõrvalda põhiprobleemi.
Vigade taaskasutus astub mängu
Artikkel pealkirjaga "Stable Video Infinity", mis võeti vastu ICLR 2026 suulise ettekandena, tutvustab petlikult lihtsat ideed: õpeta mudelit oma vigadega toime tulema.
Siin on peamine taip. Treeningu ajal õpivad standardsed video difusioonimudelid puhtast alusandmestikust. Nad ei näe kunagi enda loodud väljundit. Rakendamisel peavad nad järsku töötama sisendina oma ebatäiuslike ennustustega ega oska selle müraga toime tulla.
Vigade taaskasutus lahendab selle treeningutsükli muutmisega:
Standardne edasine läbimine
Mudel loob puhtast treeningandmestikust videolõigu.
Vigade kogumine
Mudeli enda ennustused (koos nende ebatäpsustega) püütakse kinni, selle asemel et need kõrvale heita.
Vigade taaskasutus
Need ebatäiuslikud väljundid suunatakse järgmise treeningiteratsiooni sisendiks, õpetades mudelit looma stabiilset väljundit isegi mürarikastest, enda loodud kaadritest.
Iteratiivne täiustamine
Paljude treeningtsüklite jooksul õpib mudel tugeva eneseparandusmehhanismi, mis hoiab ära vigade kuhjumise.
Selle lähenemise ilu seisneb selle elegantsuses. Puuduvad uued mudeliarhitektuurid, lisaparameetrid või inferentsiaegsed trikid. Mudel lihtsalt õpib treeningu ajal, millised näevad välja tegelikud kasutuselevõtu tingimused.
Miks see on olulisem, kui arvad
Mõju ulatub palju kaugemale pikemate kassivideote loomisest. Siin on, mis muutub:
Enne vigade taaskasutust
- Videomudelid piirduvad 4-20 sekundiga
- Stseeni järjepidevus halveneb kiiresti
- Tegelase identiteet triivib mõne sekundi järel
- Füüsika muutub järjest ebarealistlikumaks
- Värvid ja valgustus muutuvad ettearvamatult
Pärast vigade taaskasutust
- Mitmeminutiline sidus videogenereerimine
- Tegelase välimus püsib kogu video vältel stabiilne
- Järjepidev füüsika ja ruumilised suhted
- Usaldusväärne värvikorrektsioon ja valgustus
- Aja jooksul puudub nähtav kvaliteedilangus
Numbrid
VITA Lab tiim katsetas Stable Video Infinityt mitme arhitektuuri ja võrdlusandmestiku peal. Tulemused on silmatorkavad:
| Mõõdik | Ilma vigade taaskasutuseta | Vigade taaskasutusega | Paranemine |
|---|---|---|---|
| FVD (madalam on parem) | Halveneb pärast 4 s | Stabiilne kuni 2 min+ | Märkimisväärne |
| Tegelase järjepidevus | Langeb 15 s juures alla 60% | Püsib 2 min juures 90%+ | ~50% suhteline |
| Ajaline sidusus | Nähtav triiv 8 s juures | Nähtav triiv puudub 2 min juures | Kvalitatiivne hüpe |
| Arvutuse lisakulu | Baastase | Baastase (0% suurenemine) | Nullkulu |
Nulli arvutuskulu aspekt on kriitiline. Vigade taaskasutus on treeninguaegne tehnika, mitte inferentsiaegne. Pärast treenimist töötab mudel täpselt sama kiiruse ja kuluga nagu varem.
Kuidas vigade taaskasutus taustal töötab
Neile, kes soovivad tehnilisi üksikasju, kirjeldame siin, mis toimub muudetud treeningutorus.
Standardne video difusiooni treening kasutab puhastele aluskaadritele x_0 rakendatud müragraafikut epsilon. Mudel õpib müra ennustama ja algset signaali taastama. Inferentsi ajal loob mudel autoregressiivselt kaadri t+1, lähtudes oma kaadri t ennustusest.
Treeningu (puhtad sisendid) ja inferentsi (enda loodud sisendid) vahelist lõhet nimetatakse ekspositsiooninihkeks. Vigade taaskasutus tegeleb sellega otseselt.
Tehnilised üksikasjad: muudetud treeningueesmärk▼
Treeningu ajal loob mudel perioodiliselt kaadreid oma praeguste kaalude abil, selle asemel et kasutada alusandmestikku. Neid enda loodud kaadreid koos nende ebatäpsustega kasutatakse seejärel treeningjärjestuse järgnevate kaadrite tingimussisenditena.
Peamine hüperparameeter on taaskasutussuhe r, mis määrab, kui sageli asendavad enda loodud kaadrid treeningu ajal alusandmestiku kaadreid. Artiklis leitakse, et r = 0.3 (30% taaskasutatud kaadreid) saavutab optimaalse jõudluse, tasakaalustades stabiilsuse paranemist ja treeningsignaali kvaliteeti.
Muudetud kaofunktsioon jääb standardseks difusiooni eesmärgiks. Ainus erinevus on andmejaotus, mida mudel treeningu ajal näeb. Seetõttu puudub inferentsi ajal arvutuslik lisakulu.
See sarnaneb kontseptuaalselt jada-jadaks mudelite ajastatud valimiga, kuid on kohandatud pidevale difusiooniraamistikule. VITA Lab tiim tunnustab seda seost oma artiklis, märkides samas, et ajastatud valimi naiivne rakendamine difusioonimudelitele ei tööta. Nende panus on konkreetne formuleering, mis muudab selle videogenereerimise jaoks stabiilseks.
Avatud lähtekoodi eelis
Võib-olla kõige põnevam aspekt: kood on GitHubis täielikult avatud lähtekoodiga (vita-epfl/Stable-Video-Infinity). See tähendab, et iga uurimislabor või ettevõte saab vigade taaskasutust oma olemasolevatele videomudelitele rakendada.
Avatud lähtekoodi väljalase järgib AI-video uurimiskogukonnas kasvavat trendi. Mudelid nagu LTX-2 ja Wan 2.6 on näidanud, et avatud lähtekoodiga lähenemised suudavad konkureerida omanike alternatiividega.
Mida see tööstuse jaoks tähendab
Ajastus on märkimisväärne. Oleme keset AI-video võidurelvastumist, kus iga suur tegija, alates Runwayst kuni ByteDance'ini, püüab saavutada pikemat ja kvaliteetsemat väljundit. Vigade taaskasutus võib olla puuduv osa, mis avab järgmise põlvkonna võimalused.
Filmitegijatele ja loojatele
Teadlastele
Ettevõtetele
Pilk tulevikku
VITA Lab töö tähistab põhimõttelist muutust selles, kuidas me AI-video genereerimisest mõtleme. Selle asemel et ehitada aina suuremaid mudeleid või lisada keerulisi inferentsiaegseid mehhanisme, oli lahendus lihtsalt näidata mudelile, milline näeb välja tema enda väljund.
Artiklit esitletakse ICLR 2026-l ning mitu tööstusallikat viitavad, et suured videomudelite pakkujad juba uurivad selle integreerimist. Kui maailmamudelid esindavad AI tulevikku füüsika ja ruumi mõistmisel, siis vigade taaskasutus esindab AI tulevikku selle mõistmise säilitamisel ajas.
4-sekundiliste AI-videote ajastu võib lõppeda varem, kui keegi ootas. Ja selleks ei ole vaja uut mudeliarhitektuuri ega miljardidollarilist arvutuseelarvet. Vaja on vaid targemat treeningutsüklit.
Lisalugemine
- Avatud lähtekoodiga AI-video revolutsioon: kuidas avatud mudelid vähendavad lõhet omanike süsteemidega
- Füüsika simulatsioon AI-videos: kuidas mudelid õpivad füüsikalist järjepidevust
- Difusioonitransformerid: arhitektuur, mis toetab kaasaegset videogenereerimist
Allikad
- International Conference on Learning Representations: suuline ettekanne (ICLR 2026 staatus) (International Conference on Learning Representations)
- EPFL VITA teadlased arXivi kaudu: Stable Video Infinity toetab lõpmatu pikkusega videogenereerimist ilma täiendava inferentsita… (EPFL VITA teadlased arXivi kaudu)

Lausanne’ist pärit tehisintellekti insener, kes ühendab uurimistöö põhjalikkuse praktilise innovatsiooniga. Jagab oma aega mudeliarhitektuuride ja Alpide tippude vahel.
View profile →Kas teile meeldis loetu?
Muutke oma ideed minutitega piiramatult pikkadeks tehisintellekti videoteks.
Seotud artiklid
Jätkake avastamist nende seotud postitustega

Tasuta piiramatud AI-videotööriistad: mis toimib 2026. aastal
Tasuta piiramatud AI-videotööriistad põhinevad tavaliselt järjekorral või töötavad kohalikult. Uuri, mis on tegelikult piiramatu, mis aeglustab tööd ja kuidas valida toimiv 2026. aasta lahendus.

Parimad tasuta tekstist videoks AI-tööriistad: 2026. aasta juhend
Võrdle 2026. aasta parimaid tasuta tekstist videoks AI-tööriistu, sealhulgas nende tegelikke krediidipiiranguid, vesimärke, kohaliku seadistuse kompromisse ja praktilist testimisplaani.

Grok xAI pildist videoks võimalused: 2026. aasta juuni API juhend
Grok xAI pildist videoks võimalused 2026. aasta juunis: kuidas Grok Imagine käsitleb pilte, prompte, native audio't, API töövooge, ohutust, hinnastuse loogikat ning võrdlusi Sora/Veo mudelitega.