Meta PixelLiigu põhi sisuni
AlexisAlexis· tehisintellekti autor, inimese poolt üle vaadatud
6 min read
1160 sõna

EPFL Stable Video Infinity: kuidas vigade taaskasutus lahendab AI-video suurima probleemi

EPFL-i uus ICLR 2026 suuline ettekanne tutvustab vigade taaskasutust, tehnikat, mis kõrvaldab ajalise triivi ja võimaldab luua mitmeminutilisi AI-videoid ilma lisaarvutuskuluta.

EPFL Stable Video Infinity: kuidas vigade taaskasutus lahendab AI-video suurima probleemi

Kas olete valmis looma oma tehisintellekti videoid?

Liituge tuhandete Bonega.ai kasutavate loojatega

Igal AI-videomudelil on sama räpane saladus. Loo 4-sekundiline klipp ja tulemused näevad vapustavad välja. Mine üle 15 sekundi ning tegelased hakkavad moonduma, füüsika laguneb, värvid muutuvad ja kogu stseen triivib sidususe kaotamiseni. EPFL-i VITA Lab avaldas just lahenduse ning see võib olla tänavu videogenereerimise kõige olulisem artikkel.

Triiviprobleem, mida keegi ei lahendanud

Kui oled proovinud luua pika vormiga AI-videot mõne praeguse mudeliga, tead seda frustratsiooni. Sora 2 piir on sõltuvalt paketist 15 kuni 25 sekundit. Runway Gen-4.5 maksimaalne pikkus on 10. Kling 3.0 ulatub 15-ni. Põhjus ei ole arvutusvõimsus ega mälu. See on ajaline triiv.

💡

Ajaline triiv tekib siis, kui autoregressiivsed videomudelid kuhjavad kaadrist kaadrisse väikeseid vigu. Iga loodud kaader muutub järgmise sisendiks ning pisikesed ebatäpsused võimenduvad eksponentsiaalselt. Mõnesaja kaadri järel meenutab väljund algset viipa vaevu.

See sarnaneb põhimõtteliselt „telefonimängu” probleemiga. Sosista sõnum piisavalt paljude inimeste kaudu ja see muutub äratundmatuks. Varasemad lähenemised proovisid triivi vastu võidelda, luues lühemaid klippe ja ühendades need kokku, kuid ühenduskohad on nähtavad. Teised kasutasid hierarhilist genereerimist (esmalt võtmekaadrid, seejärel interpolatsioon), mis aitab, kuid ei kõrvalda põhiprobleemi.

Vigade taaskasutus astub mängu

Artikkel pealkirjaga "Stable Video Infinity", mis võeti vastu ICLR 2026 suulise ettekandena, tutvustab petlikult lihtsat ideed: õpeta mudelit oma vigadega toime tulema.

Oral
ICLR 2026 staatus
0
Lisaarvutuskulu
Minutes
Video pikkus

Siin on peamine taip. Treeningu ajal õpivad standardsed video difusioonimudelid puhtast alusandmestikust. Nad ei näe kunagi enda loodud väljundit. Rakendamisel peavad nad järsku töötama sisendina oma ebatäiuslike ennustustega ega oska selle müraga toime tulla.

Vigade taaskasutus lahendab selle treeningutsükli muutmisega:

1. samm

Standardne edasine läbimine

Mudel loob puhtast treeningandmestikust videolõigu.

2. samm

Vigade kogumine

Mudeli enda ennustused (koos nende ebatäpsustega) püütakse kinni, selle asemel et need kõrvale heita.

3. samm

Vigade taaskasutus

Need ebatäiuslikud väljundid suunatakse järgmise treeningiteratsiooni sisendiks, õpetades mudelit looma stabiilset väljundit isegi mürarikastest, enda loodud kaadritest.

4. samm

Iteratiivne täiustamine

Paljude treeningtsüklite jooksul õpib mudel tugeva eneseparandusmehhanismi, mis hoiab ära vigade kuhjumise.

Selle lähenemise ilu seisneb selle elegantsuses. Puuduvad uued mudeliarhitektuurid, lisaparameetrid või inferentsiaegsed trikid. Mudel lihtsalt õpib treeningu ajal, millised näevad välja tegelikud kasutuselevõtu tingimused.

Miks see on olulisem, kui arvad

Mõju ulatub palju kaugemale pikemate kassivideote loomisest. Siin on, mis muutub:

Enne vigade taaskasutust

  • Videomudelid piirduvad 4-20 sekundiga
  • Stseeni järjepidevus halveneb kiiresti
  • Tegelase identiteet triivib mõne sekundi järel
  • Füüsika muutub järjest ebarealistlikumaks
  • Värvid ja valgustus muutuvad ettearvamatult

Pärast vigade taaskasutust

  • Mitmeminutiline sidus videogenereerimine
  • Tegelase välimus püsib kogu video vältel stabiilne
  • Järjepidev füüsika ja ruumilised suhted
  • Usaldusväärne värvikorrektsioon ja valgustus
  • Aja jooksul puudub nähtav kvaliteedilangus

Numbrid

VITA Lab tiim katsetas Stable Video Infinityt mitme arhitektuuri ja võrdlusandmestiku peal. Tulemused on silmatorkavad:

MõõdikIlma vigade taaskasutusetaVigade taaskasutusegaParanemine
FVD (madalam on parem)Halveneb pärast 4 sStabiilne kuni 2 min+Märkimisväärne
Tegelase järjepidevusLangeb 15 s juures alla 60%Püsib 2 min juures 90%+~50% suhteline
Ajaline sidususNähtav triiv 8 s juuresNähtav triiv puudub 2 min juuresKvalitatiivne hüpe
Arvutuse lisakuluBaastaseBaastase (0% suurenemine)Nullkulu
💡

Nulli arvutuskulu aspekt on kriitiline. Vigade taaskasutus on treeninguaegne tehnika, mitte inferentsiaegne. Pärast treenimist töötab mudel täpselt sama kiiruse ja kuluga nagu varem.

Kuidas vigade taaskasutus taustal töötab

Neile, kes soovivad tehnilisi üksikasju, kirjeldame siin, mis toimub muudetud treeningutorus.

Standardne video difusiooni treening kasutab puhastele aluskaadritele x_0 rakendatud müragraafikut epsilon. Mudel õpib müra ennustama ja algset signaali taastama. Inferentsi ajal loob mudel autoregressiivselt kaadri t+1, lähtudes oma kaadri t ennustusest.

Treeningu (puhtad sisendid) ja inferentsi (enda loodud sisendid) vahelist lõhet nimetatakse ekspositsiooninihkeks. Vigade taaskasutus tegeleb sellega otseselt.

Tehnilised üksikasjad: muudetud treeningueesmärk

Treeningu ajal loob mudel perioodiliselt kaadreid oma praeguste kaalude abil, selle asemel et kasutada alusandmestikku. Neid enda loodud kaadreid koos nende ebatäpsustega kasutatakse seejärel treeningjärjestuse järgnevate kaadrite tingimussisenditena.

Peamine hüperparameeter on taaskasutussuhe r, mis määrab, kui sageli asendavad enda loodud kaadrid treeningu ajal alusandmestiku kaadreid. Artiklis leitakse, et r = 0.3 (30% taaskasutatud kaadreid) saavutab optimaalse jõudluse, tasakaalustades stabiilsuse paranemist ja treeningsignaali kvaliteeti.

Muudetud kaofunktsioon jääb standardseks difusiooni eesmärgiks. Ainus erinevus on andmejaotus, mida mudel treeningu ajal näeb. Seetõttu puudub inferentsi ajal arvutuslik lisakulu.

See sarnaneb kontseptuaalselt jada-jadaks mudelite ajastatud valimiga, kuid on kohandatud pidevale difusiooniraamistikule. VITA Lab tiim tunnustab seda seost oma artiklis, märkides samas, et ajastatud valimi naiivne rakendamine difusioonimudelitele ei tööta. Nende panus on konkreetne formuleering, mis muudab selle videogenereerimise jaoks stabiilseks.

Avatud lähtekoodi eelis

Võib-olla kõige põnevam aspekt: kood on GitHubis täielikult avatud lähtekoodiga (vita-epfl/Stable-Video-Infinity). See tähendab, et iga uurimislabor või ettevõte saab vigade taaskasutust oma olemasolevatele videomudelitele rakendada.

Miks avatud lähtekood on oluline
Iga olemasolevat video difusioonimudelit saab vigade taaskasutusega täiendada. Arhitektuurilisi muudatusi pole vaja, piisab muudetud treeningutsüklist. See võib korraga parandada Sora, Runway, Klingi ja kõiki avatud lähtekoodiga mudeleid.
Praktilised piirangud
Nõuab mudeli ümberõpet või peenhäälestamist. Omanikmudelitega ettevõtted peavad ümberõppesse arvutusressurssi investeerima. Tehnika tõhusus võib eri arhitektuuride ja skaalade vahel varieeruda.

Avatud lähtekoodi väljalase järgib AI-video uurimiskogukonnas kasvavat trendi. Mudelid nagu LTX-2 ja Wan 2.6 on näidanud, et avatud lähtekoodiga lähenemised suudavad konkureerida omanike alternatiividega.

Mida see tööstuse jaoks tähendab

Ajastus on märkimisväärne. Oleme keset AI-video võidurelvastumist, kus iga suur tegija, alates Runwayst kuni ByteDance'ini, püüab saavutada pikemat ja kvaliteetsemat väljundit. Vigade taaskasutus võib olla puuduv osa, mis avab järgmise põlvkonna võimalused.

🎬

Filmitegijatele ja loojatele

Pika vormiga sidus videogenereerimine võimaldab luua tegelikku narratiivset sisu. Mitte ainult klippe, vaid stseene, järjestusi ja lõpuks lühifilme, mis on loodud ühest viibast.
🔬

Teadlastele

Vigade taaskasutus pakub üldistatavat raamistikku. Sama põhimõte võiks kehtida heligenereerimise, 3D-stseenide sünteesi ja iga autoregressiivse generatiivse mudeli puhul, mis kannatab triivi all.
🏢

Ettevõtetele

Stabiilne pika vormiga genereerimine muudab AI-video professionaalsete kasutusjuhtude jaoks elujõuliseks: tootedemod, koolitusvideod, turunduskampaaniad, mis nõuavad ühtlast kvaliteeti mitme minuti sisu vältel.

Pilk tulevikku

VITA Lab töö tähistab põhimõttelist muutust selles, kuidas me AI-video genereerimisest mõtleme. Selle asemel et ehitada aina suuremaid mudeleid või lisada keerulisi inferentsiaegseid mehhanisme, oli lahendus lihtsalt näidata mudelile, milline näeb välja tema enda väljund.

Artiklit esitletakse ICLR 2026-l ning mitu tööstusallikat viitavad, et suured videomudelite pakkujad juba uurivad selle integreerimist. Kui maailmamudelid esindavad AI tulevikku füüsika ja ruumi mõistmisel, siis vigade taaskasutus esindab AI tulevikku selle mõistmise säilitamisel ajas.

4-sekundiliste AI-videote ajastu võib lõppeda varem, kui keegi ootas. Ja selleks ei ole vaja uut mudeliarhitektuuri ega miljardidollarilist arvutuseelarvet. Vaja on vaid targemat treeningutsüklit.

Lisalugemine


Allikad

Alexis
AlexisAI EngineerAI Author

Lausanne’ist pärit tehisintellekti insener, kes ühendab uurimistöö põhjalikkuse praktilise innovatsiooniga. Jagab oma aega mudeliarhitektuuride ja Alpide tippude vahel.

View profile →

Kas teile meeldis loetu?

Muutke oma ideed minutitega piiramatult pikkadeks tehisintellekti videoteks.

Seotud artiklid

Jätkake avastamist nende seotud postitustega

Kas artikkel meeldis?

Avastage rohkem teadmisi ja püsige kursis meie uusima sisuga.