Meta PixelSiirry pääsisältöön
AlexisAlexis· Tekoälytekijä, ihmisen tarkistama
6 min read
1130 sanaa

EPFL Stable Video Infinity: Kuinka virheiden kierrätys ratkaisee tekoälyvideon suurimman ongelman

EPFL:n uusi ICLR 2026 Oral -artikkeli esittelee virheiden kierrätyksen, tekniikan, joka poistaa ajallisen ajautumisen ja mahdollistaa useiden minuuttien mittaisen tekoälyvideon luomisen ilman lisälaskentakustannuksia.

EPFL Stable Video Infinity: Kuinka virheiden kierrätys ratkaisee tekoälyvideon suurimman ongelman

Oletko valmis luomaan omia tekoälyvideoitasi?

Liity tuhansien Bonega.ai:tä käyttävien sisällöntuottajien joukkoon

Jokaisella tekoälyvideomallilla on sama likainen salaisuus. Luo 4 sekunnin leike, ja tulokset näyttävät upeilta. Jatka yli 15 sekunnin, ja hahmot alkavat muuntua, fysiikka hajoaa, värit muuttuvat ja koko kohtaus ajautuu epäjohdonmukaiseksi. EPFL:n VITA Lab julkaisi juuri ratkaisun, ja se voi olla tämän vuoden tärkein videoiden generointia käsittelevä artikkeli.

Ajautumisongelma, jota kukaan ei ratkaissut

Jos olet yrittänyt luoda pitkämuotoista tekoälyvideota millä tahansa nykyisellä mallilla, tunnet turhautumisen. Sora 2 rajoittuu suunnitelmastasi riippuen 15-25 sekuntiin. Runway Gen-4.5 yltää enintään 10 sekuntiin. Kling 3.0 yltää 15 sekuntiin. Syy ei ole laskenta tai muisti. Se on ajallinen ajautuminen.

💡

Ajallinen ajautuminen tapahtuu, kun autoregressiiviset videomallit kasaavat pieniä virheitä ruutu ruudulta. Jokaisesta generoidusta ruudusta tulee seuraavan syöte, ja pienet epätäydellisyydet kertautuvat eksponentiaalisesti. Muutaman sadan ruudun jälkeen tulos tuskin muistuttaa alkuperäistä kehotetta.

Tämä muistuttaa pohjimmiltaan "rikkinäisen puhelimen" ongelmaa. Kuiskataan viesti tarpeeksi monen ihmisen kautta, ja siitä tulee tunnistamaton. Aiemmat lähestymistavat yrittivät torjua ajautumista luomalla lyhyempiä leikkeitä ja liittämällä ne yhteen, mutta saumat näkyvät. Toiset käyttivät hierarkkista generointia (ensin avainruudut, sitten interpolointi), mikä auttaa, mutta ei poista ydinongelmaa.

Virheiden kierrätys saapuu

Artikkeli, nimeltään "Stable Video Infinity" ja hyväksytty ICLR 2026 Oral -esitykseksi, esittelee harhaanjohtavan yksinkertaisen idean: opetetaan malli käsittelemään omia virheitään.

Oral
ICLR 2026 -tila
0
Lisälaskentakustannus
Minutes
Videon pituus

Tässä on keskeinen oivallus. Koulutuksen aikana tavalliset videodiffuusiomallit oppivat puhtaasta totuudenmukaisesta datasta. Ne eivät koskaan näe omaa generoimaansa tuotosta. Käyttöönotettaessa niiden on yhtäkkiä toimittava omien epätäydellisten ennusteidensa kanssa syötteenä, eivätkä ne osaa käsitellä kohinaa.

Virheiden kierrätys korjaa tämän muokkaamalla koulutussilmukkaa:

Vaihe 1

Tavallinen eteenpäinajo

Malli generoi videosegmentin puhtaasta koulutusdatasta.

Vaihe 2

Virheiden kerääminen

Mallin omat ennusteet (epätäydellisyyksineen) tallennetaan hylkäämisen sijaan.

Vaihe 3

Virheiden kierrätys

Nämä epätäydelliset tuotokset syötetään takaisin seuraavan koulutusiteraation syötteeksi, jolloin malli oppii generoimaan vakaata tuotosta myös kohinaisista, itse luoduista ruuduista.

Vaihe 4

Iteratiivinen hienosäätö

Monien koulutussyklien aikana malli oppii vankan itsekorjausmekanismin, joka estää virheiden kertymisen.

Tämän lähestymistavan kauneus on sen tyylikkyydessä. Ei uusia malliarkkitehtuureja, ei lisäparametreja, ei päättelyajan kikkoja. Malli oppii koulutuksen aikana yksinkertaisesti, miltä todelliset käyttöolosuhteet näyttävät.

Miksi tämä on tärkeämpää kuin ajattelet

Vaikutukset ulottuvat paljon pidempien kissavideoiden luomista laajemmalle. Tässä on, mikä muuttuu:

Ennen virheiden kierrätystä

  • Videomallit rajoittuivat 4-20 sekuntiin
  • Kohtauksen johdonmukaisuus heikkenee nopeasti
  • Hahmon identiteetti ajautuu muutaman sekunnin jälkeen
  • Fysiikasta tulee yhä epärealistisempaa
  • Värit ja valaistus muuttuvat arvaamattomasti

Virheiden kierrätyksen jälkeen

  • Useiden minuuttien johdonmukainen videogenerointi
  • Vakaa hahmon ulkonäkö koko videon ajan
  • Johdonmukainen fysiikka ja tilalliset suhteet
  • Luotettava värimäärittely ja valaistus
  • Ei näkyvää laadun heikkenemistä ajan myötä

Luvut

VITA Labin tiimi testasi Stable Video Infinityä useissa arkkitehtuureissa ja vertailuarvioinneissa. Tulokset ovat silmiinpistäviä:

MittariIlman virheiden kierrätystäVirheiden kierrätykselläParannus
FVD (pienempi on parempi)Heikkenee 4s jälkeenVakaa yli 2min astiMerkittävä
Hahmojen johdonmukaisuusLaskee alle 60% tasolle 15s kohdallaSäilyttää 90%+ tason 2min kohdalla~50% suhteellinen
Ajallinen johdonmukaisuusNäkyvää ajautumista 8s kohdallaEi näkyvää ajautumista 2min kohdallaLaadullinen harppaus
Laskenta-ylikuormitusPerustasoPerustaso (0% lisäys)Nollakustannus
💡

Nollalaskenta-ylikuormitus on ratkaisevaa. Virheiden kierrätys on koulutusajan tekniikka, ei päättelyajan tekniikka. Koulutuksen jälkeen malli toimii täsmälleen samalla nopeudella ja kustannuksella kuin aiemmin.

Kuinka virheiden kierrätys toimii konepellin alla

Niille, jotka haluavat tekniset yksityiskohdat, tässä tapahtuu muokatussa koulutusputkessa.

Tavallinen videodiffuusion koulutus käyttää kohina-aikataulua epsilon, jota sovelletaan puhtaisiin totuudenmukaisiin ruutuihin x_0. Malli oppii ennustamaan kohinan ja palauttamaan alkuperäisen signaalin. Päättelyaikana malli generoi autoregressiivisesti ruudun t+1 ehdollistettuna ruutua t koskevaan ennusteeseensa.

Koulutuksen (puhtaat syötteet) ja päättelyn (itse generoidut syötteet) välistä kuilua kutsutaan altistusharhaksi. Virheiden kierrätys käsittelee sitä suoraan.

Tekniset yksityiskohdat: Muokattu koulutustavoite

Koulutuksen aikana malli generoi ajoittain ruutuja omilla nykyisillä painoillaan totuudenmukaisen datan käytön sijaan. Näitä itse generoituja ruutuja, kaikkine epätäydellisyyksineen, käytetään sitten ehdollistavina syötteinä koulutussekvenssin seuraaville ruuduille.

Keskeinen hyperparametri on kierrätyssuhde r, joka säätelee, kuinka usein itse generoituja ruutuja korvataan koulutuksen aikana totuudenmukaisilla ruuduilla. Artikkelin mukaan r = 0.3 (30% kierrätettyjä ruutuja) saavuttaa optimaalisen suorituskyvyn tasapainottamalla vakauden parantumisen ja koulutussignaalin laadun.

Muokattu häviöfunktio pysyy tavallisena diffuusiotavoitteena. Ainoa ero on datan jakauma, jonka malli näkee koulutuksen aikana. Siksi päättelyaikana ei synny laskennallista ylikuormitusta.

Tämä muistuttaa käsitteellisesti scheduled sampling -menetelmää sekvenssistä sekvenssiin -malleissa, mutta se on mukautettu jatkuvaan diffuusiokehykseen. VITA Labin tiimi mainitsee tämän yhteyden artikkelissaan ja toteaa samalla, että scheduled samplingin naiivi soveltaminen diffuusiomalleihin ei toimi. Heidän panoksensa on erityinen muotoilu, joka tekee siitä vakaan videogeneroinnissa.

Avoimen lähdekoodin etu

Ehkä jännittävin piirre: koodi on täysin avointa lähdekoodia GitHubissa (vita-epfl/Stable-Video-Infinity). Tämä tarkoittaa, että mikä tahansa tutkimuslaboratorio tai yritys voi soveltaa virheiden kierrätystä olemassa oleviin videomalleihinsa.

Miksi avoin lähdekoodi on tärkeää
Mikä tahansa olemassa oleva videodiffuusiomalli voidaan jälkiasentaa käyttämään virheiden kierrätystä. Arkkitehtuurimuutoksia ei tarvita, vain muokattu koulutussilmukka. Tämä voisi parantaa Soraa, Runwayta, Klingiä ja kaikkia avoimen lähdekoodin malleja samanaikaisesti.
Käytännön rajoitukset
Edellyttää mallin uudelleenkoulutusta tai hienosäätöä. Omistuksellisia malleja käyttävien yritysten on investoitava laskentaa uudelleenkoulutukseen. Tekniikan tehokkuus voi vaihdella eri arkkitehtuurien ja mittakaavojen välillä.

Avoimen lähdekoodin julkaisu seuraa kasvavaa trendiä tekoälyvideotutkimusyhteisössä. Mallit kuten LTX-2 ja Wan 2.6 ovat osoittaneet, että avoimen lähdekoodin lähestymistavat voivat kilpailla omistuksellisten vaihtoehtojen kanssa.

Mitä tämä tarkoittaa alalle

Ajankohta on merkittävä. Olemme keskellä tekoälyvideon kilpavarustelua, jossa jokainen merkittävä toimija Runwaysta ByteDanceen pyrkii pidempään ja laadukkaampaan tuotokseen. Virheiden kierrätys voi olla puuttuva pala, joka avaa seuraavan sukupolven kyvykkyydet.

🎬

Elokuvantekijöille ja sisällöntuottajille

Pitkämuotoinen johdonmukainen videogenerointi mahdollistaa todellisen narratiivisen sisällön. Ei vain leikkeitä, vaan kohtauksia, jaksoja ja lopulta yhdestä kehotteesta generoituja lyhytelokuvia.
🔬

Tutkijoille

Virheiden kierrätys tarjoaa yleistettävän kehyksen. Sama periaate voisi soveltua äänen generointiin, 3D-kohtausten synteesiin ja mihin tahansa autoregressiiviseen generatiiviseen malliin, joka kärsii ajautumisesta.
🏢

Yrityksille

Vakaa pitkämuotoinen generointi tekee tekoälyvideosta käyttökelpoisen ammattimaisissa käyttötapauksissa: tuotedemoissa, koulutusvideoissa ja markkinointikampanjoissa, jotka edellyttävät tasaista laatua useiden minuuttien sisällössä.

Katse eteenpäin

VITA Labin työ edustaa perustavanlaatuista muutosta siinä, miten ajattelemme tekoälyvideon generointia. Sen sijaan, että rakennettaisiin yhä suurempia malleja tai lisättäisiin monimutkaisia päättelyajan mekanismeja, ratkaisu oli yksinkertaisesti näyttää mallille, miltä sen oma tuotos näyttää.

Artikkeli esitellään ICLR 2026 -konferenssissa, ja useat alan lähteet viittaavat siihen, että suuret videomallien tarjoajat tutkivat jo integraatiota. Jos maailmanmallit edustavat tekoälyn fysiikan ja tilan ymmärtämisen tulevaisuutta, virheiden kierrätys edustaa tulevaisuutta sille, miten tekoäly ylläpitää tätä ymmärrystä ajan myötä.

4 sekunnin tekoälyvideoiden aikakausi voi päättyä nopeammin kuin kukaan odotti. Se ei vaadi uutta malliarkkitehtuuria eikä miljardin dollarin laskentabudjettia. Vain älykkäämmän koulutussilmukan.

Lisälukemista


Lähteet

Alexis
AlexisAI EngineerAI Author

Lausannesta kotoisin oleva tekoälyinsinööri, joka yhdistää tutkimuksen syvyyden käytännön innovointiin. Jakaa aikansa malliarkkitehtuurien ja alppihuippujen välillä.

View profile →

Piditkö lukemastasi?

Muunna ideasi rajattoman pituisiksi tekoälyvideoiksi minuuteissa.

Aiheeseen liittyvät artikkelit

Jatka tutustumista näihin aiheeseen liittyviin julkaisuihin

Piditkö tästä artikkelista?

Löydä lisää oivalluksia ja pysy ajan tasalla uusimmasta sisällöstämme.