EPFL Stable Video Infinity: Kuinka virheiden kierrätys ratkaisee tekoälyvideon suurimman ongelman
EPFL:n uusi ICLR 2026 Oral -artikkeli esittelee virheiden kierrätyksen, tekniikan, joka poistaa ajallisen ajautumisen ja mahdollistaa useiden minuuttien mittaisen tekoälyvideon luomisen ilman lisälaskentakustannuksia.

Oletko valmis luomaan omia tekoälyvideoitasi?
Liity tuhansien Bonega.ai:tä käyttävien sisällöntuottajien joukkoon
Ajautumisongelma, jota kukaan ei ratkaissut
Jos olet yrittänyt luoda pitkämuotoista tekoälyvideota millä tahansa nykyisellä mallilla, tunnet turhautumisen. Sora 2 rajoittuu suunnitelmastasi riippuen 15-25 sekuntiin. Runway Gen-4.5 yltää enintään 10 sekuntiin. Kling 3.0 yltää 15 sekuntiin. Syy ei ole laskenta tai muisti. Se on ajallinen ajautuminen.
Ajallinen ajautuminen tapahtuu, kun autoregressiiviset videomallit kasaavat pieniä virheitä ruutu ruudulta. Jokaisesta generoidusta ruudusta tulee seuraavan syöte, ja pienet epätäydellisyydet kertautuvat eksponentiaalisesti. Muutaman sadan ruudun jälkeen tulos tuskin muistuttaa alkuperäistä kehotetta.
Tämä muistuttaa pohjimmiltaan "rikkinäisen puhelimen" ongelmaa. Kuiskataan viesti tarpeeksi monen ihmisen kautta, ja siitä tulee tunnistamaton. Aiemmat lähestymistavat yrittivät torjua ajautumista luomalla lyhyempiä leikkeitä ja liittämällä ne yhteen, mutta saumat näkyvät. Toiset käyttivät hierarkkista generointia (ensin avainruudut, sitten interpolointi), mikä auttaa, mutta ei poista ydinongelmaa.
Virheiden kierrätys saapuu
Artikkeli, nimeltään "Stable Video Infinity" ja hyväksytty ICLR 2026 Oral -esitykseksi, esittelee harhaanjohtavan yksinkertaisen idean: opetetaan malli käsittelemään omia virheitään.
Tässä on keskeinen oivallus. Koulutuksen aikana tavalliset videodiffuusiomallit oppivat puhtaasta totuudenmukaisesta datasta. Ne eivät koskaan näe omaa generoimaansa tuotosta. Käyttöönotettaessa niiden on yhtäkkiä toimittava omien epätäydellisten ennusteidensa kanssa syötteenä, eivätkä ne osaa käsitellä kohinaa.
Virheiden kierrätys korjaa tämän muokkaamalla koulutussilmukkaa:
Tavallinen eteenpäinajo
Malli generoi videosegmentin puhtaasta koulutusdatasta.
Virheiden kerääminen
Mallin omat ennusteet (epätäydellisyyksineen) tallennetaan hylkäämisen sijaan.
Virheiden kierrätys
Nämä epätäydelliset tuotokset syötetään takaisin seuraavan koulutusiteraation syötteeksi, jolloin malli oppii generoimaan vakaata tuotosta myös kohinaisista, itse luoduista ruuduista.
Iteratiivinen hienosäätö
Monien koulutussyklien aikana malli oppii vankan itsekorjausmekanismin, joka estää virheiden kertymisen.
Tämän lähestymistavan kauneus on sen tyylikkyydessä. Ei uusia malliarkkitehtuureja, ei lisäparametreja, ei päättelyajan kikkoja. Malli oppii koulutuksen aikana yksinkertaisesti, miltä todelliset käyttöolosuhteet näyttävät.
Miksi tämä on tärkeämpää kuin ajattelet
Vaikutukset ulottuvat paljon pidempien kissavideoiden luomista laajemmalle. Tässä on, mikä muuttuu:
Ennen virheiden kierrätystä
- Videomallit rajoittuivat 4-20 sekuntiin
- Kohtauksen johdonmukaisuus heikkenee nopeasti
- Hahmon identiteetti ajautuu muutaman sekunnin jälkeen
- Fysiikasta tulee yhä epärealistisempaa
- Värit ja valaistus muuttuvat arvaamattomasti
Virheiden kierrätyksen jälkeen
- Useiden minuuttien johdonmukainen videogenerointi
- Vakaa hahmon ulkonäkö koko videon ajan
- Johdonmukainen fysiikka ja tilalliset suhteet
- Luotettava värimäärittely ja valaistus
- Ei näkyvää laadun heikkenemistä ajan myötä
Luvut
VITA Labin tiimi testasi Stable Video Infinityä useissa arkkitehtuureissa ja vertailuarvioinneissa. Tulokset ovat silmiinpistäviä:
| Mittari | Ilman virheiden kierrätystä | Virheiden kierrätyksellä | Parannus |
|---|---|---|---|
| FVD (pienempi on parempi) | Heikkenee 4s jälkeen | Vakaa yli 2min asti | Merkittävä |
| Hahmojen johdonmukaisuus | Laskee alle 60% tasolle 15s kohdalla | Säilyttää 90%+ tason 2min kohdalla | ~50% suhteellinen |
| Ajallinen johdonmukaisuus | Näkyvää ajautumista 8s kohdalla | Ei näkyvää ajautumista 2min kohdalla | Laadullinen harppaus |
| Laskenta-ylikuormitus | Perustaso | Perustaso (0% lisäys) | Nollakustannus |
Nollalaskenta-ylikuormitus on ratkaisevaa. Virheiden kierrätys on koulutusajan tekniikka, ei päättelyajan tekniikka. Koulutuksen jälkeen malli toimii täsmälleen samalla nopeudella ja kustannuksella kuin aiemmin.
Kuinka virheiden kierrätys toimii konepellin alla
Niille, jotka haluavat tekniset yksityiskohdat, tässä tapahtuu muokatussa koulutusputkessa.
Tavallinen videodiffuusion koulutus käyttää kohina-aikataulua epsilon, jota sovelletaan puhtaisiin totuudenmukaisiin ruutuihin x_0. Malli oppii ennustamaan kohinan ja palauttamaan alkuperäisen signaalin. Päättelyaikana malli generoi autoregressiivisesti ruudun t+1 ehdollistettuna ruutua t koskevaan ennusteeseensa.
Koulutuksen (puhtaat syötteet) ja päättelyn (itse generoidut syötteet) välistä kuilua kutsutaan altistusharhaksi. Virheiden kierrätys käsittelee sitä suoraan.
Tekniset yksityiskohdat: Muokattu koulutustavoite▼
Koulutuksen aikana malli generoi ajoittain ruutuja omilla nykyisillä painoillaan totuudenmukaisen datan käytön sijaan. Näitä itse generoituja ruutuja, kaikkine epätäydellisyyksineen, käytetään sitten ehdollistavina syötteinä koulutussekvenssin seuraaville ruuduille.
Keskeinen hyperparametri on kierrätyssuhde r, joka säätelee, kuinka usein itse generoituja ruutuja korvataan koulutuksen aikana totuudenmukaisilla ruuduilla. Artikkelin mukaan r = 0.3 (30% kierrätettyjä ruutuja) saavuttaa optimaalisen suorituskyvyn tasapainottamalla vakauden parantumisen ja koulutussignaalin laadun.
Muokattu häviöfunktio pysyy tavallisena diffuusiotavoitteena. Ainoa ero on datan jakauma, jonka malli näkee koulutuksen aikana. Siksi päättelyaikana ei synny laskennallista ylikuormitusta.
Tämä muistuttaa käsitteellisesti scheduled sampling -menetelmää sekvenssistä sekvenssiin -malleissa, mutta se on mukautettu jatkuvaan diffuusiokehykseen. VITA Labin tiimi mainitsee tämän yhteyden artikkelissaan ja toteaa samalla, että scheduled samplingin naiivi soveltaminen diffuusiomalleihin ei toimi. Heidän panoksensa on erityinen muotoilu, joka tekee siitä vakaan videogeneroinnissa.
Avoimen lähdekoodin etu
Ehkä jännittävin piirre: koodi on täysin avointa lähdekoodia GitHubissa (vita-epfl/Stable-Video-Infinity). Tämä tarkoittaa, että mikä tahansa tutkimuslaboratorio tai yritys voi soveltaa virheiden kierrätystä olemassa oleviin videomalleihinsa.
Avoimen lähdekoodin julkaisu seuraa kasvavaa trendiä tekoälyvideotutkimusyhteisössä. Mallit kuten LTX-2 ja Wan 2.6 ovat osoittaneet, että avoimen lähdekoodin lähestymistavat voivat kilpailla omistuksellisten vaihtoehtojen kanssa.
Mitä tämä tarkoittaa alalle
Ajankohta on merkittävä. Olemme keskellä tekoälyvideon kilpavarustelua, jossa jokainen merkittävä toimija Runwaysta ByteDanceen pyrkii pidempään ja laadukkaampaan tuotokseen. Virheiden kierrätys voi olla puuttuva pala, joka avaa seuraavan sukupolven kyvykkyydet.
Elokuvantekijöille ja sisällöntuottajille
Tutkijoille
Yrityksille
Katse eteenpäin
VITA Labin työ edustaa perustavanlaatuista muutosta siinä, miten ajattelemme tekoälyvideon generointia. Sen sijaan, että rakennettaisiin yhä suurempia malleja tai lisättäisiin monimutkaisia päättelyajan mekanismeja, ratkaisu oli yksinkertaisesti näyttää mallille, miltä sen oma tuotos näyttää.
Artikkeli esitellään ICLR 2026 -konferenssissa, ja useat alan lähteet viittaavat siihen, että suuret videomallien tarjoajat tutkivat jo integraatiota. Jos maailmanmallit edustavat tekoälyn fysiikan ja tilan ymmärtämisen tulevaisuutta, virheiden kierrätys edustaa tulevaisuutta sille, miten tekoäly ylläpitää tätä ymmärrystä ajan myötä.
4 sekunnin tekoälyvideoiden aikakausi voi päättyä nopeammin kuin kukaan odotti. Se ei vaadi uutta malliarkkitehtuuria eikä miljardin dollarin laskentabudjettia. Vain älykkäämmän koulutussilmukan.
Lisälukemista
- Avoimen lähdekoodin tekoälyvideovallankumous: Kuinka avoimet mallit kurovat umpeen eroa omistuksellisiin järjestelmiin
- Fysiikkasimulaatio tekoälyvideossa: Ymmärrä, kuinka mallit oppivat fysikaalista johdonmukaisuutta
- Diffuusiotransformerit: Nykyaikaista videogenerointia tukeva arkkitehtuuri
Lähteet
- International Conference on Learning Representations: Oral (ICLR 2026 -tila) (International Conference on Learning Representations)
- EPFL VITA -tutkijat arXivin kautta: Stable Video Infinity tukee äärettömän pituisen videon generointia ilman lisäpäättelyä… (EPFL VITA -tutkijat arXivin kautta)

Lausannesta kotoisin oleva tekoälyinsinööri, joka yhdistää tutkimuksen syvyyden käytännön innovointiin. Jakaa aikansa malliarkkitehtuurien ja alppihuippujen välillä.
View profile →Aiheeseen liittyvät artikkelit
Jatka tutustumista näihin aiheeseen liittyviin julkaisuihin

SkyReels V4: Ensimmäinen AI-malli, joka näkee ja kuulee samaan aikaan
Skywork AI:n SkyReels V4 esittelee kaksoisvirta-diffuusioarkkitehtuurin, joka tuottaa videon ja synkronoidun äänen samalla generointikerralla. Tässä mitä se tarkoittaa sisällöntekijöille.

AI-tuotevideogeneraattorit: Täydellinen opas verkkokauppaan ja markkinointiin vuonna 2026
AI-tuotevideogeneraattorit muokkaavat brändien sisällöntuotantoa. URL-videoksi-putkilinjoista 27% korkeampiin ostoskoriin lisäyssuhteisiin: tässä on mitä jokaisen markkinoijan tulee tietää vuonna 2026.

AI-video Soran jälkeen: 4 markkinatasoa vuonna 2026
Sora sulkeutuu 26. huhtikuuta. AI-videomarkkinat ovat konsolidoituneet neljään tasoon. Käytännöllinen opas oikean Sora-vaihtoehdon valintaan.