EPFL Stable Video Infinity: Hogyan oldja meg a hibák újrahasznosítása az AI-videók legnagyobb problémáját
Az EPFL új, ICLR 2026 Oral minősítésű tanulmánya bemutatja a hibák újrahasznosítását, egy olyan technikát, amely megszünteti az időbeli sodródást, és extra számítási költség nélkül teszi lehetővé a többperces AI-videók generálását.

A sodródási probléma, amelyet senki sem oldott meg
Ha bármelyik jelenlegi modellel próbáltál hosszú formátumú AI-videót generálni, ismered a frusztrációt. A Sora 2 csomagtól függően 15-25 másodpercnél megáll. A Runway Gen-4.5 maximuma 10 másodperc. A Kling 3.0 15 másodpercig jut el. Az ok nem a számítási kapacitás vagy a memória. Hanem az időbeli sodródás.
Időbeli sodródás akkor következik be, amikor az autoregresszív videómodellek képkockáról képkockára halmozódó apró hibákat gyűjtenek. Minden generált képkocka a következő bemenetévé válik, és az apró tökéletlenségek exponenciálisan összeadódnak. Néhány száz képkocka után a kimenet alig hasonlít az eredeti promptra.
Ez alapvetően hasonlít a „telefonjáték” problémájára. Suttogj végig egy üzenetet elég sok emberen keresztül, és felismerhetetlenné válik. A korábbi megközelítések rövidebb klipek generálásával és összeillesztésével próbálták leküzdeni a sodródást, de az illesztések láthatók. Mások hierarchikus generálást használtak, előbb kulcsképkockákat, majd interpolációt, ami segít, de nem szünteti meg az alapvető problémát.
Megérkezik a hibák újrahasznosítása
A "Stable Video Infinity" című, ICLR 2026 Oral előadásként elfogadott tanulmány megtévesztően egyszerű ötletet vezet be: tanítsuk meg a modellt a saját hibáinak kezelésére.
Íme a kulcsfelismerés. A tanítás során a hagyományos videódiffúziós modellek tiszta alapigazság-adatokból tanulnak. Soha nem látják a saját generált kimenetüket. Éles használatban hirtelen a saját tökéletlen előrejelzéseikkel kell bemenetként dolgozniuk, és nem tudják kezelni a zajt.
A hibák újrahasznosítása ezt a tanítási ciklus módosításával javítja:
Hagyományos előrehaladó lépés
A modell tiszta tanítási adatokból generál egy videószegmenst.
Hibák gyűjtése
A modell saját előrejelzéseit, azok tökéletlenségeivel együtt, nem dobják el, hanem rögzítik.
Hibák újrahasznosítása
Ezeket a tökéletlen kimeneteket visszatáplálják a következő tanítási iteráció bemeneteként, így a modell megtanul stabil kimenetet létrehozni még zajos, saját maga által generált képkockákból is.
Iteratív finomítás
Sok tanítási ciklus során a modell robusztus önkorrekciós mechanizmust tanul, amely megakadályozza a hibák felhalmozódását.
Ennek a megközelítésnek a szépsége az eleganciája. Nincsenek új modellarchitektúrák, további paraméterek vagy inferenciaidejű trükkök. A modell egyszerűen megtanulja a tanítás során, hogyan néznek ki a valós éles használati körülmények.
Miért fontosabb ez, mint gondolnád
A következmények messze túlmutatnak a hosszabb macskás videók generálásán. Íme, mi változik:
A hibák újrahasznosítása előtt
- A videómodellek 4-20 másodpercre korlátozódnak
- A jelenet konzisztenciája gyorsan romlik
- A szereplők azonossága néhány másodperc után eltolódik
- A fizika egyre irreálisabbá válik
- A színek és a világítás kiszámíthatatlanul változnak
A hibák újrahasznosítása után
- Többperces, koherens videógenerálás
- Stabil szereplőmegjelenés végig
- Következetes fizika és térbeli kapcsolatok
- Megbízható színkorrekció és világítás
- Idővel nincs látható minőségromlás
A számok
A VITA Lab csapata több architektúrán és benchmarkon tesztelte a Stable Video Infinity modellt. Az eredmények figyelemre méltók:
| Metrika | Hibák újrahasznosítása nélkül | Hibák újrahasznosításával | Javulás |
|---|---|---|---|
| FVD (az alacsonyabb jobb) | 4s után romlik | 2min+ időtartamig stabil | Jelentős |
| Szereplő-konzisztencia | 15s-nél 60% alá esik | 2min-nél is 90%+ marad | ~50% relatív |
| Időbeli koherencia | Látható sodródás 8s-nél | Nincs látható sodródás 2min-nél | Minőségi ugrás |
| Számítási többletköltség | Alapérték | Alapérték (0% növekedés) | Nulla költség |
A nulla számítási többletköltség kulcsfontosságú. A hibák újrahasznosítása tanítási idejű technika, nem inferenciaidejű. A betanítás után a modell pontosan ugyanazzal a sebességgel és költséggel fut, mint korábban.
Hogyan működik a hibák újrahasznosítása a háttérben
Azok számára, akik a technikai részletekre kíváncsiak, íme, mi történik a módosított tanítási folyamatban.
A hagyományos videódiffúziós tanítás a tiszta alapigazság-képkockákra x_0 alkalmazott epsilon zajütemezést használ. A modell megtanulja előre jelezni a zajt és visszaállítani az eredeti jelet. Inferenciaidőben a modell autoregresszíven generálja a t+1 képkockát, a t képkockára adott előrejelzése alapján.
A tanítás, tiszta bemenetek, és az inferencia, saját maga által generált bemenetek, közötti különbséget expozíciós torzításnak nevezzük. A hibák újrahasznosítása közvetlenül ezt kezeli.
Technikai részletek: módosított tanítási célfüggvény▼
A tanítás során a modell időszakosan a saját aktuális súlyait használva generál képkockákat, ahelyett hogy alapigazság-adatokat használna. Ezeket a saját maga által generált képkockákat, a tökéletlenségeikkel együtt, ezután kondicionáló bemenetként használják a tanítási sorozat következő képkockáihoz.
A kulcsfontosságú hiperparaméter az újrahasznosítási arány r, amely azt szabályozza, milyen gyakran váltják fel a saját maga által generált képkockák az alapigazság-képkockákat a tanítás során. A tanulmány szerint az r = 0.3 (30% újrahasznosított képkocka) optimális teljesítményt ér el, egyensúlyt teremtve a stabilitás javulása és a tanítási jel minősége között.
A módosított veszteségfüggvény továbbra is a hagyományos diffúziós célfüggvény marad. Az egyetlen különbség az adateloszlás, amelyet a modell a tanítás során lát. Ezért nincs számítási többletköltség inferenciaidőben.
Ez koncepcionálisan hasonlít a szekvencia-szekvencia modellekben alkalmazott scheduled sampling eljárásra, de a folytonos diffúziós keretrendszerhez igazítva. A VITA Lab csapata elismeri ezt a kapcsolatot a tanulmányában, ugyanakkor megjegyzi, hogy a scheduled sampling naiv alkalmazása diffúziós modellekre nem működik. Hozzájárulásuk az a konkrét megfogalmazás, amely stabillá teszi a módszert videógeneráláshoz.
A nyílt forráskód előnye
Talán a legizgalmasabb szempont: a kód teljes egészében nyílt forráskódú a GitHubon (vita-epfl/Stable-Video-Infinity). Ez azt jelenti, hogy bármely kutatólabor vagy vállalat alkalmazhatja a hibák újrahasznosítását meglévő videómodelljeire.
A nyílt forráskódú kiadás az AI-videós kutatói közösség növekvő trendjét követi. Az olyan modellek, mint az LTX-2 és a Wan 2.6, megmutatták, hogy a nyílt forráskódú megközelítések versenyképesek lehetnek a zárt alternatívákkal.
Mit jelent ez az iparág számára
Az időzítés figyelemre méltó. Az AI-videók fegyverkezési versenyének közepén vagyunk, ahol minden jelentős szereplő, a Runwaytől a ByteDance-ig, hosszabb és jobb minőségű kimenetre törekszik. A hibák újrahasznosítása lehet az a hiányzó elem, amely felszabadítja a képességek következő generációját.
Filmkészítőknek és alkotóknak
Kutatóknak
Vállalatoknak
Előretekintés
A VITA Lab munkája alapvető változást jelent abban, ahogyan az AI-videógenerálásról gondolkodunk. Ahelyett, hogy egyre nagyobb modelleket építenénk vagy összetett inferenciaidejű mechanizmusokat adnánk hozzá, a megoldás egyszerűen az volt, hogy megmutatták a modellnek, hogyan néz ki a saját kimenete.
A tanulmányt az ICLR 2026 konferencián mutatják be, és több iparági forrás szerint a nagy videómodell-szolgáltatók már vizsgálják az integrációt. Ha a világmodellek az AI fizika- és térértelmezésének jövőjét jelentik, akkor a hibák újrahasznosítása annak jövőjét jelenti, hogyan tartja fenn az AI ezt a megértést az idő során.
A 4 másodperces AI-videók kora hamarabb véget érhet, mint bárki várta. Ehhez pedig nem lesz szükség új modellarchitektúrára vagy milliárd dolláros számítási költségvetésre. Csak egy okosabb tanítási ciklusra.
További olvasnivaló
- A nyílt forráskódú AI-videó forradalma: Hogyan csökkentik a nyílt modellek a különbséget a zárt rendszerekkel szemben
- Fizikai szimuláció az AI-videóban: Annak megértése, hogyan tanulják meg a modellek a fizikai konzisztenciát
- Diffusion Transformers: A modern videógenerálást működtető architektúra
Források
- International Conference on Learning Representations: Oral (ICLR 2026 státusz) (International Conference on Learning Representations)
- EPFL VITA kutatók az arXivon keresztül: a Stable Video Infinity végtelen hosszúságú videógenerálást támogat további inferenciaköltség nélkül… (EPFL VITA kutatók az arXivon keresztül)

Lausanne-i MI-mérnök, aki a kutatási mélységet gyakorlati innovációval ötvözi. Idejét modellarchitektúrák és alpesi csúcsok között osztja meg.
View profile →Kapcsolódó cikkek
Folytasd a felfedezést ezekkel a kapcsolódó bejegyzésekkel

SkyReels V4: Az első MI-modell, amely egyszerre lát és hall
A Skywork AI SkyReels V4 modellje kettős folyamú diffúziós architektúrát mutat be, amely egyetlen menetben generál videót és szinkronizált hangot. Íme, mit jelent ez az alkotók számára.

AI Termékvideó Generátorok: Teljes útmutató e-kereskedelemhez és marketinghez 2026-ban
Az AI termékvideó generátorok átformálják, ahogyan a márkák tartalmat hoznak létre. Az URL-ből videó pipeline-októl a 27%-kal magasabb kosárba rakási arányokig: íme, amit minden marketingesnek tudnia kell 2026-ban.

AI videó piac a Sora után: 4 piaci szint 2026-ban
A Sora április 26-án bezár. Az AI videó piac négy világos szintre konszolidálódott. Gyakorlati útmutató a megfelelő Sora alternatíva kiválasztásához.