EPFL Stable Video Infinity: Hvernig endurvinnsla villna leysir stærsta vandamál gervigreindarmyndbanda
Ný ICLR 2026 Oral-grein frá EPFL kynnir endurvinnslu villna, tækni sem útilokar tímalegt rek og gerir kleift að skapa margra mínútna gervigreindarmyndbönd án aukins reiknikostnaðar.

Tilbúin(n) til að búa til þín eigin gervigreindarmyndbönd?
Slástu í hóp þúsunda skapara sem nota Bonega.ai
Rekvandinn sem enginn leysti
Ef þú hefur reynt að búa til gervigreindarmyndbönd í löngu sniði með einhverju núverandi líkani þekkir þú gremjuna. Sora 2 takmarkast við 15 til 25 sekúndur eftir áskrift þinni. Runway Gen-4.5 nær mest 10 sekúndum. Kling 3.0 nær 15. Ástæðan er ekki reikniafl eða minni. Hún er tímalegt rek.
Tímalegt rek á sér stað þegar sjálfvirk myndbandalíkön safna upp smávægilegum villum ramma fyrir ramma. Hver myndaður rammi verður inntak fyrir þann næsta og örsmáir gallar margfaldast veldisvísis. Eftir nokkur hundruð ramma líkist útkoman varla upprunalegu skipuninni.
Þetta líkist í grundvallaratriðum „símaleiknum“. Hvíslðu skilaboð í gegnum nógu marga og þau verða óþekkjanleg. Fyrri aðferðir reyndu að berjast gegn reki með því að búa til styttri myndskeið og sauma þau saman, en samskeytin sjást. Aðrar notuðu stigskipta gerð (lykilramma fyrst, innskotsramma síðan), sem hjálpar en útilokar ekki kjarnavandann.
Endurvinnsla villna kemur til sögunnar
Greinin, sem ber heitið "Stable Video Infinity" og var samþykkt sem ICLR 2026 Oral-kynning, kynnir blekkjandi einfalda hugmynd: kenndu líkaninu að takast á við eigin mistök.
Hér er lykilinnsýnin. Við þjálfun læra hefðbundin mynddreifingarlíkön af hreinum sannleiksgögnum. Þau sjá aldrei eigið myndað úttak. Þegar þau eru tekin í notkun þurfa þau skyndilega að vinna með sínar eigin ófullkomnu spár sem inntak og þau vita ekki hvernig á að takast á við suðið.
Endurvinnsla villna lagar þetta með því að breyta þjálfunarlykkjunni:
Hefðbundin framleiðslulota
Líkanið myndar myndbandshluta úr hreinum þjálfunargögnum.
Söfnun villna
Eigin spár líkansins, með ófullkomleikum sínum, eru teknar til hliðar í stað þess að vera fargað.
Endurvinnsla villna
Þessi ófullkomnu úttök eru færð aftur inn sem inntak fyrir næstu þjálfunarítrun og kenna líkaninu að mynda stöðugt úttak jafnvel úr suðugum, sjálfmynduðum römmum.
Ítrekuð fínstilling
Yfir margar þjálfunarlotur lærir líkanið öflugt sjálfleiðréttingarkerfi sem kemur í veg fyrir uppsöfnun villna.
Fegurð þessarar nálgunar felst í einfaldleika hennar. Engin ný líkanagerð, engar viðbótarstærðir og engin brögð við keyrslu. Líkanið lærir einfaldlega við þjálfun hvernig raunveruleg notkunarskilyrði líta út.
Hvers vegna þetta skiptir meira máli en þú heldur
Afleiðingarnar ná langt út fyrir að búa til lengri kattamyndbönd. Hér er það sem breytist:
Fyrir endurvinnslu villna
- Myndbandalíkön takmörkuð við 4-20 sekúndur
- Samræmi atriða versnar hratt
- Persónueinkenni rekur eftir nokkrar sekúndur
- Eðlisfræði verður sífellt óraunverulegri
- Litir og lýsing breytast ófyrirsjáanlega
Eftir endurvinnslu villna
- Samhangandi myndbandagerð í margar mínútur
- Stöðugt útlit persóna allan tímann
- Samræmd eðlisfræði og staðbundin tengsl
- Áreiðanleg litvinnsla og lýsing
- Engin sýnileg gæðarýrnun með tímanum
Tölurnar
VITA Lab-teymið prófaði Stable Video Infinity á mörgum hugbúnaðargerðum og viðmiðum. Niðurstöðurnar eru sláandi:
| Mælikvarði | Án endurvinnslu villna | Með endurvinnslu villna | Framför |
|---|---|---|---|
| FVD (lægra er betra) | Versnar eftir 4s | Stöðugt í gegnum 2min+ | Marktæk |
| Samræmi persóna | Fellur undir 60% við 15s | Heldur 90%+ við 2min | ~50% hlutfallslegt |
| Tímalegt samræmi | Sýnilegt rek við 8s | Ekkert sýnilegt rek við 2min | Eigindlegt stökk |
| Reikniálag | Grunngildi | Grunngildi (0% aukning) | Enginn kostnaður |
Að enginn aukinn reiknikostnaður sé til staðar er lykilatriði. Endurvinnsla villna er þjálfunartækni, ekki tækni sem notuð er við keyrslu. Þegar líkanið hefur verið þjálfað keyrir það á nákvæmlega sama hraða og kostnaði og áður.
Hvernig endurvinnsla villna virkar undir yfirborðinu
Fyrir þá sem vilja tæknilegu smáatriðin, hér er það sem gerist í breyttu þjálfunarferlinu.
Hefðbundin þjálfun mynddreifingar notar suðáætlun epsilon sem er beitt á hreina sannleiksramma x_0. Líkanið lærir að spá fyrir um suðið og endurheimta upprunalega merkið. Við keyrslu myndar líkanið sjálfvirkt ramma t+1 með skilyrðingu frá spá sinni fyrir ramma t.
Bilið milli þjálfunar (hreint inntak) og keyrslu (sjálfmyndað inntak) kallast skekkjuhlutdrægni. Endurvinnsla villna tekur beint á þessu.
Tæknileg atriði: Breytt þjálfunarmarkmið▼
Við þjálfun myndar líkanið reglulega ramma með eigin núverandi vigtum í stað þess að nota sannleiksgögn. Þessir sjálfmynduðu rammar, með öllum sínum ófullkomleikum, eru síðan notaðir sem skilyrðandi inntak fyrir síðari ramma í þjálfunarröðinni.
Lykilstillingin er endurvinnsluhlutfallið r, sem stjórnar því hversu oft sjálfmyndaðir rammar koma í stað sannleiksramma við þjálfun. Greinin kemst að þeirri niðurstöðu að r = 0.3 (30% endurunnir rammar) nái bestu frammistöðu og jafni stöðugleikabætur við gæði þjálfunarmerkisins.
Breytta tapfallið er áfram hefðbundið dreifingarmarkmið. Eini munurinn er dreifing gagnanna sem líkanið sér við þjálfun. Þess vegna verður ekkert viðbótarreikniálag við keyrslu.
Þetta líkist hugmyndafræðilega scheduled sampling í sequence-to-sequence-líkönum, en er aðlagað samfellda dreifingarrammanum. VITA Lab-teymið nefnir þessi tengsl í grein sinni en bendir á að einföld beiting scheduled sampling á dreifingarlíkön virki ekki. Framlag þeirra er sértæka útfærslan sem gerir hana stöðuga fyrir myndbandagerð.
Kosturinn við opinn hugbúnað
Kannski mest spennandi þátturinn: kóðinn er að fullu opinn á GitHub (vita-epfl/Stable-Video-Infinity). Þetta þýðir að hvaða rannsóknarstofa eða fyrirtæki sem er getur beitt endurvinnslu villna á núverandi myndbandalíkön sín.
Útgáfan sem opinn hugbúnaður fylgir vaxandi þróun í rannsóknarsamfélagi gervigreindarmyndbanda. Líkön eins og LTX-2 og Wan 2.6 hafa sýnt að opnar nálganir geta keppt við sérlausnir.
Hvað þetta þýðir fyrir iðnaðinn
Tímasetningin er eftirtektarverð. Við erum mitt í vígbúnaðarkapphlaupi í gervigreindarmyndböndum þar sem allir helstu aðilar, frá Runway til ByteDance, þrýsta á um lengra og betra úttak. Endurvinnsla villna gæti verið púsluspilið sem vantar til að opna næstu kynslóð getu.
Fyrir kvikmyndagerðarfólk og höfunda
Fyrir rannsakendur
Fyrir fyrirtæki
Fram undan
Verk VITA Lab táknar grundvallarbreytingu á því hvernig við hugsum um gervigreindarmyndbandagerð. Í stað þess að byggja sífellt stærri líkön eða bæta við flóknum kerfum við keyrslu var lausnin einfaldlega að sýna líkaninu hvernig eigið úttak þess lítur út.
Greinin verður kynnt á ICLR 2026 og nokkrar heimildir úr iðnaðinum benda til þess að stórir veitendur myndbandalíkana séu þegar að kanna samþættingu. Ef heimslíkön tákna framtíðina í því hvernig gervigreind skilur eðlisfræði og rými, táknar endurvinnsla villna framtíðina í því hvernig gervigreind viðheldur þeim skilningi yfir tíma.
Tími 4 sekúndna gervigreindarmyndbanda gæti verið að líða undir lok fyrr en nokkur bjóst við. Og það mun ekki krefjast nýrrar líkanagerðar eða milljarða dollara reiknifjárhags. Bara snjallari þjálfunarlykkju.
Frekara lesefni
- Opna byltingin í gervigreindarmyndböndum: Hvernig opin líkön eru að minnka bilið við sérkerfi
- Eðlisfræðileg hermun í gervigreindarmyndböndum: Að skilja hvernig líkön læra eðlisfræðilegt samræmi
- Dreifingartransformerar: Hugbúnaðararkitektúrinn sem knýr nútíma myndbandagerð
Heimildir
- International Conference on Learning Representations: Oral (staða ICLR 2026) (International Conference on Learning Representations)
- EPFL VITA-rannsakendur í gegnum arXiv: Stable Video Infinity styður myndbandagerð af óendanlegri lengd án viðbótar keyrslu… (EPFL VITA-rannsakendur í gegnum arXiv)

Gervigreindarverkfræðingur frá Lausanne sem sameinar rannsóknardýpt og hagnýta nýsköpun. Skiptir tíma sínum á milli líkanagerðar og alpatinda.
View profile →Líkaði þér það sem þú last?
Breyttu hugmyndum þínum í gervigreindarmyndbönd af ótakmarkaðri lengd á nokkrum mínútum.
Tengdar greinar
Haltu áfram að skoða þessar tengdu færslur

Bonega vs Synthesia árið 2026: Gerð gervigreindarmyndbanda vs gervigreindarmyndbönd fyrir fyrirtæki
Bonega.ai býr til kvikmyndaleg gervigreindarmyndbönd úr texta og myndum. Synthesia býr til fyrirtækjamyndbönd með avatarum og þýðingum. Við berum saman verð, eiginleika og hvaða vettvangur hentar vinnuflæðinu þínu.

Bonega vs Pika árið 2026: Hvaða gervigreindarmyndbandagerð gefur þér meira?
Bonega.ai og Pika búa bæði til skapandi gervigreindarmyndbönd úr texta og myndum. Við berum saman verð, lengd, hljóð, áhrif og hvaða vettvangur hentar vinnuflæðinu þínu árið 2026.

Stúdíólaust: Hvernig gervigreindarmyndbandsframleiðsla gerir raunveruleg leikmyndastúdíó úrelt
Frá $11M gervigreindarkvikmyndastúdíói Indlands til auglýsingastofa eins manns, framleiðslugólfið er að færast yfir í sýndarheiminn. Hér er hvað það þýðir fyrir höfunda, stúdíó og framtíð kvikmyndagerðar.