EPFL Stable Video Infinity: kaip klaidų perdirbimas sprendžia didžiausią AI vaizdo įrašų problemą
Naujas EPFL ICLR 2026 Oral straipsnis pristato klaidų perdirbimą, metodą, kuris pašalina laikinį dreifą ir leidžia generuoti kelių minučių AI vaizdo įrašus be papildomų skaičiavimo sąnaudų.

Dreifo problema, kurios niekas neišsprendė
Jei bandėte generuoti ilgos formos AI vaizdo įrašus su bet kuriuo dabartiniu modeliu, žinote šį nusivylimą. Sora 2 riboja trukmę iki 15-25 sekundžių, priklausomai nuo jūsų plano. Runway Gen-4.5 pasiekia daugiausia 10. Kling 3.0 leidžia iki 15. Priežastis nėra skaičiavimo galia ar atmintis. Tai yra laikinis dreifas.
Laikinis dreifas atsiranda, kai autoregresiniai vaizdo įrašų modeliai kadrą po kadro kaupia mažas klaidas. Kiekvienas sugeneruotas kadras tampa įvestimi kitam, o smulkūs netobulumai eksponentiškai didėja. Po kelių šimtų kadrų išvestis vos primena pradinę užklausą.
Iš esmės tai panašu į „sugedusio telefono“ problemą. Perduokite žinutę pakankamai daug žmonių, ir ji taps neatpažįstama. Ankstesni metodai bandė kovoti su dreifu generuodami trumpesnius klipus ir juos sujungdami, tačiau siūlės matomos. Kiti naudojo hierarchinį generavimą, pirmiausia pagrindinius kadrus, vėliau interpoliaciją, tai padeda, bet nepašalina pagrindinės problemos.
Klaidų perdirbimas
Straipsnyje, pavadintame "Stable Video Infinity" ir priimtame kaip ICLR 2026 Oral pranešimas, pristatoma apgaulingai paprasta idėja: išmokyti modelį tvarkytis su savo paties klaidomis.
Pagrindinė įžvalga tokia. Mokymo metu standartiniai vaizdo difuzijos modeliai mokosi iš švarių tikrosios informacijos duomenų. Jie niekada nemato savo sugeneruotos išvesties. Įdiegus, jiems staiga tenka dirbti su savo netobulomis prognozėmis kaip įvestimi, ir jie nežino, kaip apdoroti triukšmą.
Klaidų perdirbimas tai išsprendžia pakeisdamas mokymo ciklą:
Standartinis tiesioginis praleidimas
Modelis generuoja vaizdo įrašo segmentą iš švarių mokymo duomenų.
Klaidų surinkimas
Paties modelio prognozės, kartu su jų netobulumais, užfiksuojamos, o ne atmetamos.
Klaidų perdirbimas
Šios netobulos išvestys grąžinamos kaip įvestis kitai mokymo iteracijai, mokant modelį generuoti stabilią išvestį net iš triukšmingų, paties sugeneruotų kadrų.
Iteracinis tobulinimas
Per daugelį mokymo ciklų modelis išmoksta patikimą savikorekcijos mechanizmą, kuris neleidžia kauptis klaidoms.
Šio metodo grožis slypi jo elegancijoje. Nėra naujų modelio architektūrų, papildomų parametrų ar inferencijos metu taikomų triukų. Modelis tiesiog mokymo metu išmoksta, kaip atrodo realios diegimo sąlygos.
Kodėl tai svarbiau, nei manote
Pasekmės gerokai viršija ilgesnių kačių vaizdo įrašų generavimą. Štai kas keičiasi:
Prieš klaidų perdirbimą
- Vaizdo įrašų modeliai ribojami iki 4-20 sekundžių
- Scenos nuoseklumas greitai blogėja
- Veikėjo tapatybė ima dreifuoti po kelių sekundžių
- Fizika tampa vis mažiau realistiška
- Spalvos ir apšvietimas nenuspėjamai keičiasi
Po klaidų perdirbimo
- Kelių minučių nuoseklių vaizdo įrašų generavimas
- Stabili veikėjų išvaizda visame įraše
- Nuosekli fizika ir erdviniai ryšiai
- Patikimas spalvų koregavimas ir apšvietimas
- Laikui bėgant nėra matomo kokybės prastėjimo
Skaičiai
VITA Lab komanda išbandė Stable Video Infinity keliose architektūrose ir lyginamuosiuose testuose. Rezultatai įspūdingi:
| Metrika | Be klaidų perdirbimo | Su klaidų perdirbimu | Pagerėjimas |
|---|---|---|---|
| FVD (mažiau yra geriau) | Blogėja po 4 s | Stabilus ilgiau nei 2 min. | Reikšmingas |
| Veikėjo nuoseklumas | Nukrenta žemiau 60% ties 15 s | Išlaiko 90%+ ties 2 min. | ~50% santykinis |
| Laikinis nuoseklumas | Matomas dreifas ties 8 s | Nėra matomo dreifo ties 2 min. | Kokybinis šuolis |
| Skaičiavimo pridėtinės sąnaudos | Bazinis lygis | Bazinis lygis (0% padidėjimas) | Nulinė kaina |
Nulinių papildomų skaičiavimo sąnaudų aspektas yra esminis. Klaidų perdirbimas yra mokymo metu taikomas metodas, o ne inferencijos metu. Kartą apmokytas modelis veikia lygiai tuo pačiu greičiu ir už tą pačią kainą kaip anksčiau.
Kaip klaidų perdirbimas veikia iš esmės
Tiems, kurie nori techninių detalių, štai kas vyksta pakeistame mokymo procese.
Standartinis vaizdo difuzijos mokymas naudoja triukšmo tvarkaraštį epsilon, taikomą švariems tikrosios informacijos kadrams x_0. Modelis išmoksta numatyti triukšmą ir atkurti pradinį signalą. Inferencijos metu modelis autoregresiškai generuoja kadrą t+1, remdamasis savo kadro t prognoze.
Atotrūkis tarp mokymo, kai įvestys švarios, ir inferencijos, kai įvestys sugeneruotos paties modelio, vadinamas ekspozicijos šališkumu. Klaidų perdirbimas tiesiogiai sprendžia šią problemą.
Techninės detalės: pakeistas mokymo tikslas▼
Mokymo metu modelis periodiškai generuoja kadrus naudodamas savo dabartinius svorius, užuot naudojęs tikrosios informacijos duomenis. Šie paties sugeneruoti kadrai su visais jų netobulumais vėliau naudojami kaip sąlygojančios įvestys vėlesniems kadrams mokymo sekoje.
Pagrindinis hiperparametras yra perdirbimo santykis r, kuris nustato, kaip dažnai mokymo metu paties sugeneruoti kadrai pakeičia tikrosios informacijos kadrus. Straipsnyje nustatyta, kad r = 0.3 (30% perdirbtų kadrų) pasiekia optimalų našumą, suderindamas stabilumo pagerėjimą su mokymo signalo kokybe.
Pakeista nuostolių funkcija išlieka standartiniu difuzijos tikslu. Vienintelis skirtumas yra duomenų pasiskirstymas, kurį modelis mato mokymo metu. Todėl inferencijos metu nėra papildomų skaičiavimo sąnaudų.
Koncepciškai tai panašu į planinį atrinkimą sekos į seką modeliuose, tačiau pritaikyta tęstinės difuzijos sistemai. VITA Lab komanda savo straipsnyje nurodo šį ryšį, kartu pažymėdama, kad paprastas planinio atrinkimo taikymas difuzijos modeliams neveikia. Jų indėlis yra specifinė formuluotė, dėl kurios metodas tampa stabilus vaizdo įrašų generavimui.
Atvirojo kodo pranašumas
Galbūt įdomiausias aspektas: kodas yra visiškai atvirojo kodo GitHub platformoje (vita-epfl/Stable-Video-Infinity). Tai reiškia, kad bet kuri tyrimų laboratorija ar įmonė gali pritaikyti klaidų perdirbimą savo esamiems vaizdo įrašų modeliams.
Atvirojo kodo leidimas atitinka augančią AI vaizdo įrašų tyrimų bendruomenės tendenciją. Tokie modeliai kaip LTX-2 ir Wan 2.6 parodė, kad atvirojo kodo metodai gali konkuruoti su nuosavybinėmis alternatyvomis.
Ką tai reiškia pramonei
Laikas nepaprastas. Esame AI vaizdo įrašų lenktynių viduryje, kur kiekvienas svarbus žaidėjas, nuo Runway iki ByteDance, siekia ilgesnės ir aukštesnės kokybės išvesties. Klaidų perdirbimas gali būti trūkstama dalis, atverianti naujos kartos galimybes.
Kino kūrėjams ir kūrėjams
Tyrėjams
Verslui
Žvelgiant į priekį
VITA Lab darbas žymi esminį pokytį, kaip galvojame apie AI vaizdo įrašų generavimą. Užuot kūrus vis didesnius modelius ar pridėjus sudėtingus inferencijos mechanizmus, sprendimas buvo tiesiog parodyti modeliui, kaip atrodo jo paties išvestis.
Straipsnis bus pristatytas ICLR 2026 konferencijoje, o keli pramonės šaltiniai teigia, kad pagrindiniai vaizdo įrašų modelių tiekėjai jau tyrinėja integravimą. Jei pasaulio modeliai atspindi AI fizikos ir erdvės supratimo ateitį, klaidų perdirbimas atspindi AI gebėjimo išlaikyti šį supratimą laikui bėgant ateitį.
4 sekundžių AI vaizdo įrašų era gali baigtis greičiau, nei kas nors tikėjosi. Ir tam nereikės naujos modelio architektūros ar milijardo dolerių skaičiavimo biudžeto. Tik išmanesnio mokymo ciklo.
Tolesnis skaitymas
- Atvirojo kodo AI vaizdo įrašų revoliucija: Kaip atviri modeliai mažina atotrūkį nuo nuosavybinių sistemų
- Fizikos simuliacija AI vaizdo įrašuose: Kaip modeliai išmoksta fizinio nuoseklumo
- Difuzijos transformatoriai: Architektūra, palaikanti šiuolaikinį vaizdo įrašų generavimą
Šaltiniai
- Tarptautinė mokymosi reprezentacijų konferencija: Oral (ICLR 2026 statusas) (Tarptautinė mokymosi reprezentacijų konferencija)
- EPFL VITA tyrėjai per arXiv: Stable Video Infinity palaiko begalinio ilgio vaizdo įrašų generavimą be papildomos inferencijos… (EPFL VITA tyrėjai per arXiv)

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Geriausi nemokami teksto į vaizdo įrašą AI įrankiai: 2026 m. vadovas
Palyginkite geriausius nemokamus teksto į vaizdo įrašą AI įrankius 2026 m., įskaitant tikrus kreditų limitus, vandens ženklus, vietinio diegimo kompromisus ir praktinį testavimo planą.

Grok xAI vaizdo įrašų kūrimo iš vaizdų galimybės: 2026 m. birželio API gidas
Grok xAI vaizdo įrašų kūrimo iš vaizdų galimybės 2026 m. birželį: kaip Grok Imagine apdoroja vaizdus, užklausas, integruotą garsą, API darbo eigas, saugą, kainodaros logiką ir palyginimus su Sora/Veo.

Nuo kadro iki vaizdo įrašo: kaip vaizdo į vaizdo įrašą AI tapo numatytąja kūrybine darbo eiga 2026 m.
Teksto į vaizdo įrašą sprendimai sulaukia antraščių, tačiau kūrėjai iš tikrųjų naudoja vaizdo į vaizdo įrašą. Štai kodėl pradėję nuo vieno kadro pasieksite geresnių rezultatų, turėsite daugiau kontrolės ir greičiau iteruosite.