Meta PixelPereiti prie pagrindinio turinio
AlexisAlexis· DI autorius, peržiūrėjo žmogus
7 min read
1283 žodžiai

EPFL Stable Video Infinity: kaip klaidų perdirbimas sprendžia didžiausią AI vaizdo įrašų problemą

Naujas EPFL ICLR 2026 Oral straipsnis pristato klaidų perdirbimą, metodą, kuris pašalina laikinį dreifą ir leidžia generuoti kelių minučių AI vaizdo įrašus be papildomų skaičiavimo sąnaudų.

EPFL Stable Video Infinity: kaip klaidų perdirbimas sprendžia didžiausią AI vaizdo įrašų problemą

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Kiekvienas AI vaizdo įrašų modelis turi tą pačią nešvarią paslaptį. Sugeneruokite 4 sekundžių klipą, ir rezultatai atrodo stulbinamai. Perženkite 15 sekundžių ribą, ir veikėjai pradeda keisti formas, fizika subyra, spalvos pasislenka, o visa scena nukrypsta į nenuoseklumą. EPFL VITA Lab ką tik paskelbė sprendimą, ir tai gali būti svarbiausias šių metų vaizdo įrašų generavimo straipsnis.

Dreifo problema, kurios niekas neišsprendė

Jei bandėte generuoti ilgos formos AI vaizdo įrašus su bet kuriuo dabartiniu modeliu, žinote šį nusivylimą. Sora 2 riboja trukmę iki 15-25 sekundžių, priklausomai nuo jūsų plano. Runway Gen-4.5 pasiekia daugiausia 10. Kling 3.0 leidžia iki 15. Priežastis nėra skaičiavimo galia ar atmintis. Tai yra laikinis dreifas.

💡

Laikinis dreifas atsiranda, kai autoregresiniai vaizdo įrašų modeliai kadrą po kadro kaupia mažas klaidas. Kiekvienas sugeneruotas kadras tampa įvestimi kitam, o smulkūs netobulumai eksponentiškai didėja. Po kelių šimtų kadrų išvestis vos primena pradinę užklausą.

Iš esmės tai panašu į „sugedusio telefono“ problemą. Perduokite žinutę pakankamai daug žmonių, ir ji taps neatpažįstama. Ankstesni metodai bandė kovoti su dreifu generuodami trumpesnius klipus ir juos sujungdami, tačiau siūlės matomos. Kiti naudojo hierarchinį generavimą, pirmiausia pagrindinius kadrus, vėliau interpoliaciją, tai padeda, bet nepašalina pagrindinės problemos.

Klaidų perdirbimas

Straipsnyje, pavadintame "Stable Video Infinity" ir priimtame kaip ICLR 2026 Oral pranešimas, pristatoma apgaulingai paprasta idėja: išmokyti modelį tvarkytis su savo paties klaidomis.

Oral
ICLR 2026 statusas
0
Papildomos skaičiavimo sąnaudos
Minutės
Vaizdo įrašo trukmė

Pagrindinė įžvalga tokia. Mokymo metu standartiniai vaizdo difuzijos modeliai mokosi iš švarių tikrosios informacijos duomenų. Jie niekada nemato savo sugeneruotos išvesties. Įdiegus, jiems staiga tenka dirbti su savo netobulomis prognozėmis kaip įvestimi, ir jie nežino, kaip apdoroti triukšmą.

Klaidų perdirbimas tai išsprendžia pakeisdamas mokymo ciklą:

1 žingsnis

Standartinis tiesioginis praleidimas

Modelis generuoja vaizdo įrašo segmentą iš švarių mokymo duomenų.

2 žingsnis

Klaidų surinkimas

Paties modelio prognozės, kartu su jų netobulumais, užfiksuojamos, o ne atmetamos.

3 žingsnis

Klaidų perdirbimas

Šios netobulos išvestys grąžinamos kaip įvestis kitai mokymo iteracijai, mokant modelį generuoti stabilią išvestį net iš triukšmingų, paties sugeneruotų kadrų.

4 žingsnis

Iteracinis tobulinimas

Per daugelį mokymo ciklų modelis išmoksta patikimą savikorekcijos mechanizmą, kuris neleidžia kauptis klaidoms.

Šio metodo grožis slypi jo elegancijoje. Nėra naujų modelio architektūrų, papildomų parametrų ar inferencijos metu taikomų triukų. Modelis tiesiog mokymo metu išmoksta, kaip atrodo realios diegimo sąlygos.

Kodėl tai svarbiau, nei manote

Pasekmės gerokai viršija ilgesnių kačių vaizdo įrašų generavimą. Štai kas keičiasi:

Prieš klaidų perdirbimą

  • Vaizdo įrašų modeliai ribojami iki 4-20 sekundžių
  • Scenos nuoseklumas greitai blogėja
  • Veikėjo tapatybė ima dreifuoti po kelių sekundžių
  • Fizika tampa vis mažiau realistiška
  • Spalvos ir apšvietimas nenuspėjamai keičiasi

Po klaidų perdirbimo

  • Kelių minučių nuoseklių vaizdo įrašų generavimas
  • Stabili veikėjų išvaizda visame įraše
  • Nuosekli fizika ir erdviniai ryšiai
  • Patikimas spalvų koregavimas ir apšvietimas
  • Laikui bėgant nėra matomo kokybės prastėjimo

Skaičiai

VITA Lab komanda išbandė Stable Video Infinity keliose architektūrose ir lyginamuosiuose testuose. Rezultatai įspūdingi:

MetrikaBe klaidų perdirbimoSu klaidų perdirbimuPagerėjimas
FVD (mažiau yra geriau)Blogėja po 4 sStabilus ilgiau nei 2 min.Reikšmingas
Veikėjo nuoseklumasNukrenta žemiau 60% ties 15 sIšlaiko 90%+ ties 2 min.~50% santykinis
Laikinis nuoseklumasMatomas dreifas ties 8 sNėra matomo dreifo ties 2 min.Kokybinis šuolis
Skaičiavimo pridėtinės sąnaudosBazinis lygisBazinis lygis (0% padidėjimas)Nulinė kaina
💡

Nulinių papildomų skaičiavimo sąnaudų aspektas yra esminis. Klaidų perdirbimas yra mokymo metu taikomas metodas, o ne inferencijos metu. Kartą apmokytas modelis veikia lygiai tuo pačiu greičiu ir už tą pačią kainą kaip anksčiau.

Kaip klaidų perdirbimas veikia iš esmės

Tiems, kurie nori techninių detalių, štai kas vyksta pakeistame mokymo procese.

Standartinis vaizdo difuzijos mokymas naudoja triukšmo tvarkaraštį epsilon, taikomą švariems tikrosios informacijos kadrams x_0. Modelis išmoksta numatyti triukšmą ir atkurti pradinį signalą. Inferencijos metu modelis autoregresiškai generuoja kadrą t+1, remdamasis savo kadro t prognoze.

Atotrūkis tarp mokymo, kai įvestys švarios, ir inferencijos, kai įvestys sugeneruotos paties modelio, vadinamas ekspozicijos šališkumu. Klaidų perdirbimas tiesiogiai sprendžia šią problemą.

Techninės detalės: pakeistas mokymo tikslas

Mokymo metu modelis periodiškai generuoja kadrus naudodamas savo dabartinius svorius, užuot naudojęs tikrosios informacijos duomenis. Šie paties sugeneruoti kadrai su visais jų netobulumais vėliau naudojami kaip sąlygojančios įvestys vėlesniems kadrams mokymo sekoje.

Pagrindinis hiperparametras yra perdirbimo santykis r, kuris nustato, kaip dažnai mokymo metu paties sugeneruoti kadrai pakeičia tikrosios informacijos kadrus. Straipsnyje nustatyta, kad r = 0.3 (30% perdirbtų kadrų) pasiekia optimalų našumą, suderindamas stabilumo pagerėjimą su mokymo signalo kokybe.

Pakeista nuostolių funkcija išlieka standartiniu difuzijos tikslu. Vienintelis skirtumas yra duomenų pasiskirstymas, kurį modelis mato mokymo metu. Todėl inferencijos metu nėra papildomų skaičiavimo sąnaudų.

Koncepciškai tai panašu į planinį atrinkimą sekos į seką modeliuose, tačiau pritaikyta tęstinės difuzijos sistemai. VITA Lab komanda savo straipsnyje nurodo šį ryšį, kartu pažymėdama, kad paprastas planinio atrinkimo taikymas difuzijos modeliams neveikia. Jų indėlis yra specifinė formuluotė, dėl kurios metodas tampa stabilus vaizdo įrašų generavimui.

Atvirojo kodo pranašumas

Galbūt įdomiausias aspektas: kodas yra visiškai atvirojo kodo GitHub platformoje (vita-epfl/Stable-Video-Infinity). Tai reiškia, kad bet kuri tyrimų laboratorija ar įmonė gali pritaikyti klaidų perdirbimą savo esamiems vaizdo įrašų modeliams.

Kodėl atvirasis kodas svarbus
Bet kurį esamą vaizdo difuzijos modelį galima pritaikyti klaidų perdirbimui. Architektūrinių pakeitimų nereikia, pakanka pakeisti mokymo ciklą. Tai galėtų vienu metu pagerinti Sora, Runway, Kling ir kiekvieną atvirojo kodo modelį.
Praktiniai apribojimai
Reikia iš naujo apmokyti arba papildomai tikslinti modelį. Įmonės, turinčios nuosavybinius modelius, turi investuoti skaičiavimo išteklius į pakartotinį mokymą. Metodo veiksmingumas gali skirtis skirtingose architektūrose ir masteliuose.

Atvirojo kodo leidimas atitinka augančią AI vaizdo įrašų tyrimų bendruomenės tendenciją. Tokie modeliai kaip LTX-2 ir Wan 2.6 parodė, kad atvirojo kodo metodai gali konkuruoti su nuosavybinėmis alternatyvomis.

Ką tai reiškia pramonei

Laikas nepaprastas. Esame AI vaizdo įrašų lenktynių viduryje, kur kiekvienas svarbus žaidėjas, nuo Runway iki ByteDance, siekia ilgesnės ir aukštesnės kokybės išvesties. Klaidų perdirbimas gali būti trūkstama dalis, atverianti naujos kartos galimybes.

🎬

Kino kūrėjams ir kūrėjams

Ilgos formos nuoseklių vaizdo įrašų generavimas leidžia kurti tikrą naratyvinį turinį. Ne tik klipus, bet ir scenas, sekas, o galiausiai trumpametražius filmus, sugeneruotus iš vienos užklausos.
🔬

Tyrėjams

Klaidų perdirbimas pateikia apibendrinamą sistemą. Tas pats principas galėtų būti taikomas garso generavimui, 3D scenų sintezei ir bet kuriam autoregresiniam generatyviniam modeliui, kuris kenčia nuo dreifo.
🏢

Verslui

Stabilus ilgos formos generavimas leidžia naudoti AI vaizdo įrašus profesionaliais atvejais: produktų demonstracijoms, mokomiesiems vaizdo įrašams, rinkodaros kampanijoms, kurioms reikia nuoseklios kokybės per kelias turinio minutes.

Žvelgiant į priekį

VITA Lab darbas žymi esminį pokytį, kaip galvojame apie AI vaizdo įrašų generavimą. Užuot kūrus vis didesnius modelius ar pridėjus sudėtingus inferencijos mechanizmus, sprendimas buvo tiesiog parodyti modeliui, kaip atrodo jo paties išvestis.

Straipsnis bus pristatytas ICLR 2026 konferencijoje, o keli pramonės šaltiniai teigia, kad pagrindiniai vaizdo įrašų modelių tiekėjai jau tyrinėja integravimą. Jei pasaulio modeliai atspindi AI fizikos ir erdvės supratimo ateitį, klaidų perdirbimas atspindi AI gebėjimo išlaikyti šį supratimą laikui bėgant ateitį.

4 sekundžių AI vaizdo įrašų era gali baigtis greičiau, nei kas nors tikėjosi. Ir tam nereikės naujos modelio architektūros ar milijardo dolerių skaičiavimo biudžeto. Tik išmanesnio mokymo ciklo.

Tolesnis skaitymas


Šaltiniai

Alexis
AlexisAI EngineerAI Author

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.