EPFL Stable Video Infinity: kā kļūdu pārstrāde risina AI video lielāko problēmu
Jauns EPFL ICLR 2026 Oral raksts ievieš kļūdu pārstrādi, paņēmienu, kas novērš temporālo nobīdi un ļauj ģenerēt vairākas minūtes garus AI video bez papildu skaitļošanas izmaksām.

Vai esat gatavs veidot savus MI videoklipus?
Pievienojieties tūkstošiem satura veidotāju, kuri izmanto Bonega.ai
Nobīdes problēma, ko neviens neatrisināja
Ja esat mēģinājis ģenerēt garas formas AI video ar kādu no pašreizējiem modeļiem, jūs zināt šo vilšanos. Sora 2 ierobežo ilgumu līdz 15 līdz 25 sekundēm atkarībā no jūsu plāna. Runway Gen-4.5 maksimums ir 10. Kling 3.0 sasniedz 15. Iemesls nav skaitļošanas jauda vai atmiņa. Tā ir temporālā nobīde.
Temporālā nobīde rodas, kad autoregresīvie video modeļi kadru pēc kadra uzkrāj nelielas kļūdas. Katrs ģenerētais kadrs kļūst par ievadi nākamajam, un sīkas nepilnības eksponenciāli pastiprinās. Pēc dažiem simtiem kadru izvade tik tikko atgādina sākotnējo uzvedni.
Tas būtībā ir līdzīgi "klusā telefona" problēmai. Pačukstiet ziņojumu pietiekami daudziem cilvēkiem, un tas kļūst neatpazīstams. Iepriekšējās pieejas mēģināja cīnīties ar nobīdi, ģenerējot īsākus klipus un tos savienojot, taču šuves ir redzamas. Citas izmantoja hierarhisku ģenerēšanu, vispirms atslēgkadrus, pēc tam interpolāciju, kas palīdz, bet nenovērš pamatproblēmu.
Kļūdu pārstrāde
Raksts ar nosaukumu "Stable Video Infinity", kas pieņemts kā ICLR 2026 Oral prezentācija, ievieš mānīgi vienkāršu ideju: iemācīt modelim tikt galā ar savām kļūdām.
Lūk, galvenā atziņa. Apmācības laikā standarta video difūzijas modeļi mācās no tīriem pamatpatiesības datiem. Tie nekad neredz pašu ģenerēto izvadi. Kad tie tiek izmantoti praksē, tiem pēkšņi jāstrādā ar savām nepilnīgajām prognozēm kā ievadi, un tie nezina, kā rīkoties ar troksni.
Kļūdu pārstrāde to novērš, mainot apmācības ciklu:
Standarta tiešā pāreja
Modelis ģenerē video segmentu no tīriem apmācības datiem.
Kļūdu apkopošana
Modeļa paša prognozes ar to nepilnībām tiek saglabātas, nevis izmestas.
Kļūdu pārstrāde
Šīs nepilnīgās izvades tiek ievadītas atpakaļ kā ievade nākamajai apmācības iterācijai, mācot modelim ģenerēt stabilu izvadi pat no trokšņainiem, paša ģenerētiem kadriem.
Iteratīva uzlabošana
Daudzos apmācības ciklos modelis apgūst noturīgu pašlabošanas mehānismu, kas novērš kļūdu uzkrāšanos.
Šīs pieejas skaistums ir tās elegance. Nav jaunu modeļu arhitektūru, papildu parametru vai inferenču laika triku. Modelis apmācības laikā vienkārši iemācās, kā izskatās reālie izmantošanas apstākļi.
Kāpēc tas ir svarīgāk, nekā jūs domājat
Sekas sniedzas daudz tālāk par garāku kaķu video ģenerēšanu. Lūk, kas mainās:
Pirms kļūdu pārstrādes
- Video modeļi ierobežoti līdz 4-20 sekundēm
- Ainas konsekvence strauji pasliktinās
- Tēlu identitāte novirzās pēc dažām sekundēm
- Fizika kļūst arvien nereālistiskāka
- Krāsas un apgaismojums neparedzami mainās
Pēc kļūdu pārstrādes
- Vairākas minūtes ilga sakarīga video ģenerēšana
- Stabils tēlu izskats visā video garumā
- Konsekventa fizika un telpiskās attiecības
- Uzticama krāsu korekcija un apgaismojums
- Laika gaitā nav redzamas kvalitātes pasliktināšanās
Skaitļi
VITA Lab komanda testēja Stable Video Infinity vairākās arhitektūrās un etalonuzdevumos. Rezultāti ir iespaidīgi:
| Metrika | Bez kļūdu pārstrādes | Ar kļūdu pārstrādi | Uzlabojums |
|---|---|---|---|
| FVD (zemāks ir labāks) | Pasliktinās pēc 4s | Stabils līdz 2min+ | Būtisks |
| Tēlu konsekvence | Samazinās zem 60% pie 15s | Saglabā 90%+ pie 2min | ~50% relatīvi |
| Temporālā saskaņotība | Redzama nobīde pie 8s | Nav redzamas nobīdes pie 2min | Kvalitatīvs lēciens |
| Skaitļošanas pieskaitāmās izmaksas | Bāzes līmenis | Bāzes līmenis (0% pieaugums) | Nulles izmaksas |
Nulles skaitļošanas pieskaitāmo izmaksu aspekts ir kritisks. Kļūdu pārstrāde ir apmācības laika paņēmiens, nevis inferenču laika paņēmiens. Pēc apmācības modelis darbojas tieši ar tādu pašu ātrumu un izmaksām kā iepriekš.
Kā kļūdu pārstrāde darbojas tehniski
Tiem, kuri vēlas tehniskās detaļas, lūk, kas notiek modificētajā apmācības procesā.
Standarta video difūzijas apmācība izmanto trokšņa grafiku epsilon, kas tiek piemērots tīriem pamatpatiesības kadriem x_0. Modelis iemācās prognozēt troksni un atgūt sākotnējo signālu. Inferenču laikā modelis autoregresīvi ģenerē kadru t+1, balstoties uz savu kadra t prognozi.
Atšķirību starp apmācību, tīrām ievadēm, un inferenci, paša ģenerētām ievadēm, sauc par ekspozīcijas nobīdi. Kļūdu pārstrāde to tieši risina.
Tehniskās detaļas: modificēts apmācības mērķis▼
Apmācības laikā modelis periodiski ģenerē kadrus, izmantojot savus pašreizējos svarus, nevis pamatpatiesības datus. Šie paša ģenerētie kadri ar visām to nepilnībām pēc tam tiek izmantoti kā nosacījuma ievades nākamajiem kadriem apmācības secībā.
Galvenais hiperparametrs ir pārstrādes koeficients r, kas nosaka, cik bieži paša ģenerētie kadri apmācības laikā aizstāj pamatpatiesības kadrus. Rakstā konstatēts, ka r = 0.3 (30% pārstrādātu kadru) nodrošina optimālu veiktspēju, līdzsvarojot stabilitātes uzlabojumu ar apmācības signāla kvalitāti.
Modificētā zaudējumu funkcija paliek standarta difūzijas mērķis. Vienīgā atšķirība ir datu sadalījums, ko modelis redz apmācības laikā. Tāpēc inferenču laikā nav skaitļošanas pieskaitāmo izmaksu.
Konceptuāli tas ir līdzīgi plānotajai paraugu ņemšanai secība-secvībā modeļos, taču pielāgots nepārtrauktajai difūzijas sistēmai. VITA Lab komanda rakstā atzīst šo saikni, vienlaikus norādot, ka vienkārša plānotās paraugu ņemšanas piemērošana difūzijas modeļiem nedarbojas. Viņu ieguldījums ir konkrētais formulējums, kas to padara stabilu video ģenerēšanai.
Atvērtā pirmkoda priekšrocība
Iespējams, aizraujošākais aspekts: kods ir pilnībā atvērtā pirmkoda vietnē GitHub (vita-epfl/Stable-Video-Infinity). Tas nozīmē, ka jebkura pētniecības laboratorija vai uzņēmums var piemērot kļūdu pārstrādi saviem esošajiem video modeļiem.
Atvērtā pirmkoda izlaidums seko augošai tendencei AI video pētniecības kopienā. Tādi modeļi kā LTX-2 un Wan 2.6 ir parādījuši, ka atvērtā pirmkoda pieejas var konkurēt ar patentētām alternatīvām.
Ko tas nozīmē nozarei
Laiks ir ievērojams. Mēs atrodamies AI video bruņošanās sacensību vidū, kur katrs lielais spēlētājs, no Runway līdz ByteDance, cenšas nodrošināt garāku un kvalitatīvāku izvadi. Kļūdu pārstrāde varētu būt trūkstošais elements, kas atraisa nākamās paaudzes iespējas.
Filmu veidotājiem un radītājiem
Pētniekiem
Uzņēmumiem
Skats nākotnē
VITA Lab darbs ir būtiska pārmaiņa tajā, kā mēs domājam par AI video ģenerēšanu. Tā vietā, lai veidotu arvien lielākus modeļus vai pievienotu sarežģītus inferenču laika mehānismus, risinājums bija vienkārši parādīt modelim, kā izskatās tā paša izvade.
Raksts tiks prezentēts ICLR 2026, un vairāki nozares avoti liecina, ka lielākie video modeļu nodrošinātāji jau pēta integrāciju. Ja pasaules modeļi atspoguļo AI nākotni fizikas un telpas izpratnē, kļūdu pārstrāde atspoguļo AI nākotni šīs izpratnes uzturēšanā laika gaitā.
4 sekunžu AI video ēra var beigties ātrāk, nekā kāds gaidīja. Un tam nebūs vajadzīga jauna modeļa arhitektūra vai miljardu dolāru skaitļošanas budžets. Tikai gudrāks apmācības cikls.
Papildu lasīšana
- Atvērtā pirmkoda AI video revolūcija: Kā atvērtie modeļi samazina atšķirību no patentētām sistēmām
- Fizikas simulācija AI video: Izpratne par to, kā modeļi apgūst fizisko konsekvenci
- Difūzijas transformeri: Arhitektūra, kas darbina moderno video ģenerēšanu
Avoti
- Starptautiskā konference par mācīšanās reprezentācijām: Oral (ICLR 2026 statuss) (Starptautiskā konference par mācīšanās reprezentācijām)
- EPFL VITA pētnieki vietnē arXiv: Stable Video Infinity atbalsta bezgalīga garuma video ģenerēšanu bez papildu inferenču… (EPFL VITA pētnieki vietnē arXiv)

MI inženieris no Lozannas, kurš apvieno pētniecības dziļumu ar praktiskām inovācijām. Laiku dala starp modeļu arhitektūrām un Alpu virsotnēm.
View profile →Saistītie raksti
Turpiniet izpēti ar šiem saistītajiem ierakstiem

AI video rīku cenas 2026. gadā: kā plānot budžetu, neizdedzinot kredītus
AI video rīkus vairs nav grūti atrast. Grūtākais ir izvēlēties savam darba procesam piemērotāko cenu modeli. Šeit ir praktisks budžeta plānošanas ceļvedis autoriem un komandām.

SkyReels V4: pirmais MI modelis, kas redz un dzird vienlaikus
Skywork AI SkyReels V4 ievieš divu plūsmu difūzijas arhitektūru, kas vienā piegājienā veido video un sinhronu audio. Lūk, ko tas nozīmē veidotājiem.

AI video pēc Sora: 4 tirgus līmeņi, kas jāzina 2026. gadā
Sora tiek slēgta 26. aprīlī. AI video tirgus ir konsolidējies četros līmeņos. Praktisks ceļvedis pareizās Sora alternatīvas izvēlei.