Meta PixelPāriet uz galveno saturu
AlexisAlexis· MI autors, pārskatījis cilvēks
7 min read
1260 vārdi

EPFL Stable Video Infinity: kā kļūdu pārstrāde risina AI video lielāko problēmu

Jauns EPFL ICLR 2026 Oral raksts ievieš kļūdu pārstrādi, paņēmienu, kas novērš temporālo nobīdi un ļauj ģenerēt vairākas minūtes garus AI video bez papildu skaitļošanas izmaksām.

EPFL Stable Video Infinity: kā kļūdu pārstrāde risina AI video lielāko problēmu

Vai esat gatavs veidot savus MI videoklipus?

Pievienojieties tūkstošiem satura veidotāju, kuri izmanto Bonega.ai

Katram AI video modelim ir viens un tas pats nepatīkamais noslēpums. Ģenerējiet 4 sekunžu klipu, un rezultāti izskatās satriecoši. Pārsniedziet 15 sekundes, un tēli sāk pārveidoties, fizika sabrūk, krāsas mainās, un visa aina novirzās nesakarībā. EPFL VITA Lab tikko publicēja risinājumu, un tas varētu būt šā gada nozīmīgākais raksts video ģenerēšanā.

Nobīdes problēma, ko neviens neatrisināja

Ja esat mēģinājis ģenerēt garas formas AI video ar kādu no pašreizējiem modeļiem, jūs zināt šo vilšanos. Sora 2 ierobežo ilgumu līdz 15 līdz 25 sekundēm atkarībā no jūsu plāna. Runway Gen-4.5 maksimums ir 10. Kling 3.0 sasniedz 15. Iemesls nav skaitļošanas jauda vai atmiņa. Tā ir temporālā nobīde.

💡

Temporālā nobīde rodas, kad autoregresīvie video modeļi kadru pēc kadra uzkrāj nelielas kļūdas. Katrs ģenerētais kadrs kļūst par ievadi nākamajam, un sīkas nepilnības eksponenciāli pastiprinās. Pēc dažiem simtiem kadru izvade tik tikko atgādina sākotnējo uzvedni.

Tas būtībā ir līdzīgi "klusā telefona" problēmai. Pačukstiet ziņojumu pietiekami daudziem cilvēkiem, un tas kļūst neatpazīstams. Iepriekšējās pieejas mēģināja cīnīties ar nobīdi, ģenerējot īsākus klipus un tos savienojot, taču šuves ir redzamas. Citas izmantoja hierarhisku ģenerēšanu, vispirms atslēgkadrus, pēc tam interpolāciju, kas palīdz, bet nenovērš pamatproblēmu.

Kļūdu pārstrāde

Raksts ar nosaukumu "Stable Video Infinity", kas pieņemts kā ICLR 2026 Oral prezentācija, ievieš mānīgi vienkāršu ideju: iemācīt modelim tikt galā ar savām kļūdām.

Oral
ICLR 2026 statuss
0
Papildu skaitļošanas izmaksas
Minutes
Video ilgums

Lūk, galvenā atziņa. Apmācības laikā standarta video difūzijas modeļi mācās no tīriem pamatpatiesības datiem. Tie nekad neredz pašu ģenerēto izvadi. Kad tie tiek izmantoti praksē, tiem pēkšņi jāstrādā ar savām nepilnīgajām prognozēm kā ievadi, un tie nezina, kā rīkoties ar troksni.

Kļūdu pārstrāde to novērš, mainot apmācības ciklu:

1. solis

Standarta tiešā pāreja

Modelis ģenerē video segmentu no tīriem apmācības datiem.

2. solis

Kļūdu apkopošana

Modeļa paša prognozes ar to nepilnībām tiek saglabātas, nevis izmestas.

3. solis

Kļūdu pārstrāde

Šīs nepilnīgās izvades tiek ievadītas atpakaļ kā ievade nākamajai apmācības iterācijai, mācot modelim ģenerēt stabilu izvadi pat no trokšņainiem, paša ģenerētiem kadriem.

4. solis

Iteratīva uzlabošana

Daudzos apmācības ciklos modelis apgūst noturīgu pašlabošanas mehānismu, kas novērš kļūdu uzkrāšanos.

Šīs pieejas skaistums ir tās elegance. Nav jaunu modeļu arhitektūru, papildu parametru vai inferenču laika triku. Modelis apmācības laikā vienkārši iemācās, kā izskatās reālie izmantošanas apstākļi.

Kāpēc tas ir svarīgāk, nekā jūs domājat

Sekas sniedzas daudz tālāk par garāku kaķu video ģenerēšanu. Lūk, kas mainās:

Pirms kļūdu pārstrādes

  • Video modeļi ierobežoti līdz 4-20 sekundēm
  • Ainas konsekvence strauji pasliktinās
  • Tēlu identitāte novirzās pēc dažām sekundēm
  • Fizika kļūst arvien nereālistiskāka
  • Krāsas un apgaismojums neparedzami mainās

Pēc kļūdu pārstrādes

  • Vairākas minūtes ilga sakarīga video ģenerēšana
  • Stabils tēlu izskats visā video garumā
  • Konsekventa fizika un telpiskās attiecības
  • Uzticama krāsu korekcija un apgaismojums
  • Laika gaitā nav redzamas kvalitātes pasliktināšanās

Skaitļi

VITA Lab komanda testēja Stable Video Infinity vairākās arhitektūrās un etalonuzdevumos. Rezultāti ir iespaidīgi:

MetrikaBez kļūdu pārstrādesAr kļūdu pārstrādiUzlabojums
FVD (zemāks ir labāks)Pasliktinās pēc 4sStabils līdz 2min+Būtisks
Tēlu konsekvenceSamazinās zem 60% pie 15sSaglabā 90%+ pie 2min~50% relatīvi
Temporālā saskaņotībaRedzama nobīde pie 8sNav redzamas nobīdes pie 2minKvalitatīvs lēciens
Skaitļošanas pieskaitāmās izmaksasBāzes līmenisBāzes līmenis (0% pieaugums)Nulles izmaksas
💡

Nulles skaitļošanas pieskaitāmo izmaksu aspekts ir kritisks. Kļūdu pārstrāde ir apmācības laika paņēmiens, nevis inferenču laika paņēmiens. Pēc apmācības modelis darbojas tieši ar tādu pašu ātrumu un izmaksām kā iepriekš.

Kā kļūdu pārstrāde darbojas tehniski

Tiem, kuri vēlas tehniskās detaļas, lūk, kas notiek modificētajā apmācības procesā.

Standarta video difūzijas apmācība izmanto trokšņa grafiku epsilon, kas tiek piemērots tīriem pamatpatiesības kadriem x_0. Modelis iemācās prognozēt troksni un atgūt sākotnējo signālu. Inferenču laikā modelis autoregresīvi ģenerē kadru t+1, balstoties uz savu kadra t prognozi.

Atšķirību starp apmācību, tīrām ievadēm, un inferenci, paša ģenerētām ievadēm, sauc par ekspozīcijas nobīdi. Kļūdu pārstrāde to tieši risina.

Tehniskās detaļas: modificēts apmācības mērķis

Apmācības laikā modelis periodiski ģenerē kadrus, izmantojot savus pašreizējos svarus, nevis pamatpatiesības datus. Šie paša ģenerētie kadri ar visām to nepilnībām pēc tam tiek izmantoti kā nosacījuma ievades nākamajiem kadriem apmācības secībā.

Galvenais hiperparametrs ir pārstrādes koeficients r, kas nosaka, cik bieži paša ģenerētie kadri apmācības laikā aizstāj pamatpatiesības kadrus. Rakstā konstatēts, ka r = 0.3 (30% pārstrādātu kadru) nodrošina optimālu veiktspēju, līdzsvarojot stabilitātes uzlabojumu ar apmācības signāla kvalitāti.

Modificētā zaudējumu funkcija paliek standarta difūzijas mērķis. Vienīgā atšķirība ir datu sadalījums, ko modelis redz apmācības laikā. Tāpēc inferenču laikā nav skaitļošanas pieskaitāmo izmaksu.

Konceptuāli tas ir līdzīgi plānotajai paraugu ņemšanai secība-secvībā modeļos, taču pielāgots nepārtrauktajai difūzijas sistēmai. VITA Lab komanda rakstā atzīst šo saikni, vienlaikus norādot, ka vienkārša plānotās paraugu ņemšanas piemērošana difūzijas modeļiem nedarbojas. Viņu ieguldījums ir konkrētais formulējums, kas to padara stabilu video ģenerēšanai.

Atvērtā pirmkoda priekšrocība

Iespējams, aizraujošākais aspekts: kods ir pilnībā atvērtā pirmkoda vietnē GitHub (vita-epfl/Stable-Video-Infinity). Tas nozīmē, ka jebkura pētniecības laboratorija vai uzņēmums var piemērot kļūdu pārstrādi saviem esošajiem video modeļiem.

Kāpēc atvērtajam pirmkodam ir nozīme
Jebkuru esošu video difūzijas modeli var papildināt ar kļūdu pārstrādi. Nav vajadzīgas arhitektūras izmaiņas, tikai modificēts apmācības cikls. Tas varētu vienlaikus uzlabot Sora, Runway, Kling un katru atvērtā pirmkoda modeli.
Praktiskie ierobežojumi
Nepieciešama modeļa pārtrenēšana vai precizēšana. Uzņēmumiem ar patentētiem modeļiem jāiegulda skaitļošanas jauda pārtrenēšanā. Paņēmiena efektivitāte var atšķirties dažādās arhitektūrās un mērogos.

Atvērtā pirmkoda izlaidums seko augošai tendencei AI video pētniecības kopienā. Tādi modeļi kā LTX-2 un Wan 2.6 ir parādījuši, ka atvērtā pirmkoda pieejas var konkurēt ar patentētām alternatīvām.

Ko tas nozīmē nozarei

Laiks ir ievērojams. Mēs atrodamies AI video bruņošanās sacensību vidū, kur katrs lielais spēlētājs, no Runway līdz ByteDance, cenšas nodrošināt garāku un kvalitatīvāku izvadi. Kļūdu pārstrāde varētu būt trūkstošais elements, kas atraisa nākamās paaudzes iespējas.

🎬

Filmu veidotājiem un radītājiem

Garas formas sakarīga video ģenerēšana ļauj radīt īstu naratīvu saturu. Ne tikai klipus, bet arī ainas, sekvences un galu galā īsfilmas, kas ģenerētas no vienas uzvednes.
🔬

Pētniekiem

Kļūdu pārstrāde nodrošina vispārināmu sistēmu. To pašu principu varētu piemērot audio ģenerēšanai, 3D ainu sintēzei un jebkuram autoregresīvam ģeneratīvam modelim, kas cieš no nobīdes.
🏢

Uzņēmumiem

Stabila garas formas ģenerēšana padara AI video dzīvotspējīgu profesionāliem lietojumiem: produktu demonstrācijām, apmācību video, mārketinga kampaņām, kurām nepieciešama konsekventa kvalitāte vairāku minūšu satura garumā.

Skats nākotnē

VITA Lab darbs ir būtiska pārmaiņa tajā, kā mēs domājam par AI video ģenerēšanu. Tā vietā, lai veidotu arvien lielākus modeļus vai pievienotu sarežģītus inferenču laika mehānismus, risinājums bija vienkārši parādīt modelim, kā izskatās tā paša izvade.

Raksts tiks prezentēts ICLR 2026, un vairāki nozares avoti liecina, ka lielākie video modeļu nodrošinātāji jau pēta integrāciju. Ja pasaules modeļi atspoguļo AI nākotni fizikas un telpas izpratnē, kļūdu pārstrāde atspoguļo AI nākotni šīs izpratnes uzturēšanā laika gaitā.

4 sekunžu AI video ēra var beigties ātrāk, nekā kāds gaidīja. Un tam nebūs vajadzīga jauna modeļa arhitektūra vai miljardu dolāru skaitļošanas budžets. Tikai gudrāks apmācības cikls.

Papildu lasīšana


Avoti

Alexis
AlexisAI EngineerAI Author

MI inženieris no Lozannas, kurš apvieno pētniecības dziļumu ar praktiskām inovācijām. Laiku dala starp modeļu arhitektūrām un Alpu virsotnēm.

View profile →

Patika izlasītais?

Pārvērtiet savas idejas neierobežota garuma MI videoklipos dažu minūšu laikā.

Saistītie raksti

Turpiniet izpēti ar šiem saistītajiem ierakstiem

Vai jums patika šis raksts?

Atklājiet vairāk atziņu un sekojiet līdzi mūsu jaunākajam saturam.