EPFL Stable Video Infinity: Hvordan Feilgjenbruk Løser AI-videos Største Problem
Et nytt ICLR 2026 Oral-paper fra EPFL presenterer feilgjenbruk, en teknikk som eliminerer temporal drift og muliggjør AI-videogenerering på flere minutter uten ekstra beregningskostnad.

Driftproblemet Som Ingen Løste
Hvis du har prøvd å generere langformet AI-video med noen nåværende modell, vet du om frustrasjonen. Sora 2 topper ut på 15 til 25 sekunder avhengig av din plan. Runway Gen-4.5 maxer på 10. Kling 3.0 når til 15. Årsaken er ikke beregning eller minne. Det er temporal drift.
Temporal drift oppstår når autoregressiv videomodeller akkumulerer små feil rute for rute. Hver generert rute blir innsatsen for neste, og små ufullkommenheter sammensettes eksponentielt. Etter flere hundre ruter, ligner utgangen knapt på det opprinnelige promptet.
Dette ligner fundamentalt "telefonleken"-problemet. Visker et budskap gjennom nok mennesker og det blir gjenkjennelig. Tidligere tilnærminger forsøkte å bekjempe drift ved å generere kortere klipp og stykke dem sammen, men sømmene er synlige. Andre brukte hierarkisk generering (først nøkelruter, deretter interpolering), som hjelper men løser ikke kjerneproblemmet.
Feilgjenbruk Ankommer
Papiret, tittel "Stable Video Infinity" og akseptert som ICLR 2026 Oral-presentasjon, presenterer en forbausende enkel idé: lær modellen å håndtere egne feil.
Her er nøkkelinnsikten. Under trening lærer standardvideomodeller fra ren ground-truth-data. De ser aldri sin egen genererte utgång. Når de implementeres, må de plutselig arbeide med sine egne ufullkomne forutsigelser som innsats, og de vet ikke hvordan de skal håndtere støyen.
Feilgjenbruk løser dette ved å endre treningsløkken:
Standard Fremover Pass
Modellen genererer et videosegment fra ren treningsdata.
Feilsamling
Modellens egne forutsigelser (med deres ufullkommenheter) blir fanget i stedet for kastet bort.
Feilgjenbruk
Disse ufullkomne utgångene blir matet inn som innsats for neste treningsiterering, som lær modellen å generere stabil utgång selv fra støyende, selvgenererte ruter.
Iterativ Finpolering
Over mange trenningssykler lærer modellen en robust selvkorreksjonmekanisme som forhindrer feilakkumulering.
Skjønnheten ved denne tilnærmingen er dens eleganse. Det er ingen nye modelarkitekturer, ingen ekstra parametre, ingen inferenstidskunster. Modellen lærer ganske enkelt under trening hvordan reelle implementeringsforhold ser ut.
Hvorfor Dette Betyr Mer enn Du Tror
Konsekvensene strekker seg langt utover å generere lengere kattevideoer. Her er hva som endres:
Før Feilgjenbruk
- Videomodeller begrenset til 4-20 sekunder
- Scenesammenhenget forverres raskt
- Karakteridentitet drifter etter få sekunder
- Fysikken blir stadig mer urealistisk
- Farge og belysning forskyves uforutsigelig
Etter Feilgjenbruk
- Sammenhengende videogenerering på flere minutter
- Stabil karakterutseende gjennom hele tiden
- Konsistent fysikk og romlige forhold
- Pålitelig fargegraderingn og belysning
- Ingen synlig kvalitetsforringelse over tid
Tallene
VITA Lab-teamet testet Stable Video Infinity over flere arkitekturer og benchmarks. Resultatene er imponerende:
| Måling | Uten Feilgjenbruk | Med Feilgjenbruk | Forbedring |
|---|---|---|---|
| FVD (lavere er bedre) | Forverres etter 4s | Stabil gjennom 2min+ | Signifikant |
| Karaktersammenhenget | Faller under 60% på 15s | Opprettholder 90%+ på 2min | ~50% relativt |
| Temporal Koherens | Synlig drift på 8s | Ingen synlig drift på 2min | Kvalitativ hopp |
| Beregningsoverhead | Grunnlinje | Grunnlinje (0% økning) | Null kostnader |
Null-beregnings-overhead-aspektet er kritisk. Feilgjenbruk er en trening-tid teknikk, ikke en inferens-tid teknikk. Når modellen er trent, kjøres den med nøyaktig samme hastighet og kostnad som før.
Hvordan Feilgjenbruk Fungerer Under Panseret
For dem som ønsker de tekniske detaljer, her er hva som skjer i den modifiserte trenningspipelinen.
Standard videodiffusjonstrenning bruker en støyplan epsilon brukt på ren ground-truth ruter x_0. Modellen lærer å forutsi støyen og gjenopprette det opprinnelige signalet. Under inferens genererer modellen autoregressiv rute t+1 betinget av sin forutsigelse av rute t.
Kløften mellom trening (rene innsatser) og inferens (selvgenererte innsatser) kalles exposure bias. Feilgjenbruk behandler dette direkte.
Tekniske Detaljer: Modifisert Treningssål▼
Under trening genererer modellen periodisk ruter ved bruk av sitt nåværende vekter i stedet for å bruke ground-truth data. Disse selvgenererte rutene, komplett med deres ufullkommenheter, brukes deretter som betingelseinnsatser for påfølgende ruter i treningssekvensen.
Nøkkelhyperparametelen er gjenbruksforholdet r, som kontrollerer hvor ofte selvgenererte ruter erstatter ground-truth ruter under trening. Papiret finner at r = 0.3 (30% gjenbrukte ruter) oppnår optimal ytelse, balansering av stabilitetsforbedrring med trenningssignalkvalitet.
Den modifiserte tappfunksjonen forblir standard diffusjonsmålet. Den eneste forskjellen er datadistribusjonen modellen ser under trening. Dette er hvorfor det ikke er beregningsoverhead under inferens.
Dette ligner konseptuelt planlagt sampling i sekvens-til-sekvens-modeller, men tilpasset det kontinuerlige diffusjonsrammeverket. VITA Lab-teamet erkjenner denne forbindelsen i sitt papir mens de noterer at naive bruk av planlagt sampling på diffusjonsmodeller ikke fungerer. Deres bidrag er den spesifikke formuleringen som gjør den stabil for videogenerering.
Åpen Kildekode Fordelen
Kanskje det mest spennende aspektet: koden er helt åpen kildekode på GitHub (vita-epfl/Stable-Video-Infinity). Dette betyr at ethvert forsknignslaboratorium eller selskap kan bruke feilgjenbruk på sine eksisterende videomodeller.
Utgivelsen av åpen kildekode følger en voksende trend i AI-videoforskersamfunnet. Modeller som LTX-2 og Wan 2.6 har vist at tilnærminger med åpen kildekode kan konkurrere med proprietær alternativer.
Hva Dette Betyr for Industrien
Timingen er bemerkelsesverdig. Vi er midt i en AI-videokapprustning der hver stor aktør, fra Runway til ByteDance, presser på for lengre, høyere kvalitet. Feilgjenbruk kunne være det manglende stykket som låser opp neste generasjons muligheter.
For Filmskaper og Creators
For Forskere
For Bedrifter
Fremtidsutsikter
VITA Labs arbeid representerer en grunnleggende endring i hvordan vi tenker på AI-videogenerering. I stedet for å bygge stadig større modeller eller legge til komplekse inferenstidsmekanismer var løsningen ganske enkelt å vise modellen hvordan hans egen utgång ser ut.
Papiret presenteres på ICLR 2026, og flere industrikilleder antyder at store videominuelmodellerdarbeidere allerede utforsker integrasjon. Hvis verdenmodeller representerer fremtiden for hvordan AI forstår fysikk og rom, representerer feilgjenbruk fremtiden for hvordan AI opprettholder den forståelsen over tid.
Æraen med 4-sekunders AI-videoer kan slutte tidligere enn noen forventet. Og det krever ikke en ny modelarkitektur eller et milliard-dollar beregningsbudsjett. Bare en smartere trenningsløkke.
Videre Lesing
- Åpen Kildekode AI Video-Revolusjonen: Hvordan åpne modeller lukker gapet med proprietær systemer
- Fysikksimulering i AI Video: Å forstå hvordan modeller lærer fysisk sammenhenget
- Diffusjons Transformers: Arkitekturen som driver moderne videogenerering

KI-ingeniør fra Lausanne som kombinerer forskningsdybde med praktisk innovasjon. Deler tiden mellom modellarkitekturer og alpine fjelltopper.
View profile →Relaterte artikler
Fortsett å utforske med disse relaterte innleggene

SkyReels V4: Den Første AI-Modellen Som Ser og Hører Samtidig
Skywork AI sin SkyReels V4 introduserer en dual-stream diffusjonsarkitektur som samgenererer video og synkronisert lyd i én enkelt passering. Hva det betyr for skapere.

AI Produktvideogeneratorer: Den Komplette Guiden for E-Commerce og Markedsføring i 2026
AI produktvideogeneratorer omformer hvordan merkevarer skaper innhold. Fra URL-til-video pipelines til 27% høyere legg-til-handlekurv rater, her er hva hver markedsfører må vite i 2026.

AI-video etter Sora: 4 markedsnivåer å kjenne til i 2026
Sora stenger 26. april. AI-videomarkedet har konsolidert seg til fire nivåer. En praktisk guide for å velge riktig Sora-alternativ for dine behov.