EPFL Stable Video Infinity: Hur Felåtervinning Löser AI-videos Största Problem
Ett nytt ICLR 2026 Oral-paper från EPFL presenterar felåtervinning, en teknik som eliminerar temporal drift och möjliggör AI-videogenerering på flera minuter utan extra beräkningskostnad.

Driftproblemet Som Ingen Löste
Om du har försökt att generera långformad AI-video med någon nuvarande modell vet du om frustrationen. Sora 2 toppar ut på 15 till 25 sekunder beroende på ditt abonnemang. Runway Gen-4.5 maxas på 10. Kling 3.0 når till 15. Anledningen är inte beräkning eller minne. Det är temporal drift.
Temporal drift uppstår när autoregressiva videomodeller ackumulerar små fel fotogram för fotogram. Varje genererat fotogram blir inmatningen för nästa, och små ofullkomligheter sammanfattas exponentiellt. Efter flera hundra fotogram liknar utgången knappast den ursprungliga prompten.
Detta liknar fundamentalt "telefonleken"-problemet. Viska ett meddelande genom tillräckligt många människor och det blir okänt. Tidigare tillvagagångssätt försökte bekämpa drift genom att generera kortare klipp och sätta ihop dem, men sömmarna är synliga. Andra använde hierarkisk generering (först nyckelbilder, sedan interpolering), vilket hjälper men löser inte kärnproblemet.
Felåtervinning Anländer
Dokumentet, titulerat "Stable Video Infinity" och accepterat som ICLR 2026 Oral-presentation, presenterar en förvånansvärt enkel idé: lär modellen att hantera sina egna fel.
Här är nyckelinsikten. Under träning lär sig standardvideomodeller från ren ground-truth-data. De ser aldrig sin egen genererad utgång. Vid distribution måste de plötsligt arbeta med sina egna ofullkomna förutsägelser som inmatning, och de vet inte hur de ska hantera bruset.
Felåtervinning löser detta genom att ändra träningsloopen:
Standardframsida
Modellen genererar ett videosegment från ren träningsdata.
Felsamling
Modellens egna förutsägelser (med sina ofullkomligheter) registreras istället för att kasseras.
Felåtervinning
Dessa ofullkomna utgångar matas in som inmatning för nästa träningsiteration, vilket lär modellen att generera stabil utgång även från bullriga, självgenererade fotogram.
Iterativ Förfining
Under många träningscykler lär sig modellen en robust självrättningsmekanisme som förhindrar felackumulering.
Skönheten med denna metod är dess elegans. Det finns inga nya modelarkitekturer, inga extra parametrar, inga inferensknep. Modellen lär sig helt enkelt under träning hur riktiga distributionsförhållanden ser ut.
Varför Detta Betyder Mer än Du Tror
Konsekvenserna sträcker sig långt bortom att generera längre kattvideoer. Här är vad som ändras:
Före Felåtervinning
- Videomodeller begränsade till 4-20 sekunder
- Scenkonsekvens försämras snabbt
- Karaktärsidentitet driftar efter några sekunder
- Fysiken blir alltmer orealistisk
- Färg och belysning skiftar oprediktabelt
Efter Felåtervinning
- Sammanhängande videogenerering på flera minuter
- Stabilt karaktärsutseende hela tiden
- Konsekvent fysik och rumsliga förhållanden
- Pålitlig färgkalibrering och belysning
- Ingen synlig kvalitetsförsämring över tid
Sifforna
VITA Lab-teamet testade Stable Video Infinity över flera arkitekturer och benchmarks. Resultaten är imponerande:
| Mätetal | Utan Felåtervinning | Med Felåtervinning | Förbättring |
|---|---|---|---|
| FVD (lägre är bättre) | Försämras efter 4s | Stabil genom 2min+ | Signifikant |
| Karaktärkonsekevens | Sjunker under 60% på 15s | Bibehåller 90%+ på 2min | ~50% relativ |
| Temporal Koherens | Synlig drift på 8s | Ingen synlig drift på 2min | Kvalitativt hopp |
| Beräkningsöverkostnad | Baslinje | Baslinje (0% ökning) | Noll kostnad |
Noll-beräknings-överkostnad-aspekten är kritisk. Felåtervinning är en tränings-tid-teknik, inte en inferens-tid-teknik. När modellen väl är tränad körs den med exakt samma hastighet och kostnad som tidigare.
Hur Felåtervinning Fungerar Under Huven
För dem som vill ha de tekniska detaljerna, här är vad som händer i den modifierade träningspipelinen.
Standard videomodifierings träning använder ett bruschema epsilon applicerat på ren ground-truth-fotogram x_0. Modellen lär sig att förutsäga bruset och återställa den ursprungliga signalen. Vid inferens genererar modellen autoregressivt fotogram t+1 betingat av dess förutsägelse av fotogram t.
Gapet mellan träning (rena ingångar) och inferens (själv-genererade ingångar) kallas exposure bias. Felåtervinning åtgärdar detta direkt.
Tekniska Detaljer: Modifierat Träningsuppsättning▼
Under träning genererar modellen periodiskt fotogram med hjälp av dess nuvarande vikter istället för att använda ground-truth-data. Dessa själv-genererade fotogram, kompletta med sina ofullkomligheter, används sedan som betingelser för efterföljande fotogram i träningssekvensen.
Nyckelhyperparametern är återvinningsförhållandet r, som styr hur ofta själv-genererade fotogram ersätter ground-truth-fotogram under träning. Dokumentet konstaterar att r = 0.3 (30% återvunna fotogram) uppnår optimal prestanda och balanserar stabilitetsförbättring med träningssignalkvalitet.
Den modifierade förlussfunktionen förblir standard diffusionsmålet. Den enda skillnaden är datadistributionen som modellen ser under träning. Det är varför det inte finns någon beräkningsöverkostnad vid inferens.
Detta liknar konceptuellt schemalagd sampling i sekvens-till-sekvens-modeller, men anpassad för det kontinuerliga diffusionsramverket. VITA Lab-teamet erkänner denna koppling i sitt papper medan det noterar att naiv tillämpning av schemalagd sampling på diffusionsmodeller inte fungerar. Deras bidrag är den specifika formuleringen som gör den stabil för videogenerering.
Open-Source Fördelen
Kanske det mest spännande aspekten: koden är helt öppen källkod på GitHub (vita-epfl/Stable-Video-Infinity). Detta innebär att vilket forsknignslaboratorium eller företag som helst kan tillämpa felåtervinning på sina befintliga videomodeller.
Utgåvan av öppen källkod följer en växande trend i AI-videoforskarsamfundet. Modeller som LTX-2 och Wan 2.6 har visat att tillvagagångssätt med öppen källkod kan konkurrera med proprietär alternativ.
Vad Detta Betyder för Industrin
Tidpunkten är anmärkningsvärd. Vi är midt i en AI-videokapplöpning där varje större aktör, från Runway till ByteDance, pressar på för längre, högre kvalitet. Felåtervinning kunde vara det saknade stycket som öppnar möjligheterna för nästa generation.
För Filmmakers och Creators
För Forskare
För Företag
Framtidsutsikter
VITA Labs arbete representerar en grundläggande förändring i hur vi tänker på AI-videogenerering. Istället för att bygga större och större modeller eller lägga till komplexa inferenstidsmekanismer var lösningen helt enkelt att visa modellen hur hans eget resultat ser ut.
Dokumentet presenteras på ICLR 2026, och flera industrikällor tyder på att stora videominudeiska leverantörer redan utforskar integration. Om världsmodeller representerar framtiden för hur AI förstår fysik och utrymme, representerar felåtervinning framtiden för hur AI upprätthåller det förståelsen över tid.
Eran med 4-sekunders AI-videoer kan sluta tidigare än någon förväntade. Och det kräver inte en ny modelarkitektur eller en miljardärs beräkningsbudget. Bara en smartare träningsloop.
Vidare Läsning
- Open-Source AI Video-Revolutionen: Hur öppna modeller överbryggar gapet med proprietär system
- Fysik Simulering i AI Video: Att förstå hur modeller lär sig fysisk konsekevens
- Diffusions Transformers: Arkitekturen som driver modern videogenerering

AI-ingenjör från Lausanne som kombinerar forskningens djup med praktisk innovation. Delar sin tid mellan modellarkitekturer och alpina toppar.
View profile →Relaterade artiklar
Fortsätt utforska med dessa relaterade inlägg

SkyReels V4: Den Första AI-Modellen Som Ser och Hör Samtidigt
Skywork AI:s SkyReels V4 introducerar en dual-stream diffusionsarkitektur som genererar video och synkroniserat ljud tillsammans i en enda passering. Vad det betyder för kreatörer.

AI Produktvideogeneratorer: Den Kompletta Guiden för E-Commerce och Marknadsföring 2026
AI produktvideogeneratorer omformar hur varumärken skapar innehåll. Från URL-till-video pipelines till 27% högre lägg-till-kundvagn andelar, här är vad varje marknadsförare behöver veta 2026.

AI-video efter Sora: 4 marknadsnivåer att känna till 2026
Sora stängs ner den 26 april. AI-videomarknaden har konsoliderats till fyra nivåer. En praktisk guide för att välja rätt Sora-alternativ för dina behov.