EPFL Stable Video Infinity: Hoe Foutrecycling AI Video's Grootste Probleem Oplost
Een nieuw ICLR 2026 Oral-paper van EPFL introduceert foutrecycling, een techniek die temporale drift elimineert en video-generatie met meerdere minuten AI mogelijk maakt zonder extra computerkost.

Het Driftprobleem dat Niemand Oploste
Als je hebt geprobeerd lange AI-video's te genereren met enig huidig model, ken je de frustratie. Sora 2 maxed uit op 15 tot 25 seconden afhankelijk van je plan. Runway Gen-4.5 stopt op 10. Kling 3.0 haalt 15. De reden is niet rekenkracht of geheugen. Het is temporale drift.
Temporale drift treedt op wanneer autoregressieve videomodellen kleine fouten frame voor frame accumuleren. Elk gegenereerd frame wordt de input voor het volgende, en minuscule onvolkomenheden stapelen zich exponentieel op. Na enkele honderd frames, lijkt de output nauwelijks meer op de originele prompt.
Dit is fundamenteel vergelijkbaar met het "telefoonspel" probleem. Fluister een boodschap door genoeg mensen en het wordt onherkenbaar. Eerdere benaderingen probeerden drift te bestrijden door kortere clips te genereren en die aan elkaar te zetten, maar je ziet de naden. Anderen gebruikten hiërarchische generatie (eerst keyframes, dan interpolatie), wat helpt maar los niet het kernprobleem op.
Foutrecycling Komt Binnen
Het paper, getiteld "Stable Video Infinity" en geaccepteerd als ICLR 2026 Oral-presentatie, introduceert een opvallend eenvoudig idee: leer het model zijn eigen fouten te hanteren.
Hier is het belangrijkste inzicht. Tijdens training leren standaard video diffusie-modellen van schone ground-truth data. Ze zien nooit hun eigen gegenereerde output. Bij implementatie moeten ze plotseling met hun eigen onvolmaakte voorspellingen als input werken, en ze weten niet hoe ze het ruisen moeten verwerken.
Foutrecycling lost dit op door de trainingsloop aan te passen:
Standaard Forward Pass
Het model genereert een videosegment vanuit schone trainingsdata.
Foutencollectie
De eigen voorspellingen van het model (met hun onvolkomenheden) worden vastgelegd in plaats van weggegooid.
Foutrecycling
Deze onvolmaakte outputs worden als input voor de volgende trainingsiteratie gebruikt, wat het model leert stabiele output te genereren zelfs vanuit rauwe, zelf-gegenereerde frames.
Iteratief Verfijnen
Na veel trainingsycli leert het model een robuust zelf-correctiemechanisme dat foutaccumulatie voorkomt.
De schoonheid van deze benadering is de elegantie. Er zijn geen nieuwe modelarchitecturen, geen extra parameters, geen inference-tijd trucs. Het model leert tijdens training simpelweg hoe echte implementatieomstandigheden eruitzien.
Waarom Dit Meer Betekent dan Je Denkt
De implicaties gaan ver voorbij het genereren van langere kattenvideos. Hier is wat verandert:
Voor Foutrecycling
- Videomodellen beperkt tot 4-20 seconden
- Sceneconsistentie verslechtert snel
- Karakteridentiteit drifft na enkele seconden
- Fysica wordt steeds onrealistischer
- Kleur en verlichting verschuiven onvoorspelbaar
Na Foutrecycling
- Coherente multi-minuten videogeneratie
- Stabiel karakteruiterlijk gedurende de hele tijd
- Consistente fysica en ruimtelijke relaties
- Betrouwbare kleurkalibratie en verlichting
- Geen zichtbare kwaliteitsverlaging in de tijd
De Getallen
Het VITA Lab-team testte Stable Video Infinity op meerdere architecturen en benchmarks. De resultaten zijn indrukwekkend:
| Metriek | Zonder Foutrecycling | Met Foutrecycling | Verbetering |
|---|---|---|---|
| FVD (lager is beter) | Verslechtert na 4s | Stabiel door 2min+ | Significant |
| Karakterconsistentie | Daalt onder 60% op 15s | Handhaaft 90%+ op 2min | ~50% relatief |
| Temporale Coherentie | Zichtbare drift op 8s | Geen zichtbare drift op 2min | Kwalitatieve sprong |
| Rekenoverhead | Baseline | Baseline (0% toename) | Nul kosten |
Het nul-computerkost-aspect is kritiek. Foutrecycling is een training-tijd techniek, niet inference-tijd. Eenmaal getraind, draait het model exact op dezelfde snelheid en kosten als daarvoor.
Hoe Foutrecycling onder de Motorkap Werkt
Voor degenen die de technische details willen, dit gebeurt er in de aangepaste trainings-pipeline.
Standaard video diffusie training gebruikt een ruisschema epsilon toegepast op schone ground-truth frames x_0. Het model leert het ruisen te voorspellen en het originele signaal te herstellen. Bij inference genereert het model autoregressief frame t+1 geconditioneerd op zijn voorspelling van frame t.
De kloof tussen training (schone inputs) en inference (zelf-gegenereerde inputs) heet exposure bias. Foutrecycling pakt dit direct aan.
Technische Details: Aangepast Trainingsdoel▼
Tijdens training genereert het model periodiek frames met behulp van zijn huidige gewichten in plaats van ground-truth data te gebruiken. Deze zelf-gegenereerde frames, compleet met hun onvolkomenheden, worden dan als conditionering inputs voor vervolgingframes in de trainingssequentie gebruikt.
De sleutel hyperparameter is de recycle ratio r, die bepaalt hoe vaak zelf-gegenereerde frames ground-truth frames vervangen tijdens training. Het paper vindt dat r = 0.3 (30% gerecyclede frames) optimale prestaties bereikt, en stabiliteitsverbetering balanceert met trainingssignaalskwaliteit.
De aangepaste verliesfunctie blijft het standaard diffusie objectief. Het enige verschil is de gegevensverdeling die het model tijdens training ziet. Dit is waarom er geen rekenoverhead is op inference-tijd.
Dit is conceptueel vergelijkbaar met geplande sampling in sequence-to-sequence modellen, maar aangepast voor het continue diffusie raamwerk. Het VITA Lab-team erkent deze verbinding in hun paper terwijl het opmerkt dat naïeve toepassing van geplande sampling op diffusie modellen niet werkt. Hun bijdrage is de specifieke formulering die het stabiel maakt voor videogeneratie.
Het Open-Source Voordeel
Misschien het meest opwindende aspect: de code is volledig open-source op GitHub (vita-epfl/Stable-Video-Infinity). Dit betekent dat elk onderzoekslaboratorium of bedrijf foutrecycling kan toepassen op hun bestaande videomodellen.
De open-source release volgt een groeiende trend in de AI video onderzoeksgemeenschap. Modellen zoals LTX-2 en Wan 2.6 hebben aangetoond dat open-source benaderingen kunnen concurreren met merkgebonden alternatieven.
Wat Dit Betekent voor de Industrie
De timing is opvallend. We zitten in het midden van een AI video wapenwedloop waar ieder groot acteur, van Runway tot ByteDance, pusht voor langere, hogere kwaliteit output. Foutrecycling zou het ontbrekende stuk kunnen zijn dat de volgende generatie mogelijkheden ontgrendelt.
Voor Filmmakers en Creators
Voor Onderzoekers
Voor Ondernemingen
Vooruitblik
Het werk van het VITA Lab vertegenwoordigt een fundamentele verschuiving in hoe we denken over AI-videogeneratie. In plaats van steeds groter wordende modellen te bouwen of complexe inference-tijdmechanismen toe te voegen, was de oplossing gewoon het model te laten zien hoe zijn eigen output eruitziet.
Het paper wordt gepresenteerd op ICLR 2026, en verscheidene industriebronnen suggereren dat grote videomodelproviders al integratie verkennen. Als wereld modellen de toekomst vertegenwoordigen van hoe AI fysica en ruimte begrijpt, vertegenwoordigt foutrecycling de toekomst van hoe AI dat begrip in de loop der tijd handhaaft.
Het tijdperk van 4-seconden AI-video's eindigt mogelijk sneller dan iemand verwacht. En het vereist geen nieuwe modelarchitectuur of een miljard dollar rekenbudget. Gewoon een slimmer trainingsloop.
Aanvullende Lectuur
- De Open-Source AI Video-Revolutie: Hoe open modellen de kloof met merkgebonden systemen dichten
- Fysicasimulatie in AI Video: Begrijpen hoe modellen fysieke consistentie leren
- Diffusie Transformers: De architectuur die moderne videogeneratie voedzet

AI-engineer uit Lausanne die diepgaand onderzoek combineert met praktische innovatie. Verdeelt zijn tijd tussen modelarchitecturen en alpiene bergtoppen.
View profile →Gerelateerde artikelen
Blijf ontdekken met deze gerelateerde berichten

AI Video Extender: Video Langer Maken in 2026
Gebruik een AI video extender om een video langer te maken in 2026. Vergelijk uitbreidingslimieten, behoud continuïteit en kies een workflow voor gegenereerde of bestaande clips.

Prijzen van AI-videotools in 2026: budgetteren zonder credits te verbranden
AI-videotools zijn niet langer moeilijk te vinden. Het lastige deel is het juiste prijsmodel kiezen voor je workflow. Hier is een praktische budgetgids voor creators en teams.

AI-video voor onderwijs: Hoe docenten en cursusmakers AI gebruiken in 2026
Van hoorcollege-opnames tot volledige cursusproductie, AI-videotools transformeren de manier waarop docenten content creëren. Dit is wat werkt, wat niet werkt en waar de technologie naartoe gaat.