EPFL Stable Video Infinity: Jak Error Recycling řeší největší problém generování AI videa
Nový příspěvek ICLR 2026 Oral z EPFL představuje error recycling, techniku, která eliminuje časový drift a umožňuje generování víceminutového AI videa bez dodatečných výpočetních nákladů.

Jste připraveni vytvářet vlastní AI videa?
Připojte se k tisícům tvůrců, kteří používají Bonega.ai Generování začne po zaplacení.
Problém Driftu, Který Nikdo Nevyřešil
Pokud jsi kdy zkusil generovat dlouhodobé AI video s jakýmkoli současným modelem, znáš to zklamání. Sora 2 je omezena na 15 až 25 sekund v závislosti na vašem plánu. Runway Gen-4.5 dosahuje maximálně 10 sekund. Kling 3.0 dosahuje 15 sekund. Důvodem není výpočetní výkon ani paměť. Je to časový drift.
Časový drift se vyskytuje, když autoregresivní modely videa akumulují malé chyby snímek po snímku. Každý vygenerovaný snímek se stane vstupem pro následující, a malé nedokonalosti se exponenciálně kombinují. Po několika stovkách snímků výstup ledwie připomíná původní pokyn.
To je zásadně podobné problému "telefonu". Zašepej zprávu skrz dostatek lidí a stane se nepoznatelnou. Předchozí přístupy se pokusily bojovat s driftem generováním kratších klipů a jejich lepením dohromady, ale švy jsou viditelné. Ostatní používali hierarchické generování (nejprve klíčové snímky, pak interpolace), což pomáhá, ale neodstraňuje základní problém.
Přichází Error Recycling
Článek s názvem "Stable Video Infinity" a přijatý jako ústní prezentace ICLR 2026, zavádí klamavě jednoduchou myšlenku: nauči model zvládat své vlastní chyby.
Zde je klíčový vhled. Během trénování se standardní modely difúze videa učí z čistých dat referencí. Nikdy nevidí svůj vlastní generovaný výstup. Po nasazení najednou musí pracovat se svými vlastními nedokonalými předpověďmi jako vstupem a nevědí, jak se vypořádat s šumem.
Error recycling to napravuje modifikací tréninkové smyčky:
Standardní Přední Průchod
Model generuje segment videa z čistých tréninkovacích dat.
Shromažďování Chyb
Vlastní předpovědi modelu (s jejich nedokonalostmi) jsou zachyceny místo vyřazení.
Error Recycling
Tyto nedokonalé výstupy jsou podávány zpět jako vstup pro další tréninkový iteraci, učující model generovat stabilní výstup i z hlučných, vlastních generovaných snímků.
Iterativní Zlepšování
Během mnoha tréninkových cyklů se model učí robustní mechanismus vlastní korekce, který zabraňuje akumulaci chyb.
Krása tohoto přístupu spočívá v jeho eleganci. Nejsou tu žádné nové architektury modelů, žádné dodatečné parametry, žádné triky za běhu. Model se během tréninku prostě učí, jak vypadají reálné podmínky nasazení.
Proč Na Tom Záleží Více, Než Si Myslíš
Důsledky se rozšiřují daleko za generování delších videí s kočkami. Zde je co se mění:
Před Error Recycling
- Modely videa omezeny na 4-20 sekund
- Konzistence scény se rychle zhoršuje
- Identita postavy se vzdaluje po několika sekundách
- Fyzika se stává stále nereálnější
- Barvy a osvětlení se posouvají nepředvídatelně
Po Error Recycling
- Generování koherentního videa dlouhého více minut
- Stabilní vzhled postav v průběhu
- Konzistentní fyzika a prostorové vztahy
- Spolehlivé grádování barev a osvětlení
- Bez viditelného snížení kvality v čase
Čísla
Tým VITA Lab testoval Stable Video Infinity na více architekturách a benchmarcích. Výsledky jsou údajně:
| Metrika | Bez Error Recycling | S Error Recycling | Zlepšení |
|---|---|---|---|
| FVD (nižší je lépe) | Degradace po 4s | Stabilní přes 2min+ | Významné |
| Konzistence Postav | Klesá pod 60% při 15s | Udržuje 90%+ při 2min | ~50% relativně |
| Časová Koherence | Viditelný drift při 8s | Bez viditelného driftu při 2min | Kvalitativní skok |
| Výpočetní Režie | Baseline | Baseline (0% nárůst) | Nulové náklady |
Aspekt nulových výpočetních nákladů je kritický. Error recycling je technika během tréninku, nikoli během běhu. Po natréninku se model spouští přesně stejnou rychlostí a náklady jako předtím.
Jak Error Recycling Funguje Pod Kapotou
Pro ty, kteří chtějí technické detaily, zde je co se děje v modifikovaném tréninkovacím pipeline.
Standardní trénink difúze videa používá časový plán epsilon aplikovaný na čistá referenční data x_0. Model se učí předvídat šum a obnovit původní signál. Během běhu model autoregresivně generuje snímek t+1 podmíněný svou predikcí snímku t.
Mezera mezi tréninkem (čisté vstupy) a během běhu (vlastní generované vstupy) se nazývá exposure bias. Error recycling to přímo řeší.
Technické Detaily: Modifikovaný Tréninkový Cíl▼
Během tréninku model občas generuje snímky pomocí svých současných vah místo použití referenčních dat. Tyto vlastní generované snímky, spolu s jejich nedokonalostmi, jsou pak použity jako podmíňovací vstupy pro následné snímky v tréninkové sekvenci.
Klíčovým hyperparametrem je recycling ratio r, který řídí jak často vlastní generované snímky nahrazují referenční snímky během tréninku. Článek zjišťuje, že r = 0.3 (30% recyklovaných snímků) dosahuje optimálního výkonu, vyvažování zlepšení stability s kvalitou tréninkového signálu.
Modifikovaná funkce ztráty zůstává standardním cílem difúze. Jedinou rozdílem je distribuce dat, kterou model vidí během tréninku. Proto zde nejsou výpočetní náklady během běhu.
To je koncepčně podobné scheduled sampling v modelech sekvenčnísekvence, ale přizpůsobeno pro cilivý rámec difúze. Tým VITA Lab toto připojení v článku uznává, přičemž poznamenává, že naivní aplikace plánovaného vzorkování na modely difúze nefunguje. Jejich příspěvek je konkrétní formulace, která to stabilizuje pro generování videa.
Výhoda Otevřeného Zdroje
Možná nejpodpůrnější aspekt: kód je plně otevřeného zdroje na GitHubu (vita-epfl/Stable-Video-Infinity). To znamená, že jakákoli výzkumná laboratoř nebo společnost mohou aplikovat error recycling na své existující modely videa.
Vydání otevřeného zdroje následuje rostoucí trend v komunitě výzkumu AI videa. Modely jako LTX-2 a Wan 2.6 prokázaly, že přístupy otevřeného zdroje mohou konkurovat proprietárním alternativám.
Co To Znamená pro Průmysl
Načasování je pozoruhodné. Jsme uprostřed závodu AI videa, kde každý hlavní hráč, od Runway po ByteDance, tlačí na delší, vyšší kvalitu výstup. Error recycling by mohl být chybějící kus, který odemyká další generaci schopností.
Pro Filmaře a Tvůrce
Pro Výzkumné Pracovníky
Pro Podnik
Pohled do Budoucnosti
Práce VITA Lab představuje zásadní posun v tom, jak myslíme na generování AI videa. Místo budování stále větších modelů nebo přidávání složitých mechanismů během běhu, řešením bylo jednoduše ukázat modelu, jak vypadají jeho vlastní výstupy.
Článek bude představen na ICLR 2026 a několik průmyslových zdrojů naznačuje, že si hlavní poskytovatelé modelů videa již prohlížejí integraci. Pokud world models představují budoucnost toho, jak AI chápe fyziku a prostor, error recycling představuje budoucnost toho, jak si AI toto chápání udržuje v čase.
Věk 4sekundových AI videí se může skončit dříve, než kdokoliv očekával. A nebude to vyžadovat novou architekturu modelu nebo miliardový rozpočet. Jen chytřejší tréninkovou smyčku.
Další Čtení
- Revoluce Otevřeného Videa AI: Jak otevřené modely zavírají propast s proprietárními systémy
- Simulace Fyziky v AI Videu: Pochopení jak se modely učí fyzickou konzistenci
- Diffusion Transformers: Architektura pohánějící moderní generování videa

Persona AI inženýra. Věnuje se architekturám modelů, benchmarkům a převodu výzkumu do praxe v oblasti AI videa. Koncept vytvořen pomocí Claude, publikováno po automatizovaných kontrolách.
View profile →Líbilo se vám, co jste četli?
Proměňte své nápady během několika minut v AI videa neomezené délky. Generování začne po zaplacení.
Související články
Pokračujte v objevování s těmito souvisejícími příspěvky

Oznámení Google Flow AI 2026: Sjednocený pracovní prostor pro video
Aktualizace k oznámení Google Flow AI 2026: otestujte funkce Veo 3.1, limity generování v 1080p, migraci z Whisku a stupňovité ceny od $19.99 měsíčně.

Nejlepší bezplatný AI video generátor v roce 2026: Skutečné limity otestovány
Porovnejte špičkové platformy a najděte nejlepší bezplatný AI video generátor v roce 2026: Kling nabízí 66 kreditů denně, Runway má limit 125 a Pika generuje v rozlišení 480p.

Google Veo zdarma: limity v Google Vids (2026)
Bezplatný přístup ke Google Veo v Google Vids není univerzální. Podívejte se na měsíční limit 50 videí, výstup v 720p, 8sekundové klipy z obrázků a pravidla způsobilosti.