EPFL Stable Video Infinity: Jak Error Recycling řeší největší problém generování AI videa
Nový příspěvek ICLR 2026 Oral z EPFL představuje error recycling, techniku, která eliminuje časový drift a umožňuje generování víceminutového AI videa bez dodatečných výpočetních nákladů.

Problém Driftu, Který Nikdo Nevyřešil
Pokud jsi kdy zkusil generovat dlouhodobé AI video s jakýmkoli současným modelem, znáš to zklamání. Sora 2 je omezena na 15 až 25 sekund v závislosti na vašem plánu. Runway Gen-4.5 dosahuje maximálně 10 sekund. Kling 3.0 dosahuje 15 sekund. Důvodem není výpočetní výkon ani paměť. Je to časový drift.
Časový drift se vyskytuje, když autoregresivní modely videa akumulují malé chyby snímek po snímku. Každý vygenerovaný snímek se stane vstupem pro následující, a malé nedokonalosti se exponenciálně kombinují. Po několika stovkách snímků výstup ledwie připomíná původní pokyn.
To je zásadně podobné problému "telefonu". Zašepej zprávu skrz dostatek lidí a stane se nepoznatelnou. Předchozí přístupy se pokusily bojovat s driftem generováním kratších klipů a jejich lepením dohromady, ale švy jsou viditelné. Ostatní používali hierarchické generování (nejprve klíčové snímky, pak interpolace), což pomáhá, ale neodstraňuje základní problém.
Přichází Error Recycling
Článek s názvem "Stable Video Infinity" a přijatý jako ústní prezentace ICLR 2026, zavádí klamavě jednoduchou myšlenku: nauči model zvládat své vlastní chyby.
Zde je klíčový vhled. Během trénování se standardní modely difúze videa učí z čistých dat referencí. Nikdy nevidí svůj vlastní generovaný výstup. Po nasazení najednou musí pracovat se svými vlastními nedokonalými předpověďmi jako vstupem a nevědí, jak se vypořádat s šumem.
Error recycling to napravuje modifikací tréninkové smyčky:
Standardní Přední Průchod
Model generuje segment videa z čistých tréninkovacích dat.
Shromažďování Chyb
Vlastní předpovědi modelu (s jejich nedokonalostmi) jsou zachyceny místo vyřazení.
Error Recycling
Tyto nedokonalé výstupy jsou podávány zpět jako vstup pro další tréninkový iteraci, učující model generovat stabilní výstup i z hlučných, vlastních generovaných snímků.
Iterativní Zlepšování
Během mnoha tréninkových cyklů se model učí robustní mechanismus vlastní korekce, který zabraňuje akumulaci chyb.
Krása tohoto přístupu spočívá v jeho eleganci. Nejsou tu žádné nové architektury modelů, žádné dodatečné parametry, žádné triky za běhu. Model se během tréninku prostě učí, jak vypadají reálné podmínky nasazení.
Proč Na Tom Záleží Více, Než Si Myslíš
Důsledky se rozšiřují daleko za generování delších videí s kočkami. Zde je co se mění:
Před Error Recycling
- Modely videa omezeny na 4-20 sekund
- Konzistence scény se rychle zhoršuje
- Identita postavy se vzdaluje po několika sekundách
- Fyzika se stává stále nereálnější
- Barvy a osvětlení se posouvají nepředvídatelně
Po Error Recycling
- Generování koherentního videa dlouhého více minut
- Stabilní vzhled postav v průběhu
- Konzistentní fyzika a prostorové vztahy
- Spolehlivé grádování barev a osvětlení
- Bez viditelného snížení kvality v čase
Čísla
Tým VITA Lab testoval Stable Video Infinity na více architekturách a benchmarcích. Výsledky jsou údajně:
| Metrika | Bez Error Recycling | S Error Recycling | Zlepšení |
|---|---|---|---|
| FVD (nižší je lépe) | Degradace po 4s | Stabilní přes 2min+ | Významné |
| Konzistence Postav | Klesá pod 60% při 15s | Udržuje 90%+ při 2min | ~50% relativně |
| Časová Koherence | Viditelný drift při 8s | Bez viditelného driftu při 2min | Kvalitativní skok |
| Výpočetní Režie | Baseline | Baseline (0% nárůst) | Nulové náklady |
Aspekt nulových výpočetních nákladů je kritický. Error recycling je technika během tréninku, nikoli během běhu. Po natréninku se model spouští přesně stejnou rychlostí a náklady jako předtím.
Jak Error Recycling Funguje Pod Kapotou
Pro ty, kteří chtějí technické detaily, zde je co se děje v modifikovaném tréninkovacím pipeline.
Standardní trénink difúze videa používá časový plán epsilon aplikovaný na čistá referenční data x_0. Model se učí předvídat šum a obnovit původní signál. Během běhu model autoregresivně generuje snímek t+1 podmíněný svou predikcí snímku t.
Mezera mezi tréninkem (čisté vstupy) a během běhu (vlastní generované vstupy) se nazývá exposure bias. Error recycling to přímo řeší.
Technické Detaily: Modifikovaný Tréninkový Cíl▼
Během tréninku model občas generuje snímky pomocí svých současných vah místo použití referenčních dat. Tyto vlastní generované snímky, spolu s jejich nedokonalostmi, jsou pak použity jako podmíňovací vstupy pro následné snímky v tréninkové sekvenci.
Klíčovým hyperparametrem je recycling ratio r, který řídí jak často vlastní generované snímky nahrazují referenční snímky během tréninku. Článek zjišťuje, že r = 0.3 (30% recyklovaných snímků) dosahuje optimálního výkonu, vyvažování zlepšení stability s kvalitou tréninkového signálu.
Modifikovaná funkce ztráty zůstává standardním cílem difúze. Jedinou rozdílem je distribuce dat, kterou model vidí během tréninku. Proto zde nejsou výpočetní náklady během běhu.
To je koncepčně podobné scheduled sampling v modelech sekvenčnísekvence, ale přizpůsobeno pro cilivý rámec difúze. Tým VITA Lab toto připojení v článku uznává, přičemž poznamenává, že naivní aplikace plánovaného vzorkování na modely difúze nefunguje. Jejich příspěvek je konkrétní formulace, která to stabilizuje pro generování videa.
Výhoda Otevřeného Zdroje
Možná nejpodpůrnější aspekt: kód je plně otevřeného zdroje na GitHubu (vita-epfl/Stable-Video-Infinity). To znamená, že jakákoli výzkumná laboratoř nebo společnost mohou aplikovat error recycling na své existující modely videa.
Vydání otevřeného zdroje následuje rostoucí trend v komunitě výzkumu AI videa. Modely jako LTX-2 a Wan 2.6 prokázaly, že přístupy otevřeného zdroje mohou konkurovat proprietárním alternativám.
Co To Znamená pro Průmysl
Načasování je pozoruhodné. Jsme uprostřed závodu AI videa, kde každý hlavní hráč, od Runway po ByteDance, tlačí na delší, vyšší kvalitu výstup. Error recycling by mohl být chybějící kus, který odemyká další generaci schopností.
Pro Filmaře a Tvůrce
Pro Výzkumné Pracovníky
Pro Podnik
Pohled do Budoucnosti
Práce VITA Lab představuje zásadní posun v tom, jak myslíme na generování AI videa. Místo budování stále větších modelů nebo přidávání složitých mechanismů během běhu, řešením bylo jednoduše ukázat modelu, jak vypadají jeho vlastní výstupy.
Článek bude představen na ICLR 2026 a několik průmyslových zdrojů naznačuje, že si hlavní poskytovatelé modelů videa již prohlížejí integraci. Pokud world models představují budoucnost toho, jak AI chápe fyziku a prostor, error recycling představuje budoucnost toho, jak si AI toto chápání udržuje v čase.
Věk 4sekundových AI videí se může skončit dříve, než kdokoliv očekával. A nebude to vyžadovat novou architekturu modelu nebo miliardový rozpočet. Jen chytřejší tréninkovou smyčku.
Další Čtení
- Revoluce Otevřeného Videa AI: Jak otevřené modely zavírají propast s proprietárními systémy
- Simulace Fyziky v AI Videu: Pochopení jak se modely učí fyzickou konzistenci
- Diffusion Transformers: Architektura pohánějící moderní generování videa

Inženýr AI z Lausanne, který propojuje hloubku výzkumu s praktickými inovacemi. Svůj čas dělí mezi architektury modelů a alpské vrcholy.
View profile →Související články
Pokračujte v objevování s těmito souvisejícími příspěvky

AI Video Extender: Prodlužte video v roce 2026
Použijte AI video extender k prodloužení videa v roce 2026. Porovnejte limity prodloužení, zachovejte kontinuitu a vyberte pracovní postup pro generované nebo existující klipy.

Nejlepší bezplatné AI nástroje pro převod textu na video: Průvodce pro rok 2026
Porovnejte nejlepší bezplatné AI nástroje pro převod textu na video v roce 2026, včetně skutečných limitů kreditů, vodoznaků, kompromisů lokálního nastavení a praktického plánu testování.

Možnosti Grok xAI pro převod obrázků na video: průvodce API pro červen 2026
Možnosti Grok xAI pro image-to-video v červnu 2026: jak Grok Imagine pracuje s obrázky, prompty, nativním zvukem, API workflow, bezpečností, logikou cen a srovnáním se Sora/Veo.