EPFL Stable Video Infinity: як переробка помилок вирішує головну проблему AI видео
Нова стаття EPFL для ICLR 2026 (усна презентація) представляє переробку помилок, техніку, яка усуває часовий дрейф та дозволяє генерувати багатохвилинне AI видео без додаткових обчислювальних витрат.

Проблема дрейфу, яку ніхто не вирішив
Якщо ти коли-небудь пробував генерувати довгоформатне AI відео з будь-якою з існуючих моделей, ти знаєш це розчарування. Sora 2 обмежена 15-25 секундами залежно від тарифу. Runway Gen-4.5 максимум на 10 секунд. Kling 3.0 доходить до 15 секунд. Причина не в обчислювальній потужності або пам'яті. Це часовий дрейф.
Часовий дрейф виникає, коли авторегресивні видеомоделі накопичують невеликі помилки кадр за кадром. Кожен згенерований кадр стає входом для наступного, і крихітні недосконалості нарощуються експоненціально. Після кількох сотень кадрів вихід ледве нагадує вихідний запит.
Це в принципі подібно до проблеми "гри в телефон". Передавай повідомлення через достатньо багато людей, і воно стає невпізнаваним. Попередні підходи намагалися боротися з дрейфом, генеруючи коротші кліпи та зклеюючи їх разом, але шви видні. Інші використовували ієрархічну генерацію (спочатку ключові кадри, потім інтерполяція), що допомагає, але не усуває суть проблеми.
Введення переробки помилок
Стаття з назвою "Stable Video Infinity" та прийнята як усна презентація на ICLR 2026 представляє, на перший погляд, просту ідею: навчити модель справлятися з власними помилками.
Ось ключовий момент. Під час навчання стандартні видеомоделі дифузії вчаться на чистих даних ground-truth. Вони ніколи не бачать власного згенерованого виходу. При розгортанні вони раптово мають працювати зі своїми власними недосконалими передбаченнями як входом, і вони не знають, як справитися з шумом.
Переробка помилок вирішує це шляхом модифікації циклу навчання:
Standard Forward Pass
Модель генерує відеосегмент з чистих даних навчання.
Error Collection
Власні передбачення моделі (зі всіма їх недосконалостями) захоплюються замість того, щоб бути відкинутими.
Error Recycling
Ці недосконалі виходи знову подаються як входи для наступної ітерації навчання, навчаючи модель генерувати стабільний вихід навіть з шумних, самогенерованих кадрів.
Iterative Refinement
На протязі багатьох циклів навчання модель вивчає надійний механізм самовиправлення, який запобігає накопленню помилок.
Красота цього підходу полягає в його елегантності. Немає нових архітектур моделей, нема додаткових параметрів, немає трюків на етапі висновків. Модель просто вивчає під час навчання, як виглядають реальні умови розгортання.
Чому це важливіше, ніж ти думаєш
Наслідки виходять далеко за межі генерації більш довгих відеороликів про котиків. Ось що змінюється:
До переробки помилок
- Видеомоделі обмежені 4-20 секундами
- Узгодженість сцени швидко деградує
- Ідентичність персонажа дрейфує через кілька секунд
- Фізика стає все більш нереалістичною
- Колір та освітлення змішуються непередбачувано
Після переробки помилок
- Генерація багатохвилинного узгодженого відео
- Стабільний зовнішній вигляд персонажа на протяг всього відео
- Послідовна фізика та просторові відносини
- Надійна колірна корекція та освітлення
- Немає видимої деградації якості з часом
Цифри
Команда VITA Lab протестувала Stable Video Infinity на різних архітектурах та тестових наборах. Результати вражаючі:
| Метрика | Без переробки помилок | З переробкою помилок | Покращення |
|---|---|---|---|
| FVD (нижче краще) | Деградує після 4s | Стабільна через 2min+ | Значне |
| Узгодженість персонажа | Падає нижче 60% на 15s | Утримує 90%+ на 2min | ~50% відносне |
| Часова узгодженість | Видимий дрейф на 8s | Немає видимого дрейфу на 2min | Якісний стрибок |
| Compute Overhead | Baseline | Baseline (0% приросту) | Нульові витрати |
Аспект нульових обчислювальних витрат критичний. Переробка помилок це техніка часу навчання, а не висновків. Після навчання модель працює з точно такою ж швидкістю та вартістю, як раніше.
Як переробка помилок працює під капотом
Для тих, хто хоче технічні деталі, ось що відбувається в модифікованому конвейері навчання.
Стандартне навчання відеодифузії використовує графік шуму epsilon, застосований до чистих кадрів ground-truth x_0. Модель вчиться передбачати шум та відновлювати вихідний сигнал. На етапі висновків модель авторегресивно генерує кадр t+1, обумовлений своїм передбаченням кадру t.
Розрив між навчанням (чисті входи) та висновками (самогенеровані входи) називається упередженням експозиції. Переробка помилок прямо це вирішує.
Technical Details: Modified Training Objective▼
Під час навчання модель періодично генерує кадри, використовуючи власні поточні ваги, а не використовуючи дані ground-truth. Ці самогенеровані кадри, зі всіма їх недосконалостями, потім використовуються як входи обумовлення для наступних кадрів у послідовності навчання.
Ключовий гіперпараметр це коефіцієнт переробки r, який контролює, як часто самогенеровані кадри замінюють кадри ground-truth під час навчання. Стаття обнаруживає, що r = 0.3 (30% переробленого кадру) досягає оптимальної продуктивності, балансуючи покращення стабільності з якістю сигналу навчання.
Модифікована функція втрат залишається стандартною метою дифузії. Єдина різниця це розподіл даних, які видит модель під час навчання. Ось чому немає обчислювальних витрат на етапі висновків.
Це концептуально подібно до scheduled sampling у моделях послідовність-до-послідовності, але адаптовано для неперервної структури дифузії. Команда VITA Lab відзначає цей зв'язок у своїй статті, одночасно зазначаючи, що наївне застосування scheduled sampling до моделей дифузії не працює. Їх внесок це специфічна формулювання, яка робить її стабільною для генерації відео.
Перевага з відкритим вихідним кодом
Можливо, найбільш хвилюючий аспект: код повністю з відкритим вихідним кодом на GitHub (vita-epfl/Stable-Video-Infinity). Це означає, що будь-яка дослідна лабораторія або компанія може застосувати переробку помилок до своїх існуючих видеомоделей.
Випуск з відкритим вихідним кодом слідує зростаючій тенденції в спільноті дослідників AI відео. Моделі як LTX-2 та Wan 2.6 показали, що підходи з відкритим вихідним кодом можуть конкурувати з проприєтарними альтернативами.
Що це означає для індустрії
Час примітний. Ми знаходимося в середині гонки AI відео, де кожен головний гравець, від Runway до ByteDance, намагається отримати довший, вищої якості вихід. Переробка помилок може бути відсутньою деталлю, яка розблокує наступне покоління можливостей.
Для кінематографістів та творців
Для дослідників
Для підприємства
Дивлячись вперед
Робота VITA Lab представляє фундаментальний зсув у тому, як ми думаємо про генерацію AI відео. Замість побудови все більших моделей або додавання складних механізмів часу висновків, рішення було просто показати моделі, як виглядає її власний вихід.
Стаття буде представлена на ICLR 2026, і кілька джерел індустрії припускають, що великі постачальники видеомоделей уже досліджують інтеграцію. Якщо world models представляють майбутнє того, як AI розуміє фізику та простір, переробка помилок представляє майбутнє того, як AI підтримує це розуміння з часом.
Епоха 4-секундних AI відео може закінчитися раніше, ніж будь-хто очікував. І це не потребуватиме нової архітектури моделі чи мільярдного бюджету обчислень. Просто розумніший цикл навчання.
Додаткове читання
- Революція AI видео з відкритим вихідним кодом: Як відкриті моделі закривають розрив із проприєтарними системами
- Моделювання фізики в AI відео: Розуміння того, як моделі вивчають фізичну узгодженість
- Diffusion Transformers: Архітектура, яка живить сучасну генерацію відео

Інженер ШІ з Лозанни, який поєднує глибокі дослідження з практичними інноваціями. Ділить свій час між архітектурами моделей та альпійськими вершинами.
View profile →Схожі статті
Продовжуйте дослідження з цими схожими публікаціями

SkyReels V4: перша ШІ-модель, яка одночасно бачить і чує
SkyReels V4 від Skywork AI представляє двопотокову дифузійну архітектуру, що спільно генерує відео та синхронний звук за один прохід. Ось що це означає для авторів.

AI-відео після Sora: 4 ринкові рівні, які варто знати у 2026
Sora закривається 26 квітня. Ринок AI-відео консолідувався в чотири рівні. Практичний посібник з вибору правильної альтернативи Sora для ваших потреб.

Google Veo 3.1 став безкоштовним: 10 AI-відео на місяць для кожного акаунту Google
Google відкрив Veo 3.1 для всіх особистих акаунтів з 10 безкоштовними генераціями відео щомісяця. Ось що ви отримуєте, які обмеження і чому це важливо для творців AI-відео.