Meta PixelПерейти до основного вмісту
AlexisAlexis· Автор ШІ, перевірено людиною
7 min read
1255 слів

EPFL Stable Video Infinity: як переробка помилок вирішує головну проблему AI видео

Нова стаття EPFL для ICLR 2026 (усна презентація) представляє переробку помилок, техніку, яка усуває часовий дрейф та дозволяє генерувати багатохвилинне AI видео без додаткових обчислювальних витрат.

EPFL Stable Video Infinity: як переробка помилок вирішує головну проблему AI видео

Готові створювати власні ШІ-відео?

Приєднуйтеся до тисяч творців, які використовують Bonega.ai

Кожна модель AI відео зберігає одну й ту ж забудливу таємницю. Генеруй 4-секундний кліп і результати виглядають приголомшливо. Переходь за 15 секунд, і персонажі починають деформуватися, фізика розламується, кольори зміщуються, вся сцена дрейфує в безлад. VITA Lab в EPFL щойно опублікував рішення, і це може бути найважливіша стаття в галузі генерації відео цього року.

Проблема дрейфу, яку ніхто не вирішив

Якщо ти коли-небудь пробував генерувати довгоформатне AI відео з будь-якою з існуючих моделей, ти знаєш це розчарування. Sora 2 обмежена 15-25 секундами залежно від тарифу. Runway Gen-4.5 максимум на 10 секунд. Kling 3.0 доходить до 15 секунд. Причина не в обчислювальній потужності або пам'яті. Це часовий дрейф.

💡

Часовий дрейф виникає, коли авторегресивні видеомоделі накопичують невеликі помилки кадр за кадром. Кожен згенерований кадр стає входом для наступного, і крихітні недосконалості нарощуються експоненціально. Після кількох сотень кадрів вихід ледве нагадує вихідний запит.

Це в принципі подібно до проблеми "гри в телефон". Передавай повідомлення через достатньо багато людей, і воно стає невпізнаваним. Попередні підходи намагалися боротися з дрейфом, генеруючи коротші кліпи та зклеюючи їх разом, але шви видні. Інші використовували ієрархічну генерацію (спочатку ключові кадри, потім інтерполяція), що допомагає, але не усуває суть проблеми.

Введення переробки помилок

Стаття з назвою "Stable Video Infinity" та прийнята як усна презентація на ICLR 2026 представляє, на перший погляд, просту ідею: навчити модель справлятися з власними помилками.

Oral
ICLR 2026 Status
0
Extra Compute Cost
Minutes
Video Length

Ось ключовий момент. Під час навчання стандартні видеомоделі дифузії вчаться на чистих даних ground-truth. Вони ніколи не бачать власного згенерованого виходу. При розгортанні вони раптово мають працювати зі своїми власними недосконалими передбаченнями як входом, і вони не знають, як справитися з шумом.

Переробка помилок вирішує це шляхом модифікації циклу навчання:

Step 1

Standard Forward Pass

Модель генерує відеосегмент з чистих даних навчання.

Step 2

Error Collection

Власні передбачення моделі (зі всіма їх недосконалостями) захоплюються замість того, щоб бути відкинутими.

Step 3

Error Recycling

Ці недосконалі виходи знову подаються як входи для наступної ітерації навчання, навчаючи модель генерувати стабільний вихід навіть з шумних, самогенерованих кадрів.

Step 4

Iterative Refinement

На протязі багатьох циклів навчання модель вивчає надійний механізм самовиправлення, який запобігає накопленню помилок.

Красота цього підходу полягає в його елегантності. Немає нових архітектур моделей, нема додаткових параметрів, немає трюків на етапі висновків. Модель просто вивчає під час навчання, як виглядають реальні умови розгортання.

Чому це важливіше, ніж ти думаєш

Наслідки виходять далеко за межі генерації більш довгих відеороликів про котиків. Ось що змінюється:

До переробки помилок

  • Видеомоделі обмежені 4-20 секундами
  • Узгодженість сцени швидко деградує
  • Ідентичність персонажа дрейфує через кілька секунд
  • Фізика стає все більш нереалістичною
  • Колір та освітлення змішуються непередбачувано

Після переробки помилок

  • Генерація багатохвилинного узгодженого відео
  • Стабільний зовнішній вигляд персонажа на протяг всього відео
  • Послідовна фізика та просторові відносини
  • Надійна колірна корекція та освітлення
  • Немає видимої деградації якості з часом

Цифри

Команда VITA Lab протестувала Stable Video Infinity на різних архітектурах та тестових наборах. Результати вражаючі:

МетрикаБез переробки помилокЗ переробкою помилокПокращення
FVD (нижче краще)Деградує після 4sСтабільна через 2min+Значне
Узгодженість персонажаПадає нижче 60% на 15sУтримує 90%+ на 2min~50% відносне
Часова узгодженістьВидимий дрейф на 8sНемає видимого дрейфу на 2minЯкісний стрибок
Compute OverheadBaselineBaseline (0% приросту)Нульові витрати
💡

Аспект нульових обчислювальних витрат критичний. Переробка помилок це техніка часу навчання, а не висновків. Після навчання модель працює з точно такою ж швидкістю та вартістю, як раніше.

Як переробка помилок працює під капотом

Для тих, хто хоче технічні деталі, ось що відбувається в модифікованому конвейері навчання.

Стандартне навчання відеодифузії використовує графік шуму epsilon, застосований до чистих кадрів ground-truth x_0. Модель вчиться передбачати шум та відновлювати вихідний сигнал. На етапі висновків модель авторегресивно генерує кадр t+1, обумовлений своїм передбаченням кадру t.

Розрив між навчанням (чисті входи) та висновками (самогенеровані входи) називається упередженням експозиції. Переробка помилок прямо це вирішує.

Technical Details: Modified Training Objective

Під час навчання модель періодично генерує кадри, використовуючи власні поточні ваги, а не використовуючи дані ground-truth. Ці самогенеровані кадри, зі всіма їх недосконалостями, потім використовуються як входи обумовлення для наступних кадрів у послідовності навчання.

Ключовий гіперпараметр це коефіцієнт переробки r, який контролює, як часто самогенеровані кадри замінюють кадри ground-truth під час навчання. Стаття обнаруживає, що r = 0.3 (30% переробленого кадру) досягає оптимальної продуктивності, балансуючи покращення стабільності з якістю сигналу навчання.

Модифікована функція втрат залишається стандартною метою дифузії. Єдина різниця це розподіл даних, які видит модель під час навчання. Ось чому немає обчислювальних витрат на етапі висновків.

Це концептуально подібно до scheduled sampling у моделях послідовність-до-послідовності, але адаптовано для неперервної структури дифузії. Команда VITA Lab відзначає цей зв'язок у своїй статті, одночасно зазначаючи, що наївне застосування scheduled sampling до моделей дифузії не працює. Їх внесок це специфічна формулювання, яка робить її стабільною для генерації відео.

Перевага з відкритим вихідним кодом

Можливо, найбільш хвилюючий аспект: код повністю з відкритим вихідним кодом на GitHub (vita-epfl/Stable-Video-Infinity). Це означає, що будь-яка дослідна лабораторія або компанія може застосувати переробку помилок до своїх існуючих видеомоделей.

Чому відкритий вихідний код важливий
Будь-яка існуюча видеомодель дифузії може бути переробка з переробкою помилок. Не потрібні зміни архітектури, просто модифікований цикл навчання. Це могло б покращити Sora, Runway, Kling та кожну модель з відкритим вихідним кодом одночасно.
Практичні обмеження
Потребує переучування або fine-tuning моделі. Компанії з проприєтарними моделями повинні інвестувати обчислення в переучування. Ефективність техніки може варіюватися залежно від різних архітектур та масштабів.

Випуск з відкритим вихідним кодом слідує зростаючій тенденції в спільноті дослідників AI відео. Моделі як LTX-2 та Wan 2.6 показали, що підходи з відкритим вихідним кодом можуть конкурувати з проприєтарними альтернативами.

Що це означає для індустрії

Час примітний. Ми знаходимося в середині гонки AI відео, де кожен головний гравець, від Runway до ByteDance, намагається отримати довший, вищої якості вихід. Переробка помилок може бути відсутньою деталлю, яка розблокує наступне покоління можливостей.

🎬

Для кінематографістів та творців

Довгоформатна узгоджена генерація відео дозволяє створювати реальний наративний контент. Не просто кліпи, а сцени, послідовності та, врешті-решт, короткометражні фільми, згенеровані з одного запиту.
🔬

Для дослідників

Переробка помилок забезпечує узагальнювану структуру. Той же принцип можна застосувати до генерації звуку, синтезу 3D сцен та будь-якої авторегресивної генеративної моделі, яка страждає від дрейфу.
🏢

Для підприємства

Стабільна довгоформатна генерація робить AI відео життєздатним для професійних випадків використання: демонстрування продуктів, навчальні відео, маркетингові кампанії, які вимагають послідовної якості протягом хвилин контенту.

Дивлячись вперед

Робота VITA Lab представляє фундаментальний зсув у тому, як ми думаємо про генерацію AI відео. Замість побудови все більших моделей або додавання складних механізмів часу висновків, рішення було просто показати моделі, як виглядає її власний вихід.

Стаття буде представлена на ICLR 2026, і кілька джерел індустрії припускають, що великі постачальники видеомоделей уже досліджують інтеграцію. Якщо world models представляють майбутнє того, як AI розуміє фізику та простір, переробка помилок представляє майбутнє того, як AI підтримує це розуміння з часом.

Епоха 4-секундних AI відео може закінчитися раніше, ніж будь-хто очікував. І це не потребуватиме нової архітектури моделі чи мільярдного бюджету обчислень. Просто розумніший цикл навчання.

Додаткове читання

Alexis
AlexisAI EngineerAI Author

Інженер ШІ з Лозанни, який поєднує глибокі дослідження з практичними інноваціями. Ділить свій час між архітектурами моделей та альпійськими вершинами.

View profile →

Сподобалося прочитане?

Перетворюйте свої ідеї на ШІ-відео необмеженої тривалості за лічені хвилини.

Схожі статті

Продовжуйте дослідження з цими схожими публікаціями

Вам сподобалася ця стаття?

Відкривайте більше корисного та стежте за нашим найновішим контентом.