EPFL Stable Video Infinity: как переработка ошибок решает главную проблему AI видео
Новая статья EPFL для ICLR 2026 (устное представление) представляет переработку ошибок, технику, которая устраняет временной дрейф и позволяет генерировать многоминутное AI видео без дополнительных вычислительных затрат.

Проблема дрейфа, которую никто не решил
Если ты когда-либо пробовал генерировать долгоформатное AI видео с любой из существующих моделей, ты знаешь это разочарование. Sora 2 ограничена 15-25 секундами в зависимости от тарифа. Runway Gen-4.5 максимум на 10 секунд. Kling 3.0 доходит до 15 секунд. Причина не в вычислительной мощности или памяти. Это временной дрейф.
Временной дрейф возникает, когда авторегрессивные видеомодели накапливают небольшие ошибки кадр за кадром. Каждый сгенерированный кадр становится входом для следующего, и крошечные несовершенства нарастают экспоненциально. После нескольких сотен кадров выход едва ли напоминает исходный запрос.
Это в принципе похоже на проблему "телефонной игры". Передавай сообщение через достаточно много людей, и оно становится неузнаваемым. Предыдущие подходы пытались бороться с дрейфом, генерируя более короткие клипы и склеивая их вместе, но швы видны. Другие использовали иерархическую генерацию (сначала ключевые кадры, потом интерполяция), что помогает, но не устраняет суть проблемы.
Вводится переработка ошибок
Статья с названием "Stable Video Infinity" и принятая как устное представление на ICLR 2026 представляет на первый взгляд простую идею: научить модель справляться со своими собственными ошибками.
Вот ключевой момент. Во время обучения, стандартные видеомодели диффузии учатся на чистых данных ground-truth. Они никогда не видят свой собственный сгенерированный выход. При развертывании они внезапно должны работать со своими собственными несовершенными предсказаниями как входом, и они не знают, как справиться с шумом.
Переработка ошибок решает это путем изменения цикла обучения:
Standard Forward Pass
Модель генерирует видеосегмент из чистых данных обучения.
Error Collection
Собственные предсказания модели (со всеми их несовершенствами) захватываются вместо того, чтобы быть отброшенными.
Error Recycling
Эти несовершенные выходы снова подаются как входы для следующей итерации обучения, обучая модель генерировать стабильный выход даже из шумных, самогенерируемых кадров.
Iterative Refinement
На протяжении многих циклов обучения модель изучает надежный механизм самокоррекции, который предотвращает накопление ошибок.
Красота этого подхода в его элегантности. Нет новых архитектур моделей, нет дополнительных параметров, нет трюков на этапе вывода. Модель просто изучает во время обучения, как выглядят реальные условия развертывания.
Почему это важнее, чем ты думаешь
Последствия выходят далеко за пределы генерации более длинных видео про кошек. Вот что меняется:
До переработки ошибок
- Видеомодели ограничены 4-20 секундами
- Согласованность сцены быстро деградирует
- Идентичность персонажа дрейфует через несколько секунд
- Физика становится все более нереалистичной
- Цвет и освещение смещаются непредсказуемо
После переработки ошибок
- Генерация многоминутного согласованного видео
- Стабильный внешний вид персонажа на протяжении всего видео
- Последовательная физика и пространственные отношения
- Надежная коррекция цвета и освещение
- Нет видимой деградации качества с течением времени
Цифры
Команда VITA Lab тестировала Stable Video Infinity на различных архитектурах и бенчмарках. Результаты впечатляющие:
| Метрика | Без переработки ошибок | С переработкой ошибок | Улучшение |
|---|---|---|---|
| FVD (ниже лучше) | Деградирует после 4s | Стабильна через 2min+ | Значительное |
| Consistency персонажа | Падает ниже 60% на 15s | Держит 90%+ на 2min | ~50% относительное |
| Temporal Coherence | Видимый дрейф на 8s | Нет видимого дрейфа на 2min | Качественный скачок |
| Compute Overhead | Baseline | Baseline (0% прироста) | Нулевые затраты |
Аспект нулевых вычислительных затрат критичен. Переработка ошибок - это техника времени обучения, а не вывода. После обучения модель работает с точно такой же скоростью и стоимостью, как раньше.
Как переработка ошибок работает под капотом
Для тех, кто хочет технических деталей, вот что происходит в модифицированном конвейере обучения.
Стандартное обучение видеодиффузии использует график шума epsilon, применяемый к чистым кадрам ground-truth x_0. Модель учится предсказывать шум и восстанавливать исходный сигнал. На этапе вывода модель авторегрессивно генерирует кадр t+1 обусловленный своим предсказанием кадра t.
Разрыв между обучением (чистые входы) и выводом (самогенерируемые входы) называется смещением воздействия. Переработка ошибок непосредственно это решает.
Technical Details: Modified Training Objective▼
Во время обучения, модель периодически генерирует кадры, используя собственные текущие веса, а не используя данные ground-truth. Эти самогенерируемые кадры, со всеми их несовершенствами, затем используются как входы обусловливания для последующих кадров в последовательности обучения.
Ключевой гиперпараметр - это коэффициент переработки r, который контролирует, как часто самогенерируемые кадры заменяют кадры ground-truth во время обучения. Статья обнаруживает, что r = 0.3 (30% переработанных кадров) достигает оптимальной производительности, уравновешивая улучшение стабильности с качеством сигнала обучения.
Модифицированная функция потерь остается стандартной целью диффузии. Единственное отличие - это распределение данных, которые видит модель во время обучения. Вот почему нет вычислительных затрат на этапе вывода.
Это концептуально похоже на scheduled sampling в моделях sequence-to-sequence, но адаптировано для непрерывной структуры диффузии. Команда VITA Lab отмечает эту связь в их статье, одновременно отмечая, что наивное применение scheduled sampling к моделям диффузии не работает. Их вклад - это специфическая формулировка, которая делает ее стабильной для генерации видео.
Преимущество open-source
Возможно, наиболее волнующий аспект: код полностью open-source на GitHub (vita-epfl/Stable-Video-Infinity). Это означает, что любая исследовательская лаборатория или компания может применить переработку ошибок к своим существующим видеомоделям.
Выпуск open-source следует растущему тренду в сообществе исследователей AI видео. Модели как LTX-2 и Wan 2.6 показали, что подходы с открытым исходным кодом могут конкурировать с проприетарными альтернативами.
Что это означает для индустрии
Время примечательно. Мы находимся в середине гонки AI видео, где каждый главный игрок, от Runway до ByteDance, пытается получить более длинный, выше качество выход. Переработка ошибок может быть недостающим куском, который разблокирует следующее поколение возможностей.
Для кинематографистов и создателей
Для исследователей
Для предприятия
Смотря вперед
Работа VITA Lab представляет фундаментальный сдвиг в том, как мы думаем о генерации AI видео. Вместо построения когда-либо больших моделей или добавления сложных механизмов времени вывода, решение было просто показать модели, как выглядит ее собственный выход.
Статья будет представлена на ICLR 2026, и несколько источников индустрии предполагают, что крупные поставщики видеомоделей уже исследуют интеграцию. Если world models представляют будущее того, как AI понимает физику и пространство, переработка ошибок представляет будущее того, как AI поддерживает это понимание со временем.
Эпоха 4-секундных AI видео может заканчиваться раньше, чем кто-либо ожидал. И это не потребует новой архитектуры модели или миллиардного бюджета вычислений. Просто более умный цикл обучения.
Дополнительное чтение
- Революция AI видео с открытым исходным кодом: Как открытые модели закрывают разрыв с проприетарными системами
- Симуляция физики в AI видео: Понимание того, как модели учат физическую согласованность
- Diffusion Transformers: Архитектура, питающая современную генерацию видео

Инженер ИИ из Лозанны, сочетающий глубину исследований с практическими инновациями. Делит время между архитектурами моделей и альпийскими вершинами.
View profile →Похожие статьи
Продолжите знакомство с этими похожими публикациями

Цены на AI Video Tools в 2026 году: как планировать бюджет, не сжигая кредиты
AI video tools больше не трудно найти. Сложнее выбрать правильную модель ценообразования для вашего рабочего процесса. Вот практическое руководство по бюджету для авторов и команд.

SkyReels V4: первая ИИ-модель, которая видит и слышит одновременно
SkyReels V4 от Skywork AI представляет двухпотоковую диффузионную архитектуру, которая совместно генерирует видео и синхронный звук за один проход. Вот что это значит для авторов.

AI-видео после Sora: 4 уровня рынка в 2026 году
Sora закрывается 26 апреля. Рынок AI-видео консолидировался в четыре уровня. Практическое руководство по выбору подходящей альтернативы Sora.