Meta PixelПерейти к основному содержимому
AlexisAlexis· Автор ИИ, проверено человеком
7 min read
1258 слов

EPFL Stable Video Infinity: как переработка ошибок решает главную проблему AI видео

Новая статья EPFL для ICLR 2026 (устное представление) представляет переработку ошибок, технику, которая устраняет временной дрейф и позволяет генерировать многоминутное AI видео без дополнительных вычислительных затрат.

EPFL Stable Video Infinity: как переработка ошибок решает главную проблему AI видео

Готовы создавать собственные видео с ИИ?

Присоединяйтесь к тысячам авторов, использующих Bonega.ai

Каждая модель AI видео хранит одну и ту же грязную тайну. Генерируй 4-секундный клип, и результаты выглядят потрясающе. Переходи за 15 секунд, и персонажи начинают деформироваться, физика ломается, цвета смещаются, вся сцена дрейфует в неразбериху. VITA Lab в EPFL только что опубликовал решение, и это может быть самая важная статья в области генерации видео в этом году.

Проблема дрейфа, которую никто не решил

Если ты когда-либо пробовал генерировать долгоформатное AI видео с любой из существующих моделей, ты знаешь это разочарование. Sora 2 ограничена 15-25 секундами в зависимости от тарифа. Runway Gen-4.5 максимум на 10 секунд. Kling 3.0 доходит до 15 секунд. Причина не в вычислительной мощности или памяти. Это временной дрейф.

💡

Временной дрейф возникает, когда авторегрессивные видеомодели накапливают небольшие ошибки кадр за кадром. Каждый сгенерированный кадр становится входом для следующего, и крошечные несовершенства нарастают экспоненциально. После нескольких сотен кадров выход едва ли напоминает исходный запрос.

Это в принципе похоже на проблему "телефонной игры". Передавай сообщение через достаточно много людей, и оно становится неузнаваемым. Предыдущие подходы пытались бороться с дрейфом, генерируя более короткие клипы и склеивая их вместе, но швы видны. Другие использовали иерархическую генерацию (сначала ключевые кадры, потом интерполяция), что помогает, но не устраняет суть проблемы.

Вводится переработка ошибок

Статья с названием "Stable Video Infinity" и принятая как устное представление на ICLR 2026 представляет на первый взгляд простую идею: научить модель справляться со своими собственными ошибками.

Oral
ICLR 2026 Status
0
Extra Compute Cost
Minutes
Video Length

Вот ключевой момент. Во время обучения, стандартные видеомодели диффузии учатся на чистых данных ground-truth. Они никогда не видят свой собственный сгенерированный выход. При развертывании они внезапно должны работать со своими собственными несовершенными предсказаниями как входом, и они не знают, как справиться с шумом.

Переработка ошибок решает это путем изменения цикла обучения:

Step 1

Standard Forward Pass

Модель генерирует видеосегмент из чистых данных обучения.

Step 2

Error Collection

Собственные предсказания модели (со всеми их несовершенствами) захватываются вместо того, чтобы быть отброшенными.

Step 3

Error Recycling

Эти несовершенные выходы снова подаются как входы для следующей итерации обучения, обучая модель генерировать стабильный выход даже из шумных, самогенерируемых кадров.

Step 4

Iterative Refinement

На протяжении многих циклов обучения модель изучает надежный механизм самокоррекции, который предотвращает накопление ошибок.

Красота этого подхода в его элегантности. Нет новых архитектур моделей, нет дополнительных параметров, нет трюков на этапе вывода. Модель просто изучает во время обучения, как выглядят реальные условия развертывания.

Почему это важнее, чем ты думаешь

Последствия выходят далеко за пределы генерации более длинных видео про кошек. Вот что меняется:

До переработки ошибок

  • Видеомодели ограничены 4-20 секундами
  • Согласованность сцены быстро деградирует
  • Идентичность персонажа дрейфует через несколько секунд
  • Физика становится все более нереалистичной
  • Цвет и освещение смещаются непредсказуемо

После переработки ошибок

  • Генерация многоминутного согласованного видео
  • Стабильный внешний вид персонажа на протяжении всего видео
  • Последовательная физика и пространственные отношения
  • Надежная коррекция цвета и освещение
  • Нет видимой деградации качества с течением времени

Цифры

Команда VITA Lab тестировала Stable Video Infinity на различных архитектурах и бенчмарках. Результаты впечатляющие:

МетрикаБез переработки ошибокС переработкой ошибокУлучшение
FVD (ниже лучше)Деградирует после 4sСтабильна через 2min+Значительное
Consistency персонажаПадает ниже 60% на 15sДержит 90%+ на 2min~50% относительное
Temporal CoherenceВидимый дрейф на 8sНет видимого дрейфа на 2minКачественный скачок
Compute OverheadBaselineBaseline (0% прироста)Нулевые затраты
💡

Аспект нулевых вычислительных затрат критичен. Переработка ошибок - это техника времени обучения, а не вывода. После обучения модель работает с точно такой же скоростью и стоимостью, как раньше.

Как переработка ошибок работает под капотом

Для тех, кто хочет технических деталей, вот что происходит в модифицированном конвейере обучения.

Стандартное обучение видеодиффузии использует график шума epsilon, применяемый к чистым кадрам ground-truth x_0. Модель учится предсказывать шум и восстанавливать исходный сигнал. На этапе вывода модель авторегрессивно генерирует кадр t+1 обусловленный своим предсказанием кадра t.

Разрыв между обучением (чистые входы) и выводом (самогенерируемые входы) называется смещением воздействия. Переработка ошибок непосредственно это решает.

Technical Details: Modified Training Objective

Во время обучения, модель периодически генерирует кадры, используя собственные текущие веса, а не используя данные ground-truth. Эти самогенерируемые кадры, со всеми их несовершенствами, затем используются как входы обусловливания для последующих кадров в последовательности обучения.

Ключевой гиперпараметр - это коэффициент переработки r, который контролирует, как часто самогенерируемые кадры заменяют кадры ground-truth во время обучения. Статья обнаруживает, что r = 0.3 (30% переработанных кадров) достигает оптимальной производительности, уравновешивая улучшение стабильности с качеством сигнала обучения.

Модифицированная функция потерь остается стандартной целью диффузии. Единственное отличие - это распределение данных, которые видит модель во время обучения. Вот почему нет вычислительных затрат на этапе вывода.

Это концептуально похоже на scheduled sampling в моделях sequence-to-sequence, но адаптировано для непрерывной структуры диффузии. Команда VITA Lab отмечает эту связь в их статье, одновременно отмечая, что наивное применение scheduled sampling к моделям диффузии не работает. Их вклад - это специфическая формулировка, которая делает ее стабильной для генерации видео.

Преимущество open-source

Возможно, наиболее волнующий аспект: код полностью open-source на GitHub (vita-epfl/Stable-Video-Infinity). Это означает, что любая исследовательская лаборатория или компания может применить переработку ошибок к своим существующим видеомоделям.

Почему Open-Source важен
Любая существующая видеомодель диффузии может быть переработана с переработкой ошибок. Не нужны изменения архитектуры, просто модифицированный цикл обучения. Это могло бы улучшить Sora, Runway, Kling и каждую модель с открытым исходным кодом одновременно.
Практические ограничения
Требует переобучения или fine-tuning модели. Компании с проприетарными моделями должны инвестировать вычисления в переобучение. Эффективность техники может варьироваться между различными архитектурами и масштабами.

Выпуск open-source следует растущему тренду в сообществе исследователей AI видео. Модели как LTX-2 и Wan 2.6 показали, что подходы с открытым исходным кодом могут конкурировать с проприетарными альтернативами.

Что это означает для индустрии

Время примечательно. Мы находимся в середине гонки AI видео, где каждый главный игрок, от Runway до ByteDance, пытается получить более длинный, выше качество выход. Переработка ошибок может быть недостающим куском, который разблокирует следующее поколение возможностей.

🎬

Для кинематографистов и создателей

Долгоформатная согласованная генерация видео позволяет создавать реальный нарративный контент. Не просто клипы, но сцены, последовательности и в конечном итоге короткометражные фильмы, сгенерированные из одного запроса.
🔬

Для исследователей

Переработка ошибок предоставляет обобщаемую структуру. Тот же принцип может быть применен к генерации звука, синтезу 3D сцен и любой авторегрессивной генеративной модели, которая страдает от дрейфа.
🏢

Для предприятия

Стабильная долгоформатная генерация делает AI видео жизнеспособным для профессиональных случаев использования: демонстрации продуктов, обучающие видео, маркетинговые кампании, которые требуют последовательного качества на протяжении минут контента.

Смотря вперед

Работа VITA Lab представляет фундаментальный сдвиг в том, как мы думаем о генерации AI видео. Вместо построения когда-либо больших моделей или добавления сложных механизмов времени вывода, решение было просто показать модели, как выглядит ее собственный выход.

Статья будет представлена на ICLR 2026, и несколько источников индустрии предполагают, что крупные поставщики видеомоделей уже исследуют интеграцию. Если world models представляют будущее того, как AI понимает физику и пространство, переработка ошибок представляет будущее того, как AI поддерживает это понимание со временем.

Эпоха 4-секундных AI видео может заканчиваться раньше, чем кто-либо ожидал. И это не потребует новой архитектуры модели или миллиардного бюджета вычислений. Просто более умный цикл обучения.

Дополнительное чтение

Alexis
AlexisAI EngineerAI Author

Инженер ИИ из Лозанны, сочетающий глубину исследований с практическими инновациями. Делит время между архитектурами моделей и альпийскими вершинами.

View profile →

Понравилось прочитанное?

Превращайте свои идеи в ИИ-видео неограниченной длины за считанные минуты.

Похожие статьи

Продолжите знакомство с этими похожими публикациями

Понравилась эта статья?

Откройте для себя больше полезных идей и следите за нашими последними материалами.