Meta PixelПремини към основното съдържание
AlexisAlexis· Автор ИИ, прегледано от човек
7 min read
1401 думи

EPFL Stable Video Infinity: как преработката на грешки решава главния проблем на AI видео

Нова статия от EPFL за ICLR 2026 (устна презентация) представя преработката на грешки, техника, която елиминира временния дрейф и дава възможност за генериране на многоминутно AI видео без допълнителни изчислителни разходи.

EPFL Stable Video Infinity: как преработката на грешки решава главния проблем на AI видео

Готови ли сте да създавате собствени ИИ видеа?

Присъединете се към хиляди създатели, които използват Bonega.ai

Всеки AI видео модел пази една и съща мръсна тайна. Генерирай 4-секунден клип и резултатите изглеждат спектакулярно. Прилепи отвъд 15 секунди и персонажите начало деформират се, физиката се нарушава, цветовете се изместват, и цялата сцена дрейфува в хаос. VITA Lab в EPFL щеш що публикува решение, и това може да е най-важната статия в видео генерирането тази година.

Проблемът на дрейфа, който никой не реши

Ако си опитал да генерираш дълго видео с някой от съществуващите модели, знаеш това разочарование. Sora 2 е ограничена до 15-25 секунди в зависимост от плана. Runway Gen-4.5 максимум 10 секунди. Kling 3.0 стига до 15 секунди. Причината не е в изчислителната мощ или паметта. Това е временен дрейф.

💡

Временният дрейф се появява, когато авторегресивните видео модели натрупват малки грешки кадър по кадър. Всеки генериран кадър става вход за следващия, и малките несъвършенства се натрупват експоненциално. След няколко сто кадра резултатът едва ли напомня оригиналния запит.

Това е по принцип подобно на проблема на "телефонната игра". Предай съобщение през достатъчно много хора и то се превръща в неузнаваемо. Предишните подходи се опитаха да се справят с дрейфа, като генерираха по-къси клипове и ги залепяха, но швовете са видими. Други използваха йерархично генериране (първо ключови кадри, потом интерполация), което помага, но не елиминира основния проблем.

Въвеждането на преработката на грешки

Статията озаглавена "Stable Video Infinity" и приета като устна презентация за ICLR 2026 представя, на пръв поглед, проста идея: научи модела да се справя със своите грешки.

Oral
ICLR 2026 Status
0
Extra Compute Cost
Minutes
Video Length

Ето ключовата идея. По време на обучението стандартните видео модели дифузия се обучават на чисти ground-truth данни. Те никога не виждат своя собствен генериран резултат. При разгръщане те внезапно трябва да работят със своите собствени несъвършени предвиждания като вход, и не знаят как да се справят с шума.

Преработката на грешки решава това чрез модифициране на цикъла на обучението:

Step 1

Standard Forward Pass

Моделът генерира видео сегмент от чисти обучителни данни.

Step 2

Error Collection

Собствените предвиждания на модела (със всички техни несъвършенства) се улавят вместо да се отхвърлят.

Step 3

Error Recycling

Тези несъвършени резултати се подават обратно като входове за следващата итерация на обучението, обучавайки модела да генерира стабилен резултат дори от шумни, самогенерирани кадри.

Step 4

Iterative Refinement

През много цикли на обучението моделът научава надежден механизъм за самокоригиране, който предотвратява натрупването на грешки.

Красотата на този подход е неговата елегантност. Няма нови архитектури на модели, няма допълнителни параметри, няма трикове по време на разпознаване. Моделът просто учи по време на обучението как изглеждат реалните условия на разгръщане.

Защо това е по-важно, отколкото си мислиш

Последствията далеч надвишават генерирането на по-дълги видеоклипове на котки. Ето какво се изменя:

Преди преработката на грешки

  • Видео модели ограничени до 4-20 секунди
  • Последователност на сцената бързо деградира
  • Идентичност на персонажа дрейфува след няколко секунди
  • Физиката става все по-нереалистична
  • Цветът и осветлението се изместват непредвидимо

След преработката на грешки

  • Генериране на многоминутно последователно видео
  • Стабилен външен вид на персонажа през цялото видео
  • Последователна физика и пространствени отношения
  • Надежда на цветна корекция и осветление
  • Няма видима деградация на качество с течение на времето

Числата

Екипът на VITA Lab тестна Stable Video Infinity на различни архитектури и мерки. Резултатите са разрушителни:

МетрикаБез преработка на грешкиС преработка на грешкиПодобрение
FVD (по-низко е по-добро)Деградира след 4sСтабилна през 2min+Значително
Последователност на персонажаПада под 60% на 15sПоддържа 90%+ на 2min~50% относителна
Времева последователностВидим дрейф на 8sБез видим дрейф на 2minКачествен скок
Compute OverheadBaselineBaseline (0% прирост)Нулеви разходи
💡

Аспектът на нулевите изчислителни разходи е критичен. Преработката на грешки е техника на време на обучението, а не разпознаване. След обучение моделът работи с точно същата скорост и цена като преди.

Как преработката на грешки работи под капака

За тези, които искат техническите детайли, ето какво се случва в модифицирания конвейер на обучението.

Стандартното видео дифузионно обучение използва график на шум epsilon, приложен към чисти ground-truth кадри x_0. Моделът се обучава да предвиди шума и да възстанови оригиналния сигнал. По време на разпознаване моделът авторегресивно генерира кадър t+1, обусловен от своето предвиждане на кадър t.

Разликата между обучението (чисти входове) и разпознаването (самогенерирани входове) се нарича отклонение на експозицията. Преработката на грешки директно това решава.

Technical Details: Modified Training Objective

По време на обучението моделът периодично генерира кадри, използвайки собствените си текущи тегла, а не използвайки ground-truth данни. Тези самогенерирани кадри, със всички техни несъвършенства, се използват като входове условни за последващите кадри в последователността на обучението.

Ключевият хиперпараметър е коефициентът на преработка r, който контролира колко често самогенерираните кадри замещат ground-truth кадри по време на обучението. Статията установява, че r = 0.3 (30% преработени кадри) постига оптимална производителност, балансирайки подобрението на стабилност със качество на сигнала на обучението.

Модифицираната функция на загуба остава стандартната дифузионна цел. Единствената разлика е разпределението на данните, които моделът вижда по време на обучението. Ето защо няма изчислителни разходи по време на разпознаване.

Това е концептуално подобно на scheduled sampling в последователност-на-последователност модели, но адаптирано за непрекъснатата дифузионна рамка. Екипът на VITA Lab признава това съединение в своята статия, докато отбелязва, че наивното применение на scheduled sampling към дифузионни модели не работи. Техният принос е специфичната формулировка, която я прави стабилна за видео генериране.

Предимството на отворения код

Може би най-вълнуващия аспект: кодът е напълно отворен изходен код на GitHub (vita-epfl/Stable-Video-Infinity). Това означава, че всяка изследователска лаборатория или компания може да приложи преработката на грешки към своите съществуващи видео модели.

Защо е важен отворенният код
Всеки съществуващ видео дифузионен модел може да бъде преработен с преработката на грешки. Не са необходими архитектурни промени, само модифициран цикъл на обучението. Това може да подобри Sora, Runway, Kling и всеки модел с открит изходен код едновременно.
Практически ограничения
Изисква преобучение или fine-tuning на модела. Компаниите със собственически модели трябва да инвестират преводи в преобучение. Ефективността на техниката може да варира в зависимост от различни архитектури и мащаби.

Издаването на отворен код следва растящ тренд в общността на изследователите на AI видео. Модели като LTX-2 и Wan 2.6 показаха, че подходи с открит изходен код могат да конкурират със собственически алтернативи.

Какво означава това за индустрията

Времето е забележително. Ние сме в средата на гонка за AI видео, където всеки основен играч, от Runway до ByteDance, се опитва да получи по-дълг, по-висок качествен резултат. Преработката на грешки може да е липсващото парче, което разблокира следващото поколение възможности.

🎬

За кинематографисти и творци

Дълго видео с последователност дава възможност за реално повествователно съдържание. Не просто клипове, а сцени, последователности и в крайна сметка пълнометражни филми, генерирани от един единствен запит.
🔬

За изследователи

Преработката на грешки осигурява обобщаема рамка. Същият принцип може да се приложи към генериране на звук, синтез на 3D сцени и всеки авторегресивен генеративен модел, който страда от дрейф.
🏢

За предприятия

Стабилното дълго видео генериране прави AI видео жизнеспособно за професионални случаи на употреба: демонстрации на продукти, учебни видеа, маркетингови кампании, които изискват последователно качество през минути от съдържание.

Поглед напред

Работата на VITA Lab представлява фундаментален преход в това как мислим за генериране на AI видео. Вместо построяване на все по-големи модели или добавяне на сложни механизми по време на разпознаване, решението е просто да покажеш на модела как изглежда неговия собствен резултат.

Статията ще бъде представена на ICLR 2026, и няколко индустриални източници предполагат, че основни доставчици на видео модели вече изследват интеграцията. Ако world models представят бъдещето на това как AI разбира физиката и пространството, преработката на грешки представля бъдещето на това как AI поддържа това разбиране с течение на времето.

Ерата на 4-секундните AI видеа може да завърши по-скоро, отколкото някой очаква. И няма да изисква нова архитектура на модела или бюджет за преводи. Просто по-умен цикъл на обучението.

Допълнително четене

Alexis
AlexisAI EngineerAI Author

Инженер по ИИ от Лозана, който съчетава задълбочени изследвания с практични иновации. Разпределя времето си между архитектури на модели и алпийски върхове.

View profile →

Хареса ли ви прочетеното?

Превърнете идеите си в ИИ видеа с неограничена дължина само за минути.

Свързани статии

Продължете да разглеждате с тези свързани публикации

Хареса ли ви тази статия?

Открийте още полезни идеи и бъдете в крак с най-новото ни съдържание.