EPFL Stable Video Infinity: как преработката на грешки решава главния проблем на AI видео
Нова статия от EPFL за ICLR 2026 (устна презентация) представя преработката на грешки, техника, която елиминира временния дрейф и дава възможност за генериране на многоминутно AI видео без допълнителни изчислителни разходи.

Готови ли сте да създавате собствени ИИ видеа?
Присъединете се към хиляди създатели, които използват Bonega.ai
Проблемът на дрейфа, който никой не реши
Ако си опитал да генерираш дълго видео с някой от съществуващите модели, знаеш това разочарование. Sora 2 е ограничена до 15-25 секунди в зависимост от плана. Runway Gen-4.5 максимум 10 секунди. Kling 3.0 стига до 15 секунди. Причината не е в изчислителната мощ или паметта. Това е временен дрейф.
Временният дрейф се появява, когато авторегресивните видео модели натрупват малки грешки кадър по кадър. Всеки генериран кадър става вход за следващия, и малките несъвършенства се натрупват експоненциално. След няколко сто кадра резултатът едва ли напомня оригиналния запит.
Това е по принцип подобно на проблема на "телефонната игра". Предай съобщение през достатъчно много хора и то се превръща в неузнаваемо. Предишните подходи се опитаха да се справят с дрейфа, като генерираха по-къси клипове и ги залепяха, но швовете са видими. Други използваха йерархично генериране (първо ключови кадри, потом интерполация), което помага, но не елиминира основния проблем.
Въвеждането на преработката на грешки
Статията озаглавена "Stable Video Infinity" и приета като устна презентация за ICLR 2026 представя, на пръв поглед, проста идея: научи модела да се справя със своите грешки.
Ето ключовата идея. По време на обучението стандартните видео модели дифузия се обучават на чисти ground-truth данни. Те никога не виждат своя собствен генериран резултат. При разгръщане те внезапно трябва да работят със своите собствени несъвършени предвиждания като вход, и не знаят как да се справят с шума.
Преработката на грешки решава това чрез модифициране на цикъла на обучението:
Standard Forward Pass
Моделът генерира видео сегмент от чисти обучителни данни.
Error Collection
Собствените предвиждания на модела (със всички техни несъвършенства) се улавят вместо да се отхвърлят.
Error Recycling
Тези несъвършени резултати се подават обратно като входове за следващата итерация на обучението, обучавайки модела да генерира стабилен резултат дори от шумни, самогенерирани кадри.
Iterative Refinement
През много цикли на обучението моделът научава надежден механизъм за самокоригиране, който предотвратява натрупването на грешки.
Красотата на този подход е неговата елегантност. Няма нови архитектури на модели, няма допълнителни параметри, няма трикове по време на разпознаване. Моделът просто учи по време на обучението как изглеждат реалните условия на разгръщане.
Защо това е по-важно, отколкото си мислиш
Последствията далеч надвишават генерирането на по-дълги видеоклипове на котки. Ето какво се изменя:
Преди преработката на грешки
- Видео модели ограничени до 4-20 секунди
- Последователност на сцената бързо деградира
- Идентичност на персонажа дрейфува след няколко секунди
- Физиката става все по-нереалистична
- Цветът и осветлението се изместват непредвидимо
След преработката на грешки
- Генериране на многоминутно последователно видео
- Стабилен външен вид на персонажа през цялото видео
- Последователна физика и пространствени отношения
- Надежда на цветна корекция и осветление
- Няма видима деградация на качество с течение на времето
Числата
Екипът на VITA Lab тестна Stable Video Infinity на различни архитектури и мерки. Резултатите са разрушителни:
| Метрика | Без преработка на грешки | С преработка на грешки | Подобрение |
|---|---|---|---|
| FVD (по-низко е по-добро) | Деградира след 4s | Стабилна през 2min+ | Значително |
| Последователност на персонажа | Пада под 60% на 15s | Поддържа 90%+ на 2min | ~50% относителна |
| Времева последователност | Видим дрейф на 8s | Без видим дрейф на 2min | Качествен скок |
| Compute Overhead | Baseline | Baseline (0% прирост) | Нулеви разходи |
Аспектът на нулевите изчислителни разходи е критичен. Преработката на грешки е техника на време на обучението, а не разпознаване. След обучение моделът работи с точно същата скорост и цена като преди.
Как преработката на грешки работи под капака
За тези, които искат техническите детайли, ето какво се случва в модифицирания конвейер на обучението.
Стандартното видео дифузионно обучение използва график на шум epsilon, приложен към чисти ground-truth кадри x_0. Моделът се обучава да предвиди шума и да възстанови оригиналния сигнал. По време на разпознаване моделът авторегресивно генерира кадър t+1, обусловен от своето предвиждане на кадър t.
Разликата между обучението (чисти входове) и разпознаването (самогенерирани входове) се нарича отклонение на експозицията. Преработката на грешки директно това решава.
Technical Details: Modified Training Objective▼
По време на обучението моделът периодично генерира кадри, използвайки собствените си текущи тегла, а не използвайки ground-truth данни. Тези самогенерирани кадри, със всички техни несъвършенства, се използват като входове условни за последващите кадри в последователността на обучението.
Ключевият хиперпараметър е коефициентът на преработка r, който контролира колко често самогенерираните кадри замещат ground-truth кадри по време на обучението. Статията установява, че r = 0.3 (30% преработени кадри) постига оптимална производителност, балансирайки подобрението на стабилност със качество на сигнала на обучението.
Модифицираната функция на загуба остава стандартната дифузионна цел. Единствената разлика е разпределението на данните, които моделът вижда по време на обучението. Ето защо няма изчислителни разходи по време на разпознаване.
Това е концептуално подобно на scheduled sampling в последователност-на-последователност модели, но адаптирано за непрекъснатата дифузионна рамка. Екипът на VITA Lab признава това съединение в своята статия, докато отбелязва, че наивното применение на scheduled sampling към дифузионни модели не работи. Техният принос е специфичната формулировка, която я прави стабилна за видео генериране.
Предимството на отворения код
Може би най-вълнуващия аспект: кодът е напълно отворен изходен код на GitHub (vita-epfl/Stable-Video-Infinity). Това означава, че всяка изследователска лаборатория или компания може да приложи преработката на грешки към своите съществуващи видео модели.
Издаването на отворен код следва растящ тренд в общността на изследователите на AI видео. Модели като LTX-2 и Wan 2.6 показаха, че подходи с открит изходен код могат да конкурират със собственически алтернативи.
Какво означава това за индустрията
Времето е забележително. Ние сме в средата на гонка за AI видео, където всеки основен играч, от Runway до ByteDance, се опитва да получи по-дълг, по-висок качествен резултат. Преработката на грешки може да е липсващото парче, което разблокира следващото поколение възможности.
За кинематографисти и творци
За изследователи
За предприятия
Поглед напред
Работата на VITA Lab представлява фундаментален преход в това как мислим за генериране на AI видео. Вместо построяване на все по-големи модели или добавяне на сложни механизми по време на разпознаване, решението е просто да покажеш на модела как изглежда неговия собствен резултат.
Статията ще бъде представена на ICLR 2026, и няколко индустриални източници предполагат, че основни доставчици на видео модели вече изследват интеграцията. Ако world models представят бъдещето на това как AI разбира физиката и пространството, преработката на грешки представля бъдещето на това как AI поддържа това разбиране с течение на времето.
Ерата на 4-секундните AI видеа може да завърши по-скоро, отколкото някой очаква. И няма да изисква нова архитектура на модела или бюджет за преводи. Просто по-умен цикъл на обучението.
Допълнително четене
- Революция на AI видео с отворен код: Как отворени модели затварят разлика със собственически системи
- Симулация на физика в AI видео: Разбиране на това как модели се обучават на физическа последователност
- Diffusion Transformers: Архитектура, която захранва съвременното видео генериране

Инженер по ИИ от Лозана, който съчетава задълбочени изследвания с практични иновации. Разпределя времето си между архитектури на модели и алпийски върхове.
View profile →Свързани статии
Продължете да разглеждате с тези свързани публикации

Възможности на Grok xAI за image-to-video: API ръководство за юни 2026 г.
Възможности на Grok xAI за image-to-video през юни 2026 г.: как Grok Imagine обработва изображения, промптове, native audio, API работни процеси, безопасност, логика на ценообразуване и сравнения със Sora/Veo.

SkyReels V4: Първият AI Модел, Който Едновременно Вижда и Чува
Skywork AI представя SkyReels V4 с двупоточна дифузионна архитектура, която в един проход генерира видео и синхронизиран звук. Ето какво означава това за създателите.

AI видео след Sora: 4 пазарни нива, които трябва да знаете през 2026
Sora се затваря на 26 април. Пазарът на AI видео се консолидира в четири нива. Практическо ръководство за избор на правилната алтернатива на Sora за вашите нужди.