EPFL Stable Video Infinity: Како рециклирањето грешки го решава најголемиот проблем на AI видеото
Нов труд за усно излагање на ICLR 2026 од EPFL воведува рециклирање грешки, техника што го елиминира временското отстапување и овозможува повеќеминутно генерирање AI видео без дополнителен трошок за пресметување.

Подготвени сте да создавате сопствени ВИ видеа?
Придружете им се на илјадници создавачи кои користат Bonega.ai
Проблемот со отстапувањето што никој не го реши
Ако сте се обиделе да генерирате долго AI видео со кој било актуелен модел, ја знаете фрустрацијата. Sora 2 е ограничен на 15 до 25 секунди, во зависност од вашиот план. Runway Gen-4.5 достигнува максимум 10. Kling 3.0 оди до 15. Причината не е пресметување или меморија. Тоа е временско отстапување.
Временското отстапување настанува кога авторегресивните видео модели акумулираат мали грешки кадар по кадар. Секој генериран кадар станува влез за следниот, а малите несовршености се усложнуваат експоненцијално. По неколку стотици кадри, излезот едвај наликува на оригиналниот промпт.
Ова е во основа слично на проблемот со „расипан телефон“. Шепнете порака низ доволно луѓе и таа станува непрепознатлива. Претходните пристапи се обидуваа да се борат против отстапувањето со генерирање пократки клипови и нивно спојување, но споевите се видливи. Други користеа хиерархиско генерирање, прво клучни кадри, потоа интерполација, што помага, но не го отстранува основниот проблем.
Вовед во рециклирањето грешки
Трудот, насловен "Stable Video Infinity" и прифатен како усно излагање на ICLR 2026, воведува измамливо едноставна идеја: научете го моделот да се справува со сопствените грешки.
Еве го клучниот увид. За време на обуката, стандардните модели за видео дифузија учат од чисти податоци со основна вистина. Тие никогаш не го гледаат сопствениот генериран излез. Кога се пуштени во употреба, одеднаш мораат да работат со сопствените несовршени предвидувања како влез и не знаат како да се справат со шумот.
Рециклирањето грешки го решава ова со измена на циклусот на обука:
Стандарден директен премин
Моделот генерира видео сегмент од чисти податоци за обука.
Собирање грешки
Сопствените предвидувања на моделот, со нивните несовршености, се зачувуваат наместо да се отфрлат.
Рециклирање грешки
Овие несовршени излези се враќаат како влез за следната итерација на обука, учејќи го моделот да генерира стабилен излез дури и од шумни, самогенерирани кадри.
Итеративно усовршување
Низ многу циклуси на обука, моделот учи робустен механизам за самокорекција што спречува акумулација на грешки.
Убавината на овој пристап е во неговата елеганција. Нема нови архитектури на модели, нема дополнителни параметри, нема трикови за време на инференција. Моделот едноставно учи за време на обуката како изгледаат реалните услови при употреба.
Зошто ова е поважно отколку што мислите
Импликациите се протегаат многу подалеку од генерирање подолги видеа со мачки. Еве што се менува:
Пред рециклирањето грешки
- Видео моделите се ограничени на 4-20 секунди
- Конзистентноста на сцената брзо се влошува
- Идентитетот на ликот отстапува по неколку секунди
- Физиката станува сè понереалистична
- Бојата и осветлувањето непредвидливо се менуваат
По рециклирањето грешки
- Кохерентно генерирање видеа што траат повеќе минути
- Стабилен изглед на ликот во текот на целото видео
- Конзистентна физика и просторни односи
- Сигурна обработка на бои и осветлување
- Нема видливо намалување на квалитетот со текот на времето
Бројките
Тимот на VITA Lab го тестираше Stable Video Infinity низ повеќе архитектури и репери. Резултатите се впечатливи:
| Метрика | Без рециклирање грешки | Со рециклирање грешки | Подобрување |
|---|---|---|---|
| FVD (пониско е подобро) | Се влошува по 4s | Стабилно до 2min+ | Значително |
| Конзистентност на ликот | Паѓа под 60% на 15s | Одржува 90%+ на 2min | ~50% релативно |
| Временска кохерентност | Видливо отстапување на 8s | Нема видливо отстапување на 2min | Квалитативен скок |
| Дополнително пресметување | Основно ниво | Основно ниво (0% зголемување) | Нулта цена |
Аспектот со нула дополнително пресметување е критичен. Рециклирањето грешки е техника за време на обука, а не за време на инференција. Откако ќе се обучи, моделот работи со точно истата брзина и цена како претходно.
Како функционира рециклирањето грешки во позадина
За оние што ги сакаат техничките детали, еве што се случува во изменетиот процес на обука.
Стандардната обука за видео дифузија користи распоред на шум epsilon применет врз чисти кадри со основна вистина x_0. Моделот учи да го предвидува шумот и да го обновува оригиналниот сигнал. За време на инференција, моделот авторегресивно генерира кадар t+1 условен од неговото предвидување за кадар t.
Јазот меѓу обуката, чисти влезови, и инференцијата, самогенерирани влезови, се нарекува пристрасност на изложеност. Рециклирањето грешки директно се справува со ова.
Технички детали: Изменета цел на обуката▼
За време на обуката, моделот периодично генерира кадри користејќи ги сопствените тековни тежини наместо да користи податоци со основна вистина. Овие самогенерирани кадри, заедно со нивните несовршености, потоа се користат како условни влезови за следните кадри во секвенцата за обука.
Клучниот хиперпараметар е соодносот на рециклирање r, кој контролира колку често самогенерираните кадри ги заменуваат кадрите со основна вистина за време на обуката. Трудот открива дека r = 0.3 (30% рециклирани кадри) постигнува оптимални перформанси, балансирајќи подобрување на стабилноста со квалитетот на сигналот за обука.
Изменетата функција на загуба останува стандардната цел на дифузија. Единствената разлика е распределбата на податоците што моделот ја гледа за време на обуката. Затоа нема дополнително пресметковно оптоварување за време на инференција.
Ова е концептуално слично на планирано примерување во модели од секвенца во секвенца, но приспособено за рамката на континуирана дифузија. Тимот на VITA Lab ја признава оваа поврзаност во својот труд, истовремено забележувајќи дека наивната примена на планирано примерување врз модели за дифузија не функционира. Нивниот придонес е специфичната формулација што ја прави стабилна за генерирање видео.
Предноста на отворениот код
Можеби највозбудливиот аспект е: кодот е целосно со отворен код на GitHub (vita-epfl/Stable-Video-Infinity). Ова значи дека секоја истражувачка лабораторија или компанија може да примени рециклирање грешки на своите постојни видео модели.
Објавувањето со отворен код следи растечки тренд во истражувачката заедница за AI видео. Модели како LTX-2 и Wan 2.6 покажаа дека пристапите со отворен код можат да се натпреваруваат со сопственичките алтернативи.
Што значи ова за индустријата
Времето е извонредно. Се наоѓаме среде трка во AI видеото, каде секој голем играч, од Runway до ByteDance, се стреми кон подолг и поквалитетен излез. Рециклирањето грешки би можело да биде делот што недостасува и што ќе ја отклучи следната генерација способности.
За филмаџии и креатори
За истражувачи
За претпријатија
Поглед напред
Работата на VITA Lab претставува фундаментална промена во начинот на кој размислуваме за генерирање AI видео. Наместо да градат сè поголеми модели или да додаваат сложени механизми за време на инференција, решението било едноставно да му се покаже на моделот како изгледа неговиот сопствен излез.
Трудот ќе биде презентиран на ICLR 2026, а неколку извори од индустријата сугерираат дека големите доставувачи на видео модели веќе истражуваат интеграција. Ако светските модели ја претставуваат иднината на тоа како AI ја разбира физиката и просторот, рециклирањето грешки ја претставува иднината на тоа како AI го одржува тоа разбирање низ времето.
Ерата на AI видеата од 4 секунди можеби ќе заврши порано отколку што некој очекуваше. И нема да бара нова архитектура на модел или буџет за пресметување од милијарда долари. Само попаметен циклус на обука.
Дополнително читање
- Револуцијата на AI видео со отворен код: Како отворените модели го намалуваат јазот со сопственичките системи
- Симулација на физика во AI видео: Разбирање како моделите учат физичка конзистентност
- Трансформери за дифузија: Архитектурата што го напојува современото генерирање видео
Извори
- Меѓународна конференција за учење претставувања: Усно излагање (статус на ICLR 2026) (Меѓународна конференција за учење претставувања)
- Истражувачи од EPFL VITA преку arXiv: Stable Video Infinity поддржува генерирање видео со бесконечна должина без дополнителна инференција… (Истражувачи од EPFL VITA преку arXiv)

ВИ инженер од Лозана кој комбинира длабочина во истражувањето со практична иновација. Го дели времето помеѓу архитектури на модели и алпски врвови.
View profile →Ви се допадна прочитаното?
Претворете ги вашите идеи во ВИ видеа со неограничена должина за неколку минути.
Поврзани статии
Продолжете да истражувате со овие поврзани објави

Најдобри бесплатни AI алатки за текст-во-видео: Водич за 2026
Споредете ги најдобрите бесплатни AI алатки за текст-во-видео во 2026, вклучувајќи ги нивните реални лимити на кредити, водените жигови, компромисите при локално поставување и практичен план за тестирање.

Bonega vs HeyGen во 2026: Генерирање AI видео наспроти платформа за AI аватари
Bonega.ai генерира кинематографско AI видео од текст и слики. HeyGen создава AI видеа со аватари за деловна комуникација. Ги споредуваме функциите, цените и која платформа одговара на вашите потреби.

Bonega наспроти Synthesia во 2026: Генерирање AI видео наспроти AI видео за бизнис
Bonega.ai создава кинематографско AI видео од текст и слики. Synthesia создава бизнис видеа базирани на аватари со преводи. Ги споредуваме цените, функциите и која платформа одговара на вашиот работен процес.