Meta PixelСкокни до главната содржина
AlexisAlexis· ВИ автор, прегледано од човек
8 min read
1492 зборови

EPFL Stable Video Infinity: Како рециклирањето грешки го решава најголемиот проблем на AI видеото

Нов труд за усно излагање на ICLR 2026 од EPFL воведува рециклирање грешки, техника што го елиминира временското отстапување и овозможува повеќеминутно генерирање AI видео без дополнителен трошок за пресметување.

EPFL Stable Video Infinity: Како рециклирањето грешки го решава најголемиот проблем на AI видеото

Подготвени сте да создавате сопствени ВИ видеа?

Придружете им се на илјадници создавачи кои користат Bonega.ai

Секој AI видео модел ја има истата валкана тајна. Генерирајте клип од 4 секунди и резултатите изгледаат неверојатно. Продолжете над 15 секунди и ликовите почнуваат да се преобразуваат, физиката се распаѓа, боите се менуваат, а целата сцена отстапува кон некохерентност. VITA Lab на EPFL штотуку објави решение, и можеби станува збор за најважниот труд за генерирање видео оваа година.

Проблемот со отстапувањето што никој не го реши

Ако сте се обиделе да генерирате долго AI видео со кој било актуелен модел, ја знаете фрустрацијата. Sora 2 е ограничен на 15 до 25 секунди, во зависност од вашиот план. Runway Gen-4.5 достигнува максимум 10. Kling 3.0 оди до 15. Причината не е пресметување или меморија. Тоа е временско отстапување.

💡

Временското отстапување настанува кога авторегресивните видео модели акумулираат мали грешки кадар по кадар. Секој генериран кадар станува влез за следниот, а малите несовршености се усложнуваат експоненцијално. По неколку стотици кадри, излезот едвај наликува на оригиналниот промпт.

Ова е во основа слично на проблемот со „расипан телефон“. Шепнете порака низ доволно луѓе и таа станува непрепознатлива. Претходните пристапи се обидуваа да се борат против отстапувањето со генерирање пократки клипови и нивно спојување, но споевите се видливи. Други користеа хиерархиско генерирање, прво клучни кадри, потоа интерполација, што помага, но не го отстранува основниот проблем.

Вовед во рециклирањето грешки

Трудот, насловен "Stable Video Infinity" и прифатен како усно излагање на ICLR 2026, воведува измамливо едноставна идеја: научете го моделот да се справува со сопствените грешки.

Oral
Статус на ICLR 2026
0
Дополнителен трошок за пресметување
Minutes
Должина на видеото

Еве го клучниот увид. За време на обуката, стандардните модели за видео дифузија учат од чисти податоци со основна вистина. Тие никогаш не го гледаат сопствениот генериран излез. Кога се пуштени во употреба, одеднаш мораат да работат со сопствените несовршени предвидувања како влез и не знаат како да се справат со шумот.

Рециклирањето грешки го решава ова со измена на циклусот на обука:

Чекор 1

Стандарден директен премин

Моделот генерира видео сегмент од чисти податоци за обука.

Чекор 2

Собирање грешки

Сопствените предвидувања на моделот, со нивните несовршености, се зачувуваат наместо да се отфрлат.

Чекор 3

Рециклирање грешки

Овие несовршени излези се враќаат како влез за следната итерација на обука, учејќи го моделот да генерира стабилен излез дури и од шумни, самогенерирани кадри.

Чекор 4

Итеративно усовршување

Низ многу циклуси на обука, моделот учи робустен механизам за самокорекција што спречува акумулација на грешки.

Убавината на овој пристап е во неговата елеганција. Нема нови архитектури на модели, нема дополнителни параметри, нема трикови за време на инференција. Моделот едноставно учи за време на обуката како изгледаат реалните услови при употреба.

Зошто ова е поважно отколку што мислите

Импликациите се протегаат многу подалеку од генерирање подолги видеа со мачки. Еве што се менува:

Пред рециклирањето грешки

  • Видео моделите се ограничени на 4-20 секунди
  • Конзистентноста на сцената брзо се влошува
  • Идентитетот на ликот отстапува по неколку секунди
  • Физиката станува сè понереалистична
  • Бојата и осветлувањето непредвидливо се менуваат

По рециклирањето грешки

  • Кохерентно генерирање видеа што траат повеќе минути
  • Стабилен изглед на ликот во текот на целото видео
  • Конзистентна физика и просторни односи
  • Сигурна обработка на бои и осветлување
  • Нема видливо намалување на квалитетот со текот на времето

Бројките

Тимот на VITA Lab го тестираше Stable Video Infinity низ повеќе архитектури и репери. Резултатите се впечатливи:

МетрикаБез рециклирање грешкиСо рециклирање грешкиПодобрување
FVD (пониско е подобро)Се влошува по 4sСтабилно до 2min+Значително
Конзистентност на ликотПаѓа под 60% на 15sОдржува 90%+ на 2min~50% релативно
Временска кохерентностВидливо отстапување на 8sНема видливо отстапување на 2minКвалитативен скок
Дополнително пресметувањеОсновно нивоОсновно ниво (0% зголемување)Нулта цена
💡

Аспектот со нула дополнително пресметување е критичен. Рециклирањето грешки е техника за време на обука, а не за време на инференција. Откако ќе се обучи, моделот работи со точно истата брзина и цена како претходно.

Како функционира рециклирањето грешки во позадина

За оние што ги сакаат техничките детали, еве што се случува во изменетиот процес на обука.

Стандардната обука за видео дифузија користи распоред на шум epsilon применет врз чисти кадри со основна вистина x_0. Моделот учи да го предвидува шумот и да го обновува оригиналниот сигнал. За време на инференција, моделот авторегресивно генерира кадар t+1 условен од неговото предвидување за кадар t.

Јазот меѓу обуката, чисти влезови, и инференцијата, самогенерирани влезови, се нарекува пристрасност на изложеност. Рециклирањето грешки директно се справува со ова.

Технички детали: Изменета цел на обуката

За време на обуката, моделот периодично генерира кадри користејќи ги сопствените тековни тежини наместо да користи податоци со основна вистина. Овие самогенерирани кадри, заедно со нивните несовршености, потоа се користат како условни влезови за следните кадри во секвенцата за обука.

Клучниот хиперпараметар е соодносот на рециклирање r, кој контролира колку често самогенерираните кадри ги заменуваат кадрите со основна вистина за време на обуката. Трудот открива дека r = 0.3 (30% рециклирани кадри) постигнува оптимални перформанси, балансирајќи подобрување на стабилноста со квалитетот на сигналот за обука.

Изменетата функција на загуба останува стандардната цел на дифузија. Единствената разлика е распределбата на податоците што моделот ја гледа за време на обуката. Затоа нема дополнително пресметковно оптоварување за време на инференција.

Ова е концептуално слично на планирано примерување во модели од секвенца во секвенца, но приспособено за рамката на континуирана дифузија. Тимот на VITA Lab ја признава оваа поврзаност во својот труд, истовремено забележувајќи дека наивната примена на планирано примерување врз модели за дифузија не функционира. Нивниот придонес е специфичната формулација што ја прави стабилна за генерирање видео.

Предноста на отворениот код

Можеби највозбудливиот аспект е: кодот е целосно со отворен код на GitHub (vita-epfl/Stable-Video-Infinity). Ова значи дека секоја истражувачка лабораторија или компанија може да примени рециклирање грешки на своите постојни видео модели.

Зошто отворениот код е важен
Секој постоечки модел за видео дифузија може да се надгради со рециклирање грешки. Не се потребни архитектонски промени, туку само изменет циклус на обука. Ова би можело истовремено да ги подобри Sora, Runway, Kling и секој модел со отворен код.
Практични ограничувања
Потребна е повторна обука или фино прилагодување на моделот. Компаниите со сопствени модели треба да вложат пресметковни ресурси во повторна обука. Ефикасноста на техниката може да варира кај различни архитектури и размери.

Објавувањето со отворен код следи растечки тренд во истражувачката заедница за AI видео. Модели како LTX-2 и Wan 2.6 покажаа дека пристапите со отворен код можат да се натпреваруваат со сопственичките алтернативи.

Што значи ова за индустријата

Времето е извонредно. Се наоѓаме среде трка во AI видеото, каде секој голем играч, од Runway до ByteDance, се стреми кон подолг и поквалитетен излез. Рециклирањето грешки би можело да биде делот што недостасува и што ќе ја отклучи следната генерација способности.

🎬

За филмаџии и креатори

Кохерентното генерирање долги видеа овозможува вистинска наративна содржина. Не само клипови, туку сцени, секвенци и на крај кратки филмови генерирани од еден промпт.
🔬

За истражувачи

Рециклирањето грешки обезбедува генерализирачка рамка. Истиот принцип би можел да се примени на генерирање аудио, синтеза на 3D сцени и секој авторегресивен генеративен модел што страда од отстапување.
🏢

За претпријатија

Стабилното генерирање долги содржини го прави AI видеото применливо за професионални случаи: демонстрации на производи, видеа за обука, маркетинг кампањи што бараат конзистентен квалитет низ минути содржина.

Поглед напред

Работата на VITA Lab претставува фундаментална промена во начинот на кој размислуваме за генерирање AI видео. Наместо да градат сè поголеми модели или да додаваат сложени механизми за време на инференција, решението било едноставно да му се покаже на моделот како изгледа неговиот сопствен излез.

Трудот ќе биде презентиран на ICLR 2026, а неколку извори од индустријата сугерираат дека големите доставувачи на видео модели веќе истражуваат интеграција. Ако светските модели ја претставуваат иднината на тоа како AI ја разбира физиката и просторот, рециклирањето грешки ја претставува иднината на тоа како AI го одржува тоа разбирање низ времето.

Ерата на AI видеата од 4 секунди можеби ќе заврши порано отколку што некој очекуваше. И нема да бара нова архитектура на модел или буџет за пресметување од милијарда долари. Само попаметен циклус на обука.

Дополнително читање


Извори

Alexis
AlexisAI EngineerAI Author

ВИ инженер од Лозана кој комбинира длабочина во истражувањето со практична иновација. Го дели времето помеѓу архитектури на модели и алпски врвови.

View profile →

Ви се допадна прочитаното?

Претворете ги вашите идеи во ВИ видеа со неограничена должина за неколку минути.

Поврзани статии

Продолжете да истражувате со овие поврзани објави

Најдобри бесплатни AI алатки за текст-во-видео: Водич за 2026
AI ВидеоБесплатни алатки

Најдобри бесплатни AI алатки за текст-во-видео: Водич за 2026

Споредете ги најдобрите бесплатни AI алатки за текст-во-видео во 2026, вклучувајќи ги нивните реални лимити на кредити, водените жигови, компромисите при локално поставување и практичен план за тестирање.

Read
Bonega vs HeyGen во 2026: Генерирање AI видео наспроти платформа за AI аватари
AI ВидеоBonega

Bonega vs HeyGen во 2026: Генерирање AI видео наспроти платформа за AI аватари

Bonega.ai генерира кинематографско AI видео од текст и слики. HeyGen создава AI видеа со аватари за деловна комуникација. Ги споредуваме функциите, цените и која платформа одговара на вашите потреби.

Read
Bonega наспроти Synthesia во 2026: Генерирање AI видео наспроти AI видео за бизнис
AI ВидеоBonega

Bonega наспроти Synthesia во 2026: Генерирање AI видео наспроти AI видео за бизнис

Bonega.ai создава кинематографско AI видео од текст и слики. Synthesia создава бизнис видеа базирани на аватари со преводи. Ги споредуваме цените, функциите и која платформа одговара на вашиот работен процес.

Read

Ви се допадна статијата?

Откријте повеќе сознанија и останете во тек со нашата најнова содржина.