EPFL Stable Video Infinity: як Error Recycling вырашае найбуйнейшую праблему AI-відэа
Новы даклад ICLR 2026 Oral ад EPFL прадстаўляе error recycling, тэхніку, якая ліквідуе часавы дрэйф і дазваляе генераваць шматхвілінныя AI-відэа без дадатковых выдаткаў на вылічэнні.

Праблема дрэйфу, якую ніхто не вырашыў
Калі вы спрабавалі генераваць доўгафарматнае AI-відэа любой сучаснай мадэллю, вы ведаеце гэта расчараванне. Sora 2 абмяжоўваецца 15-25 секундамі залежна ад вашага плана. Runway Gen-4.5 дасягае максімуму ў 10. Kling 3.0 дае 15. Прычына не ў вылічэннях і не ў памяці. Гэта часавы дрэйф.
Часавы дрэйф узнікае, калі аўтарэгрэсіўныя відэамадэлі назапашваюць дробныя памылкі кадр за кадрам. Кожны згенераваны кадр становіцца ўваходнымі данымі для наступнага, а нязначныя недасканаласці ўзмацняюцца экспаненцыяльна. Праз некалькі сотняў кадраў вынік ужо ледзь нагадвае зыходны запыт.
Гэта ў сваёй аснове падобна да праблемы "сапсаванага тэлефона". Перадайце паведамленне шэптам праз дастаткова шмат людзей, і яно стане непазнавальным. Папярэднія падыходы спрабавалі змагацца з дрэйфам, генеруючы карацейшыя кліпы і зшываючы іх разам, але швы бачныя. Іншыя выкарыстоўвалі іерархічную генерацыю (спачатку ключавыя кадры, потым інтэрпаляцыя), што дапамагае, але не ліквідуе галоўную праблему.
Знаёмцеся, Error Recycling
Артыкул пад назвай "Stable Video Infinity", прыняты як вусная прэзентацыя ICLR 2026, прадстаўляе падманліва простую ідэю: навучыць мадэль спраўляцца са сваімі ўласнымі памылкамі.
Вось ключавое разуменне. Падчас навучання стандартныя мадэлі дыфузіі відэа вучацца на чыстых даных ground truth. Яны ніколі не бачаць уласны згенераваны вынік. Пры разгортванні ім раптам даводзіцца працаваць са сваімі недасканалымі прагнозамі як з уваходнымі данымі, і яны не ведаюць, як апрацоўваць шум.
Error recycling выпраўляе гэта з дапамогай змены цыкла навучання:
Стандартны прамы праход
Мадэль генеруе відэасегмент з чыстых навучальных даных.
Збор памылак
Уласныя прагнозы мадэлі (з іх недасканаласцямі) захоўваюцца, а не адкідваюцца.
Паўторнае выкарыстанне памылак
Гэтыя недасканалыя вынікі падаюцца назад як уваходныя даныя для наступнай ітэрацыі навучання, навучаючы мадэль ствараць стабільны вынік нават з шумных, самастойна згенераваных кадраў.
Ітэрацыйнае ўдасканаленне
На працягу многіх цыклаў навучання мадэль асвойвае надзейны механізм самакарэкцыі, які прадухіляе назапашванне памылак.
Прыгажосць гэтага падыходу ў яго элегантнасці. Няма новых архітэктур мадэляў, дадатковых параметраў ці прыёмаў падчас інферэнсу. Мадэль проста вучыцца падчас навучання таму, як выглядаюць рэальныя ўмовы разгортвання.
Чаму гэта важней, чым вам здаецца
Наступствы выходзяць далёка за межы генерацыі даўжэйшых відэа з катамі. Вось што змяняецца:
Да Error Recycling
- Відэамадэлі абмежаваныя 4-20 секундамі
- Цэласнасць сцэны хутка пагаршаецца
- Ідэнтычнасць персанажа губляецца праз некалькі секунд
- Фізіка становіцца ўсё менш рэалістычнай
- Колер і асвятленне змяняюцца непрадказальна
Пасля Error Recycling
- Узгодненая генерацыя відэа працягласцю ў некалькі хвілін
- Стабільны выгляд персанажа на працягу ўсяго відэа
- Паслядоўная фізіка і прасторавыя сувязі
- Надзейная колеравая карэкцыя і асвятленне
- Няма бачнай страты якасці з часам
Лічбы
Каманда VITA Lab пратэставала Stable Video Infinity на некалькіх архітэктурах і бенчмарках. Вынікі ўражваюць:
| Метрыка | Без Error Recycling | З Error Recycling | Паляпшэнне |
|---|---|---|---|
| FVD (ніжэй лепш) | Пагаршаецца пасля 4s | Стабільны да 2min+ | Значнае |
| Паслядоўнасць персанажа | Падае ніжэй за 60% на 15s | Захоўвае 90%+ на 2min | ~50% адносна |
| Часавая ўзгодненасць | Бачны дрэйф на 8s | Няма бачнага дрэйфу на 2min | Якасны скачок |
| Накладныя выдаткі на вылічэнні | Базавы ўзровень | Базавы ўзровень (рост на 0%) | Нулявы кошт |
Аспект нулявых дадатковых выдаткаў на вылічэнні мае вырашальнае значэнне. Error recycling з'яўляецца тэхнікай этапу навучання, а не інферэнсу. Пасля навучання мадэль працуе сапраўды з той жа хуткасцю і коштам, што і раней.
Як працуе Error Recycling на тэхнічным узроўні
Для тых, хто хоча тэхнічныя дэталі, вось што адбываецца ў змененым канвееры навучання.
Стандартнае навучанне дыфузіі відэа выкарыстоўвае расклад шуму epsilon, які прымяняецца да чыстых кадраў ground truth x_0. Мадэль вучыцца прадказваць шум і аднаўляць зыходны сігнал. Падчас інферэнсу мадэль аўтарэгрэсіўна генеруе кадр t+1, абапіраючыся на свой прагноз кадра t.
Разрыў паміж навучаннем (чыстыя ўваходныя даныя) і інферэнсам (самастойна згенераваныя ўваходныя даныя) называецца зрушэннем экспазіцыі. Error recycling наўпрост вырашае гэтую праблему.
Тэхнічныя дэталі: змененая мэта навучання▼
Падчас навучання мадэль перыядычна генеруе кадры, выкарыстоўваючы ўласныя бягучыя вагі замест даных ground truth. Гэтыя самастойна згенераваныя кадры, разам з іх недасканаласцямі, потым выкарыстоўваюцца як умоўныя ўваходныя даныя для наступных кадраў у навучальнай паслядоўнасці.
Ключавы гіперпараметр, гэта каэфіцыент паўторнага выкарыстання r, які вызначае, як часта самастойна згенераваныя кадры замяняюць кадры ground truth падчас навучання. Артыкул выяўляе, што r = 0.3 (30% кадраў, якія выкарыстоўваюцца паўторна) дасягае аптымальнай прадукцыйнасці, балансуючы паляпшэнне стабільнасці і якасць навучальнага сігналу.
Змененая функцыя стратаў застаецца стандартнай мэтай дыфузіі. Адзіная розніца, гэта размеркаванне даных, якое мадэль бачыць падчас навучання. Менавіта таму падчас інферэнсу няма дадатковых вылічальных выдаткаў.
Канцэптуальна гэта падобна да scheduled sampling у мадэлях sequence-to-sequence, але адаптавана для бесперапыннай дыфузійнай структуры. Каманда VITA Lab адзначае гэту сувязь у сваім артыкуле, падкрэсліваючы, што наіўнае прымяненне scheduled sampling да дыфузійных мадэляў не працуе. Іх унёсак, гэта канкрэтная фармулёўка, якая робіць метад стабільным для генерацыі відэа.
Перавага open-source
Мабыць, найбольш захапляльны аспект: код цалкам open-source на GitHub (vita-epfl/Stable-Video-Infinity). Гэта азначае, што любая даследчая лабараторыя або кампанія можа прымяніць error recycling да сваіх існуючых відэамадэляў.
Рэліз open-source працягвае нарастальны трэнд у супольнасці даследаванняў AI-відэа. Такія мадэлі, як LTX-2 і Wan 2.6, паказалі, што open-source падыходы могуць канкураваць з прапрыетарнымі альтэрнатывамі.
Што гэта азначае для індустрыі
Час з'яўлення тэхналогіі ўражвае. Мы знаходзімся ў разгар гонкі ўзбраенняў у AI-відэа, дзе кожны буйны гулец, ад Runway да ByteDance, імкнецца да даўжэйшага і якаснейшага выніку. Error recycling можа стаць адсутным элементам, які адкрые наступнае пакаленне магчымасцяў.
Для рэжысёраў і творцаў
Для даследчыкаў
Для прадпрыемстваў
Наперадзе
Праца VITA Lab азначае фундаментальны зрух у тым, як мы думаем пра генерацыю AI-відэа. Замест стварэння ўсё большых мадэляў або дадання складаных механізмаў інферэнсу рашэнне палягала ў тым, каб проста паказаць мадэлі, як выглядае яе ўласны вынік.
Артыкул будзе прадстаўлены на ICLR 2026, і некалькі крыніц у індустрыі мяркуюць, што буйныя пастаўшчыкі відэамадэляў ужо вывучаюць інтэграцыю. Калі world models прадстаўляюць будучыню таго, як AI разумее фізіку і прастору, error recycling прадстаўляе будучыню таго, як AI захоўвае гэта разуменне з цягам часу.
Эра 4-секундных AI-відэа можа скончыцца раней, чым хтосьці чакаў. І для гэтага не спатрэбяцца новая архітэктура мадэлі або мільярдны бюджэт на вылічэнні. Толькі разумнейшы цыкл навучання.
Дадатковае чытанне
- Рэвалюцыя open-source AI-відэа: Як адкрытыя мадэлі скарачаюць разрыў з прапрыетарнымі сістэмамі
- Сімуляцыя фізікі ў AI-відэа: Як мадэлі вывучаюць фізічную паслядоўнасць
- Diffusion Transformers: Архітэктура, якая забяспечвае сучасную генерацыю відэа
Крыніцы
- International Conference on Learning Representations: Oral (статус ICLR 2026) (International Conference on Learning Representations)
- Даследчыкі EPFL VITA праз arXiv: Stable Video Infinity падтрымлівае генерацыю відэа бясконцай працягласці без дадатковага інферэнсу… (Даследчыкі EPFL VITA праз arXiv)

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.
View profile →Спадабалася прачытанае?
Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.
Падобныя артыкулы
Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Бясплатныя неабмежаваныя інструменты для AI-відэа: што працуе ў 2026 годзе
Бясплатныя неабмежаваныя інструменты для AI-відэа звычайна працуюць праз чаргу або лакальна. Даведайцеся, што сапраўды з'яўляецца неабмежаваным, што запавольвае працу і як выбраць працаздольную канфігурацыю ў 2026 годзе.

Найлепшыя бясплатныя AI-інструменты для стварэння відэа з тэксту: гід на 2026 год
Параўнайце найлепшыя бясплатныя AI-інструменты для стварэння відэа з тэксту ў 2026 годзе, уключаючы іх рэальныя ліміты крэдытаў, вадзяныя знакі, кампрамісы лакальнага запуску і практычны план тэставання.

Магчымасці Grok xAI для пераўтварэння выявы ў відэа: API-гайд за чэрвень 2026
Магчымасці Grok xAI для пераўтварэння выявы ў відэа ў чэрвені 2026: як Grok Imagine працуе з выявамі, промптамі, натыўным аўдыя, API-працэсамі, бяспекай, логікай цэнаўтварэння і параўнаннямі з Sora/Veo.