Meta PixelПерайсці да асноўнага змесціва
AlexisAlexis· аўтар ШІ, праверана чалавекам
7 min read
1298 слоў

EPFL Stable Video Infinity: як Error Recycling вырашае найбуйнейшую праблему AI-відэа

Новы даклад ICLR 2026 Oral ад EPFL прадстаўляе error recycling, тэхніку, якая ліквідуе часавы дрэйф і дазваляе генераваць шматхвілінныя AI-відэа без дадатковых выдаткаў на вылічэнні.

EPFL Stable Video Infinity: як Error Recycling вырашае найбуйнейшую праблему AI-відэа

Гатовыя ствараць уласныя ШІ-відэа?

Далучайцеся да тысяч стваральнікаў, якія карыстаюцца Bonega.ai

У кожнай мадэлі AI-відэа ёсць адзін непрыемны сакрэт. Згенеруйце 4-секундны кліп, і вынікі выглядаюць уражліва. Перайдзіце за мяжу 15 секунд, і персанажы пачынаюць змяняцца, фізіка ламаецца, колеры зрушваюцца, а ўся сцэна губляе цэласнасць. VITA Lab у EPFL толькі што апублікавала рашэнне, і гэта можа быць найважнейшая праца ў генерацыі відэа ў гэтым годзе.

Праблема дрэйфу, якую ніхто не вырашыў

Калі вы спрабавалі генераваць доўгафарматнае AI-відэа любой сучаснай мадэллю, вы ведаеце гэта расчараванне. Sora 2 абмяжоўваецца 15-25 секундамі залежна ад вашага плана. Runway Gen-4.5 дасягае максімуму ў 10. Kling 3.0 дае 15. Прычына не ў вылічэннях і не ў памяці. Гэта часавы дрэйф.

💡

Часавы дрэйф узнікае, калі аўтарэгрэсіўныя відэамадэлі назапашваюць дробныя памылкі кадр за кадрам. Кожны згенераваны кадр становіцца ўваходнымі данымі для наступнага, а нязначныя недасканаласці ўзмацняюцца экспаненцыяльна. Праз некалькі сотняў кадраў вынік ужо ледзь нагадвае зыходны запыт.

Гэта ў сваёй аснове падобна да праблемы "сапсаванага тэлефона". Перадайце паведамленне шэптам праз дастаткова шмат людзей, і яно стане непазнавальным. Папярэднія падыходы спрабавалі змагацца з дрэйфам, генеруючы карацейшыя кліпы і зшываючы іх разам, але швы бачныя. Іншыя выкарыстоўвалі іерархічную генерацыю (спачатку ключавыя кадры, потым інтэрпаляцыя), што дапамагае, але не ліквідуе галоўную праблему.

Знаёмцеся, Error Recycling

Артыкул пад назвай "Stable Video Infinity", прыняты як вусная прэзентацыя ICLR 2026, прадстаўляе падманліва простую ідэю: навучыць мадэль спраўляцца са сваімі ўласнымі памылкамі.

Oral
Статус ICLR 2026
0
Дадатковыя выдаткі на вылічэнні
Minutes
Працягласць відэа

Вось ключавое разуменне. Падчас навучання стандартныя мадэлі дыфузіі відэа вучацца на чыстых даных ground truth. Яны ніколі не бачаць уласны згенераваны вынік. Пры разгортванні ім раптам даводзіцца працаваць са сваімі недасканалымі прагнозамі як з уваходнымі данымі, і яны не ведаюць, як апрацоўваць шум.

Error recycling выпраўляе гэта з дапамогай змены цыкла навучання:

Крок 1

Стандартны прамы праход

Мадэль генеруе відэасегмент з чыстых навучальных даных.

Крок 2

Збор памылак

Уласныя прагнозы мадэлі (з іх недасканаласцямі) захоўваюцца, а не адкідваюцца.

Крок 3

Паўторнае выкарыстанне памылак

Гэтыя недасканалыя вынікі падаюцца назад як уваходныя даныя для наступнай ітэрацыі навучання, навучаючы мадэль ствараць стабільны вынік нават з шумных, самастойна згенераваных кадраў.

Крок 4

Ітэрацыйнае ўдасканаленне

На працягу многіх цыклаў навучання мадэль асвойвае надзейны механізм самакарэкцыі, які прадухіляе назапашванне памылак.

Прыгажосць гэтага падыходу ў яго элегантнасці. Няма новых архітэктур мадэляў, дадатковых параметраў ці прыёмаў падчас інферэнсу. Мадэль проста вучыцца падчас навучання таму, як выглядаюць рэальныя ўмовы разгортвання.

Чаму гэта важней, чым вам здаецца

Наступствы выходзяць далёка за межы генерацыі даўжэйшых відэа з катамі. Вось што змяняецца:

Да Error Recycling

  • Відэамадэлі абмежаваныя 4-20 секундамі
  • Цэласнасць сцэны хутка пагаршаецца
  • Ідэнтычнасць персанажа губляецца праз некалькі секунд
  • Фізіка становіцца ўсё менш рэалістычнай
  • Колер і асвятленне змяняюцца непрадказальна

Пасля Error Recycling

  • Узгодненая генерацыя відэа працягласцю ў некалькі хвілін
  • Стабільны выгляд персанажа на працягу ўсяго відэа
  • Паслядоўная фізіка і прасторавыя сувязі
  • Надзейная колеравая карэкцыя і асвятленне
  • Няма бачнай страты якасці з часам

Лічбы

Каманда VITA Lab пратэставала Stable Video Infinity на некалькіх архітэктурах і бенчмарках. Вынікі ўражваюць:

МетрыкаБез Error RecyclingЗ Error RecyclingПаляпшэнне
FVD (ніжэй лепш)Пагаршаецца пасля 4sСтабільны да 2min+Значнае
Паслядоўнасць персанажаПадае ніжэй за 60% на 15sЗахоўвае 90%+ на 2min~50% адносна
Часавая ўзгодненасцьБачны дрэйф на 8sНяма бачнага дрэйфу на 2minЯкасны скачок
Накладныя выдаткі на вылічэнніБазавы ўзровеньБазавы ўзровень (рост на 0%)Нулявы кошт
💡

Аспект нулявых дадатковых выдаткаў на вылічэнні мае вырашальнае значэнне. Error recycling з'яўляецца тэхнікай этапу навучання, а не інферэнсу. Пасля навучання мадэль працуе сапраўды з той жа хуткасцю і коштам, што і раней.

Як працуе Error Recycling на тэхнічным узроўні

Для тых, хто хоча тэхнічныя дэталі, вось што адбываецца ў змененым канвееры навучання.

Стандартнае навучанне дыфузіі відэа выкарыстоўвае расклад шуму epsilon, які прымяняецца да чыстых кадраў ground truth x_0. Мадэль вучыцца прадказваць шум і аднаўляць зыходны сігнал. Падчас інферэнсу мадэль аўтарэгрэсіўна генеруе кадр t+1, абапіраючыся на свой прагноз кадра t.

Разрыў паміж навучаннем (чыстыя ўваходныя даныя) і інферэнсам (самастойна згенераваныя ўваходныя даныя) называецца зрушэннем экспазіцыі. Error recycling наўпрост вырашае гэтую праблему.

Тэхнічныя дэталі: змененая мэта навучання

Падчас навучання мадэль перыядычна генеруе кадры, выкарыстоўваючы ўласныя бягучыя вагі замест даных ground truth. Гэтыя самастойна згенераваныя кадры, разам з іх недасканаласцямі, потым выкарыстоўваюцца як умоўныя ўваходныя даныя для наступных кадраў у навучальнай паслядоўнасці.

Ключавы гіперпараметр, гэта каэфіцыент паўторнага выкарыстання r, які вызначае, як часта самастойна згенераваныя кадры замяняюць кадры ground truth падчас навучання. Артыкул выяўляе, што r = 0.3 (30% кадраў, якія выкарыстоўваюцца паўторна) дасягае аптымальнай прадукцыйнасці, балансуючы паляпшэнне стабільнасці і якасць навучальнага сігналу.

Змененая функцыя стратаў застаецца стандартнай мэтай дыфузіі. Адзіная розніца, гэта размеркаванне даных, якое мадэль бачыць падчас навучання. Менавіта таму падчас інферэнсу няма дадатковых вылічальных выдаткаў.

Канцэптуальна гэта падобна да scheduled sampling у мадэлях sequence-to-sequence, але адаптавана для бесперапыннай дыфузійнай структуры. Каманда VITA Lab адзначае гэту сувязь у сваім артыкуле, падкрэсліваючы, што наіўнае прымяненне scheduled sampling да дыфузійных мадэляў не працуе. Іх унёсак, гэта канкрэтная фармулёўка, якая робіць метад стабільным для генерацыі відэа.

Перавага open-source

Мабыць, найбольш захапляльны аспект: код цалкам open-source на GitHub (vita-epfl/Stable-Video-Infinity). Гэта азначае, што любая даследчая лабараторыя або кампанія можа прымяніць error recycling да сваіх існуючых відэамадэляў.

Чаму open-source мае значэнне
Любую існуючую мадэль дыфузіі відэа можна дапрацаваць з дапамогай error recycling. Змены архітэктуры не патрэбныя, дастаткова змененага цыкла навучання. Гэта можа адначасова палепшыць Sora, Runway, Kling і кожную open-source мадэль.
Практычныя абмежаванні
Патрабуецца перанавучанне або тонкая налада мадэлі. Кампаніям з прапрыетарнымі мадэлямі трэба інвеставаць вылічальныя рэсурсы ў перанавучанне. Эфектыўнасць тэхнікі можа адрознівацца ў розных архітэктурах і маштабах.

Рэліз open-source працягвае нарастальны трэнд у супольнасці даследаванняў AI-відэа. Такія мадэлі, як LTX-2 і Wan 2.6, паказалі, што open-source падыходы могуць канкураваць з прапрыетарнымі альтэрнатывамі.

Што гэта азначае для індустрыі

Час з'яўлення тэхналогіі ўражвае. Мы знаходзімся ў разгар гонкі ўзбраенняў у AI-відэа, дзе кожны буйны гулец, ад Runway да ByteDance, імкнецца да даўжэйшага і якаснейшага выніку. Error recycling можа стаць адсутным элементам, які адкрые наступнае пакаленне магчымасцяў.

🎬

Для рэжысёраў і творцаў

Узгодненая генерацыя доўгафарматнага відэа дазваляе ствараць сапраўдны наратыўны кантэнт. Не толькі кліпы, але і сцэны, паслядоўнасці, а з часам і кароткаметражныя фільмы, згенераваныя з аднаго запыту.
🔬

Для даследчыкаў

Error recycling прапануе абагульняльную структуру. Той жа прынцып можна прымяніць да генерацыі аўдыя, сінтэзу 3D-сцэн і любой аўтарэгрэсіўнай генератыўнай мадэлі, якая пакутуе ад дрэйфу.
🏢

Для прадпрыемстваў

Стабільная доўгафарматная генерацыя робіць AI-відэа прыдатным для прафесійных выпадкаў выкарыстання: дэманстрацый прадуктаў, навучальных відэа, маркетынгавых кампаній, якім патрэбная стабільная якасць на працягу некалькіх хвілін кантэнту.

Наперадзе

Праца VITA Lab азначае фундаментальны зрух у тым, як мы думаем пра генерацыю AI-відэа. Замест стварэння ўсё большых мадэляў або дадання складаных механізмаў інферэнсу рашэнне палягала ў тым, каб проста паказаць мадэлі, як выглядае яе ўласны вынік.

Артыкул будзе прадстаўлены на ICLR 2026, і некалькі крыніц у індустрыі мяркуюць, што буйныя пастаўшчыкі відэамадэляў ужо вывучаюць інтэграцыю. Калі world models прадстаўляюць будучыню таго, як AI разумее фізіку і прастору, error recycling прадстаўляе будучыню таго, як AI захоўвае гэта разуменне з цягам часу.

Эра 4-секундных AI-відэа можа скончыцца раней, чым хтосьці чакаў. І для гэтага не спатрэбяцца новая архітэктура мадэлі або мільярдны бюджэт на вылічэнні. Толькі разумнейшы цыкл навучання.

Дадатковае чытанне


Крыніцы

Alexis
AlexisAI EngineerAI Author

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.

View profile →

Спадабалася прачытанае?

Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.

Падобныя артыкулы

Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Бясплатныя неабмежаваныя інструменты для AI-відэа: што працуе ў 2026 годзе
Бясплатныя інструментыAI-відэа

Бясплатныя неабмежаваныя інструменты для AI-відэа: што працуе ў 2026 годзе

Бясплатныя неабмежаваныя інструменты для AI-відэа звычайна працуюць праз чаргу або лакальна. Даведайцеся, што сапраўды з'яўляецца неабмежаваным, што запавольвае працу і як выбраць працаздольную канфігурацыю ў 2026 годзе.

Read
Найлепшыя бясплатныя AI-інструменты для стварэння відэа з тэксту: гід на 2026 год
AI-відэаБясплатныя інструменты

Найлепшыя бясплатныя AI-інструменты для стварэння відэа з тэксту: гід на 2026 год

Параўнайце найлепшыя бясплатныя AI-інструменты для стварэння відэа з тэксту ў 2026 годзе, уключаючы іх рэальныя ліміты крэдытаў, вадзяныя знакі, кампрамісы лакальнага запуску і практычны план тэставання.

Read
Магчымасці Grok xAI для пераўтварэння выявы ў відэа: API-гайд за чэрвень 2026
AI-відэаxAI

Магчымасці Grok xAI для пераўтварэння выявы ў відэа: API-гайд за чэрвень 2026

Магчымасці Grok xAI для пераўтварэння выявы ў відэа ў чэрвені 2026: як Grok Imagine працуе з выявамі, промптамі, натыўным аўдыя, API-працэсамі, бяспекай, логікай цэнаўтварэння і параўнаннямі з Sora/Veo.

Read

Вам спадабаўся гэты артыкул?

Адкрыйце для сябе больш карыснай інфармацыі і сачыце за нашым новым кантэнтам.