Meta PixelПерайсці да асноўнага змесціва
AlexisAlexis· аўтар ШІ, праверана чалавекам
6 min read
1137 слоў

Tavus Phoenix-4: Эмоцыйны інтэлект у рэальным часе сустракаецца з відэа ІІ

Tavus запусцила Phoenix-4, модэль на аснове Gaussian-дыфузіі, якая рэндэрыць людскія абліччы у рэальным часе пры 1080p/40fps з кантролем эмоцый. Вось што гэта значыць для будучыні відэа ІІ.

Tavus Phoenix-4: Эмоцыйны інтэлект у рэальным часе сустракаецца з відэа ІІ

Гатовыя ствараць уласныя ШІ-відэа?

Далучайцеся да тысяч стваральнікаў, якія карыстаюцца Bonega.ai

Кожная вялікая модэль відэа ІІ у 2026 годзе была сфакусавана на адной мэце: стварэнне лепш адрэндэраных кліпаў. Tavus паставіла зусім іншае пытанне. Што калі б відэа ІІ адбывалася ў рэальным часе і маглі б чытаць вашы эмоцыі падчас гэтага?

Ад кліпаў да разавораў

Прастора відэа ІІ была запёрта ў гонцы ўзбраення па разрэшэнню, трывалясці і верасці. Kling 3.0 вывяла родное 4K. Seedance 2.0 выклікала судовыя іскі Голівуда. Sora 2 заключыла угоду з Disney. Усе імпрацыўна, усе сцёгуцца адному шаблёну: увядзіце запыт, чакайце, атрымайце відэа.

Phoenix-4 парушае гэты шаблён. Выпушчаная 18 лютага 2026 года, гэта першая модэль, распрацавана для рэндэрынгу чалавека ў рэальным часе з эмоцыйным інтэлектам. Замест стварэння 10-секунднага кліпа за 30 секунд яна рэндэрыць поўнае абліччо 1080p пры 40 кадрах за секунду з адставаннем менш за 600 мілісекунд.

Гэта не генератар відэа. Гэта рушак прысутнасці.

💡
Phoenix-4 не канкуруе з Sora, Veo або Kling. Яна займае зусім іншую катэгорыю: відэа ў рэальным часе для разавораў, дзе ІІ адказвае вам, калі вы гаворыце.

Архітэктура: тры модэлі ў гармоніі

То, што робіць Phoenix-4 тэхнічна цікавай, гэта яе трохступеньчаты канвэйер, кожная кампанента апрацоўвае адасоблены аспект людскога спілкавання.

Наскрозь адставанне
40fps
Частата рэндэрынгу
1080p
Разрэшэнне выхаду
2 min
Час навучання для цифровых двойнікаў

Raven-1: сприйнятнасць эмоцый

Першая модэль ў стэку гэта Raven-1, модуль сприйнятнасці, які аналізуе ваш відэапотік ў рэальным часе. Яна выяўляе мімічныя вырасы, тон голаса і сігналы разавора для пабудовы перапыннай карты эмоцыйнага стану.

Гэта не простая аналіз настрою. Raven-1 адсочвае мікравырасы, тривалас паўз, тэмп мовы і кірунак позёра. Вынік гэта многамерны вектар эмоцый, які подаецца ў канвэйер рэндэрынгу.

Sparrow-1: час разавора

Другая кампанента, Sparrow-1, вырэшае найнедааціненую праблему ў разавораўным ІІ: веданне калі гаворыць. Сучасныя голасавыя дапаможнікі або перарыважцамуць вас, або чакаюць занадта доўга. Sparrow-1 выкарыстоўвае архітэктуру поўнадуплекснай сувязі, якая адначасова слухае і гавора, адзеркаляючы то, як людзі насапраўды разаварываюць.

Яна прадказвае сігналы змены роляў, кіруе зваротнымі сігналамі (ківанні, эквіваленты "мм-гм"), і рэгулюе час адказу на аснове эмоцыйнага стану ад Raven-1. Калі вы робіце паўзу таму што думаеце, яна чакае. Калі вы робіце паўзу таму што збентэжаны, яна ўзбагачае.

Phoenix-4: рэндэрынг на аснове Gaussian-дыфузіі

Сама модэль рэндэрынгу выкарыстоўвае гібрідны падыход Gaussian-дыфузіі. Традыцыйныя модэлі дыфузіі занадта павольны для выкарыстання ў рэальным часе. Чысты методы Gaussian не маюць якасці дэталяў дыфузіі. Phoenix-4 аб'ядноўвае оба: выкарыстоўвае Gaussian splatting для базавай геаметрыі і адсочвання ў рэальным часе, потым прымяняе ўтачненне дыфузіі целявым спосабам на крытычных для вырасу абласцях (вочы, рот, брвы).

💡
Ключавы момант ў выбіральнай дыфузіі. Замест поўнага праходу дыфузіі на кожным кадры, Phoenix-4 прымяняе яе толькі дзе эмоцыйны вырас вымагае тонкіх дэталяў. Гэта трымае адставанне пад 600ms захаваючы якас візуалізацыі.

API кантролю эмоцый

Для разгарнікаў найпрактычнейшая функцыя гэта API кантролю эмоцый. Замест того каб дазволіць ІІ самастойна эмоцыйнець, вы можаце праграмна вказаць целявыя эмоцыі.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

API падтрымлівае больш за дзесяць эмоцыйных станаў, уключаючы радасць, смутак, гнеў, здзіўленне, страх, узбуджэнне, цікавасць і задаволенне, з кантролем інтэнсіўнасці і змяшаннем. Аватар службы падтрымкі можа перамяніцца ад дружалюбнасці да суспаструёння калі выяўляе разачаванне ў голасе таго, хто дзваніць.

Менавіта тут трохступеньчаты канвэйер окупаецца. Raven-1 выяўляе эмоцыйны стан карыстальніка, правілы разгарніка вызначаюць адпаведную эмоцыйную рэакцыю, і Phoenix-4 рэндэрыць яе ў рэальным часе.

Цыфровыя двойнікі за дзве хвіліны

Адно з найбольш імпрацыўных тведжэнняў: Phoenix-4 можа стварыць карыстацкага цыфровага двойніка ўсяго з двух хвілін відэазапісу. Загружайце кароткае відэа з вамі, што гавораце, і сістэма выймае дастатково геаметрыі абліччя, дыяпазону вырасаў і характарыстык голаса для стварэння аватара ў рэальным часе.

Традыцыйнае стварэнне аватара
Гадзіны 3D-сканавання, разметка FACS, ручнон распрацоўка вырасаў, сеансы запісу голаса
Падыход Phoenix-4
Загрузка двуххвіліннага відэа, аўтаматычнае выйманне геаметрыі, вырасаў і голаса для рэндэрынгу ў рэальным часе

Якас поква не на ўзроўні кінэматаграфічных VFX. У дэманстрацыях цыфровыя двойнікі паказваюць выпадковыя артэфакты вакол хуткіх рухаў галавы і складаных переходаў асвятлення. Але для відэавызваў, службы падтрымкі і прэзентацый прадажу вернасць больш ніж дастаточна.

Чаму гэта важна для відэа ІІ

Phoenix-4 прадстаўляе разшыренне катэгорыі для відэа ІІ. Да гэтага кожная вялікая модэль была сфакусавана на стварэнні контэнту: стварэнне кліпаў, абвяшчэнняў, короткамэтражных фільмаў, постаў ў сецівах. Phoenix-4 сфакусавана на камунікацыі, намнога больш ёмкім рынку прамой відэавзаемадзеяння.

Разгледзім варыянты выкарыстання:

Служба падтрымкі кліентаў

  • 24/7 падтрымка на аснове відэа
  • Эмоцыйна адзіўчывая, не робат
  • Масштабуецца без найму

Прадажа

  • Персаналізаваныя відэадэманстрацыі
  • Прадстаўнікі аватараў на розных мовах
  • Заўсёды даступныя, заўсёды па бренду

Адукацыя

  • ІІ-рэпетытары, якія выяўляюць замішанне
  • Адаптыўны тэмп на аснове залучэння
  • Пастаянны прысутнасць выкладчыка

Аховоў здаровяй

  • Інтэрв'ю пры прыёмзе пацыентаў
  • Супаўцы праверкі сьпённевага здаровяй
  • Даступныя інтэрфейсы тэлемэдыцыны

Рынак відэа ў рэальным часе для разавораў прынцыпова адрозніваецца ад рынку стварэння кліпаў. Ён менш творчы, але больш камэрцыйна безпаслерэдны. Кампаніі, якія зараз выдаткуюць на ліцэнзіі Zoom, персанал кол-цэнтраў і вырабленне відэа для падтрымкі прадажу, з'яўляюцца першымі мішэннямі.

Тэхнічныя абмежаванні, на якія варта звярнуць увагу

Phoenix-4 не без абмежаванняў. Цяперашняя версія працуе выключна з сцэнарыямі з адным абліччам фронтальна. Многалюдныя разаворы, поўнатэльны рэндэрынг і складаныя фоны не падтрымліваюцца.

МагчымасцьСтатус
Рэндэрынг адзінага абліччяПадтрымліваецца (1080p, 40fps)
Кантроль эмоцыйнага вырасуПадтрымліваецца (10+ эмоцыйных станаў)
Сінтэз голаса ў рэальным часеПадтрымліваецца (поўнадуплексны)
Сцэны з некалькімі людзьміНе падтрымліваецца
Поўнатэльны рэндэрынгНе падтрымліваецца
Складаныя фоныАбмежаваны (толькі статычныя фоны)
Развёртванне ў аўтаномным рэжыме/крайовымНедаступна (толькі хмарны API)

Патрабаванне толькі хмары значыць, што адставанне залежыць ад якасці мережы. Tavus паведамляе пра наскрозь адставанне менш за 600ms ў оптымальных умовах, але рэальная прадуктыўнасць будзе варыяваць. Для прыладаў чутлівых да адставання, такіх як прамыя вызвы служб падтрымкі, развёртванне на крайовых вузлах у канцавым выніку будзе неабходна.

Больш яемыя схемы

Phoenix-4 прыбыває ў пункт пераламу. Прастора папярэдне адрэндэранага відэа ІІ пераполнена, з дзесяцкамі модэляй, якія канкуруюць па разрэшэнню, тривалясці і стылю. Але відэа ў рэальным часе для разавораў амаль пусто. Tavus сцякаецца з абмежаванай прамой канкурэнцыяй, пры гэтым большасць альтэрнатыў гэта простыя накладанні сінхранізацыі губ, а не поўныя сістэмы рэндэрынгу эмоцый.

Пытанне палягае ў тым, ці можа масштабаваць трохступеньчаты архітэктура. Адначасовае запушчанне Raven-1, Sparrow-1 і Phoenix-4 вымагае значных вычаліцельных рэсурсаў. Зарэ сёння гэтыя вычаленні знаходзяцца ў хмары Tavus. Прывяденне іх бліжэй да краю, або аптымізацыя для спажывацкага абсталявання, адкрые зусім новыя сцэнарыі развёртвання.

Для ширшай індустрыі відэа ІІ, Phoenix-4 сігналізуе, што наступная мяжа гэта не проста лепш відэа. Гэта відэа як інтэрфейс ў рэальным часе, дзе ІІ не стварае контэнт для вас, а спілкуецца з вамі.

💡
Каб даведацца больш пра то, як развіваюцца архітэктуры модэляў відэа ІІ, гл. нашу разбоўку дыфузійных трансфармэраў і зсув у бок светавых модэляў.

Phoenix-4 даступна праз Tavus API. Стварэнне цыфровага двойніка вымагае загрузкі двуххвіліннага відэа. Дэталяльная інфармацыя аб ціноўцэнаванні даступна на іх портале для разгарнікаў.

Alexis
AlexisAI EngineerAI Author

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.

View profile →

Спадабалася прачытанае?

Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.

Падобныя артыкулы

Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Вам спадабаўся гэты артыкул?

Адкрыйце для сябе больш карыснай інфармацыі і сачыце за нашым новым кантэнтам.