Tavus Phoenix-4: Эмоцыйны інтэлект у рэальным часе сустракаецца з відэа ІІ
Tavus запусцила Phoenix-4, модэль на аснове Gaussian-дыфузіі, якая рэндэрыць людскія абліччы у рэальным часе пры 1080p/40fps з кантролем эмоцый. Вось што гэта значыць для будучыні відэа ІІ.

Ад кліпаў да разавораў
Прастора відэа ІІ была запёрта ў гонцы ўзбраення па разрэшэнню, трывалясці і верасці. Kling 3.0 вывяла родное 4K. Seedance 2.0 выклікала судовыя іскі Голівуда. Sora 2 заключыла угоду з Disney. Усе імпрацыўна, усе сцёгуцца адному шаблёну: увядзіце запыт, чакайце, атрымайце відэа.
Phoenix-4 парушае гэты шаблён. Выпушчаная 18 лютага 2026 года, гэта першая модэль, распрацавана для рэндэрынгу чалавека ў рэальным часе з эмоцыйным інтэлектам. Замест стварэння 10-секунднага кліпа за 30 секунд яна рэндэрыць поўнае абліччо 1080p пры 40 кадрах за секунду з адставаннем менш за 600 мілісекунд.
Гэта не генератар відэа. Гэта рушак прысутнасці.
Архітэктура: тры модэлі ў гармоніі
То, што робіць Phoenix-4 тэхнічна цікавай, гэта яе трохступеньчаты канвэйер, кожная кампанента апрацоўвае адасоблены аспект людскога спілкавання.
Raven-1: сприйнятнасць эмоцый
Першая модэль ў стэку гэта Raven-1, модуль сприйнятнасці, які аналізуе ваш відэапотік ў рэальным часе. Яна выяўляе мімічныя вырасы, тон голаса і сігналы разавора для пабудовы перапыннай карты эмоцыйнага стану.
Гэта не простая аналіз настрою. Raven-1 адсочвае мікравырасы, тривалас паўз, тэмп мовы і кірунак позёра. Вынік гэта многамерны вектар эмоцый, які подаецца ў канвэйер рэндэрынгу.
Sparrow-1: час разавора
Другая кампанента, Sparrow-1, вырэшае найнедааціненую праблему ў разавораўным ІІ: веданне калі гаворыць. Сучасныя голасавыя дапаможнікі або перарыважцамуць вас, або чакаюць занадта доўга. Sparrow-1 выкарыстоўвае архітэктуру поўнадуплекснай сувязі, якая адначасова слухае і гавора, адзеркаляючы то, як людзі насапраўды разаварываюць.
Яна прадказвае сігналы змены роляў, кіруе зваротнымі сігналамі (ківанні, эквіваленты "мм-гм"), і рэгулюе час адказу на аснове эмоцыйнага стану ад Raven-1. Калі вы робіце паўзу таму што думаеце, яна чакае. Калі вы робіце паўзу таму што збентэжаны, яна ўзбагачае.
Phoenix-4: рэндэрынг на аснове Gaussian-дыфузіі
Сама модэль рэндэрынгу выкарыстоўвае гібрідны падыход Gaussian-дыфузіі. Традыцыйныя модэлі дыфузіі занадта павольны для выкарыстання ў рэальным часе. Чысты методы Gaussian не маюць якасці дэталяў дыфузіі. Phoenix-4 аб'ядноўвае оба: выкарыстоўвае Gaussian splatting для базавай геаметрыі і адсочвання ў рэальным часе, потым прымяняе ўтачненне дыфузіі целявым спосабам на крытычных для вырасу абласцях (вочы, рот, брвы).
API кантролю эмоцый
Для разгарнікаў найпрактычнейшая функцыя гэта API кантролю эмоцый. Замест того каб дазволіць ІІ самастойна эмоцыйнець, вы можаце праграмна вказаць целявыя эмоцыі.
{
"emotion": "empathetic_concern",
"intensity": 0.7,
"transition_speed": "gradual",
"micro_expressions": true
}API падтрымлівае больш за дзесяць эмоцыйных станаў, уключаючы радасць, смутак, гнеў, здзіўленне, страх, узбуджэнне, цікавасць і задаволенне, з кантролем інтэнсіўнасці і змяшаннем. Аватар службы падтрымкі можа перамяніцца ад дружалюбнасці да суспаструёння калі выяўляе разачаванне ў голасе таго, хто дзваніць.
Менавіта тут трохступеньчаты канвэйер окупаецца. Raven-1 выяўляе эмоцыйны стан карыстальніка, правілы разгарніка вызначаюць адпаведную эмоцыйную рэакцыю, і Phoenix-4 рэндэрыць яе ў рэальным часе.
Цыфровыя двойнікі за дзве хвіліны
Адно з найбольш імпрацыўных тведжэнняў: Phoenix-4 можа стварыць карыстацкага цыфровага двойніка ўсяго з двух хвілін відэазапісу. Загружайце кароткае відэа з вамі, што гавораце, і сістэма выймае дастатково геаметрыі абліччя, дыяпазону вырасаў і характарыстык голаса для стварэння аватара ў рэальным часе.
Якас поква не на ўзроўні кінэматаграфічных VFX. У дэманстрацыях цыфровыя двойнікі паказваюць выпадковыя артэфакты вакол хуткіх рухаў галавы і складаных переходаў асвятлення. Але для відэавызваў, службы падтрымкі і прэзентацый прадажу вернасць больш ніж дастаточна.
Чаму гэта важна для відэа ІІ
Phoenix-4 прадстаўляе разшыренне катэгорыі для відэа ІІ. Да гэтага кожная вялікая модэль была сфакусавана на стварэнні контэнту: стварэнне кліпаў, абвяшчэнняў, короткамэтражных фільмаў, постаў ў сецівах. Phoenix-4 сфакусавана на камунікацыі, намнога больш ёмкім рынку прамой відэавзаемадзеяння.
Разгледзім варыянты выкарыстання:
Служба падтрымкі кліентаў
- 24/7 падтрымка на аснове відэа
- Эмоцыйна адзіўчывая, не робат
- Масштабуецца без найму
Прадажа
- Персаналізаваныя відэадэманстрацыі
- Прадстаўнікі аватараў на розных мовах
- Заўсёды даступныя, заўсёды па бренду
Адукацыя
- ІІ-рэпетытары, якія выяўляюць замішанне
- Адаптыўны тэмп на аснове залучэння
- Пастаянны прысутнасць выкладчыка
Аховоў здаровяй
- Інтэрв'ю пры прыёмзе пацыентаў
- Супаўцы праверкі сьпённевага здаровяй
- Даступныя інтэрфейсы тэлемэдыцыны
Рынак відэа ў рэальным часе для разавораў прынцыпова адрозніваецца ад рынку стварэння кліпаў. Ён менш творчы, але больш камэрцыйна безпаслерэдны. Кампаніі, якія зараз выдаткуюць на ліцэнзіі Zoom, персанал кол-цэнтраў і вырабленне відэа для падтрымкі прадажу, з'яўляюцца першымі мішэннямі.
Тэхнічныя абмежаванні, на якія варта звярнуць увагу
Phoenix-4 не без абмежаванняў. Цяперашняя версія працуе выключна з сцэнарыямі з адным абліччам фронтальна. Многалюдныя разаворы, поўнатэльны рэндэрынг і складаныя фоны не падтрымліваюцца.
| Магчымасць | Статус |
|---|---|
| Рэндэрынг адзінага абліччя | Падтрымліваецца (1080p, 40fps) |
| Кантроль эмоцыйнага вырасу | Падтрымліваецца (10+ эмоцыйных станаў) |
| Сінтэз голаса ў рэальным часе | Падтрымліваецца (поўнадуплексны) |
| Сцэны з некалькімі людзьмі | Не падтрымліваецца |
| Поўнатэльны рэндэрынг | Не падтрымліваецца |
| Складаныя фоны | Абмежаваны (толькі статычныя фоны) |
| Развёртванне ў аўтаномным рэжыме/крайовым | Недаступна (толькі хмарны API) |
Патрабаванне толькі хмары значыць, што адставанне залежыць ад якасці мережы. Tavus паведамляе пра наскрозь адставанне менш за 600ms ў оптымальных умовах, але рэальная прадуктыўнасць будзе варыяваць. Для прыладаў чутлівых да адставання, такіх як прамыя вызвы служб падтрымкі, развёртванне на крайовых вузлах у канцавым выніку будзе неабходна.
Больш яемыя схемы
Phoenix-4 прыбыває ў пункт пераламу. Прастора папярэдне адрэндэранага відэа ІІ пераполнена, з дзесяцкамі модэляй, якія канкуруюць па разрэшэнню, тривалясці і стылю. Але відэа ў рэальным часе для разавораў амаль пусто. Tavus сцякаецца з абмежаванай прамой канкурэнцыяй, пры гэтым большасць альтэрнатыў гэта простыя накладанні сінхранізацыі губ, а не поўныя сістэмы рэндэрынгу эмоцый.
Пытанне палягае ў тым, ці можа масштабаваць трохступеньчаты архітэктура. Адначасовае запушчанне Raven-1, Sparrow-1 і Phoenix-4 вымагае значных вычаліцельных рэсурсаў. Зарэ сёння гэтыя вычаленні знаходзяцца ў хмары Tavus. Прывяденне іх бліжэй да краю, або аптымізацыя для спажывацкага абсталявання, адкрые зусім новыя сцэнарыі развёртвання.
Для ширшай індустрыі відэа ІІ, Phoenix-4 сігналізуе, што наступная мяжа гэта не проста лепш відэа. Гэта відэа як інтэрфейс ў рэальным часе, дзе ІІ не стварае контэнт для вас, а спілкуецца з вамі.
Phoenix-4 даступна праз Tavus API. Стварэнне цыфровага двойніка вымагае загрузкі двуххвіліннага відэа. Дэталяльная інфармацыя аб ціноўцэнаванні даступна на іх портале для разгарнікаў.

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.
View profile →Спадабалася прачытанае?
Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.
Падобныя артыкулы
Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Helios: Модэль з 14B параметрамі, якая генеруе відэа ў рэжыме рэальнага часу на споживацкім абсталяванні
Helios ад Пекінскага ўніверсітэта, ByteDance і Canva стварае хвілінныя AI-відэа зь скорасцю 19,5 FPS, патрабуючы толькі 6 ГБ VRAM, і гэта цалкам адкрыты код.

Цэны на AI Video Tools у 2026: як планаваць бюджэт без марнавання крэдытаў
Інструменты AI video больш не цяжка знайсці. Складана выбраць правільную мадэль цэнаўтварэння для вашага workflow. Вось практычны гід па бюджэтаванні для стваральнікаў і каманд.

SkyReels V4: першая ШІ-мадэль, якая адначасова бачыць і чуе
SkyReels V4 ад Skywork AI прадстаўляе двухструменевую дыфузійную архітэктуру, якая разам генеруе відэа і сінхронны гук за адзін праход. Вось што гэта значыць для аўтараў.