Meta PixelUgrás a fő tartalomra
AlexisAlexis· MI-szerző, ember által ellenőrizve
6 min read
1146 szó

Tavus Phoenix-4: Valós idejű érzelmi intelligencia és AI videó

A Tavus elindította a Phoenix-4-et, egy Gaussian-diffúzió modellt, amely valós időben rendereli az emberi arcokat 1080p/40fps-nél érzelmi kontrollal. Íme, mit jelent ez az AI videó jövőjére.

Tavus Phoenix-4: Valós idejű érzelmi intelligencia és AI videó

Készen állsz saját MI-videók készítésére?

Csatlakozz a Bonega.ai-t használó alkotók ezreihez

A 2026-os év minden nagy AI videó modellje egy célra koncentrált: jobb előre renderelt klipek létrehozása. A Tavus teljesen más kérdést tett fel: mi lenne, ha az AI videó valós időben történne, és közben képes lenne az érzelmeidet olvasni?

A klipektől a beszélgetésekig

Az AI videó tere versenyfutásban ragadt meg a felbontás, az időtartam és a hűség terén. A Kling 3.0 natív 4K-t nyomott. A Seedance 2.0 Hollywood pereket váltott ki. A Sora 2 Disney szerződést kötött. Mindez lenyűgöző, mindez ugyanazt a sablont követi: gépeljen be egy promptot, várjon, kapjon egy videót. A Phoenix-4 megtöri ezt a mintát. A 2026. február 18-án kiadott modell az első, amely valós idejű emberi renderelésre és érzelmi intelligenciára van tervezve. Ahelyett, hogy 10 másodperces klipet 30 másodperc alatt generálna, egy teljes 1080p arcot renderel 40 képkocka/másodperccel és 600 milliszekundum alatti latenenciával. Ez nem videógenerátor. Ez egy jelenlét motor.

💡
A Phoenix-4 nem verseng a Sorával, a Veóval vagy a Klinggel. Teljesen más kategóriát foglal el: valós idejű szóbeli videó, ahol az AI a beszédedre válaszol.

Az architektúra: Három modell harmóniában

Az, ami a Phoenix-4 technikai szempontból érdekes, az a háromkomponensű pipeline, ahol minden egyes komponens az emberi kommunikáció egy-egy részéhez tartozik.

Végpont-végpont latenencia
40fps
Renderelési képkockaszám
1080p
Kimeneti felbontás
2 min
Digitális ikerképzés ideje

Raven-1: Érzelmi észlelés

A verem első modellje a Raven-1, egy olyan érzékelő modul, amely valós időben elemzi a felhasználó videóadatfolyamát. Arcmimikákat, szóban kifejezéseket és beszélgetési jeleket detektál, hogy egy folyamatos érzelmi állapotleképezést készítsen. Ez nem egyszerű hangulat-elemzés. A Raven-1 mikromimikákat, szünet időtartamát, beszéd ritmusát és tekintet irányát követi nyomon. A kimenet egy sokdimenziós érzelmi vektor, amely a renderelési pipelinebe táplálódik.

Sparrow-1: Szóbeli időzítés

A második komponens, a Sparrow-1, a szóbeli AI-ben leginkább alábecsült problémával foglalkozik: tudni, hogy mikor kell beszélni. A jelenlegi hangsegédek vagy megzavarnak téged, vagy túl sokáig várnak. A Sparrow-1 egy full-duplex architektúrát használ, amely egyidejűleg hallgat és beszél, tükrözve az igazi emberi beszélgetést. Megjósolja a közbeszólási jeleket, kezeli a háttér jelzéseket (fejbólintás, „mm-hmm" ekvivalensek), és az érzelmi állapot alapján módosítja a válaszidőzítést a Raven-1-ből. Ha szünetet tarthatsz, mert gondolkodsz, vár. Ha szünetet tarthatsz, mert zavaros vagy, tisztázza.

Phoenix-4: Gaussian-diffúzió renderelés

A renderelési modell egy Gaussian-diffúzió hibrid megközelítést használ. A hagyományos diffúzió modellek túl lassúak a valós idejű használathoz. A tisztán Gaussian módszerek hiányoznak a diffúzió részletminőségéből. A Phoenix-4 mindkettőt kombinál: Gaussian splatting-et használ az alapgeometriához és a valós idejű nyomon követéshez, majd szelektíven alkalmazott diffúzió-finomítást az érzelmi kifejezésre kritikus régiókban (szemek, száj, szemöldök).

💡
A kulcs gondolat a szelektív diffúzió. Ahelyett, hogy teljes diffúzió passzust futatnál minden képkockán, a Phoenix-4 csak ott alkalmazza, ahol az érzelmi kifejezés finom részleteket igényel. Ez tartja az latenciát 600 milliszekundum alatt, miközben megőrzi a vizuális minőséget.

Az érzelmi kontroll API

A fejlesztők számára a legpraktikusabb funkció az érzelmi kontroll API. Ahelyett, hogy hagynád az AI-t dönteni az érzelmi kifejezésről, programozottan meghatározhatod a cél érzelmi állapotot.

{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}

Az API több mint tíz érzelmi állapotot támogat, beleértve a radságot, szomorúságot, haragot, meglepetést, félelmet, izgalmat, kíváncsiságot és megelégedettséget, intenzitás-szabályozással és keveredéssel. Egy ügyfélszolgálati avatar áttérhet barátságosról empátiára, amikor a hívó hangjában frusztráció jelentkezik. Itt fizet meg az hárommodell pipeline. A Raven-1 detektálja a felhasználó érzelmi állapotát, a fejlesztő szabályai meghatározzák a megfelelő válaszemzezést, a Phoenix-4 pedig valós időben rendereli azt.

Digitális ikerképzés két perc alatt

Az egyik legszembetűnőbb állítás: a Phoenix-4 egyéni digitális ikert tud létrehozni mindössze két perc felvételből. Töltsd fel egy rövid videót magadról, amint beszélsz, és a rendszer elég arcgeometriát, kifejezési tartományt és hangkarakterisztikát von ki egy valós idejű avatar generálásához.

Hagyományos avatar létrehozás
3D szkennelés órái, FACS rigging, kézi kifejezés leképezés, hangfelvételi munkamenetek
Phoenix-4 megközelítés
Kétperces videó feltöltése, geometria, kifejezések és hang automatikus kinyerése valós idejű rendereléshez

A minőség még nem film VFX szinten van. A demókban a digitális ikrek esetenként műtermékeket mutatnak a gyors fejmozdulatok és összetett megvilágítási átmenetek körül. De videohívások, ügyfélszolgálat és értékesítési bemutatók számára a hűség több mint elegendő.

Miért számít ez az AI videóhoz

A Phoenix-4 az AI videóhoz egy kategória kiterjesztést jelent. Eddig minden nagy modell a tartalomkészítésre összpontosított: klipek, hirdetések, rövidfilmek, közösségi médiás bejegyzések készítése. A Phoenix-4 a kommunikációra összpontosít, az élő videó interakció sokkal nagyobb piacára. Vegyük fontolóra a felhasználási eseteket:

Ügyfélszolgálat

  • 24/7 videó alapú támogató ügynökök
  • Érzelmileg érzékeny, nem robotikus
  • Skálázhatóság felvételek nélkül

Értékesítés

  • Személyre szabott videó demók
  • Többnyelvű avatar képviselők
  • Mindig elérhető, mindig márkamegfelelő

Oktatás

  • AI oktatók, akik detektálják a zavart
  • Adaptív tempó az elköteleződés alapján
  • Konzisztens tanítási jelenlét

Egészségügy

  • Beteg bevonási interjúk
  • Mentális egészség bejelentkezési társak
  • Hozzáférhető telehealth felületek

A valós idejű szóbeli videó piaca alapvetően eltér a klip-generálási piactól. Kevésbé kreatív, de kereskedelmileg közvetlen. Az olyan vállalkozások, amelyek jelenleg Zoom licencelésre, hívóközponti személyzetre és értékesítési korábbiakra fordítanak, az első célpontok.

Technikai korlátozások figyelemmel kíséréshez

A Phoenix-4 nem korlátok nélkül működik. A jelenlegi verzió kizárólag egyarcú, előre nézett forgatókönyvekre működik. A többszemélyes beszélgetések, teljes test renderelése és összetett háttér nem támogatottak.

KépességÁllapot
Egyarcú renderelésTámogatott (1080p, 40fps)
Érzelmi kifejezés kontrollTámogatott (10+ érzelmi állapot)
Valós idejű beszédszintézisTámogatott (full-duplex)
Többszemélyes jelenetekNem támogatott
Teljes test rendereléseNem támogatott
Összetett háttérekKorlátozott (csak statikus háttérek)
Offline/peremhálózat telepítésNem elérhető (csak felhő API)

A csak felhő követelmény azt jelenti, hogy a latenencia a hálózati minőségtől függ. A Tavus <600 ms végpontot végpontig jelent az optimális körülmények között, de a valós teljesítmény eltérő lesz. Az olyan latenencia-érzékeny alkalmazásokhoz, mint az élő ügyfélhívások, végül peremhálózat telepítésre lesz szükség.

A nagyobb kép

A Phoenix-4 egy inflexiós ponton érkezik meg. Az előre renderelt AI videó tere zsúfolt, tucatnyi modell verseng a felbontás, az időtartam és a stílus terén. De a valós idejű szóbeli videó szinte üres. A Tavus korlátozott közvetlen versegénnyel szemben néz, az alternatívák többsége egyszerű ajak-szinkronizálás helyett, nem teljes érzelmi renderelési rendszert. A kérdés az, hogy az hárommodell architektúra képes-e skálázódni. A Raven-1, Sparrow-1 és Phoenix-4 egyidejű futtatása jelentős számítási teljesítményt igényel. Jelenleg ez a számítási teljesítmény a Tavus felhőjében található. Ha közelebb viszik a peremhez, vagy a fogyasztói hardverhez optimalizálják, teljesen új telepítési forgatókönyveket nyitnának meg. Az AI videó iparág szélesebb körében a Phoenix-4 jelzi, hogy a következő határvidék nem csak jobb videók. Ez valós idejű interfészként működő videó, ahol az AI nem neked készít tartalmat, hanem veled kommunikál.

💡
Az AI videó modellek architektúrájának fejlődéséről szóló további információkért tekintsd meg a diffúzió transzformátorok részletezéséről szóló cikkünket és az világmodellek felé való elmozdulást.

A Phoenix-4 a Tavus API segítségével érhető el. A digitális ikrekhez kétperces videó feltöltése szükséges. A díjszabás részletei a fejlesztői portálján érhetők el.

Alexis
AlexisAI EngineerAI Author

Lausanne-i MI-mérnök, aki a kutatási mélységet gyakorlati innovációval ötvözi. Idejét modellarchitektúrák és alpesi csúcsok között osztja meg.

View profile →

Tetszett, amit olvastál?

Alakítsd ötleteidet korlátlan hosszúságú MI-videókká percek alatt.

Kapcsolódó cikkek

Folytasd a felfedezést ezekkel a kapcsolódó bejegyzésekkel

Tetszett ez a cikk?

Fedezz fel további hasznos információkat, és maradj naprakész legújabb tartalmainkkal.