Tavus Phoenix-4: Reaalajas tunnete intelligents ja AI-video
Tavus raieundas Phoenix-4, Gaussi-difusioonimudelit, mis renderdab inimeste nägusid reaalajal 1080p/40fps-ga tunneosalusega. Siin on, mida see AI-video tulevikule tähendab.

Klipidest vestlustesse
AI-videosüsteem on olnud lukustatud võistlusesse lahutuse, kestvuse ja ustava üle. Kling 3.0 tõukas omane 4K. Seedance 2.0 käivitas Hollywoodis kohtuasjad. Sora 2 sai Disney'i kokkulepet. Kõik muljetavaldavat, kõik sama malli järgi: tippige soov, oodake, saate video. Phoenix-4 katkestab selle mustri. Välja lastud 18. veebruaril 2026, see on esimene mudelid, mis on loodud reaalajas inimese renderdamiseks tunne intelligentsusega. Selle asemel, et luua 10-sekundiline klipp 30 sekundis, renderib see täielik 1080p nägu 40 kaadrile sekundis ja alla 600 millisekundi kõrvalekaldest. See ei ole videogeneraator. See on olemasolu mootor.
Arhitektuur: Kolm mudelit harmooniasse
Mis teeb Phoenix-4 tehislikust seisukohast huvitavat on kolmeosaline torujuhtme, kus iga komponent käsitleb inimkommunikatsiooni eraldiseisvat osa.
Raven-1: Tunne tajumine
Stogu esimene mudelid on Raven-1, tajumis moodul, mis analüüsib kasutaja videovoogu reaalajal. See tuvastab näoilmed, häälitsuse tooni ja vestluse vihje pidevale tunneseisundi kaardi koostamiseks. See ei ole lihtne sentimenti analüüs. Raven-1 jälgib mikro-ilmeid, pausi kestvust, kõne tempolauslaused ja pilgu suunda. Väljund on mitmejaoks tunne vektor, mis söödatakse renderdamise torujuhtmesse.
Sparrow-1: Vestluse ajaline
Teine komponent, Sparrow-1, käsitleb kõne AI-s kõige alahinnatud probleemi: teada, millal rääkida. Hetkeliste häälsassistendid kas katkestavad teid või ootavad liiga kaua. Sparrow-1 kasutab täis-dupleks arhitektuuri, mis kuulab ja räägib samaaegselt, peegeldades seda, kuidas inimesed tegelikult vestlevad. See ennustab pöördepointide vihjeseid, hallitseb tagaplaani signaalid (pea noogumine, „mm-hmm" samaväärsused), ja kohandab vastuseaega Raveni-1 tunne seisundil. Kui teete pausi, kuna mõtlete, ootab. Kui teete pausi, kuna olete segaduses, selgitab.
Phoenix-4: Gaussi-difusiooni renderdamine
Renderdamise mudelid ise kasutavad Gaussi-difusiooni-hübridi lähenemine. Tavapärased difusiooni mudeli on renderdamiseks liiga aeglasest. Puhas Gaussi meetodit puuduvad difusiooni üksikasjude kvaliteet. Phoenix-4 ühendab mõlemad: kasutab Gaussi õhksetamiseks alus geomeetrial ja reaalajas jälgimisele, siis rakendab difusiooni salvestamist sihtotstarbeliselt tunnetus avaldiste kriitilisels piirkondadel (silmad, suu, kulmud).
Tunne juhtimise API
Arendajatele on kõige praktilisem omadus tunne juhtimise API. Selle asemel, et lasta AI otsustada, kuidas tunneid väljendada, saate sihtotstarbelisest tunneid programmeeritult.
{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}API toetab rohkem kui kümmet tunne seisundit, sealhulgas rõõm, kurvameelsus, viha, üllatuse, hirm, põnevus, uudishimu ja rahulikkus, intensiivuse kontrollides ja segamisega. Klienditeeninduse avataari saab muuta sõbralikust empaatiaks, kui kutseja häälest tuvastakse pettumist. Siin kolmeosaline torujuhtme tasutavad. Raven-1 tuvastab kasutaja tunne seisundi, arendaja reeglid määratlevad sobiva vastuse tunne, ja Phoenix-4 renderdab seda reaalajal.
Digitaalsed kaksikud kahe minuti jooksul
Üks hämmastava väited: Phoenix-4 võib luua kohandatud digitaalse kaksikvõi vaid kahe minut materjalist. Laadige lühike video iseendast rääkimisest, ja süsteem eraldub piisavalt näo geomeetriast, avaldis valikust ja häälkarakteristikust, et luua reaalajas avatar.
Kvaliteet ei ole veel filmi VFX taseme. Demonstratsioonides näitavad digitaalsed kaksikud mõnikord artefaktid kiire pea liigutuste ja keerukate valgustusvahejuhtpunktide ümbruses. Kuid videohelistamisele, klienditeenindusele ja müük esitlustele, täpsus on rohkem kui piisav.
Miks see tähtsus AI-videosse
Phoenix-4 esindab kategooria laienemine AI-videosse. Siiani on iga suur mudelid keskendunud sisulooming: klippide, reklaamide, lühielokuvade ja sotsiaalmeedia postituste loomisele. Phoenix-4 keskendub kommunikatsioonile, elu videovastastikuse palju suuremad turgud. Kaaluge kasutamise juhtumeid:
Klienditeenindus
- 24/7 video-põhised tugiarendid
- Emotionaalselt reageerivad, mitte robotiline
- Mastaabib ilma palkamiseta
Müük
- Isikustatud video demo
- Mitmekeelsed avatar esindajad
- Alati saadaval, alati brandi kohane
Haridus
- AI õpetajad, kes avastada segadus
- Kohandatav tempo peal seisundite
- Ühtlane õpetuslehe kujud
Tervishoid
- Patsiendi vastuvõtuintervjuud
- Vaimse tervise kontrolli kaasreisijad
- Juurdepääsetavad telehealth liidesed
Reaalajas vestluse video turg on põhimõtteliselt erinev klippide loomise turust. See on vähem loom, kuid kaubanduslikult vahetu. Äridused, kes praegu Zoomi litsentse, helistamiskeskuse personali ja müügiga teavitamise videoproduktsioon kulutavad, on esimesed eesmärgid.
Tehniline piirangud jälgimisele
Phoenix-4 ei ole piiranguteta. Praegune versioon töötab ainult ühe näo, ees vaatamise stsenaariumis. Mitme inimese vestlused, täis keha renderdamine ja keerukad taustast ei ole toetatud.
| Võime | Seisund |
|---|---|
| Ühe näo renderdamine | Toetatud (1080p, 40fps) |
| Tunne avaldis juhtimine | Toetatud (10+ tunne seisund) |
| Reaalajas kõnesüntees | Toetatud (täis-dupleks) |
| Mitme inimese stseenid | Pole toetatud |
| Täis keha renderdamine | Pole toetatud |
| Keerukad taustast | Piiratud (ainult staatiline taustast) |
| Võrguühenduseta/serva juurutamine | Pole saadaval (ainult pilvessa API) |
Ainult pilvessa nõue tähendab, et latentne sõltub võrgu kvaliteedist. Tavus aruannet alle 600 ms äärmisest äärmuse optimaalses tingimused, kuid tegelikult funktsioon varieerub. Latente tundliku rakendustega, nagu elu klientide helistamise, serva juurutamine tuleb lõpuks vajalik.
Suurem pilt
Phoenix-4 jõuab painutama punktile. Eelrenderdatud AI-video space on segadusse kuulub, kust kümned mudeli võistlevad lahutuse, kestvuse ja stiili. Kuid reaalajas vestluse video on peaaegu tühi. Tavus seisab silmitsi piiratud otsese võistlusega, kus enamik alternatiiviidest on lihtsad huulte sünkroniseerimise katted, mitte täisemotionaalse renderdamise süsteemi. Küsimus on, kas kolmeosaline arhitektuur mastaabib. Raveni-1, Sparrow-1 ja Phoenix-4 samaaegne käivitamine nõuab märkimisväärne arvutus. Praegu elab see arvutus Tavusi pilvesse. Toomise tõttu lähemale serva või optimiseerimise jaoks tarbija riistvara, avaks täiesti uute juurutamine stsenaariumid. Laiem AI-video tööstusele, Phoenix-4 signaliseerib, et järgmise piir ei ole vaid paremad videod. See on video reaalajas liides, kus AI ei loo teile sisu, vaid suhtleb teiega.
Phoenix-4 on saadaval Tavus API kaudu. Digitaalsete kaksikmite loomiseks on vaja kahe minuti videolaadimine. Hindade üksikasjad on kättesaadavad nende arendaja portaalis.

Lausanne’ist pärit tehisintellekti insener, kes ühendab uurimistöö põhjalikkuse praktilise innovatsiooniga. Jagab oma aega mudeliarhitektuuride ja Alpide tippude vahel.
View profile →Kas teile meeldis loetu?
Muutke oma ideed minutitega piiramatult pikkadeks tehisintellekti videoteks.
Seotud artiklid
Jätkake avastamist nende seotud postitustega

AI-video kohtub mängudega: Mida NVIDIA GDC 2026 esitlus reaalajakirjanikele tähendab
NVIDIA näitas GDC 2026 konverentsil, et AI-videoste genereerimine toimib reaalajas kohapeal. Siin on, mida see tähendab mänguarendajatele, sisutootjatele ja interaktiivse meedia tulevikule.

Helios: 14B parameeter mudel, mis käitab reaalajas AI-videot tarbijakaupluse riistvara
Pekingi Ülikooli, ByteDance'i ja Canva Helios loob minutipikkusi AI-videoid kiirusega 19,5 FPS, kasutades vaid 6GB VRAM-i ja on täielikult avatud lähtekoodiga.

AI video 2026. aastal: 5 julget ennustust, mis muudavad kõike
Alates reaalajas interaktiivsest genereerimisest kuni AI-pärase filmikeeleni, siin on viis ennustust, kuidas AI video muudab loometöövoogusid 2026. aastal.