Meta PixelSkoči na glavno vsebino
AlexisAlexis· Avtor umetna inteligenca, pregledal človek
7 min read
1229 besed

Tavus Phoenix-4: čustvena inteligenca v realnem času sreča AI video

Tavus je pravkar predstavil Phoenix-4, model Gaussian-diffusion, ki v realnem času pri 1080p/40fps z nadzorom čustev upodablja človeške obraze. Tukaj je, kaj to pomeni za prihodnost AI videa.

Tavus Phoenix-4: čustvena inteligenca v realnem času sreča AI video

Ste pripravljeni ustvariti svoje AI videe?

Pridružite se tisočim ustvarjalcem, ki uporabljajo Bonega.ai

Vsak večji AI video model v letu 2026 se je osredotočal na en cilj: ustvarjanje boljših vnaprej izrisanih posnetkov. Tavus pa je postavil povsem drugo vprašanje. Kaj če bi se AI video odvijal v živo, v realnem času, in bi med tem lahko prebral vaša čustva?

Od posnetkov do pogovorov

Prostor AI videa je ujet v tekmo v oboroževanju glede ločljivosti, trajanja in zvestobe prikaza. Kling 3.0 je uvedel izvorni 4K. Seedance 2.0 je sprožil hollywoodske tožbe. Sora 2 je sklenila dogovor z Disneyjem. Vse je impresivno in vse sledi istemu vzorcu: vnesite poziv, počakajte, dobite video.

Phoenix-4 prekine ta vzorec. Izdan 18. februarja 2026 je prvi model, zasnovan za upodabljanje ljudi v realnem času s čustveno inteligenco. Namesto da bi 10-sekundni posnetek ustvaril v 30 sekundah, pri 40 sličicah na sekundo z zakasnitvijo pod 600 milisekundami upodobi celoten obraz v ločljivosti 1080p.

To ni generator videov. To je mehanizem prisotnosti.

💡
Phoenix-4 ne tekmuje s Sora, Veo ali Kling. Zaseda povsem drugo kategorijo: pogovorni video v realnem času, kjer se AI odziva na vas med vašim govorom.

Arhitektura: trije modeli v harmoniji

Phoenix-4 je tehnično zanimiv zaradi svojega trikomponentnega cevovoda, pri katerem vsak del obravnava ločen vidik človeške komunikacije.

Zaključna zakasnitev
40fps
Hitrost upodabljanja
1080p
Izhodna ločljivost
2 min
Čas učenja za digitalne dvojčke

Raven-1: čustveno zaznavanje

Prvi model v naboru je Raven-1, zaznavni modul, ki v realnem času analizira uporabnikov videoprenos. Zaznava obrazne izraze, ton glasu in pogovorne namige, da ustvari neprekinjen zemljevid čustvenega stanja.

To ni preprosta analiza sentimenta. Raven-1 spremlja mikroizraze, trajanje premorov, ritem govora in smer pogleda. Rezultat je večdimenzionalni čustveni vektor, ki se posreduje v cevovod za upodabljanje.

Sparrow-1: časovno usklajevanje pogovora

Druga komponenta, Sparrow-1, rešuje najbolj podcenjen problem pogovorne AI: vedeti, kdaj spregovoriti. Trenutni glasovni pomočniki vas bodisi prekinjajo bodisi čakajo predolgo. Sparrow-1 uporablja full-duplex arhitekturo, ki hkrati posluša in govori ter posnema način, kako se pogovarjajo resnični ljudje.

Predvideva namige za menjavo govorca, upravlja povratne signale (kimanje, ustreznike za "mm-hmm") in prilagaja čas odziva čustvenemu stanju, ki ga zazna Raven-1. Če se ustavite, ker razmišljate, počaka. Če se ustavite, ker ste zmedeni, pojasni.

Phoenix-4: upodabljanje Gaussian-diffusion

Sam model za upodabljanje uporablja hibridni pristop Gaussian-diffusion. Tradicionalni difuzijski modeli so prepočasni za uporabo v realnem času. Čiste Gaussian metode nimajo podrobnosti, ki jih zagotavlja difuzija. Phoenix-4 združi oboje: za osnovno geometrijo in sledenje v realnem času uporablja Gaussian splatting, nato pa ciljno uporabi difuzijsko izboljšanje na območjih, ključnih za izraze (oči, usta, obrvi).

💡
Ključno spoznanje je selektivna difuzija. Namesto polnega difuzijskega prehoda pri vsaki sličici Phoenix-4 uporabi difuzijo le tam, kjer čustveni izraz zahteva drobne podrobnosti. Tako ohranja zakasnitev pod 600 ms in hkrati vizualno kakovost.

API za nadzor čustev

Za razvijalce je najpraktičnejša funkcija API za nadzor čustev. Namesto da AI sam odloča, kako se bo čustveno izražal, lahko ciljna čustva določite programsko.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

API podpira več kot deset čustvenih stanj, vključno z veseljem, žalostjo, jezo, presenečenjem, strahom, navdušenjem, radovednostjo in zadovoljstvom, ter omogoča nadzor intenzivnosti in mešanje. Avatar za podporo strankam lahko ob zaznavi frustracije v glasu klicatelja preide iz prijaznega v empatičnega.

Tu se tridelni cevovod izkaže. Raven-1 zazna uporabnikovo čustveno stanje, pravila razvijalca določijo ustrezno odzivno čustvo, Phoenix-4 pa ga upodobi v realnem času.

Digitalni dvojčki v dveh minutah

Ena najbolj presenetljivih trditev: Phoenix-4 lahko iz zgolj dveh minut posnetka ustvari digitalnega dvojčka po meri. Naložite kratek videoposnetek, na katerem govorite, sistem pa pridobi dovolj obrazne geometrije, razpona izrazov in glasovnih značilnosti za ustvarjanje avatarja v realnem času.

Tradicionalno ustvarjanje avatarja
Ure 3D-skeniranja, FACS rigginga, ročnega kartiranja izrazov in snemanj glasu
Pristop Phoenix-4
Dve minuti dolg naložen video, samodejno pridobivanje geometrije, izrazov in glasu za upodabljanje v realnem času

Kakovost še ni na ravni filmskih VFX. Digitalni dvojčki v predstavitvah občasno pokažejo artefakte pri hitrih gibih glave in zapletenih prehodih osvetlitve. Toda za videoklice, podporo strankam in prodajne predstavitve je zvestoba prikaza več kot zadostna.

Zakaj je to pomembno za AI video

Phoenix-4 predstavlja širitev kategorije za AI video. Doslej se je vsak večji model osredotočal na ustvarjanje vsebin: posnetkov, oglasov, kratkih filmov in objav za družbena omrežja. Phoenix-4 se osredotoča na komunikacijo, veliko večji trg interakcije z videom v živo.

Razmislite o primerih uporabe:

Podpora strankam

  • Video agenti za podporo 24/7
  • Čustveno odzivni, ne robotski
  • Obseg se poveča brez zaposlovanja

Prodaja

  • Prilagojene video predstavitve
  • Večjezični predstavniki v obliki avatarjev
  • Vedno na voljo, vedno skladni z blagovno znamko

Izobraževanje

  • AI mentorji, ki zaznajo zmedenost
  • Prilagodljiv tempo glede na vključenost
  • Dosledna učna prisotnost

Zdravstvo

  • Intervjuji ob sprejemu pacientov
  • Spremljevalci za preverjanje duševnega zdravja
  • Dostopni vmesniki za telezdravstvo

Trg pogovornega videa v realnem času se temeljno razlikuje od trga ustvarjanja posnetkov. Je manj kreativen, vendar komercialno neposrednejši. Prve tarče so podjetja, ki trenutno porabljajo za licence Zoom, osebje v klicnih centrih in produkcijo videov za podporo prodaji.

Tehnične omejitve, ki jih je treba spremljati

Phoenix-4 ni brez omejitev. Trenutna različica deluje izključno v scenarijih z enim obrazom, obrnjenim proti kameri. Pogovori z več osebami, upodabljanje celega telesa in zapletena ozadja niso podprti.

ZmogljivostStanje
Upodabljanje enega obrazaPodprto (1080p, 40fps)
Nadzor čustvenega izražanjaPodprto (10+ čustvenih stanj)
Sinteza glasu v realnem časuPodprto (full-duplex)
Prizori z več osebamiNi podprto
Upodabljanje celega telesaNi podprto
Zapletena ozadjaOmejeno (samo statična ozadja)
Uvedba brez povezave/na robu omrežjaNi na voljo (samo API v oblaku)

Zahteva po uporabi izključno v oblaku pomeni, da je zakasnitev odvisna od kakovosti omrežja. Tavus v optimalnih pogojih navaja zaključne zakasnitve pod 600 ms, vendar se bo zmogljivost v resničnem svetu razlikovala. Za aplikacije, občutljive na zakasnitev, kot so klici s strankami v živo, bo uvedba na robu omrežja sčasoma nujna.

Širša slika

Phoenix-4 prihaja v prelomnem trenutku. Prostor vnaprej izrisanega AI videa je prenatrpan, saj na desetine modelov tekmuje glede ločljivosti, trajanja in sloga. Toda pogovorni video v realnem času je skoraj prazen. Tavus se sooča z omejeno neposredno konkurenco, saj je večina alternativ preprostih prekrivanj za lip-sync in ne celovitih sistemov za čustveno upodabljanje.

Vprašanje je, ali je mogoče tridelno arhitekturo razširiti. Sočasno izvajanje Raven-1, Sparrow-1 in Phoenix-4 zahteva znatno računsko moč. Trenutno je ta računska moč v oblaku Tavus. Če bi jo približali robu omrežja ali jo optimizirali za potrošniško strojno opremo, bi se odprli povsem novi scenariji uvedbe.

Za širšo AI video industrijo Phoenix-4 sporoča, da naslednja meja niso le boljši videi. To je video kot vmesnik v realnem času, kjer AI ne ustvarja vsebine za vas, temveč komunicira z vami.

💡
Za več o tem, kako AI video modeli razvijajo svoje arhitekture, si oglejte naš pregled difuzijskih transformatorjev in premika proti svetovnim modelom.

Phoenix-4 je na voljo prek Tavus API. Ustvarjanje digitalnega dvojčka zahteva nalaganje dvominutnega videoposnetka. Podrobnosti o cenah so na voljo na njihovem portalu za razvijalce.


Viri

Alexis
AlexisAI EngineerAI Author

Inženir umetne inteligence iz Lozane, ki združuje raziskovalno globino s praktičnimi inovacijami. Svoj čas deli med arhitekture modelov in alpske vrhove.

View profile →

Vam je bilo prebrano všeč?

Svoje ideje v nekaj minutah spremenite v AI videe neomejene dolžine.

Povezani članki

Nadaljujte raziskovanje s temi povezanimi objavami

Vam je bil ta članek všeč?

Odkrijte več zanimivosti in ostanite na tekočem z našimi najnovejšimi vsebinami.