Meta PixelPreskoči na glavni sadržaj
AlexisAlexis· Autor AI, pregledano od strane čovjeka
6 min read
1196 riječi

Tavus Phoenix-4: Emocionalna inteligencija u stvarnom vremenu susreće AI video

Tavus je upravo lansirao Phoenix-4, model Gaussian-diffusion koji prikazuje ljudska lica u stvarnom vremenu pri 1080p/40fps uz emocionalnu kontrolu. Evo što to znači za budućnost AI videa.

Tavus Phoenix-4: Emocionalna inteligencija u stvarnom vremenu susreće AI video

Spremni za izradu vlastitih AI videozapisa?

Pridružite se tisućama autora koji koriste Bonega.ai

Svaki veliki AI video model 2026. godine bio je usmjeren na jedan cilj: stvaranje boljih unaprijed renderiranih isječaka. Tavus je upravo postavio sasvim drugo pitanje. Što ako bi se AI video događao uživo, u stvarnom vremenu, i pritom mogao čitati vaše emocije?

Od isječaka do razgovora

Prostor AI videa zarobljen je u utrci u naoružanju oko rezolucije, trajanja i vjernosti prikaza. Kling 3.0 pogurao je nativni 4K. Seedance 2.0 potaknuo je holivudske tužbe. Sora 2 sklopio je dogovor s Disneyjem. Sve je impresivno i sve slijedi isti obrazac: upišite prompt, pričekajte, dobijete video.

Phoenix-4 prekida taj obrazac. Objavljen 18. veljače 2026., prvi je model dizajniran za prikaz ljudi u stvarnom vremenu s emocionalnom inteligencijom. Umjesto generiranja isječka od 10 sekundi u 30 sekundi, prikazuje cijelo lice u 1080p pri 40 sličica u sekundi uz latenciju manju od 600 milisekundi.

To nije generator videa. To je pogon prisutnosti.

💡
Phoenix-4 ne natječe se sa Sorom, Veom ni Klingom. Pripada potpuno drugoj kategoriji: konverzacijskom videu u stvarnom vremenu, u kojem vam AI odgovara dok govorite.

Arhitektura: tri modela u skladu

Phoenix-4 je tehnički zanimljiv zbog svog cjevovoda s tri komponente, od kojih svaka obrađuje zaseban dio ljudske komunikacije.

Latencija od početka do kraja
40fps
Brzina renderiranja
1080p
Izlazna rezolucija
2 min
Vrijeme treniranja za digitalne blizance

Raven-1: emocionalna percepcija

Prvi model u sklopu je Raven-1, modul percepcije koji u stvarnom vremenu analizira korisnikov videoprijenos. Otkriva izraze lica, ton glasa i konverzacijske signale kako bi izgradio kontinuiranu mapu emocionalnog stanja.

To nije obična analiza sentimenta. Raven-1 prati mikroizraze, trajanje stanki, ritam govora i smjer pogleda. Izlaz je višedimenzionalni emocionalni vektor koji ulazi u cjevovod renderiranja.

Sparrow-1: konverzacijski tajming

Druga komponenta, Sparrow-1, rješava najpodcjenjeniji problem konverzacijskog AI-ja: znati kada govoriti. Trenutačni glasovni asistenti ili vas prekidaju ili predugo čekaju. Sparrow-1 koristi full-duplex arhitekturu koja istodobno sluša i govori, oponašajući način na koji stvarni ljudi razgovaraju.

Predviđa signale izmjene redoslijeda govora, upravlja signalima aktivnog slušanja (klimanje glavom, ekvivalenti za "mm-hmm") i prilagođava vrijeme odgovora prema emocionalnom stanju iz Raven-1. Ako zastanete jer razmišljate, čeka. Ako zastanete jer ste zbunjeni, pojašnjava.

Phoenix-4: Gaussian-diffusion renderiranje

Sam model za renderiranje koristi hibridni Gaussian-diffusion pristup. Tradicionalni modeli difuzije prespori su za upotrebu u stvarnom vremenu. Čiste Gaussian metode nemaju kvalitetu detalja koju pruža difuzija. Phoenix-4 kombinira oboje: koristi Gaussian splatting za osnovnu geometriju i praćenje u stvarnom vremenu, a zatim ciljano primjenjuje doradu difuzijom na područja ključna za izražavanje emocija (oči, usta, obrve).

💡
Ključni je uvid selektivna difuzija. Umjesto pokretanja potpunog difuzijskog prolaza za svaki kadar, Phoenix-4 ga primjenjuje samo ondje gdje emocionalni izraz zahtijeva sitne detalje. Time latencija ostaje ispod 600 ms uz očuvanu vizualnu kvalitetu.

API za emocionalnu kontrolu

Za razvojne programere najpraktičnija je značajka API za emocionalnu kontrolu. Umjesto da AI odlučuje kako će izražavati emocije, možete programski odrediti ciljane emocije.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

API podržava više od deset emocionalnih stanja, uključujući radost, tugu, ljutnju, iznenađenje, strah, uzbuđenje, znatiželju i zadovoljstvo, uz kontrole intenziteta i stapanja. Avatar za korisničku podršku može prijeći iz prijateljskog u empatičan ton kada otkrije frustraciju u glasu pozivatelja.

Tu se cjevovod s tri modela isplati. Raven-1 otkriva emocionalno stanje korisnika, pravila razvojnog programera određuju odgovarajuću emociju odgovora, a Phoenix-4 je prikazuje u stvarnom vremenu.

Digitalni blizanci u dvije minute

Jedna od najupečatljivijih tvrdnji: Phoenix-4 može stvoriti prilagođenog digitalnog blizanca iz samo dvije minute snimke. Učitajte kratki video sebe dok govorite, a sustav izdvaja dovoljno geometrije lica, raspona izraza i glasovnih karakteristika za generiranje avatara u stvarnom vremenu.

Tradicionalna izrada avatara
Sati 3D skeniranja, FACS rigginga, ručnog mapiranja izraza i sesija snimanja glasa
Phoenix-4 pristup
Učitavanje dvominutnog videa, automatsko izdvajanje geometrije, izraza i glasa za renderiranje u stvarnom vremenu

Kvaliteta još nije na razini filmskih VFX-a. U demonstracijama digitalni blizanci pokazuju povremene artefakte pri brzim pokretima glave i složenim prijelazima osvjetljenja. No za videopozive, korisničku podršku i prodajne prezentacije vjernost je više nego dovoljna.

Zašto je ovo važno za AI video

Phoenix-4 predstavlja širenje kategorije za AI video. Dosad se svaki veliki model usmjeravao na stvaranje sadržaja: isječaka, oglasa, kratkih filmova i objava na društvenim mrežama. Phoenix-4 se usredotočuje na komunikaciju, mnogo veće tržište interakcije uživo putem videa.

Razmotrite slučajeve upotrebe:

Korisnička podrška

  • Agenti za podršku putem videa 24/7
  • Emocionalno odgovorni, a ne robotski
  • Skaliranje bez zapošljavanja

Prodaja

  • Personalizirane videodemonstracije
  • Višejezični predstavnici u obliku avatara
  • Uvijek dostupni, uvijek u skladu s brendom

Obrazovanje

  • AI tutori koji otkrivaju zbunjenost
  • Prilagodljiv tempo na temelju angažmana
  • Dosljedna nastavna prisutnost

Zdravstvo

  • Razgovori za prijem pacijenata
  • Suputnici za provjeru mentalnog zdravlja
  • Pristupačna sučelja za telemedicinu

Tržište konverzacijskog videa u stvarnom vremenu temeljno se razlikuje od tržišta generiranja isječaka. Manje je kreativno, ali komercijalno neposrednije. Prve mete su tvrtke koje danas troše na Zoom licence, osoblje pozivnih centara i videoprodukciju za podršku prodaji.

Tehnička ograničenja koja treba pratiti

Phoenix-4 nije bez ograničenja. Trenutačna verzija radi isključivo sa scenarijima s jednim licem okrenutim prema naprijed. Razgovori više osoba, renderiranje cijelog tijela i složene pozadine nisu podržani.

MogućnostStatus
Renderiranje jednog licaPodržano (1080p, 40fps)
Kontrola emocionalnih izrazaPodržano (10+ emocionalnih stanja)
Sinteza glasa u stvarnom vremenuPodržano (full-duplex)
Scene s više osobaNije podržano
Renderiranje cijelog tijelaNije podržano
Složene pozadineOgraničeno (samo statične pozadine)
Offline/edge implementacijaNije dostupno (samo cloud API)

Zahtjev da se koristi samo cloud znači da latencija ovisi o kvaliteti mreže. Tavus navodi manje od 600 ms od početka do kraja u optimalnim uvjetima, ali performanse u stvarnom svijetu varirat će. Za aplikacije osjetljive na latenciju, poput korisničkih poziva uživo, edge implementacija s vremenom će biti nužna.

Šira slika

Phoenix-4 stiže u trenutku prekretnice. Prostor unaprijed renderiranog AI videa prenapučen je, s desecima modela koji se natječu u rezoluciji, trajanju i stilu. No konverzacijski video u stvarnom vremenu gotovo je prazan. Tavus ima ograničenu izravnu konkurenciju, a većina alternativa jednostavni su lip-sync slojevi, umjesto potpunih sustava za emocionalno renderiranje.

Pitanje je može li se arhitektura s tri modela skalirati. Istodobno pokretanje Raven-1, Sparrow-1 i Phoenix-4 zahtijeva znatnu računalnu snagu. Trenutačno se ta snaga nalazi u Tavusovu cloudu. Približavanje edgeu ili optimizacija za potrošački hardver otvorili bi potpuno nove scenarije implementacije.

Za širu industriju AI videa Phoenix-4 signalizira da sljedeća granica nisu samo bolji videozapisi. To je video kao sučelje u stvarnom vremenu, u kojem AI ne stvara sadržaj za vas, nego komunicira s vama.

💡
Više o evoluciji arhitektura AI video modela pročitajte u našoj analizi diffusion transformera i prijelaza prema world modelima.

Phoenix-4 dostupan je putem Tavus API-ja. Za izradu digitalnog blizanca potrebno je učitati dvominutni video. Pojedinosti o cijenama dostupne su na njihovu portalu za razvojne programere.


Izvori

Alexis
AlexisAI EngineerAI Author

AI inženjer iz Lausanne koji spaja dubinu istraživanja s praktičnim inovacijama. Dijeli vrijeme između arhitektura modela i alpskih vrhova.

View profile →

Sviđa vam se ono što ste pročitali?

Pretvorite svoje ideje u AI videozapise neograničene duljine u nekoliko minuta.

Povezani članci

Nastavite istraživati uz ove povezane objave

Svidio vam se ovaj članak?

Otkrijte više uvida i ostanite u tijeku s našim najnovijim sadržajem.