Meta PixelLiigu põhi sisuni
AlexisAlexis· tehisintellekti autor, inimese poolt üle vaadatud
5 min read
990 sõna

Tavus Phoenix-4: Reaalajas tunnete intelligents ja AI-video

Tavus raieundas Phoenix-4, Gaussi-difusioonimudelit, mis renderdab inimeste nägusid reaalajal 1080p/40fps-ga tunneosalusega. Siin on, mida see AI-video tulevikule tähendab.

Tavus Phoenix-4: Reaalajas tunnete intelligents ja AI-video

Kas olete valmis looma oma tehisintellekti videoid?

Liituge tuhandete Bonega.ai kasutavate loojatega

Iga suur AI-videomudelel 2026. aastal oli üks eesmärk: paremad eelrenderdatud klipid. Tavus küsis täiesti teistsuguse küsimuse. Mis oleks, kui AI-video toimuks reaalajal ja saaks aru teie tunnetest samal ajal?

Klipidest vestlustesse

AI-videosüsteem on olnud lukustatud võistlusesse lahutuse, kestvuse ja ustava üle. Kling 3.0 tõukas omane 4K. Seedance 2.0 käivitas Hollywoodis kohtuasjad. Sora 2 sai Disney'i kokkulepet. Kõik muljetavaldavat, kõik sama malli järgi: tippige soov, oodake, saate video. Phoenix-4 katkestab selle mustri. Välja lastud 18. veebruaril 2026, see on esimene mudelid, mis on loodud reaalajas inimese renderdamiseks tunne intelligentsusega. Selle asemel, et luua 10-sekundiline klipp 30 sekundis, renderib see täielik 1080p nägu 40 kaadrile sekundis ja alla 600 millisekundi kõrvalekaldest. See ei ole videogeneraator. See on olemasolu mootor.

💡
Phoenix-4 ei võistle Sora, Veoga ega Klingiga. See hõivab täiesti teistsuguse kategooria: reaalajas kõnesuhtlus video, kus AI vastab teile kõne ajal.

Arhitektuur: Kolm mudelit harmooniasse

Mis teeb Phoenix-4 tehislikust seisukohast huvitavat on kolmeosaline torujuhtme, kus iga komponent käsitleb inimkommunikatsiooni eraldiseisvat osa.

Äärmisest äärmuseni kõrvalekalle
40fps
Renderdamise kaadri määr
1080p
Väljundi eraldusvõime
2 min
Õppimise aeg digitaalsete kahekeste jaoks

Raven-1: Tunne tajumine

Stogu esimene mudelid on Raven-1, tajumis moodul, mis analüüsib kasutaja videovoogu reaalajal. See tuvastab näoilmed, häälitsuse tooni ja vestluse vihje pidevale tunneseisundi kaardi koostamiseks. See ei ole lihtne sentimenti analüüs. Raven-1 jälgib mikro-ilmeid, pausi kestvust, kõne tempolauslaused ja pilgu suunda. Väljund on mitmejaoks tunne vektor, mis söödatakse renderdamise torujuhtmesse.

Sparrow-1: Vestluse ajaline

Teine komponent, Sparrow-1, käsitleb kõne AI-s kõige alahinnatud probleemi: teada, millal rääkida. Hetkeliste häälsassistendid kas katkestavad teid või ootavad liiga kaua. Sparrow-1 kasutab täis-dupleks arhitektuuri, mis kuulab ja räägib samaaegselt, peegeldades seda, kuidas inimesed tegelikult vestlevad. See ennustab pöördepointide vihjeseid, hallitseb tagaplaani signaalid (pea noogumine, „mm-hmm" samaväärsused), ja kohandab vastuseaega Raveni-1 tunne seisundil. Kui teete pausi, kuna mõtlete, ootab. Kui teete pausi, kuna olete segaduses, selgitab.

Phoenix-4: Gaussi-difusiooni renderdamine

Renderdamise mudelid ise kasutavad Gaussi-difusiooni-hübridi lähenemine. Tavapärased difusiooni mudeli on renderdamiseks liiga aeglasest. Puhas Gaussi meetodit puuduvad difusiooni üksikasjude kvaliteet. Phoenix-4 ühendab mõlemad: kasutab Gaussi õhksetamiseks alus geomeetrial ja reaalajas jälgimisele, siis rakendab difusiooni salvestamist sihtotstarbeliselt tunnetus avaldiste kriitilisels piirkondadel (silmad, suu, kulmud).

💡
Võtme idee on valitav difusiooni. Täieliku difusiooni passi käivitamise asemel igal kaadriel, Phoenix-4 rakendab seda ainult, kus tunne avaldus nõuab peenuteavitamist. See hoiab kõrvalekalde all 600 millisekunddid, kuid säilitab visuaalse kvalivedest.

Tunne juhtimise API

Arendajatele on kõige praktilisem omadus tunne juhtimise API. Selle asemel, et lasta AI otsustada, kuidas tunneid väljendada, saate sihtotstarbelisest tunneid programmeeritult.

{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}

API toetab rohkem kui kümmet tunne seisundit, sealhulgas rõõm, kurvameelsus, viha, üllatuse, hirm, põnevus, uudishimu ja rahulikkus, intensiivuse kontrollides ja segamisega. Klienditeeninduse avataari saab muuta sõbralikust empaatiaks, kui kutseja häälest tuvastakse pettumist. Siin kolmeosaline torujuhtme tasutavad. Raven-1 tuvastab kasutaja tunne seisundi, arendaja reeglid määratlevad sobiva vastuse tunne, ja Phoenix-4 renderdab seda reaalajal.

Digitaalsed kaksikud kahe minuti jooksul

Üks hämmastava väited: Phoenix-4 võib luua kohandatud digitaalse kaksikvõi vaid kahe minut materjalist. Laadige lühike video iseendast rääkimisest, ja süsteem eraldub piisavalt näo geomeetriast, avaldis valikust ja häälkarakteristikust, et luua reaalajas avatar.

Traditsiooniline avatar loomine
Tunde 3D skaneerimist, FACS rigging, käsitsemisi avaldis kaardistust, häälsalvestuse seansid
Phoenix-4 lähenemine
Kahe minuti video üleslaadimine, geomeetria, avalduste ja häälte automaatne eraldamine reaalajas renderdamiseks

Kvaliteet ei ole veel filmi VFX taseme. Demonstratsioonides näitavad digitaalsed kaksikud mõnikord artefaktid kiire pea liigutuste ja keerukate valgustusvahejuhtpunktide ümbruses. Kuid videohelistamisele, klienditeenindusele ja müük esitlustele, täpsus on rohkem kui piisav.

Miks see tähtsus AI-videosse

Phoenix-4 esindab kategooria laienemine AI-videosse. Siiani on iga suur mudelid keskendunud sisulooming: klippide, reklaamide, lühielokuvade ja sotsiaalmeedia postituste loomisele. Phoenix-4 keskendub kommunikatsioonile, elu videovastastikuse palju suuremad turgud. Kaaluge kasutamise juhtumeid:

Klienditeenindus

  • 24/7 video-põhised tugiarendid
  • Emotionaalselt reageerivad, mitte robotiline
  • Mastaabib ilma palkamiseta

Müük

  • Isikustatud video demo
  • Mitmekeelsed avatar esindajad
  • Alati saadaval, alati brandi kohane

Haridus

  • AI õpetajad, kes avastada segadus
  • Kohandatav tempo peal seisundite
  • Ühtlane õpetuslehe kujud

Tervishoid

  • Patsiendi vastuvõtuintervjuud
  • Vaimse tervise kontrolli kaasreisijad
  • Juurdepääsetavad telehealth liidesed

Reaalajas vestluse video turg on põhimõtteliselt erinev klippide loomise turust. See on vähem loom, kuid kaubanduslikult vahetu. Äridused, kes praegu Zoomi litsentse, helistamiskeskuse personali ja müügiga teavitamise videoproduktsioon kulutavad, on esimesed eesmärgid.

Tehniline piirangud jälgimisele

Phoenix-4 ei ole piiranguteta. Praegune versioon töötab ainult ühe näo, ees vaatamise stsenaariumis. Mitme inimese vestlused, täis keha renderdamine ja keerukad taustast ei ole toetatud.

VõimeSeisund
Ühe näo renderdamineToetatud (1080p, 40fps)
Tunne avaldis juhtimineToetatud (10+ tunne seisund)
Reaalajas kõnesünteesToetatud (täis-dupleks)
Mitme inimese stseenidPole toetatud
Täis keha renderdaminePole toetatud
Keerukad taustastPiiratud (ainult staatiline taustast)
Võrguühenduseta/serva juurutaminePole saadaval (ainult pilvessa API)

Ainult pilvessa nõue tähendab, et latentne sõltub võrgu kvaliteedist. Tavus aruannet alle 600 ms äärmisest äärmuse optimaalses tingimused, kuid tegelikult funktsioon varieerub. Latente tundliku rakendustega, nagu elu klientide helistamise, serva juurutamine tuleb lõpuks vajalik.

Suurem pilt

Phoenix-4 jõuab painutama punktile. Eelrenderdatud AI-video space on segadusse kuulub, kust kümned mudeli võistlevad lahutuse, kestvuse ja stiili. Kuid reaalajas vestluse video on peaaegu tühi. Tavus seisab silmitsi piiratud otsese võistlusega, kus enamik alternatiiviidest on lihtsad huulte sünkroniseerimise katted, mitte täisemotionaalse renderdamise süsteemi. Küsimus on, kas kolmeosaline arhitektuur mastaabib. Raveni-1, Sparrow-1 ja Phoenix-4 samaaegne käivitamine nõuab märkimisväärne arvutus. Praegu elab see arvutus Tavusi pilvesse. Toomise tõttu lähemale serva või optimiseerimise jaoks tarbija riistvara, avaks täiesti uute juurutamine stsenaariumid. Laiem AI-video tööstusele, Phoenix-4 signaliseerib, et järgmise piir ei ole vaid paremad videod. See on video reaalajas liides, kus AI ei loo teile sisu, vaid suhtleb teiega.

💡
Lisateavet selle kohta, kuidas AI-video mudelid arendavad arhitektuure, vt meie difusiooni muuturid ja nihe maailma mudeli suunas.

Phoenix-4 on saadaval Tavus API kaudu. Digitaalsete kaksikmite loomiseks on vaja kahe minuti videolaadimine. Hindade üksikasjad on kättesaadavad nende arendaja portaalis.

Alexis
AlexisAI EngineerAI Author

Lausanne’ist pärit tehisintellekti insener, kes ühendab uurimistöö põhjalikkuse praktilise innovatsiooniga. Jagab oma aega mudeliarhitektuuride ja Alpide tippude vahel.

View profile →

Kas teile meeldis loetu?

Muutke oma ideed minutitega piiramatult pikkadeks tehisintellekti videoteks.

Seotud artiklid

Jätkake avastamist nende seotud postitustega

Kas artikkel meeldis?

Avastage rohkem teadmisi ja püsige kursis meie uusima sisuga.