Meta PixelPereiti prie pagrindinio turinio
AlexisAlexis· DI autorius, peržiūrėjo žmogus
6 min read
1147 žodžiai

Tavus Phoenix-4: realaus laiko emocinis intelektas susitinka su DI vaizdo įrašais

Tavus ką tik pristatė Phoenix-4, Gauso difuzijos modelį, kuris realiuoju laiku 1080p/40fps raiška generuoja žmonių veidus su emocine kontrole. Štai ką tai reiškia DI vaizdo įrašų ateičiai.

Tavus Phoenix-4: realaus laiko emocinis intelektas susitinka su DI vaizdo įrašais

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Kiekvienas didelis DI vaizdo įrašų modelis 2026 m. siekė vieno tikslo: kurti geresnius iš anksto sugeneruotus klipus. Tavus ką tik uždavė visai kitą klausimą. O jeigu DI vaizdo įrašas vyktų gyvai, realiuoju laiku, ir tuo pat metu galėtų suprasti jūsų emocijas?

Nuo klipų prie pokalbių

DI vaizdo įrašų erdvėje vyksta ginklavimosi varžybos dėl raiškos, trukmės ir tikroviškumo. Kling 3.0 pristatė vietinę 4K raišką. Seedance 2.0 sukėlė Holivudo ieškinius. Sora 2 sudarė sandorį su Disney. Visa tai įspūdinga, tačiau remiasi tuo pačiu modeliu: įvedate užklausą, palaukiate, gaunate vaizdo įrašą.

Phoenix-4 nutraukia šį modelį. 2026 m. vasario 18 d. pristatytas pirmasis modelis, sukurtas realiuoju laiku generuoti žmones su emociniu intelektu. Užuot per 30 sekundžių sukūręs 10 sekundžių klipą, jis generuoja visą 1080p veidą 40 kadrų per sekundę greičiu, o delsa neviršija 600 milisekundžių.

Tai nėra vaizdo įrašų generatorius. Tai yra buvimo variklis.

💡
Phoenix-4 nekonkuruoja su Sora, Veo ar Kling. Jis priklauso visiškai kitai kategorijai: realaus laiko pokalbių vaizdo įrašams, kuriuose DI reaguoja jums kalbant.

Architektūra: trys darniai veikiantys modeliai

Phoenix-4 techniškai įdomus dėl savo trijų komponentų srauto, kuriame kiekvienas komponentas sprendžia skirtingą žmonių bendravimo dalį.

Visuminė delsa
40fps
Generavimo kadrų dažnis
1080p
Išvesties raiška
2 min
Skaitmeninių dvynių mokymo laikas

Raven-1: emocijų suvokimas

Pirmasis modelis rinkinyje yra Raven-1, suvokimo modulis, realiuoju laiku analizuojantis naudotojo vaizdo srautą. Jis aptinka veido išraiškas, balso toną ir pokalbio signalus, kad sukurtų nuolatinį emocinės būsenos žemėlapį.

Tai nėra paprasta nuotaikų analizė. Raven-1 stebi mikroišraiškas, pauzių trukmę, kalbos ritmą ir žvilgsnio kryptį. Rezultatas yra daugiamatis emocinis vektorius, perduodamas į generavimo srautą.

Sparrow-1: pokalbio laikas

Antrasis komponentas, Sparrow-1, sprendžia labiausiai nuvertinamą pokalbių DI problemą: kada kalbėti. Dabartiniai balso asistentai arba pertraukia, arba laukia per ilgai. Sparrow-1 naudoja pilno duplekso architektūrą, kuri vienu metu klausosi ir kalba, taip atkartodama tikrą žmonių pokalbį.

Jis prognozuoja kalbėjimo eilės signalus, valdo grįžtamojo ryšio ženklus (linktelėjimą, „mhm“ atitikmenis) ir koreguoja atsakymo laiką pagal iš Raven-1 gautą emocinę būseną. Jei sustojate, nes galvojate, jis palaukia. Jei sustojate, nes esate sutrikę, jis paaiškina.

Phoenix-4: Gauso difuzijos generavimas

Pats generavimo modelis naudoja hibridinį Gauso difuzijos metodą. Tradiciniai difuzijos modeliai yra per lėti naudojimui realiuoju laiku. Grynieji Gauso metodai neturi difuzijos teikiamos detalių kokybės. Phoenix-4 sujungia abu metodus: bazinei geometrijai ir sekimui realiuoju laiku jis naudoja Gauso taškų išsklaidymą, tada tiksliniu būdu taiko difuzinį patikslinimą išraiškai kritinėse srityse (akyse, burnoje, antakiuose).

💡
Pagrindinė įžvalga yra atrankinė difuzija. Užuot kiekvienam kadrui atlikęs visą difuzijos eigą, Phoenix-4 ją taiko tik ten, kur emocinei išraiškai reikia smulkių detalių. Taip delsa išlaikoma mažesnė nei 600 ms, kartu išsaugant vaizdo kokybę.

Emocinės kontrolės API

Kūrėjams praktiškiausia funkcija yra Emocinės kontrolės API. Užuot leidę DI nuspręsti, kaip reikšti emocijas, galite programiškai nurodyti tikslines emocijas.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

API palaiko daugiau nei dešimt emocinių būsenų, įskaitant džiaugsmą, liūdesį, pyktį, nuostabą, baimę, susijaudinimą, smalsumą ir pasitenkinimą, su intensyvumo kontrole ir maišymu. Klientų aptarnavimo avataras, aptikęs nusivylimą skambinančiojo balse, gali pereiti nuo draugiškos prie empatiškos išraiškos.

Čia atsiperka trijų modelių srautas. Raven-1 aptinka naudotojo emocinę būseną, kūrėjo taisyklės nustato tinkamą atsako emociją, o Phoenix-4 ją generuoja realiuoju laiku.

Skaitmeniniai dvyniai per dvi minutes

Vienas ryškiausių teiginių: Phoenix-4 gali sukurti individualų skaitmeninį dvynį vos iš dviejų minučių filmuotos medžiagos. Įkelkite trumpą savo kalbėjimo vaizdo įrašą, ir sistema išgauna pakankamai veido geometrijos, išraiškų diapazono ir balso charakteristikų, kad sukurtų realaus laiko avatarą.

Tradicinis avataro kūrimas
Valandos 3D skenavimo, FACS įrangos parengimo, rankinio išraiškų susiejimo, balso įrašymo sesijų
Phoenix-4 metodas
Dviejų minučių vaizdo įrašo įkėlimas, automatinis geometrijos, išraiškų ir balso išgavimas generavimui realiuoju laiku

Kokybė dar nepasiekia kino VFX lygio. Demonstracijose skaitmeniniai dvyniai kartais rodo artefaktus greitų galvos judesių ir sudėtingų apšvietimo perėjimų metu. Tačiau vaizdo skambučiams, klientų aptarnavimui ir pardavimo pristatymams tikroviškumo visiškai pakanka.

Kodėl tai svarbu DI vaizdo įrašams

Phoenix-4 reiškia kategorijos plėtrą DI vaizdo įrašų srityje. Iki šiol kiekvienas svarbus modelis buvo orientuotas į turinio kūrimą: klipų, reklamų, trumpametražių filmų, socialinių tinklų įrašų gamybą. Phoenix-4 orientuojasi į bendravimą, gerokai didesnę gyvos vaizdo sąveikos rinką.

Apsvarstykite naudojimo atvejus:

Klientų aptarnavimas

  • Visą parą veikiantys vaizdo klientų aptarnavimo agentai
  • Emociškai reaguojantys, ne robotiški
  • Plečiama apimtis be naujų darbuotojų samdymo

Pardavimai

  • Personalizuotos vaizdo demonstracijos
  • Daugiakalbiai avatarų atstovai
  • Visada pasiekiami, visada atitinkantys prekės ženklą

Švietimas

  • DI mokytojai, aptinkantys nesupratimą
  • Prisitaikantis tempas pagal įsitraukimą
  • Nuoseklus mokymo buvimas

Sveikatos priežiūra

  • Pacientų pirminio priėmimo pokalbiai
  • Psichinės sveikatos būklės patikros palydovai
  • Prieinamos nuotolinės sveikatos priežiūros sąsajos

Realaus laiko pokalbių vaizdo įrašų rinka iš esmės skiriasi nuo klipų generavimo rinkos. Ji mažiau kūrybinė, bet komerciškai greičiau pritaikoma. Pirmieji taikiniai yra įmonės, kurios šiuo metu išleidžia lėšas Zoom licencijoms, skambučių centrų darbuotojams ir vaizdo produkcijai, skirtai pardavimų efektyvumui didinti.

Techniniai apribojimai, į kuriuos verta atkreipti dėmesį

Phoenix-4 nėra be apribojimų. Dabartinė versija veikia tik vieno veido, į kamerą nukreiptuose scenarijuose. Kelių žmonių pokalbiai, viso kūno generavimas ir sudėtingi fonai nepalaikomi.

GalimybėBūsena
Vieno veido generavimasPalaikoma (1080p, 40fps)
Emocinės išraiškos kontrolėPalaikoma (10+ emocinių būsenų)
Realaus laiko balso sintezėPalaikoma (pilnas dupleksas)
Kelių žmonių scenosNepalaikoma
Viso kūno generavimasNepalaikoma
Sudėtingi fonaiRibota (tik statiniai fonai)
Diegimas neprisijungus / pakraštyjeNeprieinamas (tik debesijos API)

Reikalavimas naudoti tik debesiją reiškia, kad delsa priklauso nuo tinklo kokybės. Tavus praneša apie mažesnę nei 600 ms visuminę delsą optimaliomis sąlygomis, tačiau realiomis sąlygomis našumas skirsis. Jautrioms delsai programoms, pavyzdžiui, tiesioginiams klientų skambučiams, galiausiai reikės diegimo pakraštyje.

Platesnis vaizdas

Phoenix-4 pasirodo lūžio taške. Iš anksto generuojamų DI vaizdo įrašų erdvė yra perpildyta, joje dešimtys modelių varžosi dėl raiškos, trukmės ir stiliaus. Tačiau realaus laiko pokalbių vaizdo įrašų sritis beveik tuščia. Tavus susiduria su ribota tiesiogine konkurencija, nes dauguma alternatyvų yra paprasti lūpų sinchronizavimo sluoksniai, o ne visavertės emocinio generavimo sistemos.

Klausimas, ar trijų modelių architektūra gali būti išplėsta. Vienu metu vykdyti Raven-1, Sparrow-1 ir Phoenix-4 reikia reikšmingų skaičiavimo išteklių. Šiuo metu šie ištekliai yra Tavus debesijoje. Priartinus juos prie pakraščio arba optimizavus vartotojų aparatinės įrangos naudojimui, atsivertų visiškai nauji diegimo scenarijai.

Platesnei DI vaizdo įrašų industrijai Phoenix-4 rodo, kad kita riba nėra vien geresni vaizdo įrašai. Tai vaizdo įrašas kaip realaus laiko sąsaja, kurioje DI ne kuria turinį jums, o bendrauja su jumis.

💡
Daugiau apie tai, kaip DI vaizdo įrašų modeliai tobulina savo architektūras, skaitykite mūsų apžvalgoje apie difuzijos transformerius ir poslinkį link pasaulio modelių.

Phoenix-4 pasiekiamas per Tavus API. Skaitmeniniam dvyniui sukurti reikia įkelti dviejų minučių vaizdo įrašą. Informaciją apie kainodarą rasite jų kūrėjų portale.


Šaltiniai

Alexis
AlexisAI EngineerAI Author

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.