Tavus Phoenix-4: realaus laiko emocinis intelektas susitinka su DI vaizdo įrašais
Tavus ką tik pristatė Phoenix-4, Gauso difuzijos modelį, kuris realiuoju laiku 1080p/40fps raiška generuoja žmonių veidus su emocine kontrole. Štai ką tai reiškia DI vaizdo įrašų ateičiai.

Nuo klipų prie pokalbių
DI vaizdo įrašų erdvėje vyksta ginklavimosi varžybos dėl raiškos, trukmės ir tikroviškumo. Kling 3.0 pristatė vietinę 4K raišką. Seedance 2.0 sukėlė Holivudo ieškinius. Sora 2 sudarė sandorį su Disney. Visa tai įspūdinga, tačiau remiasi tuo pačiu modeliu: įvedate užklausą, palaukiate, gaunate vaizdo įrašą.
Phoenix-4 nutraukia šį modelį. 2026 m. vasario 18 d. pristatytas pirmasis modelis, sukurtas realiuoju laiku generuoti žmones su emociniu intelektu. Užuot per 30 sekundžių sukūręs 10 sekundžių klipą, jis generuoja visą 1080p veidą 40 kadrų per sekundę greičiu, o delsa neviršija 600 milisekundžių.
Tai nėra vaizdo įrašų generatorius. Tai yra buvimo variklis.
Architektūra: trys darniai veikiantys modeliai
Phoenix-4 techniškai įdomus dėl savo trijų komponentų srauto, kuriame kiekvienas komponentas sprendžia skirtingą žmonių bendravimo dalį.
Raven-1: emocijų suvokimas
Pirmasis modelis rinkinyje yra Raven-1, suvokimo modulis, realiuoju laiku analizuojantis naudotojo vaizdo srautą. Jis aptinka veido išraiškas, balso toną ir pokalbio signalus, kad sukurtų nuolatinį emocinės būsenos žemėlapį.
Tai nėra paprasta nuotaikų analizė. Raven-1 stebi mikroišraiškas, pauzių trukmę, kalbos ritmą ir žvilgsnio kryptį. Rezultatas yra daugiamatis emocinis vektorius, perduodamas į generavimo srautą.
Sparrow-1: pokalbio laikas
Antrasis komponentas, Sparrow-1, sprendžia labiausiai nuvertinamą pokalbių DI problemą: kada kalbėti. Dabartiniai balso asistentai arba pertraukia, arba laukia per ilgai. Sparrow-1 naudoja pilno duplekso architektūrą, kuri vienu metu klausosi ir kalba, taip atkartodama tikrą žmonių pokalbį.
Jis prognozuoja kalbėjimo eilės signalus, valdo grįžtamojo ryšio ženklus (linktelėjimą, „mhm“ atitikmenis) ir koreguoja atsakymo laiką pagal iš Raven-1 gautą emocinę būseną. Jei sustojate, nes galvojate, jis palaukia. Jei sustojate, nes esate sutrikę, jis paaiškina.
Phoenix-4: Gauso difuzijos generavimas
Pats generavimo modelis naudoja hibridinį Gauso difuzijos metodą. Tradiciniai difuzijos modeliai yra per lėti naudojimui realiuoju laiku. Grynieji Gauso metodai neturi difuzijos teikiamos detalių kokybės. Phoenix-4 sujungia abu metodus: bazinei geometrijai ir sekimui realiuoju laiku jis naudoja Gauso taškų išsklaidymą, tada tiksliniu būdu taiko difuzinį patikslinimą išraiškai kritinėse srityse (akyse, burnoje, antakiuose).
Emocinės kontrolės API
Kūrėjams praktiškiausia funkcija yra Emocinės kontrolės API. Užuot leidę DI nuspręsti, kaip reikšti emocijas, galite programiškai nurodyti tikslines emocijas.
{
"emotion": "empathetic_concern",
"intensity": 0.7,
"transition_speed": "gradual",
"micro_expressions": true
}API palaiko daugiau nei dešimt emocinių būsenų, įskaitant džiaugsmą, liūdesį, pyktį, nuostabą, baimę, susijaudinimą, smalsumą ir pasitenkinimą, su intensyvumo kontrole ir maišymu. Klientų aptarnavimo avataras, aptikęs nusivylimą skambinančiojo balse, gali pereiti nuo draugiškos prie empatiškos išraiškos.
Čia atsiperka trijų modelių srautas. Raven-1 aptinka naudotojo emocinę būseną, kūrėjo taisyklės nustato tinkamą atsako emociją, o Phoenix-4 ją generuoja realiuoju laiku.
Skaitmeniniai dvyniai per dvi minutes
Vienas ryškiausių teiginių: Phoenix-4 gali sukurti individualų skaitmeninį dvynį vos iš dviejų minučių filmuotos medžiagos. Įkelkite trumpą savo kalbėjimo vaizdo įrašą, ir sistema išgauna pakankamai veido geometrijos, išraiškų diapazono ir balso charakteristikų, kad sukurtų realaus laiko avatarą.
Kokybė dar nepasiekia kino VFX lygio. Demonstracijose skaitmeniniai dvyniai kartais rodo artefaktus greitų galvos judesių ir sudėtingų apšvietimo perėjimų metu. Tačiau vaizdo skambučiams, klientų aptarnavimui ir pardavimo pristatymams tikroviškumo visiškai pakanka.
Kodėl tai svarbu DI vaizdo įrašams
Phoenix-4 reiškia kategorijos plėtrą DI vaizdo įrašų srityje. Iki šiol kiekvienas svarbus modelis buvo orientuotas į turinio kūrimą: klipų, reklamų, trumpametražių filmų, socialinių tinklų įrašų gamybą. Phoenix-4 orientuojasi į bendravimą, gerokai didesnę gyvos vaizdo sąveikos rinką.
Apsvarstykite naudojimo atvejus:
Klientų aptarnavimas
- Visą parą veikiantys vaizdo klientų aptarnavimo agentai
- Emociškai reaguojantys, ne robotiški
- Plečiama apimtis be naujų darbuotojų samdymo
Pardavimai
- Personalizuotos vaizdo demonstracijos
- Daugiakalbiai avatarų atstovai
- Visada pasiekiami, visada atitinkantys prekės ženklą
Švietimas
- DI mokytojai, aptinkantys nesupratimą
- Prisitaikantis tempas pagal įsitraukimą
- Nuoseklus mokymo buvimas
Sveikatos priežiūra
- Pacientų pirminio priėmimo pokalbiai
- Psichinės sveikatos būklės patikros palydovai
- Prieinamos nuotolinės sveikatos priežiūros sąsajos
Realaus laiko pokalbių vaizdo įrašų rinka iš esmės skiriasi nuo klipų generavimo rinkos. Ji mažiau kūrybinė, bet komerciškai greičiau pritaikoma. Pirmieji taikiniai yra įmonės, kurios šiuo metu išleidžia lėšas Zoom licencijoms, skambučių centrų darbuotojams ir vaizdo produkcijai, skirtai pardavimų efektyvumui didinti.
Techniniai apribojimai, į kuriuos verta atkreipti dėmesį
Phoenix-4 nėra be apribojimų. Dabartinė versija veikia tik vieno veido, į kamerą nukreiptuose scenarijuose. Kelių žmonių pokalbiai, viso kūno generavimas ir sudėtingi fonai nepalaikomi.
| Galimybė | Būsena |
|---|---|
| Vieno veido generavimas | Palaikoma (1080p, 40fps) |
| Emocinės išraiškos kontrolė | Palaikoma (10+ emocinių būsenų) |
| Realaus laiko balso sintezė | Palaikoma (pilnas dupleksas) |
| Kelių žmonių scenos | Nepalaikoma |
| Viso kūno generavimas | Nepalaikoma |
| Sudėtingi fonai | Ribota (tik statiniai fonai) |
| Diegimas neprisijungus / pakraštyje | Neprieinamas (tik debesijos API) |
Reikalavimas naudoti tik debesiją reiškia, kad delsa priklauso nuo tinklo kokybės. Tavus praneša apie mažesnę nei 600 ms visuminę delsą optimaliomis sąlygomis, tačiau realiomis sąlygomis našumas skirsis. Jautrioms delsai programoms, pavyzdžiui, tiesioginiams klientų skambučiams, galiausiai reikės diegimo pakraštyje.
Platesnis vaizdas
Phoenix-4 pasirodo lūžio taške. Iš anksto generuojamų DI vaizdo įrašų erdvė yra perpildyta, joje dešimtys modelių varžosi dėl raiškos, trukmės ir stiliaus. Tačiau realaus laiko pokalbių vaizdo įrašų sritis beveik tuščia. Tavus susiduria su ribota tiesiogine konkurencija, nes dauguma alternatyvų yra paprasti lūpų sinchronizavimo sluoksniai, o ne visavertės emocinio generavimo sistemos.
Klausimas, ar trijų modelių architektūra gali būti išplėsta. Vienu metu vykdyti Raven-1, Sparrow-1 ir Phoenix-4 reikia reikšmingų skaičiavimo išteklių. Šiuo metu šie ištekliai yra Tavus debesijoje. Priartinus juos prie pakraščio arba optimizavus vartotojų aparatinės įrangos naudojimui, atsivertų visiškai nauji diegimo scenarijai.
Platesnei DI vaizdo įrašų industrijai Phoenix-4 rodo, kad kita riba nėra vien geresni vaizdo įrašai. Tai vaizdo įrašas kaip realaus laiko sąsaja, kurioje DI ne kuria turinį jums, o bendrauja su jumis.
Phoenix-4 pasiekiamas per Tavus API. Skaitmeniniam dvyniui sukurti reikia įkelti dviejų minučių vaizdo įrašą. Informaciją apie kainodarą rasite jų kūrėjų portale.
Šaltiniai

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Nemokami neriboti DI vaizdo įrašų įrankiai: kas veikia 2026 m.
Nemokami neriboti DI vaizdo įrankiai dažniausiai yra eilės pagrindu arba vietiniai. Sužinokite, kas iš tikrųjų yra neribota, kas sulėtėja ir kaip pasirinkti veiksmingą 2026 m. sprendimą.

DI vaizdo įrašai švietimui: kaip mokytojai ir kursų kūrėjai naudoja dirbtinį intelektą 2026 m.
Nuo paskaitų įrašų iki visų kursų kūrimo, dirbtinio intelekto vaizdo įrankiai keičia, kaip pedagogai kuria turinį. Štai kas veikia, kas ne, ir kur juda technologija.

Bonega ir Synthesia 2026 m.: DI vaizdo įrašų generavimas ir DI vaizdo įrašai verslui
Bonega.ai kuria kinematografiškus DI vaizdo įrašus iš teksto ir vaizdų. Synthesia kuria avatarais paremtus verslo vaizdo įrašus su vertimais. Lyginame kainas, funkcijas ir kuri platforma tinka jūsų darbo eigai.