Tavus Phoenix-4: Intel·ligència Emocional en Temps Real es Troba amb Video AI
Tavus acaba de llançar Phoenix-4, un model Gaussian-diffusion que representa cares humanes en temps real a 1080p/40fps amb control emocional. Aquí és el que significa per al futur del vídeo AI.

Preparat per crear els teus propis vídeos amb IA?
Uneix-te a milers de creadors que utilitzen Bonega.ai
De Talls a Converses
L'espai de vídeo AI ha estat bloquejat en una cursa d'armaments sobre resolució, durada i fidelitat. Kling 3.0 va impulsar 4K nativa. Seedance 2.0 va desencadenar demandes de Hollywood. Sora 2 va assolir un acord amb Disney. Tot impressionant, tot seguint el mateix patró: escriu un avís, espera, obtén un vídeo.
Phoenix-4 trenca aquest patró. Llançat el 18 de febrer de 2026, és el primer model dissenyat per a representació de cara en temps real amb intel·ligència emocional. En lloc de generar un clip de 10 segons en 30 segons, representa una cara 1080p completa a 40 fotogrames per segon amb latència inferior a 600 mil·lisegons.
Això no és un generador de vídeo. Això és un motor de presència.
L'Arquitectura: Tres Models en Harmonia
Allò que fa Phoenix-4 tècnicament interessant és la seva canonada de tres components, cadascuna gestionant una part diferent de la comunicació humana.
Raven-1: Percepció Emocional
El primer model de l'apila és Raven-1, un mòdul de percepció que analitza el flux de vídeo de l'usuari en temps real. Detecta expressions facials, to de veu i pistes de conversa per construir un mapa continu de l'estat emocional.
Això no és una simple anàlisi de sentiments. Raven-1 fa seguiment de micro-expressions, durada de pauses, cadència del discurs i direcció de la mirada. L'output és un vector emocional multidimensional que alimenta la canonada de representació.
Sparrow-1: Sincronització de Conversa
El segon component, Sparrow-1, aborda el problema més ignorat de l'IA conversacional: saber quan parlar. Els assistents de veu actuals o bé t'interrompen o bé esperen massa. Sparrow-1 utilitza una arquitectura full-duplex que escolca i parla simultàniament, reflectint com conversa la gent de debò.
Prediu senyals de canvi de torn, gestiona senyals de canal de retorn (moviments del cap, equivalents "mm-hmm") i ajusta el temps de resposta segons l'estat emocional de Raven-1. Si fas pausa perquè estàs pensant, espera. Si fas pausa perquè estàs confosa, aclareix.
Phoenix-4: Representació Gaussian-Diffusion
El model de representació en si utilitza un enfocament híbrid Gaussian-diffusion. Els models de difusió tradicionals són massa lents per a l'ús en temps real. Els mètodes Gaussian purs mancaren la qualitat de detall de la difusió. Phoenix-4 combina tots dos: utilitza Gaussian splatting per a la geometria base i el rastreig en temps real, després aplica refinament de difusió de manera enfocada a regions critiques per a l'expressió (ulls, boca, cella).
L'API de Control Emocional
Per a els desenvolupadors, la característica més pràctica és l'API de Control Emocional. Més que deixar que l'IA decideixi com expressar-se emocionalment, pots especificar emocions objectiu de manera programàtica.
{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}L'API admet més de deu estats emocionals, inclosos la felicitat, la tristesa, la ira, la sorpresa, la por, l'entusiasme, la curiositat i la satisfacció, amb controls d'intensitat i mescla. Un avatar de suport al client pot canviar de amic a empàtic quan detecta frustració en la veu de qui truca.
Aquí és on la canonada de tres models es paga. Raven-1 detecta l'estat emocional de l'usuari, les regles del desenvolupador determinen l'emoció de resposta apropiat, i Phoenix-4 la representa en temps real.
Bessons Digitals en Dos Minuts
Una de les afirmacions més sorprenents: Phoenix-4 pot crear un bessó digital personalitzat a partir de només dos minuts de vídeo. Carrega un vídeo curt de tu parlant, i el sistema extreu suficient geometria facial, rang d'expressions i característiques de veu per generar un avatar en temps real.
La qualitat ainda no está al nivel de VFX de películas. En las demostraciones, los gemelos digitales ocasionalmente muestran artefactos alrededor de movimientos rápidos de cabeza y transiciones de iluminación complejas. Pero para videollamadas, soporte al cliente y presentaciones de ventas, la fidelidad es más que suficiente.
Per Què Això Importa per a Vídeo AI
Phoenix-4 representa una expansió de categoria per a vídeo AI. Fins ara, cada gran model s'ha centrat en la creació de contingut: fer talls, anuncis, curtmetratges, publicacions de xarxes socials. Phoenix-4 es centra en la comunicació, el mercat molt més gran de la interacció en vídeo en directe.
Considera els casos d'ús:
Suport al Client
- Agents de suport basats en vídeo 24/7
- Responsiu emocionalment, no robòtic
- S'escala sense contractació
Vendes
- Demostracions de vídeo personalitzades
- Representants d'avatar multilingües
- Sempre disponibles, sempre en marca
Educació
- Tutors AI que detecten confusió
- Ritme adaptatiu basada en l'engagement
- Presència docent consistent
Atenció Sanitària
- Entrevistes d'admissió de pacients
- Companys de verificació de salut mental
- Interfícies telemèdiques accessibles
El mercat del vídeo conversacional en temps real és fonamentalment diferent del mercat de generació de talls. És menys creatiu però més comercialment immediat. Les empreses que actualment gasten en llicències Zoom, personal del centre de trucades i producció de vídeo per a l'habilitació de vendes són els primers objectius.
Limitacions Tècniques a Vigilar
Phoenix-4 no és sense limitacions. La versió actual funciona exclusivament amb escenaris de cara única, enfrontats. Les converses multipersona, la representació del cos complet i els fons complexos no són compatibles.
| Capacitat | Estat |
|---|---|
| Representació de cara única | Compatible (1080p, 40fps) |
| Control d'expressió emocional | Compatible (10+ estats emocionals) |
| Síntesi de veu en temps real | Compatible (full-duplex) |
| Escenes multipersona | No compatible |
| Representació de cos complet | No compatible |
| Fons complexos | Limitat (només fons estàtics) |
| Implementació fora de línia/perimetral | No disponible (només API al núvol) |
El requisit només al núvol significa que la latència depèn de la qualitat de la xarxa. Tavus informa de menys de 600 ms de punta a punta en condicions òptimes, però el rendiment real variarà. Per a aplicacions sensibles a la latència com les trucades en directe al suport del client, l'implementació perimetral acabarà sent necessària.
La Imatge Més Gran
Phoenix-4 arriba en un punt d'inflexió. L'espai de vídeo AI prerepresentat està ple, amb desenes de models competint per resolució, durada i estil. Però el vídeo de conversa en temps real és gairebé buit. Tavus es fa front a una competència directa limitada, amb la majoria d'alternatives sent simples superposicions de sincronització de llavis més que sistemes complets de representació emocional.
La pregunta és si l'arquitectura de tres models pot escalar. Executar Raven-1, Sparrow-1 i Phoenix-4 simultàniament requereix importants recursos informàtics. Ara, els recursos informàtics viuen al núvol de Tavus. Portar-ho més prop de l'extrem, o optimitzar-lo per a maquinari de consumidor, obriria escenaris de desplegament completament nous.
Per a la indústria del vídeo AI més àmplia, Phoenix-4 senyala que la següent frontera no és només vídeo millor. És vídeo com a interfície en temps real, on l'IA no crea contingut per a tu, sinó que comunica amb tu.
Phoenix-4 está disponible a través de la API de Tavus. La creación de gemelos digitales requiere cargar un vídeo de dos minutos. Los detalles de precios están disponibles en su portal para desarrolladores.

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.
View profile →T’ha agradat el que has llegit?
Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.
Articles relacionats
Continua explorant amb aquestes publicacions relacionades

Helios: El Model de 14B que Executa Video AI en Temps Real en Maquinari de Consumidor
La Universitat de Pequín, ByteDance i Canva Helios genera vídeos AI d'una durada minuta a 19.5 FPS amb només 6GB VRAM, i és completament de codi obert.

SkyReels V4: El Primer Model d'IA Que Veu i Sent Alhora
SkyReels V4 de Skywork AI estrena una arquitectura de difusió de doble flux que co-genera vídeo i àudio sincronitzat en una sola passada. Això és el que significa per als creadors.

Generadors de vídeo de productes amb IA: La guia completa per al comerç electrònic i el màrqueting el 2026
Els generadors de vídeo de productes amb IA estan transformant com les marques creen contingut. Des de pipelines d'URL a vídeo fins a taxes d'afegir a la cistella un 27% més altes, això és el que cada expert en màrqueting ha de saber el 2026.