Meta PixelSalta al contingut principal
AlexisAlexis· Autoria d’IA, revisada per humans
7 min read
1394 paraules

Tavus Phoenix-4: Intel·ligència Emocional en Temps Real es Troba amb Video AI

Tavus acaba de llançar Phoenix-4, un model Gaussian-diffusion que representa cares humanes en temps real a 1080p/40fps amb control emocional. Aquí és el que significa per al futur del vídeo AI.

Tavus Phoenix-4: Intel·ligència Emocional en Temps Real es Troba amb Video AI

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

Cada gran model de vídeo AI el 2026 s'ha centrat en un objectiu: crear millors talls prerepresentats. Tavus va fer una pregunta completament diferent. I si el vídeo AI es produés en directe, en temps real, i pogués llegir les teves emocions mentre ho feia?

De Talls a Converses

L'espai de vídeo AI ha estat bloquejat en una cursa d'armaments sobre resolució, durada i fidelitat. Kling 3.0 va impulsar 4K nativa. Seedance 2.0 va desencadenar demandes de Hollywood. Sora 2 va assolir un acord amb Disney. Tot impressionant, tot seguint el mateix patró: escriu un avís, espera, obtén un vídeo.

Phoenix-4 trenca aquest patró. Llançat el 18 de febrer de 2026, és el primer model dissenyat per a representació de cara en temps real amb intel·ligència emocional. En lloc de generar un clip de 10 segons en 30 segons, representa una cara 1080p completa a 40 fotogrames per segon amb latència inferior a 600 mil·lisegons.

Això no és un generador de vídeo. Això és un motor de presència.

💡
Phoenix-4 no competeix amb Sora, Veo o Kling. Ocupava una categoria completament diferent: vídeo de conversa en temps real, on l'IA et respon mentre parles.

L'Arquitectura: Tres Models en Harmonia

Allò que fa Phoenix-4 tècnicament interessant és la seva canonada de tres components, cadascuna gestionant una part diferent de la comunicació humana.

Latència de punta a punta
40fps
Velocitat de fotogrames de representació
1080p
Resolució de sortida
2 min
Temps de formació per a bessons digitals

Raven-1: Percepció Emocional

El primer model de l'apila és Raven-1, un mòdul de percepció que analitza el flux de vídeo de l'usuari en temps real. Detecta expressions facials, to de veu i pistes de conversa per construir un mapa continu de l'estat emocional.

Això no és una simple anàlisi de sentiments. Raven-1 fa seguiment de micro-expressions, durada de pauses, cadència del discurs i direcció de la mirada. L'output és un vector emocional multidimensional que alimenta la canonada de representació.

Sparrow-1: Sincronització de Conversa

El segon component, Sparrow-1, aborda el problema més ignorat de l'IA conversacional: saber quan parlar. Els assistents de veu actuals o bé t'interrompen o bé esperen massa. Sparrow-1 utilitza una arquitectura full-duplex que escolca i parla simultàniament, reflectint com conversa la gent de debò.

Prediu senyals de canvi de torn, gestiona senyals de canal de retorn (moviments del cap, equivalents "mm-hmm") i ajusta el temps de resposta segons l'estat emocional de Raven-1. Si fas pausa perquè estàs pensant, espera. Si fas pausa perquè estàs confosa, aclareix.

Phoenix-4: Representació Gaussian-Diffusion

El model de representació en si utilitza un enfocament híbrid Gaussian-diffusion. Els models de difusió tradicionals són massa lents per a l'ús en temps real. Els mètodes Gaussian purs mancaren la qualitat de detall de la difusió. Phoenix-4 combina tots dos: utilitza Gaussian splatting per a la geometria base i el rastreig en temps real, després aplica refinament de difusió de manera enfocada a regions critiques per a l'expressió (ulls, boca, cella).

💡
La intuïció clau és la difusió selectiva. En lloc de executar un pas de difusió complet en cada fotograma, Phoenix-4 només l'aplica allà on l'expressió emocional exigeix detall fi. Això manté la latència per sota de 600 ms mentre es manté la qualitat visual.

L'API de Control Emocional

Per a els desenvolupadors, la característica més pràctica és l'API de Control Emocional. Més que deixar que l'IA decideixi com expressar-se emocionalment, pots especificar emocions objectiu de manera programàtica.

{"emotion": "empathetic_concern", "intensity": 0.7, "transition_speed": "gradual", "micro_expressions": true}

L'API admet més de deu estats emocionals, inclosos la felicitat, la tristesa, la ira, la sorpresa, la por, l'entusiasme, la curiositat i la satisfacció, amb controls d'intensitat i mescla. Un avatar de suport al client pot canviar de amic a empàtic quan detecta frustració en la veu de qui truca.

Aquí és on la canonada de tres models es paga. Raven-1 detecta l'estat emocional de l'usuari, les regles del desenvolupador determinen l'emoció de resposta apropiat, i Phoenix-4 la representa en temps real.

Bessons Digitals en Dos Minuts

Una de les afirmacions més sorprenents: Phoenix-4 pot crear un bessó digital personalitzat a partir de només dos minuts de vídeo. Carrega un vídeo curt de tu parlant, i el sistema extreu suficient geometria facial, rang d'expressions i característiques de veu per generar un avatar en temps real.

Creació d'avatar tradicional
Hores d'escaneig 3D, rigging FACS, mapeig manual d'expressions, sessions d'enregistrament de veu
Enfocament Phoenix-4
Càrrega de vídeo de dos minuts, extracció automàtica de geometria, expressions i veu per a representació en temps real

La qualitat ainda no está al nivel de VFX de películas. En las demostraciones, los gemelos digitales ocasionalmente muestran artefactos alrededor de movimientos rápidos de cabeza y transiciones de iluminación complejas. Pero para videollamadas, soporte al cliente y presentaciones de ventas, la fidelidad es más que suficiente.

Per Què Això Importa per a Vídeo AI

Phoenix-4 representa una expansió de categoria per a vídeo AI. Fins ara, cada gran model s'ha centrat en la creació de contingut: fer talls, anuncis, curtmetratges, publicacions de xarxes socials. Phoenix-4 es centra en la comunicació, el mercat molt més gran de la interacció en vídeo en directe.

Considera els casos d'ús:

Suport al Client

  • Agents de suport basats en vídeo 24/7
  • Responsiu emocionalment, no robòtic
  • S'escala sense contractació

Vendes

  • Demostracions de vídeo personalitzades
  • Representants d'avatar multilingües
  • Sempre disponibles, sempre en marca

Educació

  • Tutors AI que detecten confusió
  • Ritme adaptatiu basada en l'engagement
  • Presència docent consistent

Atenció Sanitària

  • Entrevistes d'admissió de pacients
  • Companys de verificació de salut mental
  • Interfícies telemèdiques accessibles

El mercat del vídeo conversacional en temps real és fonamentalment diferent del mercat de generació de talls. És menys creatiu però més comercialment immediat. Les empreses que actualment gasten en llicències Zoom, personal del centre de trucades i producció de vídeo per a l'habilitació de vendes són els primers objectius.

Limitacions Tècniques a Vigilar

Phoenix-4 no és sense limitacions. La versió actual funciona exclusivament amb escenaris de cara única, enfrontats. Les converses multipersona, la representació del cos complet i els fons complexos no són compatibles.

CapacitatEstat
Representació de cara únicaCompatible (1080p, 40fps)
Control d'expressió emocionalCompatible (10+ estats emocionals)
Síntesi de veu en temps realCompatible (full-duplex)
Escenes multipersonaNo compatible
Representació de cos completNo compatible
Fons complexosLimitat (només fons estàtics)
Implementació fora de línia/perimetralNo disponible (només API al núvol)

El requisit només al núvol significa que la latència depèn de la qualitat de la xarxa. Tavus informa de menys de 600 ms de punta a punta en condicions òptimes, però el rendiment real variarà. Per a aplicacions sensibles a la latència com les trucades en directe al suport del client, l'implementació perimetral acabarà sent necessària.

La Imatge Més Gran

Phoenix-4 arriba en un punt d'inflexió. L'espai de vídeo AI prerepresentat està ple, amb desenes de models competint per resolució, durada i estil. Però el vídeo de conversa en temps real és gairebé buit. Tavus es fa front a una competència directa limitada, amb la majoria d'alternatives sent simples superposicions de sincronització de llavis més que sistemes complets de representació emocional.

La pregunta és si l'arquitectura de tres models pot escalar. Executar Raven-1, Sparrow-1 i Phoenix-4 simultàniament requereix importants recursos informàtics. Ara, els recursos informàtics viuen al núvol de Tavus. Portar-ho més prop de l'extrem, o optimitzar-lo per a maquinari de consumidor, obriria escenaris de desplegament completament nous.

Per a la indústria del vídeo AI més àmplia, Phoenix-4 senyala que la següent frontera no és només vídeo millor. És vídeo com a interfície en temps real, on l'IA no crea contingut per a tu, sinó que comunica amb tu.

💡
Per a més informació sobre com els models de vídeo AI evolucionan les seves arquitectures, consulta el nostre desglosament de transformadores de difusió i l'evolució cap a models del món.

Phoenix-4 está disponible a través de la API de Tavus. La creación de gemelos digitales requiere cargar un vídeo de dos minutos. Los detalles de precios están disponibles en su portal para desarrolladores.

Alexis
AlexisAI EngineerAI Author

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.