Tavus Phoenix-4: Emotionel Intelligens i Realtid Møder AI-Video
Tavus har netop lanceret Phoenix-4, en Gaussian-diffusion-model, der gengiver menneskelige ansigter i realtid ved 1080p/40fps med emotionel kontrol. Her er hvad det betyder for fremtiden for AI-video.

Fra Klip til Samtaler
AI-videorummet har været låst i et kapprustningsløb omkring opløsning, varighed og troskab. Kling 3.0 pressede native 4K. Seedance 2.0 udløste Hollywood-retssager. Sora 2 landede en Disney-aftale. Alt imponerende, alt efter samme skabelon: skriv en prompt, vent, få en video.
Phoenix-4 bryder dette mønster. Udgivet den 18. februar 2026 er det den første model designet til gengivelse af mennesker i realtid med emotionel intelligens. I stedet for at generere et 10-sekunders klip på 30 sekunder, gengiver det et fuldt 1080p-ansigt ved 40 billeder pr. sekund med sub-600 millisekunds latens.
Det er ikke en videogenerator. Det er en tilstedeværelsesmotor.
Arkitekturen: Tre Modeller i Harmoni
Hvad der gør Phoenix-4 teknisk interessant er dets tre-komponente pipeline, hver håndterer en skelsættende del af menneskelig kommunikation.
Raven-1: Emotionel Opfattelse
Den første model i stacken er Raven-1, et perceptionsmodul, der analyserer brugerens videofeed i realtid. Det detekterer ansigtsudtryk, vokalton og samtalehenvisninger for at opbygge et kontinuerligt kort over følelsestilstand.
Dette er ikke simpel sentimentanalyse. Raven-1 sporer mikroudtryk, pausevarighed, taleritme og blikretning. Output er en multidimensionel følelsesvektor, der føres ind i rendering-pipelinen.
Sparrow-1: Samtaletiming
Den anden komponent, Sparrow-1, håndterer det mest undervurderede problem inden for samtale-AI: at vide hvornår man skal tale. Nuværende stemmeassistenter afbryder dig enten eller venter for længe. Sparrow-1 bruger en full-duplex-arkitektur, der lytter og taler samtidigt, spejlende hvordan rigtige mennesker samtaler.
Det forudsiger skiftetegn, administrerer back-channel-signaler (nikke, "mm-hmm" ækvivalenter) og justerer svaritiming baseret på følelsestilstanden fra Raven-1. Hvis du holder pause fordi du tænker, venter den. Hvis du holder pause fordi du er forvirret, præciserer den.
Phoenix-4: Gaussian-Diffusion Rendering
Rendering-modellen selv bruger en Gaussian-diffusion hybrid-tilgang. Traditionelle diffusionsmodeller er for langsomme til realtidsbrug. Rene Gaussian-metoder mangler diffusionens detaljagtighed. Phoenix-4 kombinerer begge: det bruger Gaussian splatting til basisgeometri og realtidssporing og anvender derefter diffusionrefinement på en målrettet måde på expresionkritiske områder (øjne, mund, øjenbryn).
API for Emotionel Kontrol
For udviklere er den mest praktiske funktion API'et til Emotionel Kontrol. I stedet for at lade AI'en afgøre hvordan man skal udtrykke følelser, kan du programmering specificere målemotioner.
{
"emotion": "empathetic_concern",
"intensity": 0.7,
"transition_speed": "gradual",
"micro_expressions": true
}API'et understøtter over ti følelsestilstande, herunder glæde, tristhed, vrede, overraskelse, frygt, ophidselse, nysgerrighed og tilfredsstillelse, med intensitetskontroller og blanding. En kundesupportavatar kan skifte fra venlig til empatisk når frustration registreres i kundens stemme.
Det er her den tre-model pipeline betaler sig af. Raven-1 registrerer brugerens følelsestilstand, udviklerens regler bestemmer den passende responsemotionion, og Phoenix-4 gengiver det i realtid.
Digitale Tvillinger på To Minutter
En af de mest slående påstande: Phoenix-4 kan lave en brugerdefineret digital tvilling ud fra blot to minutter optagelse. Upload en kort video af dig selv tale, og systemet ekstraherer nok ansigtsgeometri, ekspressionsrækkevidde og stemmekarakteristika til at generere en realtidsavatar.
Kvaliteten er endnu ikke på film-VFX-niveau. I demonstrationer viser digitale tvillinger lejlighedsvise artefakter omkring hurtige hovedbevægelser og komplekse belysningsovergange. Men til videoopkald, kundesupport og salgspræsentationer er troskap mere end tilstrækkelig.
Hvorfor Dette Betyder For AI-Video
Phoenix-4 repræsenterer en kategorieudvidelse for AI-video. Indtil nu fokuserede hver større model på indholdsfremstilling: at lave klip, annoncer, kortfilms, indlæg på sociale medier. Phoenix-4 fokuserer på kommunikation, det meget større marked for live-videointeraktion.
Betragt brugssituationerne:
Kundesupport
- 24/7 videobaserede supportagenter
- Emotionelt responsiv, ikke robotagtig
- Skalerer uden ansættelser
Salg
- Personaliserede videodemonstrationer
- Flersprogede avatarepræsentanter
- Altid tilgængelige, altid on-brand
Uddannelse
- AI-vejledere som detekterer forvirring
- Adaptiv tempo baseret på engagement
- Konsistent undervisningspræsence
Sundhedsvæsen
- Interviewe patientintake
- Ledsagere til mentalsundheds-check-in
- Tilgængelige telehealth-grænseflader
Markedet for realtids-samtalevideo er fundamentalt anderledes end klip-generationsmarkedet. Det er mindre kreativt men mere kommercielt øjeblikkeligt. Virksomheder der i øjeblikket bruger penge på Zoom-licenser, call center-bemanding og videoproduktion til salgsaktivering er de første mål.
Tekniske Begrænsninger at Holde Øje Med
Phoenix-4 er ikke uden begrænsninger. Den aktuelle version fungerer udelukkende med enkeltansigt, front-facing scenarioer. Fler-personers samtaler, fuld-krops-rendering og komplekse baggrunde understøttes ikke.
| Mulighed | Status |
|---|---|
| Enkel ansigtsrendering | Understøttet (1080p, 40fps) |
| Emotionel ekspression-kontrol | Understøttet (10+ følelsestilstande) |
| Realtids-stemmesyntese | Understøttet (full-duplex) |
| Fler-personers scener | Ikke understøttet |
| Fuld-krops rendering | Ikke understøttet |
| Komplekse baggrunde | Begrænset (kun statiske baggrunde) |
| Offline/edge-implementering | Ikke tilgængelig (kun cloud API) |
Cloud-only-kravet betyder at latens afhænger af netværkskvalitet. Tavus rapporterer sub-600ms end-to-end under optimale forhold, men real-world-ydeevne vil variere. For latens-følsomme applikationer som live kundesamtaler vil edge-implementering eventuelt være nødvendig.
Det Større Billede
Phoenix-4 ankommer på et vendepunkt. Pre-rendereret AI-videorummet er fyldt, med snesevis af modeller der konkurrerer omkring opløsning, varighed og stil. Men realtids-samtalevideo er næsten tom. Tavus står over for begrænset direkte konkurrence, hvor det meste af alternativerne er simple lip-sync-overlejringer i stedet for fulde emotionel-rendering-systemer.
Spørgsmålet er om tre-model arkitekturen kan skalere. Kørsel af Raven-1, Sparrow-1 og Phoenix-4 samtidigt kræver betydelig computing. Lige nu bor den computing i Tavus' cloud. At bringe det tættere på kanten, eller at optimere det for consumer-hardware, ville åbne helt nye implementeringsscenarioer.
For den bredere AI-videoindustri signalerer Phoenix-4 at næste grænse ikke bare er bedre videoer. Det er video som realtids-grænseflade, hvor AI ikke skaber indhold for dig, men kommunikerer med dig.
Phoenix-4 er tilgængelig via Tavus API. Digitalt tvilling-oprettelse kræver upload af to-minutters video. Prisoplysninger er tilgængelige på deres udviklerportal.

AI-ingeniør fra Lausanne, der kombinerer forskningsdybde med praktisk innovation. Deler sin tid mellem modelarkitekturer og alpine bjergtoppe.
View profile →Kan du lide det, du har læst?
Forvandl dine idéer til AI-videoer med ubegrænset længde på få minutter.
Relaterede artikler
Udforsk videre med disse relaterede indlæg

Helios: 14B-modellen der køres AI-video i realtid på forbrugerhardware
Helios fra Peking University, ByteDance og Canva genererer minuttelange AI-videoer ved 19,5 FPS med blot 6GB VRAM, og det er fuldt open source.

AI-video i 2026: 5 konkrete forudsigelser der vil ændre alt
Fra realtids interaktiv generering til AI-native filmsprog, her er fem forudsigelser for hvordan AI-video vil transformere kreative workflows i 2026.

AI Video Extender: Gør video længere i 2026
Brug en AI-videoextender til at gøre en video længere i 2026. Sammenlign udvidelsesgrænser, bevar kontinuiteten, og vælg en arbejdsgang for genererede eller eksisterende klip.