Tavus Phoenix-4: ذكاء عاطفي في الوقت الفعلي يلتقي بفيديو الذكاء الاصطناعي
أطلقت Tavus للتو Phoenix-4، وهو نموذج قائم على الانتشار الغاوسي يعرض الوجوه البشرية في الوقت الفعلي بدقة 1080p و40fps مع التحكم العاطفي. إليك ما يعنيه ذلك لمستقبل فيديو الذكاء الاصطناعي.

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟
انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai
من المقاطع إلى المحادثات
كانت مساحة فيديو الذكاء الاصطناعي محاصرة في سباق تسلح على الدقة والمدة والوضوح. دفعت Kling 3.0 معايير 4K الأصلية. أثارت Seedance 2.0 دعاوى قضائية من هوليوود. حصلت Sora 2 على صفقة مع Disney. كل هذا مثير للإعجاب، وكل ذلك يتبع نفس النموذج: اكتب موجهة، انتظر، احصل على فيديو.
يكسر Phoenix-4 هذا النمط. تم إطلاقه في 18 فبراير 2026، وهو أول نموذج مصمم لـ عرض الوجوه البشرية في الوقت الفعلي مع الذكاء العاطفي. بدلاً من إنتاج مقطع بطول 10 ثوان في 30 ثانية، فإنه يعرض وجهاً كاملاً بدقة 1080p بسرعة 40 إطاراً في الثانية مع زمن تأخير أقل من 600 ميلي ثانية.
هذا ليس محرك فيديو. هذا محرك حضور.
العمارة: ثلاثة نماذج في التناغم
ما يجعل Phoenix-4 مثيراً للاهتمام من الناحية التقنية هو خط أنابيب مكون من ثلاثة مكونات، حيث يتعامل كل منها مع جانب متميز من التواصل البشري.
Raven-1: الإدراك العاطفي
النموذج الأول في المكدس هو Raven-1، وهي وحدة إدراك تحلل تدفق الفيديو الخاص بك في الوقت الفعلي. تكتشف تعابير الوجه والنبرة الصوتية والإشارات المحادثة لبناء خريطة حالة عاطفية مستمرة. هذا ليس تحليل المشاعر البسيط. يتتبع Raven-1 الحركات الدقيقة، ومدة الفترات الزمنية، وإيقاع الكلام، واتجاه النظر. والمخرجات عبارة عن متجه عاطفي متعدد الأبعاد يتم تغذيته في خط أنابيب العرض.
Sparrow-1: توقيت المحادثة
المكون الثاني، Sparrow-1، يتعامل مع المشكلة الأكثر تقليلاً في الذكاء الاصطناعي المحادثة: معرفة متى تتحدث. تقاطع مساعدات الصوت الحالية بينك أو تنتظر وقتاً طويلاً. يستخدم Sparrow-1 بنية ثنائي الاتجاه كاملة تستمع وتتحدث بو قت واحد، مما يعكس كيفية تحدث البشر الفعليين. يتنبأ بإشارات التناوب، ويدير الإشارات الخلفية (الإيماءة بالرأس، "أممم" ما يعادل)، ويضبط توقيت الاستجابة بناءً على الحالة العاطفية من Raven-1. إذا توقفت لأنك تفكر، فإنه ينتظر. إذا توقفت لأنك مرتبك، فإنه يوضح.
Phoenix-4: عرض الانتشار الغاوسي
نموذج العرض نفسه يستخدم نهج هجين من الانتشار الغاوسي. نماذج الانتشار التقليدية بطيئة جداً للاستخدام في الوقت الفعلي. الطرق الغاوسية النقية تفتقر إلى جودة التفصيل من الانتشار. يجمع Phoenix-4 بين كليهما: يستخدم Gaussian splatting للهندسة الأساسية والتتبع في الوقت الفعلي، ثم يطبق تحسين الانتشار بطريقة موجهة على المناطق الحرجة للتعبير (العيون والفم والحاجب).
واجهة برمجة التطبيقات للتحكم العاطفي
بالنسبة للمطورين، أكثر الميزات عملية هي واجهة برمجة التطبيقات للتحكم العاطفي. بدلاً من ترك الذكاء الاصطناعي يقرر كيفية التعبير عن المشاعر، يمكنك تحديد العواطف المستهدفة برمجياً.
{
"emotion": "empathetic_concern",
"intensity": 0.7,
"transition_speed": "gradual",
"micro_expressions": true
}تدعم واجهة برمجة التطبيقات أكثر من عشر حالات عاطفية، بما في ذلك الفرح والحزن والغضب والمفاجأة والخوف والإثارة والفضول والرضا، مع عناصر التحكم في الشدة والمزج. يمكن لمساعد دعم العملاء أن يتحول من ودود إلى متعاطف عند اكتشاف الإحباط في صوت المتصل. هذا هو المكان الذي يتم فيه سداد خط الأنابيب ثلاثي النموذج. يكتشف Raven-1 الحالة العاطفية للمستخدم، وتحدد قواعد المطور الحالة العاطفية المناسبة للرد، و Phoenix-4 يعرضها في الوقت الفعلي.
التوائم الرقمية في دقيقتين
أحد أكثر الادعاءات التي تلفت الانتباه: يمكن لـ Phoenix-4 إنشاء توأم رقمي مخصص من فيديو بطول دقيقتين فقط. قم بتحميل فيديو قصير لنفسك وأنت تتحدث، والنظام يستخرج هندسة الوجه وتنوع التعبير وخصائص الصوت الكافية لإنشاء صورة رمزية في الوقت الفعلي.
الجودة ليست على مستوى VFX الفيلم حتى الآن. في العروض التوضيحية، تظهر التوائم الرقمية عيوباً عرضية حول حركات الرأس السريعة والانتقالات الإضاءة المعقدة. لكن لمكالمات الفيديو ودعم العملاء والعروض التقديمية للمبيعات، الدقة أكثر من كافية.
لماذا هذا مهم لفيديو الذكاء الاصطناعي
يمثل Phoenix-4 توسع الفئة لفيديو الذكاء الاصطناعي. حتى الآن، كل نموذج رئيسي ركز على إنشاء المحتوى: إنتاج مقاطع وإعلانات وأفلام قصيرة ومنشورات وسائط اجتماعية. يركز Phoenix-4 على التواصل، السوق الأكبر بكثير لتفاعل الفيديو المباشر. ضع في الاعتبار حالات الاستخدام:
دعم العملاء
- وكلاء دعم قائمون على الفيديو 24/7
- يستجيبون عاطفياً وليس آلياً
- يتسع بدون توظيف
المبيعات
- عروض فيديو مخصصة
- ممثلو الصورة الرمزية متعددة اللغات
- متاح دائماً وعلى العلامة التجارية دائماً
التعليم
- معلمون بذكاء اصطناعي يكتشفون الارتباك
- وتيرة تكيفية بناءً على المشاركة
- حضور تدريس ثابت
الرعاية الصحية
- مقابلات تحديد البيانات للمريض
- رفاق فحص الصحة العقلية
- واجهات الطب عن بعد يسهل الوصول إليها
سوق الفيديو المحادثة في الوقت الفعلي مختلف بشكل أساسي عن سوق الفيديو مقطع الإنشاء. إنه أقل إبداعية لكن أكثر عملية من الناحية التجارية. الشركات التي تنفق حالياً على رخص Zoom وموظفي مراكز الاتصالات وإنتاج الفيديو لتمكين المبيعات هي الأهداف الأولى.
القيود التقنية التي يجب مراقبتها
Phoenix-4 لا يخلو من التقييدات. الإصدار الحالي يعمل حصرياً مع سيناريوهات ذات وجه واحد وموجهة للأمام. المحادثات متعددة الأشخاص والعرض بحجم كامل والخلفيات المعقدة غير مدعومة.
| القدرة | الحالة |
|---|---|
| عرض الوجه الواحد | مدعوم (1080p، 40fps) |
| التحكم في التعبير العاطفي | مدعوم (10+ حالات عاطفية) |
| توليف الصوت في الوقت الفعلي | مدعوم (ثنائي الاتجاه كامل) |
| مشاهد متعددة الأشخاص | غير مدعوم |
| عرض كامل الجسم | غير مدعوم |
| الخلفيات المعقدة | محدود (خلفيات ثابتة فقط) |
| النشر في وضع عدم الاتصال / الحافة | غير متاح (واجهة برمجة التطبيقات السحابية فقط) |
يعني الشرط المقتصر على السحابة أن زمن الكمون يعتمد على جودة الشبكة. يقول Tavus أقل من 600 ميلي ثانية من البداية للنهاية في الظروف المثالية، لكن الأداء الحقيقية ستختلف. بالنسبة للتطبيقات الحساسة للكمون مثل مكالمات العملاء المباشرة، سيكون نشر الحافة ضرورياً في النهاية.
الصورة الأكبر
وصل Phoenix-4 عند نقطة الانعطاف. مساحة فيديو الذكاء الاصطناعي المصنوعة مسبقاً مكتظة، مع عشرات النماذج المتنافسة على الدقة والمدة والأسلوب. لكن فيديو المحادثة في الوقت الفعلي فارغ تقريباً. تواجه Tavus منافسة مباشرة محدودة، مع أن معظم البدائل عبارة عن تراكبات بسيطة للشفاه بدلاً من أنظمة التصيير العاطفي الكاملة. السؤال هو ما إذا كانت بنية النموذج الثلاثية يمكن أن تتسع. تشغيل Raven-1 و Sparrow-1 و Phoenix-4 بو قت واحد يتطلب حساباً كبيراً. الآن، هذا الحساب يعيش في السحابة Tavus. الاقتراب من الحافة أو تحسينها لأجهزة المستهلك سيفتح سيناريوهات نشر جديدة تماماً. بالنسبة لصناعة فيديو الذكاء الاصطناعي الأوسع، يشير Phoenix-4 إلى أن الحدود التالية ليست مجرد مقاطع فيديو أفضل. إنها فيديو كواجهة في الوقت الفعلي، حيث الذكاء الاصطناعي لا ينشئ محتوى لك، بل يتواصل معك.
Phoenix-4 متاح من خلال Tavus API. يتطلب إنشاء التوائم الرقمية تحميل فيديو بطول دقيقتين. تفاصيل التسعير متاحة على بوابة المطور الخاصة بهم.

مهندس ذكاء اصطناعي من لوزان يجمع بين عمق البحث والابتكار العملي. يقسم وقته بين هياكل النماذج والقمم الجبلية.
View profile →مقالات ذات صلة
تابع الاستكشاف مع هذه المقالات ذات الصلة

فيديو الذكاء الاصطناعي يلتقي الألعاب: ماذا تعني إعلانات NVIDIA في GDC 2026 للمبدعين في الوقت الفعلي
أظهرت NVIDIA في GDC 2026 إنتاج فيديو AI بتقنية الذكاء الاصطناعي يعمل محلياً في الوقت الفعلي. إليك ما يعنيه ذلك لمطوري الألعاب والمبدعين والمستقبل من وسائط تفاعلية.

Helios: نموذج 14B يشغل فيديو ذكي في الوقت الفعلي على أجهزة المستهلك
يولد Helios من جامعة بكين وByteDance وCanva فيديوهات ذكية بطول دقيقة واحدة بسرعة 19.5 إطار في الثانية مع 6GB VRAM فقط، وهو مفتوح المصدر بالكامل.

فيديو الذكاء الاصطناعي للتعليم: كيف يستخدم المعلمون ومنشئو الدورات التدريبية الذكاء الاصطناعي في عام 2026
من تسجيلات المحاضرات إلى إنتاج الدورات التدريبية الكاملة، تعمل أدوات الفيديو بالذكاء الاصطناعي على تحويل طريقة إنشاء المحتوى التعليمي. إليك ما ينجح، وما لا ينجح، وإلى أين تتجه التكنولوجيا.