Meta Pixelتجاوز إلى المحتوى الرئيسي
AlexisAlexis· كتبه الذكاء الاصطناعي وراجعه إنسان
6 min read
1201 كلمات

Tavus Phoenix-4: ذكاء عاطفي في الوقت الفعلي يلتقي بفيديو الذكاء الاصطناعي

أطلقت Tavus للتو Phoenix-4، وهو نموذج قائم على الانتشار الغاوسي يعرض الوجوه البشرية في الوقت الفعلي بدقة 1080p و40fps مع التحكم العاطفي. إليك ما يعنيه ذلك لمستقبل فيديو الذكاء الاصطناعي.

Tavus Phoenix-4: ذكاء عاطفي في الوقت الفعلي يلتقي بفيديو الذكاء الاصطناعي

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟

انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai

كل نموذج فيديو ذكاء اصطناعي رئيسي في عام 2026 ركز على هدف واحد: إنتاج مقاطع مصنوعة مسبقاً بشكل أفضل. طرحت Tavus سؤالاً مختلفاً تماماً. ماذا لو حدث فيديو الذكاء الاصطناعي مباشرة، في الوقت الفعلي، وكان بإمكانه قراءة عواطفك أثناء القيام بذلك؟

من المقاطع إلى المحادثات

كانت مساحة فيديو الذكاء الاصطناعي محاصرة في سباق تسلح على الدقة والمدة والوضوح. دفعت Kling 3.0 معايير 4K الأصلية. أثارت Seedance 2.0 دعاوى قضائية من هوليوود. حصلت Sora 2 على صفقة مع Disney. كل هذا مثير للإعجاب، وكل ذلك يتبع نفس النموذج: اكتب موجهة، انتظر، احصل على فيديو.

يكسر Phoenix-4 هذا النمط. تم إطلاقه في 18 فبراير 2026، وهو أول نموذج مصمم لـ عرض الوجوه البشرية في الوقت الفعلي مع الذكاء العاطفي. بدلاً من إنتاج مقطع بطول 10 ثوان في 30 ثانية، فإنه يعرض وجهاً كاملاً بدقة 1080p بسرعة 40 إطاراً في الثانية مع زمن تأخير أقل من 600 ميلي ثانية.

هذا ليس محرك فيديو. هذا محرك حضور.

💡
Phoenix-4 لا ينافس Sora أو Veo أو Kling. إنه يحتل فئة مختلفة تماماً: فيديو محادثة في الوقت الفعلي، حيث يرد الذكاء الاصطناعي عليك أثناء حديثك.

العمارة: ثلاثة نماذج في التناغم

ما يجعل Phoenix-4 مثيراً للاهتمام من الناحية التقنية هو خط أنابيب مكون من ثلاثة مكونات، حيث يتعامل كل منها مع جانب متميز من التواصل البشري.

زمن الكمون من البداية للنهاية
40fps
معدل إطارات العرض
1080p
دقة الإخراج
2 min
وقت التدريب للتوائم الرقمية

Raven-1: الإدراك العاطفي

النموذج الأول في المكدس هو Raven-1، وهي وحدة إدراك تحلل تدفق الفيديو الخاص بك في الوقت الفعلي. تكتشف تعابير الوجه والنبرة الصوتية والإشارات المحادثة لبناء خريطة حالة عاطفية مستمرة. هذا ليس تحليل المشاعر البسيط. يتتبع Raven-1 الحركات الدقيقة، ومدة الفترات الزمنية، وإيقاع الكلام، واتجاه النظر. والمخرجات عبارة عن متجه عاطفي متعدد الأبعاد يتم تغذيته في خط أنابيب العرض.

Sparrow-1: توقيت المحادثة

المكون الثاني، Sparrow-1، يتعامل مع المشكلة الأكثر تقليلاً في الذكاء الاصطناعي المحادثة: معرفة متى تتحدث. تقاطع مساعدات الصوت الحالية بينك أو تنتظر وقتاً طويلاً. يستخدم Sparrow-1 بنية ثنائي الاتجاه كاملة تستمع وتتحدث بو قت واحد، مما يعكس كيفية تحدث البشر الفعليين. يتنبأ بإشارات التناوب، ويدير الإشارات الخلفية (الإيماءة بالرأس، "أممم" ما يعادل)، ويضبط توقيت الاستجابة بناءً على الحالة العاطفية من Raven-1. إذا توقفت لأنك تفكر، فإنه ينتظر. إذا توقفت لأنك مرتبك، فإنه يوضح.

Phoenix-4: عرض الانتشار الغاوسي

نموذج العرض نفسه يستخدم نهج هجين من الانتشار الغاوسي. نماذج الانتشار التقليدية بطيئة جداً للاستخدام في الوقت الفعلي. الطرق الغاوسية النقية تفتقر إلى جودة التفصيل من الانتشار. يجمع Phoenix-4 بين كليهما: يستخدم Gaussian splatting للهندسة الأساسية والتتبع في الوقت الفعلي، ثم يطبق تحسين الانتشار بطريقة موجهة على المناطق الحرجة للتعبير (العيون والفم والحاجب).

💡
الرؤية الأساسية هي الانتشار الانتقائي. بدلاً من تشغيل تمرير انتشار كامل على كل إطار، يطبق Phoenix-4 فقط حيث يطلب التعبير العاطفي تفصيلاً دقيقاً. هذا يحافظ على زمن الكمون أقل من 600 ميلي ثانية مع الحفاظ على جودة البصرية.

واجهة برمجة التطبيقات للتحكم العاطفي

بالنسبة للمطورين، أكثر الميزات عملية هي واجهة برمجة التطبيقات للتحكم العاطفي. بدلاً من ترك الذكاء الاصطناعي يقرر كيفية التعبير عن المشاعر، يمكنك تحديد العواطف المستهدفة برمجياً.

{
  "emotion": "empathetic_concern",
  "intensity": 0.7,
  "transition_speed": "gradual",
  "micro_expressions": true
}

تدعم واجهة برمجة التطبيقات أكثر من عشر حالات عاطفية، بما في ذلك الفرح والحزن والغضب والمفاجأة والخوف والإثارة والفضول والرضا، مع عناصر التحكم في الشدة والمزج. يمكن لمساعد دعم العملاء أن يتحول من ودود إلى متعاطف عند اكتشاف الإحباط في صوت المتصل. هذا هو المكان الذي يتم فيه سداد خط الأنابيب ثلاثي النموذج. يكتشف Raven-1 الحالة العاطفية للمستخدم، وتحدد قواعد المطور الحالة العاطفية المناسبة للرد، و Phoenix-4 يعرضها في الوقت الفعلي.

التوائم الرقمية في دقيقتين

أحد أكثر الادعاءات التي تلفت الانتباه: يمكن لـ Phoenix-4 إنشاء توأم رقمي مخصص من فيديو بطول دقيقتين فقط. قم بتحميل فيديو قصير لنفسك وأنت تتحدث، والنظام يستخرج هندسة الوجه وتنوع التعبير وخصائص الصوت الكافية لإنشاء صورة رمزية في الوقت الفعلي.

إنشاء الصورة الرمزية التقليدية
ساعات من المسح ثلاثي الأبعاد وربط FACS والتخطيط اليدوي للتعبيرات وجلسات تسجيل الصوت
نهج Phoenix-4
تحميل فيديو بطول دقيقتين والاستخراج التلقائي للهندسة والتعبيرات والصوت للعرض في الوقت الفعلي

الجودة ليست على مستوى VFX الفيلم حتى الآن. في العروض التوضيحية، تظهر التوائم الرقمية عيوباً عرضية حول حركات الرأس السريعة والانتقالات الإضاءة المعقدة. لكن لمكالمات الفيديو ودعم العملاء والعروض التقديمية للمبيعات، الدقة أكثر من كافية.

لماذا هذا مهم لفيديو الذكاء الاصطناعي

يمثل Phoenix-4 توسع الفئة لفيديو الذكاء الاصطناعي. حتى الآن، كل نموذج رئيسي ركز على إنشاء المحتوى: إنتاج مقاطع وإعلانات وأفلام قصيرة ومنشورات وسائط اجتماعية. يركز Phoenix-4 على التواصل، السوق الأكبر بكثير لتفاعل الفيديو المباشر. ضع في الاعتبار حالات الاستخدام:

دعم العملاء

  • وكلاء دعم قائمون على الفيديو 24/7
  • يستجيبون عاطفياً وليس آلياً
  • يتسع بدون توظيف

المبيعات

  • عروض فيديو مخصصة
  • ممثلو الصورة الرمزية متعددة اللغات
  • متاح دائماً وعلى العلامة التجارية دائماً

التعليم

  • معلمون بذكاء اصطناعي يكتشفون الارتباك
  • وتيرة تكيفية بناءً على المشاركة
  • حضور تدريس ثابت

الرعاية الصحية

  • مقابلات تحديد البيانات للمريض
  • رفاق فحص الصحة العقلية
  • واجهات الطب عن بعد يسهل الوصول إليها

سوق الفيديو المحادثة في الوقت الفعلي مختلف بشكل أساسي عن سوق الفيديو مقطع الإنشاء. إنه أقل إبداعية لكن أكثر عملية من الناحية التجارية. الشركات التي تنفق حالياً على رخص Zoom وموظفي مراكز الاتصالات وإنتاج الفيديو لتمكين المبيعات هي الأهداف الأولى.

القيود التقنية التي يجب مراقبتها

Phoenix-4 لا يخلو من التقييدات. الإصدار الحالي يعمل حصرياً مع سيناريوهات ذات وجه واحد وموجهة للأمام. المحادثات متعددة الأشخاص والعرض بحجم كامل والخلفيات المعقدة غير مدعومة.

القدرةالحالة
عرض الوجه الواحدمدعوم (1080p، 40fps)
التحكم في التعبير العاطفيمدعوم (10+ حالات عاطفية)
توليف الصوت في الوقت الفعليمدعوم (ثنائي الاتجاه كامل)
مشاهد متعددة الأشخاصغير مدعوم
عرض كامل الجسمغير مدعوم
الخلفيات المعقدةمحدود (خلفيات ثابتة فقط)
النشر في وضع عدم الاتصال / الحافةغير متاح (واجهة برمجة التطبيقات السحابية فقط)

يعني الشرط المقتصر على السحابة أن زمن الكمون يعتمد على جودة الشبكة. يقول Tavus أقل من 600 ميلي ثانية من البداية للنهاية في الظروف المثالية، لكن الأداء الحقيقية ستختلف. بالنسبة للتطبيقات الحساسة للكمون مثل مكالمات العملاء المباشرة، سيكون نشر الحافة ضرورياً في النهاية.

الصورة الأكبر

وصل Phoenix-4 عند نقطة الانعطاف. مساحة فيديو الذكاء الاصطناعي المصنوعة مسبقاً مكتظة، مع عشرات النماذج المتنافسة على الدقة والمدة والأسلوب. لكن فيديو المحادثة في الوقت الفعلي فارغ تقريباً. تواجه Tavus منافسة مباشرة محدودة، مع أن معظم البدائل عبارة عن تراكبات بسيطة للشفاه بدلاً من أنظمة التصيير العاطفي الكاملة. السؤال هو ما إذا كانت بنية النموذج الثلاثية يمكن أن تتسع. تشغيل Raven-1 و Sparrow-1 و Phoenix-4 بو قت واحد يتطلب حساباً كبيراً. الآن، هذا الحساب يعيش في السحابة Tavus. الاقتراب من الحافة أو تحسينها لأجهزة المستهلك سيفتح سيناريوهات نشر جديدة تماماً. بالنسبة لصناعة فيديو الذكاء الاصطناعي الأوسع، يشير Phoenix-4 إلى أن الحدود التالية ليست مجرد مقاطع فيديو أفضل. إنها فيديو كواجهة في الوقت الفعلي، حيث الذكاء الاصطناعي لا ينشئ محتوى لك، بل يتواصل معك.

💡
لمزيد من المعلومات حول كيفية تطور نماذج فيديو الذكاء الاصطناعي بنيتها المعمارية، انظر تفصيلنا حول محولات الانتشار والتحول نحو نماذج العالم.

Phoenix-4 متاح من خلال Tavus API. يتطلب إنشاء التوائم الرقمية تحميل فيديو بطول دقيقتين. تفاصيل التسعير متاحة على بوابة المطور الخاصة بهم.

Alexis
AlexisAI EngineerAI Author

مهندس ذكاء اصطناعي من لوزان يجمع بين عمق البحث والابتكار العملي. يقسم وقته بين هياكل النماذج والقمم الجبلية.

View profile →

أعجبك ما قرأت؟

حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق.

مقالات ذات صلة

تابع الاستكشاف مع هذه المقالات ذات الصلة

هل استمتعت بهذا المقال؟

اكتشف المزيد من الأفكار وابقَ على اطلاع بأحدث محتوياتنا.