Meta Pixelتجاوز إلى المحتوى الرئيسي
DamienDamien· كتبه الذكاء الاصطناعي وراجعه إنسان
6 min read
1022 كلمات

Alibaba HappyHorse-1.0: النموذج الغامض الذي تصدر كل لوائح ترتيب فيديو الذكاء الاصطناعي

ظهر نموذج باسم HappyHorse-1.0 على Artificial Analysis من دون إسناد، وصعد إلى المركز #1 في كل من تحويل النص إلى فيديو وتحويل الصورة إلى فيديو، ثم اتضح أنه تابع لـ Alibaba. إليكم ما نعرفه عن البنية والفريق وما يعنيه ذلك لسوق فيديو الذكاء الاصطناعي.

Alibaba HappyHorse-1.0: النموذج الغامض الذي تصدر كل لوائح ترتيب فيديو الذكاء الاصطناعي

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟

انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai

في 7 أبريل 2026، ظهر على Artificial Analysis Video Arena نموذج لم يسمع به أحد. وخلال ثلاثة أيام، احتل المركز #1 في كل من توليد الفيديو من النص وتوليد الفيديو من الصورة. من دون علامة تجارية أو بيان صحفي أو اسم شركة مرتبط به. ثم أكدت Alibaba أنه نموذجها. هذه قصة HappyHorse-1.0، الحصان الأسود الذي أعاد ترتيب تصنيفات فيديو الذكاء الاصطناعي.

الكشف

تدير Artificial Analysis ساحة فيديو يرسل فيها المستخدمون مطالبة، ثم ينشئ نموذجان مجهولان مخرجات، ويختار المستخدمون ما يفضلونه. وتغذي الأصوات نظام تصنيف Elo، وهو النظام الرياضي نفسه المستخدم في تصنيفات الشطرنج. لا تستطيع النماذج التلاعب بالنظام لأن المقيمين لا يعرفون أبدا أي نموذج أنتج أي مخرج.

دخل HappyHorse-1.0 هذه الساحة في 7 أبريل بملف شخصي فارغ. لا شعار ولا إسناد لشركة. وبحلول 10 أبريل، احتل المركز الأول في فئتين من فئات الترتيب الأربع، وأكدت Alibaba ملكيتها عبر حساب X أُنشئ حديثا وبيان لـ CNBC.

💡
ارتفعت أسهم Alibaba المدرجة في هونغ كونغ بنسبة 2.12% يوم الإعلان، وكانت قد صعدت بالفعل 6.75% في وقت سابق من الأسبوع مع تصاعد التكهنات حول النموذج الغامض.

الأرقام

تروي درجات Elo الخاصة بـ HappyHorse القصة بوضوح:

1333
Elo لتحويل النص إلى فيديو (من دون صوت)
1392
Elo لتحويل الصورة إلى فيديو (من دون صوت)
1205
Elo لتحويل النص إلى فيديو (مع صوت)

للسياق، كان المتصدر السابق #1 في تحويل النص إلى فيديو هو Seedance 2.0 التابع لـ ByteDance بدرجة Elo 1273. تفوق HappyHorse عليه بـ 60 نقطة، وهي فجوة تتطلب عادة أشهرا لإغلاقها. وفي تحويل الصورة إلى فيديو، سجل HappyHorse 1392 مقابل 1355 لـ Seedance 2.0.

تروي الفئات التي تشمل الصوت قصة مختلفة. يحتل HappyHorse المركز #2 خلف Seedance 2.0 (Elo 1219 مقابل 1205)، ما يشير إلى أن مسار الصوت لا يزال يحتاج إلى تحسين مقارنة بجودة الفيديو.

الفئةHappyHorseالمتصدر السابق #1الفجوة
تحويل النص إلى فيديو (صامت)13331273 (Seedance 2.0)+60
تحويل الصورة إلى فيديو (صامت)13921355 (Seedance 2.0)+37
تحويل النص إلى فيديو (صوت)12051219 (Seedance 2.0)-14

البنية: Transformer واحد، كل شيء دفعة واحدة

تربط معظم أنظمة فيديو الذكاء الاصطناعي مكونات منفصلة: مرمزا للنص، ومولد فيديو، ونموذجا صوتيا يضاف لاحقا. يتبع HappyHorse نهجا مختلفا.

يستخدم النموذج Transformer ذاتي الانتباه أحادي المسار من 40 طبقة من دون وحدات Cross-Attention. تتدفق رموز النص والفيديو والصوت جميعها عبر حزمة Transformer نفسها في الوقت نفسه. يلغي هذا التصميم الموحد المعلمات الزائدة ويقلل تعقيد الاستدلال.

بنية موحدة
تتم معالجة النص والفيديو والصوت في تمرير واحد. لا يوجد مسار صوتي منفصل. أجزاء متحركة أقل وزمن استجابة أدنى.
الصوت لا يزال متأخرا
رغم التصميم الموحد، تحتل جودة الصوت المركز #2 خلف مسار الصوت المتخصص في Seedance 2.0.

مسار الاستدلال مبسط بشكل غير معتاد: 8 خطوات إزالة ضوضاء فقط من دون Classifier-Free Guidance (CFG). للمقارنة، تستخدم كثير من النماذج المنافسة 25-50 خطوة مع تفعيل CFG. يشير ذلك إلى تقطير مكثف أثناء التدريب، مع مقايضة السعة الخام بالسرعة.

الفريق الذي يقف وراءه

يأتي HappyHorse من Future Life Lab ضمن Taotian Group التابعة لـ Alibaba، وهي ذراع التجارة الإلكترونية. يقوده Zhang Di، نائب الرئيس السابق في Kuaishou والقائد التقني لـ Kling AI.

هذه التفاصيل مهمة. بنى Zhang Di الثقافة الهندسية وراء Kling، أحد أقوى نماذج فيديو الذكاء الاصطناعي لعام 2025. وهو يعرف تحديات البنية التحتية ومسارات التدريب وفجوات التقييم. ونقل تلك الخبرة إلى موارد Alibaba الحاسوبية يختلف عن إدارة شركة ناشئة مستقلة.

💡
يدعم HappyHorse مزامنة الشفاه أصلا بست لغات: الصينية والإنجليزية واليابانية والكورية والألمانية والفرنسية. تشير هذه القدرة متعددة اللغات إلى نموذج دُرب على بيانات متنوعة ومنتقاة بعناية.

لماذا يهم هذا السوق

يتسم سوق فيديو الذكاء الاصطناعي في أبريل 2026 بتقلب غير معتاد:

March 2026

الإعلان عن إيقاف Sora

أكدت OpenAI أن Sora ستتوقف في 26 أبريل. فقد أثبتت تكاليف الحوسبة والضغط التنافسي أنهما غير مستدامين.

February 2026

إيقاف Seedance 2.0 مؤقتا

أُجبرت ByteDance على وقف الإطلاق بعد نزاعات حقوق النشر مع استوديوهات Hollywood.

April 7, 2026

ظهور HappyHorse

دخل نموذج مجهول إلى Artificial Analysis Video Arena.

April 10, 2026

Alibaba تؤكد الملكية

قفز السهم بعد الكشف عن الهوية.

مع تراجع Sora ومواجهة Seedance لمشكلات قانونية، يصل HappyHorse في لحظة يبحث فيها السوق عن متصدر جديد. لا يزال Runway Gen-4.5 قويا في مسارات عمل الإنتاج، ويهيمن Google Veo 3.1 على مجال التكامل المؤسسي. لكن من حيث جودة التوليد الخام المقاسة بالتفضيل البشري الأعمى، يتصدر HappyHorse الآن.

المصدر المفتوح: قريبا (ربما)

يعرض مستودع GitHub ومركز نماذج Hugging Face كلاهما عبارة "قريبا" حتى 11 أبريل. وعد الفريق بإصدار أوزان كاملة مفتوحة المصدر تضم 15 مليار معلمة بترخيص تجاري. إذا حدث ذلك، فسيصبح HappyHorse أكبر نموذج فيديو مفتوح المصدر متاحا، وأكبر بكثير من 2B معلمة لـ LTX-Video.

لكن "قريبا" لا تعني "تم الإصدار". إلى أن تصبح الأوزان قابلة للتنزيل والتحقق المستقل، تظل نتائج معيار الأداء مصحوبة بعلامة استفهام. تعلم مجتمع فيديو الذكاء الاصطناعي انتظار النتائج القابلة لإعادة الإنتاج قبل إعلان الفائزين.

ما الذي يجب مراقبته

ستحدد ثلاثة أمور ما إذا كان HappyHorse سيحافظ على تقدمه:

  • إصدار الأوزان مفتوحة المصدر وإعادة إنتاج نتائج معيار الأداء بشكل مستقل
  • تحسينات جودة الصوت لمضاهاة Seedance 2.0 أو التفوق عليه في الفئات التي تشمل الصوت
  • إتاحة API والأسعار، لأن الهيمنة على معيار الأداء لا تعني شيئا إذا لم يتمكن المبدعون من الوصول إلى النموذج

يتحرك مجال توليد فيديو الذكاء الاصطناعي بسرعة. في يناير، بدا Runway Gen-4.5 عصيا على المنافسة. وفي فبراير، انتزع Seedance 2.0 التاج. والآن يحتفظ HappyHorse به. السؤال ليس ما إذا كان شيء ما سيتفوق عليه في النهاية، بل متى ومن أين.

بالنسبة للمبدعين والمطورين الذين يبنون مسارات فيديو اليوم، فالخلاصة عملية: لا يبقى أي نموذج في القمة طويلا. أفضل استراتيجية هي بناء مسارات عمل تستطيع تبديل النماذج مع تغير لوحة المتصدرين، بدلا من الرهان بكل شيء على اسم واحد.

💡
أصدرت Alibaba أيضا مؤخرا Wan 2.7 مع Thinking Mode، وهو نموذج منفصل من قسم Tongyi Lab لديها. يشير نموذجا فيديو رئيسيان من فريقين مختلفين في Alibaba خلال الأسبوع نفسه إلى دفع على مستوى الشركة نحو فيديو الذكاء الاصطناعي.

المصادر

Damien
DamienAI DeveloperAI Author

مطوّر ذكاء اصطناعي من ليون يحب تحويل مفاهيم ML المعقدة إلى وصفات بسيطة. وعندما لا يصحح أخطاء النماذج، ستجده يركب الدراجة عبر وادي الرون.

View profile →

أعجبك ما قرأت؟

حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق.

مقالات ذات صلة

تابع الاستكشاف مع هذه المقالات ذات الصلة

هل استمتعت بهذا المقال؟

اكتشف المزيد من الأفكار وابقَ على اطلاع بأحدث محتوياتنا.