Meta Pixelاصل مواد پر جائیں
DamienDamien· AI مصنف، انسانی جائزے کے ساتھ
7 min read
1337 الفاظ

Alibaba HappyHorse-1.0: وہ پراسرار ماڈل جو ہر AI ویڈیو لیڈر بورڈ میں سرفہرست رہا

HappyHorse-1.0 نامی ایک ماڈل Artificial Analysis پر بغیر نسبت کے ظاہر ہوا، ٹیکسٹ ٹو ویڈیو اور امیج ٹو ویڈیو دونوں میں #1 تک پہنچا، پھر معلوم ہوا کہ یہ Alibaba کا ہے۔ یہاں وہ سب کچھ ہے جو ہم آرکیٹیکچر، ٹیم، اور AI ویڈیو مارکیٹ کے لیے اس کے معنی کے بارے میں جانتے ہیں۔

Alibaba HappyHorse-1.0: وہ پراسرار ماڈل جو ہر AI ویڈیو لیڈر بورڈ میں سرفہرست رہا

اپنی AI ویڈیوز بنانے کے لیے تیار ہیں؟

Bonega.ai استعمال کرنے والے ہزاروں تخلیق کاروں میں شامل ہوں

7 اپریل 2026 کو، ایک ایسا ماڈل جس کا کسی نے نام نہیں سنا تھا، Artificial Analysis Video Arena میں ظاہر ہوا۔ تین دن کے اندر اس نے ٹیکسٹ ٹو ویڈیو اور امیج ٹو ویڈیو جنریشن، دونوں میں #1 مقام حاصل کر لیا۔ نہ برانڈنگ، نہ پریس ریلیز، نہ کسی کمپنی کا نام۔ پھر Alibaba نے تصدیق کی کہ یہ ان کا ہے۔ یہ HappyHorse-1.0 کی کہانی ہے، اس ڈارک ہارس کی جس نے ابھی AI ویڈیو رینکنگز کو بدل دیا ہے۔

انکشاف

Artificial Analysis ایک Video Arena چلاتا ہے جہاں صارفین ایک پرامپٹ جمع کراتے ہیں، دو گمنام ماڈلز آؤٹ پٹس تیار کرتے ہیں، اور صارفین اپنی پسند کا آؤٹ پٹ منتخب کرتے ہیں۔ ووٹس Elo ریٹنگ سسٹم میں شامل ہوتے ہیں (وہی ریاضی جو شطرنج کی رینکنگز میں استعمال ہوتی ہے)۔ ماڈلز اس سسٹم کو گیم نہیں کر سکتے کیونکہ جانچنے والوں کو کبھی معلوم نہیں ہوتا کہ کون سے ماڈل نے کون سا آؤٹ پٹ تیار کیا۔

HappyHorse-1.0 نے 7 اپریل کو ایک خالی پروفائل کے تحت اس میدان میں قدم رکھا۔ نہ لوگو، نہ کمپنی کی نسبت۔ 10 اپریل تک اس نے چار میں سے دو رینکنگ زمروں میں سرفہرست مقام حاصل کر لیا، اور Alibaba نے ایک نئے بنائے گئے X اکاؤنٹ اور CNBC کو دیے گئے بیان کے ذریعے ملکیت کی تصدیق کی۔

💡
اعلان کے دن Alibaba کے ہانگ کانگ میں درج شیئرز 2.12% بڑھے، اور اس سے پہلے ہفتے کے دوران، جب پراسرار ماڈل کے بارے میں قیاس آرائیاں بڑھ رہی تھیں، وہ پہلے ہی 6.75% چڑھ چکے تھے۔

اعداد و شمار

HappyHorse کے Elo اسکورز کہانی کو واضح طور پر بیان کرتے ہیں:

1333
T2V Elo (آڈیو کے بغیر)
1392
I2V Elo (آڈیو کے بغیر)
1205
T2V Elo (آڈیو کے ساتھ)

سیاق کے لیے، ٹیکسٹ ٹو ویڈیو میں پچھلا #1 ByteDance کا Seedance 2.0 تھا، جس کا Elo 1273 تھا۔ HappyHorse نے اسے 60 پوائنٹس سے شکست دی، ایک ایسا فرق جسے ختم ہونے میں عموماً مہینوں لگتے ہیں۔ امیج ٹو ویڈیو میں، HappyHorse نے Seedance 2.0 کے 1355 کے مقابلے میں 1392 اسکور کیا۔

آڈیو شامل زمروں میں کہانی مختلف ہے۔ HappyHorse، Seedance 2.0 کے بعد #2 پر ہے (Elo 1219 بمقابلہ 1205)، جو ظاہر کرتا ہے کہ ویڈیو کوالٹی کے مقابلے میں آڈیو پائپ لائن کو ابھی کام درکار ہے۔

زمرہHappyHorseپچھلا #1فرق
ٹیکسٹ ٹو ویڈیو (خاموش)13331273 (Seedance 2.0)+60
امیج ٹو ویڈیو (خاموش)13921355 (Seedance 2.0)+37
ٹیکسٹ ٹو ویڈیو (آڈیو)12051219 (Seedance 2.0)-14

آرکیٹیکچر: ایک Transformer، سب کچھ ایک ساتھ

زیادہ تر AI ویڈیو سسٹمز الگ الگ اجزا کو جوڑتے ہیں: ایک ٹیکسٹ اینکوڈر، ایک ویڈیو جنریٹر، اور بعد میں شامل کیا گیا ایک آڈیو ماڈل۔ HappyHorse ایک مختلف طریقہ اختیار کرتا ہے۔

یہ ماڈل 40-layer single-stream Self-Attention Transformer استعمال کرتا ہے، جس میں کوئی Cross-Attention ماڈیولز نہیں ہیں۔ ٹیکسٹ، ویڈیو، اور آڈیو ٹوکنز بیک وقت ایک ہی transformer stack سے گزرتے ہیں۔ یہ متحدہ ڈیزائن اضافی پیرامیٹرز ختم کرتا ہے اور inference کی پیچیدگی کم کرتا ہے۔

متحدہ آرکیٹیکچر
ٹیکسٹ، ویڈیو، اور آڈیو ایک ہی پاس میں پراسیس ہوتے ہیں۔ کوئی الگ آڈیو پائپ لائن نہیں۔ کم متحرک اجزا، کم latency۔
آڈیو اب بھی پیچھے ہے
متحدہ ڈیزائن کے باوجود، آڈیو کوالٹی Seedance 2.0 کی خصوصی آڈیو پائپ لائن کے پیچھے #2 پر ہے۔

inference پائپ لائن غیر معمولی طور پر ہلکی ہے: صرف 8 denoising steps، اور کوئی Classifier-Free Guidance (CFG) نہیں۔ موازنے کے لیے، بہت سے مسابقتی ماڈلز CFG فعال رکھتے ہوئے 25-50 steps استعمال کرتے ہیں۔ یہ تربیت کے دوران aggressive distillation کی نشاندہی کرتا ہے، جس میں رفتار کے لیے خام صلاحیت کا تبادلہ کیا گیا ہے۔

اس کے پیچھے کی ٹیم

HappyHorse، Alibaba کے Taotian Group (ای کامرس بازو) کے تحت Future Life Lab سے آتا ہے۔ اس کے سربراہ Zhang Di ہیں، جو Kuaishou کے سابق VP اور Kling AI کے تکنیکی سربراہ تھے۔

یہ تفصیل اہم ہے۔ Zhang Di نے Kling کے پیچھے انجینئرنگ کلچر بنایا، جو 2025 کے مضبوط ترین AI ویڈیو ماڈلز میں سے ایک تھا۔ وہ انفراسٹرکچر کے چیلنجز، تربیتی پائپ لائنز، اور جانچ کے خلا کو جانتے ہیں۔ اس تجربے کو Alibaba کے کمپیوٹ وسائل کے ساتھ لانا، ایک آزاد startup چلانے سے بالکل مختلف مساوات ہے۔

💡
HappyHorse چھ زبانوں میں مقامی طور پر lip sync سپورٹ کرتا ہے: چینی، انگریزی، جاپانی، کوریائی، جرمن، اور فرانسیسی۔ یہ کثیر لسانی صلاحیت متنوع اور احتیاط سے منتخب کردہ ڈیٹا پر تربیت یافتہ ماڈل کی طرف اشارہ کرتی ہے۔

مارکیٹ کے لیے یہ کیوں اہم ہے

اپریل 2026 میں AI ویڈیو مارکیٹ غیر معمولی طور پر غیر مستحکم ہے:

مارچ 2026

Sora بند کرنے کا اعلان

OpenAI نے تصدیق کی کہ Sora کو بند کر دیا جائے گا 26 اپریل کو۔ کمپیوٹ کی لاگتیں اور مسابقتی دباؤ ناقابلِ برداشت ثابت ہوئے۔

فروری 2026

Seedance 2.0 روک دیا گیا

ByteDance کو Hollywood studios کے ساتھ copyright تنازعات کے بعد rollout روکنے پر مجبور ہونا پڑا۔

7 اپریل 2026

HappyHorse ظاہر ہوا

گمنام ماڈل Artificial Analysis Video Arena میں داخل ہوتا ہے۔

10 اپریل 2026

Alibaba نے ملکیت کی تصدیق کی

شناخت ظاہر ہونے پر اسٹاک بڑھ گیا۔

Sora کے ختم ہونے اور Seedance کو قانونی مسائل کا سامنا ہونے کے ساتھ، HappyHorse ایسے وقت میں آتا ہے جب مارکیٹ ایک نئے front-runner کی تلاش میں ہے۔ Runway Gen-4.5 اب بھی پروڈکشن ورک فلوز میں مضبوط ہے، اور Google Veo 3.1 انٹرپرائز انٹیگریشن کی جگہ پر حاوی ہے۔ مگر blind human preference سے ناپی گئی خالص جنریشن کوالٹی کے لیے، HappyHorse اب سرفہرست ہے۔

اوپن سورس: جلد آ رہا ہے (شاید)

11 اپریل تک GitHub repository اور Hugging Face model hub دونوں پر "Coming Soon" دکھایا گیا ہے۔ ٹیم نے کمرشل لائسنس کے ساتھ مکمل 15-billion parameter weights اوپن سورس جاری کرنے کا وعدہ کیا ہے۔ اگر ایسا ہوتا ہے تو HappyHorse دستیاب سب سے بڑا اوپن سورس ویڈیو ماڈل ہو گا، اور LTX-Video's کے 2B parameters سے نمایاں طور پر بڑا ہو گا۔

لیکن "coming soon" کا مطلب "released" نہیں ہے۔ جب تک weights ڈاؤن لوڈ کے لیے دستیاب اور آزادانہ طور پر تصدیق شدہ نہ ہوں، بینچ مارک نتائج کے ساتھ ایک ستارہ لگا رہے گا۔ AI ویڈیو کمیونٹی نے فاتحین کا اعلان کرنے سے پہلے قابل تکرار نتائج کا انتظار کرنا سیکھ لیا ہے۔

کیا دیکھنا ہے

تین چیزیں طے کریں گی کہ آیا HappyHorse اپنی برتری برقرار رکھتا ہے:

  • اوپن سورس weights کا اجرا اور بینچ مارک نتائج کی آزادانہ reproduction
  • آڈیو شامل زمروں میں Seedance 2.0 کی برابری یا اسے پیچھے چھوڑنے کے لیے آڈیو کوالٹی میں بہتری
  • API کی دستیابی اور قیمتوں کا تعین، کیونکہ اگر creators ماڈل تک رسائی حاصل نہ کر سکیں تو بینچ مارک میں برتری بے معنی ہے

AI ویڈیو جنریشن کی دنیا تیزی سے بدلتی ہے۔ جنوری میں، Runway Gen-4.5 ناقابلِ شکست لگتا تھا۔ فروری میں، Seedance 2.0 نے تاج لے لیا۔ اب HappyHorse کے پاس ہے۔ سوال یہ نہیں کہ آخرکار کوئی چیز اسے شکست دے گی یا نہیں، بلکہ کب اور کہاں سے۔

آج ویڈیو پائپ لائنز بنانے والے creators اور developers کے لیے نتیجہ عملی ہے: کوئی ایک ماڈل زیادہ دیر تک سرفہرست نہیں رہتا۔ بہترین حکمت عملی یہ ہے کہ ایسے ورک فلوز بنائے جائیں جو لیڈر بورڈ بدلنے کے ساتھ ماڈلز تبدیل کر سکیں، بجائے اس کے کہ سب کچھ ایک نام پر لگا دیا جائے۔

💡
Alibaba نے حال ہی میں Wan 2.7 with Thinking Mode بھی جاری کیا ہے، جو ان کے Tongyi Lab division کا ایک الگ ماڈل ہے۔ ایک ہی ہفتے میں مختلف Alibaba ٹیموں کے دو بڑے ویڈیو ماڈلز، AI ویڈیو میں کمپنی بھر کی پیش قدمی کی نشاندہی کرتے ہیں۔

ذرائع

Damien
DamienAI DeveloperAI Author

Lyon سے تعلق رکھنے والا AI ڈویلپر، جو پیچیدہ ML تصورات کو آسان طریقوں میں بدلنا پسند کرتا ہے۔ جب ماڈلز کی ڈیبگنگ نہیں کر رہا ہوتا، تو آپ اسے Rhône وادی میں سائیکل چلاتے پائیں گے۔

View profile →

جو پڑھا، پسند آیا؟

اپنے خیالات کو منٹوں میں لامحدود دورانیے کی AI ویڈیوز میں بدلیں۔

متعلقہ مضامین

ان متعلقہ پوسٹس کے ساتھ مزید دریافت کریں

کیا آپ کو یہ مضمون پسند آیا؟

مزید بصیرتیں دریافت کریں اور ہمارے تازہ ترین مواد سے باخبر رہیں۔