Meta Pixelमुख्य सामग्री पर जाएं
DamienDamien· AI लेखक, मानव द्वारा समीक्षा की गई
7 min read
1245 शब्द

Alibaba HappyHorse-1.0: वह रहस्यमय मॉडल जिसने हर AI वीडियो लीडरबोर्ड में शीर्ष स्थान हासिल किया

HappyHorse-1.0 नाम का एक मॉडल बिना किसी पहचान के Artificial Analysis पर दिखाई दिया, टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो दोनों में #1 तक पहुंचा, फिर पता चला कि यह Alibaba का है। यहां हम इसकी आर्किटेक्चर, टीम और AI वीडियो बाजार के लिए इसके मायने के बारे में जानते हैं।

Alibaba HappyHorse-1.0: वह रहस्यमय मॉडल जिसने हर AI वीडियो लीडरबोर्ड में शीर्ष स्थान हासिल किया

अपने AI वीडियो बनाने के लिए तैयार हैं?

Bonega.ai का उपयोग करने वाले हजारों क्रिएटर्स से जुड़ें

7 अप्रैल, 2026 को, एक ऐसा मॉडल जिसके बारे में किसी ने नहीं सुना था, Artificial Analysis Video Arena में दिखाई दिया। तीन दिनों के भीतर उसने टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो जनरेशन, दोनों में #1 स्थान हासिल कर लिया। कोई ब्रांडिंग नहीं, कोई प्रेस रिलीज नहीं, कोई कंपनी नाम नहीं। फिर Alibaba ने पुष्टि की कि यह उनका है। यह HappyHorse-1.0 की कहानी है, वह अप्रत्याशित दावेदार जिसने अभी AI वीडियो रैंकिंग को बदल दिया है।

खुलासा

Artificial Analysis एक Video Arena चलाता है, जहां उपयोगकर्ता एक प्रॉम्प्ट देते हैं, दो गुमनाम मॉडल आउटपुट जनरेट करते हैं, और उपयोगकर्ता अपनी पसंद का आउटपुट चुनते हैं। वोट Elo रेटिंग सिस्टम में शामिल होते हैं, यही गणित शतरंज रैंकिंग में भी इस्तेमाल होता है। मॉडल सिस्टम के साथ चालाकी नहीं कर सकते, क्योंकि मूल्यांकनकर्ताओं को कभी पता नहीं होता कि कौन-से मॉडल ने कौन-सा आउटपुट बनाया।

HappyHorse-1.0 ने 7 अप्रैल को एक खाली प्रोफाइल के साथ इस एरीना में प्रवेश किया। कोई लोगो नहीं, कोई कंपनी पहचान नहीं। 10 अप्रैल तक यह चार रैंकिंग श्रेणियों में से दो में शीर्ष स्थान पर था, और Alibaba ने नए बनाए गए X अकाउंट तथा CNBC को दिए गए एक बयान के जरिए स्वामित्व की पुष्टि की।

💡
घोषणा के दिन Alibaba के Hong Kong-listed शेयर 2.12% बढ़े, और रहस्यमय मॉडल को लेकर अटकलें बढ़ने के दौरान वे सप्ताह की शुरुआत में ही 6.75% चढ़ चुके थे।

आंकड़े

HappyHorse के Elo स्कोर कहानी को स्पष्ट रूप से बताते हैं:

1333
T2V Elo (ऑडियो के बिना)
1392
I2V Elo (ऑडियो के बिना)
1205
T2V Elo (ऑडियो के साथ)

संदर्भ के लिए, टेक्स्ट-टू-वीडियो में पिछला #1 ByteDance का Seedance 2.0 था, जिसका Elo 1273 था। HappyHorse ने इसे 60 अंकों से पीछे छोड़ा, ऐसा अंतर जिसे भरने में आमतौर पर महीनों लगते हैं। इमेज-टू-वीडियो में HappyHorse ने 1392 स्कोर किया, जबकि Seedance 2.0 का स्कोर 1355 था।

ऑडियो-समावेशी श्रेणियां एक अलग कहानी बताती हैं। HappyHorse, Seedance 2.0 के पीछे #2 पर है (Elo 1219 बनाम 1205), जो संकेत देता है कि वीडियो गुणवत्ता की तुलना में ऑडियो पाइपलाइन को अभी काम की जरूरत है।

श्रेणीHappyHorseपिछला #1अंतर
टेक्स्ट-टू-वीडियो (मूक)13331273 (Seedance 2.0)+60
इमेज-टू-वीडियो (मूक)13921355 (Seedance 2.0)+37
टेक्स्ट-टू-वीडियो (ऑडियो)12051219 (Seedance 2.0)-14

आर्किटेक्चर: एक Transformer, सब कुछ एक साथ

अधिकांश AI वीडियो सिस्टम अलग-अलग घटकों को जोड़ते हैं: एक टेक्स्ट एन्कोडर, एक वीडियो जनरेटर, और बाद में जोड़ा गया एक ऑडियो मॉडल। HappyHorse अलग तरीका अपनाता है।

मॉडल में कोई Cross-Attention मॉड्यूल नहीं है और यह 40-लेयर single-stream Self-Attention Transformer का उपयोग करता है। टेक्स्ट, वीडियो और ऑडियो टोकन सभी एक ही transformer stack से एक साथ गुजरते हैं। यह एकीकृत डिज़ाइन अनावश्यक पैरामीटर हटाता है और inference की जटिलता घटाता है।

एकीकृत आर्किटेक्चर
टेक्स्ट, वीडियो और ऑडियो को एक ही पास में प्रोसेस किया जाता है। कोई अलग ऑडियो पाइपलाइन नहीं। कम चल भाग, कम latency।
ऑडियो अभी पीछे है
एकीकृत डिज़ाइन के बावजूद, ऑडियो गुणवत्ता Seedance 2.0 की विशेष ऑडियो पाइपलाइन से पीछे #2 पर है।

Inference पाइपलाइन असामान्य रूप से हल्की है: केवल 8 denoising steps, बिना किसी Classifier-Free Guidance (CFG) के। तुलना के लिए, कई प्रतिस्पर्धी मॉडल CFG सक्षम रखते हुए 25-50 स्टेप्स का उपयोग करते हैं। यह प्रशिक्षण के दौरान आक्रामक distillation का संकेत देता है, जहां गति के लिए मूल क्षमता का समझौता किया गया है।

इसके पीछे की टीम

HappyHorse, Alibaba के Taotian Group, जो उसका ई-कॉमर्स विभाग है, के अंतर्गत Future Life Lab से आया है। इसका नेतृत्व Zhang Di कर रहे हैं, जो Kuaishou के पूर्व VP और Kling AI के तकनीकी प्रमुख रह चुके हैं।

यह विवरण महत्वपूर्ण है। Zhang Di ने Kling के पीछे की इंजीनियरिंग संस्कृति बनाई, जो 2025 के सबसे मजबूत AI वीडियो मॉडलों में से एक था। वे इन्फ्रास्ट्रक्चर चुनौतियों, प्रशिक्षण पाइपलाइनों और मूल्यांकन की कमियों को जानते हैं। उस अनुभव को Alibaba के compute resources के साथ लाना, एक स्वतंत्र स्टार्टअप चलाने से बिल्कुल अलग समीकरण है।

💡
HappyHorse छह भाषाओं में lip sync का मूल समर्थन देता है: Chinese, English, Japanese, Korean, German और French। यह बहुभाषी क्षमता विविध और सावधानीपूर्वक क्यूरेट किए गए डेटा पर प्रशिक्षित मॉडल का संकेत देती है।

बाजार के लिए यह क्यों मायने रखता है

अप्रैल 2026 में AI वीडियो बाजार असामान्य रूप से अस्थिर है:

मार्च 2026

Sora बंद करने की घोषणा

OpenAI ने पुष्टि की कि Sora को बंद कर दिया जाएगा, 26 अप्रैल। Compute लागत और प्रतिस्पर्धी दबाव अस्थिर साबित हुए।

फरवरी 2026

Seedance 2.0 रोका गया

ByteDance को Hollywood studios के साथ कॉपीराइट विवादों के बाद रोलआउट रोकना पड़ा।

7 अप्रैल, 2026

HappyHorse दिखाई देता है

गुमनाम मॉडल Artificial Analysis Video Arena में प्रवेश करता है।

10 अप्रैल, 2026

Alibaba ने स्वामित्व की पुष्टि की

पहचान उजागर होते ही स्टॉक उछलता है।

Sora के बंद होने और Seedance के कानूनी विवादों का सामना करने के बीच, HappyHorse ऐसे समय आया है जब बाजार एक नए अग्रणी की तलाश में है। Runway Gen-4.5 अभी भी प्रोडक्शन वर्कफ्लो में मजबूत स्थिति रखता है, और Google Veo 3.1 एंटरप्राइज इंटीग्रेशन क्षेत्र में हावी है। लेकिन blind human preference से मापी गई मूल जनरेशन गुणवत्ता में HappyHorse अब शीर्ष पर है।

ओपन सोर्स: जल्द आ रहा है (शायद)

GitHub repository और Hugging Face model hub दोनों पर 11 अप्रैल तक "Coming Soon" दिख रहा है। टीम ने वाणिज्यिक लाइसेंस के साथ पूरे 15-billion parameter weights को open-source करने का वादा किया है। यदि ऐसा होता है, तो HappyHorse उपलब्ध सबसे बड़ा open-source वीडियो मॉडल होगा, जो LTX-Video's 2B parameters से काफी बड़ा है।

लेकिन "coming soon", "released" नहीं है। जब तक weights डाउनलोड करने योग्य और स्वतंत्र रूप से सत्यापित नहीं हो जाते, बेंचमार्क परिणामों के साथ एक तारांकन लगा रहेगा। AI वीडियो समुदाय ने विजेताओं की घोषणा से पहले पुनरुत्पाद्य परिणामों की प्रतीक्षा करना सीख लिया है।

किन बातों पर नजर रखें

तीन बातें तय करेंगी कि HappyHorse अपनी बढ़त बनाए रखता है या नहीं:

  • Open-source weight रिलीज और बेंचमार्क परिणामों का स्वतंत्र पुनरुत्पादन
  • ऑडियो गुणवत्ता में सुधार, ताकि ऑडियो-समावेशी श्रेणियों में Seedance 2.0 की बराबरी या उसे पीछे छोड़ा जा सके
  • API उपलब्धता और कीमत, क्योंकि यदि creators मॉडल तक पहुंच ही न सकें तो बेंचमार्क में प्रभुत्व का कोई अर्थ नहीं

AI वीडियो जनरेशन क्षेत्र तेजी से बदलता है। जनवरी में Runway Gen-4.5 अजेय दिख रहा था। फरवरी में Seedance 2.0 ने ताज हासिल किया। अब HappyHorse के पास यह है। सवाल यह नहीं है कि अंततः कोई इसे पीछे छोड़ेगा या नहीं, बल्कि कब और कहां से।

आज वीडियो पाइपलाइन बना रहे creators और developers के लिए निष्कर्ष व्यावहारिक है: कोई भी एक मॉडल लंबे समय तक शीर्ष पर नहीं रहता। सबसे अच्छी रणनीति ऐसे workflows बनाना है जो लीडरबोर्ड बदलने पर मॉडल बदल सकें, न कि सब कुछ एक नाम पर दांव पर लगाना।

💡
Alibaba ने हाल ही में Wan 2.7 with Thinking Mode भी जारी किया है, जो उसके Tongyi Lab division का अलग मॉडल है। एक ही सप्ताह में Alibaba की अलग-अलग टीमों से दो प्रमुख वीडियो मॉडल आना, AI वीडियो के लिए कंपनी-व्यापी प्रयास का संकेत है।

स्रोत

Damien
DamienAI DeveloperAI Author

लियोन के AI डेवलपर, जिन्हें जटिल ML अवधारणाओं को आसान तरीकों में बदलना पसंद है। मॉडलों की डीबगिंग न करते समय, आप उन्हें रोन घाटी में साइकिल चलाते पाएँगे।

View profile →

जो पढ़ा, वह पसंद आया?

कुछ ही मिनटों में अपने विचारों को असीमित अवधि के AI वीडियो में बदलें।

संबंधित लेख

इन संबंधित पोस्ट के साथ आगे जानें

Google Veo 3.1 Lite: Gemini API में कम लागत वाली AI वीडियो जनरेशन आ गई
AI वीडियोGoogle Veo

Google Veo 3.1 Lite: Gemini API में कम लागत वाली AI वीडियो जनरेशन आ गई

Google ने अभी Veo 3.1 Lite लॉन्च किया है, यह Gemini API में एक तेज़ और किफायती AI वीडियो जनरेशन मॉडल है। डेवलपर्स को कीमत, गुणवत्ता के समझौतों और प्रोडक्शन ऐप्स में वीडियो बनाने के बारे में यह जानना चाहिए।

Read
चीन का AI वीडियो प्रभुत्व, क्लिंग और कुइशू सिलिकॉन वैली को पीछे छोड़ रहे हैं
AI वीडियोक्लिंग AI

चीन का AI वीडियो प्रभुत्व, क्लिंग और कुइशू सिलिकॉन वैली को पीछे छोड़ रहे हैं

शीर्ष 8 में से 7 AI वीडियो मॉडल अब चीनी कंपनियों से आ रहे हैं। देखते हैं कि कुइशू का क्लिंग AI 60 मिलियन उपयोगकर्ताओं तक कैसे पहुँचा और इसका उद्योग के लिए क्या मतलब है।

Read
MiniMax Hailuo 02: चीन का बजट AI वीडियो मॉडल तकनीकी दिग्गजों को चुनौती देता है
MiniMaxHailuo

MiniMax Hailuo 02: चीन का बजट AI वीडियो मॉडल तकनीकी दिग्गजों को चुनौती देता है

MiniMax का Hailuo 02 प्रतिस्पर्धी वीडियो क्वालिटी देता है, साथ ही कीमत Veo 3 के एक क्लिप का दसवां हिस्सा है। जानिए क्यों यह चीनी चुनौती देने वाला ध्यान देने के लायक है।

Read

क्या आपको यह लेख पसंद आया?

और जानकारियाँ पाएँ और हमारी नवीनतम सामग्री से अपडेट रहें।