Alibaba HappyHorse-1.0 : le modèle mystère qui a dominé tous les classements vidéo IA
Un modèle nommé HappyHorse-1.0 est apparu sur Artificial Analysis sans attribution, a grimpé au sommet en text-to-video et image-to-video, puis s'est révélé être une création d'Alibaba. Voici ce que l'on sait de l'architecture, de l'équipe et des implications pour le marché de la vidéo IA.

La révélation
Artificial Analysis gère un Video Arena où les utilisateurs soumettent un prompt, deux modèles anonymes génèrent des vidéos, et les utilisateurs choisissent celle qu'ils préfèrent. Les votes alimentent un système de classement Elo (les mêmes mathématiques que pour les classements aux échecs). Les modèles ne peuvent pas tricher, car les évaluateurs ne savent jamais quel modèle a produit quel résultat.
HappyHorse-1.0 est entré dans cette arène le 7 avril avec un profil vierge. Pas de logo, pas d'attribution. Le 10 avril, il occupait la première position dans deux des quatre catégories de classement, et Alibaba a confirmé en être le propriétaire via un nouveau compte X et une déclaration à CNBC.
Les chiffres
Les scores Elo de HappyHorse parlent d'eux-mêmes :
Pour situer, le précédent numéro 1 en text-to-video était Seedance 2.0 de ByteDance avec un Elo de 1273. HappyHorse le devance de 60 points, un écart qui prend généralement des mois à combler. En image-to-video, HappyHorse affiche 1392 contre 1355 pour Seedance 2.0.
Les catégories incluant l'audio racontent une autre histoire. HappyHorse se retrouve en deuxième position derrière Seedance 2.0 (Elo 1219 contre 1205), ce qui suggère que le pipeline audio nécessite encore du travail par rapport à la qualité vidéo.
| Catégorie | HappyHorse | Précédent #1 | Écart |
|---|---|---|---|
| Text-to-Video (muet) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (muet) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (audio) | 1205 | 1219 (Seedance 2.0) | -14 |
Architecture : un seul Transformer, tout en une passe
La plupart des systèmes vidéo IA enchaînent des composants séparés : un encodeur de texte, un générateur vidéo, et un modèle audio ajouté après coup. HappyHorse adopte une approche différente.
Le modèle utilise un Transformer Self-Attention à flux unique de 40 couches, sans modules Cross-Attention. Les tokens de texte, de vidéo et d'audio traversent tous la même pile de transformateurs simultanément. Cette conception unifiée élimine les paramètres redondants et réduit la complexité d'inférence.
Le pipeline d'inférence est remarquablement léger : seulement 8 étapes de débruitage sans Classifier-Free Guidance (CFG). En comparaison, de nombreux modèles concurrents utilisent 25 à 50 étapes avec CFG activé. Cela suggère une distillation agressive durant l'entraînement, sacrifiant de la capacité brute au profit de la vitesse.
L'équipe derrière le projet
HappyHorse provient du Future Life Lab, rattaché au Taotian Group d'Alibaba (la branche e-commerce). Le projet est dirigé par Zhang Di, ancien VP de Kuaishou et responsable technique de Kling AI.
Ce détail compte. Zhang Di a bâti la culture d'ingénierie derrière Kling, l'un des modèles vidéo IA les plus performants de 2025. Il connaît les défis d'infrastructure, les pipelines d'entraînement et les lacunes d'évaluation. Apporter cette expérience aux ressources de calcul d'Alibaba change complètement l'équation par rapport à une startup indépendante.
Ce que cela signifie pour le marché
Le marché de la vidéo IA en avril 2026 est inhabituellement instable :
Arrêt de Sora annoncé
OpenAI a confirmé que Sora sera interrompu le 26 avril. Les coûts de calcul et la pression concurrentielle se sont avérés insoutenables.
Seedance 2.0 suspendu
ByteDance contraint de stopper le déploiement suite à des litiges de droits d'auteur avec les studios hollywoodiens.
HappyHorse apparaît
Un modèle anonyme entre dans le Video Arena d'Artificial Analysis.
Alibaba confirme la paternité
Le titre en bourse bondit à mesure que l'identité est révélée.
Avec l'arrêt progressif de Sora et les difficultés juridiques de Seedance, HappyHorse arrive à un moment où le marché cherche un nouveau leader. Runway Gen-4.5 reste solide dans les workflows de production, et Google Veo 3.1 domine l'intégration en entreprise. Mais pour la qualité de génération brute, mesurée par la préférence humaine en aveugle, HappyHorse occupe désormais la première place.
Open source : bientôt (peut-être)
Le dépôt GitHub et le hub Hugging Face affichent tous deux "Coming Soon" au 11 avril. L'équipe a promis la publication open source des poids complets de 15 milliards de paramètres sous licence commerciale. Si cela se concrétise, HappyHorse deviendrait le plus grand modèle vidéo open source disponible, nettement plus imposant que les 2 milliards de paramètres de LTX-Video.
Mais "bientôt" n'est pas "publié". Tant que les poids ne sont pas téléchargeables et vérifiés de manière indépendante, les résultats de benchmark comportent un astérisque. La communauté vidéo IA a appris à attendre des résultats reproductibles avant de désigner des vainqueurs.
Points à surveiller
Trois éléments détermineront si HappyHorse conserve son avance :
- ✓Publication des poids open source et reproduction indépendante des résultats de benchmark
- ✓Amélioration de la qualité audio pour égaler ou dépasser Seedance 2.0 dans les catégories incluant l'audio
- ✓Disponibilité de l'API et tarification, car dominer les benchmarks ne sert à rien si les créateurs ne peuvent pas accéder au modèle
L'espace de la génération vidéo par IA évolue rapidement. En janvier, Runway Gen-4.5 semblait intouchable. En février, Seedance 2.0 a pris la couronne. Aujourd'hui, c'est HappyHorse qui la détient. La question n'est pas de savoir si quelque chose finira par le dépasser, mais quand et d'où viendra le prochain challenger.
Pour les créateurs et développeurs qui construisent des pipelines vidéo aujourd'hui, la leçon est concrète : aucun modèle ne reste au sommet bien longtemps. La meilleure stratégie est de construire des workflows capables de changer de modèle au fil des évolutions du classement, plutôt que de tout miser sur un seul nom.

Développeur IA lyonnais passionné par la transformation de concepts complexes de ML en recettes simples. Lorsqu’il ne débogue pas des modèles, vous le trouverez à vélo dans la vallée du Rhône.
View profile →Vous avez aimé votre lecture ?
Transformez vos idées en vidéos IA de durée illimitée en quelques minutes.
Articles associés
Poursuivez votre exploration avec ces articles associés

La vidéo IA après Sora : 4 segments de marché à connaître en 2026
Sora ferme le 26 avril. Le marché de la vidéo IA s'est consolidé en quatre segments distincts. Un guide pratique pour choisir la bonne alternative à Sora selon vos besoins.

Google Veo 3.1 devient gratuit : 10 vidéos IA par mois pour chaque compte Google
Google a ouvert Veo 3.1 à tous les comptes personnels avec 10 générations vidéo gratuites par mois. Voici ce que vous obtenez, quelles sont les limites, et pourquoi cela compte pour les créateurs de vidéo IA.

Google Veo 3.1 Lite : la génération vidéo IA à faible coût arrive dans l'API Gemini
Google vient de lancer Veo 3.1 Lite, un modèle de génération vidéo IA rapide et abordable intégré à l'API Gemini. Voici ce que les développeurs doivent savoir sur la tarification, les compromis qualité et l'intégration vidéo dans les applications de production.