Meta PixelPasser au contenu principal
DamienDamien· Auteur IA, révisé par un humain
6 min read
1161 mots

Alibaba HappyHorse-1.0 : le modèle mystère qui a dominé tous les classements vidéo IA

Un modèle nommé HappyHorse-1.0 est apparu sur Artificial Analysis sans attribution, a grimpé au sommet en text-to-video et image-to-video, puis s'est révélé être une création d'Alibaba. Voici ce que l'on sait de l'architecture, de l'équipe et des implications pour le marché de la vidéo IA.

Alibaba HappyHorse-1.0 : le modèle mystère qui a dominé tous les classements vidéo IA

Prêt à créer vos propres vidéos IA ?

Rejoignez des milliers de créateurs qui utilisent Bonega.ai

Le 7 avril 2026, un modèle totalement inconnu est apparu sur le Video Arena d'Artificial Analysis. En trois jours, il occupait la première place en text-to-video et en image-to-video. Aucun logo, aucun communiqué de presse, aucun nom d'entreprise associé. Puis Alibaba a confirmé en être le créateur. Voici l'histoire de HappyHorse-1.0, le outsider qui vient de redistribuer les cartes du classement vidéo IA.

La révélation

Artificial Analysis gère un Video Arena où les utilisateurs soumettent un prompt, deux modèles anonymes génèrent des vidéos, et les utilisateurs choisissent celle qu'ils préfèrent. Les votes alimentent un système de classement Elo (les mêmes mathématiques que pour les classements aux échecs). Les modèles ne peuvent pas tricher, car les évaluateurs ne savent jamais quel modèle a produit quel résultat.

HappyHorse-1.0 est entré dans cette arène le 7 avril avec un profil vierge. Pas de logo, pas d'attribution. Le 10 avril, il occupait la première position dans deux des quatre catégories de classement, et Alibaba a confirmé en être le propriétaire via un nouveau compte X et une déclaration à CNBC.

💡
Les actions d'Alibaba cotées à Hong Kong ont progressé de 2,12 % le jour de l'annonce, après avoir déjà gagné 6,75 % en début de semaine alors que les spéculations s'intensifiaient autour du modèle mystère.

Les chiffres

Les scores Elo de HappyHorse parlent d'eux-mêmes :

1333
Elo T2V (sans audio)
1392
Elo I2V (sans audio)
1205
Elo T2V (avec audio)

Pour situer, le précédent numéro 1 en text-to-video était Seedance 2.0 de ByteDance avec un Elo de 1273. HappyHorse le devance de 60 points, un écart qui prend généralement des mois à combler. En image-to-video, HappyHorse affiche 1392 contre 1355 pour Seedance 2.0.

Les catégories incluant l'audio racontent une autre histoire. HappyHorse se retrouve en deuxième position derrière Seedance 2.0 (Elo 1219 contre 1205), ce qui suggère que le pipeline audio nécessite encore du travail par rapport à la qualité vidéo.

CatégorieHappyHorsePrécédent #1Écart
Text-to-Video (muet)13331273 (Seedance 2.0)+60
Image-to-Video (muet)13921355 (Seedance 2.0)+37
Text-to-Video (audio)12051219 (Seedance 2.0)-14

Architecture : un seul Transformer, tout en une passe

La plupart des systèmes vidéo IA enchaînent des composants séparés : un encodeur de texte, un générateur vidéo, et un modèle audio ajouté après coup. HappyHorse adopte une approche différente.

Le modèle utilise un Transformer Self-Attention à flux unique de 40 couches, sans modules Cross-Attention. Les tokens de texte, de vidéo et d'audio traversent tous la même pile de transformateurs simultanément. Cette conception unifiée élimine les paramètres redondants et réduit la complexité d'inférence.

Architecture unifiée
Texte, vidéo et audio traités en une seule passe. Pas de pipeline audio séparé. Moins de composants, latence réduite.
Audio encore en retrait
Malgré le design unifié, la qualité audio reste classée #2 derrière le pipeline audio spécialisé de Seedance 2.0.

Le pipeline d'inférence est remarquablement léger : seulement 8 étapes de débruitage sans Classifier-Free Guidance (CFG). En comparaison, de nombreux modèles concurrents utilisent 25 à 50 étapes avec CFG activé. Cela suggère une distillation agressive durant l'entraînement, sacrifiant de la capacité brute au profit de la vitesse.

L'équipe derrière le projet

HappyHorse provient du Future Life Lab, rattaché au Taotian Group d'Alibaba (la branche e-commerce). Le projet est dirigé par Zhang Di, ancien VP de Kuaishou et responsable technique de Kling AI.

Ce détail compte. Zhang Di a bâti la culture d'ingénierie derrière Kling, l'un des modèles vidéo IA les plus performants de 2025. Il connaît les défis d'infrastructure, les pipelines d'entraînement et les lacunes d'évaluation. Apporter cette expérience aux ressources de calcul d'Alibaba change complètement l'équation par rapport à une startup indépendante.

💡
HappyHorse prend en charge nativement la synchronisation labiale dans six langues : chinois, anglais, japonais, coréen, allemand et français. Cette capacité multilingue suggère un modèle entraîné sur des données diversifiées et soigneusement sélectionnées.

Ce que cela signifie pour le marché

Le marché de la vidéo IA en avril 2026 est inhabituellement instable :

Mars 2026

Arrêt de Sora annoncé

OpenAI a confirmé que Sora sera interrompu le 26 avril. Les coûts de calcul et la pression concurrentielle se sont avérés insoutenables.

Février 2026

Seedance 2.0 suspendu

ByteDance contraint de stopper le déploiement suite à des litiges de droits d'auteur avec les studios hollywoodiens.

7 avril 2026

HappyHorse apparaît

Un modèle anonyme entre dans le Video Arena d'Artificial Analysis.

10 avril 2026

Alibaba confirme la paternité

Le titre en bourse bondit à mesure que l'identité est révélée.

Avec l'arrêt progressif de Sora et les difficultés juridiques de Seedance, HappyHorse arrive à un moment où le marché cherche un nouveau leader. Runway Gen-4.5 reste solide dans les workflows de production, et Google Veo 3.1 domine l'intégration en entreprise. Mais pour la qualité de génération brute, mesurée par la préférence humaine en aveugle, HappyHorse occupe désormais la première place.

Open source : bientôt (peut-être)

Le dépôt GitHub et le hub Hugging Face affichent tous deux "Coming Soon" au 11 avril. L'équipe a promis la publication open source des poids complets de 15 milliards de paramètres sous licence commerciale. Si cela se concrétise, HappyHorse deviendrait le plus grand modèle vidéo open source disponible, nettement plus imposant que les 2 milliards de paramètres de LTX-Video.

Mais "bientôt" n'est pas "publié". Tant que les poids ne sont pas téléchargeables et vérifiés de manière indépendante, les résultats de benchmark comportent un astérisque. La communauté vidéo IA a appris à attendre des résultats reproductibles avant de désigner des vainqueurs.

Points à surveiller

Trois éléments détermineront si HappyHorse conserve son avance :

  • Publication des poids open source et reproduction indépendante des résultats de benchmark
  • Amélioration de la qualité audio pour égaler ou dépasser Seedance 2.0 dans les catégories incluant l'audio
  • Disponibilité de l'API et tarification, car dominer les benchmarks ne sert à rien si les créateurs ne peuvent pas accéder au modèle

L'espace de la génération vidéo par IA évolue rapidement. En janvier, Runway Gen-4.5 semblait intouchable. En février, Seedance 2.0 a pris la couronne. Aujourd'hui, c'est HappyHorse qui la détient. La question n'est pas de savoir si quelque chose finira par le dépasser, mais quand et d'où viendra le prochain challenger.

Pour les créateurs et développeurs qui construisent des pipelines vidéo aujourd'hui, la leçon est concrète : aucun modèle ne reste au sommet bien longtemps. La meilleure stratégie est de construire des workflows capables de changer de modèle au fil des évolutions du classement, plutôt que de tout miser sur un seul nom.

💡
Alibaba a également publié récemment Wan 2.7 avec Thinking Mode, un modèle distinct issu de la division Tongyi Lab. Deux modèles vidéo majeurs provenant de deux équipes Alibaba différentes dans la même semaine signalent une offensive massive de l'entreprise dans la vidéo IA.
Damien
DamienAI DeveloperAI Author

Développeur IA lyonnais passionné par la transformation de concepts complexes de ML en recettes simples. Lorsqu’il ne débogue pas des modèles, vous le trouverez à vélo dans la vallée du Rhône.

View profile →

Vous avez aimé votre lecture ?

Transformez vos idées en vidéos IA de durée illimitée en quelques minutes.

Articles associés

Poursuivez votre exploration avec ces articles associés

Cet article vous a plu ?

Découvrez plus d’informations et restez au courant de nos derniers contenus.