Alibaba HappyHorse-1.0: El model misteriós que va arribar al capdamunt de totes les classificacions de vídeo AI
Un model anomenat HappyHorse-1.0 va aparèixer a Artificial Analysis sense cap atribució, va pujar al #1 tant en text-to-video com en image-to-video, i després va resultar ser d'Alibaba. Aquí teniu el que sabem sobre l'arquitectura, l'equip i què significa per al mercat del vídeo AI.

Preparat per crear els teus propis vídeos amb IA?
Uneix-te a milers de creadors que utilitzen Bonega.ai
La revelació
Artificial Analysis gestiona una Video Arena on els usuaris envien un prompt, dos models anònims generen resultats, i els usuaris trien el que prefereixen. Els vots alimenten un sistema de puntuació Elo (la mateixa matemàtica que s'utilitza en les classificacions d'escacs). Els models no poden manipular el sistema perquè els avaluadors mai saben quin model ha produït quin resultat.
HappyHorse-1.0 va entrar en aquesta arena el 7 d'abril amb un perfil en blanc. Sense logotip, sense atribució d'empresa. El 10 d'abril ocupava la primera posició en dues de les quatre categories de classificació, i Alibaba va confirmar-ne la propietat a través d'un compte X creat recentment i una declaració a CNBC.
Les xifres
Les puntuacions Elo de HappyHorse parlen per si mateixes:
Per posar-ho en context, l'anterior #1 en text-to-video era Seedance 2.0 de ByteDance amb Elo 1273. HappyHorse el va superar per 60 punts, una diferència que normalment triga mesos a tancar-se. En image-to-video, HappyHorse va aconseguir 1392 enfront dels 1355 de Seedance 2.0.
Les categories amb àudio expliquen una altra història. HappyHorse se situa en segona posició darrere de Seedance 2.0 (Elo 1219 contra 1205), cosa que suggereix que el pipeline d'àudio encara necessita feina en comparació amb la qualitat del vídeo.
| Categoria | HappyHorse | Anterior #1 | Diferència |
|---|---|---|---|
| Text-to-Video (sense so) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (sense so) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (amb àudio) | 1205 | 1219 (Seedance 2.0) | -14 |
Arquitectura: un Transformer, tot alhora
La majoria de sistemes de vídeo AI encadenen components separats: un codificador de text, un generador de vídeo i un model d'àudio afegit després. HappyHorse adopta un enfocament diferent.
El model utilitza un Transformer Self-Attention single-stream de 40 capes sense mòduls Cross-Attention. Els tokens de text, vídeo i àudio flueixen tots pel mateix stack de Transformer simultàniament. Aquest disseny unificat elimina paràmetres redundants i redueix la complexitat d'inferència.
El pipeline d'inferència és inusualment lleuger: només 8 passos de denoising sense Classifier-Free Guidance (CFG). Per comparació, molts models competidors utilitzen 25-50 passos amb CFG activat. Això suggereix una distillation agressiva durant l'entrenament, on es canvia capacitat bruta per velocitat.
L'equip darrere del model
HappyHorse prové del Future Life Lab sota el Taotian Group d'Alibaba (la branca de comerç electrònic). El líder és Zhang Di, antic vicepresident de Kuaishou i director tècnic de Kling AI.
Aquest detall importa. Zhang Di va construir la cultura d'enginyeria darrere de Kling, un dels models de vídeo AI més potents de 2025. Coneix els reptes d'infraestructura, els pipelines d'entrenament i les llacunes d'avaluació. Portar aquesta experiència als recursos computacionals d'Alibaba és una equació diferent que gestionar una startup independent.
Per què això importa per al mercat
El mercat del vídeo AI a l'abril de 2026 és inusualment volàtil:
Anunci del tancament de Sora
OpenAI va confirmar que Sora es discontinuarà el 26 d'abril. Els costos computacionals i la pressió competitiva van resultar insostenibles.
Seedance 2.0 pausat
ByteDance es va veure obligat a aturar el desplegament per disputes de drets d'autor amb els estudis de Hollywood.
HappyHorse apareix
Un model anònim entra a l'Artificial Analysis Video Arena.
Alibaba confirma la propietat
Les accions pugen quan es revela la identitat.
Amb Sora en procés de tancament i Seedance enfrontant problemes legals, HappyHorse arriba en un moment en què el mercat busca un nou líder. Runway Gen-4.5 continua sent fort en fluxos de treball de producció, i Google Veo 3.1 domina l'espai d'integració empresarial. Però pel que fa a la qualitat bruta de generació mesurada per preferència humana a cegues, HappyHorse ara ocupa el primer lloc.
Codi obert: properament (potser)
El repositori de GitHub i el hub de models de Hugging Face mostren tots dos "Coming Soon" a data d'11 d'abril. L'equip ha promès una publicació de codi obert dels pesos complets de 15 mil milions de paràmetres amb llicència comercial. Si això passa, HappyHorse seria el model de vídeo de codi obert més gran disponible, significativament més gran que els 2B paràmetres de LTX-Video.
Però "properament" no és "publicat." Fins que els pesos siguin descarregables i verificats independentment, els resultats dels benchmarks porten un asterisc. La comunitat de vídeo AI ha après a esperar resultats reproduïbles abans de declarar guanyadors.
Què cal vigilar
Tres coses determinaran si HappyHorse manté el seu lideratge:
- ✓Publicació dels pesos en codi obert i reproducció independent dels resultats dels benchmarks
- ✓Millores en la qualitat d'àudio per igualar o superar Seedance 2.0 en les categories amb àudio
- ✓Disponibilitat de l'API i preus, ja que dominar els benchmarks no significa res si els creadors no poden accedir al model
L'espai de generació de vídeo AI es mou ràpidament. Al gener, Runway Gen-4.5 semblava intocable. Al febrer, Seedance 2.0 va prendre la corona. Ara la té HappyHorse. La pregunta no és si alguna cosa el superarà eventualment, sinó quan i des d'on.
Per als creadors i desenvolupadors que construeixen pipelines de vídeo avui, la conclusió és pràctica: cap model es manté al capdamunt durant gaire temps. La millor estratègia és construir fluxos de treball que puguin canviar de model a mesura que la classificació evoluciona, en lloc d'apostar-ho tot a un sol nom.

Desenvolupador d’IA de Lió que gaudeix transformant conceptes complexos d’ML en receptes senzilles. Quan no depura models, el trobaràs recorrent amb bicicleta la vall del Roine.
View profile →T’ha agradat el que has llegit?
Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.
Articles relacionats
Continua explorant amb aquestes publicacions relacionades

Alibaba Wan 2.7: Com el mode de pensament canvia la generació de vídeo amb IA
Alibaba acaba de llançar Wan 2.7 amb un nou mode de pensament que planifica composicions abans de generar el vídeo. Analitzem com funciona i què significa per als creadors.

Vídeo IA després de Sora: 4 nivells de mercat que cal conèixer el 2026
Sora tanca el 26 d'abril. El mercat de vídeo IA s'ha consolidat en quatre nivells. Una guia pràctica per triar l'alternativa adequada a Sora segons les teves necessitats.

Google Veo 3.1 es torna gratuït: 10 vídeos d'IA al mes per a cada compte de Google
Google ha obert Veo 3.1 a tots els comptes personals amb 10 generacions de vídeo gratuïtes al mes. Aquí tens què obtens, quins són els límits i per què això importa als creadors de vídeo amb IA.