Alibaba HappyHorse-1.0: el modelo misterioso que lideró todos los rankings de video con IA
Un modelo llamado HappyHorse-1.0 apareció en Artificial Analysis sin atribución, escaló al puesto #1 en text-to-video e image-to-video, y resultó ser de Alibaba. Esto es lo que sabemos sobre su arquitectura, el equipo detrás y lo que significa para el mercado de video con IA.

La revelación
Artificial Analysis gestiona un Video Arena donde los usuarios envían un prompt, dos modelos anónimos generan resultados y los usuarios eligen el que prefieren. Los votos alimentan un sistema de clasificación Elo (la misma matemática utilizada en los rankings de ajedrez). Los modelos no pueden manipular el sistema porque los evaluadores nunca saben qué modelo produjo cada resultado.
HappyHorse-1.0 entró en esta arena el 7 de abril con un perfil en blanco. Sin logo, sin atribución. Para el 10 de abril ocupaba la primera posición en dos de las cuatro categorías del ranking, y Alibaba confirmó la autoría a través de una cuenta recién creada en X y una declaración a CNBC.
Los números
Los puntajes Elo de HappyHorse hablan por sí solos:
Para contextualizar, el anterior #1 en text-to-video era Seedance 2.0 de ByteDance con un Elo de 1273. HappyHorse lo supera por 60 puntos, una diferencia que normalmente toma meses en cerrarse. En image-to-video, HappyHorse marcó 1392 frente a 1355 de Seedance 2.0.
Las categorías con audio cuentan una historia diferente. HappyHorse se ubica en el puesto #2 detrás de Seedance 2.0 (Elo 1219 contra 1205), lo que sugiere que el pipeline de audio aún necesita trabajo en relación con la calidad del video.
| Categoría | HappyHorse | Anterior #1 | Diferencia |
|---|---|---|---|
| Text-to-Video (sin audio) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (sin audio) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (con audio) | 1205 | 1219 (Seedance 2.0) | -14 |
Arquitectura: un solo Transformer, todo a la vez
La mayoría de los sistemas de video con IA encadenan componentes separados: un codificador de texto, un generador de video y un modelo de audio añadido después. HappyHorse adopta un enfoque diferente.
El modelo utiliza un Transformer Self-Attention de flujo único con 40 capas, sin módulos Cross-Attention. Los tokens de texto, video y audio pasan todos por el mismo stack de transformadores simultáneamente. Este diseño unificado elimina parámetros redundantes y reduce la complejidad de inferencia.
El pipeline de inferencia es inusualmente ligero: solo 8 pasos de denoising sin Classifier-Free Guidance (CFG). En comparación, muchos modelos competidores usan entre 25 y 50 pasos con CFG activado. Esto sugiere una destilación agresiva durante el entrenamiento, sacrificando capacidad bruta por velocidad.
El equipo detrás del proyecto
HappyHorse proviene del Future Life Lab, perteneciente al Taotian Group de Alibaba (la división de comercio electrónico). Lo lidera Zhang Di, ex VP de Kuaishou y responsable técnico de Kling AI.
Este detalle importa. Zhang Di construyó la cultura de ingeniería detrás de Kling, uno de los modelos de video con IA más sólidos de 2025. Conoce los desafíos de infraestructura, los pipelines de entrenamiento y las brechas de evaluación. Llevar esa experiencia a los recursos de cómputo de Alibaba es una ecuación completamente distinta a la de un startup independiente.
Lo que esto significa para el mercado
El mercado de video con IA en abril de 2026 es inusualmente volátil:
Se anuncia el cierre de Sora
OpenAI confirmó que Sora se descontinuará el 26 de abril. Los costos de cómputo y la presión competitiva resultaron insostenibles.
Seedance 2.0 pausado
ByteDance se vio obligado a detener el despliegue tras disputas de derechos de autor con estudios de Hollywood.
HappyHorse aparece
Un modelo anónimo entra en el Video Arena de Artificial Analysis.
Alibaba confirma la autoría
Las acciones suben tras revelarse la identidad.
Con Sora en proceso de cierre y Seedance enfrentando problemas legales, HappyHorse llega en un momento en que el mercado busca un nuevo líder. Runway Gen-4.5 sigue siendo fuerte en flujos de trabajo de producción, y Google Veo 3.1 domina la integración empresarial. Pero en cuanto a calidad de generación pura, medida por preferencia humana a ciegas, HappyHorse ahora ocupa el primer lugar.
Open source: pronto (quizás)
El repositorio de GitHub y el hub de modelos de Hugging Face muestran "Coming Soon" a fecha del 11 de abril. El equipo ha prometido la publicación open source de los pesos completos de 15 mil millones de parámetros con licencia comercial. Si eso ocurre, HappyHorse sería el modelo de video open source más grande disponible, significativamente mayor que los 2 mil millones de parámetros de LTX-Video.
Pero "pronto" no es "publicado". Hasta que los pesos sean descargables y verificados de manera independiente, los resultados del benchmark llevan un asterisco. La comunidad de video con IA ha aprendido a esperar resultados reproducibles antes de declarar ganadores.
Qué observar
Tres factores determinarán si HappyHorse mantiene su ventaja:
- ✓Publicación open source de los pesos y reproducción independiente de los resultados del benchmark
- ✓Mejoras en la calidad de audio para igualar o superar a Seedance 2.0 en las categorías con audio
- ✓Disponibilidad de la API y precios, porque dominar benchmarks no sirve de nada si los creadores no pueden acceder al modelo
El espacio de generación de video con IA se mueve rápido. En enero, Runway Gen-4.5 parecía inalcanzable. En febrero, Seedance 2.0 tomó la corona. Ahora la tiene HappyHorse. La pregunta no es si algo lo superará eventualmente, sino cuándo y de dónde vendrá.
Para creadores y desarrolladores que construyen pipelines de video hoy, la conclusión es práctica: ningún modelo se mantiene en la cima por mucho tiempo. La mejor estrategia es construir flujos de trabajo que puedan intercambiar modelos a medida que el ranking cambia, en lugar de apostar todo a un solo nombre.

Desarrollador de IA de Lyon al que le encanta convertir conceptos complejos de ML en recetas sencillas. Cuando no está depurando modelos, lo encontrarás recorriendo en bicicleta el valle del Ródano.
View profile →¿Te ha gustado lo que has leído?
Convierte tus ideas en vídeos con IA de duración ilimitada en minutos.
Artículos relacionados
Sigue explorando con estas publicaciones relacionadas

Video IA después de Sora: 4 niveles de mercado que debes conocer en 2026
Sora cierra el 26 de abril. El mercado de video IA se ha consolidado en cuatro niveles. Una guía práctica para elegir la alternativa a Sora adecuada para tus necesidades.

Google Veo 3.1 ahora es gratis: 10 videos IA al mes para cada cuenta de Google
Google abrió Veo 3.1 a todas las cuentas personales con 10 generaciones de video gratuitas al mes. Esto es lo que obtienes, cuáles son los límites y por qué importa para los creadores de video IA.

Google Veo 3.1 Lite: la generación de video IA a bajo costo llega a la API de Gemini
Google acaba de lanzar Veo 3.1 Lite, un modelo de generación de video IA rápido y asequible dentro de la API de Gemini. Esto es lo que los desarrolladores necesitan saber sobre precios, compromisos de calidad y cómo integrar video en aplicaciones de producción.