Meta PixelSaltar al contenido principal
DamienDamien· Autora de IA, revisada por humanos
6 min read
1186 palabras

Alibaba HappyHorse-1.0: el modelo misterioso que lideró todos los rankings de video con IA

Un modelo llamado HappyHorse-1.0 apareció en Artificial Analysis sin atribución, escaló al puesto #1 en text-to-video e image-to-video, y resultó ser de Alibaba. Esto es lo que sabemos sobre su arquitectura, el equipo detrás y lo que significa para el mercado de video con IA.

Alibaba HappyHorse-1.0: el modelo misterioso que lideró todos los rankings de video con IA

¿Listo para crear tus propios vídeos con IA?

Únete a miles de creadores que usan Bonega.ai

El 7 de abril de 2026, un modelo que nadie conocía apareció en el Video Arena de Artificial Analysis. En tres días ocupaba el puesto #1 tanto en text-to-video como en image-to-video. Sin marca, sin comunicado de prensa, sin nombre de empresa. Después, Alibaba confirmó que era suyo. Esta es la historia de HappyHorse-1.0, el caballo negro que acaba de reorganizar los rankings de video con IA.

La revelación

Artificial Analysis gestiona un Video Arena donde los usuarios envían un prompt, dos modelos anónimos generan resultados y los usuarios eligen el que prefieren. Los votos alimentan un sistema de clasificación Elo (la misma matemática utilizada en los rankings de ajedrez). Los modelos no pueden manipular el sistema porque los evaluadores nunca saben qué modelo produjo cada resultado.

HappyHorse-1.0 entró en esta arena el 7 de abril con un perfil en blanco. Sin logo, sin atribución. Para el 10 de abril ocupaba la primera posición en dos de las cuatro categorías del ranking, y Alibaba confirmó la autoría a través de una cuenta recién creada en X y una declaración a CNBC.

💡
Las acciones de Alibaba cotizadas en Hong Kong subieron un 2,12 % el día del anuncio, y ya habían avanzado un 6,75 % a principios de semana mientras crecían las especulaciones en torno al modelo misterioso.

Los números

Los puntajes Elo de HappyHorse hablan por sí solos:

1333
Elo T2V (sin audio)
1392
Elo I2V (sin audio)
1205
Elo T2V (con audio)

Para contextualizar, el anterior #1 en text-to-video era Seedance 2.0 de ByteDance con un Elo de 1273. HappyHorse lo supera por 60 puntos, una diferencia que normalmente toma meses en cerrarse. En image-to-video, HappyHorse marcó 1392 frente a 1355 de Seedance 2.0.

Las categorías con audio cuentan una historia diferente. HappyHorse se ubica en el puesto #2 detrás de Seedance 2.0 (Elo 1219 contra 1205), lo que sugiere que el pipeline de audio aún necesita trabajo en relación con la calidad del video.

CategoríaHappyHorseAnterior #1Diferencia
Text-to-Video (sin audio)13331273 (Seedance 2.0)+60
Image-to-Video (sin audio)13921355 (Seedance 2.0)+37
Text-to-Video (con audio)12051219 (Seedance 2.0)-14

Arquitectura: un solo Transformer, todo a la vez

La mayoría de los sistemas de video con IA encadenan componentes separados: un codificador de texto, un generador de video y un modelo de audio añadido después. HappyHorse adopta un enfoque diferente.

El modelo utiliza un Transformer Self-Attention de flujo único con 40 capas, sin módulos Cross-Attention. Los tokens de texto, video y audio pasan todos por el mismo stack de transformadores simultáneamente. Este diseño unificado elimina parámetros redundantes y reduce la complejidad de inferencia.

Arquitectura unificada
Texto, video y audio procesados en una sola pasada. Sin pipeline de audio separado. Menos piezas móviles, menor latencia.
Audio aún rezagado
A pesar del diseño unificado, la calidad de audio se ubica en el puesto #2 detrás del pipeline especializado de Seedance 2.0.

El pipeline de inferencia es inusualmente ligero: solo 8 pasos de denoising sin Classifier-Free Guidance (CFG). En comparación, muchos modelos competidores usan entre 25 y 50 pasos con CFG activado. Esto sugiere una destilación agresiva durante el entrenamiento, sacrificando capacidad bruta por velocidad.

El equipo detrás del proyecto

HappyHorse proviene del Future Life Lab, perteneciente al Taotian Group de Alibaba (la división de comercio electrónico). Lo lidera Zhang Di, ex VP de Kuaishou y responsable técnico de Kling AI.

Este detalle importa. Zhang Di construyó la cultura de ingeniería detrás de Kling, uno de los modelos de video con IA más sólidos de 2025. Conoce los desafíos de infraestructura, los pipelines de entrenamiento y las brechas de evaluación. Llevar esa experiencia a los recursos de cómputo de Alibaba es una ecuación completamente distinta a la de un startup independiente.

💡
HappyHorse soporta de forma nativa la sincronización labial en seis idiomas: chino, inglés, japonés, coreano, alemán y francés. Esta capacidad multilingüe sugiere un modelo entrenado con datos diversos y cuidadosamente seleccionados.

Lo que esto significa para el mercado

El mercado de video con IA en abril de 2026 es inusualmente volátil:

Marzo 2026

Se anuncia el cierre de Sora

OpenAI confirmó que Sora se descontinuará el 26 de abril. Los costos de cómputo y la presión competitiva resultaron insostenibles.

Febrero 2026

Seedance 2.0 pausado

ByteDance se vio obligado a detener el despliegue tras disputas de derechos de autor con estudios de Hollywood.

7 de abril de 2026

HappyHorse aparece

Un modelo anónimo entra en el Video Arena de Artificial Analysis.

10 de abril de 2026

Alibaba confirma la autoría

Las acciones suben tras revelarse la identidad.

Con Sora en proceso de cierre y Seedance enfrentando problemas legales, HappyHorse llega en un momento en que el mercado busca un nuevo líder. Runway Gen-4.5 sigue siendo fuerte en flujos de trabajo de producción, y Google Veo 3.1 domina la integración empresarial. Pero en cuanto a calidad de generación pura, medida por preferencia humana a ciegas, HappyHorse ahora ocupa el primer lugar.

Open source: pronto (quizás)

El repositorio de GitHub y el hub de modelos de Hugging Face muestran "Coming Soon" a fecha del 11 de abril. El equipo ha prometido la publicación open source de los pesos completos de 15 mil millones de parámetros con licencia comercial. Si eso ocurre, HappyHorse sería el modelo de video open source más grande disponible, significativamente mayor que los 2 mil millones de parámetros de LTX-Video.

Pero "pronto" no es "publicado". Hasta que los pesos sean descargables y verificados de manera independiente, los resultados del benchmark llevan un asterisco. La comunidad de video con IA ha aprendido a esperar resultados reproducibles antes de declarar ganadores.

Qué observar

Tres factores determinarán si HappyHorse mantiene su ventaja:

  • Publicación open source de los pesos y reproducción independiente de los resultados del benchmark
  • Mejoras en la calidad de audio para igualar o superar a Seedance 2.0 en las categorías con audio
  • Disponibilidad de la API y precios, porque dominar benchmarks no sirve de nada si los creadores no pueden acceder al modelo

El espacio de generación de video con IA se mueve rápido. En enero, Runway Gen-4.5 parecía inalcanzable. En febrero, Seedance 2.0 tomó la corona. Ahora la tiene HappyHorse. La pregunta no es si algo lo superará eventualmente, sino cuándo y de dónde vendrá.

Para creadores y desarrolladores que construyen pipelines de video hoy, la conclusión es práctica: ningún modelo se mantiene en la cima por mucho tiempo. La mejor estrategia es construir flujos de trabajo que puedan intercambiar modelos a medida que el ranking cambia, en lugar de apostar todo a un solo nombre.

💡
Alibaba también lanzó recientemente Wan 2.7 con Thinking Mode, un modelo separado de su división Tongyi Lab. Dos modelos de video importantes de equipos diferentes de Alibaba en la misma semana señalan una apuesta a nivel de toda la empresa por el video con IA.
Damien
DamienAI DeveloperAI Author

Desarrollador de IA de Lyon al que le encanta convertir conceptos complejos de ML en recetas sencillas. Cuando no está depurando modelos, lo encontrarás recorriendo en bicicleta el valle del Ródano.

View profile →

¿Te ha gustado lo que has leído?

Convierte tus ideas en vídeos con IA de duración ilimitada en minutos.

Artículos relacionados

Sigue explorando con estas publicaciones relacionadas

¿Te ha gustado este artículo?

Descubre más ideas y mantente al día con nuestro contenido más reciente.