Alibaba HappyHorse-1.0: o modelo misterioso que liderou todos os rankings de vídeo com IA
Um modelo chamado HappyHorse-1.0 surgiu no Artificial Analysis sem atribuição, subiu ao primeiro lugar em text-to-video e image-to-video, e revelou-se ser da Alibaba. Eis o que sabemos sobre a arquitetura, a equipa e o que isto significa para o mercado de vídeo com IA.

Pronto para criar os seus próprios vídeos com IA?
Junte-se a milhares de criadores que utilizam Bonega.ai
A revelação
O Artificial Analysis gere um Video Arena onde os utilizadores submetem um prompt, dois modelos anónimos geram resultados e os utilizadores escolhem o que preferem. Os votos alimentam um sistema de classificação Elo (a mesma matemática utilizada nos rankings de xadrez). Os modelos não conseguem manipular o sistema porque os avaliadores nunca sabem qual modelo produziu cada resultado.
O HappyHorse-1.0 entrou nesta arena a 7 de abril com um perfil vazio. Sem logótipo, sem atribuição. A 10 de abril, ocupava a primeira posição em duas das quatro categorias do ranking, e a Alibaba confirmou a propriedade através de uma conta recém-criada no X e de uma declaração à CNBC.
Os números
Os scores Elo do HappyHorse falam por si:
Para contextualizar, o anterior número 1 em text-to-video era o Seedance 2.0 da ByteDance com um Elo de 1273. O HappyHorse supera-o por 60 pontos, uma diferença que normalmente leva meses a fechar. Em image-to-video, o HappyHorse registou 1392 contra 1355 do Seedance 2.0.
As categorias com áudio contam uma história diferente. O HappyHorse fica em segundo lugar atrás do Seedance 2.0 (Elo 1219 contra 1205), o que sugere que o pipeline de áudio ainda precisa de trabalho em relação à qualidade do vídeo.
| Categoria | HappyHorse | Anterior #1 | Diferença |
|---|---|---|---|
| Text-to-Video (sem áudio) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (sem áudio) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (com áudio) | 1205 | 1219 (Seedance 2.0) | -14 |
Arquitetura: um único Transformer, tudo de uma vez
A maioria dos sistemas de vídeo com IA encadeia componentes separados: um codificador de texto, um gerador de vídeo e um modelo de áudio adicionado depois. O HappyHorse adota uma abordagem diferente.
O modelo utiliza um Transformer Self-Attention de fluxo único com 40 camadas, sem módulos Cross-Attention. Os tokens de texto, vídeo e áudio passam todos pelo mesmo stack de transformadores em simultâneo. Este design unificado elimina parâmetros redundantes e reduz a complexidade de inferência.
O pipeline de inferência é invulgarmente leve: apenas 8 passos de denoising sem Classifier-Free Guidance (CFG). Para comparação, muitos modelos concorrentes utilizam entre 25 e 50 passos com CFG ativado. Isto sugere uma destilação agressiva durante o treino, sacrificando capacidade bruta em favor de velocidade.
A equipa por detrás
O HappyHorse vem do Future Life Lab, parte do Taotian Group da Alibaba (a divisão de comércio eletrónico). O líder é Zhang Di, ex-VP da Kuaishou e responsável técnico do Kling AI.
Este detalhe é relevante. Zhang Di construiu a cultura de engenharia por detrás do Kling, um dos modelos de vídeo com IA mais fortes de 2025. Conhece os desafios de infraestrutura, os pipelines de treino e as lacunas de avaliação. Trazer essa experiência para os recursos computacionais da Alibaba é uma equação completamente diferente de gerir uma startup independente.
O que isto significa para o mercado
O mercado de vídeo com IA em abril de 2026 está invulgarmente volátil:
Encerramento do Sora anunciado
A OpenAI confirmou que o Sora será descontinuado a 26 de abril. Os custos computacionais e a pressão competitiva revelaram-se insustentáveis.
Seedance 2.0 pausado
A ByteDance foi obrigada a suspender a distribuição após disputas de direitos de autor com estúdios de Hollywood.
HappyHorse aparece
Um modelo anónimo entra no Video Arena do Artificial Analysis.
Alibaba confirma a autoria
As ações disparam com a revelação da identidade.
Com o Sora a encerrar e o Seedance a enfrentar problemas legais, o HappyHorse chega num momento em que o mercado procura um novo líder. O Runway Gen-4.5 continua forte em workflows de produção, e o Google Veo 3.1 domina a integração empresarial. Mas em termos de qualidade de geração pura, medida por preferência humana em avaliação cega, o HappyHorse ocupa agora o primeiro lugar.
Open source: em breve (talvez)
O repositório GitHub e o hub de modelos Hugging Face mostram ambos "Coming Soon" à data de 11 de abril. A equipa prometeu a publicação open source dos pesos completos de 15 mil milhões de parâmetros com licença comercial. Se isso acontecer, o HappyHorse será o maior modelo de vídeo open source disponível, significativamente maior que os 2 mil milhões de parâmetros do LTX-Video.
Mas "em breve" não é "publicado". Até que os pesos sejam descarregáveis e verificados de forma independente, os resultados do benchmark carregam um asterisco. A comunidade de vídeo com IA aprendeu a esperar por resultados reprodutíveis antes de declarar vencedores.
O que acompanhar
Três fatores determinarão se o HappyHorse mantém a sua vantagem:
- ✓Publicação open source dos pesos e reprodução independente dos resultados do benchmark
- ✓Melhorias na qualidade do áudio para igualar ou superar o Seedance 2.0 nas categorias com áudio
- ✓Disponibilidade da API e preços, porque dominar benchmarks não serve de nada se os criadores não conseguirem aceder ao modelo
O espaço de geração de vídeo com IA move-se depressa. Em janeiro, o Runway Gen-4.5 parecia inalcançável. Em fevereiro, o Seedance 2.0 tomou a coroa. Agora é o HappyHorse que a detém. A questão não é se algo o vai superar eventualmente, mas quando e de onde.
Para criadores e programadores que constroem pipelines de vídeo hoje, a conclusão é prática: nenhum modelo se mantém no topo por muito tempo. A melhor estratégia é construir workflows que possam trocar de modelo à medida que os rankings mudam, em vez de apostar tudo num único nome.

Desenvolvedor de IA de Lyon que adora transformar conceitos complexos de ML em receitas simples. Quando não está a depurar modelos, encontra-o a pedalar pelo vale do Ródano.
View profile →Artigos relacionados
Continue a explorar com estes artigos relacionados

Vídeo IA após Sora: 4 níveis de mercado para conhecer em 2026
Sora fecha em 26 de abril. O mercado de vídeo IA se consolidou em quatro níveis. Um guia prático para escolher a alternativa ao Sora adequada às suas necessidades.

Google Veo 3.1 agora é grátis: 10 vídeos IA por mês para cada conta Google
O Google abriu o Veo 3.1 para todas as contas pessoais com 10 gerações de vídeo gratuitas por mês. Veja o que você recebe, quais são os limites e por que isso importa para criadores de vídeo IA.

Google Veo 3.1 Lite: geração de vídeo com IA de baixo custo chega à API do Gemini
O Google acaba de lançar o Veo 3.1 Lite, um modelo de geração de vídeo com IA rápido e acessível dentro da API do Gemini. Veja o que os desenvolvedores precisam saber sobre preços, compromissos de qualidade e como integrar vídeo em aplicações de produção.