Meta PixelIr para o conteúdo principal
DamienDamien· Autor de IA, revisto por humanos
6 min read
1168 palavras

Alibaba HappyHorse-1.0: o modelo misterioso que liderou todos os rankings de vídeo com IA

Um modelo chamado HappyHorse-1.0 surgiu no Artificial Analysis sem atribuição, subiu ao primeiro lugar em text-to-video e image-to-video, e revelou-se ser da Alibaba. Eis o que sabemos sobre a arquitetura, a equipa e o que isto significa para o mercado de vídeo com IA.

Alibaba HappyHorse-1.0: o modelo misterioso que liderou todos os rankings de vídeo com IA

Pronto para criar os seus próprios vídeos com IA?

Junte-se a milhares de criadores que utilizam Bonega.ai

A 7 de abril de 2026, um modelo que ninguém conhecia apareceu no Video Arena do Artificial Analysis. Em três dias, ocupava o primeiro lugar em text-to-video e image-to-video. Sem marca, sem comunicado de imprensa, sem nome de empresa. Depois, a Alibaba confirmou a autoria. Esta é a história do HappyHorse-1.0, o azarão que acabou de reorganizar os rankings de vídeo com IA.

A revelação

O Artificial Analysis gere um Video Arena onde os utilizadores submetem um prompt, dois modelos anónimos geram resultados e os utilizadores escolhem o que preferem. Os votos alimentam um sistema de classificação Elo (a mesma matemática utilizada nos rankings de xadrez). Os modelos não conseguem manipular o sistema porque os avaliadores nunca sabem qual modelo produziu cada resultado.

O HappyHorse-1.0 entrou nesta arena a 7 de abril com um perfil vazio. Sem logótipo, sem atribuição. A 10 de abril, ocupava a primeira posição em duas das quatro categorias do ranking, e a Alibaba confirmou a propriedade através de uma conta recém-criada no X e de uma declaração à CNBC.

💡
As ações da Alibaba cotadas em Hong Kong subiram 2,12% no dia do anúncio, e já tinham subido 6,75% no início da semana enquanto a especulação em torno do modelo misterioso se intensificava.

Os números

Os scores Elo do HappyHorse falam por si:

1333
Elo T2V (sem áudio)
1392
Elo I2V (sem áudio)
1205
Elo T2V (com áudio)

Para contextualizar, o anterior número 1 em text-to-video era o Seedance 2.0 da ByteDance com um Elo de 1273. O HappyHorse supera-o por 60 pontos, uma diferença que normalmente leva meses a fechar. Em image-to-video, o HappyHorse registou 1392 contra 1355 do Seedance 2.0.

As categorias com áudio contam uma história diferente. O HappyHorse fica em segundo lugar atrás do Seedance 2.0 (Elo 1219 contra 1205), o que sugere que o pipeline de áudio ainda precisa de trabalho em relação à qualidade do vídeo.

CategoriaHappyHorseAnterior #1Diferença
Text-to-Video (sem áudio)13331273 (Seedance 2.0)+60
Image-to-Video (sem áudio)13921355 (Seedance 2.0)+37
Text-to-Video (com áudio)12051219 (Seedance 2.0)-14

Arquitetura: um único Transformer, tudo de uma vez

A maioria dos sistemas de vídeo com IA encadeia componentes separados: um codificador de texto, um gerador de vídeo e um modelo de áudio adicionado depois. O HappyHorse adota uma abordagem diferente.

O modelo utiliza um Transformer Self-Attention de fluxo único com 40 camadas, sem módulos Cross-Attention. Os tokens de texto, vídeo e áudio passam todos pelo mesmo stack de transformadores em simultâneo. Este design unificado elimina parâmetros redundantes e reduz a complexidade de inferência.

Arquitetura unificada
Texto, vídeo e áudio processados numa única passagem. Sem pipeline de áudio separado. Menos peças móveis, menor latência.
Áudio ainda atrás
Apesar do design unificado, a qualidade do áudio fica em segundo lugar, atrás do pipeline especializado do Seedance 2.0.

O pipeline de inferência é invulgarmente leve: apenas 8 passos de denoising sem Classifier-Free Guidance (CFG). Para comparação, muitos modelos concorrentes utilizam entre 25 e 50 passos com CFG ativado. Isto sugere uma destilação agressiva durante o treino, sacrificando capacidade bruta em favor de velocidade.

A equipa por detrás

O HappyHorse vem do Future Life Lab, parte do Taotian Group da Alibaba (a divisão de comércio eletrónico). O líder é Zhang Di, ex-VP da Kuaishou e responsável técnico do Kling AI.

Este detalhe é relevante. Zhang Di construiu a cultura de engenharia por detrás do Kling, um dos modelos de vídeo com IA mais fortes de 2025. Conhece os desafios de infraestrutura, os pipelines de treino e as lacunas de avaliação. Trazer essa experiência para os recursos computacionais da Alibaba é uma equação completamente diferente de gerir uma startup independente.

💡
O HappyHorse suporta nativamente sincronização labial em seis línguas: chinês, inglês, japonês, coreano, alemão e francês. Esta capacidade multilingue sugere um modelo treinado com dados diversificados e cuidadosamente selecionados.

O que isto significa para o mercado

O mercado de vídeo com IA em abril de 2026 está invulgarmente volátil:

Março 2026

Encerramento do Sora anunciado

A OpenAI confirmou que o Sora será descontinuado a 26 de abril. Os custos computacionais e a pressão competitiva revelaram-se insustentáveis.

Fevereiro 2026

Seedance 2.0 pausado

A ByteDance foi obrigada a suspender a distribuição após disputas de direitos de autor com estúdios de Hollywood.

7 de abril de 2026

HappyHorse aparece

Um modelo anónimo entra no Video Arena do Artificial Analysis.

10 de abril de 2026

Alibaba confirma a autoria

As ações disparam com a revelação da identidade.

Com o Sora a encerrar e o Seedance a enfrentar problemas legais, o HappyHorse chega num momento em que o mercado procura um novo líder. O Runway Gen-4.5 continua forte em workflows de produção, e o Google Veo 3.1 domina a integração empresarial. Mas em termos de qualidade de geração pura, medida por preferência humana em avaliação cega, o HappyHorse ocupa agora o primeiro lugar.

Open source: em breve (talvez)

O repositório GitHub e o hub de modelos Hugging Face mostram ambos "Coming Soon" à data de 11 de abril. A equipa prometeu a publicação open source dos pesos completos de 15 mil milhões de parâmetros com licença comercial. Se isso acontecer, o HappyHorse será o maior modelo de vídeo open source disponível, significativamente maior que os 2 mil milhões de parâmetros do LTX-Video.

Mas "em breve" não é "publicado". Até que os pesos sejam descarregáveis e verificados de forma independente, os resultados do benchmark carregam um asterisco. A comunidade de vídeo com IA aprendeu a esperar por resultados reprodutíveis antes de declarar vencedores.

O que acompanhar

Três fatores determinarão se o HappyHorse mantém a sua vantagem:

  • Publicação open source dos pesos e reprodução independente dos resultados do benchmark
  • Melhorias na qualidade do áudio para igualar ou superar o Seedance 2.0 nas categorias com áudio
  • Disponibilidade da API e preços, porque dominar benchmarks não serve de nada se os criadores não conseguirem aceder ao modelo

O espaço de geração de vídeo com IA move-se depressa. Em janeiro, o Runway Gen-4.5 parecia inalcançável. Em fevereiro, o Seedance 2.0 tomou a coroa. Agora é o HappyHorse que a detém. A questão não é se algo o vai superar eventualmente, mas quando e de onde.

Para criadores e programadores que constroem pipelines de vídeo hoje, a conclusão é prática: nenhum modelo se mantém no topo por muito tempo. A melhor estratégia é construir workflows que possam trocar de modelo à medida que os rankings mudam, em vez de apostar tudo num único nome.

💡
A Alibaba lançou também recentemente o Wan 2.7 com Thinking Mode, um modelo separado da sua divisão Tongyi Lab. Dois modelos de vídeo importantes de equipas diferentes da Alibaba na mesma semana sinalizam uma aposta de toda a empresa no vídeo com IA.
Damien
DamienAI DeveloperAI Author

Desenvolvedor de IA de Lyon que adora transformar conceitos complexos de ML em receitas simples. Quando não está a depurar modelos, encontra-o a pedalar pelo vale do Ródano.

View profile →

Gostou do que leu?

Transforme as suas ideias em vídeos de IA de duração ilimitada em poucos minutos.

Artigos relacionados

Continue a explorar com estes artigos relacionados

Gostou deste artigo?

Descubra mais informações e mantenha-se a par dos nossos conteúdos mais recentes.