Alibaba HappyHorse-1.0: il modello misterioso che ha scalato ogni classifica di video AI
Un modello chiamato HappyHorse-1.0 è apparso su Artificial Analysis senza attribuzione, ha raggiunto il primo posto sia nel text-to-video che nell'image-to-video, e si è poi rivelato essere di Alibaba. Ecco cosa sappiamo sull'architettura, il team e le implicazioni per il mercato dei video AI.

La rivelazione
Artificial Analysis gestisce una Video Arena dove gli utenti inviano un prompt, due modelli anonimi generano i risultati e gli utenti scelgono quello che preferiscono. I voti alimentano un sistema di rating Elo (la stessa matematica usata nelle classifiche degli scacchi). I modelli non possono manipolare il sistema perché i valutatori non sanno mai quale modello ha prodotto quale output.
HappyHorse-1.0 è entrato in questa arena il 7 aprile con un profilo vuoto. Nessun logo, nessuna attribuzione aziendale. Entro il 10 aprile occupava la prima posizione in due delle quattro categorie di classificazione, e Alibaba ha confermato la paternità attraverso un nuovo account X e una dichiarazione a CNBC.
I numeri
I punteggi Elo di HappyHorse parlano chiaro:
Per dare un contesto, il precedente numero uno nel text-to-video era Seedance 2.0 di ByteDance con un Elo di 1273. HappyHorse lo ha superato di 60 punti, un divario che normalmente richiede mesi per essere colmato. Nell'image-to-video, HappyHorse ha ottenuto 1392 contro i 1355 di Seedance 2.0.
Le categorie con audio raccontano una storia diversa. HappyHorse si posiziona al secondo posto dietro Seedance 2.0 (Elo 1219 contro 1205), il che suggerisce che la pipeline audio necessita ancora di lavoro rispetto alla qualità video.
| Categoria | HappyHorse | Precedente #1 | Divario |
|---|---|---|---|
| Text-to-Video (silenzioso) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (silenzioso) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (audio) | 1205 | 1219 (Seedance 2.0) | -14 |
Architettura: un solo Transformer, tutto in una volta
La maggior parte dei sistemi video AI concatena componenti separati: un encoder di testo, un generatore video e un modello audio aggiunto successivamente. HappyHorse adotta un approccio diverso.
Il modello utilizza un Self-Attention Transformer single-stream a 40 livelli senza moduli di Cross-Attention. I token di testo, video e audio fluiscono tutti attraverso lo stesso stack Transformer simultaneamente. Questo design unificato elimina i parametri ridondanti e riduce la complessità dell'inferenza.
La pipeline di inferenza è insolitamente snella: solo 8 step di denoising senza Classifier-Free Guidance (CFG). Per confronto, molti modelli concorrenti usano 25-50 step con CFG attivo. Questo suggerisce una distillazione aggressiva durante il training, sacrificando capacità grezza in favore della velocità.
Il team dietro il progetto
HappyHorse proviene dal Future Life Lab sotto il Taotian Group di Alibaba (la divisione e-commerce). Il responsabile è Zhang Di, ex vicepresidente di Kuaishou e responsabile tecnico di Kling AI.
Questo dettaglio è significativo. Zhang Di ha costruito la cultura ingegneristica dietro Kling, uno dei modelli video AI più forti del 2025. Conosce le sfide infrastrutturali, le pipeline di training e le lacune nella valutazione. Portare questa esperienza alle risorse computazionali di Alibaba è un'equazione completamente diversa rispetto alla gestione di una startup indipendente.
Perché è importante per il mercato
Il mercato dei video AI nell'aprile 2026 è particolarmente volatile:
Annunciata la chiusura di Sora
OpenAI ha confermato che Sora cesserà il servizio il 26 aprile. I costi computazionali e la pressione competitiva si sono rivelati insostenibili.
Seedance 2.0 in pausa
ByteDance costretta a interrompere il lancio a causa di dispute sul copyright con gli studi di Hollywood.
Appare HappyHorse
Un modello anonimo entra nella Video Arena di Artificial Analysis.
Alibaba conferma la paternità
Il titolo balza in avanti quando l'identità viene rivelata.
Con Sora in fase di chiusura e Seedance alle prese con problemi legali, HappyHorse arriva in un momento in cui il mercato cerca un nuovo capofila. Runway Gen-4.5 resta solido nei flussi di lavoro di produzione, e Google Veo 3.1 domina nello spazio dell'integrazione enterprise. Ma per la qualità di generazione pura, misurata dalla preferenza umana in cieco, HappyHorse ora siede in cima.
Open source: in arrivo (forse)
Il repository GitHub e l'hub modelli di Hugging Face mostrano entrambi "Coming Soon" alla data dell'11 aprile. Il team ha promesso il rilascio open-source dei pesi completi da 15 miliardi di parametri con licenza commerciale. Se ciò accadrà, HappyHorse sarà il più grande modello video open-source disponibile, significativamente più grande dei 2 miliardi di parametri di LTX-Video.
Ma "in arrivo" non significa "rilasciato". Finché i pesi non saranno scaricabili e verificati in modo indipendente, i risultati dei benchmark portano un asterisco. La comunità dei video AI ha imparato ad attendere risultati riproducibili prima di dichiarare vincitori.
Cosa tenere d'occhio
Tre fattori determineranno se HappyHorse manterrà il suo vantaggio:
- ✓Rilascio dei pesi open-source e riproduzione indipendente dei risultati dei benchmark
- ✓Miglioramenti nella qualità audio per eguagliare o superare Seedance 2.0 nelle categorie con audio
- ✓Disponibilità e prezzi delle API, perché dominare i benchmark non conta nulla se i creatori non possono accedere al modello
Lo spazio della generazione video AI si muove velocemente. A gennaio, Runway Gen-4.5 sembrava inarrivabile. A febbraio, Seedance 2.0 ha preso la corona. Ora la detiene HappyHorse. La domanda non è se qualcosa riuscirà a batterlo, ma quando e da dove arriverà.
Per i creatori e gli sviluppatori che costruiscono pipeline video oggi, la lezione è pratica: nessun singolo modello resta in cima a lungo. La strategia migliore è costruire flussi di lavoro capaci di sostituire i modelli man mano che la classifica cambia, invece di puntare tutto su un solo nome.

Sviluppatore IA di Lione che ama trasformare complessi concetti di ML in semplici ricette. Quando non esegue il debug dei modelli, lo trovi a pedalare nella valle del Rodano.
View profile →Ti è piaciuto ciò che hai letto?
Trasforma le tue idee in video IA di durata illimitata in pochi minuti.
Articoli correlati
Continua a esplorare con questi articoli correlati

Alibaba Wan 2.7: come il Thinking Mode cambia la generazione video con IA
Alibaba ha appena rilasciato Wan 2.7 con un innovativo Thinking Mode che pianifica le composizioni prima di generare il video. Vediamo come funziona e cosa significa per i creatori.

Video IA dopo Sora: 4 livelli di mercato da conoscere nel 2026
Sora chiude il 26 aprile. Il mercato dei video IA si è consolidato in quattro livelli. Una guida pratica per scegliere l'alternativa a Sora giusta per le tue esigenze.

Google Veo 3.1 diventa gratuito: 10 video AI al mese per ogni account Google
Google ha aperto Veo 3.1 a tutti gli account personali con 10 generazioni video gratuite al mese. Ecco cosa offre, quali sono i limiti e perché è importante per i creator di video AI.