Alibaba HappyHorse-1.0: den mystiska modellen som toppade alla AI-videobenchmarks
En modell kallad HappyHorse-1.0 dök upp på Artificial Analysis utan tillskrivning, klättrade till förstaplats i både text-to-video och image-to-video, och visade sig tillhöra Alibaba. Här är vad vi vet om arkitekturen, teamet och vad det innebär för AI-videomarknaden.

Avslöjandet
Artificial Analysis driver en Video Arena där användare skickar in en prompt, två anonyma modeller genererar resultat, och användarna väljer det de föredrar. Röster matas in i ett Elo-ratingsystem (samma matematik som används i schackrankingar). Modeller kan inte fuska med systemet eftersom utvärderarna aldrig vet vilken modell som producerade vilken output.
HappyHorse-1.0 gick in i denna arena den 7 april med en tom profil. Ingen logotyp, ingen företagstillskrivning. Den 10 april satt den på förstaplatsen i två av fyra rankingkategorier, och Alibaba bekräftade ägandet via ett nyskapat X-konto och ett uttalande till CNBC.
Siffrorna
HappyHorses Elo-poäng talar sitt tydliga språk:
Som jämförelse: den tidigare ettan i text-to-video var ByteDances Seedance 2.0 med Elo 1273. HappyHorse slog den med 60 poäng, ett gap som normalt tar månader att stänga. I image-to-video fick HappyHorse 1392 mot Seedance 2.0:s 1355.
Kategorierna med ljud berättar en annan historia. HappyHorse ligger på andraplats efter Seedance 2.0 (Elo 1219 mot 1205), vilket tyder på att ljudpipelinen fortfarande behöver arbete jämfört med videokvaliteten.
| Kategori | HappyHorse | Tidigare #1 | Skillnad |
|---|---|---|---|
| Text-to-Video (tyst) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (tyst) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (ljud) | 1205 | 1219 (Seedance 2.0) | -14 |
Arkitektur: en Transformer, allt på en gång
De flesta AI-videosystem kedjar ihop separata komponenter: en textencoder, en videogenerator och en ljudmodell som skruvas fast i efterhand. HappyHorse tar ett annat grepp.
Modellen använder en 40-lagers single-stream Self-Attention Transformer utan Cross-Attention-moduler. Text-, video- och ljudtokens flödar alla genom samma Transformer-stack samtidigt. Denna enhetliga design eliminerar överflödiga parametrar och minskar inferenskomplexiteten.
Inferenspipelinen är ovanligt slimmad: bara 8 denoising-steg utan Classifier-Free Guidance (CFG). Som jämförelse använder många konkurrerande modeller 25-50 steg med CFG aktiverat. Det tyder på aggressiv distillation under träning, där rå kapacitet byts mot hastighet.
Teamet bakom
HappyHorse kommer från Future Life Lab under Alibabas Taotian Group (e-handelsgrenen). Ledaren är Zhang Di, tidigare VP på Kuaishou och teknisk chef för Kling AI.
Den detaljen är viktig. Zhang Di byggde ingenjörskulturen bakom Kling, en av de starkaste AI-videomodellerna 2025. Han känner till infrastrukturutmaningarna, träningspipelinerna och utvärderingsluckorna. Att ta med den erfarenheten till Alibabas beräkningsresurser är en helt annan ekvation än att driva en fristående startup.
Varför detta är viktigt för marknaden
AI-videomarknaden i april 2026 är ovanligt instabil:
Sora-nedstängning meddelad
OpenAI bekräftade att Sora stängs ned den 26 april. Beräkningskostnader och konkurrenstryck visade sig ohållbara.
Seedance 2.0 pausad
ByteDance tvingades stoppa utrullningen efter upphovsrättstvister med Hollywood-studior.
HappyHorse dyker upp
En anonym modell går in i Artificial Analysis Video Arena.
Alibaba bekräftar ägandet
Aktien hoppar upp när identiteten avslöjas.
Med Sora på väg ner och Seedance med juridiska problem anländer HappyHorse i ett ögonblick då marknaden letar efter en ny ledare. Runway Gen-4.5 står fortfarande starkt i produktionsarbetsflöden, och Google Veo 3.1 dominerar inom enterprise-integration. Men för ren generationskvalitet, mätt genom blind mänsklig preferens, sitter HappyHorse nu högst.
Open source: kommer snart (kanske)
GitHub-arkivet och Hugging Face model hub visar båda "Coming Soon" per den 11 april. Teamet har lovat en open source-release av de fullständiga 15 miljarder parametrarna med kommersiell licens. Om det sker skulle HappyHorse vara den största open source-videomodellen tillgänglig, betydligt större än LTX-Videos 2 miljarder parametrar.
Men "kommer snart" är inte "släppt". Tills vikterna kan laddas ner och verifieras oberoende har benchmarkresultaten en asterisk. AI-videocommunityn har lärt sig att vänta på reproducerbara resultat innan man utser vinnare.
Vad man bör följa
Tre saker avgör om HappyHorse behåller sitt försprång:
- ✓Open source-release av vikter och oberoende reproduktion av benchmarkresultat
- ✓Förbättringar i ljudkvalitet för att matcha eller slå Seedance 2.0 i ljudkategorierna
- ✓API-tillgänglighet och prissättning, eftersom benchmarkdominans inte spelar någon roll om skapare inte kan komma åt modellen
AI-videogenerering rör sig snabbt. I januari verkade Runway Gen-4.5 oantastbar. I februari tog Seedance 2.0 kronan. Nu håller HappyHorse den. Frågan är inte om något till slut slår den, utan när och varifrån.
För skapare och utvecklare som bygger videopipelines idag är slutsatsen praktisk: ingen enskild modell stannar på toppen länge. Den bästa strategin är att bygga arbetsflöden som kan byta modeller när rankingen skiftar, istället för att satsa allt på ett namn.

AI-utvecklare från Lyon som älskar att omvandla komplexa ML-koncept till enkla recept. När han inte felsöker modeller hittar du honom cyklande genom Rhônedalen.
View profile →Relaterade artiklar
Fortsätt utforska med dessa relaterade inlägg

Alibaba Wan 2.7: hur Thinking Mode förändrar AI-videogenerering
Alibaba har precis släppt Wan 2.7 med ett nytt Thinking Mode som planerar kompositioner innan video genereras. Vi går igenom hur det fungerar och vad det innebär för skapare.

AI-video efter Sora: 4 marknadsnivåer att känna till 2026
Sora stängs ner den 26 april. AI-videomarknaden har konsoliderats till fyra nivåer. En praktisk guide för att välja rätt Sora-alternativ för dina behov.

Google Veo 3.1 blir gratis: 10 AI-videor per månad för alla Google-konton
Google har öppnat Veo 3.1 för alla personliga konton med 10 gratis videogenereringar per månad. Här är vad du får, vilka begränsningarna är och varför det spelar roll för AI-videoskapare.