Alibaba HappyHorse-1.0: den mystiske modellen som toppet alle AI-videobenchmarks
En modell kalt HappyHorse-1.0 dukket opp på Artificial Analysis uten tilskrivning, klatret til førsteplass i både text-to-video og image-to-video, og viste seg å tilhøre Alibaba. Her er det vi vet om arkitekturen, teamet og hva det betyr for AI-videomarkedet.

Avsløringen
Artificial Analysis driver en Video Arena der brukere sender inn en prompt, to anonyme modeller genererer resultater, og brukerne velger den de foretrekker. Stemmer mates inn i et Elo-ratingsystem (den samme matematikken som brukes i sjakk-rankinger). Modeller kan ikke jukse med systemet fordi evaluatorene aldri vet hvilken modell som produserte hvilket resultat.
HappyHorse-1.0 gikk inn i denne arenaen 7. april med en tom profil. Ingen logo, ingen firmatilskrivning. Innen 10. april satt den på førsteplassen i to av fire rankingkategorier, og Alibaba bekreftet eierskapet via en nyopprettet X-konto og en uttalelse til CNBC.
Tallene
HappyHorses Elo-scorer snakker for seg selv:
For å sette det i perspektiv: den forrige nummer 1 i text-to-video var ByteDances Seedance 2.0 med Elo 1273. HappyHorse slo den med 60 poeng, et gap som vanligvis tar måneder å lukke. I image-to-video scoret HappyHorse 1392 mot Seedance 2.0s 1355.
Kategoriene med lyd forteller en annen historie. HappyHorse ligger på andreplass bak Seedance 2.0 (Elo 1219 mot 1205), noe som tyder på at lydpipelinen fortsatt trenger arbeid sammenlignet med videokvaliteten.
| Kategori | HappyHorse | Forrige #1 | Forskjell |
|---|---|---|---|
| Text-to-Video (stille) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (stille) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (lyd) | 1205 | 1219 (Seedance 2.0) | -14 |
Arkitektur: én Transformer, alt på en gang
De fleste AI-videosystemer lenker sammen separate komponenter: en tekstencoder, en videogenerator og en lydmodell som boltes på i etterkant. HappyHorse tar en annen tilnærming.
Modellen bruker en 40-lags single-stream Self-Attention Transformer uten Cross-Attention-moduler. Tekst-, video- og lydtokens flyter alle gjennom den samme Transformer-stacken samtidig. Dette enhetlige designet eliminerer overflødige parametere og reduserer inferenskompleksiteten.
Inferenspipelinen er uvanlig slank: bare 8 denoising-trinn uten Classifier-Free Guidance (CFG). Til sammenligning bruker mange konkurrerende modeller 25-50 trinn med CFG aktivert. Dette tyder på aggressiv distillasjon under trening, der rå kapasitet byttes mot hastighet.
Teamet bak
HappyHorse kommer fra Future Life Lab under Alibabas Taotian Group (e-handelsgrenen). Lederen er Zhang Di, tidligere VP i Kuaishou og teknisk leder for Kling AI.
Den detaljen er viktig. Zhang Di bygde ingeniørkulturen bak Kling, en av de sterkeste AI-videomodellene i 2025. Han kjenner infrastrukturutfordringene, treningspipelinene og evalueringshullene. Å bringe den erfaringen til Alibabas beregningsressurser er en helt annen ligning enn å drive en frittstående startup.
Hvorfor dette er viktig for markedet
AI-videomarkedet i april 2026 er uvanlig ustabilt:
Sora-nedleggelse annonsert
OpenAI bekreftet at Sora legges ned 26. april. Beregningskostnader og konkurransepress viste seg uholdbare.
Seedance 2.0 satt på pause
ByteDance tvunget til å stoppe utrullingen etter opphavsrettstvister med Hollywood-studioer.
HappyHorse dukker opp
En anonym modell trer inn i Artificial Analysis Video Arena.
Alibaba bekrefter eierskapet
Aksjen hopper opp når identiteten avsløres.
Med Sora på vei ned og Seedance med juridiske problemer ankommer HappyHorse i et øyeblikk da markedet leter etter en ny leder. Runway Gen-4.5 står fortsatt sterkt i produksjonsarbeidsflyter, og Google Veo 3.1 dominerer innen enterprise-integrasjon. Men for ren genereringskvalitet, målt ved blind menneskelig preferanse, sitter HappyHorse nå på toppen.
Open source: kommer snart (kanskje)
GitHub-repositoryet og Hugging Face model hub viser begge "Coming Soon" per 11. april. Teamet har lovet open source-utgivelse av de fullstendige 15 milliarder parameterne med kommersiell lisens. Hvis det skjer, ville HappyHorse være den største open source-videomodellen tilgjengelig, betydelig større enn LTX-Videos 2 milliarder parametere.
Men "kommer snart" er ikke "utgitt". Inntil vektene kan lastes ned og verifiseres uavhengig, har benchmarkresultatene en stjerne. AI-videomiljøet har lært å vente på reproduserbare resultater før det kåres vinnere.
Hva man bør følge med på
Tre ting avgjør om HappyHorse beholder forspranget:
- ✓Open source-utgivelse av vekter og uavhengig reproduksjon av benchmarkresultater
- ✓Forbedringer i lydkvalitet for å matche eller slå Seedance 2.0 i lydkategoriene
- ✓API-tilgjengelighet og prissetting, ettersom benchmarkdominans ikke betyr noe hvis skapere ikke kan få tilgang til modellen
AI-videogenerering beveger seg raskt. I januar virket Runway Gen-4.5 urørlig. I februar tok Seedance 2.0 kronen. Nå holder HappyHorse den. Spørsmålet er ikke om noe til slutt slår den, men når og hvorfra.
For skapere og utviklere som bygger videopipelines i dag, er budskapet praktisk: ingen enkelt modell holder seg på toppen lenge. Den beste strategien er å bygge arbeidsflyter som kan bytte modeller etter hvert som rankingen endrer seg, i stedet for å satse alt på ett navn.

KI-utvikler fra Lyon som elsker å gjøre komplekse ML-konsepter om til enkle oppskrifter. Når han ikke feilsøker modeller, finner du ham syklende gjennom Rhône-dalen.
View profile →Relaterte artikler
Fortsett å utforske med disse relaterte innleggene

Alibaba Wan 2.7: hvordan Thinking Mode forandrer AI-videogenerering
Alibaba har nettopp sluppet Wan 2.7 med en ny Thinking Mode som planlegger komposisjoner før video genereres. Vi går gjennom hvordan det fungerer og hva det betyr for skapere.

AI-video etter Sora: 4 markedsnivåer å kjenne til i 2026
Sora stenger 26. april. AI-videomarkedet har konsolidert seg til fire nivåer. En praktisk guide for å velge riktig Sora-alternativ for dine behov.

Google Veo 3.1 blir gratis: 10 AI-videoer per måned for alle Google-kontoer
Google har åpnet Veo 3.1 for alle personlige kontoer med 10 gratis videogenereringer per måned. Her er hva du får, hva begrensningene er, og hvorfor det betyr noe for AI-videoskapere.