Meta PixelHoppa till huvudinnehåll
DamienDamien· AI-författare, granskat av människor
5 min read
926 ord

Alibaba HappyHorse-1.0: den mystiska modellen som toppade alla AI-videobenchmarks

En modell kallad HappyHorse-1.0 dök upp på Artificial Analysis utan tillskrivning, klättrade till förstaplats i både text-to-video och image-to-video, och visade sig tillhöra Alibaba. Här är vad vi vet om arkitekturen, teamet och vad det innebär för AI-videomarknaden.

Alibaba HappyHorse-1.0: den mystiska modellen som toppade alla AI-videobenchmarks

Redo att skapa dina egna AI-videor?

Gå med i tusentals kreatörer som använder Bonega.ai

Den 7 april 2026 dök en modell som ingen hört talas om upp i Artificial Analysis Video Arena. Inom tre dagar låg den på förstaplats i både text-to-video och image-to-video. Ingen branding, inget pressmeddelande, inget företagsnamn. Sedan bekräftade Alibaba att det var deras. Det här är historien om HappyHorse-1.0, den dark horse som precis skakat om AI-videorankingarna.

Avslöjandet

Artificial Analysis driver en Video Arena där användare skickar in en prompt, två anonyma modeller genererar resultat, och användarna väljer det de föredrar. Röster matas in i ett Elo-ratingsystem (samma matematik som används i schackrankingar). Modeller kan inte fuska med systemet eftersom utvärderarna aldrig vet vilken modell som producerade vilken output.

HappyHorse-1.0 gick in i denna arena den 7 april med en tom profil. Ingen logotyp, ingen företagstillskrivning. Den 10 april satt den på förstaplatsen i två av fyra rankingkategorier, och Alibaba bekräftade ägandet via ett nyskapat X-konto och ett uttalande till CNBC.

💡
Alibabas Hongkong-noterade aktier steg 2,12 % dagen för tillkännagivandet och hade redan stigit 6,75 % tidigare under veckan medan spekulationerna kring den mystiska modellen växte.

Siffrorna

HappyHorses Elo-poäng talar sitt tydliga språk:

1333
T2V Elo (utan ljud)
1392
I2V Elo (utan ljud)
1205
T2V Elo (med ljud)

Som jämförelse: den tidigare ettan i text-to-video var ByteDances Seedance 2.0 med Elo 1273. HappyHorse slog den med 60 poäng, ett gap som normalt tar månader att stänga. I image-to-video fick HappyHorse 1392 mot Seedance 2.0:s 1355.

Kategorierna med ljud berättar en annan historia. HappyHorse ligger på andraplats efter Seedance 2.0 (Elo 1219 mot 1205), vilket tyder på att ljudpipelinen fortfarande behöver arbete jämfört med videokvaliteten.

KategoriHappyHorseTidigare #1Skillnad
Text-to-Video (tyst)13331273 (Seedance 2.0)+60
Image-to-Video (tyst)13921355 (Seedance 2.0)+37
Text-to-Video (ljud)12051219 (Seedance 2.0)-14

Arkitektur: en Transformer, allt på en gång

De flesta AI-videosystem kedjar ihop separata komponenter: en textencoder, en videogenerator och en ljudmodell som skruvas fast i efterhand. HappyHorse tar ett annat grepp.

Modellen använder en 40-lagers single-stream Self-Attention Transformer utan Cross-Attention-moduler. Text-, video- och ljudtokens flödar alla genom samma Transformer-stack samtidigt. Denna enhetliga design eliminerar överflödiga parametrar och minskar inferenskomplexiteten.

Enhetlig arkitektur
Text, video och ljud bearbetas i en enda passage. Ingen separat ljudpipeline. Färre rörliga delar, lägre latens.
Ljud ligger fortfarande efter
Trots den enhetliga designen rankas ljudkvaliteten som tvåa efter Seedance 2.0:s specialiserade ljudpipeline.

Inferenspipelinen är ovanligt slimmad: bara 8 denoising-steg utan Classifier-Free Guidance (CFG). Som jämförelse använder många konkurrerande modeller 25-50 steg med CFG aktiverat. Det tyder på aggressiv distillation under träning, där rå kapacitet byts mot hastighet.

Teamet bakom

HappyHorse kommer från Future Life Lab under Alibabas Taotian Group (e-handelsgrenen). Ledaren är Zhang Di, tidigare VP på Kuaishou och teknisk chef för Kling AI.

Den detaljen är viktig. Zhang Di byggde ingenjörskulturen bakom Kling, en av de starkaste AI-videomodellerna 2025. Han känner till infrastrukturutmaningarna, träningspipelinerna och utvärderingsluckorna. Att ta med den erfarenheten till Alibabas beräkningsresurser är en helt annan ekvation än att driva en fristående startup.

💡
HappyHorse stöder native lip sync på sex språk: kinesiska, engelska, japanska, koreanska, tyska och franska. Denna flerspråkiga förmåga antyder en modell tränad på mångsidig, noggrant kurerad data.

Varför detta är viktigt för marknaden

AI-videomarknaden i april 2026 är ovanligt instabil:

Mars 2026

Sora-nedstängning meddelad

OpenAI bekräftade att Sora stängs ned den 26 april. Beräkningskostnader och konkurrenstryck visade sig ohållbara.

Februari 2026

Seedance 2.0 pausad

ByteDance tvingades stoppa utrullningen efter upphovsrättstvister med Hollywood-studior.

7 april 2026

HappyHorse dyker upp

En anonym modell går in i Artificial Analysis Video Arena.

10 april 2026

Alibaba bekräftar ägandet

Aktien hoppar upp när identiteten avslöjas.

Med Sora på väg ner och Seedance med juridiska problem anländer HappyHorse i ett ögonblick då marknaden letar efter en ny ledare. Runway Gen-4.5 står fortfarande starkt i produktionsarbetsflöden, och Google Veo 3.1 dominerar inom enterprise-integration. Men för ren generationskvalitet, mätt genom blind mänsklig preferens, sitter HappyHorse nu högst.

Open source: kommer snart (kanske)

GitHub-arkivet och Hugging Face model hub visar båda "Coming Soon" per den 11 april. Teamet har lovat en open source-release av de fullständiga 15 miljarder parametrarna med kommersiell licens. Om det sker skulle HappyHorse vara den största open source-videomodellen tillgänglig, betydligt större än LTX-Videos 2 miljarder parametrar.

Men "kommer snart" är inte "släppt". Tills vikterna kan laddas ner och verifieras oberoende har benchmarkresultaten en asterisk. AI-videocommunityn har lärt sig att vänta på reproducerbara resultat innan man utser vinnare.

Vad man bör följa

Tre saker avgör om HappyHorse behåller sitt försprång:

  • Open source-release av vikter och oberoende reproduktion av benchmarkresultat
  • Förbättringar i ljudkvalitet för att matcha eller slå Seedance 2.0 i ljudkategorierna
  • API-tillgänglighet och prissättning, eftersom benchmarkdominans inte spelar någon roll om skapare inte kan komma åt modellen

AI-videogenerering rör sig snabbt. I januari verkade Runway Gen-4.5 oantastbar. I februari tog Seedance 2.0 kronan. Nu håller HappyHorse den. Frågan är inte om något till slut slår den, utan när och varifrån.

För skapare och utvecklare som bygger videopipelines idag är slutsatsen praktisk: ingen enskild modell stannar på toppen länge. Den bästa strategin är att bygga arbetsflöden som kan byta modeller när rankingen skiftar, istället för att satsa allt på ett namn.

💡
Alibaba släppte nyligen också Wan 2.7 med Thinking Mode, en separat modell från deras Tongyi Lab-division. Två stora videomodeller från olika Alibaba-team under samma vecka signalerar en företagsövergripande satsning på AI-video.
Damien
DamienAI DeveloperAI Author

AI-utvecklare från Lyon som älskar att omvandla komplexa ML-koncept till enkla recept. När han inte felsöker modeller hittar du honom cyklande genom Rhônedalen.

View profile →

Gillar du det du läste?

Förvandla dina idéer till AI-videor med obegränsad längd på några minuter.

Relaterade artiklar

Fortsätt utforska med dessa relaterade inlägg

Tyckte du om den här artikeln?

Upptäck fler insikter och håll dig uppdaterad med vårt senaste innehåll.