Meta PixelHopp til hovedinnhold
DamienDamien· KI-forfatter, gjennomgått av mennesker
5 min read
946 ord

Alibaba HappyHorse-1.0: den mystiske modellen som toppet alle AI-videobenchmarks

En modell kalt HappyHorse-1.0 dukket opp på Artificial Analysis uten tilskrivning, klatret til førsteplass i både text-to-video og image-to-video, og viste seg å tilhøre Alibaba. Her er det vi vet om arkitekturen, teamet og hva det betyr for AI-videomarkedet.

Alibaba HappyHorse-1.0: den mystiske modellen som toppet alle AI-videobenchmarks

Klar til å lage dine egne KI-videoer?

Bli med tusenvis av skapere som bruker Bonega.ai

Den 7. april 2026 dukket en modell ingen hadde hørt om opp i Artificial Analysis Video Arena. I løpet av tre dager lå den på førsteplass i både text-to-video og image-to-video. Ingen branding, ingen pressemelding, intet firmanavn. Så bekreftet Alibaba at den var deres. Dette er historien om HappyHorse-1.0, den dark horse som nettopp har rystet AI-videorankingene.

Avsløringen

Artificial Analysis driver en Video Arena der brukere sender inn en prompt, to anonyme modeller genererer resultater, og brukerne velger den de foretrekker. Stemmer mates inn i et Elo-ratingsystem (den samme matematikken som brukes i sjakk-rankinger). Modeller kan ikke jukse med systemet fordi evaluatorene aldri vet hvilken modell som produserte hvilket resultat.

HappyHorse-1.0 gikk inn i denne arenaen 7. april med en tom profil. Ingen logo, ingen firmatilskrivning. Innen 10. april satt den på førsteplassen i to av fire rankingkategorier, og Alibaba bekreftet eierskapet via en nyopprettet X-konto og en uttalelse til CNBC.

💡
Alibabas Hongkong-noterte aksjer steg 2,12 % dagen for kunngjøringen og hadde allerede steget 6,75 % tidligere i uken mens spekulasjonene rundt den mystiske modellen bygde seg opp.

Tallene

HappyHorses Elo-scorer snakker for seg selv:

1333
T2V Elo (uten lyd)
1392
I2V Elo (uten lyd)
1205
T2V Elo (med lyd)

For å sette det i perspektiv: den forrige nummer 1 i text-to-video var ByteDances Seedance 2.0 med Elo 1273. HappyHorse slo den med 60 poeng, et gap som vanligvis tar måneder å lukke. I image-to-video scoret HappyHorse 1392 mot Seedance 2.0s 1355.

Kategoriene med lyd forteller en annen historie. HappyHorse ligger på andreplass bak Seedance 2.0 (Elo 1219 mot 1205), noe som tyder på at lydpipelinen fortsatt trenger arbeid sammenlignet med videokvaliteten.

KategoriHappyHorseForrige #1Forskjell
Text-to-Video (stille)13331273 (Seedance 2.0)+60
Image-to-Video (stille)13921355 (Seedance 2.0)+37
Text-to-Video (lyd)12051219 (Seedance 2.0)-14

Arkitektur: én Transformer, alt på en gang

De fleste AI-videosystemer lenker sammen separate komponenter: en tekstencoder, en videogenerator og en lydmodell som boltes på i etterkant. HappyHorse tar en annen tilnærming.

Modellen bruker en 40-lags single-stream Self-Attention Transformer uten Cross-Attention-moduler. Tekst-, video- og lydtokens flyter alle gjennom den samme Transformer-stacken samtidig. Dette enhetlige designet eliminerer overflødige parametere og reduserer inferenskompleksiteten.

Enhetlig arkitektur
Tekst, video og lyd behandles i ett enkelt gjennomløp. Ingen separat lydpipeline. Færre bevegelige deler, lavere ventetid.
Lyd henger fortsatt etter
Til tross for det enhetlige designet rangerer lydkvaliteten som nummer 2 bak Seedance 2.0s spesialiserte lydpipeline.

Inferenspipelinen er uvanlig slank: bare 8 denoising-trinn uten Classifier-Free Guidance (CFG). Til sammenligning bruker mange konkurrerende modeller 25-50 trinn med CFG aktivert. Dette tyder på aggressiv distillasjon under trening, der rå kapasitet byttes mot hastighet.

Teamet bak

HappyHorse kommer fra Future Life Lab under Alibabas Taotian Group (e-handelsgrenen). Lederen er Zhang Di, tidligere VP i Kuaishou og teknisk leder for Kling AI.

Den detaljen er viktig. Zhang Di bygde ingeniørkulturen bak Kling, en av de sterkeste AI-videomodellene i 2025. Han kjenner infrastrukturutfordringene, treningspipelinene og evalueringshullene. Å bringe den erfaringen til Alibabas beregningsressurser er en helt annen ligning enn å drive en frittstående startup.

💡
HappyHorse støtter native lip sync på seks språk: kinesisk, engelsk, japansk, koreansk, tysk og fransk. Denne flerspråklige evnen antyder en modell trent på mangfoldig, nøye kuratert data.

Hvorfor dette er viktig for markedet

AI-videomarkedet i april 2026 er uvanlig ustabilt:

Mars 2026

Sora-nedleggelse annonsert

OpenAI bekreftet at Sora legges ned 26. april. Beregningskostnader og konkurransepress viste seg uholdbare.

Februar 2026

Seedance 2.0 satt på pause

ByteDance tvunget til å stoppe utrullingen etter opphavsrettstvister med Hollywood-studioer.

7. april 2026

HappyHorse dukker opp

En anonym modell trer inn i Artificial Analysis Video Arena.

10. april 2026

Alibaba bekrefter eierskapet

Aksjen hopper opp når identiteten avsløres.

Med Sora på vei ned og Seedance med juridiske problemer ankommer HappyHorse i et øyeblikk da markedet leter etter en ny leder. Runway Gen-4.5 står fortsatt sterkt i produksjonsarbeidsflyter, og Google Veo 3.1 dominerer innen enterprise-integrasjon. Men for ren genereringskvalitet, målt ved blind menneskelig preferanse, sitter HappyHorse nå på toppen.

Open source: kommer snart (kanskje)

GitHub-repositoryet og Hugging Face model hub viser begge "Coming Soon" per 11. april. Teamet har lovet open source-utgivelse av de fullstendige 15 milliarder parameterne med kommersiell lisens. Hvis det skjer, ville HappyHorse være den største open source-videomodellen tilgjengelig, betydelig større enn LTX-Videos 2 milliarder parametere.

Men "kommer snart" er ikke "utgitt". Inntil vektene kan lastes ned og verifiseres uavhengig, har benchmarkresultatene en stjerne. AI-videomiljøet har lært å vente på reproduserbare resultater før det kåres vinnere.

Hva man bør følge med på

Tre ting avgjør om HappyHorse beholder forspranget:

  • Open source-utgivelse av vekter og uavhengig reproduksjon av benchmarkresultater
  • Forbedringer i lydkvalitet for å matche eller slå Seedance 2.0 i lydkategoriene
  • API-tilgjengelighet og prissetting, ettersom benchmarkdominans ikke betyr noe hvis skapere ikke kan få tilgang til modellen

AI-videogenerering beveger seg raskt. I januar virket Runway Gen-4.5 urørlig. I februar tok Seedance 2.0 kronen. Nå holder HappyHorse den. Spørsmålet er ikke om noe til slutt slår den, men når og hvorfra.

For skapere og utviklere som bygger videopipelines i dag, er budskapet praktisk: ingen enkelt modell holder seg på toppen lenge. Den beste strategien er å bygge arbeidsflyter som kan bytte modeller etter hvert som rankingen endrer seg, i stedet for å satse alt på ett navn.

💡
Alibaba ga også nylig ut Wan 2.7 med Thinking Mode, en separat modell fra deres Tongyi Lab-divisjon. To store videomodeller fra forskjellige Alibaba-team i samme uke signaliserer en bedriftsomfattende satsing på AI-video.
Damien
DamienAI DeveloperAI Author

KI-utvikler fra Lyon som elsker å gjøre komplekse ML-konsepter om til enkle oppskrifter. Når han ikke feilsøker modeller, finner du ham syklende gjennom Rhône-dalen.

View profile →

Likte du det du leste?

Gjør ideene dine om til KI-videoer med ubegrenset lengde på få minutter.

Relaterte artikler

Fortsett å utforske med disse relaterte innleggene

Likte du denne artikkelen?

Oppdag flere innsikter og hold deg oppdatert med vårt nyeste innhold.