Meta PixelGa naar de hoofdinhoud
DamienDamien· AI-auteur, door mensen beoordeeld
5 min read
1001 woorden

Alibaba HappyHorse-1.0: het mysterieuze model dat elke AI-videobenchmark aanvoert

Een model genaamd HappyHorse-1.0 verscheen op Artificial Analysis zonder naamsvermelding, klom naar #1 in zowel text-to-video als image-to-video, en bleek van Alibaba te zijn. Dit is wat we weten over de architectuur, het team en wat het betekent voor de AI-videomarkt.

Alibaba HappyHorse-1.0: het mysterieuze model dat elke AI-videobenchmark aanvoert

Klaar om je eigen AI-video’s te maken?

Sluit je aan bij duizenden makers die Bonega.ai gebruiken

Op 7 april 2026 verscheen een model waar niemand van gehoord had in de Video Arena van Artificial Analysis. Binnen drie dagen stond het op #1 in zowel text-to-video als image-to-video generatie. Geen branding, geen persbericht, geen bedrijfsnaam. Toen bevestigde Alibaba dat het van hen was. Dit is het verhaal van HappyHorse-1.0, het dark horse dat zojuist de AI-videoranglijsten door elkaar heeft geschud.

De onthulling

Artificial Analysis beheert een Video Arena waar gebruikers een prompt insturen, twee anonieme modellen output genereren, en gebruikers hun voorkeur aangeven. Stemmen worden verwerkt in een Elo-ratingsysteem (dezelfde wiskunde als bij schaakranglijsten). Modellen kunnen het systeem niet manipuleren omdat beoordelaars nooit weten welk model welke output heeft geproduceerd.

HappyHorse-1.0 betrad deze arena op 7 april met een leeg profiel. Geen logo, geen bedrijfsattributie. Op 10 april bezette het de toppositie in twee van de vier ranglijstcategorieën, en Alibaba bevestigde het eigenaarschap via een nieuw aangemaakt X-account en een verklaring aan CNBC.

💡
Alibaba's aandelen genoteerd in Hongkong stegen 2,12% op de dag van de aankondiging en waren eerder die week al 6,75% gestegen terwijl de speculatie rond het mysterieuze model toenam.

De cijfers

De Elo-scores van HappyHorse spreken voor zich:

1333
T2V Elo (zonder audio)
1392
I2V Elo (zonder audio)
1205
T2V Elo (met audio)

Ter vergelijking: de vorige nummer één in text-to-video was ByteDance's Seedance 2.0 met een Elo van 1273. HappyHorse versloeg het met 60 punten, een kloof die doorgaans maanden kost om te dichten. Bij image-to-video scoorde HappyHorse 1392 tegenover 1355 van Seedance 2.0.

De categorieën inclusief audio vertellen een ander verhaal. HappyHorse staat op #2 achter Seedance 2.0 (Elo 1219 vs. 1205), wat suggereert dat de audiopijplijn nog werk nodig heeft in vergelijking met de videokwaliteit.

CategorieHappyHorseVorige #1Verschil
Text-to-Video (stil)13331273 (Seedance 2.0)+60
Image-to-Video (stil)13921355 (Seedance 2.0)+37
Text-to-Video (audio)12051219 (Seedance 2.0)-14

Architectuur: één Transformer, alles tegelijk

De meeste AI-videosystemen koppelen aparte componenten aan elkaar: een tekstencoder, een videogenerator en een audiomodel dat er achteraf aan wordt vastgemaakt. HappyHorse kiest een andere aanpak.

Het model gebruikt een 40-laags single-stream Self-Attention Transformer zonder Cross-Attention modules. Tekst-, video- en audiotokens stromen allemaal tegelijkertijd door dezelfde Transformer-stack. Dit uniforme ontwerp elimineert overbodige parameters en vermindert de complexiteit van de inferentie.

Uniforme architectuur
Tekst, video en audio verwerkt in één keer. Geen aparte audiopijplijn. Minder bewegende onderdelen, lagere latentie.
Audio loopt nog achter
Ondanks het uniforme ontwerp scoort de audiokwaliteit op #2 achter de gespecialiseerde audiopijplijn van Seedance 2.0.

De inferentiepijplijn is ongewoon compact: slechts 8 denoising-stappen zonder Classifier-Free Guidance (CFG). Ter vergelijking: veel concurrerende modellen gebruiken 25-50 stappen met CFG ingeschakeld. Dit wijst op agressieve distillatie tijdens training, waarbij ruwe capaciteit wordt ingeruild voor snelheid.

Het team erachter

HappyHorse komt uit het Future Life Lab onder Alibaba's Taotian Group (de e-commerce-tak). De leider is Zhang Di, voormalig VP van Kuaishou en technisch hoofd van Kling AI.

Dat detail is belangrijk. Zhang Di bouwde de engineeringcultuur achter Kling, een van de sterkste AI-videomodellen van 2025. Hij kent de infrastructuuruitdagingen, de trainingspijplijnen en de evaluatielacunes. Die ervaring meebrengen naar Alibaba's computebronnen is een heel andere vergelijking dan het runnen van een zelfstandige startup.

💡
HappyHorse ondersteunt standaard lip sync in zes talen: Chinees, Engels, Japans, Koreaans, Duits en Frans. Deze meertalige capaciteit wijst op een model dat is getraind op diverse, zorgvuldig samengestelde data.

Waarom dit ertoe doet

De AI-videomarkt in april 2026 is ongewoon volatiel:

Maart 2026

Sluiting Sora aangekondigd

OpenAI bevestigde dat Sora stopt op 26 april. De computekosten en concurrentiedruk bleken onhoudbaar.

Februari 2026

Seedance 2.0 gepauzeerd

ByteDance gedwongen de uitrol te stoppen vanwege copyrightgeschillen met Hollywood-studio's.

7 april 2026

HappyHorse verschijnt

Een anoniem model betreedt de Video Arena van Artificial Analysis.

10 april 2026

Alibaba bevestigt eigenaarschap

Het aandeel springt omhoog als de identiteit wordt onthuld.

Met het einde van Sora in zicht en Seedance met juridische problemen, arriveert HappyHorse op het moment dat de markt op zoek is naar een nieuwe koploper. Runway Gen-4.5 staat nog steeds sterk in productie-workflows, en Google Veo 3.1 domineert op het gebied van enterprise-integratie. Maar voor pure generatiekwaliteit, gemeten door blinde menselijke voorkeur, staat HappyHorse nu bovenaan.

Open source: binnenkort (misschien)

Het GitHub-repository en de Hugging Face model hub tonen beide "Coming Soon" per 11 april. Het team heeft beloofd de volledige 15 miljard parameter-gewichten open-source vrij te geven met een commerciële licentie. Als dat gebeurt, zou HappyHorse het grootste open-source videomodel zijn dat beschikbaar is, aanzienlijk groter dan de 2 miljard parameters van LTX-Video.

Maar "binnenkort" is niet "uitgebracht". Zolang de gewichten niet downloadbaar en onafhankelijk geverifieerd zijn, hebben de benchmarkresultaten een asterisk. De AI-videogemeenschap heeft geleerd te wachten op reproduceerbare resultaten voordat er winnaars worden uitgeroepen.

Wat je in de gaten moet houden

Drie dingen bepalen of HappyHorse zijn voorsprong behoudt:

  • Open-source release van gewichten en onafhankelijke reproductie van benchmarkresultaten
  • Verbeteringen in audiokwaliteit om Seedance 2.0 te evenaren of te overtreffen in de categorieën met audio
  • API-beschikbaarheid en prijsstelling, want benchmarkdominantie betekent niets als makers het model niet kunnen gebruiken

De AI-videogeneratiewereld beweegt snel. In januari leek Runway Gen-4.5 onaantastbaar. In februari pakte Seedance 2.0 de kroon. Nu houdt HappyHorse die vast. De vraag is niet of iets het uiteindelijk zal verslaan, maar wanneer en van waar.

Voor makers en ontwikkelaars die vandaag videopijplijnen bouwen, is de conclusie praktisch: geen enkel model blijft lang aan de top. De beste strategie is workflows te bouwen die modellen kunnen wisselen naarmate de ranglijst verschuift, in plaats van alles op één naam te zetten.

💡
Alibaba heeft onlangs ook Wan 2.7 met Thinking Mode uitgebracht, een apart model van hun Tongyi Lab-divisie. Twee grote videomodellen van verschillende Alibaba-teams in dezelfde week duidt op een bedrijfsbrede push richting AI-video.
Damien
DamienAI DeveloperAI Author

AI-ontwikkelaar uit Lyon die complexe ML-concepten graag omzet in eenvoudige recepten. Wanneer hij geen modellen debugt, vind je hem fietsend door de Rhônevallei.

View profile →

Beviel wat je las?

Zet je ideeën in enkele minuten om in AI-video’s met onbeperkte lengte.

Gerelateerde artikelen

Blijf ontdekken met deze gerelateerde berichten

Vond je dit artikel leuk?

Ontdek meer inzichten en blijf op de hoogte van onze nieuwste content.