Meta PixelZum Hauptinhalt springen
DamienDamien· KI-Autor, von Menschen geprüft
5 min read
991 Wörter

Alibaba HappyHorse-1.0: Das unbekannte Modell, das alle KI-Video-Ranglisten anführt

Ein Modell namens HappyHorse-1.0 tauchte ohne Zuordnung auf Artificial Analysis auf, stieg in Text-to-Video und Image-to-Video auf Platz 1 und stellte sich als Alibaba-Projekt heraus. Hier ist, was wir über die Architektur, das Team und die Auswirkungen auf den KI-Video-Markt wissen.

Alibaba HappyHorse-1.0: Das unbekannte Modell, das alle KI-Video-Ranglisten anführt

Bereit, deine eigenen KI-Videos zu erstellen?

Schließe dich Tausenden von Kreativen an, die Bonega.ai nutzen

Am 7. April 2026 erschien ein völlig unbekanntes Modell in der Video Arena von Artificial Analysis. Innerhalb von drei Tagen belegte es den ersten Platz in Text-to-Video und Image-to-Video. Kein Branding, keine Pressemitteilung, kein Firmenname. Dann bestätigte Alibaba die Urheberschaft. Dies ist die Geschichte von HappyHorse-1.0, dem Außenseiter, der die KI-Video-Ranglisten neu sortiert hat.

Die Enthüllung

Artificial Analysis betreibt eine Video Arena, in der Nutzer einen Prompt einreichen, zwei anonyme Modelle Ergebnisse generieren und die Nutzer ihren Favoriten wählen. Die Abstimmungen fließen in ein Elo-Bewertungssystem ein (dieselbe Mathematik wie bei Schach-Rankings). Modelle können das System nicht manipulieren, da die Bewerter nie wissen, welches Modell welches Ergebnis erzeugt hat.

HappyHorse-1.0 betrat diese Arena am 7. April mit einem leeren Profil. Kein Logo, keine Firmenzuordnung. Bis zum 10. April hielt es die Spitzenposition in zwei von vier Ranking-Kategorien, und Alibaba bestätigte die Eigentümerschaft über einen neu erstellten X-Account und eine Stellungnahme gegenüber CNBC.

💡
Alibabas in Hongkong gelistete Aktien stiegen am Tag der Bekanntgabe um 2,12 % und hatten bereits zu Wochenbeginn 6,75 % zugelegt, als die Spekulationen um das mysteriöse Modell zunahmen.

Die Zahlen

Die Elo-Werte von HappyHorse sprechen eine klare Sprache:

1333
T2V-Elo (ohne Audio)
1392
I2V-Elo (ohne Audio)
1205
T2V-Elo (mit Audio)

Zum Vergleich: Die bisherige Nummer 1 im Bereich Text-to-Video war ByteDances Seedance 2.0 mit einem Elo von 1273. HappyHorse übertrifft diesen Wert um 60 Punkte. Ein Abstand, der normalerweise Monate braucht, um geschlossen zu werden. Im Bereich Image-to-Video erzielte HappyHorse 1392 gegenüber 1355 von Seedance 2.0.

Die Kategorien mit Audio zeigen ein anderes Bild. HappyHorse liegt auf Platz 2 hinter Seedance 2.0 (Elo 1219 gegenüber 1205), was darauf hindeutet, dass die Audio-Pipeline im Verhältnis zur Videoqualität noch Verbesserungsbedarf hat.

KategorieHappyHorseBisherige Nr. 1Abstand
Text-to-Video (stumm)13331273 (Seedance 2.0)+60
Image-to-Video (stumm)13921355 (Seedance 2.0)+37
Text-to-Video (Audio)12051219 (Seedance 2.0)-14

Architektur: Ein Transformer, alles auf einmal

Die meisten KI-Video-Systeme verketten separate Komponenten: einen Textencoder, einen Videogenerator und ein nachträglich angebundenes Audiomodell. HappyHorse verfolgt einen anderen Ansatz.

Das Modell verwendet einen 40-schichtigen Single-Stream Self-Attention Transformer ohne Cross-Attention-Module. Text-, Video- und Audio-Tokens durchlaufen alle gleichzeitig denselben Transformer-Stack. Dieses einheitliche Design eliminiert redundante Parameter und reduziert die Inferenzkomplexität.

Einheitliche Architektur
Text, Video und Audio werden in einem einzigen Durchlauf verarbeitet. Keine separate Audio-Pipeline. Weniger bewegliche Teile, geringere Latenz.
Audio noch zurückliegend
Trotz des einheitlichen Designs liegt die Audioqualität auf Platz 2 hinter der spezialisierten Audio-Pipeline von Seedance 2.0.

Die Inferenz-Pipeline ist ungewöhnlich schlank: nur 8 Denoising-Schritte ohne Classifier-Free Guidance (CFG). Zum Vergleich: Viele konkurrierende Modelle verwenden 25 bis 50 Schritte mit aktiviertem CFG. Das deutet auf aggressive Distillation während des Trainings hin, bei der Rohkapazität zugunsten von Geschwindigkeit geopfert wird.

Das Team dahinter

HappyHorse stammt aus dem Future Life Lab unter Alibabas Taotian Group (dem E-Commerce-Bereich). Die Leitung hat Zhang Di, ehemaliger VP von Kuaishou und technischer Leiter von Kling AI.

Dieses Detail ist relevant. Zhang Di hat die Ingenieurkultur hinter Kling aufgebaut, einem der leistungsstärksten KI-Video-Modelle des Jahres 2025. Er kennt die Infrastruktur-Herausforderungen, die Trainings-Pipelines und die Bewertungslücken. Diese Erfahrung in Kombination mit Alibabas Rechenressourcen ergibt eine völlig andere Gleichung als ein eigenständiges Startup.

💡
HappyHorse unterstützt nativ Lippensynchronisation in sechs Sprachen: Chinesisch, Englisch, Japanisch, Koreanisch, Deutsch und Französisch. Diese mehrsprachige Fähigkeit weist auf ein Modell hin, das mit vielfältigen, sorgfältig kuratierten Daten trainiert wurde.

Bedeutung für den Markt

Der KI-Video-Markt im April 2026 ist ungewöhnlich volatil:

März 2026

Sora-Einstellung angekündigt

OpenAI bestätigte, dass Sora am 26. April eingestellt wird. Rechenkosten und Wettbewerbsdruck erwiesen sich als nicht tragbar.

Februar 2026

Seedance 2.0 pausiert

ByteDance war gezwungen, den Rollout nach Urheberrechtsstreitigkeiten mit Hollywood-Studios zu stoppen.

7. April 2026

HappyHorse erscheint

Ein anonymes Modell betritt die Video Arena von Artificial Analysis.

10. April 2026

Alibaba bestätigt die Urheberschaft

Der Aktienkurs springt nach oben, als die Identität enthüllt wird.

Mit dem Ende von Sora und den rechtlichen Schwierigkeiten von Seedance kommt HappyHorse zu einem Zeitpunkt, an dem der Markt nach einem neuen Spitzenreiter sucht. Runway Gen-4.5 bleibt stark in Produktionsworkflows, und Google Veo 3.1 dominiert im Bereich der Unternehmensintegration. Doch was die reine Generierungsqualität betrifft, gemessen durch blinde menschliche Präferenz, steht HappyHorse jetzt an der Spitze.

Open Source: Demnächst (vielleicht)

Das GitHub-Repository und der Hugging Face Model Hub zeigen beide "Coming Soon" (Stand: 11. April). Das Team hat die Open-Source-Veröffentlichung der vollständigen 15-Milliarden-Parameter-Gewichte unter einer kommerziellen Lizenz angekündigt. Sollte das geschehen, wäre HappyHorse das größte verfügbare Open-Source-Videomodell, deutlich größer als die 2 Milliarden Parameter von LTX-Video.

Aber "demnächst" ist nicht "veröffentlicht". Solange die Gewichte nicht herunterladbar und unabhängig überprüfbar sind, stehen die Benchmark-Ergebnisse unter Vorbehalt. Die KI-Video-Community hat gelernt, auf reproduzierbare Ergebnisse zu warten, bevor sie Gewinner ausruft.

Was zu beobachten ist

Drei Faktoren werden darüber entscheiden, ob HappyHorse seinen Vorsprung behaupten kann:

  • Open-Source-Veröffentlichung der Gewichte und unabhängige Reproduktion der Benchmark-Ergebnisse
  • Verbesserung der Audioqualität, um Seedance 2.0 in den Kategorien mit Audio zu erreichen oder zu übertreffen
  • API-Verfügbarkeit und Preisgestaltung, da Benchmark-Dominanz nichts bedeutet, wenn Ersteller keinen Zugang zum Modell erhalten

Der Bereich der KI-Videogenerierung bewegt sich schnell. Im Januar wirkte Runway Gen-4.5 unerreichbar. Im Februar übernahm Seedance 2.0 die Führung. Jetzt hält HappyHorse sie. Die Frage ist nicht, ob etwas es irgendwann übertreffen wird, sondern wann und woher.

Für Kreative und Entwickler, die heute Video-Pipelines aufbauen, ist die Erkenntnis praktisch: Kein einzelnes Modell bleibt lange an der Spitze. Die beste Strategie ist es, Workflows zu bauen, die Modelle austauschen können, wenn sich die Rangliste verschiebt, anstatt alles auf einen einzigen Namen zu setzen.

💡
Alibaba hat kürzlich auch Wan 2.7 mit Thinking Mode veröffentlicht, ein separates Modell aus der Tongyi Lab-Abteilung. Zwei bedeutende Videomodelle von verschiedenen Alibaba-Teams in derselben Woche signalisieren eine unternehmensweite Offensive im Bereich KI-Video.
Damien
DamienAI DeveloperAI Author

KI-Entwickler aus Lyon, der komplexe ML-Konzepte gern in einfache Rezepte verwandelt. Wenn er keine Modelle debuggt, fährt er mit dem Fahrrad durch das Rhônetal.

View profile →

Gefällt dir, was du gelesen hast?

Verwandle deine Ideen in wenigen Minuten in KI-Videos unbegrenzter Länge.

Ähnliche Artikel

Entdecke weitere passende Beiträge

Hat dir dieser Artikel gefallen?

Entdecke weitere Einblicke und bleibe mit unseren neuesten Inhalten auf dem Laufenden.