Alibaba HappyHorse-1.0: Das unbekannte Modell, das alle KI-Video-Ranglisten anführt
Ein Modell namens HappyHorse-1.0 tauchte ohne Zuordnung auf Artificial Analysis auf, stieg in Text-to-Video und Image-to-Video auf Platz 1 und stellte sich als Alibaba-Projekt heraus. Hier ist, was wir über die Architektur, das Team und die Auswirkungen auf den KI-Video-Markt wissen.

Bereit, deine eigenen KI-Videos zu erstellen?
Schließe dich Tausenden von Kreativen an, die Bonega.ai nutzen
Die Enthüllung
Artificial Analysis betreibt eine Video Arena, in der Nutzer einen Prompt einreichen, zwei anonyme Modelle Ergebnisse generieren und die Nutzer ihren Favoriten wählen. Die Abstimmungen fließen in ein Elo-Bewertungssystem ein (dieselbe Mathematik wie bei Schach-Rankings). Modelle können das System nicht manipulieren, da die Bewerter nie wissen, welches Modell welches Ergebnis erzeugt hat.
HappyHorse-1.0 betrat diese Arena am 7. April mit einem leeren Profil. Kein Logo, keine Firmenzuordnung. Bis zum 10. April hielt es die Spitzenposition in zwei von vier Ranking-Kategorien, und Alibaba bestätigte die Eigentümerschaft über einen neu erstellten X-Account und eine Stellungnahme gegenüber CNBC.
Die Zahlen
Die Elo-Werte von HappyHorse sprechen eine klare Sprache:
Zum Vergleich: Die bisherige Nummer 1 im Bereich Text-to-Video war ByteDances Seedance 2.0 mit einem Elo von 1273. HappyHorse übertrifft diesen Wert um 60 Punkte. Ein Abstand, der normalerweise Monate braucht, um geschlossen zu werden. Im Bereich Image-to-Video erzielte HappyHorse 1392 gegenüber 1355 von Seedance 2.0.
Die Kategorien mit Audio zeigen ein anderes Bild. HappyHorse liegt auf Platz 2 hinter Seedance 2.0 (Elo 1219 gegenüber 1205), was darauf hindeutet, dass die Audio-Pipeline im Verhältnis zur Videoqualität noch Verbesserungsbedarf hat.
| Kategorie | HappyHorse | Bisherige Nr. 1 | Abstand |
|---|---|---|---|
| Text-to-Video (stumm) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (stumm) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (Audio) | 1205 | 1219 (Seedance 2.0) | -14 |
Architektur: Ein Transformer, alles auf einmal
Die meisten KI-Video-Systeme verketten separate Komponenten: einen Textencoder, einen Videogenerator und ein nachträglich angebundenes Audiomodell. HappyHorse verfolgt einen anderen Ansatz.
Das Modell verwendet einen 40-schichtigen Single-Stream Self-Attention Transformer ohne Cross-Attention-Module. Text-, Video- und Audio-Tokens durchlaufen alle gleichzeitig denselben Transformer-Stack. Dieses einheitliche Design eliminiert redundante Parameter und reduziert die Inferenzkomplexität.
Die Inferenz-Pipeline ist ungewöhnlich schlank: nur 8 Denoising-Schritte ohne Classifier-Free Guidance (CFG). Zum Vergleich: Viele konkurrierende Modelle verwenden 25 bis 50 Schritte mit aktiviertem CFG. Das deutet auf aggressive Distillation während des Trainings hin, bei der Rohkapazität zugunsten von Geschwindigkeit geopfert wird.
Das Team dahinter
HappyHorse stammt aus dem Future Life Lab unter Alibabas Taotian Group (dem E-Commerce-Bereich). Die Leitung hat Zhang Di, ehemaliger VP von Kuaishou und technischer Leiter von Kling AI.
Dieses Detail ist relevant. Zhang Di hat die Ingenieurkultur hinter Kling aufgebaut, einem der leistungsstärksten KI-Video-Modelle des Jahres 2025. Er kennt die Infrastruktur-Herausforderungen, die Trainings-Pipelines und die Bewertungslücken. Diese Erfahrung in Kombination mit Alibabas Rechenressourcen ergibt eine völlig andere Gleichung als ein eigenständiges Startup.
Bedeutung für den Markt
Der KI-Video-Markt im April 2026 ist ungewöhnlich volatil:
Sora-Einstellung angekündigt
OpenAI bestätigte, dass Sora am 26. April eingestellt wird. Rechenkosten und Wettbewerbsdruck erwiesen sich als nicht tragbar.
Seedance 2.0 pausiert
ByteDance war gezwungen, den Rollout nach Urheberrechtsstreitigkeiten mit Hollywood-Studios zu stoppen.
HappyHorse erscheint
Ein anonymes Modell betritt die Video Arena von Artificial Analysis.
Alibaba bestätigt die Urheberschaft
Der Aktienkurs springt nach oben, als die Identität enthüllt wird.
Mit dem Ende von Sora und den rechtlichen Schwierigkeiten von Seedance kommt HappyHorse zu einem Zeitpunkt, an dem der Markt nach einem neuen Spitzenreiter sucht. Runway Gen-4.5 bleibt stark in Produktionsworkflows, und Google Veo 3.1 dominiert im Bereich der Unternehmensintegration. Doch was die reine Generierungsqualität betrifft, gemessen durch blinde menschliche Präferenz, steht HappyHorse jetzt an der Spitze.
Open Source: Demnächst (vielleicht)
Das GitHub-Repository und der Hugging Face Model Hub zeigen beide "Coming Soon" (Stand: 11. April). Das Team hat die Open-Source-Veröffentlichung der vollständigen 15-Milliarden-Parameter-Gewichte unter einer kommerziellen Lizenz angekündigt. Sollte das geschehen, wäre HappyHorse das größte verfügbare Open-Source-Videomodell, deutlich größer als die 2 Milliarden Parameter von LTX-Video.
Aber "demnächst" ist nicht "veröffentlicht". Solange die Gewichte nicht herunterladbar und unabhängig überprüfbar sind, stehen die Benchmark-Ergebnisse unter Vorbehalt. Die KI-Video-Community hat gelernt, auf reproduzierbare Ergebnisse zu warten, bevor sie Gewinner ausruft.
Was zu beobachten ist
Drei Faktoren werden darüber entscheiden, ob HappyHorse seinen Vorsprung behaupten kann:
- ✓Open-Source-Veröffentlichung der Gewichte und unabhängige Reproduktion der Benchmark-Ergebnisse
- ✓Verbesserung der Audioqualität, um Seedance 2.0 in den Kategorien mit Audio zu erreichen oder zu übertreffen
- ✓API-Verfügbarkeit und Preisgestaltung, da Benchmark-Dominanz nichts bedeutet, wenn Ersteller keinen Zugang zum Modell erhalten
Der Bereich der KI-Videogenerierung bewegt sich schnell. Im Januar wirkte Runway Gen-4.5 unerreichbar. Im Februar übernahm Seedance 2.0 die Führung. Jetzt hält HappyHorse sie. Die Frage ist nicht, ob etwas es irgendwann übertreffen wird, sondern wann und woher.
Für Kreative und Entwickler, die heute Video-Pipelines aufbauen, ist die Erkenntnis praktisch: Kein einzelnes Modell bleibt lange an der Spitze. Die beste Strategie ist es, Workflows zu bauen, die Modelle austauschen können, wenn sich die Rangliste verschiebt, anstatt alles auf einen einzigen Namen zu setzen.

KI-Entwickler aus Lyon, der komplexe ML-Konzepte gern in einfache Rezepte verwandelt. Wenn er keine Modelle debuggt, fährt er mit dem Fahrrad durch das Rhônetal.
View profile →Gefällt dir, was du gelesen hast?
Verwandle deine Ideen in wenigen Minuten in KI-Videos unbegrenzter Länge.
Ähnliche Artikel
Entdecke weitere passende Beiträge

KI-Video nach Sora: 4 Marktsegmente, die Sie 2026 kennen sollten
Sora wird am 26. April eingestellt. Der KI-Videomarkt hat sich in vier Segmente konsolidiert. Ein praktischer Leitfaden zur Auswahl der richtigen Sora-Alternative für Ihre Anforderungen.

Google Veo 3.1 wird kostenlos: 10 KI-Videos pro Monat für jedes Google-Konto
Google hat Veo 3.1 für alle persönlichen Konten mit 10 kostenlosen Videogenerierungen pro Monat geöffnet. Was Sie erhalten, wo die Grenzen liegen und warum das für KI-Video-Ersteller wichtig ist.

Google Veo 3.1 Lite: Kostengünstige KI-Videogenerierung kommt in die Gemini API
Google hat Veo 3.1 Lite veröffentlicht, ein schnelles und erschwingliches KI-Videogenerierungsmodell innerhalb der Gemini API. Was Entwickler über Preise, Qualitätskompromisse und die Integration von Video in Produktionsanwendungen wissen müssen.