Alibaba HappyHorse-1.0: Tajemniczy model, który zdominował wszystkie rankingi wideo AI
Model o nazwie HappyHorse-1.0 pojawił się na Artificial Analysis bez przypisania do żadnej firmy, wspiął się na #1 w kategoriach text-to-video i image-to-video, a potem okazało się, że stoi za nim Alibaba. Oto co wiemy o architekturze, zespole i co to oznacza dla rynku wideo AI.

Ujawnienie
Artificial Analysis prowadzi Video Arena, w której użytkownicy podają prompt, dwa anonimowe modele generują wyniki, a użytkownicy wybierają lepszy. Głosy zasilają system rankingowy Elo (ta sama matematyka co w szachach). Modele nie mogą manipulować systemem, bo oceniający nigdy nie wiedzą, który model wygenerował dany materiał.
HappyHorse-1.0 wszedł na arenę 7 kwietnia z pustym profilem. Bez logo, bez informacji o firmie. Do 10 kwietnia zajął pierwsze miejsce w dwóch z czterech kategorii rankingowych, a Alibaba potwierdziła własność przez nowo utworzone konto na X oraz oświadczenie dla CNBC.
Liczby
Wyniki Elo modelu HappyHorse mówią same za siebie:
Dla kontekstu, poprzedni lider w text-to-video to Seedance 2.0 od ByteDance z Elo 1273. HappyHorse wyprzedził go o 60 punktów, a taka różnica zazwyczaj wymaga miesięcy pracy. W image-to-video HappyHorse uzyskał 1392 wobec 1355 Seedance 2.0.
Kategorie z dźwiękiem to inna historia. HappyHorse zajmuje #2 za Seedance 2.0 (Elo 1219 vs. 1205), co sugeruje, że pipeline audio wciąż wymaga dopracowania względem jakości samego wideo.
| Kategoria | HappyHorse | Poprzedni #1 | Różnica |
|---|---|---|---|
| Text-to-Video (bez dźwięku) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (bez dźwięku) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (z dźwiękiem) | 1205 | 1219 (Seedance 2.0) | -14 |
Architektura: Jeden Transformer, wszystko naraz
Większość systemów wideo AI łączy osobne komponenty: enkoder tekstu, generator wideo i model audio doklejony na końcu. HappyHorse podchodzi do tego inaczej.
Model wykorzystuje 40-warstwowy jednopotokowy Self-Attention Transformer bez modułów Cross-Attention. Tokeny tekstu, wideo i audio przepływają jednocześnie przez ten sam stos transformera. Ta zunifikowana konstrukcja eliminuje zbędne parametry i redukuje złożoność inferencji.
Pipeline inferencji jest wyjątkowo lekki: tylko 8 kroków odszumiania bez Classifier-Free Guidance (CFG). Dla porównania, wiele konkurencyjnych modeli używa 25-50 kroków z włączonym CFG. To sugeruje agresywną destylację podczas treningu, wymianę surowej pojemności na szybkość.
Zespół stojący za modelem
HappyHorse pochodzi z Future Life Lab w ramach Taotian Group Alibaby (ramię e-commerce). Na czele stoi Zhang Di, były wiceprezes Kuaishou i szef techniczny Kling AI.
Ten szczegół ma znaczenie. Zhang Di zbudował kulturę inżynierską stojącą za Kling, jednym z najsilniejszych modeli wideo AI w 2025 roku. Zna wyzwania infrastrukturalne, pipeline treningowe i luki ewaluacyjne. Połączenie tego doświadczenia z zasobami obliczeniowymi Alibaby to zupełnie inne równanie niż prowadzenie niezależnego startupu.
Dlaczego to ma znaczenie dla rynku
Rynek wideo AI w kwietniu 2026 jest wyjątkowo niestabilny:
Ogłoszenie zamknięcia Sora
OpenAI potwierdziło, że Sora zostanie wycofana 26 kwietnia. Koszty obliczeniowe i presja konkurencji okazały się nie do utrzymania.
Seedance 2.0 wstrzymany
ByteDance zmuszony do wstrzymania wdrożenia z powodu sporów o prawa autorskie ze studiami Hollywood.
Pojawia się HappyHorse
Anonimowy model wchodzi na Artificial Analysis Video Arena.
Alibaba potwierdza własność
Akcje skaczą w górę po ujawnieniu tożsamości.
Gdy Sora schodzi ze sceny, a Seedance zmaga się z problemami prawnymi, HappyHorse pojawia się w momencie, gdy rynek szuka nowego lidera. Runway Gen-4.5 nadal trzyma mocną pozycję w profesjonalnych workflow, a Google Veo 3.1 dominuje w przestrzeni integracji korporacyjnych. Ale pod względem surowej jakości generowania mierzonej ślepą oceną przez ludzi, HappyHorse zajmuje teraz szczyt.
Open Source: wkrótce (może)
Repozytorium GitHub i Hugging Face Model Hub pokazują "Coming Soon" na dzień 11 kwietnia. Zespół obiecał otwartoźródłowe wydanie pełnych wag o 15 miliardach parametrów z licencją komercyjną. Jeśli to się stanie, HappyHorse będzie największym otwartoźródłowym modelem wideo, znacząco większym niż LTX-Video z 2 miliardami parametrów.
Ale "wkrótce" to nie "wydane". Dopóki wagi nie będą do pobrania i niezależnie zweryfikowane, wyniki benchmarków mają gwiazdkę. Społeczność wideo AI nauczyła się czekać na odtwarzalne wyniki, zanim ogłosi zwycięzców.
Na co zwrócić uwagę
Trzy rzeczy zdecydują, czy HappyHorse utrzyma prowadzenie:
- ✓Otwartoźródłowe wydanie wag i niezależna reprodukcja wyników benchmarków
- ✓Poprawa jakości audio, aby dorównać lub przewyższyć Seedance 2.0 w kategoriach z dźwiękiem
- ✓Dostępność API i cennik, bo dominacja w benchmarkach nic nie znaczy, jeśli twórcy nie mają dostępu do modelu
Przestrzeń generowania wideo AI rozwija się szybko. W styczniu Runway Gen-4.5 wydawał się nie do ruszenia. W lutym koronę przejął Seedance 2.0. Teraz dzierży ją HappyHorse. Pytanie nie brzmi, czy coś go w końcu pokona, ale kiedy i skąd.
Dla twórców i deweloperów budujących pipeline wideo dzisiaj, wniosek jest praktyczny: żaden pojedynczy model nie utrzymuje się na szczycie długo. Najlepsza strategia to budowanie workflow, które pozwalają zmieniać modele w miarę zmian w rankingach, zamiast stawiać wszystko na jedną kartę.

Programista AI z Lyonu, który uwielbia zamieniać złożone koncepcje ML w proste przepisy. Gdy nie debugguje modeli, jeździ na rowerze po dolinie Rodanu.
View profile →Podobało Ci się to, co przeczytałeś?
Zamień swoje pomysły w filmy AI o nieograniczonej długości w kilka minut.
Powiązane artykuły
Kontynuuj odkrywanie dzięki tym powiązanym wpisom

Alibaba Wan 2.7: jak tryb myślenia zmienia generowanie wideo przez AI
Alibaba właśnie wydała Wan 2.7 z nowatorskim trybem myślenia, który planuje kompozycje przed wygenerowaniem wideo. Rozkładamy na czynniki pierwsze, jak to działa i co oznacza dla twórców.

Rynek wideo AI po Sorze: 4 poziomy w 2026 roku
Sora zamyka się 26 kwietnia. Rynek wideo AI podzielił się na cztery jasne poziomy. Praktyczny przewodnik po wyborze odpowiedniej alternatywy dla Sory.

Google Veo 3.1 za darmo: 10 filmów AI miesięcznie dla każdego konta Google
Google udostępnił Veo 3.1 wszystkim kontom osobistym z 10 darmowymi generacjami wideo miesięcznie. Oto co dostajesz, jakie są limity i dlaczego to ma znaczenie dla twórców wideo AI.