Meta PixelPrzejdź do głównej treści
DamienDamien· Autor AI, zweryfikowane przez człowieka
5 min read
956 słów

Alibaba HappyHorse-1.0: Tajemniczy model, który zdominował wszystkie rankingi wideo AI

Model o nazwie HappyHorse-1.0 pojawił się na Artificial Analysis bez przypisania do żadnej firmy, wspiął się na #1 w kategoriach text-to-video i image-to-video, a potem okazało się, że stoi za nim Alibaba. Oto co wiemy o architekturze, zespole i co to oznacza dla rynku wideo AI.

Alibaba HappyHorse-1.0: Tajemniczy model, który zdominował wszystkie rankingi wideo AI

Gotowy, aby tworzyć własne filmy AI?

Dołącz do tysięcy twórców korzystających z Bonega.ai

7 kwietnia 2026 roku na Artificial Analysis Video Arena pojawił się model, o którym nikt wcześniej nie słyszał. W ciągu trzech dni zajął pozycję #1 zarówno w generowaniu wideo z tekstu, jak i z obrazu. Żadnego logo, żadnej informacji prasowej, żadnej nazwy firmy. Potem Alibaba potwierdziła, że to ich dzieło. To historia HappyHorse-1.0, czarnego konia, który właśnie przetasował rankingi wideo AI.

Ujawnienie

Artificial Analysis prowadzi Video Arena, w której użytkownicy podają prompt, dwa anonimowe modele generują wyniki, a użytkownicy wybierają lepszy. Głosy zasilają system rankingowy Elo (ta sama matematyka co w szachach). Modele nie mogą manipulować systemem, bo oceniający nigdy nie wiedzą, który model wygenerował dany materiał.

HappyHorse-1.0 wszedł na arenę 7 kwietnia z pustym profilem. Bez logo, bez informacji o firmie. Do 10 kwietnia zajął pierwsze miejsce w dwóch z czterech kategorii rankingowych, a Alibaba potwierdziła własność przez nowo utworzone konto na X oraz oświadczenie dla CNBC.

💡
Akcje Alibaby notowane w Hongkongu wzrosły o 2,12% w dniu ogłoszenia i już wcześniej w tym tygodniu zyskały 6,75%, gdy narastały spekulacje wokół tajemniczego modelu.

Liczby

Wyniki Elo modelu HappyHorse mówią same za siebie:

1333
T2V Elo (bez dźwięku)
1392
I2V Elo (bez dźwięku)
1205
T2V Elo (z dźwiękiem)

Dla kontekstu, poprzedni lider w text-to-video to Seedance 2.0 od ByteDance z Elo 1273. HappyHorse wyprzedził go o 60 punktów, a taka różnica zazwyczaj wymaga miesięcy pracy. W image-to-video HappyHorse uzyskał 1392 wobec 1355 Seedance 2.0.

Kategorie z dźwiękiem to inna historia. HappyHorse zajmuje #2 za Seedance 2.0 (Elo 1219 vs. 1205), co sugeruje, że pipeline audio wciąż wymaga dopracowania względem jakości samego wideo.

KategoriaHappyHorsePoprzedni #1Różnica
Text-to-Video (bez dźwięku)13331273 (Seedance 2.0)+60
Image-to-Video (bez dźwięku)13921355 (Seedance 2.0)+37
Text-to-Video (z dźwiękiem)12051219 (Seedance 2.0)-14

Architektura: Jeden Transformer, wszystko naraz

Większość systemów wideo AI łączy osobne komponenty: enkoder tekstu, generator wideo i model audio doklejony na końcu. HappyHorse podchodzi do tego inaczej.

Model wykorzystuje 40-warstwowy jednopotokowy Self-Attention Transformer bez modułów Cross-Attention. Tokeny tekstu, wideo i audio przepływają jednocześnie przez ten sam stos transformera. Ta zunifikowana konstrukcja eliminuje zbędne parametry i redukuje złożoność inferencji.

Zunifikowana architektura
Tekst, wideo i audio przetwarzane w jednym przebiegu. Bez osobnego pipeline audio. Mniej ruchomych części, niższe opóźnienia.
Audio wciąż w tyle
Mimo zunifikowanej architektury jakość audio plasuje się na #2 za wyspecjalizowanym pipeline audio Seedance 2.0.

Pipeline inferencji jest wyjątkowo lekki: tylko 8 kroków odszumiania bez Classifier-Free Guidance (CFG). Dla porównania, wiele konkurencyjnych modeli używa 25-50 kroków z włączonym CFG. To sugeruje agresywną destylację podczas treningu, wymianę surowej pojemności na szybkość.

Zespół stojący za modelem

HappyHorse pochodzi z Future Life Lab w ramach Taotian Group Alibaby (ramię e-commerce). Na czele stoi Zhang Di, były wiceprezes Kuaishou i szef techniczny Kling AI.

Ten szczegół ma znaczenie. Zhang Di zbudował kulturę inżynierską stojącą za Kling, jednym z najsilniejszych modeli wideo AI w 2025 roku. Zna wyzwania infrastrukturalne, pipeline treningowe i luki ewaluacyjne. Połączenie tego doświadczenia z zasobami obliczeniowymi Alibaby to zupełnie inne równanie niż prowadzenie niezależnego startupu.

💡
HappyHorse natywnie obsługuje synchronizację ruchu warg w sześciu językach: chińskim, angielskim, japońskim, koreańskim, niemieckim i francuskim. Ta wielojęzyczna zdolność sugeruje model trenowany na zróżnicowanych, starannie dobranych danych.

Dlaczego to ma znaczenie dla rynku

Rynek wideo AI w kwietniu 2026 jest wyjątkowo niestabilny:

Marzec 2026

Ogłoszenie zamknięcia Sora

OpenAI potwierdziło, że Sora zostanie wycofana 26 kwietnia. Koszty obliczeniowe i presja konkurencji okazały się nie do utrzymania.

Luty 2026

Seedance 2.0 wstrzymany

ByteDance zmuszony do wstrzymania wdrożenia z powodu sporów o prawa autorskie ze studiami Hollywood.

7 kwietnia 2026

Pojawia się HappyHorse

Anonimowy model wchodzi na Artificial Analysis Video Arena.

10 kwietnia 2026

Alibaba potwierdza własność

Akcje skaczą w górę po ujawnieniu tożsamości.

Gdy Sora schodzi ze sceny, a Seedance zmaga się z problemami prawnymi, HappyHorse pojawia się w momencie, gdy rynek szuka nowego lidera. Runway Gen-4.5 nadal trzyma mocną pozycję w profesjonalnych workflow, a Google Veo 3.1 dominuje w przestrzeni integracji korporacyjnych. Ale pod względem surowej jakości generowania mierzonej ślepą oceną przez ludzi, HappyHorse zajmuje teraz szczyt.

Open Source: wkrótce (może)

Repozytorium GitHub i Hugging Face Model Hub pokazują "Coming Soon" na dzień 11 kwietnia. Zespół obiecał otwartoźródłowe wydanie pełnych wag o 15 miliardach parametrów z licencją komercyjną. Jeśli to się stanie, HappyHorse będzie największym otwartoźródłowym modelem wideo, znacząco większym niż LTX-Video z 2 miliardami parametrów.

Ale "wkrótce" to nie "wydane". Dopóki wagi nie będą do pobrania i niezależnie zweryfikowane, wyniki benchmarków mają gwiazdkę. Społeczność wideo AI nauczyła się czekać na odtwarzalne wyniki, zanim ogłosi zwycięzców.

Na co zwrócić uwagę

Trzy rzeczy zdecydują, czy HappyHorse utrzyma prowadzenie:

  • Otwartoźródłowe wydanie wag i niezależna reprodukcja wyników benchmarków
  • Poprawa jakości audio, aby dorównać lub przewyższyć Seedance 2.0 w kategoriach z dźwiękiem
  • Dostępność API i cennik, bo dominacja w benchmarkach nic nie znaczy, jeśli twórcy nie mają dostępu do modelu

Przestrzeń generowania wideo AI rozwija się szybko. W styczniu Runway Gen-4.5 wydawał się nie do ruszenia. W lutym koronę przejął Seedance 2.0. Teraz dzierży ją HappyHorse. Pytanie nie brzmi, czy coś go w końcu pokona, ale kiedy i skąd.

Dla twórców i deweloperów budujących pipeline wideo dzisiaj, wniosek jest praktyczny: żaden pojedynczy model nie utrzymuje się na szczycie długo. Najlepsza strategia to budowanie workflow, które pozwalają zmieniać modele w miarę zmian w rankingach, zamiast stawiać wszystko na jedną kartę.

💡
Alibaba niedawno wydała również Wan 2.7 z Thinking Mode, osobny model z ich działu Tongyi Lab. Dwa poważne modele wideo od różnych zespołów Alibaby w tym samym tygodniu sygnalizują ogólnofirmowy zwrot w stronę wideo AI.
Damien
DamienAI DeveloperAI Author

Programista AI z Lyonu, który uwielbia zamieniać złożone koncepcje ML w proste przepisy. Gdy nie debugguje modeli, jeździ na rowerze po dolinie Rodanu.

View profile →

Podobało Ci się to, co przeczytałeś?

Zamień swoje pomysły w filmy AI o nieograniczonej długości w kilka minut.

Powiązane artykuły

Kontynuuj odkrywanie dzięki tym powiązanym wpisom

Podobał Ci się ten artykuł?

Odkryj więcej inspiracji i bądź na bieżąco z naszymi najnowszymi treściami.