Meta PixelPřejít na hlavní obsah
DamienDamien· Autor AI, zkontrolováno člověkem
5 min read
926 slov

Alibaba HappyHorse-1.0: Záhadný model, který ovládl všechny žebříčky AI videa

Model jménem HappyHorse-1.0 se objevil na Artificial Analysis bez uvedení firmy, vyšplhal se na #1 v text-to-video i image-to-video a pak se ukázalo, že za ním stojí Alibaba. Tady je to, co víme o architektuře, týmu a co to znamená pro trh s AI videem.

Alibaba HappyHorse-1.0: Záhadný model, který ovládl všechny žebříčky AI videa

Jste připraveni vytvářet vlastní AI videa?

Připojte se k tisícům tvůrců, kteří používají Bonega.ai

7. dubna 2026 se na Artificial Analysis Video Arena objevil model, o kterém nikdo neslyšel. Během tří dnů obsadil pozici #1 jak v generování videa z textu, tak z obrazu. Žádné logo, žádná tisková zpráva, žádné jméno firmy. Pak Alibaba potvrdila, že je jejich. Tohle je příběh HappyHorse-1.0, tmavého koně, který právě zamíchal žebříčky AI videa.

Odhalení

Artificial Analysis provozuje Video Arena, kde uživatelé zadají prompt, dva anonymní modely vygenerují výstupy a uživatelé vyberou lepší. Hlasy se promítají do hodnotícího systému Elo (stejná matematika jako v šachových žebříčcích). Modely nemohou systém podvádět, protože hodnotitelé nikdy nevědí, který model vytvořil který výstup.

HappyHorse-1.0 vstoupil do arény 7. dubna s prázdným profilem. Bez loga, bez uvedení firmy. Do 10. dubna obsadil první místo ve dvou ze čtyř kategorií žebříčku a Alibaba potvrdila vlastnictví přes nově vytvořený účet na X a prohlášením pro CNBC.

💡
Akcie Alibaby obchodované v Hongkongu vzrostly o 2,12 % v den oznámení a už dříve v tom týdnu posílily o 6,75 %, když kolem záhadného modelu narůstaly spekulace.

Čísla

Elo skóre modelu HappyHorse mluví jasně:

1333
T2V Elo (bez zvuku)
1392
I2V Elo (bez zvuku)
1205
T2V Elo (se zvukem)

Pro kontext, předchozí #1 v text-to-video byl Seedance 2.0 od ByteDance s Elo 1273. HappyHorse ho překonal o 60 bodů, což je rozdíl, jehož uzavření typicky trvá měsíce. V image-to-video HappyHorse dosáhl 1392 oproti 1355 u Seedance 2.0.

Kategorie se zvukem vyprávějí jiný příběh. HappyHorse sedí na #2 za Seedance 2.0 (Elo 1219 vs. 1205), což naznačuje, že zvukový pipeline stále potřebuje doladit ve srovnání s kvalitou samotného videa.

KategorieHappyHorsePředchozí #1Rozdíl
Text-to-Video (bez zvuku)13331273 (Seedance 2.0)+60
Image-to-Video (bez zvuku)13921355 (Seedance 2.0)+37
Text-to-Video (se zvukem)12051219 (Seedance 2.0)-14

Architektura: Jeden Transformer, všechno najednou

Většina systémů pro AI video řetězí oddělené komponenty: enkodér textu, generátor videa a zvukový model přilepený na konci. HappyHorse volí jiný přístup.

Model používá 40vrstvý jednoproudový Self-Attention Transformer bez Cross-Attention modulů. Tokeny textu, videa a zvuku procházejí současně stejným stackem transformeru. Tento sjednocený design eliminuje nadbytečné parametry a snižuje složitost inference.

Sjednocená architektura
Text, video a zvuk zpracované v jednom průchodu. Žádný oddělený zvukový pipeline. Méně pohyblivých částí, nižší latence.
Zvuk stále zaostává
Navzdory sjednocenému designu se kvalita zvuku drží na #2 za specializovaným zvukovým pipeline Seedance 2.0.

Inferenční pipeline je nezvykle lehký: pouze 8 kroků odšumování bez Classifier-Free Guidance (CFG). Pro srovnání, mnoho konkurenčních modelů používá 25-50 kroků s aktivním CFG. To naznačuje agresivní destilaci při tréninku, výměnu surové kapacity za rychlost.

Tým za modelem

HappyHorse pochází z Future Life Lab pod skupinou Taotian Group Alibaby (e-commerce divize). V čele stojí Zhang Di, bývalý viceprezident Kuaishou a technický vedoucí Kling AI.

Tento detail je důležitý. Zhang Di vybudoval inženýrskou kulturu za Klingem, jedním z nejsilnějších modelů AI videa roku 2025. Zná infrastrukturní výzvy, trénovací pipeline i mezery v hodnocení. Kombinace těchto zkušeností s výpočetními zdroji Alibaby je úplně jiná rovnice než vedení samostatného startupu.

💡
HappyHorse nativně podporuje synchronizaci rtů v šesti jazycích: čínštině, angličtině, japonštině, korejštině, němčině a francouzštině. Tato vícejazyčná schopnost naznačuje model trénovaný na rozmanitých, pečlivě vybraných datech.

Proč je to důležité pro trh

Trh s AI videem v dubnu 2026 je neobvykle nestabilní:

Březen 2026

Oznámeno ukončení Sory

OpenAI potvrdila, že Sora bude ukončena 26. dubna. Výpočetní náklady a konkurenční tlak se ukázaly jako neudržitelné.

Únor 2026

Seedance 2.0 pozastaven

ByteDance donucen pozastavit nasazení kvůli autorskoprávním sporům s hollywoodskými studii.

7. dubna 2026

Objevuje se HappyHorse

Anonymní model vstupuje na Artificial Analysis Video Arena.

10. dubna 2026

Alibaba potvrzuje vlastnictví

Akcie skočí nahoru po odhalení identity.

Když Sora odchází ze scény a Seedance čelí právním problémům, HappyHorse přichází ve chvíli, kdy trh hledá nového lídra. Runway Gen-4.5 si stále drží silnou pozici v produkčních workflow a Google Veo 3.1 dominuje v prostoru firemních integrací. Ale pokud jde o čistou kvalitu generování měřenou slepým lidským hodnocením, HappyHorse teď sedí na vrcholu.

Open Source: brzy (možná)

GitHub repozitář i Hugging Face Model Hub ukazují "Coming Soon" k 11. dubnu. Tým slíbil otevření plných 15miliardových vah s komerční licencí. Pokud se to stane, HappyHorse bude největší open-source model pro video, výrazně větší než LTX-Video s 2 miliardami parametrů.

Ale "brzy" není "vydáno". Dokud nebudou váhy ke stažení a nezávisle ověřené, nesou výsledky benchmarků hvězdičku. Komunita AI videa se naučila čekat na reprodukovatelné výsledky, než vyhlásí vítěze.

Na co se dívat

Tři věci rozhodnou, zda si HappyHorse udrží náskok:

  • Otevření vah a nezávislá reprodukce výsledků benchmarků
  • Zlepšení kvality zvuku tak, aby vyrovnala nebo překonala Seedance 2.0 v kategoriích se zvukem
  • Dostupnost API a ceník, protože dominance v benchmarcích nic neznamená, pokud tvůrci nemají k modelu přístup

Prostor generování AI videa se pohybuje rychle. V lednu Runway Gen-4.5 vypadal nedotknutelně. V únoru korunu převzal Seedance 2.0. Teď ji drží HappyHorse. Otázka nezní, jestli ho něco nakonec porazí, ale kdy a odkud.

Pro tvůrce a vývojáře budující video pipeline dnes je závěr praktický: žádný jednotlivý model nezůstane na vrcholu dlouho. Nejlepší strategie je budovat workflow, které umožní vyměnit modely, jak se žebříček mění, místo sázky na jedno jméno.

💡
Alibaba nedávno vydala také Wan 2.7 s Thinking Mode, samostatný model z jejich divize Tongyi Lab. Dva velké modely pro video od různých týmů Alibaby ve stejném týdnu signalizují celofiremní tlak do AI videa.
Damien
DamienAI DeveloperAI Author

Vývojář AI z Lyonu, který rád mění složité koncepty strojového učení v jednoduché recepty. Když zrovna neopravuje modely, najdete ho na kole v údolí Rhôny.

View profile →

Líbilo se vám, co jste četli?

Proměňte své nápady během několika minut v AI videa neomezené délky.

Související články

Pokračujte v objevování s těmito souvisejícími příspěvky

Líbil se vám tento článek?

Objevte další poznatky a zůstaňte v obraze díky našemu nejnovějšímu obsahu.