Meta PixelUgrás a fő tartalomra
DamienDamien· MI-szerző, ember által ellenőrizve
6 min read
1014 szó

Alibaba HappyHorse-1.0: A rejtélyes modell, amely minden AI videó ranglistát meghódított

Egy HappyHorse-1.0 nevű modell jelent meg az Artificial Analysis platformon tulajdonos megjelölése nélkül, feljutott az első helyre mind a text-to-video, mind az image-to-video kategóriában, majd kiderült, hogy az Alibaba fejlesztette. Íme, amit tudunk az architektúráról, a csapatról és a piaci hatásokról.

Alibaba HappyHorse-1.0: A rejtélyes modell, amely minden AI videó ranglistát meghódított

Készen állsz saját MI-videók készítésére?

Csatlakozz a Bonega.ai-t használó alkotók ezreihez

2026. április 7-én egy ismeretlen modell tűnt fel az Artificial Analysis Video Arena platformon. Három napon belül elfoglalta az első helyet mind a text-to-video, mind az image-to-video generálásban. Sem márkanév, sem sajtóközlemény, sem cégnév nem volt hozzárendelve. Aztán az Alibaba megerősítette, hogy az övék. Ez a HappyHorse-1.0 története, a sötét ló, amely felkavarta az AI videó rangsorokat.

A leleplezés

Az Artificial Analysis egy Video Arena platformot üzemeltet, ahol a felhasználók beírnak egy promptot, két anonim modell generál kimenetet, és a felhasználók kiválasztják a jobbat. A szavazatok egy Elo-értékelési rendszerbe táplálódnak (ugyanaz a matematika, amit a sakkban használnak). A modellek nem tudják manipulálni a rendszert, mert az értékelők sosem tudják, melyik modell készítette melyik kimenetet.

A HappyHorse-1.0 április 7-én lépett be az arénába üres profillal. Sem logó, sem céges attribúció. Április 10-re elfoglalta az első helyet a négy rangsorolási kategóriából kettőben, és az Alibaba megerősítette a tulajdonjogot egy újonnan létrehozott X-fiókon és egy CNBC-nek adott nyilatkozatban.

💡
Az Alibaba hongkongi tőzsdén jegyzett részvényei 2,12%-ot emelkedtek a bejelentés napján, és a héten korábban már 6,75%-ot erősödtek, miközben a spekuláció nőtt a rejtélyes modell körül.

A számok

A HappyHorse Elo-pontszámai egyértelműen beszélnek:

1333
T2V Elo (hang nélkül)
1392
I2V Elo (hang nélkül)
1205
T2V Elo (hanggal)

A kontextus kedvéért: a korábbi #1 a text-to-video kategóriában a ByteDance Seedance 2.0 volt 1273-as Elo-értékkel. A HappyHorse 60 ponttal verte meg, ami olyan különbség, amelyet általában hónapok alatt lehet behozni. Az image-to-video kategóriában a HappyHorse 1392-t ért el a Seedance 2.0 1355-ös pontszámával szemben.

A hangot is tartalmazó kategóriák más képet mutatnak. A HappyHorse a #2 helyen áll a Seedance 2.0 mögött (1219 vs. 1205 Elo), ami arra utal, hogy a hang pipeline még fejlesztésre szorul a videóminőséghez képest.

KategóriaHappyHorseKorábbi #1Különbség
Text-to-Video (néma)13331273 (Seedance 2.0)+60
Image-to-Video (néma)13921355 (Seedance 2.0)+37
Text-to-Video (hanggal)12051219 (Seedance 2.0)-14

Architektúra: Egyetlen Transformer, minden egyszerre

A legtöbb AI videó rendszer különálló komponenseket láncolat össze: egy szövegkódolót, egy videógenerátort és egy utólag hozzácsatolt hangmodellt. A HappyHorse más megközelítést alkalmaz.

A modell egy 40 rétegű egyszálú Self-Attention Transformert használ Cross-Attention modulok nélkül. A szöveg-, videó- és hangtokenek egyszerre áramlanak ugyanazon a transformer stacken keresztül. Ez az egységes felépítés kiküszöböli a redundáns paramétereket és csökkenti az inferencia komplexitását.

Egységes architektúra
Szöveg, videó és hang feldolgozása egyetlen lépésben. Nincs külön hang pipeline. Kevesebb mozgó alkatrész, alacsonyabb késleltetés.
A hang még lemarad
Az egységes felépítés ellenére a hangminőség a #2 helyen áll a Seedance 2.0 specializált hang pipeline-ja mögött.

Az inferencia pipeline szokatlanul karcsú: mindössze 8 denoising lépés Classifier-Free Guidance (CFG) nélkül. Összehasonlításképpen, sok konkurens modell 25-50 lépést használ bekapcsolt CFG-vel. Ez agresszív desztillációra utal a tanítás során, ahol a nyers kapacitást sebességre cserélték.

A mögöttes csapat

A HappyHorse a Future Life Lab-ból származik, amely az Alibaba Taotian Groupjának (az e-kereskedelmi ágának) része. A vezető Zhang Di, a Kuaishou korábbi alelnöke és a Kling AI technikai vezetője.

Ez a részlet fontos. Zhang Di építette fel a Kling mögötti mérnöki kultúrát, amely 2025 egyik legerősebb AI videómodellje volt. Ismeri az infrastruktúra kihívásait, a tanítási pipeline-okat és az értékelési hiányosságokat. Ennek a tapasztalatnak az Alibaba számítási erőforrásaival való kombinálása más felállás, mint egy önálló startup üzemeltetése.

💡
A HappyHorse natívan támogatja a szájszinkront hat nyelven: kínai, angol, japán, koreai, német és francia. Ez a többnyelvű képesség arra utal, hogy a modellt sokféle, gondosan válogatott adaton tanították.

Miért számít ez a piac szempontjából

Az AI videó piac 2026 áprilisában szokatlanul változékony:

2026. március

A Sora leállítását bejelentették

Az OpenAI megerősítette, hogy a Sora április 26-án megszűnik. A számítási költségek és a versenynyomás fenntarthatatlannak bizonyultak.

2026. február

A Seedance 2.0 szünetel

A ByteDance kénytelen volt leállítani a bevezetést hollywoodi stúdiókkal folytatott szerzői jogi viták miatt.

2026. április 7.

Megjelenik a HappyHorse

Ismeretlen modell lép be az Artificial Analysis Video Arena-ba.

2026. április 10.

Az Alibaba megerősíti a tulajdonjogot

A részvény ugrik, ahogy a személyazonosság kiderül.

A Sora leállásával és a Seedance jogi problémáival a HappyHorse olyan pillanatban érkezik, amikor a piac új éllovast keres. A Runway Gen-4.5 továbbra is erős a produkciós munkafolyamatokban, a Google Veo 3.1 pedig az enterprise integrációs térben dominál. De a nyers generálási minőséget tekintve, amelyet vak emberi preferencia mér, a HappyHorse most az élen áll.

Nyílt forráskód: Hamarosan (talán)

A GitHub repozitórium és a Hugging Face modell hub egyaránt "Hamarosan" feliratot mutat április 11-én. A csapat ígéretet tett a teljes, 15 milliárd paraméteres súlyok nyílt forráskódú kiadására kereskedelmi licenccel. Ha ez megvalósul, a HappyHorse lenne a legnagyobb nyílt forráskódú videómodell, jelentősen nagyobb, mint az LTX-Video 2 milliárd paramétere.

De a "hamarosan" nem egyenlő a "kiadva" állapottal. Amíg a súlyok nem letölthetők és függetlenül nem ellenőrzöttek, a benchmark eredmények csillaggal járnak. Az AI videó közösség megtanulta, hogy meg kell várni a reprodukálható eredményeket, mielőtt győztest hirdetne.

Mire érdemes figyelni

Három dolog fogja meghatározni, hogy a HappyHorse meg tudja-e tartani az előnyét:

  • A nyílt forráskódú súlyok kiadása és a benchmark eredmények független reprodukálása
  • A hangminőség javítása, hogy utolérje vagy megverje a Seedance 2.0-t a hangot is tartalmazó kategóriákban
  • API elérhetőség és árazás, mivel a benchmark dominancia semmit nem jelent, ha az alkotók nem férnek hozzá a modellhez

Az AI videógenerálás gyorsan mozog. Januárban a Runway Gen-4.5 legyőzhetetlennek tűnt. Februárban a Seedance 2.0 vette át a koronát. Most a HappyHorse tartja. A kérdés nem az, hogy valami végül legyőzi-e, hanem hogy mikor és honnan.

Az alkotók és fejlesztők számára, akik ma videó pipeline-okat építenek, a tanulság gyakorlatias: egyetlen modell sem marad sokáig az élen. A legjobb stratégia olyan munkafolyamatok építése, amelyek képesek modellt cserélni, ahogy a ranglista változik, ahelyett, hogy mindent egyetlen névre tennének fel.

💡
Az Alibaba nemrég adta ki a Wan 2.7-et Thinking Mode-dal is, amely a Tongyi Lab részleg egy másik modellje. Két nagy videómodell két különböző Alibaba csapattól ugyanazon a héten: ez egy vállalati szintű AI videó offenzívát jelez.
Damien
DamienAI DeveloperAI Author

Lyoni MI-fejlesztő, aki szeret összetett gépi tanulási koncepciókat egyszerű receptekké alakítani. Amikor épp nem modelleket hibakeres, a Rhône-völgyben kerékpározik.

View profile →

Tetszett, amit olvastál?

Alakítsd ötleteidet korlátlan hosszúságú MI-videókká percek alatt.

Kapcsolódó cikkek

Folytasd a felfedezést ezekkel a kapcsolódó bejegyzésekkel

Tetszett ez a cikk?

Fedezz fel további hasznos információkat, és maradj naprakész legújabb tartalmainkkal.