Alibaba HappyHorse-1.0: A rejtélyes modell, amely minden AI videó ranglistát meghódított
Egy HappyHorse-1.0 nevű modell jelent meg az Artificial Analysis platformon tulajdonos megjelölése nélkül, feljutott az első helyre mind a text-to-video, mind az image-to-video kategóriában, majd kiderült, hogy az Alibaba fejlesztette. Íme, amit tudunk az architektúráról, a csapatról és a piaci hatásokról.

A leleplezés
Az Artificial Analysis egy Video Arena platformot üzemeltet, ahol a felhasználók beírnak egy promptot, két anonim modell generál kimenetet, és a felhasználók kiválasztják a jobbat. A szavazatok egy Elo-értékelési rendszerbe táplálódnak (ugyanaz a matematika, amit a sakkban használnak). A modellek nem tudják manipulálni a rendszert, mert az értékelők sosem tudják, melyik modell készítette melyik kimenetet.
A HappyHorse-1.0 április 7-én lépett be az arénába üres profillal. Sem logó, sem céges attribúció. Április 10-re elfoglalta az első helyet a négy rangsorolási kategóriából kettőben, és az Alibaba megerősítette a tulajdonjogot egy újonnan létrehozott X-fiókon és egy CNBC-nek adott nyilatkozatban.
A számok
A HappyHorse Elo-pontszámai egyértelműen beszélnek:
A kontextus kedvéért: a korábbi #1 a text-to-video kategóriában a ByteDance Seedance 2.0 volt 1273-as Elo-értékkel. A HappyHorse 60 ponttal verte meg, ami olyan különbség, amelyet általában hónapok alatt lehet behozni. Az image-to-video kategóriában a HappyHorse 1392-t ért el a Seedance 2.0 1355-ös pontszámával szemben.
A hangot is tartalmazó kategóriák más képet mutatnak. A HappyHorse a #2 helyen áll a Seedance 2.0 mögött (1219 vs. 1205 Elo), ami arra utal, hogy a hang pipeline még fejlesztésre szorul a videóminőséghez képest.
| Kategória | HappyHorse | Korábbi #1 | Különbség |
|---|---|---|---|
| Text-to-Video (néma) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (néma) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (hanggal) | 1205 | 1219 (Seedance 2.0) | -14 |
Architektúra: Egyetlen Transformer, minden egyszerre
A legtöbb AI videó rendszer különálló komponenseket láncolat össze: egy szövegkódolót, egy videógenerátort és egy utólag hozzácsatolt hangmodellt. A HappyHorse más megközelítést alkalmaz.
A modell egy 40 rétegű egyszálú Self-Attention Transformert használ Cross-Attention modulok nélkül. A szöveg-, videó- és hangtokenek egyszerre áramlanak ugyanazon a transformer stacken keresztül. Ez az egységes felépítés kiküszöböli a redundáns paramétereket és csökkenti az inferencia komplexitását.
Az inferencia pipeline szokatlanul karcsú: mindössze 8 denoising lépés Classifier-Free Guidance (CFG) nélkül. Összehasonlításképpen, sok konkurens modell 25-50 lépést használ bekapcsolt CFG-vel. Ez agresszív desztillációra utal a tanítás során, ahol a nyers kapacitást sebességre cserélték.
A mögöttes csapat
A HappyHorse a Future Life Lab-ból származik, amely az Alibaba Taotian Groupjának (az e-kereskedelmi ágának) része. A vezető Zhang Di, a Kuaishou korábbi alelnöke és a Kling AI technikai vezetője.
Ez a részlet fontos. Zhang Di építette fel a Kling mögötti mérnöki kultúrát, amely 2025 egyik legerősebb AI videómodellje volt. Ismeri az infrastruktúra kihívásait, a tanítási pipeline-okat és az értékelési hiányosságokat. Ennek a tapasztalatnak az Alibaba számítási erőforrásaival való kombinálása más felállás, mint egy önálló startup üzemeltetése.
Miért számít ez a piac szempontjából
Az AI videó piac 2026 áprilisában szokatlanul változékony:
A Sora leállítását bejelentették
Az OpenAI megerősítette, hogy a Sora április 26-án megszűnik. A számítási költségek és a versenynyomás fenntarthatatlannak bizonyultak.
A Seedance 2.0 szünetel
A ByteDance kénytelen volt leállítani a bevezetést hollywoodi stúdiókkal folytatott szerzői jogi viták miatt.
Megjelenik a HappyHorse
Ismeretlen modell lép be az Artificial Analysis Video Arena-ba.
Az Alibaba megerősíti a tulajdonjogot
A részvény ugrik, ahogy a személyazonosság kiderül.
A Sora leállásával és a Seedance jogi problémáival a HappyHorse olyan pillanatban érkezik, amikor a piac új éllovast keres. A Runway Gen-4.5 továbbra is erős a produkciós munkafolyamatokban, a Google Veo 3.1 pedig az enterprise integrációs térben dominál. De a nyers generálási minőséget tekintve, amelyet vak emberi preferencia mér, a HappyHorse most az élen áll.
Nyílt forráskód: Hamarosan (talán)
A GitHub repozitórium és a Hugging Face modell hub egyaránt "Hamarosan" feliratot mutat április 11-én. A csapat ígéretet tett a teljes, 15 milliárd paraméteres súlyok nyílt forráskódú kiadására kereskedelmi licenccel. Ha ez megvalósul, a HappyHorse lenne a legnagyobb nyílt forráskódú videómodell, jelentősen nagyobb, mint az LTX-Video 2 milliárd paramétere.
De a "hamarosan" nem egyenlő a "kiadva" állapottal. Amíg a súlyok nem letölthetők és függetlenül nem ellenőrzöttek, a benchmark eredmények csillaggal járnak. Az AI videó közösség megtanulta, hogy meg kell várni a reprodukálható eredményeket, mielőtt győztest hirdetne.
Mire érdemes figyelni
Három dolog fogja meghatározni, hogy a HappyHorse meg tudja-e tartani az előnyét:
- ✓A nyílt forráskódú súlyok kiadása és a benchmark eredmények független reprodukálása
- ✓A hangminőség javítása, hogy utolérje vagy megverje a Seedance 2.0-t a hangot is tartalmazó kategóriákban
- ✓API elérhetőség és árazás, mivel a benchmark dominancia semmit nem jelent, ha az alkotók nem férnek hozzá a modellhez
Az AI videógenerálás gyorsan mozog. Januárban a Runway Gen-4.5 legyőzhetetlennek tűnt. Februárban a Seedance 2.0 vette át a koronát. Most a HappyHorse tartja. A kérdés nem az, hogy valami végül legyőzi-e, hanem hogy mikor és honnan.
Az alkotók és fejlesztők számára, akik ma videó pipeline-okat építenek, a tanulság gyakorlatias: egyetlen modell sem marad sokáig az élen. A legjobb stratégia olyan munkafolyamatok építése, amelyek képesek modellt cserélni, ahogy a ranglista változik, ahelyett, hogy mindent egyetlen névre tennének fel.

Lyoni MI-fejlesztő, aki szeret összetett gépi tanulási koncepciókat egyszerű receptekké alakítani. Amikor épp nem modelleket hibakeres, a Rhône-völgyben kerékpározik.
View profile →Kapcsolódó cikkek
Folytasd a felfedezést ezekkel a kapcsolódó bejegyzésekkel

Alibaba Wan 2.7: Hogyan változtatja meg a Thinking Mode az AI videógenerálást
Az Alibaba kiadta a Wan 2.7-et egy új Thinking Mode funkcióval, amely megtervezi a kompozíciókat a videó generálása előtt. Bemutatjuk, hogyan működik és mit jelent ez a tartalomkészítők számára.

AI videó piac a Sora után: 4 piaci szint 2026-ban
A Sora április 26-án bezár. Az AI videó piac négy világos szintre konszolidálódott. Gyakorlati útmutató a megfelelő Sora alternatíva kiválasztásához.

A Google Veo 3.1 ingyenes lett: havi 10 AI videó minden Google-fiókhoz
A Google megnyitotta a Veo 3.1-et minden személyes fiók számára, havi 10 ingyenes videógenerálással. Íme, mit kapsz, mik a korlátok, és miért fontos ez az AI videókészítők számára.