Meta PixelПремини към основното съдържание
DamienDamien· Автор ИИ, прегледано от човек
6 min read
1023 думи

Alibaba HappyHorse-1.0: непознатият модел, който оглави всички класации за AI видео

Модел на име HappyHorse-1.0 се появи на Artificial Analysis без указание за автора, изкачи се до първото място в text-to-video и image-to-video, а после се оказа разработка на Alibaba. Ето какво знаем за архитектурата, екипа и какво означава това за пазара на AI видео.

Alibaba HappyHorse-1.0: непознатият модел, който оглави всички класации за AI видео

Готови ли сте да създавате собствени ИИ видеа?

Присъединете се към хиляди създатели, които използват Bonega.ai

На 7 април 2026 г. на арената на Artificial Analysis Video Arena се появи модел, за който никой не бе чувал. За три дни той зае първото място едновременно в две категории: text-to-video и image-to-video. Без лого, без прессъобщение, без име на компания. После Alibaba потвърди, че е техен. Това е историята на HappyHorse-1.0, тъмния кон, който разбърка класациите за AI видео.

Разкриването

Artificial Analysis провежда Video Arena, където потребителите въвеждат промпт, два анонимни модела генерират видеа, а потребителите избират по-доброто. Гласовете постъпват в рейтингова система Elo (същата математика, използвана в шахматните класации). Моделите не могат да измамят системата, защото оценяващите не знаят кой модел е създал кой резултат.

HappyHorse-1.0 влезе на арената на 7 април с празен профил. Без лого, без указание за компания. До 10 април моделът зае първата позиция в две от четирите категории на класацията, а Alibaba потвърди авторството чрез новосъздаден акаунт в X и изявление пред CNBC.

💡
Акциите на Alibaba на Хонконгската борса се повишиха с 2,12% в деня на обявлението. По-рано през седмицата, докато спекулациите около мистериозния модел нарастваха, ръстът вече бе достигнал 6,75%.

Числата

Рейтингите Elo на HappyHorse говорят ясно:

1333
T2V Elo (без аудио)
1392
I2V Elo (без аудио)
1205
T2V Elo (с аудио)

За контекст: предишният лидер в text-to-video бе Seedance 2.0 на ByteDance с Elo 1273. HappyHorse го изпревари с 60 точки, разлика, която обикновено отнема месеци за преодоляване. В image-to-video HappyHorse получи 1392 срещу 1355 на Seedance 2.0.

В категориите с аудио картината е различна. HappyHorse е на второ място след Seedance 2.0 (Elo 1219 срещу 1205), което подсказва, че аудиопайплайнът все още се нуждае от работа в сравнение с качеството на видеото.

КатегорияHappyHorseПредишен лидерРазлика
Text-to-Video (без звук)13331273 (Seedance 2.0)+60
Image-to-Video (без звук)13921355 (Seedance 2.0)+37
Text-to-Video (с аудио)12051219 (Seedance 2.0)-14

Архитектура: един Transformer, всичко наведнъж

Повечето AI системи за генериране на видео свързват отделни компоненти в поредица: текстов енкодер, видео генератор и аудио модел, закачен отгоре. HappyHorse избира различен подход.

Моделът използва 40-слоен еднопоточен Self-Attention Transformer без модули Cross-Attention. Текстови, видео и аудио токени преминават през един и същ стек на трансформера едновременно. Тази унифицирана архитектура елиминира излишните параметри и намалява сложността на инференса.

Унифицирана архитектура
Текст, видео и аудио се обработват в един проход. Без отделен аудиопайплайн. По-малко движещи се части, по-ниска латентност.
Аудиото все още изостава
Въпреки унифицирания дизайн, качеството на аудиото се нарежда на второ място след специализирания аудиопайплайн на Seedance 2.0.

Пайплайнът за инференс е необичайно лек: само 8 стъпки за деноизинг без Classifier-Free Guidance (CFG). За сравнение, много конкурентни модели използват 25-50 стъпки с включен CFG. Това подсказва агресивна дистилация по време на обучението, при която скоростта е получена за сметка на обема изчисления.

Екипът

HappyHorse идва от Future Life Lab под Taotian Group (e-commerce подразделението на Alibaba). Ръководителят е Джан Ди, бивш вицепрезидент на Kuaishou и технически лидер на Kling AI.

Тази подробност е важна. Джан Ди изгради инженерната култура на Kling, един от най-силните AI видео модели на 2025 г. Той познава инфраструктурните предизвикателства, обучителните пайплайни и пропуските в оценяването. Пренасянето на този опит върху изчислителните ресурси на Alibaba е съвсем различно уравнение в сравнение с автономен стартъп.

💡
HappyHorse нативно поддържа синхронизация на устните на шест езика: китайски, английски, японски, корейски, немски и френски. Тази многоезична способност подсказва модел, обучен на разнообразни и внимателно подбрани данни.

Какво означава това за пазара

Пазарът на AI видео през април 2026 г. е необичайно нестабилен:

Март 2026

Обявено е закриването на Sora

OpenAI потвърди, че Sora ще прекрати работа на 26 април. Разходите за изчисления и конкурентният натиск се оказаха непосилни.

Февруари 2026

Seedance 2.0 спряна

ByteDance е принудена да спре разгръщането заради спорове за авторски права с холивудски студия.

7 април 2026

Появата на HappyHorse

Анонимен модел влиза на арената на Artificial Analysis Video Arena.

10 април 2026

Alibaba потвърждава авторството

Акциите скачат след разкриването на създателя.

С оттеглянето на Sora и правните проблеми на Seedance, HappyHorse се появява в момент, когато пазарът търси нов лидер. Runway Gen-4.5 все още е силен в продакшън воркфлоу, а Google Veo 3.1 доминира в корпоративните интеграции. Но по чисто качество на генериране, измерено чрез сляпо предпочитание от хора, HappyHorse вече е на върха.

Отворен код: скоро (може би)

На GitHub и в модулния хъб на Hugging Face към 11 април стои надпис "Coming Soon". Екипът обеща да публикува пълните тегла на модела от 15 милиарда параметъра с комерсиален лиценз. Ако това се случи, HappyHorse ще стане най-големият модел с отворен код за генериране на видео, значително по-голям от 2 милиарда параметъра на LTX-Video.

Но "скоро" не значи "публикувано". Докато теглата не могат да бъдат изтеглени и независимо верифицирани, резултатите от бенчмарковете идват със звездичка. AI общността вече се е научила да чака възпроизводими резултати, преди да обявява победители.

Какво да следим

Три фактора ще определят дали HappyHorse ще задържи лидерството:

  • Публикуване на теглата с отворен достъп и независимо възпроизвеждане на резултатите от бенчмарковете
  • Подобряване на качеството на аудиото до нивото на Seedance 2.0 в категориите с аудио
  • Наличност на API и ценообразуване, защото доминирането в бенчмаркове не струва нищо, ако създателите не могат да достъпят модела

Сферата на AI видео генерирането се движи бързо. През януари Runway Gen-4.5 изглеждаше недостижим. През февруари короната зае Seedance 2.0. Сега я държи HappyHorse. Въпросът не е дали нещо ще го надмине, а кога и откъде ще дойде конкурентът.

За създатели и разработчици, които изграждат видеопайплайни днес, изводът е практичен: никой модел не остава на върха задълго. Най-добрата стратегия е да се изграждат воркфлоу с възможност за бърза смяна на модели при промяна на класациите, вместо да се залага на едно име.

💡
Alibaba също наскоро пусна Wan 2.7 с режим Thinking, отделен модел от подразделението Tongyi Lab. Два големи видео модела от различни екипи на Alibaba за една седмица, това е сигнал за мащабно движение на компанията към AI видео.
Damien
DamienAI DeveloperAI Author

Разработчик на ИИ от Лион, който обича да превръща сложни концепции от машинното обучение в прости рецепти. Когато не отстранява грешки в модели, ще го откриете да кара колело из долината на Рона.

View profile →

Хареса ли ви прочетеното?

Превърнете идеите си в ИИ видеа с неограничена дължина само за минути.

Свързани статии

Продължете да разглеждате с тези свързани публикации

Хареса ли ви тази статия?

Открийте още полезни идеи и бъдете в крак с най-новото ни съдържание.