Meta PixelПерейти до основного вмісту
DamienDamien· Автор ШІ, перевірено людиною
5 min read
913 слів

Alibaba HappyHorse-1.0: невідома модель, яка очолила всі рейтинги AI-відео

Модель під назвою HappyHorse-1.0 з'явилася на Artificial Analysis без зазначення автора, піднялася на перше місце у text-to-video та image-to-video, а потім виявилася розробкою Alibaba. Розбираємо архітектуру, команду та наслідки для ринку AI-відео.

Alibaba HappyHorse-1.0: невідома модель, яка очолила всі рейтинги AI-відео

Готові створювати власні ШІ-відео?

Приєднуйтеся до тисяч творців, які використовують Bonega.ai

7 квітня 2026 року на арені Artificial Analysis Video Arena з'явилася модель, про яку ніхто не чув. За три дні вона зайняла перше місце одразу у двох категоріях: text-to-video та image-to-video. Жодного логотипу, жодного пресрелізу, жодної назви компанії. Потім Alibaba підтвердила, що це їхня розробка. Ось історія HappyHorse-1.0, темної конячки, яка перетасувала рейтинги AI-відео.

Розкриття

Artificial Analysis проводить Video Arena, де користувачі вводять промпт, дві анонімні моделі генерують відео, а користувачі обирають краще. Голоси надходять до системи рейтингу Elo (та сама математика, що й у шахових рейтингах). Моделі не можуть обманути систему, бо оцінювачі не знають, яка модель створила який результат.

HappyHorse-1.0 вийшла на арену 7 квітня з порожнім профілем. Ані логотипу, ані зазначення компанії. До 10 квітня модель посіла перший рядок у двох із чотирьох категорій рейтингу, і Alibaba підтвердила авторство через щойно створений акаунт у X та заяву для CNBC.

💡
Акції Alibaba на Гонконгській біржі зросли на 2,12% у день оголошення. За тиждень до цього, поки навколо загадкової моделі наростали чутки, зростання вже сягнуло 6,75%.

Цифри

Рейтинги Elo у HappyHorse кажуть самі за себе:

1333
T2V Elo (без аудіо)
1392
I2V Elo (без аудіо)
1205
T2V Elo (з аудіо)

Для контексту: попередній лідер у text-to-video, Seedance 2.0 від ByteDance, набрав Elo 1273. HappyHorse обійшла його на 60 пунктів, розрив, який зазвичай закривають місяцями. У image-to-video HappyHorse набрала 1392 проти 1355 у Seedance 2.0.

У категоріях з аудіо картина інша. HappyHorse на другому місці після Seedance 2.0 (Elo 1219 проти 1205), що вказує на необхідність доопрацювання аудіопайплайну відносно якості відео.

КатегоріяHappyHorseКолишній лідерРізниця
Text-to-Video (без звуку)13331273 (Seedance 2.0)+60
Image-to-Video (без звуку)13921355 (Seedance 2.0)+37
Text-to-Video (зі звуком)12051219 (Seedance 2.0)-14

Архітектура: один Transformer, все одразу

Більшість AI-систем для генерації відео з'єднують окремі компоненти в ланцюжок: текстовий енкодер, генератор відео та модель аудіо, прикручену зверху. HappyHorse обирає інший шлях.

Модель використовує 40-шаровий однопотоковий Self-Attention Transformer без модулів Cross-Attention. Текстові, відео- та аудіотокени проходять через один і той самий стек трансформера одночасно. Така уніфікована архітектура усуває надлишкові параметри та знижує складність інференсу.

Уніфікована архітектура
Текст, відео та аудіо обробляються за один прохід. Немає окремого аудіопайплайну. Менше рухомих частин, нижча затримка.
Аудіо поки відстає
Попри уніфікований дизайн, якість аудіо посідає друге місце після спеціалізованого аудіопайплайну Seedance 2.0.

Пайплайн інференсу надзвичайно легкий: лише 8 кроків деноізингу без Classifier-Free Guidance (CFG). Для порівняння, багато конкуруючих моделей використовують 25-50 кроків із увімкненим CFG. Це вказує на агресивну дистиляцію під час навчання, де швидкість здобуто за рахунок обсягу обчислень.

Команда

HappyHorse створена у Future Life Lab при Taotian Group (e-commerce підрозділ Alibaba). Керівник проєкту, Чжан Ді, колишній віцепрезидент Kuaishou та технічний лідер Kling AI.

Це важлива деталь. Чжан Ді створив інженерну культуру Kling, однієї з найсильніших AI-відео моделей 2025 року. Він знає інфраструктурні виклики, навчальні пайплайни та прогалини в оцінюванні. Перенесення цього досвіду на обчислювальні ресурси Alibaba, це зовсім інше рівняння порівняно з автономним стартапом.

💡
HappyHorse нативно підтримує синхронізацію губ шістьма мовами: китайською, англійською, японською, корейською, німецькою та французькою. Ця мультимовна здатність вказує на модель, навчену на різноманітних і ретельно відібраних даних.

Що це означає для ринку

Ринок AI-відео у квітні 2026 року надзвичайно нестабільний:

Березень 2026

Оголошено про закриття Sora

OpenAI підтвердила, що Sora припинить роботу 26 квітня. Витрати на обчислення та конкурентний тиск виявилися нестерпними.

Лютий 2026

Seedance 2.0 призупинена

ByteDance змушена зупинити розгортання через суперечки про авторські права з голлівудськими студіями.

7 квітня 2026

Поява HappyHorse

Анонімна модель виходить на арену Artificial Analysis Video Arena.

10 квітня 2026

Alibaba підтверджує авторство

Акції зростають після розкриття особи творця.

З відходом Sora та юридичними проблемами Seedance, HappyHorse з'являється в момент, коли ринок шукає нового лідера. Runway Gen-4.5 досі сильний у продакшн-воркфлоу, а Google Veo 3.1 домінує у корпоративних інтеграціях. Але за чистою якістю генерації, виміряною сліпою перевагою людей, HappyHorse тепер на вершині.

Відкритий код: незабаром (можливо)

На GitHub та в модельному хабі Hugging Face станом на 11 квітня стоїть позначка "Coming Soon". Команда пообіцяла викласти повні ваги моделі на 15 мільярдів параметрів із комерційною ліцензією. Якщо це станеться, HappyHorse стане найбільшою відкритою моделлю генерації відео, значно більшою за 2 мільярди параметрів LTX-Video.

Але "незабаром" не означає "випущено". Поки ваги не можна завантажити та незалежно перевірити, результати бенчмарків ідуть із зірочкою. AI-спільнота вже навчилася чекати відтворюваних результатів, перш ніж оголошувати переможців.

На що звернути увагу

Три фактори визначать, чи утримає HappyHorse лідерство:

  • Публікація ваг у відкритий доступ та незалежне відтворення результатів бенчмарків
  • Покращення якості аудіо до рівня Seedance 2.0 у категоріях з аудіо
  • Доступність API та ціноутворення, бо домінування в бенчмарках нічого не варте, якщо творці не можуть отримати доступ до моделі

Сфера генерації AI-відео рухається швидко. У січні Runway Gen-4.5 здавався недосяжним. У лютому корону забрав Seedance 2.0. Тепер вона у HappyHorse. Питання не в тому, чи хтось обійде цю модель, а коли і звідки прийде конкурент.

Для творців і розробників, які будують відеопайплайни сьогодні, висновок практичний: жодна модель не залишається на вершині надовго. Найкраща стратегія, будувати воркфлоу з можливістю швидкої заміни моделей при зміні рейтингів, а не робити ставку на одне ім'я.

💡
Alibaba також нещодавно випустила Wan 2.7 із режимом Thinking, окрему модель від підрозділу Tongyi Lab. Дві великі відеомоделі від різних команд Alibaba за один тиждень, це сигнал про масштабний рух компанії у бік AI-відео.
Damien
DamienAI DeveloperAI Author

Розробник ШІ з Ліона, який любить перетворювати складні концепції машинного навчання на прості рецепти. Коли він не налагоджує моделі, його можна зустріти на велосипеді в долині Рони.

View profile →

Сподобалося прочитане?

Перетворюйте свої ідеї на ШІ-відео необмеженої тривалості за лічені хвилини.

Схожі статті

Продовжуйте дослідження з цими схожими публікаціями

Вам сподобалася ця стаття?

Відкривайте більше корисного та стежте за нашим найновішим контентом.