Alibaba HappyHorse-1.0: невідома модель, яка очолила всі рейтинги AI-відео
Модель під назвою HappyHorse-1.0 з'явилася на Artificial Analysis без зазначення автора, піднялася на перше місце у text-to-video та image-to-video, а потім виявилася розробкою Alibaba. Розбираємо архітектуру, команду та наслідки для ринку AI-відео.

Розкриття
Artificial Analysis проводить Video Arena, де користувачі вводять промпт, дві анонімні моделі генерують відео, а користувачі обирають краще. Голоси надходять до системи рейтингу Elo (та сама математика, що й у шахових рейтингах). Моделі не можуть обманути систему, бо оцінювачі не знають, яка модель створила який результат.
HappyHorse-1.0 вийшла на арену 7 квітня з порожнім профілем. Ані логотипу, ані зазначення компанії. До 10 квітня модель посіла перший рядок у двох із чотирьох категорій рейтингу, і Alibaba підтвердила авторство через щойно створений акаунт у X та заяву для CNBC.
Цифри
Рейтинги Elo у HappyHorse кажуть самі за себе:
Для контексту: попередній лідер у text-to-video, Seedance 2.0 від ByteDance, набрав Elo 1273. HappyHorse обійшла його на 60 пунктів, розрив, який зазвичай закривають місяцями. У image-to-video HappyHorse набрала 1392 проти 1355 у Seedance 2.0.
У категоріях з аудіо картина інша. HappyHorse на другому місці після Seedance 2.0 (Elo 1219 проти 1205), що вказує на необхідність доопрацювання аудіопайплайну відносно якості відео.
| Категорія | HappyHorse | Колишній лідер | Різниця |
|---|---|---|---|
| Text-to-Video (без звуку) | 1333 | 1273 (Seedance 2.0) | +60 |
| Image-to-Video (без звуку) | 1392 | 1355 (Seedance 2.0) | +37 |
| Text-to-Video (зі звуком) | 1205 | 1219 (Seedance 2.0) | -14 |
Архітектура: один Transformer, все одразу
Більшість AI-систем для генерації відео з'єднують окремі компоненти в ланцюжок: текстовий енкодер, генератор відео та модель аудіо, прикручену зверху. HappyHorse обирає інший шлях.
Модель використовує 40-шаровий однопотоковий Self-Attention Transformer без модулів Cross-Attention. Текстові, відео- та аудіотокени проходять через один і той самий стек трансформера одночасно. Така уніфікована архітектура усуває надлишкові параметри та знижує складність інференсу.
Пайплайн інференсу надзвичайно легкий: лише 8 кроків деноізингу без Classifier-Free Guidance (CFG). Для порівняння, багато конкуруючих моделей використовують 25-50 кроків із увімкненим CFG. Це вказує на агресивну дистиляцію під час навчання, де швидкість здобуто за рахунок обсягу обчислень.
Команда
HappyHorse створена у Future Life Lab при Taotian Group (e-commerce підрозділ Alibaba). Керівник проєкту, Чжан Ді, колишній віцепрезидент Kuaishou та технічний лідер Kling AI.
Це важлива деталь. Чжан Ді створив інженерну культуру Kling, однієї з найсильніших AI-відео моделей 2025 року. Він знає інфраструктурні виклики, навчальні пайплайни та прогалини в оцінюванні. Перенесення цього досвіду на обчислювальні ресурси Alibaba, це зовсім інше рівняння порівняно з автономним стартапом.
Що це означає для ринку
Ринок AI-відео у квітні 2026 року надзвичайно нестабільний:
Оголошено про закриття Sora
OpenAI підтвердила, що Sora припинить роботу 26 квітня. Витрати на обчислення та конкурентний тиск виявилися нестерпними.
Seedance 2.0 призупинена
ByteDance змушена зупинити розгортання через суперечки про авторські права з голлівудськими студіями.
Поява HappyHorse
Анонімна модель виходить на арену Artificial Analysis Video Arena.
Alibaba підтверджує авторство
Акції зростають після розкриття особи творця.
З відходом Sora та юридичними проблемами Seedance, HappyHorse з'являється в момент, коли ринок шукає нового лідера. Runway Gen-4.5 досі сильний у продакшн-воркфлоу, а Google Veo 3.1 домінує у корпоративних інтеграціях. Але за чистою якістю генерації, виміряною сліпою перевагою людей, HappyHorse тепер на вершині.
Відкритий код: незабаром (можливо)
На GitHub та в модельному хабі Hugging Face станом на 11 квітня стоїть позначка "Coming Soon". Команда пообіцяла викласти повні ваги моделі на 15 мільярдів параметрів із комерційною ліцензією. Якщо це станеться, HappyHorse стане найбільшою відкритою моделлю генерації відео, значно більшою за 2 мільярди параметрів LTX-Video.
Але "незабаром" не означає "випущено". Поки ваги не можна завантажити та незалежно перевірити, результати бенчмарків ідуть із зірочкою. AI-спільнота вже навчилася чекати відтворюваних результатів, перш ніж оголошувати переможців.
На що звернути увагу
Три фактори визначать, чи утримає HappyHorse лідерство:
- ✓Публікація ваг у відкритий доступ та незалежне відтворення результатів бенчмарків
- ✓Покращення якості аудіо до рівня Seedance 2.0 у категоріях з аудіо
- ✓Доступність API та ціноутворення, бо домінування в бенчмарках нічого не варте, якщо творці не можуть отримати доступ до моделі
Сфера генерації AI-відео рухається швидко. У січні Runway Gen-4.5 здавався недосяжним. У лютому корону забрав Seedance 2.0. Тепер вона у HappyHorse. Питання не в тому, чи хтось обійде цю модель, а коли і звідки прийде конкурент.
Для творців і розробників, які будують відеопайплайни сьогодні, висновок практичний: жодна модель не залишається на вершині надовго. Найкраща стратегія, будувати воркфлоу з можливістю швидкої заміни моделей при зміні рейтингів, а не робити ставку на одне ім'я.

Розробник ШІ з Ліона, який любить перетворювати складні концепції машинного навчання на прості рецепти. Коли він не налагоджує моделі, його можна зустріти на велосипеді в долині Рони.
View profile →Схожі статті
Продовжуйте дослідження з цими схожими публікаціями

Alibaba Wan 2.7: як Thinking Mode змінює генерацію відео за допомогою ШІ
Alibaba щойно випустила Wan 2.7 з новим режимом Thinking Mode, який планує композицію перед генерацією відео. Розбираємо, як це працює і що це означає для творців контенту.

AI-відео після Sora: 4 ринкові рівні, які варто знати у 2026
Sora закривається 26 квітня. Ринок AI-відео консолідувався в чотири рівні. Практичний посібник з вибору правильної альтернативи Sora для ваших потреб.

Google Veo 3.1 став безкоштовним: 10 AI-відео на місяць для кожного акаунту Google
Google відкрив Veo 3.1 для всіх особистих акаунтів з 10 безкоштовними генераціями відео щомісяця. Ось що ви отримуєте, які обмеження і чому це важливо для творців AI-відео.