Alibaba HappyHorse-1.0: 모든 AI 영상 순위를 석권한 미스터리 모델
HappyHorse-1.0이라는 모델이 Artificial Analysis에 익명으로 등장해 텍스트-영상 변환과 이미지-영상 변환 모두에서 1위를 차지한 뒤, Alibaba 소유임이 밝혀졌습니다. 아키텍처, 개발팀, 그리고 AI 영상 시장에 미치는 영향을 정리합니다.

정체 공개
Artificial Analysis는 Video Arena를 운영합니다. 사용자가 프롬프트를 제출하면 두 개의 익명 모델이 각각 결과물을 생성하고, 사용자가 더 나은 것을 선택합니다. 투표 결과는 Elo 레이팅 시스템(체스 순위에 사용되는 동일한 수학 모델)에 반영됩니다. 평가자가 어느 모델이 어떤 결과물을 만들었는지 알 수 없기 때문에 조작이 불가능합니다.
HappyHorse-1.0은 4월 7일 빈 프로필로 이 아레나에 진입했습니다. 로고 없음, 회사 귀속 정보 없음. 4월 10일까지 네 개 순위 카테고리 중 두 곳에서 1위를 차지했고, Alibaba는 새로 만든 X 계정과 CNBC에 대한 성명을 통해 소유권을 확인했습니다.
숫자로 보는 실력
HappyHorse의 Elo 점수가 모든 것을 말해줍니다.
참고로, 텍스트-영상 변환 기존 1위는 ByteDance의 Seedance 2.0으로 Elo 1273이었습니다. HappyHorse는 60포인트 차이로 앞섰는데, 이 격차를 좁히려면 보통 수개월이 필요합니다. 이미지-영상 변환에서는 HappyHorse가 1392, Seedance 2.0이 1355를 기록했습니다.
오디오 포함 카테고리에서는 양상이 다릅니다. HappyHorse는 Elo 1205로 Seedance 2.0(1219) 뒤 2위에 위치합니다. 영상 품질에 비해 오디오 파이프라인에는 아직 개선이 필요하다는 의미입니다.
| 카테고리 | HappyHorse | 이전 1위 | 격차 |
|---|---|---|---|
| 텍스트-영상(무음) | 1333 | 1273 (Seedance 2.0) | +60 |
| 이미지-영상(무음) | 1392 | 1355 (Seedance 2.0) | +37 |
| 텍스트-영상(오디오 포함) | 1205 | 1219 (Seedance 2.0) | -14 |
아키텍처: 하나의 Transformer로 모든 것을 처리
대부분의 AI 영상 시스템은 텍스트 인코더, 영상 생성기, 이후 추가되는 오디오 모델 등 별도의 컴포넌트를 연결합니다. HappyHorse는 전혀 다른 접근 방식을 취합니다.
이 모델은 Cross-Attention 모듈 없이 40층 단일 스트림 Self-Attention Transformer를 사용합니다. 텍스트, 영상, 오디오 토큰이 모두 동일한 Transformer 스택을 동시에 통과합니다. 이 통합 설계는 중복 파라미터를 제거하고 추론 복잡도를 줄입니다.
추론 파이프라인은 놀라울 정도로 가볍습니다. Classifier-Free Guidance (CFG) 없이 8단계 디노이징만 수행합니다. 비교하자면, 경쟁 모델 다수는 CFG를 활성화한 상태에서 25-50단계를 사용합니다. 이는 학습 과정에서 적극적인 증류를 통해 원시 용량 대신 속도를 선택했음을 시사합니다.
개발팀
HappyHorse는 Alibaba 타오톈 그룹(이커머스 부문) 산하 Future Life Lab에서 개발되었습니다. 책임자는 장디(Zhang Di)로, 전 Kuaishou 부사장이자 Kling AI 기술 총괄입니다.
이 이력은 중요합니다. 장디는 2025년 최강 AI 영상 모델 중 하나인 Kling의 엔지니어링 문화를 구축한 인물입니다. 인프라 과제, 학습 파이프라인, 평가 사각지대를 잘 알고 있습니다. 그 경험을 Alibaba의 컴퓨팅 자원과 결합하면 독립 스타트업을 운영하는 것과는 완전히 다른 결과를 낳습니다.
시장에 미치는 영향
2026년 4월 AI 영상 시장은 유례없이 유동적입니다.
Seedance 2.0 출시 중단
ByteDance가 할리우드 스튜디오와의 저작권 분쟁으로 배포를 중단.
HappyHorse 등장
익명 모델이 Artificial Analysis Video Arena에 진입.
Alibaba 소유권 확인
정체가 밝혀지며 주가 상승.
Sora가 종료를 앞두고 Seedance가 법적 문제에 직면한 가운데, HappyHorse는 시장이 새로운 선두 주자를 찾고 있는 시점에 등장했습니다. Runway Gen-4.5는 프로덕션 워크플로에서 여전히 강세이고, Google Veo 3.1은 기업 통합 분야를 지배하고 있습니다. 그러나 블라인드 인간 선호도로 측정하는 순수 생성 품질 측면에서는 HappyHorse가 현재 정상에 있습니다.
오픈소스: 곧 공개(아마도)
4월 11일 기준, GitHub 저장소와 Hugging Face 모델 허브 모두 "Coming Soon"으로 표시되어 있습니다. 팀은 150억 파라미터의 전체 가중치를 상업 라이선스로 오픈소스 공개하겠다고 약속했습니다. 실현된다면 HappyHorse는 LTX-Video의 20억 파라미터를 크게 넘어서는, 현존 최대 오픈소스 영상 모델이 됩니다.
하지만 "곧 공개"는 "이미 공개"가 아닙니다. 가중치를 다운로드하고 독립적으로 검증할 수 있을 때까지, 이 벤치마크 결과에는 유보가 필요합니다. AI 영상 커뮤니티는 승자를 선언하기 전에 재현 가능한 결과를 기다리는 법을 배웠습니다.
주목할 점
세 가지 요소가 HappyHorse의 선두 유지 여부를 결정합니다.
- ✓오픈소스 가중치 공개 및 벤치마크 결과의 독립적 재현
- ✓오디오 품질 개선, 오디오 포함 카테고리에서 Seedance 2.0에 대등하거나 앞서기
- ✓API 제공과 가격 정책. 크리에이터가 모델에 접근할 수 없다면 벤치마크 1위는 의미가 없음
AI 영상 생성 분야는 빠르게 변합니다. 1월에는 Runway Gen-4.5가 난공불락처럼 보였습니다. 2월에는 Seedance 2.0이 왕좌를 차지했습니다. 지금은 HappyHorse가 그 자리에 있습니다. 문제는 언젠가 무언가가 이를 넘어설 것인지가 아니라, 언제, 어디에서 올 것인지입니다.
현재 영상 파이프라인을 구축 중인 크리에이터와 개발자에게 실질적인 교훈은 분명합니다. 어떤 단일 모델도 오래 정상에 머물지 않습니다. 최선의 전략은 하나의 이름에 모든 것을 거는 것이 아니라, 리더보드가 바뀔 때마다 모델을 유연하게 교체할 수 있는 워크플로를 만드는 것입니다.

복잡한 ML 개념을 간단한 레시피로 바꾸는 일을 좋아하는 리옹 출신 AI 개발자입니다. 모델 디버깅을 하지 않을 때는 론 계곡을 자전거로 달리는 모습을 볼 수 있습니다.
View profile →관련 글
관련 게시물을 통해 계속 살펴보세요

Alibaba Wan 2.7: 사고 모드가 AI 영상 생성을 어떻게 바꾸는가
Alibaba가 새로운 사고 모드를 탑재한 Wan 2.7을 출시했습니다. 영상 생성 전 구도를 계획하는 이 기능의 작동 원리와 크리에이터에게 미치는 영향을 분석합니다.

Sora 종료 후 AI 동영상 시장: 2026년에 알아야 할 4가지 시장 계층
Sora는 4월 26일에 종료됩니다. AI 동영상 시장은 4개의 계층으로 통합되었습니다. 필요에 맞는 적합한 Sora 대안을 선택하기 위한 실용적인 가이드입니다.

Google Veo 3.1 무료 개방: 모든 Google 계정에서 월 10개 AI 영상 생성 가능
Google이 모든 개인 계정에 Veo 3.1을 개방하며 월 10회 무료 영상 생성을 제공합니다. 구체적인 내용, 제한 사항, 그리고 AI 영상 크리에이터에게 왜 중요한지 알아봅니다.