Meta Pixel본문으로 건너뛰기
DamienDamien· AI 작성, 사람이 검토함
11 min read
819 단어

Alibaba HappyHorse-1.0: 모든 AI 영상 순위를 석권한 미스터리 모델

HappyHorse-1.0이라는 모델이 Artificial Analysis에 익명으로 등장해 텍스트-영상 변환과 이미지-영상 변환 모두에서 1위를 차지한 뒤, Alibaba 소유임이 밝혀졌습니다. 아키텍처, 개발팀, 그리고 AI 영상 시장에 미치는 영향을 정리합니다.

Alibaba HappyHorse-1.0: 모든 AI 영상 순위를 석권한 미스터리 모델

나만의 AI 영상을 만들 준비가 되셨나요?

Bonega.ai를 사용하는 수천 명의 크리에이터와 함께하세요

2026년 4월 7일, 아무도 들어본 적 없는 모델이 Artificial Analysis Video Arena에 나타났습니다. 3일 만에 텍스트-영상 변환과 이미지-영상 변환 두 카테고리 모두에서 1위를 차지했습니다. 브랜드 없음, 보도자료 없음, 회사 이름 없음. 이후 Alibaba가 자사 모델임을 확인했습니다. AI 영상 순위를 완전히 뒤흔든 다크호스, HappyHorse-1.0의 이야기입니다.

정체 공개

Artificial Analysis는 Video Arena를 운영합니다. 사용자가 프롬프트를 제출하면 두 개의 익명 모델이 각각 결과물을 생성하고, 사용자가 더 나은 것을 선택합니다. 투표 결과는 Elo 레이팅 시스템(체스 순위에 사용되는 동일한 수학 모델)에 반영됩니다. 평가자가 어느 모델이 어떤 결과물을 만들었는지 알 수 없기 때문에 조작이 불가능합니다.

HappyHorse-1.0은 4월 7일 빈 프로필로 이 아레나에 진입했습니다. 로고 없음, 회사 귀속 정보 없음. 4월 10일까지 네 개 순위 카테고리 중 두 곳에서 1위를 차지했고, Alibaba는 새로 만든 X 계정과 CNBC에 대한 성명을 통해 소유권을 확인했습니다.

💡
발표 당일 Alibaba 홍콩 상장 주식은 2.12% 상승했습니다. 미스터리 모델에 대한 추측이 고조되던 같은 주 초에 이미 6.75% 상승한 상태였습니다.

숫자로 보는 실력

HappyHorse의 Elo 점수가 모든 것을 말해줍니다.

1333
T2V Elo(오디오 없음)
1392
I2V Elo(오디오 없음)
1205
T2V Elo(오디오 포함)

참고로, 텍스트-영상 변환 기존 1위는 ByteDance의 Seedance 2.0으로 Elo 1273이었습니다. HappyHorse는 60포인트 차이로 앞섰는데, 이 격차를 좁히려면 보통 수개월이 필요합니다. 이미지-영상 변환에서는 HappyHorse가 1392, Seedance 2.0이 1355를 기록했습니다.

오디오 포함 카테고리에서는 양상이 다릅니다. HappyHorse는 Elo 1205로 Seedance 2.0(1219) 뒤 2위에 위치합니다. 영상 품질에 비해 오디오 파이프라인에는 아직 개선이 필요하다는 의미입니다.

카테고리HappyHorse이전 1위격차
텍스트-영상(무음)13331273 (Seedance 2.0)+60
이미지-영상(무음)13921355 (Seedance 2.0)+37
텍스트-영상(오디오 포함)12051219 (Seedance 2.0)-14

아키텍처: 하나의 Transformer로 모든 것을 처리

대부분의 AI 영상 시스템은 텍스트 인코더, 영상 생성기, 이후 추가되는 오디오 모델 등 별도의 컴포넌트를 연결합니다. HappyHorse는 전혀 다른 접근 방식을 취합니다.

이 모델은 Cross-Attention 모듈 없이 40층 단일 스트림 Self-Attention Transformer를 사용합니다. 텍스트, 영상, 오디오 토큰이 모두 동일한 Transformer 스택을 동시에 통과합니다. 이 통합 설계는 중복 파라미터를 제거하고 추론 복잡도를 줄입니다.

통합 아키텍처
텍스트, 영상, 오디오를 단일 패스로 처리. 별도의 오디오 파이프라인 불필요. 구성 요소가 적고 지연 시간이 낮음.
오디오는 여전히 뒤처짐
통합 설계에도 불구하고 오디오 품질은 Seedance 2.0의 전용 오디오 파이프라인에 이어 2위.

추론 파이프라인은 놀라울 정도로 가볍습니다. Classifier-Free Guidance (CFG) 없이 8단계 디노이징만 수행합니다. 비교하자면, 경쟁 모델 다수는 CFG를 활성화한 상태에서 25-50단계를 사용합니다. 이는 학습 과정에서 적극적인 증류를 통해 원시 용량 대신 속도를 선택했음을 시사합니다.

개발팀

HappyHorse는 Alibaba 타오톈 그룹(이커머스 부문) 산하 Future Life Lab에서 개발되었습니다. 책임자는 장디(Zhang Di)로, 전 Kuaishou 부사장이자 Kling AI 기술 총괄입니다.

이 이력은 중요합니다. 장디는 2025년 최강 AI 영상 모델 중 하나인 Kling의 엔지니어링 문화를 구축한 인물입니다. 인프라 과제, 학습 파이프라인, 평가 사각지대를 잘 알고 있습니다. 그 경험을 Alibaba의 컴퓨팅 자원과 결합하면 독립 스타트업을 운영하는 것과는 완전히 다른 결과를 낳습니다.

💡
HappyHorse는 중국어, 영어, 일본어, 한국어, 독일어, 프랑스어 6개 언어의 립싱크를 네이티브로 지원합니다. 이 다국어 지원은 다양하고 세심하게 큐레이션된 데이터로 학습된 모델임을 시사합니다.

시장에 미치는 영향

2026년 4월 AI 영상 시장은 유례없이 유동적입니다.

2026년 3월

Sora 중단 발표

OpenAI가 Sora의 4월 26일 서비스 종료를 확인. 컴퓨팅 비용과 경쟁 압박을 감당할 수 없었습니다.

2026년 2월

Seedance 2.0 출시 중단

ByteDance가 할리우드 스튜디오와의 저작권 분쟁으로 배포를 중단.

2026년 4월 7일

HappyHorse 등장

익명 모델이 Artificial Analysis Video Arena에 진입.

2026년 4월 10일

Alibaba 소유권 확인

정체가 밝혀지며 주가 상승.

Sora가 종료를 앞두고 Seedance가 법적 문제에 직면한 가운데, HappyHorse는 시장이 새로운 선두 주자를 찾고 있는 시점에 등장했습니다. Runway Gen-4.5는 프로덕션 워크플로에서 여전히 강세이고, Google Veo 3.1은 기업 통합 분야를 지배하고 있습니다. 그러나 블라인드 인간 선호도로 측정하는 순수 생성 품질 측면에서는 HappyHorse가 현재 정상에 있습니다.

오픈소스: 곧 공개(아마도)

4월 11일 기준, GitHub 저장소와 Hugging Face 모델 허브 모두 "Coming Soon"으로 표시되어 있습니다. 팀은 150억 파라미터의 전체 가중치를 상업 라이선스로 오픈소스 공개하겠다고 약속했습니다. 실현된다면 HappyHorse는 LTX-Video의 20억 파라미터를 크게 넘어서는, 현존 최대 오픈소스 영상 모델이 됩니다.

하지만 "곧 공개"는 "이미 공개"가 아닙니다. 가중치를 다운로드하고 독립적으로 검증할 수 있을 때까지, 이 벤치마크 결과에는 유보가 필요합니다. AI 영상 커뮤니티는 승자를 선언하기 전에 재현 가능한 결과를 기다리는 법을 배웠습니다.

주목할 점

세 가지 요소가 HappyHorse의 선두 유지 여부를 결정합니다.

  • 오픈소스 가중치 공개 및 벤치마크 결과의 독립적 재현
  • 오디오 품질 개선, 오디오 포함 카테고리에서 Seedance 2.0에 대등하거나 앞서기
  • API 제공과 가격 정책. 크리에이터가 모델에 접근할 수 없다면 벤치마크 1위는 의미가 없음

AI 영상 생성 분야는 빠르게 변합니다. 1월에는 Runway Gen-4.5가 난공불락처럼 보였습니다. 2월에는 Seedance 2.0이 왕좌를 차지했습니다. 지금은 HappyHorse가 그 자리에 있습니다. 문제는 언젠가 무언가가 이를 넘어설 것인지가 아니라, 언제, 어디에서 올 것인지입니다.

현재 영상 파이프라인을 구축 중인 크리에이터와 개발자에게 실질적인 교훈은 분명합니다. 어떤 단일 모델도 오래 정상에 머물지 않습니다. 최선의 전략은 하나의 이름에 모든 것을 거는 것이 아니라, 리더보드가 바뀔 때마다 모델을 유연하게 교체할 수 있는 워크플로를 만드는 것입니다.

💡
Alibaba는 최근 통의 랩(Tongyi Lab) 부서에서 별도의 모델인 Wan 2.7 Thinking Mode도 출시했습니다. 같은 주에 서로 다른 Alibaba 팀에서 두 개의 주요 영상 모델이 등장한 것은 AI 영상 분야에 대한 전사적 집중을 보여줍니다.
Damien
DamienAI DeveloperAI Author

복잡한 ML 개념을 간단한 레시피로 바꾸는 일을 좋아하는 리옹 출신 AI 개발자입니다. 모델 디버깅을 하지 않을 때는 론 계곡을 자전거로 달리는 모습을 볼 수 있습니다.

View profile →

읽으신 내용이 마음에 드셨나요?

몇 분 안에 아이디어를 길이 제한 없는 AI 영상으로 만들어 보세요.

관련 글

관련 게시물을 통해 계속 살펴보세요

이 글이 마음에 드셨나요?

더 많은 인사이트를 발견하고 최신 콘텐츠를 받아보세요.