SkyReels V4: 영상과 소리를 동시에 보고 듣는 최초의 AI 모델
Skywork AI의 SkyReels V4는 듀얼 스트림 디퓨전 아키텍처를 통해 영상과 동기화된 오디오를 한 번의 생성 과정에서 함께 만들어냅니다. 크리에이터에게 어떤 의미가 있는지 살펴봅니다.

오디오가 늘 AI 영상의 사각지대였던 이유
AI로 생성한 클립에 사운드를 입혀 본 분이라면 그 어려움을 잘 아실 겁니다. 빗방울이 창문을 때리는 영상을 만든 뒤 어울리는 오디오 트랙을 찾고, 타이밍을 맞추고, 어색하지 않기를 바라야 했습니다.
문제의 뿌리는 아키텍처에 있습니다. Kling 3.0이나 Runway Gen-4.5 같은 모델은 처음부터 시각 엔진으로 설계되었습니다. 오디오 지원이 있다 하더라도, 별도의 파이프라인을 통해 사후 동기화하는 방식입니다.
SkyReels V4 의 작동 방식
Skywork AI(쿤룬사의 연구 부문)는 듀얼 스트림 멀티모달 디퓨전 트랜스포머(MMDiT)라 불리는 구조를 만들었습니다. 하나의 신경계를 공유하는 두 명의 전문가 두뇌라고 생각하시면 됩니다.
시각 브랜치
최대 1080p, 32 FPS로 영상 프레임을 생성합니다. 모션, 조명, 장면 구성, 그리고 클립 전체의 시간적 일관성을 담당합니다.
오디오 브랜치
같은 디퓨전 패스 안에서 동기화된 사운드를 생성합니다. 완성된 영상에 소리를 맞추는 것이 아니라, 영상이 형성되는 순간에 함께 사운드를 만들어냅니다.
두 브랜치는 멀티모달 대형 언어 모델을 기반으로 한 텍스트 인코더를 공유합니다. 바로 이 공유 이해 덕분에 "대리석 바닥 위로 슬로 모션으로 깨지는 유리"와 같은 프롬프트에서 시각적 충돌점으로부터 약 40밀리초 이내에 사운드 액센트가 자리 잡습니다. 자연스럽게 느껴지기에 충분한 정밀도입니다.
Seedance, Kling 과의 차이
ByteDance의 Seedance 2.0와 콰이쇼우의 Kling 3.0도 오디오를 지원하지만 접근 방식이 근본적으로 다릅니다. 먼저 영상을 만든 뒤, 두 번째 모델로 어울리는 사운드를 만들어냅니다. 이 순차적 방식에서는 오디오가 항상 완성된 프레임에 반응할 뿐, 함께 창조되지는 않습니다.
SkyReels V4 의 듀얼 스트림 구조가 가져오는 변화는 다음과 같습니다.
- ✓오디오와 시각 요소가 처음부터 의미적으로 정렬됩니다
- ✓말하는 인물의 입 모양이 자음에 정확히 맞아 떨어집니다
- ✓환경음이 재질 특성에 맞춰 달라집니다(금속, 나무, 유리)
- ✓타이밍 어긋남을 바로잡는 후처리가 필요 없습니다
풍경 영상에서는 차이를 알아차리기 어렵지만, 사람이 말하거나 물체가 표면과 부딪히는 장면에서는 차이가 극적으로 드러납니다.
오픈 소스에 관한 질문
이전 SkyReels 버전(V1부터 V3까지)은 완전한 오픈 소스로, HuggingFace와 GitHub에서 가중치를 받을 수 있었습니다. V4는 현재 skyreels.ai 공식 플랫폼에서 무료 티어가 제공되는 한정 프리뷰 단계이며, 전체 가중치는 아직 공개되지 않았습니다.
공식 플랫폼에서 일일 생성 한도가 있는 무료 티어를 제공합니다. arXiv 논문(2602.21818)에 전체 아키텍처가 상세히 담겨 있으며, 이전 버전들은 여전히 오픈 소스로 유지됩니다.
V4 가중치는 아직 다운로드할 수 없습니다. 자체 호스팅 옵션도, 정식 프로덕션 API도 없습니다. 오픈 소스 공개 일정은 불투명합니다.
오픈 소스 커뮤니티 입장에서는 주의 깊게 지켜볼 만한 흐름입니다. Skywork가 기존 패턴을 따른다면 V4 가중치도 결국 HuggingFace에 도달할 것입니다. 오늘 당장 오픈 소스 기반의 음성 영상 생성이 필요하다면, 가장 가까운 대안은 SkyReels V3와 별도의 오디오 모델 조합입니다.
리더보드 속 SkyReels V4 의 위치
인간의 블라인드 선호 투표를 사용하는 Artificial Analysis Video Arena에서 SkyReels V4의 텍스트 투 비디오 Elo는 현재 1,244점입니다. Kling 3.0(1,243)과 거의 동률이며, 현재 1위인 알리바바의 HappyHorse-1.0(1,347)에는 못 미칩니다.
| 모델 | Elo 점수 | 오디오 지원 | 오픈 소스 | 적합한 용도 |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | 없음 | 아니오 | 순수 시각 품질 |
| SkyReels V4 | 1,244 | 네이티브(듀얼 스트림) | 검토 중 | 영상과 음성 콘텐츠 |
| Kling 3.0 | 1,243 | 순차형 | 아니오 | 양산 규모 |
| Wan 2.7 | 최상위권 | 없음 | 예 | 포토리얼리즘 |
| LTX-2 | 하위 | 없음 | 예 | 비용 효율 |

SkyReels V4와 HappyHorse 사이의 시각적 격차는 실존합니다. 그러나 SkyReels는 상위 5개 모델 중 유일하게 오디오를 네이티브로 생성합니다. 사운드가 필요한 워크플로라면, 이 아키텍처적 강점은 100점의 Elo 차이보다 더 큰 의미를 가집니다.
크리에이터에게 갖는 의미
소셜 콘텐츠 크리에이터
뮤직 비디오 제작자
광고 크리에이터
더 큰 흐름: 오디오는 더 이상 선택이 아닙니다
SkyReels V4는 고립된 실험이 아닙니다. ByteDance Seedance 1.5 Pro가 음성 영상 생성을 도입한 사례와 AI 영상이 무성 시대에서 벗어나는 전체적인 흐름을 다뤄 왔습니다. SkyReels V4가 더한 것은, 이 작업을 후처리 트릭이 아닌 아키텍처 차원에서 해낼 수 있다는 증명입니다.
결론은 분명합니다. 2026년 말이면 네이티브 오디오가 없는 AI 영상 모델은 미완성처럼 느껴질 것입니다. 문제는 이것이 표준이 될지가 아니라, 얼마나 빨리 자리 잡을지입니다.
빠른 참조: SkyReels V4
- 개발사: Skywork AI (쿤룬사)
- 아키텍처: 듀얼 스트림 멀티모달 디퓨전 트랜스포머 (MMDiT)
- 해상도: 최대 1080p, 32 FPS
- 길이: 최대 15초
- 오디오: 네이티브 공동 생성 (후처리 아님)
- 입력: 텍스트, 이미지, 영상 클립, 마스크, 참조 오디오
- 상태: skyreels.ai 한정 프리뷰 (가중치 오픈 소스 공개 예정)
- 논문: arXiv 2602.21818

AI와 예술이 만나는 지점을 탐구하는 로잔 출신 크리에이티브 테크놀로지스트입니다. 일렉트로닉 음악 작업 사이에 생성형 모델을 실험합니다.
View profile →관련 글
관련 게시물을 통해 계속 살펴보세요

2026년 3월 AI 쓰나미: 7일 동안 12개 모델로 클라우드 시대의 종말
2026년 3월은 AI 비디오 모델 출시 역사상 가장 집중된 폭발을 목격했습니다. 단 일주일 안에 12개 이상의 새로운 모델이 나왔고, 최대의 이야기는 단일 출시가 아니라 로컬 생성이 이제 클라우드와 필적한다는 것입니다.

Helios: 소비자용 하드웨어에서 작동하는 실시간 AI 동영상 생성 14B 모델
베이징 대학, ByteDance, Canva의 Helios는 그룹 오프로딩으로 단 6GB VRAM으로 초당 19.5프레임의 속도로 최대 60초 길이의 AI 동영상을 생성하며 완전히 오픈소스입니다.

로컬에서 AI 비디오 실행: 2026년 LTX-2, RTX, ComfyUI
LTX-2와 ComfyUI를 사용하여 자신의 GPU에서 4K AI 비디오를 생성하세요. 구독 없이, 클라우드 없이, 데이터 프라이버시 걱정 없이. 시작하기 위해 필요한 모든 것이 여기 있습니다.
