Meta Pixel본문으로 건너뛰기
HenryHenry· AI 작성, 사람이 검토함
12 min read
908 단어

SkyReels V4: 영상과 소리를 동시에 보고 듣는 최초의 AI 모델

Skywork AI의 SkyReels V4는 듀얼 스트림 디퓨전 아키텍처를 통해 영상과 동기화된 오디오를 한 번의 생성 과정에서 함께 만들어냅니다. 크리에이터에게 어떤 의미가 있는지 살펴봅니다.

SkyReels V4: 영상과 소리를 동시에 보고 듣는 최초의 AI 모델

나만의 AI 영상을 만들 준비가 되셨나요?

Bonega.ai를 사용하는 수천 명의 크리에이터와 함께하세요

지금까지 모든 AI 영상 모델은 오디오를 사후 작업으로 다뤄 왔습니다. 먼저 영상을 만들고 나중에 사운드를 덧붙이는 방식이었습니다. SkyReels V4는 이 워크플로 자체를 완전히 뒤집습니다. 영상과 소리를 동시에 사고하는 최초의 모델이며, 결과는 놀라울 정도로 자연스럽습니다.

오디오가 늘 AI 영상의 사각지대였던 이유

AI로 생성한 클립에 사운드를 입혀 본 분이라면 그 어려움을 잘 아실 겁니다. 빗방울이 창문을 때리는 영상을 만든 뒤 어울리는 오디오 트랙을 찾고, 타이밍을 맞추고, 어색하지 않기를 바라야 했습니다.

문제의 뿌리는 아키텍처에 있습니다. Kling 3.0이나 Runway Gen-4.5 같은 모델은 처음부터 시각 엔진으로 설계되었습니다. 오디오 지원이 있다 하더라도, 별도의 파이프라인을 통해 사후 동기화하는 방식입니다.

💡
이 긴장 관계는 통합 오디오 영상 생성을 다룬 심층 글에서 자세히 살펴봤습니다. SkyReels V4는 이를 실제 아키텍처 차원에서 해결한 최초의 양산 모델입니다.

SkyReels V4 의 작동 방식

Skywork AI(쿤룬사의 연구 부문)는 듀얼 스트림 멀티모달 디퓨전 트랜스포머(MMDiT)라 불리는 구조를 만들었습니다. 하나의 신경계를 공유하는 두 명의 전문가 두뇌라고 생각하시면 됩니다.

시각 브랜치

최대 1080p, 32 FPS로 영상 프레임을 생성합니다. 모션, 조명, 장면 구성, 그리고 클립 전체의 시간적 일관성을 담당합니다.

오디오 브랜치

같은 디퓨전 패스 안에서 동기화된 사운드를 생성합니다. 완성된 영상에 소리를 맞추는 것이 아니라, 영상이 형성되는 순간에 함께 사운드를 만들어냅니다.

두 브랜치는 멀티모달 대형 언어 모델을 기반으로 한 텍스트 인코더를 공유합니다. 바로 이 공유 이해 덕분에 "대리석 바닥 위로 슬로 모션으로 깨지는 유리"와 같은 프롬프트에서 시각적 충돌점으로부터 약 40밀리초 이내에 사운드 액센트가 자리 잡습니다. 자연스럽게 느껴지기에 충분한 정밀도입니다.

1080p
최대 해상도
32 FPS
프레임 레이트
15s
최대 길이
~40ms
오디오 동기화 정밀도

Seedance, Kling 과의 차이

ByteDance의 Seedance 2.0와 콰이쇼우의 Kling 3.0도 오디오를 지원하지만 접근 방식이 근본적으로 다릅니다. 먼저 영상을 만든 뒤, 두 번째 모델로 어울리는 사운드를 만들어냅니다. 이 순차적 방식에서는 오디오가 항상 완성된 프레임에 반응할 뿐, 함께 창조되지는 않습니다.

SkyReels V4 의 듀얼 스트림 구조가 가져오는 변화는 다음과 같습니다.

  • 오디오와 시각 요소가 처음부터 의미적으로 정렬됩니다
  • 말하는 인물의 입 모양이 자음에 정확히 맞아 떨어집니다
  • 환경음이 재질 특성에 맞춰 달라집니다(금속, 나무, 유리)
  • 타이밍 어긋남을 바로잡는 후처리가 필요 없습니다

풍경 영상에서는 차이를 알아차리기 어렵지만, 사람이 말하거나 물체가 표면과 부딪히는 장면에서는 차이가 극적으로 드러납니다.

오픈 소스에 관한 질문

이전 SkyReels 버전(V1부터 V3까지)은 완전한 오픈 소스로, HuggingFace와 GitHub에서 가중치를 받을 수 있었습니다. V4는 현재 skyreels.ai 공식 플랫폼에서 무료 티어가 제공되는 한정 프리뷰 단계이며, 전체 가중치는 아직 공개되지 않았습니다.

현재 이용 가능한 것

공식 플랫폼에서 일일 생성 한도가 있는 무료 티어를 제공합니다. arXiv 논문(2602.21818)에 전체 아키텍처가 상세히 담겨 있으며, 이전 버전들은 여전히 오픈 소스로 유지됩니다.

아직 부족한 것

V4 가중치는 아직 다운로드할 수 없습니다. 자체 호스팅 옵션도, 정식 프로덕션 API도 없습니다. 오픈 소스 공개 일정은 불투명합니다.

오픈 소스 커뮤니티 입장에서는 주의 깊게 지켜볼 만한 흐름입니다. Skywork가 기존 패턴을 따른다면 V4 가중치도 결국 HuggingFace에 도달할 것입니다. 오늘 당장 오픈 소스 기반의 음성 영상 생성이 필요하다면, 가장 가까운 대안은 SkyReels V3와 별도의 오디오 모델 조합입니다.

리더보드 속 SkyReels V4 의 위치

인간의 블라인드 선호 투표를 사용하는 Artificial Analysis Video Arena에서 SkyReels V4의 텍스트 투 비디오 Elo는 현재 1,244점입니다. Kling 3.0(1,243)과 거의 동률이며, 현재 1위인 알리바바의 HappyHorse-1.0(1,347)에는 못 미칩니다.

모델Elo 점수오디오 지원오픈 소스적합한 용도
HappyHorse-1.01,347없음아니오순수 시각 품질
SkyReels V41,244네이티브(듀얼 스트림)검토 중영상과 음성 콘텐츠
Kling 3.01,243순차형아니오양산 규모
Wan 2.7최상위권없음포토리얼리즘
LTX-2하위없음비용 효율
SkyReels V4, Kling 3.0, HappyHorse-1.0, Wan 2.7을 시각 품질, 오디오 지원, 오픈 소스, 속도 측면에서 비교한 차트
SkyReels V4는 최상위권에서 유일하게 오디오를 네이티브로 생성하는 모델

SkyReels V4와 HappyHorse 사이의 시각적 격차는 실존합니다. 그러나 SkyReels는 상위 5개 모델 중 유일하게 오디오를 네이티브로 생성합니다. 사운드가 필요한 워크플로라면, 이 아키텍처적 강점은 100점의 Elo 차이보다 더 큰 의미를 가집니다.

크리에이터에게 갖는 의미

🎬

소셜 콘텐츠 크리에이터

SkyReels V4는 빠른 회전을 위해 설계되었습니다. 어울리는 오디오와 함께 클립을 생성해 바로 게시할 수 있고, 별도의 사운드 디자인 단계가 필요 없습니다. TikTok, Reels, Shorts 크리에이터는 제작 시간을 크게 줄일 수 있습니다.
🎵

뮤직 비디오 제작자

오디오 브랜치는 참조 오디오를 가이드로 받을 수 있어, 트랙을 입력하면 비트에 맞춰 움직이는 영상을 얻을 수 있습니다. 초기 결과에서는 동작 액센트가 음악 리듬과 잘 동기화되는 모습이 확인되었습니다.
📢

광고 크리에이터

앰비언트 사운드를 갖춘 제품 영상, 보이스오버를 얹기 좋은 클립, 사운드스케이프가 입혀진 브랜드 콘텐츠를 모두 한 번의 생성으로 만들 수 있습니다. 대규모로 제작하는 브랜드라면 절약되는 시간이 빠르게 누적됩니다.

더 큰 흐름: 오디오는 더 이상 선택이 아닙니다

SkyReels V4는 고립된 실험이 아닙니다. ByteDance Seedance 1.5 Pro가 음성 영상 생성을 도입한 사례와 AI 영상이 무성 시대에서 벗어나는 전체적인 흐름을 다뤄 왔습니다. SkyReels V4가 더한 것은, 이 작업을 후처리 트릭이 아닌 아키텍처 차원에서 해낼 수 있다는 증명입니다.

결론은 분명합니다. 2026년 말이면 네이티브 오디오가 없는 AI 영상 모델은 미완성처럼 느껴질 것입니다. 문제는 이것이 표준이 될지가 아니라, 얼마나 빨리 자리 잡을지입니다.

💡
오늘 사운드가 함께 담긴 AI 영상을 만들고 싶으신가요? Bonega의 파이프라인은 사용 가능한 최적의 도구로 자동 라우팅하며, SkyReels V4 같은 모델이 성숙해질 때마다 함께 진화합니다. 무료로 시작하기.

빠른 참조: SkyReels V4

  • 개발사: Skywork AI (쿤룬사)
  • 아키텍처: 듀얼 스트림 멀티모달 디퓨전 트랜스포머 (MMDiT)
  • 해상도: 최대 1080p, 32 FPS
  • 길이: 최대 15초
  • 오디오: 네이티브 공동 생성 (후처리 아님)
  • 입력: 텍스트, 이미지, 영상 클립, 마스크, 참조 오디오
  • 상태: skyreels.ai 한정 프리뷰 (가중치 오픈 소스 공개 예정)
  • 논문: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

AI와 예술이 만나는 지점을 탐구하는 로잔 출신 크리에이티브 테크놀로지스트입니다. 일렉트로닉 음악 작업 사이에 생성형 모델을 실험합니다.

View profile →

읽으신 내용이 마음에 드셨나요?

몇 분 안에 아이디어를 길이 제한 없는 AI 영상으로 만들어 보세요.

관련 글

관련 게시물을 통해 계속 살펴보세요

이 글이 마음에 드셨나요?

더 많은 인사이트를 발견하고 최신 콘텐츠를 받아보세요.