Meta Pixel본문으로 건너뛰기
AlexisAlexis· AI 작성, 사람이 검토함
12 min read
923 단어

Alibaba Wan 2.7: 사고 모드가 AI 영상 생성을 어떻게 바꾸는가

Alibaba가 새로운 사고 모드를 탑재한 Wan 2.7을 출시했습니다. 영상 생성 전 구도를 계획하는 이 기능의 작동 원리와 크리에이터에게 미치는 영향을 분석합니다.

Alibaba Wan 2.7: 사고 모드가 AI 영상 생성을 어떻게 바꾸는가

나만의 AI 영상을 만들 준비가 되셨나요?

Bonega.ai를 사용하는 수천 명의 크리에이터와 함께하세요

Alibaba의 통의(Tongyi) 연구소는 2026년 4월 6일 Wan 2.7을 출시하며, AI 영상 모델의 프롬프트 처리 방식을 근본적으로 바꾸는 "사고 모드"를 도입했습니다. 텍스트에서 바로 프레임을 생성하는 대신, 모델이 먼저 장면의 내부 계획을 수립한 뒤 실행합니다. 결과는 분명합니다. 아티팩트 감소, 일관성 향상, 그리고 눈에 띄게 의도적인 구도가 구현됩니다.

사고 모드란 무엇인가?

대부분의 영상 생성 모델은 단일 패스로 작동합니다. 프롬프트를 입력하면 모델이 노이즈를 픽셀로 확산시키고, 그 결과물을 받게 됩니다. 단순한 장면에서는 이 방식이 적절히 작동하지만, 여러 피사체, 특정 공간 관계, 복잡한 동작이 포함된 프롬프트에서는 품질이 크게 떨어집니다.

Wan 2.7은 중간 단계를 추가했습니다. 픽셀 생성을 시작하기 전에 모델이 다음을 수행합니다.

  1. 프롬프트를 파싱하여 의미 구성 요소(피사체, 동작, 환경, 조명)로 분해
  2. 구도를 계획하여 각 요소의 위치와 상호작용 방식을 결정
  3. 출력을 생성하며 이 계획을 구조적 가이드로 활용
💡
즉흥적으로 그림을 그리는 것과 먼저 구도 스케치를 한 뒤 그리는 것의 차이라고 생각하면 됩니다. 스케치는 최종 작품에 나타나지 않지만, 모든 붓질의 방향을 결정합니다.

이는 "사고의 연쇄(Chain-of-Thought)" 추론이 대규모 언어 모델을 개선한 방식과 유사합니다. 모델에게 행동 전 사고를 강제함으로써 출력 품질이 극적으로 향상됩니다. 특히 복잡한 프롬프트에서 그 효과가 두드러집니다.

Wan 2.7 전체 모델 스위트

Wan 2.7은 단일 모델이 아니라 서로 다른 생성 워크플로를 지원하는 4개 모델로 구성된 스위트입니다.

4
모델 스위트
$0.10/초
API 가격
4월 6일
출시일
모델입력출력최적 용도
텍스트-투-비디오텍스트 프롬프트영상 클립처음부터 제작
이미지-투-비디오이미지 + 프롬프트영상 클립정지 이미지 애니메이션화, 컨셉 아트
레퍼런스-투-비디오참조 영상 + 프롬프트새 영상스타일 전이, 재제작
영상 편집영상 + 편집 지시수정된 영상후반 작업, 수정

텍스트-투-비디오 모델은 4월 3일부터 Together AI에서 이용 가능합니다. 나머지 세 모델은 향후 몇 주에 걸쳐 순차적으로 공개됩니다.

기술 분석: 아키텍처 상세

Alibaba가 아직 완전한 논문을 발표하지는 않았지만, API 문서와 초기 벤치마크에서 몇 가지 기술적 세부 사항이 확인되었습니다.

알려진 정보차별화 요소
완샹(Wanxiang) 아키텍처 계보 기반명시적 구도 계획을 갖춘 최초의 프로덕션 모델
사고 모드가 확산 전 계획 패스를 추가다중 요소 장면에서 5개 이상의 피사체를 깔끔하게 처리
프레임 간 초현실적 캐릭터 일관성생성 영상 내 텍스트가 판독 가능(깨짐 없음)
프롬프트 컨디셔닝을 통한 정밀한 색상 제어조명 변화에도 색상 정확도 유지
우수한 긴 텍스트 렌더링(영상 내 텍스트)복잡한 카메라 무빙에서도 공간 일관성 유지

긴 텍스트 렌더링 기능은 특히 주목할 만합니다. 이전 모델들은 영상 프레임 내에 판독 가능한 텍스트를 생성하는 데 어려움을 겪었습니다. Wan 2.7은 간판, 라벨, 심지어 짧은 문단도 놀라운 정확도로 처리합니다. 생성 영상에 텍스트 오버레이를 포함해야 하는 크리에이터에게 이것은 중요한 진전입니다.

경쟁 모델과의 비교

이번 주 AI 영상 분야에 큰 변화가 있었습니다. Wan 2.7이 출시되는 동시에 OpenAI가 Sora의 종료를 확인했고, Google은 Veo 3.1의 가격을 대폭 인하했습니다.

모델가격오디오최대 길이캐릭터 일관성사고/계획
Wan 2.7$0.10/초없음약 10초강함있음
Veo 3.1 Lite$0.05/초있음약 8초양호없음
Veo 3.1 Fast$0.12/초있음약 8초강함없음
Kling 3.0약 $0.08-0.17/초있음약 10초강함없음
Seedance 2.0번들있음15초양호없음
Runway Gen-4.5약 $0.15/초없음약 10초강함없음
⚠️
Wan 2.7에는 네이티브 오디오 생성 기능이 포함되어 있지 않습니다. 동기화된 사운드가 필요한 프로젝트에서는 별도의 오디오 파이프라인이 필요하거나, Kling 3.0이나 Veo 3.1처럼 오디오를 네이티브로 생성하는 모델을 사용해야 합니다.

초당 $0.10의 가격은 Wan 2.7을 경쟁력 있는 중간 가격대에 위치시킵니다. Google의 저가형 Lite 옵션보다 두 배 비싸고, Kling 3.0과 비슷한 수준(플랫폼에 따라 변동)이며, Runway보다는 상당히 저렴합니다.

Wan 2.7을 사용해야 할 때

초기 테스트와 모델의 강점을 바탕으로, Wan 2.7이 가장 적합한 시나리오를 정리했습니다.

🎬

복잡한 다중 피사체 장면

프롬프트에 여러 캐릭터나 오브젝트의 상호작용이 포함될 때 사고 모드가 뛰어난 성능을 발휘합니다. 계획 단계가 다른 모델에서 자주 발생하는 공간적 혼란을 방지합니다.
📝

텍스트 중심 콘텐츠

영상에 판독 가능한 텍스트, 간판, UI 요소가 필요한 경우, Wan 2.7의 텍스트 렌더링은 현재 최고 수준입니다.
🎨

정밀한 색상 및 스타일 제어

색상 컨디셔닝 시스템을 통해 정확한 색상 팔레트를 지정하고 프레임 간 일관성을 유지할 수 있어, 브랜드 통일성이 중요한 콘텐츠에 적합합니다.
🔄

레퍼런스를 통한 스타일 전이

곧 출시될 레퍼런스-투-비디오 모델을 사용하면 기존 클립을 스타일 가이드로 입력하여, 그 시각적 언어에 맞는 새로운 콘텐츠를 생성할 수 있습니다.

더 단순한 단일 피사체 장면에서 오디오도 필요한 경우, Kling 3.0이나 Veo 3.1이 더 나은 선택일 수 있습니다. 사고 모드의 계획 오버헤드는 프롬프트가 복잡할 때 비로소 진정한 가치를 발휘합니다.

업계에 미치는 영향

Wan 2.7의 사고 모드는 생성 모델의 작동 방식에 대한 광범위한 변화의 방향을 제시합니다. 향후 모델들은 노이즈에서 무작정 출력을 생성하는 대신, 생성의 각 측면에 명시적인 계획 단계를 도입할 가능성이 높습니다.

이 패턴은 이미 다른 분야에서 나타나고 있습니다. 코드 생성 모델은 작성 전에 계획을 세우고, 이미지 모델은 레이아웃 컨디셔닝을 활용합니다. 이제 영상 모델도 창작 전에 사고하는 것을 배우고 있습니다.

💡
2026년의 빠른 모델 출시 속도를 고려하면, 특정 벤더에 종속되는 것은 위험합니다. 파이프라인 기반 접근 방식을 채택하여 더 우수한 모델이 출시될 때 생성 백엔드를 유연하게 교체할 수 있도록 하면, 벤더 종속으로부터 워크플로를 보호할 수 있습니다.

경쟁 압력은 실질적입니다. Sora의 퇴장, Google의 가격 인하, 그리고 Wan 2.7과 Kling 3.0 같은 중국 모델의 품질 향상이 맞물리면서, 크리에이터들은 그 어느 때보다 많은 선택지를 갖게 되었고 유연성을 유지해야 할 이유도 커졌습니다.

각 모델의 구체적인 벤치마크 비교에 대해서는 Runway Gen-4.5 성능 분석을 참고하시기 바랍니다. Seedance 2.0의 출시가 CapCut 생태계를 어떻게 재편하고 있는지에 대해서도 지난달 상세히 다루었습니다.

Alexis
AlexisAI EngineerAI Author

연구의 깊이와 실용적 혁신을 결합하는 로잔 출신 AI 엔지니어입니다. 모델 아키텍처와 알프스 봉우리 사이에서 시간을 나눕니다.

View profile →

읽으신 내용이 마음에 드셨나요?

몇 분 안에 아이디어를 길이 제한 없는 AI 영상으로 만들어 보세요.

관련 글

관련 게시물을 통해 계속 살펴보세요

이 글이 마음에 드셨나요?

더 많은 인사이트를 발견하고 최신 콘텐츠를 받아보세요.