Alibaba Wan 2.7: 사고 모드가 AI 영상 생성을 어떻게 바꾸는가
Alibaba가 새로운 사고 모드를 탑재한 Wan 2.7을 출시했습니다. 영상 생성 전 구도를 계획하는 이 기능의 작동 원리와 크리에이터에게 미치는 영향을 분석합니다.

사고 모드란 무엇인가?
대부분의 영상 생성 모델은 단일 패스로 작동합니다. 프롬프트를 입력하면 모델이 노이즈를 픽셀로 확산시키고, 그 결과물을 받게 됩니다. 단순한 장면에서는 이 방식이 적절히 작동하지만, 여러 피사체, 특정 공간 관계, 복잡한 동작이 포함된 프롬프트에서는 품질이 크게 떨어집니다.
Wan 2.7은 중간 단계를 추가했습니다. 픽셀 생성을 시작하기 전에 모델이 다음을 수행합니다.
- 프롬프트를 파싱하여 의미 구성 요소(피사체, 동작, 환경, 조명)로 분해
- 구도를 계획하여 각 요소의 위치와 상호작용 방식을 결정
- 출력을 생성하며 이 계획을 구조적 가이드로 활용
이는 "사고의 연쇄(Chain-of-Thought)" 추론이 대규모 언어 모델을 개선한 방식과 유사합니다. 모델에게 행동 전 사고를 강제함으로써 출력 품질이 극적으로 향상됩니다. 특히 복잡한 프롬프트에서 그 효과가 두드러집니다.
Wan 2.7 전체 모델 스위트
Wan 2.7은 단일 모델이 아니라 서로 다른 생성 워크플로를 지원하는 4개 모델로 구성된 스위트입니다.
| 모델 | 입력 | 출력 | 최적 용도 |
|---|---|---|---|
| 텍스트-투-비디오 | 텍스트 프롬프트 | 영상 클립 | 처음부터 제작 |
| 이미지-투-비디오 | 이미지 + 프롬프트 | 영상 클립 | 정지 이미지 애니메이션화, 컨셉 아트 |
| 레퍼런스-투-비디오 | 참조 영상 + 프롬프트 | 새 영상 | 스타일 전이, 재제작 |
| 영상 편집 | 영상 + 편집 지시 | 수정된 영상 | 후반 작업, 수정 |
텍스트-투-비디오 모델은 4월 3일부터 Together AI에서 이용 가능합니다. 나머지 세 모델은 향후 몇 주에 걸쳐 순차적으로 공개됩니다.
기술 분석: 아키텍처 상세
Alibaba가 아직 완전한 논문을 발표하지는 않았지만, API 문서와 초기 벤치마크에서 몇 가지 기술적 세부 사항이 확인되었습니다.
| 알려진 정보 | 차별화 요소 |
|---|---|
| 완샹(Wanxiang) 아키텍처 계보 기반 | 명시적 구도 계획을 갖춘 최초의 프로덕션 모델 |
| 사고 모드가 확산 전 계획 패스를 추가 | 다중 요소 장면에서 5개 이상의 피사체를 깔끔하게 처리 |
| 프레임 간 초현실적 캐릭터 일관성 | 생성 영상 내 텍스트가 판독 가능(깨짐 없음) |
| 프롬프트 컨디셔닝을 통한 정밀한 색상 제어 | 조명 변화에도 색상 정확도 유지 |
| 우수한 긴 텍스트 렌더링(영상 내 텍스트) | 복잡한 카메라 무빙에서도 공간 일관성 유지 |
긴 텍스트 렌더링 기능은 특히 주목할 만합니다. 이전 모델들은 영상 프레임 내에 판독 가능한 텍스트를 생성하는 데 어려움을 겪었습니다. Wan 2.7은 간판, 라벨, 심지어 짧은 문단도 놀라운 정확도로 처리합니다. 생성 영상에 텍스트 오버레이를 포함해야 하는 크리에이터에게 이것은 중요한 진전입니다.
경쟁 모델과의 비교
이번 주 AI 영상 분야에 큰 변화가 있었습니다. Wan 2.7이 출시되는 동시에 OpenAI가 Sora의 종료를 확인했고, Google은 Veo 3.1의 가격을 대폭 인하했습니다.
| 모델 | 가격 | 오디오 | 최대 길이 | 캐릭터 일관성 | 사고/계획 |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/초 | 없음 | 약 10초 | 강함 | 있음 |
| Veo 3.1 Lite | $0.05/초 | 있음 | 약 8초 | 양호 | 없음 |
| Veo 3.1 Fast | $0.12/초 | 있음 | 약 8초 | 강함 | 없음 |
| Kling 3.0 | 약 $0.08-0.17/초 | 있음 | 약 10초 | 강함 | 없음 |
| Seedance 2.0 | 번들 | 있음 | 15초 | 양호 | 없음 |
| Runway Gen-4.5 | 약 $0.15/초 | 없음 | 약 10초 | 강함 | 없음 |
초당 $0.10의 가격은 Wan 2.7을 경쟁력 있는 중간 가격대에 위치시킵니다. Google의 저가형 Lite 옵션보다 두 배 비싸고, Kling 3.0과 비슷한 수준(플랫폼에 따라 변동)이며, Runway보다는 상당히 저렴합니다.
Wan 2.7을 사용해야 할 때
초기 테스트와 모델의 강점을 바탕으로, Wan 2.7이 가장 적합한 시나리오를 정리했습니다.
복잡한 다중 피사체 장면
텍스트 중심 콘텐츠
정밀한 색상 및 스타일 제어
레퍼런스를 통한 스타일 전이
더 단순한 단일 피사체 장면에서 오디오도 필요한 경우, Kling 3.0이나 Veo 3.1이 더 나은 선택일 수 있습니다. 사고 모드의 계획 오버헤드는 프롬프트가 복잡할 때 비로소 진정한 가치를 발휘합니다.
업계에 미치는 영향
Wan 2.7의 사고 모드는 생성 모델의 작동 방식에 대한 광범위한 변화의 방향을 제시합니다. 향후 모델들은 노이즈에서 무작정 출력을 생성하는 대신, 생성의 각 측면에 명시적인 계획 단계를 도입할 가능성이 높습니다.
이 패턴은 이미 다른 분야에서 나타나고 있습니다. 코드 생성 모델은 작성 전에 계획을 세우고, 이미지 모델은 레이아웃 컨디셔닝을 활용합니다. 이제 영상 모델도 창작 전에 사고하는 것을 배우고 있습니다.
경쟁 압력은 실질적입니다. Sora의 퇴장, Google의 가격 인하, 그리고 Wan 2.7과 Kling 3.0 같은 중국 모델의 품질 향상이 맞물리면서, 크리에이터들은 그 어느 때보다 많은 선택지를 갖게 되었고 유연성을 유지해야 할 이유도 커졌습니다.
각 모델의 구체적인 벤치마크 비교에 대해서는 Runway Gen-4.5 성능 분석을 참고하시기 바랍니다. Seedance 2.0의 출시가 CapCut 생태계를 어떻게 재편하고 있는지에 대해서도 지난달 상세히 다루었습니다.

연구의 깊이와 실용적 혁신을 결합하는 로잔 출신 AI 엔지니어입니다. 모델 아키텍처와 알프스 봉우리 사이에서 시간을 나눕니다.
View profile →관련 글
관련 게시물을 통해 계속 살펴보세요

Alibaba HappyHorse-1.0: 모든 AI 영상 순위를 석권한 미스터리 모델
HappyHorse-1.0이라는 모델이 Artificial Analysis에 익명으로 등장해 텍스트-영상 변환과 이미지-영상 변환 모두에서 1위를 차지한 뒤, Alibaba 소유임이 밝혀졌습니다. 아키텍처, 개발팀, 그리고 AI 영상 시장에 미치는 영향을 정리합니다.

Sora 종료 후 AI 동영상 시장: 2026년에 알아야 할 4가지 시장 계층
Sora는 4월 26일에 종료됩니다. AI 동영상 시장은 4개의 계층으로 통합되었습니다. 필요에 맞는 적합한 Sora 대안을 선택하기 위한 실용적인 가이드입니다.

Google Veo 3.1 무료 개방: 모든 Google 계정에서 월 10개 AI 영상 생성 가능
Google이 모든 개인 계정에 Veo 3.1을 개방하며 월 10회 무료 영상 생성을 제공합니다. 구체적인 내용, 제한 사항, 그리고 AI 영상 크리에이터에게 왜 중요한지 알아봅니다.