Alibaba Wan 2.7: Chế độ Suy nghĩ thay đổi việc tạo video AI như thế nào
Alibaba vừa phát hành Wan 2.7 với Chế độ Suy nghĩ hoàn toàn mới, cho phép lập kế hoạch bố cục trước khi tạo video. Chúng tôi phân tích cách nó hoạt động và ý nghĩa đối với người sáng tạo.

Chế độ Suy nghĩ là gì?
Hầu hết các mô hình tạo video hoạt động theo cơ chế xử lý một lượt. Bạn nhập prompt, mô hình bắt đầu khuếch tán nhiễu thành pixel, và bạn nhận được kết quả. Cách này hoạt động tạm ổn với các cảnh đơn giản, nhưng gặp vấn đề khi prompt liên quan đến nhiều chủ thể, mối quan hệ không gian cụ thể, hoặc các hành động phức tạp.
Wan 2.7 bổ sung thêm một bước trung gian. Trước khi bất kỳ pixel nào được tạo ra, mô hình sẽ:
- Phân tích prompt thành các thành phần ngữ nghĩa (chủ thể, hành động, môi trường, ánh sáng)
- Lập kế hoạch bố cục bằng cách xác định vị trí các yếu tố và cách chúng tương tác
- Tạo đầu ra sử dụng kế hoạch này làm hướng dẫn cấu trúc
Điều này tương tự với cách lập luận "chuỗi suy nghĩ" (chain-of-thought) đã cải thiện các mô hình ngôn ngữ lớn. Bằng cách buộc mô hình suy nghĩ trước khi hành động, chất lượng đầu ra được cải thiện đáng kể, đặc biệt với các prompt phức tạp.
Bộ mô hình Wan 2.7 đầy đủ
Wan 2.7 không chỉ là một mô hình đơn lẻ. Nó được phát hành dưới dạng bộ bốn mô hình phục vụ các quy trình tạo nội dung khác nhau:
| Mô hình | Đầu vào | Đầu ra | Phù hợp nhất cho |
|---|---|---|---|
| Văn bản sang Video | Prompt văn bản | Đoạn video | Tạo từ đầu |
| Hình ảnh sang Video | Hình ảnh + prompt | Đoạn video | Làm sống động ảnh tĩnh, concept art |
| Tham chiếu sang Video | Video tham chiếu + prompt | Video mới | Chuyển đổi phong cách, tái tạo |
| Chỉnh sửa Video | Video + hướng dẫn chỉnh sửa | Video đã chỉnh sửa | Hậu kỳ, điều chỉnh |
Mô hình văn bản sang video đã có mặt trên Together AI từ ngày 3 tháng 4. Ba mô hình còn lại sẽ được triển khai trong những tuần tới.
Bên trong kiến trúc: Phân tích kỹ thuật
Dù Alibaba chưa công bố bài nghiên cứu đầy đủ, một số chi tiết kỹ thuật đã được tiết lộ qua tài liệu API và các bài benchmark ban đầu.
| Thông tin đã biết | Điểm khác biệt |
|---|---|
| Xây dựng trên dòng kiến trúc Wanxiang (Vạn Tượng) | Mô hình sản xuất đầu tiên có lập kế hoạch bố cục rõ ràng |
| Chế độ Suy nghĩ thêm bước lập kế hoạch trước khuếch tán | Cảnh đa yếu tố xử lý mượt mà hơn 5 chủ thể |
| Tính nhất quán nhân vật siêu thực giữa các khung hình | Chữ trong video tạo ra có thể đọc được, không bị méo |
| Kiểm soát màu sắc chính xác qua điều kiện prompt | Độ chính xác màu sắc duy trì ổn định khi ánh sáng thay đổi |
| Khả năng render văn bản dài vượt trội (chữ trong video) | Chuyển động camera phức tạp vẫn giữ được tính nhất quán không gian |
Khả năng render văn bản dài đặc biệt đáng chú ý. Các mô hình trước đây gặp khó khăn trong việc tạo chữ đọc được trong khung hình video. Wan 2.7 xử lý biển hiệu, nhãn, và thậm chí các đoạn văn ngắn với độ chính xác đáng ngạc nhiên. Đối với những người sáng tạo cần chữ chồng lên hình ảnh trong video tạo ra, đây là một bước tiến quan trọng.
So sánh với các mô hình trên thị trường
Lĩnh vực video AI đã có nhiều biến chuyển đáng kể trong tuần này. Wan 2.7 ra mắt đúng lúc OpenAI xác nhận đóng cửa Sora và Google giảm mạnh giá Veo 3.1.
| Mô hình | Giá | Âm thanh | Thời lượng tối đa | Nhất quán nhân vật | Suy nghĩ/Lập kế hoạch |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/giây | Không | ~10 giây | Mạnh | Có |
| Veo 3.1 Lite | $0.05/giây | Có | ~8 giây | Tốt | Không |
| Veo 3.1 Fast | $0.12/giây | Có | ~8 giây | Mạnh | Không |
| Kling 3.0 | ~$0.08-0.17/giây | Có | ~10 giây | Mạnh | Không |
| Seedance 2.0 | Gói trọn | Có | 15 giây | Tốt | Không |
| Runway Gen-4.5 | ~$0.15/giây | Không | ~10 giây | Mạnh | Không |
Mức giá $0.10 mỗi giây đặt Wan 2.7 ở phân khúc giá trung bình cạnh tranh. Gấp đôi so với gói Lite giá rẻ của Google, ngang tầm Kling 3.0 (giá thay đổi theo nền tảng), và rẻ hơn đáng kể so với Runway.
Khi nào nên dùng Wan 2.7
Dựa trên các bài kiểm tra ban đầu và thế mạnh của mô hình, đây là những tình huống Wan 2.7 phát huy hiệu quả nhất:
Cảnh phức tạp nhiều chủ thể
Nội dung nhiều chữ
Kiểm soát màu sắc và phong cách chính xác
Chuyển đổi phong cách qua tham chiếu
Đối với các cảnh đơn giản hơn với một chủ thể duy nhất và cần cả âm thanh, các mô hình như Kling 3.0 hay Veo 3.1 có thể vẫn là lựa chọn tốt hơn. Chi phí lập kế hoạch trong Chế độ Suy nghĩ chỉ thực sự mang lại giá trị khi prompt phức tạp.
Ý nghĩa đối với ngành công nghiệp
Chế độ Suy nghĩ của Wan 2.7 cho thấy một xu hướng rộng hơn trong cách các mô hình sinh ảnh sẽ hoạt động. Thay vì ép buộc tạo đầu ra từ nhiễu, các mô hình tương lai có thể sẽ tích hợp các giai đoạn lập kế hoạch rõ ràng cho từng khía cạnh của quá trình tạo nội dung.
Chúng ta đã thấy mô hình này ở các lĩnh vực khác. Mô hình tạo mã lập kế hoạch trước khi viết. Mô hình hình ảnh sử dụng điều kiện bố cục. Giờ đây, mô hình video cũng đang học cách suy nghĩ trước khi sáng tạo.
Áp lực cạnh tranh là thực tế. Với việc Sora rút lui, Google giảm giá, và các mô hình Trung Quốc như Wan 2.7 cùng Kling 3.0 liên tục nâng cao chất lượng, người sáng tạo chưa bao giờ có nhiều lựa chọn đến vậy, và cũng chưa bao giờ có nhiều lý do để giữ sự linh hoạt đến thế.
Để tìm hiểu sâu hơn về cách các mô hình này so sánh trong các bài benchmark cụ thể, hãy xem phân tích hiệu suất Runway Gen-4.5 của chúng tôi. Và nếu bạn quan tâm đến cách Seedance 2.0 đang định hình lại hệ sinh thái CapCut, chúng tôi đã đề cập chi tiết vào tháng trước.

Kỹ sư AI đến từ Lausanne, kết hợp chiều sâu nghiên cứu với đổi mới thực tiễn. Chia thời gian giữa kiến trúc mô hình và những đỉnh núi Alps.
View profile →Bạn thích những gì vừa đọc?
Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.
Bài viết liên quan
Tiếp tục khám phá với các bài viết liên quan này

Alibaba HappyHorse-1.0: Mô hình bí ẩn đã chiếm đỉnh mọi bảng xếp hạng AI Video
Một mô hình mang tên HappyHorse-1.0 xuất hiện ẩn danh trên Artificial Analysis, leo lên vị trí số 1 ở cả hai hạng mục text-to-video và image-to-video, rồi được xác nhận thuộc về Alibaba. Dưới đây là những gì chúng tôi biết về kiến trúc, đội ngũ phát triển và ý nghĩa đối với thị trường AI video.

Video AI Sau Sora: 4 Cấp Độ Thị Trường Cần Biết Năm 2026
Sora đóng cửa vào ngày 26 tháng 4. Thị trường video AI đã hợp nhất thành bốn cấp độ. Hướng dẫn thực tế để chọn giải pháp thay thế Sora phù hợp với nhu cầu của bạn.

Google Veo 3.1 miễn phí: Mỗi tài khoản Google được tạo 10 video AI mỗi tháng
Google đã mở Veo 3.1 cho tất cả tài khoản cá nhân với 10 lần tạo video miễn phí mỗi tháng. Đây là những gì bạn nhận được, giới hạn là gì, và tại sao điều này quan trọng với người sáng tạo video AI.