Alibaba Wan 2.7: Thinking Mode เปลี่ยนแปลงการสร้างวิดีโอ AI อย่างไร
Alibaba เปิดตัว Wan 2.7 พร้อม Thinking Mode รูปแบบใหม่ที่วางแผนองค์ประกอบภาพก่อนสร้างวิดีโอ มาดูกันว่ามันทำงานอย่างไรและมีความหมายอย่างไรต่อครีเอเตอร์

Thinking Mode คืออะไร?
โมเดลสร้างวิดีโอส่วนใหญ่ทำงานแบบ single pass คุณพิมพ์ prompt, โมเดลเริ่ม diffuse noise ให้เป็นพิกเซล, และคุณก็ได้ผลลัพธ์ที่ออกมา วิธีนี้ใช้ได้ดีพอสมควรสำหรับฉากง่ายๆ แต่จะมีปัญหาเมื่อ prompt มีหลาย subject, ความสัมพันธ์เชิงพื้นที่เฉพาะเจาะจง, หรือการเคลื่อนไหวที่ซับซ้อน
Wan 2.7 เพิ่มขั้นตอนกลางเข้ามา ก่อนที่จะสร้างพิกเซลใดๆ โมเดลจะ:
- แยกวิเคราะห์ prompt ออกเป็นส่วนประกอบเชิงความหมาย (subject, การกระทำ, สภาพแวดล้อม, แสง)
- วางแผนองค์ประกอบภาพ โดยกำหนดว่าองค์ประกอบต่างๆ ควรปรากฏที่ใดและมีปฏิสัมพันธ์กันอย่างไร
- สร้างผลลัพธ์ โดยใช้แผนนี้เป็นโครงสร้างนำทาง
หลักการนี้คล้ายกับที่ "chain-of-thought" reasoning ช่วยปรับปรุง large language model การบังคับให้โมเดลคิดก่อนลงมือทำ ทำให้คุณภาพผลลัพธ์ดีขึ้นอย่างมาก โดยเฉพาะสำหรับ prompt ที่ซับซ้อน
ชุดโมเดล Wan 2.7 ทั้งหมด
Wan 2.7 ไม่ใช่แค่โมเดลเดียว แต่มาเป็นชุด 4 โมเดลที่ครอบคลุม workflow การสร้างวิดีโอที่แตกต่างกัน:
| Model | Input | Output | เหมาะสำหรับ |
|---|---|---|---|
| Text-to-Video | Text prompt | Video clip | สร้างจากศูนย์ |
| Image-to-Video | Image + prompt | Video clip | ทำให้ภาพนิ่งเคลื่อนไหว, concept art |
| Reference-to-Video | Reference video + prompt | New video | Style transfer, สร้างใหม่ |
| Video Editing | Video + edit instructions | Modified video | Post-production, แก้ไข |
โมเดล text-to-video ใช้งานได้แล้วบน Together AI ตั้งแต่วันที่ 3 เมษายน อีก 3 โมเดลที่เหลือจะทยอยเปิดให้บริการในสัปดาห์ต่อๆ ไป
เบื้องหลัง: ข้อมูลเชิงสถาปัตยกรรม
แม้ว่า Alibaba ยังไม่ได้ตีพิมพ์ paper ฉบับเต็ม แต่รายละเอียดทางเทคนิคหลายอย่างปรากฏจาก API documentation และ benchmark เบื้องต้น
| สิ่งที่ทราบ | สิ่งที่ทำให้แตกต่าง |
|---|---|
| สร้างบนสถาปัตยกรรม Wan (Wanxiang) | โมเดล production ตัวแรกที่มี explicit compositional planning |
| Thinking Mode เพิ่ม planning pass ก่อน diffusion | ฉากที่มีหลายองค์ประกอบรองรับ 5+ subject ได้อย่างดี |
| Character consistency แบบ hyper-realistic ตลอดทุกเฟรม | ข้อความในวิดีโอที่สร้างขึ้นอ่านได้ชัด ไม่เพี้ยน |
| ควบคุมสีได้แม่นยำผ่าน prompt conditioning | ความแม่นยำของสีคงที่แม้แสงเปลี่ยน |
| การแสดงข้อความยาวที่เหนือกว่า (ข้อความในวิดีโอ) | การเคลื่อนกล้องที่ซับซ้อนยังคง spatial coherence |
ความสามารถในการแสดงข้อความยาวเป็นจุดที่น่าสนใจเป็นพิเศษ โมเดลก่อนหน้าประสบปัญหาในการสร้างข้อความที่อ่านได้ในเฟรมวิดีโอ Wan 2.7 จัดการป้าย, ฉลาก, และแม้แต่ย่อหน้าสั้นๆ ได้อย่างแม่นยำน่าประทับใจ สำหรับครีเอเตอร์ที่ต้องการฝัง text overlay ลงในฟุตเทจที่สร้างขึ้น นี่คือก้าวสำคัญไปข้างหน้า
เปรียบเทียบกับคู่แข่ง
ภูมิทัศน์วิดีโอ AI เปลี่ยนแปลงอย่างมากในสัปดาห์นี้ Wan 2.7 มาถึงพอดีกับที่ OpenAI ยืนยันการปิด Sora และ Google ลดราคา Veo 3.1
| Model | Pricing | Audio | Max Length | Character Consistency | Thinking/Planning |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | No | ~10s | Strong | Yes |
| Veo 3.1 Lite | $0.05/s | Yes | ~8s | Good | No |
| Veo 3.1 Fast | $0.12/s | Yes | ~8s | Strong | No |
| Kling 3.0 | ~$0.08-0.17/s | Yes | ~10s | Strong | No |
| Seedance 2.0 | Bundled | Yes | 15s | Good | No |
| Runway Gen-4.5 | ~$0.15/s | No | ~10s | Strong | No |
ราคาที่ $0.10 ต่อวินาทีทำให้ Wan 2.7 อยู่ในระดับกลางที่แข่งขันได้ แพงเป็นสองเท่าของตัวเลือก Lite ราคาประหยัดของ Google, แข่งขันได้กับ Kling 3.0 (ซึ่งราคาแตกต่างตามแพลตฟอร์ม), และถูกกว่า Runway อย่างเห็นได้ชัด
ควรใช้ Wan 2.7 เมื่อใด
จากการทดสอบเบื้องต้นและจุดแข็งของโมเดล สถานการณ์ที่ Wan 2.7 เหมาะสมที่สุดมีดังนี้:
ฉากที่มีหลาย Subject ซับซ้อน
เนื้อหาที่มีข้อความมาก
ควบคุมสีและสไตล์ได้แม่นยำ
Style Transfer ผ่าน Reference
สำหรับฉากง่ายๆ ที่มี subject เดียวและต้องการเสียงด้วย โมเดลอย่าง Kling 3.0 หรือ Veo 3.1 อาจยังเป็นตัวเลือกที่ดีกว่า overhead จากการวางแผนใน Thinking Mode ให้คุณค่าเพิ่มเฉพาะเมื่อ prompt มีความซับซ้อน
สิ่งนี้มีความหมายอย่างไรต่ออุตสาหกรรม
Thinking Mode ของ Wan 2.7 ชี้ไปยังการเปลี่ยนแปลงที่ใหญ่ขึ้นในวิธีการทำงานของ generative model แทนที่จะ brute-force ผลลัพธ์จาก noise, โมเดลในอนาคตน่าจะรวม explicit planning stage สำหรับด้านต่างๆ ของการสร้างเนื้อหา
เราเห็นรูปแบบนี้ในด้านอื่นๆ แล้ว โมเดลสร้างโค้ดวางแผนก่อนเขียน โมเดลสร้างภาพใช้ layout conditioning ตอนนี้โมเดลวิดีโอก็กำลังเรียนรู้ที่จะคิดก่อนสร้าง
แรงกดดันจากการแข่งขันเป็นเรื่องจริง เมื่อ Sora ถอนตัว, Google ลดราคา, และโมเดลจีนอย่าง Wan 2.7 และ Kling 3.0 ผลักดันขีดจำกัดคุณภาพ ครีเอเตอร์ไม่เคยมีตัวเลือกมากขนาดนี้ และไม่เคยมีเหตุผลมากขนาดนี้ที่ต้องยืดหยุ่น
สำหรับการเปรียบเทียบ benchmark เฉพาะของโมเดลเหล่านี้ ดูการวิเคราะห์ประสิทธิภาพ Runway Gen-4.5 ของเรา และหากคุณสนใจว่า Seedance 2.0 rollout กำลังเปลี่ยนโฉม CapCut ecosystem อย่างไร เราได้เขียนถึงเรื่องนี้อย่างละเอียดเมื่อเดือนที่แล้ว

วิศวกร AI จากโลซานที่ผสานความลึกซึ้งด้านการวิจัยเข้ากับนวัตกรรมเชิงปฏิบัติ แบ่งเวลาระหว่างสถาปัตยกรรมโมเดลและยอดเขาแอลป์
View profile →บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

วิดีโอ AI หลัง Sora: 4 ระดับตลาดที่ควรรู้ในปี 2026
Sora ปิดตัวในวันที่ 26 เมษายน ตลาดวิดีโอ AI ได้รวมตัวเป็นสี่ระดับ คู่มือปฏิบัติสำหรับการเลือกทางเลือกทดแทน Sora ที่เหมาะสมกับความต้องการของคุณ

Google Veo 3.1 เปิดให้ใช้ฟรี: 10 AI Video ต่อเดือนสำหรับทุก Google Account
Google เปิด Veo 3.1 ให้ทุก personal account ใช้งานได้ฟรี 10 video generations ต่อเดือน มาดูกันว่าคุณจะได้อะไรบ้าง, ข้อจำกัดคืออะไร, และทำไมเรื่องนี้ถึงสำคัญสำหรับ AI video creator

Google Veo 3.1 Lite: API ที่ทำให้การสร้างวิดีโอ AI ราคาเข้าถึงได้สำหรับนักพัฒนาทุกคน
Google เปิดตัว Veo 3.1 Lite ผ่าน Gemini API ในราคาไม่ถึงครึ่งของ Veo 3.1 Fast เมื่อ Sora กำลังจะปิดตัวและ Runway หันไปทาง world models การสร้างวิดีโอ AI ราคาประหยัดจึงกลายเป็นตัวเลือกที่เป็นจริงสำหรับนักพัฒนาอิสระและสตาร์ทอัพ