Meta Pixelข้ามไปยังเนื้อหาหลัก
AlexisAlexis· ผู้เขียน AI ตรวจทานโดยมนุษย์
3 min read
579 คำ

Alibaba Wan 2.7: Thinking Mode เปลี่ยนแปลงการสร้างวิดีโอ AI อย่างไร

Alibaba เปิดตัว Wan 2.7 พร้อม Thinking Mode รูปแบบใหม่ที่วางแผนองค์ประกอบภาพก่อนสร้างวิดีโอ มาดูกันว่ามันทำงานอย่างไรและมีความหมายอย่างไรต่อครีเอเตอร์

Alibaba Wan 2.7: Thinking Mode เปลี่ยนแปลงการสร้างวิดีโอ AI อย่างไร

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

Tongyi Lab ของ Alibaba เปิดตัว Wan 2.7 เมื่อวันที่ 6 เมษายน 2026 พร้อมนำเสนอ "Thinking Mode" ที่เปลี่ยนแปลงวิธีการประมวลผล prompt ของโมเดลวิดีโอ AI อย่างสิ้นเชิง แทนที่จะสร้างเฟรมจากข้อความโดยตรง โมเดลจะสร้างแผนภายในของฉากก่อน แล้วจึงดำเนินการตามแผนนั้น ผลลัพธ์พูดเพื่อตัวเอง: artifact น้อยลง, coherence ดีขึ้น, และองค์ประกอบภาพที่ตั้งใจวางแผนมาอย่างชัดเจน

Thinking Mode คืออะไร?

โมเดลสร้างวิดีโอส่วนใหญ่ทำงานแบบ single pass คุณพิมพ์ prompt, โมเดลเริ่ม diffuse noise ให้เป็นพิกเซล, และคุณก็ได้ผลลัพธ์ที่ออกมา วิธีนี้ใช้ได้ดีพอสมควรสำหรับฉากง่ายๆ แต่จะมีปัญหาเมื่อ prompt มีหลาย subject, ความสัมพันธ์เชิงพื้นที่เฉพาะเจาะจง, หรือการเคลื่อนไหวที่ซับซ้อน

Wan 2.7 เพิ่มขั้นตอนกลางเข้ามา ก่อนที่จะสร้างพิกเซลใดๆ โมเดลจะ:

  1. แยกวิเคราะห์ prompt ออกเป็นส่วนประกอบเชิงความหมาย (subject, การกระทำ, สภาพแวดล้อม, แสง)
  2. วางแผนองค์ประกอบภาพ โดยกำหนดว่าองค์ประกอบต่างๆ ควรปรากฏที่ใดและมีปฏิสัมพันธ์กันอย่างไร
  3. สร้างผลลัพธ์ โดยใช้แผนนี้เป็นโครงสร้างนำทาง
💡
ลองนึกภาพความแตกต่างระหว่างการวาดภาพแบบ improvise กับการร่างแบบองค์ประกอบก่อน ภาพร่างไม่ปรากฏในผลงานสุดท้าย แต่กำหนดทิศทางของทุกฝีแปรง

หลักการนี้คล้ายกับที่ "chain-of-thought" reasoning ช่วยปรับปรุง large language model การบังคับให้โมเดลคิดก่อนลงมือทำ ทำให้คุณภาพผลลัพธ์ดีขึ้นอย่างมาก โดยเฉพาะสำหรับ prompt ที่ซับซ้อน

ชุดโมเดล Wan 2.7 ทั้งหมด

Wan 2.7 ไม่ใช่แค่โมเดลเดียว แต่มาเป็นชุด 4 โมเดลที่ครอบคลุม workflow การสร้างวิดีโอที่แตกต่างกัน:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelInputOutputเหมาะสำหรับ
Text-to-VideoText promptVideo clipสร้างจากศูนย์
Image-to-VideoImage + promptVideo clipทำให้ภาพนิ่งเคลื่อนไหว, concept art
Reference-to-VideoReference video + promptNew videoStyle transfer, สร้างใหม่
Video EditingVideo + edit instructionsModified videoPost-production, แก้ไข

โมเดล text-to-video ใช้งานได้แล้วบน Together AI ตั้งแต่วันที่ 3 เมษายน อีก 3 โมเดลที่เหลือจะทยอยเปิดให้บริการในสัปดาห์ต่อๆ ไป

เบื้องหลัง: ข้อมูลเชิงสถาปัตยกรรม

แม้ว่า Alibaba ยังไม่ได้ตีพิมพ์ paper ฉบับเต็ม แต่รายละเอียดทางเทคนิคหลายอย่างปรากฏจาก API documentation และ benchmark เบื้องต้น

สิ่งที่ทราบสิ่งที่ทำให้แตกต่าง
สร้างบนสถาปัตยกรรม Wan (Wanxiang)โมเดล production ตัวแรกที่มี explicit compositional planning
Thinking Mode เพิ่ม planning pass ก่อน diffusionฉากที่มีหลายองค์ประกอบรองรับ 5+ subject ได้อย่างดี
Character consistency แบบ hyper-realistic ตลอดทุกเฟรมข้อความในวิดีโอที่สร้างขึ้นอ่านได้ชัด ไม่เพี้ยน
ควบคุมสีได้แม่นยำผ่าน prompt conditioningความแม่นยำของสีคงที่แม้แสงเปลี่ยน
การแสดงข้อความยาวที่เหนือกว่า (ข้อความในวิดีโอ)การเคลื่อนกล้องที่ซับซ้อนยังคง spatial coherence

ความสามารถในการแสดงข้อความยาวเป็นจุดที่น่าสนใจเป็นพิเศษ โมเดลก่อนหน้าประสบปัญหาในการสร้างข้อความที่อ่านได้ในเฟรมวิดีโอ Wan 2.7 จัดการป้าย, ฉลาก, และแม้แต่ย่อหน้าสั้นๆ ได้อย่างแม่นยำน่าประทับใจ สำหรับครีเอเตอร์ที่ต้องการฝัง text overlay ลงในฟุตเทจที่สร้างขึ้น นี่คือก้าวสำคัญไปข้างหน้า

เปรียบเทียบกับคู่แข่ง

ภูมิทัศน์วิดีโอ AI เปลี่ยนแปลงอย่างมากในสัปดาห์นี้ Wan 2.7 มาถึงพอดีกับที่ OpenAI ยืนยันการปิด Sora และ Google ลดราคา Veo 3.1

ModelPricingAudioMax LengthCharacter ConsistencyThinking/Planning
Wan 2.7$0.10/sNo~10sStrongYes
Veo 3.1 Lite$0.05/sYes~8sGoodNo
Veo 3.1 Fast$0.12/sYes~8sStrongNo
Kling 3.0~$0.08-0.17/sYes~10sStrongNo
Seedance 2.0BundledYes15sGoodNo
Runway Gen-4.5~$0.15/sNo~10sStrongNo
⚠️
Wan 2.7 ไม่มี native audio generation หากโปรเจกต์ของคุณต้องการเสียงที่ซิงโครไนซ์ คุณจะต้องใช้ audio pipeline แยกต่างหาก หรือโมเดลอย่าง Kling 3.0 หรือ Veo 3.1 ที่สร้างเสียงได้โดยตรง

ราคาที่ $0.10 ต่อวินาทีทำให้ Wan 2.7 อยู่ในระดับกลางที่แข่งขันได้ แพงเป็นสองเท่าของตัวเลือก Lite ราคาประหยัดของ Google, แข่งขันได้กับ Kling 3.0 (ซึ่งราคาแตกต่างตามแพลตฟอร์ม), และถูกกว่า Runway อย่างเห็นได้ชัด

ควรใช้ Wan 2.7 เมื่อใด

จากการทดสอบเบื้องต้นและจุดแข็งของโมเดล สถานการณ์ที่ Wan 2.7 เหมาะสมที่สุดมีดังนี้:

🎬

ฉากที่มีหลาย Subject ซับซ้อน

Thinking Mode ทำงานได้ดีที่สุดเมื่อ prompt ของคุณมีหลายตัวละครหรือวัตถุที่มีปฏิสัมพันธ์กัน ขั้นตอนการวางแผนป้องกันความสับสนเชิงพื้นที่ที่เป็นปัญหาในโมเดลอื่นๆ
📝

เนื้อหาที่มีข้อความมาก

หากวิดีโอของคุณต้องการข้อความที่อ่านได้, ป้าย, หรือ UI element, การแสดงข้อความของ Wan 2.7 ถือว่าดีที่สุดในขณะนี้
🎨

ควบคุมสีและสไตล์ได้แม่นยำ

ระบบ color conditioning ให้คุณกำหนด palette ที่ต้องการและรักษาไว้ตลอดทุกเฟรม เหมาะสำหรับเนื้อหาที่ต้องสอดคล้องกับแบรนด์
🔄

Style Transfer ผ่าน Reference

โมเดล reference-to-video (เร็วๆ นี้) จะให้คุณป้อนคลิปที่มีอยู่เป็น style guide เพื่อสร้างเนื้อหาใหม่ที่ตรงกับภาษาภาพของคลิปนั้น

สำหรับฉากง่ายๆ ที่มี subject เดียวและต้องการเสียงด้วย โมเดลอย่าง Kling 3.0 หรือ Veo 3.1 อาจยังเป็นตัวเลือกที่ดีกว่า overhead จากการวางแผนใน Thinking Mode ให้คุณค่าเพิ่มเฉพาะเมื่อ prompt มีความซับซ้อน

สิ่งนี้มีความหมายอย่างไรต่ออุตสาหกรรม

Thinking Mode ของ Wan 2.7 ชี้ไปยังการเปลี่ยนแปลงที่ใหญ่ขึ้นในวิธีการทำงานของ generative model แทนที่จะ brute-force ผลลัพธ์จาก noise, โมเดลในอนาคตน่าจะรวม explicit planning stage สำหรับด้านต่างๆ ของการสร้างเนื้อหา

เราเห็นรูปแบบนี้ในด้านอื่นๆ แล้ว โมเดลสร้างโค้ดวางแผนก่อนเขียน โมเดลสร้างภาพใช้ layout conditioning ตอนนี้โมเดลวิดีโอก็กำลังเรียนรู้ที่จะคิดก่อนสร้าง

💡
อัตราการเปิดตัวโมเดลที่รวดเร็วในปี 2026 ทำให้การผูกมัดกับผู้ให้บริการรายเดียวมีความเสี่ยง แนวทาง pipeline-based ที่สามารถสลับ generation backend ได้เมื่อโมเดลที่ดีกว่าออกมา จะปกป้อง workflow ของคุณจาก vendor lock-in

แรงกดดันจากการแข่งขันเป็นเรื่องจริง เมื่อ Sora ถอนตัว, Google ลดราคา, และโมเดลจีนอย่าง Wan 2.7 และ Kling 3.0 ผลักดันขีดจำกัดคุณภาพ ครีเอเตอร์ไม่เคยมีตัวเลือกมากขนาดนี้ และไม่เคยมีเหตุผลมากขนาดนี้ที่ต้องยืดหยุ่น

สำหรับการเปรียบเทียบ benchmark เฉพาะของโมเดลเหล่านี้ ดูการวิเคราะห์ประสิทธิภาพ Runway Gen-4.5 ของเรา และหากคุณสนใจว่า Seedance 2.0 rollout กำลังเปลี่ยนโฉม CapCut ecosystem อย่างไร เราได้เขียนถึงเรื่องนี้อย่างละเอียดเมื่อเดือนที่แล้ว

Alexis
AlexisAI EngineerAI Author

วิศวกร AI จากโลซานที่ผสานความลึกซึ้งด้านการวิจัยเข้ากับนวัตกรรมเชิงปฏิบัติ แบ่งเวลาระหว่างสถาปัตยกรรมโมเดลและยอดเขาแอลป์

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

วิดีโอ AI หลัง Sora: 4 ระดับตลาดที่ควรรู้ในปี 2026
AI VideoSora

วิดีโอ AI หลัง Sora: 4 ระดับตลาดที่ควรรู้ในปี 2026

Sora ปิดตัวในวันที่ 26 เมษายน ตลาดวิดีโอ AI ได้รวมตัวเป็นสี่ระดับ คู่มือปฏิบัติสำหรับการเลือกทางเลือกทดแทน Sora ที่เหมาะสมกับความต้องการของคุณ

Read
Google Veo 3.1 เปิดให้ใช้ฟรี: 10 AI Video ต่อเดือนสำหรับทุก Google Account
Google VeoAI Video

Google Veo 3.1 เปิดให้ใช้ฟรี: 10 AI Video ต่อเดือนสำหรับทุก Google Account

Google เปิด Veo 3.1 ให้ทุก personal account ใช้งานได้ฟรี 10 video generations ต่อเดือน มาดูกันว่าคุณจะได้อะไรบ้าง, ข้อจำกัดคืออะไร, และทำไมเรื่องนี้ถึงสำคัญสำหรับ AI video creator

Read
Google Veo 3.1 Lite: API ที่ทำให้การสร้างวิดีโอ AI ราคาเข้าถึงได้สำหรับนักพัฒนาทุกคน
GoogleVeo 3.1

Google Veo 3.1 Lite: API ที่ทำให้การสร้างวิดีโอ AI ราคาเข้าถึงได้สำหรับนักพัฒนาทุกคน

Google เปิดตัว Veo 3.1 Lite ผ่าน Gemini API ในราคาไม่ถึงครึ่งของ Veo 3.1 Fast เมื่อ Sora กำลังจะปิดตัวและ Runway หันไปทาง world models การสร้างวิดีโอ AI ราคาประหยัดจึงกลายเป็นตัวเลือกที่เป็นจริงสำหรับนักพัฒนาอิสระและสตาร์ทอัพ

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา