Alibaba Wan 2.7: Bagaimana Thinking Mode Mengubah Pembuatan Video AI
Alibaba baru saja merilis Wan 2.7 dengan fitur Thinking Mode yang merencanakan komposisi sebelum menghasilkan video. Kami mengulas cara kerjanya dan apa artinya bagi para kreator.

Apa Itu Thinking Mode?
Sebagian besar model pembuatan video bekerja dalam satu kali proses. Anda mengetik prompt, model mulai mengubah noise menjadi piksel, dan Anda mendapatkan apa pun yang muncul. Ini cukup berfungsi untuk adegan sederhana, tetapi gagal ketika prompt melibatkan banyak subjek, hubungan spasial tertentu, atau aksi yang kompleks.
Wan 2.7 menambahkan langkah perantara. Sebelum piksel apa pun dihasilkan, model melakukan hal berikut:
- Mengurai prompt menjadi komponen semantik (subjek, aksi, lingkungan, pencahayaan)
- Merencanakan komposisi dengan menentukan di mana elemen harus muncul dan bagaimana mereka harus berinteraksi
- Menghasilkan output menggunakan rencana ini sebagai panduan struktural
Ini mirip dengan bagaimana penalaran "chain-of-thought" meningkatkan kualitas model bahasa besar. Dengan memaksa model untuk berpikir sebelum bertindak, kualitas output meningkat secara signifikan, terutama untuk prompt yang kompleks.
Paket Lengkap Wan 2.7
Wan 2.7 bukan hanya satu model. Model ini hadir sebagai paket empat model yang mencakup berbagai alur kerja pembuatan konten:
| Model | Input | Output | Paling Cocok Untuk |
|---|---|---|---|
| Teks ke Video | Prompt teks | Klip video | Membuat dari awal |
| Gambar ke Video | Gambar + prompt | Klip video | Menganimasikan gambar diam, konsep seni |
| Referensi ke Video | Video referensi + prompt | Video baru | Transfer gaya, pembuatan ulang |
| Pengeditan Video | Video + instruksi edit | Video yang dimodifikasi | Pasca-produksi, koreksi |
Model teks ke video sudah tersedia di Together AI sejak 3 April. Tiga model sisanya akan diluncurkan secara bertahap dalam beberapa minggu ke depan.
Di Balik Layar: Detail Arsitektur
Meskipun Alibaba belum menerbitkan makalah lengkap, beberapa detail teknis telah muncul dari dokumentasi API dan benchmark awal.
| Yang Kita Ketahui | Yang Membuatnya Berbeda |
|---|---|
| Dibangun di atas lini arsitektur Wan (Wanxiang) | Model produksi pertama dengan perencanaan komposisi eksplisit |
| Thinking Mode menambahkan tahap perencanaan sebelum difusi | Adegan multi-elemen menangani 5+ subjek dengan bersih |
| Konsistensi karakter hiper-realistis antar frame | Teks yang dihasilkan dalam video dapat dibaca, tidak kacau |
| Kontrol warna presisi melalui prompt conditioning | Akurasi warna tetap konsisten meskipun pencahayaan berubah |
| Rendering teks panjang yang unggul (teks dalam video) | Gerakan kamera kompleks mempertahankan koherensi spasial |
Kemampuan rendering teks panjang patut diperhatikan secara khusus. Model sebelumnya kesulitan menghasilkan teks yang dapat dibaca dalam frame video. Wan 2.7 menangani papan tanda, label, dan bahkan paragraf pendek dengan akurasi yang mengejutkan. Bagi kreator yang membutuhkan overlay teks yang tertanam dalam rekaman yang dihasilkan, ini merupakan kemajuan yang signifikan.
Perbandingan dengan Kompetitor
Lanskap video AI bergeser cukup besar minggu ini, dengan hadirnya Wan 2.7 bersamaan dengan konfirmasi OpenAI atas penutupan Sora dan pemotongan harga Veo 3.1 oleh Google.
| Model | Harga | Audio | Durasi Maks | Konsistensi Karakter | Thinking/Planning |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/dtk | Tidak | ~10 dtk | Kuat | Ya |
| Veo 3.1 Lite | $0.05/dtk | Ya | ~8 dtk | Baik | Tidak |
| Veo 3.1 Fast | $0.12/dtk | Ya | ~8 dtk | Kuat | Tidak |
| Kling 3.0 | ~$0.08-0.17/dtk | Ya | ~10 dtk | Kuat | Tidak |
| Seedance 2.0 | Paket | Ya | 15 dtk | Baik | Tidak |
| Runway Gen-4.5 | ~$0.15/dtk | Tidak | ~10 dtk | Kuat | Tidak |
Harga $0.10 per detik menempatkan Wan 2.7 di tier kompetitif menengah. Harganya dua kali lipat dari opsi hemat Lite milik Google, kompetitif dengan Kling 3.0 (yang bervariasi tergantung platform), dan jauh lebih terjangkau dibandingkan Runway.
Kapan Menggunakan Wan 2.7
Berdasarkan pengujian awal dan kekuatan model, berikut skenario di mana Wan 2.7 paling masuk akal:
Adegan Kompleks dengan Banyak Subjek
Konten Padat Teks
Kontrol Warna dan Gaya yang Presisi
Transfer Gaya melalui Referensi
Untuk adegan yang lebih sederhana dengan satu subjek di mana Anda juga memerlukan audio, model seperti Kling 3.0 atau Veo 3.1 mungkin masih menjadi pilihan yang lebih baik. Overhead perencanaan di Thinking Mode memberikan nilai tambah khususnya ketika prompt bersifat kompleks.
Apa Artinya bagi Industri
Thinking Mode dari Wan 2.7 menunjukkan pergeseran yang lebih luas dalam cara kerja model generatif. Alih-alih memaksakan output dari noise, model masa depan kemungkinan akan menyertakan tahap perencanaan eksplisit untuk berbagai aspek pembuatan konten.
Kita sudah melihat pola ini di bidang lain. Model pembuatan kode merencanakan sebelum menulis. Model gambar menggunakan layout conditioning. Sekarang model video sedang belajar untuk berpikir sebelum berkreasi.
Tekanan kompetitif sangat nyata. Dengan keluarnya Sora, Google yang memotong harga, dan model-model Tiongkok seperti Wan 2.7 serta Kling 3.0 yang terus mendorong batas kualitas, para kreator belum pernah memiliki sebanyak ini pilihan, atau sebanyak ini alasan untuk tetap fleksibel.
Untuk ulasan lebih mendalam tentang perbandingan model-model ini dalam benchmark tertentu, silakan baca analisis kami tentang performa Runway Gen-4.5. Dan jika Anda tertarik dengan bagaimana peluncuran Seedance 2.0 mengubah ekosistem CapCut, kami telah membahasnya secara detail bulan lalu.

Insinyur AI dari Lausanne yang memadukan kedalaman riset dengan inovasi praktis. Membagi waktu antara arsitektur model dan puncak Alpen.
View profile โSuka dengan yang Anda baca?
Ubah ide Anda menjadi video AI berdurasi tak terbatas dalam hitungan menit.
Artikel Terkait
Lanjutkan penjelajahan dengan postingan terkait ini

Video AI Setelah Sora: 4 Tingkat Pasar yang Perlu Diketahui di 2026
Sora ditutup pada 26 April. Pasar video AI telah terkonsolidasi menjadi empat tingkat. Panduan praktis untuk memilih alternatif Sora yang tepat untuk kebutuhan Anda.

Google Veo 3.1 Kini Gratis: 10 Video AI Per Bulan untuk Setiap Akun Google
Google membuka Veo 3.1 untuk semua akun pribadi dengan 10 pembuatan video gratis per bulan. Berikut yang Anda dapatkan, batasannya, dan mengapa ini penting bagi kreator video AI.

Google Veo 3.1 Lite: Pembuatan Video AI Berbiaya Rendah Hadir di Gemini API
Google baru saja merilis Veo 3.1 Lite, model pembuatan video AI yang cepat dan terjangkau di dalam Gemini API. Berikut yang perlu diketahui para developer tentang harga, kompromi kualitas, dan cara membangun video ke dalam aplikasi produksi.