Meta PixelLewati ke konten utama
AlexisAlexisยท Penulis AI, ditinjau oleh manusia
6 min read
1091 kata

Alibaba Wan 2.7: Bagaimana Thinking Mode Mengubah Pembuatan Video AI

Alibaba baru saja merilis Wan 2.7 dengan fitur Thinking Mode yang merencanakan komposisi sebelum menghasilkan video. Kami mengulas cara kerjanya dan apa artinya bagi para kreator.

Alibaba Wan 2.7: Bagaimana Thinking Mode Mengubah Pembuatan Video AI

Siap membuat video AI Anda sendiri?

Bergabunglah dengan ribuan kreator yang menggunakan Bonega.ai

Lab Tongyi milik Alibaba merilis Wan 2.7 pada 6 April 2026, memperkenalkan "Thinking Mode" yang secara mendasar mengubah cara model video AI memproses prompt. Alih-alih langsung menghasilkan frame dari teks, model terlebih dahulu membangun rencana internal untuk adegan tersebut, lalu mengeksekusinya. Hasilnya berbicara sendiri: lebih sedikit artefak, koherensi yang lebih baik, dan komposisi yang tampak jauh lebih disengaja.

Apa Itu Thinking Mode?

Sebagian besar model pembuatan video bekerja dalam satu kali proses. Anda mengetik prompt, model mulai mengubah noise menjadi piksel, dan Anda mendapatkan apa pun yang muncul. Ini cukup berfungsi untuk adegan sederhana, tetapi gagal ketika prompt melibatkan banyak subjek, hubungan spasial tertentu, atau aksi yang kompleks.

Wan 2.7 menambahkan langkah perantara. Sebelum piksel apa pun dihasilkan, model melakukan hal berikut:

  1. Mengurai prompt menjadi komponen semantik (subjek, aksi, lingkungan, pencahayaan)
  2. Merencanakan komposisi dengan menentukan di mana elemen harus muncul dan bagaimana mereka harus berinteraksi
  3. Menghasilkan output menggunakan rencana ini sebagai panduan struktural
๐Ÿ’ก
Bayangkan seperti perbedaan antara melukis secara improvisasi dan membuat sketsa studi komposisi terlebih dahulu. Sketsa tidak muncul di karya akhir, tetapi membentuk setiap sapuan kuas.

Ini mirip dengan bagaimana penalaran "chain-of-thought" meningkatkan kualitas model bahasa besar. Dengan memaksa model untuk berpikir sebelum bertindak, kualitas output meningkat secara signifikan, terutama untuk prompt yang kompleks.

Paket Lengkap Wan 2.7

Wan 2.7 bukan hanya satu model. Model ini hadir sebagai paket empat model yang mencakup berbagai alur kerja pembuatan konten:

4
Paket Model
$0.10/dtk
Harga API
6 April
Tanggal Rilis
ModelInputOutputPaling Cocok Untuk
Teks ke VideoPrompt teksKlip videoMembuat dari awal
Gambar ke VideoGambar + promptKlip videoMenganimasikan gambar diam, konsep seni
Referensi ke VideoVideo referensi + promptVideo baruTransfer gaya, pembuatan ulang
Pengeditan VideoVideo + instruksi editVideo yang dimodifikasiPasca-produksi, koreksi

Model teks ke video sudah tersedia di Together AI sejak 3 April. Tiga model sisanya akan diluncurkan secara bertahap dalam beberapa minggu ke depan.

Di Balik Layar: Detail Arsitektur

Meskipun Alibaba belum menerbitkan makalah lengkap, beberapa detail teknis telah muncul dari dokumentasi API dan benchmark awal.

Yang Kita KetahuiYang Membuatnya Berbeda
Dibangun di atas lini arsitektur Wan (Wanxiang)Model produksi pertama dengan perencanaan komposisi eksplisit
Thinking Mode menambahkan tahap perencanaan sebelum difusiAdegan multi-elemen menangani 5+ subjek dengan bersih
Konsistensi karakter hiper-realistis antar frameTeks yang dihasilkan dalam video dapat dibaca, tidak kacau
Kontrol warna presisi melalui prompt conditioningAkurasi warna tetap konsisten meskipun pencahayaan berubah
Rendering teks panjang yang unggul (teks dalam video)Gerakan kamera kompleks mempertahankan koherensi spasial

Kemampuan rendering teks panjang patut diperhatikan secara khusus. Model sebelumnya kesulitan menghasilkan teks yang dapat dibaca dalam frame video. Wan 2.7 menangani papan tanda, label, dan bahkan paragraf pendek dengan akurasi yang mengejutkan. Bagi kreator yang membutuhkan overlay teks yang tertanam dalam rekaman yang dihasilkan, ini merupakan kemajuan yang signifikan.

Perbandingan dengan Kompetitor

Lanskap video AI bergeser cukup besar minggu ini, dengan hadirnya Wan 2.7 bersamaan dengan konfirmasi OpenAI atas penutupan Sora dan pemotongan harga Veo 3.1 oleh Google.

ModelHargaAudioDurasi MaksKonsistensi KarakterThinking/Planning
Wan 2.7$0.10/dtkTidak~10 dtkKuatYa
Veo 3.1 Lite$0.05/dtkYa~8 dtkBaikTidak
Veo 3.1 Fast$0.12/dtkYa~8 dtkKuatTidak
Kling 3.0~$0.08-0.17/dtkYa~10 dtkKuatTidak
Seedance 2.0PaketYa15 dtkBaikTidak
Runway Gen-4.5~$0.15/dtkTidak~10 dtkKuatTidak
โš ๏ธ
Wan 2.7 tidak menyertakan pembuatan audio bawaan. Untuk proyek yang memerlukan suara tersinkronisasi, Anda memerlukan pipeline audio terpisah atau model seperti Kling 3.0 atau Veo 3.1 yang menghasilkan audio secara native.

Harga $0.10 per detik menempatkan Wan 2.7 di tier kompetitif menengah. Harganya dua kali lipat dari opsi hemat Lite milik Google, kompetitif dengan Kling 3.0 (yang bervariasi tergantung platform), dan jauh lebih terjangkau dibandingkan Runway.

Kapan Menggunakan Wan 2.7

Berdasarkan pengujian awal dan kekuatan model, berikut skenario di mana Wan 2.7 paling masuk akal:

๐ŸŽฌ

Adegan Kompleks dengan Banyak Subjek

Thinking Mode unggul ketika prompt Anda melibatkan beberapa karakter atau objek yang berinteraksi. Langkah perencanaan mencegah kebingungan spasial yang mengganggu model lain.
๐Ÿ“

Konten Padat Teks

Jika video Anda membutuhkan teks yang dapat dibaca, papan tanda, atau elemen UI, rendering teks Wan 2.7 saat ini adalah yang terbaik di kelasnya.
๐ŸŽจ

Kontrol Warna dan Gaya yang Presisi

Sistem conditioning warna memungkinkan Anda menentukan palet warna yang tepat dan mempertahankannya sepanjang frame. Sangat berguna untuk konten yang konsisten dengan identitas merek.
๐Ÿ”„

Transfer Gaya melalui Referensi

Model referensi ke video (segera hadir) akan memungkinkan Anda memasukkan klip yang sudah ada sebagai panduan gaya, menghasilkan konten baru yang sesuai dengan bahasa visualnya.

Untuk adegan yang lebih sederhana dengan satu subjek di mana Anda juga memerlukan audio, model seperti Kling 3.0 atau Veo 3.1 mungkin masih menjadi pilihan yang lebih baik. Overhead perencanaan di Thinking Mode memberikan nilai tambah khususnya ketika prompt bersifat kompleks.

Apa Artinya bagi Industri

Thinking Mode dari Wan 2.7 menunjukkan pergeseran yang lebih luas dalam cara kerja model generatif. Alih-alih memaksakan output dari noise, model masa depan kemungkinan akan menyertakan tahap perencanaan eksplisit untuk berbagai aspek pembuatan konten.

Kita sudah melihat pola ini di bidang lain. Model pembuatan kode merencanakan sebelum menulis. Model gambar menggunakan layout conditioning. Sekarang model video sedang belajar untuk berpikir sebelum berkreasi.

๐Ÿ’ก
Cepatnya perilisan model di tahun 2026 membuat komitmen pada satu vendor menjadi berisiko. Pendekatan berbasis pipeline yang dapat mengganti backend pembuatan saat model yang lebih baik hadir akan melindungi alur kerja Anda dari ketergantungan pada satu vendor.

Tekanan kompetitif sangat nyata. Dengan keluarnya Sora, Google yang memotong harga, dan model-model Tiongkok seperti Wan 2.7 serta Kling 3.0 yang terus mendorong batas kualitas, para kreator belum pernah memiliki sebanyak ini pilihan, atau sebanyak ini alasan untuk tetap fleksibel.

Untuk ulasan lebih mendalam tentang perbandingan model-model ini dalam benchmark tertentu, silakan baca analisis kami tentang performa Runway Gen-4.5. Dan jika Anda tertarik dengan bagaimana peluncuran Seedance 2.0 mengubah ekosistem CapCut, kami telah membahasnya secara detail bulan lalu.

Alexis
AlexisAI EngineerAI Author

Insinyur AI dari Lausanne yang memadukan kedalaman riset dengan inovasi praktis. Membagi waktu antara arsitektur model dan puncak Alpen.

View profile โ†’

Suka dengan yang Anda baca?

Ubah ide Anda menjadi video AI berdurasi tak terbatas dalam hitungan menit.

Artikel Terkait

Lanjutkan penjelajahan dengan postingan terkait ini

Menikmati artikel ini?

Temukan lebih banyak wawasan dan dapatkan kabar terbaru dari konten kami.