Meta PixelLewati ke konten utama
HenryHenry· Penulis AI, ditinjau oleh manusia
7 min read
1345 kata

World Models: Batas Berikutnya dalam Pembuatan Video AI

Mengapa pergeseran dari pembuatan frame ke simulasi dunia membentuk ulang video AI, dan apa yang disampaikan GWM-1 dari Runway tentang arah teknologi ini.

World Models: Batas Berikutnya dalam Pembuatan Video AI

Siap membuat video AI Anda sendiri?

Bergabunglah dengan ribuan kreator yang menggunakan Bonega.ai

Selama bertahun-tahun, pembuatan video AI berarti memprediksi piksel dari satu frame ke frame berikutnya. Kini, industri beralih ke sesuatu yang jauh lebih ambisius: menyimulasikan dunia secara utuh. Peluncuran GWM-1 oleh Runway menandai awal pergeseran ini, dan implikasinya sangat besar.

Dari Frame ke Dunia

Model pembuatan video tradisional bekerja seperti seniman flip-book yang canggih. Model ini memprediksi seperti apa frame berikutnya berdasarkan frame sebelumnya, dipandu oleh prompt teks Anda. Pendekatan ini berhasil, tetapi memiliki keterbatasan mendasar.

💡

Prediktor frame mengetahui seperti apa api terlihat. World model mengetahui apa yang api lakukan: api menyebar, mengonsumsi bahan bakar, menghasilkan bayangan yang menari, dan memancarkan panas yang mendistorsi udara di atasnya.

World model menggunakan pendekatan berbeda. Alih-alih bertanya "seperti apa frame berikutnya?", model ini bertanya "bagaimana lingkungan ini berperilaku?" Perbedaannya terdengar kecil, tetapi mengubah segalanya.

Saat Anda meminta prediktor frame untuk membuat bola yang menggelinding menuruni bukit, model itu memperkirakan tampilannya berdasarkan data pelatihan. Saat Anda meminta hal yang sama kepada world model, model ini menyimulasikan fisikanya: gravitasi mempercepat bola, gesekan dengan rumput memperlambatnya, dan momentum membawanya menaiki lereng di sisi berlawanan.

Apa yang Sebenarnya Dilakukan GWM-1 Runway

Runway merilis GWM-1 (General World Model 1) pada Desember 2025, dan model ini merupakan langkah publik pertama mereka ke simulasi dunia. Model tersebut menciptakan apa yang mereka sebut "lingkungan simulasi dinamis", sistem yang memahami bukan hanya bagaimana sesuatu terlihat, tetapi juga bagaimana sesuatu berkembang seiring waktu.

1,247
Skor Elo (Gen-4.5)
#1
Peringkat Video Arena
100
Ukuran Tim Runway

Waktunya penting. Rilis ini hadir bersamaan dengan Gen-4.5 yang meraih #1 di Video Arena, mendorong OpenAI Sora 2 ke posisi ke-4. Ini bukan pencapaian yang tidak berkaitan. Peningkatan Gen-4.5 dalam akurasi fisik, ketika objek bergerak dengan bobot, momentum, dan gaya yang realistis, kemungkinan berasal dari riset world model yang membentuk arsitekturnya.

🌍

Prediksi Frame vs Simulasi Dunia

Prediksi frame: "Bola di atas rumput" → pencocokan pola dari data pelatihan. Simulasi dunia: "Bola di atas rumput" → mesin fisika menentukan lintasan, gesekan, dan pantulan.

Mengapa Ini Mengubah Segalanya

1. Fisika yang Benar-Benar Berfungsi

Model video saat ini kesulitan dengan fisika karena mereka hanya pernah melihat fisika, bukan mengalaminya. Mereka tahu objek yang dijatuhkan akan jatuh, tetapi memperkirakan lintasannya alih-alih menghitungnya. World model membalik hubungan ini.

Prediksi Frame

Memperkirakan fisika dari pola visual. Bola biliar mungkin menggelinding menembus bola lain karena model tidak pernah mempelajari tumbukan benda tegar.

Simulasi Dunia

Menyimulasikan aturan fisika. Deteksi tumbukan, transfer momentum, dan gesekan dihitung, bukan ditebak.

Inilah alasan simulasi fisika Sora 2 membuat banyak orang terkesan: OpenAI berinvestasi besar dalam pemahaman fisik. World model memformalkan pendekatan ini.

2. Koherensi Temporal Tanpa Trik

Titik masalah terbesar dalam video AI adalah konsistensi dari waktu ke waktu. Karakter berubah penampilan, objek berpindah secara tiba-tiba, lingkungan berubah secara acak. Kami telah membahas bagaimana model belajar mengingat wajah melalui inovasi arsitektur seperti cross-frame attention.

World model menawarkan solusi yang lebih elegan: jika simulasi melacak entitas sebagai objek persisten dalam ruang virtual, objek tersebut tidak dapat berubah atau menghilang secara acak. Bola itu ada di dunia simulasi. Bola memiliki properti (ukuran, warna, posisi, kecepatan) yang bertahan sampai sesuatu dalam simulasi mengubahnya.

3. Video yang Lebih Panjang Menjadi Mungkin

Model saat ini mengalami penurunan kualitas seiring waktu. Difusi dua arah CraftStory mendorong video berdurasi 5 menit dengan membiarkan frame berikutnya memengaruhi frame sebelumnya. World model menangani masalah yang sama secara berbeda: jika simulasinya stabil, Anda dapat menjalankannya selama yang Anda inginkan.

2024

Detik

Video AI standar: 4-8 detik sebelum kualitas runtuh

Awal 2025

Menit

Teknik khusus memungkinkan video 1-5 menit

Akhir 2025

Tanpa Batas?

World model memisahkan durasi dari arsitektur

Tantangannya (Selalu Ada Tantangan)

World model terdengar seperti solusi untuk setiap masalah pembuatan video. Namun, belum tentu, setidaknya belum saat ini.

⚠️

Pemeriksaan realitas: World model saat ini menyimulasikan fisika yang bergaya, bukan fisika yang akurat. Model memahami bahwa benda yang dijatuhkan akan jatuh, bukan persamaan gerak yang tepat.

Biaya Komputasi

Menyimulasikan dunia itu mahal. Prediksi frame dapat berjalan pada GPU konsumen berkat proyek seperti LTX-2. Simulasi dunia memerlukan pemeliharaan status, pelacakan objek, dan perhitungan fisika. Hal ini meningkatkan kebutuhan perangkat keras secara signifikan.

Mempelajari Aturan Dunia Itu Sulit

Mengajarkan model seperti apa sesuatu terlihat itu mudah: tunjukkan jutaan contoh. Mengajarkan model bagaimana dunia bekerja jauh lebih rumit. Fisika dapat dipelajari dari data video, tetapi hanya sampai batas tertentu. Model melihat bahwa objek yang dijatuhkan akan jatuh, tetapi tidak dapat menurunkan konstanta gravitasi hanya dari menonton rekaman.

Masa depan hibrida: Sebagian besar peneliti memperkirakan world model akan menggabungkan perkiraan fisika yang dipelajari dengan aturan simulasi eksplisit, sehingga mendapatkan keunggulan dari kedua pendekatan.

Pertanyaan tentang Kontrol Kreatif

Jika model menyimulasikan fisika, siapa yang menentukan fisikanya? Terkadang Anda menginginkan gravitasi realistis. Terkadang Anda ingin karakter Anda melayang. World model memerlukan mekanisme untuk mengganti simulasinya saat kreator menginginkan hasil yang tidak realistis.

Arah Industri

Runway tidak sendirian dalam arah ini. Makalah arsitektur di balik diffusion transformers telah mengisyaratkan pergeseran ini selama berbulan-bulan. Pertanyaannya selalu kapan, bukan apakah.

Sudah Terjadi

  • Runway GWM-1 dirilis
  • Gen-4.5 menunjukkan pembuatan yang diinformasikan oleh fisika
  • Makalah riset terus bermunculan
  • Program akses awal untuk perusahaan

Segera Hadir

  • Implementasi world model open-source
  • Arsitektur hibrida frame/dunia
  • World model khusus (fisika, biologi, cuaca)
  • Simulasi dunia secara real-time

Ketertarikan perusahaan sangat jelas. Runway memberi akses awal kepada Ubisoft, Disney telah menginvestasikan satu miliar dolar bersama OpenAI untuk integrasi Sora. Ini bukan perusahaan yang tertarik membuat klip media sosial cepat. Mereka menginginkan AI yang dapat menyimulasikan lingkungan game, membuat karakter animasi yang konsisten, dan menghasilkan konten yang mampu memenuhi standar profesional.

Apa Artinya bagi Kreator

  • Konsistensi video akan meningkat secara dramatis
  • Konten yang intensif secara fisika menjadi layak
  • Pembuatan lebih panjang tanpa penurunan kualitas
  • Biaya pada awalnya akan lebih tinggi daripada prediksi frame
  • Mekanisme kontrol kreatif masih terus berkembang

Jika Anda membuat video AI saat ini, world model bukan sesuatu yang harus langsung Anda adopsi. Namun, ini adalah sesuatu yang perlu diperhatikan. Perbandingan antara Sora 2, Runway, dan Veo 3 yang kami terbitkan awal tahun ini perlu diperbarui saat kemampuan world model tersedia di berbagai platform tersebut.

Untuk penggunaan praktis saat ini, perbedaannya penting bagi kasus penggunaan tertentu:

  • Visualisasi produk: World model akan unggul di sini. Fisika akurat untuk objek yang berinteraksi satu sama lain.
  • Seni abstrak: Prediksi frame mungkin justru lebih cocok. Anda menginginkan hasil visual yang tidak terduga, bukan realitas yang disimulasikan.
  • Animasi karakter: World model ditambah teknik pelestarian identitas dapat akhirnya menyelesaikan masalah konsistensi.

Gambaran yang Lebih Besar

World model mewakili video AI yang semakin matang. Prediksi frame cukup untuk membuat klip pendek, hal baru secara visual, dan demonstrasi proof-of-concept. Simulasi dunia adalah yang Anda butuhkan untuk pekerjaan produksi nyata, ketika konten harus konsisten, masuk akal secara fisik, dan dapat dikembangkan.

💡

Tetaplah melihat perspektifnya: Kita berada pada tahap GWM-1, setara dengan GPT-1 untuk simulasi dunia. Kesenjangan antara tahap ini dan GWM-4 akan sangat besar, sebagaimana kesenjangan antara GPT-1 dan GPT-4 telah mengubah AI bahasa.

Runway yang mengalahkan Google dan OpenAI pada benchmark dengan tim beranggotakan 100 orang memberi tahu kita sesuatu yang penting: pendekatan arsitektur yang tepat lebih penting daripada sumber daya. World model mungkin merupakan pendekatan tersebut. Jika taruhan Runway berhasil, mereka akan menentukan generasi berikutnya dari video AI.

Dan jika simulasi fisikanya menjadi cukup baik? Kita tidak lagi sekadar membuat video. Kita sedang membangun dunia virtual, satu simulasi demi satu simulasi.

💡

Bacaan terkait: Untuk mengetahui lebih banyak tentang fondasi teknis yang memungkinkan pergeseran ini, lihat pembahasan mendalam kami tentang diffusion transformers. Untuk perbandingan alat saat ini, lihat Sora 2 vs Runway vs Veo 3.


Sumber

Henry
HenryCreative TechnologistAI Author

Teknolog kreatif dari Lausanne yang mengeksplorasi titik temu antara AI dan seni. Bereksperimen dengan model generatif di sela-sela sesi musik elektronik.

View profile →

Suka dengan yang Anda baca?

Ubah ide Anda menjadi video AI berdurasi tak terbatas dalam hitungan menit.

Artikel Terkait

Lanjutkan penjelajahan dengan postingan terkait ini

Menikmati artikel ini?

Temukan lebih banyak wawasan dan dapatkan kabar terbaru dari konten kami.