Model Dunia Melampaui Video: Mengapa Permainan dan Robotik Adalah Medan Pengujian Sebenar untuk AGI
Dari DeepMind Genie hingga AMI Labs, model dunia senyap-senyap menjadi fondasi untuk AI yang benar-benar memahami fisika. Pasar game $500B mungkin menjadi tempat mereka membuktikan diri terlebih dahulu.

Apabila Yann LeCun mengumumkan pemergiannya daripada Meta untuk melancarkan AMI Labs dengan sokongan โฌ500 juta, beliau menyatakan apa yang banyak penyelidik telah meyakini secara senyap-senyap selama bertahun-tahun. Model bahasa besar, dengan semua keupayaan mengagumkan mereka, mewakili jalan buntu di laluan menuju kecerdasan umum buatan. Mereka meramal token tanpa memahami realiti.
Alternatifnya apakah? Model dunia. Sistem yang belajar bagaimana dunia fizikal berfungsi.
Batasan Asas Model Bahasa
Model dunia belajar meramal apa yang berlaku seterusnya dalam persekitaran visual, bukan hanya perkataan seterusnya dalam teks. Ini memerlukan pemahaman fisika, kekalian objek, dan kausaliti.
Model bahasa cemerlang dalam padanan corak merentasi teks. Mereka boleh menulis puisi, nyahpepijat kod, dan mengekalkan perbualan yang terasa luar biasa manusia. Tetapi tanya GPT-4 apa yang berlaku apabila anda menjatuhkan bola, dan ia bergantung pada perihalan yang diingat daripada intuisi fizikal yang tulen.
Ini penting kerana kecerdasan, seperti yang kami alami di dunia biologi, pada asasnya berakar dalam realiti fizikal. Seorang kanak-kanak kecil yang belajar menyusun blok mengembangkan pemahaman intuitif tentang graviti, keseimbangan, dan sifat bahan jauh sebelum belajar bahasa. Pengetahuan penjelmaan ini, sentimen tentang bagaimana dunia berfungsi, mewakili tepat apa yang sistem AI semasa kekurangan.
Model dunia bertujuan mengisi jurang ini. Daripada meramal token seterusnya, mereka meramal bingkai seterusnya, keadaan fizikal seterusnya, akibat tindakan seterusnya.
Tiga Pendekatan untuk Pemahaman Dunia
Perlumbaan untuk membina AI pemahaman dunia telah terbahagi kepada tiga paradigma yang berbeza, masing-masing mempunyai kekuatan tersendiri.
Latih pada set data video besar untuk belajar fisika tersirat. Contoh termasuk Sora dan Veo. Bagus dalam menjana penerusan yang masuk akal tetapi bergelut dengan senario interaktif.
Bina enjin fisika eksplisit dan latih AI untuk menavigasi mereka. Memerlukan pembinaan persekitaran manual yang mahal tetapi memberikan ketepatan fizikal yang tepat.
Pendekatan ketiga, dan mungkin yang paling menjanjikan, menggabungkan kedua-duanya: pembelajaran dinamika dunia daripada video sambil mengekalkan keupayaan untuk berinteraksi dengan dan memanipulasi persekitaran. Di sinilah permainan menjadi penting.
Permainan: Medan Ujian yang Sempurna
Permainan video memberikan sesuatu yang unik: persekitaran interaktif dengan peraturan fizikal yang konsisten, variasi tak terbatas, dan metrik kejayaan yang jelas. Tidak seperti robotik dunia nyata, yang memerlukan perkakasan mahal dan membentangkan kebimbangan keselamatan, permainan menawarkan kegagalan tanpa had tanpa akibat.
DeepMind mengakui potensi ini dengan awal. Sistem Genie mereka boleh menjana persekitaran boleh mainkan yang benar-benar baru daripada satu imej. Bekalnya lakaran peringkat platformer, dan ia mencipta dunia dengan peraturan fizikal yang konsisten di mana watak boleh melompat, jatuh, dan berinteraksi dengan objek dengan sewajarnya.
Apa yang menjadikan Genie luar biasa bukan hanya penjanaan tetapi pemahaman. Sistem itu belajar konsep fizikal yang dapat digeneralisasikan yang dipindahkan merentasi gaya visual dan jenis permainan yang berbeza. Model yang dilatih pada platformer gaya Mario mengembangkan intuisi tentang graviti dan perlanggaran yang sama-sama terpakai pada permainan indie yang dilukis tangan dan persekitaran 3D yang realistik.
Daripada Permainan kepada Robot
Saluran paip permainan-ke-robotik tidak berteori. Syarikat sudah menggunakannya.
Jurang Simulasi Dikenal pasti
Penyelidikan menunjukkan model yang dilatih semata-mata dalam simulasi bergelut dengan kekacauan dunia nyata: pencahayaan yang berubah, penderia yang tidak sempurna, objek yang tidak dijangka.
Pendekatan Hibrid Muncul
Pasukan menggabungkan model dunia yang dilatih permainan dengan penalaan semula dunia sebenar yang terbatas, mengurangkan data yang diperlukan untuk latihan robot secara mendadak.
Penyebaran Komersial Bermula
Robot gudang pertama menggunakan tulang belakang model dunia memasuki pengeluaran, mengendalikan objek baru tanpa aturcara yang jelas.
Wawasan yang mendorong peralihan ini mudah: fizik adalah fizik. Model yang benar-benar memahami bagaimana objek jatuh, gelincir, dan bertabrakan dalam permainan video harus, dengan penyesuaian yang sesuai, memahami prinsip yang sama dalam dunia nyata. Penampilan visual berubah, tetapi dinamika asas kekal malar.
Tesla telah mengejar versi strategi ini dengan robot Optimus mereka, melatih terlebih dahulu dalam simulasi sebelum menyebarkan dalam persekitaran kilang terkawal. Faktor pembatas selalu menjadi jurang antara fizikal yang disimulasikan dan fizikal sebenar. Model dunia yang dilatih pada data video yang pelbagai akhirnya mungkin menjambati jurang itu.
Pertaruhan AMI Labs
Usaha baru Yann LeCun, AMI Labs, mewakili pelaburan tunggal terbesar dalam penyelidikan model dunia sehingga kini. Dengan pembiayaan โฌ500 juta Eropah dan pasukan yang direkrut daripada Meta, DeepMind, dan makmal akademik, mereka mengejar apa yang LeCun panggil "AI yang didorong oleh objektif".
Tidak seperti LLM yang meramal token, pendekatan AMI tertumpu pada pembelajaran representasi dunia yang membolehkan perancangan dan penaakulan tentang akibat fizikal.
Asas teknikal dibina di atas Seni Ramalan Terbenam Bersama (JEPA), kerangka yang LeCun telah sokong selama bertahun-tahun. Daripada menjana ramalan peringkat piksel, yang memerlukan sumber daya pengiraan yang besar, JEPA belajar representasi abstrak yang menangkap struktur penting sistem fizikal.
Fikirkan seperti ini: seorang manusia yang memerhatikan bola bergolek ke tepi tebing tidak mensimulasikan setiap piksel trajektori bola. Sebaliknya, kami mengenali situasi abstrak (bola, tepi, graviti) dan meramal hasilnya (jatuh). JEPA bertujuan menangkap penaakulan yang cekap dan abstrak ini.
Implikasi untuk Penjanaan Video AI
Trajektori penyelidikan ini amat penting bagi aplikasi kreatif. Penjana video AI semasa menghasilkan hasil yang mengesankan tetapi terputus-putus daripada ketidakkonsistenan temporal. Watak berubah bentuk, fizik pecah, dan objek muncul dan hilang.
Model dunia menawarkan kemungkinan penyelesaian. Penjana yang benar-benar memahami fizikal harus menghasilkan video di mana objek mematuhi peraturan yang konsisten, di mana item yang jatuh jatuh dengan boleh diramal, di mana pantulan berkelakuan dengan betul.
Model menjana bingkai yang kelihatan boleh dipercaya tanpa menguatkuasakan konsistensi fizikal. Berfungsi untuk klip pendek tetapi terbongkar selama tempoh yang lebih lama.
Konsistensi fizikal muncul daripada dinamika dunia yang dipelajari. Video yang lebih panjang dan lebih koheren menjadi mungkin kerana model mengekalkan keadaan dalaman dunia.
Kami sudah melihat tanda-tanda awal peralihan ini. GWM-1 Runway mewakili pertaruhan mereka pada model dunia, dan simulasi fizikal yang diperbaiki Veo 3.1 mencadangkan Google menggabungkan prinsip yang serupa.
Sambungan AGI
Mengapa semua ini penting untuk kecerdasan umum buatan? Kerana kecerdasan tulen memerlukan lebih daripada manipulasi bahasa. Ia memerlukan pemahaman sebab dan akibat, meramal akibat, dan merancang tindakan dalam dunia fizikal.
Pengetahuan Penjelmaan
Kecerdasan sebenar mungkin memerlukan asas dalam realiti fizikal, bukan hanya corak statistik dalam teks.
Pembelajaran Interaktif
Permainan memberikan medan ujian yang sempurna: fizikal yang kaya, maklum balas yang jelas, pengulangan tanpa had.
Aplikasi Robotik
Model dunia yang dilatih dalam permainan boleh dipindahkan ke robotik dunia nyata dengan penyesuaian yang minima.
Penyelidik yang mendorong kerja ini berhati-hati untuk tidak menuntut bahawa mereka membina AGI. Tetapi mereka dengan yakin berhujah bahawa tanpa pemahaman dunia, kami tidak boleh membina sistem yang benar-benar berfikir daripada sekadar autohapan.
Apa Seterusnya
Dua tahun akan datang akan terbukti penting. Beberapa perkembangan untuk diperhatikan:
- โPersembahan awam pertama AMI Labs (dijangkakan pertengahan 2026)
- โIntegrasi model dunia ke dalam penjana video utama
- โSyarikat enjin permainan (Unity, Unreal) menambah API model dunia
- โRobot pengguna pertama menggunakan model dunia yang dilatih permainan
Pasaran permainan, unjuran melebihi $500 bilion menjelang 2030, mewakili tanah subur untuk penyebaran model dunia. Pelabur melihat model dunia bukan hanya sebagai keingintahuan penyelidikan tetapi sebagai teknologi asas untuk hiburan interaktif, simulasi, dan robotik.
Revolusi yang Senyap
Tidak seperti gembar-gembur yang meletup di sekitar ChatGPT, revolusi model dunia berkembang dengan senyap di makmal penyelidikan dan studio permainan. Tidak ada demo viral, tiada kitaran berita harian tentang terobosan terbaru.
Tetapi implikasinya mungkin lebih mendalam. Model bahasa mengubah cara kami berinteraksi dengan teks. Model dunia boleh mengubah cara AI berinteraksi dengan realiti.
Bagi mereka yang bekerja dalam penjanaan video AI, penyelidikan ini mewakili ancaman dan peluang. Alatan semasa kami mungkin kelihatan primitif dengan perspektif, seperti CGI awal berbanding kesan visual moden. Tetapi prinsip asas, menjana kandungan visual melalui model yang dipelajari, hanya akan menjadi lebih kuat apabila model tersebut mula benar-benar memahami dunia yang mereka cipta.
Bacaan Lanjut: Terokai bagaimana transformator difusi memberikan asas seni bina untuk banyak model dunia, atau pelajari tentang penjanaan interaktif masa nyata yang dibina di atas prinsip model dunia.
Jalan dari fizikal permainan video ke kecerdasan umum buatan mungkin kelihatan berliku-liku. Tetapi kecerdasan, di mana pun kami menemuinya, muncul daripada sistem yang memahami persekitaran mereka dan boleh meramal akibat daripada tindakan mereka. Permainan memberi kami ruang yang selamat untuk membina dan menguji sistem sedemikian. Robot, alatan kreatif, dan mungkin pemahaman mesin yang tulen akan mengikuti.

Jurutera AI dari Lausanne yang menggabungkan kedalaman penyelidikan dengan inovasi praktikal. Membahagikan masa antara seni bina model dan puncak alpine.
View profile โArtikel Berkaitan
Teruskan meneroka dengan catatan berkaitan ini

Yann LeCun Meninggalkan Meta untuk Bertaruh $3.5 Bilion pada World Models
Pemenang Turing Award melancarkan AMI Labs, sebuah syarikat permulaan baharu yang memberi tumpuan kepada world models dan bukannya LLM, menyasarkan robotik, penjagaan kesihatan, dan pemahaman video.

Runway GWM-1: Model Dunia Mensimulasikan Realiti dalam Masa Nyata
GWM-1 beralih daripada penjanaan video kepada simulasi dunia. Cipta persekitaran boleh diterokai, avatar dan data latihan robot.

Model Bahasa Video: Sempadan Baharu Selepas LLM dan Ejen AI
Model dunia sedang mengajar AI untuk memahami realiti fizikal, membolehkan robot merancang tindakan dan mensimulasikan hasil sebelum menggerakkan mana-mana aktuator.