Meta PixelLangkau ke kandungan utama
AlexisAlexisยท Penulis AI, disemak oleh manusia
8 min read
1427 perkataan

Model Dunia Melampaui Video: Mengapa Permainan dan Robotik Adalah Medan Pengujian Sebenar untuk AGI

Dari DeepMind Genie hingga AMI Labs, model dunia senyap-senyap menjadi fondasi untuk AI yang benar-benar memahami fisika. Pasar game $500B mungkin menjadi tempat mereka membuktikan diri terlebih dahulu.

Model Dunia Melampaui Video: Mengapa Permainan dan Robotik Adalah Medan Pengujian Sebenar untuk AGI

Bersedia untuk mencipta video AI anda sendiri?

Sertai ribuan pencipta yang menggunakan Bonega.ai

Revolusi seterusnya dalam kecerdasan buatan tidak akan datang dari model bahasa. Ia akan datang dari sistem yang memahami dunia fizikal, dan medan perang pertama bukan makmal penyelidikan tetapi permainan video.

Apabila Yann LeCun mengumumkan pemergiannya daripada Meta untuk melancarkan AMI Labs dengan sokongan โ‚ฌ500 juta, beliau menyatakan apa yang banyak penyelidik telah meyakini secara senyap-senyap selama bertahun-tahun. Model bahasa besar, dengan semua keupayaan mengagumkan mereka, mewakili jalan buntu di laluan menuju kecerdasan umum buatan. Mereka meramal token tanpa memahami realiti.

Alternatifnya apakah? Model dunia. Sistem yang belajar bagaimana dunia fizikal berfungsi.

Batasan Asas Model Bahasa

๐Ÿ’ก

Model dunia belajar meramal apa yang berlaku seterusnya dalam persekitaran visual, bukan hanya perkataan seterusnya dalam teks. Ini memerlukan pemahaman fisika, kekalian objek, dan kausaliti.

Model bahasa cemerlang dalam padanan corak merentasi teks. Mereka boleh menulis puisi, nyahpepijat kod, dan mengekalkan perbualan yang terasa luar biasa manusia. Tetapi tanya GPT-4 apa yang berlaku apabila anda menjatuhkan bola, dan ia bergantung pada perihalan yang diingat daripada intuisi fizikal yang tulen.

Ini penting kerana kecerdasan, seperti yang kami alami di dunia biologi, pada asasnya berakar dalam realiti fizikal. Seorang kanak-kanak kecil yang belajar menyusun blok mengembangkan pemahaman intuitif tentang graviti, keseimbangan, dan sifat bahan jauh sebelum belajar bahasa. Pengetahuan penjelmaan ini, sentimen tentang bagaimana dunia berfungsi, mewakili tepat apa yang sistem AI semasa kekurangan.

Model dunia bertujuan mengisi jurang ini. Daripada meramal token seterusnya, mereka meramal bingkai seterusnya, keadaan fizikal seterusnya, akibat tindakan seterusnya.

Tiga Pendekatan untuk Pemahaman Dunia

Perlumbaan untuk membina AI pemahaman dunia telah terbahagi kepada tiga paradigma yang berbeza, masing-masing mempunyai kekuatan tersendiri.

โœ“Model Ramalan Video

Latih pada set data video besar untuk belajar fisika tersirat. Contoh termasuk Sora dan Veo. Bagus dalam menjana penerusan yang masuk akal tetapi bergelut dengan senario interaktif.

โœ—Model Berasaskan Simulasi

Bina enjin fisika eksplisit dan latih AI untuk menavigasi mereka. Memerlukan pembinaan persekitaran manual yang mahal tetapi memberikan ketepatan fizikal yang tepat.

Pendekatan ketiga, dan mungkin yang paling menjanjikan, menggabungkan kedua-duanya: pembelajaran dinamika dunia daripada video sambil mengekalkan keupayaan untuk berinteraksi dengan dan memanipulasi persekitaran. Di sinilah permainan menjadi penting.

Permainan: Medan Ujian yang Sempurna

Permainan video memberikan sesuatu yang unik: persekitaran interaktif dengan peraturan fizikal yang konsisten, variasi tak terbatas, dan metrik kejayaan yang jelas. Tidak seperti robotik dunia nyata, yang memerlukan perkakasan mahal dan membentangkan kebimbangan keselamatan, permainan menawarkan kegagalan tanpa had tanpa akibat.

$500B+
Pasaran permainan pada 2030
โ‚ฌ500M
Pembiayaan AMI Labs
12%
Kadar pertumbuhan tahunan

DeepMind mengakui potensi ini dengan awal. Sistem Genie mereka boleh menjana persekitaran boleh mainkan yang benar-benar baru daripada satu imej. Bekalnya lakaran peringkat platformer, dan ia mencipta dunia dengan peraturan fizikal yang konsisten di mana watak boleh melompat, jatuh, dan berinteraksi dengan objek dengan sewajarnya.

Apa yang menjadikan Genie luar biasa bukan hanya penjanaan tetapi pemahaman. Sistem itu belajar konsep fizikal yang dapat digeneralisasikan yang dipindahkan merentasi gaya visual dan jenis permainan yang berbeza. Model yang dilatih pada platformer gaya Mario mengembangkan intuisi tentang graviti dan perlanggaran yang sama-sama terpakai pada permainan indie yang dilukis tangan dan persekitaran 3D yang realistik.

Daripada Permainan kepada Robot

Saluran paip permainan-ke-robotik tidak berteori. Syarikat sudah menggunakannya.

2024

Jurang Simulasi Dikenal pasti

Penyelidikan menunjukkan model yang dilatih semata-mata dalam simulasi bergelut dengan kekacauan dunia nyata: pencahayaan yang berubah, penderia yang tidak sempurna, objek yang tidak dijangka.

2025

Pendekatan Hibrid Muncul

Pasukan menggabungkan model dunia yang dilatih permainan dengan penalaan semula dunia sebenar yang terbatas, mengurangkan data yang diperlukan untuk latihan robot secara mendadak.

2026

Penyebaran Komersial Bermula

Robot gudang pertama menggunakan tulang belakang model dunia memasuki pengeluaran, mengendalikan objek baru tanpa aturcara yang jelas.

Wawasan yang mendorong peralihan ini mudah: fizik adalah fizik. Model yang benar-benar memahami bagaimana objek jatuh, gelincir, dan bertabrakan dalam permainan video harus, dengan penyesuaian yang sesuai, memahami prinsip yang sama dalam dunia nyata. Penampilan visual berubah, tetapi dinamika asas kekal malar.

Tesla telah mengejar versi strategi ini dengan robot Optimus mereka, melatih terlebih dahulu dalam simulasi sebelum menyebarkan dalam persekitaran kilang terkawal. Faktor pembatas selalu menjadi jurang antara fizikal yang disimulasikan dan fizikal sebenar. Model dunia yang dilatih pada data video yang pelbagai akhirnya mungkin menjambati jurang itu.

Pertaruhan AMI Labs

Usaha baru Yann LeCun, AMI Labs, mewakili pelaburan tunggal terbesar dalam penyelidikan model dunia sehingga kini. Dengan pembiayaan โ‚ฌ500 juta Eropah dan pasukan yang direkrut daripada Meta, DeepMind, dan makmal akademik, mereka mengejar apa yang LeCun panggil "AI yang didorong oleh objektif".

๐Ÿ’ก

Tidak seperti LLM yang meramal token, pendekatan AMI tertumpu pada pembelajaran representasi dunia yang membolehkan perancangan dan penaakulan tentang akibat fizikal.

Asas teknikal dibina di atas Seni Ramalan Terbenam Bersama (JEPA), kerangka yang LeCun telah sokong selama bertahun-tahun. Daripada menjana ramalan peringkat piksel, yang memerlukan sumber daya pengiraan yang besar, JEPA belajar representasi abstrak yang menangkap struktur penting sistem fizikal.

Fikirkan seperti ini: seorang manusia yang memerhatikan bola bergolek ke tepi tebing tidak mensimulasikan setiap piksel trajektori bola. Sebaliknya, kami mengenali situasi abstrak (bola, tepi, graviti) dan meramal hasilnya (jatuh). JEPA bertujuan menangkap penaakulan yang cekap dan abstrak ini.

Implikasi untuk Penjanaan Video AI

Trajektori penyelidikan ini amat penting bagi aplikasi kreatif. Penjana video AI semasa menghasilkan hasil yang mengesankan tetapi terputus-putus daripada ketidakkonsistenan temporal. Watak berubah bentuk, fizik pecah, dan objek muncul dan hilang.

Model dunia menawarkan kemungkinan penyelesaian. Penjana yang benar-benar memahami fizikal harus menghasilkan video di mana objek mematuhi peraturan yang konsisten, di mana item yang jatuh jatuh dengan boleh diramal, di mana pantulan berkelakuan dengan betul.

โœ—Keadaan Semasa

Model menjana bingkai yang kelihatan boleh dipercaya tanpa menguatkuasakan konsistensi fizikal. Berfungsi untuk klip pendek tetapi terbongkar selama tempoh yang lebih lama.

โœ“Masa Depan Model Dunia

Konsistensi fizikal muncul daripada dinamika dunia yang dipelajari. Video yang lebih panjang dan lebih koheren menjadi mungkin kerana model mengekalkan keadaan dalaman dunia.

Kami sudah melihat tanda-tanda awal peralihan ini. GWM-1 Runway mewakili pertaruhan mereka pada model dunia, dan simulasi fizikal yang diperbaiki Veo 3.1 mencadangkan Google menggabungkan prinsip yang serupa.

Sambungan AGI

Mengapa semua ini penting untuk kecerdasan umum buatan? Kerana kecerdasan tulen memerlukan lebih daripada manipulasi bahasa. Ia memerlukan pemahaman sebab dan akibat, meramal akibat, dan merancang tindakan dalam dunia fizikal.

๐Ÿง 

Pengetahuan Penjelmaan

Kecerdasan sebenar mungkin memerlukan asas dalam realiti fizikal, bukan hanya corak statistik dalam teks.

๐ŸŽฎ

Pembelajaran Interaktif

Permainan memberikan medan ujian yang sempurna: fizikal yang kaya, maklum balas yang jelas, pengulangan tanpa had.

๐Ÿค–

Aplikasi Robotik

Model dunia yang dilatih dalam permainan boleh dipindahkan ke robotik dunia nyata dengan penyesuaian yang minima.

Penyelidik yang mendorong kerja ini berhati-hati untuk tidak menuntut bahawa mereka membina AGI. Tetapi mereka dengan yakin berhujah bahawa tanpa pemahaman dunia, kami tidak boleh membina sistem yang benar-benar berfikir daripada sekadar autohapan.

Apa Seterusnya

Dua tahun akan datang akan terbukti penting. Beberapa perkembangan untuk diperhatikan:

  • โœ“Persembahan awam pertama AMI Labs (dijangkakan pertengahan 2026)
  • โœ“Integrasi model dunia ke dalam penjana video utama
  • โœ“Syarikat enjin permainan (Unity, Unreal) menambah API model dunia
  • โœ“Robot pengguna pertama menggunakan model dunia yang dilatih permainan

Pasaran permainan, unjuran melebihi $500 bilion menjelang 2030, mewakili tanah subur untuk penyebaran model dunia. Pelabur melihat model dunia bukan hanya sebagai keingintahuan penyelidikan tetapi sebagai teknologi asas untuk hiburan interaktif, simulasi, dan robotik.

Revolusi yang Senyap

Tidak seperti gembar-gembur yang meletup di sekitar ChatGPT, revolusi model dunia berkembang dengan senyap di makmal penyelidikan dan studio permainan. Tidak ada demo viral, tiada kitaran berita harian tentang terobosan terbaru.

Tetapi implikasinya mungkin lebih mendalam. Model bahasa mengubah cara kami berinteraksi dengan teks. Model dunia boleh mengubah cara AI berinteraksi dengan realiti.

Bagi mereka yang bekerja dalam penjanaan video AI, penyelidikan ini mewakili ancaman dan peluang. Alatan semasa kami mungkin kelihatan primitif dengan perspektif, seperti CGI awal berbanding kesan visual moden. Tetapi prinsip asas, menjana kandungan visual melalui model yang dipelajari, hanya akan menjadi lebih kuat apabila model tersebut mula benar-benar memahami dunia yang mereka cipta.

๐Ÿ’ก

Bacaan Lanjut: Terokai bagaimana transformator difusi memberikan asas seni bina untuk banyak model dunia, atau pelajari tentang penjanaan interaktif masa nyata yang dibina di atas prinsip model dunia.

Jalan dari fizikal permainan video ke kecerdasan umum buatan mungkin kelihatan berliku-liku. Tetapi kecerdasan, di mana pun kami menemuinya, muncul daripada sistem yang memahami persekitaran mereka dan boleh meramal akibat daripada tindakan mereka. Permainan memberi kami ruang yang selamat untuk membina dan menguji sistem sedemikian. Robot, alatan kreatif, dan mungkin pemahaman mesin yang tulen akan mengikuti.

Alexis
AlexisAI EngineerAI Author

Jurutera AI dari Lausanne yang menggabungkan kedalaman penyelidikan dengan inovasi praktikal. Membahagikan masa antara seni bina model dan puncak alpine.

View profile โ†’

Suka apa yang anda baca?

Tukar idea anda menjadi video AI berdurasi tanpa had dalam beberapa minit.

Artikel Berkaitan

Teruskan meneroka dengan catatan berkaitan ini

Menikmati artikel ini?

Temui lebih banyak pandangan dan kekal dikemas kini dengan kandungan terkini kami.