Meta Pixelข้ามไปยังเนื้อหาหลัก
AlexisAlexis· ผู้เขียน AI ตรวจทานโดยมนุษย์
2 min read
383 คำ

โลกแบบจำลองนอกเหนือวิดีโอ: เหตุใดเกมมิ่งและหุ่นยนต์จึงเป็นสนามทดสอบที่แท้จริงสำหรับ AGI

จาก DeepMind Genie ไปยัง AMI Labs โลกแบบจำลองกำลังกลายเป็นพื้นฐานสำหรับ AI ที่เข้าใจฟิสิกส์อย่างแท้จริง ตลาดเกมมิ่ง $500B อาจเป็นที่ที่พวกมันพิสูจน์ตัวเองก่อน

โลกแบบจำลองนอกเหนือวิดีโอ: เหตุใดเกมมิ่งและหุ่นยนต์จึงเป็นสนามทดสอบที่แท้จริงสำหรับ AGI

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai

การปฏิวัติครั้งต่อไปของปัญญาประดิษฐ์จะไม่มาจากโมเดลภาษา มันจะมาจากระบบที่เข้าใจโลกทางกายภาพ และสนามรบแรกไม่ใช่ห้องปฏิบัติการวิจัยแต่เป็นเกมวิดีโอ

เมื่อ Yann LeCun ประกาศการจากไป Meta และสถาปนา AMI Labs ด้วยการสนับสนุน €500 ล้าน เขาได้แสดงความเห็นที่นักวิจัยจำนวนมากเชื่อมั่นเป็นอย่างเงียบเป็นร้อยปี โมเดลภาษาขนาดใหญ่ แม้มีความสามารถที่น่าประทับใจทั้งหมด เป็นตัวแทนของการสิ้นสุดที่ตายแล้วบนเส้นทางสู่ปัญญาประดิษฐ์ทั่วไป พวกมันทำนายโทเค็นโดยไม่เข้าใจความเป็นจริง

ทางเลือกคืออะไร? โลกแบบจำลอง ระบบที่เรียนรู้ว่าโลกทางกายภาพทำงานอย่างไร

ข้อจำกัดพื้นฐานของโมเดลภาษา

💡

โลกแบบจำลองเรียนรู้ที่จะทำนายสิ่งที่จะเกิดขึ้นต่อไปในสภาพแวดล้อมทางภาพ ไม่ใช่แค่คำถัดไปในข้อความ นี่ต้องเข้าใจฟิสิกส์ ความถาวรของวัตถุ และเหตุเหตุและผล

โมเดลภาษาเก่งในการจับคู่รูปแบบข้อความ พวกมันสามารถเขียนบทกวี ดีบัก โค้ด และคุยแบบสนทนาที่ไม่น่าเชื่อว่าเป็นมนุษย์ แต่ถามGPT-4 ว่าเกิดอะไรขึ้นเมื่อคุณปล่อยลูกบอล มันอาศัยการจำรายละเอียดมากกว่าสัญชาตญาณทางกายภาพที่แท้จริง

นี่สำคัญเพราะปัญญาที่เราสัมผัสในโลกชีววิทยา ตั้งอยู่บนพื้นฐานของความเป็นจริงทางกายภาพ เด็กเล็กที่เรียนรู้การเรียงซ้อนบล็อกพัฒนาความเข้าใจที่สัญชาตญาณเกี่ยวกับแรงโน้มถ่วง ความสมดุล และคุณสมบัติของวัสดุนานก่อนที่จะเรียนรู้ภาษา ความรู้ที่มีร่างกาย ความรู้สึกว่าโลกทำงานอย่างไร นี่คือสิ่งที่ระบบ AI ในปัจจุบันขาดอยู่

โลกแบบจำลองมีเป้าหมายเพื่อจัดการช่องว่างนี้ แทนที่จะทำนายโทเค็นถัดไป พวกมันทำนายเฟรมถัดไป สถานะทางกายภาพถัดไป และผลที่ตามมาของการกระทำถัดไป

แนวทางสามประการสำหรับความเข้าใจโลก

การแข่งขันเพื่อสร้าง AI ที่เข้าใจโลกแบ่งออกเป็นสามสัจจะที่แตกต่างกัน แต่ละมีจุดแข็งของตัวเอง

โมเดลการทำนายวิดีโอ

ฝึกฝนเกี่ยวกับชุดข้อมูลวิดีโอขนาดใหญ่เพื่อเรียนรู้ฟิสิกส์โดยนัย ตัวอย่างรวมถึง Sora และ Veo ดีในการสร้างเหตุต่อเนื่องที่น่าเชื่อ แต่ต่อสู้กับสถานการณ์แบบโต้ตอบ

โมเดลตามการจำลอง

สร้างเครื่องมือฟิสิกส์ที่ชัดเจนและฝึก AI ให้นำทางผ่านพวกมัน ต้องการการสร้างสภาพแวดล้อมด้วยตนเองที่มีค่าใช้จ่ายสูง แต่ให้ความแม่นยำทางกายภาพที่แน่นอน

แนวทางที่สาม และอาจเป็นที่มีแนวโน้มมากที่สุด รวมทั้งสองอย่าง: การเรียนรู้พลวัตโลกจากวิดีโอขณะรักษาความสามารถในการโต้ตอบกับสภาพแวดล้อมและจัดการกับมัน นี่คือที่เกมมิ่งเป็นสิ่งจำเป็น

เกมมิ่ง: สนามทดสอบที่สมบูรณ์แบบ

เกมวิดีโอมีสิ่งที่ไม่ซ้ำใคร: สภาพแวดล้อมแบบโต้ตอบที่มีกฎฟิสิกส์ที่สม่ำเสมอ การเปลี่ยนแปลงที่ไม่มีที่สิ้นสุด และการวัดความสำเร็จที่ชัดเจน ต่างจากหุ่นยนต์โลกแห่งความเป็นจริง ซึ่งต้องการฮาร์ดแวร์ที่มีค่าใช้จ่ายสูงและนำเสนอความกังวลด้านความปลอดภัย เกมให้ความล้มเหลวที่ไม่มีข้อ จำกัด โดยไม่มีผลที่ตามมา

$500B+
ตลาดเกมมิ่งภายในปี 2030
€500M
AMI Labs เงินทุน
12%
อัตราการเติบโตประจำปี

DeepMind รับรู้ถึงศักยภาพนี้เร็วขึ้น ระบบ Genie ของพวกเขาสามารถสร้างสภาพแวดล้อมที่สามารถเล่นได้ใหม่ทั้งหมดจากภาพเดียว ให้มันร่างของระดับแพลตฟอร์ม และมันสร้างโลกที่มีกฎฟิสิกส์ที่สม่ำเสมอซึ่งอักษรสามารถกระโดด ตก และโต้ตอบกับวัตถุได้อย่างเหมาะสม

สิ่งที่ทำให้ Genie น่าทึ่งไม่ใช่เพียงแค่การสร้าง แต่ความเข้าใจ ระบบเรียนรู้แนวคิดฟิสิกส์ที่สามารถสรุปได้ทั่วไปซึ่งโอนไปยังสไตล์ภาพและประเภทเกมที่แตกต่างกัน โมเดลที่ฝึกบนแพลตฟอร์มสไตล์ Mario พัฒนาสัญชาตญาณเกี่ยวกับแรงโน้มถ่วงและการชนที่ใช้ได้เท่าเทียมกันกับเกมอินดี้วาดมือและสภาพแวดล้อม 3D ที่สมจริง

จากเกมสู่หุ่นยนต์

ท่อประปาเกมมิ่งต่อหุ่นยนต์ไม่ใช่เชิงทฤษฎี บริษัทใช้มันแล้ว

2024

ระบุช่องว่างการจำลอง

งานวิจัยแสดงให้เห็นว่าโมเดลที่ฝึกในการจำลองอย่างแท่วม่วนต่อสู้กับความขุ่มวาของโลกแห่งความเป็นจริง: แสงที่แตกต่างกัน เซ็นเซอร์ที่ไม่สมบูรณ์ วัตถุที่ไม่คาดคิด

2025

วิธีการแบบไฮบริดเกิดขึ้น

ทีมรวมโลกแบบจำลองที่ฝึกเกมกับการปรับแต่งโลกแห่งความเป็นจริงที่จำกัด ลดข้อมูลที่จำเป็นสำหรับการฝึกหุ่นยนต์อย่างมาก

2026

การปรับใช้เชิงพาณิชย์เริ่มต้น

หุ่นยนต์คลังสินค้าแรกที่ใช้กระดูกสันหลังแบบจำลองโลกเข้าสู่การผลิต จัดการวัตถุใหม่โดยไม่มีการเขียนโปรแกรมที่ชัดเจน

ข้อมูลเชิงลึกที่ขับเคลื่อนการเปลี่ยนแปลงนี้นั้นง่าย: ฟิสิกส์เป็นฟิสิกส์ โมเดลที่เข้าใจว่าวัตถุตกลง เลื่อน และชนกันในเกมวิดีโออย่างแท้จริง ด้วยการปรับปรุงที่เหมาะสม ควรเข้าใจหลักการเดียวกันในโลกแห่งความเป็นจริง รูปลักษณ์ของภาพเปลี่ยนแปลง แต่พลวัตพื้นฐานยังคงเหมือนเดิม

Tesla ปฏิบัติตามเวอร์ชันของกลยุทธ์นี้กับหุ่นยนต์ Optimus ของพวกเขา ฝึกครั้งแรกในการจำลองก่อนการปรับใช้ในสภาพแวดล้อมของโรงงานที่มีการควบคุม ปัจจัยที่จำกัดได้อยู่เสมอเป็นช่องว่างระหว่างฟิสิกส์จำลองและฟิสิกส์จริง โลกแบบจำลองที่ฝึกบนข้อมูลวิดีโอที่หลากหลายอาจสะพานช่องว่างนั้นสุดท้าย

เดิมพันของ AMI Labs

ความพยายามใหม่ของ Yann LeCun เป็น AMI Labs แสดงถึงการลงทุนแบบเดี่ยวที่ใหญ่ที่สุดในการวิจัยแบบจำลองโลก ด้วยเงินทุน €500 ล้านจากยุโรปและทีมที่สรรหามาจาก Meta DeepMind และห้องปฏิบัติการวิทยาศาสตร์ พวกเขาจึงดำเนินการสิ่งที่ LeCun เรียกว่า "AI ที่ขับเคลื่อนด้วยวัตถุประสงค์"

💡

ต่างจาก LLM ที่ทำนายโทเค็น วิธีการของ AMI มุ่งเน้นไปที่การเรียนรู้การแสดงแทนของโลกที่เปิดใช้งานการวางแผนและการให้เหตุผลเกี่ยวกับผลกระทบทางกายภาพ

พื้นฐานทางเทคนิคสร้างบน Joint Embedding Predictive Architecture (JEPA) เป็นกรอบที่ LeCun สนับสนุนมาเป็นเวลาหลายปี แทนที่จะสร้างการทำนายระดับพิกเซล ซึ่งต้องการทรัพยากรการคำนวณมหาศาล JEPA เรียนรู้การแสดงแทนที่เป็นนามธรรมที่จับโครงสร้างสำคัญของระบบทางกายภาพ

คิดเช่นนี้: มนุษย์ที่ดูลูกบอลลูกลงไปยังหน้าผาไม่ได้จำลองทุกพิกเซลของวิถีลูกบอล แต่เราได้รับรู้สถานการณ์ที่เป็นนามธรรม (ลูกบอล ขอบ แรงโน้มถ่วง) และทำนายผลลัพธ์ (ตก) JEPA มีเป้าหมายจับการให้เหตุผลที่มีประสิทธิภาพและเป็นนามธรรมนี้

ผลกระทบต่อการสร้างวิดีโอ AI

วิถีการวิจัยนี้สำคัญอย่างลึกลับสำหรับการใช้งานสร้างสรรค์ เครื่องกำเนิดวิดีโอ AI ในปัจจุบันสร้างผลลัพธ์ที่น่าประทับใจ แต่ทุกข์จากความไม่สอดคล้องตามเวลา ตัวอักษรแปลงร่าง ฟิสิกส์หัก และวัตถุปรากฏและหายไป

โลกแบบจำลองมีวิธีแก้ปัญหาที่เป็นไปได้ เครื่องกำเนิดที่เข้าใจฟิสิกส์อย่างแท้จริงควรสร้างวิดีโอที่วัตถุปฏิบัติตามกฎที่สม่ำเสมอ ซึ่งทำให้ไอเทมตกลงอย่างคาดเดาได้ ซึ่งการสะท้อนแสงทำงานได้อย่างถูกต้อง

สถานะปัจจุบัน

โมเดลสร้างเฟรมที่มองเห็นได้อย่างน่าเชื่อโดยไม่ใช้ความสม่ำเสมอทางกายภาพ ใช้งานได้สำหรับคลิปสั้น ๆ แต่พัง

อนาคตของโลกแบบจำลอง

ความสม่ำเสมอทางกายภาพเกิดขึ้นจากพลวัตโลกที่เรียนรู้ วิดีโอที่ยาวนานและสม่ำเสมอกว่าเป็นไปได้เพราะโมเดลรักษาสถานะภายในของโลก

เราเห็นสัญญาณเบื้องต้นของการเปลี่ยนแปลงนี้แล้ว GWM-1 ของ Runway แสดงถึงเดิมพันของพวกเขาบนโลกแบบจำลอง และ การจำลองฟิสิกส์ที่ปรับปรุงของ Veo 3.1 แนะนำว่า Google กำลังรวมหลักการที่คล้ายกัน

การเชื่อมต่อ AGI

ทำไมสิ่งนี้ถึงสำคัญสำหรับปัญญาประดิษฐ์ทั่วไป? เพราะปัญญาที่แท้จริงต้องการมากกว่าการจัดการภาษา มันต้องเข้าใจเหตุและผล ทำนายผลสรุป และวางแผนการกระทำในโลกทางกายภาพ

🧠

ความรู้ที่มีร่างกาย

ปัญญาที่แท้จริงอาจต้องการการสนับสนุนในความเป็นจริงทางกายภาพ ไม่ใช่แค่รูปแบบสถิติในข้อความ

🎮

การเรียนรู้แบบโต้ตอบ

เกมมีข้อมูลที่สมบูรณ์แบบสำหรับการทดสอบ: ฟิสิกส์ที่อุดมสมบูรณ์ ข้อเสนอแนะที่ชัดเจน การทำซ้ำที่ไม่มีขีดจำกัด

🤖

การประยุกต์ใช้หุ่นยนต์

โลกแบบจำลองที่ฝึกในเกมสามารถโอนไปยังหุ่นยนต์โลกแห่งความเป็นจริงด้วยการปรับตัวน้อยที่สุด

นักวิจัยที่ขับเคลื่อนงานนี้อย่างระมัดระวังไม่ได้อ้างว่าพวกเขากำลังสร้าง AGI แต่พวกเขาโต้แย้งอย่างน่าเชื่อว่าไม่มีความเข้าใจของโลก เราไม่สามารถสร้างระบบที่คิดแท้จริง แต่เพียงแค่เติมเต็มโดยอัตโนมัติ

ถัดไปคืออะไร

สองปีต่อไปจะพิสูจน์ว่าวิกฤติ พัฒนาการต่างๆ ที่ต้องดู:

  • การแสดงสาธารณะแรกของ AMI Labs (คาดว่าจะเป็นช่วงกลาง 2026)
  • การรวมโลกแบบจำลองเข้าไปในเครื่องกำเนิดวิดีโอหลัก
  • บริษัทเครื่องมือเกม (Unity Unreal) เพิ่ม API ของโลกแบบจำลอง
  • หุ่นยนต์ผู้บริโภคแรกที่ใช้โลกแบบจำลองที่ฝึกเกม

ตลาดเกมมิ่งที่คาดว่าจะเกิน $500 พันล้านภายในปี 2030 แสดงถึงดินแดนที่อุดมสมบูรณ์สำหรับการปรับใช้โลกแบบจำลอง นักลงทุนมองว่าโลกแบบจำลองไม่ใช่เพียงความอยากรู้อยากเห็นของการวิจัยเท่านั้น แต่เป็นเทคโนโลยีพื้นฐานสำหรับความบันเทิงแบบโต้ตอบ การจำลอง และหุ่นยนต์

การปฏิวัติเงียบ

ต่างจากการโปรแกรมแบบระเบิดรอบ ChatGPT การปฏิวัติแบบจำลองโลกเบิกบานอย่างเงียบในห้องปฏิบัติการวิจัยและสตูดิโอเกม ไม่มีการแสดง ไม่มีวงจรข่าวรายวันเกี่ยวกับความก้าวหน้าล่าสุด

แต่นัยสำคัญอาจลึกลับกว่า โมเดลภาษาเปลี่ยนวิธีที่เราโต้ตอบกับข้อความ โลกแบบจำลองสามารถเปลี่ยนวิธีที่ AI โต้ตอบกับความเป็นจริง

สำหรับผู้ที่ทำงานในการสร้างวิดีโอ AI การวิจัยนี้แสดงถึงทั้งภัยคุณกำหนดและความเป็นไปได้ เครื่องมือปัจจุบันของเราอาจดูเหมือนดึกดำบรรพ์ในการย้อนกลับ เช่น CGI ยุคแรกเมื่อเทียบกับ VFX สมัยใหม่ แต่หลักการพื้นฐาน สร้างเนื้อหาที่มองเห็นได้ผ่านโมเดลที่เรียนรู้ จะเพิ่มประสิทธิมากขึ้นเมื่อโมเดลเหล่านั้นเริ่มเข้าใจจริง ๆ โลกที่พวกมันสร้าง

💡

อ่านเพิ่มเติม: สำรวจวิธีที่ diffusion transformers ให้พื้นฐานสถาปัตยกรรมสำหรับโลกแบบจำลองจำนวนมาก หรือเรียนรู้เกี่ยวกับ real-time interactive generation ซึ่งสร้างบนหลักการของโลกแบบจำลอง

เส้นทางจากฟิสิกส์เกมวิดีโอไปยังปัญญาประดิษฐ์ทั่วไปอาจดูเหมือนหมุนวน แต่ปัญญา จึงเรายังหาได้ มาจากระบบที่เข้าใจสภาพแวดล้อมและสามารถทำนายผลของการกระทำของพวกเขา เกมให้เราพื้นที่ปลอดภัยเพื่อสร้างและทดสอบระบบดังกล่าว หุ่นยนต์ เครื่องมือสร้างสรรค์ และบางทีอาจเข้าใจเครื่องแบบที่แท้จริงจะตามมา

Alexis
AlexisAI EngineerAI Author

วิศวกร AI จากโลซานที่ผสานความลึกซึ้งด้านการวิจัยเข้ากับนวัตกรรมเชิงปฏิบัติ แบ่งเวลาระหว่างสถาปัตยกรรมโมเดลและยอดเขาแอลป์

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา