โลกแบบจำลองนอกเหนือวิดีโอ: เหตุใดเกมมิ่งและหุ่นยนต์จึงเป็นสนามทดสอบที่แท้จริงสำหรับ AGI
จาก DeepMind Genie ไปยัง AMI Labs โลกแบบจำลองกำลังกลายเป็นพื้นฐานสำหรับ AI ที่เข้าใจฟิสิกส์อย่างแท้จริง ตลาดเกมมิ่ง $500B อาจเป็นที่ที่พวกมันพิสูจน์ตัวเองก่อน

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?
เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai เริ่มสร้างหลังชำระเงิน
เมื่อ Yann LeCun ประกาศการจากไป Meta และสถาปนา AMI Labs ด้วยการสนับสนุน €500 ล้าน เขาได้แสดงความเห็นที่นักวิจัยจำนวนมากเชื่อมั่นเป็นอย่างเงียบเป็นร้อยปี โมเดลภาษาขนาดใหญ่ แม้มีความสามารถที่น่าประทับใจทั้งหมด เป็นตัวแทนของการสิ้นสุดที่ตายแล้วบนเส้นทางสู่ปัญญาประดิษฐ์ทั่วไป พวกมันทำนายโทเค็นโดยไม่เข้าใจความเป็นจริง
ทางเลือกคืออะไร? โลกแบบจำลอง ระบบที่เรียนรู้ว่าโลกทางกายภาพทำงานอย่างไร
ข้อจำกัดพื้นฐานของโมเดลภาษา
โลกแบบจำลองเรียนรู้ที่จะทำนายสิ่งที่จะเกิดขึ้นต่อไปในสภาพแวดล้อมทางภาพ ไม่ใช่แค่คำถัดไปในข้อความ นี่ต้องเข้าใจฟิสิกส์ ความถาวรของวัตถุ และเหตุเหตุและผล
โมเดลภาษาเก่งในการจับคู่รูปแบบข้อความ พวกมันสามารถเขียนบทกวี ดีบัก โค้ด และคุยแบบสนทนาที่ไม่น่าเชื่อว่าเป็นมนุษย์ แต่ถามGPT-4 ว่าเกิดอะไรขึ้นเมื่อคุณปล่อยลูกบอล มันอาศัยการจำรายละเอียดมากกว่าสัญชาตญาณทางกายภาพที่แท้จริง
นี่สำคัญเพราะปัญญาที่เราสัมผัสในโลกชีววิทยา ตั้งอยู่บนพื้นฐานของความเป็นจริงทางกายภาพ เด็กเล็กที่เรียนรู้การเรียงซ้อนบล็อกพัฒนาความเข้าใจที่สัญชาตญาณเกี่ยวกับแรงโน้มถ่วง ความสมดุล และคุณสมบัติของวัสดุนานก่อนที่จะเรียนรู้ภาษา ความรู้ที่มีร่างกาย ความรู้สึกว่าโลกทำงานอย่างไร นี่คือสิ่งที่ระบบ AI ในปัจจุบันขาดอยู่
โลกแบบจำลองมีเป้าหมายเพื่อจัดการช่องว่างนี้ แทนที่จะทำนายโทเค็นถัดไป พวกมันทำนายเฟรมถัดไป สถานะทางกายภาพถัดไป และผลที่ตามมาของการกระทำถัดไป
แนวทางสามประการสำหรับความเข้าใจโลก
การแข่งขันเพื่อสร้าง AI ที่เข้าใจโลกแบ่งออกเป็นสามสัจจะที่แตกต่างกัน แต่ละมีจุดแข็งของตัวเอง
ฝึกฝนเกี่ยวกับชุดข้อมูลวิดีโอขนาดใหญ่เพื่อเรียนรู้ฟิสิกส์โดยนัย ตัวอย่างรวมถึง Sora และ Veo ดีในการสร้างเหตุต่อเนื่องที่น่าเชื่อ แต่ต่อสู้กับสถานการณ์แบบโต้ตอบ
สร้างเครื่องมือฟิสิกส์ที่ชัดเจนและฝึก AI ให้นำทางผ่านพวกมัน ต้องการการสร้างสภาพแวดล้อมด้วยตนเองที่มีค่าใช้จ่ายสูง แต่ให้ความแม่นยำทางกายภาพที่แน่นอน
แนวทางที่สาม และอาจเป็นที่มีแนวโน้มมากที่สุด รวมทั้งสองอย่าง: การเรียนรู้พลวัตโลกจากวิดีโอขณะรักษาความสามารถในการโต้ตอบกับสภาพแวดล้อมและจัดการกับมัน นี่คือที่เกมมิ่งเป็นสิ่งจำเป็น
เกมมิ่ง: สนามทดสอบที่สมบูรณ์แบบ
เกมวิดีโอมีสิ่งที่ไม่ซ้ำใคร: สภาพแวดล้อมแบบโต้ตอบที่มีกฎฟิสิกส์ที่สม่ำเสมอ การเปลี่ยนแปลงที่ไม่มีที่สิ้นสุด และการวัดความสำเร็จที่ชัดเจน ต่างจากหุ่นยนต์โลกแห่งความเป็นจริง ซึ่งต้องการฮาร์ดแวร์ที่มีค่าใช้จ่ายสูงและนำเสนอความกังวลด้านความปลอดภัย เกมให้ความล้มเหลวที่ไม่มีข้อ จำกัด โดยไม่มีผลที่ตามมา
DeepMind รับรู้ถึงศักยภาพนี้เร็วขึ้น ระบบ Genie ของพวกเขาสามารถสร้างสภาพแวดล้อมที่สามารถเล่นได้ใหม่ทั้งหมดจากภาพเดียว ให้มันร่างของระดับแพลตฟอร์ม และมันสร้างโลกที่มีกฎฟิสิกส์ที่สม่ำเสมอซึ่งอักษรสามารถกระโดด ตก และโต้ตอบกับวัตถุได้อย่างเหมาะสม
สิ่งที่ทำให้ Genie น่าทึ่งไม่ใช่เพียงแค่การสร้าง แต่ความเข้าใจ ระบบเรียนรู้แนวคิดฟิสิกส์ที่สามารถสรุปได้ทั่วไปซึ่งโอนไปยังสไตล์ภาพและประเภทเกมที่แตกต่างกัน โมเดลที่ฝึกบนแพลตฟอร์มสไตล์ Mario พัฒนาสัญชาตญาณเกี่ยวกับแรงโน้มถ่วงและการชนที่ใช้ได้เท่าเทียมกันกับเกมอินดี้วาดมือและสภาพแวดล้อม 3D ที่สมจริง
จากเกมสู่หุ่นยนต์
ท่อประปาเกมมิ่งต่อหุ่นยนต์ไม่ใช่เชิงทฤษฎี บริษัทใช้มันแล้ว
ระบุช่องว่างการจำลอง
งานวิจัยแสดงให้เห็นว่าโมเดลที่ฝึกในการจำลองอย่างแท่วม่วนต่อสู้กับความขุ่มวาของโลกแห่งความเป็นจริง: แสงที่แตกต่างกัน เซ็นเซอร์ที่ไม่สมบูรณ์ วัตถุที่ไม่คาดคิด
วิธีการแบบไฮบริดเกิดขึ้น
ทีมรวมโลกแบบจำลองที่ฝึกเกมกับการปรับแต่งโลกแห่งความเป็นจริงที่จำกัด ลดข้อมูลที่จำเป็นสำหรับการฝึกหุ่นยนต์อย่างมาก
การปรับใช้เชิงพาณิชย์เริ่มต้น
หุ่นยนต์คลังสินค้าแรกที่ใช้กระดูกสันหลังแบบจำลองโลกเข้าสู่การผลิต จัดการวัตถุใหม่โดยไม่มีการเขียนโปรแกรมที่ชัดเจน
ข้อมูลเชิงลึกที่ขับเคลื่อนการเปลี่ยนแปลงนี้นั้นง่าย: ฟิสิกส์เป็นฟิสิกส์ โมเดลที่เข้าใจว่าวัตถุตกลง เลื่อน และชนกันในเกมวิดีโออย่างแท้จริง ด้วยการปรับปรุงที่เหมาะสม ควรเข้าใจหลักการเดียวกันในโลกแห่งความเป็นจริง รูปลักษณ์ของภาพเปลี่ยนแปลง แต่พลวัตพื้นฐานยังคงเหมือนเดิม
Tesla ปฏิบัติตามเวอร์ชันของกลยุทธ์นี้กับหุ่นยนต์ Optimus ของพวกเขา ฝึกครั้งแรกในการจำลองก่อนการปรับใช้ในสภาพแวดล้อมของโรงงานที่มีการควบคุม ปัจจัยที่จำกัดได้อยู่เสมอเป็นช่องว่างระหว่างฟิสิกส์จำลองและฟิสิกส์จริง โลกแบบจำลองที่ฝึกบนข้อมูลวิดีโอที่หลากหลายอาจสะพานช่องว่างนั้นสุดท้าย
เดิมพันของ AMI Labs
ความพยายามใหม่ของ Yann LeCun เป็น AMI Labs แสดงถึงการลงทุนแบบเดี่ยวที่ใหญ่ที่สุดในการวิจัยแบบจำลองโลก ด้วยเงินทุน €500 ล้านจากยุโรปและทีมที่สรรหามาจาก Meta DeepMind และห้องปฏิบัติการวิทยาศาสตร์ พวกเขาจึงดำเนินการสิ่งที่ LeCun เรียกว่า "AI ที่ขับเคลื่อนด้วยวัตถุประสงค์"
ต่างจาก LLM ที่ทำนายโทเค็น วิธีการของ AMI มุ่งเน้นไปที่การเรียนรู้การแสดงแทนของโลกที่เปิดใช้งานการวางแผนและการให้เหตุผลเกี่ยวกับผลกระทบทางกายภาพ
พื้นฐานทางเทคนิคสร้างบน Joint Embedding Predictive Architecture (JEPA) เป็นกรอบที่ LeCun สนับสนุนมาเป็นเวลาหลายปี แทนที่จะสร้างการทำนายระดับพิกเซล ซึ่งต้องการทรัพยากรการคำนวณมหาศาล JEPA เรียนรู้การแสดงแทนที่เป็นนามธรรมที่จับโครงสร้างสำคัญของระบบทางกายภาพ
คิดเช่นนี้: มนุษย์ที่ดูลูกบอลลูกลงไปยังหน้าผาไม่ได้จำลองทุกพิกเซลของวิถีลูกบอล แต่เราได้รับรู้สถานการณ์ที่เป็นนามธรรม (ลูกบอล ขอบ แรงโน้มถ่วง) และทำนายผลลัพธ์ (ตก) JEPA มีเป้าหมายจับการให้เหตุผลที่มีประสิทธิภาพและเป็นนามธรรมนี้
ผลกระทบต่อการสร้างวิดีโอ AI
วิถีการวิจัยนี้สำคัญอย่างลึกลับสำหรับการใช้งานสร้างสรรค์ เครื่องกำเนิดวิดีโอ AI ในปัจจุบันสร้างผลลัพธ์ที่น่าประทับใจ แต่ทุกข์จากความไม่สอดคล้องตามเวลา ตัวอักษรแปลงร่าง ฟิสิกส์หัก และวัตถุปรากฏและหายไป
โลกแบบจำลองมีวิธีแก้ปัญหาที่เป็นไปได้ เครื่องกำเนิดที่เข้าใจฟิสิกส์อย่างแท้จริงควรสร้างวิดีโอที่วัตถุปฏิบัติตามกฎที่สม่ำเสมอ ซึ่งทำให้ไอเทมตกลงอย่างคาดเดาได้ ซึ่งการสะท้อนแสงทำงานได้อย่างถูกต้อง
โมเดลสร้างเฟรมที่มองเห็นได้อย่างน่าเชื่อโดยไม่ใช้ความสม่ำเสมอทางกายภาพ ใช้งานได้สำหรับคลิปสั้น ๆ แต่พัง
ความสม่ำเสมอทางกายภาพเกิดขึ้นจากพลวัตโลกที่เรียนรู้ วิดีโอที่ยาวนานและสม่ำเสมอกว่าเป็นไปได้เพราะโมเดลรักษาสถานะภายในของโลก
เราเห็นสัญญาณเบื้องต้นของการเปลี่ยนแปลงนี้แล้ว GWM-1 ของ Runway แสดงถึงเดิมพันของพวกเขาบนโลกแบบจำลอง และ การจำลองฟิสิกส์ที่ปรับปรุงของ Veo 3.1 แนะนำว่า Google กำลังรวมหลักการที่คล้ายกัน
การเชื่อมต่อ AGI
ทำไมสิ่งนี้ถึงสำคัญสำหรับปัญญาประดิษฐ์ทั่วไป? เพราะปัญญาที่แท้จริงต้องการมากกว่าการจัดการภาษา มันต้องเข้าใจเหตุและผล ทำนายผลสรุป และวางแผนการกระทำในโลกทางกายภาพ
ความรู้ที่มีร่างกาย
ปัญญาที่แท้จริงอาจต้องการการสนับสนุนในความเป็นจริงทางกายภาพ ไม่ใช่แค่รูปแบบสถิติในข้อความ
การเรียนรู้แบบโต้ตอบ
เกมมีข้อมูลที่สมบูรณ์แบบสำหรับการทดสอบ: ฟิสิกส์ที่อุดมสมบูรณ์ ข้อเสนอแนะที่ชัดเจน การทำซ้ำที่ไม่มีขีดจำกัด
การประยุกต์ใช้หุ่นยนต์
โลกแบบจำลองที่ฝึกในเกมสามารถโอนไปยังหุ่นยนต์โลกแห่งความเป็นจริงด้วยการปรับตัวน้อยที่สุด
นักวิจัยที่ขับเคลื่อนงานนี้อย่างระมัดระวังไม่ได้อ้างว่าพวกเขากำลังสร้าง AGI แต่พวกเขาโต้แย้งอย่างน่าเชื่อว่าไม่มีความเข้าใจของโลก เราไม่สามารถสร้างระบบที่คิดแท้จริง แต่เพียงแค่เติมเต็มโดยอัตโนมัติ
ถัดไปคืออะไร
สองปีต่อไปจะพิสูจน์ว่าวิกฤติ พัฒนาการต่างๆ ที่ต้องดู:
- ✓การแสดงสาธารณะแรกของ AMI Labs (คาดว่าจะเป็นช่วงกลาง 2026)
- ✓การรวมโลกแบบจำลองเข้าไปในเครื่องกำเนิดวิดีโอหลัก
- ✓บริษัทเครื่องมือเกม (Unity Unreal) เพิ่ม API ของโลกแบบจำลอง
- ✓หุ่นยนต์ผู้บริโภคแรกที่ใช้โลกแบบจำลองที่ฝึกเกม
ตลาดเกมมิ่งที่คาดว่าจะเกิน $500 พันล้านภายในปี 2030 แสดงถึงดินแดนที่อุดมสมบูรณ์สำหรับการปรับใช้โลกแบบจำลอง นักลงทุนมองว่าโลกแบบจำลองไม่ใช่เพียงความอยากรู้อยากเห็นของการวิจัยเท่านั้น แต่เป็นเทคโนโลยีพื้นฐานสำหรับความบันเทิงแบบโต้ตอบ การจำลอง และหุ่นยนต์
การปฏิวัติเงียบ
ต่างจากการโปรแกรมแบบระเบิดรอบ ChatGPT การปฏิวัติแบบจำลองโลกเบิกบานอย่างเงียบในห้องปฏิบัติการวิจัยและสตูดิโอเกม ไม่มีการแสดง ไม่มีวงจรข่าวรายวันเกี่ยวกับความก้าวหน้าล่าสุด
แต่นัยสำคัญอาจลึกลับกว่า โมเดลภาษาเปลี่ยนวิธีที่เราโต้ตอบกับข้อความ โลกแบบจำลองสามารถเปลี่ยนวิธีที่ AI โต้ตอบกับความเป็นจริง
สำหรับผู้ที่ทำงานในการสร้างวิดีโอ AI การวิจัยนี้แสดงถึงทั้งภัยคุณกำหนดและความเป็นไปได้ เครื่องมือปัจจุบันของเราอาจดูเหมือนดึกดำบรรพ์ในการย้อนกลับ เช่น CGI ยุคแรกเมื่อเทียบกับ VFX สมัยใหม่ แต่หลักการพื้นฐาน สร้างเนื้อหาที่มองเห็นได้ผ่านโมเดลที่เรียนรู้ จะเพิ่มประสิทธิมากขึ้นเมื่อโมเดลเหล่านั้นเริ่มเข้าใจจริง ๆ โลกที่พวกมันสร้าง
อ่านเพิ่มเติม: สำรวจวิธีที่ diffusion transformers ให้พื้นฐานสถาปัตยกรรมสำหรับโลกแบบจำลองจำนวนมาก หรือเรียนรู้เกี่ยวกับ real-time interactive generation ซึ่งสร้างบนหลักการของโลกแบบจำลอง
เส้นทางจากฟิสิกส์เกมวิดีโอไปยังปัญญาประดิษฐ์ทั่วไปอาจดูเหมือนหมุนวน แต่ปัญญา จึงเรายังหาได้ มาจากระบบที่เข้าใจสภาพแวดล้อมและสามารถทำนายผลของการกระทำของพวกเขา เกมให้เราพื้นที่ปลอดภัยเพื่อสร้างและทดสอบระบบดังกล่าว หุ่นยนต์ เครื่องมือสร้างสรรค์ และบางทีอาจเข้าใจเครื่องแบบที่แท้จริงจะตามมา

เพอร์โซนาวิศวกร AI นำเสนอสถาปัตยกรรมโมเดล เกณฑ์มาตรฐาน และคำอธิบายการนำงานวิจัยไปใช้จริงสำหรับวิดีโอ AI ร่างเนื้อหาด้วย Claude เผยแพร่หลังผ่านการตรวจสอบอัตโนมัติ
View profile →ชอบสิ่งที่คุณอ่านไหม?
เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที เริ่มสร้างหลังชำระเงิน
บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

Yann LeCun ลาออกจาก Meta เพื่อลงทุน 3.5 พันล้านดอลลาร์ใน World Models
ผู้ได้รับรางวัล Turing Award เปิดตัว AMI Labs บริษัทสตาร์ทอัพใหม่ที่เน้น world models แทน LLM โดยมีเป้าหมายด้านหุ่นยนต์ การดูแลสุขภาพ และการเข้าใจวิดีโอ

Runway GWM-1: โมเดลโลกจำลองความเป็นจริงแบบเรียลไทม์
GWM-1 เปลี่ยนจากการสร้างวิดีโอสู่การจำลองโลก สร้างสภาพแวดล้อมที่สำรวจได้ อวตาร และข้อมูลฝึกหุ่นยนต์

วิดีโอ AI พบกับเกม: NVIDIA GDC 2026 หมายถึงอะไรสำหรับผู้สร้างแบบเรียลไทม์
NVIDIA GDC 2026 แสดงให้เห็นการสร้างวิดีโอ AI ที่ทำงานในเครื่องแบบเรียลไทม์ นี่คือความหมายสำหรับนักพัฒนาเกม ผู้สร้างคอนเทนต์ และอนาคตของสื่อแบบอินเทอร์แอกทีฟ