World Models: พรมแดนถัดไปของการสร้างวิดีโอด้วย AI
เหตุใดการเปลี่ยนจากการสร้างเฟรมไปสู่การจำลองโลกจึงกำลังปรับโฉมวิดีโอ AI และ GWM-1 ของ Runway บอกอะไรเราเกี่ยวกับทิศทางของเทคโนโลยีนี้

หลายปีที่ผ่านมา การสร้างวิดีโอด้วย AI หมายถึงการคาดการณ์พิกเซลทีละเฟรม แต่ตอนนี้อุตสาหกรรมกำลังหันไปสู่สิ่งที่ทะเยอทะยานกว่ามาก นั่นคือการจำลองโลกทั้งใบ การเปิดตัว GWM-1 ของ Runway คือจุดเริ่มต้นของการเปลี่ยนผ่านนี้ และผลกระทบของมันมีนัยสำคัญอย่างยิ่ง
จากเฟรมสู่โลก
โมเดลสร้างวิดีโอแบบดั้งเดิมทำงานคล้ายศิลปินผู้สร้างภาพพลิกที่ซับซ้อน พวกมันคาดการณ์ว่าเฟรมถัดไปควรมีลักษณะอย่างไรจากเฟรมก่อนหน้า โดยอิงตามข้อความพรอมต์ของคุณ มันใช้งานได้ แต่มีข้อจำกัดพื้นฐาน
ตัวคาดการณ์เฟรมรู้ว่าไฟ มีลักษณะอย่างไร ส่วน world model รู้ว่าไฟ ทำอะไร: มันลุกลาม มันเผาผลาญเชื้อเพลิง มันทิ้งเงาที่เคลื่อนไหวและปล่อยความร้อนจนทำให้อากาศเหนือเปลวไฟบิดเบือน
World models ใช้แนวทางที่แตกต่างออกไป แทนที่จะถามว่า "เฟรมถัดไปควรมีลักษณะอย่างไร?" พวกมันถามว่า "สภาพแวดล้อมนี้ทำงานอย่างไร?" ความแตกต่างอาจฟังดูเล็กน้อย แต่มันเปลี่ยนทุกอย่าง
เมื่อคุณบอกตัวคาดการณ์เฟรมให้สร้างลูกบอลกลิ้งลงเนิน มันจะประมาณภาพที่น่าจะเป็นจากข้อมูลฝึก แต่เมื่อคุณบอก world model ในสิ่งเดียวกัน มันจะจำลองฟิสิกส์: แรงโน้มถ่วงเร่งลูกบอล แรงเสียดทานกับหญ้าทำให้มันช้าลง และโมเมนตัมพามันขึ้นไปบนทางลาดฝั่งตรงข้าม
สิ่งที่ GWM-1 ของ Runway ทำจริง ๆ
Runway เปิดตัว GWM-1 (General World Model 1) ในเดือนธันวาคม 2025 และนี่คือก้าวสาธารณะครั้งแรกของบริษัทสู่การจำลองโลก โมเดลนี้สร้างสิ่งที่พวกเขาเรียกว่า "สภาพแวดล้อมการจำลองแบบไดนามิก" ซึ่งเป็นระบบที่เข้าใจไม่เพียงว่าสิ่งต่าง ๆ ปรากฏอย่างไร แต่ยังเข้าใจว่ามันเปลี่ยนแปลงไปตามเวลาอย่างไร
จังหวะเวลามีความสำคัญ การเปิดตัวนี้เกิดขึ้นพร้อมกับ Gen-4.5 ขึ้นอันดับ 1 บน Video Arena ซึ่งผลัก OpenAI Sora 2 ลงไปอยู่อันดับ 4 ความสำเร็จเหล่านี้ไม่ใช่เรื่องที่ไม่เกี่ยวข้องกัน การพัฒนาของ Gen-4.5 ด้านความแม่นยำทางกายภาพ ซึ่งวัตถุเคลื่อนไหวด้วยน้ำหนัก โมเมนตัม และแรงที่สมจริง น่าจะมาจากงานวิจัย world model ที่ส่งผลต่อสถาปัตยกรรมของมัน
การคาดการณ์เฟรมเทียบกับการจำลองโลก
การคาดการณ์เฟรม: "ลูกบอลบนหญ้า" → การจับคู่รูปแบบจากข้อมูลฝึก การจำลองโลก: "ลูกบอลบนหญ้า" → เอนจินฟิสิกส์กำหนดวิถี แรงเสียดทาน และการเด้ง
เหตุใดสิ่งนี้จึงเปลี่ยนทุกอย่าง
1. ฟิสิกส์ที่ทำงานได้จริง
โมเดลวิดีโอปัจจุบันมีปัญหากับฟิสิกส์ เพราะพวกมันเพียงเคยเห็นฟิสิกส์ แต่ไม่เคยสัมผัสมัน พวกมันรู้ว่าวัตถุที่ถูกปล่อยจะตก แต่จะประมาณวิถีแทนการคำนวณ World models พลิกความสัมพันธ์นี้
ประมาณฟิสิกส์จากรูปแบบภาพ ลูกบิลเลียดอาจกลิ้งทะลุลูกอื่น เพราะโมเดลไม่เคยเรียนรู้การชนของวัตถุแข็งเกร็ง
จำลองกฎฟิสิกส์ การตรวจจับการชน การถ่ายโอนโมเมนตัม และแรงเสียดทานถูกคำนวณ ไม่ใช่การคาดเดา
นี่คือเหตุผลที่ การจำลองฟิสิกส์ของ Sora 2 สร้างความประทับใจให้ผู้คน: OpenAI ลงทุนอย่างมากกับความเข้าใจทางกายภาพ World models ทำให้แนวทางนี้เป็นระบบชัดเจนขึ้น
2. ความต่อเนื่องตามเวลาโดยไม่ต้องใช้กลเม็ด
จุดเจ็บปวดที่ใหญ่ที่สุดของวิดีโอ AI คือความสม่ำเสมอตามเวลา ตัวละครเปลี่ยนรูปลักษณ์ วัตถุเคลื่อนย้ายทันที สภาพแวดล้อมเปลี่ยนแบบสุ่ม เราได้สำรวจ วิธีที่โมเดลกำลังเรียนรู้การจดจำใบหน้า ผ่านนวัตกรรมเชิงสถาปัตยกรรม เช่น cross-frame attention
World models เสนอทางออกที่สง่างามกว่า: หากการจำลองติดตามเอนทิตีในฐานะวัตถุถาวรในพื้นที่เสมือน พวกมันก็ไม่อาจเปลี่ยนหรือหายไปแบบสุ่มได้ ลูกบอลมีอยู่ในโลกที่จำลอง มันมีคุณสมบัติ (ขนาด สี ตำแหน่ง ความเร็ว) ที่คงอยู่จนกว่าจะมีบางสิ่งในการจำลองเปลี่ยนแปลงมัน
3. วิดีโอที่ยาวขึ้นกลายเป็นไปได้
โมเดลปัจจุบันเสื่อมคุณภาพไปตามเวลา diffusion แบบสองทิศทางของ CraftStory ผลักดันไปสู่วิดีโอ 5 นาทีด้วยการให้เฟรมหลังมีอิทธิพลต่อเฟรมก่อน World models เข้าหาปัญหาเดียวกันด้วยวิธีต่างออกไป: หากการจำลองมีเสถียรภาพ คุณก็สามารถรันมันได้นานเท่าที่ต้องการ
วินาที
วิดีโอ AI มาตรฐาน: 4-8 วินาทีก่อนคุณภาพพังลง
นาที
เทคนิคเฉพาะทางทำให้วิดีโอความยาว 1-5 นาทีเป็นไปได้
ไม่จำกัด?
World models แยกระยะเวลาออกจากสถาปัตยกรรม
ข้อควรระวัง (ย่อมมีข้อควรระวังเสมอ)
World models ฟังดูเหมือนเป็นคำตอบของทุกปัญหาในการสร้างวิดีโอ แต่ยังไม่ใช่ อย่างน้อยก็ในตอนนี้
ตรวจสอบความเป็นจริง: World models ปัจจุบันจำลองฟิสิกส์แบบ มีสไตล์ ไม่ใช่ฟิสิกส์ที่แม่นยำ พวกมันเข้าใจว่าสิ่งที่ถูกปล่อยตกลงมา ไม่ใช่สมการการเคลื่อนที่ที่แน่นอน
ต้นทุนการประมวลผล
การจำลองโลกมีค่าใช้จ่ายสูง การคาดการณ์เฟรมสามารถทำงานบน GPU สำหรับผู้บริโภคได้ด้วยผลงานจากโครงการอย่าง LTX-2 การจำลองโลกต้องรักษาสถานะ ติดตามวัตถุ และรันการคำนวณฟิสิกส์ สิ่งนี้เพิ่มความต้องการด้านฮาร์ดแวร์อย่างมาก
การเรียนรู้กฎของโลกเป็นเรื่องยาก
การสอนโมเดลว่าสิ่งต่าง ๆ มีลักษณะอย่างไร นั้นตรงไปตรงมา: แสดงตัวอย่างหลายล้านรายการให้มันดู แต่การสอนโมเดลว่าโลก ทำงานอย่างไร นั้นคลุมเครือกว่า ฟิสิกส์เรียนรู้ได้จากข้อมูลวิดีโอ แต่มีขีดจำกัด โมเดลเห็นว่าวัตถุที่ถูกปล่อยตกลงมา แต่ไม่สามารถอนุมานค่าคงที่แรงโน้มถ่วงจากการดูภาพวิดีโอได้
อนาคตแบบไฮบริด: นักวิจัยส่วนใหญ่คาดว่า world models จะผสานการประมาณฟิสิกส์ที่เรียนรู้เข้ากับกฎการจำลองแบบชัดเจน เพื่อรับข้อดีของทั้งสองแนวทาง
คำถามเรื่องการควบคุมเชิงสร้างสรรค์
หากโมเดลกำลังจำลองฟิสิกส์ ใครเป็นผู้กำหนดฟิสิกส์นั้น? บางครั้งคุณต้องการแรงโน้มถ่วงที่สมจริง บางครั้งคุณต้องการให้ตัวละครลอยได้ World models ต้องมีกลไกสำหรับแทนที่การจำลองของตน เมื่อผู้สร้างต้องการผลลัพธ์ที่ไม่สมจริง
อุตสาหกรรมกำลังมุ่งหน้าไปทางไหน
Runway ไม่ได้เดินไปในทิศทางนี้เพียงลำพัง เอกสารด้านสถาปัตยกรรมเบื้องหลัง diffusion transformers ส่งสัญญาณถึงการเปลี่ยนแปลงนี้มาหลายเดือนแล้ว คำถามมีมาโดยตลอดว่า เมื่อไร ไม่ใช่ หรือไม่
กำลังเกิดขึ้นแล้ว
- เปิดตัว Runway GWM-1 แล้ว
- Gen-4.5 แสดงให้เห็นการสร้างที่อิงข้อมูลฟิสิกส์
- เอกสารวิจัยเพิ่มจำนวนขึ้นอย่างต่อเนื่อง
- โปรแกรม early access สำหรับองค์กร
กำลังจะมาเร็ว ๆ นี้
- การใช้งาน world model แบบโอเพนซอร์ส
- สถาปัตยกรรมไฮบริดระหว่างเฟรมและโลก
- World models เฉพาะทาง (ฟิสิกส์ ชีววิทยา สภาพอากาศ)
- การจำลองโลกแบบเรียลไทม์
ความสนใจจากองค์กรบอกอะไรได้มาก Runway ให้ Ubisoft เข้าถึงก่อนกำหนด ขณะที่ Disney ลงทุนหนึ่งพันล้านดอลลาร์กับ OpenAI เพื่อการผสาน Sora บริษัทเหล่านี้ไม่ได้สนใจสร้างคลิปโซเชียลมีเดียแบบรวดเร็ว พวกเขาต้องการ AI ที่สามารถจำลองสภาพแวดล้อมของเกม สร้างตัวละครแอนิเมชันที่สม่ำเสมอ และผลิตคอนเทนต์ที่ผ่านการตรวจสอบในระดับมืออาชีพได้
สิ่งนี้หมายความว่าอย่างไรสำหรับครีเอเตอร์
- ✓ความสม่ำเสมอของวิดีโอจะดีขึ้นอย่างมาก
- ✓คอนเทนต์ที่เน้นฟิสิกส์จะใช้งานได้จริง
- ✓สร้างวิดีโอได้นานขึ้นโดยคุณภาพไม่พังลง
- ✓ต้นทุนในช่วงแรกจะสูงกว่าการคาดการณ์เฟรม
- ✓กลไกการควบคุมเชิงสร้างสรรค์ยังอยู่ระหว่างการพัฒนา
หากคุณกำลังผลิตวิดีโอ AI ในวันนี้ World models ยังไม่ใช่สิ่งที่คุณต้องนำมาใช้ทันที แต่เป็นสิ่งที่ควรจับตาดู การเปรียบเทียบระหว่าง Sora 2, Runway และ Veo 3 ที่เราเผยแพร่เมื่อต้นปีนี้จะต้องได้รับการอัปเดต เมื่อความสามารถของ world model เริ่มเปิดใช้ในแพลตฟอร์มเหล่านี้
สำหรับการใช้งานจริงในตอนนี้ ความแตกต่างมีผลต่อกรณีใช้งานเฉพาะ:
- การสร้างภาพผลิตภัณฑ์: World models จะโดดเด่นในด้านนี้ ฟิสิกส์ที่แม่นยำสำหรับวัตถุที่โต้ตอบกัน
- ศิลปะนามธรรม: การคาดการณ์เฟรมอาจเหมาะกว่า คุณต้องการผลลัพธ์ภาพที่คาดไม่ถึง ไม่ใช่ความเป็นจริงที่จำลองขึ้น
- แอนิเมชันตัวละคร: World models ร่วมกับเทคนิคการรักษาอัตลักษณ์ อาจแก้ปัญหาความสม่ำเสมอได้ในที่สุด
ภาพใหญ่
World models คือการเติบโตของวิดีโอ AI การคาดการณ์เฟรมเพียงพอสำหรับการสร้างคลิปสั้น ความแปลกใหม่ทางภาพ และการสาธิต proof-of-concept แต่การจำลองโลกคือสิ่งที่คุณต้องการสำหรับงานผลิตจริง ซึ่งคอนเทนต์ต้องมีความสม่ำเสมอ น่าเชื่อถือทางกายภาพ และขยายต่อได้
มองภาพตามความเป็นจริง: เราอยู่ในช่วง GWM-1 ซึ่งเทียบเท่ากับ GPT-1 สำหรับการจำลองโลก ช่องว่างระหว่างสิ่งนี้กับ GWM-4 จะมหาศาล เช่นเดียวกับช่องว่างระหว่าง GPT-1 และ GPT-4 ที่เปลี่ยนโฉม AI ภาษา
การที่ Runway เอาชนะ Google และ OpenAI ในการทดสอบวัดประสิทธิภาพด้วยทีม 100 คน บอกเราถึงสิ่งสำคัญ: แนวทางสถาปัตยกรรมที่ถูกต้องสำคัญกว่าทรัพยากร World models อาจเป็นแนวทางนั้น หากเดิมพันของ Runway ประสบความสำเร็จ พวกเขาจะเป็นผู้กำหนด AI วิดีโอรุ่นถัดไป
และหากการจำลองฟิสิกส์ดีพอ? เราจะไม่ได้แค่สร้างวิดีโออีกต่อไป เรากำลังสร้างโลกเสมือน ทีละการจำลอง
บทความที่เกี่ยวข้อง: หากต้องการอ่านเพิ่มเติมเกี่ยวกับรากฐานทางเทคนิคที่ทำให้การเปลี่ยนแปลงนี้เป็นไปได้ โปรดดู บทวิเคราะห์เชิงลึกเกี่ยวกับ diffusion transformers ของเรา สำหรับการเปรียบเทียบเครื่องมือในปัจจุบัน ดู Sora 2 vs Runway vs Veo 3
แหล่งข้อมูล

นักเทคโนโลยีสร้างสรรค์จากโลซานผู้สำรวจจุดที่ AI มาบรรจบกับศิลปะ ทดลองใช้โมเดลเชิงกำเนิดระหว่างช่วงเวลาฟังดนตรีอิเล็กทรอนิกส์
View profile →บทความที่เกี่ยวข้อง
สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

Bonega vs Runway 2026: ฟีเจอร์ ราคา และตัวไหนเหมาะกับคุณ
เปรียบเทียบ Bonega.ai และ Runway สำหรับการสร้างวิดีโอ AI อย่างละเอียด วิเคราะห์ราคา ฟีเจอร์ คุณภาพวิดีโอ และเครื่องมือไหนเหมาะกับเวิร์กโฟลว์ของคุณ

Runway筹集$315M以超越视频: 为什么最大的AI视频公司正在押注World Models
Runway的$315M Series E以$5.3B估值表明从视频生成向世界模拟的战略转变。这对创作者和行业意味着什么。

การจำลองฟิสิกส์ในวิดีโอ AI: โมเดลเรียนรู้ที่จะเคารพความเป็นจริงได้อย่างไร
จากลูกบาสเก็ตบอลที่เทเลพอร์ตไปจนถึงการเด้งที่สมจริง โมเดลวิดีโอ AI ในปัจจุบันเข้าใจแรงโน้มถ่วง โมเมนตัม และพลวัตของวัสดุแล้ว เราจะสำรวจความก้าวหน้าทางเทคนิคที่ทำให้สิ่งนี้เป็นไปได้