Meta Pixelข้ามไปยังเนื้อหาหลัก
HenryHenry· ผู้เขียน AI, ผ่านการตรวจสอบอัตโนมัติ, อยู่ในความรับผิดชอบของบรรณาธิการ
3 min read
584 คำ

Video Language Models: พรมแดนขั้นถัดไปต่อจาก LLM และ AI Agent

World Model กำลังสอนให้ AI เข้าใจความจริงทางกายภาพ ช่วยให้หุ่นยนต์สามารถวางแผนการกระทำและจำลองผลลัพธ์ก่อนที่จะเริ่มขยับชิ้นส่วนจริงเพียงชิ้นเดียว

Video Language Models: พรมแดนขั้นถัดไปต่อจาก LLM และ AI Agent

พร้อมสร้างวิดีโอ AI ของคุณเองหรือยัง?

เข้าร่วมกับครีเอเตอร์หลายพันคนที่ใช้ Bonega.ai เริ่มสร้างหลังชำระเงิน

Large Language Model พิชิตโลกแห่งข้อความ Vision Model เชี่ยวชาญเรื่องรูปภาพ AI Agent เรียนรู้การใช้เครื่องมือ และตอนนี้ หมวดหมู่ใหม่ที่อาจมีขนาดยิ่งใหญ่กว่าทั้งหมดกำลังก่อตัวขึ้น นั่นคือ Video Language Model หรือสิ่งที่นักวิจัยเริ่มเรียกว่า "World Model"

เราใช้เวลาช่วงหลายปีที่ผ่านมาในการสอนให้ AI อ่าน เขียน และแม้กระทั่งใช้เหตุผลเพื่อแก้ปัญหาที่ซับซ้อน แต่ประเด็นก็คือ ทั้งหมดนั้นเกิดขึ้นในโลกดิจิทัล ChatGPT อาจเขียนบทกวีเกี่ยวกับการเดินป่าให้คุณได้ แต่มันไม่ได้มีความเข้าใจเลยว่าการก้าวข้ามท่อนไม้ที่ล้มลงหรือการก้มหลบกิ่งไม้ต่ำๆ รู้สึกอย่างไร

World Model เกิดขึ้นมาเพื่อเปลี่ยนแปลงสิ่งนี้

Video Language Model คืออะไร?

💡

Video Language Model (VLM) ประมวลผลทั้งลำดับภาพและภาษาไปพร้อมๆ กัน ช่วยให้ AI ไม่เพียงแต่เข้าใจว่ามีอะไรอยู่ในเฟรม แต่ยังเข้าใจด้วยว่าฉากนั้นพัฒนาเปลี่ยนแปลงไปอย่างไรตามเวลา และอาจเกิดอะไรขึ้นเป็นลำดับถัดไป

ลองคิดว่าสิ่งนี้คือวิวัฒนาการของ Vision-Language Model แต่มีการเพิ่มองค์ประกอบสำคัญเข้ามา นั่นคือความเข้าใจด้านมิติเวลา (Temporal Understanding) ในขณะที่ VLM ทั่วไปมองภาพเพียงภาพเดียวแล้วตอบคำถามเกี่ยวกับภาพนั้น Video Language Model จะเฝ้าสังเกตลำดับเหตุการณ์ที่เกิดขึ้นและเรียนรู้กฎเกณฑ์ที่ควบคุมความเป็นจริงทางกายภาพ

นี่ไม่ใช่แค่ความสนใจในเชิงวิชาการ แต่นำไปสู่การประยุกต์ใช้งานจริงอย่างมหาศาล

เมื่อหุ่นยนต์ต้องการหยิบถ้วยกาแฟ มันไม่ได้แค่จดจำคำว่า "ถ้วย" ในภาพได้เท่านั้น แต่มันจำเป็นต้องเข้าใจ:

  • วัตถุมีพฤติกรรมอย่างไรเมื่อถูกดันหรือยกขึ้น
  • จะเกิดอะไรขึ้นเมื่อของเหลวฉีดกระฉอกหรือกระฉอกไปมา
  • การเคลื่อนไหวของตัวมันเองส่งผลต่อฉากอย่างไร
  • การกระทำใดบ้างที่เกิดขึ้นได้จริงทางกายภาพ และการกระทำใดที่เป็นไปไม่ได้

และนี่คือจุดที่ World Model เข้ามามีบทบาท

จากการจำลองสู่การลงมือทำ

🤖

สติปัญญาทางกายภาพ

World Model สร้างการจำลองอนาคตที่เป็นไปได้ในรูปแบบคล้ายวิดีโอ ช่วยให้หุ่นยนต์สามารถ "จินตนาการ" ผลลัพธ์ก่อนที่จะเริ่มลงมือทำจริง

แนวคิดนี้มีความประณีตสวยงาม แทนที่จะต้องเขียนโค้ดระบุกฎทางฟิสิกส์ทีละข้อ คุณใช้วิธีเทรน AI ด้วยวิดีโอความยาวหลายล้านชั่วโมงที่แสดงให้เห็นว่าโลกจริงทำงานอย่างไร ตัวโมเดลจะเรียนรู้เรื่องแรงโน้มถ่วง แรงเสียดทาน ความคงอยู่ของวัตถุ (Object Permanence) และความสัมพันธ์เชิงสาเหตุ ไม่ใช่จากสมการ แต่จากการสังเกตการณ์

Cosmos ของ NVIDIA เป็นหนึ่งในความพยายามที่ทะเยอทะยานที่สุดในด้านนี้ World Model กรรมสิทธิ์ของพวกเขาถูกออกแบบมาโดยเฉพาะสำหรับการใช้งานในวิทยาการหุ่นยนต์ ซึ่งการเข้าใจความจริงทางกายภาพไม่ใช่ตัวเลือก แต่เป็นสิ่งจำเป็นสำหรับการรอดชีวิต

Genie 3 ของ Google DeepMind ใช้แนวทางที่แตกต่างออกไป โดยมุ่งเน้นไปที่การสร้างโลกแบบโต้ตอบได้ ซึ่งสามารถ "เล่น" โมเดลเสมือนเป็นสภาพแวดล้อมในวิดีโอเกมได้

หุ่นยนต์แบบดั้งเดิม

กฎฟิสิกส์ที่เขียนด้วยมือ, เคสขอบเขตที่เปราะบาง, เซนเซอร์ราคาแพง, ปรับตัวเข้ากับสภาพแวดล้อมใหม่ได้ช้า

แนวทาง World Model

สัญชาตญาณทางฟิสิกส์ที่เกิดจากการเรียนรู้, ทำงานได้ราบรื่นแม้เจอข้อผิดพลาด, ฮาร์ดแวร์ไม่ต้องซับซ้อน, ปรับใช้กับสถานการณ์ใหม่ได้อย่างรวดเร็ว

การทดลอง PAN

เมื่อไม่นานมานี้ นักวิจัยจาก Mohamed bin Zayed University ได้เปิดตัว PAN ซึ่งเป็น World Model ทั่วไปที่ทำการทดลองสิ่งที่เรียกว่า "การทดลองทางความคิด" (Thought Experiments) ภายในสถานการณ์จำลองที่ควบคุมได้

🧪

PAN ทำงานอย่างไร

ด้วยการใช้สถาปัตยกรรม Generative Latent Prediction (GLP) และ Causal Swin-DPM ทำให้ PAN สามารถรักษาความสอดคล้องของฉากในลำดับวิดีโอยาวๆ พร้อมทั้งทำนายผลลัพธ์ที่เป็นไปได้ทางฟิสิกส์อย่างสมจริง

นวัตกรรมสำคัญคือการมองว่าการสร้าง World Model เป็นปัญหาการสร้างวิดีโอ (Generative Video) แทนที่จะโปรแกรมระบบฟิสิกส์โดยตรง ตัวโมเดลจะเรียนรู้การสร้างวิดีโอส่วนต่อขยายที่สอดคล้องกับกฎทางฟิสิกส์ เมื่อกำหนดฉากเริ่มต้นและการกระทำที่เสนอ โมเดลจะสามารถ "จินตนาการ" ได้ว่าอะไรจะเกิดขึ้นเป็นลำดับถัดไป

สิ่งนี้มีนัยสำคัญอย่างยิ่งต่อวิทยาการหุ่นยนต์ ก่อนที่หุ่นยนต์ฮิวมานอยด์จะยื่นมือไปจับถ้วยกาแฟ มันสามารถรันการทดลองจำลองได้หลายร้อยครั้ง เพื่อเรียนรู้ว่ามุมการเข้าถึงแบบใดที่สำเร็จ และแบบใดที่จะจบลงด้วยกาแฟหกเต็มพื้น

อนาคตแห่งหุ่นยนต์พันล้านตัว

1B
คาดการณ์จำนวนหุ่นยนต์ฮิวมานอยด์ภายในปี 2050
3x
การเติบโตของการลงทุนด้าน AI สำหรับหุ่นยนต์ตั้งแต่ปี 2023

นี่ไม่ใช่ตัวเลขที่ยกขึ้นมาลอยๆ เพื่อสร้างความตื่นเต้น แต่การคาดการณ์ของอุตสาหกรรมชี้ไปที่อนาคตที่หุ่นยนต์ฮิวมานอยด์จะกลายเป็นเรื่องแพร่หลายเหมือนสมาร์ทโฟนจริงๆ และหุ่นยนต์ทุกตัวจำเป็นต้องมี World Model เพื่อที่จะทำงานเคียงข้างมนุษย์ได้อย่างปลอดภัย

การประยุกต์ใช้งานนั้นขยายไปไกลกว่าหุ่นยนต์ฮิวมานอยด์:

ปัจจุบัน

การจำลองในโรงงาน

การฝึกอบรมคนงานในสภาพแวดล้อมเสมือนจริงก่อนที่จะปฏิบัติงานในโรงงานจริง

2025

ยานยนต์ไร้คนขับ

ระบบความปลอดภัยที่ทำนายสถานการณ์อุบัติเหตุและดำเนินการป้องกันล่วงหน้า

2026

การนำทางในคลังสินค้า

หุ่นยนต์ที่เข้าใจพื้นที่ซับซ้อนและปรับตัวเข้ากับการเปลี่ยนแปลงผังพื้นที่ได้

2027+

ผู้ช่วยในบ้าน

หุ่นยนต์ที่นำทางในพื้นที่อยู่อาศัยของมนุษย์ได้อย่างปลอดภัยและจัดการกับวัตถุในชีวิตประจำวันได้

จุดตัดระหว่างการสร้างวิดีโอกับความเข้าใจโลก

หากคุณติดตามเรื่องการสร้างวิดีโอด้วย AI คุณอาจสังเกตเห็นจุดที่ซ้อนทับกัน เครื่องมืออย่าง Sora 2 และ Veo 3 สามารถสร้างวิดีโอที่สมจริงอย่างน่าทึ่งอยู่แล้ว คำถามคือ พวกมันนับเป็น World Model ด้วยหรือไม่?

คำตอบคือ ทั้งใช่และไม่ใช่

OpenAI ได้วางตำแหน่ง Sora ไว้อย่างชัดเจนว่ามีความสามารถในการจำลองโลก ตัวโมเดลมีความเข้าใจบางอย่างเกี่ยวกับฟิสิกส์อย่างเห็นได้ชัด เมื่อดูผลงานจาก Sora คุณจะเห็นแสงเงาที่สมจริง การเคลื่อนไหวที่เป็นไปได้ และวัตถุที่มีพฤติกรรมถูกต้องเกือบทั้งหมด

แต่มีความแตกต่างสำคัญระหว่างการสร้างวิดีโอที่ดูสมจริง กับการเข้าใจความสัมพันธ์เชิงสาเหตุทางกายภาพอย่างแท้จริง เครื่องมือเจนวิดีโอในปัจจุบันได้รับการปรับแต่งให้เน้นความสมจริงทางทัศนวิสัย (Visual Realism) ในขณะที่ World Model ถูกปรับแต่งให้เน้นความแม่นยำในการทำนาย (Predictive Accuracy)

💡

การทดสอบไม่ได้อยู่ที่ว่า "สิ่งนี้ดูสมจริงหรือไม่?" แต่อยู่ที่ว่า "เมื่อกำหนดการกระทำ X โมเดลทำนายผลลัพธ์ Y ได้ถูกต้องหรือไม่?" นั่นคือเกณฑ์ที่ผ่านได้ยากกว่ามาก

ปัญหาการประสาทหลอน (Hallucination)

และนี่คือความจริงที่น่าอึดอัด: World Model ประสบปัญหาการประสาทหลอน (Hallucination) ในลักษณะเดียวกับที่ระบาดใน LLM

เมื่อ ChatGPT ระบุข้อเท็จจริงที่ผิดด้วยความมั่นใจ มันอาจจะน่ารำคาญ แต่เมื่อ World Model ทำนายอย่างมั่นใจว่าหุ่นยนต์สามารถเดินทะลุกำแพงได้ นั่นเป็นเรื่องที่อันตราย

⚠️

อาการประสาทหลอนของ World Model ในระบบกายภาพอาจก่อให้เกิดอันตรายจริงได้ ข้อจำกัดด้านความปลอดภัยและเลเยอร์การตรวจสอบความถูกต้องจึงมีความจำเป็นอย่างยิ่งก่อนที่จะนำไปใช้งานจริงร่วมกับมนุษย์

ระบบในปัจจุบันมีประสิทธิภาพลดลงเมื่อเจอลำดับวิดีโอที่ยาวขึ้น โดยสูญเสียความสอดคล้องเมื่อต้องคาดการณ์อนาคตที่ไกลออกไป สิ่งนี้สร้างความตึงเครียดพื้นฐาน นั่นคือการทำนายที่มีประโยชน์ที่สุดมักเป็นการทำนายระยะยาว แต่การทำนายระยะยาวกลับเป็นสิ่งที่น่าเชื่อถือน้อยที่สุด

นักวิจัยกำลังรับมือกับปัญหานี้จากหลายมุมมอง บางส่วนมุ่งเน้นไปที่ข้อมูลการเทรนที่ดีขึ้น บางส่วนทำงานด้านสถาปัตยกรรมใหม่ๆ ที่ช่วยรักษาความคงเส้นคงวาของฉาก และยังมีบางส่วนที่เสนอแนวทางผสมผสาน (Hybrid Approach) ซึ่งรวม World Model ที่เกิดจากการเรียนรู้เข้ากับข้อจำกัดทางฟิสิกส์ที่กำหนดไว้ชัดเจน

ก้าวสำคัญของ Qwen 3-VL

ในฝั่ง Vision-Language โมเดล Qwen 3-VL ของ Alibaba ถือเป็นระดับสเตตออฟดิอาร์ต (State of the Art) ของโมเดลโอเพนซอร์สในปัจจุบัน

โมเดลเรือธง Qwen3-VL-235B สามารถแข่งขันกับระบบกรรมสิทธิ์ชั้นนำได้ในการทดสอบมัลติโมดัล (Multimodal Benchmarks) ซึ่งครอบคลุมทั้งการตอบคำถามทั่วไป, 3D Grounding, ความเข้าใจวิดีโอ, OCR และความเข้าใจเอกสาร

สิ่งที่ทำให้ Qwen 3-VL น่าสนใจเป็นพิเศษคือความสามารถสไตล์ "Agentic" โมเดลสามารถควบคุมส่วนติดต่อผู้ใช้แบบกราฟิก (GUI) จดจำองค์ประกอบ UI เข้าใจฟังก์ชัน และดำเนินงานในโลกจริงผ่านการเรียกใช้เครื่องมือต่างๆ ได้

นี่คือสะพานเชื่อมระหว่างความเข้าใจและการลงมือทำที่ World Model จำเป็นต้องมี

ทำไมเรื่องนี้จึงสำคัญสำหรับผู้สร้างสรรค์งาน

หากคุณเป็นผู้สร้างวิดีโอ คนทำหนัง หรือแอนิเมเตอร์ World Model อาจฟังดูไกลตัวจากงานประจำวันของคุณ แต่ผลกระทบของมันกลับอยู่ใกล้ตัวกว่าที่คุณคิด

อาการที่คุณคุ้นเคยดีอยู่แล้ว

เครื่องมือวิดีโอ AI ในปัจจุบันยังคงต่อสู้กับความสอดคล้องทางฟิสิกส์ และความผิดพลาดเหล่านั้นมีสาเหตุร่วมกัน:

  • วัตถุทะลุซ้อนกัน เพราะไม่มีส่วนใดในโมเดลที่แสดงผลว่าวัตถุเป็นสิ่งที่จับจองพื้นที่
  • แรงโน้มถ่วงทำงานไม่สม่ำเสมอระหว่างช็อต เพราะแต่ละช็อตถูกสุ่มสร้างอย่างเป็นอิสระต่อกัน
  • เหตุและผลสับสนปนเป เพราะโมเดลกำลังทำนายว่าเฟรมมีหน้าตาอย่างไร มากกว่าทำนายว่าเกิดอะไรขึ้นเป็นลำดับถัดไป

ทั้งหมดนี้คืออาการของโมเดลที่สามารถสร้างพิกเซลที่ดูสมจริงได้ แต่ไม่ได้เข้าใจกฎทางฟิสิกส์ที่เป็นเบื้องหลังของภาพนั้นอย่างแท้จริง

สภาพที่จะเปลี่ยนไปเมื่อมี World Model

World Model คือระบบที่รักษาการแสดงผล (Representation) ของตัวฉากเอาไว้ ไม่ใช่แค่ของเฟรมสุดท้าย ความแตกต่างนี้คือสิ่งที่ช่วยให้วัตถุยังคงอยู่ที่เดิมเมื่อกล้องแพนออกไปแล้วกลับมาใหม่

World Model ที่ถูกเทรนด้วยชุดข้อมูลวิดีโอขนาดมหาศาลจะย้อนกลับมาส่งเสริมการสร้างวิดีโอ ผลิตเครื่องมือ AI ที่เคารพกฎทางฟิสิกส์โดยธรรมชาติ ลองจินตนาการถึงตัวเจนวิดีโอที่คุณไม่ต้องใส่พรอมต์คำว่า "ฟิสิกส์สมจริง" อีกต่อไป เพราะโมเดลรู้เรื่องการทำงานของโลกจริงอยู่แล้ว

💡

อ่านเพิ่มเติม: เพื่อดูรายละเอียดเพิ่มเติมเกี่ยวกับวิวัฒนาการของการสร้างวิดีโอ สามารถอ่านบทวิเคราะห์เชิงลึกของเราเกี่ยวกับ diffusion transformers และ world models in video generation

สิ่งนี้หมายความอย่างไรสำหรับโปรเจกต์ถัดไปของคุณ

ยังไม่มีสิ่งใดในนี้ที่พร้อมใช้งานในฐานะผลิตภัณฑ์ให้คุณใช้ได้ในวันนี้ คำแนะนำอย่างตรงไปตรงมาจึงมีดังนี้

  • หากคุณต้องส่งมอบวิดีโอในไตรมาสนี้: ให้มองข้าม World Model ไปได้เลย แล้วเลือกจากปัจจัยที่มีอยู่ในปัจจุบัน ได้แก่ ความยาวช็อต ความคงเส้นคงวาของตัวละคร/เอกลักษณ์ และราคาต่อวินาที โมเดลที่ใช้เหตุผลทางฟิสิกส์ไม่ได้อยู่ในตัวเลือก เพราะยังไม่มีตัวใดทำได้
  • หากคุณกำลังวางแผนเวิร์กโฟลว์สำหรับปีหน้า: เกณฑ์ที่ควรรอดูคือตัวเจนวิดีโอรักษาความเสถียรของวัตถุได้หรือไม่เมื่อวัตถุนั้นออกจากเฟรมไปแล้วกลับเข้ามาใหม่ การทดสอบเพียงข้อนี้ข้อเดียวสามารถแยก World Model ออกจากตัวทำนายเฟรมที่ดีได้ และคุณสามารถทดสอบกับเครื่องมือใดก็ได้ในเวลาประมาณหนึ่งนาที
  • หากคุณกำลังเลือกสิ่งที่จะเรียนรู้: ทักษะที่ต่อยอดได้จริงคือการวางแผนช็อตโดยยึดข้อจำกัดของโมเดลเป็นหลัก มากกว่าการสรรหาถ้อยคำในพรอมต์ เพราะข้อจำกัดเปลี่ยนแปลงช้า แต่การแต่งพรอมต์ปรับเปลี่ยนทุกครั้งที่มีเวอร์ชันใหม่

ข้อกล่าวอ้างที่ควรตั้งข้อสงสัยไว้ก่อน คือเครื่องมือใดก็ตามที่โฆษณาเรื่องความเข้าใจทางฟิสิกส์โดยไม่แสดงช็อตยาวแบบไม่ตัดต่อ (Uncut Shot) ตัวอย่างสาธิตลักษณะนี้ทำได้ไม่ยาก ดังนั้นการไม่มีช็อตแบบนี้ในการเปิดตัวจึงเป็นสิ่งที่น่าสังเกต

เส้นทางข้างหน้า

World Model อาจเป็นเป้าหมายที่ทะเยอทะยานที่สุดในวงการ AI นั่นคือการสอนให้เครื่องจักรเข้าใจความจริงทางกายภาพในแบบที่มนุษย์เข้าใจ ไม่ใช่ผ่านการเขียนโค้ดตรงๆ แต่ผ่านการสังเกต การอนุมาน และจินตนาการ

เรายังอยู่ในช่วงเริ่มต้น ระบบในปัจจุบันคือการสาธิตที่น่าประทับใจ ยังไม่ใช่โซลูชันที่พร้อมสำหรับสภาพแวดล้อมจริง แต่นิศทางนั้นชัดเจนแล้ว

สิ่งที่เรามีในปัจจุบัน:

  • ความสอดคล้องของลำดับวิดีโอยังจำกัด
  • โมเดลเฉพาะโดเมน
  • ต้นทุนการคำนวณสูง
  • การปรับใช้ยังอยู่ในขั้นการวิจัย

สิ่งกำลังจะมาถึง:

  • ความเข้าใจเชิงมิติเวลาที่ยาวนานขึ้น
  • World Model วัตถุประสงค์ทั่วไป
  • การปรับใช้บนอุปกรณ์ปลายทาง (Edge Device)
  • การบูรณาการในเชิงพาณิชย์สำหรับวิทยาการหุ่นยนต์

บริษัทที่ลงทุนอย่างหนักในพื้นที่นี้ ทั้ง NVIDIA, Google DeepMind, OpenAI และสตาร์ทอัพจำนวนมาก กำลังเดิมพันว่าสติปัญญาทางกายภาพ (Physical Intelligence) คือพรมแดนขั้นถัดไปต่อจากสติปัญญาทางดิจิทัล

เมื่อพิจารณาว่า LLM สร้างการเปลี่ยนแปลงครั้งใหญ่ให้กับการทำงานกับข้อความได้อย่างไร ลองจินตนาการถึงผลกระทบเมื่อ AI สามารถเข้าใจและมีปฏิสัมพันธ์กับโลกจริงได้อย่างคล่องแคล่วไม่แพ้กัน

นั่นคือคำสัญญาของ Video Language Model และนั่นคือเหตุผลว่าทำไมพรมแดนนี้จึงมีความสำคัญ

💡

อ่านเพิ่มเติม: สัมผัสประสบการณ์ว่า AI วิดีโอกำลังพลิกโฉมเวิร์กโฟลว์สร้างสรรค์ได้อย่างไรในบทความของเราเกี่ยวกับ native audio generation และ enterprise adoption


แหล่งอ้างอิง

Henry
HenryCreative TechnologistAI Author

เพอร์โซนานักเทคโนโลยีสายครีเอทีฟ นำเสนอวิดีโอ AI เชิงสร้างสรรค์ ทั้งคำสั่งพรอมต์ สไตล์ และกระบวนการผลิต ร่างเนื้อหาด้วย Claude เผยแพร่หลังผ่านการตรวจสอบอัตโนมัติ

View profile →

ชอบสิ่งที่คุณอ่านไหม?

เปลี่ยนไอเดียของคุณให้เป็นวิดีโอ AI ความยาวไม่จำกัดได้ภายในไม่กี่นาที เริ่มสร้างหลังชำระเงิน

บทความที่เกี่ยวข้อง

สำรวจต่อด้วยบทความที่เกี่ยวข้องเหล่านี้

Runway筹集$315M以超越视频: 为什么最大的AI视频公司正在押注World Models
RunwayAI Video

Runway筹集$315M以超越视频: 为什么最大的AI视频公司正在押注World Models

Runway的$315M Series E以$5.3B估值表明从视频生成向世界模拟的战略转变。这对创作者和行业意味着什么。

Read
โลกแบบจำลองนอกเหนือวิดีโอ: เหตุใดเกมมิ่งและหุ่นยนต์จึงเป็นสนามทดสอบที่แท้จริงสำหรับ AGI
World ModelsAGI

โลกแบบจำลองนอกเหนือวิดีโอ: เหตุใดเกมมิ่งและหุ่นยนต์จึงเป็นสนามทดสอบที่แท้จริงสำหรับ AGI

จาก DeepMind Genie ไปยัง AMI Labs โลกแบบจำลองกำลังกลายเป็นพื้นฐานสำหรับ AI ที่เข้าใจฟิสิกส์อย่างแท้จริง ตลาดเกมมิ่ง $500B อาจเป็นที่ที่พวกมันพิสูจน์ตัวเองก่อน

Read
PixVerse R1: จุดเริ่มต้นของวิดีโอ AI แบบโต้ตอบแบบเรียลไทม์
PixVerseReal-Time AI

PixVerse R1: จุดเริ่มต้นของวิดีโอ AI แบบโต้ตอบแบบเรียลไทม์

PixVerse ที่ได้รับการสนับสนุนจาก Alibaba เปิดตัว R1 ซึ่งเป็นโมเดลโลกตัวแรกที่สามารถสร้างวิดีโอ 1080p และตอบสนองต่ออินพุตของผู้ใช้ได้ทันที เปิดประตูสู่เกมส์และภาพยนตร์เชิงโต้ตอบที่ไม่มีที่สิ้นสุด

Read

ชอบบทความนี้ไหม?

ค้นพบข้อมูลเชิงลึกเพิ่มเติมและติดตามเนื้อหาล่าสุดของเรา