Meta PixelBỏ qua để đến nội dung chính
AlexisAlexis· Tác giả AI, đã được con người biên tập
12 min read
2397 từ

Vượt qua Video, Mô hình Thế giới: Tại sao Trò chơi và Robotics là Bằng chứng Thực của AGI

Từ Genie của DeepMind đến AMI Labs, các mô hình thế giới đang từng bước trở thành nền tảng cho AI thực sự hiểu được vật lý. Thị trường trò chơi 500 tỷ đô la có thể là nơi chúng chứng minh giá trị của mình trước tiên.

Vượt qua Video, Mô hình Thế giới: Tại sao Trò chơi và Robotics là Bằng chứng Thực của AGI

Sẵn sàng tạo video AI của riêng bạn?

Tham gia cùng hàng nghìn nhà sáng tạo đang sử dụng Bonega.ai

Cuộc cách mạng AI tiếp theo sẽ không đến từ các mô hình ngôn ngữ. Nó sẽ đến từ các hệ thống thực sự hiểu thế giới vật lý, và chiến trường đầu tiên không phải là các phòng thí nghiệm mà là trò chơi điện tử.

Khi Yann LeCun công bố rời khỏi Meta để khởi động AMI Labs với sự hỗ trợ tài chính 500 triệu euro, ông đã diễn đạt những gì nhiều nhà nghiên cứu im lặng tin tưởng trong nhiều năm. Các mô hình ngôn ngữ lớn, bất chấp những khả năng ấn tượng của chúng, đại diện cho một ngõ cụt trên con đường dẫn đến trí tuệ nhân tạo tổng quát. Chúng dự đoán các token mà không hiểu thực tế.

Vậy giải pháp thay thế là gì, các mô hình thế giới. Các hệ thống học cách mô phỏng cách hoạt động của thế giới vật lý.

Hạn chế Cơ bản của Các Mô hình Ngôn ngữ

💡

Các mô hình thế giới học cách dự đoán điều gì sẽ xảy ra tiếp theo trong các môi trường trực quan, chứ không phải những từ nào sẽ xuất hiện tiếp theo trong văn bản. Điều này yêu cầu hiểu biết về vật lý, tính bền vững của vật thể và nhân quả.

Các mô hình ngôn ngữ giỏi trong việc khớp mẫu trên toàn bộ văn bản. Chúng có thể viết thơ, gỡ lỗi code, và tham gia vào các cuộc hội thoại cảm thấy đáng chú ý là con người. Nhưng yêu cầu GPT-4 dự đoán những gì sẽ xảy ra khi bạn thả một quả bóng, nó sẽ phụ thuộc vào các mô tả được ghi nhớ chứ không phải trực giác vật lý thực sự.

Điều này quan trọng vì trí tuệ mà chúng ta trải nghiệm trong thế giới sinh học về cơ bản được nền tảng trong thực tế vật lý. Một em bé học cách xếp chồng các khối lập phương phát triển sự hiểu biết trực quan về trọng lực, cân bằng và các tính chất vật liệu lâu trước khi học ngôn ngữ. Nhận thức cụ thể này, cảm giác này về cách hoạt động của thế giới, chính xác là những gì các hệ thống AI hiện tại thiếu.

Các mô hình thế giới nhằm mục đích lấp đầy khoảng trống này. Thay vì dự đoán token tiếp theo, chúng dự đoán frame tiếp theo, trạng thái vật lý tiếp theo, hậu quả tiếp theo của một hành động.

Ba Cách tiếp cận Hiểu Thế giới

Cuộc đua để xây dựng AI hiểu thế giới đã chia thành ba mô thức khác biệt, mỗi cái có những điểm mạnh khác nhau.

Mô hình Dự đoán Video

Đào tạo trên các tập dữ liệu video lớn để học vật lý ngầm. Các ví dụ bao gồm Sora và Veo. Tốt ở việc tạo ra những phần tiếp theo hợp lý nhưng gặp khó khăn trong các kịch bản tương tác.

Mô hình Dựa trên Mô phỏng

Xây dựng các động cơ vật lý rõ ràng và đào tạo AI để điều hướng chúng. Yêu cầu xây dựng môi trường thủ công tốn kém nhưng cung cấp độ chính xác vật lý chính xác.

Cách tiếp cận thứ ba, và có lẽ đầy hứa hẹn nhất, kết hợp cả hai: học động lực của thế giới từ video trong khi duy trì khả năng tương tác và thao tác với môi trường. Đây là nơi trò chơi trở nên cần thiết.

Trò chơi, Sân Đào tạo Hoàn hảo

Trò chơi điện tử cung cấp một cái gì đó độc đáo: các môi trường tương tác với các quy tắc vật lý nhất quán, biến đổi vô hạn và các chỉ số thành công rõ ràng. Không giống như robotics thế giới thực, yêu cầu phần cứng đắt tiền và gây ra các mối quan tâm về an toàn, các trò chơi cung cấp những thất bại vô hạn mà không có hậu quả.

500 tỷ đô la+
Thị trường trò chơi đến năm 2030
500 triệu euro
Tài trợ AMI Labs
12%
Tỷ lệ tăng trưởng hàng năm

DeepMind đã công nhận tiềm năng này sớm. Hệ thống Genie của họ có thể tạo ra hoàn toàn môi trường có thể chơi được mới từ một hình ảnh duy nhất. Cho nó một bản phác thảo của một cấp độ nền tảng, và nó tạo một thế giới có vật lý nhất quán nơi các nhân vật có thể nhảy, rơi và tương tác với các đối tượng một cách thích hợp.

Điều làm cho Genie đáng chú ý không chỉ là việc tạo ra mà còn là sự hiểu biết. Hệ thống học các khái niệm vật lý có thể khái quát hóa được chuyển giao trên các kiểu dáng hình ảnh khác nhau và các loại trò chơi. Một mô hình được đào tạo trên các trò chơi nền tảng kiểu Mario phát triển trực giác về trọng lực và va chạm áp dụng như nhau cho các trò chơi indie được vẽ tay và các môi trường 3D thực tế.

Từ Trò chơi đến Robotics

Đường ống từ trò chơi đến robotics không phải là lý thuyết. Các công ty đã sử dụng nó.

2024

Xác định Khoảng cách Mô phỏng

Nghiên cứu cho thấy các mô hình được đào tạo thuần túy trong mô phỏng gặp khó khăn với sự hỗn loạn thế giới thực: ánh sáng thay đổi, cảm biến không hoàn hảo, các đối tượng không mong muốn.

2025

Các Phương pháp Kết hợp Xuất hiện

Các nhóm kết hợp các mô hình thế giới được đào tạo bằng trò chơi với điều chỉnh thế giới thực hạn chế, giảm đáng kể dữ liệu cần thiết cho đào tạo robotics.

2026

Triển khai Thương mại Bắt đầu

Các robotics kho hàng đầu tiên sử dụng xương sống mô hình thế giới đi vào sản xuất, xử lý các đối tượng mới mà không cần lập trình rõ ràng.

Cái nhìn sâu sắc thúc đẩy sự chuyển đổi này là đơn giản: vật lý là vật lý. Một mô hình thực sự hiểu cách các đối tượng rơi, trượt và va chạm trong một trò chơi điện tử nên, có sự điều chỉnh thích hợp, hiểu các nguyên tắc tương tự trong thế giới thực. Sự xuất hiện hình ảnh thay đổi, nhưng động lực cơ bản vẫn không đổi.

Tesla đã theo đuổi một phiên bản của chiến lược này với các robot Optimus của họ, đào tạo trước trong mô phỏng trước khi triển khai trong các môi trường nhà máy được kiểm soát. Yếu tố hạn chế luôn là khoảng cách giữa vật lý được mô phỏng và vật lý thực tế. Các mô hình thế giới được đào tạo trên dữ liệu video đa dạng cuối cùng có thể lấp đầy khoảng cách đó.

Cược của AMI Labs

Công ty mạo hiểm mới của Yann LeCun, AMI Labs, đại diện cho khoản đầu tư đơn lẻ lớn nhất vào nghiên cứu mô hình thế giới cho đến nay. Với tài trợ 500 triệu euro từ châu Âu và một đội được tuyển dụng từ Meta, DeepMind và các phòng thí nghiệm học viện, họ đang theo đuổi những gì LeCun gọi là "AI hướng mục tiêu".

💡

Không giống như LLM dự đoán token, phương pháp của AMI tập trung vào việc học các biểu diễn của thế giới cho phép lập kế hoạch và suy luận về các hậu quả vật lý.

Cơ sở kỹ thuật được xây dựng dựa trên Kiến trúc Dự đoán Nhúng Chung (JEPA), một khuôn khổ LeCun đã tôi championed trong nhiều năm. Thay vì tạo ra dự đoán cấp độ pixel, yêu cầu tài nguyên tính toán khổng lồ, JEPA học các biểu diễn trừu tượng chụp cấu trúc thiết yếu của các hệ thống vật lý.

Hãy nghĩ về nó như thế này: một người quan sát quả bóng lăn về phía vách đá không mô phỏng mọi pixel của quỹ đạo quả bóng. Thay vào đó, chúng ta nhận ra tình huống trừu tượng (bóng, cạnh, trọng lực) và dự đoán kết quả (rơi). JEPA nhằm mục đích nắm bắt suy luận trừu tượng hiệu quả này.

Ý Nghĩa cho Tạo Video AI

Quỹ đạo nghiên cứu này có tác động sâu sắc đến các ứng dụng sáng tạo. Các trình tạo video AI hiện tại tạo ra kết quả ấn tượng nhưng gặp khó khăn với sự không nhất quán thời gian. Các nhân vật biến hình, vật lý phá vỡ, các đối tượng xuất hiện và biến mất.

Các mô hình thế giới cung cấp một giải pháp tiềm năng. Một trình tạo thực sự hiểu vật lý nên tạo ra video nơi các đối tượng tuân theo các quy tắc nhất quán, nơi các mục bị thả rơi có thể dự đoán được, nơi các phản xạ hoạt động một cách chính xác.

Trạng thái hiện tại

Các mô hình tạo ra các khung hình hợp lý về mặt hình ảnh mà không ép buộc tính nhất quán vật lý. Hoạt động cho các clip ngắn nhưng phá vỡ trong khoảng thời gian dài hơn.

Tương lai Mô hình Thế giới

Tính nhất quán vật lý xuất hiện từ động lực thế giới được học tập. Các video dài hơn, mạch lạc hơn trở nên khả thi vì mô hình duy trì một trạng thái bên trong của thế giới.

Chúng tôi đã thấy các dấu hiệu sớm của sự chuyển đổi này. GWM-1 của Runway đại diện cho cược của họ về các mô hình thế giới, và mô phỏng vật lý cải thiện của Veo 3.1 gợi ý Google đang kết hợp các nguyên tắc tương tự.

Kết nối với AGI

Tại sao tất cả điều này lại quan trọng đối với trí tuệ nhân tạo tổng quát? Vì trí tuệ thực sự đòi hỏi nhiều hơn là thao tác ngôn ngữ. Nó đòi hỏi hiểu biết về nguyên nhân và kết quả, dự đoán hậu quả và lập kế hoạch hành động trong một thế giới vật lý.

🧠

Nhận thức Cụ thể

Trí tuệ thực sự có thể yêu cầu neo giữ trong thực tế vật lý, không chỉ là các mô hình thống kê trong văn bản.

🎮

Học Tương tác

Trò chơi cung cấp sân thử nghiệm hoàn hảo: vật lý phong phú, phản hồi rõ ràng, lặp lại vô hạn.

🤖

Ứng dụng Robotics

Các mô hình thế giới được đào tạo trong các trò chơi có thể chuyển giao sang robotics thế giới thực với sự điều chỉnh tối thiểu.

Các nhà nghiên cứu thúc đẩy công việc này cẩn thận tránh tuyên bố rằng họ đang xây dựng AGI. Nhưng họ thuyết phục rằng không có sự hiểu biết về thế giới, chúng ta không thể xây dựng các hệ thống thực sự suy nghĩ thay vì đơn giản là tự động hoàn thành.

Tiếp Theo Sẽ Là Gì

Hai năm tới sẽ rất quan trọng. Một số phát triển để quan sát:

  • Cuộc biểu diễn công khai đầu tiên của AMI Labs (dự kiến giữa 2026)
  • Tích hợp các mô hình thế giới vào các trình tạo video chính
  • Các công ty động cơ trò chơi (Unity, Unreal) thêm API mô hình thế giới
  • Robotics người dùng đầu tiên sử dụng các mô hình thế giới được đào tạo bằng trò chơi

Thị trường trò chơi, được dự báo vượt quá 500 tỷ đô la đến năm 2030, đại diện cho vùng đất màu mỡ cho triển khai mô hình thế giới. Các nhà đầu tư thấy các mô hình thế giới không chỉ là những công cụ phục vụ nghiên cứu mà là công nghệ nền tảng cho giải trí tương tác, mô phỏng và robotics.

Cuộc Cách mạng Im Lặng

Không giống như sự cường điệu nổ tung xung quanh ChatGPT, cuộc cách mạng về mô hình thế giới diễn ra im lặng trong các phòng thí nghiệm nghiên cứu và các studio trò chơi. Không có cuộc biểu diễn lan truyền, không có chu kỳ tin tức hàng ngày về những bước ngoặt mới nhất.

Nhưng ý nghĩa có thể sâu sắc hơn. Các mô hình ngôn ngữ thay đổi cách chúng ta tương tác với văn bản. Các mô hình thế giới có thể thay đổi cách AI tương tác với thực tế.

Đối với những người trong chúng tôi làm việc trong tạo video AI, nghiên cứu này đại diện cho cả mối đe dọa và cơ hội. Các công cụ hiện tại của chúng tôi có thể trông nguyên thủy trong nhận định lại, như CGI sớm so với hiệu ứng hình ảnh hiện đại. Nhưng nguyên tắc cơ bản, tạo nội dung hình ảnh thông qua các mô hình được học tập, sẽ chỉ trở nên mạnh mẽ hơn khi những mô hình này bắt đầu thực sự hiểu các thế giới mà chúng tạo ra.

💡

**Đọc Thêm:**Khám phá cách mô hình biến áp khuếch tán cung cấp nền tảng kiến trúc cho nhiều mô hình thế giới, hoặc tìm hiểu về tạo tương tác thời gian thực xây dựng dựa trên các nguyên tắc mô hình thế giới.

Đường đi từ vật lý trò chơi điện tử đến trí tuệ nhân tạo tổng quát có thể trông liên tục. Nhưng trí tuệ, bất kể chúng ta tìm thấy nó ở đâu, nảy sinh từ các hệ thống hiểu môi trường của chúng và có thể dự đoán hậu quả của hành động của chúng. Các trò chơi cung cấp cho chúng ta một không gian an toàn để xây dựng và kiểm tra các hệ thống như vậy. Các robotics, các công cụ sáng tạo và có lẽ sự hiểu biết máy thực sự sẽ theo sau.

Alexis
AlexisAI EngineerAI Author

Kỹ sư AI đến từ Lausanne, kết hợp chiều sâu nghiên cứu với đổi mới thực tiễn. Chia thời gian giữa kiến trúc mô hình và những đỉnh núi Alps.

View profile →

Bạn thích những gì vừa đọc?

Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút.

Bài viết liên quan

Tiếp tục khám phá với các bài viết liên quan này

Bạn thích bài viết này chứ?

Khám phá thêm nhiều thông tin hữu ích và cập nhật nội dung mới nhất của chúng tôi.