Meta PixelBỏ qua để đến nội dung chính
HenryHenry· Tác giả AI, kiểm tra tự động, biên tập viên chịu trách nhiệm
15 min read
2919 từ

Mô hình Ngôn ngữ Video: Ranh giới Tiếp theo Sau LLM và AI Agent

Các mô hình thế giới đang dạy AI hiểu thực tế vật lý, cho phép robot lập kế hoạch hành động và mô phỏng kết quả trước khi di chuyển bất kỳ bộ chấp hành nào.

Mô hình Ngôn ngữ Video: Ranh giới Tiếp theo Sau LLM và AI Agent

Sẵn sàng tạo video AI của riêng bạn?

Tham gia cùng hàng nghìn nhà sáng tạo đang sử dụng Bonega.ai Video bắt đầu được tạo sau khi thanh toán.

Mô hình ngôn ngữ lớn đã chinh phục văn bản. Các mô hình thị giác đã làm chủ hình ảnh. Các AI agent đã học được cách sử dụng công cụ. Giờ đây, một danh mục mới đang xuất hiện có thể vượt xa tất cả: mô hình ngôn ngữ video, hay điều mà các nhà nghiên cứu ngày càng gọi là "mô hình thế giới".

Chúng ta đã dành vài năm qua để dạy AI đọc, viết và thậm chí suy luận qua các vấn đề phức tạp. Nhưng có một thực tế là: tất cả những điều đó đều diễn ra trong thế giới kỹ thuật số. ChatGPT có thể viết cho bạn một bài thơ về việc đi dạo trong rừng, nhưng nó hoàn toàn không biết cảm giác thực sự khi bước qua một khúc gỗ mục hay cúi người dưới một cành cây thấp là như thế nào.

Các mô hình thế giới xuất hiện để thay đổi điều đó.

Mô hình Ngôn ngữ Video là gì?

💡

Mô hình ngôn ngữ video (VLM) xử lý đồng thời cả chuỗi hình ảnh và ngôn ngữ, cho phép AI không chỉ hiểu những gì có trong một khung hình, mà còn hiểu cách các cảnh quay tiến triển theo thời gian và điều gì có thể xảy ra tiếp theo.

Hãy nghĩ về chúng như sự tiến hóa của các mô hình ngôn ngữ thị giác, nhưng có thêm một bổ sung quan trọng: sự hiểu biết về thời gian. Trong khi một VLM tiêu chuẩn nhìn vào một hình ảnh đơn lẻ và trả lời các câu hỏi về nó, một mô hình ngôn ngữ video quan sát các chuỗi diễn biến và học các quy luật chi phối thực tế vật lý.

Đây không chỉ là sự tò mò mang tính học thuật. Những ứng dụng thực tế của nó là vô cùng to lớn.

Khi một robot cần nhấc một tách cà phê, nó không thể chỉ nhận diện "tách" trong một hình ảnh. Nó cần phải hiểu:

  • Các vật thể phản ứng như thế nào khi bị đẩy hoặc nâng lên
  • Điều gì xảy ra khi chất lỏng bị sóng sánh
  • Các chuyển động của chính nó ảnh hưởng đến cảnh quay như thế nào
  • Những hành động nào là khả thi về mặt vật lý so với những hành động bất khả thi

Đó là lúc các mô hình thế giới phát huy tác dụng.

Từ Mô phỏng đến Hành động

🤖

Trí tuệ Vật lý

Các mô hình thế giới tạo ra mô phỏng dạng video về các kịch bản tương lai có thể xảy ra, giúp robot "tưởng tượng" ra kết quả trước khi thực hiện hành động.

Khái niệm này rất tinh tế: thay vì lập trình cứng các quy tắc vật lý, bạn huấn luyện AI trên hàng triệu giờ video cho thấy thế giới thực sự vận hành như thế nào. Mô hình học về trọng lực, ma sát, sự tồn tại vĩnh cửu của vật thể và mối quan hệ nguyên nhân kết quả không phải từ các phương trình, mà từ sự quan sát.

Cosmos của NVIDIA đại diện cho một trong những nỗ lực táo bạo nhất theo hướng này. Mô hình thế giới độc quyền của họ được thiết kế dành riêng cho các ứng dụng robot, nơi việc hiểu thực tế vật lý không phải là lựa chọn nâng cao. Đó là yếu tố sống còn.

Genie 3 của Google DeepMind lại tiếp cận theo một hướng khác, tập trung vào việc tạo ra thế giới tương tác, nơi mô hình có thể được "chơi" giống như môi trường trong trò chơi điện tử.

Robot học Truyền thống

Quy tắc vật lý được lập trình thủ công, dễ lỗi ở các trường hợp biên, hệ thống cảm biến đắt đỏ, thích ứng chậm với môi trường mới

Tiếp cận bằng Mô hình Thế giới

Trực giác vật lý được tích lũy qua học tập, khả năng xử lý linh hoạt khi gặp lỗi, yêu cầu phần cứng đơn giản hơn, chuyển giao nhanh chóng sang các kịch bản mới

Thí nghiệm PAN

Các nhà nghiên cứu tại Đại học Mohamed bin Zayed gần đây đã ra mắt PAN, một mô hình thế giới tổng quát thực hiện điều mà họ gọi là "thí nghiệm tư duy" trong các mô phỏng được kiểm soát.

🧪

Cách PAN Hoạt động

Sử dụng kiến trúc Dự đoán Ẩn Tái tạo (Generative Latent Prediction - GLP) và Swin-DPM Nhân quả, PAN duy trì tính nhất quán của cảnh quay trên các chuỗi kéo dài trong khi dự đoán các kết quả hợp lý về mặt vật lý.

Đột phá then chốt là coi việc mô hình hóa thế giới như một bài toán tạo video. Thay vì lập trình vật lý một cách rõ ràng, mô hình học cách tạo ra các đoạn video nối tiếp tuân thủ các luật vật lý. Khi được cung cấp một cảnh bắt đầu và một hành động đề xuất, nó có thể "tưởng tượng" điều gì sẽ xảy ra tiếp theo.

Điều này có ý nghĩa sâu sắc đối với ngành robot. Trước khi một robot hình người với tới tách cà phê đó, nó có thể chạy hàng trăm lần thử nghiệm mô phỏng, học xem góc tiếp cận nào hiệu quả và góc nào sẽ dẫn đến việc cà phê đổ ra sàn.

Tương lai với Hàng tỷ Robot

1B
Dự báo số lượng robot hình người vào năm 2050
3x
Tăng trưởng đầu tư vào AI robot kể từ năm 2023

Đây không phải là những con số ngẫu nhiên được đưa ra để gây chú ý. Các dự báo ngành thực sự chỉ ra một tương lai nơi robot hình người trở nên phổ biến như điện thoại thông minh. Và mỗi robot trong số đó sẽ cần các mô hình thế giới để hoạt động an toàn bên cạnh con người.

Các ứng dụng không chỉ dừng lại ở robot hình người:

Hiện tại

Mô phỏng Nhà máy

Huấn luyện công nhân trong môi trường ảo trước khi triển khai họ vào nhà xưởng thực tế

2025

Xe Tự lái

Hệ thống an toàn dự đoán các kịch bản tai nạn và thực hiện hành động phòng ngừa

2026

Điều hướng Kho hàng

Robot hiểu được các không gian phức tạp và thích ứng với sơ đồ thay đổi

2027+

Trợ lý Gia đình

Robot điều hướng an toàn trong không gian sống của con người và thao tác với các vật dụng hàng ngày

Nơi Tạo Video Gặp gỡ Sự Hiểu biết Thế giới

Nếu bạn đang theo dõi sự phát triển của công nghệ tạo video bằng AI, bạn có thể nhận thấy một số điểm tương đồng ở đây. Các công cụ như Sora 2Veo 3 đã tạo ra những video chân thực đến kinh ngạc. Chúng chẳng phải cũng là mô hình thế giới sao?

Vừa đúng vừa không.

OpenAI đã công khai định vị Sora là mô hình có khả năng mô phỏng thế giới. Mô hình này rõ ràng hiểu được một phần nào đó về vật lý. Hãy nhìn vào bất kỳ sản phẩm nào do Sora tạo ra, bạn sẽ thấy ánh sáng thực tế, chuyển động hợp lý và các vật thể ứng xử hầu như chính xác.

Nhưng có một sự khác biệt quan trọng giữa việc tạo ra video trông có vẻ hợp lý và việc thực sự hiểu mối quan hệ nguyên nhân kết quả vật lý. Các công cụ tạo video hiện tại được tối ưu hóa cho độ chân thực về mặt thị giác. Trong khi đó, các mô hình thế giới lại được tối ưu hóa cho độ chính xác trong dự đoán.

💡

Thước đo thử nghiệm không phải là "vấn đề này trông có thực hay không?", mà là "khi có hành động X, mô hình có dự đoán chính xác kết quả Y hay không?". Đó là một tiêu chuẩn khó đạt hơn rất nhiều.

Vấn đề Bịa đặt (Hallucination)

Có một sự thật mất lòng: các mô hình thế giới cũng gặp phải vấn đề bịa đặt thông tin (hallucination) tương tự như các mô hình LLM.

Khi ChatGPT tự tin đưa ra một thông tin sai, nó gây phiền phức. Nhưng khi một mô hình thế giới tự tin dự đoán rằng một robot có thể đi xuyên qua tường, điều đó lại cực kỳ nguy hiểm.

⚠️

Hiện tượng bịa đặt của mô hình thế giới trong các hệ thống vật lý có thể gây ra tác hại thực sự. Các ràng buộc an toàn và lớp kiểm duyệt là bắt buộc trước khi triển khai robot bên cạnh con người.

Các hệ thống hiện tại thường suy giảm chất lượng qua các chuỗi dài, mất đi tính nhất quán càng tiến xa vào tương lai. Điều này tạo ra một mâu thuẫn căn bản: những dự đoán hữu ích nhất lại là những dự đoán dài hạn, nhưng chúng cũng là những dự đoán kém tin cậy nhất.

Các nhà nghiên cứu đang tiếp cận vấn đề này từ nhiều góc độ. Một số tập trung vào dữ liệu huấn luyện tốt hơn. Những người khác làm việc trên các kiến trúc cải tiến để duy trì tính nhất quán của cảnh quay. Số khác lại ủng hộ các phương pháp tiếp cận kết hợp giữa các mô hình thế giới được học với các ràng buộc vật lý rõ ràng.

Đột phá từ Qwen 3-VL

Về phía thị giác ngôn ngữ, Qwen 3-VL của Alibaba đại diện cho trạng thái tiên tiến nhất hiện nay của các mô hình mã nguồn mở.

Mô hình chủ lực Qwen3-VL-235B cạnh tranh trực tiếp với các hệ thống độc quyền hàng đầu trên các bài kiểm tra đa thức (multimodal benchmark), bao gồm Hỏi & Đáp tổng quát, định vị 3D (3D grounding), hiểu video, OCR và đọc hiểu tài liệu.

Điều làm cho Qwen 3-VL trở nên đặc biệt thú vị là khả năng "agentic" (tính tự chủ/đại lý) của nó. Mô hình có thể thao tác trên các giao diện đồ họa, nhận diện các yếu tố UI, hiểu chức năng của chúng và thực hiện các tác vụ thực tế thông qua việc gọi công cụ.

Đây chính là chiếc cầu nối giữa sự hiểu biết và hành động mà các mô hình thế giới cần.

Tại sao Điều này Quan trọng đối với Nhà sáng tạo Nội dung

Nếu bạn là một nhà tạo video, nhà làm phim hoặc nghệ sĩ hoạt hình, các mô hình thế giới có vẻ như khá xa lạ với công việc hàng ngày của bạn. Nhưng những ảnh hưởng của nó lại gần hơn bạn nghĩ.

Những biểu hiện bạn đã quen thuộc

Các công cụ tạo video AI hiện tại gặp khó khăn với tính nhất quán vật lý, và các lỗi này đều có chung một nguyên nhân gốc rễ:

  • Các vật thể bị xuyên thấu vào nhau, bởi vì không có thành phần nào trong mô hình đại diện cho vật thể như một thực thể chiếm giữ không gian.
  • Trọng lực hoạt động không đồng nhất giữa các góc quay, bởi vì mỗi góc quay được lấy mẫu độc lập.
  • Nguyên nhân và kết quả bị rối loạn, bởi vì mô hình đang dự đoán khung hình tiếp theo trông như thế nào thay vì điều gì sẽ xảy ra tiếp theo.

Đây đều là những biểu hiện của các mô hình có thể tạo ra các điểm ảnh chân thực nhưng không thực sự hiểu các quy tắc vật lý đằng sau những gì chúng đang thể hiện.

Mô hình thế giới thay đổi điều gì

Một mô hình thế giới là một hệ thống duy trì biểu diễn của chính cảnh quay, chứ không chỉ là khung hình cuối cùng. Sự khác biệt đó là điều cho phép một vật thể giữ nguyên vị trí cũ khi ống kính máy ảnh rời đi và quay trở lại.

Các mô hình thế giới được huấn luyện trên các tập dữ liệu video khổng lồ cuối cùng có thể tích hợp ngược lại vào quá trình tạo video, sản sinh ra các công cụ AI tuân thủ tự nhiên các luật vật lý. Hãy tưởng tượng một công cụ tạo video mà bạn không cần phải nhập câu lệnh yêu cầu "vật lý chân thực", bởi vì mô hình đã tự hiểu cách thế giới vận hành.

💡

Bài viết liên quan: Để tìm hiểu thêm về cách công nghệ tạo video đang phát triển, hãy xem bài phân tích sâu của chúng tôi về transformer khuếch tánmô hình thế giới trong tạo video.

Điều này có ý nghĩa gì cho dự án tiếp theo của bạn

Chưa có sản phẩm nào đề cập ở đây sẵn sàng để bạn sử dụng ngay hôm nay, và lời khuyên chân thành sẽ xuất phát từ thực tế đó.

  • Nếu bạn cần bàn giao video trong quý này: hãy hoàn toàn bỏ qua các mô hình thế giới và chọn lựa dựa trên các tiêu chí hiện có, đó là độ dài góc quay, tính nhất quán của đối tượng và chi phí trên mỗi giây. Một mô hình có khả năng suy luận về vật lý hiện không nằm trong danh sách cân nhắc, vì chưa có mô hình nào thực sự làm được điều đó.
  • Nếu bạn đang lên kế hoạch cho quy trình sản xuất năm tới: tiêu chí đáng theo dõi là liệu một công cụ tạo video có giữ cho vật thể ổn định khi nó rời khỏi khung hình và quay trở lại hay không. Phép thử đơn giản đó sẽ phân biệt một mô hình thế giới với một công cụ dự đoán khung hình cực tốt, và bạn có thể thử nghiệm trên bất kỳ công cụ nào trong khoảng một phút.
  • Nếu bạn đang chọn những gì cần học: kỹ năng có thể chuyển giao được là lên kế hoạch cho góc quay xung quanh các giới hạn của mô hình chứ không phải là cách đặt câu lệnh (prompt), bởi vì các giới hạn thay đổi rất chậm còn cách đặt câu lệnh lại thay đổi sau mỗi phiên bản phát hành.

Khẳng định mà bạn nên hoài nghi nhất là bất kỳ công cụ nào quảng bá về khả năng hiểu biết vật lý mà không đưa ra một góc quay liên tục không cắt dựng. Một bản demo như vậy rất rẻ để sản xuất, vì vậy sự vắng mặt của nó trong một đợt ra mắt là điều đáng chú ý.

Chặng đường Phía trước

Mô hình thế giới đại diện cho mục tiêu có thể nói là táo bạo nhất trong lĩnh vực AI: dạy máy tính hiểu thực tế vật lý theo cách con người làm. Không phải thông qua việc lập trình cứng rõ ràng, mà thông qua sự quan sát, suy luận và tưởng tượng.

Chúng ta vẫn đang ở giai đoạn đầu. Các hệ thống hiện tại là những thử nghiệm ấn tượng, chưa phải là giải pháp sẵn sàng cho sản xuất. Nhưng quỹ đạo phát triển đã rất rõ ràng.

Những gì Chúng ta Có Hiện tại:

  • Tính nhất quán chuỗi hình ảnh còn hạn chế
  • Các mô hình chỉ áp dụng cho miền cụ thể
  • Chi phí tính toán cao
  • Triển khai mới dừng lại ở mức nghiên cứu

Những gì Sắp Đến:

  • Mở rộng sự hiểu biết theo thời gian
  • Các mô hình thế giới đa năng
  • Triển khai trên các thiết bị biên (edge devices)
  • Tích hợp vào thương mại hóa robot

Các công ty đang đầu tư mạnh mẽ vào lĩnh vực này, như NVIDIA, Google DeepMind, OpenAI và vô số công ty khởi nghiệp, đang đặt cược rằng trí tuệ vật lý là ranh giới tiếp theo sau trí tuệ kỹ thuật số.

Xét đến mức độ biến đổi to lớn mà LLM đã mang lại cho công việc dựa trên văn bản, hãy tưởng tượng tác động khi AI có thể hiểu và tương tác với thế giới vật lý một cách thành thạo tương tự.

Đó là lời hứa của các mô hình ngôn ngữ video. Đó là lý do tại sao ranh giới này lại quan trọng đến vậy.

💡

Đọc thêm: Khám phá cách AI video đang thay đổi quy trình làm việc sáng tạo trong các bài viết của chúng tôi về tạo âm thanh bản địasự áp dụng AI của doanh nghiệp.


Nguồn tham khảo

Henry
HenryCreative TechnologistAI Author

Hình mẫu chuyên gia công nghệ sáng tạo. Chuyên về video tạo sinh dưới dạng phương tiện sáng tạo: câu lệnh gợi ý, phong cách và quy trình sản xuất. Soạn thảo bằng Claude, xuất bản sau khi qua kiểm tra tự động.

View profile →

Bạn thích những gì vừa đọc?

Biến ý tưởng của bạn thành video AI có độ dài không giới hạn chỉ trong vài phút. Video bắt đầu được tạo sau khi thanh toán.

Bài viết liên quan

Tiếp tục khám phá với các bài viết liên quan này

Bạn thích bài viết này chứ?

Khám phá thêm nhiều thông tin hữu ích và cập nhật nội dung mới nhất của chúng tôi.