Meta Pixel본문으로 건너뛰기
AlexisAlexis· AI 작성, 사람이 검토함
18 min read
1229 단어

비디오를 넘어선 월드 모델: 게임과 로보틱스가 AGI의 진정한 증명장인 이유

DeepMind의 Genie부터 AMI Labs까지, 월드 모델은 물리학을 진정으로 이해하는 AI의 기초가 되고 있다. 5000억 달러 규모의 게임 시장이 처음으로 자신들의 가치를 입증하는 장소가 될 수 있다.

비디오를 넘어선 월드 모델: 게임과 로보틱스가 AGI의 진정한 증명장인 이유

나만의 AI 영상을 만들 준비가 되셨나요?

Bonega.ai를 사용하는 수천 명의 크리에이터와 함께하세요

다음 AI 혁명은 언어 모델에서 나오지 않을 것이다. 그것은 물리적 세계를 진정으로 이해하는 시스템에서 나올 것이며, 첫 번째 전장은 연구실이 아니라 비디오 게임이다.

Yann LeCun이 Meta를 떠나 5억 유로 자금 지원을 받으며 AMI Labs를 출범시킬 것을 발표했을 때, 그는 많은 연구자들이 수년간 조용히 믿어온 것을 표현했다. 대규모 언어 모델은 그들의 인상적인 능력에도 불구하고 인공 일반 지능으로 가는 길에서 막다른 골목이다. 그들은 현실을 이해하지 않고 토큰을 예측한다.

그렇다면 대안은 무엇인가, 월드 모델이다. 물리적 세계가 어떻게 작동하는지를 시뮬레이션하는 방법을 배우는 시스템이다.

언어 모델의 근본적 한계

💡

월드 모델은 텍스트의 다음 단어가 아니라 시각 환경에서 다음에 무엇이 일어날지를 예측하는 방법을 배운다. 이는 물리학, 물체 영속성 및 인과관계의 이해가 필요하다.

언어 모델은 텍스트 전반에 걸친 패턴 매칭에 능하다. 그들은 시를 쓸 수 있고, 코드를 디버깅하고, 놀랍도록 인간적인 느낌의 대화를 할 수 있다. 하지만 GPT-4에게 공을 떨어뜨렸을 때 어떤 일이 일어나는지 예측하도록 요청하면, 그것은 진정한 물리적 직감이 아닌 암기된 설명에 의존한다.

이것이 중요한 이유는 생물학적 세계에서 우리가 경험하는 지능이 본질적으로 물리적 현실에 근거하고 있기 때문이다. 블록을 쌓는 방법을 배우고 있는 유아는 언어를 배우기 훨씬 전에 중력, 균형 및 물질 특성에 대한 직관적인 이해를 발달시킨다. 이러한 구체적 인식, 즉 세계가 어떻게 작동하는지에 대한 감각은 현재의 AI 시스템이 부족한 정확히 것이다.

월드 모델은 이 격차를 채우는 것을 목표로 한다. 그들은 다음 토큰이 아니라 다음 프레임, 다음 물리적 상태, 하나의 동작의 다음 결과를 예측한다.

세계 이해를 위한 세 가지 접근 방식

세계 이해 AI를 구축하는 경쟁은 세 가지 서로 다른 패러다임으로 분화되었으며, 각각은 다른 강점을 가지고 있다.

비디오 예측 모델

대규모 비디오 데이터 세트에서 훈련되어 암묵적 물리학을 배운다. 예에는 Sora와 Veo가 포함된다. 그럴듯한 연속을 생성하는 데 능하지만 상호 작용 시나리오에서는 어려움을 겪는다.

시뮬레이션 기반 모델

명시적 물리 엔진을 구축하고 AI를 교육하여 탐색한다. 비싼 수동 환경 구성이 필요하지만 정확한 물리적 정확도를 제공한다.

세 번째 접근 방식, 아마도 가장 유망한 방식은 둘 다를 결합한다: 비디오에서 세계 역학을 배우면서 환경과 상호 작용하고 조작할 수 있는 능력을 유지한다. 게임이 필수적이 되는 곳이 여기이다.

게임, 완벽한 훈련장

비디오 게임은 독특한 것을 제공한다: 일관된 물리 규칙, 무한한 변화, 명확한 성공 지표를 갖춘 대화형 환경. 비싼 하드웨어가 필요하고 안전 문제가 있는 실제 로보틱스와는 달리, 게임은 결과 없이 무한한 실패를 제공한다.

5000억 달러+
2030년까지의 게임 시장
5억 유로
AMI Labs 자금 조달
12%
연간 성장률

DeepMind는 이 가능성을 일찍 인식했다. 그들의Genie 시스템은 단일 이미지에서 완전히 새로운 플레이 가능한 환경을 생성할 수 있다. 플랫포머 레벨의 스케치를 제공하면, 캐릭터가 점프하고, 떨어지며, 물체와 적절히 상호 작용할 수 있는 일관된 물리의 세계를 만든다.

Genie가 주목할 만한 이유는 생성뿐만 아니라 이해 때문이다. 이 시스템은 서로 다른 시각적 스타일과 게임 유형에 걸쳐 이전 가능한 일반화 가능한 물리 개념을 배운다. Mario 스타일의 플랫포머에서 훈련된 모델은 손으로 그린 인디 게임과 사실적인 3D 환경에 똑같이 적용되는 중력과 충돌에 대한 직감을 개발한다.

게임에서 로봇으로

게임에서 로봇으로의 파이프라인은 이론적이지 않다. 회사들은 이미 그것을 사용하고 있다.

2024

시뮬레이션 격차 식별

연구에 따르면 순수하게 시뮬레이션에서 훈련된 모델은 실제 세계의 혼란으로 인해 어려움을 겪는다: 변화하는 조명, 불완전한 센서, 예기치 않은 물체.

2025

하이브리드 접근 방식 출현

팀은 게임 훈련 월드 모델을 제한된 실제 세계 미세 조정과 결합하여 로봇 훈련에 필요한 데이터를 극적으로 줄인다.

2026

상업 배포 시작

월드 모델 백본을 사용하는 첫 번째 창고 로봇이 생산에 들어가 명시적 프로그래밍 없이 새로운 물체를 처리한다.

이 전환을 추진하는 통찰력은 간단하다: 물리는 물리이다. 비디오 게임에서 물체가 어떻게 떨어지고, 미끄러지고, 충돌하는지를 진정으로 이해하는 모델은 적절한 적응을 통해 실제 세계에서 동일한 원리를 이해해야 한다. 시각적 모습은 변하지만 기본 역학은 일정하게 유지된다.

Tesla는 그들의 Optimus 로봇을 사용한 이 전략의 버전을 추구했으며, 먼저 시뮬레이션에서 훈련한 다음 제어된 공장 환경에 배포했다. 제한 요인은 항상 시뮬레이션된 물리와 실제 물리 사이의 격차였다. 다양한 비디오 데이터에서 훈련된 월드 모델이 마침내 그 격차를 메울 수 있을 것이다.

AMI Labs의 베팅

Yann LeCun의 새로운 벤처인 AMI Labs는 월드 모델 연구에서 지금까지 가장 큰 단일 투자를 나타낸다. 5억 유로의 유럽 자금과 Meta, DeepMind 및 학술 연구실에서 채용한 팀으로, 그들은 LeCun이 "목표 주도 AI"라고 부르는 것을 추구하고 있다.

💡

토큰을 예측하는 LLM과는 달리, AMI의 접근 방식은 세계의 표현을 배우는 데 중점을 두며, 계획 및 물리적 결과에 대한 추론을 가능하게 한다.

기술적 기초는공동 임베딩 예측 아키텍처(JEPA)의 위에 구축되며, 이는 LeCun이 수년간 옹호해온 프레임워크이다. JEPA는 픽셀 수준의 예측을 생성하는 대신(이는 엄청난 계산 리소스가 필요)물리적 시스템의 본질적인 구조를 캡처하는 추상적 표현을 배운다.

이렇게 생각해 보자: 공이 절벽을 향해 구르는 것을 보는 인간은 공의 궤적의 모든 픽셀을 시뮬레이션하지 않는다. 대신 우리는 추상적 상황(공, 가장자리, 중력)을 인식하고 결과(하강)를 예측한다. JEPA는 이 효율적인 추상적 추론을 캡처하는 것을 목표로 한다.

AI 비디오 생성에 대한 영향

이 연구 궤도는 창의적 응용 프로그램에 깊은 영향을 미친다. 현재의 AI 비디오 생성기는 인상적인 결과를 생성하지만 시간적 불일치로 어려움을 겪는다. 캐릭터 변형, 물리 손상, 물체 나타남과 사라짐.

월드 모델은 잠재적 해결책을 제공한다. 물리를 진정으로 이해하는 생성기는 물체가 일관된 규칙을 따르는 비디오, 떨어진 항목이 예측 가능하게 떨어지고, 반사가 올바르게 작동하는 비디오를 생성해야 한다.

현재 상태

모델은 물리적 일관성을 강제하지 않고 시각적으로 그럴듯한 프레임을 생성한다. 짧은 클립에서는 작동하지만 더 긴 시간에서 분해된다.

월드 모델의 미래

물리적 일관성은 학습된 세계 역학에서 나타난다. 모델이 세계의 내부 상태를 유지하므로 더 길고 더 일관성 있는 비디오가 가능하다.

우리는 이미 이 전환의 초기 징후를 보고 있다. Runway의GWM-1은 월드 모델에 대한 그들의 베팅을 나타내고, Veo 3.1의 개선된 물리 시뮬레이션은 Google이 유사한 원리를 통합하고 있음을 시사한다.

AGI와의 연결

이 모든 것이 인공 일반 지능에 왜 중요한가, 진정한 지능은 언어 조작 이상을 필요로 하기 때문이다. 원인과 결과를 이해하고, 결과를 예측하고, 물리적 세계에서 행동을 계획해야 한다.

🧠

구체적 인식

진정한 지능은 텍스트의 통계적 패턴만이 아니라 물리적 현실에 근거할 필요가 있을 수 있다.

🎮

상호 작용 학습

게임은 완벽한 테스트 베드를 제공한다: 풍부한 물리학, 명확한 피드백, 무한한 반복.

🤖

로봇 응용

게임에서 훈련된 월드 모델은 최소한의 적응으로 실제 로보틱스로 이전될 수 있다.

이 작업을 추진하는 연구자들은 자신들이 AGI를 구축하고 있다고 주장하지 않도록 조심한다. 하지만 그들은 설득력 있게 세계의 이해 없이는 단순히 자동 완성하는 것이 아니라 진정으로 생각하는 시스템을 구축할 수 없다고 주장한다.

다음에 무엇이 올 것인가

다음 2년은 중요할 것이다. 관찰할 몇 가지 발전:

  • AMI Labs 첫 번째 공개 시연(2026년 중기 예상)
  • 주요 비디오 생성기로의 월드 모델 통합
  • 게임 엔진 회사(Unity, Unreal)가 월드 모델 API 추가
  • 게임 훈련 월드 모델을 사용하는 첫 번째 소비자 로봇

2030년까지 5000억 달러를 초과할 것으로 예상되는 게임 시장은 월드 모델 배포를 위한 비옥한 땅을 나타낸다. 투자자들은 월드 모델을 단순한 연구 호기심이 아니라 상호 작용 오락, 시뮬레이션 및 로보틱스의 기초 기술로 본다.

조용한 혁명

ChatGPT 주변의 폭발적인 과장과는 달리, 월드 모델 혁명은 연구실과 게임 스튜디오에서 조용히 일어나고 있다. 바이러스 데모도 없고, 최신 돌파구에 대한 일일 뉴스 사이클도 없다.

하지만 그 함의는 더 깊을 수 있다. 언어 모델은 우리가 텍스트와 상호 작용하는 방식을 바꿨다. 월드 모델은 AI가 현실과 상호 작용하는 방식을 바꿀 수 있다.

AI 비디오 생성에 종사하는 우리에게는 이 연구가 위협과 기회 모두를 나타낸다. 우리의 현재 도구는 회고적으로 보면 원시적으로 보일 수 있다, 초기 CGI를 현대 시각 효과와 비교하는 것처럼. 하지만 학습된 모델을 통해 시각적 콘텐츠를 생성하는 기본 원리는 이러한 모델이 자신들이 만드는 세계를 진정으로 이해하기 시작할 때만 더 강력해질 것이다.

💡

추가 읽기:확산 변환기가 많은 월드 모델의 아키텍처 기초를 어떻게 제공하는지 탐색하거나실시간 상호 작용 생성이 월드 모델 원리에 기반하여 어떻게 구축되는지 배운다.

비디오 게임 물리에서 인공 일반 지능으로의 경로는 우회적으로 보일 수 있다. 하지만 지능은 어디서든 찾을 수 있으며, 환경을 이해하고 자신의 행동의 결과를 예측할 수 있는 시스템에서 나타난다. 게임은 우리에게 그러한 시스템을 구축하고 테스트할 안전한 공간을 제공한다. 로봇, 창의적 도구, 그리고 아마도 진정한 기계 이해가 따를 것이다.

Alexis
AlexisAI EngineerAI Author

연구의 깊이와 실용적 혁신을 결합하는 로잔 출신 AI 엔지니어입니다. 모델 아키텍처와 알프스 봉우리 사이에서 시간을 나눕니다.

View profile →

읽으신 내용이 마음에 드셨나요?

몇 분 안에 아이디어를 길이 제한 없는 AI 영상으로 만들어 보세요.

관련 글

관련 게시물을 통해 계속 살펴보세요

이 글이 마음에 드셨나요?

더 많은 인사이트를 발견하고 최신 콘텐츠를 받아보세요.