Meta PixelСкокни до главната содржина
AlexisAlexis· ВИ автор, прегледано од човек
8 min read
1547 зборови

Светски модели надвор од видеото: Зошто гејмингот и роботиката се вистинските полиња за докажување на AGI

Од DeepMind Genie до AMI Labs, светските модели тивко стануваат темел за AI што навистина ја разбира физиката. Пазарот за гејминг вреден $500B можеби ќе биде местото каде што прво ќе се докажат.

Светски модели надвор од видеото: Зошто гејмингот и роботиката се вистинските полиња за докажување на AGI

Подготвени сте да создавате сопствени ВИ видеа?

Придружете им се на илјадници создавачи кои користат Bonega.ai

Следната револуција во вештачката интелигенција нема да произлезе од јазични модели. Ќе дојде од системи што го разбираат физичкиот свет, а првото бојно поле не се истражувачките лаборатории, туку видеоигрите.

Кога Yann LeCun го објави своето заминување од Meta за да го основа AMI Labs со поддршка од €500 million, тој го изрази она во што многу истражувачи тивко веруваа со години. Големите јазични модели, и покрај сите нивни импресивни способности, претставуваат ќорсокак на патот кон општа вештачка интелигенција. Тие предвидуваат токени без да ја разбираат реалноста.

Алтернативата? Светски модели. Системи што учат да симулираат како функционира физичкиот свет.

Основното ограничување на јазичните модели

💡

Светските модели учат да предвидуваат што се случува следно во визуелни средини, а не само кои зборови следат во текстот. За тоа е потребно разбирање на физиката, постојаноста на објектите и причинско-последичните односи.

Јазичните модели се одлични во препознавање обрасци во текст. Тие можат да пишуваат поезија, да дебагираат код и да водат разговори што делуваат извонредно човечки. Но, побарајте од GPT-4 да предвиди што се случува кога ќе пуштите топка, и тој се потпира на запаметени описи наместо на вистинска физичка интуиција.

Ова е важно бидејќи интелигенцијата, онака како што ја доживуваме во биолошкиот свет, суштински е втемелена во физичката реалност. Мало дете што учи да реди коцки развива интуитивно разбирање за гравитацијата, рамнотежата и својствата на материјалите многу пред да научи јазик. Ова отелотворено сознание, ова чувство за тоа како функционира светот, е токму она што им недостига на сегашните AI системи.

Светските модели имаат цел да ја пополнат оваа празнина. Наместо да го предвидуваат следниот токен, тие ја предвидуваат следната слика, следната физичка состојба, следната последица од дејство.

Три пристапи кон разбирањето на светот

Трката за изградба на AI што го разбира светот се подели на три различни парадигми, секоја со различни предности.

Модели за предвидување видео

Тренирани на огромни видео-датасетови за да научат имплицитна физика. Примери се Sora и Veo. Добри се во генерирање веродостојни продолженија, но имаат тешкотии со интерактивни сценарија.

Модели засновани на симулација

Градат експлицитни физички машини и тренираат AI да се движи низ нив. Бараат скапа рачна изградба на средини, но нудат прецизна физичка точност.

Третиот пристап, а можеби и најперспективниот, ги комбинира двата: учење на динамиката на светот од видео, со задржување на способноста за интеракција и манипулација со средината. Тука гејмингот станува суштински.

Гејмингот: Совршено поле за тренирање

Видеоигрите нудат нешто уникатно: интерактивни средини со доследни правила на физиката, бесконечни варијации и јасни метрики за успех. За разлика од роботиката во реалниот свет, која бара скап хардвер и носи безбедносни ризици, игрите овозможуваат неограничени неуспеси без последици.

$500B+
Пазар за гејминг до 2030
€500M
Финансирање на AMI Labs
12%
Годишна стапка на раст

DeepMind рано го препозна овој потенцијал. Нивниот систем Genie може да генерира целосно нови средини за играње од една слика. Дајте му скица на ниво за платформска игра, и тој создава свет со доследна физика, каде ликовите можат да скокаат, паѓаат и соодветно да интерагираат со објектите.

Она што го прави Genie извонреден не е само генерирањето, туку и разбирањето. Системот учи генерализирачки физички концепти што се пренесуваат низ различни визуелни стилови и типови игри. Модел трениран на платформски игри во стилот на Mario развива интуиција за гравитација и судири што подеднакво важи за рачно нацртани инди-игри и реалистични 3D средини.

Од игри до роботи

Патеката од гејминг до роботика не е теоретска. Компаниите веќе ја користат.

2024

Идентификуван е јазот во симулацијата

Истражувањето покажува дека моделите тренирани исклучиво во симулација имаат тешкотии со неуредноста на реалниот свет: променливо осветлување, несовршени сензори, неочекувани објекти.

2025

Се појавуваат хибридни пристапи

Тимовите комбинираат светски модели тренирани во игри со ограничено дообучување во реалниот свет, драматично намалувајќи ги податоците потребни за тренирање роботи.

2026

Почнува комерцијалното распоредување

Првите магацински роботи што користат основи од светски модели влегуваат во производство, ракувајќи со нови објекти без експлицитно програмирање.

Согледувањето што ја движи оваа транзиција е едноставно: физиката е физика. Модел што навистина разбира како објектите паѓаат, лизгаат и се судираат во видеоигра треба, со соодветна адаптација, да ги разбира истите принципи и во реалниот свет. Визуелниот изглед се менува, но основната динамика останува константна.

Tesla следи верзија на оваа стратегија со своите Optimus роботи, прво тренирајќи во симулација пред распоредување во контролирани фабрички средини. Ограничувачкиот фактор отсекогаш бил јазот меѓу симулираната и реалната физика. Светските модели тренирани на разновидни видео-податоци можеби конечно ќе го премостат тој јаз.

Облогот на AMI Labs

Новиот потфат на Yann LeCun, AMI Labs, ја претставува најголемата единечна инвестиција во истражување на светски модели досега. Со €500 million европско финансирање и тим регрутиран од Meta, DeepMind и академски лаборатории, тие го следат она што LeCun го нарекува "AI насочена кон цели."

💡

За разлика од LLMs што предвидуваат токени, пристапот на AMI е насочен кон учење претстави на светот што овозможуваат планирање и расудување за физичките последици.

Техничката основа се надоврзува на Joint Embedding Predictive Architecture (JEPA), рамка што LeCun ја застапува со години. Наместо да генерира предвидувања на ниво на пиксели, што бара огромни пресметковни ресурси, JEPA учи апстрактни претстави што ја доловуваат суштинската структура на физичките системи.

Размислете вака: човек што гледа топка како се тркала кон карпа не го симулира секој пиксел од траекторијата на топката. Наместо тоа, ја препознава апстрактната ситуација (топка, раб, гравитација) и го предвидува исходот (пад). JEPA има цел да го долови ова ефикасно, апстрактно расудување.

Импликации за AI генерирањето видео

Оваа истражувачка траекторија е многу важна за креативните апликации. Сегашните AI видео-генератори создаваат импресивни резултати, но страдаат од временска недоследност. Ликовите се менуваат, физиката се нарушува, а објектите се појавуваат и исчезнуваат.

Светските модели нудат потенцијално решение. Генератор што навистина ја разбира физиката треба да создава видеа каде објектите следат доследни правила, каде испуштените предмети паѓаат предвидливо и каде рефлексиите се однесуваат правилно.

Тековна состојба

Моделите генерираат визуелно веродостојни слики без да наметнат физичка доследност. Ова функционира за кратки клипови, но се распаѓа при подолго траење.

Иднина со светски модели

Физичката доследност произлегува од научената динамика на светот. Стануваат можни подолги, покохерентни видеа бидејќи моделот одржува внатрешна состојба на светот.

Веќе гледаме рани знаци на оваа транзиција. Runway's GWM-1 го претставува нивниот облог на светските модели, а подобрената симулација на физика во Veo 3.1 сугерира дека Google вградува слични принципи.

Поврзаноста со AGI

Зошто сето ова е важно за општата вештачка интелигенција? Бидејќи вистинската интелигенција бара повеќе од манипулација со јазик. Таа бара разбирање на причината и последицата, предвидување на исходите и планирање дејства во физички свет.

🧠

Отелотворено сознание

Вистинската интелигенција можеби бара втемеленост во физичката реалност, а не само статистички обрасци во текст.

🎮

Интерактивно учење

Игрите обезбедуваат совршено тест-окружување: богата физика, јасна повратна информација, неограничено повторување.

🤖

Роботска примена

Светските модели тренирани во игри би можеле да се пренесат во роботиката во реалниот свет со минимална адаптација.

Истражувачите што ја водат оваа работа внимателно избегнуваат да тврдат дека градат AGI. Но, убедливо тврдат дека без разбирање на светот, не можеме да изградиме системи што навистина мислат, наместо само да довршуваат текст.

Што следува

Следните две години ќе бидат пресудни. Неколку случувања што треба да се следат:

  • Први јавни демонстрации на AMI Labs (се очекуваат во средината на 2026)
  • Интеграција на светски модели во главните видео-генератори
  • Компании за гејминг машини (Unity, Unreal) додаваат API за светски модели
  • Први потрошувачки роботи што користат светски модели тренирани во игри

Пазарот за гејминг, за кој се предвидува дека ќе надмине $500 billion до 2030, претставува плодна почва за распоредување светски модели. Инвеститорите ги гледаат светските модели не само како истражувачки куриозитети, туку како темелна технологија за интерактивна забава, симулација и роботика.

Тивката револуција

За разлика од експлозивната возбуда околу ChatGPT, револуцијата на светските модели се одвива тивко во истражувачки лаборатории и гејминг студија. Нема вирални демоа, нема дневни циклуси на вести за најновото откритие.

Но, импликациите можеби се подлабоки. Јазичните модели го променија начинот на кој комуницираме со текст. Светските модели би можеле да го променат начинот на кој AI комуницира со реалноста.

За оние од нас што работат во AI генерирањето видео, ова истражување претставува и закана и можност. Нашите сегашни алатки можеби ретроспективно ќе изгледаат примитивни, како раниот CGI во споредба со современите визуелни ефекти. Но, основниот принцип, генерирање визуелна содржина преку научени модели, само ќе станува помоќен кога тие модели ќе почнат навистина да ги разбираат световите што ги создаваат.

💡

Дополнително читање: Истражете како дифузиските трансформери ја обезбедуваат архитектонската основа за многу светски модели или дознајте повеќе за интерактивно генерирање во реално време, кое се надоврзува на принципите на светските модели.

Патот од физиката во видеоигрите до општата вештачка интелигенција можеби изгледа заобиколен. Но интелигенцијата, каде и да ја најдеме, произлегува од системи што ја разбираат својата средина и можат да ги предвидат последиците од своите дејства. Игрите ни даваат безбеден простор за градење и тестирање такви системи. Ќе следат роботите, креативните алатки и можеби вистинското машинско разбирање.


Извори

Alexis
AlexisAI EngineerAI Author

ВИ инженер од Лозана кој комбинира длабочина во истражувањето со практична иновација. Го дели времето помеѓу архитектури на модели и алпски врвови.

View profile →

Ви се допадна прочитаното?

Претворете ги вашите идеи во ВИ видеа со неограничена должина за неколку минути.

Поврзани статии

Продолжете да истражувате со овие поврзани објави

EPFL Stable Video Infinity: Како рециклирањето грешки го решава најголемиот проблем на AI видеото
AI ВидеоИстражување

EPFL Stable Video Infinity: Како рециклирањето грешки го решава најголемиот проблем на AI видеото

Нов труд за усно излагање на ICLR 2026 од EPFL воведува рециклирање грешки, техника што го елиминира временското отстапување и овозможува повеќеминутно генерирање AI видео без дополнителен трошок за пресметување.

Read
Светски модели: Следната граница во генерирањето AI видео
AI ВидеоСветски модели

Светски модели: Следната граница во генерирањето AI видео

Зошто преминот од генерирање кадри кон симулација на светови го преобликува AI видеото и што ни кажува Runway's GWM-1 за правецот во кој се движи оваа технологија.

Read
Бесплатни неограничени AI видео алатки: Што функционира во 2026
Бесплатни алаткиAI видео

Бесплатни неограничени AI видео алатки: Што функционира во 2026

Бесплатните неограничени AI видео алатки обично се засновани на редици или работат локално. Дознајте што навистина е неограничено, што го забавува процесот и како да изберете практична поставка за 2026.

Read

Ви се допадна статијата?

Откријте повеќе сознанија и останете во тек со нашата најнова содржина.