Vaizdo kalbos modeliai: kita riba po LLM ir DI agentų
Pasaulio modeliai moko DI suprasti fizinę tikrovę, todėl robotai gali planuoti veiksmus ir simuliuoti rezultatus prieš pajudindami nors vieną pavarą.

Didieji kalbos modeliai užkariavo tekstą. Vaizdo modeliai įvaldė vaizdus. DI agentai išmoko naudotis įrankiais. Dabar atsiranda nauja kategorija, galinti pranokti juos visus: vaizdo kalbos modeliai, arba tai, ką tyrėjai vis dažniau vadina „pasaulio modeliais“.
Pastaruosius kelerius metus mokėme DI skaityti, rašyti ir net spręsti sudėtingas problemas. Tačiau yra vienas dalykas: visa tai vyksta skaitmeninėje erdvėje. ChatGPT gali parašyti eilėraštį apie pasivaikščiojimą mišku, bet jis neturi supratimo, ką iš tikrųjų reiškia peržengti nuvirtusį rąstą ar pasilenkti po žema šaka.
Pasaulio modeliai skirti tai pakeisti.
Kas yra vaizdo kalbos modeliai?
Vaizdo kalbos modeliai (VLM) vienu metu apdoroja tiek vaizdines sekas, tiek kalbą, todėl DI gali suprasti ne tik tai, kas yra kadre, bet ir kaip scenos kinta laikui bėgant bei kas gali nutikti toliau.
Įsivaizduokite juos kaip vaizdo ir kalbos modelių evoliuciją, tačiau su esminiu papildymu: laiko supratimu. Įprastas VLM pažvelgia į vieną vaizdą ir atsako į klausimus apie jį, o vaizdo kalbos modelis stebi besiskleidžiančias sekas ir mokosi taisyklių, valdančių fizinę tikrovę.
Tai nėra vien akademinis smalsumas. Praktinės pasekmės stulbinančios.
Kai robotui reikia pakelti kavos puodelį, neužtenka atpažinti „puodelį“ vaizde. Jis turi suprasti:
- ✓Kaip objektai elgiasi, kai juos stumia ar pakelia
- ✓Kas nutinka, kai skysčiai taškosi
- ✓Kaip jo paties judesiai veikia sceną
- ✓Kokie veiksmai yra fiziškai įmanomi, o kokie ne
Būtent čia atsiranda pasaulio modeliai.
Nuo simuliacijos iki veiksmo
Fizinis intelektas
Pasaulio modeliai kuria į vaizdo įrašą panašias galimų ateičių simuliacijas, leidžiančias robotams „įsivaizduoti“ rezultatus prieš atliekant veiksmus.
Koncepcija elegantiška: užuot rankiniu būdu užkodavę fizikos taisykles, mokote DI iš milijonų valandų vaizdo įrašų, rodančių, kaip pasaulis iš tikrųjų veikia. Modelis išmoksta gravitacijos, trinties, objektų pastovumo ir priežastingumo ne iš lygčių, o stebėdamas.
NVIDIA Cosmos yra vienas ambicingiausių bandymų šioje srityje. Jų nuosavas pasaulio modelis sukurtas būtent robotikos taikymams, kuriuose fizinės tikrovės supratimas nėra pasirenkamas. Tai išgyvenimo klausimas.
Google DeepMind Genie 3 renkasi kitokį kelią ir koncentruojasi į interaktyvų pasaulio generavimą, kuriame modelį galima „žaisti“ tarsi vaizdo žaidimo aplinką.
Rankiniu būdu užkoduotos fizikos taisyklės, trapūs ribiniai atvejai, brangūs jutiklių rinkiniai, lėtas prisitaikymas prie naujų aplinkų
Išmokta fizinė intuicija, laipsniškas veikimo prastėjimas, paprastesni aparatinės įrangos reikalavimai, greitas perkėlimas į naujus scenarijus
PAN eksperimentas
Mohamed bin Zayed universiteto tyrėjai neseniai pristatė PAN, bendrą pasaulio modelį, atliekantį tai, ką jie vadina „minties eksperimentais“ kontroliuojamose simuliacijose.
Kaip veikia PAN
Naudodamas Generative Latent Prediction (GLP) ir Causal Swin-DPM architektūrą, PAN išlaiko scenos nuoseklumą ilgose sekose ir kartu prognozuoja fiziškai tikėtinus rezultatus.
Pagrindinė inovacija yra pasaulio modeliavimą laikyti generatyvine vaizdo problema. Užuot aiškiai programavęs fiziką, modelis išmoksta generuoti vaizdo tęstinumus, kurie laikosi fizikos dėsnių. Gavęs pradinę sceną ir siūlomą veiksmą, jis gali „įsivaizduoti“, kas nutiks toliau.
Tai turi didžiulių pasekmių robotikai. Prieš humanoidiniam robotui siekiant kavos puodelio, jis gali atlikti šimtus simuliuotų bandymų ir išmokti, kurie priėjimo kampai veikia, o kurie baigiasi kava ant grindų.
Milijardo robotų ateitis
Tai nėra atsitiktiniai skaičiai, parinkti dramatiškam efektui. Pramonės prognozės iš tiesų rodo ateitį, kurioje humanoidiniai robotai taps tokie pat įprasti kaip išmanieji telefonai. Ir kiekvienam iš jų reikės pasaulio modelių, kad galėtų saugiai veikti šalia žmonių.
Taikymo sritys apima ne vien humanoidinius robotus:
Gamyklų simuliacijos
Darbuotojų mokymas virtualiose aplinkose prieš siunčiant juos į fizines gamyklų erdves
Autonominės transporto priemonės
Saugos sistemos, kurios prognozuoja avarijų scenarijus ir imasi prevencinių veiksmų
Sandėlių navigacija
Robotai, suprantantys sudėtingas erdves ir prisitaikantys prie kintančių išdėstymų
Namų asistentai
Robotai, saugiai judantys žmonių gyvenamosiose erdvėse ir manipuliuojantys kasdieniais objektais
Kur vaizdo generavimas susitinka su pasaulio supratimu
Jei sekate DI vaizdo generavimą, galite pastebėti tam tikrą persidengimą. Tokie įrankiai kaip Sora 2 ir Veo 3 jau generuoja nepaprastai tikroviškus vaizdo įrašus. Ar jie taip pat nėra pasaulio modeliai?
Taip ir ne.
OpenAI aiškiai pristatė Sora kaip turintį pasaulio simuliavimo galimybių. Modelis akivaizdžiai kažką supranta apie fiziką. Pažiūrėkite į bet kurį Sora sugeneruotą vaizdo įrašą ir pamatysite tikrovišką apšvietimą, įtikinamą judesį bei objektus, kurie dažniausiai elgiasi teisingai.
Tačiau tarp tikėtinai atrodančio vaizdo generavimo ir tikro fizinio priežastingumo supratimo yra esminis skirtumas. Dabartiniai vaizdo generatoriai optimizuoti vizualiniam realizmui. Pasaulio modeliai optimizuoti prognozių tikslumui.
Testas nėra „ar tai atrodo tikra?“, o „gavęs veiksmą X, ar modelis teisingai prognozuoja rezultatą Y?“ Tai daug aukštesnė kartelė.
Haliucinacijų problema
Štai nepatogi tiesa: pasaulio modeliai kenčia nuo tų pačių haliucinacijų problemų, kurios kamuoja LLM.
Kai ChatGPT užtikrintai pateikia klaidingą faktą, tai erzina. Kai pasaulio modelis užtikrintai prognozuoja, kad robotas gali pereiti per sieną, tai pavojinga.
Pasaulio modelių haliucinacijos fizinėse sistemose gali sukelti realią žalą. Prieš diegiant sistemas šalia žmonių būtini saugos apribojimai ir patikros sluoksniai.
Dabartinės sistemos prastėja ilgesnėse sekose, prarasdamos nuoseklumą kuo toliau jos projektuoja į ateitį. Tai sukuria esminę įtampą: naudingiausios prognozės yra ilgalaikės, tačiau jos taip pat mažiausiai patikimos.
Tyrėjai sprendžia šią problemą iš kelių pusių. Vieni koncentruojasi į geresnius mokymo duomenis. Kiti dirba su architektūrinėmis inovacijomis, kurios išlaiko scenos nuoseklumą. Dar kiti pasisako už hibridinius metodus, jungiančius išmoktus pasaulio modelius su aiškiais fiziniais apribojimais.
Qwen 3-VL proveržis
Vaizdo ir kalbos srityje Alibaba Qwen 3-VL atspindi dabartinį atvirojo kodo modelių technologinį lygį.
Pavyzdinis Qwen3-VL-235B modelis konkuruoja su pirmaujančiomis nuosavomis sistemomis multimodaliniuose palyginamuosiuose testuose, apimančiuose bendrus klausimus ir atsakymus, 3D įžeminimą, vaizdo supratimą, OCR ir dokumentų supratimą.
Qwen 3-VL ypač įdomus dėl savo „agentinių“ galimybių. Modelis gali valdyti grafines sąsajas, atpažinti UI elementus, suprasti jų funkcijas ir atlikti realaus pasaulio užduotis naudodamas įrankius.
Tai tiltas tarp supratimo ir veiksmo, kurio reikia pasaulio modeliams.
Kodėl tai svarbu kūrėjams
Jei esate vaizdo kūrėjas, filmų kūrėjas ar animatorius, pasaulio modeliai gali atrodyti nutolę nuo jūsų kasdienio darbo. Tačiau jų reikšmė yra arčiau, nei manote.
Dabartiniai DI vaizdo įrankiai sunkiai išlaiko fizinį nuoseklumą. Objektai prasiskverbia vieni per kitus. Gravitacija veikia nenuosekliai. Priežastis ir pasekmė susipainioja. Visa tai yra modelių, kurie gali generuoti tikroviškus pikselius, bet iš tiesų nesupranta vaizduojamų fizinių taisyklių, simptomai.
Pasaulio modeliai, mokomi iš didžiulių vaizdo duomenų rinkinių, galiausiai galėtų pagerinti vaizdo generavimą ir sukurti DI įrankius, kurie iš prigimties laikosi fizikos dėsnių. Įsivaizduokite vaizdo generatorių, kuriam nereikia nurodyti „tikroviškos fizikos“, nes modelis jau žino, kaip veikia tikrovė.
Susijęs skaitymas: Daugiau apie vaizdo generavimo raidą skaitykite mūsų išsamioje apžvalgoje apie difuzinius transformerius ir pasaulio modelius vaizdo generavime.
Kelias į priekį
Pasaulio modeliai yra galbūt ambicingiausias DI tikslas: išmokyti mašinas suprasti fizinę tikrovę taip, kaip ją supranta žmonės. Ne per aiškų programavimą, o per stebėjimą, išvadų darymą ir vaizduotę.
Dar esame pradžioje. Dabartinės sistemos yra įspūdingos demonstracijos, o ne gamybai paruošti sprendimai. Tačiau kryptis aiški.
Ką turime dabar:
- Ribotas sekų nuoseklumas
- Konkrečioms sritims skirti modeliai
- Didelės skaičiavimo sąnaudos
- Tyrimų etapo diegimai
Kas laukia:
- Išplėstas laiko supratimas
- Bendrosios paskirties pasaulio modeliai
- Diegimas kraštiniuose įrenginiuose
- Komercinė integracija į robotiką
Į šią sritį daug investuojančios bendrovės, NVIDIA, Google DeepMind, OpenAI ir daugybė startuolių, stato už tai, kad fizinis intelektas yra kita riba po skaitmeninio intelekto.
Atsižvelgiant į tai, kaip LLM pakeitė tekstu paremtą darbą, įsivaizduokite poveikį, kai DI galės taip pat sklandžiai suprasti fizinį pasaulį ir su juo sąveikauti.
Toks yra vaizdo kalbos modelių pažadas. Štai kodėl ši riba svarbi.
Tolesnis skaitymas: Sužinokite, kaip DI vaizdo įrašai jau keičia kūrybines darbo eigas, mūsų apžvalgose apie vietinį garso generavimą ir įmonių diegimą.
Šaltiniai

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Yann LeCun palieka Meta ir stato $3.5 Billion už pasaulio modelius
Turingo premijos laureatas pristato AMI Labs, naują startuolį, orientuotą į pasaulio modelius, o ne LLM, skirtą robotikai, sveikatos priežiūrai ir vaizdo įrašų supratimui.

Pasaulio modeliai už vaizdo ribų: kodėl žaidimai ir robotika yra tikrieji AGI įrodymo laukai
Nuo DeepMind Genie iki AMI Labs, pasaulio modeliai tyliai tampa dirbtinio intelekto, kuris iš tiesų supranta fiziką, pagrindu. $500B vertės žaidimų rinka gali būti vieta, kur jie pirmiausia tai įrodys.

Runway GWM-1: pasaulio modelis simuliuoja realybę realiuoju laiku
GWM-1 pereina nuo vaizdo įrašų generavimo prie pasaulio simuliacijos. Kurkite tyrinėjamas aplinkas, avatarus ir robotų mokymo duomenis.