Meta PixelPereiti prie pagrindinio turinio
HenryHenry· DI autorius, peržiūrėjo žmogus
7 min read
1279 žodžiai

Vaizdo kalbos modeliai: kita riba po LLM ir DI agentų

Pasaulio modeliai moko DI suprasti fizinę tikrovę, todėl robotai gali planuoti veiksmus ir simuliuoti rezultatus prieš pajudindami nors vieną pavarą.

Vaizdo kalbos modeliai: kita riba po LLM ir DI agentų

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Didieji kalbos modeliai užkariavo tekstą. Vaizdo modeliai įvaldė vaizdus. DI agentai išmoko naudotis įrankiais. Dabar atsiranda nauja kategorija, galinti pranokti juos visus: vaizdo kalbos modeliai, arba tai, ką tyrėjai vis dažniau vadina „pasaulio modeliais“.

Pastaruosius kelerius metus mokėme DI skaityti, rašyti ir net spręsti sudėtingas problemas. Tačiau yra vienas dalykas: visa tai vyksta skaitmeninėje erdvėje. ChatGPT gali parašyti eilėraštį apie pasivaikščiojimą mišku, bet jis neturi supratimo, ką iš tikrųjų reiškia peržengti nuvirtusį rąstą ar pasilenkti po žema šaka.

Pasaulio modeliai skirti tai pakeisti.

Kas yra vaizdo kalbos modeliai?

💡

Vaizdo kalbos modeliai (VLM) vienu metu apdoroja tiek vaizdines sekas, tiek kalbą, todėl DI gali suprasti ne tik tai, kas yra kadre, bet ir kaip scenos kinta laikui bėgant bei kas gali nutikti toliau.

Įsivaizduokite juos kaip vaizdo ir kalbos modelių evoliuciją, tačiau su esminiu papildymu: laiko supratimu. Įprastas VLM pažvelgia į vieną vaizdą ir atsako į klausimus apie jį, o vaizdo kalbos modelis stebi besiskleidžiančias sekas ir mokosi taisyklių, valdančių fizinę tikrovę.

Tai nėra vien akademinis smalsumas. Praktinės pasekmės stulbinančios.

Kai robotui reikia pakelti kavos puodelį, neužtenka atpažinti „puodelį“ vaizde. Jis turi suprasti:

  • Kaip objektai elgiasi, kai juos stumia ar pakelia
  • Kas nutinka, kai skysčiai taškosi
  • Kaip jo paties judesiai veikia sceną
  • Kokie veiksmai yra fiziškai įmanomi, o kokie ne

Būtent čia atsiranda pasaulio modeliai.

Nuo simuliacijos iki veiksmo

🤖

Fizinis intelektas

Pasaulio modeliai kuria į vaizdo įrašą panašias galimų ateičių simuliacijas, leidžiančias robotams „įsivaizduoti“ rezultatus prieš atliekant veiksmus.

Koncepcija elegantiška: užuot rankiniu būdu užkodavę fizikos taisykles, mokote DI iš milijonų valandų vaizdo įrašų, rodančių, kaip pasaulis iš tikrųjų veikia. Modelis išmoksta gravitacijos, trinties, objektų pastovumo ir priežastingumo ne iš lygčių, o stebėdamas.

NVIDIA Cosmos yra vienas ambicingiausių bandymų šioje srityje. Jų nuosavas pasaulio modelis sukurtas būtent robotikos taikymams, kuriuose fizinės tikrovės supratimas nėra pasirenkamas. Tai išgyvenimo klausimas.

Google DeepMind Genie 3 renkasi kitokį kelią ir koncentruojasi į interaktyvų pasaulio generavimą, kuriame modelį galima „žaisti“ tarsi vaizdo žaidimo aplinką.

Tradicinė robotika

Rankiniu būdu užkoduotos fizikos taisyklės, trapūs ribiniai atvejai, brangūs jutiklių rinkiniai, lėtas prisitaikymas prie naujų aplinkų

Pasaulio modelio metodas

Išmokta fizinė intuicija, laipsniškas veikimo prastėjimas, paprastesni aparatinės įrangos reikalavimai, greitas perkėlimas į naujus scenarijus

PAN eksperimentas

Mohamed bin Zayed universiteto tyrėjai neseniai pristatė PAN, bendrą pasaulio modelį, atliekantį tai, ką jie vadina „minties eksperimentais“ kontroliuojamose simuliacijose.

🧪

Kaip veikia PAN

Naudodamas Generative Latent Prediction (GLP) ir Causal Swin-DPM architektūrą, PAN išlaiko scenos nuoseklumą ilgose sekose ir kartu prognozuoja fiziškai tikėtinus rezultatus.

Pagrindinė inovacija yra pasaulio modeliavimą laikyti generatyvine vaizdo problema. Užuot aiškiai programavęs fiziką, modelis išmoksta generuoti vaizdo tęstinumus, kurie laikosi fizikos dėsnių. Gavęs pradinę sceną ir siūlomą veiksmą, jis gali „įsivaizduoti“, kas nutiks toliau.

Tai turi didžiulių pasekmių robotikai. Prieš humanoidiniam robotui siekiant kavos puodelio, jis gali atlikti šimtus simuliuotų bandymų ir išmokti, kurie priėjimo kampai veikia, o kurie baigiasi kava ant grindų.

Milijardo robotų ateitis

1B
Prognozuojamas humanoidinių robotų skaičius iki 2050 m.
3x
Robotikos DI investicijų augimas nuo 2023 m.

Tai nėra atsitiktiniai skaičiai, parinkti dramatiškam efektui. Pramonės prognozės iš tiesų rodo ateitį, kurioje humanoidiniai robotai taps tokie pat įprasti kaip išmanieji telefonai. Ir kiekvienam iš jų reikės pasaulio modelių, kad galėtų saugiai veikti šalia žmonių.

Taikymo sritys apima ne vien humanoidinius robotus:

Dabar

Gamyklų simuliacijos

Darbuotojų mokymas virtualiose aplinkose prieš siunčiant juos į fizines gamyklų erdves

2025

Autonominės transporto priemonės

Saugos sistemos, kurios prognozuoja avarijų scenarijus ir imasi prevencinių veiksmų

2026

Sandėlių navigacija

Robotai, suprantantys sudėtingas erdves ir prisitaikantys prie kintančių išdėstymų

2027+

Namų asistentai

Robotai, saugiai judantys žmonių gyvenamosiose erdvėse ir manipuliuojantys kasdieniais objektais

Kur vaizdo generavimas susitinka su pasaulio supratimu

Jei sekate DI vaizdo generavimą, galite pastebėti tam tikrą persidengimą. Tokie įrankiai kaip Sora 2 ir Veo 3 jau generuoja nepaprastai tikroviškus vaizdo įrašus. Ar jie taip pat nėra pasaulio modeliai?

Taip ir ne.

OpenAI aiškiai pristatė Sora kaip turintį pasaulio simuliavimo galimybių. Modelis akivaizdžiai kažką supranta apie fiziką. Pažiūrėkite į bet kurį Sora sugeneruotą vaizdo įrašą ir pamatysite tikrovišką apšvietimą, įtikinamą judesį bei objektus, kurie dažniausiai elgiasi teisingai.

Tačiau tarp tikėtinai atrodančio vaizdo generavimo ir tikro fizinio priežastingumo supratimo yra esminis skirtumas. Dabartiniai vaizdo generatoriai optimizuoti vizualiniam realizmui. Pasaulio modeliai optimizuoti prognozių tikslumui.

💡

Testas nėra „ar tai atrodo tikra?“, o „gavęs veiksmą X, ar modelis teisingai prognozuoja rezultatą Y?“ Tai daug aukštesnė kartelė.

Haliucinacijų problema

Štai nepatogi tiesa: pasaulio modeliai kenčia nuo tų pačių haliucinacijų problemų, kurios kamuoja LLM.

Kai ChatGPT užtikrintai pateikia klaidingą faktą, tai erzina. Kai pasaulio modelis užtikrintai prognozuoja, kad robotas gali pereiti per sieną, tai pavojinga.

⚠️

Pasaulio modelių haliucinacijos fizinėse sistemose gali sukelti realią žalą. Prieš diegiant sistemas šalia žmonių būtini saugos apribojimai ir patikros sluoksniai.

Dabartinės sistemos prastėja ilgesnėse sekose, prarasdamos nuoseklumą kuo toliau jos projektuoja į ateitį. Tai sukuria esminę įtampą: naudingiausios prognozės yra ilgalaikės, tačiau jos taip pat mažiausiai patikimos.

Tyrėjai sprendžia šią problemą iš kelių pusių. Vieni koncentruojasi į geresnius mokymo duomenis. Kiti dirba su architektūrinėmis inovacijomis, kurios išlaiko scenos nuoseklumą. Dar kiti pasisako už hibridinius metodus, jungiančius išmoktus pasaulio modelius su aiškiais fiziniais apribojimais.

Qwen 3-VL proveržis

Vaizdo ir kalbos srityje Alibaba Qwen 3-VL atspindi dabartinį atvirojo kodo modelių technologinį lygį.

Pavyzdinis Qwen3-VL-235B modelis konkuruoja su pirmaujančiomis nuosavomis sistemomis multimodaliniuose palyginamuosiuose testuose, apimančiuose bendrus klausimus ir atsakymus, 3D įžeminimą, vaizdo supratimą, OCR ir dokumentų supratimą.

Qwen 3-VL ypač įdomus dėl savo „agentinių“ galimybių. Modelis gali valdyti grafines sąsajas, atpažinti UI elementus, suprasti jų funkcijas ir atlikti realaus pasaulio užduotis naudodamas įrankius.

Tai tiltas tarp supratimo ir veiksmo, kurio reikia pasaulio modeliams.

Kodėl tai svarbu kūrėjams

Jei esate vaizdo kūrėjas, filmų kūrėjas ar animatorius, pasaulio modeliai gali atrodyti nutolę nuo jūsų kasdienio darbo. Tačiau jų reikšmė yra arčiau, nei manote.

Dabartiniai DI vaizdo įrankiai sunkiai išlaiko fizinį nuoseklumą. Objektai prasiskverbia vieni per kitus. Gravitacija veikia nenuosekliai. Priežastis ir pasekmė susipainioja. Visa tai yra modelių, kurie gali generuoti tikroviškus pikselius, bet iš tiesų nesupranta vaizduojamų fizinių taisyklių, simptomai.

Pasaulio modeliai, mokomi iš didžiulių vaizdo duomenų rinkinių, galiausiai galėtų pagerinti vaizdo generavimą ir sukurti DI įrankius, kurie iš prigimties laikosi fizikos dėsnių. Įsivaizduokite vaizdo generatorių, kuriam nereikia nurodyti „tikroviškos fizikos“, nes modelis jau žino, kaip veikia tikrovė.

💡

Susijęs skaitymas: Daugiau apie vaizdo generavimo raidą skaitykite mūsų išsamioje apžvalgoje apie difuzinius transformerius ir pasaulio modelius vaizdo generavime.

Kelias į priekį

Pasaulio modeliai yra galbūt ambicingiausias DI tikslas: išmokyti mašinas suprasti fizinę tikrovę taip, kaip ją supranta žmonės. Ne per aiškų programavimą, o per stebėjimą, išvadų darymą ir vaizduotę.

Dar esame pradžioje. Dabartinės sistemos yra įspūdingos demonstracijos, o ne gamybai paruošti sprendimai. Tačiau kryptis aiški.

Ką turime dabar:

  • Ribotas sekų nuoseklumas
  • Konkrečioms sritims skirti modeliai
  • Didelės skaičiavimo sąnaudos
  • Tyrimų etapo diegimai

Kas laukia:

  • Išplėstas laiko supratimas
  • Bendrosios paskirties pasaulio modeliai
  • Diegimas kraštiniuose įrenginiuose
  • Komercinė integracija į robotiką

Į šią sritį daug investuojančios bendrovės, NVIDIA, Google DeepMind, OpenAI ir daugybė startuolių, stato už tai, kad fizinis intelektas yra kita riba po skaitmeninio intelekto.

Atsižvelgiant į tai, kaip LLM pakeitė tekstu paremtą darbą, įsivaizduokite poveikį, kai DI galės taip pat sklandžiai suprasti fizinį pasaulį ir su juo sąveikauti.

Toks yra vaizdo kalbos modelių pažadas. Štai kodėl ši riba svarbi.

💡

Tolesnis skaitymas: Sužinokite, kaip DI vaizdo įrašai jau keičia kūrybines darbo eigas, mūsų apžvalgose apie vietinį garso generavimą ir įmonių diegimą.


Šaltiniai

Henry
HenryCreative TechnologistAI Author

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.