Atvirojo kodo DI vaizdo modeliai pagaliau vejasi lyderius
Wan 2.2, HunyuanVideo 1.5 ir Open-Sora 2.0 mažina atotrūkį nuo nuosavybinių gigantų. Štai ką tai reiškia kūrėjams ir įmonėms.

Daugelį metų atvirojo kodo DI vaizdas atrodė tarsi atvykti į superautomobilių lenktynes dviračiu. Nuosavybiniai OpenAI, Google ir Runway modeliai dominavo visuose etalonuose, o atviros alternatyvos sunkiai išlaikydavo net bazinį nuoseklumą. Tačiau 2025 m. pabaigoje kažkas pasikeitė, ir atotrūkis pagaliau iš tiesų mažėja.
Nauji atvirojo kodo pretendentai
Pasakysiu tiesiai: jei prieš metus išbandėte atvirojo kodo vaizdo generavimą ir nusivylę pasidavėte, metas pabandyti dar kartą. Aplinka pasikeitė iš esmės.
Wan 2.2: MoE proveržis
Alibaba Wan 2.2 nusipelno ypatingo dėmesio. Tai pirmasis atvirojo kodo vaizdo modelis, naudojantis Mixture-of-Experts architektūrą, tą patį metodą, dėl kurio GPT-4 tapo toks galingas. Rezultatas? Vietinė 720p raiška, 24fps dažniu veikianti vartotojams skirtose RTX 4090 kortose, o 1080p galima pasiekti naudojant DI didinimą.
Wan 2.2 buvo mokytas naudojant 65% daugiau vaizdų ir 83% daugiau vaizdo įrašų nei jo pirmtakas. Kokybės šuolis akivaizdus.
Modelis stebėtinai gerai tvarkosi su fizika, išlaiko objektų pastovumą ir gravitacijos nuoseklumą, su kuriais ankstesni atviri modeliai strigo. Jis nėra tobulas, tačiau jau pakankamai artimas, kad būtų svarbus.
HunyuanVideo 1.5: daugiau su mažiau
Tencent su HunyuanVideo 1.5 pasirinko kitą kelią. Užuot didinę mastą, jie jį sumažino, nuo 13 mlrd. iki 8,3 mlrd. parametrų, ir kartu kažkaip pagerino greitį bei kokybę.
Veikia su 14GB VRAM naudojant offloading. Vietinė garso integracija. Integruota fizikos simuliacija. Efektyvi architektūra.
Lėtesnis už debesijos alternatyvas. Reikia techninio parengimo. Mažiau nugludintas nei komerciniai įrankiai.
Efektyvumo pagerėjimas svarbus, nes jis leidžia rimtai generuoti vaizdo įrašus ne tik duomenų centruose, bet ir nešiojamuosiuose kompiuteriuose bei darbo stotyse.
Open-Sora 2.0: $200K eksperimentas
Štai provokuojantis skaičius: Open-Sora 2.0 buvo mokytas už maždaug $200,000. Palyginkite tai su šimtais milijonų, išleistų nuosavybiniams modeliams. Vis dėlto jis prilygsta 11 mlrd. parametrų turinčio HunyuanVideo kokybei ir net meta iššūkį 30 mlrd. parametrų turinčiam Step-Video milžinui.
Mokymo kodas yra visiškai atviras. Svorius galima atsisiųsti. Architektūra dokumentuota. Tai nėra mokslinių tyrimų peržiūra, tai paruoštas naudoti gamyboje modelis, kurį galite paleisti jau šiandien.
Kodėl atotrūkis mažėja
Susilieja trys jėgos:
Architektūrų suartėjimas
Atviri modeliai perėmė difuzinių transformerių architektūras ir priartėjo prie nuosavybinių inovacijų.
Mokymo efektyvumas
Naujos technikos, tokios kaip MoE ir retas dėmesys, smarkiai sumažino skaičiavimo poreikius.
Bendruomenės pagreitis
ComfyUI darbo eigos, tikslinio derinimo vadovai ir optimizavimo įrankiai greitai subrendo.
Šis modelis primena tai, kas nutiko, kai LTX-2 atnešė 4K į vartotojų GPU, tačiau didesniu mastu.
Praktinė realybė
Būkime atviri, ką iš tiesų reiškia „vejasi“:
| Aspektas | Atvirasis kodas | Nuosavybiniai |
|---|---|---|
| Aukščiausia kokybė | 85-90% | 100% |
| Generavimo greitis | 2-5 minutės | 10-30 sekundžių |
| Naudojimo paprastumas | Techninis parengimas | Vienu spustelėjimu internete |
| Kaina už vaizdo įrašą | Nemokama (įsigijus aparatinę įrangą) | $0.10-$2.00 |
| Pritaikymas | Neribotas | Ribotas |
Atvirasis kodas vis dar atsilieka pagal gryną kokybę ir greitį. Tačiau daugeliu naudojimo atvejų šis skirtumas nebėra svarbus.
Daugiau konteksto apie šių modelių palyginimą su komercinėmis alternatyvomis rasite mūsų išsamiame Sora 2, Runway ir Veo 3 palyginime.
Kam tai turėtų rūpėti?
Nepriklausomi kūrėjai
Generuokite neribotą kiekį vaizdo įrašų be prenumeratos išlaidų. Mokykite modelį pagal savo stilių.
Įmonių komandos
Diekite savo infrastruktūroje jautriam turiniui. Jokie duomenys nepalieka jūsų serverių.
Tyrėjai
Visiška prieiga prie svorių ir architektūros. Keiskite, eksperimentuokite, publikuokite.
Žaidimų kūrėjai
Generuokite intarpus ir išteklius vietoje. Integruokite į procesus.
Šešių mėnesių prognozė
Remdamasis dabartinėmis tendencijomis, tikiuosi:
- ✓Trumpesnis nei 10 sekundžių generavimas taps standartu iki 2026 m. Q2
- ✓Metų viduryje atsiras generavimo realiuoju laiku prototipų
- ✓Kokybės lygybė su nuosavybiniais modeliais (iki jos dar 12-18 mėnesių)
- ✓Spartės pagrindinis ComfyUI diegimas
Šiuos modelius maitinanti difuzinių transformerių architektūra toliau gerėja. Kiekvienas mėnuo atneša naujų optimizacijų, mokymo metodų ir efektyvumo pagerinimų.
Nuo ko pradėti
Jei norite patys išbandyti šiuos modelius:
- Wan 2.2: Reikia RTX 4090 arba lygiaverčio sprendimo. Galima rasti GitHub su ComfyUI mazgais.
- HunyuanVideo 1.5: Veikia su 14GB+ VRAM. Galima Hugging Face integracija.
- Open-Sora 2.0: Visas mokymo ir išvadų darymo kodas GitHub.
Šiems modeliams reikia techninio išmanymo apie Python, CUDA ir modelių įkėlimą. Jie dar nėra vienu spustelėjimu veikiantys sprendimai.
Platesnis vaizdas
Labiausiai mane jaudina ne tai, kur atvirojo kodo vaizdas yra šiandien, o kur jis juda. Kiekvienas proveržis fizikos simuliacijoje ir vietiniame garso generavime galiausiai pasiekia atvirus modelius.
Demokratizacija yra reali. Įrankiai prieinami. Atotrūkis mažėja.
Kūrėjams, kuriems aukščiausios klasės DI vaizdo prenumeratos buvo neįperkamos, įmonėms, kurioms reikia savo infrastruktūroje veikiančių sprendimų, tyrėjams, plečiantiems galimybių ribas, tai metas atkreipti dėmesį.
Dviratis virsta motociklu. O superautomobilių lenktynės ką tik tapo gerokai įdomesnės.
Šaltiniai

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Atvirojo kodo DI vaizdo revoliucija: ar vartotojų GPU gali konkuruoti su technologijų gigantais?
ByteDance ir Tencent ką tik išleido atvirojo kodo vaizdo modelius, veikiančius vartotojų aparatinėje įrangoje. Tai keičia viską nepriklausomiems kūrėjams.

Kandinsky 5.0: Rusijos atvirojo kodo atsakas į DI vaizdo įrašų generavimą
Kandinsky 5.0 leidžia generuoti 10 sekundžių vaizdo įrašus vartotojų GPU su Apache 2.0 licencija. Nagrinėjame, kaip NABLA dėmesio mechanizmas ir srautų suderinimas tai įgalina.

TurboDiffusion: proveržis kuriant DI vaizdo įrašus realiuoju laiku
ShengShu Technology ir Tsinghua universitetas pristato TurboDiffusion, pasiekiantį 100-200 kartų spartesnį DI vaizdo įrašų generavimą ir pradedantį kūrimo realiuoju laiku erą.