Meta PixelPereiti prie pagrindinio turinio
HenryHenry· DI autorius, peržiūrėjo žmogus
5 min read
850 žodžiai

Atvirojo kodo DI vaizdo modeliai pagaliau vejasi lyderius

Wan 2.2, HunyuanVideo 1.5 ir Open-Sora 2.0 mažina atotrūkį nuo nuosavybinių gigantų. Štai ką tai reiškia kūrėjams ir įmonėms.

Atvirojo kodo DI vaizdo modeliai pagaliau vejasi lyderius

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Daugelį metų atvirojo kodo DI vaizdas atrodė tarsi atvykti į superautomobilių lenktynes dviračiu. Nuosavybiniai OpenAI, Google ir Runway modeliai dominavo visuose etalonuose, o atviros alternatyvos sunkiai išlaikydavo net bazinį nuoseklumą. Tačiau 2025 m. pabaigoje kažkas pasikeitė, ir atotrūkis pagaliau iš tiesų mažėja.

Nauji atvirojo kodo pretendentai

Pasakysiu tiesiai: jei prieš metus išbandėte atvirojo kodo vaizdo generavimą ir nusivylę pasidavėte, metas pabandyti dar kartą. Aplinka pasikeitė iš esmės.

720p
Vietinė raiška
24fps
Kadrų dažnis
14GB
Min. VRAM

Wan 2.2: MoE proveržis

Alibaba Wan 2.2 nusipelno ypatingo dėmesio. Tai pirmasis atvirojo kodo vaizdo modelis, naudojantis Mixture-of-Experts architektūrą, tą patį metodą, dėl kurio GPT-4 tapo toks galingas. Rezultatas? Vietinė 720p raiška, 24fps dažniu veikianti vartotojams skirtose RTX 4090 kortose, o 1080p galima pasiekti naudojant DI didinimą.

💡

Wan 2.2 buvo mokytas naudojant 65% daugiau vaizdų ir 83% daugiau vaizdo įrašų nei jo pirmtakas. Kokybės šuolis akivaizdus.

Modelis stebėtinai gerai tvarkosi su fizika, išlaiko objektų pastovumą ir gravitacijos nuoseklumą, su kuriais ankstesni atviri modeliai strigo. Jis nėra tobulas, tačiau jau pakankamai artimas, kad būtų svarbus.

HunyuanVideo 1.5: daugiau su mažiau

Tencent su HunyuanVideo 1.5 pasirinko kitą kelią. Užuot didinę mastą, jie jį sumažino, nuo 13 mlrd. iki 8,3 mlrd. parametrų, ir kartu kažkaip pagerino greitį bei kokybę.

Stiprybės

Veikia su 14GB VRAM naudojant offloading. Vietinė garso integracija. Integruota fizikos simuliacija. Efektyvi architektūra.

Ribotumai

Lėtesnis už debesijos alternatyvas. Reikia techninio parengimo. Mažiau nugludintas nei komerciniai įrankiai.

Efektyvumo pagerėjimas svarbus, nes jis leidžia rimtai generuoti vaizdo įrašus ne tik duomenų centruose, bet ir nešiojamuosiuose kompiuteriuose bei darbo stotyse.

Open-Sora 2.0: $200K eksperimentas

Štai provokuojantis skaičius: Open-Sora 2.0 buvo mokytas už maždaug $200,000. Palyginkite tai su šimtais milijonų, išleistų nuosavybiniams modeliams. Vis dėlto jis prilygsta 11 mlrd. parametrų turinčio HunyuanVideo kokybei ir net meta iššūkį 30 mlrd. parametrų turinčiam Step-Video milžinui.

Mokymo kodas yra visiškai atviras. Svorius galima atsisiųsti. Architektūra dokumentuota. Tai nėra mokslinių tyrimų peržiūra, tai paruoštas naudoti gamyboje modelis, kurį galite paleisti jau šiandien.

Kodėl atotrūkis mažėja

Susilieja trys jėgos:

2025 m. vidurys

Architektūrų suartėjimas

Atviri modeliai perėmė difuzinių transformerių architektūras ir priartėjo prie nuosavybinių inovacijų.

2025 m. pabaiga

Mokymo efektyvumas

Naujos technikos, tokios kaip MoE ir retas dėmesys, smarkiai sumažino skaičiavimo poreikius.

2026 m. pradžia

Bendruomenės pagreitis

ComfyUI darbo eigos, tikslinio derinimo vadovai ir optimizavimo įrankiai greitai subrendo.

Šis modelis primena tai, kas nutiko, kai LTX-2 atnešė 4K į vartotojų GPU, tačiau didesniu mastu.

Praktinė realybė

Būkime atviri, ką iš tiesų reiškia „vejasi“:

AspektasAtvirasis kodasNuosavybiniai
Aukščiausia kokybė85-90%100%
Generavimo greitis2-5 minutės10-30 sekundžių
Naudojimo paprastumasTechninis parengimasVienu spustelėjimu internete
Kaina už vaizdo įrašąNemokama (įsigijus aparatinę įrangą)$0.10-$2.00
PritaikymasNeribotasRibotas

Atvirasis kodas vis dar atsilieka pagal gryną kokybę ir greitį. Tačiau daugeliu naudojimo atvejų šis skirtumas nebėra svarbus.

💡

Daugiau konteksto apie šių modelių palyginimą su komercinėmis alternatyvomis rasite mūsų išsamiame Sora 2, Runway ir Veo 3 palyginime.

Kam tai turėtų rūpėti?

🎨

Nepriklausomi kūrėjai

Generuokite neribotą kiekį vaizdo įrašų be prenumeratos išlaidų. Mokykite modelį pagal savo stilių.

🏢

Įmonių komandos

Diekite savo infrastruktūroje jautriam turiniui. Jokie duomenys nepalieka jūsų serverių.

🔬

Tyrėjai

Visiška prieiga prie svorių ir architektūros. Keiskite, eksperimentuokite, publikuokite.

🎮

Žaidimų kūrėjai

Generuokite intarpus ir išteklius vietoje. Integruokite į procesus.

Šešių mėnesių prognozė

Remdamasis dabartinėmis tendencijomis, tikiuosi:

  • Trumpesnis nei 10 sekundžių generavimas taps standartu iki 2026 m. Q2
  • Metų viduryje atsiras generavimo realiuoju laiku prototipų
  • Kokybės lygybė su nuosavybiniais modeliais (iki jos dar 12-18 mėnesių)
  • Spartės pagrindinis ComfyUI diegimas

Šiuos modelius maitinanti difuzinių transformerių architektūra toliau gerėja. Kiekvienas mėnuo atneša naujų optimizacijų, mokymo metodų ir efektyvumo pagerinimų.

Nuo ko pradėti

Jei norite patys išbandyti šiuos modelius:

  1. Wan 2.2: Reikia RTX 4090 arba lygiaverčio sprendimo. Galima rasti GitHub su ComfyUI mazgais.
  2. HunyuanVideo 1.5: Veikia su 14GB+ VRAM. Galima Hugging Face integracija.
  3. Open-Sora 2.0: Visas mokymo ir išvadų darymo kodas GitHub.
⚠️

Šiems modeliams reikia techninio išmanymo apie Python, CUDA ir modelių įkėlimą. Jie dar nėra vienu spustelėjimu veikiantys sprendimai.

Platesnis vaizdas

Labiausiai mane jaudina ne tai, kur atvirojo kodo vaizdas yra šiandien, o kur jis juda. Kiekvienas proveržis fizikos simuliacijoje ir vietiniame garso generavime galiausiai pasiekia atvirus modelius.

Demokratizacija yra reali. Įrankiai prieinami. Atotrūkis mažėja.

Kūrėjams, kuriems aukščiausios klasės DI vaizdo prenumeratos buvo neįperkamos, įmonėms, kurioms reikia savo infrastruktūroje veikiančių sprendimų, tyrėjams, plečiantiems galimybių ribas, tai metas atkreipti dėmesį.

Dviratis virsta motociklu. O superautomobilių lenktynės ką tik tapo gerokai įdomesnės.


Šaltiniai

Henry
HenryCreative TechnologistAI Author

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.