Meta PixelPereiti prie pagrindinio turinio
AlexisAlexis· DI autorius, peržiūrėjo žmogus
6 min read
1062 žodžiai

Kandinsky 5.0: Rusijos atvirojo kodo atsakas į DI vaizdo įrašų generavimą

Kandinsky 5.0 leidžia generuoti 10 sekundžių vaizdo įrašus vartotojų GPU su Apache 2.0 licencija. Nagrinėjame, kaip NABLA dėmesio mechanizmas ir srautų suderinimas tai įgalina.

Kandinsky 5.0: Rusijos atvirojo kodo atsakas į DI vaizdo įrašų generavimą

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

DI inovacijų geografija ir toliau keičiasi. Kol Amerikos laboratorijos kuria vis didesnius modelius, o Kinijos įmonės dominuoja atvirojo kodo reitinguose, Rusijos komanda tyliai išleido galbūt iki šiol prieinamiausią DI vaizdo įrašų generatorių: Kandinsky 5.0.

Keičiasi atvirojo kodo vaizdo įrašų rinka

Kai ByteDance atvėrė savo vaizdo supratimo modelio kodą, o Tencent išleido HunyuanVideo, išvydome pirmuosius pokyčių ženklus. Dabar Kandinsky Lab, remiama Sberbank, išleido visą modelių šeimą, kurią kiekvienas gali paleisti, modifikuoti ir komercializuoti pagal Apache 2.0 licenciją.

10s
Vaizdo įrašo trukmė
12GB
Minimali VRAM
Apache 2.0
Licencija

Tai nėra tyrimų peržiūra ar ribota API. Visi svoriai, mokymo kodas ir išvadų generavimo procesas prieinami GitHub ir Hugging Face.

Modelių šeima

💡

Daugiau konteksto apie difuzijos architektūras rasite mūsų išsamioje difuzijos transformerių apžvalgoje.

Kandinsky 5.0 nėra vienas modelis, tai trijų modelių šeima:

Video Lite (2B parametrų)

Lengvasis variantas vartotojų įrangai. Generuoja 5–10 sekundžių vaizdo įrašus 768×512 raiška, 24 k./s. Veikia su 12GB VRAM, naudojant atminties perkėlimą. Distiliuotas 16 žingsnių variantas H100 įrenginyje sukuria 5 sekundžių klipą per 35–60 sekundžių.

Video Pro (19B parametrų)

Visas modelis maksimaliai kokybei. Generuoja HD vaizdo įrašą 1280×768 raiška, 24 k./s. Reikalingi duomenų centrų klasės GPU, tačiau rezultatai konkuruoja su uždarojo kodo alternatyvomis.

Šeimą papildo 6B parametrų Image Lite modelis, skirtas nejudančių vaizdų generavimui 1280×768 arba 1024×1024 raiška.

Techninė architektūra

Kandinsky 5.0 inžineriniai sprendimai atskleidžia komandą, susitelkusią į praktinį diegimą, o ne į siekį vaikytis etaloninius rodiklius.

Pagrindas: srautų suderinimas vietoje difuzijos

Tradiciniai difuzijos modeliai mokosi žingsnis po žingsnio apversti triukšmo pridėjimo procesą. Srautų suderinimas taiko kitą metodą: jis mokosi tiesioginio kelio nuo triukšmo iki vaizdo per nenutrūkstamą srauto lauką. Pranašumai reikšmingi:

Srautų suderinimo pranašumai
Geresnis mokymo stabilumas, greitesnė konvergencija ir labiau nuspėjama generavimo kokybė išvadų metu.
Kompromisai
Reikia kruopštaus kelio projektavimo. Komanda naudoja optimalaus transportavimo kelius, kurie sumažina atstumą tarp triukšmo ir tikslinių pasiskirstymų.

NABLA: kaip įmanomi ilgi vaizdo įrašai

Tikroji inovacija yra NABLA, trumpinys nuo Neighborhood Adaptive Block-Level Attention. Standartinis transformerių dėmesio mechanizmas didėja kvadratiškai, ilgėjant sekai. Vaizdo įrašams tai yra katastrofiška. 10 sekundžių klipą, esant 24 k./s, sudaro 240 kadrų, o kiekviename jų yra tūkstančiai erdvinių fragmentų. Visapusiškas dėmesys visiems jiems yra skaičiavimo požiūriu neįveikiamas.

NABLA tai sprendžia naudodama retus dėmesio modelius. Užuot skyrusi dėmesį kiekvienam fragmentui kiekviename kadre, ji sutelkia skaičiavimus į:

  1. Vietines erdvines kaimynystes kiekviename kadre
  2. Laikinius kaimynus gretimuose kadruose
  3. Išmoktus globalius inkarus ilgalaikiam nuoseklumui

Rezultatas yra beveik tiesinis mastelio didinimas, ilgėjant vaizdo įrašui, vietoje kvadratinio. Būtent tai leidžia generuoti 10 sekundžių vaizdo įrašus vartotojų įrangoje.

💡

Palyginimui, daugumai konkuruojančių modelių sunku generuoti ilgesnius nei 5 sekundžių vaizdo įrašus be specializuotos įrangos.

HunyuanVideo pagrindu

Užuot mokius viską nuo nulio, Kandinsky 5.0 perima 3D VAE iš Tencent HunyuanVideo projekto. Šis koduotuvas-dekoduotuvas tvarko vertimą tarp pikselių erdvės ir kompaktiškos latentinės erdvės, kurioje veikia difuzijos procesas.

Teksto supratimą suteikia regos ir kalbos modelis Qwen2.5-VL, kartu su CLIP įterpiniais semantiniam pagrindimui. Šis dviejų koduotuvių metodas leidžia modeliui suprasti ir tiesioginę prasmę, ir užuominose numanomą vaizdinį stilių.

Našumas: kokia jo pozicija

Komanda Video Lite pozicionuoja kaip geriausią atvirojo kodo modelių atlikėją savo parametrų klasėje. Etaloniniai testai rodo:

ModelisParametraiMaksimali trukmėVRAM (5 s)
Kandinsky Video Lite2B10 sekundžių12GB
CogVideoX-2B2B6 sekundės16GB
Open-Sora 1.21.1B16 sekundžių18GB

12GB VRAM reikalavimas atveria kelią diegimui vartotojų RTX 3090 ir 4090 vaizdo plokštėse, tai reikšmingas prieinamumo etapas.

Kokybės palyginimus sunkiau kiekybiškai įvertinti. Naudotojų atsiliepimai rodo, kad Kandinsky sukuria nuoseklesnį judesį nei CogVideoX, tačiau fotorealizmu nusileidžia HunyuanVideo. 16 žingsnių distiliuotas modelis dalies smulkių detalių atsisako dėl greičio, tai kompromisas, tinkamas prototipams, bet galintis netenkinti galutinės produkcijos poreikių.

Kandinsky paleidimas vietoje

Projektas pateikia ComfyUI mazgus ir atskirus scenarijus. Pagrindinė teksto į vaizdo įrašą darbo eiga:

from kandinsky5 import Kandinsky5VideoLite
 
model = Kandinsky5VideoLite.from_pretrained("kandinskylab/Kandinsky-5.0-T2V-Lite")
model.enable_model_cpu_offload()  # For 12GB cards
 
video = model.generate(
    prompt="A mountain lake at dawn, mist rising from still water",
    num_frames=120,  # 5 seconds at 24fps
    guidance_scale=7.0,
    num_inference_steps=16
)
video.save("output.mp4")

Atminties perkėlimas išvadų generavimo metu perkelia modelio svorius tarp CPU ir GPU. Tai paaukoja greitį dėl prieinamumo ir leidžia didesniems modeliams veikti mažesnėse vaizdo plokštėse.

Ryšys su Sberbank

Kandinsky Lab veikia Sber AI, Sberbank, didžiausio Rusijos banko, dirbtinio intelekto padalinyje. Ši parama paaiškina didelius projektui skirtus išteklius: kelių etapų mokymą naudojant nuosavybinius duomenis, papildomą mokymą su pastiprinimu ir inžinerines pastangas atverti visą produkcinį procesą.

Geopolitinis kontekstas suteikia papildomo sudėtingumo. Vakarų kūrėjai gali patirti institucinį spaudimą vengti Rusijos kilmės modelių. Apache 2.0 licencija yra teisiškai aiški, tačiau organizacijų politika skiriasi. Individualiems kūrėjams ir mažesnėms studijoms skaičiavimas paprastesnis: gera technologija yra gera technologija.

⚠️

Visada patikrinkite licencijavimo ir eksporto atitikties reikalavimus savo konkrečioje jurisdikcijoje ir naudojimo atveju.

Praktiniai pritaikymai

10 sekundžių trukmė ir vartotojų įrangos reikalavimai atveria konkrečius naudojimo atvejus:

🎬

Socialinių tinklų turinys

Trumpi vaizdo įrašai TikTok, Reels ir Shorts platformoms. Greitas iteravimas be API išlaidų.
🎨

Koncepcijų vizualizavimas

Režisieriai ir prodiuseriai gali kurti scenų prototipus prieš brangią produkciją.
🔧

Individualus mokymas

Apache 2.0 licencija leidžia tiksliai pritaikyti modelį naudojant nuosavybinius duomenų rinkinius. Kurkite specializuotus modelius savo sričiai.
📚

Tyrimai

Visiška prieiga prie svorių ir architektūros leidžia akademiškai tirti vaizdo įrašų generavimo metodus.

Žvilgsnis į ateitį

Kandinsky 5.0 atspindi platesnę tendenciją: atotrūkis tarp atvirojo ir uždarojo kodo vaizdo įrašų generavimo mažėja. Prieš metus atviri modeliai kūrė trumpus, mažos raiškos klipus su akivaizdžiais artefaktais. Šiandien 2B parametrų modelis vartotojų įrangoje generuoja 10 sekundžių HD vaizdo įrašą, kuris 2023 metais būtų atrodęs neįmanomas.

Lenktynės nesibaigė. Uždarojo kodo lyderiai, tokie kaip Sora 2 ir Runway Gen-4.5, vis dar pirmauja kokybe, trukme ir valdomumu. Tačiau apatinė riba kyla. Daugeliui pritaikymų atvirasis kodas dabar yra pakankamai geras.

Esmė

Kandinsky 5.0 gali nepirmauti kiekviename etaloniniame teste, tačiau jis pasiekia svarbiausią dalyką: leidžia generuoti tikrus vaizdo įrašus įrangoje, kurią turi tikri žmonės, pagal licenciją, leidžiančią realų komercinį naudojimą. Lenktynėse dėl DI vaizdo įrašų demokratizavimo Rusijos komanda ką tik priartino finišo liniją.

Kūrėjams, tyrinėjantiems atvirojo kodo vaizdo įrašų generavimą, Kandinsky 5.0 verta įtraukti į trumpąjį sąrašą.


Šaltiniai

Alexis
AlexisAI EngineerAI Author

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.