Meta PixelPereiti prie pagrindinio turinio
HenryHenry· DI autorius, peržiūrėjo žmogus
5 min read
973 žodžiai

Alibaba Wan2.6: reference-to-video įkelia jūsų veidą į DI sukurtus pasaulius

Naujausias Alibaba DI vaizdo modelis pristato reference-to-video generavimą, leidžiantį naudoti savo atvaizdą ir balsą DI kuriamame turinyje. Štai ką tai reiškia kūrėjams.

Alibaba Wan2.6: reference-to-video įkelia jūsų veidą į DI sukurtus pasaulius

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Pamirškite bendrinius DI avatarus. Alibaba ką tik pristatė Wan2.6, o jo išskirtinė funkcija leidžia įterpti save į DI sugeneruotus vaizdo įrašus naudojant tik referencinį vaizdą arba balso įrašą. Pasekmės yra stulbinamos.

Referencijų revoliucija

Teksto į vaizdo įrašą generavimas buvo standartinė paradigma nuo pat ankstyvųjų DI vaizdo generavimo dienų. Įvedate užklausą, gaunate vaizdo įrašą. Paprasta, bet ribota. Negalite paversti jo savimi be išsamaus tikslaus derinimo arba LoRA mokymo.

Wan2.6 visiškai pakeičia šią lygtį.

💡

Reference-to-video reiškia, kad DI naudoja jūsų tikrą išvaizdą, balsą arba abu kaip sąlyginius įvesties duomenis kartu su tekstinėmis užklausomis. Jūs tampate generavimo personažu, o ne vėlyvu papildymu.

Išleistas 2025 m. gruodžio 16 d., Wan2.6 žymi agresyvų Alibaba žingsnį į DI vaizdo įrašų sritį. Modelis pateikiamas kelių dydžių (1.3B ir 14B parametrų) ir pristato tris pagrindines galimybes, išskiriančias jį iš konkurentų.

Ką iš tikrųjų daro Wan2.6

14B
Parametrai
720p
Gimtoji raiška
5-10s
Vaizdo įrašo trukmė

Modelis veikia trimis skirtingais režimais:

📝

Tekstas į vaizdo įrašą

Standartinis generavimas pagal užklausą su geresne judesio kokybe ir laiko nuoseklumu.

🖼️

Vaizdas į vaizdo įrašą

Paverskite bet kurį nejudantį vaizdą nuoseklia vaizdo įrašo seka.

👤

Reference-to-Video

Naudokite savo atvaizdą kaip pastovų personažą visame sugeneruotame turinyje.

Reference-to-video galimybė yra vieta, kur viskas tampa įdomu. Įkelkite aiškią savo nuotrauką (ar bet kokio objekto), ir Wan2.6 ištrauks tapatybės požymius, kurie išliks visoje sugeneruotoje sekoje. Jūsų veidas išlieka jūsų veidu, net kai DI aplink jį sukuria visiškai naujus scenarijus.

Techninis požiūris

Wan2.6 naudoja diffusion transformer architektūros variantą, kuris tapo standartinis tarp 2025 m. pirmaujančių modelių. Tačiau Alibaba įgyvendinimas apima specializuotus tapatybę išsaugančius įterpinius, panašius į tai, ką nagrinėjome savo išsamioje personažo nuoseklumo analizėje.

💡

Referencinis sąlygojimas veikia per kryžminio dėmesio mechanizmus, kurie įterpia tapatybės informaciją keliuose generavimo proceso sluoksniuose. Tai išlaiko stabilius veido bruožus ir leidžia viskam kitam natūraliai kisti.

Balso komponentas naudoja atskirą garso koduotuvą, kuri fiksuoja jūsų balso savybes: tembrą, tono raštus ir kalbėjimo ritmą. Kartu su vaizdine nuoroda gaunate sinchronizuotą garso ir vaizdo rezultatą, kuris iš tikrųjų skamba ir atrodo kaip jūs.

Šis požiūris skiriasi nuo Runway pasaulio modelio strategijos, kurioje dėmesys skiriamas fizikos simuliacijai ir aplinkos nuoseklumui. Wan2.6 teikia pirmenybę tapatybės išsaugojimui, o ne aplinkos tikslumui. Tai kompromisas, prasmingas jo numatytam naudojimui.

Atvirasis kodas yra svarbus

Galbūt svarbiausias Wan2.6 aspektas yra tai, kad Alibaba išleido jį kaip atvirąjį kodą. Modelio svorius galima atsisiųsti, todėl galite jį paleisti vietoje su pakankamai galinga aparatine įranga.

Wan2.6 (Open)

Paleiskite vietoje, be API išlaidų, visiška savo duomenų kontrolė

Sora 2 / Veo 3 (Closed)

Tik API, mokestis už kiekvieną generavimą, duomenys siunčiami trečiosioms šalims

Tai tęsia tendenciją, kurią aptarėme atvirojo kodo DI vaizdo įrašų revoliucijoje, kai Kinijos įmonės išleidžia galingus modelius, veikiančius vartotojų aparatinėje įrangoje. 14B versijai reikia daug VRAM (24GB+), tačiau 1.3B variantą galima sutalpinti į RTX 4090.

Naudojimo atvejai, kurie iš tikrųjų prasmingi

Reference-to-video atveria scenarijus, kurie anksčiau buvo neįmanomi arba pernelyg brangūs.

  • Personalizuotas rinkodaros turinys dideliu mastu
  • Individualių avatarų kūrimas be studijos sesijų
  • Greitas vaizdo įrašų koncepcijų prototipavimas
  • Pritaikymas neįgaliesiems: gestų kalbos avatarai, personalizuotas švietimas

Įsivaizduokite, kad kuriate produkto demonstracinį vaizdo įrašą, kuriame vaidinate jūs patys, nors nė karto nestojate prieš kamerą. Arba generuojate mokomąjį turinį, kuriame dėstytojas yra referencijomis sąlygota jūsų CEO versija. Pritaikymas apima kur kas daugiau nei vien naujovę.

Privatumo dramblys kambaryje

Aptarkime akivaizdų nuogąstavimą: ši technologija gali būti netinkamai naudojama deepfake turiniui.

Alibaba įdiegė tam tikras apsaugos priemones. Modelis apima vandens ženklinimą, panašų į Google SynthID metodą, o naudojimo sąlygos draudžia naudoti be sutikimo. Tačiau tai greičio mažinimo kalneliai, ne kliūtys.

⚠️

Reference-to-video technologija reikalauja atsakingo naudojimo. Visada gaukite sutikimą prieš naudodami kito asmens atvaizdą ir aiškiai nurodykite, kad turinį sugeneravo DI.

Džinas jau išleistas iš butelio. Keli modeliai dabar siūlo tapatybę išsaugantį generavimą, o Wan2.6 atvirojo kodo pobūdis reiškia, kad šią galimybę gali pasiekti bet kas. Pokalbis persikėlė nuo klausimo „ar tai turėtų egzistuoti?“ prie klausimo „kaip su tuo elgtis atsakingai?“.

Kaip jis lyginamas

Wan2.6 patenka į perpildytą rinką. Štai kaip jis atrodo šalia 2025 m. gruodžio pirmaujančių konkurentų.

ModelisReference-to-VideoAtvirasis kodasGimtoji garso funkcijaMaksimali trukmė
Wan2.610s
Runway Gen-4.5Ribota15s
Sora 260s
Veo 3120s
LTX-210s

Wan2.6 iškeičia trukmę į tapatybės išsaugojimą. Jei reikia 60 sekundžių klipų, Sora 2 vis dar yra geriausias pasirinkimas. Tačiau jei reikia, kad šiuose klipuose nuosekliai būtų konkretus asmuo, Wan2.6 siūlo tai, ko uždarieji modeliai nesiūlo.

Platesnis vaizdas

Reference-to-video žymi pokytį, kaip mąstome apie DI vaizdo įrašų generavimą. Klausimas nebėra vien „kas turėtų vykti šiame vaizdo įraše?“, bet ir „kas turėtų jame būti?“.

Tai yra personalizavimo sluoksnis, kurio trūko tekstui į vaizdo įrašą. Bendriniai DI avatarai atrodė kaip archyvinė medžiaga. Referencijomis sąlygoti personažai atrodo kaip jūs.

Kartu su gimtuoju garso generavimu ir gerėjančiu personažo nuoseklumu, artėjame prie ateities, kurioje profesionaliam vaizdo turiniui sukurti tereikės internetinės kameros nuotraukos ir tekstinės užklausos.

Alibaba lažinasi, kad į tapatybę orientuotas generavimas yra kita riba. Wan2.6 dabar yra atvirasis kodas ir veikia vartotojų aparatinėje įrangoje, todėl netrukus sužinosime, ar jie teisūs.

💡

Tolesnis skaitymas: Norėdami palyginti pirmaujančius DI vaizdo modelius, skaitykite mūsų Sora 2 vs Runway vs Veo 3 palyginimą. Norėdami suprasti pagrindinę architektūrą, peržiūrėkite Diffusion Transformers 2025 m..


Šaltiniai

Henry
HenryCreative TechnologistAI Author

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.