Alibaba Wan2.6: reference-to-video įkelia jūsų veidą į DI sukurtus pasaulius
Naujausias Alibaba DI vaizdo modelis pristato reference-to-video generavimą, leidžiantį naudoti savo atvaizdą ir balsą DI kuriamame turinyje. Štai ką tai reiškia kūrėjams.

Pamirškite bendrinius DI avatarus. Alibaba ką tik pristatė Wan2.6, o jo išskirtinė funkcija leidžia įterpti save į DI sugeneruotus vaizdo įrašus naudojant tik referencinį vaizdą arba balso įrašą. Pasekmės yra stulbinamos.
Referencijų revoliucija
Teksto į vaizdo įrašą generavimas buvo standartinė paradigma nuo pat ankstyvųjų DI vaizdo generavimo dienų. Įvedate užklausą, gaunate vaizdo įrašą. Paprasta, bet ribota. Negalite paversti jo savimi be išsamaus tikslaus derinimo arba LoRA mokymo.
Wan2.6 visiškai pakeičia šią lygtį.
Reference-to-video reiškia, kad DI naudoja jūsų tikrą išvaizdą, balsą arba abu kaip sąlyginius įvesties duomenis kartu su tekstinėmis užklausomis. Jūs tampate generavimo personažu, o ne vėlyvu papildymu.
Išleistas 2025 m. gruodžio 16 d., Wan2.6 žymi agresyvų Alibaba žingsnį į DI vaizdo įrašų sritį. Modelis pateikiamas kelių dydžių (1.3B ir 14B parametrų) ir pristato tris pagrindines galimybes, išskiriančias jį iš konkurentų.
Ką iš tikrųjų daro Wan2.6
Modelis veikia trimis skirtingais režimais:
Tekstas į vaizdo įrašą
Standartinis generavimas pagal užklausą su geresne judesio kokybe ir laiko nuoseklumu.
Vaizdas į vaizdo įrašą
Paverskite bet kurį nejudantį vaizdą nuoseklia vaizdo įrašo seka.
Reference-to-Video
Naudokite savo atvaizdą kaip pastovų personažą visame sugeneruotame turinyje.
Reference-to-video galimybė yra vieta, kur viskas tampa įdomu. Įkelkite aiškią savo nuotrauką (ar bet kokio objekto), ir Wan2.6 ištrauks tapatybės požymius, kurie išliks visoje sugeneruotoje sekoje. Jūsų veidas išlieka jūsų veidu, net kai DI aplink jį sukuria visiškai naujus scenarijus.
Techninis požiūris
Wan2.6 naudoja diffusion transformer architektūros variantą, kuris tapo standartinis tarp 2025 m. pirmaujančių modelių. Tačiau Alibaba įgyvendinimas apima specializuotus tapatybę išsaugančius įterpinius, panašius į tai, ką nagrinėjome savo išsamioje personažo nuoseklumo analizėje.
Referencinis sąlygojimas veikia per kryžminio dėmesio mechanizmus, kurie įterpia tapatybės informaciją keliuose generavimo proceso sluoksniuose. Tai išlaiko stabilius veido bruožus ir leidžia viskam kitam natūraliai kisti.
Balso komponentas naudoja atskirą garso koduotuvą, kuri fiksuoja jūsų balso savybes: tembrą, tono raštus ir kalbėjimo ritmą. Kartu su vaizdine nuoroda gaunate sinchronizuotą garso ir vaizdo rezultatą, kuris iš tikrųjų skamba ir atrodo kaip jūs.
Šis požiūris skiriasi nuo Runway pasaulio modelio strategijos, kurioje dėmesys skiriamas fizikos simuliacijai ir aplinkos nuoseklumui. Wan2.6 teikia pirmenybę tapatybės išsaugojimui, o ne aplinkos tikslumui. Tai kompromisas, prasmingas jo numatytam naudojimui.
Atvirasis kodas yra svarbus
Galbūt svarbiausias Wan2.6 aspektas yra tai, kad Alibaba išleido jį kaip atvirąjį kodą. Modelio svorius galima atsisiųsti, todėl galite jį paleisti vietoje su pakankamai galinga aparatine įranga.
Paleiskite vietoje, be API išlaidų, visiška savo duomenų kontrolė
Tik API, mokestis už kiekvieną generavimą, duomenys siunčiami trečiosioms šalims
Tai tęsia tendenciją, kurią aptarėme atvirojo kodo DI vaizdo įrašų revoliucijoje, kai Kinijos įmonės išleidžia galingus modelius, veikiančius vartotojų aparatinėje įrangoje. 14B versijai reikia daug VRAM (24GB+), tačiau 1.3B variantą galima sutalpinti į RTX 4090.
Naudojimo atvejai, kurie iš tikrųjų prasmingi
Reference-to-video atveria scenarijus, kurie anksčiau buvo neįmanomi arba pernelyg brangūs.
- ✓Personalizuotas rinkodaros turinys dideliu mastu
- ✓Individualių avatarų kūrimas be studijos sesijų
- ✓Greitas vaizdo įrašų koncepcijų prototipavimas
- ✓Pritaikymas neįgaliesiems: gestų kalbos avatarai, personalizuotas švietimas
Įsivaizduokite, kad kuriate produkto demonstracinį vaizdo įrašą, kuriame vaidinate jūs patys, nors nė karto nestojate prieš kamerą. Arba generuojate mokomąjį turinį, kuriame dėstytojas yra referencijomis sąlygota jūsų CEO versija. Pritaikymas apima kur kas daugiau nei vien naujovę.
Privatumo dramblys kambaryje
Aptarkime akivaizdų nuogąstavimą: ši technologija gali būti netinkamai naudojama deepfake turiniui.
Alibaba įdiegė tam tikras apsaugos priemones. Modelis apima vandens ženklinimą, panašų į Google SynthID metodą, o naudojimo sąlygos draudžia naudoti be sutikimo. Tačiau tai greičio mažinimo kalneliai, ne kliūtys.
Reference-to-video technologija reikalauja atsakingo naudojimo. Visada gaukite sutikimą prieš naudodami kito asmens atvaizdą ir aiškiai nurodykite, kad turinį sugeneravo DI.
Džinas jau išleistas iš butelio. Keli modeliai dabar siūlo tapatybę išsaugantį generavimą, o Wan2.6 atvirojo kodo pobūdis reiškia, kad šią galimybę gali pasiekti bet kas. Pokalbis persikėlė nuo klausimo „ar tai turėtų egzistuoti?“ prie klausimo „kaip su tuo elgtis atsakingai?“.
Kaip jis lyginamas
Wan2.6 patenka į perpildytą rinką. Štai kaip jis atrodo šalia 2025 m. gruodžio pirmaujančių konkurentų.
| Modelis | Reference-to-Video | Atvirasis kodas | Gimtoji garso funkcija | Maksimali trukmė |
|---|---|---|---|---|
| Wan2.6 | ✅ | ✅ | ✅ | 10s |
| Runway Gen-4.5 | Ribota | ❌ | ✅ | 15s |
| Sora 2 | ❌ | ❌ | ✅ | 60s |
| Veo 3 | ❌ | ❌ | ✅ | 120s |
| LTX-2 | ❌ | ✅ | ✅ | 10s |
Wan2.6 iškeičia trukmę į tapatybės išsaugojimą. Jei reikia 60 sekundžių klipų, Sora 2 vis dar yra geriausias pasirinkimas. Tačiau jei reikia, kad šiuose klipuose nuosekliai būtų konkretus asmuo, Wan2.6 siūlo tai, ko uždarieji modeliai nesiūlo.
Platesnis vaizdas
Reference-to-video žymi pokytį, kaip mąstome apie DI vaizdo įrašų generavimą. Klausimas nebėra vien „kas turėtų vykti šiame vaizdo įraše?“, bet ir „kas turėtų jame būti?“.
Tai yra personalizavimo sluoksnis, kurio trūko tekstui į vaizdo įrašą. Bendriniai DI avatarai atrodė kaip archyvinė medžiaga. Referencijomis sąlygoti personažai atrodo kaip jūs.
Kartu su gimtuoju garso generavimu ir gerėjančiu personažo nuoseklumu, artėjame prie ateities, kurioje profesionaliam vaizdo turiniui sukurti tereikės internetinės kameros nuotraukos ir tekstinės užklausos.
Alibaba lažinasi, kad į tapatybę orientuotas generavimas yra kita riba. Wan2.6 dabar yra atvirasis kodas ir veikia vartotojų aparatinėje įrangoje, todėl netrukus sužinosime, ar jie teisūs.
Tolesnis skaitymas: Norėdami palyginti pirmaujančius DI vaizdo modelius, skaitykite mūsų Sora 2 vs Runway vs Veo 3 palyginimą. Norėdami suprasti pagrindinę architektūrą, peržiūrėkite Diffusion Transformers 2025 m..
Šaltiniai

Kūrybinių technologijų specialistas iš Lozanos, tyrinėjantis DI ir meno susitikimo vietą. Tarp elektroninės muzikos sesijų eksperimentuoja su generatyviniais modeliais.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Alibaba HappyHorse-1.0: paslaptingas modelis, užėmęs pirmą vietą visuose AI vaizdo įrašų reitinguose
Modelis pavadinimu HappyHorse-1.0 pasirodė Artificial Analysis platformoje be jokio priskyrimo, pakilo į pirmą vietą tiek teksto pavertimo vaizdo įrašu, tiek vaizdo pavertimo vaizdo įrašu kategorijose, o paskui paaiškėjo, kad už jo stovi Alibaba. Štai ką žinome apie architektūrą, komandą ir ką tai reiškia AI vaizdo įrašų rinkai.

Alibaba Wan 2.7: Kaip mąstymo režimas keičia DI vaizdo įrašų generavimą
Alibaba ką tik išleido Wan 2.7 su nauju mąstymo režimu, kuris planuoja kompozicijas prieš generuojant vaizdo įrašą. Nagrinėjame, kaip tai veikia ir ką tai reiškia kūrėjams.

Nemokami neriboti DI vaizdo įrašų įrankiai: kas veikia 2026 m.
Nemokami neriboti DI vaizdo įrankiai dažniausiai yra eilės pagrindu arba vietiniai. Sužinokite, kas iš tikrųjų yra neribota, kas sulėtėja ir kaip pasirinkti veiksmingą 2026 m. sprendimą.