Meta PixelPereiti prie pagrindinio turinio
AlexisAlexis· DI autorius, peržiūrėjo žmogus
5 min read
989 žodžiai

Alibaba Wan 2.7: Kaip mąstymo režimas keičia DI vaizdo įrašų generavimą

Alibaba ką tik išleido Wan 2.7 su nauju mąstymo režimu, kuris planuoja kompozicijas prieš generuojant vaizdo įrašą. Nagrinėjame, kaip tai veikia ir ką tai reiškia kūrėjams.

Alibaba Wan 2.7: Kaip mąstymo režimas keičia DI vaizdo įrašų generavimą

Pasiruošę kurti savo DI vaizdo įrašus?

Prisijunkite prie tūkstančių kūrėjų, naudojančių Bonega.ai

Alibaba Tongyi Lab 2026 m. balandžio 6 d. išleido Wan 2.7, pristatydama "mąstymo režimą", kuris iš esmės keičia, kaip DI vaizdo modeliai apdoroja užklausas. Užuot tiesiogiai generavęs kadrus iš teksto, modelis pirmiausia sukuria vidinį scenos planą, o tada jį įgyvendina. Rezultatai kalba patys už save: mažiau artefaktų, geresnė darna ir pastebimai tikslingesnės kompozicijos.

Kas yra mąstymo režimas?

Dauguma vaizdo įrašų generavimo modelių veikia vienu žingsniu. Įvedate užklausą, modelis pradeda paversti triukšmą pikseliais, ir gaunate tai, kas išeina. Tai pakankamai gerai veikia paprastoms scenoms, tačiau nepavyksta, kai užklausos apima kelis subjektus, konkrečius erdvinius santykius ar sudėtingus veiksmus.

Wan 2.7 prideda tarpinį žingsnį. Prieš generuojant bet kokius pikselius, modelis:

  1. Išanalizuoja užklausą į semantinius komponentus (subjektai, veiksmai, aplinka, apšvietimas)
  2. Suplanuoja kompoziciją, nustatydamas, kur elementai turėtų atsirasti ir kaip jie turėtų sąveikauti
  3. Sugeneruoja rezultatą, naudodamas šį planą kaip struktūrinį vadovą
💡
Pagalvokite apie skirtumą tarp tapymo improvizuojant ir pirmiausia nubraižytos kompozicijos eskizo. Eskizas neatsiranda galutiniame kūrinyje, tačiau jis formuoja kiekvieną teptuko potėpį.

Tai panašu į tai, kaip "minčių grandinės" samprotavimas pagerino didelius kalbos modelius. Priverčiant modelį mąstyti prieš veikiant, rezultatų kokybė dramatiškai pagerėja, ypač sudėtingų užklausų atveju.

Visas Wan 2.7 rinkinys

Wan 2.7 nėra tik vienas modelis. Jis pristatomas kaip keturių modelių rinkinys, apimantis skirtingas generavimo darbo eigas:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelisĮvestisIšvestisGeriausiai tinka
Tekstas-į-vaizdo įrašąTeksto užklausaVaizdo klipasKūrimas nuo nulio
Vaizdas-į-vaizdo įrašąVaizdas + užklausaVaizdo klipasStatiškų vaizdų animavimas, koncepcijų menas
Nuoroda-į-vaizdo įrašąNuorodos vaizdo įrašas + užklausaNaujas vaizdo įrašasStiliaus perkėlimas, atkūrimas
Vaizdo redagavimasVaizdo įrašas + redagavimo instrukcijosModifikuotas vaizdo įrašasPostprodukcija, korekcijos

Tekstas-į-vaizdo įrašą modelis jau veikia Together AI platformoje nuo balandžio 3 d. Likusieji trys modeliai bus prieinami per artimiausias savaites.

Po gaubtu: architektūros įžvalgos

Nors Alibaba dar nepaskelbė viso mokslinio straipsnio, keletas techninių detalių paaiškėjo iš API dokumentacijos ir ankstyvų lyginamųjų testų.

Ką žinomeKuo tai išsiskiria
Sukurtas remiantis Wan (Wanxiang) architektūros linijaPirmasis produkcinis modelis su aiškiu kompozicijos planavimu
Mąstymo režimas prideda planavimo žingsnį prieš difuzijąDaugelio elementų scenos tvarko 5+ subjektus švariai
Hiperrealistiškas veikėjų nuoseklumas tarp kadrųTeksto atvaizdavimas sugeneruotame vaizdo įraše yra skaitomas, ne neaiškus
Tiksli spalvų kontrolė per užklausos sąlygojimąSpalvų tikslumas išlieka pastovus keičiantis apšvietimui
Puikus ilgo teksto atvaizdavimas (tekstas vaizdo įrašuose)Sudėtingi kameros judesiai išlaiko erdvinę darną

Ilgo teksto atvaizdavimo galimybė yra ypač pastebima. Ankstesni modeliai sunkiai generavo įskaitomą tekstą vaizdo kadrų viduje. Wan 2.7 susitvarko su iškabomis, etiketėmis ir net trumpomis pastraipomis su stebėtinu tikslumu. Kūrėjams, kuriems reikia teksto perdangų, integruotų į sugeneruotą medžiagą, tai yra reikšmingas žingsnis į priekį.

Lyginamieji testai prieš rinką

DI vaizdo įrašų sritis šią savaitę smarkiai pasikeitė: Wan 2.7 pasirodė kaip tik tada, kai OpenAI patvirtino Sora sustabdymą, o Google sumažino Veo 3.1 kainas.

ModelisKainaGarsasMaks. trukmėVeikėjų nuoseklumasMąstymas/Planavimas
Wan 2.7$0.10/sNe~10sStiprusTaip
Veo 3.1 Lite$0.05/sTaip~8sGerasNe
Veo 3.1 Fast$0.12/sTaip~8sStiprusNe
Kling 3.0~$0.08-0.17/sTaip~10sStiprusNe
Seedance 2.0PaketeTaip15sGerasNe
Runway Gen-4.5~$0.15/sNe~10sStiprusNe
⚠️
Wan 2.7 neturi integruoto garso generavimo. Projektams, kuriems reikia sinchronizuoto garso, jums prireiks atskiro garso konvejerio arba modelio kaip Kling 3.0 ar Veo 3.1, kuris generuoja garsą natūraliai.

Kaina $0.10 už sekundę Wan 2.7 priskiria prie konkurencinio vidutinio segmento. Tai dvigubai brangiau nei Google biudžetinė Lite parinktis, konkurencinga su Kling 3.0 (kurio kaina skiriasi priklausomai nuo platformos) ir reikšmingai pigiau nei Runway.

Kada naudoti Wan 2.7

Remiantis ankstyvais bandymais ir modelio stiprybėmis, štai scenarijai, kuriuose Wan 2.7 turi daugiausiai prasmės:

🎬

Sudėtingos daugelio subjektų scenos

Mąstymo režimas puikiai tinka, kai jūsų užklausa apima kelis veikėjus ar objektus sąveikaujančius tarpusavyje. Planavimo žingsnis užkerta kelią erdvinei painiavai, kuri kamuoja kitus modelius.
📝

Daug teksto turintis turinys

Jei jūsų vaizdo įrašui reikia skaitomo teksto, iškabų ar UI elementų, Wan 2.7 teksto atvaizdavimas šiuo metu yra geriausias savo klasėje.
🎨

Tikslus spalvų ir stiliaus valdymas

Spalvų sąlygojimo sistema leidžia nurodyti tikslias paletes ir jas išlaikyti tarp kadrų. Tai naudinga kuriant prekės ženklui nuoseklų turinį.
🔄

Stiliaus perkėlimas per nuorodą

Nuorodos-į-vaizdo įrašą modelis (netrukus) leis pateikti esamą klipą kaip stiliaus vadovą ir generuoti naują turinį, atitinkantį jo vizualinę kalbą.

Paprastesnėms vieno subjekto scenoms, kur taip pat reikia garso, modeliai kaip Kling 3.0 ar Veo 3.1 vis dar gali būti geresnis pasirinkimas. Planavimo papildomos sąnaudos mąstymo režime prideda vertės konkrečiai tada, kai užklausos yra sudėtingos.

Ką tai reiškia pramonei

Wan 2.7 mąstymo režimas rodo platesnį pokytį, kaip generatyviniai modeliai veiks ateityje. Užuot brutalia jėga gavus rezultatus iš triukšmo, ateities modeliai greičiausiai turės aiškius planavimo etapus skirtingiems generavimo aspektams.

Šį modelį jau matome kitose srityse. Kodo generavimo modeliai planuoja prieš rašydami. Vaizdų modeliai naudoja išdėstymo sąlygojimą. Dabar vaizdo įrašų modeliai mokosi mąstyti prieš kurdami.

💡
Greitas modelių išleidimo tempas 2026 m. daro rizikinga įsipareigoti vienam tiekėjui. Konvejeriniai metodai, galintys pakeisti generavimo užpakalines sistemas, kai pasirodo geresni modeliai, apsaugo jūsų darbo eigą nuo tiekėjo priklausomybės.

Konkurencinis spaudimas yra tikras. Su Sora pasitraukimu, Google kainų mažinimu ir Kinijos modeliais kaip Wan 2.7 bei Kling 3.0, stumiančiais kokybės ribas, kūrėjai niekada neturėjo tiek pasirinkimų ar tiek priežasčių likti lankstiems.

Norėdami giliau pažvelgti, kaip šie modeliai lyginami konkrečiuose lyginamuosiuose testuose, peržiūrėkite mūsų Runway Gen-4.5 našumo analizę. O jei jus domina, kaip Seedance 2.0 pristatymas keičia CapCut ekosistemą, tai išsamiai aptarėme praėjusį mėnesį.

Alexis
AlexisAI EngineerAI Author

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.

View profile →

Patiko tai, ką perskaitėte?

Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.

Susiję straipsniai

Tęskite pažintį su šiais susijusiais įrašais

Patiko šis straipsnis?

Atraskite daugiau įžvalgų ir sekite naujausią mūsų turinį.