Meta PixelLiigu põhi sisuni
AlexisAlexis· tehisintellekti autor, inimese poolt üle vaadatud
5 min read
924 sõna

Alibaba Wan 2.7: Kuidas Thinking Mode muudab tehisintellekti videogenereerimist

Alibaba avaldas just Wan 2.7 uudse Thinking Mode funktsiooniga, mis planeerib kompositsioonid enne video genereerimist. Selgitame, kuidas see toimib ja mida see loojatele tähendab.

Alibaba Wan 2.7: Kuidas Thinking Mode muudab tehisintellekti videogenereerimist

Kas olete valmis looma oma tehisintellekti videoid?

Liituge tuhandete Bonega.ai kasutavate loojatega

Alibaba Tongyi Lab avaldas Wan 2.7 6. aprillil 2026, tuues kaasa "Thinking Mode" funktsiooni, mis muudab põhjalikult viisi, kuidas AI videomudelid päringuid töötlevad. Selle asemel, et genereerida kaadreid otse tekstist, koostab mudel esmalt stseeni sisemise plaani ja seejärel viib selle ellu. Tulemused räägivad enda eest: vähem artefakte, parem sidusus ja märgatavalt teadlikumad kompositsioonid.

Mis on Thinking Mode?

Enamik videogenereerimise mudeleid töötab ühe läbimisega. Kirjutad päringu, mudel hakkab müra piksliteks muundama ja saad selle, mis välja tuleb. See toimib lihtsate stseenide puhul piisavalt hästi, kuid ebaõnnestub, kui päringud hõlmavad mitut subjekti, konkreetseid ruumilisi suhteid või keerukaid tegevusi.

Wan 2.7 lisab vaheetapi. Enne mis tahes pikslite genereerimist mudel:

  1. Analüüsib päringut semantilisteks komponentideks (subjektid, tegevused, keskkond, valgustus)
  2. Planeerib kompositsiooni määrates kindlaks, kus elemendid peaksid asuma ja kuidas nad peaksid omavahel suhtlema
  3. Genereerib väljundi kasutades seda plaani struktuurse juhisena
💡
Mõtle sellele kui erinevusele maali improviseerimise ja esmalt kompositsiooniuuringu joonistamise vahel. Eskiis ei ilmu lõppteosesse, kuid see kujundab iga pintslitõmmet.

See sarnaneb sellega, kuidas "mõtteahela" (chain-of-thought) lähenemine parandas suuri keelemudeleid. Sundides mudelit enne tegutsemist mõtlema, paraneb väljundi kvaliteet märkimisväärselt, eriti keerukate päringute puhul.

Täielik Wan 2.7 komplekt

Wan 2.7 ei ole ainult üks mudel. See tarnitakse nelja mudeli komplektina, mis katab erinevaid genereerimisvoogusid:

4
Mudelikomplekt
$0.10/s
API hind
6. apr.
Avaldamiskuupäev
MudelSisendVäljundParim kasutus
Tekstist videoksTekstipäringVideoklippLoomine nullist
Pildist videoksPilt + päringVideoklippPiltide animeerimine, kontseptkunst
Viidest videoksViitevideo + päringUus videoStiiliülekanne, taasloomine
Video redigeerimineVideo + redigeerimishjuhisedMuudetud videoJäreltöötlus, parandused

Tekstist videoks mudel on juba saadaval Together AI platvormil alates 3. aprillist. Ülejäänud kolm mudelit muutuvad kättesaadavaks järgnevate nädalate jooksul.

Kapoti all: arhitektuuri üksikasjad

Kuigi Alibaba ei ole veel täielikku uurimistööd avaldanud, on API dokumentatsioonist ja varastest testidest selgunud mitmeid tehnilisi üksikasju.

Mida teameMis seda eristab
Ehitatud Wan (Wanxiang) arhitektuuriliini pealeEsimene tootmismudel selgesõnalise kompositsioonilise planeerimisega
Thinking Mode lisab planeerimisfaasi enne difusiooniMitme elemendiga stseenid käsitlevad 5+ subjekti puhtalt
Hüperrealistlik tegelaste järjepidevus kaadrite vahelTeksti renderdamine genereeritud videos on loetav, mitte moonutatud
Täpne värvikontroll päringu konditsioneerimise kauduVärvitäpsus püsib järjekindel valgustusmuutuste korral
Suurepärane pika teksti renderdamine (tekst videotes)Keerukad kaameraliigutused säilitavad ruumilise sidususe

Pika teksti renderdamise võimekus on eriti tähelepanuväärne. Varasemad mudelid vaevlesid loetava teksti genereerimisega videokaadreis. Wan 2.7 käsitleb silte, märgiseid ja isegi lühikesi lõike üllatava täpsusega. Loojatele, kes vajavad genereeritud materjali sisse põimitud tekstikihte, on see märkimisväärne samm edasi.

Võrdlus konkurentidega

AI videoturg muutus sel nädalal oluliselt: Wan 2.7 saabus just siis, kui OpenAI kinnitas Sora sulgemist ja Google vähendas Veo 3.1 hindu.

MudelHindHeliMaks. pikkusTegelaste järjepidevusMõtlemine/Planeerimine
Wan 2.7$0.10/sEi~10sTugevJah
Veo 3.1 Lite$0.05/sJah~8sHeaEi
Veo 3.1 Fast$0.12/sJah~8sTugevEi
Kling 3.0~$0.08-0.17/sJah~10sTugevEi
Seedance 2.0SisaldubJah15sHeaEi
Runway Gen-4.5~$0.15/sEi~10sTugevEi
⚠️
Wan 2.7 ei sisalda natiivset heligenereerimist. Sünkroniseeritud heli nõudvate projektide jaoks vajad eraldi helikonveierit või mudelit nagu Kling 3.0 või Veo 3.1, mis genereerivad heli natiivselt.

Hind $0.10 sekundi kohta asetab Wan 2.7 konkurentsivõimelisse keskkategooriasse. See on kaks korda kallim kui Google'i soodne Lite variant, konkurentsivõimeline Kling 3.0-ga (mille hind varieerub platvormiti) ja oluliselt soodsam kui Runway.

Millal kasutada Wan 2.7-t

Varaste testide ja mudeli tugevuste põhjal on need stsenaariumid, kus Wan 2.7 on kõige mõttekam valik:

🎬

Keerukad mitme subjektiga stseenid

Thinking Mode paistab silma, kui päring hõlmab mitut tegelast või objekti omavahelises suhtluses. Planeerimisfaas hoiab ära ruumilise segaduse, mis vaevab teisi mudeleid.
📝

Tekstimahukas sisu

Kui sinu video vajab loetavat teksti, silte või kasutajaliidese elemente, on Wan 2.7 teksti renderdamine praegu oma klassi parim.
🎨

Täpne värvi- ja stiililine kontroll

Värvikonditsioneerimissüsteem võimaldab täpsete palettide määramist ja nende hoidmist läbi kaadrite. See on kasulik brändiga kooskõlas oleva sisu loomiseks.
🔄

Stiiliülekanne viite kaudu

Viidest videoks mudel (peagi saadaval) võimaldab olemasoleva klipi kasutamist stiilijuhisena, genereerides uut sisu, mis vastab selle visuaalsele keelele.

Lihtsamate ühe subjektiga stseenide jaoks, kus on vaja ka heli, võivad Kling 3.0 või Veo 3.1 endiselt olla paremad valikud. Thinking Mode planeerimise lisakoormus annab lisaväärtust just keerukate päringute puhul.

Mida see tähendab tööstusele

Wan 2.7 Thinking Mode viitab laiemale nihkele generatiivsete mudelite toimimises. Selle asemel, et toore jõuga mürist väljundeid välja suruda, sisaldavad tulevased mudelid tõenäoliselt selgesõnalisi planeerimisfaase genereerimise erinevate aspektide jaoks.

Me näeme seda mustrit juba teistes valdkondades. Koodigenereerimise mudelid planeerivad enne kirjutamist. Pildimudelid kasutavad paigutuse konditsioneerimist. Nüüd õpivad ka videomudelid mõtlema enne loomist.

💡
Mudelite kiire avaldamistempo 2026. aastal muudab ühele tarnijale pühendumise riskantseks. Konveieripõhised lähenemised, mis suudavad genereerimise taustasüsteemi vahetada paremate mudelite ilmumisel, kaitsevad sinu töövooge tarnijalukust.

Konkurentsisurve on reaalne. Sora lahkumise, Google'i hindade alandamise ning Hiina mudelite nagu Wan 2.7 ja Kling 3.0 kvaliteedipiire nihutamisega pole loojatel kunagi olnud nii palju valikuid ega nii palju põhjust jääda paindlikuks.

Üksikasjalikuma ülevaate jaoks mudelite võrdlusest konkreetsetel testidel vaata meie Runway Gen-4.5 jõudluse analüüsi. Ja kui sind huvitab, kuidas Seedance 2.0 käivitamine kujundab CapCut ökosüsteemi ümber, käsitlesime seda teemat üksikasjalikult eelmisel kuul.

Alexis
AlexisAI EngineerAI Author

Lausanne’ist pärit tehisintellekti insener, kes ühendab uurimistöö põhjalikkuse praktilise innovatsiooniga. Jagab oma aega mudeliarhitektuuride ja Alpide tippude vahel.

View profile →

Kas teile meeldis loetu?

Muutke oma ideed minutitega piiramatult pikkadeks tehisintellekti videoteks.

Seotud artiklid

Jätkake avastamist nende seotud postitustega

Kas artikkel meeldis?

Avastage rohkem teadmisi ja püsige kursis meie uusima sisuga.