Meta PixelSiirry pääsisältöön
AlexisAlexis· Tekoälytekijä, ihmisen tarkistama
5 min read
882 sanaa

Alibaba Wan 2.7: Miten Thinking Mode muuttaa tekoälyvideogenerointia

Alibaba julkaisi Wan 2.7:n uudella Thinking Mode -toiminnolla, joka suunnittelee sommittelut ennen videon luomista. Käymme läpi, miten se toimii ja mitä se tarkoittaa sisällöntuottajille.

Alibaba Wan 2.7: Miten Thinking Mode muuttaa tekoälyvideogenerointia

Oletko valmis luomaan omia tekoälyvideoitasi?

Liity tuhansien Bonega.ai:tä käyttävien sisällöntuottajien joukkoon

Alibaban Tongyi Lab julkaisi Wan 2.7:n 6. huhtikuuta 2026. Se tuo mukanaan "Thinking Mode" -toiminnon, joka muuttaa perustavanlaatuisesti tapaa, jolla tekoälyvideomallit käsittelevät kehotteita. Sen sijaan, että malli generoisi ruutuja suoraan tekstistä, se rakentaa ensin sisäisen suunnitelman kohtauksesta ja toteuttaa sen sitten. Tulokset puhuvat puolestaan: vähemmän artefakteja, parempi johdonmukaisuus ja selvästi harkitummat sommittelut.

Mikä on Thinking Mode?

Useimmat videogenerointimallit toimivat yhdellä läpikäynnillä. Kirjoitat kehotteen, malli alkaa muuntaa kohinaa pikseleiksi ja saat sen, mitä syntyy. Tämä toimii kohtuullisen hyvin yksinkertaisissa kohtauksissa, mutta kaatuu, kun kehotteet sisältävät useita kohteita, tarkkoja tilasuhteita tai monimutkaisia toimintoja.

Wan 2.7 lisää välivaiheen. Ennen kuin yhtään pikseliä generoidaan, malli:

  1. Jäsentää kehotteen semanttisiin osiin (kohteet, toiminnot, ympäristö, valaistus)
  2. Suunnittelee sommittelun määrittämällä, mihin elementtien tulisi sijoittua ja miten niiden tulisi olla vuorovaikutuksessa
  3. Generoi tulosteen käyttäen tätä suunnitelmaa rakenteellisena ohjeena
💡
Ajattele sitä kuin eroa improvisoinnin ja sommitteluluonnoksen välillä maalauksessa. Luonnos ei näy lopputyössä, mutta se ohjaa jokaista sivellinvetoa.

Tämä on samanlaista kuin "ajatusketju"-päättely (chain-of-thought), joka paransi suuria kielimalleja. Pakottamalla mallin ajattelemaan ennen toimintaa tuloslaatu paranee merkittävästi, erityisesti monimutkaisten kehotteiden kohdalla.

Koko Wan 2.7 -kokonaisuus

Wan 2.7 ei ole vain yksi malli. Se julkaistaan neljän mallin kokonaisuutena, joka kattaa eri generointityönkulut:

4
Mallisto
$0.10/s
API-hinta
6. huhtik.
Julkaisupäivä
MalliSyöteTulosteParhaimmillaan
Tekstistä videoksiTekstikehoteVideoklippiLuominen tyhjästä
Kuvasta videoksiKuva + kehoteVideoklippiStillkuvien animointi, konseptitaide
Referenssistä videoksiReferenssivideo + kehoteUusi videoTyylisiirto, uudelleenluonti
Videon muokkausVideo + muokkausohjeetMuokattu videoJälkituotanto, korjaukset

Tekstistä videoksi -malli on jo käytettävissä Together AI:ssa 3. huhtikuuta alkaen. Loput kolme mallia tulevat saataville tulevien viikkojen aikana.

Konepellin alla: arkkitehtuurin yksityiskohdat

Vaikka Alibaba ei ole vielä julkaissut täyttä tutkimuspaperia, useita teknisiä yksityiskohtia on tullut esiin API-dokumentaatiosta ja varhaisista testituloksista.

Mitä tiedämmeMikä erottaa sen muista
Rakennettu Wan (Wanxiang) -arkkitehtuurilinjan päälleEnsimmäinen tuotantomalli, jossa on eksplisiittinen sommittelun suunnittelu
Thinking Mode lisää suunnitteluvaiheen ennen diffuusiotaMonielementtiset kohtaukset käsittelevät 5+ kohdetta siististi
Hyperrealistinen hahmojen johdonmukaisuus ruutujen välilläGeneroituun videoon upotettu teksti on luettavaa, ei vääristynyttä
Tarkka värien hallinta kehote-ehdollistamisellaVäritarkkuus pysyy johdonmukaisena valaistusmuutoksissa
Erinomainen pitkän tekstin renderointi (teksti videoissa)Monimutkaiset kameraliikkeet säilyttävät tilallisen koherenssin

Pitkän tekstin renderointikyky on erityisen huomionarvoinen. Aikaisemmat mallit kamppailivat luettavan tekstin tuottamisessa videokehysten sisällä. Wan 2.7 käsittelee kylttejä, tunnisteita ja jopa lyhyitä kappaleita yllättävällä tarkkuudella. Sisällöntuottajille, jotka tarvitsevat generoituun materiaaliin upotettuja tekstipeittokuvia, tämä on merkittävä edistysaskel.

Vertailu muihin malleihin

Tekoälyvideokenttä muuttui tällä viikolla merkittävästi: Wan 2.7 saapui juuri kun OpenAI vahvisti Soran sulkemisen ja Google laski Veo 3.1:n hintoja.

MalliHintaÄäniMaks. pituusHahmojohdonmukaisuusAjattelu/Suunnittelu
Wan 2.7$0.10/sEi~10sVahvaKyllä
Veo 3.1 Lite$0.05/sKyllä~8sHyväEi
Veo 3.1 Fast$0.12/sKyllä~8sVahvaEi
Kling 3.0~$0.08-0.17/sKyllä~10sVahvaEi
Seedance 2.0SisältyyKyllä15sHyväEi
Runway Gen-4.5~$0.15/sEi~10sVahvaEi
⚠️
Wan 2.7 ei sisällä natiivia äänigenerointia. Synkronoitua ääntä vaativiin projekteihin tarvitset erillisen äänipipelinen tai mallin, kuten Kling 3.0 tai Veo 3.1, joka generoi äänen natiivisti.

Hinta $0.10 sekunnilta asettaa Wan 2.7:n kilpailukykyiseen keskisarjaan. Se on kaksinkertainen Googlen edulliseen Lite-vaihtoehtoon nähden, kilpailukykyinen Kling 3.0:n kanssa (jonka hinta vaihtelee alustan mukaan) ja huomattavasti edullisempi kuin Runway.

Milloin käyttää Wan 2.7:ää

Varhaisten testien ja mallin vahvuuksien perusteella nämä ovat tilanteet, joissa Wan 2.7 on järkevin valinta:

🎬

Monimutkaiset monen kohteen kohtaukset

Thinking Mode loistaa, kun kehote sisältää useita hahmoja tai esineitä vuorovaikutuksessa. Suunnitteluvaihe ehkäisee tilallisen sekaannuksen, joka vaivaa muita malleja.
📝

Tekstipainotteinen sisältö

Jos videossasi tarvitaan luettavaa tekstiä, kylttejä tai käyttöliittymäelementtejä, Wan 2.7:n tekstinrenderointi on tällä hetkellä luokkansa paras.
🎨

Tarkka väri- ja tyylihallinta

Väri-ehdollistusjärjestelmä mahdollistaa tarkkojen palettien määrittämisen ja niiden ylläpitämisen ruutujen välillä. Tämä on hyödyllistä brändin mukaisen sisällön tuotannossa.
🔄

Tyylisiirto referenssin kautta

Referenssistä videoksi -malli (tulossa pian) mahdollistaa olemassa olevan klipin syöttämisen tyylioppaana, jolloin syntyy uutta sisältöä, joka vastaa sen visuaalista kieltä.

Yksinkertaisempiin yhden kohteen kohtauksiin, joissa tarvitaan myös ääntä, Kling 3.0 tai Veo 3.1 voivat silti olla parempia valintoja. Thinking Moden suunnittelun lisäkuorma tuottaa lisäarvoa nimenomaan monimutkaisten kehotteiden kohdalla.

Mitä tämä tarkoittaa alalle

Wan 2.7:n Thinking Mode viittaa laajempaan muutokseen generatiivisten mallien toiminnassa. Sen sijaan, että tulosteet pakotettaisiin esiin kohinasta raa'alla voimalla, tulevat mallit sisältävät todennäköisesti eksplisiittisiä suunnitteluvaiheita generoinnin eri osa-alueille.

Näemme tämän kaavan jo muilla alueilla. Koodigenerointimallit suunnittelevat ennen kirjoittamista. Kuvamallit käyttävät asettelun ehdollistamista. Nyt myös videomallit oppivat ajattelemaan ennen luomista.

💡
Mallien nopea julkaisutahti vuonna 2026 tekee yhteen toimittajaan sitoutumisesta riskialtista. Pipeline-pohjaiset lähestymistavat, jotka voivat vaihtaa generointipalvelua parempien mallien ilmestyessä, suojaavat työnkulkuasi toimittajariippuvuudelta.

Kilpailupaine on todellinen. Soran poistumisen, Googlen hinnanalennusten sekä kiinalaisten mallien kuten Wan 2.7:n ja Kling 3.0:n laaturajoja työntäessä sisällöntuottajilla ei ole koskaan ollut näin paljon vaihtoehtoja, eikä näin paljon syytä pysyä joustavina.

Tarkemman vertailun yksittäisistä testituloksista löydät Runway Gen-4.5 -suorituskykyanalyysistämme. Ja jos kiinnostaa, miten Seedance 2.0:n julkaisu muovaa CapCut-ekosysteemiä, käsittelimme aihetta yksityiskohtaisesti viime kuussa.

Alexis
AlexisAI EngineerAI Author

Lausannesta kotoisin oleva tekoälyinsinööri, joka yhdistää tutkimuksen syvyyden käytännön innovointiin. Jakaa aikansa malliarkkitehtuurien ja alppihuippujen välillä.

View profile →

Piditkö lukemastasi?

Muunna ideasi rajattoman pituisiksi tekoälyvideoiksi minuuteissa.

Aiheeseen liittyvät artikkelit

Jatka tutustumista näihin aiheeseen liittyviin julkaisuihin

Piditkö tästä artikkelista?

Löydä lisää oivalluksia ja pysy ajan tasalla uusimmasta sisällöstämme.