Alibaba Wan 2.7: Miten Thinking Mode muuttaa tekoälyvideogenerointia
Alibaba julkaisi Wan 2.7:n uudella Thinking Mode -toiminnolla, joka suunnittelee sommittelut ennen videon luomista. Käymme läpi, miten se toimii ja mitä se tarkoittaa sisällöntuottajille.

Oletko valmis luomaan omia tekoälyvideoitasi?
Liity tuhansien Bonega.ai:tä käyttävien sisällöntuottajien joukkoon
Mikä on Thinking Mode?
Useimmat videogenerointimallit toimivat yhdellä läpikäynnillä. Kirjoitat kehotteen, malli alkaa muuntaa kohinaa pikseleiksi ja saat sen, mitä syntyy. Tämä toimii kohtuullisen hyvin yksinkertaisissa kohtauksissa, mutta kaatuu, kun kehotteet sisältävät useita kohteita, tarkkoja tilasuhteita tai monimutkaisia toimintoja.
Wan 2.7 lisää välivaiheen. Ennen kuin yhtään pikseliä generoidaan, malli:
- Jäsentää kehotteen semanttisiin osiin (kohteet, toiminnot, ympäristö, valaistus)
- Suunnittelee sommittelun määrittämällä, mihin elementtien tulisi sijoittua ja miten niiden tulisi olla vuorovaikutuksessa
- Generoi tulosteen käyttäen tätä suunnitelmaa rakenteellisena ohjeena
Tämä on samanlaista kuin "ajatusketju"-päättely (chain-of-thought), joka paransi suuria kielimalleja. Pakottamalla mallin ajattelemaan ennen toimintaa tuloslaatu paranee merkittävästi, erityisesti monimutkaisten kehotteiden kohdalla.
Koko Wan 2.7 -kokonaisuus
Wan 2.7 ei ole vain yksi malli. Se julkaistaan neljän mallin kokonaisuutena, joka kattaa eri generointityönkulut:
| Malli | Syöte | Tuloste | Parhaimmillaan |
|---|---|---|---|
| Tekstistä videoksi | Tekstikehote | Videoklippi | Luominen tyhjästä |
| Kuvasta videoksi | Kuva + kehote | Videoklippi | Stillkuvien animointi, konseptitaide |
| Referenssistä videoksi | Referenssivideo + kehote | Uusi video | Tyylisiirto, uudelleenluonti |
| Videon muokkaus | Video + muokkausohjeet | Muokattu video | Jälkituotanto, korjaukset |
Tekstistä videoksi -malli on jo käytettävissä Together AI:ssa 3. huhtikuuta alkaen. Loput kolme mallia tulevat saataville tulevien viikkojen aikana.
Konepellin alla: arkkitehtuurin yksityiskohdat
Vaikka Alibaba ei ole vielä julkaissut täyttä tutkimuspaperia, useita teknisiä yksityiskohtia on tullut esiin API-dokumentaatiosta ja varhaisista testituloksista.
| Mitä tiedämme | Mikä erottaa sen muista |
|---|---|
| Rakennettu Wan (Wanxiang) -arkkitehtuurilinjan päälle | Ensimmäinen tuotantomalli, jossa on eksplisiittinen sommittelun suunnittelu |
| Thinking Mode lisää suunnitteluvaiheen ennen diffuusiota | Monielementtiset kohtaukset käsittelevät 5+ kohdetta siististi |
| Hyperrealistinen hahmojen johdonmukaisuus ruutujen välillä | Generoituun videoon upotettu teksti on luettavaa, ei vääristynyttä |
| Tarkka värien hallinta kehote-ehdollistamisella | Väritarkkuus pysyy johdonmukaisena valaistusmuutoksissa |
| Erinomainen pitkän tekstin renderointi (teksti videoissa) | Monimutkaiset kameraliikkeet säilyttävät tilallisen koherenssin |
Pitkän tekstin renderointikyky on erityisen huomionarvoinen. Aikaisemmat mallit kamppailivat luettavan tekstin tuottamisessa videokehysten sisällä. Wan 2.7 käsittelee kylttejä, tunnisteita ja jopa lyhyitä kappaleita yllättävällä tarkkuudella. Sisällöntuottajille, jotka tarvitsevat generoituun materiaaliin upotettuja tekstipeittokuvia, tämä on merkittävä edistysaskel.
Vertailu muihin malleihin
Tekoälyvideokenttä muuttui tällä viikolla merkittävästi: Wan 2.7 saapui juuri kun OpenAI vahvisti Soran sulkemisen ja Google laski Veo 3.1:n hintoja.
| Malli | Hinta | Ääni | Maks. pituus | Hahmojohdonmukaisuus | Ajattelu/Suunnittelu |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Ei | ~10s | Vahva | Kyllä |
| Veo 3.1 Lite | $0.05/s | Kyllä | ~8s | Hyvä | Ei |
| Veo 3.1 Fast | $0.12/s | Kyllä | ~8s | Vahva | Ei |
| Kling 3.0 | ~$0.08-0.17/s | Kyllä | ~10s | Vahva | Ei |
| Seedance 2.0 | Sisältyy | Kyllä | 15s | Hyvä | Ei |
| Runway Gen-4.5 | ~$0.15/s | Ei | ~10s | Vahva | Ei |
Hinta $0.10 sekunnilta asettaa Wan 2.7:n kilpailukykyiseen keskisarjaan. Se on kaksinkertainen Googlen edulliseen Lite-vaihtoehtoon nähden, kilpailukykyinen Kling 3.0:n kanssa (jonka hinta vaihtelee alustan mukaan) ja huomattavasti edullisempi kuin Runway.
Milloin käyttää Wan 2.7:ää
Varhaisten testien ja mallin vahvuuksien perusteella nämä ovat tilanteet, joissa Wan 2.7 on järkevin valinta:
Monimutkaiset monen kohteen kohtaukset
Tekstipainotteinen sisältö
Tarkka väri- ja tyylihallinta
Tyylisiirto referenssin kautta
Yksinkertaisempiin yhden kohteen kohtauksiin, joissa tarvitaan myös ääntä, Kling 3.0 tai Veo 3.1 voivat silti olla parempia valintoja. Thinking Moden suunnittelun lisäkuorma tuottaa lisäarvoa nimenomaan monimutkaisten kehotteiden kohdalla.
Mitä tämä tarkoittaa alalle
Wan 2.7:n Thinking Mode viittaa laajempaan muutokseen generatiivisten mallien toiminnassa. Sen sijaan, että tulosteet pakotettaisiin esiin kohinasta raa'alla voimalla, tulevat mallit sisältävät todennäköisesti eksplisiittisiä suunnitteluvaiheita generoinnin eri osa-alueille.
Näemme tämän kaavan jo muilla alueilla. Koodigenerointimallit suunnittelevat ennen kirjoittamista. Kuvamallit käyttävät asettelun ehdollistamista. Nyt myös videomallit oppivat ajattelemaan ennen luomista.
Kilpailupaine on todellinen. Soran poistumisen, Googlen hinnanalennusten sekä kiinalaisten mallien kuten Wan 2.7:n ja Kling 3.0:n laaturajoja työntäessä sisällöntuottajilla ei ole koskaan ollut näin paljon vaihtoehtoja, eikä näin paljon syytä pysyä joustavina.
Tarkemman vertailun yksittäisistä testituloksista löydät Runway Gen-4.5 -suorituskykyanalyysistämme. Ja jos kiinnostaa, miten Seedance 2.0:n julkaisu muovaa CapCut-ekosysteemiä, käsittelimme aihetta yksityiskohtaisesti viime kuussa.

Lausannesta kotoisin oleva tekoälyinsinööri, joka yhdistää tutkimuksen syvyyden käytännön innovointiin. Jakaa aikansa malliarkkitehtuurien ja alppihuippujen välillä.
View profile →Aiheeseen liittyvät artikkelit
Jatka tutustumista näihin aiheeseen liittyviin julkaisuihin

Alibaba HappyHorse-1.0: Mysteerimalli, joka nousi jokaisen AI-videovertailun kärkeen
HappyHorse-1.0-niminen malli ilmestyi Artificial Analysis -alustalle ilman tekijätietoja, nousi ykköseksi sekä text-to-video- että image-to-video-kategorioissa ja osoittautui Alibaban malliksi. Tässä on mitä tiedämme arkkitehtuurista, tiimistä ja vaikutuksista AI-videomarkkinoille.

AI-video Soran jälkeen: 4 markkinatasoa vuonna 2026
Sora sulkeutuu 26. huhtikuuta. AI-videomarkkinat ovat konsolidoituneet neljään tasoon. Käytännöllinen opas oikean Sora-vaihtoehdon valintaan.

Google Veo 3.1 tulee ilmaiseksi: 10 AI-videota kuukaudessa jokaiselle Google-tilille
Google avasi Veo 3.1:n kaikille henkilökohtaisille tileille 10 ilmaisella videogeneroinnilla kuukaudessa. Tässä on mitä saat, mitkä ovat rajoitukset ja miksi tällä on merkitystä AI-videon tekijöille.