Alibaba Wan 2.7: hvordan Thinking Mode forandrer AI-videogenerering
Alibaba har nettopp sluppet Wan 2.7 med en ny Thinking Mode som planlegger komposisjoner før video genereres. Vi går gjennom hvordan det fungerer og hva det betyr for skapere.

Hva er Thinking Mode?
De fleste videogenereringsmodeller jobber i et enkelt gjennomkjøring. Du skriver en prompt, modellen begynner å omforme støy til piksler, og du får det som kommer ut. Dette fungerer greit for enkle scener, men bryter sammen når prompts involverer flere motiver, spesifikke romlige relasjoner eller komplekse handlinger.
Wan 2.7 legger til et mellomsteg. Før noen piksler genereres, gjør modellen følgende:
- Analyserer prompten og bryter den ned i semantiske komponenter (motiver, handlinger, miljø, belysning)
- Planlegger komposisjonen ved å bestemme hvor elementer skal plasseres og hvordan de skal samhandle
- Genererer resultatet med denne planen som strukturell veileder
Dette minner om hvordan "chain-of-thought"-resonnering forbedret store språkmodeller. Ved å tvinge modellen til å tenke før den handler, forbedres outputkvaliteten betydelig, spesielt for komplekse prompts.
Den komplette Wan 2.7-suiten
Wan 2.7 er ikke bare en enkelt modell. Den leveres som en suite av fire modeller som dekker ulike genereringsarbeidsflyter:
| Modell | Input | Output | Best For |
|---|---|---|---|
| Text-to-Video | Tekstprompt | Videoklipp | Skape fra bunnen av |
| Image-to-Video | Bilde + prompt | Videoklipp | Animere stillbilder, concept art |
| Reference-to-Video | Referansevideo + prompt | Ny video | Stiloverføring, gjenskaping |
| Video Editing | Video + redigeringsinstruksjoner | Redigert video | Etterproduksjon, korreksjoner |
Text-to-video-modellen er allerede tilgjengelig på Together AI siden 3. april. De resterende tre modellene rulles ut i løpet av de kommende ukene.
Under panseret: arkitekturdetaljer
Selv om Alibaba ennå ikke har publisert en fullstendig artikkel, har flere tekniske detaljer kommet frem fra API-dokumentasjonen og tidlige benchmarks.
| Hva Vi Vet | Hva som Skiller den Ut |
|---|---|
| Bygget på Wan (Wanxiang) arkitekturlinjen | Første produksjonsmodell med eksplisitt komposisjonell planlegging |
| Thinking Mode legger til et planleggingssteg før diffusjon | Scener med flere elementer håndterer 5+ motiver rent |
| Hyperrealistisk karakterkonsistens mellom bilder | Tekstgjengivelse i generert video er lesbar, ikke forvrengt |
| Presis fargekontroll via promptkondisjonering | Fargenøyaktighet forblir konsistent ved belysningsendringer |
| Overlegen langtekstgjengivelse (tekst i videoer) | Komplekse kamerabevegelser opprettholder romlig sammenheng |
Langtekstgjengivelsen er spesielt bemerkelsesverdig. Tidligere modeller slet med å generere lesbar tekst i videobilder. Wan 2.7 håndterer skilt, etiketter og til og med korte avsnitt med overraskende nøyaktighet. For skapere som trenger tekstoverlegg bakt inn i det genererte materialet, er dette et betydelig steg fremover.
Sammenligning med konkurrentene
AI-videolandskapet endret seg betraktelig denne uken, med Wan 2.7 som ankom akkurat da OpenAI bekreftet nedleggelsen av Sora og Google kuttet prisene på Veo 3.1.
| Modell | Pris | Lyd | Maks Lengde | Karakterkonsistens | Thinking/Planlegging |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Nei | ~10s | Sterk | Ja |
| Veo 3.1 Lite | $0.05/s | Ja | ~8s | God | Nei |
| Veo 3.1 Fast | $0.12/s | Ja | ~8s | Sterk | Nei |
| Kling 3.0 | ~$0.08-0.17/s | Ja | ~10s | Sterk | Nei |
| Seedance 2.0 | Inkludert | Ja | 15s | God | Nei |
| Runway Gen-4.5 | ~$0.15/s | Nei | ~10s | Sterk | Nei |
Prisen på $0.10 per sekund plasserer Wan 2.7 i det konkurransedyktige mellomsjiktet. Det koster dobbelt så mye som Googles budsjett Lite-alternativ, er konkurransedyktig med Kling 3.0 (som varierer etter plattform) og er betydelig rimeligere enn Runway.
Når bør du bruke Wan 2.7
Basert på tidlige tester og modellens styrker, her er scenariene der Wan 2.7 gir mest mening:
Komplekse scener med flere motiver
Teksttungt innhold
Presis farge- og stilkontroll
Stiloverføring via referanse
For enklere scener med et enkelt motiv der du også trenger lyd, kan modeller som Kling 3.0 eller Veo 3.1 fortsatt være det bedre valget. Planleggingsoverheaden i Thinking Mode tilfører spesifikt verdi når prompts er komplekse.
Hva dette betyr for bransjen
Wan 2.7s Thinking Mode peker mot et bredere skifte i hvordan generative modeller vil fungere. I stedet for å tvinge resultater ut av støy, vil fremtidige modeller sannsynligvis inkorporere eksplisitte planleggingsfaser for ulike aspekter av genereringen.
Vi ser allerede dette mønsteret i andre domener. Kodegenereringsmodeller planlegger før de skriver. Bildemodeller bruker layoutkondisjonering. Nå lærer videomodeller å tenke før de skaper.
Konkurransepresset er reelt. Med Sora som legges ned, Google som kutter priser og kinesiske modeller som Wan 2.7 og Kling 3.0 som skyver kvalitetsgrensene, har skapere aldri hatt flere alternativer, eller mer grunn til å forbli fleksible.
For en dypere titt på hvordan disse modellene presterer på spesifikke benchmarks, sjekk ut vår analyse av Runway Gen-4.5-ytelse. Og hvis du er interessert i hvordan Seedance 2.0-utrullingen omformer CapCut-økosystemet, dekket vi det i detalj forrige måned.

KI-ingeniør fra Lausanne som kombinerer forskningsdybde med praktisk innovasjon. Deler tiden mellom modellarkitekturer og alpine fjelltopper.
View profile →Relaterte artikler
Fortsett å utforske med disse relaterte innleggene

Alibaba HappyHorse-1.0: den mystiske modellen som toppet alle AI-videobenchmarks
En modell kalt HappyHorse-1.0 dukket opp på Artificial Analysis uten tilskrivning, klatret til førsteplass i både text-to-video og image-to-video, og viste seg å tilhøre Alibaba. Her er det vi vet om arkitekturen, teamet og hva det betyr for AI-videomarkedet.

AI-video etter Sora: 4 markedsnivåer å kjenne til i 2026
Sora stenger 26. april. AI-videomarkedet har konsolidert seg til fire nivåer. En praktisk guide for å velge riktig Sora-alternativ for dine behov.

Google Veo 3.1 blir gratis: 10 AI-videoer per måned for alle Google-kontoer
Google har åpnet Veo 3.1 for alle personlige kontoer med 10 gratis videogenereringer per måned. Her er hva du får, hva begrensningene er, og hvorfor det betyr noe for AI-videoskapere.