Alibaba Wan 2.7: hur Thinking Mode förändrar AI-videogenerering
Alibaba har precis släppt Wan 2.7 med ett nytt Thinking Mode som planerar kompositioner innan video genereras. Vi går igenom hur det fungerar och vad det innebär för skapare.

Vad är Thinking Mode?
De flesta videogenereringsmodeller arbetar i ett enda pass. Du skriver en prompt, modellen börjar omvandla brus till pixlar, och du får det som kommer ut. Det fungerar hyggligt för enkla scener, men faller isär när prompts involverar flera motiv, specifika rumsliga relationer eller komplexa handlingar.
Wan 2.7 lägger till ett mellansteg. Innan några pixlar genereras gör modellen följande:
- Analyserar prompten och bryter ner den i semantiska komponenter (motiv, handlingar, miljö, belysning)
- Planerar kompositionen genom att bestämma var element ska placeras och hur de ska interagera
- Genererar resultatet med denna plan som strukturell guide
Detta påminner om hur "chain-of-thought"-resonemang förbättrade stora språkmodeller. Genom att tvinga modellen att tänka innan den agerar förbättras outputkvaliteten avsevärt, särskilt för komplexa prompts.
Den fullständiga Wan 2.7-sviten
Wan 2.7 är inte bara en enda modell. Den levereras som en svit av fyra modeller som täcker olika genereringsarbetsflöden:
| Modell | Input | Output | Bäst För |
|---|---|---|---|
| Text-to-Video | Textprompt | Videoklipp | Skapa från grunden |
| Image-to-Video | Bild + prompt | Videoklipp | Animera stillbilder, concept art |
| Reference-to-Video | Referensvideo + prompt | Ny video | Stilöverföring, återskapande |
| Video Editing | Video + redigeringsinstruktioner | Redigerad video | Efterproduktion, korrigeringar |
Text-to-video-modellen är redan tillgänglig på Together AI sedan den 3 april. De återstående tre modellerna rullas ut under de kommande veckorna.
Under huven: arkitekturdetaljer
Även om Alibaba ännu inte har publicerat en fullständig artikel har flera tekniska detaljer framkommit från API-dokumentationen och tidiga benchmarks.
| Vad Vi Vet | Vad som Skiljer den |
|---|---|
| Byggd på Wan (Wanxiang) arkitekturlinjen | Första produktionsmodellen med explicit kompositionell planering |
| Thinking Mode lägger till ett planeringssteg före diffusion | Scener med flera element hanterar 5+ motiv rent |
| Hyperrealistisk karaktärskonsistens mellan bildrutor | Textåtergivning i genererad video är läsbar, inte förvrängd |
| Exakt färgkontroll via promptkonditionering | Färgnoggrannhet förblir konsekvent vid belysningsändringar |
| Överlägsen långtextåtergivning (text i videor) | Komplexa kamerarörelser bibehåller rumslig sammanhang |
Långtextåtergivningen är särskilt anmärkningsvärd. Tidigare modeller hade svårt att generera läsbar text i videobildrutor. Wan 2.7 hanterar skyltar, etiketter och till och med korta stycken med överraskande precision. För skapare som behöver textöverlägg inbäddade i genererat material är detta ett betydande steg framåt.
Jämförelse med konkurrenterna
AI-videolandskapet har förändrats avsevärt denna vecka, med Wan 2.7 som anländer precis när OpenAI bekräftade nedläggningen av Sora och Google sänkte priserna på Veo 3.1.
| Modell | Pris | Ljud | Max Längd | Karaktärskonsistens | Thinking/Planering |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Nej | ~10s | Stark | Ja |
| Veo 3.1 Lite | $0.05/s | Ja | ~8s | Bra | Nej |
| Veo 3.1 Fast | $0.12/s | Ja | ~8s | Stark | Nej |
| Kling 3.0 | ~$0.08-0.17/s | Ja | ~10s | Stark | Nej |
| Seedance 2.0 | Inkluderat | Ja | 15s | Bra | Nej |
| Runway Gen-4.5 | ~$0.15/s | Nej | ~10s | Stark | Nej |
Priset på $0.10 per sekund placerar Wan 2.7 i det konkurrenskraftiga mellansegmentet. Det kostar dubbelt så mycket som Googles budget Lite-alternativ, är konkurrenskraftigt med Kling 3.0 (som varierar beroende på plattform) och är avsevärt billigare än Runway.
När du bör använda Wan 2.7
Baserat på tidiga tester och modellens styrkor, här är scenarierna där Wan 2.7 ger mest mening:
Komplexa scener med flera motiv
Textintensivt innehåll
Exakt färg- och stilkontroll
Stilöverföring via referens
För enklare scener med ett enda motiv där du också behöver ljud kan modeller som Kling 3.0 eller Veo 3.1 fortfarande vara det bättre valet. Planeringsoverheaden i Thinking Mode tillför specifikt värde när prompts är komplexa.
Vad detta innebär för branschen
Wan 2.7:s Thinking Mode pekar mot ett bredare skifte i hur generativa modeller kommer att fungera. Istället för att tvinga fram resultat ur brus kommer framtida modeller sannolikt att inkorporera explicita planeringsfaser för olika aspekter av genereringen.
Vi ser redan detta mönster i andra domäner. Kodgenereringsmodeller planerar innan de skriver. Bildmodeller använder layoutkonditionering. Nu lär sig videomodeller att tänka innan de skapar.
Konkurrenstrycket är verkligt. Med Sora som stänger ner, Google som sänker priserna och kinesiska modeller som Wan 2.7 och Kling 3.0 som pressar kvalitetsgränserna har skapare aldrig haft fler alternativ, eller mer anledning att förbli flexibla.
För en djupare titt på hur dessa modeller presterar på specifika benchmarks, kolla in vår analys av Runway Gen-4.5-prestanda. Och om du är intresserad av hur Seedance 2.0-utrullningen omformar CapCut-ekosystemet täckte vi det i detalj förra månaden.

AI-ingenjör från Lausanne som kombinerar forskningens djup med praktisk innovation. Delar sin tid mellan modellarkitekturer och alpina toppar.
View profile →Relaterade artiklar
Fortsätt utforska med dessa relaterade inlägg

Alibaba HappyHorse-1.0: den mystiska modellen som toppade alla AI-videobenchmarks
En modell kallad HappyHorse-1.0 dök upp på Artificial Analysis utan tillskrivning, klättrade till förstaplats i både text-to-video och image-to-video, och visade sig tillhöra Alibaba. Här är vad vi vet om arkitekturen, teamet och vad det innebär för AI-videomarknaden.

AI-video efter Sora: 4 marknadsnivåer att känna till 2026
Sora stängs ner den 26 april. AI-videomarknaden har konsoliderats till fyra nivåer. En praktisk guide för att välja rätt Sora-alternativ för dina behov.

Google Veo 3.1 blir gratis: 10 AI-videor per månad för alla Google-konton
Google har öppnat Veo 3.1 för alla personliga konton med 10 gratis videogenereringar per månad. Här är vad du får, vilka begränsningarna är och varför det spelar roll för AI-videoskapare.