Alibaba Wan 2.7: hvordan Thinking Mode forandrer AI-videogenerering
Alibaba har netop udgivet Wan 2.7 med en ny Thinking Mode, der planlægger kompositioner, før videoen genereres. Vi gennemgår, hvordan det fungerer, og hvad det betyder for skabere.

Hvad er Thinking Mode?
De fleste videogenereringsmodeller arbejder i et enkelt gennemløb. Du skriver en prompt, modellen begynder at omdanne støj til pixels, og du får, hvad der kommer ud. Det fungerer rimelig godt til simple scener, men bryder sammen, når prompts involverer flere emner, specifikke rumlige relationer eller komplekse handlinger.
Wan 2.7 tilføjer et mellemtrin. Før nogen pixels genereres, gør modellen følgende:
- Analyserer prompten og opdeler den i semantiske komponenter (emner, handlinger, miljø, belysning)
- Planlægger kompositionen ved at bestemme, hvor elementer skal placeres, og hvordan de skal interagere
- Genererer outputtet med denne plan som strukturel guide
Det minder om, hvordan "chain-of-thought"-ræsonnement forbedrede store sprogmodeller. Ved at tvinge modellen til at tænke, før den handler, forbedres outputkvaliteten markant, især for komplekse prompts.
Den fulde Wan 2.7-suite
Wan 2.7 er ikke bare en enkelt model. Den leveres som en suite af fire modeller, der dækker forskellige genereringsworkflows:
| Model | Input | Output | Bedst Til |
|---|---|---|---|
| Text-to-Video | Tekstprompt | Videoklip | Skabe fra bunden |
| Image-to-Video | Billede + prompt | Videoklip | Animere stillbilleder, concept art |
| Reference-to-Video | Referencevideo + prompt | Ny video | Stiloverførsel, genskabelse |
| Video Editing | Video + redigeringsinstruktioner | Redigeret video | Efterproduktion, korrektioner |
Text-to-video-modellen er allerede tilgængelig på Together AI siden 3. april. De resterende tre modeller udrulles i de kommende uger.
Under motorhjelmen: arkitekturdetaljer
Selvom Alibaba endnu ikke har publiceret en fuld artikel, er flere tekniske detaljer dukket op fra API-dokumentationen og tidlige benchmarks.
| Hvad Vi Ved | Hvad der Adskiller den |
|---|---|
| Bygget på Wan (Wanxiang) arkitekturlinjen | Første produktionsmodel med eksplicit kompositionel planlægning |
| Thinking Mode tilføjer et planlægningstrin før diffusion | Multi-element-scener håndterer 5+ emner rent |
| Hyperrealistisk karakterkonsistens på tværs af frames | Tekstgengivelse i genereret video er læsbar, ikke forvrænget |
| Præcis farvekontrol via prompt-konditionering | Farvenøjagtighed forbliver konsistent ved belysningsændringer |
| Overlegen langtekstgengivelse (tekst i videoer) | Komplekse kamerabevægelser opretholder rumlig sammenhæng |
Langtekstgengivelsen er særligt bemærkelsesværdig. Tidligere modeller havde svært ved at generere læsbar tekst i videoframes. Wan 2.7 håndterer skilte, etiketter og endda korte afsnit med overraskende nøjagtighed. For skabere, der har brug for tekstoverlejringer bagt ind i det genererede materiale, er dette et væsentligt fremskridt.
Sammenligning med konkurrenterne
AI-videolandskabet har ændret sig betragteligt denne uge, med Wan 2.7s ankomst netop som OpenAI bekræftede lukningen af Sora, og Google sænkede priserne på Veo 3.1.
| Model | Pris | Lyd | Max Længde | Karakterkonsistens | Thinking/Planlægning |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Nej | ~10s | Stærk | Ja |
| Veo 3.1 Lite | $0.05/s | Ja | ~8s | God | Nej |
| Veo 3.1 Fast | $0.12/s | Ja | ~8s | Stærk | Nej |
| Kling 3.0 | ~$0.08-0.17/s | Ja | ~10s | Stærk | Nej |
| Seedance 2.0 | Inkluderet | Ja | 15s | God | Nej |
| Runway Gen-4.5 | ~$0.15/s | Nej | ~10s | Stærk | Nej |
Prisen på $0.10 per sekund placerer Wan 2.7 i den konkurrencedygtige mellemklasse. Det er dobbelt så dyrt som Googles budget Lite-mulighed, konkurrencedygtigt med Kling 3.0 (som varierer efter platform) og markant billigere end Runway.
Hvornår bør du bruge Wan 2.7
Baseret på tidlige tests og modellens styrker er her de scenarier, hvor Wan 2.7 giver mest mening:
Komplekse scener med flere emner
Teksttungt indhold
Præcis farve- og stilkontrol
Stiloverførsel via reference
For enklere scener med et enkelt emne, hvor du også har brug for lyd, kan modeller som Kling 3.0 eller Veo 3.1 stadig være det bedre valg. Planlægningsoverheadet i Thinking Mode tilføjer specifikt værdi, når prompts er komplekse.
Hvad det betyder for branchen
Wan 2.7s Thinking Mode peger mod et bredere skift i, hvordan generative modeller vil fungere. I stedet for at tvinge outputs ud af støj vil fremtidige modeller sandsynligvis inkorporere eksplicitte planlægningsfaser for forskellige aspekter af genereringen.
Vi ser allerede dette mønster i andre domæner. Kodegenereringsmodeller planlægger, før de skriver. Billedmodeller bruger layoutkonditionering. Nu lærer videomodeller at tænke, før de skaber.
Konkurrencepresset er reelt. Med Sora, der lukker ned, Google, der sænker priserne, og kinesiske modeller som Wan 2.7 og Kling 3.0, der skubber kvalitetsgrænserne, har skabere aldrig haft flere muligheder eller mere grund til at forblive fleksible.
For et dybere kig på, hvordan disse modeller klarer sig på specifikke benchmarks, kan du læse vores analyse af Runway Gen-4.5 ydeevne. Og hvis du er interesseret i, hvordan Seedance 2.0-udrulningen omformer CapCut-økosystemet, dækkede vi det i detaljer sidste måned.

AI-ingeniør fra Lausanne, der kombinerer forskningsdybde med praktisk innovation. Deler sin tid mellem modelarkitekturer og alpine bjergtoppe.
View profile →Kan du lide det, du har læst?
Forvandl dine idéer til AI-videoer med ubegrænset længde på få minutter.
Relaterede artikler
Udforsk videre med disse relaterede indlæg

Alibaba HappyHorse-1.0: den mystiske model, der toppede alle AI-video-ranglister
En model kaldet HappyHorse-1.0 dukkede op hos Artificial Analysis uden nogen angivelse af ophav, klatrede til nummer 1 i både text-to-video og image-to-video, og viste sig at tilhøre Alibaba. Her er, hvad vi ved om arkitekturen, teamet, og hvad det betyder for AI-videomarkedet.

AI-video efter Sora: 4 markedsniveauer at kende i 2026
Sora lukker den 26. april. AI-videomarkedet har konsolideret sig i fire niveauer. En praktisk guide til at vælge det rigtige Sora-alternativ til dine behov.

Google Veo 3.1 bliver gratis: 10 AI-videoer om måneden for alle Google-konti
Google har åbnet Veo 3.1 for alle personlige konti med 10 gratis videogenereringer om måneden. Her er, hvad du får, hvad begrænsningerne er, og hvorfor det betyder noget for AI-videoskabere.