Meta PixelSpring til hovedindhold
AlexisAlexis· AI-forfatter, menneskegennemgået
6 min read
1021 ord

Alibaba Wan 2.7: hvordan Thinking Mode forandrer AI-videogenerering

Alibaba har netop udgivet Wan 2.7 med en ny Thinking Mode, der planlægger kompositioner, før videoen genereres. Vi gennemgår, hvordan det fungerer, og hvad det betyder for skabere.

Alibaba Wan 2.7: hvordan Thinking Mode forandrer AI-videogenerering

Klar til at skabe dine egne AI-videoer?

Slut dig til tusindvis af skabere, der bruger Bonega.ai

Alibabas Tongyi Lab udgav Wan 2.7 den 6. april 2026 med en "Thinking Mode", der grundlæggende ændrer, hvordan AI-videomodeller behandler prompts. I stedet for at generere frames direkte fra tekst bygger modellen først en intern plan for scenen og udfører den derefter. Resultaterne taler for sig selv: færre artefakter, bedre sammenhæng og mærkbart mere bevidste kompositioner.

Hvad er Thinking Mode?

De fleste videogenereringsmodeller arbejder i et enkelt gennemløb. Du skriver en prompt, modellen begynder at omdanne støj til pixels, og du får, hvad der kommer ud. Det fungerer rimelig godt til simple scener, men bryder sammen, når prompts involverer flere emner, specifikke rumlige relationer eller komplekse handlinger.

Wan 2.7 tilføjer et mellemtrin. Før nogen pixels genereres, gør modellen følgende:

  1. Analyserer prompten og opdeler den i semantiske komponenter (emner, handlinger, miljø, belysning)
  2. Planlægger kompositionen ved at bestemme, hvor elementer skal placeres, og hvordan de skal interagere
  3. Genererer outputtet med denne plan som strukturel guide
💡
Tænk på det som forskellen mellem at improvisere et maleri og først lave en kompositionsskitse. Skitsen vises ikke i det færdige værk, men den former hvert penselstrøg.

Det minder om, hvordan "chain-of-thought"-ræsonnement forbedrede store sprogmodeller. Ved at tvinge modellen til at tænke, før den handler, forbedres outputkvaliteten markant, især for komplekse prompts.

Den fulde Wan 2.7-suite

Wan 2.7 er ikke bare en enkelt model. Den leveres som en suite af fire modeller, der dækker forskellige genereringsworkflows:

4
Modelsuite
$0.10/s
API-pris
6. apr
Udgivelsesdato
ModelInputOutputBedst Til
Text-to-VideoTekstpromptVideoklipSkabe fra bunden
Image-to-VideoBillede + promptVideoklipAnimere stillbilleder, concept art
Reference-to-VideoReferencevideo + promptNy videoStiloverførsel, genskabelse
Video EditingVideo + redigeringsinstruktionerRedigeret videoEfterproduktion, korrektioner

Text-to-video-modellen er allerede tilgængelig på Together AI siden 3. april. De resterende tre modeller udrulles i de kommende uger.

Under motorhjelmen: arkitekturdetaljer

Selvom Alibaba endnu ikke har publiceret en fuld artikel, er flere tekniske detaljer dukket op fra API-dokumentationen og tidlige benchmarks.

Hvad Vi VedHvad der Adskiller den
Bygget på Wan (Wanxiang) arkitekturlinjenFørste produktionsmodel med eksplicit kompositionel planlægning
Thinking Mode tilføjer et planlægningstrin før diffusionMulti-element-scener håndterer 5+ emner rent
Hyperrealistisk karakterkonsistens på tværs af framesTekstgengivelse i genereret video er læsbar, ikke forvrænget
Præcis farvekontrol via prompt-konditioneringFarvenøjagtighed forbliver konsistent ved belysningsændringer
Overlegen langtekstgengivelse (tekst i videoer)Komplekse kamerabevægelser opretholder rumlig sammenhæng

Langtekstgengivelsen er særligt bemærkelsesværdig. Tidligere modeller havde svært ved at generere læsbar tekst i videoframes. Wan 2.7 håndterer skilte, etiketter og endda korte afsnit med overraskende nøjagtighed. For skabere, der har brug for tekstoverlejringer bagt ind i det genererede materiale, er dette et væsentligt fremskridt.

Sammenligning med konkurrenterne

AI-videolandskabet har ændret sig betragteligt denne uge, med Wan 2.7s ankomst netop som OpenAI bekræftede lukningen af Sora, og Google sænkede priserne på Veo 3.1.

ModelPrisLydMax LængdeKarakterkonsistensThinking/Planlægning
Wan 2.7$0.10/sNej~10sStærkJa
Veo 3.1 Lite$0.05/sJa~8sGodNej
Veo 3.1 Fast$0.12/sJa~8sStærkNej
Kling 3.0~$0.08-0.17/sJa~10sStærkNej
Seedance 2.0InkluderetJa15sGodNej
Runway Gen-4.5~$0.15/sNej~10sStærkNej
⚠️
Wan 2.7 inkluderer ikke native lydgenerering. For projekter, der kræver synkroniseret lyd, skal du bruge en separat lydpipeline eller en model som Kling 3.0 eller Veo 3.1, der genererer lyd nativt.

Prisen på $0.10 per sekund placerer Wan 2.7 i den konkurrencedygtige mellemklasse. Det er dobbelt så dyrt som Googles budget Lite-mulighed, konkurrencedygtigt med Kling 3.0 (som varierer efter platform) og markant billigere end Runway.

Hvornår bør du bruge Wan 2.7

Baseret på tidlige tests og modellens styrker er her de scenarier, hvor Wan 2.7 giver mest mening:

🎬

Komplekse scener med flere emner

Thinking Mode udmærker sig, når din prompt involverer flere karakterer eller objekter, der interagerer. Planlægningstrinnet forhindrer den rumlige forvirring, der plager andre modeller.
📝

Teksttungt indhold

Hvis din video har brug for læsbar tekst, skilte eller UI-elementer, er Wan 2.7s tekstgengivelse i øjeblikket den bedste i klassen.
🎨

Præcis farve- og stilkontrol

Farvekonditioneringssystemet lader dig specificere præcise paletter og fastholde dem på tværs af frames, nyttigt til brandkonsistent indhold.
🔄

Stiloverførsel via reference

Reference-to-video-modellen (kommer snart) vil lade dig bruge et eksisterende klip som stilguide til at generere nyt indhold, der matcher dets visuelle sprog.

For enklere scener med et enkelt emne, hvor du også har brug for lyd, kan modeller som Kling 3.0 eller Veo 3.1 stadig være det bedre valg. Planlægningsoverheadet i Thinking Mode tilføjer specifikt værdi, når prompts er komplekse.

Hvad det betyder for branchen

Wan 2.7s Thinking Mode peger mod et bredere skift i, hvordan generative modeller vil fungere. I stedet for at tvinge outputs ud af støj vil fremtidige modeller sandsynligvis inkorporere eksplicitte planlægningsfaser for forskellige aspekter af genereringen.

Vi ser allerede dette mønster i andre domæner. Kodegenereringsmodeller planlægger, før de skriver. Billedmodeller bruger layoutkonditionering. Nu lærer videomodeller at tænke, før de skaber.

💡
Det hurtige tempo af modeludgivelser i 2026 gør det risikabelt at binde sig til en enkelt leverandør. Pipeline-baserede tilgange, der kan skifte genereringsbackends, når bedre modeller udkommer, beskytter din workflow mod vendor lock-in.

Konkurrencepresset er reelt. Med Sora, der lukker ned, Google, der sænker priserne, og kinesiske modeller som Wan 2.7 og Kling 3.0, der skubber kvalitetsgrænserne, har skabere aldrig haft flere muligheder eller mere grund til at forblive fleksible.

For et dybere kig på, hvordan disse modeller klarer sig på specifikke benchmarks, kan du læse vores analyse af Runway Gen-4.5 ydeevne. Og hvis du er interesseret i, hvordan Seedance 2.0-udrulningen omformer CapCut-økosystemet, dækkede vi det i detaljer sidste måned.

Alexis
AlexisAI EngineerAI Author

AI-ingeniør fra Lausanne, der kombinerer forskningsdybde med praktisk innovation. Deler sin tid mellem modelarkitekturer og alpine bjergtoppe.

View profile →

Kan du lide det, du har læst?

Forvandl dine idéer til AI-videoer med ubegrænset længde på få minutter.

Relaterede artikler

Udforsk videre med disse relaterede indlæg

Kunne du lide denne artikel?

Få flere indsigter, og hold dig opdateret med vores seneste indhold.