Alibaba Wan 2.7: hoe Thinking Mode AI-videogeneratie verandert
Alibaba heeft Wan 2.7 uitgebracht met een nieuwe Thinking Mode die composities plant voordat video wordt gegenereerd. We leggen uit hoe het werkt en wat het betekent voor makers.

Wat is Thinking Mode?
De meeste videogeneratiemodellen werken in één enkele pass. Je typt een prompt, het model begint ruis om te zetten in pixels, en je krijgt wat eruit komt. Dit werkt redelijk voor simpele scènes, maar valt uiteen als prompts meerdere onderwerpen, specifieke ruimtelijke relaties of complexe acties bevatten.
Wan 2.7 voegt een tussenstap toe. Voordat er pixels worden gegenereerd, doet het model het volgende:
- Ontleedt de prompt in semantische componenten (onderwerpen, acties, omgeving, belichting)
- Plant de compositie door te bepalen waar elementen moeten verschijnen en hoe ze moeten interageren
- Genereert de output met dit plan als structurele leidraad
Dit lijkt op hoe "chain-of-thought" redenering grote taalmodellen verbeterde. Door het model te dwingen na te denken voordat het handelt, verbetert de outputkwaliteit aanzienlijk, vooral bij complexe prompts.
De volledige Wan 2.7-suite
Wan 2.7 is niet één enkel model. Het wordt geleverd als een suite van vier modellen die verschillende generatieworkflows dekken:
| Model | Input | Output | Beste Voor |
|---|---|---|---|
| Text-to-Video | Tekstprompt | Videoclip | Vanaf nul creëren |
| Image-to-Video | Afbeelding + prompt | Videoclip | Stilstaande beelden animeren, concept art |
| Reference-to-Video | Referentievideo + prompt | Nieuwe video | Stijloverdracht, herschepping |
| Video Editing | Video + bewerkingsinstructies | Bewerkte video | Nabewerking, correcties |
Het text-to-video-model is al beschikbaar op Together AI sinds 3 april. De overige drie modellen worden de komende weken uitgerold.
Onder de motorkap: architectuurdetails
Hoewel Alibaba nog geen volledig paper heeft gepubliceerd, zijn er al diverse technische details naar voren gekomen uit de API-documentatie en vroege benchmarks.
| Wat We Weten | Wat het Onderscheidt |
|---|---|
| Gebouwd op de Wan (Wanxiang) architectuurlijn | Eerste productiemodel met expliciete compositionele planning |
| Thinking Mode voegt een planningsstap toe vóór diffusie | Multi-elementscènes verwerken 5+ onderwerpen netjes |
| Hyperrealistisch karakterconsistentie over frames heen | Tekstrendering in gegenereerde video is leesbaar, niet onleesbaar |
| Precieze kleurcontrole via promptconditionering | Kleurnauwkeurigheid blijft consistent bij belichtingswisselingen |
| Superieure langetekstrendering (tekst in video's) | Complexe camerabewegingen behouden ruimtelijke samenhang |
De langetekstrenderingcapaciteit is bijzonder opvallend. Eerdere modellen hadden moeite met het genereren van leesbare tekst in videoframes. Wan 2.7 verwerkt borden, labels en zelfs korte alinea's met verrassende nauwkeurigheid. Voor makers die tekstoverlays nodig hebben die in het gegenereerde beeldmateriaal zijn ingebakken, is dit een flinke stap vooruit.
Vergelijking met het veld
Het AI-videolandschap is deze week flink verschoven, met de komst van Wan 2.7 precies op het moment dat OpenAI de sluiting van Sora bevestigde en Google de prijzen van Veo 3.1 verlaagde.
| Model | Prijs | Audio | Max Lengte | Karakterconsistentie | Thinking/Planning |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Nee | ~10s | Sterk | Ja |
| Veo 3.1 Lite | $0.05/s | Ja | ~8s | Goed | Nee |
| Veo 3.1 Fast | $0.12/s | Ja | ~8s | Sterk | Nee |
| Kling 3.0 | ~$0.08-0.17/s | Ja | ~10s | Sterk | Nee |
| Seedance 2.0 | Gebundeld | Ja | 15s | Goed | Nee |
| Runway Gen-4.5 | ~$0.15/s | Nee | ~10s | Sterk | Nee |
De prijs van $0.10 per seconde plaatst Wan 2.7 in de competitieve middenmoot. Het is twee keer zo duur als Google's budget Lite-optie, concurrerend met Kling 3.0 (dat varieert per platform) en aanzienlijk goedkoper dan Runway.
Wanneer Wan 2.7 gebruiken
Op basis van vroege tests en de sterke punten van het model zijn dit de scenario's waarin Wan 2.7 het meeste zin heeft:
Complexe scènes met meerdere onderwerpen
Tekstrijke content
Precieze kleur- en stijlcontrole
Stijloverdracht via referentie
Voor eenvoudigere scènes met één onderwerp waar je ook audio nodig hebt, kunnen modellen zoals Kling 3.0 of Veo 3.1 nog steeds de betere keuze zijn. De planningsoverhead in Thinking Mode voegt specifiek waarde toe wanneer prompts complex zijn.
Wat dit betekent voor de industrie
Wan 2.7's Thinking Mode wijst richting een bredere verschuiving in hoe generatieve modellen gaan werken. In plaats van outputs uit ruis te forceren, zullen toekomstige modellen waarschijnlijk expliciete planningsfasen inbouwen voor verschillende aspecten van generatie.
We zien dit patroon al in andere domeinen. Codegeneratiemodellen plannen voordat ze schrijven. Beeldmodellen gebruiken layoutconditionering. Nu leren videomodellen om na te denken voordat ze creëren.
De concurrentiedruk is reëel. Met Sora die stopt, Google die prijzen verlaagt en Chinese modellen zoals Wan 2.7 en Kling 3.0 die kwaliteitsgrenzen verleggen, hebben makers nooit meer opties gehad, of meer reden om flexibel te blijven.
Voor een uitgebreidere blik op hoe deze modellen presteren op specifieke benchmarks, bekijk onze analyse van Runway Gen-4.5 prestaties. En als je benieuwd bent hoe de Seedance 2.0 uitrol het CapCut-ecosysteem verandert, hebben we dat vorige maand uitgebreid behandeld.

AI-engineer uit Lausanne die diepgaand onderzoek combineert met praktische innovatie. Verdeelt zijn tijd tussen modelarchitecturen en alpiene bergtoppen.
View profile →Gerelateerde artikelen
Blijf ontdekken met deze gerelateerde berichten

Alibaba HappyHorse-1.0: het mysterieuze model dat elke AI-videobenchmark aanvoert
Een model genaamd HappyHorse-1.0 verscheen op Artificial Analysis zonder naamsvermelding, klom naar #1 in zowel text-to-video als image-to-video, en bleek van Alibaba te zijn. Dit is wat we weten over de architectuur, het team en wat het betekent voor de AI-videomarkt.

AI-videomarkt na Sora: 4 marktniveaus in 2026
Sora sluit op 26 april. De AI-videomarkt heeft zich geconsolideerd in vier duidelijke niveaus. Een praktische gids voor het kiezen van het juiste Sora-alternatief.

Google Veo 3.1 wordt gratis: 10 AI-video's per maand voor elk Google-account
Google heeft Veo 3.1 opengesteld voor alle persoonlijke accounts met 10 gratis videogeneraties per maand. Dit is wat je krijgt, wat de limieten zijn en waarom het ertoe doet voor AI-videocreators.