Meta PixelSalta al contingut principal
AlexisAlexis· Autoria d’IA, revisada per humans
7 min read
1222 paraules

Alibaba Wan 2.7: Com el mode de pensament canvia la generació de vídeo amb IA

Alibaba acaba de llançar Wan 2.7 amb un nou mode de pensament que planifica composicions abans de generar el vídeo. Analitzem com funciona i què significa per als creadors.

Alibaba Wan 2.7: Com el mode de pensament canvia la generació de vídeo amb IA

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

El Tongyi Lab d'Alibaba va llançar Wan 2.7 el 6 d'abril de 2026, introduint un "mode de pensament" que canvia fonamentalment com els models de vídeo amb IA processen les instruccions. En lloc de generar fotogrames directament a partir del text, el model primer construeix un pla intern de l'escena i després l'executa. Els resultats parlen per si mateixos: menys artefactes, millor coherència i composicions notablement més intencionades.

Què és el mode de pensament?

La majoria de models de generació de vídeo funcionen en una sola passada. Escrius una instrucció, el model comença a difondre soroll en píxels i obtens el que en surt. Això funciona raonablement bé per a escenes simples, però falla quan les instruccions impliquen múltiples subjectes, relacions espacials específiques o accions complexes.

Wan 2.7 afegeix un pas intermedi. Abans de generar cap píxel, el model:

  1. Analitza la instrucció en components semàntics (subjectes, accions, entorn, il·luminació)
  2. Planifica la composició determinant on han d'aparèixer els elements i com han d'interactuar
  3. Genera la sortida utilitzant aquest pla com a guia estructural
💡
Penseu-hi com la diferència entre improvisar una pintura i fer primer un esbós de composició. L'esbós no apareix a l'obra final, però dóna forma a cada pinzellada.

Això és similar a com el raonament en "cadena de pensament" va millorar els grans models de llenguatge. En forçar el model a pensar abans d'actuar, la qualitat de la sortida millora dràsticament, especialment per a instruccions complexes.

La suite completa de Wan 2.7

Wan 2.7 no és un sol model. Es presenta com una suite de quatre models que cobreix diferents fluxos de treball de generació:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelEntradaSortidaMillor per a
Text-a-vídeoInstrucció de textClip de vídeoCreació des de zero
Imatge-a-vídeoImatge + instruccióClip de vídeoAnimar imatges fixes, art conceptual
Referència-a-vídeoVídeo de referència + instruccióNou vídeoTransferència d'estil, recreació
Edició de vídeoVídeo + instruccions d'edicióVídeo modificatPostproducció, correccions

El model de text-a-vídeo ja està disponible a Together AI des del 3 d'abril. Els tres models restants s'aniran desplegant durant les properes setmanes.

Sota el capó: coneixements d'arquitectura

Tot i que Alibaba encara no ha publicat un article complet, diversos detalls tècnics han aparegut a la documentació de l'API i les primeres proves comparatives.

Què sabemQuè el diferencia
Construït sobre la línia d'arquitectura Wan (Wanxiang)Primer model de producció amb planificació composicional explícita
El mode de pensament afegeix una passada de planificació abans de la difusióEscenes amb múltiples elements gestionen 5+ subjectes de manera neta
Consistència de personatges hiperealista entre fotogramesEl renderitzat de text en vídeo generat és llegible, no deformat
Control de color precís mitjançant condicionament d'instruccionsLa precisió del color es manté consistent amb els canvis d'il·luminació
Renderitzat superior de text llarg (text en vídeos)Moviments de càmera complexos mantenen la coherència espacial

La capacitat de renderitzat de text llarg és particularment notable. Els models anteriors tenien dificultats per generar text llegible dins dels fotogrames de vídeo. Wan 2.7 gestiona rètols, etiquetes i fins i tot paràgrafs curts amb una precisió sorprenent. Per als creadors que necessiten superposicions de text integrades en el material generat, això representa un avenç significatiu.

Comparativa amb el mercat

El camp del vídeo amb IA va canviar considerablement aquesta setmana, amb l'arribada de Wan 2.7 just quan OpenAI va confirmar el tancament de Sora i Google va reduir els preus de Veo 3.1.

ModelPreuÀudioDurada màx.Consistència de personatgesPensament/Planificació
Wan 2.7$0.10/sNo~10sForta
Veo 3.1 Lite$0.05/s~8sBonaNo
Veo 3.1 Fast$0.12/s~8sFortaNo
Kling 3.0~$0.08-0.17/s~10sFortaNo
Seedance 2.0Inclòs15sBonaNo
Runway Gen-4.5~$0.15/sNo~10sFortaNo
⚠️
Wan 2.7 no inclou generació d'àudio nativa. Per a projectes que requereixin so sincronitzat, necessitareu un pipeline d'àudio separat o un model com Kling 3.0 o Veo 3.1 que generi àudio de manera nativa.

El preu de $0.10 per segon situa Wan 2.7 en el segment competitiu mitjà. Costa el doble que l'opció econòmica Lite de Google, és competitiu amb Kling 3.0 (que varia segons la plataforma) i resulta significativament més barat que Runway.

Quan utilitzar Wan 2.7

Basant-nos en les primeres proves i els punts forts del model, aquí teniu els escenaris on Wan 2.7 té més sentit:

🎬

Escenes complexes amb múltiples subjectes

El mode de pensament destaca quan la instrucció implica diversos personatges o objectes interactuant. El pas de planificació evita la confusió espacial que afecta altres models.
📝

Contingut ric en text

Si el vostre vídeo necessita text llegible, rètols o elements d'interfície, el renderitzat de text de Wan 2.7 és actualment el millor de la seva categoria.
🎨

Control precís de color i estil

El sistema de condicionament de color permet especificar paletes exactes i mantenir-les entre fotogrames, útil per a contingut coherent amb la marca.
🔄

Transferència d'estil per referència

El model de referència-a-vídeo (properament) permetrà utilitzar un clip existent com a guia d'estil, generant contingut nou que coincideixi amb el seu llenguatge visual.

Per a escenes més simples amb un sol subjecte on també necessiteu àudio, models com Kling 3.0 o Veo 3.1 poden seguir sent la millor opció. La càrrega addicional de planificació del mode de pensament aporta valor específicament quan les instruccions són complexes.

Què significa això per a la indústria

El mode de pensament de Wan 2.7 apunta cap a un canvi més ampli en el funcionament dels models generatius. En lloc de forçar resultats a partir del soroll, els models futurs probablement incorporaran etapes de planificació explícites per a diferents aspectes de la generació.

Ja estem veient aquest patró en altres àmbits. Els models de generació de codi planifiquen abans d'escriure. Els models d'imatge utilitzen condicionament de disposició. Ara els models de vídeo estan aprenent a pensar abans de crear.

💡
El ritme accelerat de llançaments de models el 2026 fa arriscat comprometre's amb un sol proveïdor. Enfocaments basats en pipelines que puguin intercanviar backends de generació quan surtin models millors protegeixen el vostre flux de treball de la dependència d'un proveïdor.

La pressió competitiva és real. Amb la sortida de Sora, Google reduint preus i models xinesos com Wan 2.7 i Kling 3.0 empenyent els límits de qualitat, els creadors mai no han tingut tantes opcions ni tantes raons per mantenir-se flexibles.

Per a una anàlisi més detallada de com aquests models es comparen en proves comparatives específiques, consulteu la nostra anàlisi del rendiment de Runway Gen-4.5. I si us interessa com el llançament de Seedance 2.0 està transformant l'ecosistema de CapCut, ho vam cobrir en detall el mes passat.

Alexis
AlexisAI EngineerAI Author

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.