Alibaba Wan 2.7: Com el mode de pensament canvia la generació de vídeo amb IA
Alibaba acaba de llançar Wan 2.7 amb un nou mode de pensament que planifica composicions abans de generar el vídeo. Analitzem com funciona i què significa per als creadors.

Preparat per crear els teus propis vídeos amb IA?
Uneix-te a milers de creadors que utilitzen Bonega.ai
Què és el mode de pensament?
La majoria de models de generació de vídeo funcionen en una sola passada. Escrius una instrucció, el model comença a difondre soroll en píxels i obtens el que en surt. Això funciona raonablement bé per a escenes simples, però falla quan les instruccions impliquen múltiples subjectes, relacions espacials específiques o accions complexes.
Wan 2.7 afegeix un pas intermedi. Abans de generar cap píxel, el model:
- Analitza la instrucció en components semàntics (subjectes, accions, entorn, il·luminació)
- Planifica la composició determinant on han d'aparèixer els elements i com han d'interactuar
- Genera la sortida utilitzant aquest pla com a guia estructural
Això és similar a com el raonament en "cadena de pensament" va millorar els grans models de llenguatge. En forçar el model a pensar abans d'actuar, la qualitat de la sortida millora dràsticament, especialment per a instruccions complexes.
La suite completa de Wan 2.7
Wan 2.7 no és un sol model. Es presenta com una suite de quatre models que cobreix diferents fluxos de treball de generació:
| Model | Entrada | Sortida | Millor per a |
|---|---|---|---|
| Text-a-vídeo | Instrucció de text | Clip de vídeo | Creació des de zero |
| Imatge-a-vídeo | Imatge + instrucció | Clip de vídeo | Animar imatges fixes, art conceptual |
| Referència-a-vídeo | Vídeo de referència + instrucció | Nou vídeo | Transferència d'estil, recreació |
| Edició de vídeo | Vídeo + instruccions d'edició | Vídeo modificat | Postproducció, correccions |
El model de text-a-vídeo ja està disponible a Together AI des del 3 d'abril. Els tres models restants s'aniran desplegant durant les properes setmanes.
Sota el capó: coneixements d'arquitectura
Tot i que Alibaba encara no ha publicat un article complet, diversos detalls tècnics han aparegut a la documentació de l'API i les primeres proves comparatives.
| Què sabem | Què el diferencia |
|---|---|
| Construït sobre la línia d'arquitectura Wan (Wanxiang) | Primer model de producció amb planificació composicional explícita |
| El mode de pensament afegeix una passada de planificació abans de la difusió | Escenes amb múltiples elements gestionen 5+ subjectes de manera neta |
| Consistència de personatges hiperealista entre fotogrames | El renderitzat de text en vídeo generat és llegible, no deformat |
| Control de color precís mitjançant condicionament d'instruccions | La precisió del color es manté consistent amb els canvis d'il·luminació |
| Renderitzat superior de text llarg (text en vídeos) | Moviments de càmera complexos mantenen la coherència espacial |
La capacitat de renderitzat de text llarg és particularment notable. Els models anteriors tenien dificultats per generar text llegible dins dels fotogrames de vídeo. Wan 2.7 gestiona rètols, etiquetes i fins i tot paràgrafs curts amb una precisió sorprenent. Per als creadors que necessiten superposicions de text integrades en el material generat, això representa un avenç significatiu.
Comparativa amb el mercat
El camp del vídeo amb IA va canviar considerablement aquesta setmana, amb l'arribada de Wan 2.7 just quan OpenAI va confirmar el tancament de Sora i Google va reduir els preus de Veo 3.1.
| Model | Preu | Àudio | Durada màx. | Consistència de personatges | Pensament/Planificació |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | No | ~10s | Forta | Sí |
| Veo 3.1 Lite | $0.05/s | Sí | ~8s | Bona | No |
| Veo 3.1 Fast | $0.12/s | Sí | ~8s | Forta | No |
| Kling 3.0 | ~$0.08-0.17/s | Sí | ~10s | Forta | No |
| Seedance 2.0 | Inclòs | Sí | 15s | Bona | No |
| Runway Gen-4.5 | ~$0.15/s | No | ~10s | Forta | No |
El preu de $0.10 per segon situa Wan 2.7 en el segment competitiu mitjà. Costa el doble que l'opció econòmica Lite de Google, és competitiu amb Kling 3.0 (que varia segons la plataforma) i resulta significativament més barat que Runway.
Quan utilitzar Wan 2.7
Basant-nos en les primeres proves i els punts forts del model, aquí teniu els escenaris on Wan 2.7 té més sentit:
Escenes complexes amb múltiples subjectes
Contingut ric en text
Control precís de color i estil
Transferència d'estil per referència
Per a escenes més simples amb un sol subjecte on també necessiteu àudio, models com Kling 3.0 o Veo 3.1 poden seguir sent la millor opció. La càrrega addicional de planificació del mode de pensament aporta valor específicament quan les instruccions són complexes.
Què significa això per a la indústria
El mode de pensament de Wan 2.7 apunta cap a un canvi més ampli en el funcionament dels models generatius. En lloc de forçar resultats a partir del soroll, els models futurs probablement incorporaran etapes de planificació explícites per a diferents aspectes de la generació.
Ja estem veient aquest patró en altres àmbits. Els models de generació de codi planifiquen abans d'escriure. Els models d'imatge utilitzen condicionament de disposició. Ara els models de vídeo estan aprenent a pensar abans de crear.
La pressió competitiva és real. Amb la sortida de Sora, Google reduint preus i models xinesos com Wan 2.7 i Kling 3.0 empenyent els límits de qualitat, els creadors mai no han tingut tantes opcions ni tantes raons per mantenir-se flexibles.
Per a una anàlisi més detallada de com aquests models es comparen en proves comparatives específiques, consulteu la nostra anàlisi del rendiment de Runway Gen-4.5. I si us interessa com el llançament de Seedance 2.0 està transformant l'ecosistema de CapCut, ho vam cobrir en detall el mes passat.

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.
View profile →T’ha agradat el que has llegit?
Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.
Articles relacionats
Continua explorant amb aquestes publicacions relacionades

Alibaba HappyHorse-1.0: El model misteriós que va arribar al capdamunt de totes les classificacions de vídeo AI
Un model anomenat HappyHorse-1.0 va aparèixer a Artificial Analysis sense cap atribució, va pujar al #1 tant en text-to-video com en image-to-video, i després va resultar ser d'Alibaba. Aquí teniu el que sabem sobre l'arquitectura, l'equip i què significa per al mercat del vídeo AI.

Vídeo IA després de Sora: 4 nivells de mercat que cal conèixer el 2026
Sora tanca el 26 d'abril. El mercat de vídeo IA s'ha consolidat en quatre nivells. Una guia pràctica per triar l'alternativa adequada a Sora segons les teves necessitats.

Google Veo 3.1 es torna gratuït: 10 vídeos d'IA al mes per a cada compte de Google
Google ha obert Veo 3.1 a tots els comptes personals amb 10 generacions de vídeo gratuïtes al mes. Aquí tens què obtens, quins són els límits i per què això importa als creadors de vídeo amb IA.