Alibaba Wan 2.7: come il Thinking Mode cambia la generazione video con IA
Alibaba ha appena rilasciato Wan 2.7 con un innovativo Thinking Mode che pianifica le composizioni prima di generare il video. Vediamo come funziona e cosa significa per i creatori.

Cos'è il Thinking Mode?
La maggior parte dei modelli di generazione video lavora in un singolo passaggio. Scrivi un prompt, il modello inizia a trasformare il rumore in pixel e ottieni quello che ne esce. Questo funziona abbastanza bene per scene semplici, ma crolla quando i prompt coinvolgono più soggetti, relazioni spaziali specifiche o azioni complesse.
Wan 2.7 aggiunge un passaggio intermedio. Prima che venga generato qualsiasi pixel, il modello:
- Analizza il prompt scomponendolo in componenti semantici (soggetti, azioni, ambiente, illuminazione)
- Pianifica la composizione determinando dove gli elementi devono apparire e come devono interagire
- Genera l'output usando questo piano come guida strutturale
Questo ricorda il modo in cui il ragionamento "chain-of-thought" ha migliorato i grandi modelli linguistici. Costringendo il modello a pensare prima di agire, la qualità dell'output migliora notevolmente, soprattutto per i prompt complessi.
La suite completa di Wan 2.7
Wan 2.7 non è un singolo modello. Si presenta come una suite di quattro modelli che coprono diversi flussi di lavoro per la generazione:
| Modello | Input | Output | Ideale Per |
|---|---|---|---|
| Text-to-Video | Prompt testuale | Clip video | Creare da zero |
| Image-to-Video | Immagine + prompt | Clip video | Animare immagini fisse, concept art |
| Reference-to-Video | Video di riferimento + prompt | Nuovo video | Trasferimento di stile, ri-creazione |
| Video Editing | Video + istruzioni di modifica | Video modificato | Post-produzione, correzioni |
Il modello text-to-video è già disponibile su Together AI dal 3 aprile. I restanti tre modelli saranno distribuiti nelle prossime settimane.
Sotto il cofano: dettagli architetturali
Sebbene Alibaba non abbia ancora pubblicato un paper completo, diversi dettagli tecnici sono emersi dalla documentazione API e dai primi benchmark.
| Cosa Sappiamo | Cosa lo Distingue |
|---|---|
| Costruito sulla linea architetturale Wan (Wanxiang) | Primo modello in produzione con pianificazione compositiva esplicita |
| Il Thinking Mode aggiunge un passaggio di pianificazione prima della diffusione | Le scene multi-elemento gestiscono 5+ soggetti in modo pulito |
| Coerenza iper-realistica dei personaggi tra i fotogrammi | Il rendering del testo nei video generati è leggibile, non confuso |
| Controllo preciso del colore tramite condizionamento del prompt | La precisione cromatica resta costante con i cambi di illuminazione |
| Rendering superiore di testi lunghi (testo nei video) | I movimenti di camera complessi mantengono la coerenza spaziale |
La capacità di rendering dei testi lunghi è particolarmente notevole. I modelli precedenti faticavano a generare testo leggibile nei fotogrammi video. Wan 2.7 gestisce insegne, etichette e persino brevi paragrafi con una precisione sorprendente. Per i creatori che hanno bisogno di sovrapposizioni testuali integrate nel filmato generato, questo rappresenta un passo avanti significativo.
Confronto con la concorrenza
Il panorama dei video IA si è trasformato considerevolmente questa settimana, con l'arrivo di Wan 2.7 proprio mentre OpenAI confermava la chiusura di Sora e Google tagliava i prezzi di Veo 3.1.
| Modello | Prezzo | Audio | Durata Max | Coerenza Personaggi | Thinking/Pianificazione |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | No | ~10s | Forte | Si |
| Veo 3.1 Lite | $0.05/s | Si | ~8s | Buona | No |
| Veo 3.1 Fast | $0.12/s | Si | ~8s | Forte | No |
| Kling 3.0 | ~$0.08-0.17/s | Si | ~10s | Forte | No |
| Seedance 2.0 | Incluso | Si | 15s | Buona | No |
| Runway Gen-4.5 | ~$0.15/s | No | ~10s | Forte | No |
Il prezzo di $0.10 al secondo posiziona Wan 2.7 nella fascia media competitiva. Costa il doppio dell'opzione budget Lite di Google, è competitivo con Kling 3.0 (che varia a seconda della piattaforma) e costa meno di Runway in modo significativo.
Quando usare Wan 2.7
Sulla base dei primi test e dei punti di forza del modello, ecco gli scenari in cui Wan 2.7 ha più senso:
Scene complesse con più soggetti
Contenuti ricchi di testo
Controllo preciso di colore e stile
Trasferimento di stile tramite riferimento
Per scene più semplici con un singolo soggetto in cui serve anche l'audio, modelli come Kling 3.0 o Veo 3.1 possono ancora essere la scelta migliore. Il passaggio di pianificazione del Thinking Mode aggiunge valore specificamente quando i prompt sono complessi.
Cosa significa per il settore
Il Thinking Mode di Wan 2.7 indica una direzione più ampia nel funzionamento dei modelli generativi. Invece di forzare gli output dal rumore, i modelli futuri incorporeranno probabilmente fasi di pianificazione esplicite per diversi aspetti della generazione.
Stiamo già vedendo questo schema in altri ambiti. I modelli di generazione codice pianificano prima di scrivere. I modelli di immagini usano il condizionamento del layout. Ora anche i modelli video stanno imparando a pensare prima di creare.
La pressione competitiva è reale. Con l'uscita di scena di Sora, Google che taglia i prezzi e modelli cinesi come Wan 2.7 e Kling 3.0 che alzano l'asticella della qualità, i creatori non hanno mai avuto più opzioni, né più motivi per restare flessibili.
Per un approfondimento su come questi modelli si confrontano su benchmark specifici, consulta la nostra analisi delle performance di Runway Gen-4.5. E se ti interessa come il lancio di Seedance 2.0 sta trasformando l'ecosistema CapCut, ne abbiamo parlato in dettaglio il mese scorso.

Ingegnere IA di Losanna che unisce profondità di ricerca e innovazione pratica. Divide il suo tempo tra architetture di modelli e vette alpine.
View profile →Ti è piaciuto ciò che hai letto?
Trasforma le tue idee in video IA di durata illimitata in pochi minuti.
Articoli correlati
Continua a esplorare con questi articoli correlati

Alibaba HappyHorse-1.0: il modello misterioso che ha scalato ogni classifica di video AI
Un modello chiamato HappyHorse-1.0 è apparso su Artificial Analysis senza attribuzione, ha raggiunto il primo posto sia nel text-to-video che nell'image-to-video, e si è poi rivelato essere di Alibaba. Ecco cosa sappiamo sull'architettura, il team e le implicazioni per il mercato dei video AI.

Video IA dopo Sora: 4 livelli di mercato da conoscere nel 2026
Sora chiude il 26 aprile. Il mercato dei video IA si è consolidato in quattro livelli. Una guida pratica per scegliere l'alternativa a Sora giusta per le tue esigenze.

Google Veo 3.1 diventa gratuito: 10 video AI al mese per ogni account Google
Google ha aperto Veo 3.1 a tutti gli account personali con 10 generazioni video gratuite al mese. Ecco cosa offre, quali sono i limiti e perché è importante per i creator di video AI.