Alibaba Wan 2.7: Como o Thinking Mode muda a geração de vídeo por IA
A Alibaba acaba de lançar o Wan 2.7 com um inovador Thinking Mode que planeja composições antes de gerar vídeo. Analisamos como ele funciona e o que significa para os criadores.

Pronto para criar os seus próprios vídeos com IA?
Junte-se a milhares de criadores que utilizam Bonega.ai
O que é o Thinking Mode?
A maioria dos modelos de geração de vídeo funciona numa única passagem. Escreve um prompt, o modelo começa a difundir ruído em pixels e obtém o que surgir. Isto funciona razoavelmente bem para cenas simples, mas falha quando os prompts envolvem vários sujeitos, relações espaciais específicas ou ações complexas.
O Wan 2.7 adiciona uma etapa intermédia. Antes de qualquer pixel ser gerado, o modelo:
- Analisa o prompt em componentes semânticos (sujeitos, ações, ambiente, iluminação)
- Planeia a composição ao determinar onde os elementos devem aparecer e como devem interagir
- Gera o resultado usando este plano como guia estrutural
Isto é semelhante à forma como o raciocínio "chain-of-thought" melhorou os grandes modelos de linguagem. Ao forçar o modelo a pensar antes de agir, a qualidade do resultado melhora drasticamente, especialmente em prompts complexos.
A suite completa Wan 2.7
O Wan 2.7 não é apenas um modelo. É lançado como uma suite de quatro modelos que abrange diferentes fluxos de trabalho de geração:
| Modelo | Entrada | Resultado | Ideal para |
|---|---|---|---|
| Texto para vídeo | Prompt de texto | Clipe de vídeo | Criar do zero |
| Imagem para vídeo | Imagem + prompt | Clipe de vídeo | Animar imagens estáticas, concept art |
| Referência para vídeo | Vídeo de referência + prompt | Novo vídeo | Transferência de estilo, recriação |
| Edição de vídeo | Vídeo + instruções de edição | Vídeo modificado | Pós-produção, correções |
O modelo de texto para vídeo já está disponível na Together AI desde 3 de abril. Os três modelos restantes serão lançados nas próximas semanas.
Nos bastidores: informações sobre a arquitetura
Embora a Alibaba ainda não tenha publicado um artigo completo, vários detalhes técnicos surgiram na documentação da API e nos primeiros benchmarks.
| O que sabemos | O que o diferencia |
|---|---|
| Construído sobre a linhagem de arquitetura Wan (Wanxiang) | Primeiro modelo de produção com planeamento composicional explícito |
| O Thinking Mode adiciona uma passagem de planeamento antes da difusão | Cenas com vários elementos tratam 5+ sujeitos de forma limpa |
| Consistência hiper-realista de personagens entre fotogramas | O texto em vídeos gerados é legível, não distorcido |
| Controlo preciso de cores através do condicionamento do prompt | A precisão das cores mantém-se consistente entre alterações de iluminação |
| Renderização superior de textos longos (texto em vídeos) | Movimentos complexos de câmara mantêm a coerência espacial |
A capacidade de renderização de textos longos é particularmente notável. Modelos anteriores tinham dificuldade em gerar texto legível dentro de fotogramas de vídeo. O Wan 2.7 lida com sinais, etiquetas e até parágrafos curtos com uma precisão surpreendente. Para criadores que precisam de sobreposições de texto integradas no material gerado, isto representa um avanço significativo.
Comparação com o mercado
O panorama dos vídeos por IA mudou consideravelmente esta semana, com a chegada do Wan 2.7 precisamente quando a OpenAI confirmou o encerramento do Sora e a Google reduziu drasticamente os preços do Veo 3.1.
| Modelo | Preço | Áudio | Duração máxima | Consistência de personagens | Pensamento/planeamento |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Não | ~10s | Forte | Sim |
| Veo 3.1 Lite | $0.05/s | Sim | ~8s | Boa | Não |
| Veo 3.1 Fast | $0.12/s | Sim | ~8s | Forte | Não |
| Kling 3.0 | ~$0.08-0.17/s | Sim | ~10s | Forte | Não |
| Seedance 2.0 | Incluído | Sim | 15s | Boa | Não |
| Runway Gen-4.5 | ~$0.15/s | Não | ~10s | Forte | Não |
O preço de $0.10 por segundo coloca o Wan 2.7 no nível intermédio competitivo. Custa o dobro da opção Lite económica da Google, é competitivo com o Kling 3.0 (cujo preço varia consoante a plataforma) e é significativamente mais barato do que o Runway.
Quando usar o Wan 2.7
Com base nos primeiros testes e nos pontos fortes do modelo, estes são os cenários em que o Wan 2.7 faz mais sentido:
Cenas complexas com vários sujeitos
Conteúdo com muito texto
Controlo preciso de cor e estilo
Transferência de estilo por referência
Para cenas mais simples, com um único sujeito, em que também precisa de áudio, modelos como o Kling 3.0 ou o Veo 3.1 podem continuar a ser a melhor escolha. A sobrecarga de planeamento do Thinking Mode acrescenta valor especificamente quando os prompts são complexos.
O que isto significa para o setor
O Thinking Mode do Wan 2.7 aponta para uma mudança mais ampla na forma como os modelos generativos irão funcionar. Em vez de produzir resultados à força a partir de ruído, os modelos futuros irão provavelmente incorporar etapas explícitas de planeamento para diferentes aspetos da geração.
Já vemos este padrão noutros domínios. Os modelos de geração de código planeiam antes de escrever. Os modelos de imagem usam condicionamento de layout. Agora, os modelos de vídeo estão a aprender a pensar antes de criar.
A pressão competitiva é real. Com a saída do Sora, a Google a reduzir preços e modelos chineses como o Wan 2.7 e o Kling 3.0 a ultrapassarem limites de qualidade, os criadores nunca tiveram tantas opções, nem tantos motivos para se manterem flexíveis.
Para uma análise mais aprofundada de como estes modelos se comparam em benchmarks específicos, consulte a nossa análise do desempenho do Runway Gen-4.5. E, se tiver interesse em saber como o lançamento do Seedance 2.0 está a remodelar o ecossistema CapCut, abordámos o tema em detalhe no mês passado.
Fontes

Engenheiro de IA de Lausanne que combina profundidade de investigação com inovação prática. Divide o tempo entre arquiteturas de modelos e picos alpinos.
View profile →Artigos relacionados
Continue a explorar com estes artigos relacionados

Alibaba HappyHorse-1.0: o modelo misterioso que liderou todos os rankings de vídeo com IA
Um modelo chamado HappyHorse-1.0 surgiu no Artificial Analysis sem atribuição, subiu ao primeiro lugar em text-to-video e image-to-video, e revelou-se ser da Alibaba. Eis o que sabemos sobre a arquitetura, a equipa e o que isto significa para o mercado de vídeo com IA.

A Revolução do Modelo do Mundo em Vídeo de IA: Como a Simulação Física Está Substituindo a Geração de Pixels em 2026
De predição de pixels para simulação física, os modelos do mundo estão mudando fundamentalmente como a IA cria vídeo. Aqui está por que isso importa para criadores.

Plataformas de Narrativa de Vídeo IA: Como o Conteúdo Serializado Está Mudando Tudo em 2026
De clips isolados a séries completas, o vídeo IA evolui de ferramenta de geração para motor narrativo. Conheça as plataformas que o tornam possível.