阿里巴巴 Wan 2.7:思考模式如何改变 AI 视频生成
阿里巴巴刚刚发布了 Wan 2.7,引入了全新的思考模式,能在生成视频前规划构图。我们将详细解析其工作原理及对创作者的意义。

什么是思考模式?
大多数视频生成模型采用单次处理方式。你输入提示词,模型开始将噪声扩散为像素,然后你得到生成的结果。对于简单场景,这种方式效果尚可,但当提示词涉及多个主体、特定空间关系或复杂动作时,效果往往不尽人意。
Wan 2.7 增加了一个中间步骤。在生成任何像素之前,模型会:
- 解析提示词,将其分解为语义组件(主体、动作、环境、光照)
- 规划构图,确定各元素应出现的位置及交互方式
- 执行生成,以该规划作为结构引导
这与"思维链"推理改善大语言模型的方式类似。通过迫使模型在行动前先思考,输出质量获得了显著提升,尤其是对于复杂提示词。
完整的 Wan 2.7 模型套件
Wan 2.7 并非单一模型,而是一个包含四个模型的套件,覆盖不同的生成工作流:
| 模型 | 输入 | 输出 | 最适用于 |
|---|---|---|---|
| 文本生成视频 | 文本提示词 | 视频片段 | 从零创建 |
| 图片生成视频 | 图片 + 提示词 | 视频片段 | 让静态图片动起来、概念设计动画化 |
| 参考视频生成 | 参考视频 + 提示词 | 新视频 | 风格迁移、重新创作 |
| 视频编辑 | 视频 + 编辑指令 | 修改后的视频 | 后期制作、修正调整 |
文本生成视频模型自 4 月 3 日起已在 Together AI 上线。其余三个模型将在未来几周内陆续推出。
技术细节:架构解析
虽然阿里巴巴尚未发布完整论文,但从 API 文档和早期基准测试中已透露出若干技术细节。
| 已知信息 | 独特之处 |
|---|---|
| 基于万象(Wanxiang)架构传承 | 首个具备显式构图规划的生产级模型 |
| 思考模式在扩散前增加规划步骤 | 多元素场景可流畅处理 5 个以上主体 |
| 跨帧超写实角色一致性 | 生成视频中的文字清晰可读,而非乱码 |
| 通过提示词调节实现精确色彩控制 | 色彩准确度在光照变化中保持一致 |
| 优秀的长文本渲染能力(视频内文字) | 复杂运镜保持空间连贯性 |
长文本渲染能力尤为值得关注。此前的模型在视频帧内生成清晰可读的文字方面表现不佳。Wan 2.7 能够以出色的准确度处理标牌、标签甚至短段落。对于需要在生成素材中嵌入文字叠加的创作者来说,这是一个重要的进步。
与同类模型的对比
本周 AI 视频领域发生了重大变化。Wan 2.7 发布的同时,OpenAI 确认关停 Sora,Google 也大幅下调了 Veo 3.1 的定价。
| 模型 | 定价 | 音频 | 最大时长 | 角色一致性 | 思考/规划 |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/秒 | 否 | 约10秒 | 强 | 是 |
| Veo 3.1 Lite | $0.05/秒 | 是 | 约8秒 | 良好 | 否 |
| Veo 3.1 Fast | $0.12/秒 | 是 | 约8秒 | 强 | 否 |
| Kling 3.0 | 约$0.08-0.17/秒 | 是 | 约10秒 | 强 | 否 |
| Seedance 2.0 | 捆绑定价 | 是 | 15秒 | 良好 | 否 |
| Runway Gen-4.5 | 约$0.15/秒 | 否 | 约10秒 | 强 | 否 |
每秒 $0.10 的定价使 Wan 2.7 处于竞争力适中的价格区间。它是 Google 经济型 Lite 方案的两倍,与 Kling 3.0 价格相当(后者因平台而异),同时明显低于 Runway 的定价。
何时使用 Wan 2.7
根据早期测试及该模型的优势,以下是 Wan 2.7 最适合的应用场景:
复杂多主体场景
文字密集型内容
精确的色彩与风格控制
参考视频风格迁移
对于较简单的单主体场景,如果同时需要音频,Kling 3.0 或 Veo 3.1 可能仍是更好的选择。思考模式的规划开销在提示词复杂时才能真正体现价值。
对行业的意义
Wan 2.7 的思考模式预示着生成模型工作方式的更广泛转变。未来的模型可能不再简单地从噪声中强行生成输出,而是在生成的各个环节引入显式规划阶段。
这种模式已在其他领域出现。代码生成模型在编写前会先规划,图像模型使用布局条件引导,如今视频模型也在学习先思考再创作。
竞争压力确实存在。随着 Sora 退出市场、Google 降价,以及 Wan 2.7 和 Kling 3.0 等中国模型不断推高质量标准,创作者拥有了前所未有的选择,也有了更多保持灵活性的理由。
如需深入了解这些模型在具体基准测试中的表现,请查看我们的 Runway Gen-4.5 性能分析。如果你对 Seedance 2.0 的推出如何重塑剪映生态感兴趣,我们上个月也做了详细报道。
相关文章
继续探索这些相关文章

阿里巴巴 HappyHorse-1.0: 登顶所有 AI 视频排行榜的神秘模型
一个名为 HappyHorse-1.0 的模型在 Artificial Analysis 平台上匿名现身,迅速攀升至文本生成视频和图片生成视频双料第一,随后被证实来自阿里巴巴。以下是关于其架构、团队以及对 AI 视频市场影响的全面梳理。

Sora 之后的 AI 视频市场:2026 年需要了解的 4 个市场层级
Sora 将于 4 月 26 日关闭。AI 视频市场已整合为四个层级。这是一份实用指南,帮助您根据需求选择合适的 Sora 替代方案。

Google Veo 3.1 免费开放: 每个Google账户每月可生成10个AI视频
Google向所有个人账户开放了Veo 3.1, 每月提供10次免费视频生成。以下是具体内容、使用限制, 以及这对AI视频创作者意味着什么。
