Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
9 min read
344

阿里巴巴 Wan 2.7:思考模式如何改变 AI 视频生成

阿里巴巴刚刚发布了 Wan 2.7,引入了全新的思考模式,能在生成视频前规划构图。我们将详细解析其工作原理及对创作者的意义。

阿里巴巴 Wan 2.7:思考模式如何改变 AI 视频生成

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

阿里巴巴通义实验室于 2026 年 4 月 6 日发布了 Wan 2.7,引入了一种"思考模式",从根本上改变了 AI 视频模型处理提示词的方式。模型不再直接从文本生成帧画面,而是先构建场景的内部规划,然后再执行生成。效果不言而喻:伪影更少、连贯性更强、构图明显更具意图性。

什么是思考模式?

大多数视频生成模型采用单次处理方式。你输入提示词,模型开始将噪声扩散为像素,然后你得到生成的结果。对于简单场景,这种方式效果尚可,但当提示词涉及多个主体、特定空间关系或复杂动作时,效果往往不尽人意。

Wan 2.7 增加了一个中间步骤。在生成任何像素之前,模型会:

  1. 解析提示词,将其分解为语义组件(主体、动作、环境、光照)
  2. 规划构图,确定各元素应出现的位置及交互方式
  3. 执行生成,以该规划作为结构引导
💡
可以将其类比为即兴绘画与先画构图草稿的区别。草稿不会出现在最终作品中,但它决定了每一笔的走向。

这与"思维链"推理改善大语言模型的方式类似。通过迫使模型在行动前先思考,输出质量获得了显著提升,尤其是对于复杂提示词。

完整的 Wan 2.7 模型套件

Wan 2.7 并非单一模型,而是一个包含四个模型的套件,覆盖不同的生成工作流:

4
模型套件
$0.10/秒
API 定价
4月6日
发布日期
模型输入输出最适用于
文本生成视频文本提示词视频片段从零创建
图片生成视频图片 + 提示词视频片段让静态图片动起来、概念设计动画化
参考视频生成参考视频 + 提示词新视频风格迁移、重新创作
视频编辑视频 + 编辑指令修改后的视频后期制作、修正调整

文本生成视频模型自 4 月 3 日起已在 Together AI 上线。其余三个模型将在未来几周内陆续推出。

技术细节:架构解析

虽然阿里巴巴尚未发布完整论文,但从 API 文档和早期基准测试中已透露出若干技术细节。

已知信息独特之处
基于万象(Wanxiang)架构传承首个具备显式构图规划的生产级模型
思考模式在扩散前增加规划步骤多元素场景可流畅处理 5 个以上主体
跨帧超写实角色一致性生成视频中的文字清晰可读,而非乱码
通过提示词调节实现精确色彩控制色彩准确度在光照变化中保持一致
优秀的长文本渲染能力(视频内文字)复杂运镜保持空间连贯性

长文本渲染能力尤为值得关注。此前的模型在视频帧内生成清晰可读的文字方面表现不佳。Wan 2.7 能够以出色的准确度处理标牌、标签甚至短段落。对于需要在生成素材中嵌入文字叠加的创作者来说,这是一个重要的进步。

与同类模型的对比

本周 AI 视频领域发生了重大变化。Wan 2.7 发布的同时,OpenAI 确认关停 Sora,Google 也大幅下调了 Veo 3.1 的定价。

模型定价音频最大时长角色一致性思考/规划
Wan 2.7$0.10/秒约10秒
Veo 3.1 Lite$0.05/秒约8秒良好
Veo 3.1 Fast$0.12/秒约8秒
Kling 3.0约$0.08-0.17/秒约10秒
Seedance 2.0捆绑定价15秒良好
Runway Gen-4.5约$0.15/秒约10秒
⚠️
Wan 2.7 不包含原生音频生成功能。如果项目需要同步音效,你需要单独的音频处理流程,或者使用 Kling 3.0、Veo 3.1 等支持原生音频生成的模型。

每秒 $0.10 的定价使 Wan 2.7 处于竞争力适中的价格区间。它是 Google 经济型 Lite 方案的两倍,与 Kling 3.0 价格相当(后者因平台而异),同时明显低于 Runway 的定价。

何时使用 Wan 2.7

根据早期测试及该模型的优势,以下是 Wan 2.7 最适合的应用场景:

🎬

复杂多主体场景

当提示词涉及多个角色或物体交互时,思考模式表现出色。规划步骤有效避免了其他模型常见的空间混乱问题。
📝

文字密集型内容

如果视频需要可读的文字、标牌或 UI 元素,Wan 2.7 的文字渲染能力目前处于领先水平。
🎨

精确的色彩与风格控制

色彩调节系统让你可以指定精确的配色方案,并在帧间保持一致,适用于品牌统一的内容制作。
🔄

参考视频风格迁移

即将推出的参考视频生成模型允许你输入现有片段作为风格参考,生成匹配其视觉风格的新内容。

对于较简单的单主体场景,如果同时需要音频,Kling 3.0 或 Veo 3.1 可能仍是更好的选择。思考模式的规划开销在提示词复杂时才能真正体现价值。

对行业的意义

Wan 2.7 的思考模式预示着生成模型工作方式的更广泛转变。未来的模型可能不再简单地从噪声中强行生成输出,而是在生成的各个环节引入显式规划阶段。

这种模式已在其他领域出现。代码生成模型在编写前会先规划,图像模型使用布局条件引导,如今视频模型也在学习先思考再创作。

💡
2026 年模型更新的速度之快,使得锁定任何单一供应商都存在风险。采用流水线架构,在更好的模型出现时灵活切换生成后端,能有效保护你的工作流免受供应商锁定的影响。

竞争压力确实存在。随着 Sora 退出市场、Google 降价,以及 Wan 2.7 和 Kling 3.0 等中国模型不断推高质量标准,创作者拥有了前所未有的选择,也有了更多保持灵活性的理由。

如需深入了解这些模型在具体基准测试中的表现,请查看我们的 Runway Gen-4.5 性能分析。如果你对 Seedance 2.0 的推出如何重塑剪映生态感兴趣,我们上个月也做了详细报道。

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。