阿里巴巴 Wan2.6:参考视频生成技术让你的面孔出现在AI生成的世界中
阿里巴巴最新的AI视频模型引入了参考到视频生成功能,让你能够在AI创作的内容中使用自己的外貌和声音。这对创作者意味着什么。

忘掉那些千篇一律的AI头像吧。阿里巴巴刚刚发布了Wan2.6,其核心功能让你只需一张参考图片或一段语音就能将自己融入AI生成的视频中。这项技术的影响深远。
参考革命
自AI视频生成的早期阶段以来,文本到视频一直是标准范式。你输入提示词,得到一段视频。简单,但有局限性。如果不进行大量微调或LoRA训练,你无法让视频中出现你自己。
Wan2.6彻底改变了这一格局。
参考到视频意味着AI将你的真实外貌、声音或两者同时作为条件输入,与文本提示词一起使用。你成为生成内容中的角色,而不是事后添加的元素。
Wan2.6于2025年12月16日发布,代表着阿里巴巴在AI视频领域的强势布局。该模型提供多种规格(13亿和140亿参数),并引入了三项使其脱颖而出的核心能力。
Wan2.6的实际功能
该模型有三种不同的运行模式:
文本到视频
标准的基于提示词的生成,具有改进的运动质量和时间一致性。
图像到视频
将任何静态图像转换为连贯的视频序列。
参考到视频
在生成的内容中使用你的外貌作为持续存在的角色。
参考到视频功能是最令人兴奋的部分。上传一张清晰的自己的照片(或任何主体),Wan2.6会提取身份特征,这些特征会在整个生成序列中保持一致。即使AI在其周围创建全新的场景,你的面孔仍然是你的面孔。
技术方法
Wan2.6采用了2025年主流模型中标准的扩散变换器架构的变体。但阿里巴巴的实现包含了专门的身份保持嵌入,类似于我们在角色一致性深度分析中探讨的技术。
参考条件通过交叉注意力机制工作,在生成过程的多个层级注入身份信息。这使面部特征保持稳定,同时允许其他一切自然变化。
语音组件使用单独的音频编码器来捕捉你的声音特征:音色、音高模式和说话节奏。与视觉参考结合后,你会获得真正看起来和听起来像你的同步音视频输出。
这种方法不同于Runway的世界模型策略,后者专注于物理模拟和环境一致性。Wan2.6优先考虑身份保持而非环境准确性,这对于其目标用例来说是合理的权衡。
开源的重要性
Wan2.6最重要的一点可能是阿里巴巴将其作为开源发布。权重可供下载,这意味着你可以在性能足够的硬件上本地运行。
本地运行,无API成本,完全控制你的数据
仅API访问,按次付费,数据发送给第三方
这延续了我们在开源AI视频革命中报道的趋势,中国公司一直在发布可在消费级硬件上运行的强大模型。140亿参数版本需要大量显存(24GB以上),但13亿参数版本可以在RTX 4090上运行。
真正有意义的用例
参考到视频解锁了以前不可能或成本过高的场景。
- ✓大规模个性化营销内容
- ✓无需工作室拍摄即可创建自定义头像
- ✓视频概念的快速原型设计
- ✓无障碍功能:手语头像、个性化教育
想象一下,不用站在摄像头前就能创建以你自己为主角的产品演示视频。或者生成培训内容,其中讲师是你CEO的参考条件版本。这些应用远不止新奇那么简单。
隐私问题
让我们直面显而易见的担忧:这项技术可能被滥用于深度伪造。
阿里巴巴实施了一些保护措施。该模型包含类似谷歌SynthID方法的水印,服务条款禁止未经同意的使用。但这些只是减速带,不是障碍。
参考到视频技术需要负责任地使用。在使用他人的外貌之前务必获得同意,并对AI生成的内容保持透明。
精灵已经从瓶子里出来了。现在多个模型都提供身份保持生成,而Wan2.6的开源性质意味着任何人都可以获得这种能力。讨论已经从"这应该存在吗"转变为"我们如何负责任地处理它"。
竞品对比
Wan2.6进入了一个竞争激烈的市场。以下是它与2025年12月主要竞争对手的比较。
| 模型 | 参考到视频 | 开源 | 原生音频 | 最大时长 |
|---|---|---|---|---|
| Wan2.6 | ✅ | ✅ | ✅ | 10秒 |
| Runway Gen-4.5 | 有限 | ❌ | ✅ | 15秒 |
| Sora 2 | ❌ | ❌ | ✅ | 60秒 |
| Veo 3 | ❌ | ❌ | ✅ | 120秒 |
| LTX-2 | ❌ | ✅ | ✅ | 10秒 |
Wan2.6以时长换取身份保持。如果你需要60秒的片段,Sora 2仍然是最佳选择。但如果你需要这些片段始终展示特定的人物,Wan2.6提供了闭源模型所没有的功能。
更大的图景
参考到视频代表了我们对AI视频生成思维方式的转变。问题不再只是"这个视频中应该发生什么",而是"谁应该出现在其中"。
这是文本到视频所缺失的个性化层。通用AI头像感觉像库存素材。参考条件角色感觉像是你自己。
结合原生音频生成和不断改进的角色一致性,我们正在接近一个未来,创建专业视频内容只需要一张网络摄像头照片和一个文本提示词。
阿里巴巴押注身份优先的生成是下一个前沿。随着Wan2.6现在开源并可在消费级硬件上运行,我们很快就会知道他们是否正确。
延伸阅读: 要比较领先的AI视频模型,请参阅我们的Sora 2 vs Runway vs Veo 3对比。要了解底层架构,请查看2025年的扩散变换器。
相关文章
继续探索这些相关文章

阿里巴巴 HappyHorse-1.0: 登顶所有 AI 视频排行榜的神秘模型
一个名为 HappyHorse-1.0 的模型在 Artificial Analysis 平台上匿名现身,迅速攀升至文本生成视频和图片生成视频双料第一,随后被证实来自阿里巴巴。以下是关于其架构、团队以及对 AI 视频市场影响的全面梳理。

阿里巴巴 Wan 2.7:思考模式如何改变 AI 视频生成
阿里巴巴刚刚发布了 Wan 2.7,引入了全新的思考模式,能在生成视频前规划构图。我们将详细解析其工作原理及对创作者的意义。

LTX-2:通过开源在消费级GPU上实现原生4K AI视频生成
Lightricks发布具有原生4K视频生成和同步音频的LTX-2,在竞争对手保持API锁定的情况下提供开源访问,尽管存在重要的性能权衡。
