Meta Pixel跳到主要内容
HenryHenry· AI 作者,经人工审核
9 min read
203

阿里巴巴 Wan2.6:参考视频生成技术让你的面孔出现在AI生成的世界中

阿里巴巴最新的AI视频模型引入了参考到视频生成功能,让你能够在AI创作的内容中使用自己的外貌和声音。这对创作者意味着什么。

阿里巴巴 Wan2.6:参考视频生成技术让你的面孔出现在AI生成的世界中

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

忘掉那些千篇一律的AI头像吧。阿里巴巴刚刚发布了Wan2.6,其核心功能让你只需一张参考图片或一段语音就能将自己融入AI生成的视频中。这项技术的影响深远。

参考革命

自AI视频生成的早期阶段以来,文本到视频一直是标准范式。你输入提示词,得到一段视频。简单,但有局限性。如果不进行大量微调或LoRA训练,你无法让视频中出现你自己

Wan2.6彻底改变了这一格局。

💡

参考到视频意味着AI将你的真实外貌、声音或两者同时作为条件输入,与文本提示词一起使用。你成为生成内容中的角色,而不是事后添加的元素。

Wan2.6于2025年12月16日发布,代表着阿里巴巴在AI视频领域的强势布局。该模型提供多种规格(13亿和140亿参数),并引入了三项使其脱颖而出的核心能力。

Wan2.6的实际功能

140亿
参数
720p
原生分辨率
5-10秒
视频时长

该模型有三种不同的运行模式:

📝

文本到视频

标准的基于提示词的生成,具有改进的运动质量和时间一致性。

🖼️

图像到视频

将任何静态图像转换为连贯的视频序列。

👤

参考到视频

在生成的内容中使用你的外貌作为持续存在的角色。

参考到视频功能是最令人兴奋的部分。上传一张清晰的自己的照片(或任何主体),Wan2.6会提取身份特征,这些特征会在整个生成序列中保持一致。即使AI在其周围创建全新的场景,你的面孔仍然是你的面孔。

技术方法

Wan2.6采用了2025年主流模型中标准的扩散变换器架构的变体。但阿里巴巴的实现包含了专门的身份保持嵌入,类似于我们在角色一致性深度分析中探讨的技术。

💡

参考条件通过交叉注意力机制工作,在生成过程的多个层级注入身份信息。这使面部特征保持稳定,同时允许其他一切自然变化。

语音组件使用单独的音频编码器来捕捉你的声音特征:音色、音高模式和说话节奏。与视觉参考结合后,你会获得真正看起来和听起来像你的同步音视频输出。

这种方法不同于Runway的世界模型策略,后者专注于物理模拟和环境一致性。Wan2.6优先考虑身份保持而非环境准确性,这对于其目标用例来说是合理的权衡。

开源的重要性

Wan2.6最重要的一点可能是阿里巴巴将其作为开源发布。权重可供下载,这意味着你可以在性能足够的硬件上本地运行。

Wan2.6(开源)

本地运行,无API成本,完全控制你的数据

Sora 2 / Veo 3(闭源)

仅API访问,按次付费,数据发送给第三方

这延续了我们在开源AI视频革命中报道的趋势,中国公司一直在发布可在消费级硬件上运行的强大模型。140亿参数版本需要大量显存(24GB以上),但13亿参数版本可以在RTX 4090上运行。

真正有意义的用例

参考到视频解锁了以前不可能或成本过高的场景。

  • 大规模个性化营销内容
  • 无需工作室拍摄即可创建自定义头像
  • 视频概念的快速原型设计
  • 无障碍功能:手语头像、个性化教育

想象一下,不用站在摄像头前就能创建以你自己为主角的产品演示视频。或者生成培训内容,其中讲师是你CEO的参考条件版本。这些应用远不止新奇那么简单。

隐私问题

让我们直面显而易见的担忧:这项技术可能被滥用于深度伪造。

阿里巴巴实施了一些保护措施。该模型包含类似谷歌SynthID方法的水印,服务条款禁止未经同意的使用。但这些只是减速带,不是障碍。

⚠️

参考到视频技术需要负责任地使用。在使用他人的外貌之前务必获得同意,并对AI生成的内容保持透明。

精灵已经从瓶子里出来了。现在多个模型都提供身份保持生成,而Wan2.6的开源性质意味着任何人都可以获得这种能力。讨论已经从"这应该存在吗"转变为"我们如何负责任地处理它"。

竞品对比

Wan2.6进入了一个竞争激烈的市场。以下是它与2025年12月主要竞争对手的比较。

模型参考到视频开源原生音频最大时长
Wan2.610秒
Runway Gen-4.5有限15秒
Sora 260秒
Veo 3120秒
LTX-210秒

Wan2.6以时长换取身份保持。如果你需要60秒的片段,Sora 2仍然是最佳选择。但如果你需要这些片段始终展示特定的人物,Wan2.6提供了闭源模型所没有的功能。

更大的图景

参考到视频代表了我们对AI视频生成思维方式的转变。问题不再只是"这个视频中应该发生什么",而是"谁应该出现在其中"。

这是文本到视频所缺失的个性化层。通用AI头像感觉像库存素材。参考条件角色感觉像是你自己

结合原生音频生成和不断改进的角色一致性,我们正在接近一个未来,创建专业视频内容只需要一张网络摄像头照片和一个文本提示词。

阿里巴巴押注身份优先的生成是下一个前沿。随着Wan2.6现在开源并可在消费级硬件上运行,我们很快就会知道他们是否正确。

💡

延伸阅读: 要比较领先的AI视频模型,请参阅我们的Sora 2 vs Runway vs Veo 3对比。要了解底层架构,请查看2025年的扩散变换器

Henry
HenryCreative TechnologistAI Author

来自洛桑的创意技术专家,探索 AI 与艺术的交汇点。他在电子音乐创作间隙试验生成式模型。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。