阿里巴巴 Wan2.6:參考影片生成技術讓你的面孔出現在AI生成的世界中
阿里巴巴最新的AI影片模型引入了參考到影片生成功能,讓你能夠在AI創作的內容中使用自己的外貌和聲音。這對創作者意味著什麼。

忘掉那些千篇一律的AI頭像吧。阿里巴巴剛剛發布了Wan2.6,其核心功能讓你只需一張參考圖片或一段語音就能將自己融入AI生成的影片中。這項技術的影響深遠。
參考革命
自AI影片生成的早期階段以來,文字到影片一直是標準範式。你輸入提示詞,得到一段影片。簡單,但有局限性。如果不進行大量微調或LoRA訓練,你無法讓影片中出現你自己。
Wan2.6徹底改變了這一格局。
參考到影片意味著AI將你的真實外貌、聲音或兩者同時作為條件輸入,與文字提示詞一起使用。你成為生成內容中的角色,而不是事後添加的元素。
Wan2.6於2025年12月16日發布,代表著阿里巴巴在AI影片領域的強勢布局。該模型提供多種規格(13億和140億參數),並引入了三項使其脫穎而出的核心能力。
Wan2.6的實際功能
該模型有三種不同的運行模式:
文字到影片
標準的基於提示詞的生成,具有改進的運動品質和時間一致性。
圖像到影片
將任何靜態圖像轉換為連貫的影片序列。
參考到影片
在生成的內容中使用你的外貌作為持續存在的角色。
參考到影片功能是最令人興奮的部分。上傳一張清晰的自己的照片(或任何主體),Wan2.6會提取身份特徵,這些特徵會在整個生成序列中保持一致。即使AI在其周圍創建全新的場景,你的面孔仍然是你的面孔。
技術方法
Wan2.6採用了2025年主流模型中標準的擴散變換器架構的變體。但阿里巴巴的實現包含了專門的身份保持嵌入,類似於我們在角色一致性深度分析中探討的技術。
參考條件透過交叉注意力機制工作,在生成過程的多個層級注入身份資訊。這使面部特徵保持穩定,同時允許其他一切自然變化。
語音組件使用單獨的音訊編碼器來捕捉你的聲音特徵:音色、音高模式和說話節奏。與視覺參考結合後,你會獲得真正看起來和聽起來像你的同步音視訊輸出。
這種方法不同於Runway的世界模型策略,後者專注於物理模擬和環境一致性。Wan2.6優先考慮身份保持而非環境準確性,這對於其目標用例來說是合理的權衡。
開源的重要性
Wan2.6最重要的一點可能是阿里巴巴將其作為開源發布。權重可供下載,這意味著你可以在性能足夠的硬體上本地運行。
本地運行,無API成本,完全控制你的資料
僅API存取,按次付費,資料發送給第三方
這延續了我們在開源AI影片革命中報導的趨勢,中國公司一直在發布可在消費級硬體上運行的強大模型。140億參數版本需要大量顯存(24GB以上),但13億參數版本可以在RTX 4090上運行。
真正有意義的用例
參考到影片解鎖了以前不可能或成本過高的場景。
- ✓大規模個人化行銷內容
- ✓無需工作室拍攝即可創建自訂頭像
- ✓影片概念的快速原型設計
- ✓無障礙功能:手語頭像、個人化教育
想像一下,不用站在攝影機前就能創建以你自己為主角的產品演示影片。或者生成培訓內容,其中講師是你CEO的參考條件版本。這些應用遠不止新奇那麼簡單。
隱私問題
讓我們直面顯而易見的擔憂:這項技術可能被濫用於深度偽造。
阿里巴巴實施了一些保護措施。該模型包含類似Google SynthID方法的浮水印,服務條款禁止未經同意的使用。但這些只是減速帶,不是障礙。
參考到影片技術需要負責任地使用。在使用他人的外貌之前務必獲得同意,並對AI生成的內容保持透明。
精靈已經從瓶子裡出來了。現在多個模型都提供身份保持生成,而Wan2.6的開源性質意味著任何人都可以獲得這種能力。討論已經從「這應該存在嗎」轉變為「我們如何負責任地處理它」。
競品對比
Wan2.6進入了一個競爭激烈的市場。以下是它與2025年12月主要競爭對手的比較。
| 模型 | 參考到影片 | 開源 | 原生音訊 | 最大時長 |
|---|---|---|---|---|
| Wan2.6 | ✅ | ✅ | ✅ | 10秒 |
| Runway Gen-4.5 | 有限 | ❌ | ✅ | 15秒 |
| Sora 2 | ❌ | ❌ | ✅ | 60秒 |
| Veo 3 | ❌ | ❌ | ✅ | 120秒 |
| LTX-2 | ❌ | ✅ | ✅ | 10秒 |
Wan2.6以時長換取身份保持。如果你需要60秒的片段,Sora 2仍然是最佳選擇。但如果你需要這些片段始終展示特定的人物,Wan2.6提供了閉源模型所沒有的功能。
更大的圖景
參考到影片代表了我們對AI影片生成思維方式的轉變。問題不再只是「這個影片中應該發生什麼」,而是「誰應該出現在其中」。
這是文字到影片所缺失的個人化層。通用AI頭像感覺像庫存素材。參考條件角色感覺像是你自己。
結合原生音訊生成和不斷改進的角色一致性,我們正在接近一個未來,創建專業影片內容只需要一張網路攝影機照片和一個文字提示詞。
阿里巴巴押注身份優先的生成是下一個前沿。隨著Wan2.6現在開源並可在消費級硬體上運行,我們很快就會知道他們是否正確。
延伸閱讀: 要比較領先的AI影片模型,請參閱我們的Sora 2 vs Runway vs Veo 3對比。要了解底層架構,請查看2025年的擴散變換器。
相關文章
繼續探索這些相關文章

阿里巴巴 HappyHorse-1.0: 稱霸所有 AI 影片排行榜的神秘模型
一個名為 HappyHorse-1.0 的模型在 Artificial Analysis 平台上匿名現身,迅速攀升至文字生成影片和圖片生成影片雙料第一,隨後被證實來自阿里巴巴。以下是關於其架構、團隊以及對 AI 影片市場影響的完整分析。

阿里巴巴 Wan 2.7:思考模式如何改變 AI 影片生成
阿里巴巴剛剛發佈了 Wan 2.7,引入全新的思考模式,能在生成影片前規劃構圖。我們將詳細解析其運作原理及對創作者的意義。

LTX-2:透過開源在消費級 GPU 上實現原生 4K AI 影片生成
Lightricks 發布 LTX-2,具有原生 4K 影片生成和同步音訊功能,在競爭對手仍鎖定於 API 的情況下提供消費級硬體上的開源存取,儘管存在重要的性能權衡。
