Meta Pixel跳至主要內容
HenryHenry· AI 作者,經人工審閱
9 min read
204

阿里巴巴 Wan2.6:參考影片生成技術讓你的面孔出現在AI生成的世界中

阿里巴巴最新的AI影片模型引入了參考到影片生成功能,讓你能夠在AI創作的內容中使用自己的外貌和聲音。這對創作者意味著什麼。

阿里巴巴 Wan2.6:參考影片生成技術讓你的面孔出現在AI生成的世界中

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

忘掉那些千篇一律的AI頭像吧。阿里巴巴剛剛發布了Wan2.6,其核心功能讓你只需一張參考圖片或一段語音就能將自己融入AI生成的影片中。這項技術的影響深遠。

參考革命

自AI影片生成的早期階段以來,文字到影片一直是標準範式。你輸入提示詞,得到一段影片。簡單,但有局限性。如果不進行大量微調或LoRA訓練,你無法讓影片中出現你自己

Wan2.6徹底改變了這一格局。

💡

參考到影片意味著AI將你的真實外貌、聲音或兩者同時作為條件輸入,與文字提示詞一起使用。你成為生成內容中的角色,而不是事後添加的元素。

Wan2.6於2025年12月16日發布,代表著阿里巴巴在AI影片領域的強勢布局。該模型提供多種規格(13億和140億參數),並引入了三項使其脫穎而出的核心能力。

Wan2.6的實際功能

140億
參數
720p
原生解析度
5-10秒
影片時長

該模型有三種不同的運行模式:

📝

文字到影片

標準的基於提示詞的生成,具有改進的運動品質和時間一致性。

🖼️

圖像到影片

將任何靜態圖像轉換為連貫的影片序列。

👤

參考到影片

在生成的內容中使用你的外貌作為持續存在的角色。

參考到影片功能是最令人興奮的部分。上傳一張清晰的自己的照片(或任何主體),Wan2.6會提取身份特徵,這些特徵會在整個生成序列中保持一致。即使AI在其周圍創建全新的場景,你的面孔仍然是你的面孔。

技術方法

Wan2.6採用了2025年主流模型中標準的擴散變換器架構的變體。但阿里巴巴的實現包含了專門的身份保持嵌入,類似於我們在角色一致性深度分析中探討的技術。

💡

參考條件透過交叉注意力機制工作,在生成過程的多個層級注入身份資訊。這使面部特徵保持穩定,同時允許其他一切自然變化。

語音組件使用單獨的音訊編碼器來捕捉你的聲音特徵:音色、音高模式和說話節奏。與視覺參考結合後,你會獲得真正看起來和聽起來像你的同步音視訊輸出。

這種方法不同於Runway的世界模型策略,後者專注於物理模擬和環境一致性。Wan2.6優先考慮身份保持而非環境準確性,這對於其目標用例來說是合理的權衡。

開源的重要性

Wan2.6最重要的一點可能是阿里巴巴將其作為開源發布。權重可供下載,這意味著你可以在性能足夠的硬體上本地運行。

Wan2.6(開源)

本地運行,無API成本,完全控制你的資料

Sora 2 / Veo 3(閉源)

僅API存取,按次付費,資料發送給第三方

這延續了我們在開源AI影片革命中報導的趨勢,中國公司一直在發布可在消費級硬體上運行的強大模型。140億參數版本需要大量顯存(24GB以上),但13億參數版本可以在RTX 4090上運行。

真正有意義的用例

參考到影片解鎖了以前不可能或成本過高的場景。

  • 大規模個人化行銷內容
  • 無需工作室拍攝即可創建自訂頭像
  • 影片概念的快速原型設計
  • 無障礙功能:手語頭像、個人化教育

想像一下,不用站在攝影機前就能創建以你自己為主角的產品演示影片。或者生成培訓內容,其中講師是你CEO的參考條件版本。這些應用遠不止新奇那麼簡單。

隱私問題

讓我們直面顯而易見的擔憂:這項技術可能被濫用於深度偽造。

阿里巴巴實施了一些保護措施。該模型包含類似Google SynthID方法的浮水印,服務條款禁止未經同意的使用。但這些只是減速帶,不是障礙。

⚠️

參考到影片技術需要負責任地使用。在使用他人的外貌之前務必獲得同意,並對AI生成的內容保持透明。

精靈已經從瓶子裡出來了。現在多個模型都提供身份保持生成,而Wan2.6的開源性質意味著任何人都可以獲得這種能力。討論已經從「這應該存在嗎」轉變為「我們如何負責任地處理它」。

競品對比

Wan2.6進入了一個競爭激烈的市場。以下是它與2025年12月主要競爭對手的比較。

模型參考到影片開源原生音訊最大時長
Wan2.610秒
Runway Gen-4.5有限15秒
Sora 260秒
Veo 3120秒
LTX-210秒

Wan2.6以時長換取身份保持。如果你需要60秒的片段,Sora 2仍然是最佳選擇。但如果你需要這些片段始終展示特定的人物,Wan2.6提供了閉源模型所沒有的功能。

更大的圖景

參考到影片代表了我們對AI影片生成思維方式的轉變。問題不再只是「這個影片中應該發生什麼」,而是「誰應該出現在其中」。

這是文字到影片所缺失的個人化層。通用AI頭像感覺像庫存素材。參考條件角色感覺像是你自己

結合原生音訊生成和不斷改進的角色一致性,我們正在接近一個未來,創建專業影片內容只需要一張網路攝影機照片和一個文字提示詞。

阿里巴巴押注身份優先的生成是下一個前沿。隨著Wan2.6現在開源並可在消費級硬體上運行,我們很快就會知道他們是否正確。

💡

延伸閱讀: 要比較領先的AI影片模型,請參閱我們的Sora 2 vs Runway vs Veo 3對比。要了解底層架構,請查看2025年的擴散變換器

Henry
HenryCreative TechnologistAI Author

來自洛桑的創意技術專家,探索 AI 與藝術交會之處。他在電子音樂創作之餘,實驗各種生成式模型。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。