Meta Pixel跳至主要內容
AlexisAlexis· AI 作者,經人工審閱
9 min read
344

阿里巴巴 Wan 2.7:思考模式如何改變 AI 影片生成

阿里巴巴剛剛發佈了 Wan 2.7,引入全新的思考模式,能在生成影片前規劃構圖。我們將詳細解析其運作原理及對創作者的意義。

阿里巴巴 Wan 2.7:思考模式如何改變 AI 影片生成

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

阿里巴巴通義實驗室於 2026 年 4 月 6 日發佈了 Wan 2.7,引入了一種「思考模式」,從根本上改變了 AI 影片模型處理提示詞的方式。模型不再直接從文字生成畫面,而是先建構場景的內部規劃,然後再執行生成。成果不言而喻:瑕疵更少、連貫性更強、構圖明顯更具意圖性。

什麼是思考模式?

大多數影片生成模型採用單次處理方式。你輸入提示詞,模型開始將雜訊擴散為像素,然後你得到生成的結果。對於簡單場景,這種方式效果尚可,但當提示詞涉及多個主體、特定空間關係或複雜動作時,效果往往不盡理想。

Wan 2.7 增加了一個中間步驟。在生成任何像素之前,模型會:

  1. 解析提示詞,將其分解為語義組件(主體、動作、環境、光照)
  2. 規劃構圖,確定各元素應出現的位置及互動方式
  3. 執行生成,以該規劃作為結構引導
💡
可以將其比喻為即興繪畫與先畫構圖草稿的區別。草稿不會出現在最終作品中,但它決定了每一筆的走向。

這與「思維鏈」推理改善大型語言模型的方式類似。透過迫使模型在行動前先思考,輸出品質獲得了顯著提升,尤其是對於複雜提示詞。

完整的 Wan 2.7 模型套件

Wan 2.7 並非單一模型,而是一個包含四個模型的套件,涵蓋不同的生成工作流程:

4
模型套件
$0.10/秒
API 定價
4月6日
發佈日期
模型輸入輸出最適用於
文字生成影片文字提示詞影片片段從零開始創建
圖片生成影片圖片 + 提示詞影片片段讓靜態圖片動起來、概念設計動畫化
參考影片生成參考影片 + 提示詞新影片風格遷移、重新創作
影片編輯影片 + 編輯指令修改後的影片後製、修正調整

文字生成影片模型自 4 月 3 日起已在 Together AI 上線。其餘三個模型將在未來幾週內陸續推出。

技術細節:架構解析

雖然阿里巴巴尚未發佈完整論文,但從 API 文件和早期基準測試中已透露出若干技術細節。

已知資訊獨特之處
基於萬象(Wanxiang)架構傳承首個具備顯式構圖規劃的生產級模型
思考模式在擴散前增加規劃步驟多元素場景可流暢處理 5 個以上主體
跨幀超寫實角色一致性生成影片中的文字清晰可讀,而非亂碼
透過提示詞調節實現精確色彩控制色彩準確度在光照變化中保持一致
優秀的長文字渲染能力(影片內文字)複雜運鏡保持空間連貫性

長文字渲染能力尤其值得關注。先前的模型在影片幀內生成清晰可讀的文字方面表現不佳。Wan 2.7 能夠以出色的準確度處理招牌、標籤甚至短段落。對於需要在生成素材中嵌入文字疊加的創作者來說,這是一項重要的進步。

與同類模型的對比

本週 AI 影片領域發生了重大變化。Wan 2.7 發佈的同時,OpenAI 確認關停 Sora,Google 也大幅下調了 Veo 3.1 的定價。

模型定價音訊最大時長角色一致性思考/規劃
Wan 2.7$0.10/秒約10秒
Veo 3.1 Lite$0.05/秒約8秒良好
Veo 3.1 Fast$0.12/秒約8秒
Kling 3.0約$0.08-0.17/秒約10秒
Seedance 2.0捆綁定價15秒良好
Runway Gen-4.5約$0.15/秒約10秒
⚠️
Wan 2.7 不包含原生音訊生成功能。如果專案需要同步音效,你需要獨立的音訊處理流程,或者使用 Kling 3.0、Veo 3.1 等支援原生音訊生成的模型。

每秒 $0.10 的定價使 Wan 2.7 處於競爭力適中的價格區間。它是 Google 經濟型 Lite 方案的兩倍,與 Kling 3.0 價格相當(後者因平台而異),同時明顯低於 Runway 的定價。

何時使用 Wan 2.7

根據早期測試及該模型的優勢,以下是 Wan 2.7 最適合的應用場景:

🎬

複雜多主體場景

當提示詞涉及多個角色或物體互動時,思考模式表現出色。規劃步驟有效避免了其他模型常見的空間混亂問題。
📝

文字密集型內容

如果影片需要可讀的文字、招牌或 UI 元素,Wan 2.7 的文字渲染能力目前處於領先水準。
🎨

精確的色彩與風格控制

色彩調節系統讓你可以指定精確的配色方案,並在幀間保持一致,適用於品牌統一的內容製作。
🔄

參考影片風格遷移

即將推出的參考影片生成模型允許你輸入現有片段作為風格參考,生成匹配其視覺風格的新內容。

對於較簡單的單主體場景,如果同時需要音訊,Kling 3.0 或 Veo 3.1 可能仍是更好的選擇。思考模式的規劃開銷在提示詞複雜時才能真正體現價值。

對產業的意義

Wan 2.7 的思考模式預示著生成模型運作方式的更廣泛轉變。未來的模型可能不再單純從雜訊中強行生成輸出,而是在生成的各個環節引入顯式規劃階段。

這種模式已在其他領域出現。程式碼生成模型在撰寫前會先規劃,影像模型使用佈局條件引導,如今影片模型也在學習先思考再創作。

💡
2026 年模型更新的速度之快,使得鎖定任何單一供應商都存在風險。採用流水線架構,在更好的模型出現時靈活切換生成後端,能有效保護你的工作流程免受供應商綁定的影響。

競爭壓力確實存在。隨著 Sora 退出市場、Google 降價,以及 Wan 2.7 和 Kling 3.0 等中國模型不斷推高品質標準,創作者擁有了前所未有的選擇,也有了更多保持靈活性的理由。

如需深入了解這些模型在具體基準測試中的表現,請查看我們的 Runway Gen-4.5 效能分析。如果你對 Seedance 2.0 的推出如何重塑剪映生態感興趣,我們上個月也做了詳細報導。

Alexis
AlexisAI EngineerAI Author

來自洛桑的 AI 工程師,結合深入研究與實務創新。他在模型架構與阿爾卑斯山峰之間分配時間。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。