Meta Pixel跳至主要內容
HenryHenry· AI 作者,經人工審閱
9 min read
250

SkyReels V4:首個能同時看與聽的AI模型

Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

SkyReels V4:首個能同時看與聽的AI模型

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

迄今為止,每一款AI影片模型都把音訊當作事後補救。先生成畫面,再貼上聲音。SkyReels V4徹底顛覆了這套流程。這是首個能同時以畫面與聲音進行思考的模型,成果令人驚喜。

為何音訊一直是AI影片的盲點

如果你曾嘗試為AI生成的片段加上聲音,應該深有體會。先生成一段雨打窗戶的畫面,再去尋找匹配的音軌,調整時間點,祈禱它不會顯得違和。

問題的根源在於架構。像Kling 3.0Runway Gen-4.5這類模型,最初都是作為視覺引擎所打造。即便支援音訊,也是透過另一條獨立管線在事後進行同步。

💡
我們在統一音影片生成的深度文章中探討過這項矛盾。SkyReels V4是首個真正於架構層面解決問題的量產模型。

SkyReels V4 的運作方式

Skywork AI(崑崙公司旗下的研究部門)打造了一個稱為雙流多模態擴散變換器(Dual-stream MMDiT)的系統。可以把它想成兩個共用同一神經系統的專家大腦。

視覺分支

以最高1080p、32 FPS規格生成影片畫格,處理動作、光線、場景構圖,以及整段片段的時序一致性。

音訊分支

在同一次擴散過程中生成同步聲音。不是為成片配音,而是與畫面同步成形。

兩條分支共用一個建立在多模態大型語言模型之上的文字編碼器。正因為這種共享理解,像「慢動作下玻璃在大理石地板上碎裂」這樣的提示詞,所產生的音訊重音能落在視覺衝擊點的約40毫秒之內。這種精度足以讓人覺得自然。

1080p
最高解析度
32 FPS
影格率
15s
最長時長
~40ms
音畫同步精度

與 Seedance 或 Kling 的差異

位元組跳動的Seedance 2.0與快手的Kling 3.0也支援音訊,但路徑完全不同。它們先生成影片,再用第二個模型產出匹配的聲音。這種順序式做法意味著音訊始終在被動適應已經定型的畫面,而不是與畫面共同誕生。

SkyReels V4 的雙流架構帶來:

  • 音訊與視覺元素從一開始就在語意上對齊
  • 說話畫面的嘴型同步落在子音上,而非延遲
  • 環境聲匹配材質特性(金屬、木頭、玻璃各異)
  • 無需後期處理來修正時間漂移

觀看風景片段時差異並不明顯,但在觀看人物說話或物體與表面互動時,差距非常顯著。

開源問題

先前的SkyReels版本(V1至V3)完全開源,可於HuggingFace與GitHub下載權重。V4目前處於限量預覽階段,skyreels.ai官方平台提供免費方案,但完整權重尚未釋出。

目前可用

官方平台提供有每日生成限額的免費方案。arXiv論文(2602.21818)詳細介紹完整架構。先前版本仍保持開源。

尚未具備

V4權重暫未開放下載。尚無自架方案,亦無正式生產級API。開源時程仍不明朗。

對開源社群而言,這值得密切關注。若Skywork延續以往慣例,V4權重最終應會登上HuggingFace。如果你今天就需要開源的音影片生成方案,最接近的替代是SkyReels V3 搭配獨立音訊模型

SkyReels V4 在排行榜中的位置

在Artificial Analysis Video Arena(採用人類盲測偏好投票)上,SkyReels V4的文字生影片Elo分目前為1,244。這與Kling 3.0(1,243)幾乎打平,仍落後於當前榜首阿里巴巴的HappyHorse-1.0(1,347)。

模型Elo分數音訊支援開源適合場景
HappyHorse-1.01,347純視覺品質
SkyReels V41,244原生(雙流)待定音影片內容
Kling 3.01,243順序式量產規模
Wan 2.7頂級寫實風格
LTX-2較低成本效率
對比圖呈現SkyReels V4、Kling 3.0、HappyHorse-1.0與Wan 2.7在視覺品質、音訊支援、開源程度與速度上的差異
SkyReels V4 是頂級陣營中唯一原生生成音訊的模型

SkyReels V4 與 HappyHorse 之間的視覺差距確實存在。但SkyReels是前五名中唯一能原生生成音訊的模型。若你的工作流程需要聲音,這項架構層面的優勢比100分的Elo差距更為重要。

這對創作者意味著什麼

🎬

社群內容創作者

SkyReels V4 為快速產出而設計。生成帶匹配音訊的片段後即可發佈,無需獨立的聲音設計環節。對TikTok、Reels與Shorts創作者而言,製作時間將大幅壓縮。
🎵

音樂影片製作者

音訊分支可接受參考音訊作為引導,意味著你可以輸入一段曲目,得到與節拍同步律動的畫面。早期成果顯示,動作重音與音樂節奏的契合度相當不錯。
📢

廣告創作者

帶環境聲的產品影片、可直接配旁白的素材、帶聲景的品牌內容,都能在單次生成中完成。對於規模化生產的品牌而言,節省的時間將快速累積。

更宏觀的趨勢:音訊不再是可選項

SkyReels V4 並非孤立的實驗。我們曾報導過位元組跳動 Seedance 1.5 Pro引入音影片生成,以及AI影片走出無聲時代的整體趨勢。SkyReels V4 進一步證明,這件事可以在架構層面完成,而非倚賴後處理的小技巧。

結論很清楚:到2026年底,任何不具備原生音訊的AI影片模型都會顯得不完整。問題不在於這是否會成為標準,而在於普及速度有多快。

💡
想立刻生成有聲音的AI影片?Bonega的統一管線會自動選用當下最優的工具,並隨著SkyReels V4等模型的成熟持續升級。免費試用

速查參考:SkyReels V4

  • 開發方: Skywork AI(崑崙公司)
  • 架構: 雙流多模態擴散變換器(MMDiT)
  • 解析度: 最高1080p,32 FPS
  • 時長: 最長15秒
  • 音訊: 原生協同生成(非後處理)
  • 輸入: 文字、圖像、影片片段、遮罩、參考音訊
  • 狀態: skyreels.ai 限量預覽(權重待開源釋出)
  • 論文: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

來自洛桑的創意技術專家,探索 AI 與藝術交會之處。他在電子音樂創作之餘,實驗各種生成式模型。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。