SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

為何音訊一直是AI影片的盲點
如果你曾嘗試為AI生成的片段加上聲音,應該深有體會。先生成一段雨打窗戶的畫面,再去尋找匹配的音軌,調整時間點,祈禱它不會顯得違和。
問題的根源在於架構。像Kling 3.0或Runway Gen-4.5這類模型,最初都是作為視覺引擎所打造。即便支援音訊,也是透過另一條獨立管線在事後進行同步。
SkyReels V4 的運作方式
Skywork AI(崑崙公司旗下的研究部門)打造了一個稱為雙流多模態擴散變換器(Dual-stream MMDiT)的系統。可以把它想成兩個共用同一神經系統的專家大腦。
視覺分支
以最高1080p、32 FPS規格生成影片畫格,處理動作、光線、場景構圖,以及整段片段的時序一致性。
音訊分支
在同一次擴散過程中生成同步聲音。不是為成片配音,而是與畫面同步成形。
兩條分支共用一個建立在多模態大型語言模型之上的文字編碼器。正因為這種共享理解,像「慢動作下玻璃在大理石地板上碎裂」這樣的提示詞,所產生的音訊重音能落在視覺衝擊點的約40毫秒之內。這種精度足以讓人覺得自然。
與 Seedance 或 Kling 的差異
位元組跳動的Seedance 2.0與快手的Kling 3.0也支援音訊,但路徑完全不同。它們先生成影片,再用第二個模型產出匹配的聲音。這種順序式做法意味著音訊始終在被動適應已經定型的畫面,而不是與畫面共同誕生。
SkyReels V4 的雙流架構帶來:
- ✓音訊與視覺元素從一開始就在語意上對齊
- ✓說話畫面的嘴型同步落在子音上,而非延遲
- ✓環境聲匹配材質特性(金屬、木頭、玻璃各異)
- ✓無需後期處理來修正時間漂移
觀看風景片段時差異並不明顯,但在觀看人物說話或物體與表面互動時,差距非常顯著。
開源問題
先前的SkyReels版本(V1至V3)完全開源,可於HuggingFace與GitHub下載權重。V4目前處於限量預覽階段,skyreels.ai官方平台提供免費方案,但完整權重尚未釋出。
官方平台提供有每日生成限額的免費方案。arXiv論文(2602.21818)詳細介紹完整架構。先前版本仍保持開源。
V4權重暫未開放下載。尚無自架方案,亦無正式生產級API。開源時程仍不明朗。
對開源社群而言,這值得密切關注。若Skywork延續以往慣例,V4權重最終應會登上HuggingFace。如果你今天就需要開源的音影片生成方案,最接近的替代是SkyReels V3 搭配獨立音訊模型。
SkyReels V4 在排行榜中的位置
在Artificial Analysis Video Arena(採用人類盲測偏好投票)上,SkyReels V4的文字生影片Elo分目前為1,244。這與Kling 3.0(1,243)幾乎打平,仍落後於當前榜首阿里巴巴的HappyHorse-1.0(1,347)。
| 模型 | Elo分數 | 音訊支援 | 開源 | 適合場景 |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | 無 | 否 | 純視覺品質 |
| SkyReels V4 | 1,244 | 原生(雙流) | 待定 | 音影片內容 |
| Kling 3.0 | 1,243 | 順序式 | 否 | 量產規模 |
| Wan 2.7 | 頂級 | 無 | 是 | 寫實風格 |
| LTX-2 | 較低 | 無 | 是 | 成本效率 |

SkyReels V4 與 HappyHorse 之間的視覺差距確實存在。但SkyReels是前五名中唯一能原生生成音訊的模型。若你的工作流程需要聲音,這項架構層面的優勢比100分的Elo差距更為重要。
這對創作者意味著什麼
社群內容創作者
音樂影片製作者
廣告創作者
更宏觀的趨勢:音訊不再是可選項
SkyReels V4 並非孤立的實驗。我們曾報導過位元組跳動 Seedance 1.5 Pro引入音影片生成,以及AI影片走出無聲時代的整體趨勢。SkyReels V4 進一步證明,這件事可以在架構層面完成,而非倚賴後處理的小技巧。
結論很清楚:到2026年底,任何不具備原生音訊的AI影片模型都會顯得不完整。問題不在於這是否會成為標準,而在於普及速度有多快。
速查參考:SkyReels V4
- 開發方: Skywork AI(崑崙公司)
- 架構: 雙流多模態擴散變換器(MMDiT)
- 解析度: 最高1080p,32 FPS
- 時長: 最長15秒
- 音訊: 原生協同生成(非後處理)
- 輸入: 文字、圖像、影片片段、遮罩、參考音訊
- 狀態: skyreels.ai 限量預覽(權重待開源釋出)
- 論文: arXiv 2602.21818
相關文章
繼續探索這些相關文章

2026年3月AI海嘯:7天12個模型終結雲端時代
2026年3月見證了AI視頻模型發布歷史上最密集的爆發。在短短一週內發布了十多個新模型,最大的故事不是任何單個發布,而是本地生成現在與雲端相當。

Helios: 在消費級硬體上執行即時AI影片生成的14B模型
來自北京大學、位元組跳動和Canva的Helios僅用6GB顯存透過群組卸載生成長達一分鐘的AI影片,幀率達19.5 FPS,完全開源。

在本地執行AI視頻:LTX-2、RTX和ComfyUI在2026年
使用LTX-2和ComfyUI在自己的GPU上生成4K AI視頻。無需訂閱、無需雲端、無需數據隱私顧慮。以下是開始所需的所有資訊。

