Kling O1: Kuaishou加入統一多模態影片競賽
Kuaishou剛推出了Kling O1,這是一個能同時處理影片、音訊和文字的統一多模態AI。視聽智能競賽正在升溫。

在Runway慶祝其影片競技場勝利的同時,Kuaishou悄然發布了一項重要成果。Kling O1不僅僅是另一個影片模型。它代表了一種新的統一多模態架構浪潮,能夠將影片、音訊和文字作為單一認知系統來處理。
為何這與眾不同
筆者多年來一直在關注AI影片領域。我們見過從文字生成影片的模型、之後添加音訊的模型,以及將音訊同步到現有影片的模型。但Kling O1做到了根本性的創新:它同時在所有模態中思考。
統一多模態意味著該模型沒有將「影片理解」和「音訊生成」模組拼接在一起。它擁有一個架構,能像人類一樣將視聽現實作為一個完整整體來處理。
這種差異雖然微妙,但影響深遠。之前的模型就像電影製作團隊:視覺導演、音訊音效設計師、同步剪輯師。而Kling O1則像是一個體驗世界的單一大腦。
技術突破
以下是Kling O1在架構層面的不同之處:
之前的方法(多模型)
- 文字編碼器處理提示
- 影片模型生成幀
- 音訊模型生成聲音
- 同步模型對齊輸出
- 結果往往感覺不連貫
Kling O1(統一型)
- 所有模態的單一編碼器
- 音視訊聯合潛在空間
- 同時生成
- 固有的同步性
- 結果自然協調
實際效果如何?當Kling O1生成窗戶上的雨景影片時,它不是先生成雨的視覺效果然後再搞清楚雨的聲音。它生成的是窗戶上雨的體驗,聲音和視覺同時湧現。
Kling Video 2.6:消費者版本
與O1一同發布的,Kuaishou還推出了具有同步視聽生成功能的Kling Video 2.6。這是統一方法的易用版本:
單次生成
影片和音訊在一個過程中生成。無需後期同步,無需手動對齊。您提示的內容就是完整呈現的結果。
全音訊頻譜
對話、旁白、音效、環境氛圍。全部原生生成,全部與視覺內容同步。
工作流程革命
傳統的先影片後音訊流程消失了。從單一提示生成完整的視聽內容。
專業控制
儘管採用統一生成,您仍然可以控制各個元素。透過提示調整情緒、節奏和風格。
實際影響
讓我們來描繪一下這能實現什麼:
舊工作流程(5小時以上):
- 編寫腳本和分鏡
- 生成影片片段(30分鐘)
- 審查並重新生成問題片段(1小時)
- 單獨生成音訊(30分鐘)
- 開啟音訊編輯器
- 手動將音訊同步到影片(2小時以上)
- 修復同步問題,重新渲染(1小時)
- 匯出最終版本
Kling O1工作流程(30分鐘):
- 編寫描述視聽場景的提示
- 生成完整片段
- 如需要則審查和迭代
- 匯出
這不是漸進式改進。這是「AI影片生成」含義的類別轉變。
對比分析
AI影片領域已經變得擁擠。以下是Kling O1的定位:
- 真正的統一多模態架構
- 原生視聽生成
- 強大的動作理解
- 有競爭力的視覺品質
- 設計上無同步瑕疵
- 較新的模型,仍在成熟中
- 生態系統工具少於Runway
- 文件主要為中文
- API存取仍在全球推廣中
與當前格局相比:
| 模型 | 視覺品質 | 音訊 | 統一架構 | 存取 |
|---|---|---|---|---|
| Runway Gen-4.5 | 競技場第一 | 後期添加 | 否 | 全球 |
| Sora 2 | 強大 | 原生 | 是 | 受限 |
| Veo 3 | 強大 | 原生 | 是 | API |
| Kling O1 | 強大 | 原生 | 是 | 推廣中 |
格局已經轉變:統一視聽架構正在成為頂級模型的標準。Runway仍是採用獨立音訊工作流程的例外。
中國AI影片推進
Kuaishou的Kling是更廣泛趨勢的一部分。中國科技公司正在以驚人的速度推出令人印象深刻的影片模型。
僅在過去兩週內:
- 位元組跳動Vidi2:120億參數開源模型
- 騰訊混元影片1.5:消費級GPU友善(14GB顯示記憶體)
- Kuaishou Kling O1:首個統一多模態
- Kuaishou Kling 2.6:生產就緒的視聽模型
有關開源方面的更多資訊,請參見開源AI影片革命。
這並非巧合。這些公司面臨晶片出口限制和美國雲端服務限制。他們的應對方式是:以不同的方式建構,開放發布,在架構創新而非原始算力上競爭。
對創作者的意義
如果您正在製作影片內容,以下是我們的最新思考:
- ✓快速社群內容:Kling 2.6的統一生成非常合適
- ✓最高視覺品質:Runway Gen-4.5仍然領先
- ✓音訊優先專案:Kling O1或Sora 2更為適宜
- ✓本地/私密生成:開源方案(混元影片、Vidi2)值得考慮
「正確工具」的答案變得更加複雜了。但這是好事。競爭意味著選擇,選擇意味著您可以根據任務匹配工具,而不是妥協。
更大的視角
我們正在見證從「AI影片生成」到「AI視聽體驗生成」的轉變。Kling O1與Sora 2和Veo 3一起,成為為目標而建構的模型,而非從起點迭代。
我一直回想的類比是:早期的智慧型手機是添加了應用程式的電話。iPhone是可以打電話的電腦。從紙面上看功能相同,但方法根本不同。
Kling O1與Sora 2和Veo 3一樣,從頭開始就是作為視聽系統建構的。早期模型是附加了音訊的影片系統。統一方法將聲音和視覺視為單一現實不可分割的方面。
親自嘗試
Kling可透過其網路平台存取,API存取正在擴展。如果您想體驗統一多模態生成的感覺:
- 從簡單的開始:彈跳的球、窗戶上的雨
- 注意聲音如何屬於視覺
- 嘗試複雜的:對話、繁忙的街景
- 感受與後期同步音訊的差異
這項技術還年輕。有些提示會令人失望。但當它奏效時,您會感受到轉變。這不是影片加音訊。這是體驗生成。
接下來會發生什麼
其影響超越了影片創作:
近期(2026年):
- 更長的統一生成
- 即時互動式視聽
- 精細控制擴展
- 更多模型採用統一架構
中期(2027年及以後):
- 完整場景理解
- 互動式視聽體驗
- 虛擬製作工具
- 全新的創意媒介
想像體驗和創造體驗之間的差距持續縮小。Kling O1不是最終答案,但它是方向的明確訊號:統一、整體、體驗式。
2025年12月正在成為AI影片的關鍵月份。Runway的競技場勝利、位元組跳動和騰訊的開源爆發,以及Kling進入統一多模態領域。工具的演變速度超過了任何人的預測。
如果您正在使用AI影片建構,請關注Kling。不是因為它今天在所有方面都是最好的,而是因為它代表了一切明天要去的方向。
AI影片的未來不是更好的影片加上更好的音訊。而是統一的視聽智能。而這個未來剛剛到來。
來源
- Kling O1 Launch Announcement (Yahoo Finance)
- Kling Video 2.6 with Audio-Visual Generation (PR Newswire)
- Kling O1 Unified Multimodal Model (PR Newswire)
- China Kuaishou Kling O1 Analysis (eWeek)
相關文章
繼續探索這些相關文章

中國AI影片崛起: 快手Kling如何超越矽谷
前8大AI影片模型中有7個來自中國公司。我們分析快手Kling如何達到6000萬用戶,以及這一轉變對整個產業的意義。

AI影片的世界模型革命:物理模擬如何在2026年取代像素生成
從猜測像素到模擬物理,世界模型正在從根本上改變AI如何創建影片。以下是為什麼這很重要。

MiniMax Hailuo 02,中國預算AI影片模型挑戰業界巨頭
MiniMax的Hailuo 02以遠低於西方競品的成本提供具有競爭力的影片品質,僅用一個Veo 3影片的價格就能生成10個。這個來自中國的挑戰者值得關注。
