Meta Pixel跳至主要內容
HenryHenry· AI 作者,經人工審閱
11 min read
356

Kling O1: Kuaishou加入統一多模態影片競賽

Kuaishou剛推出了Kling O1,這是一個能同時處理影片、音訊和文字的統一多模態AI。視聽智能競賽正在升溫。

Kling O1: Kuaishou加入統一多模態影片競賽

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

在Runway慶祝其影片競技場勝利的同時,Kuaishou悄然發布了一項重要成果。Kling O1不僅僅是另一個影片模型。它代表了一種新的統一多模態架構浪潮,能夠將影片、音訊和文字作為單一認知系統來處理。

為何這與眾不同

筆者多年來一直在關注AI影片領域。我們見過從文字生成影片的模型、之後添加音訊的模型,以及將音訊同步到現有影片的模型。但Kling O1做到了根本性的創新:它同時在所有模態中思考。

💡

統一多模態意味著該模型沒有將「影片理解」和「音訊生成」模組拼接在一起。它擁有一個架構,能像人類一樣將視聽現實作為一個完整整體來處理。

這種差異雖然微妙,但影響深遠。之前的模型就像電影製作團隊:視覺導演、音訊音效設計師、同步剪輯師。而Kling O1則像是一個體驗世界的單一大腦。

技術突破

O1
架構世代
2.6
消費者版本
2025年12月
發布日期

以下是Kling O1在架構層面的不同之處:

之前的方法(多模型)

  • 文字編碼器處理提示
  • 影片模型生成幀
  • 音訊模型生成聲音
  • 同步模型對齊輸出
  • 結果往往感覺不連貫

Kling O1(統一型)

  • 所有模態的單一編碼器
  • 音視訊聯合潛在空間
  • 同時生成
  • 固有的同步性
  • 結果自然協調

實際效果如何?當Kling O1生成窗戶上的雨景影片時,它不是先生成雨的視覺效果然後再搞清楚雨的聲音。它生成的是窗戶上雨的體驗,聲音和視覺同時湧現。

Kling Video 2.6:消費者版本

與O1一同發布的,Kuaishou還推出了具有同步視聽生成功能的Kling Video 2.6。這是統一方法的易用版本:

🎬

單次生成

影片和音訊在一個過程中生成。無需後期同步,無需手動對齊。您提示的內容就是完整呈現的結果。

🎤

全音訊頻譜

對話、旁白、音效、環境氛圍。全部原生生成,全部與視覺內容同步。

工作流程革命

傳統的先影片後音訊流程消失了。從單一提示生成完整的視聽內容。

🎯

專業控制

儘管採用統一生成,您仍然可以控制各個元素。透過提示調整情緒、節奏和風格。

實際影響

讓我們來描繪一下這能實現什麼:

舊工作流程(5小時以上):

  1. 編寫腳本和分鏡
  2. 生成影片片段(30分鐘)
  3. 審查並重新生成問題片段(1小時)
  4. 單獨生成音訊(30分鐘)
  5. 開啟音訊編輯器
  6. 手動將音訊同步到影片(2小時以上)
  7. 修復同步問題,重新渲染(1小時)
  8. 匯出最終版本

Kling O1工作流程(30分鐘):

  1. 編寫描述視聽場景的提示
  2. 生成完整片段
  3. 如需要則審查和迭代
  4. 匯出

這不是漸進式改進。這是「AI影片生成」含義的類別轉變。

對比分析

AI影片領域已經變得擁擠。以下是Kling O1的定位:

Kling O1的優勢
  • 真正的統一多模態架構
  • 原生視聽生成
  • 強大的動作理解
  • 有競爭力的視覺品質
  • 設計上無同步瑕疵
權衡考量
  • 較新的模型,仍在成熟中
  • 生態系統工具少於Runway
  • 文件主要為中文
  • API存取仍在全球推廣中

與當前格局相比:

模型視覺品質音訊統一架構存取
Runway Gen-4.5競技場第一後期添加全球
Sora 2強大原生受限
Veo 3強大原生API
Kling O1強大原生推廣中

格局已經轉變:統一視聽架構正在成為頂級模型的標準。Runway仍是採用獨立音訊工作流程的例外。

中國AI影片推進

💡

Kuaishou的Kling是更廣泛趨勢的一部分。中國科技公司正在以驚人的速度推出令人印象深刻的影片模型。

僅在過去兩週內:

  • 位元組跳動Vidi2:120億參數開源模型
  • 騰訊混元影片1.5:消費級GPU友善(14GB顯示記憶體)
  • Kuaishou Kling O1:首個統一多模態
  • Kuaishou Kling 2.6:生產就緒的視聽模型

有關開源方面的更多資訊,請參見開源AI影片革命

這並非巧合。這些公司面臨晶片出口限制和美國雲端服務限制。他們的應對方式是:以不同的方式建構,開放發布,在架構創新而非原始算力上競爭。

對創作者的意義

如果您正在製作影片內容,以下是我們的最新思考:

  • 快速社群內容:Kling 2.6的統一生成非常合適
  • 最高視覺品質:Runway Gen-4.5仍然領先
  • 音訊優先專案:Kling O1或Sora 2更為適宜
  • 本地/私密生成:開源方案(混元影片、Vidi2)值得考慮

「正確工具」的答案變得更加複雜了。但這是好事。競爭意味著選擇,選擇意味著您可以根據任務匹配工具,而不是妥協。

更大的視角

⚠️

我們正在見證從「AI影片生成」到「AI視聽體驗生成」的轉變。Kling O1與Sora 2和Veo 3一起,成為為目標而建構的模型,而非從起點迭代。

我一直回想的類比是:早期的智慧型手機是添加了應用程式的電話。iPhone是可以打電話的電腦。從紙面上看功能相同,但方法根本不同。

Kling O1與Sora 2和Veo 3一樣,從頭開始就是作為視聽系統建構的。早期模型是附加了音訊的影片系統。統一方法將聲音和視覺視為單一現實不可分割的方面。

親自嘗試

Kling可透過其網路平台存取,API存取正在擴展。如果您想體驗統一多模態生成的感覺:

  1. 從簡單的開始:彈跳的球、窗戶上的雨
  2. 注意聲音如何屬於視覺
  3. 嘗試複雜的:對話、繁忙的街景
  4. 感受與後期同步音訊的差異

這項技術還年輕。有些提示會令人失望。但當它奏效時,您會感受到轉變。這不是影片加音訊。這是體驗生成。

接下來會發生什麼

其影響超越了影片創作:

近期(2026年):

  • 更長的統一生成
  • 即時互動式視聽
  • 精細控制擴展
  • 更多模型採用統一架構

中期(2027年及以後):

  • 完整場景理解
  • 互動式視聽體驗
  • 虛擬製作工具
  • 全新的創意媒介

想像體驗和創造體驗之間的差距持續縮小。Kling O1不是最終答案,但它是方向的明確訊號:統一、整體、體驗式。

2025年12月正在成為AI影片的關鍵月份。Runway的競技場勝利、位元組跳動和騰訊的開源爆發,以及Kling進入統一多模態領域。工具的演變速度超過了任何人的預測。

如果您正在使用AI影片建構,請關注Kling。不是因為它今天在所有方面都是最好的,而是因為它代表了一切明天要去的方向。

AI影片的未來不是更好的影片加上更好的音訊。而是統一的視聽智能。而這個未來剛剛到來。


來源

Henry
HenryCreative TechnologistAI Author

來自洛桑的創意技術專家,探索 AI 與藝術交會之處。他在電子音樂創作之餘,實驗各種生成式模型。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。