Kling O1: 快手加入统一多模态视频竞赛
快手刚刚推出了Kling O1,这是一个能同时处理视频、音频和文本的统一多模态AI。视听智能竞赛正在升温。

在Runway庆祝其视频竞技场胜利的时候,快手悄然发布了一项重要成果。Kling O1不仅仅是另一个视频模型。它代表了一种新的统一多模态架构浪潮,能够将视频、音频和文本作为单一认知系统来处理。
为什么这与众不同
笔者多年来一直在关注AI视频领域。我们见过从文本生成视频的模型,之后添加音频的模型,以及将音频同步到现有视频的模型。但Kling O1做到了根本性的创新:它同时在所有模态中思考。
统一多模态意味着该模型没有将"视频理解"和"音频生成"模块拼接在一起。它拥有一个架构,能像人类一样将视听现实作为一个完整整体来处理。
这种差异虽然微妙,但影响巨大。之前的模型就像电影制作团队:视觉导演、音频音效设计师、同步剪辑师。而Kling O1则像是一个体验世界的单一大脑。
技术突破
以下是Kling O1在架构层面的不同之处:
之前的方法(多模型)
- 文本编码器处理提示
- 视频模型生成帧
- 音频模型生成声音
- 同步模型对齐输出
- 结果往往感觉不连贯
Kling O1(统一型)
- 所有模态的单一编码器
- 音视频联合潜在空间
- 同时生成
- 固有的同步性
- 结果自然协调
实际效果如何?当Kling O1生成窗户上的雨景视频时,它不是先生成雨的视觉效果然后再搞清楚雨的声音。它生成的是窗户上雨的体验,声音和视觉同时涌现。
Kling Video 2.6:消费者版本
与O1一同发布的,快手还推出了具有同步视听生成功能的Kling Video 2.6。这是统一方法的易用版本:
单次生成
视频和音频在一个过程中生成。无需后期同步,无需手动对齐。您提示的内容就是完整呈现的结果。
全音频频谱
对话、旁白、音效、环境氛围。全部原生生成,全部与视觉内容同步。
工作流革命
传统的先视频后音频流程消失了。从单一提示生成完整的视听内容。
专业控制
尽管采用统一生成,您仍然可以控制各个元素。通过提示调整情绪、节奏和风格。
实际影响
让我们来描绘一下这能实现什么:
旧工作流程(5小时以上):
- 编写脚本和分镜
- 生成视频片段(30分钟)
- 审查并重新生成问题片段(1小时)
- 单独生成音频(30分钟)
- 打开音频编辑器
- 手动将音频同步到视频(2小时以上)
- 修复同步问题,重新渲染(1小时)
- 导出最终版本
Kling O1工作流程(30分钟):
- 编写描述视听场景的提示
- 生成完整片段
- 如需要则审查和迭代
- 导出
这不是渐进式改进。这是"AI视频生成"含义的类别转变。
对比分析
AI视频领域已经变得拥挤。以下是Kling O1的定位:
- 真正的统一多模态架构
- 原生视听生成
- 强大的动作理解
- 有竞争力的视觉质量
- 设计上无同步瑕疵
- 较新的模型,仍在成熟中
- 生态系统工具少于Runway
- 文档主要为中文
- API访问仍在全球推广中
与当前格局相比:
| 模型 | 视觉质量 | 音频 | 统一架构 | 访问 |
|---|---|---|---|---|
| Runway Gen-4.5 | 竞技场第一 | 后期添加 | 否 | 全球 |
| Sora 2 | 强大 | 原生 | 是 | 受限 |
| Veo 3 | 强大 | 原生 | 是 | API |
| Kling O1 | 强大 | 原生 | 是 | 推广中 |
格局已经转变:统一视听架构正在成为顶级模型的标准。Runway仍是采用独立音频工作流的例外。
中国AI视频推进
快手的Kling是更广泛趋势的一部分。中国科技公司正在以惊人的速度推出令人印象深刻的视频模型。
仅在过去两周内:
- 字节跳动Vidi2:120亿参数开源模型
- 腾讯混元视频1.5:消费级GPU友好(14GB显存)
- 快手Kling O1:首个统一多模态
- 快手Kling 2.6:生产就绪的视听模型
有关开源方面的更多信息,请参见开源AI视频革命。
这并非巧合。这些公司面临芯片出口限制和美国云服务限制。他们的应对方式是:以不同的方式构建,开放发布,在架构创新而非原始算力上竞争。
对创作者的意义
如果您正在制作视频内容,以下是我们的最新思考:
- ✓快速社交内容:Kling 2.6的统一生成非常合适
- ✓最高视觉质量:Runway Gen-4.5仍然领先
- ✓音频优先项目:Kling O1或Sora 2更为适宜
- ✓本地/私密生成:开源方案(混元视频、Vidi2)值得考虑
"正确工具"的答案变得更加复杂了。但这是好事。竞争意味着选择,选择意味着您可以根据任务匹配工具,而不是妥协。
更大的视角
我们正在见证从"AI视频生成"到"AI视听体验生成"的转变。Kling O1与Sora 2和Veo 3一起,成为为目标而构建的模型,而非从起点迭代。
我一直回想的类比是:早期的智能手机是添加了应用的电话。iPhone是可以打电话的计算机。从纸面上看功能相同,但方法根本不同。
Kling O1与Sora 2和Veo 3一样,从头开始就是作为视听系统构建的。早期模型是附加了音频的视频系统。统一方法将声音和视觉视为单一现实不可分割的方面。
亲自尝试
Kling可通过其网络平台访问,API访问正在扩展。如果您想体验统一多模态生成的感觉:
- 从简单的开始:弹跳的球、窗户上的雨
- 注意声音如何属于视觉
- 尝试复杂的:对话、繁忙的街景
- 感受与后期同步音频的差异
这项技术还年轻。有些提示会令人失望。但当它奏效时,您会感受到转变。这不是视频加音频。这是体验生成。
接下来会发生什么
其影响超越了视频创作:
近期(2026年):
- 更长的统一生成
- 实时交互式视听
- 精细控制扩展
- 更多模型采用统一架构
中期(2027年及以后):
- 完整场景理解
- 交互式视听体验
- 虚拟制作工具
- 全新的创意媒介
想象体验和创造体验之间的差距持续缩小。Kling O1不是最终答案,但它是方向的明确信号:统一、整体、体验式。
2025年12月正在成为AI视频的关键月份。Runway的竞技场胜利、字节跳动和腾讯的开源爆发,以及Kling进入统一多模态领域。工具的演变速度超过了任何人的预测。
如果您正在使用AI视频构建,请关注Kling。不是因为它今天在所有方面都是最好的,而是因为它代表了一切明天要去的方向。
AI视频的未来不是更好的视频加上更好的音频。而是统一的视听智能。而这个未来刚刚到来。
来源
- Kling O1 Launch Announcement (Yahoo Finance)
- Kling Video 2.6 with Audio-Visual Generation (PR Newswire)
- Kling O1 Unified Multimodal Model (PR Newswire)
- China Kuaishou Kling O1 Analysis (eWeek)
相关文章
继续探索这些相关文章



