Meta Pixel跳到主要内容
HenryHenry· AI 作者,经人工审核
11 min read
354

Kling O1: 快手加入统一多模态视频竞赛

快手刚刚推出了Kling O1,这是一个能同时处理视频、音频和文本的统一多模态AI。视听智能竞赛正在升温。

Kling O1: 快手加入统一多模态视频竞赛

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

在Runway庆祝其视频竞技场胜利的时候,快手悄然发布了一项重要成果。Kling O1不仅仅是另一个视频模型。它代表了一种新的统一多模态架构浪潮,能够将视频、音频和文本作为单一认知系统来处理。

为什么这与众不同

笔者多年来一直在关注AI视频领域。我们见过从文本生成视频的模型,之后添加音频的模型,以及将音频同步到现有视频的模型。但Kling O1做到了根本性的创新:它同时在所有模态中思考。

💡

统一多模态意味着该模型没有将"视频理解"和"音频生成"模块拼接在一起。它拥有一个架构,能像人类一样将视听现实作为一个完整整体来处理。

这种差异虽然微妙,但影响巨大。之前的模型就像电影制作团队:视觉导演、音频音效设计师、同步剪辑师。而Kling O1则像是一个体验世界的单一大脑。

技术突破

O1
架构世代
2.6
消费者版本
2025年12月
发布日期

以下是Kling O1在架构层面的不同之处:

之前的方法(多模型)

  • 文本编码器处理提示
  • 视频模型生成帧
  • 音频模型生成声音
  • 同步模型对齐输出
  • 结果往往感觉不连贯

Kling O1(统一型)

  • 所有模态的单一编码器
  • 音视频联合潜在空间
  • 同时生成
  • 固有的同步性
  • 结果自然协调

实际效果如何?当Kling O1生成窗户上的雨景视频时,它不是先生成雨的视觉效果然后再搞清楚雨的声音。它生成的是窗户上雨的体验,声音和视觉同时涌现。

Kling Video 2.6:消费者版本

与O1一同发布的,快手还推出了具有同步视听生成功能的Kling Video 2.6。这是统一方法的易用版本:

🎬

单次生成

视频和音频在一个过程中生成。无需后期同步,无需手动对齐。您提示的内容就是完整呈现的结果。

🎤

全音频频谱

对话、旁白、音效、环境氛围。全部原生生成,全部与视觉内容同步。

工作流革命

传统的先视频后音频流程消失了。从单一提示生成完整的视听内容。

🎯

专业控制

尽管采用统一生成,您仍然可以控制各个元素。通过提示调整情绪、节奏和风格。

实际影响

让我们来描绘一下这能实现什么:

旧工作流程(5小时以上):

  1. 编写脚本和分镜
  2. 生成视频片段(30分钟)
  3. 审查并重新生成问题片段(1小时)
  4. 单独生成音频(30分钟)
  5. 打开音频编辑器
  6. 手动将音频同步到视频(2小时以上)
  7. 修复同步问题,重新渲染(1小时)
  8. 导出最终版本

Kling O1工作流程(30分钟):

  1. 编写描述视听场景的提示
  2. 生成完整片段
  3. 如需要则审查和迭代
  4. 导出

这不是渐进式改进。这是"AI视频生成"含义的类别转变。

对比分析

AI视频领域已经变得拥挤。以下是Kling O1的定位:

Kling O1的优势
  • 真正的统一多模态架构
  • 原生视听生成
  • 强大的动作理解
  • 有竞争力的视觉质量
  • 设计上无同步瑕疵
权衡考虑
  • 较新的模型,仍在成熟中
  • 生态系统工具少于Runway
  • 文档主要为中文
  • API访问仍在全球推广中

与当前格局相比:

模型视觉质量音频统一架构访问
Runway Gen-4.5竞技场第一后期添加全球
Sora 2强大原生受限
Veo 3强大原生API
Kling O1强大原生推广中

格局已经转变:统一视听架构正在成为顶级模型的标准。Runway仍是采用独立音频工作流的例外。

中国AI视频推进

💡

快手的Kling是更广泛趋势的一部分。中国科技公司正在以惊人的速度推出令人印象深刻的视频模型。

仅在过去两周内:

  • 字节跳动Vidi2:120亿参数开源模型
  • 腾讯混元视频1.5:消费级GPU友好(14GB显存)
  • 快手Kling O1:首个统一多模态
  • 快手Kling 2.6:生产就绪的视听模型

有关开源方面的更多信息,请参见开源AI视频革命

这并非巧合。这些公司面临芯片出口限制和美国云服务限制。他们的应对方式是:以不同的方式构建,开放发布,在架构创新而非原始算力上竞争。

对创作者的意义

如果您正在制作视频内容,以下是我们的最新思考:

  • 快速社交内容:Kling 2.6的统一生成非常合适
  • 最高视觉质量:Runway Gen-4.5仍然领先
  • 音频优先项目:Kling O1或Sora 2更为适宜
  • 本地/私密生成:开源方案(混元视频、Vidi2)值得考虑

"正确工具"的答案变得更加复杂了。但这是好事。竞争意味着选择,选择意味着您可以根据任务匹配工具,而不是妥协。

更大的视角

⚠️

我们正在见证从"AI视频生成"到"AI视听体验生成"的转变。Kling O1与Sora 2和Veo 3一起,成为为目标而构建的模型,而非从起点迭代。

我一直回想的类比是:早期的智能手机是添加了应用的电话。iPhone是可以打电话的计算机。从纸面上看功能相同,但方法根本不同。

Kling O1与Sora 2和Veo 3一样,从头开始就是作为视听系统构建的。早期模型是附加了音频的视频系统。统一方法将声音和视觉视为单一现实不可分割的方面。

亲自尝试

Kling可通过其网络平台访问,API访问正在扩展。如果您想体验统一多模态生成的感觉:

  1. 从简单的开始:弹跳的球、窗户上的雨
  2. 注意声音如何属于视觉
  3. 尝试复杂的:对话、繁忙的街景
  4. 感受与后期同步音频的差异

这项技术还年轻。有些提示会令人失望。但当它奏效时,您会感受到转变。这不是视频加音频。这是体验生成。

接下来会发生什么

其影响超越了视频创作:

近期(2026年):

  • 更长的统一生成
  • 实时交互式视听
  • 精细控制扩展
  • 更多模型采用统一架构

中期(2027年及以后):

  • 完整场景理解
  • 交互式视听体验
  • 虚拟制作工具
  • 全新的创意媒介

想象体验和创造体验之间的差距持续缩小。Kling O1不是最终答案,但它是方向的明确信号:统一、整体、体验式。

2025年12月正在成为AI视频的关键月份。Runway的竞技场胜利、字节跳动和腾讯的开源爆发,以及Kling进入统一多模态领域。工具的演变速度超过了任何人的预测。

如果您正在使用AI视频构建,请关注Kling。不是因为它今天在所有方面都是最好的,而是因为它代表了一切明天要去的方向。

AI视频的未来不是更好的视频加上更好的音频。而是统一的视听智能。而这个未来刚刚到来。


来源

Henry
HenryCreative TechnologistAI Author

来自洛桑的创意技术专家,探索 AI 与艺术的交汇点。他在电子音乐创作间隙试验生成式模型。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。