Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
10 min read
226

Kandinsky 5.0:俄罗斯的开源AI视频生成方案

Kandinsky 5.0以Apache 2.0许可证在消费级GPU上实现10秒视频生成。我们探讨NABLA attention和flow matching如何使这成为可能。

Kandinsky 5.0:俄罗斯的开源AI视频生成方案

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

AI创新的地理格局持续变化。当美国实验室追求更大规模的模型,中国企业主导开源排行榜时,一支俄罗斯团队悄然发布了可能是最易获取的AI视频生成器:Kandinsky 5.0。

开源视频领域的转变

当ByteDance开源其视频理解模型,腾讯发布HunyuanVideo时,我们看到了转变的初期迹象。现在,由Sberbank支持的Kandinsky Lab发布了完整的模型系列,任何人都可以在Apache 2.0许可证下运行、修改和商业化使用。

10秒
视频时长
12GB
最小显存
Apache 2.0
许可证

这不是研究预览或受限API。完整的权重、训练代码和推理流程都在GitHub和Hugging Face上公开提供。

模型系列

💡

关于扩散架构的详细信息,请参阅我们的扩散Transformer深度解析

Kandinsky 5.0不是单一模型,而是由三个模型组成的系列。

Video Lite(20亿参数)

面向消费级硬件的轻量级选项。生成768×512分辨率、24fps、5至10秒的视频。通过内存卸载在12GB显存上运行。蒸馏的16步变体在H100上35至60秒内生成5秒片段。

Video Pro(190亿参数)

追求最高质量的完整模型。输出1280×768、24fps的高清视频。需要数据中心级GPU,但提供与闭源替代方案相媲美的结果。

60亿参数的Image Lite模型完善了系列,支持1280×768或1024×1024分辨率的静态图像生成。

技术架构

Kandinsky 5.0的工程决策展现了一个专注于实际部署而非追求基准的团队。

基础技术:Flow Matching胜过扩散

传统扩散模型学习逐步逆转添加噪声的过程。Flow Matching采取不同方法:通过连续流场学习从噪声到图像的直接路径。优势显著。

Flow Matching的优势
更好的训练稳定性、更快的收敛速度,以及推理时更可预测的生成质量。
权衡
需要仔细的路径设计。团队使用最优传输路径来最小化噪声和目标分布之间的距离。

NABLA:让长视频成为可能

真正的创新是NABLA,即Neighborhood Adaptive Block-Level Attention(邻域自适应块级注意力)。标准Transformer注意力随序列长度呈二次方扩展。对于视频来说,这是灾难性的。24fps的10秒片段包含240帧,每帧有数千个空间块。对所有这些进行完全注意力计算上不可行。

NABLA通过稀疏注意力模式解决这个问题。它不是关注每帧中的每个块,而是将计算集中在:

  1. 每帧内的局部空间邻域
  2. 相邻帧之间的时间邻域
  3. 学习的全局锚点以实现长距离一致性

结果是随视频长度近乎线性扩展,而非二次方。这使得在消费级硬件上生成10秒视频成为可能。

💡

作为对比,大多数竞争模型在没有专用硬件的情况下难以生成超过5秒的视频。

基于HunyuanVideo构建

Kandinsky 5.0没有从零开始训练一切,而是采用了腾讯HunyuanVideo项目的3D VAE。这个编码器-解码器处理像素空间和扩散过程运行的紧凑潜在空间之间的转换。

文本理解来自视觉语言模型Qwen2.5-VL,结合CLIP嵌入进行语义定位。这种双编码器方法使模型能够理解提示所暗示的字面含义和视觉风格。

性能:当前定位

团队将Video Lite定位为其参数类别中表现最佳的开源模型。基准测试显示:

模型参数量最大时长显存(5秒)
Kandinsky Video Lite20亿10秒12GB
CogVideoX-2B20亿6秒16GB
Open-Sora 1.211亿16秒18GB

12GB显存要求使得在消费级RTX 3090和4090显卡上部署成为可能,这是一个重要的可访问性里程碑。

质量比较更难量化。用户报告表明,Kandinsky产生的运动比CogVideoX更一致,但在照片真实感方面落后于HunyuanVideo。16步蒸馏模型为速度牺牲了一些细节,这种权衡适合原型制作,但可能无法满足最终生产需求。

本地运行Kandinsky

项目提供ComfyUI节点和独立脚本。基本的文本转视频工作流程:

from kandinsky5 import Kandinsky5VideoLite
 
model = Kandinsky5VideoLite.from_pretrained("kandinskylab/Kandinsky-5.0-T2V-Lite")
model.enable_model_cpu_offload()  # 用于12GB显卡
 
video = model.generate(
    prompt="A mountain lake at dawn, mist rising from still water",
    num_frames=120,  # 24fps时为5秒
    guidance_scale=7.0,
    num_inference_steps=16
)
video.save("output.mp4")

内存卸载在推理期间在CPU和GPU之间移动模型权重。这用速度换取可访问性,允许在较小的显卡上运行更大的模型。

Sberbank的背景

Kandinsky Lab在俄罗斯最大银行Sberbank的人工智能部门Sber AI旗下运营。这种支持解释了项目背后的大量资源:在专有数据上进行多阶段训练、强化学习后训练,以及将完整生产流程开源的工程努力。

地缘政治背景增加了复杂性。西方开发者可能面临避免使用俄罗斯来源模型的组织压力。Apache 2.0许可证在法律上是明确的,但组织政策各不相同。对于个人开发者和小型工作室来说,计算更简单:好技术就是好技术。

⚠️

请始终验证您特定管辖区和用例的许可和出口合规性。

实际应用

10秒时长和消费级硬件要求开启了特定用例:

🎬

社交内容

TikTok、Reels和Shorts的短视频。无需API成本即可快速迭代。
🎨

概念可视化

导演和制片人可以在昂贵的制作之前对场景进行原型设计。
🔧

自定义训练

Apache 2.0许可允许在专有数据集上进行微调。为您的领域构建专业模型。
📚

研究

完全访问权重和架构使视频生成技术的学术研究成为可能。

展望未来

Kandinsky 5.0代表了一个更广泛的趋势:开源和闭源视频生成之间的差距正在缩小。一年前,开源模型生成的是带有明显瑕疵的短时低分辨率片段。今天,消费级硬件上的20亿参数模型生成的10秒高清视频在2023年看来是不可能的。

竞争尚未结束。Sora 2Runway Gen-4.5等闭源领导者在质量、时长和可控性方面仍然领先。但底线正在提高。对于许多应用来说,开源现在已经足够好了。

总结

Kandinsky 5.0可能不会在每个基准测试中名列前茅,但它在最重要的方面取得了成功:在真实的人拥有的硬件上运行真实的视频生成,在允许真实商业用途的许可证下。在AI视频民主化的竞赛中,俄罗斯团队刚刚将终点线拉近了。

对于探索开源视频生成的开发者来说,Kandinsky 5.0值得列入候选清单。

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。