Kandinsky 5.0:俄罗斯的开源AI视频生成方案
Kandinsky 5.0以Apache 2.0许可证在消费级GPU上实现10秒视频生成。我们探讨NABLA attention和flow matching如何使这成为可能。

开源视频领域的转变
当ByteDance开源其视频理解模型,腾讯发布HunyuanVideo时,我们看到了转变的初期迹象。现在,由Sberbank支持的Kandinsky Lab发布了完整的模型系列,任何人都可以在Apache 2.0许可证下运行、修改和商业化使用。
这不是研究预览或受限API。完整的权重、训练代码和推理流程都在GitHub和Hugging Face上公开提供。
模型系列
关于扩散架构的详细信息,请参阅我们的扩散Transformer深度解析。
Kandinsky 5.0不是单一模型,而是由三个模型组成的系列。
Video Lite(20亿参数)
面向消费级硬件的轻量级选项。生成768×512分辨率、24fps、5至10秒的视频。通过内存卸载在12GB显存上运行。蒸馏的16步变体在H100上35至60秒内生成5秒片段。
Video Pro(190亿参数)
追求最高质量的完整模型。输出1280×768、24fps的高清视频。需要数据中心级GPU,但提供与闭源替代方案相媲美的结果。
60亿参数的Image Lite模型完善了系列,支持1280×768或1024×1024分辨率的静态图像生成。
技术架构
Kandinsky 5.0的工程决策展现了一个专注于实际部署而非追求基准的团队。
基础技术:Flow Matching胜过扩散
传统扩散模型学习逐步逆转添加噪声的过程。Flow Matching采取不同方法:通过连续流场学习从噪声到图像的直接路径。优势显著。
NABLA:让长视频成为可能
真正的创新是NABLA,即Neighborhood Adaptive Block-Level Attention(邻域自适应块级注意力)。标准Transformer注意力随序列长度呈二次方扩展。对于视频来说,这是灾难性的。24fps的10秒片段包含240帧,每帧有数千个空间块。对所有这些进行完全注意力计算上不可行。
NABLA通过稀疏注意力模式解决这个问题。它不是关注每帧中的每个块,而是将计算集中在:
- 每帧内的局部空间邻域
- 相邻帧之间的时间邻域
- 学习的全局锚点以实现长距离一致性
结果是随视频长度近乎线性扩展,而非二次方。这使得在消费级硬件上生成10秒视频成为可能。
作为对比,大多数竞争模型在没有专用硬件的情况下难以生成超过5秒的视频。
基于HunyuanVideo构建
Kandinsky 5.0没有从零开始训练一切,而是采用了腾讯HunyuanVideo项目的3D VAE。这个编码器-解码器处理像素空间和扩散过程运行的紧凑潜在空间之间的转换。
文本理解来自视觉语言模型Qwen2.5-VL,结合CLIP嵌入进行语义定位。这种双编码器方法使模型能够理解提示所暗示的字面含义和视觉风格。
性能:当前定位
团队将Video Lite定位为其参数类别中表现最佳的开源模型。基准测试显示:
| 模型 | 参数量 | 最大时长 | 显存(5秒) |
|---|---|---|---|
| Kandinsky Video Lite | 20亿 | 10秒 | 12GB |
| CogVideoX-2B | 20亿 | 6秒 | 16GB |
| Open-Sora 1.2 | 11亿 | 16秒 | 18GB |
12GB显存要求使得在消费级RTX 3090和4090显卡上部署成为可能,这是一个重要的可访问性里程碑。
质量比较更难量化。用户报告表明,Kandinsky产生的运动比CogVideoX更一致,但在照片真实感方面落后于HunyuanVideo。16步蒸馏模型为速度牺牲了一些细节,这种权衡适合原型制作,但可能无法满足最终生产需求。
本地运行Kandinsky
项目提供ComfyUI节点和独立脚本。基本的文本转视频工作流程:
from kandinsky5 import Kandinsky5VideoLite
model = Kandinsky5VideoLite.from_pretrained("kandinskylab/Kandinsky-5.0-T2V-Lite")
model.enable_model_cpu_offload() # 用于12GB显卡
video = model.generate(
prompt="A mountain lake at dawn, mist rising from still water",
num_frames=120, # 24fps时为5秒
guidance_scale=7.0,
num_inference_steps=16
)
video.save("output.mp4")内存卸载在推理期间在CPU和GPU之间移动模型权重。这用速度换取可访问性,允许在较小的显卡上运行更大的模型。
Sberbank的背景
Kandinsky Lab在俄罗斯最大银行Sberbank的人工智能部门Sber AI旗下运营。这种支持解释了项目背后的大量资源:在专有数据上进行多阶段训练、强化学习后训练,以及将完整生产流程开源的工程努力。
地缘政治背景增加了复杂性。西方开发者可能面临避免使用俄罗斯来源模型的组织压力。Apache 2.0许可证在法律上是明确的,但组织政策各不相同。对于个人开发者和小型工作室来说,计算更简单:好技术就是好技术。
请始终验证您特定管辖区和用例的许可和出口合规性。
实际应用
10秒时长和消费级硬件要求开启了特定用例:
社交内容
概念可视化
自定义训练
研究
展望未来
Kandinsky 5.0代表了一个更广泛的趋势:开源和闭源视频生成之间的差距正在缩小。一年前,开源模型生成的是带有明显瑕疵的短时低分辨率片段。今天,消费级硬件上的20亿参数模型生成的10秒高清视频在2023年看来是不可能的。
竞争尚未结束。Sora 2和Runway Gen-4.5等闭源领导者在质量、时长和可控性方面仍然领先。但底线正在提高。对于许多应用来说,开源现在已经足够好了。
总结
Kandinsky 5.0可能不会在每个基准测试中名列前茅,但它在最重要的方面取得了成功:在真实的人拥有的硬件上运行真实的视频生成,在允许真实商业用途的许可证下。在AI视频民主化的竞赛中,俄罗斯团队刚刚将终点线拉近了。
对于探索开源视频生成的开发者来说,Kandinsky 5.0值得列入候选清单。
相关文章
继续探索这些相关文章



