Kandinsky 5.0:俄羅斯的開源AI影片生成方案
Kandinsky 5.0以Apache 2.0授權在消費級GPU上實現10秒影片生成。我們探討NABLA attention和flow matching如何使這成為可能。

開源影片領域的轉變
當ByteDance開源其影片理解模型,騰訊發布HunyuanVideo時,我們看到了轉變的初期跡象。現在,由Sberbank支持的Kandinsky Lab發布了完整的模型系列,任何人都可以在Apache 2.0授權下執行、修改和商業化使用。
這不是研究預覽或受限API。完整的權重、訓練程式碼和推論流程都在GitHub和Hugging Face上公開提供。
模型系列
關於擴散架構的詳細資訊,請參閱我們的擴散Transformer深度解析。
Kandinsky 5.0不是單一模型,而是由三個模型組成的系列。
Video Lite(20億參數)
面向消費級硬體的輕量級選項。生成768×512解析度、24fps、5至10秒的影片。透過記憶體卸載在12GB顯存上執行。蒸餾的16步變體在H100上35至60秒內生成5秒片段。
Video Pro(190億參數)
追求最高品質的完整模型。輸出1280×768、24fps的高畫質影片。需要資料中心級GPU,但提供與閉源替代方案相媲美的結果。
60億參數的Image Lite模型完善了系列,支援1280×768或1024×1024解析度的靜態影像生成。
技術架構
Kandinsky 5.0的工程決策展現了一個專注於實際部署而非追求基準的團隊。
基礎技術:Flow Matching勝過擴散
傳統擴散模型學習逐步逆轉添加雜訊的過程。Flow Matching採取不同方法:透過連續流場學習從雜訊到影像的直接路徑。優勢顯著。
NABLA:讓長影片成為可能
真正的創新是NABLA,即Neighborhood Adaptive Block-Level Attention(鄰域自適應區塊級注意力)。標準Transformer注意力隨序列長度呈二次方擴展。對於影片來說,這是災難性的。24fps的10秒片段包含240幀,每幀有數千個空間區塊。對所有這些進行完全注意力計算上不可行。
NABLA透過稀疏注意力模式解決這個問題。它不是關注每幀中的每個區塊,而是將計算集中在:
- 每幀內的局部空間鄰域
- 相鄰幀之間的時間鄰域
- 學習的全域錨點以實現長距離一致性
結果是隨影片長度近乎線性擴展,而非二次方。這使得在消費級硬體上生成10秒影片成為可能。
作為對比,大多數競爭模型在沒有專用硬體的情況下難以生成超過5秒的影片。
基於HunyuanVideo建構
Kandinsky 5.0沒有從零開始訓練一切,而是採用了騰訊HunyuanVideo專案的3D VAE。這個編碼器-解碼器處理像素空間和擴散過程運作的緊湊潛在空間之間的轉換。
文字理解來自視覺語言模型Qwen2.5-VL,結合CLIP嵌入進行語義定位。這種雙編碼器方法使模型能夠理解提示所暗示的字面含義和視覺風格。
效能:當前定位
團隊將Video Lite定位為其參數類別中表現最佳的開源模型。基準測試顯示:
| 模型 | 參數量 | 最大時長 | 顯存(5秒) |
|---|---|---|---|
| Kandinsky Video Lite | 20億 | 10秒 | 12GB |
| CogVideoX-2B | 20億 | 6秒 | 16GB |
| Open-Sora 1.2 | 11億 | 16秒 | 18GB |
12GB顯存要求使得在消費級RTX 3090和4090顯示卡上部署成為可能,這是一個重要的可存取性里程碑。
品質比較更難量化。使用者報告表明,Kandinsky產生的運動比CogVideoX更一致,但在照片真實感方面落後於HunyuanVideo。16步蒸餾模型為速度犧牲了一些細節,這種權衡適合原型製作,但可能無法滿足最終生產需求。
本地執行Kandinsky
專案提供ComfyUI節點和獨立腳本。基本的文字轉影片工作流程:
from kandinsky5 import Kandinsky5VideoLite
model = Kandinsky5VideoLite.from_pretrained("kandinskylab/Kandinsky-5.0-T2V-Lite")
model.enable_model_cpu_offload() # 用於12GB顯示卡
video = model.generate(
prompt="A mountain lake at dawn, mist rising from still water",
num_frames=120, # 24fps時為5秒
guidance_scale=7.0,
num_inference_steps=16
)
video.save("output.mp4")記憶體卸載在推論期間在CPU和GPU之間移動模型權重。這用速度換取可存取性,允許在較小的顯示卡上執行更大的模型。
Sberbank的背景
Kandinsky Lab在俄羅斯最大銀行Sberbank的人工智慧部門Sber AI旗下營運。這種支持解釋了專案背後的大量資源:在專有資料上進行多階段訓練、強化學習後訓練,以及將完整生產流程開源的工程努力。
地緣政治背景增加了複雜性。西方開發者可能面臨避免使用俄羅斯來源模型的組織壓力。Apache 2.0授權在法律上是明確的,但組織政策各不相同。對於個人開發者和小型工作室來說,計算更簡單:好技術就是好技術。
請始終驗證您特定管轄區和使用案例的授權和出口合規性。
實際應用
10秒時長和消費級硬體要求開啟了特定使用案例:
社群內容
概念視覺化
自訂訓練
研究
展望未來
Kandinsky 5.0代表了一個更廣泛的趨勢:開源和閉源影片生成之間的差距正在縮小。一年前,開源模型生成的是帶有明顯瑕疵的短時低解析度片段。今天,消費級硬體上的20億參數模型生成的10秒高畫質影片在2023年看來是不可能的。
競爭尚未結束。Sora 2和Runway Gen-4.5等閉源領導者在品質、時長和可控性方面仍然領先。但底線正在提高。對於許多應用來說,開源現在已經足夠好了。
總結
Kandinsky 5.0可能不會在每個基準測試中名列前茅,但它在最重要的方面取得了成功:在真實的人擁有的硬體上執行真實的影片生成,在允許真實商業用途的授權下。在AI影片民主化的競賽中,俄羅斯團隊剛剛將終點線拉近了。
對於探索開源影片生成的開發者來說,Kandinsky 5.0值得列入候選清單。
相關文章
繼續探索這些相關文章



