Helios: 在消费级硬件上运行实时AI视频生成的14B模型
来自北京大学、字节跳动和Canva的Helios仅用6GB显存通过组卸载生成长达一分钟的AI视频,帧率达19.5 FPS,完全开源。

Helios为什么重要
大多数AI视频模型迫使你做出选择:质量或速度。像Veo 3.1或Runway Gen-4.5这样的大型模型产生令人惊艳的效果,但它们运行在云计算集群上并按秒收费。较小的模型适合消费级GPU,但输出质量明显较弱。Helios拒绝这种选择。
关键洞察:Helios是一个自回归扩散模型,以流式方式逐帧生成视频,而不是一次性去噪整个视频。这意味着它可以立即开始输出帧,同时继续生成其余部分。无需等待整个视频渲染完成。
工作原理
传统扩散模型同时处理整个视频。你提交提示词,等待几分钟,然后得到完整的视频。Helios采取了完全不同的方法。
| 传统扩散模型 | Helios(自回归扩散) |
|---|---|
| 同时处理所有帧 | 逐帧生成 |
| 高显存需求 | 恒定显存使用 |
| 仅在完全完成时输出 | 实时流式输出 |
| 长度增加时质量下降 | 任何长度的一致质量 |
该模型使用双向时间注意机制,允许每个新帧在滑动窗口内参考过去和未来的上下文。这防止了通常困扰自回归视频模型的质量漂移,在自回归视频模型中,后续帧逐渐失去与早期帧的一致性。
消费级硬件角度
这就是事情变得实用的地方。通过组卸载,Helios可以在约6GB显存的硬件上运行。这正好落在RTX 4060 Ti的范围内,这款显卡的成本约为$400。
与基于云的生成相比较:
| 方法 | 单位时间视频成本 | 所需硬件 |
|---|---|---|
| 云API(Sora、Veo) | 每生成$2-8 | 无(云) |
| Helios(本地、H100) | 约$0.15电费 | H100($25,000+) |
| Helios(本地、RTX 4060 Ti) | 约$0.01电费 | RTX 4060 Ti(~$400) |
使用消费级GPU的权衡是速度。在RTX 4060 Ti上,你不会达到19.5 FPS。预期接近2-3 FPS,这仍然意味着60秒视频在不到10分钟内完成。对于本地、隐私、无限生成,这很有吸引力。
支持这些主张的基准测试
Helios不仅声称实时性能。它在标准视频质量基准上的得分具有竞争力。
研究团队是北京大学、字节跳动和Canva之间的合作,专门针对以下模型进行了测试:
- CogVideoX(13B参数):Helios以5-10倍更快的生成速度匹配质量
- Pyramid Flow(自回归基线):Helios生成时间一致性更高的输出
- Open-Sora v1.2:Helios生成更长、更连贯的视频片段
关键比较是与1-2B参数范围内的模型,如LTX-2和较小的CogVideo变体。Helios以类似的速度运行,同时生成看起来像来自更大模型的输出。
你实际上可以用它做什么
Helios不是一个研究好奇心。它是一个实用工具,你可以立即安装和运行。
- ✓文本生成长达60秒的视频
- ✓从参考帧进行图像到视频动画
- ✓实时流式输出(生成时开始观看)
- ✓Apache 2.0许可(允许商业使用)
- ✓组卸载支持消费级GPU
Apache 2.0许可证很重要。与许多限制商业使用的开放权重模型不同,Helios明确允许商业使用。这为独立开发者、小型工作室和初创公司打开了在模型之上构建产品的大门,无需许可费用。
更大的图景
Helios改变了我们处理AI视频可访问性的方式。上一代"开放"视频模型要么需要企业级硬件,要么产生明显不如云对应物的结果。
对于每个项目生成数百次迭代的专业人士,经济学变化显著。$400的GPU在大约200-300次云生成后就能收回成本。对于在产品中实验AI视频的团队,本地生成的无限性质消除了实验的犹豫。
我们在我们的本地运行AI视频指南中涵盖了不断增长的本地生成生态系统,Helios直接融入了该工作流程。它还建立在我们用TurboDiffusion撰写的实时生成突破之上,使用更大的模型将概念推进得更远。
接下来会发生什么
Helios团队已经暗示了音视频生成和交互式控制能力的后续工作。如果应用相同的效率收益,我们可能会在2026年底看到消费级硬件上的实时、可控、包含音频的视频生成。
目前,Helios在GitHub上以Apache 2.0许可证提供。如果你有6GB+显存的NVIDIA GPU并想实验真正具有竞争力的本地AI视频生成,这是最强的入门点。
相关阅读: 了解开源模型如何缩小与专有平台的差距,或探索LTX-2对消费级GPU上原生4K生成的方法。
相关文章
继续探索这些相关文章

字节跳动Vidi2:像编辑师一样理解视频的AI
字节跳动开源了Vidi2,一个拥有120亿参数的模型,能够深入理解视频内容,自动将数小时的素材编辑成精良的片段。该技术已为抖音智能剪辑功能提供支持。

SkyReels V4:首个能同时看与听的AI模型
Skywork AI的SkyReels V4引入了双流扩散架构,可在一次生成过程中同步产出视频和音频。这对创作者意味着什么?

Seedance 2.0 登陆剪映,好莱坞坐不住了
字节跳动在 Sora 停服两天后,将争议性 AI 视频模型上线剪映。这件事为什么重要,好莱坞又为什么全面反击。
