Meta Pixel跳到主要内容
DamienDamien· AI 作者,经人工审核
8 min read
161

Helios: 在消费级硬件上运行实时AI视频生成的14B模型

来自北京大学、字节跳动和Canva的Helios仅用6GB显存通过组卸载生成长达一分钟的AI视频,帧率达19.5 FPS,完全开源。

Helios: 在消费级硬件上运行实时AI视频生成的14B模型

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

实时AI视频生成的最大瓶颈一直是计算能力。来自北京大学、字节跳动和Canva的新型14B参数模型Helios刚刚打破了这个障碍。它在单个H100上以19.5帧每秒的速度运行,生成长达60秒的视频,仅需约6GB显存(通过组卸载),而且采用Apache 2.0许可证。

Helios为什么重要

大多数AI视频模型迫使你做出选择:质量或速度。像Veo 3.1或Runway Gen-4.5这样的大型模型产生令人惊艳的效果,但它们运行在云计算集群上并按秒收费。较小的模型适合消费级GPU,但输出质量明显较弱。Helios拒绝这种选择。

14B
参数数量
19.5
单个H100上的FPS
~6GB
带组卸载的显存
60s
最大视频长度

关键洞察:Helios是一个自回归扩散模型,以流式方式逐帧生成视频,而不是一次性去噪整个视频。这意味着它可以立即开始输出帧,同时继续生成其余部分。无需等待整个视频渲染完成。

工作原理

传统扩散模型同时处理整个视频。你提交提示词,等待几分钟,然后得到完整的视频。Helios采取了完全不同的方法。

传统扩散模型Helios(自回归扩散)
同时处理所有帧逐帧生成
高显存需求恒定显存使用
仅在完全完成时输出实时流式输出
长度增加时质量下降任何长度的一致质量

该模型使用双向时间注意机制,允许每个新帧在滑动窗口内参考过去和未来的上下文。这防止了通常困扰自回归视频模型的质量漂移,在自回归视频模型中,后续帧逐渐失去与早期帧的一致性。

💡
Helios无需依赖KV-cache技巧或防漂移黑客即可实现长达一分钟的视频(最多1,452帧)。架构本身保持了一致性。

消费级硬件角度

这就是事情变得实用的地方。通过组卸载,Helios可以在约6GB显存的硬件上运行。这正好落在RTX 4060 Ti的范围内,这款显卡的成本约为$400。

与基于云的生成相比较:

方法单位时间视频成本所需硬件
云API(Sora、Veo)每生成$2-8无(云)
Helios(本地、H100)约$0.15电费H100($25,000+)
Helios(本地、RTX 4060 Ti)约$0.01电费RTX 4060 Ti(~$400)

使用消费级GPU的权衡是速度。在RTX 4060 Ti上,你不会达到19.5 FPS。预期接近2-3 FPS,这仍然意味着60秒视频在不到10分钟内完成。对于本地、隐私、无限生成,这很有吸引力。

支持这些主张的基准测试

Helios不仅声称实时性能。它在标准视频质量基准上的得分具有竞争力。

💡
在VBench上,Helios在运动质量、时间一致性和美学评分等方面与类似参数数量的模型相匹配或超越。完整的基准测试结果可在论文中获得(arXiv:2603.04379)。

研究团队是北京大学、字节跳动和Canva之间的合作,专门针对以下模型进行了测试:

  • CogVideoX(13B参数):Helios以5-10倍更快的生成速度匹配质量
  • Pyramid Flow(自回归基线):Helios生成时间一致性更高的输出
  • Open-Sora v1.2:Helios生成更长、更连贯的视频片段

关键比较是与1-2B参数范围内的模型,如LTX-2和较小的CogVideo变体。Helios以类似的速度运行,同时生成看起来像来自更大模型的输出。

你实际上可以用它做什么

Helios不是一个研究好奇心。它是一个实用工具,你可以立即安装和运行。

  • 文本生成长达60秒的视频
  • 从参考帧进行图像到视频动画
  • 实时流式输出(生成时开始观看)
  • Apache 2.0许可(允许商业使用)
  • 组卸载支持消费级GPU

Apache 2.0许可证很重要。与许多限制商业使用的开放权重模型不同,Helios明确允许商业使用。这为独立开发者、小型工作室和初创公司打开了在模型之上构建产品的大门,无需许可费用。

更大的图景

Helios改变了我们处理AI视频可访问性的方式。上一代"开放"视频模型要么需要企业级硬件,要么产生明显不如云对应物的结果。

云生成
不需要硬件投资,最高质量输出,不断更新的模型
本地生成(Helios)
零生成成本,完全隐私,无速率限制,商业友好的许可证,离线可用

对于每个项目生成数百次迭代的专业人士,经济学变化显著。$400的GPU在大约200-300次云生成后就能收回成本。对于在产品中实验AI视频的团队,本地生成的无限性质消除了实验的犹豫。

我们在我们的本地运行AI视频指南中涵盖了不断增长的本地生成生态系统,Helios直接融入了该工作流程。它还建立在我们用TurboDiffusion撰写的实时生成突破之上,使用更大的模型将概念推进得更远。

接下来会发生什么

Helios团队已经暗示了音视频生成交互式控制能力的后续工作。如果应用相同的效率收益,我们可能会在2026年底看到消费级硬件上的实时、可控、包含音频的视频生成。

目前,Helios在GitHub上以Apache 2.0许可证提供。如果你有6GB+显存的NVIDIA GPU并想实验真正具有竞争力的本地AI视频生成,这是最强的入门点。

💡

相关阅读: 了解开源模型如何缩小与专有平台的差距,或探索LTX-2对消费级GPU上原生4K生成的方法

Damien
DamienAI DeveloperAI Author

来自里昂的 AI 开发者,热衷于将复杂的 ML 概念转化为简单易懂的方法。不调试模型时,您会发现他骑行在罗讷河谷。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。