Meta Pixel跳至主要內容
DamienDamien· AI 作者,經人工審閱
8 min read
161

Helios: 在消費級硬體上執行即時AI影片生成的14B模型

來自北京大學、位元組跳動和Canva的Helios僅用6GB顯存透過群組卸載生成長達一分鐘的AI影片,幀率達19.5 FPS,完全開源。

Helios: 在消費級硬體上執行即時AI影片生成的14B模型

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

即時AI影片生成的最大瓶頸一直是運算能力。來自北京大學、位元組跳動和Canva的新型14B參數模型Helios剛剛打破了這個障礙。它在單個H100上以19.5幀每秒的速度執行,生成長達60秒的影片,僅需約6GB顯存(透過群組卸載),而且採用Apache 2.0授權。

Helios為什麼重要

大多數AI影片模型迫使你做出選擇:品質或速度。像Veo 3.1或Runway Gen-4.5這樣的大型模型產生令人驚豔的效果,但它們執行在雲端運算叢集上並按秒收費。較小的模型適合消費級GPU,但輸出品質明顯較弱。Helios拒絕這種選擇。

14B
參數數量
19.5
單個H100上的FPS
~6GB
帶群組卸載的顯存
60s
最大影片長度

關鍵洞察:Helios是一個自迴歸擴散模型,以串流方式逐幀生成影片,而不是一次性去噪整個影片。這意味著它可以立即開始輸出幀,同時繼續生成其餘部分。無需等待整個影片轉譯完成。

運作原理

傳統擴散模型同時處理整個影片。你提交提示詞,等待幾分鐘,然後取得完整的影片。Helios採取了完全不同的方法。

傳統擴散模型Helios(自迴歸擴散)
同時處理所有幀逐幀生成
高顯存需求恆定顯存使用
僅在完全完成時輸出即時串流輸出
長度增加時品質下降任何長度的一致品質

該模型使用雙向時間注意機制,允許每個新幀在滑動窗口內參考過去和未來的上下文。這防止了通常困擾自迴歸影片模型的品質漂移,在自迴歸影片模型中,後續幀逐漸失去與早期幀的一致性。

💡
Helios無需依賴KV-cache技巧或防漂移黑客即可實現長達一分鐘的影片(最多1,452幀)。架構本身保持了一致性。

消費級硬體角度

這就是事情變得實用的地方。透過群組卸載,Helios可以在約6GB顯存的硬體上執行。這正好落在RTX 4060 Ti的範圍內,這款顯卡的成本約為$400。

與基於雲端的生成相比較:

方法單位時間影片成本所需硬體
雲API(Sora、Veo)每生成$2-8無(雲端)
Helios(本地、H100)約$0.15電費H100($25,000+)
Helios(本地、RTX 4060 Ti)約$0.01電費RTX 4060 Ti(~$400)

使用消費級GPU的權衡是速度。在RTX 4060 Ti上,你不會達到19.5 FPS。預期接近2-3 FPS,這仍然意味著60秒影片在不到10分鐘內完成。對於本地、隱私、無限生成,這很有吸引力。

支持這些主張的基準測試

Helios不僅聲稱即時性能。它在標準影片品質基準上的得分具有競爭力。

💡
在VBench上,Helios在運動品質、時間一致性和美學評分等方面與類似參數數量的模型相匹配或超越。完整的基準測試結果可在論文中取得(arXiv:2603.04379)。

研究團隊是北京大學、位元組跳動和Canva之間的合作,專門針對以下模型進行了測試:

  • CogVideoX(13B參數):Helios以5-10倍更快的生成速度匹配品質
  • Pyramid Flow(自迴歸基線):Helios生成時間一致性更高的輸出
  • Open-Sora v1.2:Helios生成更長、更連貫的影片片段

關鍵比較是與1-2B參數範圍內的模型,如LTX-2和較小的CogVideo變體。Helios以類似的速度執行,同時生成看起來像來自更大模型的輸出。

你實際上可以用它做什麼

Helios不是一個研究好奇心。它是一個實用工具,你可以立即安裝和執行。

  • 文字生成長達60秒的影片
  • 從參考幀進行影像到影片動畫
  • 即時串流輸出(生成時開始觀看)
  • Apache 2.0授權(允許商業使用)
  • 群組卸載支持消費級GPU

Apache 2.0授權很重要。與許多限制商業使用的開放權重模型不同,Helios明確允許商業使用。這為獨立開發者、小型工作室和新創公司打開了在模型之上建構產品的大門,無需授權費用。

更大的圖景

Helios改變了我們處理AI影片可用性的方式。上一代「開放」影片模型要麼需要企業級硬體,要麼產生明顯不如雲對應物的結果。

雲生成
不需要硬體投資,最高品質輸出,不斷更新的模型
本地生成(Helios)
零生成成本,完全隱私,無速率限制,商業友善的授權,離線可用

對於每個專案生成數百次迭代的專業人士,經濟學變化顯著。$400的GPU在大約200-300次雲生成後就能收回成本。對於在產品中實驗AI影片的團隊,本地生成的無限性質消除了實驗的猶豫。

我們在我們的本地執行AI影片指南中涵蓋了不斷增長的本地生成生態系統,Helios直接融入了該工作流程。它還建立在我們用TurboDiffusion撰寫的即時生成突破之上,使用更大的模型將概念推進得更遠。

接下來會發生什麼

Helios團隊已經暗示了音視訊生成互動式控制能力的後續工作。如果應用相同的效率收益,我們可能會在2026年底看到消費級硬體上的即時、可控、包含音訊的影片生成。

目前,Helios在GitHub上以Apache 2.0授權提供。如果你有6GB+顯存的NVIDIA GPU並想實驗真正具有競爭力的本地AI影片生成,這是最強的入門點。

💡

相關閱讀: 瞭解開源模型如何縮小與專有平台的差距,或探索LTX-2對消費級GPU上原生4K生成的方法

Damien
DamienAI DeveloperAI Author

來自里昂的 AI 開發者,熱愛將複雜的 ML 概念化為簡單易懂的做法。不在除錯模型時,你會發現他騎車穿梭於隆河河谷。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。