Helios: 在消費級硬體上執行即時AI影片生成的14B模型
來自北京大學、位元組跳動和Canva的Helios僅用6GB顯存透過群組卸載生成長達一分鐘的AI影片,幀率達19.5 FPS,完全開源。

Helios為什麼重要
大多數AI影片模型迫使你做出選擇:品質或速度。像Veo 3.1或Runway Gen-4.5這樣的大型模型產生令人驚豔的效果,但它們執行在雲端運算叢集上並按秒收費。較小的模型適合消費級GPU,但輸出品質明顯較弱。Helios拒絕這種選擇。
關鍵洞察:Helios是一個自迴歸擴散模型,以串流方式逐幀生成影片,而不是一次性去噪整個影片。這意味著它可以立即開始輸出幀,同時繼續生成其餘部分。無需等待整個影片轉譯完成。
運作原理
傳統擴散模型同時處理整個影片。你提交提示詞,等待幾分鐘,然後取得完整的影片。Helios採取了完全不同的方法。
| 傳統擴散模型 | Helios(自迴歸擴散) |
|---|---|
| 同時處理所有幀 | 逐幀生成 |
| 高顯存需求 | 恆定顯存使用 |
| 僅在完全完成時輸出 | 即時串流輸出 |
| 長度增加時品質下降 | 任何長度的一致品質 |
該模型使用雙向時間注意機制,允許每個新幀在滑動窗口內參考過去和未來的上下文。這防止了通常困擾自迴歸影片模型的品質漂移,在自迴歸影片模型中,後續幀逐漸失去與早期幀的一致性。
消費級硬體角度
這就是事情變得實用的地方。透過群組卸載,Helios可以在約6GB顯存的硬體上執行。這正好落在RTX 4060 Ti的範圍內,這款顯卡的成本約為$400。
與基於雲端的生成相比較:
| 方法 | 單位時間影片成本 | 所需硬體 |
|---|---|---|
| 雲API(Sora、Veo) | 每生成$2-8 | 無(雲端) |
| Helios(本地、H100) | 約$0.15電費 | H100($25,000+) |
| Helios(本地、RTX 4060 Ti) | 約$0.01電費 | RTX 4060 Ti(~$400) |
使用消費級GPU的權衡是速度。在RTX 4060 Ti上,你不會達到19.5 FPS。預期接近2-3 FPS,這仍然意味著60秒影片在不到10分鐘內完成。對於本地、隱私、無限生成,這很有吸引力。
支持這些主張的基準測試
Helios不僅聲稱即時性能。它在標準影片品質基準上的得分具有競爭力。
研究團隊是北京大學、位元組跳動和Canva之間的合作,專門針對以下模型進行了測試:
- CogVideoX(13B參數):Helios以5-10倍更快的生成速度匹配品質
- Pyramid Flow(自迴歸基線):Helios生成時間一致性更高的輸出
- Open-Sora v1.2:Helios生成更長、更連貫的影片片段
關鍵比較是與1-2B參數範圍內的模型,如LTX-2和較小的CogVideo變體。Helios以類似的速度執行,同時生成看起來像來自更大模型的輸出。
你實際上可以用它做什麼
Helios不是一個研究好奇心。它是一個實用工具,你可以立即安裝和執行。
- ✓文字生成長達60秒的影片
- ✓從參考幀進行影像到影片動畫
- ✓即時串流輸出(生成時開始觀看)
- ✓Apache 2.0授權(允許商業使用)
- ✓群組卸載支持消費級GPU
Apache 2.0授權很重要。與許多限制商業使用的開放權重模型不同,Helios明確允許商業使用。這為獨立開發者、小型工作室和新創公司打開了在模型之上建構產品的大門,無需授權費用。
更大的圖景
Helios改變了我們處理AI影片可用性的方式。上一代「開放」影片模型要麼需要企業級硬體,要麼產生明顯不如雲對應物的結果。
對於每個專案生成數百次迭代的專業人士,經濟學變化顯著。$400的GPU在大約200-300次雲生成後就能收回成本。對於在產品中實驗AI影片的團隊,本地生成的無限性質消除了實驗的猶豫。
我們在我們的本地執行AI影片指南中涵蓋了不斷增長的本地生成生態系統,Helios直接融入了該工作流程。它還建立在我們用TurboDiffusion撰寫的即時生成突破之上,使用更大的模型將概念推進得更遠。
接下來會發生什麼
Helios團隊已經暗示了音視訊生成和互動式控制能力的後續工作。如果應用相同的效率收益,我們可能會在2026年底看到消費級硬體上的即時、可控、包含音訊的影片生成。
目前,Helios在GitHub上以Apache 2.0授權提供。如果你有6GB+顯存的NVIDIA GPU並想實驗真正具有競爭力的本地AI影片生成,這是最強的入門點。
相關閱讀: 瞭解開源模型如何縮小與專有平台的差距,或探索LTX-2對消費級GPU上原生4K生成的方法。
相關文章
繼續探索這些相關文章

字節跳動Vidi2:像編輯師一樣理解視訊的AI
字節跳動開源了Vidi2,一個擁有120億參數的模型,能夠深入理解視訊內容,自動將數小時的素材編輯成精良的片段。該技術已為TikTok智慧剪輯功能提供支援。

SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

Seedance 2.0 進駐 CapCut,好萊塢不買帳
字節跳動在 Sora 停止服務兩天後,將爭議性 AI 影片模型上線 CapCut。這件事為什麼重要,好萊塢又為什麼全面反擊。
