Helios: 消費者向けハードウェアで動作するリアルタイムAIビデオ生成14Bモデル
北京大学、ByteDance、Canvaが開発したHeliosは、わずか6GBのVRAMでグループオフロードを使用して、19.5 FPSで最大60秒のAIビデオを生成します。完全にオープンソースです。

Heliosが重要な理由
ほとんどのAIビデオモデルは、品質か速度かの選択を強いられます。Veo 3.1やRunway Gen-4.5のような大規模モデルは素晴らしい結果を生成しますが、クラウドクラスタで実行され、秒単位で課金されます。より小さいモデルは消費者向けGPUに適合しますが、明らかに弱い出力を生成します。Heliosはその選択を拒否します。
主な洞察:Heliosは、ビデオ全体を同時にノイズ除去するのではなく、ストリーミング方式でフレームバイフレームでビデオを生成する自己回帰拡散モデルです。つまり、残りを生成しながら、すぐにフレームを出力開始できます。完全なクリップレンダリングを待つ必要はありません。
動作方法
従来の拡散モデルはビデオ全体を同時に処理します。プロンプトを送信し、数分待ってから、完全なクリップを取得します。Heliosは根本的に異なるアプローチを採用しています。
| 従来の拡散 | Helios(自己回帰拡散) |
|---|---|
| すべてのフレームを同時処理 | フレームバイフレーム生成 |
| 高いメモリ要件 | 一定のメモリ使用量 |
| 完全完了時のみ出力 | リアルタイムストリーミング出力 |
| 長さが増すと品質が低下 | あらゆる長さで一貫した品質 |
このモデルは双方向時間的注意機構を使用しており、各新フレームがスライディングウィンドウ内の過去および未来のコンテキストを参照できます。これにより、自己回帰ビデオモデルを悩ませる品質ドリフトを防ぎます。自己回帰ビデオモデルでは、後のフレームが徐々に前のフレームとの一貫性を失うことがあります。
消費者向けハードウェアの角度
ここが実用的になる部分です。グループオフロードにより、Heliosは約6GBのVRAMを備えたハードウェアで実行できます。これはRTX 4060 Tiの領域内に収まり、このカードは約$400の費用がかかります。
クラウドベース生成と比較してください:
| 方法 | 1分間のビデオあたりのコスト | 必要なハードウェア |
|---|---|---|
| クラウドAPI(Sora、Veo) | 生成あたり$2-8 | なし(クラウド) |
| Helios(ローカル、H100) | 電気代約$0.15 | H100($25,000+) |
| Helios(ローカル、RTX 4060 Ti) | 電気代約$0.01 | RTX 4060 Ti(~$400) |
消費者向けGPUを使用する場合の代償は速度です。RTX 4060 Tiでは19.5 FPSに達しません。2~3 FPS程度が見込めます。これでも60秒ビデオが10分未満で完成します。ローカル、プライベート、無制限生成の場合、これは魅力的です。
主張を裏付けるベンチマーク
Heliosはリアルタイムパフォーマンスだけを主張していません。標準的なビデオ品質ベンチマークで競争力のあるスコアを記録しています。
研究チームは北京大学、ByteDance、Canvaのコラボレーションで、以下に対して特に検査しました:
- CogVideoX(13Bパラメータ):Heliosは5~10倍高速な生成で品質と一致
- Pyramid Flow(自己回帰ベースライン):Heliosはより時間的に一貫した出力を生成
- Open-Sora v1.2:Heliosはより長く、より一貫性のあるクリップを生成
重要な比較は、LTX-2やより小さいCogVideoバリアントなどの1~2Bパラメータ範囲のモデルとです。Heliosは同様の速度で実行されながら、より大規模なモデルから出てきたように見える出力を生成します。
実際にできることは何か
Heliosは研究の好奇心ではありません。今すぐインストールして実行できる実用的なツールです。
- ✓最大60秒のテキストからビデオ生成
- ✓参照フレームからの画像からビデオアニメーション
- ✓リアルタイムストリーミング出力(生成中に視聴開始)
- ✓Apache 2.0ライセンス(商用利用許可)
- ✓消費者向けGPU対応のグループオフロード
Apache 2.0ライセンスは重要です。商用利用を制限する多くのオープンウェイトモデルとは異なり、Heliosは明示的にそれを許可しています。これにより、独立系開発者、小規模スタジオ、スタートアップがライセンス料なしでモデル上に製品を構築できるドアが開きます。
より大きな図景
Heliosはこれをどのようにアプローチするのかを変えます。AI動画のアクセス可能性。前世代の「オープン」ビデオモデルはエンタープライズハードウェアを必要とするか、クラウド対応物よりも明らかに悪い結果を生成していました。
プロジェクトあたり数百回の繰り返しを生成するプロフェッショナルにとって、経済学は大きく変わります。$400のGPUはおよそ200~300回のクラウド生成後に自分自身を支払います。製品でAIビデオ実験をしているチームにとって、ローカル生成の無制限の性質は実験へのためらいを取り除きます。
私たちのローカルでAIビデオを実行するガイド](/blog/run-ai-video-locally-rtx-ltx-2-comfyui-2026)で拡大するローカル生成エコシステムについて説明しており、Heliosはそのワークフローにはまっています。また、TurboDiffusionで説明したリアルタイム生成の突破口に基づいており、より大規模なモデルでコンセプトをさらに推し進めます。
次に起こること
Heliosチームは既にオーディオビジュアル生成とインタラクティブ制御機能に関する後続作業をほのめかしています。同じ効率向上が適用されれば、2026年後半までに消費者向けハードウェアで、リアルタイム、制御可能、オーディオ包括的なビデオ生成が見られるかもしれません。
現在のところ、HeliosはGitHubでApache 2.0で入手可能です。6GB以上のVRAMを搭載したNVIDIA GPUを持っており、本当に競争力のあるローカルAIビデオ生成を実験したい場合、これが最も強力なエントリーポイントです。
関連する読書: オープンソースモデルが専有プラットフォームとのギャップを縮めている方法を参照するか、消費者向けGPU上での原動力4Kジェネレーションに対するLTX-2のアプローチを探索してください。

リヨン出身のAI開発者。複雑なMLの概念をわかりやすいレシピに変えることが好きです。モデルのデバッグをしていないときは、ローヌ渓谷を自転車で走っています。
View profile →関連記事
これらの関連記事を引き続きお楽しみください

ByteDance Vidi2:編集者のように動画を理解するAI
ByteDanceは、動画コンテンツを十分に理解し、数時間の映像を自動的に洗練されたクリップに編集できる120億パラメータのモデルであるVidi2をオープンソース化しました。すでにTikTok Smart Splitを支えています。

SkyReels V4:映像と音を同時に捉える初のAIモデル
Skywork AIのSkyReels V4は、デュアルストリーム拡散アーキテクチャを採用し、映像と同期音声を一度の生成で共に作り出します。クリエイターにとって何を意味するのかを解説します。

Seedance 2.0がCapCutに搭載、ハリウッドは黙っていない
Soraの終了からわずか2日後、ByteDanceが物議を醸すAI動画モデルをCapCutに投入。なぜこれが重要なのか、そしてハリウッドがなぜ全面的に反撃しているのか。