SkyReels V4:映像と音を同時に捉える初のAIモデル
Skywork AIのSkyReels V4は、デュアルストリーム拡散アーキテクチャを採用し、映像と同期音声を一度の生成で共に作り出します。クリエイターにとって何を意味するのかを解説します。

なぜ音声はAIビデオの盲点であり続けたのか
AI生成クリップに音を加えようとしたことがある方なら、その苦労はご存知でしょう。雨が窓に当たる映像を生成し、合うオーディオトラックを探し、タイミングを合わせ、不自然に感じないことを祈る。
問題の根は構造にあります。Kling 3.0やRunway Gen-4.5などのモデルは、もともと映像エンジンとして設計されました。音声対応がある場合でも、別パイプラインで事後的に同期を取る方式です。
SkyReels V4 の仕組み
Skywork AI(崑崙社の研究部門)が構築したのは、デュアルストリーム・マルチモーダル拡散トランスフォーマー(MMDiT)と呼ばれるシステムです。一つの神経系を共有する二つの専門脳のような存在と捉えていただくと分かりやすいでしょう。
映像ブランチ
最大1080p、32 FPSで映像フレームを生成。動き、光、シーン構図、そしてクリップ全体の時間的一貫性を担います。
音声ブランチ
同じ拡散プロセス内で同期音声を生成します。完成映像に音を合わせるのではなく、映像と共に音を生み出す方式です。
両ブランチはマルチモーダル大規模言語モデルを基盤とするテキストエンコーダーを共有しています。この共通理解があるからこそ、「大理石の床にスローモーションでガラスが砕ける」というプロンプトに対し、映像インパクトから約40ミリ秒以内に音響アクセントが収まるのです。これは自然に感じられるほど精度の高い同期です。
Seedance や Kling との違い
ByteDanceのSeedance 2.0や快手のKling 3.0も音声に対応していますが、その手法は根本的に異なります。先に映像を生成し、続いて二つ目のモデルで合う音声を作るのです。この逐次的な方式では、音声は常に完成済みフレームに反応する立場であり、共に創られることはありません。
SkyReels V4 のデュアルストリーム構造がもたらすもの。
- ✓音声と映像要素が最初から意味的に揃っている
- ✓話し手のリップシンクが子音にぴったり合い、遅れない
- ✓環境音が素材特性に合致する(金属、木材、ガラスで異なる)
- ✓タイミングのズレを直すための後処理が不要
風景を見ているときには差が分かりにくいかもしれません。しかし人が話す場面や、物が表面と接触する場面では、差は明確に表れます。
オープンソースをめぐる問い
これまでのSkyReels(V1からV3)は完全オープンソースで、HuggingFaceとGitHubで重みをダウンロードできました。V4は現在、skyreels.ai上の無料プランを伴う限定プレビュー段階にあり、完全な重みはまだ公開されていません。
公式プラットフォーム上で、1日あたりの生成上限付き無料プランが提供されています。arXiv論文(2602.21818)に完全なアーキテクチャが記載されており、過去バージョンは引き続きオープンソースのままです。
V4の重みはまだダウンロードできません。セルフホスティングの選択肢も、本番運用APIもありません。オープンソース化のスケジュールは不透明です。
オープンソースコミュニティにとっては注視すべき動きです。Skyworkがこれまでのパターンを踏襲するなら、V4の重みも最終的にはHuggingFaceに登場するはずです。もし今すぐにオープンソースの音声映像生成が必要なら、最も近い選択肢はSkyReels V3に独立した音声モデルを組み合わせる構成です。
リーダーボード上での SkyReels V4 の位置
人間のブラインド選好投票を用いるArtificial Analysis Video Arenaにおいて、SkyReels V4のテキスト・トゥ・ビデオEloスコアは現在1,244です。これはKling 3.0(1,243)とほぼ同水準で、首位を走るアリババのHappyHorse-1.0(1,347)には及びません。
| モデル | Eloスコア | 音声サポート | オープンソース | 得意領域 |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | なし | 非対応 | 純粋な映像品質 |
| SkyReels V4 | 1,244 | ネイティブ(デュアルストリーム) | 検討中 | 音声付きコンテンツ |
| Kling 3.0 | 1,243 | 逐次型 | 非対応 | 量産規模 |
| Wan 2.7 | トップ層 | なし | 対応 | フォトリアル |
| LTX-2 | 下位 | なし | 対応 | コスト効率 |

SkyReels V4 と HappyHorse の映像品質差は実在します。しかしSkyReelsはトップ5の中で唯一、音声をネイティブに生成するモデルです。音声が必要なワークフローであれば、このアーキテクチャ上の利点は100ポイントのEloの差よりも大きな意味を持ちます。
クリエイターにとっての意味
ソーシャル系コンテンツクリエイター
ミュージックビデオ制作者
広告クリエイター
より大きな潮流:音声はもはやオプションではない
SkyReels V4 は孤立した実験ではありません。私たちはByteDance Seedance 1.5 Proによる音声映像生成の導入や、AIビデオが無音時代を脱しつつある潮流を取り上げてきました。SkyReels V4が加えたのは、これを後処理の小細工ではなくアーキテクチャ層で実現できるという証明です。
結論は明らかです。2026年末までに、ネイティブ音声を持たないAIビデオモデルは未完成と感じられるでしょう。問題はそれが標準になるかどうかではなく、どれだけ早く広がるかです。
クイックリファレンス:SkyReels V4
- 開発元: Skywork AI(崑崙社)
- アーキテクチャ: デュアルストリーム・マルチモーダル拡散トランスフォーマー(MMDiT)
- 解像度: 最大1080p、32 FPS
- 長さ: 最長15秒
- 音声: ネイティブな共同生成(後処理ではない)
- 入力: テキスト、画像、ビデオクリップ、マスク、参照音声
- 状態: skyreels.ai での限定プレビュー(重みのオープンソース公開は予定)
- 論文: arXiv 2602.21818

ローザンヌ出身のクリエイティブテクノロジスト。AIとアートが交わる領域を探求しています。電子音楽のセッションの合間に生成モデルを実験しています。
View profile →関連記事
これらの関連記事を引き続きお楽しみください

2026年3月のAI大津波:7日間で12モデル、クラウド専用時代の終わり
2026年3月は、AIビデオモデル発表の歴史で最も集中した爆発を目撃しました。わずか1週間で12個以上の新モデルが登場し、最大の物語は単一のリリースではなく、ローカル生成がクラウドに匹敵するようになったことです。

Helios: 消費者向けハードウェアで動作するリアルタイムAIビデオ生成14Bモデル
北京大学、ByteDance、Canvaが開発したHeliosは、わずか6GBのVRAMでグループオフロードを使用して、19.5 FPSで最大60秒のAIビデオを生成します。完全にオープンソースです。

ローカルでAIビデオを実行する:2026年のLTX-2、RTX、ComfyUI
LTX-2とComfyUIを使用して、自身のGPU上で4K AIビデオを生成できます。サブスクリプション、クラウド、データプライバシーの懸念は不要です。ここに必要なすべての情報があります。
