Meta Pixelメインコンテンツへスキップ
HenryHenry· AI著、専門家がレビュー済み
11 min read
246

SkyReels V4:映像と音を同時に捉える初のAIモデル

Skywork AIのSkyReels V4は、デュアルストリーム拡散アーキテクチャを採用し、映像と同期音声を一度の生成で共に作り出します。クリエイターにとって何を意味するのかを解説します。

SkyReels V4:映像と音を同時に捉える初のAIモデル

自分だけのAI動画を作る準備はできましたか?

Bonega.aiを利用する数千人のクリエイターに参加しましょう

これまでのAIビデオモデルは、音声を後付けの要素として扱ってきました。先に映像を生成し、後から音を貼り付ける。SkyReels V4はそのワークフローを根本から覆します。映像と音を同時に思考する初のモデルであり、その結果は驚くほど自然です。

なぜ音声はAIビデオの盲点であり続けたのか

AI生成クリップに音を加えようとしたことがある方なら、その苦労はご存知でしょう。雨が窓に当たる映像を生成し、合うオーディオトラックを探し、タイミングを合わせ、不自然に感じないことを祈る。

問題の根は構造にあります。Kling 3.0Runway Gen-4.5などのモデルは、もともと映像エンジンとして設計されました。音声対応がある場合でも、別パイプラインで事後的に同期を取る方式です。

💡
この緊張関係については、統合音声映像生成の詳細記事で掘り下げました。SkyReels V4は、それを実際にアーキテクチャレベルで解決した初の実用モデルです。

SkyReels V4 の仕組み

Skywork AI(崑崙社の研究部門)が構築したのは、デュアルストリーム・マルチモーダル拡散トランスフォーマー(MMDiT)と呼ばれるシステムです。一つの神経系を共有する二つの専門脳のような存在と捉えていただくと分かりやすいでしょう。

映像ブランチ

最大1080p、32 FPSで映像フレームを生成。動き、光、シーン構図、そしてクリップ全体の時間的一貫性を担います。

音声ブランチ

同じ拡散プロセス内で同期音声を生成します。完成映像に音を合わせるのではなく、映像と共に音を生み出す方式です。

両ブランチはマルチモーダル大規模言語モデルを基盤とするテキストエンコーダーを共有しています。この共通理解があるからこそ、「大理石の床にスローモーションでガラスが砕ける」というプロンプトに対し、映像インパクトから約40ミリ秒以内に音響アクセントが収まるのです。これは自然に感じられるほど精度の高い同期です。

1080p
最大解像度
32 FPS
フレームレート
15s
最大長さ
~40ms
音声同期精度

Seedance や Kling との違い

ByteDanceのSeedance 2.0や快手のKling 3.0も音声に対応していますが、その手法は根本的に異なります。先に映像を生成し、続いて二つ目のモデルで合う音声を作るのです。この逐次的な方式では、音声は常に完成済みフレームに反応する立場であり、共に創られることはありません。

SkyReels V4 のデュアルストリーム構造がもたらすもの。

  • 音声と映像要素が最初から意味的に揃っている
  • 話し手のリップシンクが子音にぴったり合い、遅れない
  • 環境音が素材特性に合致する(金属、木材、ガラスで異なる)
  • タイミングのズレを直すための後処理が不要

風景を見ているときには差が分かりにくいかもしれません。しかし人が話す場面や、物が表面と接触する場面では、差は明確に表れます。

オープンソースをめぐる問い

これまでのSkyReels(V1からV3)は完全オープンソースで、HuggingFaceとGitHubで重みをダウンロードできました。V4は現在、skyreels.ai上の無料プランを伴う限定プレビュー段階にあり、完全な重みはまだ公開されていません。

現時点で利用可能

公式プラットフォーム上で、1日あたりの生成上限付き無料プランが提供されています。arXiv論文(2602.21818)に完全なアーキテクチャが記載されており、過去バージョンは引き続きオープンソースのままです。

まだ未提供

V4の重みはまだダウンロードできません。セルフホスティングの選択肢も、本番運用APIもありません。オープンソース化のスケジュールは不透明です。

オープンソースコミュニティにとっては注視すべき動きです。Skyworkがこれまでのパターンを踏襲するなら、V4の重みも最終的にはHuggingFaceに登場するはずです。もし今すぐにオープンソースの音声映像生成が必要なら、最も近い選択肢はSkyReels V3に独立した音声モデルを組み合わせる構成です。

リーダーボード上での SkyReels V4 の位置

人間のブラインド選好投票を用いるArtificial Analysis Video Arenaにおいて、SkyReels V4のテキスト・トゥ・ビデオEloスコアは現在1,244です。これはKling 3.0(1,243)とほぼ同水準で、首位を走るアリババのHappyHorse-1.0(1,347)には及びません。

モデルEloスコア音声サポートオープンソース得意領域
HappyHorse-1.01,347なし非対応純粋な映像品質
SkyReels V41,244ネイティブ(デュアルストリーム)検討中音声付きコンテンツ
Kling 3.01,243逐次型非対応量産規模
Wan 2.7トップ層なし対応フォトリアル
LTX-2下位なし対応コスト効率
SkyReels V4、Kling 3.0、HappyHorse-1.0、Wan 2.7を映像品質、音声サポート、オープンソース性、速度の面で比較した図
SkyReels V4は最上位グループでネイティブに音声を生成する唯一のモデル

SkyReels V4 と HappyHorse の映像品質差は実在します。しかしSkyReelsはトップ5の中で唯一、音声をネイティブに生成するモデルです。音声が必要なワークフローであれば、このアーキテクチャ上の利点は100ポイントのEloの差よりも大きな意味を持ちます。

クリエイターにとっての意味

🎬

ソーシャル系コンテンツクリエイター

SkyReels V4 は素早い回転を念頭に設計されています。クリップを音声付きで生成し、そのまま投稿できます。サウンドデザインの工程は不要です。TikTok、Reels、Shortsの制作者にとって、制作時間を大きく圧縮できます。
🎵

ミュージックビデオ制作者

音声ブランチは参照音声をガイドとして受け入れられるため、楽曲を入力すればビートに合わせて動く映像が得られます。初期の結果では、動きのアクセントが音楽のリズムと良く同期しています。
📢

広告クリエイター

環境音付きの製品動画、ナレーションを乗せやすいクリップ、サウンドスケープを伴うブランドコンテンツが、いずれも一度の生成で実現可能になります。スケールで生産するブランドにとって、節約される時間は急速に積み上がります。

より大きな潮流:音声はもはやオプションではない

SkyReels V4 は孤立した実験ではありません。私たちはByteDance Seedance 1.5 Proによる音声映像生成の導入や、AIビデオが無音時代を脱しつつある潮流を取り上げてきました。SkyReels V4が加えたのは、これを後処理の小細工ではなくアーキテクチャ層で実現できるという証明です。

結論は明らかです。2026年末までに、ネイティブ音声を持たないAIビデオモデルは未完成と感じられるでしょう。問題はそれが標準になるかどうかではなく、どれだけ早く広がるかです。

💡
音声付きAI動画を今すぐ生成したい方へ。Bonegaのパイプラインは利用可能な最良のツールへ自動でルーティングし、SkyReels V4のようなモデルが成熟するたびに進化を続けます。無料で試す

クイックリファレンス:SkyReels V4

  • 開発元: Skywork AI(崑崙社)
  • アーキテクチャ: デュアルストリーム・マルチモーダル拡散トランスフォーマー(MMDiT)
  • 解像度: 最大1080p、32 FPS
  • 長さ: 最長15秒
  • 音声: ネイティブな共同生成(後処理ではない)
  • 入力: テキスト、画像、ビデオクリップ、マスク、参照音声
  • 状態: skyreels.ai での限定プレビュー(重みのオープンソース公開は予定)
  • 論文: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

ローザンヌ出身のクリエイティブテクノロジスト。AIとアートが交わる領域を探求しています。電子音楽のセッションの合間に生成モデルを実験しています。

View profile →

記事を気に入っていただけましたか?

アイデアを数分で長さ無制限のAI動画に変えましょう。

関連記事

これらの関連記事を引き続きお楽しみください

この記事はいかがでしたか?

さらに多くのインサイトを発見し、最新コンテンツをチェックしましょう。