Meta Pixelメインコンテンツへスキップ
AlexisAlexis· AI著、専門家がレビュー済み
15 min read
228

1日1500万ドルの問題: なぜAI動画の経済学が2026年の生き残りを決めるのか

SoraはOpenAIが停止する前に1日1500万ドルを消費していました。本当の問題は、誰が最高のAI動画モデルを作れるかではありません。誰がそれを運用する余裕があるかです。

1日1500万ドルの問題: なぜAI動画の経済学が2026年の生き残りを決めるのか

自分だけのAI動画を作る準備はできましたか?

Bonega.aiを利用する数千人のクリエイターに参加しましょう

OpenAIがSoraを停止したのは、技術が失敗したからではありません。数字が合わなかったからです。1日1500万ドルのコンピューティングコストでは、地球上で最も資金力のあるAI企業でさえ、消費者向け動画生成サービスを維持できませんでした。このコスト数字は、この分野のすべての企業にとって衝撃的なものであるはずです。

Soraを終わらせた数字

OpenAIが6ヶ月間隠そうとしていた経済状況を明らかにしましょう。

Soraは2025年9月に消費者向け価格で提供を開始しました。APIを通じた720p動画生成は1秒あたり約0.10ドルでした。ピーク時には、毎日数百万人のユーザーがクリップを生成していました。GPU推論コスト(主にNVIDIA H100クラスタ上で実行)は、リクエストごとに線形にスケールしていきました。

$15M/day
Soraピーク時の計算コスト
$2.1M
全期間の総収益
6 months
サービス停止までの期間
$0.10/sec
API価格 (720p)

収益とコストの比率は壊滅的でした。Soraの全期間における総収益は推定210万ドルです。運営コストはおよそ27億ドルでした。これはビジネスモデルではありません。ベンチャーキャピタルを産業規模で燃やすデモンストレーションでした。

⚠️
これらの数字はCNBCとBloombergの報道に、独立アナリストによるインフラコスト推定を組み合わせたものです。OpenAIは公式のコスト内訳を公表していませんが、複数の情報源にわたって桁数は一致しています。

なぜ動画生成は画像生成より本質的にコストが高いのか

これがSoraだけの問題ではない理由を理解するには、画像生成と動画生成のコンピューティングギャップを把握する必要があります。

DALL-E 3やStable Diffusion XLのようなモデルで1枚の画像を生成するには、H100上で約10-30秒のGPU時間が必要です。24fpsで5秒の動画を生成するには120フレームの生成が必要であり、各フレーム間の時間的整合性の制約により、単純な並列化は困難です。動画拡散トランスフォーマーにおけるアテンション機構は、シーケンス長に対して二次関数的にスケールします。

生成タイプ出力あたりのGPU秒数H100の概算コスト
単一画像 (1024x1024)10-30秒$0.003-$0.01
5秒動画 (720p, 24fps)300-600秒$0.10-$0.20
10秒動画 (1080p, 24fps)900-2400秒$0.30-$0.80
60秒動画 (1080p, 24fps)5400-14400秒$1.80-$4.80
GPU計算コストを比較する棒グラフ: 画像生成0.01ドル vs 60秒動画3.30ドル
画像と動画生成の計算コスト差は5-10倍ではなく、30-100倍です

画像と動画の差は5倍や10倍ではありません。出力あたり30-100倍の計算量です。テキスト生成では、KVキャッシングや投機的デコーディングにより推論コストが大幅に削減されましたが、動画生成にはコストを桁違いに削減する同等の最適化手法がまだ存在しません。

コスト危機を生き延びるための3つの戦略

AI動画生成を提供し続けるすべての企業が、この同じ根本的な問題に直面しています。しかし、その対応戦略は大きく異なります。

戦略1: 補助金を出して祈る(VCアプローチ)

これはSoraの戦略でした。コスト以下の価格設定でユーザーを獲得し、マネタイズは後から考える。ドットコムバブル時代から経済学者が予測していた通りの結末を迎えました。

現在もこの方式で運営している企業は複数あります。Pika、Luma、Runwayはいずれも推定計算コストを大幅に下回る価格でサービスを提供しています。コストの下落速度が収益成長の必要性を上回るという賭けです。

💡
Runwayは2026年2月に3.15億ドルを調達し、評価額53億ドルとなりました。現在のバーンレートでは約18-24ヶ月の資金的余裕がありますが、収益化への道筋が見つからなければの話です。時間は刻々と過ぎています。

リスクは明白です。GPUコストの低下が十分に速くない場合、あるいはユーザー増加が最適化による効率改善を上回る場合、これらの企業はSoraと同じ壁にぶつかることになります。

戦略2: コストをハードウェアに転嫁する(NVIDIA/オープンソースの手法)

これはHelios、Wan 2.2、LTX-2.3、そして消費者向けGPUに最適化されたすべてのオープンソースモデルの背後にある戦略です。

そのロジックは洗練されています。高価なクラウドインフラを運用する代わりに、計算コストをユーザーのハードウェアに転嫁するのです。RTX 4090は1,599ドルで一度購入すれば済みます。その後のすべての動画生成は、限界費用の観点では「無料」です(電気代を除く)。

Heliosは、ByteDanceと北京大学による140億パラメータのモデルで、1台のH100で60秒の動画を19.5 FPSで生成できることを実証しました。さらに重要なのは、最適化されたオープンソースモデルが消費者向けRTX 5090ハードウェア上でリアルタイム生成に近づいていることです。

モデル必要なハードウェア生成速度品質レベル
Helios 14B1x H100 (またはRTX 5090)19.5 FPS (リアルタイム)プロフェッショナル
Wan 2.2 14B1x RTX 4090~3 FPSプロフェッショナル
LTX-2.31x RTX 4090~5 FPS (4K)プロフェッショナル
PixVerse R11x RTX 3090~2 FPSコンシューマー

この戦略の限界は明らかです。ハイエンドGPUを所有するユーザーにしか対応できません。これは意味のある市場ではありますが、Soraを人気にしたカジュアルなクリエイターは除外されてしまいます。

戦略3: プラットフォーム集約(Adobe/Googleの手法)

これは財務的に最も持続可能なアプローチです。生成コストの全額を負担するのではなく、複数のモデルプロバイダーにリクエストを振り分けるマーケットプレイスになるのです。

Adobe Fireflyは現在30以上のモデルを統合しています。Google FlowはVeoとサードパーティモデルを統合しています。CapCutはSeedance 2.0を内蔵しています。これら3つのケースすべてにおいて、プラットフォームがマージンを取り、モデルプロバイダーが計算コストを負担します。

プラットフォームの利点
初日からリクエストあたりの収益がプラスです。大規模なGPUクラスタを所有する必要がありません。各ユースケースに最適なモデルをユーザーに提供できます。リスクが複数のプロバイダーに分散されます。
プラットフォームのリスク
モデルプロバイダーの事業継続に依存します。競合他社が同じモデルを集約する場合、差別化が困難です。プロバイダーがより有利な条件を交渉するにつれ、マージンへの圧力が生じます。

Adobeはこの分野で最も有利な位置にあります。Premiere ProとAfter Effectsがすでにプロフェッショナル動画編集市場を支配しているからです。既存のワークフローにAI生成機能を追加することは自然な拡張であり、ユーザーがすでに支払っているCreative Cloudサブスクリプション内のプレミアム機能として価格設定できます。

インフラコスト曲線

重要な問いは、GPUコストが消費者向けAI動画を実現可能にするほど十分に速く下がるかどうかです。

NVIDIAのBlackwellアーキテクチャ(B200、GB200)は、H100と比較して推論ワークロードで約2-3倍の価格性能比を実現します。次期Rubinアーキテクチャはさらに2-3倍の改善を約束しています。両方が予測通りに実現すれば、2028年までに10秒の動画を生成するコストは0.50ドルから約0.05ドルに下がる可能性があります。

このタイムラインは重要です。補助金付き価格で資金を燃やしている企業は、ハードウェアの改善がビジネスモデルを救済するまで、あと2-3年生き延びる必要があります。すべての企業がそこまで持つわけではありません。

💡
生き残る可能性が最も高い企業は、膨大な現金準備を持つ企業(Google、Adobe、ByteDance)、フレームあたりの計算量を削減する効率的なモデルアーキテクチャを持つ企業、または直接的な生成コストを負担しないプラットフォームビジネスのいずれかです。

クリエイターにとっての意味

AI動画プラットフォームを選ぶクリエイターにとって、経済性は機能と同じくらい重要です。

  • 収益性のある親会社に支えられたプラットフォーム(Google、Adobe、ByteDance)は、より安全な長期的選択です
  • ローカルで実行するオープンソースモデルは、特定の企業への依存をなくします
  • 低価格で「無制限」の生成を提供するスタートアップは最もリスクが高いです
  • コストが安定するのを待ってからワークフローを確定するのは合理的ですが、早期採用の利点を逃すことになります

Soraの停止は偶発的な出来事ではありませんでした。最初のドミノ倒しだったのです。AI動画生成の経済状況は厳しく、生き残る企業はコスト問題に対する創造的な解決策を見つけた企業であり、生成問題に対する創造的な解決策だけを見つけた企業ではありません。

より大きな構図

コンピューティングの大きな転換期には、技術は機能するが経済性が伴わないという段階が必ずあります。クラウドコンピューティングは、AWSがそれを収益マシンに変えるまで何年も赤字でした。ストリーミング動画は、Netflixが軌道に乗るまで何十億ドルもの損失を出しました。AI動画生成は、まさにその同じ苦しい過渡期にあります。

今回異なるのはスピードです。ハードウェアの改善曲線は、クラウドやストリーミングの時代よりも急勾配です。NVIDIAは18-24ヶ月ごとに新しいアーキテクチャを出荷しており、FLOP当たりのコストは着実に低下しています。モデル効率の研究は、蒸留からMixture of Experts、Heliosのコンテキスト圧縮のようなアーキテクチャイノベーションに至るまで、ソフトウェア側から計算要件を削減しています。

私の予測では、2027年後半までに、クラウドインフラ上で10秒の1080p動画を生成するコストは0.10ドル未満になります。その価格帯であれば、ビジネスモデルは成立します。問題は、どの企業がそこまで生き延びられるかです。

AI動画スタートアップの墓場は、まもなく混み合うことになるでしょう。しかし、技術そのものはなくなりません。経済性が追いつくのを待っているだけです。

💡
AI動画をローカルで実行し、クラウドコストを完全に回避する実践ガイドについては、LTX-2とComfyUIを使ったローカルAI動画生成ガイドをご覧ください。
Alexis
AlexisAI EngineerAI Author

ローザンヌ出身のAIエンジニア。研究の深さと実践的なイノベーションを融合させています。モデルアーキテクチャとアルプスの山々の間で時間を過ごしています。

View profile →

記事を気に入っていただけましたか?

アイデアを数分で長さ無制限のAI動画に変えましょう。

関連記事

これらの関連記事を引き続きお楽しみください

この記事はいかがでしたか?

さらに多くのインサイトを発見し、最新コンテンツをチェックしましょう。