Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
13 min read
232

每天1500万美元的难题: 为什么AI视频经济学将决定谁能活过2026年

Sora在OpenAI叫停之前每天消耗1500万美元。真正的问题不是谁能制作出最好的AI视频模型,而是谁有能力运行它。

每天1500万美元的难题: 为什么AI视频经济学将决定谁能活过2026年

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

OpenAI关闭Sora并非因为技术失败,而是因为数学算不过来。每天1500万美元的计算成本,即使是全球资金最雄厚的AI公司也无法让消费者级视频生成服务持续运营。这个成本数字应该让这个领域的每一家公司都感到震撼。

压垮Sora的数字

让我来展示OpenAI试图隐藏了六个月的经济账。

Sora于2025年9月推出,面向消费者定价: 通过API生成720p视频大约每秒0.10美元。在使用高峰期,每天有数百万用户在生成视频片段。GPU推理成本(主要运行在NVIDIA H100集群上)随着每个请求线性增长。

$15M/day
Sora峰值计算成本
$2.1M
整个生命周期总收入
6 months
从上线到关停
$0.10/sec
API定价 (720p)

收入与成本的比率是灾难性的。Sora在整个生命周期中的总收入估计为210万美元,而运营成本大约为27亿美元。这不是一个商业模式,这是一场烧掉风投资金的工业级演示。

⚠️
这些数据来自CNBC和彭博社的报道,结合了独立分析师的基础设施成本估算。OpenAI并未公布官方成本明细,但多个来源的数量级是一致的。

为什么视频生成本质上比图像生成更昂贵

要理解这件事为什么不仅仅关乎Sora,你需要了解图像和视频生成之间的计算差距。

使用DALL-E 3或Stable Diffusion XL等模型生成一张图像,大约需要在H100上使用10-30秒的GPU时间。而生成一段5秒、24fps的视频需要生成120帧,每帧之间的时间一致性约束使得简单的并行化变得不可行。视频扩散变换器中的注意力机制随序列长度呈二次方增长。

生成类型每次输出的GPU秒数H100大致成本
单张图像 (1024x1024)10-30秒$0.003-$0.01
5秒视频 (720p, 24fps)300-600秒$0.10-$0.20
10秒视频 (1080p, 24fps)900-2400秒$0.30-$0.80
60秒视频 (1080p, 24fps)5400-14400秒$1.80-$4.80
柱状图对比GPU计算成本: 图像生成0.01美元 vs 60秒视频3.30美元
图像与视频生成的计算成本差距是30-100倍,而不是5-10倍

图像和视频之间的差距不是5倍或10倍,而是每次输出30-100倍的计算量。与文本生成不同的是,文本领域中KV缓存和推测解码已经大幅降低了推理成本,而视频生成目前还没有能将成本降低一个数量级的等效优化方案。

度过成本危机的三种策略

每一家仍在提供AI视频生成服务的公司都面临着同样的根本问题。但它们的应对策略截然不同。

策略一: 补贴然后祈祷(风投模式)

这正是Sora的策略。以低于成本的价格定价,获取用户,之后再想办法盈利。结果正如经济学教授们自互联网泡沫时代以来一直预言的那样。

目前仍有数家公司采用这种方式运营。Pika、Luma和Runway的服务定价都远低于预估的计算成本。他们的赌注是,成本下降的速度会快于收入增长的需求。

💡
Runway在2026年2月融资3.15亿美元,估值53亿美元。按照目前的烧钱速度,这大约能支撑18-24个月,前提是他们找不到盈利之路。时间在流逝。

风险显而易见。如果GPU成本下降得不够快,或者用户增长速度超过优化收益,这些公司将面临与Sora相同的困境。

策略二: 将成本转移到硬件端(NVIDIA/开源路线)

这是Helios、Wan 2.2、LTX-2.3以及每一个为消费级GPU优化的开源模型背后的策略。

其逻辑简洁而优雅: 不再运行昂贵的云基础设施,而是将计算成本推给用户的硬件。一块RTX 4090只需花费1,599美元一次。之后,每次视频生成在边际成本上是"免费的"(除去电费)。

Helios是字节跳动与北京大学合作推出的140亿参数模型,它展示了单块H100就能以19.5 FPS的速度生成60秒视频。更重要的是,优化后的开源模型正在接近消费级RTX 5090硬件上的实时生成能力。

模型所需硬件生成速度质量等级
Helios 14B1x H100 (或RTX 5090)19.5 FPS (实时)专业级
Wan 2.2 14B1x RTX 4090~3 FPS专业级
LTX-2.31x RTX 4090~5 FPS (4K)专业级
PixVerse R11x RTX 3090~2 FPS消费级

这一策略的局限性也很明显: 它只适用于拥有高端GPU的用户。这确实是一个有意义的市场,但排除了那些让Sora走红的普通创作者。

策略三: 平台聚合(Adobe/Google模式)

这是在财务上最具可持续性的方案。不再承担全部生成成本,而是成为一个将请求分发到多个模型供应商的市场平台。

Adobe Firefly现在整合了30多个模型,来自不同的供应商。Google Flow将Veo与第三方模型整合。CapCut内嵌了Seedance 2.0。在所有这三种情况下,平台收取利润,而模型供应商承担计算成本。

平台优势
从第一天起每个请求的收入就是正的。不需要拥有大规模GPU集群。可以为用户提供每个场景下最优的模型。风险分散到多个供应商。
平台风险
依赖于模型供应商的持续运营。如果竞争对手聚合了相同的模型,则缺乏差异化。随着供应商议价能力增强,利润空间面临压力。

Adobe在这个方向上拥有最佳优势,因为Premiere Pro和After Effects已经主导了专业视频编辑市场。将AI生成功能添加到现有工作流中是自然的延伸,Adobe可以将其作为用户已经在付费的Creative Cloud订阅中的高级功能来定价。

基础设施成本曲线

关键问题是: GPU成本能否快速下降到足以使消费者级AI视频变得可行?

NVIDIA的Blackwell架构(B200、GB200)在推理工作负载上,相比H100提供了大约2-3倍的性价比提升。即将推出的Rubin架构承诺再提供2-3倍的改进。如果两者都能如期实现,到2028年,生成一段10秒视频的成本可能从0.50美元降至大约0.05美元。

这个时间线至关重要。那些在补贴定价上烧钱的公司需要再撑2-3年,等待硬件改进来拯救它们的商业模式。不是所有公司都能等到那一天。

💡
最有可能存活下来的公司具备以下条件之一: 拥有大量现金储备(Google、Adobe、字节跳动),拥有能减少每帧计算量的高效模型架构,或者运营不直接承担生成成本的平台业务。

对创作者意味着什么

如果你是一位正在选择AI视频平台的创作者,经济账和功能同样重要。

  • 由盈利母公司支持的平台(Google、Adobe、字节跳动)是更安全的长期选择
  • 在本地运行的开源模型消除了对任何单一公司的依赖
  • 以低价提供"无限"生成的初创公司风险最高
  • 等待成本稳定后再确定工作流程是合理的,但意味着会错失早期采用的优势

Sora的关停不是偶然事件,它是第一块多米诺骨牌。AI视频生成的经济现实是残酷的。能够存活下来的公司,是那些找到了创造性解决成本问题的方案的公司,而不仅仅是找到了创造性解决生成问题方案的公司。

更宏观的视角

计算领域的每一次重大变革都经历过技术可行但经济不可行的阶段。云计算在AWS将其变成印钞机之前亏损了多年。流媒体视频在Netflix站稳脚跟之前烧掉了数十亿美元。AI视频生成正处于同样痛苦的中间阶段。

这一次的不同在于速度。硬件改进曲线比云计算或流媒体时代更加陡峭。NVIDIA每18-24个月就推出新架构,每FLOP成本有着实质性的降低。模型效率研究,从蒸馏到混合专家,再到Helios上下文压缩等架构创新,正在从软件层面削减计算需求。

我的判断是: 到2027年底,在云基础设施上生成一段10秒1080p视频的成本将降至0.10美元以下。在这个价格水平上,商业模式是成立的。问题是,哪些公司能撑到那个时候。

AI视频初创公司的墓地即将变得拥挤。但技术本身不会消失。它只是在等待经济规律跟上步伐。

💡
如果你想了解如何在本地运行AI视频、完全绕过云端成本,请参阅我们的使用LTX-2和ComfyUI在本地运行AI视频的指南
Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。