Meta PixelSaltar al contenido principal
AlexisAlexis· Autora de IA, revisada por humanos
9 min read
1732 palabras

El problema de 15 millones de dólares al día: por qué la economía del video con IA decidirá quién sobrevive en 2026

Sora quemaba 15 millones de dólares diarios antes de que OpenAI cortara el grifo. La verdadera pregunta no es quién hace el mejor modelo de video con IA. Es quién puede permitirse operar uno.

El problema de 15 millones de dólares al día: por qué la economía del video con IA decidirá quién sobrevive en 2026

¿Listo para crear tus propios vídeos con IA?

Únete a miles de creadores que usan Bonega.ai

OpenAI no cerró Sora porque la tecnología falló. Lo cerraron porque las cuentas no cuadraban. Con 15 millones de dólares al día en costes de computación, ni siquiera la empresa de IA mejor financiada del planeta podía hacer rentable la generación de video para consumidores. Esa cifra debería aterrorizar a todas las empresas del sector.

Los números que mataron a Sora

Permítanme exponer los datos económicos que OpenAI intentó ocultar durante seis meses.

Sora se lanzó en septiembre de 2025 con precios para consumidores: aproximadamente 0,10 $ por segundo de video 720p a través de la API. En el pico de uso, millones de usuarios generaban clips a diario. Los costes de inferencia en GPU, principalmente ejecutándose en clusters NVIDIA H100, escalaban linealmente con cada solicitud.

$15M/day
Coste máximo de computación de Sora
$2.1M
Ingresos totales en toda su vida
6 months
Tiempo hasta el cierre
$0.10/sec
Precio API (720p)

La relación ingresos-costes fue catastrófica. Sora generó aproximadamente 2,1 millones de dólares en ingresos totales a lo largo de toda su vida útil. Su operación costó alrededor de 2.700 millones de dólares. Eso no es un modelo de negocio. Es una demostración que quemó capital de riesgo a escala industrial.

⚠️
Estas cifras provienen de reportajes de CNBC y Bloomberg, combinados con estimaciones de costes de infraestructura de analistas independientes. OpenAI no ha publicado desgloses oficiales de costes, pero el orden de magnitud es consistente en múltiples fuentes.

Por qué la generación de video es fundamentalmente más cara que las imágenes

Para entender por qué esto importa más allá de Sora, hay que comprender la brecha computacional entre la generación de imágenes y la de video.

Una sola solicitud de generación de imagen con un modelo como DALL-E 3 o Stable Diffusion XL requiere aproximadamente 10-30 segundos de tiempo GPU en un H100. Un video de 5 segundos a 24 fps requiere generar 120 fotogramas, cada uno con restricciones de coherencia temporal que impiden la paralelización simple. El mecanismo de atención en los transformers de difusión de video escala cuadráticamente con la longitud de la secuencia.

Tipo de generaciónGPU-segundos por salidaCoste aproximado H100
Imagen única (1024x1024)10-30s0,003-0,01 $
Video de 5 segundos (720p, 24fps)300-600s0,10-0,20 $
Video de 10 segundos (1080p, 24fps)900-2400s0,30-0,80 $
Video de 60 segundos (1080p, 24fps)5400-14400s1,80-4,80 $
Gráfico de barras comparando los costes de computación GPU: generación de imagen a 0,01 $ frente a video de 60 segundos a 3,30 $
La brecha de coste computacional entre imagen y video es de 30 a 100 veces, no de 5 a 10 veces

La diferencia entre imagen y video no es de 5x o 10x. Es de 30 a 100 veces en computación por resultado. Y a diferencia de la generación de texto, donde el KV-caching y la decodificación especulativa han reducido drásticamente los costes de inferencia, la generación de video no tiene una optimización equivalente que reduzca los costes en un orden de magnitud.

Tres estrategias para sobrevivir a la crisis de costes

Todas las empresas que todavía ofrecen generación de video con IA enfrentan este mismo problema fundamental. Sus estrategias divergen notablemente.

Estrategia 1: Subvencionar y rezar (el enfoque del capital de riesgo)

Esta fue la estrategia de Sora. Fijar precios por debajo del coste, captar usuarios, resolver la monetización después. Terminó exactamente como los profesores de economía vienen prediciendo desde la era de las puntocom.

Varias empresas siguen operando así. Pika, Luma y Runway ofrecen sus servicios muy por debajo de los costes de computación estimados. La apuesta es que los costes bajarán más rápido de lo que necesitan crecer los ingresos.

💡
Runway recaudó 315 millones de dólares en febrero de 2026 con una valoración de 5.300 millones de dólares. Esto les da aproximadamente 18-24 meses de margen al ritmo actual de gasto, siempre que no encuentren un camino hacia la rentabilidad. El reloj sigue corriendo.

El riesgo es evidente. Si los costes de GPU no bajan lo suficientemente rápido, o si el uso crece más rápido que las ganancias de optimización, estas empresas se encontrarán con el mismo muro que Sora.

Estrategia 2: Trasladar los costes al hardware (la vía NVIDIA/Open Source)

Esta es la estrategia detrás de Helios, Wan 2.2, LTX-2.3 y todos los demás modelos open source optimizados para GPUs de consumo.

La lógica es elegante: en lugar de mantener una infraestructura cloud costosa, se traslada el coste computacional al hardware del usuario. Una RTX 4090 cuesta 1.599 $ una sola vez. Después, cada generación de video es "gratuita" en términos de coste marginal (descontando la electricidad).

Helios, el modelo de 14.000 millones de parámetros de ByteDance y la Universidad de Pekín, demostró que un solo H100 puede generar videos de 60 segundos a 19,5 FPS. Más importante aún, los modelos open source optimizados se acercan a la generación en tiempo real en hardware de consumo RTX 5090.

ModeloHardware necesarioVelocidad de generaciónNivel de calidad
Helios 14B1x H100 (o RTX 5090)19,5 FPS (tiempo real)Profesional
Wan 2.2 14B1x RTX 4090~3 FPSProfesional
LTX-2.31x RTX 4090~5 FPS (4K)Profesional
PixVerse R11x RTX 3090~2 FPSConsumo

La limitación es evidente: esta estrategia solo sirve a usuarios con GPUs de gama alta. Es un mercado significativo, pero excluye a los creadores ocasionales que hicieron popular a Sora.

Estrategia 3: Agregación de plataformas (la vía Adobe/Google)

Este es el enfoque más sostenible financieramente. En lugar de asumir el coste total de la generación, se convierte en un marketplace que enruta las solicitudes a múltiples proveedores de modelos.

Adobe Firefly ahora aloja más de 30 modelos de diferentes proveedores. Google Flow integra Veo con modelos de terceros. CapCut integra Seedance 2.0. En los tres casos, la plataforma toma un margen mientras el proveedor del modelo asume el coste computacional.

Ventajas de la plataforma
Los ingresos por solicitud son positivos desde el primer día. No se necesitan clusters GPU masivos propios. Se puede ofrecer a los usuarios el mejor modelo para cada caso de uso. El riesgo se distribuye entre múltiples proveedores.
Riesgos de la plataforma
Dependencia de que los proveedores de modelos sigan en el negocio. Sin diferenciación si los competidores agregan los mismos modelos. Presión en los márgenes a medida que los proveedores negocian mejores condiciones.

Adobe está mejor posicionado aquí porque Premiere Pro y After Effects ya dominan la edición de video profesional. Añadir generación IA a los flujos de trabajo existentes es una extensión natural, y Adobe puede cobrarla como una función premium dentro de las suscripciones a Creative Cloud que los usuarios ya pagan.

La curva de costes de infraestructura

La pregunta clave es si los costes de GPU bajarán lo suficientemente rápido como para hacer viable el video con IA para consumidores.

La arquitectura Blackwell de NVIDIA (B200, GB200) ofrece un rendimiento precio-coste aproximadamente 2-3 veces mejor para cargas de inferencia en comparación con el H100. La próxima arquitectura Rubin promete otra mejora de 2-3 veces. Si ambas cumplen lo proyectado, para 2028 el coste de generar un video de 10 segundos podría bajar de 0,50 $ a aproximadamente 0,05 $.

Ese calendario importa. Las empresas que queman efectivo con precios subsidiados necesitan sobrevivir 2-3 años más para que las mejoras de hardware rescaten sus modelos de negocio. No todas lo conseguirán.

💡
Las empresas con más probabilidades de sobrevivir son las que cuentan con reservas de efectivo masivas (Google, Adobe, ByteDance), arquitecturas de modelos eficientes que reducen la computación por fotograma, o negocios de plataforma que no asumen costes directos de generación.

Qué significa esto para los creadores

Si eres un creador eligiendo una plataforma de video con IA hoy, la economía importa tanto como las funcionalidades.

  • Las plataformas respaldadas por empresas matrices rentables (Google, Adobe, ByteDance) son apuestas más seguras a largo plazo
  • Los modelos open source que se ejecutan localmente eliminan la dependencia de cualquier empresa individual
  • Las startups que ofrecen generación "ilimitada" a precios bajos son las de mayor riesgo
  • Esperar a que los costes se estabilicen antes de comprometerse con un flujo de trabajo es razonable, pero implica perder las ventajas de la adopción temprana

El cierre de Sora no fue una anomalía. Fue la primera ficha de dominó. La economía de la generación de video con IA es brutal, y las empresas que sobrevivirán serán las que encontraron soluciones creativas al problema de los costes, no solo soluciones creativas al problema de la generación.

La perspectiva general

Cada gran cambio en la computación ha pasado por una fase en la que la tecnología funciona pero la economía no. El cloud computing fue deficitario durante años antes de que AWS lo convirtiera en una máquina de generar dinero. El streaming de video perdió miles de millones antes de que Netflix encontrara su equilibrio. La generación de video con IA está en ese mismo período intermedio doloroso.

La diferencia esta vez es la velocidad. La curva de mejora del hardware es más pronunciada que con el cloud o el streaming. NVIDIA lanza nuevas arquitecturas cada 18-24 meses con reducciones significativas del coste por FLOP. La investigación en eficiencia de modelos, desde la destilación hasta mixture-of-experts pasando por innovaciones arquitectónicas como la compresión de contexto de Helios, está recortando los requisitos computacionales desde el lado del software.

Mi estimación: para finales de 2027, generar un video de 10 segundos a 1080p costará menos de 0,10 $ en infraestructura cloud. A ese precio, el modelo de negocio funciona. La pregunta es qué empresas pueden sobrevivir hasta entonces.

El cementerio de startups de video con IA está a punto de llenarse. Pero la tecnología en sí no va a desaparecer. Solo está esperando a que la economía la alcance.

💡
Para una guía práctica sobre cómo ejecutar video con IA localmente y evitar por completo los costes de la nube, consulta nuestra guía de generación de video IA local con LTX-2 y ComfyUI.
Alexis
AlexisAI EngineerAI Author

Ingeniero de IA de Lausana que combina profundidad investigadora con innovación práctica. Divide su tiempo entre arquitecturas de modelos y cumbres alpinas.

View profile →

¿Te ha gustado lo que has leído?

Convierte tus ideas en vídeos con IA de duración ilimitada en minutos.

Artículos relacionados

Sigue explorando con estas publicaciones relacionadas

¿Te ha gustado este artículo?

Descubre más ideas y mantente al día con nuestro contenido más reciente.