El problema de 15 millones de dólares al día: por qué la economía del video con IA decidirá quién sobrevive en 2026
Sora quemaba 15 millones de dólares diarios antes de que OpenAI cortara el grifo. La verdadera pregunta no es quién hace el mejor modelo de video con IA. Es quién puede permitirse operar uno.

Los números que mataron a Sora
Permítanme exponer los datos económicos que OpenAI intentó ocultar durante seis meses.
Sora se lanzó en septiembre de 2025 con precios para consumidores: aproximadamente 0,10 $ por segundo de video 720p a través de la API. En el pico de uso, millones de usuarios generaban clips a diario. Los costes de inferencia en GPU, principalmente ejecutándose en clusters NVIDIA H100, escalaban linealmente con cada solicitud.
La relación ingresos-costes fue catastrófica. Sora generó aproximadamente 2,1 millones de dólares en ingresos totales a lo largo de toda su vida útil. Su operación costó alrededor de 2.700 millones de dólares. Eso no es un modelo de negocio. Es una demostración que quemó capital de riesgo a escala industrial.
Por qué la generación de video es fundamentalmente más cara que las imágenes
Para entender por qué esto importa más allá de Sora, hay que comprender la brecha computacional entre la generación de imágenes y la de video.
Una sola solicitud de generación de imagen con un modelo como DALL-E 3 o Stable Diffusion XL requiere aproximadamente 10-30 segundos de tiempo GPU en un H100. Un video de 5 segundos a 24 fps requiere generar 120 fotogramas, cada uno con restricciones de coherencia temporal que impiden la paralelización simple. El mecanismo de atención en los transformers de difusión de video escala cuadráticamente con la longitud de la secuencia.
| Tipo de generación | GPU-segundos por salida | Coste aproximado H100 |
|---|---|---|
| Imagen única (1024x1024) | 10-30s | 0,003-0,01 $ |
| Video de 5 segundos (720p, 24fps) | 300-600s | 0,10-0,20 $ |
| Video de 10 segundos (1080p, 24fps) | 900-2400s | 0,30-0,80 $ |
| Video de 60 segundos (1080p, 24fps) | 5400-14400s | 1,80-4,80 $ |

La diferencia entre imagen y video no es de 5x o 10x. Es de 30 a 100 veces en computación por resultado. Y a diferencia de la generación de texto, donde el KV-caching y la decodificación especulativa han reducido drásticamente los costes de inferencia, la generación de video no tiene una optimización equivalente que reduzca los costes en un orden de magnitud.
Tres estrategias para sobrevivir a la crisis de costes
Todas las empresas que todavía ofrecen generación de video con IA enfrentan este mismo problema fundamental. Sus estrategias divergen notablemente.
Estrategia 1: Subvencionar y rezar (el enfoque del capital de riesgo)
Esta fue la estrategia de Sora. Fijar precios por debajo del coste, captar usuarios, resolver la monetización después. Terminó exactamente como los profesores de economía vienen prediciendo desde la era de las puntocom.
Varias empresas siguen operando así. Pika, Luma y Runway ofrecen sus servicios muy por debajo de los costes de computación estimados. La apuesta es que los costes bajarán más rápido de lo que necesitan crecer los ingresos.
El riesgo es evidente. Si los costes de GPU no bajan lo suficientemente rápido, o si el uso crece más rápido que las ganancias de optimización, estas empresas se encontrarán con el mismo muro que Sora.
Estrategia 2: Trasladar los costes al hardware (la vía NVIDIA/Open Source)
Esta es la estrategia detrás de Helios, Wan 2.2, LTX-2.3 y todos los demás modelos open source optimizados para GPUs de consumo.
La lógica es elegante: en lugar de mantener una infraestructura cloud costosa, se traslada el coste computacional al hardware del usuario. Una RTX 4090 cuesta 1.599 $ una sola vez. Después, cada generación de video es "gratuita" en términos de coste marginal (descontando la electricidad).
Helios, el modelo de 14.000 millones de parámetros de ByteDance y la Universidad de Pekín, demostró que un solo H100 puede generar videos de 60 segundos a 19,5 FPS. Más importante aún, los modelos open source optimizados se acercan a la generación en tiempo real en hardware de consumo RTX 5090.
| Modelo | Hardware necesario | Velocidad de generación | Nivel de calidad |
|---|---|---|---|
| Helios 14B | 1x H100 (o RTX 5090) | 19,5 FPS (tiempo real) | Profesional |
| Wan 2.2 14B | 1x RTX 4090 | ~3 FPS | Profesional |
| LTX-2.3 | 1x RTX 4090 | ~5 FPS (4K) | Profesional |
| PixVerse R1 | 1x RTX 3090 | ~2 FPS | Consumo |
La limitación es evidente: esta estrategia solo sirve a usuarios con GPUs de gama alta. Es un mercado significativo, pero excluye a los creadores ocasionales que hicieron popular a Sora.
Estrategia 3: Agregación de plataformas (la vía Adobe/Google)
Este es el enfoque más sostenible financieramente. En lugar de asumir el coste total de la generación, se convierte en un marketplace que enruta las solicitudes a múltiples proveedores de modelos.
Adobe Firefly ahora aloja más de 30 modelos de diferentes proveedores. Google Flow integra Veo con modelos de terceros. CapCut integra Seedance 2.0. En los tres casos, la plataforma toma un margen mientras el proveedor del modelo asume el coste computacional.
Adobe está mejor posicionado aquí porque Premiere Pro y After Effects ya dominan la edición de video profesional. Añadir generación IA a los flujos de trabajo existentes es una extensión natural, y Adobe puede cobrarla como una función premium dentro de las suscripciones a Creative Cloud que los usuarios ya pagan.
La curva de costes de infraestructura
La pregunta clave es si los costes de GPU bajarán lo suficientemente rápido como para hacer viable el video con IA para consumidores.
La arquitectura Blackwell de NVIDIA (B200, GB200) ofrece un rendimiento precio-coste aproximadamente 2-3 veces mejor para cargas de inferencia en comparación con el H100. La próxima arquitectura Rubin promete otra mejora de 2-3 veces. Si ambas cumplen lo proyectado, para 2028 el coste de generar un video de 10 segundos podría bajar de 0,50 $ a aproximadamente 0,05 $.
Ese calendario importa. Las empresas que queman efectivo con precios subsidiados necesitan sobrevivir 2-3 años más para que las mejoras de hardware rescaten sus modelos de negocio. No todas lo conseguirán.
Qué significa esto para los creadores
Si eres un creador eligiendo una plataforma de video con IA hoy, la economía importa tanto como las funcionalidades.
- ✓Las plataformas respaldadas por empresas matrices rentables (Google, Adobe, ByteDance) son apuestas más seguras a largo plazo
- ✓Los modelos open source que se ejecutan localmente eliminan la dependencia de cualquier empresa individual
- ✓Las startups que ofrecen generación "ilimitada" a precios bajos son las de mayor riesgo
- ✓Esperar a que los costes se estabilicen antes de comprometerse con un flujo de trabajo es razonable, pero implica perder las ventajas de la adopción temprana
El cierre de Sora no fue una anomalía. Fue la primera ficha de dominó. La economía de la generación de video con IA es brutal, y las empresas que sobrevivirán serán las que encontraron soluciones creativas al problema de los costes, no solo soluciones creativas al problema de la generación.
La perspectiva general
Cada gran cambio en la computación ha pasado por una fase en la que la tecnología funciona pero la economía no. El cloud computing fue deficitario durante años antes de que AWS lo convirtiera en una máquina de generar dinero. El streaming de video perdió miles de millones antes de que Netflix encontrara su equilibrio. La generación de video con IA está en ese mismo período intermedio doloroso.
La diferencia esta vez es la velocidad. La curva de mejora del hardware es más pronunciada que con el cloud o el streaming. NVIDIA lanza nuevas arquitecturas cada 18-24 meses con reducciones significativas del coste por FLOP. La investigación en eficiencia de modelos, desde la destilación hasta mixture-of-experts pasando por innovaciones arquitectónicas como la compresión de contexto de Helios, está recortando los requisitos computacionales desde el lado del software.
Mi estimación: para finales de 2027, generar un video de 10 segundos a 1080p costará menos de 0,10 $ en infraestructura cloud. A ese precio, el modelo de negocio funciona. La pregunta es qué empresas pueden sobrevivir hasta entonces.
El cementerio de startups de video con IA está a punto de llenarse. Pero la tecnología en sí no va a desaparecer. Solo está esperando a que la economía la alcance.

Ingeniero de IA de Lausana que combina profundidad investigadora con innovación práctica. Divide su tiempo entre arquitecturas de modelos y cumbres alpinas.
View profile →¿Te ha gustado lo que has leído?
Convierte tus ideas en vídeos con IA de duración ilimitada en minutos.
Artículos relacionados
Sigue explorando con estas publicaciones relacionadas

Sora ha muerto. OpenAI abandona por completo la generación de video con IA.
OpenAI cierra la app de Sora, cancela el acuerdo con Disney y gira hacia la robótica. El producto de video IA más sonado duró apenas seis meses. Esto es lo que los creadores deben hacer ahora mismo.

La avalancha de video IA de marzo de 2026: por qué la dirección creativa es el nuevo cuello de botella
Más de 12 modelos de video IA se lanzaron en una sola semana en marzo de 2026. Con la calidad alcanzando paridad, la ventaja competitiva se ha desplazado de la capacidad técnica a la dirección creativa.

La meseta de calidad de video de IA: cuando todos los modelos se ven igual, qué importa realmente?
Los mejores modelos de video de IA han convergido a una calidad casi idéntica. La competencia real ahora se trata de ecosistemas, flujos de trabajo y control creativo.
