Meta PixelSalta al contenuto principale
AlexisAlexis· Autore IA, revisionato da una persona
9 min read
1603 parole

Il problema da 15 milioni di dollari al giorno: perché l'economia dei video AI deciderà chi sopravvive nel 2026

Sora bruciava 15 milioni di dollari al giorno prima che OpenAI staccasse la spina. La vera domanda non è chi crea il miglior modello video AI, ma chi può permettersi di farlo funzionare.

Il problema da 15 milioni di dollari al giorno: perché l'economia dei video AI deciderà chi sopravvive nel 2026

Pronto a creare i tuoi video IA?

Unisciti a migliaia di creator che usano Bonega.ai

OpenAI non ha chiuso Sora perch\u00e9 la tecnologia non funzionava. L'ha chiuso perch\u00e9 i conti non tornavano. Con 15 milioni di dollari al giorno in costi di calcolo, nemmeno l'azienda AI pi\u00f9 finanziata del pianeta \u00e8 riuscita a far funzionare la generazione video per i consumatori. Quella cifra dovrebbe spaventare ogni azienda del settore.

I numeri che hanno ucciso Sora

Ecco l'economia che OpenAI ha cercato di nascondere per sei mesi.

Sora \u00e8 stato lanciato a settembre 2025 con prezzi al consumo: circa 0,10 dollari al secondo per video a 720p tramite API. Al picco di utilizzo, milioni di utenti generavano clip ogni giorno. I costi di inferenza GPU, eseguiti principalmente su cluster NVIDIA H100, scalavano linearmente con ogni richiesta.

$15M/day
Costo di calcolo giornaliero di Sora al picco
$2.1M
Ricavi totali nell'intero ciclo di vita
6 months
Tempo fino alla chiusura
$0.10/sec
Prezzo API (720p)

Il rapporto ricavi-costi era catastrofico. Sora ha generato circa 2,1 milioni di dollari di ricavi totali nell'intero ciclo di vita. Il costo operativo \u00e8 stato di circa 2,7 miliardi di dollari. Non \u00e8 un modello di business. \u00c8 una dimostrazione che ha bruciato capitale di rischio su scala industriale.

⚠️
Questi numeri provengono da report di CNBC e Bloomberg, combinati con stime dei costi infrastrutturali di analisti indipendenti. OpenAI non ha pubblicato dettagli ufficiali sui costi, ma l'ordine di grandezza \u00e8 coerente tra pi\u00f9 fonti.

Perch\u00e9 la generazione video \u00e8 fondamentalmente pi\u00f9 costosa delle immagini

Per capire perch\u00e9 questo conta al di l\u00e0 di Sora, bisogna comprendere il divario computazionale tra generazione di immagini e video.

Una singola richiesta di generazione immagine con un modello come DALL-E 3 o Stable Diffusion XL richiede circa 10-30 secondi di tempo GPU su un H100. Un video di 5 secondi a 24fps richiede la generazione di 120 frame, ciascuno con vincoli di coerenza temporale che impediscono la semplice parallelizzazione. Il meccanismo di attenzione nei transformer di diffusione video scala quadraticamente con la lunghezza della sequenza.

Tipo di generazioneSecondi GPU per outputCosto approssimativo H100
Singola immagine (1024x1024)10-30s$0,003-$0,01
Video 5 secondi (720p, 24fps)300-600s$0,10-$0,20
Video 10 secondi (1080p, 24fps)900-2400s$0,30-$0,80
Video 60 secondi (1080p, 24fps)5400-14400s$1,80-$4,80
Grafico a barre che confronta i costi di calcolo GPU: generazione immagine a $0,01 contro video di 60 secondi a $3,30
Il divario nei costi di calcolo tra immagini e video \u00e8 30-100x, non 5-10x

Il divario tra immagine e video non \u00e8 5x o 10x. \u00c8 30-100x in calcolo per output. E a differenza della generazione di testo, dove il KV-caching e il decoding speculativo hanno ridotto drasticamente i costi di inferenza, la generazione video non ha un'ottimizzazione equivalente che tagli i costi di un ordine di grandezza.

Tre strategie per sopravvivere alla crisi dei costi

Ogni azienda che ancora offre generazione video AI affronta lo stesso problema fondamentale. Le loro strategie divergono nettamente.

Strategia 1: Sussidiare e sperare (l'approccio VC)

Questa era la strategia di Sora. Prezzare sotto costo, acquisire utenti, capire la monetizzazione dopo. \u00c8 finita esattamente come i professori di economia prevedono dall'era delle dot-com.

Diverse aziende operano ancora cos\u00ec. Pika, Luma e Runway prezzano tutti i loro servizi ben al di sotto dei costi di calcolo stimati. La scommessa \u00e8 che i costi scenderanno pi\u00f9 velocemente di quanto i ricavi debbano crescere.

💡
Runway ha raccolto 315 milioni di dollari a febbraio 2026 con una valutazione di 5,3 miliardi di dollari. Questo d\u00e0 loro circa 18-24 mesi di autonomia ai tassi di consumo attuali, supponendo che non trovino un percorso verso la redditivit\u00e0. Il tempo stringe.

Il rischio \u00e8 evidente. Se i costi GPU non scendono abbastanza velocemente, o se l'utilizzo cresce pi\u00f9 rapidamente dei guadagni di ottimizzazione, queste aziende si scontreranno con lo stesso muro di Sora.

Strategia 2: Spostare i costi sull'hardware (la mossa NVIDIA/Open Source)

Questa \u00e8 la strategia dietro Helios, Wan 2.2, LTX-2.3 e ogni altro modello open source ottimizzato per GPU consumer.

La logica \u00e8 elegante: invece di gestire costose infrastrutture cloud, trasferisci il costo di calcolo sull'hardware dell'utente. Una RTX 4090 costa 1.599 dollari una volta sola. Dopo, ogni generazione video \u00e8 "gratuita" in termini di costo marginale (meno l'elettricit\u00e0).

Helios, il modello da 14 miliardi di parametri di ByteDance e Universit\u00e0 di Pechino, ha dimostrato che un singolo H100 pu\u00f2 generare video di 60 secondi a 19,5 FPS. Ancora pi\u00f9 importante, i modelli open source ottimizzati si stanno avvicinando alla generazione in tempo reale su hardware consumer RTX 5090.

ModelloHardware necessarioVelocit\u00e0 di generazioneLivello qualit\u00e0
Helios 14B1x H100 (o RTX 5090)19,5 FPS (tempo reale)Professionale
Wan 2.2 14B1x RTX 4090~3 FPSProfessionale
LTX-2.31x RTX 4090~5 FPS (4K)Professionale
PixVerse R11x RTX 3090~2 FPSConsumer

Il limite \u00e8 evidente: questa strategia serve solo utenti che possiedono GPU di fascia alta. \u00c8 un mercato significativo, ma esclude i creatori occasionali che avevano reso Sora popolare.

Strategia 3: Aggregazione di piattaforma (la mossa Adobe/Google)

Questo \u00e8 l'approccio finanziariamente pi\u00f9 sostenibile. Invece di sostenere l'intero costo della generazione, diventa un marketplace che instrada le richieste verso pi\u00f9 fornitori di modelli.

Adobe Firefly ora ospita pi\u00f9 di 30 modelli di diversi fornitori. Google Flow integra Veo con modelli di terze parti. CapCut integra Seedance 2.0. In tutti e tre i casi, la piattaforma prende un margine mentre il fornitore del modello sostiene il costo di calcolo.

Vantaggi della piattaforma
I ricavi per richiesta sono positivi dal primo giorno. Non serve possedere enormi cluster GPU. Si pu\u00f2 offrire agli utenti il modello migliore per ogni caso d'uso. Il rischio \u00e8 distribuito tra pi\u00f9 fornitori.
Rischi della piattaforma
Dipendenza dalla sopravvivenza dei fornitori di modelli. Nessuna differenziazione se i concorrenti aggregano gli stessi modelli. Pressione sui margini quando i fornitori negoziano condizioni migliori.

Adobe \u00e8 nella posizione migliore perch\u00e9 Premiere Pro e After Effects dominano gi\u00e0 il montaggio video professionale. Aggiungere la generazione AI ai flussi di lavoro esistenti \u00e8 un'estensione naturale, e Adobe pu\u00f2 prezzarla come funzionalit\u00e0 premium all'interno degli abbonamenti Creative Cloud che gli utenti gi\u00e0 pagano.

La curva dei costi infrastrutturali

La domanda cruciale \u00e8 se i costi GPU scenderanno abbastanza velocemente da rendere il video AI consumer un business sostenibile.

L'architettura Blackwell di NVIDIA (B200, GB200) offre un rapporto prezzo-prestazioni circa 2-3 volte migliore per i carichi di inferenza rispetto all'H100. La prossima architettura Rubin promette un ulteriore miglioramento di 2-3 volte. Se entrambe mantengono le promesse, entro il 2028 il costo di generazione di un video di 10 secondi potrebbe scendere da 0,50 a circa 0,05 dollari.

Quella tempistica conta. Le aziende che bruciano liquidit\u00e0 con prezzi sussidiati devono sopravvivere altri 2-3 anni perch\u00e9 i miglioramenti hardware salvino i loro modelli di business. Non tutte ce la faranno.

💡
Le aziende con pi\u00f9 probabilit\u00e0 di sopravvivere sono quelle con enormi riserve di liquidit\u00e0 (Google, Adobe, ByteDance), architetture di modelli efficienti che riducono il calcolo per frame, o business di piattaforma che non sostengono direttamente i costi di generazione.

Cosa significa per i creator

Se sei un creator che sceglie una piattaforma video AI oggi, l'economia conta quanto le funzionalit\u00e0.

  • Le piattaforme supportate da aziende madri profittevoli (Google, Adobe, ByteDance) sono scommesse pi\u00f9 sicure a lungo termine
  • I modelli open source eseguiti localmente eliminano la dipendenza da una singola azienda
  • Le startup che offrono generazione "illimitata" a prezzi bassi sono quelle a rischio pi\u00f9 alto
  • Aspettare che i costi si stabilizzino prima di impegnarsi in un flusso di lavoro \u00e8 ragionevole, ma significa perdere i vantaggi dell'adozione precoce

La chiusura di Sora non \u00e8 stata un'anomalia. \u00c8 stata la prima tessera del domino. L'economia della generazione video AI \u00e8 spietata, e le aziende che sopravviveranno saranno quelle che hanno trovato soluzioni creative al problema dei costi, non solo soluzioni creative al problema della generazione.

Il quadro generale

Ogni grande svolta nell'informatica ha attraversato una fase in cui la tecnologia funziona ma l'economia no. Il cloud computing \u00e8 stato in perdita per anni prima che AWS lo trasformasse in una macchina da soldi. Lo streaming video ha perso miliardi prima che Netflix trovasse il suo equilibrio. La generazione video AI si trova in quello stesso doloroso periodo intermedio.

La differenza questa volta \u00e8 la velocit\u00e0. La curva di miglioramento hardware \u00e8 pi\u00f9 ripida rispetto a quella del cloud o dello streaming. NVIDIA rilascia nuove architetture ogni 18-24 mesi con riduzioni significative del costo per FLOP. La ricerca sull'efficienza dei modelli, dalla distillazione alla mixture-of-experts fino a innovazioni architetturali come la compressione del contesto di Helios, sta tagliando i requisiti computazionali dal lato software.

La mia stima: entro la fine del 2027, generare un video di 10 secondi a 1080p coster\u00e0 meno di 0,10 dollari su infrastruttura cloud. A quel prezzo, il modello di business funziona. La domanda \u00e8 quali aziende riusciranno a sopravvivere fino ad allora.

Il cimitero delle startup video AI sta per affollarsi. Ma la tecnologia in s\u00e9 non scomparir\u00e0. Sta solo aspettando che l'economia la raggiunga.

💡
Per una guida pratica su come eseguire video AI in locale e bypassare completamente i costi cloud, consulta la nostra guida alla generazione video AI locale con LTX-2 e ComfyUI.
Alexis
AlexisAI EngineerAI Author

Ingegnere IA di Losanna che unisce profondità di ricerca e innovazione pratica. Divide il suo tempo tra architetture di modelli e vette alpine.

View profile →

Ti è piaciuto ciò che hai letto?

Trasforma le tue idee in video IA di durata illimitata in pochi minuti.

Articoli correlati

Continua a esplorare con questi articoli correlati

Ti è piaciuto questo articolo?

Scopri altri approfondimenti e resta aggiornato sui nostri ultimi contenuti.