প্রতিদিনের $15 Million সমস্যাটি: কেন AI Video-এর অর্থনীতি ঠিক করবে 2026-এ কে টিকে থাকবে
OpenAI বন্ধ করার আগে Sora প্রতিদিন $15 million খরচ করছিল। আসল প্রশ্ন কে সেরা AI video model বানায় তা নয়। প্রশ্ন হলো, কে একটি চালানোর সামর্থ্য রাখে।

যে সংখ্যাগুলো Sora-কে শেষ করেছে
OpenAI ছয় মাস ধরে যে অর্থনীতি আড়াল করার চেষ্টা করেছিল, তা তুলে ধরি।
Sora 2025 সালের September-এ ভোক্তা মূল্য নিয়ে চালু হয়েছিল: API-এর মাধ্যমে 720p video-র প্রতি সেকেন্ডে আনুমানিক $0.10। সর্বোচ্চ ব্যবহারের সময়, প্রতিদিন লক্ষ লক্ষ ব্যবহারকারী clip তৈরি করছিলেন। প্রধানত NVIDIA H100 cluster-এ চলা GPU inference খরচ প্রতিটি অনুরোধের সঙ্গে সরলরেখায় বাড়ছিল।
আয়-ব্যয় অনুপাত ছিল বিপর্যয়কর। Sora তার পুরো জীবনকালে মোট আয় হিসেবে আনুমানিক $2.1 million করেছে। এটি চালাতে আনুমানিক $2.7 billion লেগেছে। এটি কোনো ব্যবসায়িক মডেল নয়। এটি শিল্প-পর্যায়ে venture capital পুড়িয়ে ফেলার একটি প্রদর্শনী।
কেন Video Generation ছবির চেয়ে মৌলিকভাবে বেশি ব্যয়বহুল
Sora-এর বাইরেও বিষয়টি কেন গুরুত্বপূর্ণ, তা বুঝতে হলে image ও video generation-এর মধ্যে compute ব্যবধান বুঝতে হবে।
DALL-E 3 বা Stable Diffusion XL-এর মতো model দিয়ে একটি image generation request-এর জন্য H100-এ আনুমানিক 10-30 seconds GPU সময় লাগে। 24fps-এ একটি 5-second video-র জন্য 120টি frame তৈরি করতে হয়, এবং প্রতিটি frame-এ temporal coherence সীমাবদ্ধতা থাকে যা সহজ parallelization প্রতিরোধ করে। video diffusion transformer-এর attention mechanism sequence length-এর সঙ্গে দ্বিঘাত হারে বাড়ে।
| Generation Type | প্রতি output-এ GPU-seconds | আনুমানিক H100 খরচ |
|---|---|---|
| একক image (1024x1024) | 10-30s | $0.003-$0.01 |
| 5-second video (720p, 24fps) | 300-600s | $0.10-$0.20 |
| 10-second video (1080p, 24fps) | 900-2400s | $0.30-$0.80 |
| 60-second video (1080p, 24fps) | 5400-14400s | $1.80-$4.80 |

image ও video-এর ব্যবধান 5x বা 10x নয়। প্রতি output-এ compute-এর হিসেবে এটি 30-100x। এবং text generation-এর বিপরীতে, যেখানে KV-caching ও speculative decoding inference খরচ নাটকীয়ভাবে কমিয়েছে, video generation-এ এমন কোনো সমতুল্য optimization নেই যা এক অর্ডার মাত্রায় খরচ কমায়।
খরচ সংকট থেকে টিকে থাকার তিনটি কৌশল
এখনও AI video generation প্রদানকারী প্রতিটি কোম্পানি একই মৌলিক সমস্যার মোকাবিলা করছে। তাদের কৌশলগুলো ব্যাপকভাবে ভিন্ন।
কৌশল 1: ভর্তুকি দিন এবং প্রার্থনা করুন (VC পদ্ধতি)
এটি ছিল Sora-এর কৌশল। খরচের নিচে মূল্য নির্ধারণ করুন, ব্যবহারকারী অর্জন করুন, পরে monetization বের করুন। dot-com যুগ থেকে অর্থনীতির অধ্যাপকরা যেমন পূর্বাভাস দিয়ে আসছেন, ঠিক তেমনভাবেই এর সমাপ্তি হয়েছে।
বেশ কিছু কোম্পানি এখনও এভাবেই চলে। Pika, Luma এবং Runway সবাই তাদের পরিষেবার মূল্য আনুমানিক compute খরচের অনেক নিচে রাখে। বাজি হলো, আয়ের প্রয়োজনীয় বৃদ্ধির চেয়ে খরচ দ্রুত কমবে।
ঝুঁকিটি স্পষ্ট। GPU খরচ যথেষ্ট দ্রুত না কমলে, অথবা optimization-এর লাভের চেয়ে ব্যবহার দ্রুত বাড়লে, এই কোম্পানিগুলো Sora যে একই দেয়ালে আঘাত করেছিল তার মুখোমুখি হবে।
কৌশল 2: খরচ Hardware-এ সরিয়ে দিন (NVIDIA/Open Source পদ্ধতি)
এটি Helios, Wan 2.2, LTX-2.3 এবং consumer GPU-এর জন্য optimized অন্য সব open-source model-এর পেছনের কৌশল।
যুক্তিটি চমৎকার: ব্যয়বহুল cloud infrastructure চালানোর বদলে compute খরচ ব্যবহারকারীর hardware-এ সরিয়ে দিন। একটি RTX 4090-এর একবারের খরচ $1,599। এরপর marginal cost-এর দিক থেকে প্রতিটি video generation "free" (বিদ্যুৎ বাদে)।
Helios, ByteDance ও Peking University-এর 14-billion parameter model, দেখিয়েছে যে একটি H100 19.5 FPS-এ 60-second video তৈরি করতে পারে। আরও গুরুত্বপূর্ণ হলো, optimized open-source model-গুলো consumer RTX 5090 hardware-এ real-time generation-এর কাছাকাছি পৌঁছে যাচ্ছে।
| Model | প্রয়োজনীয় Hardware | Generation Speed | Quality Tier |
|---|---|---|---|
| Helios 14B | 1x H100 (বা RTX 5090) | 19.5 FPS (real-time) | পেশাদার |
| Wan 2.2 14B | 1x RTX 4090 | ~3 FPS | পেশাদার |
| LTX-2.3 | 1x RTX 4090 | ~5 FPS (4K) | পেশাদার |
| PixVerse R1 | 1x RTX 3090 | ~2 FPS | ভোক্তা |
সীমাবদ্ধতাটি স্পষ্ট: এই কৌশল কেবল সেই ব্যবহারকারীদের সেবা দেয় যাদের high-end GPU আছে। এটি একটি অর্থবহ বাজার, কিন্তু Sora-কে জনপ্রিয় করা casual creator-দের বাদ দেয়।
কৌশল 3: Platform Aggregation (Adobe/Google পদ্ধতি)
এটি আর্থিকভাবে সবচেয়ে টেকসই পদ্ধতি। generation-এর পুরো খরচ বহন করার বদলে, এমন একটি marketplace হয়ে উঠুন যা একাধিক model provider-এ request পাঠায়।
Adobe Firefly এখন 30+ model host করে বিভিন্ন provider থেকে। Google Flow তৃতীয় পক্ষের model-এর সঙ্গে Veo সংযুক্ত করে। CapCut Seedance 2.0 embed করে। তিন ক্ষেত্রেই platform margin নেয়, আর model provider compute খরচ বহন করে।
Adobe এখানে সবচেয়ে ভালো অবস্থানে আছে, কারণ Premiere Pro ও After Effects ইতিমধ্যেই professional video editing-এ প্রভাবশালী। বিদ্যমান workflow-তে AI generation যোগ করা একটি স্বাভাবিক সম্প্রসারণ, এবং Adobe এটিকে ব্যবহারকারীদের ইতিমধ্যেই পরিশোধ করা Creative Cloud subscription-এর মধ্যে premium feature হিসেবে মূল্য নির্ধারণ করতে পারে।
Infrastructure Cost Curve
গুরুত্বপূর্ণ প্রশ্ন হলো, consumer AI video কার্যকর করার জন্য GPU খরচ যথেষ্ট দ্রুত কমবে কি না।
NVIDIA-এর Blackwell architecture (B200, GB200) H100-এর তুলনায় inference workload-এ আনুমানিক 2-3x ভালো price-performance দেয়। আসন্ন Rubin architecture আরও 2-3x উন্নতির প্রতিশ্রুতি দিচ্ছে। উভয়টি প্রত্যাশামতো কাজ করলে, 2028 সালের মধ্যে 10-second video তৈরির খরচ $0.50 থেকে কমে আনুমানিক $0.05 হতে পারে।
এই সময়রেখা গুরুত্বপূর্ণ। subsidized pricing-এ নগদ অর্থ পোড়ানো কোম্পানিগুলোর ব্যবসায়িক মডেল বাঁচাতে hardware উন্নয়ন আসা পর্যন্ত আরও 2-3 more years টিকে থাকতে হবে। সবাই পারবে না।
Creator-দের জন্য এর অর্থ কী
আজ আপনি যদি AI video platform বেছে নেওয়া একজন creator হন, তাহলে feature-এর মতোই অর্থনীতিও গুরুত্বপূর্ণ।
- ✓লাভজনক parent company-র সমর্থন থাকা platform (Google, Adobe, ByteDance) দীর্ঘমেয়াদে নিরাপদ পছন্দ
- ✓স্থানীয়ভাবে চলা open-source model যেকোনো একক কোম্পানির উপর নির্ভরতা দূর করে
- ✓কম মূল্যে "unlimited" generation প্রদানকারী startup-গুলো সবচেয়ে বেশি ঝুঁকিপূর্ণ
- ✓workflow-তে প্রতিশ্রুতিবদ্ধ হওয়ার আগে খরচ স্থিতিশীল হওয়ার অপেক্ষা যুক্তিসঙ্গত, কিন্তু এতে early adoption-এর সুবিধা হারাতে হয়
Sora বন্ধ হওয়া কোনো ব্যতিক্রম ছিল না। এটি ছিল প্রথম domino। AI video generation-এর অর্থনীতি নির্মম, এবং যে কোম্পানিগুলো টিকবে তারা cost problem-এর সৃজনশীল সমাধান খুঁজেছে বলেই টিকবে, শুধু generation problem-এর সৃজনশীল সমাধান খুঁজেছে বলে নয়।
বৃহত্তর চিত্র
computing-এর প্রতিটি বড় পরিবর্তন এমন একটি পর্যায় পার করেছে যেখানে প্রযুক্তি কাজ করে, কিন্তু অর্থনীতি করে না। AWS এটিকে cash machine-এ পরিণত করার আগে cloud computing বহু বছর অলাভজনক ছিল। Netflix নিজেদের অবস্থান পাওয়ার আগে streaming video billions হারিয়েছে। AI video generation একই বেদনাদায়ক মধ্যবর্তী পর্যায়ে আছে।
এবারের পার্থক্য হলো গতি। hardware improvement curve cloud বা streaming-এর চেয়ে বেশি খাড়া। NVIDIA প্রতি 18-24 months-এ অর্থবহ cost-per-FLOP হ্রাসসহ নতুন architecture সরবরাহ করছে। distillation থেকে mixture-of-experts পর্যন্ত model efficiency research, এবং Helios-এর context compression-এর মতো architectural innovation, software-এর দিক থেকে compute requirement কমিয়ে দিচ্ছে।
আমার অনুমান: 2027 সালের শেষ নাগাদ, cloud infrastructure-এ 1080p-এ একটি 10-second video তৈরি করতে $0.10-এর কম খরচ হবে। সেই মূল্যবিন্দুতে business model কার্যকর হয়। প্রশ্ন হলো, ততদিন পর্যন্ত কোন কোম্পানিগুলো টিকে থাকতে পারবে।
AI video startup-গুলোর কবরস্থান খুব শিগগিরই ভিড় করবে। কিন্তু প্রযুক্তিটি নিজে কোথাও যাচ্ছে না। অর্থনীতি তাল মেলানোর অপেক্ষায় আছে মাত্র।
উৎস

লসানের একজন AI ইঞ্জিনিয়ার, যিনি গবেষণার গভীরতার সঙ্গে ব্যবহারিক উদ্ভাবন মিলিয়ে কাজ করেন। মডেল আর্কিটেকচার এবং আল্পসের শৃঙ্গের মধ্যে সময় ভাগ করেন।
View profile →সম্পর্কিত নিবন্ধ
এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

2026 সালের 10টি সেরা Sora বিকল্প, র্যাঙ্ক করা হয়েছে (জুলাই আপডেট)
Sora 24 মার্চ, 2026-এ বন্ধ হয়ে গেছে। আমরা আউটপুটের মান, প্রকৃত মূল্য এবং সময়সীমার সীমা অনুযায়ী 10টি সেরা বিকল্প, Veo 3.1, Runway, Kling 3.0, Bonega, Luma, র্যাঙ্ক করেছি, প্রতিটি ব্যবহারের জন্য দ্রুত একটি পছন্দসহ।

Sora শেষ। OpenAI AI ভিডিও জেনারেশন থেকে সম্পূর্ণ বের হয়ে গেল।
OpenAI Sora অ্যাপ বন্ধ করে দিল, Disney ডিল বাতিল করল, এবং রোবোটিক্সের দিকে ঘুরে গেল। সবচেয়ে হাই-প্রোফাইল AI ভিডিও প্রোডাক্ট মাত্র ছয় মাস টিকল। ক্রিয়েটরদের এখনই কী করা দরকার, জানুন এখানে।

একটি ভিডিও, হাজার দর্শক: কীভাবে এআই ব্যক্তিগতকরণ 2026 সালে ভিডিও মার্কেটিং পুনর্লিখন করছে
এআই ভিডিও ব্যক্তিগতকরণ ব্র্যান্ডগুলিকে একটি একক ধারণা থেকে হাজার হাজার কাস্টমাইজড ভিডিও ভেরিয়েন্ট তৈরি করতে দেয়। এক-আকার-সব-মানানসই থেকে ব্যক্তি-এক পর্যন্ত পরিবর্তন কীভাবে মার্কেটিং চিরতরে পরিবর্তন করছে তা জানুন।
