مشكلة 15 مليون دولار يومياً: لماذا ستحدد اقتصاديات فيديو الذكاء الاصطناعي من سيبقى في 2026
أنفقت Sora ما يقارب 15 مليون دولار يومياً قبل أن توقفها OpenAI. السؤال الحقيقي ليس من يصنع أفضل نموذج فيديو بالذكاء الاصطناعي، بل من يستطيع تحمّل تكلفة تشغيله.

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟
انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai
الأرقام التي قتلت Sora
دعوني أعرض لكم الاقتصاديات التي حاولت OpenAI إخفاءها لمدة ستة أشهر.
أُطلقت Sora في سبتمبر 2025 بأسعار موجهة للمستهلكين: نحو 0.10 دولار لكل ثانية من فيديو بدقة 720p عبر واجهة برمجة التطبيقات. في ذروة الاستخدام, كان ملايين المستخدمين ينتجون مقاطع يومياً. وتكاليف استدلال وحدات GPU, التي كانت تعمل بشكل رئيسي على مجموعات NVIDIA H100, تصاعدت خطياً مع كل طلب.
كانت نسبة الإيرادات إلى التكلفة كارثية. حققت Sora ما يقدّر بنحو 2.1 مليون دولار من إجمالي الإيرادات طوال فترة عملها. وبلغت تكلفة تشغيلها نحو 2.7 مليار دولار. هذا ليس نموذج أعمال. هذا عرض توضيحي أحرق رأس المال الاستثماري على نطاق صناعي.
لماذا إنتاج الفيديو أكثر تكلفة جوهرياً من الصور
لفهم أهمية هذا الأمر بعيداً عن Sora, يجب فهم الفجوة الحوسبية بين إنتاج الصور والفيديو.
يتطلب طلب إنتاج صورة واحدة بنموذج مثل DALL-E 3 أو Stable Diffusion XL نحو 10 إلى 30 ثانية من وقت GPU على H100. أما فيديو مدته 5 ثوانٍ بمعدل 24 إطاراً في الثانية فيتطلب إنتاج 120 إطاراً, كل منها مع قيود التماسك الزمني التي تمنع التوازي البسيط. وآلية الانتباه في محولات الانتشار للفيديو تتصاعد بشكل تربيعي مع طول التسلسل.
| نوع الإنتاج | ثوانٍ GPU لكل مخرج | التكلفة التقريبية على H100 |
|---|---|---|
| صورة واحدة (1024x1024) | 10-30 ثانية | $0.003-$0.01 |
| فيديو 5 ثوانٍ (720p, 24fps) | 300-600 ثانية | $0.10-$0.20 |
| فيديو 10 ثوانٍ (1080p, 24fps) | 900-2400 ثانية | $0.30-$0.80 |
| فيديو 60 ثانية (1080p, 24fps) | 5400-14400 ثانية | $1.80-$4.80 |

الفجوة بين الصور والفيديو ليست 5 أو 10 أضعاف. إنها 30 إلى 100 ضعف في الحوسبة لكل مخرج. وعلى عكس توليد النصوص, حيث أدى التخزين المؤقت KV والفك التخميني إلى تقليل تكاليف الاستدلال بشكل كبير, لا يمتلك إنتاج الفيديو تحسيناً مكافئاً يخفض التكاليف بمقدار عشرة أضعاف.
ثلاث استراتيجيات للبقاء في أزمة التكاليف
كل شركة لا تزال تقدم خدمة إنتاج فيديو بالذكاء الاصطناعي تواجه هذه المشكلة الجوهرية ذاتها. واستراتيجياتها تتباين بشكل حاد.
الاستراتيجية الأولى: الدعم والأمل (نهج رأس المال الاستثماري)
هذه كانت استراتيجية Sora. التسعير بأقل من التكلفة, واستقطاب المستخدمين, ثم معرفة كيفية تحقيق الإيرادات لاحقاً. وانتهت تماماً كما كان يتوقع أساتذة الاقتصاد منذ عصر الدوت كوم.
لا تزال عدة شركات تعمل بهذه الطريقة. تسعّر Pika وLuma وRunway خدماتها بأقل بكثير من تكاليف الحوسبة المقدرة. الرهان هو أن التكاليف ستنخفض أسرع مما تحتاج الإيرادات للنمو.
المخاطر واضحة. إذا لم تنخفض تكاليف GPU بالسرعة الكافية, أو إذا نما الاستخدام أسرع من مكاسب التحسين, فإن هذه الشركات ستواجه الجدار نفسه الذي اصطدمت به Sora.
الاستراتيجية الثانية: نقل التكاليف إلى الأجهزة (نهج NVIDIA والمصادر المفتوحة)
هذه هي الاستراتيجية وراء Helios وWan 2.2 وLTX-2.3 وكل نموذج مفتوح المصدر مُحسّن لبطاقات GPU الاستهلاكية.
المنطق أنيق: بدلاً من تشغيل بنية تحتية سحابية مكلفة, يتم نقل تكلفة الحوسبة إلى أجهزة المستخدم. تكلف بطاقة RTX 4090 مبلغ 1,599 دولاراً مرة واحدة. وبعد ذلك, كل عملية إنتاج فيديو "مجانية" من حيث التكلفة الحدية (باستثناء الكهرباء).
Helios, النموذج ذو 14 مليار معامل من ByteDance وجامعة بكين, أثبت أن وحدة H100 واحدة يمكنها إنتاج فيديوهات مدتها 60 ثانية بمعدل 19.5 إطاراً في الثانية. والأهم من ذلك, أن نماذج المصدر المفتوح المحسّنة تقترب من الإنتاج الفوري على أجهزة RTX 5090 الاستهلاكية.
| النموذج | الأجهزة المطلوبة | سرعة الإنتاج | مستوى الجودة |
|---|---|---|---|
| Helios 14B | 1x H100 (أو RTX 5090) | 19.5 FPS (فوري) | احترافي |
| Wan 2.2 14B | 1x RTX 4090 | ~3 FPS | احترافي |
| LTX-2.3 | 1x RTX 4090 | ~5 FPS (4K) | احترافي |
| PixVerse R1 | 1x RTX 3090 | ~2 FPS | استهلاكي |
القيد واضح: هذه الاستراتيجية تخدم فقط المستخدمين الذين يمتلكون بطاقات GPU متطورة. هذا سوق ذو قيمة, لكنه يستبعد المبدعين العاديين الذين جعلوا Sora شائعة.
الاستراتيجية الثالثة: تجميع المنصات (نهج Adobe وGoogle)
هذا هو النهج الأكثر استدامة مالياً. بدلاً من تحمّل التكلفة الكاملة للإنتاج, تصبح سوقاً يوجّه الطلبات إلى مزودي نماذج متعددين.
يستضيف Adobe Firefly الآن أكثر من 30 نموذجاً من مزودين مختلفين. يدمج Google Flow نموذج Veo مع نماذج الطرف الثالث. ويدمج CapCut نموذج Seedance 2.0. في جميع الحالات الثلاث, تأخذ المنصة هامشاً بينما يتحمل مزود النموذج تكلفة الحوسبة.
Adobe هي الأفضل موقعاً هنا لأن Premiere Pro وAfter Effects يهيمنان بالفعل على تحرير الفيديو الاحترافي. إضافة الإنتاج بالذكاء الاصطناعي إلى سير العمل الحالي هو امتداد طبيعي, ويمكن لـ Adobe تسعيره كميزة متقدمة ضمن اشتراكات Creative Cloud التي يدفع المستخدمون ثمنها بالفعل.
منحنى تكلفة البنية التحتية
السؤال الحاسم هو ما إذا كانت تكاليف GPU ستنخفض بسرعة كافية لجعل فيديو الذكاء الاصطناعي للمستهلكين قابلاً للتطبيق.
تقدم بنية Blackwell من NVIDIA (B200, GB200) أداءً أفضل بنحو 2 إلى 3 أضعاف من حيث السعر مقابل الأداء لأعباء الاستدلال مقارنة بـ H100. وتعد بنية Rubin القادمة بتحسين مماثل بمقدار 2 إلى 3 أضعاف. إذا تحقق كلاهما كما هو متوقع, بحلول 2028 يمكن أن تنخفض تكلفة إنتاج فيديو مدته 10 ثوانٍ من 0.50 دولار إلى نحو 0.05 دولار.
هذا الجدول الزمني مهم. الشركات التي تحرق النقد على التسعير المدعوم تحتاج للبقاء من 2 إلى 3 سنوات أخرى حتى تنقذ التحسينات في الأجهزة نماذج أعمالها. ليس جميعها ستنجح.
ماذا يعني هذا للمبدعين
إذا كنت مبدعاً تختار منصة فيديو بالذكاء الاصطناعي اليوم, فإن الاقتصاديات تهم بقدر أهمية الميزات.
- ✓المنصات المدعومة من شركات أم مربحة (Google, Adobe, ByteDance) هي رهانات أكثر أماناً على المدى الطويل
- ✓نماذج المصدر المفتوح التي تعمل محلياً تزيل الاعتماد على أي شركة بعينها
- ✓الشركات الناشئة التي تقدم إنتاجاً "غير محدود" بأسعار منخفضة هي الأعلى خطورة
- ✓الانتظار حتى استقرار التكاليف قبل الالتزام بسير عمل معين أمر منطقي لكنه يعني فقدان مزايا التبني المبكر
لم يكن إغلاق Sora حالة شاذة. كان أول حجر دومينو يسقط. اقتصاديات إنتاج الفيديو بالذكاء الاصطناعي قاسية, والشركات التي ستبقى هي تلك التي وجدت حلولاً إبداعية لمشكلة التكلفة, وليس فقط حلولاً إبداعية لمشكلة الإنتاج.
الصورة الأشمل
كل تحول كبير في الحوسبة مرّ بمرحلة تعمل فيها التقنية لكن الاقتصاديات لا تعمل. كانت الحوسبة السحابية غير مربحة لسنوات قبل أن تحوّلها AWS إلى مصدر دخل ضخم. خسر البث المباشر للفيديو مليارات قبل أن تجد Netflix موطئ قدم. إنتاج الفيديو بالذكاء الاصطناعي يمر بالمرحلة الوسطى المؤلمة ذاتها.
الفرق هذه المرة هو السرعة. منحنى تحسين الأجهزة أكثر حدة مما كان عليه للحوسبة السحابية أو البث. تطرح NVIDIA بنيات جديدة كل 18 إلى 24 شهراً مع تخفيضات ملموسة في التكلفة لكل عملية حسابية. أبحاث كفاءة النماذج, من التقطير إلى مزيج الخبراء إلى الابتكارات المعمارية مثل ضغط السياق في Helios, تخفض متطلبات الحوسبة من الجانب البرمجي.
تقديري: بحلول أواخر 2027, سيكلف إنتاج فيديو مدته 10 ثوانٍ بدقة 1080p أقل من 0.10 دولار على البنية التحتية السحابية. عند هذا السعر, يصبح نموذج الأعمال ناجحاً. السؤال هو أي الشركات يمكنها البقاء حتى ذلك الحين.
مقبرة شركات الفيديو الناشئة بالذكاء الاصطناعي على وشك أن تزدحم. لكن التقنية نفسها لن تختفي. إنها فقط تنتظر أن تلحق بها الاقتصاديات.

مهندس ذكاء اصطناعي من لوزان يجمع بين عمق البحث والابتكار العملي. يقسم وقته بين هياكل النماذج والقمم الجبلية.
View profile →مقالات ذات صلة
تابع الاستكشاف مع هذه المقالات ذات الصلة

سورا انتهت. OpenAI تنسحب كليًا من إنتاج الفيديو بالذكاء الاصطناعي.
أوقفت OpenAI تطبيق Sora، وألغت صفقة ديزني، وتحولت نحو الروبوتات. أبرز منتج فيديو بالذكاء الاصطناعي في العالم استمر ستة أشهر فقط. إليك ما يجب على صناع المحتوى فعله الآن.

انهيار نماذج الفيديو الذكية في مارس 2026: لماذا أصبح الاتجاه الإبداعي هو الاختناق الحقيقي
شهد مارس 2026 إطلاق أكثر من 12 نموذج فيديو ذكي خلال أسبوع واحد. مع تحقيق جودة متماثلة، انتقل المزايا التنافسية من القدرة التقنية إلى الاتجاه الإبداعي.

فيديو واحد، ألف جمهور: كيف يعيد تخصيص الفيديو بالذكاء الاصطناعي كتابة تسويق الفيديو في عام 2026
يتيح تخصيص فيديو الذكاء الاصطناعي للعلامات التجارية إنشاء آلاف متغيرات الفيديو المخصصة من مفهوم واحد. إليك كيف ينقل التحول من التعامل الموحد إلى التخصيص المفرد تسويق الفيديو إلى الأبد.
