Meta Pixelتجاوز إلى المحتوى الرئيسي
HenryHenry· كاتب ذكاء اصطناعي، فحوصات آلية، المسؤولية للمحرر
9 min read
1626 كلمات

نماذج لغة الفيديو: الأفق القادم بعد النماذج اللغوية الكبيرة ووكلاء الذكاء الاصطناعي

تعلم نماذج العالم الذكاء الاصطناعي كيفية فهم الواقع المادي، مما يمكن الروبوتات من تخطيط الأفعال ومحاكاة النتائج قبل تحريك مشغل ميكانيكي واحد.

نماذج لغة الفيديو: الأفق القادم بعد النماذج اللغوية الكبيرة ووكلاء الذكاء الاصطناعي

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟

انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai يبدأ الإنشاء بعد الدفع.

حققت النماذج اللغوية الكبيرة السيطرة على النصوص. وأتقنت نماذج الرؤية التعامل مع الصور. وتعلمت وكلاء الذكاء الاصطناعي استخدام الأدوات. والآن، تنشأ فئة جديدة قد تتضاءل أمامها باقي الفئات: نماذج لغة الفيديو، أو ما يطلق عليه الباحثون بشكل متزايد "نماذج العالم".

لقد أمضينا السنوات القليلة الماضية في تعليم الذكاء الاصطناعي القراءة والكتابة وحتى التفكير في المشكلات المعقدة. ولكن القضية هنا: كل هذا يحدث في العالم الرقمي. يمكن لـ ChatGPT أن يكتب لك قصيدة عن السير في الغابة، لكنه لا يملك أي فكرة عما يعنيه فعلياً التخطي فوق جذع شجرة ساقط أو الانحناء تحت فرع منخفض.

نماذج العالم موجودة لتغيير ذلك.

ما هي نماذج لغة الفيديو؟

💡

تعالج نماذج لغة الفيديو (VLMs) التسلسلات البصرية واللغة في وقت واحد، مما يمكن الذكاء الاصطناعي ليس فقط من فهم ما يحتويه إطار الصورة، بل كيفية تطور المشاهد عبر الزمن وما قد يحدث بعد ذلك.

فكر فيها على أنها تطور لنماذج الرؤية واللغة، ولكن مع إضافة حاسمة: الفهم الزمني. في حين تنظر نماذج VLM القياسية إلى صورة واحدة وتجيب عن أسئلة حولها، يراقب نموذج لغة الفيديو التسلسلات وهي تتكشف ويتعلم القواعد التي تحكم الواقع المادي.

هذا ليس مجرد فضول أكاديمي. فالآثار العملية مذهلة.

عندما يحتاج روبوت إلى التقاط فنجان قهوة، لا يمكنه مجرد التعرف على كلمة "فنجان" في صورة. إنه بحاجة إلى فهم:

  • كيف تتصرف الأجسام عند دفعها أو رفعها
  • ماذا يحدث عندما تتلاطم السوائل
  • كيف تؤثر تحركاته الخاصة على المشهد
  • ما هي الأفعال الممكنة فيزياءً مقابل المستحيلة

هنا يأتي دور نماذج العالم.

من المحاكاة إلى الفعل

🤖

الذكاء المادي

تولد نماذج العالم محاكاة شبيهة بالفيديو لمستقبليات محتملة، مما يسمح للروبوتات بـ "تخيل" النتائج قبل الالتزام بالأفعال.

المفهوم أنيق: بدلاً من الترميز الصلب للقواعد الفيزيائية، تقوم بتدريب الذكاء الاصطناعي على ملايين الساعات من الفيديو التي تظهر كيف يعمل العالم بالفعل. يتعلم النموذج الجاذبية، والاحتكاك، وثبات الأجسام، والسببية ليس من المعادلة، بل من الملاحظة.

يمثل Cosmos من NVIDIA إحدى أكثر المحاولات طموحاً في هذا المجال. تم تصميم نموذج العالم الخاص بهم خصيصاً لتطبيقات الروبوتات، حيث لا يكون فهم الواقع المادي خياراً إضافياً، بل مسألة بقاء.

يتخذ Genie 3 من Google DeepMind نهجاً مختلفاً، حيث يركز على توليد عالم تفاعلي يمكن "لعبه" كبيئة ألعاب فيديو.

الروبوتات التقليدية

قواعد فيزياء مرمزة يدوياً، حالات حدية هشّة، مصفوفات أجهزة استشعار مكلفة، تكيف بطيء مع البيئات الجديدة

نهج نموذج العالم

حدس مادي مكتسب، تدهور تدريجي سلس، متطلبات عتاد أسهل، انتقال سريع إلى سيناريوهات جديدة

تجربة PAN

كشف الباحثون في جامعة محمد بن زايد مؤخراً عن PAN، وهو نموذج عالم عام ينفذ ما يسمونه "تجارب فكرية" في محاكاة خاضعة للتحكم.

🧪

كيف يعمل PAN

باستخدام التنبؤ الكامن التوليدي (GLP) وبنية Causal Swin-DPM، يحافظ PAN على اتساق المشهد عبر تسلسلات ممتدة أثناء التنبؤ بنتائج معقولة فيزيائياً.

الابتكار الرئيسي هو التعامل مع نمذجة العالم كمسألة فيديو توليدي. بدلاً من برمجة الفيزياء بشكل صريح، يتعلم النموذج توليد استمرارية للفيديو تحترم القوانين الفيزيائية. عندما يُعطى المشهد الابتدائي وعملاً مقترحاً، يمكنه "تخيل" ما يحدث بعد ذلك.

هذا له آثار عميقة على علم الروبوتات. قبل أن يمد روبوت شبيه بالبشر يده للوصول إلى فنجان القهوة، يمكنه تشغيل مئات المحاولات المحاكاة، ليتعلم أي زوايا الاقتراب تنجح وأيها تنتهي بانسكاب القهوة على الأرض.

مستقبل المليار روبوت

1B
العدد المتوقع للروبوتات الشبيهة بالبشر بحلول عام 2050
3x
النمو في الاستثمار في الذكاء الاصطناعي للروبوتات منذ 2023

هذه ليست أرقاماً عشوائية جُذبت لإحداث تأثير درامي. تشير توقعات الصناعة بوضوح إلى مستقبل تفي فيه الروبوتات الشبيهة بالبشر بشيوع الهواتف الذكية. وكل روبوت منها سيحتاج إلى نماذج عالم ليعمل بأمان إلى جانب البشر.

تمتد التطبيقات إلى ما هو أبعد من الروبوتات الشبيهة بالبشر:

الآن

محاكاة المصانع

تدريب العمال في بيئات افتراضية قبل نشرهم في أرضيات المصانع الحقيقية

2025

المركبات ذاتية القيادة

أنظمة أمان تتنبأ بسيناريوهات الحوادث وتتخذ إجراءات وقائية

2026

الملاحة في المستودعات

روبوتات تفهم المساحات المعقدة وتتكيف مع المخططات المتغيرة

2027+

المساعدون المنزليون

روبوتات تتنقل بأمان في المساحات المعيشية للجميع وتتعامل مع الأجسام اليومية

حيث يلتقي توليد الفيديو بفهم العالم

إذا كنت تتابع توليد الفيديو بالذكاء الاصطناعي، فقد تلاحظ بعض التداخل هنا. أدوات مثل Sora 2 و Veo 3 تولد بالفعل فيديوهات واقعية بشكل ملحوظ. أليست هي أيضاً نماذج عالم؟

نعم ولا.

قامت OpenAI بوضع Sora بشكل صريح كنموذج يملك قدرات محاكاة العالم. من الواضح أن النموذج يفهم شيئاً ما عن الفيزياء. انظر إلى أي فيديو مولد بواسطة Sora وستلاحظ إضاءة واقعية، وحركة معقولة، وأجساماً تتصرف بشكل صحيح غالباً.

ولكن هناك فارق حاسم بين توليد فيديو يبدو معقولاً وبين الفهم الحقيقي للسببية الفيزيائية. تم تحسين مولدات الفيديو الحالية من أجل الواقعية البصرية. بينما تم تحسين نماذج العالم من أجل الدقة التنبؤية.

💡

الاختبار ليس "هل يبدو هذا واقعياً؟" بل "عند القيام بالعمل X، هل يتنبأ النموذج بالنتيجة Y بشكل صحيح؟" هذا معيار أصلب بكثير للتحقق.

مشكلة الهلوسة

إليك الحقيقة غير المريحة: تعاني نماذج العالم من نفس مشكلات الهلوسة التي تلاحق النماذج اللغوية الكبيرة (LLMs).

عندما يذكر ChatGPT بثقة حقيقة خاطئة، يكون الأمر مزعجاً. ولكن عندما يتنبأ نموذج العالم بثقة بأن الروبوت يمكنه المشي عبر الجدار، يكون الأمر خطيراً.

⚠️

قد تتسبب هلوسات نموذج العالم في الأنظمة المادية في أضرار حقيقية. قيود السلامة وطبقات التحقق ضرورية قبل النشر إلى جانب البشر.

تتدهور الأنظمة الحالية عبر التسلسلات الطويلة، متخلية عن الاتساق كلما امتد توقعها في المستقبل. هذا يخلق توتراً أساسياً: أكثر التنبؤات فائدة هي تلك الممتدة على المدى الطويل، لكنها أيضاً الأقل موثوقية.

يهاجم الباحثون هذه المشكلة من زوايا متعددة. يركز البعض على بيانات تدريب أفضل. ويعمل آخرون على ابتكارات معمارية تحافظ على اتساق المشهد. بينما يدعو آخرون إلى نهج هجين يجمع بين نماذج العالم المكتسبة والقيود الفيزيائية الصريحة.

اختراق Qwen 3-VL

على جانب الرؤية واللغة، يمثل Qwen 3-VL من Alibaba أحدث ما توصلت إليه التكنولوجيا للنماذج مفتوحة المصدر.

ينافس نموذج Qwen3-VL-235B الرائد النظم التجارية الكبرى عبر معايير تقييم متعددة الوسائط تغطي الأسئلة والأجوبة العامة، والتأريض ثلاثي الأبعاد، وفهم الفيديو، والتعرف الضوئي على الحروف (OCR)، وفهم المستندات.

ما يجعل Qwen 3-VL مثيراً للاهتمام بشكل خاص هو قدراته "الوكيلية". يمكن للنموذج تشغيل الواجهات الرسومية، والتعرف على عناصر واجهة المستخدم، وفهم وظائفها، وتأدية مهام في العالم الحقيقي من خلال استدعاء الأدوات.

هذا هو الجسر بين الفهم والفعل الذي تحتاجه نماذج العالم.

لماذا يهم هذا منشئي المحتوى

إذا كنت منشئ فيديو أو مخرج أفلام أو رسام رسوم متحركة، فقد تبدو نماذج العالم بعيدة عن عملك اليومي. لكن الآثار المترتبة على ذلك أقرب مما تعتقد.

الأعراض التي تعرفها بالفعل

تعاني أدوات فيديو الذكاء الاصطناعي الحالية من صعوبة في الاتساق الفيزيائي، وللإخفاقات سبب مشترك:

  • تتداخل الأجسام أو تبتلع بعضها، لأنه لا يوجد شيء في النموذج يمثل الجسم ككيان يشغل مساحة.
  • تتصرف الجاذبية بشكل غير متسق بين اللقطات، لأن كل لقطة يتم أخذ عينتها بشكل مستقل.
  • تختل السبب والنتيجة، لأن النموذج يتنبأ بما يبدو عليه الإطار بدلاً من التنبؤ بما يحدث بعد ذلك.

هذه كلها أعراض لنماذج يمكنها توليد بكسلات واقعية ولكنها لا تفهم حقاً القواعد الفيزيائية التي تكمن وراء ما تصوره.

ما الذي يغيره نموذج العالم

نموذج العالم هو نظام يحافظ على تمثيل للمشهد نفسه، وليس فقط للإطار الأخير. هذا التمييز هو ما يسمح لجسم ما بالبقاء حيث كان عندما تغادره الكاميرا وتعود إليه.

إن نماذج العالم المدربة على مجموعات بيانات فيديو ضخمة قد تغذي في النهاية أدوات توليد الفيديو، مما ينتج أدوات ذكاء اصطناعي تحترم القوانين الفيزيائية بطبيعتها. تخيل مولد فيديو لا تحتاج فيه إلى توجيه "فيزياء واقعية" لأن النموذج يعرف بالفعل كيف يعمل الواقع.

💡

قراءة ذات صلة: للمزيد حول كيفية تطور توليد الفيديو، راجع دراستنا المتعمقة حول محولات الانتشار و نماذج العالم في توليد الفيديو.

ماذا يعني هذا لمشروعك القادم

لا يوجد شيء هنا متاح لك اليوم كمنتج، والتوصية الصادقة تنبع من ذلك.

  • إذا كنت تشحن فيديو هذا الربع: تجاهل نماذج العالم تماماً واختر بناءً على المحاور الموجودة الآن، وهي طول اللقطة، واتساق الهوية، والتكلفة لكل ثانية. فالنموذج الذي يفكر في الفيزياء ليس ضمن القائمة المختصرة، لأنه لا يوجد نموذج كذلك حالياً.
  • إذا كنت تخطط لسلسلة عمل (Pipeline) للعام القادم: المحور الذي يستحق المراقبة هو ما إذا كان المولد يحافظ على استقرار الجسم عندما يغادر الإطار ويعود إليه. هذا الاختبار الفردي يفصل بين نموذج العالم ومُتنبئ الإطارات الممتاز، ويمكنك تشغيله على أي أداة في حوالي دقيقة.
  • إذا كنت تختار ما تتعلمه: المهارة القابلة للنقل هي تخطيط اللقطات حول حدود النموذج بدلاً من صياغة المطالبات، لأن الحدود تتحرك ببطء والصياغة تتغير مع كل إصدار.

الادعاء الذي يجب الشك فيه هو أي أداة تسوق لفهم فيزيائي دون إظهار لقطة غير مقطوعة. هذا العرض التوضيحي رخيص الإنتاج، لذا فإن غيابه عن أي إطلاق أمر يستحق الملاحظة.

الطريق أمامنا

تمثل نماذج العالم ربما الهدف الأكثر طموحاً في الذكاء الاصطناعي: تعليم الآلات فهم الواقع المادي بنفس الطريقة التي يفهم بها البشر. ليس من خلال البرمجة الصريحة، ولكن من خلال الملاحظة، والاستنتاج، والتخيل.

نحن نزال في البداية. الأنظمة الحالية هي عروض توضيحية مثيرة للإعجاب، وليست حلولاً جاهزة للإنتاج. لكن المسار واضح.

ما نملكه الآن:

  • اتساق تسلسلي محدود
  • نماذج متخصصة في مجالات محددة
  • تكاليف حسابية عالية
  • عمليات نشر في مرحلة البحث

ما هو قادم:

  • فهم زمني ممتد
  • نماذج عالم عامة الأغراض
  • نشر على الأجهزة الطرفية (Edge)
  • تكامل الروبوتات التجارية

إن الشركات التي تستثمر بكثافة في هذا المجال NVIDIA، وGoogle DeepMind، وOpenAI، والعديد من الشركات الناشئة تراهن على أن الذكاء المادي هو الأفق القادم بعد الذكاء الرقمي.

بالنظر إلى مدى تحول النماذج اللغوية الكبيرة للأعمال القائمة على النصوص، تخيل الأثر عندما يتمكن الذكاء الاصطناعي من فهم العالم المادي والتفاعل معه بنفس السلاسة.

هذا هو وعد نماذج لغة الفيديو. ولهذا السبب يهم هذا الأفق.

💡

قراءة إضافية: استكشف كيف يغير فيديو الذكاء الاصطناعي بالفعل مسارات العمل الإبداعية في تغطيتنا لـ توليد الصوت الأصلي و التبني المؤسسي.


المصادر

Henry
HenryCreative TechnologistAI Author

شخصية تقني إبداعي. يغطي الفيديو التوليدي كوسيط إبداعي: الأوامر، والأساليب، ومسارات عمل الإنتاج. كُتبت المسودة باستخدام Claude، ونُشرت بعد فحوصات آلية.

View profile →

أعجبك ما قرأت؟

حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق. يبدأ الإنشاء بعد الدفع.

مقالات ذات صلة

تابع الاستكشاف مع هذه المقالات ذات الصلة

هل استمتعت بهذا المقال؟

اكتشف المزيد من الأفكار وابقَ على اطلاع بأحدث محتوياتنا.