Meta Pixelتجاوز إلى المحتوى الرئيسي
AlexisAlexis· كتبه الذكاء الاصطناعي وراجعه إنسان
7 min read
1277 كلمات

EPFL Stable Video Infinity: كيف تحل إعادة تدوير الأخطاء أكبر مشكلة في توليد الفيديو بالذكاء الاصطناعي

تقديم ورقة بحثية جديدة من EPFL مقبولة في ICLR 2026 كعرض شفهي، تقدم تقنية إعادة تدوير الأخطاء التي تلغي الانجراف الزمني وتمكّن من توليد فيديو متعدد الدقائق بدون أي تكلفة حسابية إضافية.

EPFL Stable Video Infinity: كيف تحل إعادة تدوير الأخطاء أكبر مشكلة في توليد الفيديو بالذكاء الاصطناعي

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟

انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai

لكل نموذج فيديو بالذكاء الاصطناعي نفس السر المظلم. توليد مقطع مدته 4 ثوان والنتائج تبدو مذهلة. تجاوز الـ 15 ثانية وتبدأ الشخصيات في التشوه، والفيزياء تنهار، والألوان تتغير، والمشهد بأكمله ينجرف نحو اللاتماسك. نشرت مختبر VITA بـ EPFL للتو حلاً، وقد تكون هذه الورقة الأهم في توليد الفيديو هذا العام.

مشكلة الانجراف التي لم يحلها أحد

إذا حاولت توليد فيديو طويل الشكل بالذكاء الاصطناعي باستخدام أي نموذج حالي، تعرف الإحباط. يحد Sora 2 على 15 إلى 25 ثانية حسب خطتك. يصل Runway Gen-4.5 إلى 10 ثوان بحد أقصى. تصل Kling 3.0 إلى 15 ثانية. السبب ليس الحوسبة أو الذاكرة. إنه الانجراف الزمني.

💡

يحدث الانجراف الزمني عندما تراكم نماذج الفيديو الانحدارية الذاتية أخطاء صغيرة إطار تلو الآخر. كل إطار يتم توليده يصبح المدخل للإطار التالي، والنواقص الدقيقة تتراكم بشكل أسي. بعد بضع مئات من الإطارات، النتيجة بالكاد تشبه التعليمات الأصلية.

هذا مشابه بشكل أساسي لمشكلة "لعبة الهاتف". همس برسالة عبر ما يكفي من الناس وتصبح غير معروفة. حاولت الأساليب السابقة محاربة الانجراف من خلال توليد مقاطع أقصر وخياطتها معاً، لكن الدرزات مرئية. استخدم آخرون التوليد الهرمي (الإطارات الرئيسية أولاً، الاستيفاء ثانياً)، الأمر الذي يساعد لكنه لا يلغي المشكلة الأساسية.

دخول إعادة تدوير الأخطاء

الورقة البحثية، بعنوان "Stable Video Infinity" ومقبولة كـ عرض شفهي في ICLR 2026، تقدم فكرة بسيطة الظاهر: علّم النموذج التعامل مع أخطاؤه الخاصة.

عرض شفهي
حالة ICLR 2026
0
تكلفة الحوسبة الإضافية
دقائق
طول الفيديو

الرؤية الأساسية هنا هي أن نماذج انتشار الفيديو القياسية تتعلم من البيانات الأساسية النظيفة أثناء التدريب. لا ترى أبداً نتائجها المُولدة الخاصة. عند النشر، يتعين عليها فجأة العمل مع تنبؤاتها غير الكاملة كمدخل، ولا تعرف كيفية التعامل مع الضوضاء.

تحل إعادة تدوير الأخطاء هذه من خلال تعديل حلقة التدريب:

الخطوة 1

المرحلة الأمامية القياسية

النموذج يولد جزء فيديو من بيانات التدريب النظيفة.

الخطوة 2

تجميع الأخطاء

يتم التقاط التنبؤات الخاصة بالنموذج (مع نواقصها) بدلاً من التخلص منها.

الخطوة 3

إعادة تدوير الأخطاء

يتم إعادة إدخال هذه المخرجات غير الكاملة كمدخل لتكرار التدريب التالي، مما يعلّم النموذج توليد مخرجات مستقرة حتى من الإطارات المولدة ذاتياً والضوضائية.

الخطوة 4

التحسين التكراري

عبر العديد من دورات التدريب، يتعلم النموذج آلية تصحيح ذاتية قوية تمنع تراكم الأخطاء.

جمال هذا الأسلوب يكمن في بساطته. لا توجد معماريات نموذج جديدة، لا معاملات إضافية، لا حيل وقت الاستدلال. النموذج يتعلم ببساطة أثناء التدريب كيف تبدو ظروف النشر الحقيقية.

لماذا يهم هذا أكثر مما تعتقد

التداعيات تمتد إلى ما وراء توليد مقاطع قطط أطول. إليك ما يتغير:

قبل إعادة تدوير الأخطاء

  • نماذج الفيديو مقتصرة على 4-20 ثانية
  • اتساق المشهد يتدهور بسرعة
  • هوية الشخصية تنجرف بعد بضع ثوان
  • الفيزياء تصبح بشكل متزايد غير واقعية
  • الألوان والإضاءة تتغير بشكل غير متوقع

بعد إعادة تدوير الأخطاء

  • توليد فيديو متماسك متعدد الدقائق
  • مظهر الشخصية مستقر طوال الفيديو
  • فيزياء متسقة وعلاقات مكانية
  • درجات ألوان وإضاءة موثوقة
  • لا توجد تدهور في الجودة مع مرور الوقت

الأرقام

اختبر فريق مختبر VITA تقنية Stable Video Infinity عبر معماريات وأنظمة قياس متعددة. النتائج مذهلة:

مقياسبدون إعادة تدوير الأخطاءمع إعادة تدوير الأخطاءالتحسن
FVD (الأقل أفضل)يتدهور بعد 4 ثوانمستقر خلال دقيقتين وما فوقكبير
اتساق الشخصيةينخفض تحت 60% عند 15 ثانيةيحافظ على 90%+ عند دقيقتينحوالي 50% نسبة
التماسك الزمنيانجراف مرئي عند 8 ثوانلا انجراف مرئي عند دقيقتينقفزة نوعية
أثر الحوسبةالخط الأساسيالخط الأساسي (0% زيادة)بدون تكلفة
💡

جانب الأثر الحسابي الصفري حاسم. إعادة تدوير الأخطاء هي تقنية وقت التدريب، وليست تقنية وقت الاستدلال. بمجرد التدريب، يعمل النموذج بنفس السرعة والتكلفة تماماً كما كان من قبل.

كيف تعمل إعادة تدوير الأخطاء تحت الغطاء

لمن يريد التفاصيل التقنية، إليك ما يحدث في خط أنابيب التدريب المعدل.

يستخدم التدريب القياسي لانتشار الفيديو جدول ضوضاء epsilon مطبقاً على الإطارات الأساسية النظيفة x_0. يتعلم النموذج التنبؤ بالضوضاء واستعادة الإشارة الأصلية. وقت الاستدلال، يولد النموذج بشكل انحداري ذاتي الإطار t+1 مشروط على تنبؤه للإطار t.

الفجوة بين التدريب (المدخلات النظيفة) والاستدلال (المدخلات المولدة ذاتياً) تسمى انحياز التعريض. إعادة تدوير الأخطاء تعالج هذا مباشرة.

التفاصيل التقنية: الهدف التدريبي المعدل

أثناء التدريب، يولد النموذج أحياناً الإطارات باستخدام أوزانه الحالية بدلاً من استخدام بيانات أساسية. هذه الإطارات المولدة ذاتياً، المكتملة مع نواقصها، يتم استخدامها بعد ذلك كمدخلات تكيف للإطارات اللاحقة في تسلسل التدريب.

المعامل الفائق الرئيسي هو نسبة إعادة التدوير r، والذي يتحكم في عدد مرات استبدال الإطارات المولدة ذاتياً بالإطارات الأساسية أثناء التدريب. تجد الورقة أن r = 0.3 (30% إطارات معاد تدويرها) تحقق الأداء الأمثل، مع موازنة تحسن الاستقرار وجودة إشارة التدريب.

دالة الخسارة المعدلة تبقى الهدف الانتشار القياسي. الفرق الوحيد هو توزيع البيانات الذي يرى النموذج أثناء التدريب. هذا هو السبب في عدم وجود أثر حسابي وقت الاستدلال.

هذا مشابه بشكل مفاهيمي للـ أخذ العينات المجدول في نماذج تسلسل-إلى-تسلسل، لكن مكيّف للإطار الانتشار المستمر. يشيد فريق مختبر VITA بهذا الاتصال في ورقتهم مع ملاحظة أن التطبيق الساذج للأخذ العينات المجدول على نماذج الانتشار لا يعمل. مساهمتهم هي الصيغة المحددة التي تجعلها مستقرة لتوليد الفيديو.

مزايا المصدر المفتوح

ربما الجانب الأكثر إثارة للإعجاب: الكود مفتوح المصدر بالكامل على GitHub (vita-epfl/Stable-Video-Infinity). هذا يعني أن أي مختبر بحثي أو شركة يمكنها تطبيق إعادة تدوير الأخطاء على نماذج الفيديو الموجودة لديهم.

لماذا المصدر المفتوح مهم
أي نموذج انتشار فيديو موجود يمكن تحديثه بإعادة تدوير الأخطاء. لا توجد حاجة لتغييرات معمارية، فقط حلقة تدريب معدلة. يمكن أن يحسن هذا Sora و Runway و Kling وكل نموذج مفتوح المصدر في نفس الوقت.
القيود العملية
يتطلب إعادة تدريب أو ضبط نموذج. يحتاج الشركات ذات النماذج الخاصة إلى استثمار موارد حسابية في إعادة التدريب. قد تختلف فعالية التقنية عبر المعماريات والمقاييس المختلفة.

يتبع الإصدار مفتوح المصدر اتجاهاً متنامياً في مجتمع أبحاث فيديو الذكاء الاصطناعي. أظهرت النماذج مثل LTX-2 و Wan 2.6 أن المناهج مفتوحة المصدر يمكنها منافسة البدائل الخاصة.

ماذا يعني هذا للصناعة

التوقيت ملحوظ. نحن في وسط سباق أسلحة فيديو ذكاء اصطناعي حيث كل لاعب رئيسي، من Runway إلى ByteDance، يسعى لتحقيق مخرجات أطول وعالية الجودة. قد تكون إعادة تدوير الأخطاء الجزء المفقود الذي يفتح قدرات الجيل التالي.

🎬

لصانعي الأفلام والمبدعين

توليد فيديو متماسك طويل الشكل يمكّن محتوى سردي فعلي. ليس فقط مقاطع، بل مشاهد وتسلسلات وفي النهاية أفلام قصيرة مولدة من تعليمة واحدة.
🔬

للباحثين

إعادة تدوير الأخطاء توفر إطار عمل قابل للتعميم. يمكن تطبيق نفس المبدأ على توليد الصوت، وتوليف مشاهد ثلاثية الأبعاد، وأي نموذج توليدي انحداري ذاتي يعاني من الانجراف.
🏢

للمؤسسات

التوليد المستقر طويل الشكل يجعل فيديو الذكاء الاصطناعي قابلاً للاستخدام للحالات المهنية: عروض المنتجات، مقاطع التدريب، حملات التسويق التي تتطلب جودة متسقة على دقائق من المحتوى.

الطريق للأمام

يمثل عمل مختبر VITA تحولاً أساسياً في كيفية تفكيرنا حول توليد فيديو الذكاء الاصطناعي. بدلاً من بناء نماذج أكبر وأكبر أو إضافة آليات معقدة وقت الاستدلال، كان الحل هو ببساطة إظهار النموذج كيف يبدو مخرجه الخاص.

سيتم عرض الورقة في ICLR 2026، وتشير عدة مصادر من الصناعة إلى أن مزودي نماذج الفيديو الرئيسيين يستكشفون بالفعل التكامل. إذا كانت نماذج العالم تمثل مستقبل كيفية فهم الذكاء الاصطناعي للفيزياء والفضاء، فإن إعادة تدوير الأخطاء تمثل مستقبل كيفية حفاظ الذكاء الاصطناعي على هذا الفهم مع مرور الوقت.

قد ينتهي عصر فيديو الذكاء الاصطناعي بـ 4 ثوان أسرع مما يتوقع أي شخص. ولن يتطلب معمارية نموذج جديدة أو ميزانية حوسبة بمليار دولار. فقط حلقة تدريب أذكى.

مزيد من القراءة

Alexis
AlexisAI EngineerAI Author

مهندس ذكاء اصطناعي من لوزان يجمع بين عمق البحث والابتكار العملي. يقسم وقته بين هياكل النماذج والقمم الجبلية.

View profile →

أعجبك ما قرأت؟

حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق.

مقالات ذات صلة

تابع الاستكشاف مع هذه المقالات ذات الصلة

هل استمتعت بهذا المقال؟

اكتشف المزيد من الأفكار وابقَ على اطلاع بأحدث محتوياتنا.