Alibaba Wan 2.7: كيف يغيّر وضع التفكير مستقبل توليد الفيديو بالذكاء الاصطناعي
أطلقت Alibaba نموذج Wan 2.7 مع وضع تفكير مبتكر يخطط لتكوين المشاهد قبل توليد الفيديو. نستعرض آلية عمله وما يعنيه للمبدعين.

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟
انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai
ما هو وضع التفكير؟
تعمل معظم نماذج توليد الفيديو بتمريرة واحدة. تكتب نصاً وصفياً، يبدأ النموذج بتحويل الضوضاء إلى بكسلات، وتحصل على ما ينتج. يعمل هذا بشكل مقبول للمشاهد البسيطة، لكنه يفشل عندما تتضمن النصوص عناصر متعددة أو علاقات مكانية محددة أو حركات معقدة.
يضيف Wan 2.7 خطوة وسيطة. قبل توليد أي بكسل، يقوم النموذج بما يلي:
- تحليل النص الوصفي إلى مكونات دلالية (عناصر، حركات، بيئة، إضاءة)
- تخطيط التكوين بتحديد مواضع العناصر وكيفية تفاعلها
- توليد المخرج باستخدام هذه الخطة كدليل هيكلي
يشبه هذا طريقة تحسين "سلسلة التفكير" للنماذج اللغوية الكبيرة. فبإجبار النموذج على التفكير قبل التنفيذ، تتحسّن جودة المخرجات بشكل ملحوظ، خاصة مع النصوص الوصفية المعقدة.
مجموعة Wan 2.7 الكاملة
لا يقتصر Wan 2.7 على نموذج واحد. بل يأتي كمجموعة من أربعة نماذج تغطي سير عمل مختلفة للتوليد:
| النموذج | المدخل | المخرج | الأنسب لـ |
|---|---|---|---|
| نص إلى فيديو | نص وصفي | مقطع فيديو | الإنشاء من الصفر |
| صورة إلى فيديو | صورة + نص وصفي | مقطع فيديو | تحريك الصور الثابتة والرسوم المفاهيمية |
| مرجع إلى فيديو | فيديو مرجعي + نص وصفي | فيديو جديد | نقل الأسلوب وإعادة الإنشاء |
| تحرير الفيديو | فيديو + تعليمات تحرير | فيديو معدّل | مرحلة ما بعد الإنتاج والتصحيحات |
نموذج النص إلى الفيديو متاح بالفعل على Together AI منذ الثالث من أبريل. أما النماذج الثلاثة المتبقية فسيتم إطلاقها تدريجياً خلال الأسابيع القادمة.
نظرة تقنية: تفاصيل البنية
رغم أن Alibaba لم تنشر ورقة بحثية كاملة بعد، ظهرت عدة تفاصيل تقنية من وثائق API والاختبارات المبكرة.
| ما نعرفه | ما يميّزه |
|---|---|
| مبني على سلالة بنية Wan (Wanxiang) | أول نموذج إنتاجي بتخطيط تكويني صريح |
| يضيف وضع التفكير تمريرة تخطيط قبل الانتشار | المشاهد متعددة العناصر تتعامل مع 5+ عناصر بسلاسة |
| تماسك فائق الواقعية للشخصيات عبر الإطارات | النصوص المعروضة في الفيديو مقروءة وليست مشوّهة |
| تحكم دقيق بالألوان عبر تهيئة النص الوصفي | دقة الألوان تبقى متسقة مع تغيّرات الإضاءة |
| عرض نصوص طويلة متفوّق (نصوص داخل الفيديو) | حركات الكاميرا المعقدة تحافظ على التماسك المكاني |
تبرز قدرة عرض النصوص الطويلة بشكل خاص. فالنماذج السابقة كانت تعاني من توليد نصوص مقروءة داخل إطارات الفيديو. يتعامل Wan 2.7 مع اللافتات والتسميات وحتى الفقرات القصيرة بدقة مفاجئة. للمبدعين الذين يحتاجون إلى نصوص مدمجة في اللقطات المولّدة، هذه خطوة مهمة إلى الأمام.
المقارنة مع المنافسين
شهد مشهد الفيديو بالذكاء الاصطناعي تحوّلاً ملحوظاً هذا الأسبوع، مع وصول Wan 2.7 بالتزامن مع تأكيد OpenAI إيقاف Sora وخفض Google لأسعار Veo 3.1.
| النموذج | التسعير | الصوت | أقصى مدة | تماسك الشخصيات | التفكير/التخطيط |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/ث | لا | ~10 ثوانٍ | قوي | نعم |
| Veo 3.1 Lite | $0.05/ث | نعم | ~8 ثوانٍ | جيد | لا |
| Veo 3.1 Fast | $0.12/ث | نعم | ~8 ثوانٍ | قوي | لا |
| Kling 3.0 | ~$0.08-0.17/ث | نعم | ~10 ثوانٍ | قوي | لا |
| Seedance 2.0 | مجمّع | نعم | 15 ثانية | جيد | لا |
| Runway Gen-4.5 | ~$0.15/ث | لا | ~10 ثوانٍ | قوي | لا |
يضع التسعير بقيمة $0.10 للثانية نموذج Wan 2.7 في الفئة التنافسية المتوسطة. فهو ضعف تكلفة خيار Google الاقتصادي Lite، ومنافس لـ Kling 3.0 (الذي يتفاوت حسب المنصة)، وأقل سعراً من Runway بشكل ملحوظ.
متى تستخدم Wan 2.7
بناءً على الاختبارات المبكرة ونقاط قوة النموذج، إليك السيناريوهات التي يكون فيها Wan 2.7 الخيار الأمثل:
مشاهد معقدة متعددة العناصر
محتوى غني بالنصوص
تحكم دقيق بالألوان والأسلوب
نقل الأسلوب عبر المرجع
للمشاهد الأبسط ذات العنصر الواحد التي تحتاج فيها إلى صوت أيضاً، قد تظل نماذج مثل Kling 3.0 أو Veo 3.1 الخيار الأفضل. تضيف عملية التخطيط في وضع التفكير قيمة تحديداً عندما تكون النصوص الوصفية معقدة.
ماذا يعني هذا للصناعة
يشير وضع التفكير في Wan 2.7 إلى تحوّل أوسع في طريقة عمل النماذج التوليدية. فبدلاً من فرض المخرجات من الضوضاء بالقوة، ستدمج النماذج المستقبلية على الأرجح مراحل تخطيط صريحة لجوانب مختلفة من التوليد.
نشهد هذا النمط بالفعل في مجالات أخرى. نماذج توليد الشفرات البرمجية تخطط قبل الكتابة. نماذج الصور تستخدم تهيئة التخطيط. والآن نماذج الفيديو تتعلم التفكير قبل الإبداع.
الضغط التنافسي حقيقي. مع خروج Sora، وخفض Google للأسعار، ونماذج صينية مثل Wan 2.7 وKling 3.0 تدفع حدود الجودة، لم يكن أمام المبدعين خيارات أكثر من الآن، ولا أسباب أكثر للبقاء مرنين.
لإلقاء نظرة أعمق على مقارنة أداء هذه النماذج في اختبارات محددة، اطلع على تحليلنا لأداء Runway Gen-4.5. وإذا كنت مهتماً بكيفية تأثير إطلاق Seedance 2.0 على منظومة CapCut، فقد غطّينا ذلك بالتفصيل الشهر الماضي.

مهندس ذكاء اصطناعي من لوزان يجمع بين عمق البحث والابتكار العملي. يقسم وقته بين هياكل النماذج والقمم الجبلية.
View profile →مقالات ذات صلة
تابع الاستكشاف مع هذه المقالات ذات الصلة

الفيديو بالذكاء الاصطناعي بعد Sora: 4 فئات سوقية يجب معرفتها في 2026
ستغلق Sora في 26 أبريل. توحّد سوق الفيديو بالذكاء الاصطناعي في أربع فئات. دليل عملي لاختيار البديل المناسب لـ Sora حسب احتياجاتك.

Google Veo 3.1 أصبح مجانيًا: 10 فيديوهات بالذكاء الاصطناعي شهريًا لكل حساب Google
أتاحت Google نموذج Veo 3.1 لجميع الحسابات الشخصية مع 10 فيديوهات مجانية شهريًا. إليك ما تحصل عليه، وما هي القيود، ولماذا يهم ذلك صانعي فيديوهات الذكاء الاصطناعي.

Google Veo 3.1 Lite: توليد فيديو بالذكاء الاصطناعي منخفض التكلفة يصل إلى واجهة Gemini API
أطلقت Google نموذج Veo 3.1 Lite، وهو نموذج سريع ومنخفض التكلفة لتوليد الفيديو بالذكاء الاصطناعي ضمن واجهة Gemini API. إليك ما يحتاج المطورون معرفته حول التسعير والمقايضات في الجودة وبناء تطبيقات الفيديو للإنتاج.