Alibaba Wan 2.7: كيف يغيّر وضع التفكير مستقبل توليد الفيديو بالذكاء الاصطناعي
أطلقت Alibaba نموذج Wan 2.7 مع وضع تفكير مبتكر يخطط لتكوين المشاهد قبل توليد الفيديو. نستعرض آلية عمله وما يعنيه للمبدعين.

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟
انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai يبدأ الإنشاء بعد الدفع.
ما هو وضع التفكير؟
تعمل معظم نماذج توليد الفيديو بتمريرة واحدة. تكتب نصاً وصفياً، يبدأ النموذج بتحويل الضوضاء إلى بكسلات، وتحصل على ما ينتج. يعمل هذا بشكل مقبول للمشاهد البسيطة، لكنه يفشل عندما تتضمن النصوص عناصر متعددة أو علاقات مكانية محددة أو حركات معقدة.
يضيف Wan 2.7 خطوة وسيطة. قبل توليد أي بكسل، يقوم النموذج بما يلي:
- تحليل النص الوصفي إلى مكونات دلالية (عناصر، حركات، بيئة، إضاءة)
- تخطيط التكوين بتحديد مواضع العناصر وكيفية تفاعلها
- توليد المخرج باستخدام هذه الخطة كدليل هيكلي
يشبه هذا طريقة تحسين "سلسلة التفكير" للنماذج اللغوية الكبيرة. فبإجبار النموذج على التفكير قبل التنفيذ، تتحسّن جودة المخرجات بشكل ملحوظ، خاصة مع النصوص الوصفية المعقدة.
مجموعة Wan 2.7 الكاملة
لا يقتصر Wan 2.7 على نموذج واحد. بل يأتي كمجموعة من أربعة نماذج تغطي سير عمل مختلفة للتوليد:
| النموذج | المدخل | المخرج | الأنسب لـ |
|---|---|---|---|
| نص إلى فيديو | نص وصفي | مقطع فيديو | الإنشاء من الصفر |
| صورة إلى فيديو | صورة + نص وصفي | مقطع فيديو | تحريك الصور الثابتة والرسوم المفاهيمية |
| مرجع إلى فيديو | فيديو مرجعي + نص وصفي | فيديو جديد | نقل الأسلوب وإعادة الإنشاء |
| تحرير الفيديو | فيديو + تعليمات تحرير | فيديو معدّل | مرحلة ما بعد الإنتاج والتصحيحات |
نموذج النص إلى الفيديو متاح بالفعل على Together AI منذ الثالث من أبريل. أما النماذج الثلاثة المتبقية فسيتم إطلاقها تدريجياً خلال الأسابيع القادمة.
نظرة تقنية: تفاصيل البنية
رغم أن Alibaba لم تنشر ورقة بحثية كاملة بعد، ظهرت عدة تفاصيل تقنية من وثائق API والاختبارات المبكرة.
| ما نعرفه | ما يميّزه |
|---|---|
| مبني على سلالة بنية Wan (Wanxiang) | أول نموذج إنتاجي بتخطيط تكويني صريح |
| يضيف وضع التفكير تمريرة تخطيط قبل الانتشار | المشاهد متعددة العناصر تتعامل مع 5+ عناصر بسلاسة |
| تماسك فائق الواقعية للشخصيات عبر الإطارات | النصوص المعروضة في الفيديو مقروءة وليست مشوّهة |
| تحكم دقيق بالألوان عبر تهيئة النص الوصفي | دقة الألوان تبقى متسقة مع تغيّرات الإضاءة |
| عرض نصوص طويلة متفوّق (نصوص داخل الفيديو) | حركات الكاميرا المعقدة تحافظ على التماسك المكاني |
تبرز قدرة عرض النصوص الطويلة بشكل خاص. فالنماذج السابقة كانت تعاني من توليد نصوص مقروءة داخل إطارات الفيديو. يتعامل Wan 2.7 مع اللافتات والتسميات وحتى الفقرات القصيرة بدقة مفاجئة. للمبدعين الذين يحتاجون إلى نصوص مدمجة في اللقطات المولّدة، هذه خطوة مهمة إلى الأمام.
المقارنة مع المنافسين
شهد مشهد الفيديو بالذكاء الاصطناعي تحوّلاً ملحوظاً هذا الأسبوع، مع وصول Wan 2.7 بالتزامن مع تأكيد OpenAI إيقاف Sora وخفض Google لأسعار Veo 3.1.
| النموذج | التسعير | الصوت | أقصى مدة | تماسك الشخصيات | التفكير/التخطيط |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/ث | لا | ~10 ثوانٍ | قوي | نعم |
| Veo 3.1 Lite | $0.05/ث | نعم | ~8 ثوانٍ | جيد | لا |
| Veo 3.1 Fast | $0.12/ث | نعم | ~8 ثوانٍ | قوي | لا |
| Kling 3.0 | ~$0.08-0.17/ث | نعم | ~10 ثوانٍ | قوي | لا |
| Seedance 2.0 | مجمّع | نعم | 15 ثانية | جيد | لا |
| Runway Gen-4.5 | ~$0.15/ث | لا | ~10 ثوانٍ | قوي | لا |
يضع التسعير بقيمة $0.10 للثانية نموذج Wan 2.7 في الفئة التنافسية المتوسطة. فهو ضعف تكلفة خيار Google الاقتصادي Lite، ومنافس لـ Kling 3.0 (الذي يتفاوت حسب المنصة)، وأقل سعراً من Runway بشكل ملحوظ.
متى تستخدم Wan 2.7
بناءً على الاختبارات المبكرة ونقاط قوة النموذج، إليك السيناريوهات التي يكون فيها Wan 2.7 الخيار الأمثل:
مشاهد معقدة متعددة العناصر
محتوى غني بالنصوص
تحكم دقيق بالألوان والأسلوب
نقل الأسلوب عبر المرجع
للمشاهد الأبسط ذات العنصر الواحد التي تحتاج فيها إلى صوت أيضاً، قد تظل نماذج مثل Kling 3.0 أو Veo 3.1 الخيار الأفضل. تضيف عملية التخطيط في وضع التفكير قيمة تحديداً عندما تكون النصوص الوصفية معقدة.
ماذا يعني هذا للصناعة
يشير وضع التفكير في Wan 2.7 إلى تحوّل أوسع في طريقة عمل النماذج التوليدية. فبدلاً من فرض المخرجات من الضوضاء بالقوة، ستدمج النماذج المستقبلية على الأرجح مراحل تخطيط صريحة لجوانب مختلفة من التوليد.
نشهد هذا النمط بالفعل في مجالات أخرى. نماذج توليد الشفرات البرمجية تخطط قبل الكتابة. نماذج الصور تستخدم تهيئة التخطيط. والآن نماذج الفيديو تتعلم التفكير قبل الإبداع.
الضغط التنافسي حقيقي. مع خروج Sora، وخفض Google للأسعار، ونماذج صينية مثل Wan 2.7 وKling 3.0 تدفع حدود الجودة، لم يكن أمام المبدعين خيارات أكثر من الآن، ولا أسباب أكثر للبقاء مرنين.
لإلقاء نظرة أعمق على مقارنة أداء هذه النماذج في اختبارات محددة، اطلع على تحليلنا لأداء Runway Gen-4.5. وإذا كنت مهتماً بكيفية تأثير إطلاق Seedance 2.0 على منظومة CapCut، فقد غطّينا ذلك بالتفصيل الشهر الماضي.

شخصية مهندس ذكاء اصطناعي. يغطي معماريات النماذج، واختبارات الأداء، وشروحات تحويل الأبحاث إلى تطبيقات عملية في مجال فيديو الذكاء الاصطناعي. كُتبت المسودة باستخدام Claude، ونُشرت بعد فحوصات آلية.
View profile →أعجبك ما قرأت؟
حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق. يبدأ الإنشاء بعد الدفع.
مقالات ذات صلة
تابع الاستكشاف مع هذه المقالات ذات الصلة

الفيديو بالذكاء الاصطناعي بعد Sora: 4 فئات سوقية يجب معرفتها في 2026
ستغلق Sora في 26 أبريل. توحّد سوق الفيديو بالذكاء الاصطناعي في أربع فئات. دليل عملي لاختيار البديل المناسب لـ Sora حسب احتياجاتك.

تحول المنصات: لماذا أصبحت Adobe وCapCut وGoogle مراكز لنماذج الفيديو بالذكاء الاصطناعي
لم يعد السباق في الفيديو بالذكاء الاصطناعي يتعلق ببناء أفضل نموذج. بل يتعلق باستضافة جميع النماذج. تجمع Adobe Firefly الآن أكثر من 30 محرك ذكاء اصطناعي، وقامت CapCut مؤخراً بدمج Seedance 2.0، ودمجت Google Flow توليد المحتوى مع التحرير. إليك لماذا تعتبر استراتيجية المنصة أكثر أهمية من أي نموذج منفرد.

Seedance 2.0 يخيف هوليوود، وهذا هو المقصود
تقوم Seedance 2.0 من ByteDance بإنشاء مقاطع صور حقيقية فيروسية تضاهي الإنتاجات الاستوديوية. كيف أصبحت نموذج الذكاء الاصطناعي الصيني الأداة الإبداعية التي لم تتوقعها هوليوود.