SkyReels V4: أول نموذج ذكاء اصطناعي يرى ويسمع في آنٍ واحد
يقدم SkyReels V4 من Skywork AI بنية انتشار ثنائية التيار تولّد الفيديو والصوت المتزامن معاً في تمريرة واحدة. إليك ما يعنيه ذلك للمبدعين.

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟
انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai
لماذا ظلّ الصوت نقطة عمياء في فيديو الذكاء الاصطناعي
إن سبق لك أن حاولت إضافة صوت إلى مقطع مولَّد بالذكاء الاصطناعي، فأنت تعرف هذا العناء. تولِّد فيديو لقطرات المطر على نافذة، ثم تبحث عن مقطع صوتي مطابق. تضبط توقيته، ثم تعدّله، ثم تدعو ألا يبدو غريباً.
المشكلة في جوهرها بنيوية. نماذج مثل Kling 3.0 أو Runway Gen-4.5 صُمِّمت أصلاً كمحرّكات بصرية. ودعم الصوت، حين يوجد، يمرّ عبر مسار منفصل يحاول المزامنة بعد فوات الأوان.
كيف يعمل SkyReels V4 فعلياً
بَنَت Skywork AI (وهي قسم بحثي تابع لشركة Kunlun Inc.) ما تسمّيه محوّل الانتشار متعدد الوسائط ثنائي التيار، أو MMDiT. تخيّله كدماغين متخصّصين يتشاركان جهازاً عصبياً واحداً.
الفرع البصري
يولّد إطارات الفيديو بدقة تصل إلى 1080p و 32 إطاراً في الثانية. ويتولّى الحركة والإضاءة وتكوين المشهد والاتساق الزمني عبر المقطع كاملاً.
الفرع الصوتي
يولّد صوتاً متزامناً في تمريرة الانتشار ذاتها. لا مطابقة الصوت بفيديو منتهٍ، بل ابتكار الصوت بينما يتشكّل الفيديو.
يتشارك الفرعان مُرمِّز نصوص مبنياً فوق نموذج لغوي ضخم متعدد الوسائط. وبفضل هذا الفهم المشترك، فإن موجِّهاً مثل "تحطّم زجاج على أرضية رخامية بالحركة البطيئة" يُنتج تأكيدات صوتية تقع ضمن نحو 40 ميلي ثانية من اللحظة البصرية للارتطام. وهذا فارق ضيّق بما يكفي ليبدو طبيعياً.
ما الذي يميّزه عن Seedance أو Kling
يدعم كل من Seedance 2.0 من ByteDance و Kling 3.0 من Kuaishou الصوتَ، غير أن مقاربتهما مختلفة جذرياً. فهما يولّدان الفيديو أولاً، ثم يُشغِّلان نموذجاً ثانياً لإنتاج صوت مطابق. هذه المقاربة التتابعية تعني أن الصوت دائماً ما يأتي تفاعلاً مع إطارات منتهية، لا مشاركاً في صنعها.
أما بنية SkyReels V4 ثنائية التيار فتعني:
- ✓تتطابق العناصر الصوتية والبصرية دلالياً منذ البداية
- ✓تزامن الشفاه على الوجوه المتحدّثة يقع على الحروف الساكنة، لا بعدها
- ✓الأصوات البيئية تنسجم مع خصائص المواد (المعدن مقابل الخشب مقابل الزجاج)
- ✓لا حاجة لأي معالجة لاحقة لتصحيح انحراف التوقيت
الفرق خفيّ عند مشاهدة منظر طبيعي، لكنه صارخ حين ترى شخصاً يتحدّث أو جسماً يتفاعل مع سطح.
مسألة المصادر المفتوحة
كانت إصدارات SkyReels السابقة (V1 إلى V3) مفتوحة المصدر بالكامل، مع أوزان قابلة للتنزيل على HuggingFace و GitHub. أما V4 فهو حالياً في معاينة محدودة مع طبقة مجانية على skyreels.ai، لكن الأوزان الكاملة لم تُطلق بعد.
الطبقة المجانية مع حدود توليد يومية على المنصة الرسمية. وتعرض ورقة arXiv (2602.21818) البنيةَ بالكامل. وتظل الإصدارات السابقة مفتوحة المصدر.
لا أوزان قابلة للتنزيل من V4 حتى الآن. لا خيار للاستضافة الذاتية. لا واجهة API إنتاجية. والجدول الزمني للإصدار مفتوح المصدر غير واضح.
بالنسبة لمجتمع المصادر المفتوحة، يستحقّ الأمر متابعة دقيقة. فإذا سارت Skywork على نهجها التاريخي، فإن أوزان V4 ينبغي أن تصل في النهاية إلى HuggingFace. وإن كنت تحتاج توليد صوت وفيديو مفتوح المصدر اليوم، فأقرب البدائل هو SkyReels V3 مع نموذج صوتي منفصل.
موقع SkyReels V4 في لوحة الترتيب
على Artificial Analysis Video Arena (التي تعتمد التصويت البشري الأعمى للتفضيل)، يحتل SkyReels V4 حالياً درجة Elo قدرها 1,244 لتحويل النص إلى فيديو. وهذا يضعه في تعادل شبه تام مع Kling 3.0 (1,243)، خلف المتصدّر الحالي HappyHorse-1.0 من Alibaba (1,347).
| النموذج | درجة Elo | دعم الصوت | مفتوح المصدر | الأنسب لـ |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | لا | لا | الجودة البصرية الصافية |
| SkyReels V4 | 1,244 | أصلي (ثنائي التيار) | قيد الانتظار | المحتوى الصوتي البصري |
| Kling 3.0 | 1,243 | تتابعي | لا | الإنتاج على نطاق واسع |
| Wan 2.7 | المرتبة العليا | لا | نعم | الواقعية الفوتوغرافية |
| LTX-2 | أدنى | لا | نعم | الكفاءة من حيث التكلفة |

الفجوة في الجودة البصرية بين SkyReels V4 و HappyHorse حقيقية. لكن SkyReels هو النموذج الوحيد ضمن الخمسة الأوائل الذي يولّد الصوت أصلياً. وإذا كان سير عملك يتطلّب صوتاً، فإن هذه الميزة البنيوية تفوق في أهميتها فارق 100 نقطة Elo.
ماذا يعني هذا للمبدعين
صنّاع المحتوى الاجتماعي
منتجو فيديوهات الموسيقى
صنّاع الإعلانات
الصورة الأشمل: الصوت لم يعد اختيارياً
ليس SkyReels V4 تجربة معزولة. تناولنا تقديم Seedance 1.5 Pro من ByteDance للتوليد الصوتي البصري، والاتجاه الأشمل لخروج فيديو الذكاء الاصطناعي من حقبة الصمت. وما يضيفه SkyReels V4 هو دليل على إمكانية فعل ذلك على مستوى البنية لا كحيلة معالجة لاحقة.
والدلالة واضحة: بحلول نهاية 2026، أيّ نموذج فيديو ذكاء اصطناعي بلا صوت أصلي سيبدو ناقصاً. والسؤال ليس ما إذا كان هذا سيصبح المعيار، بل بأيّ سرعة.
مرجع سريع: SkyReels V4
- المطوِّر: Skywork AI (Kunlun Inc.)
- البنية: محوّل انتشار متعدد الوسائط ثنائي التيار (MMDiT)
- الدقة: حتى 1080p بمعدّل 32 إطاراً في الثانية
- المدّة: حتى 15 ثانية
- الصوت: توليد أصلي مشترك (لا معالجة لاحقة)
- المُدخلات: نصوص، صور، مقاطع فيديو، أقنعة، مراجع صوتية
- الحالة: معاينة محدودة على skyreels.ai (الأوزان قيد الانتظار للإصدار مفتوح المصدر)
- الورقة البحثية: arXiv 2602.21818

تقني إبداعي من لوزان يستكشف نقطة التقاء الذكاء الاصطناعي بالفن. يجرّب النماذج التوليدية بين جلسات الموسيقى الإلكترونية.
View profile →مقالات ذات صلة
تابع الاستكشاف مع هذه المقالات ذات الصلة

الانهيار الجليدي للذكاء الاصطناعي في مارس 2026: كيف قتلت 12 نموذج في 7 أيام عصر السحابة فقط
شهد مارس 2026 أكثر انفجار مركز من إطلاقات نماذج الفيديو بالذكاء الاصطناعي في التاريخ. وصل أكثر من اثني عشر نموذج جديد في أسبوع واحد، والقصة الأهم ليست أي إطلاق واحد، بل أن التوليد المحلي أصبح الآن منافساً للسحابة.

Helios: نموذج 14B يشغل فيديو ذكي في الوقت الفعلي على أجهزة المستهلك
يولد Helios من جامعة بكين وByteDance وCanva فيديوهات ذكية بطول دقيقة واحدة بسرعة 19.5 إطار في الثانية مع 6GB VRAM فقط، وهو مفتوح المصدر بالكامل.

تشغيل فيديو الذكاء الاصطناعي محليا: LTX-2 و RTX و ComfyUI في 2026
إنشاء فيديوهات بدقة 4K باستخدام الذكاء الاصطناعي على معالج الرسومات الخاص بك. بدون اشتراكات، بدون سحابة، بدون قلق بشأن خصوصية البيانات. إليك كل ما تحتاجه للبدء.
