Meta Pixelتجاوز إلى المحتوى الرئيسي
HenryHenry· كتبه الذكاء الاصطناعي وراجعه إنسان
6 min read
1053 كلمات

SkyReels V4: أول نموذج ذكاء اصطناعي يرى ويسمع في آنٍ واحد

يقدم SkyReels V4 من Skywork AI بنية انتشار ثنائية التيار تولّد الفيديو والصوت المتزامن معاً في تمريرة واحدة. إليك ما يعنيه ذلك للمبدعين.

SkyReels V4: أول نموذج ذكاء اصطناعي يرى ويسمع في آنٍ واحد

هل أنت مستعد لإنشاء فيديوهاتك الخاصة بالذكاء الاصطناعي؟

انضم إلى آلاف المبدعين الذين يستخدمون Bonega.ai

تعاملت كل نماذج الفيديو بالذكاء الاصطناعي حتى الآن مع الصوت بوصفه أمراً ثانوياً. تولِّد المقطع أولاً، ثم تُلصِق به الصوت لاحقاً. لكن SkyReels V4 يطيح بهذا الأسلوب من جذوره. إنه أول نموذج يفكر بالصورة والصوت في الوقت نفسه، والنتائج مدهشة بحقّ.

لماذا ظلّ الصوت نقطة عمياء في فيديو الذكاء الاصطناعي

إن سبق لك أن حاولت إضافة صوت إلى مقطع مولَّد بالذكاء الاصطناعي، فأنت تعرف هذا العناء. تولِّد فيديو لقطرات المطر على نافذة، ثم تبحث عن مقطع صوتي مطابق. تضبط توقيته، ثم تعدّله، ثم تدعو ألا يبدو غريباً.

المشكلة في جوهرها بنيوية. نماذج مثل Kling 3.0 أو Runway Gen-4.5 صُمِّمت أصلاً كمحرّكات بصرية. ودعم الصوت، حين يوجد، يمرّ عبر مسار منفصل يحاول المزامنة بعد فوات الأوان.

💡
تناولنا هذا التوتر بالضبط في تحليلنا المعمّق حول التوليد الموحَّد للصوت والفيديو. و SkyReels V4 هو أول نموذج إنتاجي يحلّ هذه المعضلة فعلياً على مستوى البنية.

كيف يعمل SkyReels V4 فعلياً

بَنَت Skywork AI (وهي قسم بحثي تابع لشركة Kunlun Inc.) ما تسمّيه محوّل الانتشار متعدد الوسائط ثنائي التيار، أو MMDiT. تخيّله كدماغين متخصّصين يتشاركان جهازاً عصبياً واحداً.

الفرع البصري

يولّد إطارات الفيديو بدقة تصل إلى 1080p و 32 إطاراً في الثانية. ويتولّى الحركة والإضاءة وتكوين المشهد والاتساق الزمني عبر المقطع كاملاً.

الفرع الصوتي

يولّد صوتاً متزامناً في تمريرة الانتشار ذاتها. لا مطابقة الصوت بفيديو منتهٍ، بل ابتكار الصوت بينما يتشكّل الفيديو.

يتشارك الفرعان مُرمِّز نصوص مبنياً فوق نموذج لغوي ضخم متعدد الوسائط. وبفضل هذا الفهم المشترك، فإن موجِّهاً مثل "تحطّم زجاج على أرضية رخامية بالحركة البطيئة" يُنتج تأكيدات صوتية تقع ضمن نحو 40 ميلي ثانية من اللحظة البصرية للارتطام. وهذا فارق ضيّق بما يكفي ليبدو طبيعياً.

1080p
أقصى دقة
32 FPS
معدّل الإطارات
15s
أقصى مدّة
~40ms
دقّة مزامنة الصوت

ما الذي يميّزه عن Seedance أو Kling

يدعم كل من Seedance 2.0 من ByteDance و Kling 3.0 من Kuaishou الصوتَ، غير أن مقاربتهما مختلفة جذرياً. فهما يولّدان الفيديو أولاً، ثم يُشغِّلان نموذجاً ثانياً لإنتاج صوت مطابق. هذه المقاربة التتابعية تعني أن الصوت دائماً ما يأتي تفاعلاً مع إطارات منتهية، لا مشاركاً في صنعها.

أما بنية SkyReels V4 ثنائية التيار فتعني:

  • تتطابق العناصر الصوتية والبصرية دلالياً منذ البداية
  • تزامن الشفاه على الوجوه المتحدّثة يقع على الحروف الساكنة، لا بعدها
  • الأصوات البيئية تنسجم مع خصائص المواد (المعدن مقابل الخشب مقابل الزجاج)
  • لا حاجة لأي معالجة لاحقة لتصحيح انحراف التوقيت

الفرق خفيّ عند مشاهدة منظر طبيعي، لكنه صارخ حين ترى شخصاً يتحدّث أو جسماً يتفاعل مع سطح.

مسألة المصادر المفتوحة

كانت إصدارات SkyReels السابقة (V1 إلى V3) مفتوحة المصدر بالكامل، مع أوزان قابلة للتنزيل على HuggingFace و GitHub. أما V4 فهو حالياً في معاينة محدودة مع طبقة مجانية على skyreels.ai، لكن الأوزان الكاملة لم تُطلق بعد.

ما هو متاح الآن

الطبقة المجانية مع حدود توليد يومية على المنصة الرسمية. وتعرض ورقة arXiv (2602.21818) البنيةَ بالكامل. وتظل الإصدارات السابقة مفتوحة المصدر.

ما الذي ما زال ينقص

لا أوزان قابلة للتنزيل من V4 حتى الآن. لا خيار للاستضافة الذاتية. لا واجهة API إنتاجية. والجدول الزمني للإصدار مفتوح المصدر غير واضح.

بالنسبة لمجتمع المصادر المفتوحة، يستحقّ الأمر متابعة دقيقة. فإذا سارت Skywork على نهجها التاريخي، فإن أوزان V4 ينبغي أن تصل في النهاية إلى HuggingFace. وإن كنت تحتاج توليد صوت وفيديو مفتوح المصدر اليوم، فأقرب البدائل هو SkyReels V3 مع نموذج صوتي منفصل.

موقع SkyReels V4 في لوحة الترتيب

على Artificial Analysis Video Arena (التي تعتمد التصويت البشري الأعمى للتفضيل)، يحتل SkyReels V4 حالياً درجة Elo قدرها 1,244 لتحويل النص إلى فيديو. وهذا يضعه في تعادل شبه تام مع Kling 3.0 (1,243)، خلف المتصدّر الحالي HappyHorse-1.0 من Alibaba (1,347).

النموذجدرجة Eloدعم الصوتمفتوح المصدرالأنسب لـ
HappyHorse-1.01,347لالاالجودة البصرية الصافية
SkyReels V41,244أصلي (ثنائي التيار)قيد الانتظارالمحتوى الصوتي البصري
Kling 3.01,243تتابعيلاالإنتاج على نطاق واسع
Wan 2.7المرتبة العليالانعمالواقعية الفوتوغرافية
LTX-2أدنىلانعمالكفاءة من حيث التكلفة
مخطط مقارنة يوضّح SkyReels V4 و Kling 3.0 و HappyHorse-1.0 و Wan 2.7 من حيث الجودة البصرية ودعم الصوت والمصدر المفتوح والسرعة
SkyReels V4 هو النموذج الوحيد من الفئة العليا الذي يولّد الصوت أصلياً

الفجوة في الجودة البصرية بين SkyReels V4 و HappyHorse حقيقية. لكن SkyReels هو النموذج الوحيد ضمن الخمسة الأوائل الذي يولّد الصوت أصلياً. وإذا كان سير عملك يتطلّب صوتاً، فإن هذه الميزة البنيوية تفوق في أهميتها فارق 100 نقطة Elo.

ماذا يعني هذا للمبدعين

🎬

صنّاع المحتوى الاجتماعي

صُمِّم SkyReels V4 لسرعة الإنجاز. تولّد مقطعاً مع صوت مطابق، ثم تنشره. لا خطوة لتصميم الصوت. وبالنسبة لصنّاع TikTok و Reels و Shorts، يُقلّص هذا زمن الإنتاج بصورة ملحوظة.
🎵

منتجو فيديوهات الموسيقى

يستطيع الفرع الصوتي قبول صوت مرجعي بوصفه إرشاداً، ما يعني أنك تستطيع تغذيته بمقطوعة فتحصل على محتوى بصري يتحرك مع الإيقاع. وتُظهر النتائج المبكرة تزامناً جيداً بين تأكيدات الحركة والإيقاع الموسيقي.
📢

صنّاع الإعلانات

تصبح فيديوهات المنتجات بالأصوات المحيطة، والمقاطع الجاهزة للتعليق الصوتي، والمحتوى الإعلاني الغنيّ بالمشهد الصوتي ممكنة كلها في خطوة توليد واحدة. وللعلامات التي تنتج على نطاق واسع، يتراكم توفير الوقت سريعاً.

الصورة الأشمل: الصوت لم يعد اختيارياً

ليس SkyReels V4 تجربة معزولة. تناولنا تقديم Seedance 1.5 Pro من ByteDance للتوليد الصوتي البصري، والاتجاه الأشمل لخروج فيديو الذكاء الاصطناعي من حقبة الصمت. وما يضيفه SkyReels V4 هو دليل على إمكانية فعل ذلك على مستوى البنية لا كحيلة معالجة لاحقة.

والدلالة واضحة: بحلول نهاية 2026، أيّ نموذج فيديو ذكاء اصطناعي بلا صوت أصلي سيبدو ناقصاً. والسؤال ليس ما إذا كان هذا سيصبح المعيار، بل بأيّ سرعة.

💡
تريد توليد فيديو ذكاء اصطناعي مع صوت اليوم؟ خط أنابيب Bonega يوجِّه تلقائياً إلى أفضل الأدوات المتاحة، ويظل يرتقي مع نضج نماذج مثل SkyReels V4. جرّبه مجاناً.

مرجع سريع: SkyReels V4

  • المطوِّر: Skywork AI (Kunlun Inc.)
  • البنية: محوّل انتشار متعدد الوسائط ثنائي التيار (MMDiT)
  • الدقة: حتى 1080p بمعدّل 32 إطاراً في الثانية
  • المدّة: حتى 15 ثانية
  • الصوت: توليد أصلي مشترك (لا معالجة لاحقة)
  • المُدخلات: نصوص، صور، مقاطع فيديو، أقنعة، مراجع صوتية
  • الحالة: معاينة محدودة على skyreels.ai (الأوزان قيد الانتظار للإصدار مفتوح المصدر)
  • الورقة البحثية: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

تقني إبداعي من لوزان يستكشف نقطة التقاء الذكاء الاصطناعي بالفن. يجرّب النماذج التوليدية بين جلسات الموسيقى الإلكترونية.

View profile →

أعجبك ما قرأت؟

حوّل أفكارك إلى فيديوهات بالذكاء الاصطناعي بطول غير محدود خلال دقائق.

مقالات ذات صلة

تابع الاستكشاف مع هذه المقالات ذات الصلة

هل استمتعت بهذا المقال؟

اكتشف المزيد من الأفكار وابقَ على اطلاع بأحدث محتوياتنا.