SkyReels V4: מודל הבינה המלאכותית הראשון שרואה ושומע בו זמנית
SkyReels V4 של Skywork AI מציג ארכיטקטורת דיפוזיה דו ערוצית שמייצרת וידאו ואודיו מסונכרן במעבר אחד. הנה מה שזה אומר ליוצרים.

למה אודיו תמיד היה הנקודה העיוורת של וידאו AI
אם פעם ניסיתם להוסיף קול לקליפ שנוצר בבינה מלאכותית, אתם מכירים את הכאב. מייצרים וידאו של גשם שפוגע בחלון, ואז מחפשים פס קול תואם. מסנכרנים אותו. מתאימים אותו. מקווים שהוא לא ירגיש מוזר.
הבעיה במהותה היא ארכיטקטונית. מודלים כמו Kling 3.0 או Runway Gen-4.5 נבנו קודם כל כמנועים חזותיים. תמיכת אודיו, כשהיא קיימת, רצה דרך צינור נפרד שמנסה לסנכרן בדיעבד.
איך SkyReels V4 באמת עובד
ב Skywork AI (חטיבת מחקר של Kunlun Inc.) בנו משהו שהם קוראים לו Multimodal Diffusion Transformer דו ערוצי, או MMDiT. תחשבו על זה כשני מוחות מומחים שחולקים מערכת עצבים אחת.
הענף החזותי
מייצר פריימים של וידאו עד 1080p, 32 פריימים לשנייה. אחראי על תנועה, תאורה, הרכב הסצנה ועקביות זמנית לאורך כל הקליפ.
הענף השמיעתי
מייצר סאונד מסונכרן באותו מעבר דיפוזיה. לא מתאים סאונד לווידאו מוגמר. יוצר את הסאונד בזמן שהווידאו מתגבש.
שני הענפים חולקים מקודד טקסט שבנוי מעל מודל שפה גדול מולטימודלי. ההבנה המשותפת הזאת היא הסיבה שפרומפט כמו "זכוכית מתנפצת על רצפת שיש בהילוך איטי" מפיק הדגשי אודיו שנוחתים בערך 40 מילישניות מרגע הפגיעה החזותית. זה מספיק צמוד כדי להרגיש טבעי.
מה מבדיל אותו מ Seedance או Kling
Seedance 2.0 של ByteDance ו Kling 3.0 של Kuaishou שניהם תומכים באודיו, אבל הגישה שלהם שונה במהותה. הם מייצרים וידאו קודם, ואז מריצים מודל שני שמפיק אודיו תואם. הגישה הסדרתית הזאת אומרת שהאודיו תמיד מגיב לפריימים מוגמרים, אף פעם לא יוצר אותם יחד.
הארכיטקטורה הדו ערוצית של SkyReels V4 משמעותה:
- ✓אלמנטים שמיעתיים וחזותיים מיושרים סמנטית מההתחלה
- ✓סנכרון שפתיים על דמויות מדברות נוחת על העיצורים, לא אחריהם
- ✓צלילי סביבה תואמים את תכונות החומר (מתכת מול עץ מול זכוכית)
- ✓אין צורך בעיבוד שלאחר ייצור לתיקון סטיות תזמון
ההבדל עדין כשמסתכלים על נוף, אבל דרמטי כשרואים בן אדם מדבר או חפץ נפגש עם משטח.
שאלת הקוד הפתוח
גרסאות SkyReels הקודמות (V1 עד V3) היו קוד פתוח לחלוטין עם משקלות להורדה ב HuggingFace וב GitHub. V4 כרגע בתצוגה מקדימה מוגבלת עם שכבה חינמית ב skyreels.ai, אבל המשקלות המלאים עוד לא שוחררו.
שכבה חינמית עם הגבלות ייצור יומיות בפלטפורמה הרשמית. מאמר ה arXiv (2602.21818) מפרט את הארכיטקטורה המלאה. הגרסאות הקודמות נשארות בקוד פתוח.
אין משקלות להורדה ל V4 עדיין. אין אפשרות לאירוח עצמי. אין API לייצור. לוח הזמנים לשחרור הקוד הפתוח לא ברור.
לקהילת הקוד הפתוח, שווה לעקוב מקרוב. אם Skywork ילכו בתבנית ההיסטורית שלהם, משקלות V4 אמורים בסופו של דבר להגיע ל HuggingFace. אם אתם זקוקים לייצור אודיו וידאו בקוד פתוח היום, החלופות הקרובות ביותר הן SkyReels V3 בתוספת מודל אודיו נפרד.
איפה SkyReels V4 ממוקם בלוח התוצאות
ב Artificial Analysis Video Arena (שמשתמש בהצבעות העדפה אנושיות עיוורות), SkyReels V4 ממוקם כרגע בציון Elo של 1,244 בייצור טקסט לווידאו. זה ממקם אותו כמעט בתיקו עם Kling 3.0 (1,243) ומאחורי המוביל הנוכחי, HappyHorse-1.0 של Alibaba (1,347).
| מודל | ציון Elo | תמיכת אודיו | קוד פתוח | הכי טוב ל |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | לא | לא | איכות חזותית טהורה |
| SkyReels V4 | 1,244 | מובנית (דו ערוצית) | בהמתנה | תוכן אודיו ויזואלי |
| Kling 3.0 | 1,243 | סדרתית | לא | ייצור בקנה מידה גדול |
| Wan 2.7 | שורה ראשונה | לא | כן | פוטוריאליזם |
| LTX-2 | נמוך יותר | לא | כן | יעילות עלות |

הפער באיכות החזותית בין SkyReels V4 ל HappyHorse אמיתי. אבל SkyReels הוא המודל היחיד בחמישייה הראשונה שמייצר אודיו באופן מובנה. אם זרימת העבודה שלכם דורשת סאונד, היתרון הארכיטקטוני הזה חשוב יותר מפער של 100 נקודות Elo.
מה זה אומר ליוצרים
יוצרי תוכן לרשתות חברתיות
מפיקי קליפים מוזיקליים
יוצרי פרסומות
התמונה הגדולה: אודיו כבר לא אופציונלי
SkyReels V4 הוא לא ניסוי בודד. כיסינו את הצגת Seedance 1.5 Pro של ByteDance שהביאה ייצור אודיו ויזואלי, ואת המגמה הרחבה יותר של וידאו AI שיוצא מעידן הסרט האילם. מה ש SkyReels V4 מוסיף הוא הוכחה שאפשר לעשות את זה ברמת הארכיטקטורה, לא כטריק של עיבוד שלאחר ייצור.
המסקנה ברורה: עד סוף 2026, כל מודל וידאו AI בלי אודיו מובנה ירגיש לא שלם. השאלה היא לא אם זה יהפוך לסטנדרט, אלא באיזו מהירות.
מדריך מהיר: SkyReels V4
- מפתח: Skywork AI (Kunlun Inc.)
- ארכיטקטורה: Multimodal Diffusion Transformer דו ערוצי (MMDiT)
- רזולוציה: עד 1080p ב 32 פריימים לשנייה
- משך: עד 15 שניות
- אודיו: ייצור משותף מובנה (לא עיבוד שלאחר ייצור)
- קלטים: טקסט, תמונות, קליפי וידאו, מסכות, רפרנסים שמיעתיים
- סטטוס: תצוגה מקדימה מוגבלת ב skyreels.ai (משקלות בהמתנה לשחרור קוד פתוח)
- מאמר: arXiv 2602.21818

טכנולוג יצירתי מלוזאן החוקר את המפגש בין בינה מלאכותית לאמנות. מתנסה במודלים גנרטיביים בין סשנים של מוזיקה אלקטרונית.
View profile →מאמרים קשורים
המשיכו לגלות עם הפוסטים הקשורים האלה

מפל התלקיחון של הבינה המלאכותית במרץ 2026: איך 12 מודלים ב-7 ימים הרגו את עידן הענן בלבד
מרץ 2026 ראה את ההתפרצות המרוכזת ביותר של שחרור מודלי וידאו בבינה מלאכותית בהיסטוריה. יותר מתריסר מודלים חדשים הגיעו בשבוע אחד, והסיפור הגדול ביותר הוא לא שום שחרור יחיד, אלא שהדור המקומי כעת תחרות בענן.

Helios: מודל 14B המריץ וידאו בזמן אמת בחומרה צרכנית
Helios מאוניברסיטת בייג'ינג, ByteDance וCanva מייצר סרטונים בינה מלאכותית באורך דקה ב-19.5 FPS עם רק 6GB VRAM, והוא בקוד פתוח לחלוטין.

הפעלת ווידאו בינה מלאכותית בקומפיוטר: LTX-2, RTX, ו-ComfyUI ב-2026
יצר וידאו 4K בעזרת בינה מלאכותית ב-GPU שלך. אין מנויים, אין ענן, אין דאגות לגבי פרטיות הנתונים. הנה כל מה שצריך כדי להתחיל.
