Helios: מודל 14B המריץ וידאו בזמן אמת בחומרה צרכנית
Helios מאוניברסיטת בייג'ינג, ByteDance וCanva מייצר סרטונים בינה מלאכותית באורך דקה ב-19.5 FPS עם רק 6GB VRAM, והוא בקוד פתוח לחלוטין.

למה Helios חשוב
מרבית דגמי וידאו בינה מלאכותית כופים עליך בחירה: איכות או מהירות. דגמים גדולים כמו Veo 3.1 או Runway Gen-4.5 מייצרים תוצאות מדהימות, אך הם רצים על אשכולות ענן וגובים לפי שנייה. דגמים קטנים מתאימים ל-GPU צרכנית אך מייצרים פלט ברור יותר חלש. Helios דוחה בחירה זו.
התובנה המרכזית: Helios הוא מודל דיפוזיה אוטוריגרסיבי המייצר וידאו פריים אחר פריים בצורה הזרמה, במקום להסיר רעש מכל הוידאו בבת אחת. זה אומר שהוא יכול להתחיל להוציא פריימים מיד תוך כדי כתיבת השאר. אין חיכוך לתיקייה מלאה.
איך זה עובד
דגמי דיפוזיה מסורתיים עובדים וידאו כולל בו זמנית. אתה שולח הנחיה טקסט, חוכה דקות, וקבל קליפ שלם. Helios לוקח גישה שונה מיסודה.
| דיפוזיה מסורתית | Helios (דיפוזיה אוטוריגרסיבית) |
|---|---|
| עיבוד כל הפריימים בו זמנית | יצירת פריים אחר פריים |
| דרישות זיכרון גבוהות | שימוש בזיכרון קבוע |
| פלט רק כשמושלם לגמרי | הזרם פלט בזמן אמת |
| איכות מתדרדרת עם אורך | איכות עקבית בכל אורך |
המודל משתמש במנגנון תשומת לב זמנית דו-כיוונית המאפשר לכל פריים חדש להתייחס הן להקשר העבר והן לעתיד בתוך חלון גלילה. זה מונע את סחיפת האיכות שבדרך כלל מנציחה מודלים וידאו אוטוריגרסיביים, כאשר פריימים מאוחרים יותר הדרגתית מאבדים קוהרנטיות עם פריימים מוקדמים יותר.
הזווית של חומרה צרכנית
כאן הדברים הופכים למעשיים. עם ריקון קבוצות, Helios יכול לרוץ על חומרה עם בערך 6GB VRAM. זה מציב אותה ישר בטריטוריה של RTX 4060 Ti, כרטיס שעולה בערך $400.
השווה לכך יצירה מבוססת ענן:
| שיטה | עלות לדקה וידאו | חומרה נדרשת |
|---|---|---|
| ממשק API ענן (Sora, Veo) | $2-8 לדור | כלום (ענן) |
| Helios (מקומי, H100) | ~$0.15 בחשמל | H100 ($25,000+) |
| Helios (מקומי, RTX 4060 Ti) | ~$0.01 בחשמל | RTX 4060 Ti (~$400) |
ההסכם עם GPU צרכנית היא מהירות. ב-RTX 4060 Ti, לא תגיע ל-19.5 FPS. צפה קרוב יותר ל-2-3 FPS, וזה עדיין אומר וידאו של 60 שניות בהרבה מתחת 10 דקות. ליצירה מקומית, פרטית וללא הגבלה, זה משכנע.
הנתונים התומכים בטענות
Helios לא רק טוען ביצועים בזמן אמת. זה משיג ניקוד תחרותי בחנוני איכות וידאו סטנדרטיים.
צוות המחקר, שיתוף פעולה בין אוניברסיטת בייג'ינג, ByteDance וCanva, בדק ספציפית נגד:
- CogVideoX (13B פרמטרים): Helios תואם איכות ב-5-10x דור מהיר יותר
- Pyramid Flow (קו בסיס אוטוריגרסיבי): Helios מייצר פלט יותר עקבי זמנית
- Open-Sora v1.2: Helios יוצר קליפים ארוכים יותר וקוהרנטיים יותר
ההשוואה הקריטית היא עם דגמים בטווח של 1-2B פרמטרים, כמו LTX-2 וגרסאות CogVideo קטנות יותר. Helios רץ במהירויות דומות תוך הפקת פלט שנראה כאילו הוא בא מדגם הרבה יותר גדול.
מה אתה יכול בעצם לעשות איתו
Helios לא קוריוז במחקר. זו כלי מעשית שאתה יכול להתקין ולהריץ היום.
- ✓יצירת טקסט לוידאו עד 60 שניות
- ✓הנפשת תמונה לוידאו מפריים התייחסות
- ✓הזרם פלט בזמן אמת (התחל צפייה תוך כדי יצירה)
- ✓רישיון Apache 2.0 (שימוש מסחרי מותר)
- ✓ריקון קבוצות לתמיכת GPU צרכנית
רישיון Apache 2.0 משמעותי. בניגוד לדגמים פתוחים רבים המגבילים שימוש מסחרי, Helios מאפשר זאת בבירור. זה פותח דלת למפתחים עצמאיים, סטודיוهים קטנים וסטארטאפים לבנות מוצרים על בסיס הדגם ללא עמלות רישוי.
התמונה הגדולה יותר
Helios משנה כיצד אנו מתקרבים לנגישות ייצור וידאו בינה מלאכותית. הדור הקודם של דגמי וידאו "פתוחים" או דרש חומרת ארגון או הייצר תוצאות שנראו בעיצומן חלשות יותר מעמיתים בענן שלהם.
לתומכי מקצוע שיוצרים מאות איטרציות לפרויקט, כלכלה משתנה משמעותית. GPU בשווי $400 משלם לעצמו לאחר בערך 200-300 דור בענן. לצוותים שמנסים וידאו בינה מלאכותית במוצרים, הטבע הבלתי מוגבל של יצירה מקומית מסיר את ההיסוס לנסות.
קיבלנו את נמוכות הגדלת של הדור המקומי בנו מדריך להרצת וידאו בינה מלאכותית מקומית, וHelios משובץ ישר לסדר העבודה הזה. זה גם בונה על פריצת הדור בזמן אמת שכתבנו עם TurboDiffusion, לוקח את הקונצפט הרחוק יותר עם דגם הרבה יותר גדול.
מה בא הלאה
צוות Helios כבר רמז לעבודת המשך על יצירה שמעו-ויזואלית ויכולות בקרה אינטראקטיבית. אם כסיחות הנדסה דומות החלות, אנחנו יכולים לראות יצירת וידאו אינטראקטיבית שניתן לשלוט בה וכולל שמע בזמן אמת בחומרה צרכנית עד סוף 2026.
בינתיים, Helios זמין על GitHub תחת Apache 2.0. אם יש לך NVIDIA GPU עם 6GB+ VRAM ורוצה לנסות עם יצירת וידאו בינה מלאכותית מקומית באופן תחרותי, זה נקודת הכניסה החזקה ביותר זמינה.
קריאה קשורה: ראה כיצד דגמים פתוחים תוכן סגירת הפער עם פלטפורמות ממלכתיות, או חקור את הגישה של LTX-2 ל-4K יצירה מקומית ב-GPU צרכנית.

מפתח בינה מלאכותית מליון שאוהב להפוך מושגי ML מורכבים למתכונים פשוטים. כשהוא לא מנפה באגים ממודלים, תמצאו אותו רוכב על אופניים בעמק הרון.
View profile →מאמרים קשורים
המשיכו לגלות עם הפוסטים הקשורים האלה

ByteDance Vidi2: בינה מלאכותית שמבינה וידאו כמו עורך מקצועי
ByteDance פרסמו את Vidi2 כקוד פתוח - מודל של 12 מiliardi פרמטרים שמבין תוכן וידאו מספיק טוב כדי לערוך אוטומטית שעות של צילומים לקליפים מעודנים. הוא כבר מפעיל את TikTok Smart Split.

SkyReels V4: מודל הבינה המלאכותית הראשון שרואה ושומע בו זמנית
SkyReels V4 של Skywork AI מציג ארכיטקטורת דיפוזיה דו ערוצית שמייצרת וידאו ואודיו מסונכרן במעבר אחד. הנה מה שזה אומר ליוצרים.

Seedance 2.0 נחת ב-CapCut, והוליווד לא מרוצה
ByteDance השיקה את מודל הווידאו ה-AI השנוי במחלוקת בתוך CapCut, ימים אחרי ש-Sora נסגרה. למה זה חשוב, ולמה הוליווד נלחמת בחזרה.