EPFL Stable Video Infinity: איך מחזור שגיאות פותר את הבעיה הגדולה ביותר בייצור וידאו בבינה מלאכותית
מאמר חדש מ-EPFL שקובל כהצגה שפויה ב-ICLR 2026 מציג טכניקת מחזור שגיאות שמבטלת סחיפה זמנית ומאפשרת ייצור וידאו ממולא לעדכון מחשבוני של אפס.

בעיית הסחיפה שלא איש פתר
אם ניסיתם לייצר וידאו ארוך עם כל מודל קיים, אתם יודעים את התסכול. Sora 2 עוצר בחירה בין 15 ל-25 שניות בהתאם לתוכנית שלכם. Runway Gen-4.5 מגיע לשיא של 10 שניות. Kling 3.0 דוחפת ל-15 שניות. הסיבה אינה חישוב או זיכרון. זו סחיפה זמנית.
סחיפה זמנית מתרחשת כאשר מודלים וידאו אוטורגרסיביים צוברים שגיאות קטנות מסגרת לסגרת. כל סגרת שנוצרת הופכת לקלט עבור הבאה, וחוסרי שלמות קטנים מצטברים באופן אקספוננציאלי. לאחר כמה מאות סגרות, הפלט כמעט לא דומה להנחיה המקורית.
זה דומה בעצם לבעיית "משחק הטלפון". שלחו הודעה דרך מספיק אנשים והיא הופכת להיות לא מוכרת. ניסיונות קודמים ניסו להלחם בסחיפה על ידי ייצור קטעים קצרים יותר ותפירתם ביחד, אבל התפרים נראים. אחרים השתמשו בייצור היררכי (מסגרות קשת קודם כל, אינטרפולציה שנייה), שעוזר אבל לא מבטל את הבעיה הבסיסית.
כניסת מחזור שגיאות
המאמר, בשם "Stable Video Infinity" וקבול כ-הצגה שפויה ב-ICLR 2026, מציג רעיון קל הופעה, קשה יישום: לימדו את המודל להתמודד עם הטעויות שלו.
הקנייה הרקעית היא זו. במהלך אימון, מודלי דיפוזיה וידאו סטנדרטיים לומדים מנתונים אמיתיים נקיים. הם לעולם לא רואים את הפלט שלהם שנוצר. בעת פריסה, הם פתאום צריכים לעבוד עם חזוי חזוי שלהם כקלט, והם לא יודעים כיצד להתמודד עם הרעש.
מחזור שגיאות משכנע זאת על ידי שינוי לולאת האימון:
מעבר קדמי סטנדרטי
המודל משחק קטע וידאו מנתוני אימון נקיים.
אוספי שגיאות
התחזוקות שלו (עם חוסרי השלמות שלהם) נתפסות במקום להיות שפך.
מחזור שגיאות
פלט חוסר שלם אלה מוזנים חזרה כקלט עבור איטרציית האימון הבאה, לימדו את המודל לייצר פלט יציב אפילו מסגרות שנוצרו מעצמו ורעשניות.
שיפור איטרטיבי
על פני מחזורי אימון רבים, המודל למד מנגנון תיקון עצמי חזק שמונע צבירת שגיאות.
יופיו של גישה זו הוא בפשטותו. אין ארכיטקטורות מודל חדשות, אין פרמטרים נוספים, אין כיסויי מזמן הסקה. המודל פשוט לומד במהלך אימון מה נראות תנאי פריסה בעולם האמיתי.
למה זה חשוב יותר ממה שאתה חושב
ההשלכות משתרעות הרבה מעבר ליצירת סרטונים ארוכים יותר של חתולים. להלן מה משתנה:
לפני מחזור שגיאות
- מודלי וידאו מוגבלים ל-4-20 שניות
- עקביות המשהו מתדרדרת במהירות
- זהות דמות נסחפת לאחר כמה שניות
- הפיזיקה הופכת בהדרגה לבלתי יציאה
- צבעים והארה משתנים בלתי צפויים
אחרי מחזור שגיאות
- ייצור וידאו קוהרנטי ממולא לעדכון
- מראה דמות יציב לאורך כל הווידאו
- פיזיקה עקבית ויחסי מרחבי
- דירוג צבעים והארה אמינים
- אין ירידה בחיוני המשהו לאורך זמן
המספרים
צוות VITA Lab בדק Stable Video Infinity על פני ארכיטקטורות ומדדים מרובים. התוצאות בולטות:
| מדד | ללא מחזור שגיאות | עם מחזור שגיאות | שיפור |
|---|---|---|---|
| FVD (נמוך יותר טוב) | מתדרדר אחרי 4 ש"ש | יציב דרך 2 דקות+ | משמעותי |
| עקביות דמות | יורדת מתחת ל-60% ב-15 ש"ש | שמור 90%+ ב-2 דקות | ~50% יחסי |
| קוהרנציה זמנית | סחיפה גלויה ב-8 ש"ש | אין סחיפה גלויה ב-2 דקות | קפיצה איכותית |
| עלות חישוב | בסיסי | בסיסי (0% עלייה) | מחיר אפס |
היבט עלות חישוב אפס הוא קריטי. מחזור שגיאות הוא טכניקת זמן אימון, לא טכניקת זמן הסקה. ברגע שמאומן, המודל פעול בדיוק באותה מהירות וטיימר כמו קודם.
איך מחזור שגיאות עובד תחת המכסה
לאלה שרוצים את הפרטים הטכניים, כך מה קורה בזרם אימון המשתנה.
אימון דיפוזיה וידאו סטנדרטי משתמש בלוח הרעש epsilon הפעיל על סגרות אמתיות נקיות x_0. המודל למד לחזות רעש ולהחזיר את האות המקורית. בזמן הסקה, המודל משחק בעצמו את הסגרת t+1 עם עיתון על התחזוקה של הסגרת t.
הפער בין אימון (קלטים נקיים) והסקה (קלטים שנוצרו עצמו) נקרא הטיה חשיפה. מחזור שגיאות מתיחות זאת בעצמו.
פרטים טכניים: יעד אימון משתנה▼
במהלך אימון, המודל מחוללים משחקים סגרות באמצעות משקלים נוכחי של משלו במקום להשתמש בנתונים אמתיים. סגרות שנוצרו עצמו אלה, שלמות עם הנקיבים שלהם, משמשות לאחר מכן כקלטי קבוצות לסגרות הבאות בסדר האימון.
פרמטר היפר הרקעי הוא יחס מחזור r, השולט על כיצד בעתידות קרוב משחקים שנוצרו עצמו החלף סגרות אמתיות במהלך אימון. הנייר מעקיף כי r = 0.3 (30% סגרות מחוזרות) מעקיף ביצוע אופטימלי, משווקות בעדלות יציבות עקביות עם חוק אימון טוב.
פונקציית אובדן המשתנה נשארת הנטייה הדיפוזיה סטנדרטית. הבדל היחידי הוא התאמת הנתונים שהמודל רואה במהלך אימון. זו הסיבה שאין עלות חישוב בזמן הסקה.
זה דומה בצורה קונספטית ל-דגימה שנתוך במודלים רצף לרצף, אבל הסתגל לתיקייה דיפוזיה רציפה. צוות VITA Lab נקודות הקשר זה במאמר שלהם תוך הערה כי התיקייה אנדוח של דגימה שנתוך לדיפוזיה לא עובדת. התרומה שלהם היא הניסוח הנדרש שמכניס אותה יציבה לייצור וידאו.
יתרון קוד פתוח
אולי הגורם הכי משמחות: הקוד הוא בחלופה פתוחה ב-GitHub (vita-epfl/Stable-Video-Infinity). פירוש הדבר הוא שכל מעבדת מחקר או ציבור יכולות ליישם מחזור שגיאות לדגמי הווידאו הקיימים שלהם.
השחרור פתוח-קוד עקוב אחר מגמה גדלה בקהילת מחקר וידאו AI. דגמים כמו LTX-2 ו-Wan 2.6 הראו שגישות קוד פתוח יכולות להתחרות עם בדיקות בעלות.
מה זה אומר לעסקים
התזמון נפלא. אנחנו באמצע מרוץ זרוע וידאו AI בו כל שחקן ראשי, מ-Runway ל-ByteDance, דוחף לפלטים יותר וחזקים, ומחוקים גבוהים יותר. מחזור שגיאות יכול להיות החלק הקטום שמסגרת את בעיה השנה הבאה של יכולת.
לעשו סרטים וקוראויים
לחוקרים
לעסקים
מחפש להישך
עבודת VITA Lab מצב תזוזה בסיסית בזה אנחנו חושבים על ייצור וידאו AI. במקום בנייה דגמים עוד ועוד גדול או הוספת מנגנונים מורכבים בזמן הסקה, הפתרון היה פשוט להראות את המודל מה הפלט שלו נראה כמו.
המאמר יוצג ב-ICLR 2026, וכמה מקורות בתעשיה מציעים שמספיק יצרני דגם וידאו יחקרו כבר קלטות. אם דגמי עולם מצביעים על העתיד של איך AI מבין פיזיקה ומרחב, מחזור שגיאות מצביע על העתיד של איך AI משמר הבנה זו לאורך זמן.
יתכן שזמן הוידאו AI של 4 שניות יסתיים מוקדם יותר מה-ערבה כל אחד מעולם. וזה לא יידרוש ארכיטקטורה דגם חדשה או תקציב חישוב מיליארד דולר. בדיוק לולאת אימון חכמה יותר.
קריאה נוספת
- מהפכת וידאו AI בקוד פתוח: איך דגמים פתוחים מכניסים את הפער עם מערכות בעלות
- סימולציה פיזיקה בוידאו AI: בהבנה איך דגמים לומדים עקביות פיזיקה
- משנים דיפוזיה: ארכיטקטורה פעל דגמי ייצור וידאו מודרניים

מהנדס בינה מלאכותית מלוזאן המשלב עומק מחקרי עם חדשנות מעשית. מחלק את זמנו בין ארכיטקטורות מודלים לפסגות האלפים.
View profile →מאמרים קשורים
המשיכו לגלות עם הפוסטים הקשורים האלה

כלי וידאו AI חינמיים ללא הגבלה: מה עובד ב-2026
כלי וידאו AI חינמיים ללא הגבלה מבוססים בדרך כלל על תורים או על עבודה מקומית. למדו מה באמת אינו מוגבל, מה מאט אתכם ואיך לבחור מערך עבודה מעשי ל-2026.

מרחיב וידאו AI: הארכת סרטונים ב-2026
השתמשו במרחיב וידאו AI כדי להאריך סרטונים ב-2026. השוו מגבלות הארכה, שמרו על רציפות ובחרו תהליך עבודה עבור קליפים שנוצרו או קיימים.

כלי הבינה המלאכותית החינמיים הטובים ביותר להמרת טקסט לווידאו: מדריך 2026
השוו בין כלי הבינה המלאכותית החינמיים הטובים ביותר להמרת טקסט לווידאו ב-2026, כולל מגבלות הקרדיטים האמיתיות, סימני מים, פשרות בהתקנה מקומית ותוכנית בדיקה מעשית.