EPFL Stable Video Infinity: एरर रीसाइक्लिंग AI वीडियो की सबसे बड़ी समस्या को कैसे हल करती है
EPFL का एक नया ICLR 2026 Oral पेपर एरर रीसाइक्लिंग प्रस्तुत करता है, एक ऐसी तकनीक जो टेम्पोरल ड्रिफ्ट को समाप्त करती है और बिना अतिरिक्त कंप्यूट लागत के कई मिनट लंबे AI वीडियो जनरेशन को सक्षम बनाती है।

ड्रिफ्ट की वह समस्या जिसे कोई हल नहीं कर सका
यदि आपने किसी मौजूदा मॉडल के साथ लॉन्ग-फॉर्म AI वीडियो जनरेट करने की कोशिश की है, तो आप इसकी निराशा जानते हैं। Sora 2 आपके प्लान के अनुसार 15 से 25 सेकंड तक सीमित है। Runway Gen-4.5 अधिकतम 10 सेकंड तक जाता है। Kling 3.0 15 तक पहुंचता है। कारण कंप्यूट या मेमोरी नहीं है। यह टेम्पोरल ड्रिफ्ट है।
टेम्पोरल ड्रिफ्ट तब होती है जब ऑटोरेग्रेसिव वीडियो मॉडल फ्रेम दर फ्रेम छोटी त्रुटियां जमा करते हैं। प्रत्येक जनरेट किया गया फ्रेम अगले का इनपुट बन जाता है, और छोटी खामियां तेजी से बढ़ती जाती हैं। कुछ सौ फ्रेम के बाद, आउटपुट मूल प्रॉम्प्ट से मुश्किल से मिलता-जुलता है।
यह मूल रूप से "टेलीफोन गेम" समस्या के समान है। किसी संदेश को पर्याप्त लोगों तक फुसफुसाकर पहुंचाएं और वह पहचान में नहीं आता। पहले के तरीकों ने छोटी क्लिप जनरेट करके और उन्हें जोड़कर ड्रिफ्ट से लड़ने की कोशिश की, लेकिन जोड़ दिखाई देते हैं। अन्य ने हाइरार्किकल जनरेशन का उपयोग किया (पहले कीफ्रेम, फिर इंटरपोलेशन), जो मदद करता है लेकिन मूल समस्या को समाप्त नहीं करता।
एरर रीसाइक्लिंग का प्रवेश
पेपर, जिसका शीर्षक "Stable Video Infinity" है और जिसे ICLR 2026 Oral प्रस्तुति के लिए स्वीकार किया गया है, एक भ्रामक रूप से सरल विचार प्रस्तुत करता है: मॉडल को अपनी गलतियों से निपटना सिखाएं।
यहां मुख्य अंतर्दृष्टि है। प्रशिक्षण के दौरान, मानक वीडियो डिफ्यूज़न मॉडल स्वच्छ ग्राउंड-ट्रुथ डेटा से सीखते हैं। वे कभी अपना जनरेट किया हुआ आउटपुट नहीं देखते। तैनात होने पर, उन्हें अचानक अपने अपूर्ण अनुमानों को इनपुट के रूप में इस्तेमाल करना पड़ता है, और वे शोर को संभालना नहीं जानते।
एरर रीसाइक्लिंग प्रशिक्षण लूप को संशोधित करके इसे ठीक करती है:
मानक फॉरवर्ड पास
मॉडल स्वच्छ प्रशिक्षण डेटा से एक वीडियो सेगमेंट जनरेट करता है।
त्रुटि संग्रह
मॉडल के अपने अनुमान (उनकी खामियों सहित) को हटाने के बजाय कैप्चर किया जाता है।
एरर रीसाइक्लिंग
इन अपूर्ण आउटपुट को अगले प्रशिक्षण पुनरावृत्ति के लिए इनपुट के रूप में वापस दिया जाता है, जिससे मॉडल को शोरयुक्त, स्वयं-जनरेट किए गए फ्रेम से भी स्थिर आउटपुट जनरेट करना सिखाया जाता है।
पुनरावृत्त सुधार
कई प्रशिक्षण चक्रों में, मॉडल एक मज़बूत स्व-सुधार तंत्र सीखता है जो त्रुटि संचय को रोकता है।
इस दृष्टिकोण की खूबसूरती इसकी सादगी में है। कोई नई मॉडल आर्किटेक्चर नहीं, कोई अतिरिक्त पैरामीटर नहीं, कोई इन्फरेंस-टाइम युक्ति नहीं। मॉडल प्रशिक्षण के दौरान बस सीखता है कि वास्तविक तैनाती की परिस्थितियां कैसी दिखती हैं।
यह आपकी सोच से अधिक महत्वपूर्ण क्यों है
इसके प्रभाव सिर्फ लंबी बिल्ली वीडियो जनरेट करने से कहीं आगे जाते हैं। यहां क्या बदलता है:
एरर रीसाइक्लिंग से पहले
- वीडियो मॉडल 4-20 सेकंड तक सीमित
- दृश्य की संगति तेजी से बिगड़ती है
- कुछ सेकंड बाद किरदार की पहचान भटकती है
- फिजिक्स धीरे-धीरे अधिक अवास्तविक हो जाती है
- रंग और प्रकाश अप्रत्याशित रूप से बदलते हैं
एरर रीसाइक्लिंग के बाद
- कई मिनट का संगत वीडियो जनरेशन
- पूरे समय किरदार का स्थिर रूप
- संगत फिजिक्स और स्थानिक संबंध
- विश्वसनीय कलर ग्रेडिंग और प्रकाश
- समय के साथ कोई दिखने योग्य गुणवत्ता ह्रास नहीं
आंकड़े
VITA Lab टीम ने Stable Video Infinity को कई आर्किटेक्चर और बेंचमार्क पर परीक्षण किया। नतीजे प्रभावशाली हैं:
| मेट्रिक | एरर रीसाइक्लिंग के बिना | एरर रीसाइक्लिंग के साथ | सुधार |
|---|---|---|---|
| FVD (कम बेहतर है) | 4s के बाद बिगड़ता है | 2min+ तक स्थिर | महत्वपूर्ण |
| किरदार की संगति | 15s पर 60% से नीचे गिरती है | 2min पर 90%+ बनाए रखता है | ~50% सापेक्ष |
| टेम्पोरल कोहेरेंस | 8s पर दिखने योग्य ड्रिफ्ट | 2min पर कोई दिखने योग्य ड्रिफ्ट नहीं | गुणात्मक छलांग |
| कंप्यूट ओवरहेड | बेसलाइन | बेसलाइन (0% वृद्धि) | शून्य लागत |
शून्य-कंप्यूट-ओवरहेड पहलू महत्वपूर्ण है। एरर रीसाइक्लिंग एक प्रशिक्षण-समय तकनीक है, इन्फरेंस-समय की नहीं। प्रशिक्षण के बाद, मॉडल पहले की तरह ठीक उसी गति और लागत पर चलता है।
एरर रीसाइक्लिंग अंदर से कैसे काम करती है
तकनीकी विवरण चाहने वालों के लिए, संशोधित प्रशिक्षण पाइपलाइन में यह होता है।
मानक वीडियो डिफ्यूज़न प्रशिक्षण स्वच्छ ग्राउंड-ट्रुथ फ्रेम x_0 पर लागू किए गए नॉइज़ शेड्यूल epsilon का उपयोग करता है। मॉडल नॉइज़ का अनुमान लगाना और मूल सिग्नल को पुनर्प्राप्त करना सीखता है। इन्फरेंस समय पर, मॉडल फ्रेम t के अपने अनुमान पर कंडीशन होकर ऑटोरेग्रेसिव रूप से फ्रेम t+1 जनरेट करता है।
प्रशिक्षण (स्वच्छ इनपुट) और इन्फरेंस (स्वयं-जनरेटेड इनपुट) के बीच के अंतर को एक्सपोज़र बायस कहा जाता है। एरर रीसाइक्लिंग इसे सीधे संबोधित करती है।
तकनीकी विवरण: संशोधित प्रशिक्षण उद्देश्य▼
प्रशिक्षण के दौरान, मॉडल समय-समय पर ग्राउंड-ट्रुथ डेटा का उपयोग करने के बजाय अपने वर्तमान वेट्स का उपयोग करके फ्रेम जनरेट करता है। इन स्वयं-जनरेट किए गए फ्रेमों को, उनकी खामियों सहित, प्रशिक्षण अनुक्रम में अगले फ्रेमों के लिए कंडीशनिंग इनपुट के रूप में उपयोग किया जाता है।
मुख्य हाइपरपैरामीटर रीसाइक्लिंग अनुपात r है, जो नियंत्रित करता है कि प्रशिक्षण के दौरान स्वयं-जनरेट किए गए फ्रेम कितनी बार ग्राउंड-ट्रुथ फ्रेमों को बदलते हैं। पेपर पाता है कि r = 0.3 (30% रीसाइक्ल किए गए फ्रेम) इष्टतम प्रदर्शन प्राप्त करता है, स्थिरता सुधार और प्रशिक्षण सिग्नल गुणवत्ता में संतुलन बनाते हुए।
संशोधित लॉस फ़ंक्शन मानक डिफ्यूज़न उद्देश्य ही रहता है। एकमात्र अंतर वह डेटा वितरण है जिसे मॉडल प्रशिक्षण के दौरान देखता है। यही कारण है कि इन्फरेंस समय पर कोई कम्प्यूटेशनल ओवरहेड नहीं है।
यह वैचारिक रूप से सीक्वेंस-टू-सीक्वेंस मॉडलों में scheduled sampling के समान है, लेकिन सतत डिफ्यूज़न फ्रेमवर्क के लिए अनुकूलित है। VITA Lab टीम अपने पेपर में इस संबंध का श्रेय देती है, साथ ही यह भी बताती है कि डिफ्यूज़न मॉडलों पर scheduled sampling का सामान्य उपयोग काम नहीं करता। उनका योगदान वह विशिष्ट फॉर्मूलेशन है जो इसे वीडियो जनरेशन के लिए स्थिर बनाता है।
ओपन-सोर्स लाभ
शायद सबसे रोमांचक पहलू: कोड पूरी तरह ओपन-सोर्स है GitHub पर (vita-epfl/Stable-Video-Infinity)। इसका मतलब है कि कोई भी रिसर्च लैब या कंपनी अपने मौजूदा वीडियो मॉडलों पर एरर रीसाइक्लिंग लागू कर सकती है।
ओपन-सोर्स रिलीज़ AI वीडियो रिसर्च समुदाय में बढ़ते रुझान का अनुसरण करती है। LTX-2 और Wan 2.6 जैसे मॉडलों ने दिखाया है कि ओपन-सोर्स दृष्टिकोण मालिकाना विकल्पों के साथ प्रतिस्पर्धा कर सकते हैं।
उद्योग के लिए इसका क्या अर्थ है
समय उल्लेखनीय है। हम AI वीडियो हथियारों की दौड़ के बीच में हैं, जहां Runway से लेकर ByteDance तक हर प्रमुख खिलाड़ी लंबे, उच्च-गुणवत्ता आउटपुट के लिए प्रयास कर रहा है। एरर रीसाइक्लिंग वह गायब हिस्सा हो सकती है जो क्षमताओं की अगली पीढ़ी को अनलॉक करे।
फिल्मकारों और क्रिएटर्स के लिए
शोधकर्ताओं के लिए
एंटरप्राइज़ के लिए
आगे की राह
VITA Lab का काम AI वीडियो जनरेशन के बारे में हमारी सोच में एक बुनियादी बदलाव का प्रतिनिधित्व करता है। लगातार बड़े मॉडल बनाने या जटिल इन्फरेंस-टाइम तंत्र जोड़ने के बजाय, समाधान बस मॉडल को यह दिखाना था कि उसका अपना आउटपुट कैसा दिखता है।
पेपर ICLR 2026 में प्रस्तुत किया जाएगा, और कई उद्योग स्रोत संकेत देते हैं कि प्रमुख वीडियो मॉडल प्रदाता पहले से ही एकीकरण तलाश रहे हैं। यदि world models AI द्वारा फिजिक्स और स्पेस को समझने के भविष्य का प्रतिनिधित्व करते हैं, तो एरर रीसाइक्लिंग समय के साथ उस समझ को बनाए रखने के AI के भविष्य का प्रतिनिधित्व करती है।
4-सेकंड AI वीडियो का युग उम्मीद से कहीं जल्दी समाप्त हो सकता है। और इसके लिए न तो नई मॉडल आर्किटेक्चर चाहिए होगी, न ही एक बिलियन-डॉलर कंप्यूट बजट। बस एक अधिक बुद्धिमान प्रशिक्षण लूप।
आगे पढ़ें
- ओपन-सोर्स AI वीडियो क्रांति: ओपन मॉडल मालिकाना प्रणालियों के साथ अंतर कैसे कम कर रहे हैं
- AI वीडियो में फिजिक्स सिमुलेशन: यह समझना कि मॉडल भौतिक संगति कैसे सीखते हैं
- डिफ्यूज़न ट्रांसफॉर्मर्स: आधुनिक वीडियो जनरेशन को शक्ति देने वाली आर्किटेक्चर
स्रोत
- लर्निंग रिप्रेजेंटेशंस पर अंतरराष्ट्रीय सम्मेलन: Oral (ICLR 2026 स्थिति) (लर्निंग रिप्रेजेंटेशंस पर अंतरराष्ट्रीय सम्मेलन)
- arXiv के माध्यम से EPFL VITA शोधकर्ता: Stable Video Infinity बिना अतिरिक्त इन्फरेंस के अनंत-लंबाई वीडियो जनरेशन का समर्थन करता है… (arXiv के माध्यम से EPFL VITA शोधकर्ता)

लॉज़ान के AI इंजीनियर, जो शोध की गहराई को व्यावहारिक नवाचार के साथ जोड़ते हैं। अपना समय मॉडल आर्किटेक्चर और आल्प्स की चोटियों के बीच बाँटते हैं।
View profile →संबंधित लेख
इन संबंधित पोस्ट के साथ आगे जानें

मुफ्त असीमित AI वीडियो टूल्स: 2026 में क्या काम करता है
मुफ्त असीमित AI वीडियो टूल्स आमतौर पर क्यू-आधारित या स्थानीय होते हैं। जानें कि वास्तव में क्या असीमित है, क्या धीमा करता है, और 2026 के लिए व्यावहारिक सेटअप कैसे चुनें।

AI वीडियो एक्सटेंडर: 2026 में वीडियो को लंबा करें
2026 में वीडियो को लंबा करने के लिए AI वीडियो एक्सटेंडर का उपयोग करें। एक्सटेंशन सीमाओं की तुलना करें, निरंतरता बनाए रखें, और जनरेट किए गए या मौजूदा क्लिप के लिए एक वर्कफ़्लो चुनें।

सर्वश्रेष्ठ मुफ़्त टेक्स्ट-टू-वीडियो AI टूल: 2026 गाइड
2026 के सर्वश्रेष्ठ मुफ़्त टेक्स्ट-टू-वीडियो AI टूल की तुलना करें, जिनमें उनकी वास्तविक क्रेडिट सीमाएं, वॉटरमार्क, लोकल सेटअप के समझौते और एक व्यावहारिक टेस्ट प्लान शामिल हैं।