Meta Pixelमुख्य सामग्री पर जाएं
AlexisAlexis· AI लेखक, मानव द्वारा समीक्षा की गई
9 min read
1635 शब्द

EPFL Stable Video Infinity: एरर रीसाइक्लिंग AI वीडियो की सबसे बड़ी समस्या को कैसे हल करती है

EPFL का एक नया ICLR 2026 Oral पेपर एरर रीसाइक्लिंग प्रस्तुत करता है, एक ऐसी तकनीक जो टेम्पोरल ड्रिफ्ट को समाप्त करती है और बिना अतिरिक्त कंप्यूट लागत के कई मिनट लंबे AI वीडियो जनरेशन को सक्षम बनाती है।

EPFL Stable Video Infinity: एरर रीसाइक्लिंग AI वीडियो की सबसे बड़ी समस्या को कैसे हल करती है

अपने AI वीडियो बनाने के लिए तैयार हैं?

Bonega.ai का उपयोग करने वाले हजारों क्रिएटर्स से जुड़ें

हर AI वीडियो मॉडल का एक ही गंदा राज़ है। 4-सेकंड की क्लिप जनरेट करें और नतीजे शानदार दिखते हैं। 15 सेकंड से आगे बढ़ें और किरदार बदलने लगते हैं, फिजिक्स बिगड़ जाती है, रंग बदलते हैं, और पूरा दृश्य असंगतता में भटकने लगता है। EPFL की VITA Lab ने अभी एक समाधान प्रकाशित किया है, और यह इस वर्ष वीडियो जनरेशन का सबसे महत्वपूर्ण पेपर हो सकता है।

ड्रिफ्ट की वह समस्या जिसे कोई हल नहीं कर सका

यदि आपने किसी मौजूदा मॉडल के साथ लॉन्ग-फॉर्म AI वीडियो जनरेट करने की कोशिश की है, तो आप इसकी निराशा जानते हैं। Sora 2 आपके प्लान के अनुसार 15 से 25 सेकंड तक सीमित है। Runway Gen-4.5 अधिकतम 10 सेकंड तक जाता है। Kling 3.0 15 तक पहुंचता है। कारण कंप्यूट या मेमोरी नहीं है। यह टेम्पोरल ड्रिफ्ट है।

💡

टेम्पोरल ड्रिफ्ट तब होती है जब ऑटोरेग्रेसिव वीडियो मॉडल फ्रेम दर फ्रेम छोटी त्रुटियां जमा करते हैं। प्रत्येक जनरेट किया गया फ्रेम अगले का इनपुट बन जाता है, और छोटी खामियां तेजी से बढ़ती जाती हैं। कुछ सौ फ्रेम के बाद, आउटपुट मूल प्रॉम्प्ट से मुश्किल से मिलता-जुलता है।

यह मूल रूप से "टेलीफोन गेम" समस्या के समान है। किसी संदेश को पर्याप्त लोगों तक फुसफुसाकर पहुंचाएं और वह पहचान में नहीं आता। पहले के तरीकों ने छोटी क्लिप जनरेट करके और उन्हें जोड़कर ड्रिफ्ट से लड़ने की कोशिश की, लेकिन जोड़ दिखाई देते हैं। अन्य ने हाइरार्किकल जनरेशन का उपयोग किया (पहले कीफ्रेम, फिर इंटरपोलेशन), जो मदद करता है लेकिन मूल समस्या को समाप्त नहीं करता।

एरर रीसाइक्लिंग का प्रवेश

पेपर, जिसका शीर्षक "Stable Video Infinity" है और जिसे ICLR 2026 Oral प्रस्तुति के लिए स्वीकार किया गया है, एक भ्रामक रूप से सरल विचार प्रस्तुत करता है: मॉडल को अपनी गलतियों से निपटना सिखाएं

Oral
ICLR 2026 स्थिति
0
अतिरिक्त कंप्यूट लागत
Minutes
वीडियो की अवधि

यहां मुख्य अंतर्दृष्टि है। प्रशिक्षण के दौरान, मानक वीडियो डिफ्यूज़न मॉडल स्वच्छ ग्राउंड-ट्रुथ डेटा से सीखते हैं। वे कभी अपना जनरेट किया हुआ आउटपुट नहीं देखते। तैनात होने पर, उन्हें अचानक अपने अपूर्ण अनुमानों को इनपुट के रूप में इस्तेमाल करना पड़ता है, और वे शोर को संभालना नहीं जानते।

एरर रीसाइक्लिंग प्रशिक्षण लूप को संशोधित करके इसे ठीक करती है:

चरण 1

मानक फॉरवर्ड पास

मॉडल स्वच्छ प्रशिक्षण डेटा से एक वीडियो सेगमेंट जनरेट करता है।

चरण 2

त्रुटि संग्रह

मॉडल के अपने अनुमान (उनकी खामियों सहित) को हटाने के बजाय कैप्चर किया जाता है।

चरण 3

एरर रीसाइक्लिंग

इन अपूर्ण आउटपुट को अगले प्रशिक्षण पुनरावृत्ति के लिए इनपुट के रूप में वापस दिया जाता है, जिससे मॉडल को शोरयुक्त, स्वयं-जनरेट किए गए फ्रेम से भी स्थिर आउटपुट जनरेट करना सिखाया जाता है।

चरण 4

पुनरावृत्त सुधार

कई प्रशिक्षण चक्रों में, मॉडल एक मज़बूत स्व-सुधार तंत्र सीखता है जो त्रुटि संचय को रोकता है।

इस दृष्टिकोण की खूबसूरती इसकी सादगी में है। कोई नई मॉडल आर्किटेक्चर नहीं, कोई अतिरिक्त पैरामीटर नहीं, कोई इन्फरेंस-टाइम युक्ति नहीं। मॉडल प्रशिक्षण के दौरान बस सीखता है कि वास्तविक तैनाती की परिस्थितियां कैसी दिखती हैं।

यह आपकी सोच से अधिक महत्वपूर्ण क्यों है

इसके प्रभाव सिर्फ लंबी बिल्ली वीडियो जनरेट करने से कहीं आगे जाते हैं। यहां क्या बदलता है:

एरर रीसाइक्लिंग से पहले

  • वीडियो मॉडल 4-20 सेकंड तक सीमित
  • दृश्य की संगति तेजी से बिगड़ती है
  • कुछ सेकंड बाद किरदार की पहचान भटकती है
  • फिजिक्स धीरे-धीरे अधिक अवास्तविक हो जाती है
  • रंग और प्रकाश अप्रत्याशित रूप से बदलते हैं

एरर रीसाइक्लिंग के बाद

  • कई मिनट का संगत वीडियो जनरेशन
  • पूरे समय किरदार का स्थिर रूप
  • संगत फिजिक्स और स्थानिक संबंध
  • विश्वसनीय कलर ग्रेडिंग और प्रकाश
  • समय के साथ कोई दिखने योग्य गुणवत्ता ह्रास नहीं

आंकड़े

VITA Lab टीम ने Stable Video Infinity को कई आर्किटेक्चर और बेंचमार्क पर परीक्षण किया। नतीजे प्रभावशाली हैं:

मेट्रिकएरर रीसाइक्लिंग के बिनाएरर रीसाइक्लिंग के साथसुधार
FVD (कम बेहतर है)4s के बाद बिगड़ता है2min+ तक स्थिरमहत्वपूर्ण
किरदार की संगति15s पर 60% से नीचे गिरती है2min पर 90%+ बनाए रखता है~50% सापेक्ष
टेम्पोरल कोहेरेंस8s पर दिखने योग्य ड्रिफ्ट2min पर कोई दिखने योग्य ड्रिफ्ट नहींगुणात्मक छलांग
कंप्यूट ओवरहेडबेसलाइनबेसलाइन (0% वृद्धि)शून्य लागत
💡

शून्य-कंप्यूट-ओवरहेड पहलू महत्वपूर्ण है। एरर रीसाइक्लिंग एक प्रशिक्षण-समय तकनीक है, इन्फरेंस-समय की नहीं। प्रशिक्षण के बाद, मॉडल पहले की तरह ठीक उसी गति और लागत पर चलता है।

एरर रीसाइक्लिंग अंदर से कैसे काम करती है

तकनीकी विवरण चाहने वालों के लिए, संशोधित प्रशिक्षण पाइपलाइन में यह होता है।

मानक वीडियो डिफ्यूज़न प्रशिक्षण स्वच्छ ग्राउंड-ट्रुथ फ्रेम x_0 पर लागू किए गए नॉइज़ शेड्यूल epsilon का उपयोग करता है। मॉडल नॉइज़ का अनुमान लगाना और मूल सिग्नल को पुनर्प्राप्त करना सीखता है। इन्फरेंस समय पर, मॉडल फ्रेम t के अपने अनुमान पर कंडीशन होकर ऑटोरेग्रेसिव रूप से फ्रेम t+1 जनरेट करता है।

प्रशिक्षण (स्वच्छ इनपुट) और इन्फरेंस (स्वयं-जनरेटेड इनपुट) के बीच के अंतर को एक्सपोज़र बायस कहा जाता है। एरर रीसाइक्लिंग इसे सीधे संबोधित करती है।

तकनीकी विवरण: संशोधित प्रशिक्षण उद्देश्य

प्रशिक्षण के दौरान, मॉडल समय-समय पर ग्राउंड-ट्रुथ डेटा का उपयोग करने के बजाय अपने वर्तमान वेट्स का उपयोग करके फ्रेम जनरेट करता है। इन स्वयं-जनरेट किए गए फ्रेमों को, उनकी खामियों सहित, प्रशिक्षण अनुक्रम में अगले फ्रेमों के लिए कंडीशनिंग इनपुट के रूप में उपयोग किया जाता है।

मुख्य हाइपरपैरामीटर रीसाइक्लिंग अनुपात r है, जो नियंत्रित करता है कि प्रशिक्षण के दौरान स्वयं-जनरेट किए गए फ्रेम कितनी बार ग्राउंड-ट्रुथ फ्रेमों को बदलते हैं। पेपर पाता है कि r = 0.3 (30% रीसाइक्ल किए गए फ्रेम) इष्टतम प्रदर्शन प्राप्त करता है, स्थिरता सुधार और प्रशिक्षण सिग्नल गुणवत्ता में संतुलन बनाते हुए।

संशोधित लॉस फ़ंक्शन मानक डिफ्यूज़न उद्देश्य ही रहता है। एकमात्र अंतर वह डेटा वितरण है जिसे मॉडल प्रशिक्षण के दौरान देखता है। यही कारण है कि इन्फरेंस समय पर कोई कम्प्यूटेशनल ओवरहेड नहीं है।

यह वैचारिक रूप से सीक्वेंस-टू-सीक्वेंस मॉडलों में scheduled sampling के समान है, लेकिन सतत डिफ्यूज़न फ्रेमवर्क के लिए अनुकूलित है। VITA Lab टीम अपने पेपर में इस संबंध का श्रेय देती है, साथ ही यह भी बताती है कि डिफ्यूज़न मॉडलों पर scheduled sampling का सामान्य उपयोग काम नहीं करता। उनका योगदान वह विशिष्ट फॉर्मूलेशन है जो इसे वीडियो जनरेशन के लिए स्थिर बनाता है।

ओपन-सोर्स लाभ

शायद सबसे रोमांचक पहलू: कोड पूरी तरह ओपन-सोर्स है GitHub पर (vita-epfl/Stable-Video-Infinity)। इसका मतलब है कि कोई भी रिसर्च लैब या कंपनी अपने मौजूदा वीडियो मॉडलों पर एरर रीसाइक्लिंग लागू कर सकती है।

ओपन-सोर्स क्यों महत्वपूर्ण है
किसी भी मौजूदा वीडियो डिफ्यूज़न मॉडल को एरर रीसाइक्लिंग के साथ रेट्रोफिट किया जा सकता है। आर्किटेक्चरल बदलाव की जरूरत नहीं, बस संशोधित प्रशिक्षण लूप चाहिए। यह Sora, Runway, Kling और हर ओपन-सोर्स मॉडल को एक साथ बेहतर बना सकता है।
व्यावहारिक सीमाएं
मॉडल को फिर से प्रशिक्षित या फाइन-ट्यून करने की जरूरत होती है। मालिकाना मॉडलों वाली कंपनियों को पुनः प्रशिक्षण में कंप्यूट निवेश करना होगा। तकनीक की प्रभावशीलता विभिन्न आर्किटेक्चर और स्केल के बीच अलग हो सकती है।

ओपन-सोर्स रिलीज़ AI वीडियो रिसर्च समुदाय में बढ़ते रुझान का अनुसरण करती है। LTX-2 और Wan 2.6 जैसे मॉडलों ने दिखाया है कि ओपन-सोर्स दृष्टिकोण मालिकाना विकल्पों के साथ प्रतिस्पर्धा कर सकते हैं।

उद्योग के लिए इसका क्या अर्थ है

समय उल्लेखनीय है। हम AI वीडियो हथियारों की दौड़ के बीच में हैं, जहां Runway से लेकर ByteDance तक हर प्रमुख खिलाड़ी लंबे, उच्च-गुणवत्ता आउटपुट के लिए प्रयास कर रहा है। एरर रीसाइक्लिंग वह गायब हिस्सा हो सकती है जो क्षमताओं की अगली पीढ़ी को अनलॉक करे।

🎬

फिल्मकारों और क्रिएटर्स के लिए

लॉन्ग-फॉर्म संगत वीडियो जनरेशन वास्तविक नैरेटिव कंटेंट को सक्षम बनाती है। सिर्फ क्लिप नहीं, बल्कि दृश्य, अनुक्रम और आखिरकार एक ही प्रॉम्प्ट से जनरेट हुई शॉर्ट फिल्में।
🔬

शोधकर्ताओं के लिए

एरर रीसाइक्लिंग एक सामान्यीकृत फ्रेमवर्क प्रदान करती है। यही सिद्धांत ऑडियो जनरेशन, 3D सीन सिंथेसिस और ड्रिफ्ट से पीड़ित किसी भी ऑटोरेग्रेसिव जनरेटिव मॉडल पर लागू हो सकता है।
🏢

एंटरप्राइज़ के लिए

स्थिर लॉन्ग-फॉर्म जनरेशन AI वीडियो को पेशेवर उपयोग मामलों के लिए व्यवहार्य बनाती है: प्रोडक्ट डेमो, प्रशिक्षण वीडियो, ऐसे मार्केटिंग अभियान जिनमें कई मिनट के कंटेंट में एकसमान गुणवत्ता चाहिए।

आगे की राह

VITA Lab का काम AI वीडियो जनरेशन के बारे में हमारी सोच में एक बुनियादी बदलाव का प्रतिनिधित्व करता है। लगातार बड़े मॉडल बनाने या जटिल इन्फरेंस-टाइम तंत्र जोड़ने के बजाय, समाधान बस मॉडल को यह दिखाना था कि उसका अपना आउटपुट कैसा दिखता है।

पेपर ICLR 2026 में प्रस्तुत किया जाएगा, और कई उद्योग स्रोत संकेत देते हैं कि प्रमुख वीडियो मॉडल प्रदाता पहले से ही एकीकरण तलाश रहे हैं। यदि world models AI द्वारा फिजिक्स और स्पेस को समझने के भविष्य का प्रतिनिधित्व करते हैं, तो एरर रीसाइक्लिंग समय के साथ उस समझ को बनाए रखने के AI के भविष्य का प्रतिनिधित्व करती है।

4-सेकंड AI वीडियो का युग उम्मीद से कहीं जल्दी समाप्त हो सकता है। और इसके लिए न तो नई मॉडल आर्किटेक्चर चाहिए होगी, न ही एक बिलियन-डॉलर कंप्यूट बजट। बस एक अधिक बुद्धिमान प्रशिक्षण लूप।

आगे पढ़ें


स्रोत

Alexis
AlexisAI EngineerAI Author

लॉज़ान के AI इंजीनियर, जो शोध की गहराई को व्यावहारिक नवाचार के साथ जोड़ते हैं। अपना समय मॉडल आर्किटेक्चर और आल्प्स की चोटियों के बीच बाँटते हैं।

View profile →

जो पढ़ा, वह पसंद आया?

कुछ ही मिनटों में अपने विचारों को असीमित अवधि के AI वीडियो में बदलें।

संबंधित लेख

इन संबंधित पोस्ट के साथ आगे जानें

मुफ्त असीमित AI वीडियो टूल्स: 2026 में क्या काम करता है
मुफ्त टूल्सAI वीडियो

मुफ्त असीमित AI वीडियो टूल्स: 2026 में क्या काम करता है

मुफ्त असीमित AI वीडियो टूल्स आमतौर पर क्यू-आधारित या स्थानीय होते हैं। जानें कि वास्तव में क्या असीमित है, क्या धीमा करता है, और 2026 के लिए व्यावहारिक सेटअप कैसे चुनें।

Read
AI वीडियो एक्सटेंडर: 2026 में वीडियो को लंबा करें
AI वीडियोवीडियो संपादन

AI वीडियो एक्सटेंडर: 2026 में वीडियो को लंबा करें

2026 में वीडियो को लंबा करने के लिए AI वीडियो एक्सटेंडर का उपयोग करें। एक्सटेंशन सीमाओं की तुलना करें, निरंतरता बनाए रखें, और जनरेट किए गए या मौजूदा क्लिप के लिए एक वर्कफ़्लो चुनें।

Read
सर्वश्रेष्ठ मुफ़्त टेक्स्ट-टू-वीडियो AI टूल: 2026 गाइड
AI वीडियोमुफ़्त टूल

सर्वश्रेष्ठ मुफ़्त टेक्स्ट-टू-वीडियो AI टूल: 2026 गाइड

2026 के सर्वश्रेष्ठ मुफ़्त टेक्स्ट-टू-वीडियो AI टूल की तुलना करें, जिनमें उनकी वास्तविक क्रेडिट सीमाएं, वॉटरमार्क, लोकल सेटअप के समझौते और एक व्यावहारिक टेस्ट प्लान शामिल हैं।

Read

क्या आपको यह लेख पसंद आया?

और जानकारियाँ पाएँ और हमारी नवीनतम सामग्री से अपडेट रहें।