EPFL Stable Video Infinity: غلطی کی تدوین کی نقل کس طرح AI ویڈیو کے بڑے ترین مسئلہ کو حل کرتی ہے
EPFL سے ایک نیا ICLR 2026 زبانی مقالہ غلطی کی تدوین کی تکنیک پیش کرتا ہے جو عارضی رفتار کو ختم کرتا ہے اور بغیر کسی اضافی کمپیوٹنگ لاگت کے کثیر منٹ کی AI ویڈیو کی تیاری کو ممکن بناتا ہے۔

ڈریفٹ کا مسئلہ جسے کوئی حل نہ کر سکا
اگر آپ نے کسی موجودہ ماڈل سے طویل مدت کی AI ویڈیو تیار کرنے کی کوشش کی ہے، تو آپ کو مایوسی معلوم ہے۔ Sora 2 آپ کے منصوبے کی بنیاد پر 15 سے 25 سیکنڈ تک محدود ہے۔ Runway Gen-4.5 زیادہ سے زیادہ 10 سیکنڈ ہے۔ Kling 3.0 15 سیکنڈ تک جاتا ہے۔ اس کی وجہ کمپیوٹنگ یا میموری نہیں ہے۔ یہ عارضی ڈریفٹ ہے۔
عارضی ڈریفٹ اس وقت واقع ہوتی ہے جب آٹورجریسیو ویڈیو ماڈل فریم سے فریم تک چھوٹی خرابیوں کو جمع کرتے ہیں۔ ہر تیار کردہ فریم اگلے کے لیے ان پٹ بن جاتا ہے، اور چھوٹی خامیاں بطور نمائندگی کے جمع ہوتی ہیں۔ سینکڑوں فریم کے بعد، آؤٹ پٹ اصل ہدایات سے شاید مختلف ہے۔
یہ بنیادی طور پر "ٹیلیفون گیم" کے مسئلہ کی طرح ہے۔ کافی لوگوں کے ذریعے ایک پیغام کتتا پھیلائیں اور یہ ناقابل شناخت ہو جاتا ہے۔ پچھلے طریقوں نے مختصر کلپ تیار کر کے انہیں ایک ساتھ سلائی کر کے ڈریفٹ سے لڑنے کی کوشش کی، لیکن سیم نظر آتے ہیں۔ دوسروں نے ہائریکل جنریشن استعمال کی (پہلے کے ڈھانچے، دوسرے میں انٹرپولیشن)، جو مدد دیتا ہے لیکن بنیادی مسئلہ کو ختم نہیں کرتا۔
غلطی کی تدوین میں داخل ہوں
یہ مقالہ، "Stable Video Infinity" کے نام سے، اور ICLR 2026 زبانی پریزنٹیشن کے طور پر قبول، ایک دھوکہ سادہ خیال پیش کرتا ہے: ماڈل کو اپنی غلطیوں کے ساتھ نمٹنے کی تیاری دیں۔
یہاں کلیدی بصیرت ہے۔ تربیت کے دوران، معیاری ویڈیو ڈفیوژن ماڈل صاف زمینی سچائی کے ڈیٹا سے سیکھتے ہیں۔ وہ کبھی اپنی تیار شدہ پیداوار نہیں دیکھتے۔ تعینات کے وقت، انہیں اچانک اپنی ناقص پیشن گوئیوں کے ساتھ کام کرنا پڑتا ہے، اور وہ شور سے نمٹنا نہیں جانتے۔
غلطی کی تدوین تربیت کے لوپ میں ترمیم کر کے اس کو درست کرتی ہے:
معیاری فارورڈ پاس
ماڈل صاف تربیت ڈیٹا سے ایک ویڈیو حصہ تیار کرتا ہے۔
خرابی کا مجموعہ
ماڈل کی اپنی پیشن گوئیاں (ان کی خامیوں کے ساتھ) اتار کے بجائے حاصل کی جاتی ہیں۔
غلطی کی تدوین
یہ ناقص اخراجات اگلی تربیت کے تکرار کے لیے ان پٹ کے طور پر واپس ڈالی جاتی ہیں، ماڈل کو خود سے تیار، شور والے فریم سے بھی مستحکم پیداوار تیار کرنے کی تیاری دیتی ہے۔
تکراری بہتری
متعدد تربیت کے چکروں میں، ماڈل ایک مضبوط خود اصلاح میکانزم سیکھتا ہے جو غلطی کے جمع کو روکتا ہے۔
اس نقطہ نظر کی خوبصورتی اس کی سادگی میں ہے۔ کوئی نیا ماڈل معماری نہیں، کوئی اضافی پیرامیٹرز نہیں، کوئی انفرنس ٹائم کی چالیں نہیں۔ ماڈل صرف تربیت کے دوران سیکھتا ہے کہ حقیقی تعیناتی کی شرائط کیسی ہیں۔
یہ کیوں سوچتے ہو سے زیادہ اہم ہے
مضمرات لمبی بلی ویڈیو سے آگے جاتے ہیں۔ یہاں کیا بدلا:
غلطی کی تدوین سے پہلے
- ویڈیو ماڈل 4-20 سیکنڈ تک محدود
- منظرنامہ کی مطابقت تیزی سے کمزور ہوتی ہے
- کردار کی شناخت کچھ سیکنڈ کے بعد بہتر ہوتی ہے
- فزکس بتدریج غیر حقیقی ہو جاتا ہے
- رنگ اور روشنی غیر متوقع طریقے سے بدل جاتے ہیں
غلطی کی تدوین کے بعد
- کثیر منٹ کی ہم آہنگ ویڈیو کی تیاری
- پوری ویڈیو میں مستحکم کردار کی ظاہری شکل
- مسلسل فزکس اور مکانی تعلقات
- قابل اعتماد رنگ گریڈنگ اور روشنی
- وقت کے ساتھ کوئی نظر آنے والی معیار کی خرابی نہیں
اعدادوشمار
VITA Lab ٹیم نے متعدد فن تعمیر اور بینچ مارکس میں Stable Video Infinity کو ٹیسٹ کیا۔ نتائج حیران کن ہیں:
| میٹرک | غلطی کی تدوین کے بغیر | غلطی کی تدوین کے ساتھ | بہتری |
|---|---|---|---|
| FVD (کم بہتر ہے) | 4s کے بعد خراب ہوتا ہے | 2 منٹ + تک مستحکم | نمایاں |
| کردار کی مطابقت | 15s پر 60% سے نیچے گرتی ہے | 2 منٹ پر 90%+ برقرار | تقریباً 50% رشتہ دار |
| عارضی ربط | 8s پر نظر آنے والی ڈریفٹ | 2 منٹ پر کوئی نظر آنے والی ڈریفٹ نہیں | معیار کا چھلانگ |
| کمپیوٹنگ کا بوجھ | بنیاد لائن | بنیاد لائن (0% اضافہ) | صفر لاگت |
صفر کمپیوٹنگ لاگت کا پہلو اہم ہے۔ غلطی کی تدوین ایک تربیت کے وقت کی تکنیک ہے، انفرنس ٹائم کی نہیں۔ ایک بار تربیت یافتہ ہونے کے بعد، ماڈل بالکل اسی رفتار اور لاگت میں چلتا ہے جیسے پہلے تھا۔
غلطی کی تدوین ہود کے نیچے کیسے کام کرتی ہے
ان لوگوں کے لیے جو تکنیکی تفصیلات چاہتے ہیں، یہاں ترمیم شدہ تربیت پائپ لائن میں کیا ہوتا ہے۔
معیاری ویڈیو ڈفیوژن تربیت صاف زمینی سچائی فریم x_0 کے لیے لاگو شدہ شور کے شیڈول epsilon استعمال کرتی ہے۔ ماڈل شور کی پیشن گوئی کرنا اور اصل سگنل کو بحال کرنا سیکھتا ہے۔ انفرنس ٹائم پر، ماڈل خود سے فریم t+1 کو فریم t کی اپنی پیشن گوئی پر مشروط کرتا ہے۔
تربیت (صاف ان پٹ) اور انفرنس (خود سے تیار کردہ ان پٹ) کے درمیان فاصلہ انتشار میں جانبداری کہلاتا ہے۔ غلطی کی تدوین براہ راست اس کو سنبھالتی ہے۔
تکنیکی تفصیلات: ترمیم شدہ تربیت کا مقصد▼
تربیت کے دوران، ماڈل بعض اوقات اپنے موجودہ وزن کا استعمال کرتے ہوئے فریم تیار کرتا ہے بجائے زمینی سچائی کے ڈیٹا استعمال کے۔ یہ خود سے تیار کردہ فریمیں، اپنی خامیوں کے ساتھ مکمل، بعد میں تربیت کی ترتیب میں آنے والے فریم کے لیے شرائط ان پٹ کے طور پر استعمال کی جاتی ہیں۔
کلیدی ہائپر پیرامیٹر تدوین کا تناسب r ہے، جو کنٹرول کرتا ہے کہ خود سے تیار کردہ فریم تربیت کے دوران زمینی سچائی کی جگہ کتنی بار لیتے ہیں۔ مقالہ دیکھتا ہے کہ r = 0.3 (30% تدوین شدہ فریم) بہترین کارکردگی حاصل کرتا ہے، استحکام میں بہتری اور تربیت کے سگنل کی معیار میں توازن رکھتا ہے۔
ترمیم شدہ نقصان کی تقریب معیاری ڈفیوژن مقصد رہتی ہے۔ واحد فرق وہ ڈیٹا کی تقسیم ہے جو ماڈل تربیت میں دیکھتا ہے۔ یہی وجہ ہے کہ انفرنس ٹائم میں کمپیوٹنگ کا کوئی عام بوجھ نہیں۔
یہ تصوری طور پر طے شدہ نمونہ سازی کی طرح ہے تسلسل سے تسلسل ماڈل میں، لیکن مسلسل ڈفیوژن فریم ورک کے لیے موافق۔ VITA Lab ٹیم اپنے مقالہ میں اس کنکشن کو قرار دیتے ہیں جبکہ نوٹ کرتے ہیں کہ ڈفیوژن ماڈل میں طے شدہ نمونہ سازی کی سادہ درخواست کام نہیں کرتی۔ ان کا شراکت وہ مخصوص فارمولہ ہے جو اسے ویڈیو جنریشن کے لیے مستحکم بناتا ہے۔
کھلے ذریعے کا فائدہ
شاید سب سے زیادہ دلکش پہلو: کوڈ GitHub پر مکمل طور پر کھلے ذرائع ہے (vita-epfl/Stable-Video-Infinity)۔ اس کا مطلب ہے کہ کوئی بھی تحقیقی لیب یا کمپنی اپنے موجودہ ویڈیو ماڈل میں غلطی کی تدوین کو لاگو کر سکتی ہے۔
کھلے ذریعے کی رہائی AI ویڈیو تحقیق کی برادری میں بڑھتے ہوئے رجحان کی پیروی کرتی ہے۔ LTX-2 اور Wan 2.6 جیسے ماڈل نے دکھایا ہے کہ کھلے ذریعے کی تراکیب ملکانہ متبادل کے ساتھ مقابلہ کر سکتے ہیں۔
صنعت کے لیے اس کا مطلب
ٹائمنگ قابل غور ہے۔ ہم AI ویڈیو کے ہتھیاروں کی دوڑ میں ہیں جہاں ہر بڑے کھلاڑی، Runway سے ByteDance تک، طویل، اعلیٰ معیار کی پیداوار کے لیے دھکا دے رہے ہیں۔ غلطی کی تدوین وہ گمشدہ حصہ ہو سکتا ہے جو صلاحیتوں کی اگلی نسل کو کھول سکتا ہے۔
فلم سازوں اور تخلیق کاروں کے لیے
محققین کے لیے
موسسوں کے لیے
آگے کے لیے دیکھو
VITA Lab کا کام AI ویڈیو جنریشن کے بارے میں سوچنے میں بنیادی تبدیلی کی نمائندگی کرتا ہے۔ بڑے ماڈل بنانے یا انفرنس ٹائم کے پیچیدہ میکانزم شامل کرنے کی بجائے، حل صرف ماڈل کو دکھانا تھا کہ اس کی پیداوار کیسی لگتی ہے۔
مقالہ ICLR 2026 میں پیش کیا جائے گا، اور متعدد صنعت کے ذرائع تجویز کرتے ہیں کہ بڑے ویڈیو ماڈل فراہم کنندگان پہلے سے انضمام کو دیکھ رہے ہیں۔ اگر دنیا کے ماڈل فزکس اور جگہ کو سمجھنے کے ماڈل کی آئندہ کی نمائندگی کرتے ہیں، تو غلطی کی تدوین وقت کے ساتھ اس سمجھ کو برقرار رکھنے کے ماڈل کی آئندہ کی نمائندگی کرتا ہے۔
4 سیکنڈ کی AI ویڈیو کا دور شاید کسی کی توقع سے جلدی ختم ہو سکتا ہے۔ اور اسے نیا ماڈل معمّاری یا ایک ارب ڈالر کے بجٹ کی ضرورت نہیں ہوگی۔ صرف ایک سمارٹ تربیت کی لوپ۔
مزید پڑھنا
- کھلے ذریعے کی AI ویڈیو انقلاب: کیسے کھلے ماڈل ملکانہ نظاموں کے ساتھ فاصلہ بند کر رہے ہیں
- AI ویڈیو میں فزکس کی نقل: یہ سمجھنا کہ ماڈل فزیکل مطابقت کو کیسے سیکھتے ہیں
- ڈفیوژن ٹرانسفار میرز: جدید ویڈیو جنریشن ماڈل کو چلانے والی معماری

Lausanne سے تعلق رکھنے والا AI انجینئر جو تحقیقی گہرائی کو عملی جدت کے ساتھ جوڑتا ہے۔ اپنا وقت ماڈل آرکیٹیکچرز اور الپائن چوٹیوں کے درمیان تقسیم کرتا ہے۔
View profile →متعلقہ مضامین
ان متعلقہ پوسٹس کے ساتھ مزید دریافت کریں

مفت لا محدود AI ویڈیو ٹولز: 2026 میں کیا کام کرتا ہے
مفت لا محدود AI ویڈیو ٹولز عموماً قطار پر مبنی یا مقامی ہوتے ہیں۔ جانیں کہ حقیقت میں کیا لا محدود ہے، کیا چیز سست کرتی ہے، اور 2026 کے لیے قابلِ عمل سیٹ اپ کیسے منتخب کریں۔

بہترین مفت ٹیکسٹ ٹو ویڈیو AI ٹولز: 2026 گائیڈ
2026 میں بہترین مفت ٹیکسٹ ٹو ویڈیو AI ٹولز کا موازنہ کریں، بشمول ان کی حقیقی کریڈٹ حدود، واٹر مارکس، مقامی سیٹ اپ کے سمجھوتے، اور عملی ٹیسٹ پلان۔

AI ویڈیو ٹولز کی قیمتیں 2026: کریڈٹس جلائے بغیر بجٹ کیسے بنائیں
AI ویڈیو ٹولز اب تلاش کرنا مشکل نہیں رہے۔ مشکل حصہ آپ کے workflow کے لیے درست pricing model کا انتخاب ہے۔ یہاں creators اور teams کے لیے ایک عملی budgeting guide ہے۔