Meta Pixelاصل مواد پر جائیں
AlexisAlexis· AI مصنف، انسانی جائزے کے ساتھ
9 min read
1761 الفاظ

EPFL Stable Video Infinity: غلطی کی تدوین کی نقل کس طرح AI ویڈیو کے بڑے ترین مسئلہ کو حل کرتی ہے

EPFL سے ایک نیا ICLR 2026 زبانی مقالہ غلطی کی تدوین کی تکنیک پیش کرتا ہے جو عارضی رفتار کو ختم کرتا ہے اور بغیر کسی اضافی کمپیوٹنگ لاگت کے کثیر منٹ کی AI ویڈیو کی تیاری کو ممکن بناتا ہے۔

EPFL Stable Video Infinity: غلطی کی تدوین کی نقل کس طرح AI ویڈیو کے بڑے ترین مسئلہ کو حل کرتی ہے

اپنی AI ویڈیوز بنانے کے لیے تیار ہیں؟

Bonega.ai استعمال کرنے والے ہزاروں تخلیق کاروں میں شامل ہوں

ہر AI ویڈیو ماڈل کا ایک جیسا تاریک راز ہے۔ 4 سیکنڈ کا کلپ تیار کریں اور نتائج شاندار نظر آتے ہیں۔ 15 سیکنڈ سے آگے بڑھیں اور کرداراں تبدیل ہونا شروع ہو جاتے ہیں، فزکس ٹوٹ جاتا ہے، رنگ بدل جاتے ہیں، اور پورا صحنہ بے ترتیبی میں دھسک جاتا ہے۔ EPFL کے VITA ل ابنے ابھی ایک حل شائع کیا ہے، اور یہ اس سال ویڈیو جنریشن میں سب سے اہم مقالہ ہو سکتا ہے۔

ڈریفٹ کا مسئلہ جسے کوئی حل نہ کر سکا

اگر آپ نے کسی موجودہ ماڈل سے طویل مدت کی AI ویڈیو تیار کرنے کی کوشش کی ہے، تو آپ کو مایوسی معلوم ہے۔ Sora 2 آپ کے منصوبے کی بنیاد پر 15 سے 25 سیکنڈ تک محدود ہے۔ Runway Gen-4.5 زیادہ سے زیادہ 10 سیکنڈ ہے۔ Kling 3.0 15 سیکنڈ تک جاتا ہے۔ اس کی وجہ کمپیوٹنگ یا میموری نہیں ہے۔ یہ عارضی ڈریفٹ ہے۔

💡

عارضی ڈریفٹ اس وقت واقع ہوتی ہے جب آٹورجریسیو ویڈیو ماڈل فریم سے فریم تک چھوٹی خرابیوں کو جمع کرتے ہیں۔ ہر تیار کردہ فریم اگلے کے لیے ان پٹ بن جاتا ہے، اور چھوٹی خامیاں بطور نمائندگی کے جمع ہوتی ہیں۔ سینکڑوں فریم کے بعد، آؤٹ پٹ اصل ہدایات سے شاید مختلف ہے۔

یہ بنیادی طور پر "ٹیلیفون گیم" کے مسئلہ کی طرح ہے۔ کافی لوگوں کے ذریعے ایک پیغام کتتا پھیلائیں اور یہ ناقابل شناخت ہو جاتا ہے۔ پچھلے طریقوں نے مختصر کلپ تیار کر کے انہیں ایک ساتھ سلائی کر کے ڈریفٹ سے لڑنے کی کوشش کی، لیکن سیم نظر آتے ہیں۔ دوسروں نے ہائریکل جنریشن استعمال کی (پہلے کے ڈھانچے، دوسرے میں انٹرپولیشن)، جو مدد دیتا ہے لیکن بنیادی مسئلہ کو ختم نہیں کرتا۔

غلطی کی تدوین میں داخل ہوں

یہ مقالہ، "Stable Video Infinity" کے نام سے، اور ICLR 2026 زبانی پریزنٹیشن کے طور پر قبول، ایک دھوکہ سادہ خیال پیش کرتا ہے: ماڈل کو اپنی غلطیوں کے ساتھ نمٹنے کی تیاری دیں۔

زبانی
ICLR 2026 حالت
0
اضافی کمپیوٹنگ لاگت
منٹ
ویڈیو کی لمبائی

یہاں کلیدی بصیرت ہے۔ تربیت کے دوران، معیاری ویڈیو ڈفیوژن ماڈل صاف زمینی سچائی کے ڈیٹا سے سیکھتے ہیں۔ وہ کبھی اپنی تیار شدہ پیداوار نہیں دیکھتے۔ تعینات کے وقت، انہیں اچانک اپنی ناقص پیشن گوئیوں کے ساتھ کام کرنا پڑتا ہے، اور وہ شور سے نمٹنا نہیں جانتے۔

غلطی کی تدوین تربیت کے لوپ میں ترمیم کر کے اس کو درست کرتی ہے:

مرحلہ 1

معیاری فارورڈ پاس

ماڈل صاف تربیت ڈیٹا سے ایک ویڈیو حصہ تیار کرتا ہے۔

مرحلہ 2

خرابی کا مجموعہ

ماڈل کی اپنی پیشن گوئیاں (ان کی خامیوں کے ساتھ) اتار کے بجائے حاصل کی جاتی ہیں۔

مرحلہ 3

غلطی کی تدوین

یہ ناقص اخراجات اگلی تربیت کے تکرار کے لیے ان پٹ کے طور پر واپس ڈالی جاتی ہیں، ماڈل کو خود سے تیار، شور والے فریم سے بھی مستحکم پیداوار تیار کرنے کی تیاری دیتی ہے۔

مرحلہ 4

تکراری بہتری

متعدد تربیت کے چکروں میں، ماڈل ایک مضبوط خود اصلاح میکانزم سیکھتا ہے جو غلطی کے جمع کو روکتا ہے۔

اس نقطہ نظر کی خوبصورتی اس کی سادگی میں ہے۔ کوئی نیا ماڈل معماری نہیں، کوئی اضافی پیرامیٹرز نہیں، کوئی انفرنس ٹائم کی چالیں نہیں۔ ماڈل صرف تربیت کے دوران سیکھتا ہے کہ حقیقی تعیناتی کی شرائط کیسی ہیں۔

یہ کیوں سوچتے ہو سے زیادہ اہم ہے

مضمرات لمبی بلی ویڈیو سے آگے جاتے ہیں۔ یہاں کیا بدلا:

غلطی کی تدوین سے پہلے

  • ویڈیو ماڈل 4-20 سیکنڈ تک محدود
  • منظرنامہ کی مطابقت تیزی سے کمزور ہوتی ہے
  • کردار کی شناخت کچھ سیکنڈ کے بعد بہتر ہوتی ہے
  • فزکس بتدریج غیر حقیقی ہو جاتا ہے
  • رنگ اور روشنی غیر متوقع طریقے سے بدل جاتے ہیں

غلطی کی تدوین کے بعد

  • کثیر منٹ کی ہم آہنگ ویڈیو کی تیاری
  • پوری ویڈیو میں مستحکم کردار کی ظاہری شکل
  • مسلسل فزکس اور مکانی تعلقات
  • قابل اعتماد رنگ گریڈنگ اور روشنی
  • وقت کے ساتھ کوئی نظر آنے والی معیار کی خرابی نہیں

اعدادوشمار

VITA Lab ٹیم نے متعدد فن تعمیر اور بینچ مارکس میں Stable Video Infinity کو ٹیسٹ کیا۔ نتائج حیران کن ہیں:

میٹرکغلطی کی تدوین کے بغیرغلطی کی تدوین کے ساتھبہتری
FVD (کم بہتر ہے)4s کے بعد خراب ہوتا ہے2 منٹ + تک مستحکمنمایاں
کردار کی مطابقت15s پر 60% سے نیچے گرتی ہے2 منٹ پر 90%+ برقرارتقریباً 50% رشتہ دار
عارضی ربط8s پر نظر آنے والی ڈریفٹ2 منٹ پر کوئی نظر آنے والی ڈریفٹ نہیںمعیار کا چھلانگ
کمپیوٹنگ کا بوجھبنیاد لائنبنیاد لائن (0% اضافہ)صفر لاگت
💡

صفر کمپیوٹنگ لاگت کا پہلو اہم ہے۔ غلطی کی تدوین ایک تربیت کے وقت کی تکنیک ہے، انفرنس ٹائم کی نہیں۔ ایک بار تربیت یافتہ ہونے کے بعد، ماڈل بالکل اسی رفتار اور لاگت میں چلتا ہے جیسے پہلے تھا۔

غلطی کی تدوین ہود کے نیچے کیسے کام کرتی ہے

ان لوگوں کے لیے جو تکنیکی تفصیلات چاہتے ہیں، یہاں ترمیم شدہ تربیت پائپ لائن میں کیا ہوتا ہے۔

معیاری ویڈیو ڈفیوژن تربیت صاف زمینی سچائی فریم x_0 کے لیے لاگو شدہ شور کے شیڈول epsilon استعمال کرتی ہے۔ ماڈل شور کی پیشن گوئی کرنا اور اصل سگنل کو بحال کرنا سیکھتا ہے۔ انفرنس ٹائم پر، ماڈل خود سے فریم t+1 کو فریم t کی اپنی پیشن گوئی پر مشروط کرتا ہے۔

تربیت (صاف ان پٹ) اور انفرنس (خود سے تیار کردہ ان پٹ) کے درمیان فاصلہ انتشار میں جانبداری کہلاتا ہے۔ غلطی کی تدوین براہ راست اس کو سنبھالتی ہے۔

تکنیکی تفصیلات: ترمیم شدہ تربیت کا مقصد

تربیت کے دوران، ماڈل بعض اوقات اپنے موجودہ وزن کا استعمال کرتے ہوئے فریم تیار کرتا ہے بجائے زمینی سچائی کے ڈیٹا استعمال کے۔ یہ خود سے تیار کردہ فریمیں، اپنی خامیوں کے ساتھ مکمل، بعد میں تربیت کی ترتیب میں آنے والے فریم کے لیے شرائط ان پٹ کے طور پر استعمال کی جاتی ہیں۔

کلیدی ہائپر پیرامیٹر تدوین کا تناسب r ہے، جو کنٹرول کرتا ہے کہ خود سے تیار کردہ فریم تربیت کے دوران زمینی سچائی کی جگہ کتنی بار لیتے ہیں۔ مقالہ دیکھتا ہے کہ r = 0.3 (30% تدوین شدہ فریم) بہترین کارکردگی حاصل کرتا ہے، استحکام میں بہتری اور تربیت کے سگنل کی معیار میں توازن رکھتا ہے۔

ترمیم شدہ نقصان کی تقریب معیاری ڈفیوژن مقصد رہتی ہے۔ واحد فرق وہ ڈیٹا کی تقسیم ہے جو ماڈل تربیت میں دیکھتا ہے۔ یہی وجہ ہے کہ انفرنس ٹائم میں کمپیوٹنگ کا کوئی عام بوجھ نہیں۔

یہ تصوری طور پر طے شدہ نمونہ سازی کی طرح ہے تسلسل سے تسلسل ماڈل میں، لیکن مسلسل ڈفیوژن فریم ورک کے لیے موافق۔ VITA Lab ٹیم اپنے مقالہ میں اس کنکشن کو قرار دیتے ہیں جبکہ نوٹ کرتے ہیں کہ ڈفیوژن ماڈل میں طے شدہ نمونہ سازی کی سادہ درخواست کام نہیں کرتی۔ ان کا شراکت وہ مخصوص فارمولہ ہے جو اسے ویڈیو جنریشن کے لیے مستحکم بناتا ہے۔

کھلے ذریعے کا فائدہ

شاید سب سے زیادہ دلکش پہلو: کوڈ GitHub پر مکمل طور پر کھلے ذرائع ہے (vita-epfl/Stable-Video-Infinity)۔ اس کا مطلب ہے کہ کوئی بھی تحقیقی لیب یا کمپنی اپنے موجودہ ویڈیو ماڈل میں غلطی کی تدوین کو لاگو کر سکتی ہے۔

کھلے ذرائع کیوں اہم ہے
کوئی بھی موجودہ ویڈیو ڈفیوژن ماڈل غلطی کی تدوین کے ساتھ تبدیل کیا جا سکتا ہے۔ کوئی معماری کی تبدیلی کی ضرورت نہیں، صرف ایک ترمیم شدہ تربیت کی لوپ۔ یہ Sora، Runway، Kling، اور ایک ہی وقت میں ہر کھلے ذریعے کے ماڈل کو بہتر بنا سکتا ہے۔
عملی محدودیت
ماڈل کو دوبارہ تربیت یا اچھی ترتیب دینے کی ضرورت ہے۔ ملکانہ ماڈل والی کمپنیاں دوبارہ تربیت میں کمپیوٹنگ وسائل میں سرمایہ کاری کرنے کی ضرورت ہے۔ مختلف معماریوں اور پیمانوں میں تکنیک کی تاثیر مختلف ہو سکتی ہے۔

کھلے ذریعے کی رہائی AI ویڈیو تحقیق کی برادری میں بڑھتے ہوئے رجحان کی پیروی کرتی ہے۔ LTX-2 اور Wan 2.6 جیسے ماڈل نے دکھایا ہے کہ کھلے ذریعے کی تراکیب ملکانہ متبادل کے ساتھ مقابلہ کر سکتے ہیں۔

صنعت کے لیے اس کا مطلب

ٹائمنگ قابل غور ہے۔ ہم AI ویڈیو کے ہتھیاروں کی دوڑ میں ہیں جہاں ہر بڑے کھلاڑی، Runway سے ByteDance تک، طویل، اعلیٰ معیار کی پیداوار کے لیے دھکا دے رہے ہیں۔ غلطی کی تدوین وہ گمشدہ حصہ ہو سکتا ہے جو صلاحیتوں کی اگلی نسل کو کھول سکتا ہے۔

🎬

فلم سازوں اور تخلیق کاروں کے لیے

طویل مدت کی ہم آہنگ ویڈیو کی تیاری اصل کہانی کے مواد کو فعال بناتی ہے۔ صرف کلپس نہیں، بلکہ منظرنامے، ترتیب، اور بالآخر مختصر فلمیں ایک واحد ہدایت سے تیار کی جاتی ہیں۔
🔬

محققین کے لیے

غلطی کی تدوین ایک قابل فیض فریم ورک فراہم کرتی ہے۔ یہ اصول آڈیو جنریشن، 3D منظرنامہ کی تخلیق، اور کسی بھی خود رگرسیو ماڈل پر لاگو ہو سکتا ہے جو ڈریفٹ سے دوچار ہو۔
🏢

موسسوں کے لیے

مستحکم طویل مدت کی تیاری AI ویڈیو کو پیشہ ورانہ استعمال کے لیے قابل عمل بناتی ہے۔ مصنوعات کے مظاہرے، تربیتی ویڈیوں، مارکیٹنگ کے مہم جو مندرجات میں مسلسل معیار کی ضرورت ہے۔

آگے کے لیے دیکھو

VITA Lab کا کام AI ویڈیو جنریشن کے بارے میں سوچنے میں بنیادی تبدیلی کی نمائندگی کرتا ہے۔ بڑے ماڈل بنانے یا انفرنس ٹائم کے پیچیدہ میکانزم شامل کرنے کی بجائے، حل صرف ماڈل کو دکھانا تھا کہ اس کی پیداوار کیسی لگتی ہے۔

مقالہ ICLR 2026 میں پیش کیا جائے گا، اور متعدد صنعت کے ذرائع تجویز کرتے ہیں کہ بڑے ویڈیو ماڈل فراہم کنندگان پہلے سے انضمام کو دیکھ رہے ہیں۔ اگر دنیا کے ماڈل فزکس اور جگہ کو سمجھنے کے ماڈل کی آئندہ کی نمائندگی کرتے ہیں، تو غلطی کی تدوین وقت کے ساتھ اس سمجھ کو برقرار رکھنے کے ماڈل کی آئندہ کی نمائندگی کرتا ہے۔

4 سیکنڈ کی AI ویڈیو کا دور شاید کسی کی توقع سے جلدی ختم ہو سکتا ہے۔ اور اسے نیا ماڈل معمّاری یا ایک ارب ڈالر کے بجٹ کی ضرورت نہیں ہوگی۔ صرف ایک سمارٹ تربیت کی لوپ۔

مزید پڑھنا

Alexis
AlexisAI EngineerAI Author

Lausanne سے تعلق رکھنے والا AI انجینئر جو تحقیقی گہرائی کو عملی جدت کے ساتھ جوڑتا ہے۔ اپنا وقت ماڈل آرکیٹیکچرز اور الپائن چوٹیوں کے درمیان تقسیم کرتا ہے۔

View profile →

جو پڑھا، پسند آیا؟

اپنے خیالات کو منٹوں میں لامحدود دورانیے کی AI ویڈیوز میں بدلیں۔

متعلقہ مضامین

ان متعلقہ پوسٹس کے ساتھ مزید دریافت کریں

کیا آپ کو یہ مضمون پسند آیا؟

مزید بصیرتیں دریافت کریں اور ہمارے تازہ ترین مواد سے باخبر رہیں۔