EPFL Stable Video Infinity: কীভাবে Error Recycling AI ভিডিওর সবচেয়ে বড় সমস্যার সমাধান করে
EPFL-এর একটি নতুন ICLR 2026 Oral পেপার error recycling পরিচয় করিয়ে দিয়েছে, এটি এমন একটি কৌশল যা temporal drift দূর করে এবং অতিরিক্ত compute খরচ ছাড়াই বহু মিনিটের AI ভিডিও তৈরি সম্ভব করে।

যে Drift সমস্যার সমাধান কেউ করেনি
বর্তমান যেকোনো মডেল দিয়ে দীর্ঘ AI ভিডিও তৈরি করার চেষ্টা করে থাকলে, আপনি হতাশাটি জানেন। আপনার প্ল্যানের ওপর নির্ভর করে Sora 2 15 থেকে 25 সেকেন্ডে সীমাবদ্ধ। Runway Gen-4.5 সর্বোচ্চ 10। Kling 3.0 15 পর্যন্ত যায়। কারণটি compute বা memory নয়। এটি temporal drift।
Temporal drift ঘটে যখন autoregressive ভিডিও মডেলগুলো frame-এর পর frame ছোট ছোট ত্রুটি জমা করে। প্রতিটি তৈরি হওয়া frame পরেরটির input হয়ে যায়, এবং ক্ষুদ্র অসম্পূর্ণতাগুলো সূচকীয় হারে বেড়ে যায়। কয়েকশ frame পর output আর মূল prompt-এর সঙ্গে খুব কমই মেলে।
এটি মূলত "telephone game" সমস্যার মতো। যথেষ্ট মানুষের মাধ্যমে একটি বার্তা ফিসফিস করে পাঠালে তা অচেনা হয়ে যায়। আগের পদ্ধতিগুলো ছোট ক্লিপ তৈরি করে সেগুলো জোড়া লাগিয়ে drift প্রতিরোধের চেষ্টা করেছিল, কিন্তু সংযোগস্থলগুলো দেখা যায়। অন্যরা hierarchical generation ব্যবহার করেছে (আগে keyframe, পরে interpolation), যা সাহায্য করে, কিন্তু মূল সমস্যাটি দূর করে না।
Error Recycling-এর আগমন
"Stable Video Infinity" শিরোনামের এবং ICLR 2026 Oral presentation হিসেবে গৃহীত পেপারটি একটি আপাতদৃষ্টিতে সহজ ধারণা উপস্থাপন করে: মডেলকে নিজের ভুল সামলাতে শেখান।
এখানে মূল অন্তর্দৃষ্টি হলো। প্রশিক্ষণের সময়, সাধারণ ভিডিও diffusion মডেলগুলো পরিষ্কার ground-truth data থেকে শেখে। তারা কখনো নিজেদের তৈরি output দেখে না। মোতায়েনের সময় হঠাৎই তাদের নিজেদের অসম্পূর্ণ prediction-কে input হিসেবে ব্যবহার করতে হয়, এবং তারা noise সামলাতে জানে না।
প্রশিক্ষণ লুপ পরিবর্তন করে Error recycling এটি সমাধান করে:
সাধারণ Forward Pass
মডেলটি পরিষ্কার training data থেকে একটি ভিডিও segment তৈরি করে।
ত্রুটি সংগ্রহ
মডেলের নিজস্ব prediction (এর অসম্পূর্ণতাসহ) বাতিল করার বদলে সংগ্রহ করা হয়।
ত্রুটি পুনর্ব্যবহার
এই অসম্পূর্ণ output-গুলো পরের training iteration-এর input হিসেবে ফিরিয়ে দেওয়া হয়, যা মডেলকে noisy, নিজে-তৈরি frame থেকেও স্থিতিশীল output তৈরি করতে শেখায়।
পুনরাবৃত্ত পরিমার্জন
অনেক training cycle জুড়ে, মডেল একটি শক্তিশালী self-correction mechanism শেখে যা ত্রুটি জমা হওয়া রোধ করে।
এই পদ্ধতির সৌন্দর্য এর সরলতায়। কোনো নতুন model architecture নেই, কোনো অতিরিক্ত parameter নেই, inference-time কৌশলও নেই। বাস্তব deployment condition কেমন, মডেলটি শুধু প্রশিক্ষণের সময় সেটিই শেখে।
এটি আপনার ভাবনার চেয়েও বেশি গুরুত্বপূর্ণ কেন
এর প্রভাব শুধু দীর্ঘ cat video তৈরির অনেক বাইরে। কী বদলায়, তা এখানে দেওয়া হলো:
Error Recycling-এর আগে
- ভিডিও মডেল 4-20 সেকেন্ডে সীমিত
- দৃশ্যের সামঞ্জস্য দ্রুত নষ্ট হয়
- কয়েক সেকেন্ড পর চরিত্রের পরিচয় বদলে যায়
- পদার্থবিজ্ঞান ক্রমেই অবাস্তব হয়ে ওঠে
- রং ও আলো অনির্দেশ্যভাবে বদলে যায়
Error Recycling-এর পরে
- বহু মিনিটের সুসংগত ভিডিও জেনারেশন
- পুরো ভিডিওজুড়ে স্থিতিশীল চরিত্রের উপস্থিতি
- সামঞ্জস্যপূর্ণ পদার্থবিজ্ঞান ও স্থানিক সম্পর্ক
- নির্ভরযোগ্য color grading ও আলো
- সময়ের সঙ্গে দৃশ্যমান কোনো মানহানি নেই
সংখ্যাগুলো
VITA Lab দলটি একাধিক architecture ও benchmark জুড়ে Stable Video Infinity পরীক্ষা করেছে। ফলাফলগুলো উল্লেখযোগ্য:
| মেট্রিক | Error Recycling ছাড়া | Error Recycling সহ | উন্নতি |
|---|---|---|---|
| FVD (কম হলে ভালো) | 4s-এর পর অবনতি | 2min+ পর্যন্ত স্থিতিশীল | উল্লেখযোগ্য |
| চরিত্রের সামঞ্জস্য | 15s-এ 60%-এর নিচে নেমে যায় | 2min-এ 90%+ বজায় রাখে | ~50% আপেক্ষিক |
| Temporal Coherence | 8s-এ দৃশ্যমান drift | 2min-এ কোনো দৃশ্যমান drift নেই | গুণগত লাফ |
| Compute Overhead | ভিত্তিমূল | ভিত্তিমূল (0% বৃদ্ধি) | শূন্য খরচ |
শূন্য-compute-overhead দিকটি অত্যন্ত গুরুত্বপূর্ণ। Error recycling একটি training-time কৌশল, inference-time কৌশল নয়। একবার প্রশিক্ষিত হলে, মডেলটি আগের মতোই একই গতি ও খরচে চলে।
আড়ালে Error Recycling কীভাবে কাজ করে
যাঁরা প্রযুক্তিগত বিশদ জানতে চান, পরিবর্তিত training pipeline-এ কী ঘটে তা এখানে দেওয়া হলো।
সাধারণ ভিডিও diffusion training পরিষ্কার ground-truth frame x_0-এ প্রয়োগ করা একটি noise schedule epsilon ব্যবহার করে। মডেলটি noise predict করতে এবং মূল signal পুনরুদ্ধার করতে শেখে। inference time-এ, মডেলটি frame t-এর নিজস্ব prediction-এর শর্তে autoregressively frame t+1 তৈরি করে।
training (পরিষ্কার input) এবং inference (নিজে-তৈরি input)-এর ব্যবধানকে exposure bias বলা হয়। Error recycling সরাসরি এর সমাধান করে।
প্রযুক্তিগত বিশদ: পরিবর্তিত Training Objective▼
Training-এর সময়, মডেলটি পর্যায়ক্রমে ground-truth data ব্যবহারের বদলে নিজের বর্তমান weight ব্যবহার করে frame তৈরি করে। এই নিজে-তৈরি frame-গুলো, তাদের অসম্পূর্ণতাসহ, training sequence-এর পরবর্তী frame-গুলোর conditioning input হিসেবে ব্যবহৃত হয়।
মূল hyperparameter হলো recycling ratio r, যা নিয়ন্ত্রণ করে training-এর সময় কত ঘন ঘন নিজে-তৈরি frame ground-truth frame প্রতিস্থাপন করবে। পেপারটি দেখেছে যে r = 0.3 (30% recycled frame) সর্বোত্তম performance অর্জন করে, stability improvement এবং training signal quality-এর মধ্যে ভারসাম্য রেখে।
পরিবর্তিত loss function সাধারণ diffusion objective-ই থাকে। একমাত্র পার্থক্য হলো training-এর সময় মডেল যে data distribution দেখে। এ কারণেই inference time-এ কোনো computational overhead নেই।
ধারণাগতভাবে এটি sequence-to-sequence মডেলের scheduled sampling-এর অনুরূপ, তবে continuous diffusion framework-এর জন্য অভিযোজিত। VITA Lab দলটি তাদের পেপারে এই সংযোগের কৃতিত্ব দিয়েছে, একই সঙ্গে উল্লেখ করেছে যে diffusion model-এ scheduled sampling-এর সরল প্রয়োগ কাজ করে না। তাদের অবদান হলো সেই নির্দিষ্ট formulation যা ভিডিও জেনারেশনের জন্য এটিকে স্থিতিশীল করে।
Open-Source সুবিধা
সম্ভবত সবচেয়ে উত্তেজনাপূর্ণ দিকটি হলো: কোডটি GitHub-এ সম্পূর্ণ open-source (vita-epfl/Stable-Video-Infinity)। অর্থাৎ যেকোনো research lab বা company তাদের বিদ্যমান ভিডিও মডেলে error recycling প্রয়োগ করতে পারে।
Open-source release AI ভিডিও গবেষণা কমিউনিটিতে ক্রমবর্ধমান একটি প্রবণতা অনুসরণ করে। LTX-2 এবং Wan 2.6-এর মতো মডেল দেখিয়েছে যে open-source পদ্ধতি proprietary বিকল্পগুলোর সঙ্গে প্রতিযোগিতা করতে পারে।
শিল্পখাতের জন্য এর অর্থ কী
সময়সূচিটি উল্লেখযোগ্য। আমরা AI ভিডিওর প্রতিযোগিতার মাঝখানে আছি, যেখানে Runway থেকে ByteDance পর্যন্ত প্রতিটি বড় প্রতিষ্ঠান দীর্ঘতর ও উচ্চমানের output-এর দিকে এগোচ্ছে। Error recycling হয়তো সেই অনুপস্থিত অংশ, যা পরবর্তী প্রজন্মের সক্ষমতা উন্মুক্ত করবে।
চলচ্চিত্র নির্মাতা ও স্রষ্টাদের জন্য
গবেষকদের জন্য
Enterprise-এর জন্য
সামনে কী আছে
VITA Lab-এর কাজ AI ভিডিও জেনারেশন নিয়ে আমাদের চিন্তাভাবনায় একটি মৌলিক পরিবর্তন আনে। আরও বড় মডেল তৈরি করা বা জটিল inference-time mechanism যোগ করার বদলে, সমাধানটি ছিল মডেলকে শুধু দেখানো যে এর নিজের output কেমন।
পেপারটি ICLR 2026-এ উপস্থাপিত হবে, এবং কয়েকটি শিল্পখাতের সূত্র বলছে যে বড় ভিডিও মডেল provider-রা ইতিমধ্যেই integration অন্বেষণ করছে। যদি world models AI কীভাবে পদার্থবিজ্ঞান ও স্থান বোঝে তার ভবিষ্যৎকে উপস্থাপন করে, তবে error recycling সময়ের সঙ্গে AI কীভাবে সেই বোঝাপড়া বজায় রাখে তার ভবিষ্যৎকে উপস্থাপন করে।
4-সেকেন্ডের AI ভিডিওর যুগ হয়তো প্রত্যাশার চেয়েও দ্রুত শেষ হতে চলেছে। এবং এর জন্য নতুন model architecture বা billion-dollar compute budget লাগবে না। শুধু আরও স্মার্ট একটি training loop।
আরও পড়ুন
- Open-Source AI Video Revolution: কীভাবে open model proprietary system-এর সঙ্গে ব্যবধান কমাচ্ছে
- AI Video-তে Physics Simulation: মডেল কীভাবে physical consistency শেখে তা বোঝা
- Diffusion Transformers: আধুনিক ভিডিও জেনারেশনকে শক্তি দেওয়া architecture
উৎস
- International Conference on Learning Representations: Oral (ICLR 2026 Status) (International Conference on Learning Representations)
- EPFL VITA researchers via arXiv: Stable Video Infinity supports infinite-length video generation with no additional inference… (EPFL VITA researchers via arXiv)

লসানের একজন AI ইঞ্জিনিয়ার, যিনি গবেষণার গভীরতার সঙ্গে ব্যবহারিক উদ্ভাবন মিলিয়ে কাজ করেন। মডেল আর্কিটেকচার এবং আল্পসের শৃঙ্গের মধ্যে সময় ভাগ করেন।
View profile →সম্পর্কিত নিবন্ধ
এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

Grok xAI ইমেজ-টু-ভিডিও সক্ষমতা: জুন 2026 API গাইড
জুন 2026-এ Grok xAI ইমেজ-টু-ভিডিও সক্ষমতা: Grok Imagine কীভাবে ছবি, prompt, native audio, API workflow, safety, pricing logic, এবং Sora/Veo তুলনা সামলায়।

AI Video Tools Pricing 2026: ক্রেডিট না পুড়িয়ে বাজেট করার উপায়
AI ভিডিও টুল এখন আর খুঁজে পাওয়া কঠিন নয়। কঠিন অংশ হলো আপনার ওয়ার্কফ্লোর জন্য সঠিক প্রাইসিং মডেল বেছে নেওয়া। ক্রিয়েটর ও টিমের জন্য এখানে একটি ব্যবহারিক বাজেটিং গাইড দেওয়া হলো।

AI পণ্য ভিডিও জেনারেটর: 2026 সালে ই-কমার্স এবং মার্কেটিং এর জন্য সম্পূর্ণ গাইড
AI পণ্য ভিডিও জেনারেটরগুলি ব্র্যান্ডগুলি কীভাবে কন্টেন্ট তৈরি করে তা পুনর্গঠন করছে। URL-থেকে-ভিডিও পাইপলাইন থেকে 27% বেশি অ্যাড-টু-কার্ট রেট পর্যন্ত, এখানে 2026 সালে প্রতিটি মার্কেটারকে যা জানা দরকার তা রয়েছে।