Meta Pixelমূল বিষয়বস্তুতে যান
AlexisAlexis· AI লেখক, মানুষের পর্যালোচিত
7 min read
1304 শব্দ

EPFL Stable Video Infinity: কীভাবে Error Recycling AI ভিডিওর সবচেয়ে বড় সমস্যার সমাধান করে

EPFL-এর একটি নতুন ICLR 2026 Oral পেপার error recycling পরিচয় করিয়ে দিয়েছে, এটি এমন একটি কৌশল যা temporal drift দূর করে এবং অতিরিক্ত compute খরচ ছাড়াই বহু মিনিটের AI ভিডিও তৈরি সম্ভব করে।

EPFL Stable Video Infinity: কীভাবে Error Recycling AI ভিডিওর সবচেয়ে বড় সমস্যার সমাধান করে

নিজের AI ভিডিও তৈরি করতে প্রস্তুত?

Bonega.ai ব্যবহারকারী হাজারো নির্মাতার সঙ্গে যোগ দিন

প্রতিটি AI ভিডিও মডেলের একই নোংরা গোপন বিষয় আছে। 4-সেকেন্ডের একটি ক্লিপ তৈরি করুন, ফলাফল অসাধারণ দেখায়। 15 সেকেন্ড পেরোলেই চরিত্রগুলোর রূপ বদলাতে শুরু করে, পদার্থবিজ্ঞান ভেঙে পড়ে, রং সরে যায়, এবং পুরো দৃশ্যটি অসংলগ্নতায় ভেসে যায়। EPFL-এর VITA Lab সদ্য একটি সমাধান প্রকাশ করেছে, এবং এটি হয়তো এ বছরের ভিডিও জেনারেশনের সবচেয়ে গুরুত্বপূর্ণ পেপার।

যে Drift সমস্যার সমাধান কেউ করেনি

বর্তমান যেকোনো মডেল দিয়ে দীর্ঘ AI ভিডিও তৈরি করার চেষ্টা করে থাকলে, আপনি হতাশাটি জানেন। আপনার প্ল্যানের ওপর নির্ভর করে Sora 2 15 থেকে 25 সেকেন্ডে সীমাবদ্ধ। Runway Gen-4.5 সর্বোচ্চ 10। Kling 3.0 15 পর্যন্ত যায়। কারণটি compute বা memory নয়। এটি temporal drift

💡

Temporal drift ঘটে যখন autoregressive ভিডিও মডেলগুলো frame-এর পর frame ছোট ছোট ত্রুটি জমা করে। প্রতিটি তৈরি হওয়া frame পরেরটির input হয়ে যায়, এবং ক্ষুদ্র অসম্পূর্ণতাগুলো সূচকীয় হারে বেড়ে যায়। কয়েকশ frame পর output আর মূল prompt-এর সঙ্গে খুব কমই মেলে।

এটি মূলত "telephone game" সমস্যার মতো। যথেষ্ট মানুষের মাধ্যমে একটি বার্তা ফিসফিস করে পাঠালে তা অচেনা হয়ে যায়। আগের পদ্ধতিগুলো ছোট ক্লিপ তৈরি করে সেগুলো জোড়া লাগিয়ে drift প্রতিরোধের চেষ্টা করেছিল, কিন্তু সংযোগস্থলগুলো দেখা যায়। অন্যরা hierarchical generation ব্যবহার করেছে (আগে keyframe, পরে interpolation), যা সাহায্য করে, কিন্তু মূল সমস্যাটি দূর করে না।

Error Recycling-এর আগমন

"Stable Video Infinity" শিরোনামের এবং ICLR 2026 Oral presentation হিসেবে গৃহীত পেপারটি একটি আপাতদৃষ্টিতে সহজ ধারণা উপস্থাপন করে: মডেলকে নিজের ভুল সামলাতে শেখান

Oral
ICLR 2026 অবস্থা
0
অতিরিক্ত Compute খরচ
Minutes
ভিডিওর দৈর্ঘ্য

এখানে মূল অন্তর্দৃষ্টি হলো। প্রশিক্ষণের সময়, সাধারণ ভিডিও diffusion মডেলগুলো পরিষ্কার ground-truth data থেকে শেখে। তারা কখনো নিজেদের তৈরি output দেখে না। মোতায়েনের সময় হঠাৎই তাদের নিজেদের অসম্পূর্ণ prediction-কে input হিসেবে ব্যবহার করতে হয়, এবং তারা noise সামলাতে জানে না।

প্রশিক্ষণ লুপ পরিবর্তন করে Error recycling এটি সমাধান করে:

ধাপ 1

সাধারণ Forward Pass

মডেলটি পরিষ্কার training data থেকে একটি ভিডিও segment তৈরি করে।

ধাপ 2

ত্রুটি সংগ্রহ

মডেলের নিজস্ব prediction (এর অসম্পূর্ণতাসহ) বাতিল করার বদলে সংগ্রহ করা হয়।

ধাপ 3

ত্রুটি পুনর্ব্যবহার

এই অসম্পূর্ণ output-গুলো পরের training iteration-এর input হিসেবে ফিরিয়ে দেওয়া হয়, যা মডেলকে noisy, নিজে-তৈরি frame থেকেও স্থিতিশীল output তৈরি করতে শেখায়।

ধাপ 4

পুনরাবৃত্ত পরিমার্জন

অনেক training cycle জুড়ে, মডেল একটি শক্তিশালী self-correction mechanism শেখে যা ত্রুটি জমা হওয়া রোধ করে।

এই পদ্ধতির সৌন্দর্য এর সরলতায়। কোনো নতুন model architecture নেই, কোনো অতিরিক্ত parameter নেই, inference-time কৌশলও নেই। বাস্তব deployment condition কেমন, মডেলটি শুধু প্রশিক্ষণের সময় সেটিই শেখে।

এটি আপনার ভাবনার চেয়েও বেশি গুরুত্বপূর্ণ কেন

এর প্রভাব শুধু দীর্ঘ cat video তৈরির অনেক বাইরে। কী বদলায়, তা এখানে দেওয়া হলো:

Error Recycling-এর আগে

  • ভিডিও মডেল 4-20 সেকেন্ডে সীমিত
  • দৃশ্যের সামঞ্জস্য দ্রুত নষ্ট হয়
  • কয়েক সেকেন্ড পর চরিত্রের পরিচয় বদলে যায়
  • পদার্থবিজ্ঞান ক্রমেই অবাস্তব হয়ে ওঠে
  • রং ও আলো অনির্দেশ্যভাবে বদলে যায়

Error Recycling-এর পরে

  • বহু মিনিটের সুসংগত ভিডিও জেনারেশন
  • পুরো ভিডিওজুড়ে স্থিতিশীল চরিত্রের উপস্থিতি
  • সামঞ্জস্যপূর্ণ পদার্থবিজ্ঞান ও স্থানিক সম্পর্ক
  • নির্ভরযোগ্য color grading ও আলো
  • সময়ের সঙ্গে দৃশ্যমান কোনো মানহানি নেই

সংখ্যাগুলো

VITA Lab দলটি একাধিক architecture ও benchmark জুড়ে Stable Video Infinity পরীক্ষা করেছে। ফলাফলগুলো উল্লেখযোগ্য:

মেট্রিকError Recycling ছাড়াError Recycling সহউন্নতি
FVD (কম হলে ভালো)4s-এর পর অবনতি2min+ পর্যন্ত স্থিতিশীলউল্লেখযোগ্য
চরিত্রের সামঞ্জস্য15s-এ 60%-এর নিচে নেমে যায়2min-এ 90%+ বজায় রাখে~50% আপেক্ষিক
Temporal Coherence8s-এ দৃশ্যমান drift2min-এ কোনো দৃশ্যমান drift নেইগুণগত লাফ
Compute Overheadভিত্তিমূলভিত্তিমূল (0% বৃদ্ধি)শূন্য খরচ
💡

শূন্য-compute-overhead দিকটি অত্যন্ত গুরুত্বপূর্ণ। Error recycling একটি training-time কৌশল, inference-time কৌশল নয়। একবার প্রশিক্ষিত হলে, মডেলটি আগের মতোই একই গতি ও খরচে চলে।

আড়ালে Error Recycling কীভাবে কাজ করে

যাঁরা প্রযুক্তিগত বিশদ জানতে চান, পরিবর্তিত training pipeline-এ কী ঘটে তা এখানে দেওয়া হলো।

সাধারণ ভিডিও diffusion training পরিষ্কার ground-truth frame x_0-এ প্রয়োগ করা একটি noise schedule epsilon ব্যবহার করে। মডেলটি noise predict করতে এবং মূল signal পুনরুদ্ধার করতে শেখে। inference time-এ, মডেলটি frame t-এর নিজস্ব prediction-এর শর্তে autoregressively frame t+1 তৈরি করে।

training (পরিষ্কার input) এবং inference (নিজে-তৈরি input)-এর ব্যবধানকে exposure bias বলা হয়। Error recycling সরাসরি এর সমাধান করে।

প্রযুক্তিগত বিশদ: পরিবর্তিত Training Objective

Training-এর সময়, মডেলটি পর্যায়ক্রমে ground-truth data ব্যবহারের বদলে নিজের বর্তমান weight ব্যবহার করে frame তৈরি করে। এই নিজে-তৈরি frame-গুলো, তাদের অসম্পূর্ণতাসহ, training sequence-এর পরবর্তী frame-গুলোর conditioning input হিসেবে ব্যবহৃত হয়।

মূল hyperparameter হলো recycling ratio r, যা নিয়ন্ত্রণ করে training-এর সময় কত ঘন ঘন নিজে-তৈরি frame ground-truth frame প্রতিস্থাপন করবে। পেপারটি দেখেছে যে r = 0.3 (30% recycled frame) সর্বোত্তম performance অর্জন করে, stability improvement এবং training signal quality-এর মধ্যে ভারসাম্য রেখে।

পরিবর্তিত loss function সাধারণ diffusion objective-ই থাকে। একমাত্র পার্থক্য হলো training-এর সময় মডেল যে data distribution দেখে। এ কারণেই inference time-এ কোনো computational overhead নেই।

ধারণাগতভাবে এটি sequence-to-sequence মডেলের scheduled sampling-এর অনুরূপ, তবে continuous diffusion framework-এর জন্য অভিযোজিত। VITA Lab দলটি তাদের পেপারে এই সংযোগের কৃতিত্ব দিয়েছে, একই সঙ্গে উল্লেখ করেছে যে diffusion model-এ scheduled sampling-এর সরল প্রয়োগ কাজ করে না। তাদের অবদান হলো সেই নির্দিষ্ট formulation যা ভিডিও জেনারেশনের জন্য এটিকে স্থিতিশীল করে।

Open-Source সুবিধা

সম্ভবত সবচেয়ে উত্তেজনাপূর্ণ দিকটি হলো: কোডটি GitHub-এ সম্পূর্ণ open-source (vita-epfl/Stable-Video-Infinity)। অর্থাৎ যেকোনো research lab বা company তাদের বিদ্যমান ভিডিও মডেলে error recycling প্রয়োগ করতে পারে।

Open-Source কেন গুরুত্বপূর্ণ
যেকোনো বিদ্যমান ভিডিও diffusion মডেলকে error recycling দিয়ে retrofitted করা যায়। Architecture পরিবর্তনের প্রয়োজন নেই, শুধু একটি পরিবর্তিত training loop। এটি একই সঙ্গে Sora, Runway, Kling এবং প্রতিটি open-source মডেলকে উন্নত করতে পারে।
ব্যবহারিক সীমাবদ্ধতা
মডেলটিকে পুনরায় training বা fine-tuning করতে হবে। Proprietary মডেল থাকা company-গুলোর retraining-এ compute বিনিয়োগ করতে হবে। কৌশলটির কার্যকারিতা বিভিন্ন architecture ও scale-এ ভিন্ন হতে পারে।

Open-source release AI ভিডিও গবেষণা কমিউনিটিতে ক্রমবর্ধমান একটি প্রবণতা অনুসরণ করে। LTX-2 এবং Wan 2.6-এর মতো মডেল দেখিয়েছে যে open-source পদ্ধতি proprietary বিকল্পগুলোর সঙ্গে প্রতিযোগিতা করতে পারে।

শিল্পখাতের জন্য এর অর্থ কী

সময়সূচিটি উল্লেখযোগ্য। আমরা AI ভিডিওর প্রতিযোগিতার মাঝখানে আছি, যেখানে Runway থেকে ByteDance পর্যন্ত প্রতিটি বড় প্রতিষ্ঠান দীর্ঘতর ও উচ্চমানের output-এর দিকে এগোচ্ছে। Error recycling হয়তো সেই অনুপস্থিত অংশ, যা পরবর্তী প্রজন্মের সক্ষমতা উন্মুক্ত করবে।

🎬

চলচ্চিত্র নির্মাতা ও স্রষ্টাদের জন্য

দীর্ঘ-ফর্মের সুসংগত ভিডিও জেনারেশন বাস্তব narrative content সম্ভব করে। শুধু ক্লিপ নয়, বরং দৃশ্য, sequence, এবং শেষ পর্যন্ত একটি prompt থেকে তৈরি short film।
🔬

গবেষকদের জন্য

Error recycling একটি সাধারণীকরণযোগ্য framework দেয়। একই নীতি audio generation, 3D scene synthesis এবং drift-এ ভোগা যেকোনো autoregressive generative model-এ প্রয়োগ করা যেতে পারে।
🏢

Enterprise-এর জন্য

স্থিতিশীল দীর্ঘ-ফর্ম generation AI ভিডিওকে পেশাদার ব্যবহারের জন্য কার্যকর করে: product demo, training video, এবং এমন marketing campaign, যেখানে কয়েক মিনিটের content জুড়ে সামঞ্জস্যপূর্ণ মান প্রয়োজন।

সামনে কী আছে

VITA Lab-এর কাজ AI ভিডিও জেনারেশন নিয়ে আমাদের চিন্তাভাবনায় একটি মৌলিক পরিবর্তন আনে। আরও বড় মডেল তৈরি করা বা জটিল inference-time mechanism যোগ করার বদলে, সমাধানটি ছিল মডেলকে শুধু দেখানো যে এর নিজের output কেমন।

পেপারটি ICLR 2026-এ উপস্থাপিত হবে, এবং কয়েকটি শিল্পখাতের সূত্র বলছে যে বড় ভিডিও মডেল provider-রা ইতিমধ্যেই integration অন্বেষণ করছে। যদি world models AI কীভাবে পদার্থবিজ্ঞান ও স্থান বোঝে তার ভবিষ্যৎকে উপস্থাপন করে, তবে error recycling সময়ের সঙ্গে AI কীভাবে সেই বোঝাপড়া বজায় রাখে তার ভবিষ্যৎকে উপস্থাপন করে।

4-সেকেন্ডের AI ভিডিওর যুগ হয়তো প্রত্যাশার চেয়েও দ্রুত শেষ হতে চলেছে। এবং এর জন্য নতুন model architecture বা billion-dollar compute budget লাগবে না। শুধু আরও স্মার্ট একটি training loop।

আরও পড়ুন


উৎস

Alexis
AlexisAI EngineerAI Author

লসানের একজন AI ইঞ্জিনিয়ার, যিনি গবেষণার গভীরতার সঙ্গে ব্যবহারিক উদ্ভাবন মিলিয়ে কাজ করেন। মডেল আর্কিটেকচার এবং আল্পসের শৃঙ্গের মধ্যে সময় ভাগ করেন।

View profile →

যা পড়লেন তা ভালো লেগেছে?

কয়েক মিনিটে আপনার ভাবনাকে সীমাহীন দৈর্ঘ্যের AI ভিডিওতে রূপান্তর করুন।

সম্পর্কিত নিবন্ধ

এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

Grok xAI ইমেজ-টু-ভিডিও সক্ষমতা: জুন 2026 API গাইড
AI VideoxAI

Grok xAI ইমেজ-টু-ভিডিও সক্ষমতা: জুন 2026 API গাইড

জুন 2026-এ Grok xAI ইমেজ-টু-ভিডিও সক্ষমতা: Grok Imagine কীভাবে ছবি, prompt, native audio, API workflow, safety, pricing logic, এবং Sora/Veo তুলনা সামলায়।

Read
AI Video Tools Pricing 2026: ক্রেডিট না পুড়িয়ে বাজেট করার উপায়
AI VideoPricing

AI Video Tools Pricing 2026: ক্রেডিট না পুড়িয়ে বাজেট করার উপায়

AI ভিডিও টুল এখন আর খুঁজে পাওয়া কঠিন নয়। কঠিন অংশ হলো আপনার ওয়ার্কফ্লোর জন্য সঠিক প্রাইসিং মডেল বেছে নেওয়া। ক্রিয়েটর ও টিমের জন্য এখানে একটি ব্যবহারিক বাজেটিং গাইড দেওয়া হলো।

Read
AI পণ্য ভিডিও জেনারেটর: 2026 সালে ই-কমার্স এবং মার্কেটিং এর জন্য সম্পূর্ণ গাইড
AI VideoProduct Video

AI পণ্য ভিডিও জেনারেটর: 2026 সালে ই-কমার্স এবং মার্কেটিং এর জন্য সম্পূর্ণ গাইড

AI পণ্য ভিডিও জেনারেটরগুলি ব্র্যান্ডগুলি কীভাবে কন্টেন্ট তৈরি করে তা পুনর্গঠন করছে। URL-থেকে-ভিডিও পাইপলাইন থেকে 27% বেশি অ্যাড-টু-কার্ট রেট পর্যন্ত, এখানে 2026 সালে প্রতিটি মার্কেটারকে যা জানা দরকার তা রয়েছে।

Read

নিবন্ধটি ভালো লেগেছে?

আরও অন্তর্দৃষ্টি জানুন এবং আমাদের সর্বশেষ কনটেন্টের সঙ্গে আপডেট থাকুন।