SkyReels V4: একই সময়ে দেখে এবং শোনে এমন প্রথম AI মডেল
Skywork AI-এর SkyReels V4 একটি ডুয়াল-স্ট্রিম ডিফিউশন আর্কিটেকচার নিয়ে এসেছে, যা এক পাসেই ভিডিও এবং সিঙ্ক্রোনাইজড অডিও সহ-তৈরি করে। নির্মাতাদের জন্য এর অর্থ কী, এখানে তা জানা যাবে।

কেন অডিও সবসময় AI ভিডিওর দুর্বল দিক ছিল
আপনি যদি কখনও AI-তৈরি ক্লিপে শব্দ যোগ করার চেষ্টা করে থাকেন, তাহলে ঝামেলাটা জানেন। জানালায় বৃষ্টি পড়ার একটি ভিডিও তৈরি করুন, তারপর মিলিয়ে নেওয়ার মতো একটি অডিও ট্র্যাক খুঁজুন। সময় মিলান। সমন্বয় করুন। আশা করুন, ব্যাপারটি অস্বাভাবিক না লাগে।
মূল সমস্যাটি স্থাপত্যগত। Kling 3.0 বা Runway Gen-4.5-এর মতো মডেল প্রথমে ভিজ্যুয়াল ইঞ্জিন হিসেবে তৈরি হয়েছিল। অডিও সমর্থন থাকলেও, তা একটি আলাদা পাইপলাইনের মাধ্যমে চলে, যা পরে সিঙ্ক করার চেষ্টা করে।
SkyReels V4 আসলে কীভাবে কাজ করে
Skywork AI (Kunlun Inc.-এর একটি গবেষণা বিভাগ) এমন কিছু তৈরি করেছে যাকে তারা dual-stream Multimodal Diffusion Transformer, বা MMDiT বলে। এটিকে একটি স্নায়ুতন্ত্র ভাগ করে নেওয়া দুই বিশেষজ্ঞ মস্তিষ্ক হিসেবে ভাবুন।
ভিজ্যুয়াল শাখা
1080p পর্যন্ত, 32 FPS-এ ভিডিও ফ্রেম তৈরি করে। পুরো ক্লিপ জুড়ে গতি, আলো, দৃশ্যের বিন্যাস এবং সময়গত সামঞ্জস্য সামলায়।
অডিও শাখা
একই ডিফিউশন পাসে সিঙ্ক্রোনাইজড শব্দ তৈরি করে। সম্পন্ন ভিডিওর সঙ্গে শব্দ মেলানো নয়। ভিডিও তৈরি হওয়ার সঙ্গেই শব্দ তৈরি করা।
দুই শাখাই একটি Multimodal Large Language Model-এর উপর নির্মিত টেক্সট এনকোডার ভাগ করে। এই যৌথ বোঝাপড়ার কারণেই "glass shattering on marble floor in slow motion"-এর মতো একটি প্রম্পট অডিও অ্যাকসেন্ট তৈরি করে, যা ভিজ্যুয়াল প্রভাবের প্রায় 40ms-এর মধ্যে পৌঁছায়। স্বাভাবিক অনুভব করার জন্য এটি যথেষ্ট নির্ভুল।
Seedance বা Kling থেকে কীভাবে এটি আলাদা
ByteDance-এর Seedance 2.0 এবং Kuaishou-এর Kling 3.0, দুটিই অডিও সমর্থন করে, তবে তাদের পদ্ধতি মৌলিকভাবে ভিন্ন। তারা আগে ভিডিও তৈরি করে, তারপর মিলিয়ে নেওয়া অডিও তৈরির জন্য দ্বিতীয় একটি মডেল চালায়। এই ধারাবাহিক পদ্ধতির অর্থ হলো অডিও সবসময় সম্পন্ন ফ্রেমের প্রতিক্রিয়া দেখায়, সেগুলোর সঙ্গে কখনও সহ-সৃষ্টি করে না।
SkyReels V4-এর ডুয়াল-স্ট্রিম স্থাপত্যের অর্থ:
- ✓শুরু থেকেই অডিও এবং ভিজ্যুয়াল উপাদান অর্থগতভাবে সামঞ্জস্যপূর্ণ থাকে
- ✓কথা বলা মুখের লিপ-সিঙ্ক ব্যঞ্জনধ্বনির সঙ্গে মেলে, পরে নয়
- ✓পরিবেশের শব্দ উপকরণের বৈশিষ্ট্যের সঙ্গে মেলে (ধাতু বনাম কাঠ বনাম কাচ)
- ✓টাইমিং ড্রিফট ঠিক করতে পোস্ট-প্রসেসিংয়ের প্রয়োজন হয় না
ল্যান্ডস্কেপ দেখার সময় পার্থক্যটি সূক্ষ্ম, কিন্তু একজন ব্যক্তিকে কথা বলতে দেখা বা কোনো বস্তুকে পৃষ্ঠের সঙ্গে মিথস্ক্রিয়া করতে দেখার সময় নাটকীয়।
ওপেন-সোর্স প্রশ্ন
আগের SkyReels সংস্করণগুলো (V1 থেকে V3) HuggingFace ও GitHub-এ ডাউনলোডযোগ্য ওয়েটসহ পুরোপুরি ওপেন-সোর্স ছিল। V4 বর্তমানে skyreels.ai-এ একটি বিনামূল্যের টিয়ারসহ সীমিত প্রিভিউতে আছে, তবে সম্পূর্ণ ওয়েট এখনও প্রকাশ করা হয়নি।
অফিশিয়াল প্ল্যাটফর্মে দৈনিক জেনারেশন সীমাসহ বিনামূল্যের টিয়ার। arXiv পেপারটি (2602.21818) সম্পূর্ণ স্থাপত্যের বিবরণ দেয়। আগের সংস্করণগুলো ওপেন-সোর্সই রয়েছে।
V4-এর ডাউনলোডযোগ্য ওয়েট এখনও নেই। স্ব-হোস্টিং বিকল্প নেই। প্রোডাকশন API নেই। ওপেন-সোর্স প্রকাশের সময়রেখা অস্পষ্ট।
ওপেন-সোর্স কমিউনিটির জন্য এটি কাছ থেকে পর্যবেক্ষণ করার মতো বিষয়। Skywork যদি তাদের ঐতিহাসিক ধারা অনুসরণ করে, তবে V4-এর ওয়েট শেষ পর্যন্ত HuggingFace-এ আসা উচিত। আজই যদি ওপেন-সোর্স অডিও-ভিডিও জেনারেশন প্রয়োজন হয়, সবচেয়ে কাছের বিকল্প হলো SkyReels V3 এবং একটি আলাদা অডিও মডেল।
লিডারবোর্ডে SkyReels V4 কোথায় আছে
Artificial Analysis Video Arena-তে (যা ব্লাইন্ড মানব পছন্দভিত্তিক ভোট ব্যবহার করে), SkyReels V4 বর্তমানে text-to-video-এর জন্য 1,244 Elo-তে অবস্থান করছে। এটি Kling 3.0 (1,243)-এর সঙ্গে প্রায় সমানে এবং বর্তমান শীর্ষস্থানীয় Alibaba-এর HappyHorse-1.0 (1,347)-এর পেছনে।
| মডেল | Elo স্কোর | অডিও সমর্থন | ওপেন সোর্স | সবচেয়ে উপযোগী |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | না | না | বিশুদ্ধ ভিজ্যুয়াল মান |
| SkyReels V4 | 1,244 | নেটিভ (ডুয়াল-স্ট্রিম) | অপেক্ষমাণ | অডিও-ভিজ্যুয়াল কনটেন্ট |
| Kling 3.0 | 1,243 | ধারাবাহিক | না | প্রোডাকশন স্কেল |
| Wan 2.7 | শীর্ষ স্তর | না | হ্যাঁ | ফটোরিয়ালিজম |
| LTX-2 | নিম্ন | না | হ্যাঁ | খরচ দক্ষতা |

SkyReels V4 এবং HappyHorse-এর মধ্যে ভিজ্যুয়াল মানের ব্যবধান বাস্তব। তবে শীর্ষ 5-এর মধ্যে SkyReels-ই একমাত্র মডেল যা নেটিভভাবে অডিও তৈরি করে। আপনার কর্মপ্রবাহে যদি শব্দের প্রয়োজন হয়, তবে সেই স্থাপত্যগত সুবিধাটি 100-পয়েন্টের Elo পার্থক্যের চেয়ে বেশি গুরুত্বপূর্ণ।
নির্মাতাদের জন্য এর অর্থ কী
সোশ্যাল কনটেন্ট নির্মাতা
মিউজিক ভিডিও প্রযোজক
বিজ্ঞাপন নির্মাতা
বড় চিত্র: অডিও আর ঐচ্ছিক নয়
SkyReels V4 কোনো বিচ্ছিন্ন পরীক্ষা নয়। আমরা ByteDance-এর Seedance 1.5 Pro-এর অডিও-ভিজ্যুয়াল জেনারেশন প্রবর্তন এবং নির্বাক যুগ থেকে AI ভিডিওর বেরিয়ে আসার বৃহত্তর প্রবণতা নিয়ে লিখেছি। SkyReels V4 যা যোগ করে তা হলো প্রমাণ যে এটি পোস্ট-প্রসেসিং কৌশল হিসেবে নয়, স্থাপত্য পর্যায়ে করা সম্ভব।
ইঙ্গিতটি স্পষ্ট: 2026-এর শেষ নাগাদ নেটিভ অডিওবিহীন যেকোনো AI ভিডিও মডেল অসম্পূর্ণ মনে হবে। প্রশ্ন এটি মানদণ্ড হবে কি না নয়, বরং কত দ্রুত হবে।
দ্রুত রেফারেন্স: SkyReels V4
- ডেভেলপার: Skywork AI (Kunlun Inc.)
- স্থাপত্য: Dual-stream Multimodal Diffusion Transformer (MMDiT)
- রেজোলিউশন: 32 FPS-এ 1080p পর্যন্ত
- সময়কাল: 15 সেকেন্ড পর্যন্ত
- অডিও: নেটিভ সহ-জেনারেশন (পোস্ট-প্রসেসিং নয়)
- ইনপুট: টেক্সট, ছবি, ভিডিও ক্লিপ, মাস্ক, অডিও রেফারেন্স
- অবস্থা: skyreels.ai-এ সীমিত প্রিভিউ (ওপেন-সোর্স প্রকাশের অপেক্ষায় ওয়েট)
- পেপার: arXiv 2602.21818
উৎসসমূহ

লসানের একজন সৃজনশীল প্রযুক্তিবিদ, যিনি AI ও শিল্পের মিলনস্থল অনুসন্ধান করেন। ইলেকট্রনিক সঙ্গীত সেশনের ফাঁকে জেনারেটিভ মডেল নিয়ে পরীক্ষা করেন।
View profile →সম্পর্কিত নিবন্ধ
এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

Kling 3.0: নেটিভ 4K, মাল্টি-শট স্টোরিবোর্ড এবং সিঙ্গেল-ক্লিপ AI ভিডিওর সমাপ্তি
Kuaishou নেটিভ 4K 60fps, 6-শট স্টোরিবোর্ডিং, ছয় ভাষায় সিঙ্ক্রোনাইজড অডিও এবং অবশেষে কার্যকর চরিত্রের ধারাবাহিকতাসহ Kling 3.0 চালু করেছে। এটি শুধু একটি আপগ্রেড নয়।

ওপেন-সোর্স AI ভিডিও বিপ্লব: ভোক্তা GPU কি প্রযুক্তি দৈত্যদের সাথে প্রতিযোগিতা করতে পারে?
ByteDance এবং Tencent সবেমাত্র ওপেন-সোর্স ভিডিও মডেল প্রকাশ করেছে যা ভোক্তা হার্ডওয়্যারে চলে। এটি স্বাধীন সৃষ্টিকারীদের জন্য সবকিছু পরিবর্তন করে।

বিনামূল্যে আনলিমিটেড AI ভিডিও টুল: ২০২৬ সালে কী কাজ করে
বিনামূল্যে আনলিমিটেড AI ভিডিও টুল সাধারণত কিউ-ভিত্তিক বা লোকাল। আসলে কী আনলিমিটেড, কী ধীর করে দেয় এবং ২০২৬ সালের কার্যকর সেটআপ কীভাবে বেছে নেবেন তা জানুন।
