Alibaba Wan 2.7: Thinking Mode কীভাবে AI Video Generation বদলে দিচ্ছে
Alibaba Wan 2.7 রিলিজ করেছে যাতে একটি নতুন Thinking Mode আছে যা ভিডিও তৈরি করার আগে composition পরিকল্পনা করে। জানুন এটি কীভাবে কাজ করে এবং ক্রিয়েটরদের জন্য এর অর্থ কী।

Thinking Mode কী?
বেশিরভাগ video generation model একটি single pass-এ কাজ করে। আপনি একটি prompt টাইপ করেন, মডেল noise-কে pixel-এ diffuse করতে শুরু করে, এবং যা তৈরি হয় তাই আপনি পান। সাধারণ দৃশ্যের জন্য এটি যথেষ্ট ভালো কাজ করে, কিন্তু যখন prompt-এ একাধিক subject, নির্দিষ্ট spatial সম্পর্ক, বা জটিল action থাকে তখন এটি ভেঙে পড়ে।
Wan 2.7 একটি মধ্যবর্তী ধাপ যোগ করে। কোনো pixel তৈরি হওয়ার আগে, মডেলটি:
- Prompt-কে parse করে semantic উপাদানে (subject, action, পরিবেশ, আলো)
- Composition পরিকল্পনা করে নির্ধারণ করে উপাদানগুলো কোথায় থাকবে এবং কীভাবে interact করবে
- Output তৈরি করে এই পরিকল্পনাকে structural guide হিসেবে ব্যবহার করে
এটি অনেকটা সেভাবেই কাজ করে যেভাবে "chain-of-thought" reasoning large language model-গুলোকে উন্নত করেছে। মডেলকে কাজ করার আগে চিন্তা করতে বাধ্য করলে output-এর গুণগত মান উল্লেখযোগ্যভাবে বাড়ে, বিশেষত জটিল prompt-এর জন্য।
সম্পূর্ণ Wan 2.7 Suite
Wan 2.7 শুধু একটি মডেল নয়। এটি চারটি মডেলের suite হিসেবে আসে যা বিভিন্ন generation workflow কভার করে:
| Model | Input | Output | Best For |
|---|---|---|---|
| Text-to-Video | Text prompt | Video clip | শুরু থেকে তৈরি করা |
| Image-to-Video | Image + prompt | Video clip | Still ছবি animate করা, concept art |
| Reference-to-Video | Reference video + prompt | New video | Style transfer, পুনর্নির্মাণ |
| Video Editing | Video + edit instructions | Modified video | Post-production, সংশোধন |
Text-to-video model ৩ এপ্রিল থেকে Together AI-তে ইতিমধ্যে live আছে। বাকি তিনটি model আগামী কয়েক সপ্তাহে rollout হবে।
Under the Hood: Architecture Insights
Alibaba এখনও কোনো সম্পূর্ণ paper প্রকাশ করেনি, তবে API documentation এবং প্রাথমিক benchmark থেকে বেশ কিছু technical তথ্য সামনে এসেছে।
| যা জানা গেছে | যা আলাদা করে |
|---|---|
| Wan (Wanxiang) architecture lineage-এর উপর নির্মিত | Explicit compositional planning সহ প্রথম production model |
| Thinking Mode diffusion-এর আগে একটি planning pass যোগ করে | Multi-element scene-এ ৫+ subject পরিষ্কারভাবে handle করে |
| ফ্রেম জুড়ে hyper-realistic character consistency | তৈরি করা ভিডিওতে text পড়া যায়, garbled নয় |
| Prompt conditioning-এর মাধ্যমে precise color control | আলোর পরিবর্তনেও color accuracy সামঞ্জস্যপূর্ণ থাকে |
| উন্নত long-text rendering (ভিডিওতে text) | জটিল camera movement spatial coherence বজায় রাখে |
Long-text rendering ক্ষমতা বিশেষভাবে উল্লেখযোগ্য। আগের model-গুলো video frame-এ পড়ার যোগ্য text তৈরি করতে সমস্যায় পড়ত। Wan 2.7 sign, label, এমনকি ছোট paragraph-ও বিস্ময়কর নির্ভুলতায় handle করে। যেসব ক্রিয়েটরের তৈরি footage-এ text overlay বসানো দরকার, তাদের জন্য এটি একটি গুরুত্বপূর্ণ অগ্রগতি।
প্রতিযোগীদের সাথে Benchmarking
এই সপ্তাহে AI video ক্ষেত্রে উল্লেখযোগ্য পরিবর্তন এসেছে। Wan 2.7 ঠিক সেই সময় এলো যখন OpenAI Sora বন্ধ করার কথা নিশ্চিত করল এবং Google Veo 3.1-এর দাম কমাল।
| Model | Pricing | Audio | Max Length | Character Consistency | Thinking/Planning |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | No | ~10s | Strong | Yes |
| Veo 3.1 Lite | $0.05/s | Yes | ~8s | Good | No |
| Veo 3.1 Fast | $0.12/s | Yes | ~8s | Strong | No |
| Kling 3.0 | ~$0.08-0.17/s | Yes | ~10s | Strong | No |
| Seedance 2.0 | Bundled | Yes | 15s | Good | No |
| Runway Gen-4.5 | ~$0.15/s | No | ~10s | Strong | No |
প্রতি সেকেন্ডে $0.10 মূল্য Wan 2.7-কে competitive middle tier-এ রাখে। এটি Google-এর budget Lite option-এর দ্বিগুণ, Kling 3.0-এর সাথে প্রতিযোগিতামূলক (যা platform ভেদে ভিন্ন হয়), এবং Runway-কে উল্লেখযোগ্যভাবে undercut করে।
কখন Wan 2.7 ব্যবহার করবেন
প্রাথমিক পরীক্ষা এবং model-এর শক্তির ভিত্তিতে, এখানে সেই পরিস্থিতিগুলো যেখানে Wan 2.7 সবচেয়ে বেশি কার্যকর:
Complex Multi-Subject Scenes
Text-Heavy Content
Precise Color ও Style Control
Reference-এর মাধ্যমে Style Transfer
সরল, single-subject দৃশ্যের জন্য যেখানে audio-ও প্রয়োজন, Kling 3.0 বা Veo 3.1-এর মতো model এখনও ভালো পছন্দ হতে পারে। Thinking Mode-এর planning overhead বিশেষভাবে তখনই মূল্য যোগ করে যখন prompt জটিল হয়।
শিল্পের জন্য এর অর্থ কী
Wan 2.7-এর Thinking Mode generative model কীভাবে কাজ করবে তার একটি বৃহত্তর পরিবর্তনের দিকে ইঙ্গিত করে। Noise থেকে brute-force output তৈরি করার বদলে, ভবিষ্যতের model-গুলো generation-এর বিভিন্ন দিকের জন্য explicit planning stage অন্তর্ভুক্ত করবে।
আমরা ইতিমধ্যে অন্যান্য ক্ষেত্রে এই প্যাটার্ন দেখছি। Code generation model লেখার আগে পরিকল্পনা করে। Image model layout conditioning ব্যবহার করে। এখন video model-ও তৈরি করার আগে চিন্তা করতে শিখছে।
প্রতিযোগিতামূলক চাপ বাস্তব। Sora-র প্রস্থান, Google-এর দাম কমানো, এবং Wan 2.7 ও Kling 3.0-এর মতো Chinese model-এর গুণগত মানের সীমা ঠেলে দেওয়া, ক্রিয়েটরদের কাছে এত বিকল্প আগে কখনো ছিল না, এবং নমনীয় থাকার এত কারণও ছিল না।
নির্দিষ্ট benchmark-এ এই model-গুলোর তুলনার জন্য, আমাদের Runway Gen-4.5 performance-এর বিশ্লেষণ দেখুন। এবং আপনি যদি জানতে চান Seedance 2.0 rollout কীভাবে CapCut ecosystem-কে নতুন রূপ দিচ্ছে, আমরা গত মাসে এটি বিস্তারিতভাবে আলোচনা করেছি।

লসানের একজন AI ইঞ্জিনিয়ার, যিনি গবেষণার গভীরতার সঙ্গে ব্যবহারিক উদ্ভাবন মিলিয়ে কাজ করেন। মডেল আর্কিটেকচার এবং আল্পসের শৃঙ্গের মধ্যে সময় ভাগ করেন।
View profile →সম্পর্কিত নিবন্ধ
এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

Sora-র পর AI ভিডিও: ২০২৬-এ জানার মতো ৪টি মার্কেট টায়ার
Sora ২৬ এপ্রিল বন্ধ হচ্ছে। AI ভিডিও মার্কেট চারটি টায়ারে একত্রিত হয়েছে। আপনার প্রয়োজন অনুযায়ী সঠিক Sora বিকল্প বেছে নেওয়ার জন্য একটি ব্যবহারিক গাইড।

Google Veo 3.1 এখন ফ্রি: প্রতিটি Google Account-এর জন্য মাসে 10টি AI Video
Google সব personal account-এর জন্য Veo 3.1 খুলে দিয়েছে, মাসে 10টি ফ্রি video generation সহ। আপনি কী পাবেন, সীমাবদ্ধতা কী, এবং AI video creator-দের জন্য এটি কেন গুরুত্বপূর্ণ তা জানুন।

Google Veo 3.1 Lite: যে API প্রতিটি ডেভেলপারের জন্য AI ভিডিও জেনারেশন সাশ্রয়ী করে তুলছে
Google Gemini API-এর মাধ্যমে Veo 3.1 Lite লঞ্চ করেছে, যার দাম Veo 3.1 Fast-এর অর্ধেকেরও কম। Sora বন্ধ হয়ে যাচ্ছে এবং Runway ওয়ার্ল্ড মডেলের দিকে এগোচ্ছে, এমন সময়ে ইন্ডি ডেভেলপার ও স্টার্টআপদের জন্য সাশ্রয়ী ভিডিও জেনারেশন এখন বাস্তব সম্ভাবনা।