Meta Pixelমূল বিষয়বস্তুতে যান
AlexisAlexis· AI লেখক, মানুষের পর্যালোচিত
6 min read
1045 শব্দ

Alibaba Wan 2.7: Thinking Mode কীভাবে AI Video Generation বদলে দিচ্ছে

Alibaba Wan 2.7 রিলিজ করেছে যাতে একটি নতুন Thinking Mode আছে যা ভিডিও তৈরি করার আগে composition পরিকল্পনা করে। জানুন এটি কীভাবে কাজ করে এবং ক্রিয়েটরদের জন্য এর অর্থ কী।

Alibaba Wan 2.7: Thinking Mode কীভাবে AI Video Generation বদলে দিচ্ছে

নিজের AI ভিডিও তৈরি করতে প্রস্তুত?

Bonega.ai ব্যবহারকারী হাজারো নির্মাতার সঙ্গে যোগ দিন

Alibaba-র Tongyi Lab ২০২৬ সালের ৬ এপ্রিল Wan 2.7 রিলিজ করেছে, যাতে একটি "Thinking Mode" চালু করা হয়েছে যা AI video model-গুলো prompt প্রক্রিয়া করার পদ্ধতিকে মৌলিকভাবে বদলে দেয়। টেক্সট থেকে সরাসরি ফ্রেম তৈরি করার বদলে, মডেলটি প্রথমে দৃশ্যের একটি অভ্যন্তরীণ পরিকল্পনা তৈরি করে, তারপর সেটি কার্যকর করে। ফলাফল নিজেই কথা বলে: কম artifact, উন্নত coherence, এবং লক্ষণীয়ভাবে আরও সুচিন্তিত composition।

Thinking Mode কী?

বেশিরভাগ video generation model একটি single pass-এ কাজ করে। আপনি একটি prompt টাইপ করেন, মডেল noise-কে pixel-এ diffuse করতে শুরু করে, এবং যা তৈরি হয় তাই আপনি পান। সাধারণ দৃশ্যের জন্য এটি যথেষ্ট ভালো কাজ করে, কিন্তু যখন prompt-এ একাধিক subject, নির্দিষ্ট spatial সম্পর্ক, বা জটিল action থাকে তখন এটি ভেঙে পড়ে।

Wan 2.7 একটি মধ্যবর্তী ধাপ যোগ করে। কোনো pixel তৈরি হওয়ার আগে, মডেলটি:

  1. Prompt-কে parse করে semantic উপাদানে (subject, action, পরিবেশ, আলো)
  2. Composition পরিকল্পনা করে নির্ধারণ করে উপাদানগুলো কোথায় থাকবে এবং কীভাবে interact করবে
  3. Output তৈরি করে এই পরিকল্পনাকে structural guide হিসেবে ব্যবহার করে
💡
এটিকে এভাবে ভাবুন: একটি ছবি সরাসরি improvise করা এবং প্রথমে একটি composition study sketch করার মধ্যে যে পার্থক্য। Sketch চূড়ান্ত কাজে দেখা যায় না, কিন্তু প্রতিটি brushstroke-কে রূপ দেয়।

এটি অনেকটা সেভাবেই কাজ করে যেভাবে "chain-of-thought" reasoning large language model-গুলোকে উন্নত করেছে। মডেলকে কাজ করার আগে চিন্তা করতে বাধ্য করলে output-এর গুণগত মান উল্লেখযোগ্যভাবে বাড়ে, বিশেষত জটিল prompt-এর জন্য।

সম্পূর্ণ Wan 2.7 Suite

Wan 2.7 শুধু একটি মডেল নয়। এটি চারটি মডেলের suite হিসেবে আসে যা বিভিন্ন generation workflow কভার করে:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelInputOutputBest For
Text-to-VideoText promptVideo clipশুরু থেকে তৈরি করা
Image-to-VideoImage + promptVideo clipStill ছবি animate করা, concept art
Reference-to-VideoReference video + promptNew videoStyle transfer, পুনর্নির্মাণ
Video EditingVideo + edit instructionsModified videoPost-production, সংশোধন

Text-to-video model ৩ এপ্রিল থেকে Together AI-তে ইতিমধ্যে live আছে। বাকি তিনটি model আগামী কয়েক সপ্তাহে rollout হবে।

Under the Hood: Architecture Insights

Alibaba এখনও কোনো সম্পূর্ণ paper প্রকাশ করেনি, তবে API documentation এবং প্রাথমিক benchmark থেকে বেশ কিছু technical তথ্য সামনে এসেছে।

যা জানা গেছেযা আলাদা করে
Wan (Wanxiang) architecture lineage-এর উপর নির্মিতExplicit compositional planning সহ প্রথম production model
Thinking Mode diffusion-এর আগে একটি planning pass যোগ করেMulti-element scene-এ ৫+ subject পরিষ্কারভাবে handle করে
ফ্রেম জুড়ে hyper-realistic character consistencyতৈরি করা ভিডিওতে text পড়া যায়, garbled নয়
Prompt conditioning-এর মাধ্যমে precise color controlআলোর পরিবর্তনেও color accuracy সামঞ্জস্যপূর্ণ থাকে
উন্নত long-text rendering (ভিডিওতে text)জটিল camera movement spatial coherence বজায় রাখে

Long-text rendering ক্ষমতা বিশেষভাবে উল্লেখযোগ্য। আগের model-গুলো video frame-এ পড়ার যোগ্য text তৈরি করতে সমস্যায় পড়ত। Wan 2.7 sign, label, এমনকি ছোট paragraph-ও বিস্ময়কর নির্ভুলতায় handle করে। যেসব ক্রিয়েটরের তৈরি footage-এ text overlay বসানো দরকার, তাদের জন্য এটি একটি গুরুত্বপূর্ণ অগ্রগতি।

প্রতিযোগীদের সাথে Benchmarking

এই সপ্তাহে AI video ক্ষেত্রে উল্লেখযোগ্য পরিবর্তন এসেছে। Wan 2.7 ঠিক সেই সময় এলো যখন OpenAI Sora বন্ধ করার কথা নিশ্চিত করল এবং Google Veo 3.1-এর দাম কমাল।

ModelPricingAudioMax LengthCharacter ConsistencyThinking/Planning
Wan 2.7$0.10/sNo~10sStrongYes
Veo 3.1 Lite$0.05/sYes~8sGoodNo
Veo 3.1 Fast$0.12/sYes~8sStrongNo
Kling 3.0~$0.08-0.17/sYes~10sStrongNo
Seedance 2.0BundledYes15sGoodNo
Runway Gen-4.5~$0.15/sNo~10sStrongNo
⚠️
Wan 2.7-এ native audio generation অন্তর্ভুক্ত নেই। যেসব project-এ synchronized sound প্রয়োজন, সেখানে আপনার একটি আলাদা audio pipeline বা Kling 3.0 বা Veo 3.1-এর মতো model লাগবে যা natively audio তৈরি করে।

প্রতি সেকেন্ডে $0.10 মূল্য Wan 2.7-কে competitive middle tier-এ রাখে। এটি Google-এর budget Lite option-এর দ্বিগুণ, Kling 3.0-এর সাথে প্রতিযোগিতামূলক (যা platform ভেদে ভিন্ন হয়), এবং Runway-কে উল্লেখযোগ্যভাবে undercut করে।

কখন Wan 2.7 ব্যবহার করবেন

প্রাথমিক পরীক্ষা এবং model-এর শক্তির ভিত্তিতে, এখানে সেই পরিস্থিতিগুলো যেখানে Wan 2.7 সবচেয়ে বেশি কার্যকর:

🎬

Complex Multi-Subject Scenes

Thinking Mode তখন সবচেয়ে ভালো কাজ করে যখন আপনার prompt-এ একাধিক character বা object interact করছে। Planning ধাপ সেই spatial বিভ্রান্তি রোধ করে যা অন্য model-গুলোতে সমস্যা তৈরি করে।
📝

Text-Heavy Content

যদি আপনার ভিডিওতে পড়ার যোগ্য text, sign, বা UI element প্রয়োজন হয়, Wan 2.7-এর text rendering এই মুহূর্তে best-in-class।
🎨

Precise Color ও Style Control

Color conditioning system আপনাকে সুনির্দিষ্ট palette নির্ধারণ করতে এবং ফ্রেম জুড়ে সেগুলো বজায় রাখতে দেয়। Brand-consistent content-এর জন্য উপযোগী।
🔄

Reference-এর মাধ্যমে Style Transfer

Reference-to-video model (শীঘ্রই আসছে) আপনাকে একটি বিদ্যমান clip style guide হিসেবে দিতে দেবে, এমন নতুন content তৈরি করবে যা তার visual ভাষার সাথে মিলে যায়।

সরল, single-subject দৃশ্যের জন্য যেখানে audio-ও প্রয়োজন, Kling 3.0 বা Veo 3.1-এর মতো model এখনও ভালো পছন্দ হতে পারে। Thinking Mode-এর planning overhead বিশেষভাবে তখনই মূল্য যোগ করে যখন prompt জটিল হয়।

শিল্পের জন্য এর অর্থ কী

Wan 2.7-এর Thinking Mode generative model কীভাবে কাজ করবে তার একটি বৃহত্তর পরিবর্তনের দিকে ইঙ্গিত করে। Noise থেকে brute-force output তৈরি করার বদলে, ভবিষ্যতের model-গুলো generation-এর বিভিন্ন দিকের জন্য explicit planning stage অন্তর্ভুক্ত করবে।

আমরা ইতিমধ্যে অন্যান্য ক্ষেত্রে এই প্যাটার্ন দেখছি। Code generation model লেখার আগে পরিকল্পনা করে। Image model layout conditioning ব্যবহার করে। এখন video model-ও তৈরি করার আগে চিন্তা করতে শিখছে।

💡
২০২৬-এ model release-এর দ্রুত গতি যেকোনো একটি vendor-এ commit করা ঝুঁকিপূর্ণ করে তোলে। Pipeline-ভিত্তিক পদ্ধতি যা উন্নত model আসলে generation backend পাল্টাতে পারে, আপনার workflow-কে vendor lock-in থেকে রক্ষা করে।

প্রতিযোগিতামূলক চাপ বাস্তব। Sora-র প্রস্থান, Google-এর দাম কমানো, এবং Wan 2.7 ও Kling 3.0-এর মতো Chinese model-এর গুণগত মানের সীমা ঠেলে দেওয়া, ক্রিয়েটরদের কাছে এত বিকল্প আগে কখনো ছিল না, এবং নমনীয় থাকার এত কারণও ছিল না।

নির্দিষ্ট benchmark-এ এই model-গুলোর তুলনার জন্য, আমাদের Runway Gen-4.5 performance-এর বিশ্লেষণ দেখুন। এবং আপনি যদি জানতে চান Seedance 2.0 rollout কীভাবে CapCut ecosystem-কে নতুন রূপ দিচ্ছে, আমরা গত মাসে এটি বিস্তারিতভাবে আলোচনা করেছি।

Alexis
AlexisAI EngineerAI Author

লসানের একজন AI ইঞ্জিনিয়ার, যিনি গবেষণার গভীরতার সঙ্গে ব্যবহারিক উদ্ভাবন মিলিয়ে কাজ করেন। মডেল আর্কিটেকচার এবং আল্পসের শৃঙ্গের মধ্যে সময় ভাগ করেন।

View profile →

যা পড়লেন তা ভালো লেগেছে?

কয়েক মিনিটে আপনার ভাবনাকে সীমাহীন দৈর্ঘ্যের AI ভিডিওতে রূপান্তর করুন।

সম্পর্কিত নিবন্ধ

এই সম্পর্কিত পোস্টগুলোর মাধ্যমে আরও অনুসন্ধান করুন

Sora-র পর AI ভিডিও: ২০২৬-এ জানার মতো ৪টি মার্কেট টায়ার
AI VideoSora

Sora-র পর AI ভিডিও: ২০২৬-এ জানার মতো ৪টি মার্কেট টায়ার

Sora ২৬ এপ্রিল বন্ধ হচ্ছে। AI ভিডিও মার্কেট চারটি টায়ারে একত্রিত হয়েছে। আপনার প্রয়োজন অনুযায়ী সঠিক Sora বিকল্প বেছে নেওয়ার জন্য একটি ব্যবহারিক গাইড।

Read
Google Veo 3.1 এখন ফ্রি: প্রতিটি Google Account-এর জন্য মাসে 10টি AI Video
Google VeoAI Video

Google Veo 3.1 এখন ফ্রি: প্রতিটি Google Account-এর জন্য মাসে 10টি AI Video

Google সব personal account-এর জন্য Veo 3.1 খুলে দিয়েছে, মাসে 10টি ফ্রি video generation সহ। আপনি কী পাবেন, সীমাবদ্ধতা কী, এবং AI video creator-দের জন্য এটি কেন গুরুত্বপূর্ণ তা জানুন।

Read
Google Veo 3.1 Lite: যে API প্রতিটি ডেভেলপারের জন্য AI ভিডিও জেনারেশন সাশ্রয়ী করে তুলছে
GoogleVeo 3.1

Google Veo 3.1 Lite: যে API প্রতিটি ডেভেলপারের জন্য AI ভিডিও জেনারেশন সাশ্রয়ী করে তুলছে

Google Gemini API-এর মাধ্যমে Veo 3.1 Lite লঞ্চ করেছে, যার দাম Veo 3.1 Fast-এর অর্ধেকেরও কম। Sora বন্ধ হয়ে যাচ্ছে এবং Runway ওয়ার্ল্ড মডেলের দিকে এগোচ্ছে, এমন সময়ে ইন্ডি ডেভেলপার ও স্টার্টআপদের জন্য সাশ্রয়ী ভিডিও জেনারেশন এখন বাস্তব সম্ভাবনা।

Read

নিবন্ধটি ভালো লেগেছে?

আরও অন্তর্দৃষ্টি জানুন এবং আমাদের সর্বশেষ কনটেন্টের সঙ্গে আপডেট থাকুন।