Meta PixelПремини към основното съдържание
AlexisAlexis· Автор ИИ, прегледано от човек
6 min read
1103 думи

Alibaba Wan 2.7: как Thinking Mode променя генерирането на видео с ИИ

Alibaba пусна Wan 2.7 с нов режим Thinking Mode, който планира композицията преди генериране на видео. Разглеждаме как работи и какво означава за създателите на съдържание.

Alibaba Wan 2.7: как Thinking Mode променя генерирането на видео с ИИ

Готови ли сте да създавате собствени ИИ видеа?

Присъединете се към хиляди създатели, които използват Bonega.ai

Лабораторията Tongyi на Alibaba пусна Wan 2.7 на 6 април 2026 г., представяйки режим Thinking Mode, който коренно променя начина, по който ИИ моделите обработват промптове. Вместо да генерира кадри директно от текст, моделът първо изгражда вътрешен план на сцената, а след това го изпълнява. Резултатите говорят сами за себе си: по-малко артефакти, по-добра свързаност и забележимо по-целенасочени композиции.

Какво е Thinking Mode?

Повечето модели за генериране на видео работят в един проход. Въвеждате промпт, моделът започва да превръща шум в пиксели и получавате каквото се е получило. За прости сцени това работи прилично, но се разпада, когато промптовете включват множество обекти, конкретни пространствени отношения или сложни действия.

Wan 2.7 добавя междинна стъпка. Преди да бъде генериран дори един пиксел, моделът:

  1. Анализира промпта на семантични компоненти (субекти, действия, среда, осветление)
  2. Планира композицията, определяйки къде трябва да се намират елементите и как трябва да взаимодействат
  3. Генерира резултата, използвайки този план като структурно ръководство
💡
Помислете за разликата между импровизиране на картина и предварителна скица на композицията. Скицата не се появява в крайното произведение, но определя всяко движение на четката.

Това е подобно на начина, по който верижното мислене (chain-of-thought) подобри големите езикови модели. Принуждавайки модела да мисли преди да действа, качеството на изхода се подобрява драстично, особено при сложни промптове.

Пълният пакет Wan 2.7

Wan 2.7 не е само един модел. Представлява пакет от четири модела, покриващи различни работни процеси за генериране:

4
Пакет модели
$0.10/с
Цена API
6 апр
Дата на пускане
МоделВходИзходНай-добре за
Текст-към-видеоТекстов промптВидеоклипСъздаване от нулата
Изображение-към-видеоИзображение + промптВидеоклипАнимиране на стоп-кадри, концепт арт
Референс-към-видеоРеферентно видео + промптНово видеоПренос на стил, пресъздаване
Редактиране на видеоВидео + инструкции за редакцияМодифицирано видеоПостпродукция, корекции

Моделът текст-към-видео вече е достъпен на Together AI от 3 април. Останалите три модела ще бъдат пуснати през следващите седмици.

Под капака: архитектурни подробности

Въпреки че Alibaba все още не е публикувала пълна статия, редица технически детайли вече са известни от документацията на API и първите бенчмаркове.

Какво знаемС какво се отличава
Изграден върху архитектурата Wan (Wanxiang)Първият продукционен модел с явно планиране на композиция
Thinking Mode добавя стъпка за планиране преди дифузиятаСцени с множество елементи обработват 5+ субекта коректно
Хиперреалистична консистентност на персонажите между кадритеТекстът в генерираното видео е четим, не объркан
Прецизен контрол на цветовете чрез кондициониране на промптаТочността на цветовете се запазва при промяна на осветлението
Подобрено рендериране на дълъг текст (текст във видео)Сложните движения на камерата запазват пространствена свързаност

Възможността за рендериране на дълъг текст е особено забележителна. Предишните модели трудно генерираха четим текст вътре във видеокадри. Wan 2.7 се справя с табели, надписи и дори кратки абзаци с впечатляваща точност. За създатели, които се нуждаят от текст, вграден в генерирано видео, това е сериозна крачка напред.

Сравнение с конкуренцията

Пазарът на ИИ видео се промени значително тази седмица. Wan 2.7 пристигна едновременно с потвърждението за спирането на Sora от OpenAI и намаляването на цените на Veo 3.1 от Google.

МоделЦенаАудиоМакс. дължинаКонсистентност на персонажитеThinking/Планиране
Wan 2.7$0.10/сНе~10сВисокаДа
Veo 3.1 Lite$0.05/сДа~8сДобраНе
Veo 3.1 Fast$0.12/сДа~8сВисокаНе
Kling 3.0~$0.08-0.17/сДа~10сВисокаНе
Seedance 2.0В пакетДа15сДобраНе
Runway Gen-4.5~$0.15/сНе~10сВисокаНе
⚠️
Wan 2.7 не включва вградено генериране на аудио. За проекти, изискващи синхронизиран звук, ще ви трябва отделен аудио пайплайн или модел като Kling 3.0 или Veo 3.1, който генерира аудио нативно.

Цената от $0.10 на секунда поставя Wan 2.7 в конкурентния среден сегмент. Два пъти по-скъп от бюджетния вариант Lite на Google, сравним с Kling 3.0 (чиято цена варира според платформата) и значително по-евтин от Runway.

Кога да използвате Wan 2.7

Въз основа на първите тестове и силните страни на модела, ето сценариите, в които Wan 2.7 има най-голям смисъл:

🎬

Сложни сцени с множество обекти

Thinking Mode работи особено добре, когато промптът включва няколко персонажа или обекта, които взаимодействат. Стъпката за планиране предотвратява пространственото объркване, присъщо на други модели.
📝

Съдържание с много текст

Ако видеото ви се нуждае от четим текст, табели или елементи на интерфейса, рендерирането на текст в Wan 2.7 в момента е най-доброто в класа си.
🎨

Прецизен контрол на цвят и стил

Системата за цветово кондициониране ви позволява да зададете точни палитри и да ги запазите между кадрите. Полезно за съдържание с фирмен стил.
🔄

Пренос на стил чрез референс

Моделът референс-към-видео (очаквайте скоро) ще ви позволи да подадете съществуващ клип като стилово ръководство, генерирайки ново съдържание, което съответства на визуалния му език.

За по-прости сцени с един обект, където също ви трябва звук, модели като Kling 3.0 или Veo 3.1 може да са по-добрият избор. Допълнителното натоварване от планирането в Thinking Mode дава стойност точно когато промптовете са сложни.

Какво означава това за индустрията

Thinking Mode на Wan 2.7 сочи към по-широка промяна в начина на работа на генеративните модели. Вместо грубо генериране на изход от шум, бъдещите модели вероятно ще включват явни етапи на планиране за различни аспекти на генерирането.

Вече виждаме този модел в други области. Моделите за генериране на код планират преди да пишат. Моделите за изображения използват кондициониране по макет. Сега моделите за видео се учат да мислят, преди да създават.

💡
Бързият темп на пускане на нови модели през 2026 г. прави рисковано обвързването с един доставчик. Пайплайн подходът, който позволява да сменяте бекенди за генериране с появата на по-добри модели, защитава работния ви процес от vendor lock-in.

Конкурентният натиск е реален. На фона на оттеглянето на Sora, намаляването на цените от Google и повишаването на качеството от китайски модели като Wan 2.7 и Kling 3.0, създателите на съдържание никога не са имали толкова много възможности и толкова причини да останат гъвкави.

За по-задълбочено сравнение на моделите по конкретни бенчмаркове, вижте нашия анализ на производителността на Runway Gen-4.5. А ако ви интересува как пускането на Seedance 2.0 променя екосистемата на CapCut, разгледахме го подробно миналия месец.

Alexis
AlexisAI EngineerAI Author

Инженер по ИИ от Лозана, който съчетава задълбочени изследвания с практични иновации. Разпределя времето си между архитектури на модели и алпийски върхове.

View profile →

Хареса ли ви прочетеното?

Превърнете идеите си в ИИ видеа с неограничена дължина само за минути.

Свързани статии

Продължете да разглеждате с тези свързани публикации

Хареса ли ви тази статия?

Открийте още полезни идеи и бъдете в крак с най-новото ни съдържание.