Alibaba Wan 2.7: как Thinking Mode променя генерирането на видео с ИИ
Alibaba пусна Wan 2.7 с нов режим Thinking Mode, който планира композицията преди генериране на видео. Разглеждаме как работи и какво означава за създателите на съдържание.

Готови ли сте да създавате собствени ИИ видеа?
Присъединете се към хиляди създатели, които използват Bonega.ai
Какво е Thinking Mode?
Повечето модели за генериране на видео работят в един проход. Въвеждате промпт, моделът започва да превръща шум в пиксели и получавате каквото се е получило. За прости сцени това работи прилично, но се разпада, когато промптовете включват множество обекти, конкретни пространствени отношения или сложни действия.
Wan 2.7 добавя междинна стъпка. Преди да бъде генериран дори един пиксел, моделът:
- Анализира промпта на семантични компоненти (субекти, действия, среда, осветление)
- Планира композицията, определяйки къде трябва да се намират елементите и как трябва да взаимодействат
- Генерира резултата, използвайки този план като структурно ръководство
Това е подобно на начина, по който верижното мислене (chain-of-thought) подобри големите езикови модели. Принуждавайки модела да мисли преди да действа, качеството на изхода се подобрява драстично, особено при сложни промптове.
Пълният пакет Wan 2.7
Wan 2.7 не е само един модел. Представлява пакет от четири модела, покриващи различни работни процеси за генериране:
| Модел | Вход | Изход | Най-добре за |
|---|---|---|---|
| Текст-към-видео | Текстов промпт | Видеоклип | Създаване от нулата |
| Изображение-към-видео | Изображение + промпт | Видеоклип | Анимиране на стоп-кадри, концепт арт |
| Референс-към-видео | Референтно видео + промпт | Ново видео | Пренос на стил, пресъздаване |
| Редактиране на видео | Видео + инструкции за редакция | Модифицирано видео | Постпродукция, корекции |
Моделът текст-към-видео вече е достъпен на Together AI от 3 април. Останалите три модела ще бъдат пуснати през следващите седмици.
Под капака: архитектурни подробности
Въпреки че Alibaba все още не е публикувала пълна статия, редица технически детайли вече са известни от документацията на API и първите бенчмаркове.
| Какво знаем | С какво се отличава |
|---|---|
| Изграден върху архитектурата Wan (Wanxiang) | Първият продукционен модел с явно планиране на композиция |
| Thinking Mode добавя стъпка за планиране преди дифузията | Сцени с множество елементи обработват 5+ субекта коректно |
| Хиперреалистична консистентност на персонажите между кадрите | Текстът в генерираното видео е четим, не объркан |
| Прецизен контрол на цветовете чрез кондициониране на промпта | Точността на цветовете се запазва при промяна на осветлението |
| Подобрено рендериране на дълъг текст (текст във видео) | Сложните движения на камерата запазват пространствена свързаност |
Възможността за рендериране на дълъг текст е особено забележителна. Предишните модели трудно генерираха четим текст вътре във видеокадри. Wan 2.7 се справя с табели, надписи и дори кратки абзаци с впечатляваща точност. За създатели, които се нуждаят от текст, вграден в генерирано видео, това е сериозна крачка напред.
Сравнение с конкуренцията
Пазарът на ИИ видео се промени значително тази седмица. Wan 2.7 пристигна едновременно с потвърждението за спирането на Sora от OpenAI и намаляването на цените на Veo 3.1 от Google.
| Модел | Цена | Аудио | Макс. дължина | Консистентност на персонажите | Thinking/Планиране |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/с | Не | ~10с | Висока | Да |
| Veo 3.1 Lite | $0.05/с | Да | ~8с | Добра | Не |
| Veo 3.1 Fast | $0.12/с | Да | ~8с | Висока | Не |
| Kling 3.0 | ~$0.08-0.17/с | Да | ~10с | Висока | Не |
| Seedance 2.0 | В пакет | Да | 15с | Добра | Не |
| Runway Gen-4.5 | ~$0.15/с | Не | ~10с | Висока | Не |
Цената от $0.10 на секунда поставя Wan 2.7 в конкурентния среден сегмент. Два пъти по-скъп от бюджетния вариант Lite на Google, сравним с Kling 3.0 (чиято цена варира според платформата) и значително по-евтин от Runway.
Кога да използвате Wan 2.7
Въз основа на първите тестове и силните страни на модела, ето сценариите, в които Wan 2.7 има най-голям смисъл:
Сложни сцени с множество обекти
Съдържание с много текст
Прецизен контрол на цвят и стил
Пренос на стил чрез референс
За по-прости сцени с един обект, където също ви трябва звук, модели като Kling 3.0 или Veo 3.1 може да са по-добрият избор. Допълнителното натоварване от планирането в Thinking Mode дава стойност точно когато промптовете са сложни.
Какво означава това за индустрията
Thinking Mode на Wan 2.7 сочи към по-широка промяна в начина на работа на генеративните модели. Вместо грубо генериране на изход от шум, бъдещите модели вероятно ще включват явни етапи на планиране за различни аспекти на генерирането.
Вече виждаме този модел в други области. Моделите за генериране на код планират преди да пишат. Моделите за изображения използват кондициониране по макет. Сега моделите за видео се учат да мислят, преди да създават.
Конкурентният натиск е реален. На фона на оттеглянето на Sora, намаляването на цените от Google и повишаването на качеството от китайски модели като Wan 2.7 и Kling 3.0, създателите на съдържание никога не са имали толкова много възможности и толкова причини да останат гъвкави.
За по-задълбочено сравнение на моделите по конкретни бенчмаркове, вижте нашия анализ на производителността на Runway Gen-4.5. А ако ви интересува как пускането на Seedance 2.0 променя екосистемата на CapCut, разгледахме го подробно миналия месец.

Инженер по ИИ от Лозана, който съчетава задълбочени изследвания с практични иновации. Разпределя времето си между архитектури на модели и алпийски върхове.
View profile →Свързани статии
Продължете да разглеждате с тези свързани публикации

Alibaba HappyHorse-1.0: непознатият модел, който оглави всички класации за AI видео
Модел на име HappyHorse-1.0 се появи на Artificial Analysis без указание за автора, изкачи се до първото място в text-to-video и image-to-video, а после се оказа разработка на Alibaba. Ето какво знаем за архитектурата, екипа и какво означава това за пазара на AI видео.

AI видео след Sora: 4 пазарни нива, които трябва да знаете през 2026
Sora се затваря на 26 април. Пазарът на AI видео се консолидира в четири нива. Практическо ръководство за избор на правилната алтернатива на Sora за вашите нужди.

Google Veo 3.1 стана безплатен: 10 AI видеа на месец за всеки акаунт в Google
Google отвори Veo 3.1 за всички лични акаунти с 10 безплатни видео генерации месечно. Ето какво получавате, какви са ограниченията и защо е важно за създателите на AI видео.