Alibaba Wan 2.7: как режим Thinking Mode меняет генерацию видео с помощью ИИ
Alibaba выпустила Wan 2.7 с новым режимом Thinking Mode, который планирует композицию перед генерацией видео. Разбираем, как это работает и что это значит для создателей контента.

Что такое Thinking Mode?
Большинство моделей генерации видео работают в один проход. Вы вводите промпт, модель начинает преобразовывать шум в пиксели, и вы получаете то, что получилось. Для простых сцен это работает неплохо, но рассыпается, когда промпты включают несколько объектов, конкретные пространственные отношения или сложные действия.
Wan 2.7 добавляет промежуточный этап. Прежде чем генерируется хотя бы один пиксель, модель:
- Разбирает промпт на семантические компоненты (субъекты, действия, окружение, освещение)
- Планирует композицию, определяя, где должны располагаться элементы и как они должны взаимодействовать
- Генерирует результат, используя этот план как структурное руководство
Это похоже на то, как рассуждения по цепочке (chain-of-thought) улучшили большие языковые модели. Заставляя модель думать перед действием, качество результата резко возрастает, особенно при работе со сложными промптами.
Полный набор Wan 2.7
Wan 2.7 это не одна модель. Это набор из четырёх моделей, покрывающих разные рабочие процессы генерации:
| Модель | Вход | Выход | Лучше всего для |
|---|---|---|---|
| Текст-в-видео | Текстовый промпт | Видеоклип | Создание с нуля |
| Изображение-в-видео | Изображение + промпт | Видеоклип | Анимация стоп-кадров, концепт-арт |
| Референс-в-видео | Референсное видео + промпт | Новое видео | Перенос стиля, воссоздание |
| Редактирование видео | Видео + инструкции правок | Изменённое видео | Постпродакшн, коррекции |
Модель текст-в-видео уже доступна на Together AI с 3 апреля. Остальные три модели появятся в ближайшие недели.
Под капотом: архитектурные детали
Хотя Alibaba ещё не опубликовала полную статью, ряд технических подробностей уже известен из документации API и первых бенчмарков.
| Что известно | Чем выделяется |
|---|---|
| Построена на архитектуре Wan (Wanxiang) | Первая продакшн-модель с явным планированием композиции |
| Thinking Mode добавляет этап планирования перед диффузией | Сцены с множеством элементов обрабатывают 5+ субъектов корректно |
| Гиперреалистичная консистентность персонажей между кадрами | Текст в сгенерированном видео читаем, а не превращён в мешанину |
| Точное управление цветом через кондиционирование промпта | Точность цветов сохраняется при изменении освещения |
| Улучшенный рендеринг длинного текста (текст в видео) | Сложные движения камеры сохраняют пространственную связность |
Возможность рендеринга длинного текста особенно примечательна. Предыдущие модели с трудом генерировали разборчивый текст внутри видеокадров. Wan 2.7 справляется с вывесками, подписями и даже короткими абзацами с впечатляющей точностью. Для создателей, которым нужен текст, вшитый в сгенерированное видео, это серьёзный шаг вперёд.
Сравнение с конкурентами
Рынок ИИ-видео заметно сдвинулся на этой неделе. Wan 2.7 появился одновременно с подтверждением закрытия Sora от OpenAI и снижением цен на Veo 3.1 от Google.
| Модель | Цена | Аудио | Макс. длина | Консистентность персонажей | Thinking/Планирование |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/с | Нет | ~10с | Высокая | Да |
| Veo 3.1 Lite | $0.05/с | Да | ~8с | Хорошая | Нет |
| Veo 3.1 Fast | $0.12/с | Да | ~8с | Высокая | Нет |
| Kling 3.0 | ~$0.08-0.17/с | Да | ~10с | Высокая | Нет |
| Seedance 2.0 | В пакете | Да | 15с | Хорошая | Нет |
| Runway Gen-4.5 | ~$0.15/с | Нет | ~10с | Высокая | Нет |
Цена $0.10 за секунду ставит Wan 2.7 в конкурентный средний сегмент. Это вдвое дороже бюджетного варианта Lite от Google, сопоставимо с Kling 3.0 (цена которого варьируется в зависимости от платформы) и значительно дешевле Runway.
Когда использовать Wan 2.7
Исходя из первых тестов и сильных сторон модели, вот сценарии, где Wan 2.7 имеет наибольший смысл:
Сложные сцены с множеством объектов
Контент с большим количеством текста
Точное управление цветом и стилем
Перенос стиля через референс
Для более простых сцен с одним объектом, где также нужен звук, модели вроде Kling 3.0 или Veo 3.1 могут оказаться лучшим выбором. Дополнительная нагрузка планирования в Thinking Mode даёт ценность именно тогда, когда промпты сложные.
Что это значит для индустрии
Thinking Mode в Wan 2.7 указывает на более широкий сдвиг в работе генеративных моделей. Вместо грубого перебора выходных данных из шума будущие модели, скорее всего, будут включать явные этапы планирования для различных аспектов генерации.
Мы уже наблюдаем этот паттерн в других областях. Модели генерации кода планируют перед написанием. Модели изображений используют кондиционирование по макету. Теперь модели видео учатся думать, прежде чем создавать.
Конкурентное давление реально. На фоне ухода Sora, снижения цен Google и продвижения качества китайскими моделями вроде Wan 2.7 и Kling 3.0, у создателей контента никогда не было столько вариантов и столько причин оставаться гибкими.
Для более детального сравнения моделей на конкретных бенчмарках, ознакомьтесь с нашим анализом производительности Runway Gen-4.5. А если вам интересно, как запуск Seedance 2.0 меняет экосистему CapCut, мы подробно рассмотрели это в прошлом месяце.

Инженер ИИ из Лозанны, сочетающий глубину исследований с практическими инновациями. Делит время между архитектурами моделей и альпийскими вершинами.
View profile →Похожие статьи
Продолжите знакомство с этими похожими публикациями

Alibaba HappyHorse-1.0: неизвестная модель, которая возглавила все рейтинги AI-видео
Модель под названием HappyHorse-1.0 появилась на Artificial Analysis без указания автора, поднялась на первое место в генерации text-to-video и image-to-video, а затем оказалась разработкой Alibaba. Разбираем архитектуру, команду и последствия для рынка AI-видео.

AI-видео после Sora: 4 уровня рынка в 2026 году
Sora закрывается 26 апреля. Рынок AI-видео консолидировался в четыре уровня. Практическое руководство по выбору подходящей альтернативы Sora.

Google Veo 3.1 стал бесплатным: 10 AI-видео в месяц для каждого аккаунта Google
Google открыл Veo 3.1 для всех личных аккаунтов с 10 бесплатными генерациями видео в месяц. Что вы получаете, какие есть ограничения и почему это важно для создателей AI-видео.