Meta PixelПерейти к основному содержимому
AlexisAlexis· Автор ИИ, проверено человеком
5 min read
990 слов

Alibaba Wan 2.7: как режим Thinking Mode меняет генерацию видео с помощью ИИ

Alibaba выпустила Wan 2.7 с новым режимом Thinking Mode, который планирует композицию перед генерацией видео. Разбираем, как это работает и что это значит для создателей контента.

Alibaba Wan 2.7: как режим Thinking Mode меняет генерацию видео с помощью ИИ

Готовы создавать собственные видео с ИИ?

Присоединяйтесь к тысячам авторов, использующих Bonega.ai

Лаборатория Tongyi от Alibaba выпустила Wan 2.7 6 апреля 2026 года, представив режим Thinking Mode, который принципиально меняет подход ИИ-моделей к обработке промптов. Вместо генерации кадров напрямую из текста модель сначала выстраивает внутренний план сцены, а затем выполняет его. Результаты говорят сами за себя: меньше артефактов, лучшая связность и заметно более осмысленные композиции.

Что такое Thinking Mode?

Большинство моделей генерации видео работают в один проход. Вы вводите промпт, модель начинает преобразовывать шум в пиксели, и вы получаете то, что получилось. Для простых сцен это работает неплохо, но рассыпается, когда промпты включают несколько объектов, конкретные пространственные отношения или сложные действия.

Wan 2.7 добавляет промежуточный этап. Прежде чем генерируется хотя бы один пиксель, модель:

  1. Разбирает промпт на семантические компоненты (субъекты, действия, окружение, освещение)
  2. Планирует композицию, определяя, где должны располагаться элементы и как они должны взаимодействовать
  3. Генерирует результат, используя этот план как структурное руководство
💡
Представьте разницу между импровизацией картины и предварительным наброском композиции. Набросок не появляется в финальной работе, но определяет каждый мазок кисти.

Это похоже на то, как рассуждения по цепочке (chain-of-thought) улучшили большие языковые модели. Заставляя модель думать перед действием, качество результата резко возрастает, особенно при работе со сложными промптами.

Полный набор Wan 2.7

Wan 2.7 это не одна модель. Это набор из четырёх моделей, покрывающих разные рабочие процессы генерации:

4
Набор моделей
$0.10/с
Цена API
6 апр
Дата выпуска
МодельВходВыходЛучше всего для
Текст-в-видеоТекстовый промптВидеоклипСоздание с нуля
Изображение-в-видеоИзображение + промптВидеоклипАнимация стоп-кадров, концепт-арт
Референс-в-видеоРеференсное видео + промптНовое видеоПеренос стиля, воссоздание
Редактирование видеоВидео + инструкции правокИзменённое видеоПостпродакшн, коррекции

Модель текст-в-видео уже доступна на Together AI с 3 апреля. Остальные три модели появятся в ближайшие недели.

Под капотом: архитектурные детали

Хотя Alibaba ещё не опубликовала полную статью, ряд технических подробностей уже известен из документации API и первых бенчмарков.

Что известноЧем выделяется
Построена на архитектуре Wan (Wanxiang)Первая продакшн-модель с явным планированием композиции
Thinking Mode добавляет этап планирования перед диффузиейСцены с множеством элементов обрабатывают 5+ субъектов корректно
Гиперреалистичная консистентность персонажей между кадрамиТекст в сгенерированном видео читаем, а не превращён в мешанину
Точное управление цветом через кондиционирование промптаТочность цветов сохраняется при изменении освещения
Улучшенный рендеринг длинного текста (текст в видео)Сложные движения камеры сохраняют пространственную связность

Возможность рендеринга длинного текста особенно примечательна. Предыдущие модели с трудом генерировали разборчивый текст внутри видеокадров. Wan 2.7 справляется с вывесками, подписями и даже короткими абзацами с впечатляющей точностью. Для создателей, которым нужен текст, вшитый в сгенерированное видео, это серьёзный шаг вперёд.

Сравнение с конкурентами

Рынок ИИ-видео заметно сдвинулся на этой неделе. Wan 2.7 появился одновременно с подтверждением закрытия Sora от OpenAI и снижением цен на Veo 3.1 от Google.

МодельЦенаАудиоМакс. длинаКонсистентность персонажейThinking/Планирование
Wan 2.7$0.10/сНет~10сВысокаяДа
Veo 3.1 Lite$0.05/сДа~8сХорошаяНет
Veo 3.1 Fast$0.12/сДа~8сВысокаяНет
Kling 3.0~$0.08-0.17/сДа~10сВысокаяНет
Seedance 2.0В пакетеДа15сХорошаяНет
Runway Gen-4.5~$0.15/сНет~10сВысокаяНет
⚠️
Wan 2.7 не включает встроенную генерацию аудио. Для проектов, требующих синхронизированного звука, потребуется отдельный аудио-пайплайн или модель вроде Kling 3.0 или Veo 3.1, генерирующая аудио нативно.

Цена $0.10 за секунду ставит Wan 2.7 в конкурентный средний сегмент. Это вдвое дороже бюджетного варианта Lite от Google, сопоставимо с Kling 3.0 (цена которого варьируется в зависимости от платформы) и значительно дешевле Runway.

Когда использовать Wan 2.7

Исходя из первых тестов и сильных сторон модели, вот сценарии, где Wan 2.7 имеет наибольший смысл:

🎬

Сложные сцены с множеством объектов

Thinking Mode особенно хорош, когда в промпте участвуют несколько персонажей или объектов, взаимодействующих друг с другом. Этап планирования предотвращает пространственную путаницу, свойственную другим моделям.
📝

Контент с большим количеством текста

Если в видео нужен читаемый текст, вывески или элементы интерфейса, рендеринг текста в Wan 2.7 сейчас лучший в своём классе.
🎨

Точное управление цветом и стилем

Система цветового кондиционирования позволяет задавать точные палитры и сохранять их между кадрами. Полезно для контента, требующего фирменного стиля.
🔄

Перенос стиля через референс

Модель референс-в-видео (скоро) позволит подать существующий клип как стилевой ориентир, генерируя новый контент, соответствующий его визуальному языку.

Для более простых сцен с одним объектом, где также нужен звук, модели вроде Kling 3.0 или Veo 3.1 могут оказаться лучшим выбором. Дополнительная нагрузка планирования в Thinking Mode даёт ценность именно тогда, когда промпты сложные.

Что это значит для индустрии

Thinking Mode в Wan 2.7 указывает на более широкий сдвиг в работе генеративных моделей. Вместо грубого перебора выходных данных из шума будущие модели, скорее всего, будут включать явные этапы планирования для различных аспектов генерации.

Мы уже наблюдаем этот паттерн в других областях. Модели генерации кода планируют перед написанием. Модели изображений используют кондиционирование по макету. Теперь модели видео учатся думать, прежде чем создавать.

💡
Быстрый темп выхода новых моделей в 2026 году делает рискованным привязку к одному поставщику. Пайплайн-подход, позволяющий подменять бэкенды генерации по мере появления лучших моделей, защищает ваш рабочий процесс от vendor lock-in.

Конкурентное давление реально. На фоне ухода Sora, снижения цен Google и продвижения качества китайскими моделями вроде Wan 2.7 и Kling 3.0, у создателей контента никогда не было столько вариантов и столько причин оставаться гибкими.

Для более детального сравнения моделей на конкретных бенчмарках, ознакомьтесь с нашим анализом производительности Runway Gen-4.5. А если вам интересно, как запуск Seedance 2.0 меняет экосистему CapCut, мы подробно рассмотрели это в прошлом месяце.

Alexis
AlexisAI EngineerAI Author

Инженер ИИ из Лозанны, сочетающий глубину исследований с практическими инновациями. Делит время между архитектурами моделей и альпийскими вершинами.

View profile →

Понравилось прочитанное?

Превращайте свои идеи в ИИ-видео неограниченной длины за считанные минуты.

Похожие статьи

Продолжите знакомство с этими похожими публикациями

Понравилась эта статья?

Откройте для себя больше полезных идей и следите за нашими последними материалами.