Alibaba Wan 2.7: як Thinking Mode змінює генерацію відео за допомогою ШІ
Alibaba щойно випустила Wan 2.7 з новим режимом Thinking Mode, який планує композицію перед генерацією відео. Розбираємо, як це працює і що це означає для творців контенту.

Що таке Thinking Mode?
Більшість моделей генерації відео працюють в один прохід. Ви вводите промпт, модель починає перетворювати шум на пікселі, і ви отримуєте те, що вийшло. Для простих сцен це працює непогано, але розсипається, коли промпти включають кілька об'єктів, конкретні просторові відношення або складні дії.
Wan 2.7 додає проміжний етап. Перш ніж генерується хоча б один піксель, модель:
- Розбирає промпт на семантичні компоненти (суб'єкти, дії, середовище, освітлення)
- Планує композицію, визначаючи, де мають розташовуватися елементи і як вони повинні взаємодіяти
- Генерує результат, використовуючи цей план як структурний орієнтир
Це схоже на те, як ланцюжкове мислення (chain-of-thought) покращило великі мовні моделі. Змушуючи модель думати перед дією, якість результату різко зростає, особливо при роботі зі складними промптами.
Повний набір Wan 2.7
Wan 2.7 це не одна модель. Це набір з чотирьох моделей, що охоплюють різні робочі процеси генерації:
| Модель | Вхід | Вихід | Найкраще для |
|---|---|---|---|
| Текст-у-відео | Текстовий промпт | Відеокліп | Створення з нуля |
| Зображення-у-відео | Зображення + промпт | Відеокліп | Анімація стоп-кадрів, концепт-арт |
| Референс-у-відео | Референсне відео + промпт | Нове відео | Перенесення стилю, відтворення |
| Редагування відео | Відео + інструкції правок | Змінене відео | Постпродакшн, корекції |
Модель текст-у-відео вже доступна на Together AI з 3 квітня. Решта трьох моделей з'являться протягом найближчих тижнів.
Під капотом: архітектурні деталі
Хоча Alibaba ще не опублікувала повну статтю, низка технічних подробиць вже відома з документації API та перших бенчмарків.
| Що відомо | Чим вирізняється |
|---|---|
| Побудована на архітектурі Wan (Wanxiang) | Перша продакшн-модель з явним плануванням композиції |
| Thinking Mode додає етап планування перед дифузією | Сцени з багатьма елементами обробляють 5+ суб'єктів коректно |
| Гіперреалістична консистентність персонажів між кадрами | Текст у згенерованому відео читабельний, а не перетворений на безлад |
| Точне управління кольором через кондиціонування промпта | Точність кольорів зберігається при зміні освітлення |
| Покращений рендеринг довгого тексту (текст у відео) | Складні рухи камери зберігають просторову зв'язність |
Можливість рендерингу довгого тексту особливо примітна. Попередні моделі з трудом генерували розбірливий текст всередині відеокадрів. Wan 2.7 справляється з вивісками, підписами і навіть короткими абзацами з вражаючою точністю. Для творців, яким потрібен текст, вбудований у згенероване відео, це серйозний крок уперед.
Порівняння з конкурентами
Ринок ШІ-відео помітно зрушив цього тижня. Wan 2.7 з'явився одночасно з підтвердженням закриття Sora від OpenAI та зниженням цін на Veo 3.1 від Google.
| Модель | Ціна | Аудіо | Макс. тривалість | Консистентність персонажів | Thinking/Планування |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/с | Ні | ~10с | Висока | Так |
| Veo 3.1 Lite | $0.05/с | Так | ~8с | Добра | Ні |
| Veo 3.1 Fast | $0.12/с | Так | ~8с | Висока | Ні |
| Kling 3.0 | ~$0.08-0.17/с | Так | ~10с | Висока | Ні |
| Seedance 2.0 | У пакеті | Так | 15с | Добра | Ні |
| Runway Gen-4.5 | ~$0.15/с | Ні | ~10с | Висока | Ні |
Ціна $0.10 за секунду ставить Wan 2.7 у конкурентний середній сегмент. Це вдвічі дорожче за бюджетний варіант Lite від Google, порівнянно з Kling 3.0 (ціна якого варіюється залежно від платформи) і значно дешевше за Runway.
Коли використовувати Wan 2.7
Виходячи з перших тестів та сильних сторін моделі, ось сценарії, де Wan 2.7 має найбільший сенс:
Складні сцени з кількома об'єктами
Контент з великою кількістю тексту
Точне управління кольором і стилем
Перенесення стилю через референс
Для простіших сцен з одним об'єктом, де також потрібен звук, моделі на кшталт Kling 3.0 або Veo 3.1 можуть виявитися кращим вибором. Додаткове навантаження планування у Thinking Mode дає цінність саме тоді, коли промпти складні.
Що це означає для індустрії
Thinking Mode у Wan 2.7 вказує на ширший зсув у роботі генеративних моделей. Замість грубого перебору вихідних даних з шуму, майбутні моделі, найімовірніше, включатимуть явні етапи планування для різних аспектів генерації.
Ми вже спостерігаємо цей патерн в інших сферах. Моделі генерації коду планують перед написанням. Моделі зображень використовують кондиціонування за макетом. Тепер моделі відео вчаться думати, перш ніж створювати.
Конкурентний тиск реальний. На тлі відходу Sora, зниження цін Google та просування якості китайськими моделями на кшталт Wan 2.7 і Kling 3.0, у творців контенту ніколи не було стільки варіантів і стільки причин залишатися гнучкими.
Для детальнішого порівняння моделей на конкретних бенчмарках ознайомтеся з нашим аналізом продуктивності Runway Gen-4.5. А якщо вас цікавить, як запуск Seedance 2.0 змінює екосистему CapCut, ми детально розглянули це минулого місяця.

Інженер ШІ з Лозанни, який поєднує глибокі дослідження з практичними інноваціями. Ділить свій час між архітектурами моделей та альпійськими вершинами.
View profile →Схожі статті
Продовжуйте дослідження з цими схожими публікаціями

Alibaba HappyHorse-1.0: невідома модель, яка очолила всі рейтинги AI-відео
Модель під назвою HappyHorse-1.0 з'явилася на Artificial Analysis без зазначення автора, піднялася на перше місце у text-to-video та image-to-video, а потім виявилася розробкою Alibaba. Розбираємо архітектуру, команду та наслідки для ринку AI-відео.

AI-відео після Sora: 4 ринкові рівні, які варто знати у 2026
Sora закривається 26 квітня. Ринок AI-відео консолідувався в чотири рівні. Практичний посібник з вибору правильної альтернативи Sora для ваших потреб.

Google Veo 3.1 став безкоштовним: 10 AI-відео на місяць для кожного акаунту Google
Google відкрив Veo 3.1 для всіх особистих акаунтів з 10 безкоштовними генераціями відео щомісяця. Ось що ви отримуєте, які обмеження і чому це важливо для творців AI-відео.