Alibaba Wan 2.7: як рэжым Thinking Mode змяняе генерацыю відэа з дапамогай ШІ
Alibaba выпусціла Wan 2.7 з новым рэжымам Thinking Mode, які плануе кампазіцыю перад генерацыяй відэа. Разбіраем, як гэта працуе і што гэта значыць для стваральнікаў кантэнту.

Што такое Thinking Mode?
Большасць мадэляў генерацыі відэа працуюць у адзін праход. Вы ўводзіце промпт, мадэль пачынае пераўтвараць шум у пікселі, і вы атрымліваеце тое, што атрымалася. Для простых сцэн гэта працуе нядрэнна, але разбураецца, калі промпты ўключаюць некалькі аб'ектаў, канкрэтныя прасторавыя суадносіны або складаныя дзеянні.
Wan 2.7 дадае прамежкавы этап. Перш чым генеруецца хоць адзін піксель, мадэль:
- Разбірае промпт на семантычныя кампаненты (суб'екты, дзеянні, асяроддзе, асвятленне)
- Плануе кампазіцыю, вызначаючы, дзе павінны размяшчацца элементы і як яны павінны ўзаемадзейнічаць
- Генеруе вынік, выкарыстоўваючы гэты план як структурны арыенцір
Гэта падобна на тое, як ланцужковае мысленне (chain-of-thought) палепшыла вялікія моўныя мадэлі. Прымушаючы мадэль думаць перад дзеяннем, якасць выніку рэзка ўзрастае, асабліва пры працы са складанымі промптамі.
Поўны набор Wan 2.7
Wan 2.7 гэта не адна мадэль. Гэта набор з чатырох мадэляў, якія ахопліваюць розныя працоўныя працэсы генерацыі:
| Мадэль | Уваход | Выхад | Лепш за ўсё для |
|---|---|---|---|
| Тэкст-у-відэа | Тэкставы промпт | Відэакліп | Стварэнне з нуля |
| Выява-ў-відэа | Выява + промпт | Відэакліп | Анімацыя стоп-кадраў, канцэпт-арт |
| Рэферэнс-у-відэа | Рэферэнснае відэа + промпт | Новае відэа | Перанос стылю, аднаўленне |
| Рэдагаванне відэа | Відэа + інструкцыі правак | Змененае відэа | Постпрадакшн, карэкцыі |
Мадэль тэкст-у-відэа ўжо даступная на Together AI з 3 красавіка. Астатнія тры мадэлі з'явяцца на працягу бліжэйшых тыдняў.
Пад капотам: архітэктурныя дэталі
Хаця Alibaba яшчэ не апублікавала поўны артыкул, шэраг тэхнічных падрабязнасцяў ужо вядомы з дакументацыі API і першых бенчмаркаў.
| Што вядома | Чым вылучаецца |
|---|---|
| Пабудавана на архітэктуры Wan (Wanxiang) | Першая прадакшн-мадэль з яўным планаваннем кампазіцыі |
| Thinking Mode дадае этап планавання перад дыфузіяй | Сцэны з мноствам элементаў апрацоўваюць 5+ суб'ектаў карэктна |
| Гіперрэалістычная кансістэнтнасць персанажаў паміж кадрамі | Тэкст у згенераваным відэа чытэльны, а не ператвораны ў блытаніну |
| Дакладнае кіраванне колерам праз кандыцыянаванне промпта | Дакладнасць колераў захоўваецца пры змене асвятлення |
| Палепшаны рэндэрынг доўгага тэксту (тэкст у відэа) | Складаныя рухі камеры захоўваюць прасторавую звязнасць |
Магчымасць рэндэрынгу доўгага тэксту асабліва прыкметная. Папярэднія мадэлі з цяжкасцю генеравалі разборлівы тэкст усярэдзіне відэакадраў. Wan 2.7 спраўляецца з шыльдамі, подпісамі і нават кароткімі абзацамі з уражальнай дакладнасцю. Для стваральнікаў, якім патрэбны тэкст, убудаваны ў згенераванае відэа, гэта сур'ёзны крок наперад.
Параўнанне з канкурэнтамі
Рынак ШІ-відэа прыкметна зрушыўся на гэтым тыдні. Wan 2.7 з'явіўся адначасова з пацвярджэннем закрыцця Sora ад OpenAI і зніжэннем цэн на Veo 3.1 ад Google.
| Мадэль | Цана | Аўдыё | Макс. працягласць | Кансістэнтнасць персанажаў | Thinking/Планаванне |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/с | Не | ~10с | Высокая | Так |
| Veo 3.1 Lite | $0.05/с | Так | ~8с | Добрая | Не |
| Veo 3.1 Fast | $0.12/с | Так | ~8с | Высокая | Не |
| Kling 3.0 | ~$0.08-0.17/с | Так | ~10с | Высокая | Не |
| Seedance 2.0 | У пакеце | Так | 15с | Добрая | Не |
| Runway Gen-4.5 | ~$0.15/с | Не | ~10с | Высокая | Не |
Цана $0.10 за секунду ставіць Wan 2.7 у канкурэнтны сярэдні сегмент. Гэта ўдвая даражэй за бюджэтны варыянт Lite ад Google, супастаўна з Kling 3.0 (цана якога вар'іруецца ў залежнасці ад платформы) і значна танней за Runway.
Калі выкарыстоўваць Wan 2.7
Зыходзячы з першых тэстаў і моцных бакоў мадэлі, вось сцэнарыі, дзе Wan 2.7 мае найбольшы сэнс:
Складаныя сцэны з мноствам аб'ектаў
Кантэнт з вялікай колькасцю тэксту
Дакладнае кіраванне колерам і стылем
Перанос стылю праз рэферэнс
Для прасцейшых сцэн з адным аб'ектам, дзе таксама патрэбны гук, мадэлі кшталту Kling 3.0 або Veo 3.1 могуць аказацца лепшым выбарам. Дадатковая нагрузка планавання ў Thinking Mode дае каштоўнасць менавіта тады, калі промпты складаныя.
Што гэта значыць для індустрыі
Thinking Mode у Wan 2.7 указвае на шырэйшы зрух у працы генератыўных мадэляў. Замест грубага перабору выхадных даных з шуму, будучыя мадэлі, хутчэй за ўсё, будуць уключаць яўныя этапы планавання для розных аспектаў генерацыі.
Мы ўжо назіраем гэты патэрн у іншых сферах. Мадэлі генерацыі коду плануюць перад напісаннем. Мадэлі выяў выкарыстоўваюць кандыцыянаванне па макеце. Цяпер мадэлі відэа вучацца думаць, перш чым ствараць.
Канкурэнтны ціск рэальны. На фоне адыходу Sora, зніжэння цэн Google і прасоўвання якасці кітайскімі мадэлямі кшталту Wan 2.7 і Kling 3.0, у стваральнікаў кантэнту ніколі не было столькі варыянтаў і столькі прычын заставацца гнуткімі.
Для больш дэталёвага параўнання мадэляў на канкрэтных бенчмарках азнаёмцеся з нашым аналізам прадукцыйнасці Runway Gen-4.5. А калі вас цікавіць, як запуск Seedance 2.0 змяняе экасістэму CapCut, мы падрабязна разгледзелі гэта ў мінулым месяцы.

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.
View profile →Спадабалася прачытанае?
Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.
Падобныя артыкулы
Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Alibaba HappyHorse-1.0: невядомая мадэль, якая ўзначаліла ўсе рэйтынгі AI-відэа
Мадэль пад назвай HappyHorse-1.0 з'явілася на Artificial Analysis без указання аўтара, паднялася на першае месца ў text-to-video і image-to-video, а потым аказалася распрацоўкай Alibaba. Разбіраем архітэктуру, каманду і наступствы для рынку AI-відэа.

Google Veo 3.1 стаў бясплатным: 10 AI-відэа на месяц для кожнага акаўнта Google
Google адкрыў Veo 3.1 для ўсіх асабістых акаўнтаў з 10 бясплатнымі генерацыямі відэа штомесяц. Вось што вы атрымліваеце, якія абмежаванні і чаму гэта важна для стваральнікаў AI-відэа.

Google Veo 3.1 Lite: танная генерацыя відэа праз Gemini API
Google выпусціла Veo 3.1 Lite, хуткую і танную мадэль генерацыі відэа ў Gemini API. Разбіраемся ў цэнах, кампрамісах па якасці і тым, як убудаваць відэа ў прадакшн-прыкладанні.