Meta PixelПерайсці да асноўнага змесціва
AlexisAlexis· аўтар ШІ, праверана чалавекам
5 min read
995 слоў

Alibaba Wan 2.7: як рэжым Thinking Mode змяняе генерацыю відэа з дапамогай ШІ

Alibaba выпусціла Wan 2.7 з новым рэжымам Thinking Mode, які плануе кампазіцыю перад генерацыяй відэа. Разбіраем, як гэта працуе і што гэта значыць для стваральнікаў кантэнту.

Alibaba Wan 2.7: як рэжым Thinking Mode змяняе генерацыю відэа з дапамогай ШІ

Гатовыя ствараць уласныя ШІ-відэа?

Далучайцеся да тысяч стваральнікаў, якія карыстаюцца Bonega.ai

Лабараторыя Tongyi ад Alibaba выпусціла Wan 2.7 6 красавіка 2026 года, прадставіўшы рэжым Thinking Mode, які прынцыпова змяняе падыход ШІ-мадэляў да апрацоўкі промптаў. Замест генерацыі кадраў непасрэдна з тэксту мадэль спачатку будуе ўнутраны план сцэны, а потым выконвае яго. Вынікі гавораць самі за сябе: менш артэфактаў, лепшая звязнасць і прыкметна больш асэнсаваныя кампазіцыі.

Што такое Thinking Mode?

Большасць мадэляў генерацыі відэа працуюць у адзін праход. Вы ўводзіце промпт, мадэль пачынае пераўтвараць шум у пікселі, і вы атрымліваеце тое, што атрымалася. Для простых сцэн гэта працуе нядрэнна, але разбураецца, калі промпты ўключаюць некалькі аб'ектаў, канкрэтныя прасторавыя суадносіны або складаныя дзеянні.

Wan 2.7 дадае прамежкавы этап. Перш чым генеруецца хоць адзін піксель, мадэль:

  1. Разбірае промпт на семантычныя кампаненты (суб'екты, дзеянні, асяроддзе, асвятленне)
  2. Плануе кампазіцыю, вызначаючы, дзе павінны размяшчацца элементы і як яны павінны ўзаемадзейнічаць
  3. Генеруе вынік, выкарыстоўваючы гэты план як структурны арыенцір
💡
Уявіце розніцу паміж імправізацыяй карціны і папярэднім эскізам кампазіцыі. Эскіз не з'яўляецца ў фінальнай працы, але вызначае кожны мазок пэндзля.

Гэта падобна на тое, як ланцужковае мысленне (chain-of-thought) палепшыла вялікія моўныя мадэлі. Прымушаючы мадэль думаць перад дзеяннем, якасць выніку рэзка ўзрастае, асабліва пры працы са складанымі промптамі.

Поўны набор Wan 2.7

Wan 2.7 гэта не адна мадэль. Гэта набор з чатырох мадэляў, якія ахопліваюць розныя працоўныя працэсы генерацыі:

4
Набор мадэляў
$0.10/с
Цана API
6 крас
Дата выпуску
МадэльУваходВыхадЛепш за ўсё для
Тэкст-у-відэаТэкставы промптВідэакліпСтварэнне з нуля
Выява-ў-відэаВыява + промптВідэакліпАнімацыя стоп-кадраў, канцэпт-арт
Рэферэнс-у-відэаРэферэнснае відэа + промптНовае відэаПеранос стылю, аднаўленне
Рэдагаванне відэаВідэа + інструкцыі правакЗмененае відэаПостпрадакшн, карэкцыі

Мадэль тэкст-у-відэа ўжо даступная на Together AI з 3 красавіка. Астатнія тры мадэлі з'явяцца на працягу бліжэйшых тыдняў.

Пад капотам: архітэктурныя дэталі

Хаця Alibaba яшчэ не апублікавала поўны артыкул, шэраг тэхнічных падрабязнасцяў ужо вядомы з дакументацыі API і першых бенчмаркаў.

Што вядомаЧым вылучаецца
Пабудавана на архітэктуры Wan (Wanxiang)Першая прадакшн-мадэль з яўным планаваннем кампазіцыі
Thinking Mode дадае этап планавання перад дыфузіяйСцэны з мноствам элементаў апрацоўваюць 5+ суб'ектаў карэктна
Гіперрэалістычная кансістэнтнасць персанажаў паміж кадраміТэкст у згенераваным відэа чытэльны, а не ператвораны ў блытаніну
Дакладнае кіраванне колерам праз кандыцыянаванне промптаДакладнасць колераў захоўваецца пры змене асвятлення
Палепшаны рэндэрынг доўгага тэксту (тэкст у відэа)Складаныя рухі камеры захоўваюць прасторавую звязнасць

Магчымасць рэндэрынгу доўгага тэксту асабліва прыкметная. Папярэднія мадэлі з цяжкасцю генеравалі разборлівы тэкст усярэдзіне відэакадраў. Wan 2.7 спраўляецца з шыльдамі, подпісамі і нават кароткімі абзацамі з уражальнай дакладнасцю. Для стваральнікаў, якім патрэбны тэкст, убудаваны ў згенераванае відэа, гэта сур'ёзны крок наперад.

Параўнанне з канкурэнтамі

Рынак ШІ-відэа прыкметна зрушыўся на гэтым тыдні. Wan 2.7 з'явіўся адначасова з пацвярджэннем закрыцця Sora ад OpenAI і зніжэннем цэн на Veo 3.1 ад Google.

МадэльЦанаАўдыёМакс. працягласцьКансістэнтнасць персанажаўThinking/Планаванне
Wan 2.7$0.10/сНе~10сВысокаяТак
Veo 3.1 Lite$0.05/сТак~8сДобраяНе
Veo 3.1 Fast$0.12/сТак~8сВысокаяНе
Kling 3.0~$0.08-0.17/сТак~10сВысокаяНе
Seedance 2.0У пакецеТак15сДобраяНе
Runway Gen-4.5~$0.15/сНе~10сВысокаяНе
⚠️
Wan 2.7 не ўключае ўбудаваную генерацыю аўдыё. Для праектаў, якія патрабуюць сінхранізаванага гуку, спатрэбіцца асобны аўдыё-пайплайн або мадэль кшталту Kling 3.0 ці Veo 3.1, якая генеруе аўдыё натыўна.

Цана $0.10 за секунду ставіць Wan 2.7 у канкурэнтны сярэдні сегмент. Гэта ўдвая даражэй за бюджэтны варыянт Lite ад Google, супастаўна з Kling 3.0 (цана якога вар'іруецца ў залежнасці ад платформы) і значна танней за Runway.

Калі выкарыстоўваць Wan 2.7

Зыходзячы з першых тэстаў і моцных бакоў мадэлі, вось сцэнарыі, дзе Wan 2.7 мае найбольшы сэнс:

🎬

Складаныя сцэны з мноствам аб'ектаў

Thinking Mode асабліва добра працуе, калі ў промпце задзейнічана некалькі персанажаў або аб'ектаў, якія ўзаемадзейнічаюць. Этап планавання прадухіляе прасторавую блытаніну, уласцівую іншым мадэлям.
📝

Кантэнт з вялікай колькасцю тэксту

Калі ў відэа патрэбны чытэльны тэкст, шыльды або элементы інтэрфейсу, рэндэрынг тэксту ў Wan 2.7 зараз лепшы ў сваім класе.
🎨

Дакладнае кіраванне колерам і стылем

Сістэма каляровага кандыцыянавання дазваляе задаваць дакладныя палітры і захоўваць іх паміж кадрамі. Карысна для кантэнту з фірмовым стылем.
🔄

Перанос стылю праз рэферэнс

Мадэль рэферэнс-у-відэа (хутка) дазволіць падаць існуючы кліп як стылёвы арыенцір, генеруючы новы кантэнт, які адпавядае яго візуальнай мове.

Для прасцейшых сцэн з адным аб'ектам, дзе таксама патрэбны гук, мадэлі кшталту Kling 3.0 або Veo 3.1 могуць аказацца лепшым выбарам. Дадатковая нагрузка планавання ў Thinking Mode дае каштоўнасць менавіта тады, калі промпты складаныя.

Што гэта значыць для індустрыі

Thinking Mode у Wan 2.7 указвае на шырэйшы зрух у працы генератыўных мадэляў. Замест грубага перабору выхадных даных з шуму, будучыя мадэлі, хутчэй за ўсё, будуць уключаць яўныя этапы планавання для розных аспектаў генерацыі.

Мы ўжо назіраем гэты патэрн у іншых сферах. Мадэлі генерацыі коду плануюць перад напісаннем. Мадэлі выяў выкарыстоўваюць кандыцыянаванне па макеце. Цяпер мадэлі відэа вучацца думаць, перш чым ствараць.

💡
Хуткі тэмп выпуску новых мадэляў у 2026 годзе робіць рызыкоўнай прывязку да аднаго пастаўшчыка. Пайплайн-падыход, які дазваляе падмяняць бэкенды генерацыі па меры з'яўлення лепшых мадэляў, абараняе ваш працоўны працэс ад vendor lock-in.

Канкурэнтны ціск рэальны. На фоне адыходу Sora, зніжэння цэн Google і прасоўвання якасці кітайскімі мадэлямі кшталту Wan 2.7 і Kling 3.0, у стваральнікаў кантэнту ніколі не было столькі варыянтаў і столькі прычын заставацца гнуткімі.

Для больш дэталёвага параўнання мадэляў на канкрэтных бенчмарках азнаёмцеся з нашым аналізам прадукцыйнасці Runway Gen-4.5. А калі вас цікавіць, як запуск Seedance 2.0 змяняе экасістэму CapCut, мы падрабязна разгледзелі гэта ў мінулым месяцы.

Alexis
AlexisAI EngineerAI Author

Інжынер ШІ з Лазаны, які спалучае глыбіню даследаванняў з практычнымі інавацыямі. Дзеліць час паміж архітэктурамі мадэляў і альпійскімі вяршынямі.

View profile →

Спадабалася прачытанае?

Пераўтварайце свае ідэі ў ШІ-відэа неабмежаванай працягласці за лічаныя хвіліны.

Падобныя артыкулы

Працягвайце знаёмства з гэтымі падобнымі артыкуламі

Вам спадабаўся гэты артыкул?

Адкрыйце для сябе больш карыснай інфармацыі і сачыце за нашым новым кантэнтам.