Alibaba Wan 2.7: ako režim premýšľania mení generovanie videa pomocou AI
Alibaba práve vydala Wan 2.7 s novým režimom premýšľania, ktorý plánuje kompozície pred generovaním videa. Rozoberáme, ako to funguje a čo to znamená pre tvorcov.

Čo je režim premýšľania?
Väčšina modelov na generovanie videa pracuje v jednom priechode. Napíšete prompt, model začne premieňať šum na pixely a dostanete to, čo z toho vyjde. Pri jednoduchých scénach to funguje celkom dobre, ale zlyháva to, keď prompty zahŕňajú viacero subjektov, špecifické priestorové vzťahy alebo zložité akcie.
Wan 2.7 pridáva medzikrok. Predtým, než sa vygeneruje jediný pixel, model:
- Analyzuje prompt a rozkladá ho na sémantické komponenty (subjekty, akcie, prostredie, osvetlenie)
- Naplánuje kompozíciu a určí, kde sa majú elementy objaviť a ako spolu majú interagovať
- Vygeneruje výstup s využitím tohto plánu ako štrukturálneho vodidla
Je to podobné tomu, ako "reťazové premýšľanie" zlepšilo veľké jazykové modely. Tým, že model prinútite myslieť pred konaním, sa kvalita výstupu dramaticky zvýši, najmä pri zložitých promptoch.
Kompletná sada Wan 2.7
Wan 2.7 nie je len jeden model. Ide o sadu štyroch modelov pokrývajúcich rôzne pracovné postupy generovania:
| Model | Vstup | Výstup | Najlepší pre |
|---|---|---|---|
| Text-to-Video | Textový prompt | Video klip | Tvorba od nuly |
| Image-to-Video | Obrázok + prompt | Video klip | Animácia statických obrázkov, konceptov |
| Reference-to-Video | Referenčné video + prompt | Nové video | Prenos štýlu, rekonštrukcia |
| Video Editing | Video + inštrukcie na úpravu | Upravené video | Postprodukcia, korekcie |
Model text-to-video je už dostupný na Together AI od 3. apríla. Zvyšné tri modely budú nasadzované v priebehu nasledujúcich týždňov.
Pod kapotou: detaily architektúry
Hoci Alibaba zatiaľ nepublikovala úplnú vedeckú prácu, niekoľko technických detailov vyplynulo z dokumentácie API a prvých benchmarkov.
| Čo vieme | Čím sa odlišuje |
|---|---|
| Postavený na architektonickej línii Wan (Wanxiang) | Prvý produkčný model s explicitným kompozičným plánovaním |
| Režim premýšľania pridáva plánovací priechod pred difúziou | Scény s viacerými elementmi zvládajú 5+ subjektov bez problémov |
| Hyperrealistická konzistencia postáv medzi snímkami | Text vykreslený v generovanom videu je čitateľný, nie skomolený |
| Presné riadenie farieb pomocou podmieneného promptovania | Presnosť farieb zostáva konzistentná pri zmenách osvetlenia |
| Lepšie vykresľovanie dlhšieho textu (text vo videu) | Zložité pohyby kamery zachovávajú priestorovú koherenciu |
Schopnosť vykresľovania dlhšieho textu je obzvlášť pozoruhodná. Predchádzajúce modely mali problémy s generovaním čitateľného textu vo video snímkach. Wan 2.7 zvláda nápisy, popisky a dokonca krátke odseky s prekvapujúcou presnosťou. Pre tvorcov, ktorí potrebujú textové prekrytia zapečené do generovaného materiálu, ide o zásadný posun vpred.
Porovnanie s konkurenciou
Oblasť AI videa sa tento týždeň výrazne premenila. Wan 2.7 dorazil presne vo chvíli, keď OpenAI potvrdilo ukončenie Sory a Google znížil ceny Veo 3.1.
| Model | Cena | Audio | Max. dĺžka | Konzistencia postáv | Premýšľanie/Plánovanie |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Nie | ~10s | Silná | Áno |
| Veo 3.1 Lite | $0.05/s | Áno | ~8s | Dobrá | Nie |
| Veo 3.1 Fast | $0.12/s | Áno | ~8s | Silná | Nie |
| Kling 3.0 | ~$0.08-0.17/s | Áno | ~10s | Silná | Nie |
| Seedance 2.0 | V balíku | Áno | 15s | Dobrá | Nie |
| Runway Gen-4.5 | ~$0.15/s | Nie | ~10s | Silná | Nie |
Cena $0.10 za sekundu zaraďuje Wan 2.7 do konkurenčného stredného pásma. Je dvakrát drahší ako rozpočtová varianta Lite od Google, porovnateľný s Kling 3.0 (ktorého cena sa líši podľa platformy) a výrazne lacnejší ako Runway.
Kedy použiť Wan 2.7
Na základe prvých testov a silných stránok modelu, tu sú scenáre, kde Wan 2.7 dáva najväčší zmysel:
Zložité scény s viacerými subjektmi
Obsah s veľkým množstvom textu
Presné riadenie farieb a štýlu
Prenos štýlu cez referenciu
Pre jednoduchšie scény s jedným subjektom, kde potrebujete aj zvuk, môžu byť modely ako Kling 3.0 alebo Veo 3.1 stále lepšou voľbou. Plánovacia réžia režimu premýšľania prináša hodnotu konkrétne vtedy, keď sú prompty zložité.
Čo to znamená pre odvetvie
Režim premýšľania Wan 2.7 ukazuje na širší posun vo fungovaní generatívnych modelov. Namiesto vytvárania výstupov hrubou silou zo šumu budú budúce modely pravdepodobne obsahovať explicitné plánovacie fázy pre rôzne aspekty generovania.
Tento vzorec už vidíme aj v iných oblastiach. Modely na generovanie kódu plánujú pred písaním. Obrazové modely používajú podmienené rozloženie. Teraz sa modely pre video učia premýšľať, než začnú tvoriť.
Konkurenčný tlak je reálny. Po odchode Sory, znížení cien zo strany Google a čínskych modeloch ako Wan 2.7 a Kling 3.0, ktoré posúvajú hranice kvality, tvorcovia nikdy nemali toľko možností ani toľko dôvodov zostať flexibilní.
Pre bližší pohľad na porovnanie týchto modelov v konkrétnych benchmarkoch si pozrite našu analýzu výkonu Runway Gen-4.5. A ak vás zaujíma, ako uvedenie Seedance 2.0 premieňa ekosystém CapCut, podrobne sme to opísali minulý mesiac.

AI inžinier z Lausanne, ktorý spája hĺbku výskumu s praktickými inováciami. Svoj čas delí medzi architektúry modelov a alpské vrcholy.
View profile →Súvisiace články
Pokračujte v objavovaní s týmito súvisiacimi príspevkami

Alibaba HappyHorse-1.0: Záhadný model, ktorý ovládol všetky rebríčky AI videa
Model s názvom HappyHorse-1.0 sa objavil na Artificial Analysis bez priradenia k akejkoľvek firme, vyšplhal sa na #1 v text-to-video aj image-to-video a potom sa ukázalo, že za ním stojí Alibaba. Tu je to, čo vieme o architektúre, tíme a čo to znamená pre trh s AI videom.

AI video po Sora: 4 úrovne trhu, ktoré musíte poznať v roku 2026
Sora sa zatvára 26. apríla. Trh s AI videom sa konsolidoval do štyroch úrovní. Praktický sprievodca výberom správnej alternatívy k Sora pre vaše potreby.

Google Veo 3.1 zadarmo: 10 AI videí mesačne pre každý účet Google
Google sprístupnil Veo 3.1 všetkým osobným účtom s 10 bezplatnými generáciami videa mesačne. Tu je prehľad toho, čo dostanete, aké sú limity a prečo je to dôležité pre tvorcov AI videí.