Alibaba Wan 2.7: jak režim přemýšlení mění generování videa pomocí AI
Alibaba právě vydala Wan 2.7 s novým režimem přemýšlení, který plánuje kompozice před generováním videa. Rozebíráme, jak to funguje a co to znamená pro tvůrce.

Co je režim přemýšlení?
Většina modelů pro generování videa pracuje v jednom průchodu. Napíšete prompt, model začne přetvářet šum na pixely a dostanete to, co z toho vzejde. U jednoduchých scén to funguje celkem dobře, ale selhává to, když prompty zahrnují více subjektů, specifické prostorové vztahy nebo složité akce.
Wan 2.7 přidává mezikrok. Než se vygeneruje jediný pixel, model:
- Analyzuje prompt a rozkládá jej na sémantické komponenty (subjekty, akce, prostředí, osvětlení)
- Naplánuje kompozici a určí, kde se mají elementy objevit a jak spolu mají interagovat
- Vygeneruje výstup s využitím tohoto plánu jako strukturálního vodítka
Je to podobné tomu, jak "řetězové přemýšlení" zlepšilo velké jazykové modely. Tím, že model přinutíte myslet dříve, než začne jednat, se kvalita výstupu dramaticky zvýší, zejména u složitých promptů.
Kompletní sada Wan 2.7
Wan 2.7 není jen jeden model. Jde o sadu čtyř modelů pokrývajících různé pracovní postupy generování:
| Model | Vstup | Výstup | Nejlepší pro |
|---|---|---|---|
| Text-to-Video | Textový prompt | Video klip | Tvorba od nuly |
| Image-to-Video | Obrázek + prompt | Video klip | Animace statických obrázků, konceptů |
| Reference-to-Video | Referenční video + prompt | Nové video | Přenos stylu, rekonstrukce |
| Video Editing | Video + instrukce pro úpravu | Upravené video | Postprodukce, korekce |
Model text-to-video je již dostupný na Together AI od 3. dubna. Zbývající tři modely budou nasazovány v průběhu následujících týdnů.
Pod kapotou: detaily architektury
Ačkoli Alibaba dosud nepublikovala kompletní vědeckou práci, několik technických detailů vyplynulo z dokumentace API a prvních benchmarků.
| Co víme | Čím se odlišuje |
|---|---|
| Postavený na architektonické linii Wan (Wanxiang) | První produkční model s explicitním kompozičním plánováním |
| Režim přemýšlení přidává plánovací průchod před difuzí | Scény s více elementy zvládají 5+ subjektů bez problémů |
| Hyperrealistická konzistence postav mezi snímky | Text vykreslený v generovaném videu je čitelný, ne zkomolený |
| Přesné řízení barev pomocí podmíněného promptování | Přesnost barev zůstává konzistentní při změnách osvětlení |
| Lepší vykreslování delšího textu (text ve videu) | Složité pohyby kamery zachovávají prostorovou koherenci |
Schopnost vykreslování delšího textu je obzvláště pozoruhodná. Předchozí modely měly problémy s generováním čitelného textu ve snímcích videa. Wan 2.7 zvládá nápisy, popisky a dokonce krátké odstavce s překvapivou přesností. Pro tvůrce, kteří potřebují textové překryvy zapečené do generovaného materiálu, jde o zásadní posun vpřed.
Srovnání s konkurencí
Oblast AI videa se tento týden výrazně proměnila. Wan 2.7 dorazil přesně ve chvíli, kdy OpenAI potvrdilo ukončení Sory a Google snížil ceny Veo 3.1.
| Model | Cena | Audio | Max. délka | Konzistence postav | Přemýšlení/Plánování |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Ne | ~10s | Silná | Ano |
| Veo 3.1 Lite | $0.05/s | Ano | ~8s | Dobrá | Ne |
| Veo 3.1 Fast | $0.12/s | Ano | ~8s | Silná | Ne |
| Kling 3.0 | ~$0.08-0.17/s | Ano | ~10s | Silná | Ne |
| Seedance 2.0 | V balíčku | Ano | 15s | Dobrá | Ne |
| Runway Gen-4.5 | ~$0.15/s | Ne | ~10s | Silná | Ne |
Cena $0.10 za sekundu řadí Wan 2.7 do konkurenčního středního pásma. Je dvakrát dražší než rozpočtová varianta Lite od Google, srovnatelný s Kling 3.0 (jehož cena se liší podle platformy) a výrazně levnější než Runway.
Kdy použít Wan 2.7
Na základě prvních testů a silných stránek modelu, zde jsou scénáře, kde Wan 2.7 dává největší smysl:
Složité scény s více subjekty
Obsah s velkým množstvím textu
Přesné řízení barev a stylu
Přenos stylu přes referenci
Pro jednodušší scény s jedním subjektem, kde potřebujete i zvuk, mohou být modely jako Kling 3.0 nebo Veo 3.1 stále lepší volbou. Plánovací režie režimu přemýšlení přináší hodnotu konkrétně tehdy, když jsou prompty složité.
Co to znamená pro odvětví
Režim přemýšlení Wan 2.7 ukazuje na širší posun ve fungování generativních modelů. Místo vytváření výstupů hrubou silou ze šumu budou budoucí modely pravděpodobně obsahovat explicitní plánovací fáze pro různé aspekty generování.
Tento vzorec už vidíme i v jiných oblastech. Modely pro generování kódu plánují před psaním. Obrazové modely používají podmíněné rozvržení. Nyní se modely pro video učí přemýšlet, než začnou tvořit.
Konkurenční tlak je reálný. Po odchodu Sory, snížení cen ze strany Google a čínských modelech jako Wan 2.7 a Kling 3.0, které posouvají hranice kvality, tvůrci nikdy neměli tolik možností ani tolik důvodů zůstat flexibilní.
Pro bližší pohled na porovnání těchto modelů v konkrétních benchmarcích se podívejte na naši analýzu výkonu Runway Gen-4.5. A pokud vás zajímá, jak uvedení Seedance 2.0 proměňuje ekosystém CapCut, detailně jsme to popsali minulý měsíc.

Inženýr AI z Lausanne, který propojuje hloubku výzkumu s praktickými inovacemi. Svůj čas dělí mezi architektury modelů a alpské vrcholy.
View profile →Související články
Pokračujte v objevování s těmito souvisejícími příspěvky

Alibaba HappyHorse-1.0: Záhadný model, který ovládl všechny žebříčky AI videa
Model jménem HappyHorse-1.0 se objevil na Artificial Analysis bez uvedení firmy, vyšplhal se na #1 v text-to-video i image-to-video a pak se ukázalo, že za ním stojí Alibaba. Tady je to, co víme o architektuře, týmu a co to znamená pro trh s AI videem.

Trh AI videa po Sora: 4 úrovně trhu v roce 2026
Sora končí 26. dubna. Trh AI videa se konsolidoval do čtyř jasných úrovní. Praktický průvodce výběrem správné alternativy k Sora.

Google Veo 3.1 zdarma: 10 AI videí měsíčně pro každý účet Google
Google zpřístupnil Veo 3.1 všem osobním účtům s 10 bezplatnými generacemi videa měsíčně. Tady je přehled toho, co dostanete, jaké jsou limity a proč je to důležité pro tvůrce AI videí.