Alibaba Wan 2.7: kako Thinking Mode menja generisanje videa pomoću veštačke inteligencije
Alibaba je upravo objavila Wan 2.7 sa novim režimom Thinking Mode koji planira kompoziciju pre generisanja videa. Analiziramo kako funkcioniše i šta to znači za kreatore sadržaja.

Spremni da kreirate sopstvene AI videozapise?
Pridružite se hiljadama kreatora koji koriste Bonega.ai
Šta je Thinking Mode?
Većina modela za generisanje videa radi u jednom prolazu. Unesete prompt, model počne da pretvara šum u piksele i dobijete ono što se dobilo. Za proste scene ovo radi solidno, ali se raspada kada promptovi uključuju više subjekata, konkretne prostorne odnose ili složene radnje.
Wan 2.7 dodaje međukorak. Pre nego što se generiše ijedan piksel, model:
- Raščlanjuje prompt na semantičke komponente (subjekti, radnje, okruženje, osvetljenje)
- Planira kompoziciju određujući gde treba da se nalaze elementi i kako treba da interaguju
- Generiše rezultat koristeći ovaj plan kao strukturni vodič
Ovo je slično načinu na koji je lančano razmišljanje (chain-of-thought) poboljšalo velike jezičke modele. Primoravajući model da razmisli pre nego što deluje, kvalitet izlaza drastično raste, naročito pri radu sa složenim promptovima.
Kompletan paket Wan 2.7
Wan 2.7 nije samo jedan model. To je paket od četiri modela koji pokrivaju različite radne tokove generisanja:
| Model | Ulaz | Izlaz | Najbolje za |
|---|---|---|---|
| Tekst-u-video | Tekstualni prompt | Video klip | Kreiranje od nule |
| Slika-u-video | Slika + prompt | Video klip | Animiranje stop-kadrova, koncept art |
| Referens-u-video | Referentni video + prompt | Novi video | Prenos stila, rekreacija |
| Uređivanje videa | Video + uputstva za izmene | Modifikovan video | Postprodukcija, korekcije |
Model tekst-u-video je već dostupan na Together AI od 3. aprila. Preostala tri modela biće dostupna u narednim nedeljama.
Ispod haube: arhitekturni detalji
Iako Alibaba još uvek nije objavila kompletan rad, niz tehničkih detalja već je poznat iz API dokumentacije i prvih benčmarkova.
| Šta znamo | Po čemu se izdvaja |
|---|---|
| Izgrađen na arhitekturi Wan (Wanxiang) | Prvi produkcijski model sa eksplicitnim planiranjem kompozicije |
| Thinking Mode dodaje korak planiranja pre difuzije | Scene sa više elemenata obrađuju 5+ subjekata korektno |
| Hiperrealistična konzistentnost likova između kadrova | Tekst u generisanom videu je čitljiv, ne iskvaren |
| Precizna kontrola boja kroz kondicioniranje prompta | Tačnost boja se održava pri promeni osvetljenja |
| Poboljšano renderovanje dugačkog teksta (tekst u videu) | Složeni pokreti kamere održavaju prostornu povezanost |
Sposobnost renderovanja dugačkog teksta je posebno značajna. Prethodni modeli su se mučili da generišu čitljiv tekst unutar video kadrova. Wan 2.7 se nosi sa tablama, natpisima, pa čak i kratkim pasusima sa impresivnom tačnošću. Za kreatore kojima je potreban tekst ugrađen u generisani video, ovo je ozbiljan korak napred.
Poređenje sa konkurencijom
Tržište VI videa značajno se pomerilo ove nedelje. Wan 2.7 je stigao istovremeno sa potvrdom gašenja Sora od strane OpenAI i sniženjem cena Veo 3.1 od strane Google-a.
| Model | Cena | Audio | Maks. dužina | Konzistentnost likova | Thinking/Planiranje |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Ne | ~10s | Visoka | Da |
| Veo 3.1 Lite | $0.05/s | Da | ~8s | Dobra | Ne |
| Veo 3.1 Fast | $0.12/s | Da | ~8s | Visoka | Ne |
| Kling 3.0 | ~$0.08-0.17/s | Da | ~10s | Visoka | Ne |
| Seedance 2.0 | U paketu | Da | 15s | Dobra | Ne |
| Runway Gen-4.5 | ~$0.15/s | Ne | ~10s | Visoka | Ne |
Cena od $0.10 po sekundi stavlja Wan 2.7 u konkurentni srednji segment. Dvostruko je skuplji od budžetske opcije Lite od Google-a, uporediv sa Kling 3.0 (čija cena varira u zavisnosti od platforme) i značajno jeftiniji od Runway-a.
Kada koristiti Wan 2.7
Na osnovu prvih testova i jakih strana modela, evo scenarija u kojima Wan 2.7 ima najviše smisla:
Složene scene sa više objekata
Sadržaj sa puno teksta
Precizna kontrola boje i stila
Prenos stila preko referense
Za jednostavnije scene sa jednim objektom, gde vam takođe treba zvuk, modeli poput Kling 3.0 ili Veo 3.1 mogu biti bolji izbor. Dodatno opterećenje planiranjem u Thinking Mode donosi vrednost tačno onda kada su promptovi složeni.
Šta ovo znači za industriju
Thinking Mode u Wan 2.7 ukazuje na širi pomak u načinu rada generativnih modela. Umesto grubog generisanja izlaza iz šuma, budući modeli će verovatno uključivati eksplicitne korake planiranja za različite aspekte generisanja.
Ovaj obrazac već vidimo u drugim oblastima. Modeli za generisanje koda planiraju pre pisanja. Modeli za slike koriste kondicioniranje po rasporedu. Sada modeli za video uče da razmišljaju pre nego što kreiraju.
Konkurentski pritisak je realan. Sa povlačenjem Sora, snižavanjem cena od strane Google-a i unapređivanjem kvaliteta kineskih modela poput Wan 2.7 i Kling 3.0, kreatori sadržaja nikada nisu imali više opcija i više razloga da ostanu fleksibilni.
Za detaljnije poređenje modela na konkretnim benčmarkovima, pogledajte našu analizu performansi Runway Gen-4.5. A ako vas zanima kako lansiranje Seedance 2.0 menja ekosistem CapCut-a, detaljno smo to obradili prošlog meseca.

AI inženjer iz Lozane koji kombinuje dubinu istraživanja sa praktičnim inovacijama. Deli vreme između arhitektura modela i alpskih vrhova.
View profile →Sviđa vam se ono što ste pročitali?
Pretvorite svoje ideje u AI videozapise neograničene dužine za nekoliko minuta.
Povezani članci
Nastavite istraživanje uz ove povezane objave

Alibaba HappyHorse-1.0: nepoznati model koji je zauzeo vrh svih AI video rangiranja
Model pod nazivom HappyHorse-1.0 pojavio se na Artificial Analysis bez navođenja autora, popeo se na prvo mesto u text-to-video i image-to-video, a onda se ispostavilo da je Alibaba iza njega. Evo šta znamo o arhitekturi, timu i šta to znači za tržište AI videa.

AI video nakon Sora: 4 tržišna nivoa koja treba da znate u 2026.
Sora se zatvara 26. aprila. Tržište AI videa se konsolidovalo u četiri nivoa. Praktičan vodič za izbor prave alternative Sora za vaše potrebe.

Google Veo 3.1 postao besplatan: 10 AI videa mesečno za svaki Google nalog
Google je otvorio Veo 3.1 za sve lične naloge sa 10 besplatnih generacija videa mesečno. Evo šta dobijate, koja su ograničenja i zašto je ovo važno za kreatore AI videa.