Meta PixelPreskoči na glavni sadržaj
AlexisAlexis· Autor AI, pregledano od strane čovjeka
6 min read
1032 riječi

Alibaba Wan 2.7: kako način razmišljanja mijenja generiranje videa pomoću AI-ja

Alibaba je upravo objavila Wan 2.7 s novim načinom razmišljanja koji planira kompozicije prije generiranja videa. Analiziramo kako funkcionira i što to znači za kreatore.

Alibaba Wan 2.7: kako način razmišljanja mijenja generiranje videa pomoću AI-ja

Spremni za izradu vlastitih AI videozapisa?

Pridružite se tisućama autora koji koriste Bonega.ai

Laboratorij Tongyi tvrtke Alibaba objavio je Wan 2.7 dana 6. travnja 2026., uvodeći "način razmišljanja" koji iz temelja mijenja kako AI video modeli obrađuju promptove. Umjesto izravnog generiranja kadrova iz teksta, model najprije gradi interni plan scene, a zatim ga provodi. Rezultati govore sami za sebe: manje artefakata, bolja koherencija i zamjetno promišljenije kompozicije.

Što je način razmišljanja?

Većina modela za generiranje videa radi u jednom prolazu. Upišete prompt, model počne pretvarati šum u piksele i dobijete što god izađe. Ovo funkcionira prilično dobro za jednostavne scene, ali zakazuje kada promptovi uključuju više subjekata, specifične prostorne odnose ili složene radnje.

Wan 2.7 dodaje međukorak. Prije nego što se generira ijedan piksel, model:

  1. Raščlanjuje prompt na semantičke komponente (subjekti, radnje, okolina, osvjetljenje)
  2. Planira kompoziciju određujući gdje se elementi trebaju pojaviti i kako trebaju međusobno djelovati
  3. Generira izlaz koristeći ovaj plan kao strukturalni vodič
💡
Zamislite to kao razliku između improviziranja slike i prethodnog skiciranja kompozicijske studije. Skica se ne pojavljuje u gotovom djelu, ali oblikuje svaki potez kista.

Ovo je slično načinu na koji je "lančano razmišljanje" poboljšalo velike jezične modele. Prisiljavanjem modela da razmisli prije nego što djeluje, kvaliteta izlaza dramatično raste, posebno kod složenih promptova.

Kompletni paket Wan 2.7

Wan 2.7 nije samo jedan model. Dolazi kao paket od četiri modela koji pokrivaju različite radne tokove generiranja:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelUlazIzlazNajbolji za
Text-to-VideoTekstualni promptVideo isječakStvaranje od nule
Image-to-VideoSlika + promptVideo isječakAnimiranje fotografija, konceptualnih radova
Reference-to-VideoReferentni video + promptNovi videoPrijenos stila, rekonstrukcija
Video EditingVideo + upute za uređivanjeModificirani videoPostprodukcija, korekcije

Model text-to-video već je dostupan na Together AI od 3. travnja. Preostala tri modela postupno se objavljuju tijekom sljedećih tjedana.

Ispod haube: uvidi u arhitekturu

Iako Alibaba još nije objavila potpuni znanstveni rad, nekoliko tehničkih detalja proizašlo je iz API dokumentacije i ranih benchmarkova.

Što znamoŠto ga izdvaja
Izgrađen na arhitektonskoj liniji Wan (Wanxiang)Prvi produkcijski model s eksplicitnim kompozicijskim planiranjem
Način razmišljanja dodaje fazu planiranja prije difuzijeScene s više elemenata čisto obrađuju 5+ subjekata
Hiperrealističan konzistentnost likova između kadrovaTekst prikazan u generiranom videu je čitljiv, ne iskrivljen
Precizna kontrola boja putem uvjetovanog promptovanjaTočnost boja ostaje konzistentna pri promjenama osvjetljenja
Bolje prikazivanje dugog teksta (tekst u videu)Složeni pokreti kamere održavaju prostornu koherenciju

Sposobnost prikazivanja dugog teksta posebno je vrijedna pozornosti. Prethodni modeli imali su problema s generiranjem čitljivog teksta unutar video kadrova. Wan 2.7 obrađuje znakove, oznake, pa čak i kratke odlomke s iznenađujućom točnošću. Za kreatore kojima trebaju tekstualni slojevi ugrađeni u generirani materijal, ovo je značajan korak naprijed.

Usporedba s konkurencijom

Područje AI videa značajno se promijenilo ovog tjedna. Wan 2.7 stigao je upravo kada je OpenAI potvrdio gašenje Sore, a Google snizio cijene Veo 3.1.

ModelCijenaAudioMaks. duljinaKonzistentnost likovaRazmišljanje/Planiranje
Wan 2.7$0.10/sNe~10sJakaDa
Veo 3.1 Lite$0.05/sDa~8sDobraNe
Veo 3.1 Fast$0.12/sDa~8sJakaNe
Kling 3.0~$0.08-0.17/sDa~10sJakaNe
Seedance 2.0U paketuDa15sDobraNe
Runway Gen-4.5~$0.15/sNe~10sJakaNe
⚠️
Wan 2.7 ne uključuje nativno generiranje zvuka. Za projekte koji zahtijevaju sinkronizirani zvuk trebat ćete zasebni audio pipeline ili model poput Kling 3.0 ili Veo 3.1 koji generira zvuk nativno.

Cijena od $0.10 po sekundi stavlja Wan 2.7 u konkurentni srednji raspon. Dvostruko je skuplji od Googleove budžetne Lite opcije, usporediv s Kling 3.0 (čija cijena varira ovisno o platformi) i znatno jeftiniji od Runwaya.

Kada koristiti Wan 2.7

Na temelju ranih testiranja i prednosti modela, ovo su scenariji u kojima Wan 2.7 ima najviše smisla:

🎬

Složene scene s više subjekata

Način razmišljanja se ističe kada vaš prompt uključuje više likova ili objekata u interakciji. Korak planiranja sprječava prostornu konfuziju koja muči druge modele.
📝

Sadržaj s puno teksta

Ako vaš video treba čitljiv tekst, znakove ili elemente korisničkog sučelja, prikazivanje teksta u Wan 2.7 trenutno je najbolje u klasi.
🎨

Precizna kontrola boja i stila

Sustav uvjetovanja bojama omogućuje specificiranje točnih paleta i njihovo održavanje kroz kadrove, korisno za sadržaj usklađen s brendom.
🔄

Prijenos stila putem reference

Model reference-to-video (uskoro dostupan) omogućit će vam unos postojećeg isječka kao stilskog vodiča, generirajući novi sadržaj koji odgovara njegovom vizualnom jeziku.

Za jednostavnije scene s jednim subjektom gdje trebate i zvuk, modeli poput Kling 3.0 ili Veo 3.1 mogu i dalje biti bolji izbor. Dodatni teret planiranja u načinu razmišljanja donosi vrijednost specifično kada su promptovi složeni.

Što to znači za industriju

Način razmišljanja Wan 2.7 ukazuje na širi pomak u načinu rada generativnih modela. Umjesto iznuđivanja rezultata iz šuma grubom silom, budući modeli vjerojatno će uključivati eksplicitne faze planiranja za različite aspekte generiranja.

Ovaj obrazac već vidimo u drugim područjima. Modeli za generiranje koda planiraju prije pisanja. Modeli za slike koriste uvjetovano raspoređivanje. Sada modeli za video uče razmišljati prije nego što krenu stvarati.

💡
Brzi tempo objave modela u 2026. čini rizičnim vezivanje za jednog dobavljača. Pristupi temeljeni na pipelineu koji mogu zamjenjivati generacijske backendove kako se pojavljuju bolji modeli štite vaš radni tok od ovisnosti o dobavljaču.

Konkurentski pritisak je stvaran. Nakon povlačenja Sore, sniženja cijena od strane Googlea i kineskih modela poput Wan 2.7 i Kling 3.0 koji pomiču granice kvalitete, kreatori nikada nisu imali više opcija niti više razloga ostati fleksibilni.

Za detaljniji pogled na usporedbu ovih modela u specifičnim benchmarkovima, pogledajte našu analizu performansi Runway Gen-4.5. A ako vas zanima kako objava Seedance 2.0 preoblikuje ekosustav CapCut, detaljno smo to pokrili prošlog mjeseca.

Alexis
AlexisAI EngineerAI Author

AI inženjer iz Lausanne koji spaja dubinu istraživanja s praktičnim inovacijama. Dijeli vrijeme između arhitektura modela i alpskih vrhova.

View profile →

Sviđa vam se ono što ste pročitali?

Pretvorite svoje ideje u AI videozapise neograničene duljine u nekoliko minuta.

Povezani članci

Nastavite istraživati uz ove povezane objave

Svidio vam se ovaj članak?

Otkrijte više uvida i ostanite u tijeku s našim najnovijim sadržajem.