Alibaba Wan 2.7: Kaip mąstymo režimas keičia DI vaizdo įrašų generavimą
Alibaba ką tik išleido Wan 2.7 su nauju mąstymo režimu, kuris planuoja kompozicijas prieš generuojant vaizdo įrašą. Nagrinėjame, kaip tai veikia ir ką tai reiškia kūrėjams.

Kas yra mąstymo režimas?
Dauguma vaizdo įrašų generavimo modelių veikia vienu žingsniu. Įvedate užklausą, modelis pradeda paversti triukšmą pikseliais, ir gaunate tai, kas išeina. Tai pakankamai gerai veikia paprastoms scenoms, tačiau nepavyksta, kai užklausos apima kelis subjektus, konkrečius erdvinius santykius ar sudėtingus veiksmus.
Wan 2.7 prideda tarpinį žingsnį. Prieš generuojant bet kokius pikselius, modelis:
- Išanalizuoja užklausą į semantinius komponentus (subjektai, veiksmai, aplinka, apšvietimas)
- Suplanuoja kompoziciją, nustatydamas, kur elementai turėtų atsirasti ir kaip jie turėtų sąveikauti
- Sugeneruoja rezultatą, naudodamas šį planą kaip struktūrinį vadovą
Tai panašu į tai, kaip "minčių grandinės" samprotavimas pagerino didelius kalbos modelius. Priverčiant modelį mąstyti prieš veikiant, rezultatų kokybė dramatiškai pagerėja, ypač sudėtingų užklausų atveju.
Visas Wan 2.7 rinkinys
Wan 2.7 nėra tik vienas modelis. Jis pristatomas kaip keturių modelių rinkinys, apimantis skirtingas generavimo darbo eigas:
| Modelis | Įvestis | Išvestis | Geriausiai tinka |
|---|---|---|---|
| Tekstas-į-vaizdo įrašą | Teksto užklausa | Vaizdo klipas | Kūrimas nuo nulio |
| Vaizdas-į-vaizdo įrašą | Vaizdas + užklausa | Vaizdo klipas | Statiškų vaizdų animavimas, koncepcijų menas |
| Nuoroda-į-vaizdo įrašą | Nuorodos vaizdo įrašas + užklausa | Naujas vaizdo įrašas | Stiliaus perkėlimas, atkūrimas |
| Vaizdo redagavimas | Vaizdo įrašas + redagavimo instrukcijos | Modifikuotas vaizdo įrašas | Postprodukcija, korekcijos |
Tekstas-į-vaizdo įrašą modelis jau veikia Together AI platformoje nuo balandžio 3 d. Likusieji trys modeliai bus prieinami per artimiausias savaites.
Po gaubtu: architektūros įžvalgos
Nors Alibaba dar nepaskelbė viso mokslinio straipsnio, keletas techninių detalių paaiškėjo iš API dokumentacijos ir ankstyvų lyginamųjų testų.
| Ką žinome | Kuo tai išsiskiria |
|---|---|
| Sukurtas remiantis Wan (Wanxiang) architektūros linija | Pirmasis produkcinis modelis su aiškiu kompozicijos planavimu |
| Mąstymo režimas prideda planavimo žingsnį prieš difuziją | Daugelio elementų scenos tvarko 5+ subjektus švariai |
| Hiperrealistiškas veikėjų nuoseklumas tarp kadrų | Teksto atvaizdavimas sugeneruotame vaizdo įraše yra skaitomas, ne neaiškus |
| Tiksli spalvų kontrolė per užklausos sąlygojimą | Spalvų tikslumas išlieka pastovus keičiantis apšvietimui |
| Puikus ilgo teksto atvaizdavimas (tekstas vaizdo įrašuose) | Sudėtingi kameros judesiai išlaiko erdvinę darną |
Ilgo teksto atvaizdavimo galimybė yra ypač pastebima. Ankstesni modeliai sunkiai generavo įskaitomą tekstą vaizdo kadrų viduje. Wan 2.7 susitvarko su iškabomis, etiketėmis ir net trumpomis pastraipomis su stebėtinu tikslumu. Kūrėjams, kuriems reikia teksto perdangų, integruotų į sugeneruotą medžiagą, tai yra reikšmingas žingsnis į priekį.
Lyginamieji testai prieš rinką
DI vaizdo įrašų sritis šią savaitę smarkiai pasikeitė: Wan 2.7 pasirodė kaip tik tada, kai OpenAI patvirtino Sora sustabdymą, o Google sumažino Veo 3.1 kainas.
| Modelis | Kaina | Garsas | Maks. trukmė | Veikėjų nuoseklumas | Mąstymas/Planavimas |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Ne | ~10s | Stiprus | Taip |
| Veo 3.1 Lite | $0.05/s | Taip | ~8s | Geras | Ne |
| Veo 3.1 Fast | $0.12/s | Taip | ~8s | Stiprus | Ne |
| Kling 3.0 | ~$0.08-0.17/s | Taip | ~10s | Stiprus | Ne |
| Seedance 2.0 | Pakete | Taip | 15s | Geras | Ne |
| Runway Gen-4.5 | ~$0.15/s | Ne | ~10s | Stiprus | Ne |
Kaina $0.10 už sekundę Wan 2.7 priskiria prie konkurencinio vidutinio segmento. Tai dvigubai brangiau nei Google biudžetinė Lite parinktis, konkurencinga su Kling 3.0 (kurio kaina skiriasi priklausomai nuo platformos) ir reikšmingai pigiau nei Runway.
Kada naudoti Wan 2.7
Remiantis ankstyvais bandymais ir modelio stiprybėmis, štai scenarijai, kuriuose Wan 2.7 turi daugiausiai prasmės:
Sudėtingos daugelio subjektų scenos
Daug teksto turintis turinys
Tikslus spalvų ir stiliaus valdymas
Stiliaus perkėlimas per nuorodą
Paprastesnėms vieno subjekto scenoms, kur taip pat reikia garso, modeliai kaip Kling 3.0 ar Veo 3.1 vis dar gali būti geresnis pasirinkimas. Planavimo papildomos sąnaudos mąstymo režime prideda vertės konkrečiai tada, kai užklausos yra sudėtingos.
Ką tai reiškia pramonei
Wan 2.7 mąstymo režimas rodo platesnį pokytį, kaip generatyviniai modeliai veiks ateityje. Užuot brutalia jėga gavus rezultatus iš triukšmo, ateities modeliai greičiausiai turės aiškius planavimo etapus skirtingiems generavimo aspektams.
Šį modelį jau matome kitose srityse. Kodo generavimo modeliai planuoja prieš rašydami. Vaizdų modeliai naudoja išdėstymo sąlygojimą. Dabar vaizdo įrašų modeliai mokosi mąstyti prieš kurdami.
Konkurencinis spaudimas yra tikras. Su Sora pasitraukimu, Google kainų mažinimu ir Kinijos modeliais kaip Wan 2.7 bei Kling 3.0, stumiančiais kokybės ribas, kūrėjai niekada neturėjo tiek pasirinkimų ar tiek priežasčių likti lankstiems.
Norėdami giliau pažvelgti, kaip šie modeliai lyginami konkrečiuose lyginamuosiuose testuose, peržiūrėkite mūsų Runway Gen-4.5 našumo analizę. O jei jus domina, kaip Seedance 2.0 pristatymas keičia CapCut ekosistemą, tai išsamiai aptarėme praėjusį mėnesį.

DI inžinierius iš Lozanos, derinantis mokslinių tyrimų gilumą su praktinėmis inovacijomis. Laiką dalija tarp modelių architektūrų ir Alpių viršukalnių.
View profile →Patiko tai, ką perskaitėte?
Paverskite savo idėjas neribotos trukmės DI vaizdo įrašais per kelias minutes.
Susiję straipsniai
Tęskite pažintį su šiais susijusiais įrašais

Alibaba HappyHorse-1.0: paslaptingas modelis, užėmęs pirmą vietą visuose AI vaizdo įrašų reitinguose
Modelis pavadinimu HappyHorse-1.0 pasirodė Artificial Analysis platformoje be jokio priskyrimo, pakilo į pirmą vietą tiek teksto pavertimo vaizdo įrašu, tiek vaizdo pavertimo vaizdo įrašu kategorijose, o paskui paaiškėjo, kad už jo stovi Alibaba. Štai ką žinome apie architektūrą, komandą ir ką tai reiškia AI vaizdo įrašų rinkai.

AI vaizdo įrašai po Sora: 4 rinkos lygiai, kuriuos reikia žinoti 2026 m.
Sora užsidaro balandžio 26 d. AI vaizdo įrašų rinka susijungė į keturis lygius. Praktinis vadovas, kaip pasirinkti tinkamą Sora alternatyvą.

Google Veo 3.1 tampa nemokamas: 10 AI vaizdo įrašų per mėnesį kiekvienai Google paskyrai
Google atvėrė Veo 3.1 visoms asmeninėms paskyroms su 10 nemokamų vaizdo generavimų per mėnesį. Štai ką gausite, kokie apribojimai ir kodėl tai svarbu AI vaizdo kūrėjams.