Alibaba Wan 2.7: kako način razmišljanja spreminja generiranje videa z umetno inteligenco
Alibaba je pravkar izdala Wan 2.7 z novim načinom razmišljanja, ki načrtuje kompozicije pred generiranjem videa. Razčlenimo, kako deluje in kaj to pomeni za ustvarjalce.

Ste pripravljeni ustvariti svoje AI videe?
Pridružite se tisočim ustvarjalcem, ki uporabljajo Bonega.ai
Kaj je način razmišljanja?
Večina modelov za generiranje videa deluje v enem prehodu. Vpišete poziv, model začne pretvarjati šum v pike in dobite, kar nastane. To pri enostavnih scenah deluje razmeroma dobro, a odpove, ko pozivi vključujejo več subjektov, specifične prostorske odnose ali zapletena dejanja.
Wan 2.7 dodaja vmesni korak. Preden se generira en sam piksel, model:
- Razčleni poziv na semantične komponente (subjekti, dejanja, okolje, osvetlitev)
- Načrtuje kompozicijo z določanjem, kje naj se elementi pojavijo in kako naj medsebojno delujejo
- Generira izhod z uporabo tega načrta kot strukturnega vodila
To je podobno temu, kako je "verižno razmišljanje" izboljšalo velike jezikovne modele. S tem, ko model prisilite k razmisleku pred dejanjem, se kakovost izhoda dramatično izboljša, zlasti pri zapletenih pozivi.
Celotni paket Wan 2.7
Wan 2.7 ni samo en model. Gre za paket štirih modelov, ki pokrivajo različne delovne tokove generiranja:
| Model | Vhod | Izhod | Najbolje za |
|---|---|---|---|
| Text-to-Video | Besedilni poziv | Video posnetek | Ustvarjanje od začetka |
| Image-to-Video | Slika + poziv | Video posnetek | Animiranje fotografij, konceptov |
| Reference-to-Video | Referenčni video + poziv | Nov video | Prenos sloga, rekonstrukcija |
| Video Editing | Video + navodila za urejanje | Spremenjen video | Postprodukcija, popravki |
Model text-to-video je že na voljo na Together AI od 3. aprila. Preostali trije modeli se uvajajo v prihodnjih tednih.
Pod pokrovom: vpogled v arhitekturo
Čeprav Alibaba še ni objavila celotnega znanstvenega članka, je iz API dokumentacije in zgodnjih primerjalnih testov razvidnih nekaj tehničnih podrobnosti.
| Kaj vemo | Kaj ga loči od drugih |
|---|---|
| Zgrajen na arhitekturni liniji Wan (Wanxiang) | Prvi produkcijski model z eksplicitnim kompozicijskim načrtovanjem |
| Način razmišljanja doda faze načrtovanja pred difuzijo | Scene z več elementi čisto obdelajo 5+ subjektov |
| Hiperrealistična doslednost likov med sličicami | Besedilo v generiranem videu je berljivo, ne popačeno |
| Natančen nadzor barv prek pogojenega pozivanja | Natančnost barv ostaja dosledna pri spremembah osvetlitve |
| Boljše izrisovanje dolgega besedila (besedilo v videu) | Zapleteni gibi kamere ohranjajo prostorsko koherenco |
Sposobnost izrisovanja dolgega besedila je še posebej omembe vredna. Prejšnji modeli so imeli težave z generiranjem berljivega besedila znotraj video sličic. Wan 2.7 obvladuje znake, oznake in celo kratke odstavke s presenetljivo natančnostjo. Za ustvarjalce, ki potrebujejo besedilne prekrivke vgrajene v generirani material, je to pomemben korak naprej.
Primerjava s konkurenco
Področje AI videa se je ta teden znatno spremenilo. Wan 2.7 je prispel ravno takrat, ko je OpenAI potrdil ukinitev Sore, Google pa je znižal cene Veo 3.1.
| Model | Cena | Zvok | Najv. dolžina | Doslednost likov | Razmišljanje/Načrtovanje |
|---|---|---|---|---|---|
| Wan 2.7 | $0.10/s | Ne | ~10s | Močna | Da |
| Veo 3.1 Lite | $0.05/s | Da | ~8s | Dobra | Ne |
| Veo 3.1 Fast | $0.12/s | Da | ~8s | Močna | Ne |
| Kling 3.0 | ~$0.08-0.17/s | Da | ~10s | Močna | Ne |
| Seedance 2.0 | V paketu | Da | 15s | Dobra | Ne |
| Runway Gen-4.5 | ~$0.15/s | Ne | ~10s | Močna | Ne |
Cena $0.10 na sekundo uvršča Wan 2.7 v konkurenčni srednji razred. Je dvakrat dražji od Googlove proračunske možnosti Lite, primerljiv s Kling 3.0 (katerega cena se razlikuje glede na platformo) in občutno cenejši od Runwaya.
Kdaj uporabiti Wan 2.7
Na podlagi zgodnjih testiranj in prednosti modela so tu scenariji, kjer Wan 2.7 najbolj pride do izraza:
Zapletene scene z več subjekti
Vsebina z veliko besedila
Natančen nadzor barv in sloga
Prenos sloga prek reference
Za enostavnejše scene z enim subjektom, kjer potrebujete tudi zvok, so modeli, kot sta Kling 3.0 ali Veo 3.1, morda še vedno boljša izbira. Dodatna obremenitev načrtovanja v načinu razmišljanja prinaša vrednost specifično takrat, ko so pozivi zapleteni.
Kaj to pomeni za industrijo
Način razmišljanja Wan 2.7 kaže na širši premik v delovanju generativnih modelov. Namesto izsiljevanja rezultatov iz šuma s surovo silo bodo prihodnji modeli verjetno vključevali eksplicitne faze načrtovanja za različne vidike generiranja.
Ta vzorec že opažamo na drugih področjih. Modeli za generiranje kode načrtujejo pred pisanjem. Modeli za slike uporabljajo pogojeno razporeditev. Zdaj se modeli za video učijo razmišljati, preden začnejo ustvarjati.
Konkurenčni pritisk je resničen. Po umiku Sore, znižanju cen s strani Googla in kitajskih modelih, kot sta Wan 2.7 in Kling 3.0, ki premikajo meje kakovosti, ustvarjalci še nikoli niso imeli toliko možnosti niti toliko razlogov, da ostanejo prilagodljivi.
Za podrobnejši pogled na primerjavo teh modelov v specifičnih primerjalnih testih si oglejte našo analizo zmogljivosti Runway Gen-4.5. In če vas zanima, kako uvedba Seedance 2.0 preoblikuje ekosistem CapCut, smo to podrobno obravnavali prejšnji mesec.

Inženir umetne inteligence iz Lozane, ki združuje raziskovalno globino s praktičnimi inovacijami. Svoj čas deli med arhitekture modelov in alpske vrhove.
View profile →Povezani članki
Nadaljujte raziskovanje s temi povezanimi objavami

Alibaba HappyHorse-1.0: Skrivnostni model, ki je zavladal vsem lestvicam AI videa
Model z imenom HappyHorse-1.0 se je pojavil na Artificial Analysis brez navedbe podjetja, povzpel se na #1 v text-to-video in image-to-video, nato pa se je izkazalo, da za njim stoji Alibaba. Tukaj je, kar vemo o arhitekturi, ekipi in kaj to pomeni za trg AI videa.

AI Video po Sori: 4 tržne ravni, ki jih morate poznati v letu 2026
Sora zapira 26. aprila. Trg AI videa se je konsolidiral v štiri ravni. Praktični vodnik za izbiro prave alternative za Soro glede na vaše potrebe.

Google Veo 3.1 brezplačno: 10 AI videov mesečno za vsak Google račun
Google je odprl Veo 3.1 za vse osebne račune z 10 brezplačnimi generacijami videa mesečno. Tukaj je pregled, kaj dobite, kakšne so omejitve in zakaj je to pomembno za ustvarjalce AI videov.