Meta PixelSkoči na glavno vsebino
AlexisAlexis· Avtor umetna inteligenca, pregledal človek
6 min read
1052 besed

Alibaba Wan 2.7: kako način razmišljanja spreminja generiranje videa z umetno inteligenco

Alibaba je pravkar izdala Wan 2.7 z novim načinom razmišljanja, ki načrtuje kompozicije pred generiranjem videa. Razčlenimo, kako deluje in kaj to pomeni za ustvarjalce.

Alibaba Wan 2.7: kako način razmišljanja spreminja generiranje videa z umetno inteligenco

Ste pripravljeni ustvariti svoje AI videe?

Pridružite se tisočim ustvarjalcem, ki uporabljajo Bonega.ai

Laboratorij Tongyi podjetja Alibaba je 6. aprila 2026 izdal Wan 2.7 in predstavil "način razmišljanja", ki temeljito spreminja, kako AI video modeli obdelujejo pozive. Namesto neposrednega generiranja sličic iz besedila model najprej zgradi notranji načrt scene, nato pa ga izvede. Rezultati govorijo sami zase: manj artefaktov, boljša koherenca in opazno bolj premišljene kompozicije.

Kaj je način razmišljanja?

Večina modelov za generiranje videa deluje v enem prehodu. Vpišete poziv, model začne pretvarjati šum v pike in dobite, kar nastane. To pri enostavnih scenah deluje razmeroma dobro, a odpove, ko pozivi vključujejo več subjektov, specifične prostorske odnose ali zapletena dejanja.

Wan 2.7 dodaja vmesni korak. Preden se generira en sam piksel, model:

  1. Razčleni poziv na semantične komponente (subjekti, dejanja, okolje, osvetlitev)
  2. Načrtuje kompozicijo z določanjem, kje naj se elementi pojavijo in kako naj medsebojno delujejo
  3. Generira izhod z uporabo tega načrta kot strukturnega vodila
💡
Predstavljajte si to kot razliko med improviziranjem slike in predhodnim skiciranjem kompozicijske študije. Skica se v končnem delu ne pojavi, a oblikuje vsako potezo čopiča.

To je podobno temu, kako je "verižno razmišljanje" izboljšalo velike jezikovne modele. S tem, ko model prisilite k razmisleku pred dejanjem, se kakovost izhoda dramatično izboljša, zlasti pri zapletenih pozivi.

Celotni paket Wan 2.7

Wan 2.7 ni samo en model. Gre za paket štirih modelov, ki pokrivajo različne delovne tokove generiranja:

4
Model Suite
$0.10/s
API Pricing
Apr 6
Release Date
ModelVhodIzhodNajbolje za
Text-to-VideoBesedilni pozivVideo posnetekUstvarjanje od začetka
Image-to-VideoSlika + pozivVideo posnetekAnimiranje fotografij, konceptov
Reference-to-VideoReferenčni video + pozivNov videoPrenos sloga, rekonstrukcija
Video EditingVideo + navodila za urejanjeSpremenjen videoPostprodukcija, popravki

Model text-to-video je že na voljo na Together AI od 3. aprila. Preostali trije modeli se uvajajo v prihodnjih tednih.

Pod pokrovom: vpogled v arhitekturo

Čeprav Alibaba še ni objavila celotnega znanstvenega članka, je iz API dokumentacije in zgodnjih primerjalnih testov razvidnih nekaj tehničnih podrobnosti.

Kaj vemoKaj ga loči od drugih
Zgrajen na arhitekturni liniji Wan (Wanxiang)Prvi produkcijski model z eksplicitnim kompozicijskim načrtovanjem
Način razmišljanja doda faze načrtovanja pred difuzijoScene z več elementi čisto obdelajo 5+ subjektov
Hiperrealistična doslednost likov med sličicamiBesedilo v generiranem videu je berljivo, ne popačeno
Natančen nadzor barv prek pogojenega pozivanjaNatančnost barv ostaja dosledna pri spremembah osvetlitve
Boljše izrisovanje dolgega besedila (besedilo v videu)Zapleteni gibi kamere ohranjajo prostorsko koherenco

Sposobnost izrisovanja dolgega besedila je še posebej omembe vredna. Prejšnji modeli so imeli težave z generiranjem berljivega besedila znotraj video sličic. Wan 2.7 obvladuje znake, oznake in celo kratke odstavke s presenetljivo natančnostjo. Za ustvarjalce, ki potrebujejo besedilne prekrivke vgrajene v generirani material, je to pomemben korak naprej.

Primerjava s konkurenco

Področje AI videa se je ta teden znatno spremenilo. Wan 2.7 je prispel ravno takrat, ko je OpenAI potrdil ukinitev Sore, Google pa je znižal cene Veo 3.1.

ModelCenaZvokNajv. dolžinaDoslednost likovRazmišljanje/Načrtovanje
Wan 2.7$0.10/sNe~10sMočnaDa
Veo 3.1 Lite$0.05/sDa~8sDobraNe
Veo 3.1 Fast$0.12/sDa~8sMočnaNe
Kling 3.0~$0.08-0.17/sDa~10sMočnaNe
Seedance 2.0V paketuDa15sDobraNe
Runway Gen-4.5~$0.15/sNe~10sMočnaNe
⚠️
Wan 2.7 ne vključuje izvornega generiranja zvoka. Za projekte, ki zahtevajo sinhroniziran zvok, boste potrebovali ločen zvočni pipeline ali model, kot je Kling 3.0 ali Veo 3.1, ki generira zvok izvorno.

Cena $0.10 na sekundo uvršča Wan 2.7 v konkurenčni srednji razred. Je dvakrat dražji od Googlove proračunske možnosti Lite, primerljiv s Kling 3.0 (katerega cena se razlikuje glede na platformo) in občutno cenejši od Runwaya.

Kdaj uporabiti Wan 2.7

Na podlagi zgodnjih testiranj in prednosti modela so tu scenariji, kjer Wan 2.7 najbolj pride do izraza:

🎬

Zapletene scene z več subjekti

Način razmišljanja se odlikuje, ko vaš poziv vključuje več likov ali predmetov v interakciji. Korak načrtovanja prepreči prostorsko zmedo, ki pesti druge modele.
📝

Vsebina z veliko besedila

Če vaš video potrebuje berljivo besedilo, znake ali elemente uporabniškega vmesnika, je izrisovanje besedila v Wan 2.7 trenutno najboljše v razredu.
🎨

Natančen nadzor barv in sloga

Sistem barvnega pogojevanja omogoča določanje natančnih palet in njihovo ohranjanje skozi sličice, kar je uporabno za vsebino, ki je usklajena z blagovno znamko.
🔄

Prenos sloga prek reference

Model reference-to-video (kmalu na voljo) vam bo omogočil vnos obstoječega posnetka kot slogovnega vodila za generiranje nove vsebine, ki ustreza njegovemu vizualnemu jeziku.

Za enostavnejše scene z enim subjektom, kjer potrebujete tudi zvok, so modeli, kot sta Kling 3.0 ali Veo 3.1, morda še vedno boljša izbira. Dodatna obremenitev načrtovanja v načinu razmišljanja prinaša vrednost specifično takrat, ko so pozivi zapleteni.

Kaj to pomeni za industrijo

Način razmišljanja Wan 2.7 kaže na širši premik v delovanju generativnih modelov. Namesto izsiljevanja rezultatov iz šuma s surovo silo bodo prihodnji modeli verjetno vključevali eksplicitne faze načrtovanja za različne vidike generiranja.

Ta vzorec že opažamo na drugih področjih. Modeli za generiranje kode načrtujejo pred pisanjem. Modeli za slike uporabljajo pogojeno razporeditev. Zdaj se modeli za video učijo razmišljati, preden začnejo ustvarjati.

💡
Hitri tempo izdajanja modelov v letu 2026 dela vezavo na enega dobavitelja tvegano. Pristopi, temelječi na pipelineu, ki lahko zamenjajo generacijske zaledne sisteme ob prihodu boljših modelov, ščitijo vaš delovni tok pred odvisnostjo od dobavitelja.

Konkurenčni pritisk je resničen. Po umiku Sore, znižanju cen s strani Googla in kitajskih modelih, kot sta Wan 2.7 in Kling 3.0, ki premikajo meje kakovosti, ustvarjalci še nikoli niso imeli toliko možnosti niti toliko razlogov, da ostanejo prilagodljivi.

Za podrobnejši pogled na primerjavo teh modelov v specifičnih primerjalnih testih si oglejte našo analizo zmogljivosti Runway Gen-4.5. In če vas zanima, kako uvedba Seedance 2.0 preoblikuje ekosistem CapCut, smo to podrobno obravnavali prejšnji mesec.

Alexis
AlexisAI EngineerAI Author

Inženir umetne inteligence iz Lozane, ki združuje raziskovalno globino s praktičnimi inovacijami. Svoj čas deli med arhitekture modelov in alpske vrhove.

View profile →

Vam je bilo prebrano všeč?

Svoje ideje v nekaj minutah spremenite v AI videe neomejene dolžine.

Povezani članki

Nadaljujte raziskovanje s temi povezanimi objavami

Vam je bil ta članek všeč?

Odkrijte več zanimivosti in ostanite na tekočem z našimi najnovejšimi vsebinami.