SkyReels V4: Prvi AI Model Koji Istovremeno Vidi i Čuje
Skywork AI predstavlja SkyReels V4 s dvostruko strujnom difuzijskom arhitekturom koja u jednom prolazu generira video i sinkronizirani zvuk. Evo što to znači za autore.

Zašto je Zvuk Oduvijek Bio Slijepa Točka AI Videa
Ako ste ikada pokušali dodati zvuk klipu generiranom AI-jem, znate kakva je to muka. Generirate video kiše koja udara u prozor, pa lovite zvučnu podlogu koja se uklapa. Tempirate je. Prilagođavate je. Molite se da ne djeluje neprirodno.
Glavni problem je arhitektonski. Modeli poput Kling 3.0 ili Runway Gen-4.5 izgrađeni su prvenstveno kao vizualni motori. Podrška za zvuk, kada postoji, ide kroz odvojeni cjevovod koji pokušava sinkronizirati zvuk naknadno.
Kako SkyReels V4 Zapravo Radi
Skywork AI (istraživački odjel tvrtke Kunlun Inc.) izgradio je nešto što nazivaju dvostruko strujnim Multimodalnim Difuzijskim Transformerom, ili MMDiT. Zamislite to kao dva specijalizirana mozga koji dijele jedan živčani sustav.
Vizualna Grana
Generira video kadrove do 1080p, 32 FPS. Obrađuje pokret, osvjetljenje, kompoziciju scene i vremensku konzistentnost kroz cijeli klip.
Audio Grana
Generira sinkronizirani zvuk u istom difuzijskom prolazu. Ne usklađuje zvuk s gotovim videom. Stvara zvuk dok se video oblikuje.
Obje grane dijele tekstualni enkoder izgrađen na vrhu Multimodalnog Velikog Jezičnog Modela. To zajedničko razumijevanje razlog je zašto prompt poput "staklo se razbija na mramornom podu u usporenom snimku" proizvodi zvučne akcente koji padaju unutar otprilike 40 ms od vizualnog udara. To je dovoljno čvrsto da djeluje prirodno.
Po Čemu se Razlikuje od Seedancea ili Klinga
ByteDanceov Seedance 2.0 i Kuaishouov Kling 3.0 oba podržavaju zvuk, ali njihov je pristup temeljno drugačiji. Prvo generiraju video, a zatim pokreću drugi model za izradu odgovarajućeg zvuka. Taj sekvencijalni pristup znači da zvuk uvijek reagira na gotove kadrove, nikada se ne stvara zajedno s njima.
Dvostruko strujna arhitektura SkyReels V4 znači:
- ✓Audio i vizualni elementi semantički su usklađeni od samog početka
- ✓Sinkronizacija usana na govornicima pada na suglasnike, a ne nakon njih
- ✓Zvukovi okoline odgovaraju svojstvima materijala (metal naspram drveta naspram stakla)
- ✓Nije potrebna naknadna obrada za ispravljanje vremenskog odstupanja
Razlika je suptilna kada gledate krajolik, ali dramatična kada gledate osobu kako govori ili objekt koji djeluje na površinu.
Pitanje Otvorenog Koda
Prethodne verzije SkyReelsa (V1 do V3) bile su potpuno otvorenog koda s preuzimljivim težinama na HuggingFaceu i GitHubu. V4 je trenutno u ograničenom pregledu s besplatnom razinom na skyreels.ai, ali pune težine još nisu objavljene.
Besplatna razina s dnevnim ograničenjima generiranja na službenoj platformi. arXiv rad (2602.21818) opisuje cijelu arhitekturu. Prethodne verzije ostaju otvorenog koda.
Još nema preuzimljivih težina za V4. Nema opcije samostalnog hostinga. Nema produkcijskog API-ja. Vremenski okvir za objavu otvorenog koda je nejasan.
Zajednica otvorenog koda trebala bi ovo pomno pratiti. Ako Skywork slijedi svoj povijesni obrazac, težine V4 trebale bi na kraju završiti na HuggingFaceu. Ako vam treba audio-video generacija otvorenog koda već danas, najbliže alternative su SkyReels V3 plus odvojeni audio model.
Gdje SkyReels V4 Stoji na Ljestvici
Na Artificial Analysis Video Areni (koja koristi slijepo glasanje ljudskih preferencija), SkyReels V4 trenutno ima Elo od 1.244 za text-to-video. To ga stavlja u gotovo izjednačeno mjesto s Kling 3.0 (1.243) i iza trenutnog vodećeg, Alibabinog HappyHorse-1.0 (1.347).
| Model | Elo Ocjena | Podrška za Zvuk | Open Source | Najbolji Za |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | Ne | Ne | Čistu vizualnu kvalitetu |
| SkyReels V4 | 1,244 | Nativna (dual-stream) | U najavi | Audio-vizualni sadržaj |
| Kling 3.0 | 1,243 | Sekvencijalna | Ne | Produkcijsku skalu |
| Wan 2.7 | Vrh | Ne | Da | Fotorealizam |
| LTX-2 | Niže | Ne | Da | Isplativost |

Razlika u vizualnoj kvaliteti između SkyReels V4 i HappyHorsea je stvarna. Ali SkyReels je jedini model u top 5 koji nativno generira zvuk. Ako vaš radni tok zahtijeva zvuk, ta arhitektonska prednost važnija je od razlike od 100 Elo bodova.
Što Ovo Znači za Autore
Kreatori Društvenog Sadržaja
Producenti Glazbenih Spotova
Kreatori Oglasa
Šira Slika: Zvuk Više Nije Opcija
SkyReels V4 nije izolirani eksperiment. Pisali smo o ByteDanceovom Seedanceu 1.5 Pro koji uvodi audio-vizualnu generaciju, te o širem trendu AI videa koji izlazi iz nijemog razdoblja. Ono što SkyReels V4 dodaje jest dokaz da to možete učiniti na razini arhitekture, a ne kao trik naknadne obrade.
Implikacija je jasna: do kraja 2026., bilo koji AI video model bez nativnog zvuka djelovat će nepotpuno. Pitanje nije hoće li ovo postati standard, nego koliko brzo.
Brza Referenca: SkyReels V4
- Razvijatelj: Skywork AI (Kunlun Inc.)
- Arhitektura: Dvostruko strujni Multimodalni Difuzijski Transformer (MMDiT)
- Rezolucija: Do 1080p pri 32 FPS
- Trajanje: Do 15 sekundi
- Zvuk: Nativna ko-generacija (ne naknadna obrada)
- Ulazi: Tekst, slike, video isječci, maske, audio reference
- Status: Ograničeni pregled na skyreels.ai (težine čekaju objavu otvorenog koda)
- Rad: arXiv 2602.21818

Kreativni tehnolog iz Lausanne koji istražuje gdje se AI susreće s umjetnošću. Eksperimentira s generativnim modelima između sesija elektroničke glazbe.
View profile →Sviđa vam se ono što ste pročitali?
Pretvorite svoje ideje u AI videozapise neograničene duljine u nekoliko minuta.
Povezani članci
Nastavite istraživati uz ove povezane objave

Lavina AI-ja u ožujku 2026: Kako je 12 modela u 7 dana ubila eru samo oblačnih rješenja
Ožujak 2026 donio je najveću koncentraciju izdanja AI video modela u povijesti. Više od tuceta novih modela pojavljeno je tijekom jednog tjedna, a najveća vijest nije bilo o jednom izdanju, već činjenica da lokalno generiranje sada konkurira oblaku.

Helios: Model s 14B parametara koji generira AI video u stvarnom vremenu na potrošačkoj opremi
Peking University, ByteDance i Canva predstavili su Helios, koji generira minutni AI video pri 19,5 FPS sa samo 6GB VRAM-a i potpuno je otvorenog koda.

Generiraj AI video lokalno: LTX-2, RTX i ComfyUI u 2026
Generiraj 4K AI video na svojoj GPU s LTX-2 i ComfyUI. Bez pretplate, bez oblaka, bez briga za privatnost podataka. Evo svega što trebaš za početak.
