SkyReels V4: El Primer Model d'IA Que Veu i Sent Alhora
SkyReels V4 de Skywork AI estrena una arquitectura de difusió de doble flux que co-genera vídeo i àudio sincronitzat en una sola passada. Això és el que significa per als creadors.

Preparat per crear els teus propis vídeos amb IA?
Uneix-te a milers de creadors que utilitzen Bonega.ai
Per Què l'Àudio Sempre Ha Estat el Punt Cec del Vídeo amb IA
Si alguna vegada has provat d'afegir so a un clip generat per IA, coneixes el dolor. Generar un vídeo de pluja picant en una finestra i després perseguir una pista d'àudio que encaixi. Sincronitzar-la. Ajustar-la. Pregar perquè no soni estranya.
El problema de fons és arquitectònic. Models com Kling 3.0 o Runway Gen-4.5 van ser construïts primer com a motors visuals. El suport d'àudio, quan existeix, passa per una pipeline a part que intenta sincronitzar a posteriori.
Com Funciona Realment SkyReels V4
Skywork AI (una divisió de recerca de Kunlun Inc.) ha construït allò que anomenen un Multimodal Diffusion Transformer de doble flux, o MMDiT. Imagina-te'l com dos cervells especialistes que comparteixen un sol sistema nerviós.
La Branca Visual
Genera fotogrames de vídeo fins a 1080p, 32 FPS. Gestiona moviment, il·luminació, composició d'escena i coherència temporal al llarg de tot el clip.
La Branca d'Àudio
Genera so sincronitzat en la mateixa passada de difusió. No és encaixar el so a un vídeo acabat. És crear el so mentre el vídeo es forma.
Les dues branques comparteixen un codificador de text construït sobre un Multimodal Large Language Model. Aquesta comprensió compartida és la raó per la qual un prompt com «vidre trencant-se sobre terra de marbre a càmera lenta» produeix accents d'àudio que cauen a uns 40 ms de l'impacte visual. Prou ajustat perquè soni natural.
Què el Distingeix de Seedance o Kling
Seedance 2.0 de ByteDance i Kling 3.0 de Kuaishou tots dos suporten àudio, però la seva aproximació és fonamentalment diferent. Generen primer el vídeo, després executen un segon model per produir l'àudio que encaixi. Aquest enfocament seqüencial vol dir que l'àudio sempre està reaccionant a fotogrames acabats, mai co-creant amb ells.
L'arquitectura de doble flux de SkyReels V4 implica:
- ✓Els elements visuals i sonors estan alineats semànticament des del principi
- ✓El lip-sync en cares parlant cau sobre les consonants, no després
- ✓Els sons d'entorn s'adapten a les propietats del material (metall, fusta, vidre)
- ✓No cal postproducció per corregir desfasaments de timing
La diferència és subtil mirant un paisatge, però rotunda mirant una persona parlant o un objecte interactuant amb una superfície.
La Qüestió del Codi Obert
Les versions anteriors de SkyReels (V1 a V3) eren totalment open source, amb pesos descarregables a HuggingFace i GitHub. La V4 està actualment en preview limitat amb un pla gratuït a skyreels.ai, però els pesos complets encara no s'han alliberat.
Pla gratuït amb límits diaris de generació a la plataforma oficial. El paper d'arXiv (2602.21818) detalla l'arquitectura completa. Les versions anteriors continuen sent open source.
Cap pes V4 descarregable. Cap opció de self-hosting. Cap API de producció. El calendari per a l'alliberament open source no és clar.
Per a la comunitat open source, val la pena seguir-ho de prop. Si Skywork manté el seu patró històric, els pesos de la V4 haurien d'acabar aterrant a HuggingFace. Si necessites generació open source d'àudio i vídeo avui, les alternatives més properes són SkyReels V3 més un model d'àudio a part.
On se Situa SkyReels V4 a la Classificació
A l'Artificial Analysis Video Arena (que es basa en vots humans a cegues), SkyReels V4 marca actualment un Elo de 1.244 en text-to-video. Això el deixa pràcticament empatat amb Kling 3.0 (1.243) i per darrere del líder actual, HappyHorse-1.0 d'Alibaba (1.347).
| Model | Puntuació Elo | Suport d'Àudio | Open Source | Millor per a |
|---|---|---|---|---|
| HappyHorse-1.0 | 1.347 | No | No | Qualitat visual pura |
| SkyReels V4 | 1.244 | Natiu (doble flux) | Pendent | Contingut audiovisual |
| Kling 3.0 | 1.243 | Seqüencial | No | Escala de producció |
| Wan 2.7 | Capdavanter | No | Sí | Fotorealisme |
| LTX-2 | Més baix | No | Sí | Eficiència de cost |

La distància en qualitat visual entre SkyReels V4 i HappyHorse és real. Però SkyReels és l'únic model dins del top 5 que genera àudio de manera nativa. Si el teu flux de treball requereix so, aquest avantatge arquitectònic pesa més que una diferència de 100 punts d'Elo.
Què Significa Això per als Creadors
Creadors de Contingut Social
Productors de Videoclips Musicals
Creadors Publicitaris
La Imatge Més Àmplia: l'Àudio Ja No És Opcional
SkyReels V4 no és un experiment aïllat. Hem cobert Seedance 1.5 Pro de ByteDance introduint la generació audiovisual, i la tendència més àmplia del vídeo amb IA sortint de l'era del cinema mut. El que SkyReels V4 hi afegeix és la prova que es pot fer a nivell d'arquitectura, i no com un truc de postproducció.
La implicació és clara: a finals de 2026, qualsevol model de vídeo amb IA sense àudio natiu semblarà incomplet. La pregunta no és si això es converteix en estàndard, sinó amb quina rapidesa.
Referència Ràpida: SkyReels V4
- Desenvolupador: Skywork AI (Kunlun Inc.)
- Arquitectura: Multimodal Diffusion Transformer de doble flux (MMDiT)
- Resolució: Fins a 1080p a 32 FPS
- Durada: Fins a 15 segons
- Àudio: Co-generació nativa (no postproducció)
- Entrades: Text, imatges, clips de vídeo, màscares, referències d'àudio
- Estat: Preview limitat a skyreels.ai (pesos pendents d'alliberament open source)
- Paper: arXiv 2602.21818

Tecnòleg creatiu de Lausana que explora el punt de trobada entre la IA i l’art. Experimenta amb models generatius entre sessions de música electrònica.
View profile →T’ha agradat el que has llegit?
Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.
Articles relacionats
Continua explorant amb aquestes publicacions relacionades

Març 2026: Com 12 Models en 7 Dies Van Matar l'Era del Núvol Únic
Març 2026 va veure la rfàga més concentrada de llançaments de models de vídeo d'IA en la història. Més de dotzena de models nous van arribar en una sola setmana, i la història més gran no és sobre un model únic, sinó que la generació local ara rivalitza amb el núvol.

Helios: El Model de 14B que Executa Video AI en Temps Real en Maquinari de Consumidor
La Universitat de Pequín, ByteDance i Canva Helios genera vídeos AI d'una durada minuta a 19.5 FPS amb només 6GB VRAM, i és completament de codi obert.

Genereu vídeo amb IA localment: LTX-2, RTX i ComfyUI el 2026
Creeu vídeo en 4K amb IA a la vostra GPU. Sense subscripcions, sense núvol, sense preocupacions per la privacitat de dades. Aquí teniu tot el que necessiteu per començar.
