Meta PixelSalta al contingut principal
HenryHenry· Autoria d’IA, revisada per humans
7 min read
1219 paraules

SkyReels V4: El Primer Model d'IA Que Veu i Sent Alhora

SkyReels V4 de Skywork AI estrena una arquitectura de difusió de doble flux que co-genera vídeo i àudio sincronitzat en una sola passada. Això és el que significa per als creadors.

SkyReels V4: El Primer Model d'IA Que Veu i Sent Alhora

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

Fins ara, tots els models de vídeo amb IA havien tractat l'àudio com una idea tardana. Generes el clip primer i li enganxes el so a sobre després. SkyReels V4 envia tot aquest flux de treball per la finestra. És el primer model que pensa en imatges i en so alhora, i els resultats són sincerament sorprenents.

Per Què l'Àudio Sempre Ha Estat el Punt Cec del Vídeo amb IA

Si alguna vegada has provat d'afegir so a un clip generat per IA, coneixes el dolor. Generar un vídeo de pluja picant en una finestra i després perseguir una pista d'àudio que encaixi. Sincronitzar-la. Ajustar-la. Pregar perquè no soni estranya.

El problema de fons és arquitectònic. Models com Kling 3.0 o Runway Gen-4.5 van ser construïts primer com a motors visuals. El suport d'àudio, quan existeix, passa per una pipeline a part que intenta sincronitzar a posteriori.

💡
Vam explorar aquesta mateixa tensió a la nostra anàlisi en profunditat sobre la generació unificada d'àudio i vídeo. SkyReels V4 és el primer model de producció que la resol de debò a nivell d'arquitectura.

Com Funciona Realment SkyReels V4

Skywork AI (una divisió de recerca de Kunlun Inc.) ha construït allò que anomenen un Multimodal Diffusion Transformer de doble flux, o MMDiT. Imagina-te'l com dos cervells especialistes que comparteixen un sol sistema nerviós.

La Branca Visual

Genera fotogrames de vídeo fins a 1080p, 32 FPS. Gestiona moviment, il·luminació, composició d'escena i coherència temporal al llarg de tot el clip.

La Branca d'Àudio

Genera so sincronitzat en la mateixa passada de difusió. No és encaixar el so a un vídeo acabat. És crear el so mentre el vídeo es forma.

Les dues branques comparteixen un codificador de text construït sobre un Multimodal Large Language Model. Aquesta comprensió compartida és la raó per la qual un prompt com «vidre trencant-se sobre terra de marbre a càmera lenta» produeix accents d'àudio que cauen a uns 40 ms de l'impacte visual. Prou ajustat perquè soni natural.

1080p
Resolució Màxima
32 FPS
Cadència
15s
Durada Màxima
~40ms
Precisió de Sincronia

Què el Distingeix de Seedance o Kling

Seedance 2.0 de ByteDance i Kling 3.0 de Kuaishou tots dos suporten àudio, però la seva aproximació és fonamentalment diferent. Generen primer el vídeo, després executen un segon model per produir l'àudio que encaixi. Aquest enfocament seqüencial vol dir que l'àudio sempre està reaccionant a fotogrames acabats, mai co-creant amb ells.

L'arquitectura de doble flux de SkyReels V4 implica:

  • Els elements visuals i sonors estan alineats semànticament des del principi
  • El lip-sync en cares parlant cau sobre les consonants, no després
  • Els sons d'entorn s'adapten a les propietats del material (metall, fusta, vidre)
  • No cal postproducció per corregir desfasaments de timing

La diferència és subtil mirant un paisatge, però rotunda mirant una persona parlant o un objecte interactuant amb una superfície.

La Qüestió del Codi Obert

Les versions anteriors de SkyReels (V1 a V3) eren totalment open source, amb pesos descarregables a HuggingFace i GitHub. La V4 està actualment en preview limitat amb un pla gratuït a skyreels.ai, però els pesos complets encara no s'han alliberat.

Què està disponible ara

Pla gratuït amb límits diaris de generació a la plataforma oficial. El paper d'arXiv (2602.21818) detalla l'arquitectura completa. Les versions anteriors continuen sent open source.

Què encara falta

Cap pes V4 descarregable. Cap opció de self-hosting. Cap API de producció. El calendari per a l'alliberament open source no és clar.

Per a la comunitat open source, val la pena seguir-ho de prop. Si Skywork manté el seu patró històric, els pesos de la V4 haurien d'acabar aterrant a HuggingFace. Si necessites generació open source d'àudio i vídeo avui, les alternatives més properes són SkyReels V3 més un model d'àudio a part.

On se Situa SkyReels V4 a la Classificació

A l'Artificial Analysis Video Arena (que es basa en vots humans a cegues), SkyReels V4 marca actualment un Elo de 1.244 en text-to-video. Això el deixa pràcticament empatat amb Kling 3.0 (1.243) i per darrere del líder actual, HappyHorse-1.0 d'Alibaba (1.347).

ModelPuntuació EloSuport d'ÀudioOpen SourceMillor per a
HappyHorse-1.01.347NoNoQualitat visual pura
SkyReels V41.244Natiu (doble flux)PendentContingut audiovisual
Kling 3.01.243SeqüencialNoEscala de producció
Wan 2.7CapdavanterNoFotorealisme
LTX-2Més baixNoEficiència de cost
Gràfic comparatiu entre SkyReels V4, Kling 3.0, HappyHorse-1.0 i Wan 2.7 segons qualitat visual, suport d'àudio, codi obert i velocitat
SkyReels V4 és l'únic model de capçalera amb generació d'àudio nativa

La distància en qualitat visual entre SkyReels V4 i HappyHorse és real. Però SkyReels és l'únic model dins del top 5 que genera àudio de manera nativa. Si el teu flux de treball requereix so, aquest avantatge arquitectònic pesa més que una diferència de 100 punts d'Elo.

Què Significa Això per als Creadors

🎬

Creadors de Contingut Social

SkyReels V4 està pensat per a temps d'entrega curts. Generes un clip amb àudio que encaixa i el publiques. Sense etapa de disseny sonor. Per a creadors a TikTok, Reels i Shorts, això retalla el temps de producció de manera significativa.
🎵

Productors de Videoclips Musicals

La branca d'àudio pot acceptar àudio de referència com a guia, és a dir, li pots passar un tema i obtenir contingut visual que es mou al ritme. Els primers resultats mostren accents de moviment ben sincronitzats amb el ritme musical.
📢

Creadors Publicitaris

Vídeos de producte amb so ambient, clips llestos per a veu en off i continguts de marca amb paisatge sonor esdevenen possibles en un sol pas de generació. Per a marques que produeixen a escala, l'estalvi de temps s'acumula ràpidament.

La Imatge Més Àmplia: l'Àudio Ja No És Opcional

SkyReels V4 no és un experiment aïllat. Hem cobert Seedance 1.5 Pro de ByteDance introduint la generació audiovisual, i la tendència més àmplia del vídeo amb IA sortint de l'era del cinema mut. El que SkyReels V4 hi afegeix és la prova que es pot fer a nivell d'arquitectura, i no com un truc de postproducció.

La implicació és clara: a finals de 2026, qualsevol model de vídeo amb IA sense àudio natiu semblarà incomplet. La pregunta no és si això es converteix en estàndard, sinó amb quina rapidesa.

💡
Vols generar vídeo amb IA amb so avui mateix? El pipeline de Bonega encamina automàticament cap a les millors eines disponibles i continua actualitzant-se a mesura que models com SkyReels V4 maduren. Prova-ho gratis.

Referència Ràpida: SkyReels V4

  • Desenvolupador: Skywork AI (Kunlun Inc.)
  • Arquitectura: Multimodal Diffusion Transformer de doble flux (MMDiT)
  • Resolució: Fins a 1080p a 32 FPS
  • Durada: Fins a 15 segons
  • Àudio: Co-generació nativa (no postproducció)
  • Entrades: Text, imatges, clips de vídeo, màscares, referències d'àudio
  • Estat: Preview limitat a skyreels.ai (pesos pendents d'alliberament open source)
  • Paper: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

Tecnòleg creatiu de Lausana que explora el punt de trobada entre la IA i l’art. Experimenta amb models generatius entre sessions de música electrònica.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.