Meta PixelPāriet uz galveno saturu
HenryHenry· MI autors, pārskatījis cilvēks
6 min read
1020 vārdi

SkyReels V4: pirmais MI modelis, kas redz un dzird vienlaikus

Skywork AI SkyReels V4 ievieš divu plūsmu difūzijas arhitektūru, kas vienā piegājienā veido video un sinhronu audio. Lūk, ko tas nozīmē veidotājiem.

SkyReels V4: pirmais MI modelis, kas redz un dzird vienlaikus

Vai esat gatavs veidot savus MI videoklipus?

Pievienojieties tūkstošiem satura veidotāju, kuri izmanto Bonega.ai

Līdz šim katrs MI video modelis pret skaņu izturējās kā pret pēcdomu. Vispirms ģenerē klipu, pēc tam pieliek skaņu. SkyReels V4 visu šo darbplūsmu izsviež pa logu. Šis ir pirmais modelis, kas domā attēlos un skaņā vienlaikus, un rezultāti ir patiesi pārsteidzoši.

Kāpēc skaņa vienmēr ir bijusi MI video aklā zona

Ja jebkad esat mēģinājuši pievienot skaņu MI ģenerētam klipam, jūs zināt to sāpi. Ģenerējiet video ar lietu, kas sit pret logu, tad meklējiet piemērotu audio celiņu. Saskaņojiet laikus. Pielāgojiet. Lūdziet, lai tas neliekas dīvains.

Pamatproblēma ir arhitektoniska. Tādi modeļi kā Kling 3.0 vai Runway Gen-4.5 tika būvēti vispirms kā vizuāli dzinēji. Audio atbalsts, ja tas vispār ir, iet caur atsevišķu cauruļvadu, kas mēģina sinhronizēt pēc fakta.

💡
Mēs aplūkojām tieši šo spriedzi savā padziļinātajā analīzē par vienotu audio-video ģenerēšanu. SkyReels V4 ir pirmais ražošanas modelis, kas to patiešām atrisina arhitektūras līmenī.

Kā SkyReels V4 patiesībā strādā

Skywork AI (Kunlun Inc. pētniecības nodaļa) uzbūvēja kaut ko, ko viņi sauc par divu plūsmu multimodālo difūzijas transformeri jeb MMDiT. Iedomājieties to kā divas specializētas smadzenes, kas dala vienu nervu sistēmu.

Vizuālā nozare

Ģenerē video kadrus līdz 1080p, 32 FPS. Tiek galā ar kustību, apgaismojumu, ainas kompozīciju un laika konsekvenci visā klipā.

Audio nozare

Ģenerē sinhronu skaņu tajā pašā difūzijas piegājienā. Ne pieskaņo skaņu pabeigtam video. Veido skaņu tajā brīdī, kad veidojas video.

Abas nozares dala teksta kodētāju, kas būvēts uz multimodāla liela valodas modeļa. Šī kopīgā izpratne ir iemesls, kāpēc tāda uzvedne kā "stikls plīst uz marmora grīdas palēninātā uzņēmumā" rada audio akcentus, kas iekrīt aptuveni 40 ms robežās no vizuālā trieciena. Tas ir pietiekami precīzi, lai justos dabiski.

1080p
Maksimālā izšķirtspēja
32 FPS
Kadru biežums
15s
Maksimālais ilgums
~40ms
Audio sinhronizācijas precizitāte

Ar ko tas atšķiras no Seedance vai Kling

ByteDance Seedance 2.0 un Kuaishou Kling 3.0 abi atbalsta audio, bet to pieeja ir fundamentāli atšķirīga. Tie vispirms ģenerē video, tad palaiž otru modeli, lai radītu atbilstošu audio. Šī secīgā pieeja nozīmē, ka audio vienmēr reaģē uz pabeigtiem kadriem, nekad neveidojas kopā ar tiem.

SkyReels V4 divu plūsmu arhitektūra nozīmē, ka:

  • Audio un vizuālie elementi ir semantiski saskaņoti no paša sākuma
  • Runājošu galvu lūpu sinhronizācija iekrīt uz līdzskaņiem, ne pēc tiem
  • Vides skaņas atbilst materiāla īpašībām (metāls vs. koks vs. stikls)
  • Nav vajadzīga pēcapstrāde, lai izlabotu laika nobīdi

Atšķirība ir smalka, vērojot ainavu, bet dramatiska, vērojot cilvēku runājam vai objektu mijiedarbojamies ar virsmu.

Atvērtā koda jautājums

Iepriekšējās SkyReels versijas (V1 līdz V3) bija pilnīgi atvērtā koda ar lejupielādējamiem svariem HuggingFace un GitHub. V4 pašlaik ir ierobežotā priekšskatījumā ar bezmaksas līmeni vietnē skyreels.ai, bet pilnie svari vēl nav izlaisti.

Kas ir pieejams tagad

Bezmaksas līmenis ar dienas ģenerēšanas ierobežojumiem oficiālajā platformā. arXiv raksts (2602.21818) detalizēti apraksta visu arhitektūru. Iepriekšējās versijas paliek atvērtā koda.

Kas vēl trūkst

Vēl nav lejupielādējamu V4 svaru. Nav pašhostēšanas iespējas. Nav ražošanas API. Atvērtā koda izlaišanas grafiks ir neskaidrs.

Atvērtā koda kopienai to ir vērts cieši vērot. Ja Skywork sekos savai vēsturiskajai shēmai, V4 svariem galu galā vajadzētu nonākt HuggingFace. Ja jums šodien ir vajadzīga atvērtā koda audio-video ģenerēšana, tuvākās alternatīvas ir SkyReels V3 plus atsevišķs audio modelis.

Kur SkyReels V4 atrodas līderu sarakstā

Artificial Analysis Video Arena (kas izmanto aklu cilvēku izvēles balsošanu) SkyReels V4 pašlaik ierindo ar Elo 1244 teksta-uz-video kategorijā. Tas to nostāda gandrīz neizšķirtā ar Kling 3.0 (1243) un aiz pašreizējā līdera, Alibaba HappyHorse-1.0 (1347).

ModelisElo punktiAudio atbalstsAtvērtais kodsVislabāk piemērots
HappyHorse-1.01347Tīra vizuālā kvalitāte
SkyReels V41244Iebūvēts (divas plūsmas)GaidaAudiovizuāls saturs
Kling 3.01243SecīgsRažošanas mērogs
Wan 2.7Augstākā klaseFotoreālisms
LTX-2ZemāksIzmaksu efektivitāte
Salīdzinājuma diagramma, kas rāda SkyReels V4, Kling 3.0, HappyHorse-1.0 un Wan 2.7 pa vizuālo kvalitāti, audio atbalstu, atvērto kodu un ātrumu
SkyReels V4 ir vienīgais augstākās klases modelis ar iebūvētu audio ģenerēšanu

Vizuālās kvalitātes atstarpe starp SkyReels V4 un HappyHorse ir reāla. Bet SkyReels ir vienīgais modelis top 5, kas ģenerē audio iebūvēti. Ja jūsu darbplūsmai vajag skaņu, šī arhitektoniskā priekšrocība sver vairāk nekā 100 punktu Elo atšķirība.

Ko tas nozīmē veidotājiem

🎬

Sociālā satura veidotāji

SkyReels V4 ir būvēts ātrai apstrādei. Ģenerējiet klipu ar atbilstošu audio, publicējiet to. Nav skaņas dizaina soļa. TikTok, Reels un Shorts veidotājiem tas būtiski samazina ražošanas laiku.
🎵

Mūzikas klipu producenti

Audio nozare var pieņemt atskaites audio kā vadlīnijas, kas nozīmē, ka jūs varat tai padot dziesmu un saņemt vizuālu saturu, kas kustas līdzi ritmam. Agrīni rezultāti rāda, ka kustību akcenti labi sinhronizējas ar mūzikas ritmu.
📢

Reklāmu veidotāji

Produktu video ar fona skaņu, klipi, kas gatavi balss pārklājam, un skaņu ainavas zīmola saturs, visi kļūst iespējami vienā ģenerēšanas solī. Zīmoliem, kas ražo lielā mērogā, laika ietaupījumi ātri uzkrājas.

Plašāka aina: audio vairs nav izvēles iespēja

SkyReels V4 nav izolēts eksperiments. Mēs aplūkojām ByteDance Seedance 1.5 Pro ievestu audiovizuālo ģenerēšanu un plašāku tendenci, kā MI video izlaužas no klusā kino laikmeta. Ko SkyReels V4 pievieno, ir pierādījums, ka to var izdarīt arhitektūras līmenī, ne kā pēcapstrādes triku.

Secinājums ir skaidrs: līdz 2026. gada beigām jebkurš MI video modelis bez iebūvēta audio jutīsies nepabeigts. Jautājums nav par to, vai tas kļūs par standartu, bet cik ātri.

💡
Vēlaties šodien ģenerēt MI video ar skaņu? Bonega cauruļvads automātiski novirza uz labākajiem pieejamajiem rīkiem un turpina atjaunoties, kad tādi modeļi kā SkyReels V4 nobriest. Izmēģiniet bez maksas.

Ātrā atsauce: SkyReels V4

  • Izstrādātājs: Skywork AI (Kunlun Inc.)
  • Arhitektūra: Divu plūsmu multimodāls difūzijas transformeris (MMDiT)
  • Izšķirtspēja: Līdz 1080p, 32 FPS
  • Ilgums: Līdz 15 sekundēm
  • Audio: Iebūvēta kopģenerēšana (ne pēcapstrāde)
  • Ievades: Teksts, attēli, video klipi, maskas, audio atsauces
  • Statuss: Ierobežots priekšskatījums vietnē skyreels.ai (svari gaida atvērtā koda izlaidi)
  • Raksts: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

Radošais tehnologs no Lozannas, kurš pēta, kur satiekas MI un māksla. Eksperimentē ar ģeneratīvajiem modeļiem starp elektroniskās mūzikas sesijām.

View profile →

Patika izlasītais?

Pārvērtiet savas idejas neierobežota garuma MI videoklipos dažu minūšu laikā.

Saistītie raksti

Turpiniet izpēti ar šiem saistītajiem ierakstiem

Vai jums patika šis raksts?

Atklājiet vairāk atziņu un sekojiet līdzi mūsu jaunākajam saturam.