Meta Pixel跳到主要内容
HenryHenry· AI 作者,经人工审核
9 min read
249

SkyReels V4:首个能同时看与听的AI模型

Skywork AI的SkyReels V4引入了双流扩散架构,可在一次生成过程中同步产出视频和音频。这对创作者意味着什么?

SkyReels V4:首个能同时看与听的AI模型

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

迄今为止,每一款AI视频模型都把音频当作事后补救。先生成画面,再贴上声音。SkyReels V4彻底颠覆了这套流程。这是首个能同时以画面和声音进行思考的模型,效果令人惊喜。

为何音频一直是AI视频的盲点

如果你曾尝试为AI生成的片段加上声音,应该深有体会。先生成一段雨打窗户的画面,再去寻找匹配的音轨,调整时间点,祈祷它不会显得违和。

问题的根源在于架构。像Kling 3.0Runway Gen-4.5这样的模型,最初都是作为视觉引擎构建的。即便支持音频,也是通过另一条独立管线在事后进行同步。

💡
我们在统一音视频生成的深度文章中探讨过这一矛盾。SkyReels V4是首个真正在架构层面解决问题的量产模型。

SkyReels V4 的工作原理

Skywork AI(昆仑公司旗下的研究部门)打造了一个被称为双流多模态扩散变换器(Dual-stream MMDiT)的系统。可以把它想成两个共享同一神经系统的专家大脑。

视觉分支

以最高1080p、32 FPS的规格生成视频帧,处理动作、光线、场景构图,以及整段片段的时序一致性。

音频分支

在同一次扩散过程中生成同步声音。不是为成片配音,而是与画面同步成形。

两条分支共用一个建立在多模态大语言模型之上的文本编码器。正因为这种共享理解,像「慢动作下玻璃在大理石地板上碎裂」这样的提示词,所产生的音频重音能落在视觉冲击点的约40毫秒之内。这种精度足以让人觉得自然。

1080p
最高分辨率
32 FPS
帧率
15s
最长时长
~40ms
音画同步精度

与 Seedance 或 Kling 的差异

字节跳动的Seedance 2.0和快手的Kling 3.0也支持音频,但路径完全不同。它们先生成视频,再用第二个模型产出匹配的声音。这种顺序式做法意味着音频始终是在被动适应已经定型的画面,而不是与画面共同诞生。

SkyReels V4 的双流架构带来:

  • 音频与视觉元素从一开始就在语义上对齐
  • 说话画面的口型同步落在辅音上,而不是滞后
  • 环境声匹配材质属性(金属、木头、玻璃各异)
  • 无需后期处理来修正时间漂移

观看风景片段时差异并不明显,但在观看人物说话或物体与表面互动时,差距非常显著。

开源问题

此前的SkyReels版本(V1至V3)完全开源,可在HuggingFace和GitHub上下载权重。V4目前处于限量预览阶段,skyreels.ai官方平台提供免费层,但完整权重尚未发布。

目前可用

官方平台提供有每日生成限额的免费层。arXiv论文(2602.21818)详细介绍了完整架构。此前版本仍保持开源。

尚未具备

V4权重暂未开放下载。尚无自托管方案,也没有正式生产API。开源时间表仍不明朗。

对开源社区而言,这值得密切关注。如果Skywork延续以往的惯例,V4权重最终应会落地HuggingFace。如果你今天就需要开源的音视频生成方案,最接近的替代是SkyReels V3加上独立的音频模型

SkyReels V4 在排行榜中的位置

在Artificial Analysis Video Arena(采用人类盲测偏好投票)上,SkyReels V4的文本生视频Elo分目前为1,244。这与Kling 3.0(1,243)几乎打平,仍落后于当前榜首阿里巴巴的HappyHorse-1.0(1,347)。

模型Elo分数音频支持开源适合场景
HappyHorse-1.01,347纯视觉品质
SkyReels V41,244原生(双流)待定音视频内容
Kling 3.01,243顺序式量产规模
Wan 2.7顶级写实风格
LTX-2较低成本效率
对比图展示SkyReels V4、Kling 3.0、HappyHorse-1.0和Wan 2.7在视觉质量、音频支持、开源程度与速度上的差异
SkyReels V4 是顶级阵营中唯一原生生成音频的模型

SkyReels V4 与 HappyHorse 之间的视觉差距是真实存在的。但SkyReels是前五名中唯一能原生生成音频的模型。如果你的工作流需要声音,这种架构层面的优势比100分的Elo差距更重要。

这对创作者意味着什么

🎬

社交内容创作者

SkyReels V4 专为快速产出而生。生成带匹配音频的片段后即可发布,无需独立的声音设计环节。对TikTok、Reels与Shorts创作者来说,制作时间将大幅压缩。
🎵

音乐视频制作者

音频分支可接受参考音频作为引导,意味着你可以输入一段曲目,得到与节拍同步律动的画面。早期结果显示,动作重音与音乐节奏的契合度相当不错。
📢

广告创作者

带环境声的产品视频、可直接配旁白的素材、带声景的品牌内容,都能在一次生成中完成。对于规模化生产的品牌而言,节省的时间将快速累积。

更宏观的趋势:音频不再是可选项

SkyReels V4 并非孤立的实验。我们曾报道过字节跳动 Seedance 1.5 Pro引入音视频生成,以及AI视频走出无声时代的整体趋势。SkyReels V4 进一步证明,这件事可以在架构层面完成,而非靠后处理小技巧。

结论很清楚:到2026年底,任何不具备原生音频的AI视频模型都会显得不完整。问题不在于这是否会成为标准,而在于普及速度有多快。

💡
想立刻生成带声音的AI视频?Bonega的统一管线会自动选用当下最优的工具,并随着SkyReels V4等模型的成熟持续升级。免费试用

速查参考:SkyReels V4

  • 开发方: Skywork AI(昆仑公司)
  • 架构: 双流多模态扩散变换器(MMDiT)
  • 分辨率: 最高1080p,32 FPS
  • 时长: 最长15秒
  • 音频: 原生协同生成(非后处理)
  • 输入: 文本、图像、视频片段、蒙版、参考音频
  • 状态: skyreels.ai 限量预览(权重待开源发布)
  • 论文: arXiv 2602.21818
Henry
HenryCreative TechnologistAI Author

来自洛桑的创意技术专家,探索 AI 与艺术的交汇点。他在电子音乐创作间隙试验生成式模型。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。