SkyReels V4:首个能同时看与听的AI模型
Skywork AI的SkyReels V4引入了双流扩散架构,可在一次生成过程中同步产出视频和音频。这对创作者意味着什么?

为何音频一直是AI视频的盲点
如果你曾尝试为AI生成的片段加上声音,应该深有体会。先生成一段雨打窗户的画面,再去寻找匹配的音轨,调整时间点,祈祷它不会显得违和。
问题的根源在于架构。像Kling 3.0或Runway Gen-4.5这样的模型,最初都是作为视觉引擎构建的。即便支持音频,也是通过另一条独立管线在事后进行同步。
SkyReels V4 的工作原理
Skywork AI(昆仑公司旗下的研究部门)打造了一个被称为双流多模态扩散变换器(Dual-stream MMDiT)的系统。可以把它想成两个共享同一神经系统的专家大脑。
视觉分支
以最高1080p、32 FPS的规格生成视频帧,处理动作、光线、场景构图,以及整段片段的时序一致性。
音频分支
在同一次扩散过程中生成同步声音。不是为成片配音,而是与画面同步成形。
两条分支共用一个建立在多模态大语言模型之上的文本编码器。正因为这种共享理解,像「慢动作下玻璃在大理石地板上碎裂」这样的提示词,所产生的音频重音能落在视觉冲击点的约40毫秒之内。这种精度足以让人觉得自然。
与 Seedance 或 Kling 的差异
字节跳动的Seedance 2.0和快手的Kling 3.0也支持音频,但路径完全不同。它们先生成视频,再用第二个模型产出匹配的声音。这种顺序式做法意味着音频始终是在被动适应已经定型的画面,而不是与画面共同诞生。
SkyReels V4 的双流架构带来:
- ✓音频与视觉元素从一开始就在语义上对齐
- ✓说话画面的口型同步落在辅音上,而不是滞后
- ✓环境声匹配材质属性(金属、木头、玻璃各异)
- ✓无需后期处理来修正时间漂移
观看风景片段时差异并不明显,但在观看人物说话或物体与表面互动时,差距非常显著。
开源问题
此前的SkyReels版本(V1至V3)完全开源,可在HuggingFace和GitHub上下载权重。V4目前处于限量预览阶段,skyreels.ai官方平台提供免费层,但完整权重尚未发布。
官方平台提供有每日生成限额的免费层。arXiv论文(2602.21818)详细介绍了完整架构。此前版本仍保持开源。
V4权重暂未开放下载。尚无自托管方案,也没有正式生产API。开源时间表仍不明朗。
对开源社区而言,这值得密切关注。如果Skywork延续以往的惯例,V4权重最终应会落地HuggingFace。如果你今天就需要开源的音视频生成方案,最接近的替代是SkyReels V3加上独立的音频模型。
SkyReels V4 在排行榜中的位置
在Artificial Analysis Video Arena(采用人类盲测偏好投票)上,SkyReels V4的文本生视频Elo分目前为1,244。这与Kling 3.0(1,243)几乎打平,仍落后于当前榜首阿里巴巴的HappyHorse-1.0(1,347)。
| 模型 | Elo分数 | 音频支持 | 开源 | 适合场景 |
|---|---|---|---|---|
| HappyHorse-1.0 | 1,347 | 无 | 否 | 纯视觉品质 |
| SkyReels V4 | 1,244 | 原生(双流) | 待定 | 音视频内容 |
| Kling 3.0 | 1,243 | 顺序式 | 否 | 量产规模 |
| Wan 2.7 | 顶级 | 无 | 是 | 写实风格 |
| LTX-2 | 较低 | 无 | 是 | 成本效率 |

SkyReels V4 与 HappyHorse 之间的视觉差距是真实存在的。但SkyReels是前五名中唯一能原生生成音频的模型。如果你的工作流需要声音,这种架构层面的优势比100分的Elo差距更重要。
这对创作者意味着什么
社交内容创作者
音乐视频制作者
广告创作者
更宏观的趋势:音频不再是可选项
SkyReels V4 并非孤立的实验。我们曾报道过字节跳动 Seedance 1.5 Pro引入音视频生成,以及AI视频走出无声时代的整体趋势。SkyReels V4 进一步证明,这件事可以在架构层面完成,而非靠后处理小技巧。
结论很清楚:到2026年底,任何不具备原生音频的AI视频模型都会显得不完整。问题不在于这是否会成为标准,而在于普及速度有多快。
速查参考:SkyReels V4
- 开发方: Skywork AI(昆仑公司)
- 架构: 双流多模态扩散变换器(MMDiT)
- 分辨率: 最高1080p,32 FPS
- 时长: 最长15秒
- 音频: 原生协同生成(非后处理)
- 输入: 文本、图像、视频片段、蒙版、参考音频
- 状态: skyreels.ai 限量预览(权重待开源发布)
- 论文: arXiv 2602.21818
相关文章
继续探索这些相关文章

2026年3月AI海啸:7天12个模型终结云计算时代
2026年3月见证了AI视频模型发布历史上最密集的爆发。在短短一周内发布了十多个新模型,最大的故事不是任何单个发布,而是本地生成现在与云计算相当。

Helios: 在消费级硬件上运行实时AI视频生成的14B模型
来自北京大学、字节跳动和Canva的Helios仅用6GB显存通过组卸载生成长达一分钟的AI视频,帧率达19.5 FPS,完全开源。

在本地运行AI视频:LTX-2、RTX和ComfyUI在2026年
使用LTX-2和ComfyUI在自己的GPU上生成4K AI视频。无需订阅、无需云端、无需数据隐私顾虑。以下是开始所需的所有信息。

