EPFL Stable Video Infinity:错误循环如何解决 AI 视频最大的难题
EPFL 一篇新的 ICLR 2026 Oral 论文提出了错误循环技术,它能消除时间漂移,并以零额外计算成本实现多分钟 AI 视频生成。

无人解决的漂移难题
如果你尝试过使用任何当前模型生成长篇 AI 视频,就会明白其中的挫败感。Sora 2 依据套餐限制在 15 至 25 秒。Runway Gen-4.5 最长为 10 秒。Kling 3.0 可达到 15 秒。原因不是算力或内存,而是时间漂移。
时间漂移发生于自回归视频模型逐帧累积微小误差时。每个生成帧都会成为下一帧的输入,细微缺陷会呈指数级叠加。数百帧之后,输出几乎不再像最初的提示词。
这在本质上类似于“传话游戏”问题。信息经过足够多人耳语传递后,就会变得无法辨认。以往的方法试图通过生成更短的片段再将其拼接来对抗漂移,但接缝清晰可见。另一些方法采用分层生成(先关键帧,后插值),这有所帮助,但并未消除核心问题。
错误循环登场
这篇题为 "Stable Video Infinity"、被接收为 ICLR 2026 Oral presentation 的论文,提出了一个看似简单却极具巧思的理念:教会模型处理自己的错误。
关键洞见如下。在训练期间,标准视频扩散模型从干净的真实数据中学习。它们从未见过自己的生成输出。部署后,它们突然必须将自身不完美的预测作为输入,却不知道如何处理其中的噪声。
错误循环通过修改训练循环解决这一问题:
标准前向传递
模型基于干净的训练数据生成一个视频片段。
收集错误
模型自身的预测结果(包括其中的不完美之处)会被捕获,而非丢弃。
错误循环
这些不完美的输出会作为下一次训练迭代的输入反馈给模型,从而让模型即使面对带噪声、由自身生成的帧,也能生成稳定输出。
迭代优化
经过多轮训练,模型学会了强健的自我纠正机制,可防止误差累积。
这种方法的美妙之处在于其优雅。没有新的模型架构,没有额外参数,也没有推理时技巧。模型只是在训练中学习真实部署条件的样子。
为什么这比你想象的更重要
其影响远不止生成更长的猫咪视频。以下是发生的变化:
错误循环之前
- 视频模型仅限于 4-20 秒
- 场景一致性迅速下降
- 角色身份在几秒后开始漂移
- 物理效果变得越来越不真实
- 色彩与光照发生不可预测的变化
错误循环之后
- 可生成连贯的多分钟视频
- 角色外观始终稳定
- 物理规律与空间关系保持一致
- 色彩分级与光照可靠稳定
- 随时间推移没有可见的质量下降
数据表现
VITA Lab 团队在多种架构和基准上测试了 Stable Video Infinity。结果令人瞩目:
| 指标 | 无错误循环 | 使用错误循环 | 改进 |
|---|---|---|---|
| FVD(越低越好) | 4 秒后恶化 | 在 2 分钟以上保持稳定 | 显著 |
| 角色一致性 | 15 秒时降至 60% 以下 | 2 分钟时维持 90% 以上 | 约 50% 相对提升 |
| 时间连贯性 | 8 秒时出现可见漂移 | 2 分钟时无可见漂移 | 质的飞跃 |
| 计算开销 | 基准 | 基准(增加 0%) | 零成本 |
零计算开销这一点至关重要。错误循环是训练时技术,而非推理时技术。一旦训练完成,模型会以与之前完全相同的速度和成本运行。
错误循环的底层工作原理
对于想了解技术细节的人,以下是修改后训练流程中发生的内容。
标准视频扩散训练使用施加于干净真实帧 x_0 的噪声调度 epsilon。模型学习预测噪声并恢复原始信号。在推理时,模型以自回归方式生成帧 t+1,其条件是对帧 t 的预测。
训练(干净输入)与推理(自生成输入)之间的差距称为暴露偏差。错误循环直接解决了这一问题。
技术细节:修改后的训练目标▼
在训练期间,模型会定期使用自身当前权重生成帧,而不是使用真实数据。这些包含不完美之处的自生成帧,随后会作为训练序列中后续帧的条件输入。
关键超参数是循环比例 r,它控制训练期间自生成帧替换真实帧的频率。论文发现,r = 0.3(30% 循环帧)可实现最佳性能,在稳定性提升和训练信号质量之间取得平衡。
修改后的损失函数仍然是标准扩散目标。唯一差别是模型在训练期间看到的数据分布。这正是推理时不存在计算开销的原因。
从概念上讲,这类似于序列到序列模型中的计划采样,但适配到了连续扩散框架。VITA Lab 团队在论文中指出了这一关联,同时也说明将计划采样直接应用于扩散模型并不可行。他们的贡献在于使其能够稳定用于视频生成的特定公式。
开源优势
或许最令人兴奋的一点是:代码已在 GitHub 上完全开源(vita-epfl/Stable-Video-Infinity)。这意味着任何研究实验室或公司都可以将错误循环应用到其现有视频模型中。
此次开源发布延续了 AI 视频研究社区日益壮大的趋势。LTX-2 和 Wan 2.6 等模型已经表明,开源方案能够与专有替代方案竞争。
这对行业意味着什么
时机引人注目。我们正处于一场 AI 视频军备竞赛之中,从 Runway 到 ByteDance,每个主要参与者都在追求更长、更高质量的输出。错误循环可能正是开启下一代能力所缺失的关键环节。
面向电影人和创作者
面向研究人员
面向企业
展望未来
VITA Lab 的工作代表了我们对 AI 视频生成思考方式的根本转变。与其构建越来越大的模型,或增加复杂的推理时机制,解决方案只是让模型看到自己的输出是什么样子。
该论文将在 ICLR 2026 展示,多家行业消息来源表明,主要视频模型提供商已经在探索集成。如果世界模型代表 AI 如何理解物理与空间的未来,那么错误循环则代表 AI 如何随时间保持这种理解的未来。
4 秒 AI 视频的时代或许会比任何人预期的更早结束。而且这不需要新的模型架构,也不需要数十亿美元的算力预算。只需要一个更智能的训练循环。
延伸阅读
- 开源 AI 视频革命:开源模型如何缩小与专有系统之间的差距
- AI 视频中的物理模拟:了解模型如何学习物理一致性
- 扩散 Transformer:驱动现代视频生成的架构
来源
- International Conference on Learning Representations:Oral(ICLR 2026 状态) (International Conference on Learning Representations)
- EPFL VITA researchers via arXiv:Stable Video Infinity 支持无限长度视频生成,且无需额外推理… (EPFL VITA researchers via arXiv)
相关文章
继续探索这些相关文章

最佳免费 Text-to-Video AI 工具:2026 指南
比较 2026 年最佳免费 Text-to-Video AI 工具,包括其实际积分限制、水印、本地部署的取舍,以及实用测试方案。

AI 视频工具定价 2026:如何规划预算而不烧光 Credits
AI 视频工具已经不难找到。难的是为你的工作流选择合适的定价模式。这里是一份面向创作者和团队的实用预算指南。

AI 视频在教育领域的应用:2026 年教师和课程创作者如何使用 AI
从讲座录制到完整的课程制作,AI 视频工具正在改变教育工作者创建内容的方式。本文将探讨哪些方法有效,哪些无效,以及这项技术的发展方向。
