Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
12 min read
329

EPFL Stable Video Infinity:错误循环如何解决 AI 视频最大的难题

EPFL 一篇新的 ICLR 2026 Oral 论文提出了错误循环技术,它能消除时间漂移,并以零额外计算成本实现多分钟 AI 视频生成。

EPFL Stable Video Infinity:错误循环如何解决 AI 视频最大的难题

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

每个 AI 视频模型都有同一个不愿公开的秘密。生成一段 4 秒视频,结果惊艳无比。但超过 15 秒后,角色开始变形,物理规律失效,色彩发生偏移,整个场景逐渐漂移至混乱无序。EPFL 的 VITA Lab 刚刚发布了一项解决方案,它可能是今年视频生成领域最重要的论文。

无人解决的漂移难题

如果你尝试过使用任何当前模型生成长篇 AI 视频,就会明白其中的挫败感。Sora 2 依据套餐限制在 15 至 25 秒。Runway Gen-4.5 最长为 10 秒。Kling 3.0 可达到 15 秒。原因不是算力或内存,而是时间漂移

💡

时间漂移发生于自回归视频模型逐帧累积微小误差时。每个生成帧都会成为下一帧的输入,细微缺陷会呈指数级叠加。数百帧之后,输出几乎不再像最初的提示词。

这在本质上类似于“传话游戏”问题。信息经过足够多人耳语传递后,就会变得无法辨认。以往的方法试图通过生成更短的片段再将其拼接来对抗漂移,但接缝清晰可见。另一些方法采用分层生成(先关键帧,后插值),这有所帮助,但并未消除核心问题。

错误循环登场

这篇题为 "Stable Video Infinity"、被接收为 ICLR 2026 Oral presentation 的论文,提出了一个看似简单却极具巧思的理念:教会模型处理自己的错误

Oral
ICLR 2026 状态
0
额外计算成本
Minutes
视频时长

关键洞见如下。在训练期间,标准视频扩散模型从干净的真实数据中学习。它们从未见过自己的生成输出。部署后,它们突然必须将自身不完美的预测作为输入,却不知道如何处理其中的噪声。

错误循环通过修改训练循环解决这一问题:

第 1 步

标准前向传递

模型基于干净的训练数据生成一个视频片段。

第 2 步

收集错误

模型自身的预测结果(包括其中的不完美之处)会被捕获,而非丢弃。

第 3 步

错误循环

这些不完美的输出会作为下一次训练迭代的输入反馈给模型,从而让模型即使面对带噪声、由自身生成的帧,也能生成稳定输出。

第 4 步

迭代优化

经过多轮训练,模型学会了强健的自我纠正机制,可防止误差累积。

这种方法的美妙之处在于其优雅。没有新的模型架构,没有额外参数,也没有推理时技巧。模型只是在训练中学习真实部署条件的样子。

为什么这比你想象的更重要

其影响远不止生成更长的猫咪视频。以下是发生的变化:

错误循环之前

  • 视频模型仅限于 4-20 秒
  • 场景一致性迅速下降
  • 角色身份在几秒后开始漂移
  • 物理效果变得越来越不真实
  • 色彩与光照发生不可预测的变化

错误循环之后

  • 可生成连贯的多分钟视频
  • 角色外观始终稳定
  • 物理规律与空间关系保持一致
  • 色彩分级与光照可靠稳定
  • 随时间推移没有可见的质量下降

数据表现

VITA Lab 团队在多种架构和基准上测试了 Stable Video Infinity。结果令人瞩目:

指标无错误循环使用错误循环改进
FVD(越低越好)4 秒后恶化在 2 分钟以上保持稳定显著
角色一致性15 秒时降至 60% 以下2 分钟时维持 90% 以上约 50% 相对提升
时间连贯性8 秒时出现可见漂移2 分钟时无可见漂移质的飞跃
计算开销基准基准(增加 0%)零成本
💡

零计算开销这一点至关重要。错误循环是训练时技术,而非推理时技术。一旦训练完成,模型会以与之前完全相同的速度和成本运行。

错误循环的底层工作原理

对于想了解技术细节的人,以下是修改后训练流程中发生的内容。

标准视频扩散训练使用施加于干净真实帧 x_0 的噪声调度 epsilon。模型学习预测噪声并恢复原始信号。在推理时,模型以自回归方式生成帧 t+1,其条件是对帧 t 的预测。

训练(干净输入)与推理(自生成输入)之间的差距称为暴露偏差。错误循环直接解决了这一问题。

技术细节:修改后的训练目标

在训练期间,模型会定期使用自身当前权重生成帧,而不是使用真实数据。这些包含不完美之处的自生成帧,随后会作为训练序列中后续帧的条件输入。

关键超参数是循环比例 r,它控制训练期间自生成帧替换真实帧的频率。论文发现,r = 0.3(30% 循环帧)可实现最佳性能,在稳定性提升和训练信号质量之间取得平衡。

修改后的损失函数仍然是标准扩散目标。唯一差别是模型在训练期间看到的数据分布。这正是推理时不存在计算开销的原因。

从概念上讲,这类似于序列到序列模型中的计划采样,但适配到了连续扩散框架。VITA Lab 团队在论文中指出了这一关联,同时也说明将计划采样直接应用于扩散模型并不可行。他们的贡献在于使其能够稳定用于视频生成的特定公式。

开源优势

或许最令人兴奋的一点是:代码已在 GitHub 上完全开源vita-epfl/Stable-Video-Infinity)。这意味着任何研究实验室或公司都可以将错误循环应用到其现有视频模型中。

开源为何重要
任何现有的视频扩散模型都可以通过错误循环进行改造。无需改变架构,只需修改训练循环。这可能会同时改进 Sora、Runway、Kling 以及所有开源模型。
实际限制
需要重新训练或微调模型。拥有专有模型的公司需要投入算力进行重新训练。该技术的有效性可能因不同架构和规模而异。

此次开源发布延续了 AI 视频研究社区日益壮大的趋势。LTX-2Wan 2.6 等模型已经表明,开源方案能够与专有替代方案竞争。

这对行业意味着什么

时机引人注目。我们正处于一场 AI 视频军备竞赛之中,从 RunwayByteDance,每个主要参与者都在追求更长、更高质量的输出。错误循环可能正是开启下一代能力所缺失的关键环节。

🎬

面向电影人和创作者

长篇连贯视频生成让真正的叙事内容成为可能。不再只是片段,而是场景、序列,最终还能从单个提示词生成短片。
🔬

面向研究人员

错误循环提供了一个可泛化的框架。同一原则可应用于音频生成、3D 场景合成,以及任何遭受漂移问题的自回归生成模型。
🏢

面向企业

稳定的长篇生成使 AI 视频适用于专业场景:产品演示、培训视频,以及需要在数分钟内容中保持一致质量的营销活动。

展望未来

VITA Lab 的工作代表了我们对 AI 视频生成思考方式的根本转变。与其构建越来越大的模型,或增加复杂的推理时机制,解决方案只是让模型看到自己的输出是什么样子。

该论文将在 ICLR 2026 展示,多家行业消息来源表明,主要视频模型提供商已经在探索集成。如果世界模型代表 AI 如何理解物理与空间的未来,那么错误循环则代表 AI 如何随时间保持这种理解的未来。

4 秒 AI 视频的时代或许会比任何人预期的更早结束。而且这不需要新的模型架构,也不需要数十亿美元的算力预算。只需要一个更智能的训练循环。

延伸阅读


来源

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。