CraftStory Model 2.0:双向扩散如何实现5分钟AI视频生成
当Sora 2最长只能生成25秒视频时,CraftStory推出了能够生成连贯5分钟视频的系统。其秘诀在于:通过双向约束并行运行多个扩散引擎。

AI视频领域一直面临的核心挑战是什么?时长限制。Sora 2最多只能生成25秒,Runway和Pika通常在10秒左右徘徊。而CraftStory刚刚带来了突破性的成果:能够生成连贯的5分钟视频。这背后的技术确实令人称道。
长久未解的时长难题
关于当前AI视频模型的一个现实是:它们更擅长短跑而非马拉松。虽然能生成8秒精美的画面,但一旦尝试延长,就会出现类似"传话游戏"的视觉问题。伪影不断累积,人物形象漂移,整体效果逐渐崩塌。
传统方法的工作流程是:生成一个片段,使用最后几帧作为下一个片段的上下文,然后将它们拼接在一起。问题在于错误会不断累积。第一个片段中略显奇怪的手部位置,到第五个片段时就会变成一个奇怪的模糊物。
CraftStory由OpenCV背后的团队创立,OpenCV是一个几乎运行在您所使用过的每个视觉系统中的计算机视觉库。他们的首席执行官Victor Erukhimov联合创立了Itseez,这是一家于2016年被英特尔收购的计算机视觉初创公司。
双向扩散:架构创新
CraftStory的解决方案颠覆了传统方法。它不是按顺序生成并寄希望于最佳效果,而是在整个视频时间线上同时运行多个较小的扩散引擎。
双向约束
关键洞察是,正如Erukhimov所解释的:"视频的后半部分也可以影响前半部分。这一点相当重要,因为如果逐个生成,那么出现在第一部分的伪影会传播到第二部分,然后不断累积。"
可以这样理解:这就像写小说与列提纲的区别。顺序生成就像写第一页,然后第二页,再第三页,无法回头修改。而CraftStory的方法就像有一个提纲,第十章可以影响第二章需要发生的内容。
传统顺序方法
- 生成片段A
- 使用A的结尾开始B
- 使用B的结尾开始C
- 期望没有累积问题
- 在拼接点处祈祷顺利
双向并行方法
- 同时处理所有片段
- 每个片段约束其相邻片段
- 早期片段受后期片段影响
- 伪影在时间线上自我修正
- 原生连贯性,无需拼接
Model 2.0的实际工作原理
目前,CraftStory Model 2.0是一个视频到视频的系统。您需要提供一张图像和一个驱动视频,系统会生成输出,让您图像中的人物执行驱动视频中的动作。
- ✓上传参考图像(您的主体)
- ✓提供驱动视频(动作模板)
- ✓模型合成表演
- ✓文本到视频功能将在未来更新中推出
其唇形同步系统表现出色。输入脚本或音频轨道,它就能生成匹配的嘴部动作。一个独立的手势对齐算法可以将肢体语言与语音节奏和情感基调同步。最终效果是什么?视频中的人物看起来确实像在说这些话,而不只是机械地张合嘴巴。
CraftStory使用专门为该模型拍摄的专有高帧率素材进行训练。标准的30fps YouTube视频片段存在过多运动模糊,无法捕捉手指等精细细节。他们聘请了工作室以更高帧率拍摄演员,以获得更清晰的训练数据。
输出效果:实际获得的成果
- 最长5分钟连续视频
- 原生480p和720p分辨率
- 720p可放大至1080p
- 支持横屏和竖屏格式
- 同步的唇部动作
- 自然的手势对齐
- 仅支持视频到视频(尚无文本到视频)
- 需要驱动视频输入
- 低分辨率30秒视频约需15分钟
- 目前仅支持静态相机(移动相机即将推出)
生成一个低分辨率30秒片段大约需要15分钟。这比某些模型提供的近乎即时生成要慢,但权衡之处在于获得连贯的长格式输出,而不是无法连接的精美片段。
对创作者的意义
5分钟这个界限并非随意设定。这是AI视频变得能够用于实际内容创作的门槛。
社交片段
适合TikTok短视频和广告,但叙事能力有限
简短说明
足以进行快速产品演示或概念说明
真实内容
YouTube教程、培训视频、演示文稿、叙事内容
长格式
完整剧集、纪录片、教育课程
大多数商业视频内容都在2-5分钟范围内。产品演示、培训模块、说明视频、内部沟通。这是CraftStory对专业用例变得相关的领域。
开启的应用场景:
- 具有一致主持人的产品教程
- 无需安排人才时间的培训视频
- 大规模个性化视频消息
- 带有虚拟讲师的教育内容
- 带有生成发言人的企业通信
竞争格局
CraftStory获得了由Wrike和Zencoder创始人Andrew Filev领投的200万美元种子轮融资。与流向OpenAI和谷歌的数十亿美元相比,这个数字并不算大,但足以证明该技术的可行性。
OpenCV的联系
创始团队的资历在这里很重要。OpenCV为各行业的计算机视觉系统提供支持。这些专业人士对视觉处理基础的理解,是大多数AI视频初创公司所不具备的。
文本到视频功能正在开发中。一旦推出,价值主张将变得更加清晰:用文本描述一个5分钟的视频,就能获得连贯的输出,而不会出现困扰其他工具的逐帧质量下降问题。
未来展望
路线图功能▼
CraftStory已宣布即将推出的几项功能:
- 文本到视频:无需驱动视频即可从提示生成
- 移动相机:摇镜、变焦和跟踪镜头
- 边走边说:主体在说话时在空间中移动
双向扩散方法不仅仅是CraftStory的独门秘籍。这是一种其他团队可能会采用的模式。一旦解决了"错误向前累积"的问题,更长时间的生成就会从一个根本性障碍变成一个工程挑战。
Model 2.0目前专注于以人为中心的视频。对于没有人物的场景,您仍然需要针对环境或抽象生成优化的工具。这是一个专业工具,而不是通用工具。
更宏观的视角
我们正在见证AI视频经历其尴尬的青春期。这些模型可以生成令人惊叹的10秒片段,但要求它们在几分钟内保持连贯性,它们就会失败。CraftStory的双向方法是解决这个问题的一个答案。
真正的问题是:这项技术被更大的参与者采用还需要多久?OpenAI、谷歌和Runway都拥有实施类似架构的资源。CraftStory的优势在于率先将可用的长格式生成推向市场。
目前,如果您需要具有人物主体的一致多分钟AI视频内容,CraftStory刚刚成为唯一的选择。时长障碍尚未完全打破,但已经有人在上面打出了一个严重的裂缝。
立即尝试
CraftStory Model 2.0现已推出。定价结构尚未公开详述,因此您需要查看他们的网站以了解当前的服务。文本到视频功能即将推出,这将使该平台对没有现有驱动视频内容的用户更加易用。
相关文章
继续探索这些相关文章

Pika 2.5:通过速度、价格和创意工具推动AI视频大众化
Pika Labs发布2.5版本,结合更快的生成速度、增强的物理效果以及Pikaframes和Pikaffects等创意工具,让每个人都能使用AI视频。

几秒创建专业视频:Runway Gen 4.5 评测(超越 Sora)
Runway Gen 4.5 在盲测中排名第一。提供免费试用。了解为何优于 Sora,对比功能特性,立即开始创作。

Sora 之后的 AI 视频市场:2026 年需要了解的 4 个市场层级
Sora 将于 4 月 26 日关闭。AI 视频市场已整合为四个层级。这是一份实用指南,帮助您根据需求选择合适的 Sora 替代方案。
