字节跳动Vidi2:像编辑师一样理解视频的AI
字节跳动开源了Vidi2,一个拥有120亿参数的模型,能够深入理解视频内容,自动将数小时的素材编辑成精良的片段。该技术已为抖音智能剪辑功能提供支持。

当大家都专注于视频生成时,字节跳动悄然解决了一个不同的问题:让AI像经验丰富的编辑师那样理解视频。Vidi2能够观看数小时的原始素材,并精准提取其中的关键内容。
鲜为人谈及的问题
我们现在拥有出色的AI视频生成器。Runway Gen-4.5在质量榜单上名列前茅。Kling O1能生成同步音频。但视频制作中有一个不为人知的秘密:大部分时间花在剪辑上,而非创作。
婚礼摄影师拍摄8小时素材,只为制作5分钟的精彩集锦。内容创作者录制45分钟,只为制作60秒的TikTok短视频。企业团队有200小时的培训素材深埋在SharePoint中。
视频生成占据头条,视频理解完成实际工作。
Vidi2正是为解决这一差距而生。它不是又一个生成器,而是一个能够观看视频、理解发生了什么,并帮助您大规模处理这些内容的AI。
Vidi2的实际功能
字节跳动将Vidi2描述为"用于视频理解与创作的大型多模态模型"。这个拥有120亿参数的模型擅长:
时空定位
在视频中找到任何物体并跟踪其运动轨迹。不仅是"0:32处有一只猫",而是"猫在0:32进入画面,在0:45移动到沙发,在1:12离开画面"。
智能剪辑
分析素材并根据内容建议剪切点。找到最佳时刻,识别场景边界,理解节奏。
内容分析
以足够详细的方式描述视频中发生的事情。不是"两个人在说话",而是"访谈片段,嘉宾讲解产品功能,3:45处为高互动时刻"。
物体跟踪
将物体作为连续的"管道"在视频中跟踪,即使它们离开并重新进入画面。这使得精确选择以应用效果、移除或强调成为可能。
技术创新:时空定位
以往的视频AI在两个维度上工作:空间(这一帧中有什么)或时间(某事何时发生)。Vidi2将两者结合成字节跳动所称的"时空定位"(STG)。
传统方法:
- 空间:"汽车位于像素坐标(450, 320)"
- 时间:"汽车在时间戳0:15出现"
- 结果:需要人工关联的分散信息
Vidi2 STG:
- 组合:"红色汽车在0:15时位于(450, 320),在0:18移动到(890, 340),在0:22从右侧离开"
- 结果:物体在空间和时间中的完整轨迹
这一点很重要,因为真实的剪辑任务需要两个维度。"移除收音杆"需要知道它出现在哪里(空间)以及持续多长时间(时间)。Vidi2将其作为单一查询处理。
基准测试:超越巨头
有趣的地方来了。在字节跳动的VUE-STG时空定位基准测试中,尽管参数量较少,Vidi2的表现仍然优于Gemini 2.0 Flash和GPT-4o。
需要注意的是:这些基准测试由字节跳动创建。在第三方基准测试上的独立验证将使这些主张更具说服力。话虽如此,专业化架构方法是合理的。
基准测试结果表明,视频理解受益于专业化设计,而不仅仅是规模。从零开始为视频构建的模型可以超越那些将视频视为图像理解延伸的更大通用模型。
已投入生产:抖音智能剪辑
这不是空谈。Vidi2为抖音的"智能剪辑"功能提供支持,该功能:
- ✓自动从长视频中提取精彩片段
- ✓生成与语音同步的字幕
- ✓为不同长宽比重建布局
- ✓基于内容识别最佳剪切点
数百万创作者每天都在使用智能剪辑。该模型已在大规模应用中得到验证,而非理论产物。
开源:亲自运行
字节跳动在GitHub上以CC BY-NC 4.0许可证发布了Vidi2。这意味着可免费用于研究、教育和个人项目,但商业使用需要单独授权。其影响包括:
对于开发者:
- 构建自定义视频分析管道
- 将理解能力集成到现有工具中
- 针对特定领域进行微调
- 大规模使用无API成本
对于企业:
- 在本地处理敏感素材
- 构建专有剪辑工作流
- 避免供应商锁定
- 针对内部内容类型进行定制
开源发布延续了我们在LTX Video和其他中国AI实验室看到的模式:公开发布强大模型,而西方竞争对手则保持其专有性。
实际应用
让我介绍一些Vidi2能够实现的真实工作流:
内容再利用
输入:2小时播客录制 输出:10个精彩时刻的短片段,每个都有适当的开场/结尾剪辑
该模型识别引人入胜的时刻,找到自然的剪切点,并提取可作为独立内容的片段。
培训视频管理
输入:500小时企业培训素材 查询:"查找所有解释新CRM工作流程的片段"
无需手动浏览或依赖不可靠的元数据,Vidi2实际观看并理解内容。
体育精彩集锦
输入:完整比赛录像 输出:包含所有得分时刻、险些得分和庆祝场景的精彩集锦
该模型对体育情境的理解足以识别有意义的时刻,而不仅仅是动作。
监控回顾
输入:24小时安保录像 查询:"查找所有在下午6点后从侧门进入的人员"
时空定位意味着能够提供带有精确时间戳和位置的准确答案。
与生成模型的比较
- 处理现有素材
- 节省剪辑时间,而非生成时间
- 可扩展至海量视频库
- 无需创意提示
- 立即适用于企业
- 从零创建新内容
- 创意表达工具
- 营销和广告应用
- 质量快速提升
- 令人兴奋但应用场景不同
这些不是竞争技术。它们解决不同的问题。完整的AI视频工作流需要两者:生成用于创建新内容,理解用于处理现有内容。
更大的图景
视频理解是AI从"令人印象深刻的演示"转向"日常工具"的关键。生成吸引注意力,理解完成工作。
考虑一下这带来了什么:
- 每家企业都有被困在档案中的视频内容
- 每位创作者在剪辑上花费的时间多于拍摄
- 每个平台都需要更好的内容审核和发现
- 每位研究人员都有无法高效分析的素材
Vidi2解决了所有这些问题。开源发布意味着这些功能现在对任何拥有足够算力的人都是可访问的。
入门指南
该模型在GitHub上提供,附带文档和演示。要求:
- 至少24GB显存的NVIDIA GPU用于完整模型
- 为较小GPU提供量化版本
- Python 3.10+和PyTorch 2.0+
快速开始:
git clone https://github.com/bytedance/vidi
cd vidi
pip install -r requirements.txt
python demo.py --video your_video.mp4 --query "describe the main events"尽管字节跳动是一家中国公司,但文档主要使用英语,这反映了其全球目标受众。
对行业的意义
AI视频领域现在有两条不同的赛道:
| 赛道 | 领导者 | 焦点 | 价值 |
|---|---|---|---|
| 生成 | Runway、Sora、Veo、Kling | 创建新视频 | 创意表达 |
| 理解 | Vidi2(其他正在涌现) | 分析现有视频 | 生产力 |
两者都将成熟。两者都将集成。2026年完整的AI视频堆栈将无缝地生成、编辑和理解。
目前,Vidi2代表了视频理解领域最强大的开源选择。如果您有素材需要分析、剪辑需要自动化或内容需要整理,这是值得探索的模型。
我的看法
我花了多年时间构建视频处理管道。使用Vidi2这样的模型前后的对比是鲜明的。那些需要自定义计算机视觉堆栈、手动标注和脆弱启发式的任务,现在可以通过一个提示解决。
最好的AI工具不会取代人类判断。它们消除了阻碍人类大规模应用判断的繁琐工作。
Vidi2不会取代编辑师。它为编辑师提供了以前无法大规模实现的能力。而且通过开放访问(用于非商业用途),这些能力对任何愿意搭建基础设施的人都是可用的。
视频的未来不仅仅是生成。而是理解。这个未来现在已经开源。
来源
相关文章
继续探索这些相关文章

Helios: 在消费级硬件上运行实时AI视频生成的14B模型
来自北京大学、字节跳动和Canva的Helios仅用6GB显存通过组卸载生成长达一分钟的AI视频,帧率达19.5 FPS,完全开源。

AI 视频延长器:2026 年如何延长视频时长
使用 AI 视频延长器在 2026 年延长视频时长。比较延长限制,保持连贯性,并为生成或现有片段选择工作流程。

SkyReels V4:首个能同时看与听的AI模型
Skywork AI的SkyReels V4引入了双流扩散架构,可在一次生成过程中同步产出视频和音频。这对创作者意味着什么?
