字節跳動Vidi2:像編輯師一樣理解視訊的AI
字節跳動開源了Vidi2,一個擁有120億參數的模型,能夠深入理解視訊內容,自動將數小時的素材編輯成精良的片段。該技術已為TikTok智慧剪輯功能提供支援。

當大家都專注於視訊生成時,字節跳動悄然解決了一個不同的問題:讓AI像經驗豐富的編輯師那樣理解視訊。Vidi2能夠觀看數小時的原始素材,並精準提取其中的關鍵內容。
鮮為人談及的問題
我們現在擁有出色的AI視訊生成器。Runway Gen-4.5在質量榜單上名列前茅。Kling O1能生成同步音訊。但視訊製作中有一個不為人知的秘密:大部分時間花在剪輯上,而非創作。
婚禮攝影師拍攝8小時素材,只為製作5分鐘的精彩集錦。內容創作者錄製45分鐘,只為製作60秒的TikTok短視訊。企業團隊有200小時的培訓素材深埋在SharePoint中。
視訊生成佔據頭條,視訊理解完成實際工作。
Vidi2正是為解決這一差距而生。它不是又一個生成器,而是一個能夠觀看視訊、理解發生了什麼,並幫助您大規模處理這些內容的AI。
Vidi2的實際功能
字節跳動將Vidi2描述為「用於視訊理解與創作的大型多模態模型」。這個擁有120億參數的模型擅長:
時空定位
在視訊中找到任何物體並跟蹤其運動軌跡。不僅是「0:32處有一隻貓」,而是「貓在0:32進入畫面,在0:45移動到沙發,在1:12離開畫面」。
智慧剪輯
分析素材並根據內容建議剪切點。找到最佳時刻,識別場景邊界,理解節奏。
內容分析
以足夠詳細的方式描述視訊中發生的事情。不是「兩個人在說話」,而是「訪談片段,嘉賓講解產品功能,3:45處為高互動時刻」。
物體跟蹤
將物體作為連續的「管道」在視訊中跟蹤,即使它們離開並重新進入畫面。這使得精確選擇以應用效果、移除或強調成為可能。
技術創新:時空定位
以往的視訊AI在兩個維度上工作:空間(這一幀中有什麼)或時間(某事何時發生)。Vidi2將兩者結合成字節跳動所稱的「時空定位」(STG)。
傳統方法:
- 空間:「汽車位於像素座標(450, 320)」
- 時間:「汽車在時間戳0:15出現」
- 結果:需要人工關聯的分散資訊
Vidi2 STG:
- 組合:「紅色汽車在0:15時位於(450, 320),在0:18移動到(890, 340),在0:22從右側離開」
- 結果:物體在空間和時間中的完整軌跡
這一點很重要,因為真實的剪輯任務需要兩個維度。「移除收音桿」需要知道它出現在哪裡(空間)以及持續多長時間(時間)。Vidi2將其作為單一查詢處理。
基準測試:超越巨頭
有趣的地方來了。在字節跳動的VUE-STG時空定位基準測試中,儘管參數量較少,Vidi2的表現仍然優於Gemini 2.0 Flash和GPT-4o。
需要注意的是:這些基準測試由字節跳動創建。在第三方基準測試上的獨立驗證將使這些主張更具說服力。話雖如此,專業化架構方法是合理的。
基準測試結果表明,視訊理解受益於專業化設計,而不僅僅是規模。從零開始為視訊構建的模型可以超越那些將視訊視為圖像理解延伸的更大通用模型。
已投入生產:TikTok智慧剪輯
這不是空談。Vidi2為TikTok的「智慧剪輯」功能提供支援,該功能:
- ✓自動從長視訊中提取精彩片段
- ✓生成與語音同步的字幕
- ✓為不同長寬比重建佈局
- ✓基於內容識別最佳剪切點
數百萬創作者每天都在使用智慧剪輯。該模型已在大規模應用中得到驗證,而非理論產物。
開源:親自運行
字節跳動在GitHub上以CC BY-NC 4.0許可證發布了Vidi2。這意味著可免費用於研究、教育和個人專案,但商業使用需要單獨授權。其影響包括:
對於開發者:
- 構建自訂視訊分析管道
- 將理解能力整合到現有工具中
- 針對特定領域進行微調
- 大規模使用無API成本
對於企業:
- 在本地處理敏感素材
- 構建專有剪輯工作流
- 避免供應商鎖定
- 針對內部內容類型進行定製
開源發布延續了我們在LTX Video和其他中國AI實驗室看到的模式:公開發布強大模型,而西方競爭對手則保持其專有性。
實際應用
讓我介紹一些Vidi2能夠實現的真實工作流:
內容再利用
輸入:2小時播客錄製 輸出:10個精彩時刻的短片段,每個都有適當的開場/結尾剪輯
該模型識別引人入勝的時刻,找到自然的剪切點,並提取可作為獨立內容的片段。
培訓視訊管理
輸入:500小時企業培訓素材 查詢:「查找所有解釋新CRM工作流程的片段」
無需手動瀏覽或依賴不可靠的中繼資料,Vidi2實際觀看並理解內容。
體育精彩集錦
輸入:完整比賽錄影 輸出:包含所有得分時刻、險些得分和慶祝場景的精彩集錦
該模型對體育情境的理解足以識別有意義的時刻,而不僅僅是動作。
監控回顧
輸入:24小時安保錄影 查詢:「查找所有在下午6點後從側門進入的人員」
時空定位意味著能夠提供帶有精確時間戳和位置的準確答案。
與生成模型的比較
- 處理現有素材
- 節省剪輯時間,而非生成時間
- 可擴展至海量視訊庫
- 無需創意提示
- 立即適用於企業
- 從零創建新內容
- 創意表達工具
- 行銷和廣告應用
- 質量快速提升
- 令人興奮但應用場景不同
這些不是競爭技術。它們解決不同的問題。完整的AI視訊工作流需要兩者:生成用於創建新內容,理解用於處理現有內容。
更大的圖景
視訊理解是AI從「令人印象深刻的展示」轉向「日常工具」的關鍵。生成吸引注意力,理解完成工作。
考慮一下這帶來了什麼:
- 每家企業都有被困在檔案中的視訊內容
- 每位創作者在剪輯上花費的時間多於拍攝
- 每個平台都需要更好的內容審核和發現
- 每位研究人員都有無法高效分析的素材
Vidi2解決了所有這些問題。開源發布意味著這些功能現在對任何擁有足夠算力的人都是可存取的。
入門指南
該模型在GitHub上提供,附帶文件和示範。要求:
- 至少24GB顯存的NVIDIA GPU用於完整模型
- 為較小GPU提供量化版本
- Python 3.10+和PyTorch 2.0+
快速開始:
git clone https://github.com/bytedance/vidi
cd vidi
pip install -r requirements.txt
python demo.py --video your_video.mp4 --query "describe the main events"儘管字節跳動是一家中國公司,但文件主要使用英語,這反映了其全球目標受眾。
對行業的意義
AI視訊領域現在有兩條不同的賽道:
| 賽道 | 領導者 | 焦點 | 價值 |
|---|---|---|---|
| 生成 | Runway、Sora、Veo、Kling | 創建新視訊 | 創意表達 |
| 理解 | Vidi2(其他正在湧現) | 分析現有視訊 | 生產力 |
兩者都將成熟。兩者都將整合。2026年完整的AI視訊堆疊將無縫地生成、編輯和理解。
目前,Vidi2代表了視訊理解領域最強大的開源選擇。如果您有素材需要分析、剪輯需要自動化或內容需要整理,這是值得探索的模型。
我的看法
我花了多年時間構建視訊處理管道。使用Vidi2這樣的模型前後的對比是鮮明的。那些需要自訂電腦視覺堆疊、手動標註和脆弱啟發式的任務,現在可以透過一個提示解決。
最好的AI工具不會取代人類判斷。它們消除了阻礙人類大規模應用判斷的繁瑣工作。
Vidi2不會取代編輯師。它為編輯師提供了以前無法大規模實現的能力。而且透過開放存取(用於非商業用途),這些能力對任何願意搭建基礎設施的人都是可用的。
視訊的未來不僅僅是生成。而是理解。這個未來現在已經開源。
來源
相關文章
繼續探索這些相關文章

Helios: 在消費級硬體上執行即時AI影片生成的14B模型
來自北京大學、位元組跳動和Canva的Helios僅用6GB顯存透過群組卸載生成長達一分鐘的AI影片,幀率達19.5 FPS,完全開源。

SkyReels V4:首個能同時看與聽的AI模型
Skywork AI的SkyReels V4引入了雙流擴散架構,可在單一生成過程中同步產出影片與音訊。這對創作者意味著什麼?

Seedance 2.0 進駐 CapCut,好萊塢不買帳
字節跳動在 Sora 停止服務兩天後,將爭議性 AI 影片模型上線 CapCut。這件事為什麼重要,好萊塢又為什麼全面反擊。
