CraftStory Model 2.0:雙向擴散如何實現5分鐘AI影片生成
當Sora 2最長只能生成25秒影片時,CraftStory推出了能夠生成連貫5分鐘影片的系統。其秘訣在於:透過雙向約束並行運行多個擴散引擎。

AI影片領域一直面臨的核心挑戰是什麼?時長限制。Sora 2最多只能生成25秒,Runway和Pika通常在10秒左右徘徊。而CraftStory剛剛帶來了突破性的成果:能夠生成連貫的5分鐘影片。這背後的技術確實令人稱道。
長久未解的時長難題
關於當前AI影片模型的一個現實是:它們更擅長短跑而非馬拉松。雖然能生成8秒精美的畫面,但一旦嘗試延長,就會出現類似「傳話遊戲」的視覺問題。偽影不斷累積,人物形象漂移,整體效果逐漸崩塌。
傳統方法的工作流程是:生成一個片段,使用最後幾幀作為下一個片段的上下文,然後將它們拼接在一起。問題在於錯誤會不斷累積。第一個片段中略顯奇怪的手部位置,到第五個片段時就會變成一個奇怪的模糊物。
CraftStory由OpenCV背後的團隊創立,OpenCV是一個幾乎運行在您所使用過的每個視覺系統中的電腦視覺函式庫。他們的執行長Victor Erukhimov聯合創立了Itseez,這是一家於2016年被英特爾收購的電腦視覺新創公司。
雙向擴散:架構創新
CraftStory的解決方案顛覆了傳統方法。它不是按順序生成並寄希望於最佳效果,而是在整個影片時間線上同時運行多個較小的擴散引擎。
雙向約束
關鍵洞察是,正如Erukhimov所解釋的:「影片的後半部分也可以影響前半部分。這一點相當重要,因為如果逐個生成,那麼出現在第一部分的偽影會傳播到第二部分,然後不斷累積。」
可以這樣理解:這就像寫小說與列提綱的區別。順序生成就像寫第一頁,然後第二頁,再第三頁,無法回頭修改。而CraftStory的方法就像有一個提綱,第十章可以影響第二章需要發生的內容。
傳統順序方法
- 生成片段A
- 使用A的結尾開始B
- 使用B的結尾開始C
- 期望沒有累積問題
- 在拼接點處祈禱順利
雙向並行方法
- 同時處理所有片段
- 每個片段約束其相鄰片段
- 早期片段受後期片段影響
- 偽影在時間線上自我修正
- 原生連貫性,無需拼接
Model 2.0的實際工作原理
目前,CraftStory Model 2.0是一個影片到影片的系統。您需要提供一張圖像和一個驅動影片,系統會生成輸出,讓您圖像中的人物執行驅動影片中的動作。
- ✓上傳參考圖像(您的主體)
- ✓提供驅動影片(動作模板)
- ✓模型合成表演
- ✓文字到影片功能將在未來更新中推出
其唇形同步系統表現出色。輸入腳本或音訊軌道,它就能生成匹配的嘴部動作。一個獨立的手勢對齊演算法可以將肢體語言與語音節奏和情感基調同步。最終效果是什麼?影片中的人物看起來確實像在說這些話,而不只是機械地張合嘴巴。
CraftStory使用專門為該模型拍攝的專有高幀率素材進行訓練。標準的30fps YouTube影片片段存在過多運動模糊,無法捕捉手指等精細細節。他們聘請了工作室以更高幀率拍攝演員,以獲得更清晰的訓練資料。
輸出效果:實際獲得的成果
- 最長5分鐘連續影片
- 原生480p和720p解析度
- 720p可放大至1080p
- 支援橫屏和豎屏格式
- 同步的唇部動作
- 自然的手勢對齊
- 僅支援影片到影片(尚無文字到影片)
- 需要驅動影片輸入
- 低解析度30秒影片約需15分鐘
- 目前僅支援靜態相機(移動相機即將推出)
生成一個低解析度30秒片段大約需要15分鐘。這比某些模型提供的近乎即時生成要慢,但權衡之處在於獲得連貫的長格式輸出,而不是無法連接的精美片段。
對創作者的意義
5分鐘這個界限並非隨意設定。這是AI影片變得能夠用於實際內容創作的門檻。
社交片段
適合TikTok短影片和廣告,但敘事能力有限
簡短說明
足以進行快速產品展示或概念說明
真實內容
YouTube教學、培訓影片、簡報、敘事內容
長格式
完整劇集、紀錄片、教育課程
大多數商業影片內容都在2-5分鐘範圍內。產品展示、培訓模組、說明影片、內部溝通。這是CraftStory對專業用例變得相關的領域。
開啟的應用場景:
- 具有一致主持人的產品教學
- 無需安排人才時間的培訓影片
- 大規模個人化影片訊息
- 帶有虛擬講師的教育內容
- 帶有生成發言人的企業溝通
競爭格局
CraftStory獲得了由Wrike和Zencoder創辦人Andrew Filev領投的200萬美元種子輪融資。與流向OpenAI和谷歌的數十億美元相比,這個數字並不算大,但足以證明該技術的可行性。
OpenCV的聯繫
創始團隊的資歷在這裡很重要。OpenCV為各行業的電腦視覺系統提供支援。這些專業人士對視覺處理基礎的理解,是大多數AI影片新創公司所不具備的。
文字到影片功能正在開發中。一旦推出,價值主張將變得更加清晰:用文字描述一個5分鐘的影片,就能獲得連貫的輸出,而不會出現困擾其他工具的逐幀品質下降問題。
未來展望
路線圖功能▼
CraftStory已宣布即將推出的幾項功能:
- 文字到影片:無需驅動影片即可從提示生成
- 移動相機:搖鏡、變焦和追蹤鏡頭
- 邊走邊說:主體在說話時在空間中移動
雙向擴散方法不僅僅是CraftStory的獨門秘訣。這是一種其他團隊可能會採用的模式。一旦解決了「錯誤向前累積」的問題,更長時間的生成就會從一個根本性障礙變成一個工程挑戰。
Model 2.0目前專注於以人為中心的影片。對於沒有人物的場景,您仍然需要針對環境或抽象生成優化的工具。這是一個專業工具,而不是通用工具。
更宏觀的視角
我們正在見證AI影片經歷其尷尬的青春期。這些模型可以生成令人驚艷的10秒片段,但要求它們在幾分鐘內保持連貫性,它們就會失敗。CraftStory的雙向方法是解決這個問題的一個答案。
真正的問題是:這項技術被更大的參與者採用還需要多久?OpenAI、谷歌和Runway都擁有實施類似架構的資源。CraftStory的優勢在於率先將可用的長格式生成推向市場。
目前,如果您需要具有人物主體的一致多分鐘AI影片內容,CraftStory剛剛成為唯一的選擇。時長障礙尚未完全打破,但已經有人在上面打出了一個嚴重的裂縫。
立即嘗試
CraftStory Model 2.0現已推出。定價結構尚未公開詳述,因此您需要查看他們的網站以了解當前的服務。文字到影片功能即將推出,這將使該平台對沒有現有驅動影片內容的使用者更加易用。
相關文章
繼續探索這些相關文章

Pika 2.5:透過速度、價格與創意工具推動AI影片大眾化
Pika Labs發布2.5版本,結合更快的生成速度、強化的物理效果以及Pikaframes和Pikaffects等創意工具,讓每個人都能使用AI影片。

幾秒創建專業影片:Runway Gen 4.5 評測(超越 Sora)
Runway Gen 4.5 在盲測中排名第一。提供免費試用。了解為何優於 Sora,對比功能特性,立即開始創作。

Sora 之後的 AI 影片市場:2026 年需要了解的 4 個市場層級
Sora 將於 4 月 26 日關閉。AI 影片市場已整合為四個層級。這是一份實用指南,幫助您根據需求選擇合適的 Sora 替代方案。
