Meta Pixel跳至主要內容
AlexisAlexis· AI 作者,經人工審閱
9 min read
153

Runway Gen-4.5 主導AI影片基準測試,1,247 Elo分數意味著什麼

Runway Gen-4.5以空前的1,247 Elo分數登頂Artificial Analysis基準測試,超越Google Veo 3.1和OpenAI Sora 2。我們分析了這款模型卓越的原因以及它對影片創作者的意義。

Runway Gen-4.5 主導AI影片基準測試,1,247 Elo分數意味著什麼

準備好製作自己的 AI 影片了嗎?

加入數千名使用 Bonega.ai 的創作者

自2025年12月推出以來,Runway Gen-4.5已經在Artificial Analysis AI影片競技場基準測試中佔據榜首位置。憑藉1,247的Elo分數,Gen-4.5不僅贏了,還重新定義了我們對AI影片生成的期待。

數字說話

當Runway在2025年12月宣布Gen-4.5時,懷疑者們想知道它是否能與Google和OpenAI龐大的研究預算相匹敵。Artificial Analysis基準測試給出了明確的答案。

1,247
Runway Gen-4.5 Elo
1,226
Google Veo 3 Elo
1,206
OpenAI Sora 2 Pro Elo

Elo評級系統源自國際象棋,基於模型之間的一對一比較提供相對品質的衡量。Runway與Veo 3之間的21分差異意味著Runway在直接比較中贏得約53%的勝利。對比Sora 2 Pro,這個優勢增長到約56%。

💡

有關Sora 2如何融入競爭格局的背景資訊,請參閱我們的Sora 2、Runway和Veo 3綜合對比

Gen-4.5為什麼表現卓越,物理真實感

基準測試結果反映了Gen-4.5在Runway稱之為"物理連貫性"的突破。與早期型號偶爾出現物體相互穿過或重力表現不一致的情況不同,Gen-4.5在更長的序列中保持物理合理性。

這不是完美的物理模擬。這是直觀的正確性。當水從杯子中倒出時,它向下流動。當球彈跳時,軌跡是合理的。這些看似簡單的需求對於早期模型來說卻出人意料地困難。

Gen-4.5優勢

10秒以上影片的物理連貫性、一致的照明、精確的反射以及業界領先的動作品質。

改進空間

生成速度慢於競爭對手、價格層級更高、以及複雜多角色場景中偶有瑕疵。

分數背後的架構

Gen-4.5構建於自2024年以來主導影片生成的擴散變壓器架構之上。但Runway的實現包含多項創新,對其基準測試性能做出了貢獻。

大規模時間注意力

該模型使用分層注意力機制,在保持幀間一致性的同時擴展到分鐘級別的輸出。早期模型苦於"漂移",即角色外觀或場景元素會隨時間逐漸變化。Gen-4.5通過Runway描述的"固定時間注意力"解決了這個問題。

原生音頻整合

與競爭對手一樣,Gen-4.5現在可以生成音頻和影片。這種統一方法,在我們對原生音頻如何改變AI影片的分析中探討,消除了困擾早期工作流程的不協調。

🎵

視聽連貫性

Gen-4.5生成同步音頻,具有精確的環境聲學、對話時序和與螢幕動作相匹配的音效。

基準測試方法,測量什麼

Artificial Analysis基準測試使用盲測比較,其中人類評估者在多個維度上對影片對進行評分。

該基準測試在多個維度上評估模型,包括運動品質、視覺保真度、提示詞遵循度、時間連貫性和音頻品質。人類評估者在盲測中比較生成的影片,提供直接的一對一評分,輸入Elo系統。

這種多維度評分有助於解釋為什麼Runway在整體排行榜上領先,儘管競爭對手在單個類別中勝出。Google Veo 3在純分辨率上領先,而Sora 2通常在創意解釋上獲勝。但Gen-4.5在所有維度上的均衡卓越產生了最高的綜合分數。

這對創作者意味著什麼

對於影片專業人士來說,基準測試分數不如實際能力重要。以下是Gen-4.5性能如何轉化為實際使用。

速度

生成時間

1080p 10秒片段需要5-7分鐘,比Sora 2(2-3分鐘)慢,但比本地開源替代品快。

品質

輸出分辨率

原生4K支持和Runway的升級管道,與Veo 3.1的專業級輸出相匹配。

控制

創意工具

圖像到影片、動作筆刷、攝影機控制和風格參考提供比任何競爭對手更多的導演控制。

創意控制和輸出品質的結合使Gen-4.5特別適合專業工作流程。廣告公司、電影前期視覺化團隊和內容工作室已經採用它用於從概念影片到社交媒體內容的任務。

2026年2月的競爭格局

Gen-4.5的基準測試領先地位不意味著競爭已經停止創新。AI影片領域發展迅速,多項發展可能改變排名。

🔜

Google Veo 3.2

謠傳將在2026年第二季度推出,Google的下一代迭代據稱專注於更長形式的敘事連貫性和場景間改進的角色一致性。

💡

OpenAI Sora 3

雖然OpenAI尚未宣布Sora 3,但迪士尼合作夥伴關係表明為授權角色生成開發的主要功能。

🚀

Kling 3.0

快手激進的發布計畫可能在年中前從中國帶來另一個基準測試競爭者。

超越基準測試,更大圖景

1,247這樣的Elo數字講述了故事的一部分,但不能說明一切。AI影片生成已經達到所有頂級模型都能產生出色結果的階段。差異在於特定用例、定價和生態系統整合。

Runway的優勢不僅僅是基準測試分數。它是多年工作流程精進的成果,使Gen-4.5成為一個實用工具而非技術演示。動作筆刷、精確的攝影機控制和與專業編輯軟體的無縫整合等功能反映了對創作者實際工作方式的關注。

💡

有關如何從任何AI影片工具中獲得最佳效果的實踐指南,請參閱我們的綜合提示詞工程指南

展望未來

1,247 Elo分數標誌著一個里程碑,但不是終點。AI影片生成繼續以使今天的基準測試成為明天基線的速度發展。比任何單一分數更重要的是軌跡,理解物理、保持連貫並給創作者直觀控制的模型。

Runway Gen-4.5今天引領該軌跡。明天將帶來新的挑戰、新的能力和新的基準測試。目前,數據是明確的,如果你需要最能幹的AI影片生成,Runway已經贏得了榜首位置。


基準測試數據來源於Artificial Analysis AI Video Arena,2026年2月。Elo分數反映當前排行榜,隨著新模型的評估可能會改變。

Alexis
AlexisAI EngineerAI Author

來自洛桑的 AI 工程師,結合深入研究與實務創新。他在模型架構與阿爾卑斯山峰之間分配時間。

View profile →

喜歡你所讀的內容嗎?

幾分鐘內將你的想法轉化為不限長度的 AI 影片。

相關文章

繼續探索這些相關文章

喜歡這篇文章嗎?

探索更多觀點,並隨時掌握我們的最新內容。