Meta Pixel跳到主要内容
AlexisAlexis· AI 作者,经人工审核
9 min read
152

Runway Gen-4.5 主导AI视频基准测试:1,247 Elo分数意味着什么

Runway Gen-4.5以空前的1,247 Elo分数登顶Artificial Analysis基准测试,超越谷歌Veo 3.1和OpenAI Sora 2。我们分析了这款模型卓越的原因以及它对视频创作者的意义。

Runway Gen-4.5 主导AI视频基准测试:1,247 Elo分数意味着什么

准备好创作您自己的 AI 视频了吗?

加入数千位使用 Bonega.ai 的创作者

自2025年12月推出以来,Runway Gen-4.5已经在Artificial Analysis AI视频竞技场基准测试中占据榜首位置。凭借1,247的Elo分数,Gen-4.5不仅赢了,还重新定义了我们对AI视频生成的期待。

数字说话

当Runway在2025年12月宣布Gen-4.5时,怀疑者们想知道它是否能与谷歌和OpenAI庞大的研究预算相匹敌。Artificial Analysis基准测试给出了明确的答案。

1,247
Runway Gen-4.5 Elo
1,226
谷歌 Veo 3 Elo
1,206
OpenAI Sora 2 Pro Elo

Elo评级系统源自国际象棋,基于模型之间的一对一比较提供相对质量的衡量。Runway与Veo 3之间的21分差异意味着Runway在直接比较中赢得约53%的胜利。对比Sora 2 Pro,这个优势增长到约56%。

💡

有关Sora 2如何融入竞争格局的背景信息,请参阅我们的Sora 2、Runway和Veo 3综合对比

Gen-4.5为什么表现卓越:物理真实感

基准测试结果反映了Gen-4.5在Runway称之为"物理连贯性"的突破。与早期型号偶尔出现物体相互穿过或重力表现不一致的情况不同,Gen-4.5在更长的序列中保持物理合理性。

这不是完美的物理模拟。这是直观的正确性。当水从杯子中倒出时,它向下流动。当球弹跳时,轨迹是合理的。这些看似简单的需求对于早期模型来说却出人意料地困难。

Gen-4.5优势

10秒以上视频的物理连贯性、一致的照明、精确的反射以及业界领先的动作质量。

改进空间

生成速度慢于竞争对手、价格层级更高、以及复杂多角色场景中偶有伪影。

分数背后的架构

Gen-4.5构建于自2024年以来主导视频生成的扩散变换器架构之上。但Runway的实现包含多项创新,对其基准测试性能做出了贡献。

大规模时间注意力

该模型使用分层注意力机制,在保持帧间一致性的同时扩展到分钟级别的输出。早期模型苦于"漂移",即角色外观或场景元素会随时间逐渐变化。Gen-4.5通过Runway描述的"固定时间注意力"解决了这个问题。

原生音频集成

与竞争对手一样,Gen-4.5现在可以生成音频和视频。这种统一方法,在我们对原生音频如何改变AI视频的分析中探讨,消除了困扰早期工作流程的不协调。

🎵

视听连贯性

Gen-4.5生成同步音频,具有精确的环境声学、对话时序和与屏幕动作相匹配的音效。

基准测试方法:测量什么

Artificial Analysis基准测试使用盲测比较,其中人类评估者在多个维度上对视频对进行评分。

该基准测试在多个维度上评估模型,包括运动质量、视觉保真度、提示词遵循度、时间连贯性和音频质量。人类评估者在盲测中比较生成的视频,提供直接的一对一评分,输入Elo系统。

这种多维度评分有助于解释为什么Runway在整体排行榜上领先,尽管竞争对手在单个类别中胜出。谷歌Veo 3在纯分辨率上领先,而Sora 2通常在创意解释上获胜。但Gen-4.5在所有维度上的均衡卓越产生了最高的综合分数。

这对创作者意味着什么

对于视频专业人士来说,基准测试分数不如实际能力重要。以下是Gen-4.5性能如何转化为实际使用。

速度

生成时间

1080p 10秒片段需要5-7分钟,比Sora 2(2-3分钟)慢,但比本地开源替代品快。

质量

输出分辨率

原生4K支持和Runway的升级管道,与Veo 3.1的专业级输出相匹配。

控制

创意工具

图像到视频、动作笔刷、摄像头控制和风格参考提供比任何竞争对手更多的导演控制。

创意控制和输出质量的结合使Gen-4.5特别适合专业工作流程。广告公司、电影前期可视化团队和内容工作室已经采用它用于从概念视频到社交媒体内容的任务。

2026年2月的竞争格局

Gen-4.5的基准测试领先地位不意味着竞争已经停止创新。AI视频领域发展迅速,多项发展可能改变排名。

🔜

谷歌 Veo 3.2

谣传将在2026年第二季度推出,谷歌的下一代迭代据称专注于更长形式的叙事连贯性和场景间改进的角色一致性。

💡

OpenAI Sora 3

虽然OpenAI尚未宣布Sora 3,但迪士尼合作伙伴关系表明为授权角色生成开发的主要功能。

🚀

Kling 3.0

快手激进的发布计划可能在年中前从中国带来另一个基准测试竞争者。

超越基准测试:更大图景

1,247这样的Elo数字讲述了故事的一部分,但不能说明一切。AI视频生成已经达到所有顶级模型都能产生出色结果的阶段。差异在于特定用例、定价和生态系统集成。

Runway的优势不仅仅是基准测试分数。它是多年工作流程精进的成果,使Gen-4.5成为一个实用工具而非技术演示。动作笔刷、精确的摄像头控制和与专业编辑软件的无缝集成等功能反映了对创作者实际工作方式的关注。

💡

有关如何从任何AI视频工具中获得最佳效果的实践指南,请参阅我们的综合提示词工程指南

展望未来

1,247 Elo分数标志着一个里程碑,但不是终点。AI视频生成继续以使今天的基准测试成为明天基线的速度发展。比任何单一分数更重要的是轨迹:理解物理、保持连贯并给创作者直观控制的模型。

Runway Gen-4.5今天引领该轨迹。明天将带来新的挑战、新的能力和新的基准测试。目前,数据是明确的:如果你需要最能干的AI视频生成,Runway已经赢得了榜首位置。


基准测试数据来源于Artificial Analysis AI Video Arena,2026年2月。Elo分数反映当前排行榜,随着新模型的评估可能会改变。

Alexis
AlexisAI EngineerAI Author

来自洛桑的 AI 工程师,将深厚的研究能力与实用创新相结合。他在模型架构与阿尔卑斯山峰之间分配时间。

View profile →

喜欢您读到的内容吗?

几分钟内将您的想法变成无限时长的 AI 视频。

相关文章

继续探索这些相关文章

喜欢这篇文章吗?

探索更多见解,并及时了解我们的最新内容。