Meta PixelSalta al contingut principal
AlexisAlexis· Autoria d’IA, revisada per humans
7 min read
1225 paraules

Runway Gen-4.5 Domina els Benchmarks de Vídeo IA: Què Significa la Puntuació Elo de 1.247

Runway Gen-4.5 encapçala el benchmark d'Artificial Analysis amb una puntuació Elo sense precedents de 1.247, superant Google Veo 3.1 i OpenAI Sora 2. Analitzem què fa que aquest model sigui excepcional i què significa per als creadors de vídeo.

Runway Gen-4.5 Domina els Benchmarks de Vídeo IA: Què Significa la Puntuació Elo de 1.247

Preparat per crear els teus propis vídeos amb IA?

Uneix-te a milers de creadors que utilitzen Bonega.ai

Des del seu llançament al desembre de 2025, Runway Gen-4.5 ha ocupat el primer lloc al benchmark de l'Arena de Vídeo IA d'Artificial Analysis. Amb una puntuació Elo de 1.247, Gen-4.5 no només va guanyar, va redefinir el que esperem de la generació de vídeo per IA.

Els números que importan

Quan Runway va anunciar Gen-4.5 al desembre de 2025, els escèptics es demanaven si podria competir amb els massius pressupostos de recerca de Google i OpenAI. El benchmark d'Artificial Analysis va respondre de manera definitiva.

1,247
Runway Gen-4.5 Elo
1,226
Google Veo 3 Elo
1,206
OpenAI Sora 2 Pro Elo

El sistema de classificació Elo, pres de l'escacs, proporciona una mesura relativa de la qualitat del model basada en comparacions d'un contra un. Una bretxa de 21 punts entre Runway i Veo 3 es tradueix en que Runway guanya aproximadament el 53% de les comparacions directes. Davant Sora 2 Pro, aquest avantatge creix fins a aproximadament el 56%.

💡

Per a context sobre com s'ajusta Sora 2 a aquest paisatge competitiu, vegeu la nostra comparació integral de Sora 2, Runway i Veo 3.

Per Què Gen-4.5 Excel·leix: Realisme Físic

Els resultats del benchmark reflecteixen el salt de Gen-4.5 en el que Runway anomena "coherència física." A diferència dels models anteriors que ocasionalment produïen vídeos on els objectes passaven un pels altres o la gravetat es comportava de manera inconsistent, Gen-4.5 manté la plausibilitat física en seqüències més llargues.

No es tracta de simulació física perfecta. Es tracta de correccióintuïtiva. Quan l'aigua es vessa d'una copa, cau cap a baix. Quan una bola rebota, la trajectòria té sentit. Aquests requisits aparentment simples es van demostrar sorprenentment difícils pels models de generacions anteriors.

Punts Forts de Gen-4.5

Coherència física en vídeos de 10+ segons, il·luminació consistent, reflexos precisos i qualitat de moviment líder de la indústria.

Àrees de Millora

Temps de generació més lent que els competidors, tier de preus més alt i ocasionals artefactes en escenes complexes de múltiples personatges.

L'Arquitectura Darrera de la Puntuació

Gen-4.5 es basa en arquitectures diffusion transformer que han dominat la generació de vídeo des de 2024. Però la implementació de Runway inclou diverses innovacions que contribueixen a la seva rendiment al benchmark.

Atenció Temporal a Escala

El model utilitza un mecanisme d'atenció jeràrquic que manté la coherència entre fotogrames mentre escala a sortides de durada de minuts. Els models anteriors eren difícil amb la "deriva," on l'aparença dels personatges o elements de l'escena canviarien gradualment amb el temps. Gen-4.5 ho aborda mitjançant allò que Runway descriu com "atenció temporal ancorada."

Integració Nativa de Sóna

Com els seus competidors, Gen-4.5 genera sons juntament amb vídeo. Aquest enfocament unificat, explorat en la nostra anàlisi sobre com l'àudio natiu transforma el vídeo IA, elimina els problemes desentonadament que van plagiar els fluxos de treball anteriors.

🎵

Coherència Audiovisual

Gen-4.5 genera àudio sincronitzat amb acústica ambiental precisa, sincronització de diàleg i efectes de so que coincideixen amb les accions de pantalla.

Metodologia del Benchmark: Què es Mesura

El benchmark d'Artificial Analysis utilitza comparacions cegues on els avaluadors humans valoren parells de vídeos en múltiples dimensions.

El benchmark evalúa models en múltiples dimensions incloent qualitat de moviment, fidelitat visual, adherència al indicació, coherència temporal i qualitat de sóna. Els avaluadors humans comparen vídeos generats en proves cegues, proporcionant classificacions directes d'un contra un que alimenten el sistema Elo.

Aquesta puntuació multidimensional ajuda a explicar per què Runway encapçala la taula de classificació general tot i que els competidors guanyen categories individuals. Google Veo 3 lidera en resolució pura, mentre que Sora 2 sovint guanya en interpretació creativa. Però la coherència equilibrada de Gen-4.5 en totes les dimensions produeix la puntuació composta més alta.

Què Significa Per als Creadors

Per als professionals del vídeo, les puntuacions del benchmark importan menys que les capacitats pràctiques. Així és com el rendiment de Gen-4.5 es tradueix en ús en el món real.

Speed

Temps de Generació

5-7 minuts per a un clip de 10 segons a 1080p, més lent que Sora 2 (2-3 minuts) però més ràpid que alternatives open-source locals.

Quality

Resolució de Sortida

Suport natiu 4K amb la canonada de escalat de Runway, igualant la sortida de grau professional de Veo 3.1.

Control

Eines Creatives

Imatge a vídeo, pinzell de moviment, controls de càmera i referències d'estil proporcionen més control de director que qualsevol competidor.

La combinació de control creatiu i qualitat de sortida fa que Gen-4.5 sigui particularment adequat per als fluxos de treball professionals. Les agències publicitàries, els equips de previsualizació de pel·lícules i els estudis de contingut l'han adoptat per a tasques que van des de vídeos conceptuals fins al contingut de xarxes socials.

El Paisatge Competitiu en Febrer de 2026

El lideratge del benchmark de Gen-4.5 no significa que la competència hagi deixat d'innovar. L'espai de vídeo IA es mou ràpidament, i diversos desenvolupaments podrien canviar les classificacions.

🔜

Google Veo 3.2

Rumors per a Q2 2026, la següent iteració de Google se suposadament enfoca en la coherència narrativa de forma més llarga i coherència de personatges millorada en escenes.

💡

OpenAI Sora 3

Tot i que OpenAI no ha anunciat Sora 3, la associació amb Disney suggereix capacitats principals en desenvolupament per a generació de personatges concedits en llicència.

🚀

Kling 3.0

L'horari de llançament agressiu de Kuaishou podria portar un altre contendent de benchmark de Xina abans de mitjan any.

Més Allà dels Benchmarks: La Imatge Més Gran

Els números com 1.247 Elo conten part de la història, però no la capturen tota. La generació de vídeo per IA ha arribar a un punt on tots els models de nivell superior produeixen resultats remarcables. Les diferències es troben en casos d'ús específics, preus i integració de l'ecosistema.

L'avantatge de Runway no és només la puntuació del benchmark. Es el refinament del flux de treball de anys que fan que Gen-4.5 sigui una eina pràctica en lloc d'una demostració tecnològica. Les característiques com el pinzell de moviment, els controls de càmera precisos i la integració perfecta amb el programari d'edició professional reflecteixen un enfocament en com els creadors realment funcionen.

💡

Per a una guia pràctica per obtenir els millors resultats de qualsevol eina de vídeo IA, vegeu la nostra guia integral d'enginyeria de indicacions.

Mirando Cap al Futur

La puntuació Elo de 1.247 marca un hito, però no un punt final. La generació de vídeo per IA continua avançant a un ritme que fa que els benchmarks d'avui siguin les línies de base de demà. El que importa més que qualsevol puntuació única és la trajectòria: models que entenen la física, mantenen la coherència i donen als creadors un control intuïtiu.

Runway Gen-4.5 lidera aquesta trajectòria avui. Demà traïn nous desafiadors, noves capacitats i nous benchmarks. Per ara, les dades són clares: si necessiteu la generació de vídeo IA més capaç disponible, Runway ha guanyat el lloc superior.


Dades de benchmark extretes d'Artificial Analysis AI Video Arena, febrer de 2026. Les puntuacions Elo reflecteixen la taula de classificació actual i poden canviar a mesura que nous models són avaluats.

Alexis
AlexisAI EngineerAI Author

Enginyer d’IA de Lausana que combina la profunditat de la recerca amb la innovació pràctica. Divideix el seu temps entre arquitectures de models i cims alpins.

View profile →

T’ha agradat el que has llegit?

Converteix les teves idees en vídeos amb IA de durada il·limitada en qüestió de minuts.

Articles relacionats

Continua explorant amb aquestes publicacions relacionades

T’ha agradat aquest article?

Descobreix més idees i mantén-te al dia amb el nostre contingut més recent.