Clasificación de modelos de IA

Clasificados según el tráfico de producción real de OrcaRouter y los votos de la comunidad en Battle Mode, no según benchmarks declarados por los proveedores.

Actualizado el 2026-09-235 fuentes de evidenciaModelos nuevos listados en 48 h
Medido con tráfico real
100.0%
Mayor tasa de éxito (7 d)
MiniMax: MiniMax M2.5
156 ms
Latencia p50 más rápida
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Mayor tasa de victoria de la comunidad
Qwen3.7 Max (2026-05-20)

Clasificación consolidada

Un ranking combinado por modelo — votos de LMArena, benchmarks independientes, adopción del ecosistema y evidencia de producción de OrcaRouter, con pesos públicos fijos. Los modelos nuevos entran desde el primer día a partir de evidencia externa.

PuestoModeloPuntuación compuestaFiabilidad$/1M mixtoVelocidadImpulsoEvidencia
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 tokens por segundoAA 66.0Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).Win 58.7%Tasa de victorias en Blind Battle de OrcaRouter — votos ciegos de nuestra comunidad.
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2532ms$0.38$0.15 → $0.6 per 1M tokens184 tokens por segundoAA 39.5Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 13.5%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#3OpenAI: GPT-6 Astra75.899.16% · 10000ms$30.00$10 → $50 per 1M tokens56 tokens por segundoAA 52.7Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens1784 tokens por segundoAA 57.6Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.0%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#5Anthropic: Claude Opus 572.699.17% · 6222ms$15.00$5 → $25 per 1M tokens84 tokens por segundoAA 50.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#6Anthropic: Claude Fable 5.172.399.26% · 8014ms$30.00$10 → $50 per 1M tokens61 tokens por segundoAA 53.4Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#7Z.ai: GLM 5.372.199.86% · 3910ms$2.61$1.26 → $3.96 per 1M tokens74 tokens por segundoAA 44.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 2.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#8OpenAI: GPT-5.6 Luna72.199.88% · 1631ms$0.70$0.2 → $1.2 per 1M tokens110 tokens por segundoAA 37.3Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 6.6%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#9Z.ai: GLM 5.3 Flash71.599.55% · 6861ms$0.16$0.075 → $0.25 per 1M tokens93 tokens por segundoArena 1472Elo comunitario de LMArena — votos humanos a ciegas en la arena de texto (CC-BY-4.0).AA 41.8Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 13.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#10OpenAI: GPT-5.6 Sol71.499.14% · 10000ms$12.00$4 → $20 per 1M tokens1625 tokens por segundoAA 47.0Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.4%Cuota de tokens de OpenRouter — adopción real del ecosistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Proporción del top 20 por laboratorio
openai 25.0%anthropic 20.0%z-ai 15.0%google 10.0%Otros 30.0%
40%
Preferencia humana
LMArena · Bradley–Terry
30%
Benchmarks independientes
Artificial Analysis · SWE-bench
20%
Evidencia de producción
OrcaRouter Blind Battle win rate
10%
Adopción del ecosistema
OpenRouter token share

Enfrentamientos directos

Tasas de victoria por pares en Battle Mode: con qué frecuencia cada modelo gana a cada rival cara a cara.

Benchmarks: inteligencia frente a precio

Puntuaciones de inteligencia independientes representadas frente al precio de entrada. La línea discontinua es la frontera de Pareto precio/inteligencia.

Duelo a ciegas

Dos respuestas anónimas, un voto. Tus batallas alimentan el 20 % de evidencia de producción del rango consolidado.

⚔️ Duelo a ciegas

Dos modelos anónimos responden al mismo prompt. Lee ambos, vota por el ganador y luego descubre quién escribió qué: tu voto alimenta la clasificación de arriba.

Metodología — cómo funciona esta clasificación

Cada número de esta página está medido, nunca autoinformado. Este es el método completo detrás del ranking combinado — las mismas reglas para cada modelo, todos los días.

Una puntuación combinada, pesos públicos fijos

Cada modelo recibe una puntuación compuesta de cuatro familias de evidencia independientes: preferencia humana a ciegas 40 %, benchmarks independientes 30 %, evidencia de producción de OrcaRouter 20 % y adopción del ecosistema 10 %. Los pesos son fijos y públicos — sin ajustes editoriales, sin puestos pagados, sin envíos de proveedores.

Qué alimenta cada familia

La preferencia humana proviene del Elo comunitario de LMArena — votos ciegos por pares en las arenas de texto y visión (CC-BY-4.0). Los benchmarks independientes combinan Artificial Analysis (Intelligence Index más programación, matemáticas, GPQA Diamond y τ²-Bench) con SWE-bench Verified, la proporción de issues reales de GitHub resueltos. La evidencia de producción son las tasas de victoria en Blind Battle de OrcaRouter. La adopción usa la cuota de tokens publicada por OpenRouter. La tasa de éxito, la latencia y el rendimiento se muestran junto a cada modelo como contexto: nunca influyen en el ranking.

Cómo las puntuaciones se vuelven comparables

Las fuentes puntúan en escalas distintas (Elo, índices 0–100, % resuelto), así que cada señal se estandariza contra el tablero actual y se proyecta a 0–100: 50 es la media del tablero y cada 15 puntos equivalen a una desviación estándar, con topes en los extremos. Un modelo necesita al menos dos familias de evidencia independientes para clasificar, y el tablero lista el top 25 por puntuación compuesta.

Tableros por caso de uso

Los tableros de texto, programación, visión, matemáticas, razonamiento y agentes recalculan la misma mezcla con señales propias del segmento — programación cambia a los benchmarks de código y SWE-bench Verified, visión usa la arena de visión de LMArena — y las Blind Battles solo emparejan modelos del mismo segmento.

Frescura y juego limpio

Los feeds externos se actualizan a diario y la telemetría propia es en vivo; los modelos nuevos entran con evidencia externa en las 48 horas posteriores a su lanzamiento. No se usan cifras autoinformadas de proveedores en ningún punto, el buzz comunitario se muestra solo como contexto y nunca alimenta un puesto, y cada fuente externa está acreditada bajo el tablero.

Preguntas frecuentes

¿Cómo se calcula la clasificación de modelos de IA?

Cada modelo recibe una puntuación combinada de cuatro familias de evidencia — preferencia humana a ciegas (LMArena), benchmarks independientes (Artificial Analysis, SWE-bench), fiabilidad de producción de OrcaRouter y adopción del ecosistema (OpenRouter) — con pesos públicos fijos de 40 / 30 / 20 / 10.

¿Por qué un modelo recién lanzado ya tiene rango?

Los modelos nuevos entran al ranking a partir de evidencia externa dentro de las 48 horas posteriores a su lanzamiento. El puesto se consolida a medida que se acumulan batallas comunitarias y tráfico de producción.

¿Con qué frecuencia se actualiza la clasificación?

Las fuentes externas se refrescan a diario y la telemetría de OrcaRouter es en vivo; la fecha de actualización aparece en la cabecera.

¿Por qué falta un modelo?

Un modelo necesita al menos dos fuentes de evidencia independientes para clasificarse, y el tablero muestra el top 25 por puntuación compuesta; los modelos con evidencia insuficiente permanecen fuera hasta que otra fuente los cubra.

¿Se clasifican por separado los casos de uso?

Sí — los botones sobre la tabla consolidada alternan entre los rankings de texto, programación, visión, matemáticas, razonamiento y agentes, y las batallas solo emparejan modelos comparables.

¿Cuándo se consolida el puesto de un modelo nuevo?

Cuando un modelo reúne tres familias de evidencia, incluidas las batallas y el tráfico propios de OrcaRouter, su puesto se basa en la mezcla completa y no solo en evidencia externa.

¿De dónde salen los datos?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench y OpenRouter, más la telemetría de producción de OrcaRouter — todo atribuido bajo el tablero.

¿Pueden los proveedores manipular la clasificación?

Difícil: pesos públicos, sin cifras autodeclaradas, y las batallas ciegas más el tráfico real anclan cada puntuación.

¿Puedo exportar o insertar estos datos?

Sí — exportación JSON/CSV, insignia de rango insertable y feed RSS de cambios, gratis con atribución. Enlaces en el pie de página.

Nuevos modelos, cambios de rango y lanzamientos — síguenos:X · @OrcaRouterDiscord