Clasificación de modelos de IA

Clasificados según el tráfico de producción real de OrcaRouter y los votos de la comunidad en Battle Mode, no según benchmarks declarados por los proveedores.

Actualizado el 2026-08-095 fuentes de evidenciaModelos nuevos listados en 48 h
Medido con tráfico real
100.0%
Mayor tasa de éxito (7 d)
openai/gpt-4-turbo-2024-04-09
450 ms
Latencia p50 más rápida
OpenAI: GPT-4o (2024-08-06)
80.1%
Mayor tasa de victoria de la comunidad
Qwen3.7 Max (2026-05-20)

Clasificación consolidada

Un ranking combinado por modelo — votos de LMArena, benchmarks independientes, adopción del ecosistema y evidencia de producción de OrcaRouter, con pesos públicos fijos. Los modelos nuevos entran desde el primer día a partir de evidencia externa.

PuestoModeloPuntuación compuestaFiabilidad$/1M mixtoVolumenImpulsoEvidencia
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 6.7%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).Win 58.7%Tasa de victorias en Blind Battle de OrcaRouter — votos ciegos de nuestra comunidad.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 2.0%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 4.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.Win 63.6%Tasa de victorias en Blind Battle de OrcaRouter — votos ciegos de nuestra comunidad.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.9%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.1%Cuota de tokens de OpenRouter — adopción real del ecosistema.Win 80.1%Tasa de victorias en Blind Battle de OrcaRouter — votos ciegos de nuestra comunidad.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 1.2%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo comunitario de LMArena — votos humanos a ciegas en la arena de texto (CC-BY-4.0).AA 62.1Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 0.3%Cuota de tokens de OpenRouter — adopción real del ecosistema.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo comunitario de LMArena — votos humanos a ciegas en la arena de texto (CC-BY-4.0).AA 51.6Índice de inteligencia de Artificial Analysis — benchmark compuesto independiente (0–100).OR 3.5%Cuota de tokens de OpenRouter — adopción real del ecosistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Cuota de tokens por laboratorio
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Otros 6.8%
40%
Preferencia humana
LMArena · Bradley–Terry
30%
Benchmarks independientes
Artificial Analysis · SWE-bench
20%
Evidencia de producción
OrcaRouter battles & traffic
10%
Adopción del ecosistema
OpenRouter token share

Enfrentamientos directos

Tasas de victoria por pares en Battle Mode: con qué frecuencia cada modelo gana a cada rival cara a cara.

Benchmarks: inteligencia frente a precio

Puntuaciones de inteligencia independientes representadas frente al precio de entrada. La línea discontinua es la frontera de Pareto precio/inteligencia.

Duelo a ciegas

Dos respuestas anónimas, un voto. Tus batallas alimentan el 20 % de evidencia de producción del rango consolidado.

⚔️ Duelo a ciegas

Dos modelos anónimos responden al mismo prompt. Lee ambos, vota por el ganador y luego descubre quién escribió qué: tu voto alimenta la clasificación de arriba.

Metodología — cómo funciona esta clasificación

Cada número de esta página está medido, nunca autoinformado. Este es el método completo detrás del ranking combinado — las mismas reglas para cada modelo, todos los días.

Una puntuación combinada, pesos públicos fijos

Cada modelo recibe una puntuación compuesta de cuatro familias de evidencia independientes: preferencia humana a ciegas 40 %, benchmarks independientes 30 %, evidencia de producción de OrcaRouter 20 % y adopción del ecosistema 10 %. Los pesos son fijos y públicos — sin ajustes editoriales, sin puestos pagados, sin envíos de proveedores.

Qué alimenta cada familia

La preferencia humana proviene del Elo comunitario de LMArena — votos ciegos por pares en las arenas de texto y visión (CC-BY-4.0). Los benchmarks independientes combinan Artificial Analysis (Intelligence Index más programación, matemáticas, GPQA Diamond y τ²-Bench) con SWE-bench Verified, la proporción de issues reales de GitHub resueltos. La evidencia de producción es propia de OrcaRouter: tasas de victoria en Blind Battle más telemetría en vivo de la pasarela — tasa de éxito, latencia y volumen de tokens enrutados. La adopción usa la cuota de tokens publicada por OpenRouter.

Cómo las puntuaciones se vuelven comparables

Las fuentes puntúan en escalas distintas (Elo, índices 0–100, % resuelto), así que cada señal se estandariza contra el tablero actual y se proyecta a 0–100: 50 es la media del tablero y cada 15 puntos equivalen a una desviación estándar, con topes en los extremos. Un modelo necesita al menos dos familias de evidencia independientes para clasificar, y el tablero lista el top 25 por puntuación compuesta.

Tableros por caso de uso

Los tableros de texto, programación, visión, matemáticas, razonamiento y agentes recalculan la misma mezcla con señales propias del segmento — programación cambia a los benchmarks de código y SWE-bench Verified, visión usa la arena de visión de LMArena — y las Blind Battles solo emparejan modelos del mismo segmento.

Frescura y juego limpio

Los feeds externos se actualizan a diario y la telemetría propia es en vivo; los modelos nuevos entran con evidencia externa en las 48 horas posteriores a su lanzamiento. No se usan cifras autoinformadas de proveedores en ningún punto, el buzz comunitario se muestra solo como contexto y nunca alimenta un puesto, y cada fuente externa está acreditada bajo el tablero.

Preguntas frecuentes

¿Cómo se calcula la clasificación de modelos de IA?

Cada modelo recibe una puntuación combinada de cuatro familias de evidencia — preferencia humana a ciegas (LMArena), benchmarks independientes (Artificial Analysis, SWE-bench), fiabilidad de producción de OrcaRouter y adopción del ecosistema (OpenRouter) — con pesos públicos fijos de 40 / 30 / 20 / 10.

¿Por qué un modelo recién lanzado ya tiene rango?

Los modelos nuevos entran al ranking a partir de evidencia externa dentro de las 48 horas posteriores a su lanzamiento. El puesto se consolida a medida que se acumulan batallas comunitarias y tráfico de producción.

¿Con qué frecuencia se actualiza la clasificación?

Las fuentes externas se refrescan a diario y la telemetría de OrcaRouter es en vivo; la fecha de actualización aparece en la cabecera.

¿Por qué falta un modelo?

Un modelo necesita al menos dos fuentes de evidencia independientes para clasificarse, y el tablero muestra el top 25 por puntuación compuesta; los modelos con evidencia insuficiente permanecen fuera hasta que otra fuente los cubra.

¿Se clasifican por separado los casos de uso?

Sí — los botones sobre la tabla consolidada alternan entre los rankings de texto, programación, visión, matemáticas, razonamiento y agentes, y las batallas solo emparejan modelos comparables.

¿Cuándo se consolida el puesto de un modelo nuevo?

Cuando un modelo reúne tres familias de evidencia, incluidas las batallas y el tráfico propios de OrcaRouter, su puesto se basa en la mezcla completa y no solo en evidencia externa.

¿De dónde salen los datos?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench y OpenRouter, más la telemetría de producción de OrcaRouter — todo atribuido bajo el tablero.

¿Pueden los proveedores manipular la clasificación?

Difícil: pesos públicos, sin cifras autodeclaradas, y las batallas ciegas más el tráfico real anclan cada puntuación.

¿Puedo exportar o insertar estos datos?

Sí — exportación JSON/CSV, insignia de rango insertable y feed RSS de cambios, gratis con atribución. Enlaces en el pie de página.

Nuevos modelos, cambios de rango y lanzamientos — síguenos:X · @OrcaRouterDiscord