Clasificación de modelos de IA

Clasificados según el tráfico de producción real de OrcaRouter y los votos de la comunidad en Battle Mode, no según benchmarks declarados por los proveedores.

Medido con tráfico real
100.0%
Mayor tasa de éxito (7 d)
OpenAI: GPT-5 Mini
399 ms
Latencia p50 más rápida
DeepSeek: DeepSeek V3
80.1%
Mayor tasa de victoria de la comunidad
Qwen3.7 Max (2026-05-20)

General — tasa de victoria de la comunidad

Votos del Battle Mode a ciegas, clasificados con un modelo de Bradley–Terry (Elo). Los puntos muestran la puntuación; las barras, el intervalo de confianza del 95 %. Los modelos de una misma banda están estadísticamente empatados.

Control de estilo
Próximamente — requiere más datos de duelos

⚔️ Duelo a ciegas

Dos modelos anónimos responden al mismo prompt. Lee ambos, vota por el ganador y luego descubre quién escribió qué: tu voto alimenta la clasificación de arriba.

PuestoModeloPuntuación de arenaMétodoVotosV·D·E
#1Qwen3.7 Max (2026-05-20)1746±140
a ciegas · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
a ciegas · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
a ciegas · BT
281158·111·12
OpenAI: GPT-5.51521±81
a ciegas · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
a ciegas · BT
310149·149·12
Qwen3.7 Max1519±125
a ciegas · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
a ciegas · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
a ciegas · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
a ciegas · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
a ciegas · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
a ciegas · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
a ciegas · BT
224119·93·12
MiniMax: MiniMax M31300±59
a ciegas · BT
265127·126·12
Google: Gemma 4 31B1300±58
a ciegas · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
a ciegas · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
a ciegas · BT
213100·101·12
Z.ai: GLM 5.21298±67
a ciegas · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
a ciegas · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
a ciegas · BT
281151·118·12
OpenAI: GPT-5.41078±73
a ciegas · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
a ciegas · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
a ciegas · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
a ciegas · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
a ciegas · BT
248118·118·12
Z.ai: GLM 5.11076±78
a ciegas · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
a ciegas · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
a ciegas · BT
18871·105·12
#28Gemini 3.5 Flash852±123
a ciegas · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
a ciegas · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
a ciegas · BT
12861·61·6

Enfrentamientos directos

Tasas de victoria por pares en Battle Mode: con qué frecuencia cada modelo gana a cada rival cara a cara.

Líderes por categoría

El modelo más fuerte en cada capacidad —programación, matemáticas, razonamiento y más— con un perfil por eje frente a la mediana del conjunto.

Benchmarks: inteligencia frente a precio

Puntuaciones de inteligencia independientes representadas frente al precio de entrada. La línea discontinua es la frontera de Pareto precio/inteligencia.

Fiabilidad y coste

Medido con el tráfico de producción de OrcaRouter de los últimos 7 días.

Modelo
Éxito % (7 d)
p50
p99
Errores %
$/M (entrada→salida)
tok/s
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
Qwen: Qwen3.7 Plus100.0%3.96 s10.00 s
0.0%
$0.35 → $1.4258
MiniMax M2.5 highspeed100.0%2.12 s2.12 s
0.0%
$0.60 → $2.40
openai/gpt-3.5-turbo-1106100.0%1.80 s4.15 s
0.0%
$1.00 → $2.00143
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
Qwen: Qwen3 VL 235B A22B Instruct100.0%10.00 s10.00 s
0.0%
$0.40 → $1.6074
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
google/gemini-3.1-flash-lite100.0%986 ms4.90 s
0.0%
$0.25 → $1.50285
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.00103
openai/gpt-5-2025-08-07100.0%10.00 s10.00 s
0.0%
$1.25 → $10.00363
qwen/qwen3.5-plus100.0%3.96 s10.00 s
0.0%
$0.12 → $0.6952
openai/gpt-5.4-2026-03-05100.0%1.40 s2.18 s
0.0%
$5.00 → $22.50196
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25161
Z.ai: GLM 4.5 Air100.0%6.67 s10.00 s
0.0%
$0.20 → $1.1065
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
OpenAI: GPT-4.1 Nano100.0%1.36 s5.00 s
0.0%
$0.10 → $0.4099
Qwen: Qwen3 VL 8B Thinking100.0%7.50 s10.00 s
0.0%
$0.18 → $2.1067
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
OpenAI: GPT-5.1100.0%2.43 s4.63 s
0.0%
$1.25 → $10.00108
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Qwen: Qwen3.6 35B A3B100.0%4.54 s10.00 s
0.0%
$0.25 → $1.49205
Mostrando del 1 al 25 de 133

Volumen — tráfico de producción

Qué modelos soportan realmente el tráfico de producción de OrcaRouter, clasificados por rendimiento de tokens en la ventana seleccionada.

La clasificación por volumen se está calentando

En este período hemos visto hasta ahora — modelos. La clasificación por volumen se desbloquea cuando se acumula suficiente tráfico para clasificar los modelos de forma justa.

Modelos vistos

Mientras tanto, las tablas General y Fiabilidad de arriba ya están activas.

Validación — concordancia con clasificaciones externas

Cuánto se ajusta la clasificación de la comunidad a las clasificaciones externas independientes, medido por la correlación de rangos de Spearman (ρ) y Kendall (τ).

Tendencias — popularidad y opinión

De lo que habla la comunidad — volumen de menciones, impulso de 14 días y opinión. Solo contexto, nunca una señal de clasificación.