Clasificados según el tráfico de producción real de OrcaRouter y los votos de la comunidad en Battle Mode, no según benchmarks declarados por los proveedores.
Votos del Battle Mode a ciegas, clasificados con un modelo de Bradley–Terry (Elo). Los puntos muestran la puntuación; las barras, el intervalo de confianza del 95 %. Los modelos de una misma banda están estadísticamente empatados.
Dos modelos anónimos responden al mismo prompt. Lee ambos, vota por el ganador y luego descubre quién escribió qué: tu voto alimenta la clasificación de arriba.
| Puesto | Modelo | Puntuación de arena | Método | Votos | V·D·E |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | a ciegas · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | a ciegas · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | a ciegas · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | a ciegas · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | a ciegas · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | a ciegas · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | a ciegas · BT | 247 | 117·117·13 | ||
| Qwen: Qwen3.6 35B A3B | a ciegas · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | a ciegas · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | a ciegas · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | a ciegas · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | a ciegas · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | a ciegas · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | a ciegas · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | a ciegas · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | a ciegas · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | a ciegas · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | a ciegas · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | a ciegas · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | a ciegas · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | a ciegas · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | a ciegas · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | a ciegas · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | a ciegas · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | a ciegas · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | a ciegas · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | a ciegas · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | a ciegas · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | a ciegas · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | a ciegas · BT | 128 | 61·61·6 |
Tasas de victoria por pares en Battle Mode: con qué frecuencia cada modelo gana a cada rival cara a cara.
El modelo más fuerte en cada capacidad —programación, matemáticas, razonamiento y más— con un perfil por eje frente a la mediana del conjunto.
Puntuaciones de inteligencia independientes representadas frente al precio de entrada. La línea discontinua es la frontera de Pareto precio/inteligencia.
Medido con el tráfico de producción de OrcaRouter de los últimos 7 días.
| Modelo | Éxito % (7 d) | p50 | p99 | Errores % | $/M (entrada→salida) | tok/s |
|---|---|---|---|---|---|---|
| OpenAI: GPT-5 Mini | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.25 → $2.00 | 189 |
| OpenAI: GPT-5 Nano | 100.0% | 4.31 s | 10.00 s | 0.0% | $0.05 → $0.40 | 835 |
| openai/gpt-5.2-chat-latest | 100.0% | 1.57 s | 10.00 s | 0.0% | $1.75 → $14.00 | 112 |
| Qwen: Qwen3.7 Plus | 100.0% | 3.96 s | 10.00 s | 0.0% | $0.35 → $1.42 | 58 |
| MIMiniMax M2.5 highspeed | 100.0% | 2.12 s | 2.12 s | 0.0% | $0.60 → $2.40 | — |
| openai/gpt-3.5-turbo-1106 | 100.0% | 1.80 s | 4.15 s | 0.0% | $1.00 → $2.00 | 143 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| Qwen: Qwen3 VL 235B A22B Instruct | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.40 → $1.60 | 74 |
| OpenAI: GPT-4o | 100.0% | 902 ms | 10.00 s | 0.0% | $2.50 → $10.00 | 98 |
| Qwen: Qwen3.5-122B-A10B | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.12 → $0.92 | 89 |
| google/gemini-3.1-flash-lite | 100.0% | 986 ms | 4.90 s | 0.0% | $0.25 → $1.50 | 285 |
| OpenAI: GPT-3.5 Turbo 16k | 100.0% | 5.00 s | 7.07 s | 0.0% | $3.00 → $4.00 | 103 |
| openai/gpt-5-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 363 |
| qwen/qwen3.5-plus | 100.0% | 3.96 s | 10.00 s | 0.0% | $0.12 → $0.69 | 52 |
| openai/gpt-5.4-2026-03-05 | 100.0% | 1.40 s | 2.18 s | 0.0% | $5.00 → $22.50 | 196 |
| OpenAI: GPT-5.4 Nano | 100.0% | 1.35 s | 10.00 s | 0.0% | $0.20 → $1.25 | 161 |
| ZAZ.ai: GLM 4.5 Air | 100.0% | 6.67 s | 10.00 s | 0.0% | $0.20 → $1.10 | 65 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| OpenAI: GPT-4.1 Nano | 100.0% | 1.36 s | 5.00 s | 0.0% | $0.10 → $0.40 | 99 |
| Qwen: Qwen3 VL 8B Thinking | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.18 → $2.10 | 67 |
| ZAZ.ai: GLM 5.1 | 100.0% | 4.59 s | 10.00 s | 0.0% | $1.40 → $4.40 | 67 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| OpenAI: GPT-5.1 | 100.0% | 2.43 s | 4.63 s | 0.0% | $1.25 → $10.00 | 108 |
| OpenAI: GPT-5.4 Pro | 100.0% | 2.67 s | 4.72 s | 0.0% | $60.00 → $270.00 | 6 |
| Qwen: Qwen3.6 35B A3B | 100.0% | 4.54 s | 10.00 s | 0.0% | $0.25 → $1.49 | 205 |
Qué modelos soportan realmente el tráfico de producción de OrcaRouter, clasificados por rendimiento de tokens en la ventana seleccionada.
En este período hemos visto hasta ahora — modelos. La clasificación por volumen se desbloquea cuando se acumula suficiente tráfico para clasificar los modelos de forma justa.
Mientras tanto, las tablas General y Fiabilidad de arriba ya están activas.
Cuánto se ajusta la clasificación de la comunidad a las clasificaciones externas independientes, medido por la correlación de rangos de Spearman (ρ) y Kendall (τ).
El Arena Rating de cada modelo durante los últimos 90 días, a partir de instantáneas diarias. Una insignia de regresión señala una caída sostenida.
De lo que habla la comunidad — volumen de menciones, impulso de 14 días y opinión. Solo contexto, nunca una señal de clasificación.