Classificati in base al traffico di produzione reale di OrcaRouter e ai voti della community in Battle Mode, non a benchmark dichiarati dai fornitori.
Voti del Battle Mode alla cieca, classificati con un modello di Bradley–Terry (Elo). I punti mostrano il punteggio; le barre, l’intervallo di confidenza al 95%. I modelli nella stessa fascia sono statisticamente alla pari.
Due modelli anonimi rispondono allo stesso prompt. Leggi entrambi, vota il vincitore e poi scopri chi ha scritto cosa: il tuo voto alimenta la classifica qui sopra.
| Posizione | Modello | Punteggio arena | Metodo | Voti | V·S·P |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | alla cieca · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | alla cieca · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | alla cieca · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | alla cieca · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | alla cieca · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | alla cieca · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | alla cieca · BT | 247 | 117·117·13 | ||
| Qwen: Qwen3.6 35B A3B | alla cieca · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | alla cieca · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | alla cieca · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | alla cieca · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | alla cieca · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | alla cieca · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | alla cieca · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | alla cieca · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | alla cieca · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | alla cieca · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | alla cieca · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | alla cieca · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | alla cieca · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | alla cieca · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | alla cieca · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | alla cieca · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | alla cieca · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | alla cieca · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | alla cieca · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | alla cieca · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | alla cieca · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | alla cieca · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | alla cieca · BT | 128 | 61·61·6 |
Percentuali di vittoria a coppie nel Battle Mode: quanto spesso ogni modello batte ciascun rivale nello scontro diretto.
Il modello più forte in ogni capacità — programmazione, matematica, ragionamento e altro — con un profilo per asse rispetto alla mediana del gruppo.
Punteggi di intelligenza indipendenti tracciati rispetto al prezzo di input. La linea tratteggiata è la frontiera di Pareto prezzo/intelligenza.
Misurato sul traffico di produzione OrcaRouter degli ultimi 7 giorni.
| Modello | Successo % (7 g) | p50 | p99 | Errori % | $/M (ingr.→usc.) | tok/s |
|---|---|---|---|---|---|---|
| Google: Nano Banana (Gemini 2.5 Flash Image) | 100.0% | 6.79 s | 8.93 s | 0.0% | $0.30 → $30.00 | 2503 |
| OpenAI: GPT-5.4 Mini | 100.0% | 4.17 s | 10.00 s | 0.0% | $0.75 → $4.50 | 659 |
| Qwen: Qwen3.6 Flash | 100.0% | 3.85 s | 10.00 s | 0.0% | $0.25 → $1.50 | 303 |
| openai/gpt-5.2-2025-12-11 | 100.0% | 2.50 s | 10.00 s | 0.0% | $1.75 → $14.00 | 74 |
| qwen/qwen3.6-flash-2026-04-16 | 100.0% | 3.80 s | 10.00 s | 0.0% | $0.25 → $1.50 | 134 |
| OpenAI: GPT-5 Codex | 100.0% | 875 ms | 7.35 s | 0.0% | $1.25 → $10.00 | 129 |
| qwen/qwen3.6-plus-2026-04-02 | 100.0% | 4.18 s | 7.86 s | 0.0% | $0.28 → $1.65 | 56 |
| ZAZ.ai: GLM 4.6 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.60 → $2.20 | 42 |
| DEDeepSeek: DeepSeek V3 | 100.0% | 399 ms | 4.67 s | 0.0% | $0.15 → $0.29 | 58 |
| OpenAI: GPT-4 | 100.0% | 6.88 s | 8.12 s | 0.0% | $30.00 → $60.00 | 294 |
| OpenAI: GPT-4 Turbo | 100.0% | 5.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 24 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| openai/gpt-5.4-nano-2026-03-17 | 100.0% | 1.55 s | 3.30 s | 0.0% | $0.20 → $1.25 | 157 |
| Qwen: Qwen3.5-122B-A10B | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.12 → $0.92 | 89 |
| openai/gpt-3.5-turbo-1106 | 100.0% | 1.67 s | 4.15 s | 0.0% | $1.00 → $2.00 | 145 |
| OpenAI: GPT-4o (2024-08-06) | 100.0% | 2.86 s | 5.72 s | 0.0% | $2.50 → $10.00 | 86 |
| OpenAI: GPT-5.3-Codex | 100.0% | 1.10 s | 2.89 s | 0.0% | $1.75 → $14.00 | 62 |
| Qwen: Qwen3.5-27B | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.09 → $0.69 | 50 |
| qwen/qwen3.5-plus | 100.0% | 3.96 s | 10.00 s | 0.0% | $0.12 → $0.69 | 52 |
| ZAZ.ai: GLM 5.1 | 100.0% | 4.59 s | 10.00 s | 0.0% | $1.40 → $4.40 | 67 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| OpenAI: GPT-3.5 Turbo 16k | 100.0% | 5.00 s | 7.07 s | 0.0% | $3.00 → $4.00 | 103 |
| openai/gpt-5-nano-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.05 → $0.40 | 650 |
| OpenAI: GPT-4o-mini (2024-07-18) | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.15 → $0.60 | 32 |
| qwen/qwen3-max-preview | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.86 → $3.44 | 86 |
Quali modelli sostengono realmente il traffico di produzione di OrcaRouter, classificati per throughput di token nella finestra selezionata.
In questo periodo abbiamo finora visto — modelli. La classifica per volume si sblocca quando si accumula traffico sufficiente per classificare i modelli in modo equo.
Nel frattempo, le classifiche Generale e Affidabilità qui sopra sono già attive.
Quanto la classifica della community segue le classifiche esterne indipendenti, misurata dalla correlazione di rango di Spearman (ρ) e Kendall (τ).
L’Arena Rating di ciascun modello negli ultimi 90 giorni, da istantanee giornaliere. Un badge di regressione segnala un calo prolungato.
Di cosa parla la community — volume delle menzioni, slancio a 14 giorni e sentiment. Solo contesto, mai un segnale di classifica.