Classifica dei modelli di IA

Classificati in base al traffico di produzione reale di OrcaRouter e ai voti della community in Battle Mode, non a benchmark dichiarati dai fornitori.

Misurato su traffico reale
100.0%
Miglior tasso di successo (7 g)
Google: Nano Banana (Gemini 2.5 Flash Image)
399 ms
Latenza p50 più rapida
DeepSeek: DeepSeek V3
80.1%
Miglior tasso di vittoria della community
Qwen3.7 Max (2026-05-20)

Generale — tasso di vittoria della community

Voti del Battle Mode alla cieca, classificati con un modello di Bradley–Terry (Elo). I punti mostrano il punteggio; le barre, l’intervallo di confidenza al 95%. I modelli nella stessa fascia sono statisticamente alla pari.

Controllo dello stile
In arrivo — servono più dati di sfida

⚔️ Sfida alla cieca

Due modelli anonimi rispondono allo stesso prompt. Leggi entrambi, vota il vincitore e poi scopri chi ha scritto cosa: il tuo voto alimenta la classifica qui sopra.

PosizioneModelloPunteggio arenaMetodoVotiV·S·P
#1Qwen3.7 Max (2026-05-20)1746±140
alla cieca · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
alla cieca · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
alla cieca · BT
281158·111·12
OpenAI: GPT-5.51521±81
alla cieca · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
alla cieca · BT
310149·149·12
Qwen3.7 Max1519±125
alla cieca · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
alla cieca · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
alla cieca · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
alla cieca · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
alla cieca · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
alla cieca · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
alla cieca · BT
224119·93·12
MiniMax: MiniMax M31300±59
alla cieca · BT
265127·126·12
Google: Gemma 4 31B1300±58
alla cieca · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
alla cieca · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
alla cieca · BT
213100·101·12
Z.ai: GLM 5.21298±67
alla cieca · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
alla cieca · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
alla cieca · BT
281151·118·12
OpenAI: GPT-5.41078±73
alla cieca · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
alla cieca · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
alla cieca · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
alla cieca · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
alla cieca · BT
248118·118·12
Z.ai: GLM 5.11076±78
alla cieca · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
alla cieca · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
alla cieca · BT
18871·105·12
#28Gemini 3.5 Flash852±123
alla cieca · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
alla cieca · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
alla cieca · BT
12861·61·6

Sfide dirette

Percentuali di vittoria a coppie nel Battle Mode: quanto spesso ogni modello batte ciascun rivale nello scontro diretto.

Leader per categoria

Il modello più forte in ogni capacità — programmazione, matematica, ragionamento e altro — con un profilo per asse rispetto alla mediana del gruppo.

Benchmark — intelligenza e prezzo

Punteggi di intelligenza indipendenti tracciati rispetto al prezzo di input. La linea tratteggiata è la frontiera di Pareto prezzo/intelligenza.

Affidabilità e costo

Misurato sul traffico di produzione OrcaRouter degli ultimi 7 giorni.

Modello
Successo % (7 g)
p50
p99
Errori %
$/M (ingr.→usc.)
tok/s
Google: Nano Banana (Gemini 2.5 Flash Image)100.0%6.79 s8.93 s
0.0%
$0.30 → $30.002503
OpenAI: GPT-5.4 Mini100.0%4.17 s10.00 s
0.0%
$0.75 → $4.50659
Qwen: Qwen3.6 Flash100.0%3.85 s10.00 s
0.0%
$0.25 → $1.50303
openai/gpt-5.2-2025-12-11100.0%2.50 s10.00 s
0.0%
$1.75 → $14.0074
qwen/qwen3.6-flash-2026-04-16100.0%3.80 s10.00 s
0.0%
$0.25 → $1.50134
OpenAI: GPT-5 Codex100.0%875 ms7.35 s
0.0%
$1.25 → $10.00129
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
Z.ai: GLM 4.6100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2042
DeepSeek: DeepSeek V3100.0%399 ms4.67 s
0.0%
$0.15 → $0.2958
OpenAI: GPT-4100.0%6.88 s8.12 s
0.0%
$30.00 → $60.00294
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
openai/gpt-3.5-turbo-1106100.0%1.67 s4.15 s
0.0%
$1.00 → $2.00145
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
OpenAI: GPT-5.3-Codex100.0%1.10 s2.89 s
0.0%
$1.75 → $14.0062
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
qwen/qwen3.5-plus100.0%3.96 s10.00 s
0.0%
$0.12 → $0.6952
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.00103
openai/gpt-5-nano-2025-08-07100.0%10.00 s10.00 s
0.0%
$0.05 → $0.40650
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
qwen/qwen3-max-preview100.0%10.00 s10.00 s
0.0%
$0.86 → $3.4486
Mostra 1 a 25 di 133

Volume — traffico di produzione

Quali modelli sostengono realmente il traffico di produzione di OrcaRouter, classificati per throughput di token nella finestra selezionata.

La classifica per volume si sta avviando

In questo periodo abbiamo finora visto — modelli. La classifica per volume si sblocca quando si accumula traffico sufficiente per classificare i modelli in modo equo.

Modelli rilevati

Nel frattempo, le classifiche Generale e Affidabilità qui sopra sono già attive.

Validazione — concordanza con le classifiche esterne

Quanto la classifica della community segue le classifiche esterne indipendenti, misurata dalla correlazione di rango di Spearman (ρ) e Kendall (τ).

Buzz — popolarità e sentiment

Di cosa parla la community — volume delle menzioni, slancio a 14 giorni e sentiment. Solo contesto, mai un segnale di classifica.