Classifica dei modelli di IA

Classificati in base al traffico di produzione reale di OrcaRouter e ai voti della community in Battle Mode, non a benchmark dichiarati dai fornitori.

Aggiornato il 2026-09-235 fonti di evidenzaNuovi modelli in classifica entro 48 h
Misurato su traffico reale
100.0%
Miglior tasso di successo (7 g)
Meta: Muse Spark 1.1
156 ms
Latenza p50 più rapida
Orca: OrcaVerify Text 1.0 (Free)
80.1%
Miglior tasso di vittoria della community
Qwen3.7 Max (2026-05-20)

Classifica consolidata

Una classifica combinata per modello — voti LMArena, benchmark indipendenti, adozione dell'ecosistema ed evidenze di produzione OrcaRouter, con pesi pubblici fissi. I nuovi modelli entrano dal primo giorno sulla base di evidenze esterne.

PosizioneModelloPunteggio compositoAffidabilità$/1M mistoVelocitàSlancioEvidenze
#1OpenAI: GPT-5.4 Pro81.199.46% · 10000ms$165.00$60 → $270 per 1M tokens132 token al secondoAA 66.0Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).Win 58.7%Percentuale di vittorie Blind Battle OrcaRouter — voti ciechi della nostra community.
#2DeepSeek: DeepSeek V4.1 Flash78.699.90% · 2541ms$0.38$0.15 → $0.6 per 1M tokens185 token al secondoAA 39.5Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 13.5%Quota token OpenRouter — adozione reale dell'ecosistema.
#3OpenAI: GPT-6 Astra75.899.30% · 10000ms$30.00$10 → $50 per 1M tokens55 token al secondoAA 52.7Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 1.4%Quota token OpenRouter — adozione reale dell'ecosistema.
#4Anthropic: Claude Opus 5.573.4100.00% · 10000ms$12.00$4 → $20 per 1M tokens4489 token al secondoAA 57.6Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 0.0%Quota token OpenRouter — adozione reale dell'ecosistema.
#5Anthropic: Claude Opus 572.699.37% · 6164ms$15.00$5 → $25 per 1M tokens85 token al secondoAA 50.8Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 0.9%Quota token OpenRouter — adozione reale dell'ecosistema.
#6Anthropic: Claude Fable 5.172.399.32% · 8022ms$30.00$10 → $50 per 1M tokens61 token al secondoAA 53.4Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 0.4%Quota token OpenRouter — adozione reale dell'ecosistema.
#7Z.ai: GLM 5.372.199.86% · 3904ms$2.61$1.26 → $3.96 per 1M tokens74 token al secondoAA 44.8Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 2.4%Quota token OpenRouter — adozione reale dell'ecosistema.
#8OpenAI: GPT-5.6 Luna72.199.88% · 1632ms$0.70$0.2 → $1.2 per 1M tokens110 token al secondoAA 37.3Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 6.6%Quota token OpenRouter — adozione reale dell'ecosistema.
#9Z.ai: GLM 5.3 Flash71.599.55% · 6866ms$0.16$0.075 → $0.25 per 1M tokens95 token al secondoArena 1472Elo della community LMArena — voti umani alla cieca nell'arena testo (CC-BY-4.0).AA 41.8Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 13.9%Quota token OpenRouter — adozione reale dell'ecosistema.
#10OpenAI: GPT-5.6 Sol71.499.42% · 10000ms$12.00$4 → $20 per 1M tokens1625 token al secondoAA 47.0Indice di intelligenza Artificial Analysis — benchmark composito indipendente (0–100).OR 1.4%Quota token OpenRouter — adozione reale dell'ecosistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Quota della top 20 per laboratorio
openai 25.0%anthropic 20.0%z-ai 15.0%google 10.0%Altri 30.0%
40%
Preferenza umana
LMArena · Bradley–Terry
30%
Benchmark indipendenti
Artificial Analysis · SWE-bench
20%
Evidenza di produzione
OrcaRouter Blind Battle win rate
10%
Adozione dell'ecosistema
OpenRouter token share

Sfide dirette

Percentuali di vittoria a coppie nel Battle Mode: quanto spesso ogni modello batte ciascun rivale nello scontro diretto.

Benchmark — intelligenza e prezzo

Punteggi di intelligenza indipendenti tracciati rispetto al prezzo di input. La linea tratteggiata è la frontiera di Pareto prezzo/intelligenza.

Sfida alla cieca

Due risposte anonime, un voto. Le tue battaglie alimentano il 20% di evidenza di produzione del punteggio consolidato.

⚔️ Sfida alla cieca

Due modelli anonimi rispondono allo stesso prompt. Leggi entrambi, vota il vincitore e poi scopri chi ha scritto cosa: il tuo voto alimenta la classifica qui sopra.

Metodologia — come funziona questa classifica

Ogni numero in questa pagina è misurato, mai autodichiarato. Questo è il metodo completo dietro la classifica combinata — le stesse regole per ogni modello, ogni giorno.

Un punteggio combinato, pesi pubblici fissi

Ogni modello riceve un punteggio composito da quattro famiglie di evidenze indipendenti: preferenza umana alla cieca 40%, benchmark indipendenti 30%, evidenze di produzione OrcaRouter 20% e adozione dell’ecosistema 10%. I pesi sono fissi e pubblici — nessun aggiustamento editoriale, nessun posizionamento a pagamento, nessuna candidatura dei vendor.

Cosa alimenta ogni famiglia

La preferenza umana viene dall’Elo comunitario di LMArena — voti ciechi a coppie nelle arene testo e visione (CC-BY-4.0). I benchmark indipendenti combinano Artificial Analysis (Intelligence Index più coding, matematica, GPQA Diamond e τ²-Bench) con SWE-bench Verified, la percentuale di issue GitHub reali risolte. Le evidenze di produzione sono i tassi di vittoria in Blind Battle di OrcaRouter. L’adozione usa la quota di token pubblicata da OpenRouter. Tasso di successo, latenza e throughput sono mostrati accanto a ogni modello come contesto: non entrano mai nel ranking.

Come i punteggi diventano confrontabili

Le fonti misurano su scale diverse (Elo, indici 0–100, % risolte), quindi ogni segnale è standardizzato rispetto alla classifica corrente e proiettato su 0–100: 50 è la media della classifica e ogni 15 punti valgono una deviazione standard, con limiti agli estremi. Un modello ha bisogno di almeno due famiglie di evidenze indipendenti per classificarsi, e la tabella elenca i top 25 per punteggio composito.

Classifiche per caso d’uso

Le classifiche testo, coding, visione, matematica, ragionamento e agenti ricalcolano la stessa miscela su segnali adatti al segmento — il coding sostituisce i benchmark di codice e SWE-bench Verified, la visione usa l’arena visione di LMArena — e le Blind Battle accoppiano solo modelli dello stesso segmento.

Freschezza e fair play

I feed esterni si aggiornano ogni giorno e la telemetria interna è live; i nuovi modelli entrano con evidenze esterne entro 48 ore dal rilascio. Non si usano mai numeri autodichiarati dai vendor, il buzz della community è mostrato solo come contesto e non alimenta mai una posizione, e ogni fonte esterna è accreditata sotto la classifica.

Domande frequenti

Come viene calcolata la classifica dei modelli IA?

Ogni modello riceve un punteggio combinato da quattro famiglie di evidenze — preferenza umana alla cieca (LMArena), benchmark indipendenti (Artificial Analysis, SWE-bench), affidabilità di produzione OrcaRouter e adozione nell'ecosistema (OpenRouter) — con pesi pubblici fissi 40 / 30 / 20 / 10.

Perché un modello appena uscito ha già una posizione?

I nuovi modelli entrano in classifica sulla base di evidenze esterne entro 48 ore dal rilascio. La posizione si consolida man mano che si accumulano battaglie della community e traffico di produzione.

Ogni quanto si aggiorna la classifica?

I feed esterni si aggiornano ogni giorno e la telemetria OrcaRouter è live; la data di aggiornamento è nell'intestazione.

Perché un modello manca?

Un modello richiede almeno due fonti di evidenza indipendenti per essere classificato e la board mostra i primi 25 per punteggio composito — i modelli con evidenze insufficienti restano esclusi finché un'altra fonte non li copre.

I casi d'uso sono classificati separatamente?

Sì — i pulsanti sopra la tabella consolidata passano tra le classifiche testo, coding, visione, matematica, ragionamento e agenti, e le battaglie accoppiano solo modelli comparabili.

Quando si consolida la posizione di un nuovo modello?

Quando un modello raggiunge tre famiglie di evidenze, incluse le battaglie e il traffico di OrcaRouter, la sua posizione si basa sulla combinazione completa e non solo su evidenze esterne.

Da dove vengono i dati?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, più la telemetria di produzione OrcaRouter — tutto attribuito sotto la tabella.

I vendor possono truccare la classifica?

Difficile: pesi pubblici, niente numeri autodichiarati, e battaglie alla cieca più traffico reale ancorano ogni punteggio.

Posso esportare o incorporare questi dati?

Sì — export JSON/CSV, badge di posizione incorporabile e feed RSS delle variazioni, gratuiti con attribuzione. Link nel footer.

Nuovi modelli, cambi di rango e lanci — seguici:X · @OrcaRouterDiscord