Classement des modèles d’IA

Classé selon le trafic de production réel d’OrcaRouter et les votes communautaires du Battle Mode — et non sur des benchmarks fournis par les éditeurs.

Mesuré sur du trafic réel
100.0%
Meilleur taux de réussite (7 j)
OpenAI: GPT-5.3-Codex
399 ms
Latence p50 la plus rapide
DeepSeek: DeepSeek V3
80.1%
Meilleur taux de victoire communautaire
Qwen3.7 Max (2026-05-20)

Général — taux de victoire communautaire

Votes du Battle Mode à l’aveugle, classés par un modèle de Bradley–Terry (Elo). Les points indiquent le score ; les barres, l’intervalle de confiance à 95 %. Les modèles d’une même bande sont statistiquement à égalité.

Contrôle de style
Bientôt disponible — nécessite plus de données de duel

⚔️ Duel à l’aveugle

Deux modèles anonymes répondent à la même requête. Lisez les deux, votez pour le gagnant, puis découvrez qui a écrit quoi — votre vote alimente le classement ci-dessus.

RangModèleScore d'arèneMéthodeVotesV·D·N
#1Qwen3.7 Max (2026-05-20)1746±140
à l’aveugle · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
à l’aveugle · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
à l’aveugle · BT
281158·111·12
OpenAI: GPT-5.51521±81
à l’aveugle · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
à l’aveugle · BT
310149·149·12
Qwen3.7 Max1519±125
à l’aveugle · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
à l’aveugle · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
à l’aveugle · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
à l’aveugle · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
à l’aveugle · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
à l’aveugle · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
à l’aveugle · BT
224119·93·12
MiniMax: MiniMax M31300±59
à l’aveugle · BT
265127·126·12
Google: Gemma 4 31B1300±58
à l’aveugle · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
à l’aveugle · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
à l’aveugle · BT
213100·101·12
Z.ai: GLM 5.21298±67
à l’aveugle · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
à l’aveugle · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
à l’aveugle · BT
281151·118·12
OpenAI: GPT-5.41078±73
à l’aveugle · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
à l’aveugle · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
à l’aveugle · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
à l’aveugle · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
à l’aveugle · BT
248118·118·12
Z.ai: GLM 5.11076±78
à l’aveugle · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
à l’aveugle · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
à l’aveugle · BT
18871·105·12
#28Gemini 3.5 Flash852±123
à l’aveugle · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
à l’aveugle · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
à l’aveugle · BT
12861·61·6

Duels directs

Taux de victoire en duel du Battle Mode — à quelle fréquence chaque modèle bat chaque rival en face-à-face.

Leaders par catégorie

Le modèle le plus performant dans chaque capacité — code, mathématiques, raisonnement et plus encore — avec un profil par axe comparé à la médiane du panel.

Benchmarks — intelligence et prix

Scores d’intelligence indépendants tracés par rapport au prix d’entrée. La ligne en pointillés est la frontière de Pareto prix/intelligence.

Fiabilité et coût

Mesuré sur le trafic de production OrcaRouter des 7 derniers jours.

Modèle
Réussite % (7 j)
p50
p99
Erreurs %
$/M (entrée→sortie)
tok/s
OpenAI: GPT-5.3-Codex100.0%1.10 s2.89 s
0.0%
$1.75 → $14.0062
openai/gpt-5.1-chat-latest100.0%2.38 s3.50 s
0.0%
$1.25 → $10.00110
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
openai/gpt-3.5-turbo-1106100.0%1.83 s4.15 s
0.0%
$1.00 → $2.00143
OpenAI: GPT-4100.0%6.88 s8.12 s
0.0%
$30.00 → $60.00294
OpenAI: GPT-4.1 Nano100.0%1.36 s5.00 s
0.0%
$0.10 → $0.4099
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Z.ai: GLM 4.5 Air100.0%7.50 s10.00 s
0.0%
$0.20 → $1.1065
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
grok/grok-4.3100.0%2.00 s3.33 s
0.0%
$1.25 → $2.50115
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
google/gemini-3.1-flash-lite100.0%988 ms4.90 s
0.0%
$0.25 → $1.50286
OpenAI: GPT-5.2 Pro100.0%2.00 s4.42 s
0.0%
$21.00 → $168.0013
openai/gpt-5.4-2026-03-05100.0%1.40 s2.18 s
0.0%
$5.00 → $22.50196
Qwen: Qwen3 VL 235B A22B Thinking100.0%8.00 s10.00 s
0.0%
$0.40 → $4.0035
grok/grok-imagine-image100.0%4.76 s4.76 s
0.0%
— → —
OpenAI: GPT-4o (2024-05-13)100.0%3.13 s6.12 s
0.0%
$5.00 → $15.00122
OpenAI: GPT-5.2100.0%1.51 s8.31 s
0.0%
$1.75 → $14.00171
Montrant 1 to 25 of 133

Volume — trafic de production

Quels modèles portent réellement le trafic de production OrcaRouter, classés selon le débit de tokens sur la fenêtre sélectionnée.

Le classement par volume se met en route

Nous avons vu — modèles jusqu’à présent cette période. Le classement par volume se débloque dès qu’un trafic suffisant est accumulé pour classer les modèles équitablement.

Modèles observés

En attendant, les classements Global et Fiabilité ci-dessus sont déjà actifs.

Validation — concordance avec les classements externes

À quel point le classement de la communauté suit les classements externes indépendants, mesuré par la corrélation de rang de Spearman (ρ) et de Kendall (τ).

Tendances — popularité et sentiment

Ce dont la communauté parle — volume de mentions, dynamique sur 14 jours et sentiment. Contexte uniquement, jamais un signal de classement.