Classé selon le trafic de production réel d’OrcaRouter et les votes communautaires du Battle Mode — et non sur des benchmarks fournis par les éditeurs.
Votes du Battle Mode à l’aveugle, classés par un modèle de Bradley–Terry (Elo). Les points indiquent le score ; les barres, l’intervalle de confiance à 95 %. Les modèles d’une même bande sont statistiquement à égalité.
Deux modèles anonymes répondent à la même requête. Lisez les deux, votez pour le gagnant, puis découvrez qui a écrit quoi — votre vote alimente le classement ci-dessus.
| Rang | Modèle | Score d'arène | Méthode | Votes | V·D·N |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | à l’aveugle · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | à l’aveugle · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | à l’aveugle · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | à l’aveugle · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | à l’aveugle · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | à l’aveugle · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | à l’aveugle · BT | 247 | 117·117·13 | ||
| Qwen: Qwen3.6 35B A3B | à l’aveugle · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | à l’aveugle · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | à l’aveugle · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | à l’aveugle · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | à l’aveugle · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | à l’aveugle · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | à l’aveugle · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | à l’aveugle · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | à l’aveugle · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | à l’aveugle · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | à l’aveugle · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | à l’aveugle · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | à l’aveugle · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | à l’aveugle · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | à l’aveugle · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | à l’aveugle · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | à l’aveugle · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | à l’aveugle · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | à l’aveugle · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | à l’aveugle · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | à l’aveugle · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | à l’aveugle · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | à l’aveugle · BT | 128 | 61·61·6 |
Taux de victoire en duel du Battle Mode — à quelle fréquence chaque modèle bat chaque rival en face-à-face.
Le modèle le plus performant dans chaque capacité — code, mathématiques, raisonnement et plus encore — avec un profil par axe comparé à la médiane du panel.
Scores d’intelligence indépendants tracés par rapport au prix d’entrée. La ligne en pointillés est la frontière de Pareto prix/intelligence.
Mesuré sur le trafic de production OrcaRouter des 7 derniers jours.
| Modèle | Réussite % (7 j) | p50 | p99 | Erreurs % | $/M (entrée→sortie) | tok/s |
|---|---|---|---|---|---|---|
| OpenAI: GPT-5.3-Codex | 100.0% | 1.10 s | 2.89 s | 0.0% | $1.75 → $14.00 | 62 |
| openai/gpt-5.1-chat-latest | 100.0% | 2.38 s | 3.50 s | 0.0% | $1.25 → $10.00 | 110 |
| openai/gpt-5.2-chat-latest | 100.0% | 1.57 s | 10.00 s | 0.0% | $1.75 → $14.00 | 112 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| openai/gpt-3.5-turbo-1106 | 100.0% | 1.83 s | 4.15 s | 0.0% | $1.00 → $2.00 | 143 |
| OpenAI: GPT-4 | 100.0% | 6.88 s | 8.12 s | 0.0% | $30.00 → $60.00 | 294 |
| OpenAI: GPT-4.1 Nano | 100.0% | 1.36 s | 5.00 s | 0.0% | $0.10 → $0.40 | 99 |
| openai/gpt-4o-mini-search-preview-2025-03-11 | 100.0% | 5.19 s | 5.19 s | 0.0% | $0.15 → $0.60 | — |
| OpenAI: GPT-5 Nano | 100.0% | 4.31 s | 10.00 s | 0.0% | $0.05 → $0.40 | 835 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| OpenAI: GPT-5.4 Pro | 100.0% | 2.67 s | 4.72 s | 0.0% | $60.00 → $270.00 | 6 |
| ZAZ.ai: GLM 4.5 Air | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.20 → $1.10 | 65 |
| ZAZ.ai: GLM 5.1 | 100.0% | 4.59 s | 10.00 s | 0.0% | $1.40 → $4.40 | 67 |
| Google: Nano Banana Pro (Gemini 3 Pro Image Preview) | 100.0% | 5.00 s | 5.53 s | 0.0% | — → — | — |
| GRgrok/grok-4.3 | 100.0% | 2.00 s | 3.33 s | 0.0% | $1.25 → $2.50 | 115 |
| OpenAI: GPT-5 Mini | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.25 → $2.00 | 189 |
| google/gemini-3.1-flash-lite | 100.0% | 988 ms | 4.90 s | 0.0% | $0.25 → $1.50 | 286 |
| OpenAI: GPT-5.2 Pro | 100.0% | 2.00 s | 4.42 s | 0.0% | $21.00 → $168.00 | 13 |
| openai/gpt-5.4-2026-03-05 | 100.0% | 1.40 s | 2.18 s | 0.0% | $5.00 → $22.50 | 196 |
| Qwen: Qwen3 VL 235B A22B Thinking | 100.0% | 8.00 s | 10.00 s | 0.0% | $0.40 → $4.00 | 35 |
| GRgrok/grok-imagine-image | 100.0% | 4.76 s | 4.76 s | 0.0% | — → — | — |
| OpenAI: GPT-4o (2024-05-13) | 100.0% | 3.13 s | 6.12 s | 0.0% | $5.00 → $15.00 | 122 |
| OpenAI: GPT-5.2 | 100.0% | 1.51 s | 8.31 s | 0.0% | $1.75 → $14.00 | 171 |
Quels modèles portent réellement le trafic de production OrcaRouter, classés selon le débit de tokens sur la fenêtre sélectionnée.
Nous avons vu — modèles jusqu’à présent cette période. Le classement par volume se débloque dès qu’un trafic suffisant est accumulé pour classer les modèles équitablement.
En attendant, les classements Global et Fiabilité ci-dessus sont déjà actifs.
À quel point le classement de la communauté suit les classements externes indépendants, mesuré par la corrélation de rang de Spearman (ρ) et de Kendall (τ).
L’Arena Rating de chaque modèle sur les 90 derniers jours, à partir d’instantanés quotidiens. Un badge de régression signale une baisse durable.
Ce dont la communauté parle — volume de mentions, dynamique sur 14 jours et sentiment. Contexte uniquement, jamais un signal de classement.