AI-modelranglijst

Gerangschikt op basis van echt productieverkeer van OrcaRouter en communitystemmen in Battle Mode — niet op door leveranciers gerapporteerde benchmarks.

Gemeten op echt verkeer
100.0%
Hoogste succespercentage (7 d)
OpenAI: GPT-4o (2024-08-06)
399 ms
Snelste p50-latentie
DeepSeek: DeepSeek V3
80.1%
Hoogste community-winratio
Qwen3.7 Max (2026-05-20)

Algemeen — community-winratio

Blinde Battle Mode-stemmen, gerangschikt met een Bradley–Terry-model (Elo). Stippen tonen de score; balken tonen het 95%-betrouwbaarheidsinterval. Modellen binnen één band zijn statistisch gelijk.

Stijlcorrectie
Binnenkort — heeft meer duelgegevens nodig

⚔️ Blind duel

Twee anonieme modellen beantwoorden dezelfde prompt. Lees beide, stem op de winnaar en zie dan wie wat schreef — je stem telt mee voor de ranglijst hierboven.

RangModelArena-scoreMethodeStemmenW·V·G
#1Qwen3.7 Max (2026-05-20)1746±140
blind · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
blind · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
blind · BT
281158·111·12
OpenAI: GPT-5.51521±81
blind · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
blind · BT
310149·149·12
Qwen3.7 Max1519±125
blind · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
blind · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
blind · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
blind · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
blind · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
blind · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
blind · BT
224119·93·12
MiniMax: MiniMax M31300±59
blind · BT
265127·126·12
Google: Gemma 4 31B1300±58
blind · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
blind · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
blind · BT
213100·101·12
Z.ai: GLM 5.21298±67
blind · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
blind · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
blind · BT
281151·118·12
OpenAI: GPT-5.41078±73
blind · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
blind · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
blind · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
blind · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
blind · BT
248118·118·12
Z.ai: GLM 5.11076±78
blind · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
blind · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
blind · BT
18871·105·12
#28Gemini 3.5 Flash852±123
blind · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
blind · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
blind · BT
12861·61·6

Directe duels

Paarsgewijze winstpercentages in Battle Mode — hoe vaak elk model elke rivaal in een direct duel verslaat.

Categorieleiders

Het sterkste model in elke vaardigheid — programmeren, wiskunde, redeneren en meer — met een profiel per as ten opzichte van de mediaan van het veld.

Benchmarks — intelligentie versus prijs

Onafhankelijke intelligentiescores uitgezet tegen de invoerprijs. De stippellijn is de Pareto-grens van prijs/intelligentie.

Betrouwbaarheid & kosten

Gemeten op het OrcaRouter-productieverkeer van de afgelopen 7 dagen.

Model
Succes % (7 d)
p50
p99
Fouten %
$/M (in→uit)
tok/s
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25162
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-5.2-Codex100.0%750 ms1.48 s
0.0%
$1.75 → $14.00101
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Z.ai: GLM 4.7100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2037
openai/gpt-3.5-turbo-1106100.0%1.83 s4.15 s
0.0%
$1.00 → $2.00143
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
openai/gpt-5.4-mini-2026-03-17100.0%2.00 s4.99 s
0.0%
$0.75 → $4.50174
Qwen: Qwen3 VL 235B A22B Thinking100.0%8.00 s10.00 s
0.0%
$0.40 → $4.0035
Z.ai: GLM 4.6100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2042
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
MiniMax: MiniMax M2.7100.0%1.28 s10.00 s
0.0%
$0.30 → $1.2082
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
OpenAI: GPT-4o-mini100.0%644 ms8.50 s
0.0%
$0.15 → $0.6068
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
1 tot 25 van 133 wordt weergegeven

Volume — productieverkeer

Welke modellen het OrcaRouter-productieverkeer daadwerkelijk dragen, gerangschikt op tokendoorvoer in het gekozen venster.

RangModelAandeelTrend
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22qwen3.6-plus
#23qwen3.6-35b-a3b
#24claude-sonnet-4.6
#25gemini-2.5-flash
1 tot 25 van 141 wordt weergegeven

+17 andere modellen onder de ranglijstdrempel voor dit venster.

Validatie — overeenstemming met externe ranglijsten

Hoe nauw de community-ranglijst onafhankelijke externe ranglijsten volgt, gemeten met de rangcorrelatie van Spearman (ρ) en Kendall (τ).

Buzz — populariteit en sentiment

Waar de community over praat — aantal vermeldingen, momentum over 14 dagen en sentiment. Alleen context, nooit een rangschikkingssignaal.