KI-Modell-Bestenliste

Eingestuft nach echtem Produktionsverkehr von OrcaRouter und Community-Abstimmungen im Battle Mode — nicht nach herstellereigenen Benchmarks.

Mit echtem Datenverkehr gemessen
100.0%
Höchste Erfolgsquote (7 Tage)
openai/gpt-5.4-2026-03-05
399 ms
Schnellste p50-Latenz
DeepSeek: DeepSeek V3
80.1%
Höchste Community-Siegquote
Qwen3.7 Max (2026-05-20)

Gesamt — Community-Siegquote

Blinde Battle-Mode-Abstimmungen, sortiert nach einem Bradley–Terry-Modell (Elo). Punkte zeigen die Wertung, Balken das 95-%-Konfidenzintervall. Modelle innerhalb einer Bande sind statistisch gleichauf.

Stilkontrolle
Demnächst — benötigt mehr Duelldaten

⚔️ Blind-Duell

Zwei anonyme Modelle beantworten denselben Prompt. Lies beide, stimme für den Sieger ab und sieh dann, wer was geschrieben hat — deine Stimme fließt in die Rangliste oben ein.

RangModellArena-WertungMethodeStimmenS·N·U
#1Qwen3.7 Max (2026-05-20)1746±140
blind · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
blind · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
blind · BT
281158·111·12
OpenAI: GPT-5.51521±81
blind · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
blind · BT
310149·149·12
Qwen3.7 Max1519±125
blind · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
blind · BT
247117·117·13
Qwen3.6 35B A3B Uncensored (Aggressive)1518±91
blind · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
blind · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
blind · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
blind · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
blind · BT
224119·93·12
MiniMax: MiniMax M31300±59
blind · BT
265127·126·12
Google: Gemma 4 31B1300±58
blind · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
blind · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
blind · BT
213100·101·12
Z.ai: GLM 5.21298±67
blind · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
blind · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
blind · BT
281151·118·12
OpenAI: GPT-5.41078±73
blind · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
blind · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
blind · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
blind · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
blind · BT
248118·118·12
Z.ai: GLM 5.11076±78
blind · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
blind · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
blind · BT
18871·105·12
#28Gemini 3.5 Flash852±123
blind · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
blind · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
blind · BT
12861·61·6

Direkte Duelle

Paarweise Battle-Mode-Siegquoten – wie oft jedes Modell jeden Rivalen im direkten Vergleich schlägt.

Spitzenreiter nach Kategorie

Das stärkste Modell in jeder Fähigkeit — Programmieren, Mathematik, logisches Denken und mehr — mit einem Profil je Achse im Vergleich zum Median des Felds.

Benchmarks – Intelligenz vs. Preis

Unabhängige Intelligenz-Scores gegen den Eingabepreis aufgetragen. Die gestrichelte Linie ist die Pareto-Front aus Preis und Intelligenz.

Zuverlässigkeit & Kosten

Gemessen am OrcaRouter-Produktionsverkehr der letzten 7 Tage.

Modell
Erfolg % (7 Tage)
p50
p99
Fehler %
$/Mio. (Ein→Aus)
tok/s
openai/gpt-5.4-2026-03-05100.0%1.40 s2.18 s
0.0%
$5.00 → $22.50196
qwen/qwen3.5-flash100.0%5.83 s10.00 s
0.0%
$0.10 → $0.40140
openai/gpt-5-nano-2025-08-07100.0%10.00 s10.00 s
0.0%
$0.05 → $0.40650
tencent/Hunyuan-A13B-Instruct100.0%1.24 s1.24 s
0.0%
$0.14 → $0.57
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.00103
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
Qwen: Qwen3 VL 8B Instruct100.0%6.00 s10.00 s
0.0%
$0.18 → $0.7071
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
openai/gpt-5.5-pro-2026-04-23100.0%1.44 s2.11 s
0.0%
$60.00 → $270.0015
Qwen: Qwen3 VL 8B Thinking100.0%7.50 s10.00 s
0.0%
$0.18 → $2.1067
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25161
qwen/qwen3.6-flash-2026-04-16100.0%3.80 s10.00 s
0.0%
$0.25 → $1.50134
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
qwen/qwen3.5-plus-2026-02-15100.0%4.08 s10.00 s
0.0%
$0.12 → $0.6955
OpenAI: GPT-4.1 Mini100.0%1.83 s10.00 s
0.0%
$0.40 → $1.6092
openai/gpt-5.1-chat-latest100.0%2.38 s3.50 s
0.0%
$1.25 → $10.00110
OpenAI: GPT-5.3-Codex100.0%1.10 s2.89 s
0.0%
$1.75 → $14.0062
OpenAI: GPT-4o (2024-05-13)100.0%3.13 s6.12 s
0.0%
$5.00 → $15.00122
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
tencent/Hy3-preview100.0%1.77 s1.77 s
0.0%
$75.00 → $75.00
Anzeigen 1 bis 25 von 133

Volumen — Produktionsverkehr

Welche Modelle den OrcaRouter-Produktionsverkehr tatsächlich tragen, sortiert nach Token-Durchsatz im gewählten Zeitfenster.

RangModellAnteilTrend
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22grok-4.5
#23qwen3.6-plus
#24qwen3.6-35b-a3b
#25claude-sonnet-4.6
Anzeigen 1 bis 25 von 141

+17 weitere Modelle unter der Wertungsschwelle für diesen Zeitraum.

Validierung — Übereinstimmung mit externen Rankings

Wie genau das Community-Ranking unabhängigen externen Rankings folgt, gemessen an der Rangkorrelation nach Spearman (ρ) und Kendall (τ).

Buzz — Beliebtheit und Stimmung

Worüber die Community spricht — Erwähnungsvolumen, 14-Tage-Dynamik und Stimmung. Nur als Kontext, niemals als Ranking-Signal.