Eingestuft nach echtem Produktionsverkehr von OrcaRouter und Community-Abstimmungen im Battle Mode — nicht nach herstellereigenen Benchmarks.
Blinde Battle-Mode-Abstimmungen, sortiert nach einem Bradley–Terry-Modell (Elo). Punkte zeigen die Wertung, Balken das 95-%-Konfidenzintervall. Modelle innerhalb einer Bande sind statistisch gleichauf.
Zwei anonyme Modelle beantworten denselben Prompt. Lies beide, stimme für den Sieger ab und sieh dann, wer was geschrieben hat — deine Stimme fließt in die Rangliste oben ein.
| Rang | Modell | Arena-Wertung | Methode | Stimmen | S·N·U |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | blind · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | blind · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | blind · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | blind · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | blind · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | blind · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | blind · BT | 247 | 117·117·13 | ||
| OBQwen3.6 35B A3B Uncensored (Aggressive) | blind · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | blind · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | blind · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | blind · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | blind · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | blind · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | blind · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | blind · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | blind · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | blind · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | blind · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | blind · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | blind · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | blind · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | blind · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | blind · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | blind · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | blind · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | blind · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | blind · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | blind · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | blind · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | blind · BT | 128 | 61·61·6 |
Paarweise Battle-Mode-Siegquoten – wie oft jedes Modell jeden Rivalen im direkten Vergleich schlägt.
Das stärkste Modell in jeder Fähigkeit — Programmieren, Mathematik, logisches Denken und mehr — mit einem Profil je Achse im Vergleich zum Median des Felds.
Unabhängige Intelligenz-Scores gegen den Eingabepreis aufgetragen. Die gestrichelte Linie ist die Pareto-Front aus Preis und Intelligenz.
Gemessen am OrcaRouter-Produktionsverkehr der letzten 7 Tage.
| Modell | Erfolg % (7 Tage) | p50 | p99 | Fehler % | $/Mio. (Ein→Aus) | tok/s |
|---|---|---|---|---|---|---|
| openai/gpt-5.4-2026-03-05 | 100.0% | 1.40 s | 2.18 s | 0.0% | $5.00 → $22.50 | 196 |
| qwen/qwen3.5-flash | 100.0% | 5.83 s | 10.00 s | 0.0% | $0.10 → $0.40 | 140 |
| openai/gpt-5-nano-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.05 → $0.40 | 650 |
| TEtencent/Hunyuan-A13B-Instruct | 100.0% | 1.24 s | 1.24 s | 0.0% | $0.14 → $0.57 | — |
| OpenAI: GPT-3.5 Turbo 16k | 100.0% | 5.00 s | 7.07 s | 0.0% | $3.00 → $4.00 | 103 |
| OpenAI: GPT-4o (2024-08-06) | 100.0% | 2.86 s | 5.72 s | 0.0% | $2.50 → $10.00 | 86 |
| Qwen: Qwen3 VL 8B Instruct | 100.0% | 6.00 s | 10.00 s | 0.0% | $0.18 → $0.70 | 71 |
| OpenAI: GPT-5 Nano | 100.0% | 4.31 s | 10.00 s | 0.0% | $0.05 → $0.40 | 835 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| openai/gpt-5.5-pro-2026-04-23 | 100.0% | 1.44 s | 2.11 s | 0.0% | $60.00 → $270.00 | 15 |
| Qwen: Qwen3 VL 8B Thinking | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.18 → $2.10 | 67 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| OpenAI: GPT-5.4 Nano | 100.0% | 1.35 s | 10.00 s | 0.0% | $0.20 → $1.25 | 161 |
| qwen/qwen3.6-flash-2026-04-16 | 100.0% | 3.80 s | 10.00 s | 0.0% | $0.25 → $1.50 | 134 |
| OpenAI: GPT-5.4 Pro | 100.0% | 2.67 s | 4.72 s | 0.0% | $60.00 → $270.00 | 6 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| qwen/qwen3.5-plus-2026-02-15 | 100.0% | 4.08 s | 10.00 s | 0.0% | $0.12 → $0.69 | 55 |
| OpenAI: GPT-4.1 Mini | 100.0% | 1.83 s | 10.00 s | 0.0% | $0.40 → $1.60 | 92 |
| openai/gpt-5.1-chat-latest | 100.0% | 2.38 s | 3.50 s | 0.0% | $1.25 → $10.00 | 110 |
| OpenAI: GPT-5.3-Codex | 100.0% | 1.10 s | 2.89 s | 0.0% | $1.75 → $14.00 | 62 |
| OpenAI: GPT-4o (2024-05-13) | 100.0% | 3.13 s | 6.12 s | 0.0% | $5.00 → $15.00 | 122 |
| Qwen: Qwen3.5-122B-A10B | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.12 → $0.92 | 89 |
| Qwen: Qwen3.5-27B | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.09 → $0.69 | 50 |
| TEtencent/Hy3-preview | 100.0% | 1.77 s | 1.77 s | 0.0% | $75.00 → $75.00 | — |
Welche Modelle den OrcaRouter-Produktionsverkehr tatsächlich tragen, sortiert nach Token-Durchsatz im gewählten Zeitfenster.
| Rang | Modell | Anteil | Trend |
|---|---|---|---|
| #1 | DEdeepseek-v4-flash | — | |
| #2 | DEdeepseek-v4-pro | — | |
| #3 | ZAglm-5.2 | — | |
| #4 | claude-opus-4.8 | ||
| #5 | DEdeepseek-chat | ||
| #6 | DEdeepseek-reasoner | ||
| #7 | MIminimax-m3 | ||
| #8 | claude-sonnet-5 | — | |
| #9 | claude-opus-4.7 | ||
| #10 | gpt-image-2-medium | — | |
| #11 | qwen3.7-max | ||
| #12 | qwen3.7-plus | ||
| #13 | gemini-3.5-flash | ||
| #14 | qwen3.5-35b-a3b | ||
| #15 | gpt-5.4-nano | ||
| #16 | gemini-2.5-flash-lite | ||
| #17 | gemini-3-flash-preview | ||
| #18 | KIkimi-k2.7-code | — | |
| #19 | gemini-embedding-2-preview | ||
| #20 | ZAglm-5.1 | ||
| #21 | claude-haiku-4.5 | ||
| #22 | GRgrok-4.5 | — | |
| #23 | qwen3.6-plus | ||
| #24 | OBqwen3.6-35b-a3b | ||
| #25 | claude-sonnet-4.6 |
+17 weitere Modelle unter der Wertungsschwelle für diesen Zeitraum.
Wie genau das Community-Ranking unabhängigen externen Rankings folgt, gemessen an der Rangkorrelation nach Spearman (ρ) und Kendall (τ).
Das Arena Rating jedes Modells über die letzten 90 Tage, aus täglichen Momentaufnahmen. Ein Regressions-Badge weist auf einen anhaltenden Rückgang hin.
Worüber die Community spricht — Erwähnungsvolumen, 14-Tage-Dynamik und Stimmung. Nur als Kontext, niemals als Ranking-Signal.