Diperingkat berdasarkan lalu lintas produksi nyata OrcaRouter dan suara komunitas di Battle Mode — bukan tolok ukur yang dilaporkan vendor.
Suara Battle Mode buta, diperingkat dengan model Bradley–Terry (Elo). Titik menunjukkan skor; batang menunjukkan interval kepercayaan 95%. Model dalam satu pita setara secara statistik.
Dua model anonim menjawab prompt yang sama. Baca keduanya, pilih pemenangnya, lalu lihat siapa menulis apa — suaramu memengaruhi peringkat di atas.
| Peringkat | Model | Peringkat Arena | Metode | Suara | M·K·S |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | buta · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | buta · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | buta · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | buta · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | buta · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | buta · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | buta · BT | 247 | 117·117·13 | ||
| Qwen: Qwen3.6 35B A3B | buta · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | buta · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | buta · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | buta · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | buta · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | buta · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | buta · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | buta · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | buta · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | buta · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | buta · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | buta · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | buta · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | buta · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | buta · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | buta · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | buta · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | buta · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | buta · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | buta · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | buta · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | buta · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | buta · BT | 128 | 61·61·6 |
Tingkat kemenangan berpasangan di Battle Mode — seberapa sering setiap model mengalahkan tiap lawan secara langsung.
Model terkuat di setiap kemampuan — pengodean, matematika, penalaran, dan lainnya — dengan profil per sumbu terhadap median lapangan.
Skor kecerdasan independen diplot terhadap harga input. Garis putus-putus adalah frontier Pareto harga/kecerdasan.
Diukur pada lalu lintas produksi OrcaRouter selama 7 hari terakhir.
| Model | Berhasil % (7 hari) | p50 | p99 | Galat % | $/Jt (masuk→keluar) | tok/s |
|---|---|---|---|---|---|---|
| openai/gpt-5.5-pro-2026-04-23 | 100.0% | 1.44 s | 2.11 s | 0.0% | $60.00 → $270.00 | 15 |
| Anthropic: Claude Opus 4.6 | 100.0% | 7.32 s | 10.00 s | 0.0% | $5.00 → $25.00 | 63 |
| GRgrok/grok-imagine-image | 100.0% | 4.76 s | 4.76 s | 0.0% | — → — | — |
| MIMiniMax M2.5 highspeed | 100.0% | 2.12 s | 2.12 s | 0.0% | $0.60 → $2.40 | — |
| openai/gpt-5.2-2025-12-11 | 100.0% | 2.50 s | 10.00 s | 0.0% | $1.75 → $14.00 | 74 |
| qwen/qwen3.6-plus-2026-04-02 | 100.0% | 4.18 s | 7.86 s | 0.0% | $0.28 → $1.65 | 56 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| openai/gpt-5.4-mini-2026-03-17 | 100.0% | 2.00 s | 4.99 s | 0.0% | $0.75 → $4.50 | 174 |
| Qwen: Qwen3.5-27B | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.09 → $0.69 | 50 |
| openai/gpt-4o-mini-search-preview-2025-03-11 | 100.0% | 5.19 s | 5.19 s | 0.0% | $0.15 → $0.60 | — |
| OpenAI: GPT-5 Mini | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.25 → $2.00 | 189 |
| openai/gpt-5.4-nano-2026-03-17 | 100.0% | 1.55 s | 3.30 s | 0.0% | $0.20 → $1.25 | 157 |
| Qwen: Qwen3.6 Flash | 100.0% | 3.85 s | 10.00 s | 0.0% | $0.25 → $1.50 | 303 |
| google/gemini-3.1-flash-lite | 100.0% | 986 ms | 4.90 s | 0.0% | $0.25 → $1.50 | 285 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| Qwen: Qwen3.6 35B A3B | 100.0% | 4.54 s | 10.00 s | 0.0% | $0.25 → $1.49 | 205 |
| DEDeepSeek: DeepSeek V3 | 100.0% | 399 ms | 4.67 s | 0.0% | $0.15 → $0.29 | 58 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| openai/gpt-5.5-2026-04-23 | 100.0% | 4.25 s | 10.00 s | 0.0% | $10.00 → $45.00 | 124 |
| ZAZ.ai: GLM 5 | 100.0% | 7.50 s | 10.00 s | 0.0% | $1.00 → $3.20 | 51 |
| OpenAI: GPT-4 Turbo | 100.0% | 5.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 24 |
| openai/gpt-4-turbo-2024-04-09 | 100.0% | 7.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 28 |
| OpenAI: GPT-4.1 | 100.0% | 2.60 s | 5.46 s | 0.0% | $2.00 → $8.00 | 91 |
| OpenAI: GPT-5 Codex | 100.0% | 875 ms | 7.35 s | 0.0% | $1.25 → $10.00 | 129 |
| KIkimi/kimi-k2.6 | 100.0% | 3.92 s | 10.00 s | 0.0% | $0.95 → $4.00 | 36 |
Model mana yang benar-benar mengemban lalu lintas produksi OrcaRouter, diperingkat berdasarkan throughput token pada rentang terpilih.
Pada periode ini kami telah melihat — model sejauh ini. Peringkat volume terbuka setelah lalu lintas cukup terkumpul untuk memeringkat model secara adil.
Sementara itu, papan Keseluruhan dan Keandalan di atas sudah aktif.
Seberapa dekat peringkat komunitas mengikuti peringkat eksternal independen, diukur dengan korelasi peringkat Spearman ρ dan Kendall τ.
Arena Rating setiap model selama 90 hari terakhir, dari snapshot harian. Lencana regresi menandai penurunan yang berkelanjutan.
Apa yang sedang dibicarakan komunitas — volume penyebutan, momentum 14 hari, dan sentimen. Hanya konteks, bukan sinyal peringkat.