Papan Peringkat Model AI

Diperingkat berdasarkan lalu lintas produksi nyata OrcaRouter dan suara komunitas di Battle Mode — bukan tolok ukur yang dilaporkan vendor.

Diukur pada lalu lintas nyata
100.0%
Tingkat keberhasilan tertinggi (7 hari)
openai/gpt-5.5-pro-2026-04-23
399 ms
Latensi p50 tercepat
DeepSeek: DeepSeek V3
80.1%
Tingkat kemenangan komunitas tertinggi
Qwen3.7 Max (2026-05-20)

Keseluruhan — tingkat kemenangan komunitas

Suara Battle Mode buta, diperingkat dengan model Bradley–Terry (Elo). Titik menunjukkan skor; batang menunjukkan interval kepercayaan 95%. Model dalam satu pita setara secara statistik.

Kontrol gaya
Segera hadir — butuh lebih banyak data duel

⚔️ Duel Buta

Dua model anonim menjawab prompt yang sama. Baca keduanya, pilih pemenangnya, lalu lihat siapa menulis apa — suaramu memengaruhi peringkat di atas.

PeringkatModelPeringkat ArenaMetodeSuaraM·K·S
#1Qwen3.7 Max (2026-05-20)1746±140
buta · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
buta · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
buta · BT
281158·111·12
OpenAI: GPT-5.51521±81
buta · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
buta · BT
310149·149·12
Qwen3.7 Max1519±125
buta · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
buta · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
buta · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
buta · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
buta · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
buta · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
buta · BT
224119·93·12
MiniMax: MiniMax M31300±59
buta · BT
265127·126·12
Google: Gemma 4 31B1300±58
buta · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
buta · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
buta · BT
213100·101·12
Z.ai: GLM 5.21298±67
buta · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
buta · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
buta · BT
281151·118·12
OpenAI: GPT-5.41078±73
buta · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
buta · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
buta · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
buta · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
buta · BT
248118·118·12
Z.ai: GLM 5.11076±78
buta · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
buta · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
buta · BT
18871·105·12
#28Gemini 3.5 Flash852±123
buta · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
buta · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
buta · BT
12861·61·6

Duel langsung

Tingkat kemenangan berpasangan di Battle Mode — seberapa sering setiap model mengalahkan tiap lawan secara langsung.

Pemimpin kategori

Model terkuat di setiap kemampuan — pengodean, matematika, penalaran, dan lainnya — dengan profil per sumbu terhadap median lapangan.

Tolok ukur — kecerdasan vs harga

Skor kecerdasan independen diplot terhadap harga input. Garis putus-putus adalah frontier Pareto harga/kecerdasan.

Keandalan & biaya

Diukur pada lalu lintas produksi OrcaRouter selama 7 hari terakhir.

Model
Berhasil % (7 hari)
p50
p99
Galat %
$/Jt (masuk→keluar)
tok/s
openai/gpt-5.5-pro-2026-04-23100.0%1.44 s2.11 s
0.0%
$60.00 → $270.0015
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
grok/grok-imagine-image100.0%4.76 s4.76 s
0.0%
— → —
MiniMax M2.5 highspeed100.0%2.12 s2.12 s
0.0%
$0.60 → $2.40
openai/gpt-5.2-2025-12-11100.0%2.50 s10.00 s
0.0%
$1.75 → $14.0074
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
openai/gpt-5.4-mini-2026-03-17100.0%2.00 s4.99 s
0.0%
$0.75 → $4.50174
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Qwen: Qwen3.6 Flash100.0%3.85 s10.00 s
0.0%
$0.25 → $1.50303
google/gemini-3.1-flash-lite100.0%986 ms4.90 s
0.0%
$0.25 → $1.50285
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
Qwen: Qwen3.6 35B A3B100.0%4.54 s10.00 s
0.0%
$0.25 → $1.49205
DeepSeek: DeepSeek V3100.0%399 ms4.67 s
0.0%
$0.15 → $0.2958
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
openai/gpt-5.5-2026-04-23100.0%4.25 s10.00 s
0.0%
$10.00 → $45.00124
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
openai/gpt-4-turbo-2024-04-09100.0%7.00 s10.00 s
0.0%
$10.00 → $30.0028
OpenAI: GPT-4.1100.0%2.60 s5.46 s
0.0%
$2.00 → $8.0091
OpenAI: GPT-5 Codex100.0%875 ms7.35 s
0.0%
$1.25 → $10.00129
kimi/kimi-k2.6100.0%3.92 s10.00 s
0.0%
$0.95 → $4.0036
Menampilkan 1-25 dari 133

Volume — lalu lintas produksi

Model mana yang benar-benar mengemban lalu lintas produksi OrcaRouter, diperingkat berdasarkan throughput token pada rentang terpilih.

Peringkat volume sedang dipanaskan

Pada periode ini kami telah melihat — model sejauh ini. Peringkat volume terbuka setelah lalu lintas cukup terkumpul untuk memeringkat model secara adil.

Model yang terlihat

Sementara itu, papan Keseluruhan dan Keandalan di atas sudah aktif.

Validasi — kesesuaian dengan peringkat eksternal

Seberapa dekat peringkat komunitas mengikuti peringkat eksternal independen, diukur dengan korelasi peringkat Spearman ρ dan Kendall τ.

Perbincangan — popularitas & sentimen

Apa yang sedang dibicarakan komunitas — volume penyebutan, momentum 14 hari, dan sentimen. Hanya konteks, bukan sinyal peringkat.