AI モデルリーダーボード

OrcaRouter の実運用トラフィックとコミュニティの Battle Mode 投票に基づくランキング — ベンダー公称のベンチマークではありません。

実トラフィックで計測
100.0%
最高成功率(7日間)
OpenAI: GPT-5
399 ms
最速 p50 レイテンシ
DeepSeek: DeepSeek V3
80.1%
最高のコミュニティ勝率
Qwen3.7 Max (2026-05-20)

総合 — コミュニティ勝率

ブラインド Battle Mode の投票を Bradley–Terry(Elo)モデルで順位付け。点はレーティング、バーは 95% 信頼区間を示します。同じ帯内のモデルは統計的に同等です。

スタイル補正
近日公開 — 対戦データがさらに必要です

⚔️ ブラインドバトル

2つの匿名モデルが同じプロンプトに回答します。両方を読んで勝者に投票し、どちらがどのモデルかを確認しましょう。あなたの投票は上のランキングに反映されます。

順位モデルアリーナレーティング手法票数勝·敗·分
#1Qwen3.7 Max (2026-05-20)1746±140
ブラインド · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
ブラインド · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
ブラインド · BT
281158·111·12
OpenAI: GPT-5.51521±81
ブラインド · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
ブラインド · BT
310149·149·12
Qwen3.7 Max1519±125
ブラインド · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
ブラインド · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
ブラインド · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
ブラインド · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
ブラインド · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
ブラインド · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
ブラインド · BT
224119·93·12
MiniMax: MiniMax M31300±59
ブラインド · BT
265127·126·12
Google: Gemma 4 31B1300±58
ブラインド · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
ブラインド · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
ブラインド · BT
213100·101·12
Z.ai: GLM 5.21298±67
ブラインド · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
ブラインド · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
ブラインド · BT
281151·118·12
OpenAI: GPT-5.41078±73
ブラインド · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
ブラインド · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
ブラインド · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
ブラインド · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
ブラインド · BT
248118·118·12
Z.ai: GLM 5.11076±78
ブラインド · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
ブラインド · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
ブラインド · BT
18871·105·12
#28Gemini 3.5 Flash852±123
ブラインド · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
ブラインド · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
ブラインド · BT
12861·61·6

直接対決

Battle Mode の総当たり勝率——各モデルが直接対決で各ライバルに勝つ頻度です。

カテゴリ別リーダー

コーディング、数学、推論など各能力で最も強いモデルを、全体の中央値に対する軸ごとのプロファイルとともに示します。

ベンチマーク——知能と価格

独立した知能スコアを入力価格に対してプロットしています。破線は価格と知能のパレートフロンティアです。

信頼性とコスト

過去 7 日間の OrcaRouter 実運用トラフィックで計測。

モデル
成功率(7日間)
p50
p99
エラー率
$/100万(入力→出力)
tok/s
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
OpenAI: GPT-5.1100.0%2.43 s4.63 s
0.0%
$1.25 → $10.00109
Qwen: Qwen3 VL 235B A22B Instruct100.0%10.00 s10.00 s
0.0%
$0.40 → $1.6074
openai/gpt-5-2025-08-07100.0%10.00 s10.00 s
0.0%
$1.25 → $10.00363
Qwen: Qwen3 VL 8B Instruct100.0%6.00 s10.00 s
0.0%
$0.18 → $0.7071
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
tencent/Hy3-preview100.0%1.77 s1.77 s
0.0%
$75.00 → $75.00
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
openai/gpt-5.1-chat-latest100.0%2.38 s3.50 s
0.0%
$1.25 → $10.00110
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
OpenAI: GPT-4.1 Mini100.0%1.83 s10.00 s
0.0%
$0.40 → $1.6092
OpenAI: GPT-4o-mini100.0%640 ms7.86 s
0.0%
$0.15 → $0.6069
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
qwen/qwen3.5-flash-2026-02-23100.0%5.00 s10.00 s
0.0%
$0.10 → $0.40145
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.0070
Qwen: Qwen3.6 Plus100.0%4.09 s9.16 s
0.0%
$0.50 → $3.0054
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25162
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
OpenAI: GPT-5 Codex100.0%875 ms7.35 s
0.0%
$1.25 → $10.00129
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
OpenAI: GPT-5.2-Codex100.0%750 ms1.48 s
0.0%
$1.75 → $14.00101
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
google/gemini-3.1-flash-lite100.0%989 ms4.91 s
0.0%
$0.25 → $1.50287
kimi/kimi-k2.6100.0%3.92 s10.00 s
0.0%
$0.95 → $4.0036
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
133件のうち、1~25件目を表示しています

ボリューム — 本番トラフィック

OrcaRouter の本番トラフィックを実際に担っているモデルを、選択した期間のトークンスループットで順位付けします。

順位モデルシェアトレンド
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-plus
#12gemini-3.5-flash
#13qwen3.7-max
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22qwen3.6-plus
#23qwen3.6-35b-a3b
#24claude-sonnet-4.6
#25gemini-2.5-flash
141件のうち、1~25件目を表示しています

この期間のランキングしきい値を下回るモデルがさらに 17 件あります。

検証 — 外部ランキングとの一致度

コミュニティのランキングが独立した外部ランキングをどれだけ追従しているかを、Spearman の ρ と Kendall の τ 順位相関で測定します。

話題 — 人気とセンチメント

コミュニティで話題になっていること — 言及数、14 日間の勢い、センチメント。参考情報のみで、ランキングの指標には一切なりません。