AI 模型排行榜

基于 OrcaRouter 真实生产流量与社区 Battle Mode 投票排名 —— 而非厂商自报的基准测试。

基于真实流量测量
100.0%
最高成功率(7 天)
OpenAI: GPT-5 Mini
399 ms
最快 p50 延迟
DeepSeek: DeepSeek V3
80.1%
最高社区胜率
Qwen3.7 Max (2026-05-20)

总榜 —— 社区胜率

盲测 Battle Mode 投票,使用 Bradley–Terry(Elo)模型排名。圆点表示评分,横条表示 95% 置信区间。同一区间内的模型在统计上持平。

风格校正
即将推出 — 需要更多对战数据

⚔️ 盲测对战

两个匿名模型回答同一个提示词。读完两边再投票,然后揭晓各自是谁——你的投票会计入上方榜单。

排名模型竞技场评分方法票数胜·负·平
#1Qwen3.7 Max (2026-05-20)1746±140
盲测 · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
盲测 · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
盲测 · BT
281158·111·12
OpenAI: GPT-5.51521±81
盲测 · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
盲测 · BT
310149·149·12
Qwen3.7 Max1519±125
盲测 · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
盲测 · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
盲测 · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
盲测 · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
盲测 · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
盲测 · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
盲测 · BT
224119·93·12
MiniMax: MiniMax M31300±59
盲测 · BT
265127·126·12
Google: Gemma 4 31B1300±58
盲测 · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
盲测 · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
盲测 · BT
213100·101·12
Z.ai: GLM 5.21298±67
盲测 · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
盲测 · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
盲测 · BT
281151·118·12
OpenAI: GPT-5.41078±73
盲测 · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
盲测 · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
盲测 · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
盲测 · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
盲测 · BT
248118·118·12
Z.ai: GLM 5.11076±78
盲测 · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
盲测 · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
盲测 · BT
18871·105·12
#28Gemini 3.5 Flash852±123
盲测 · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
盲测 · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
盲测 · BT
12861·61·6

正面对战

Battle Mode 两两对战胜率——每个模型与各个对手正面交锋的获胜频率。

分类领先者

各项能力——编程、数学、推理等——上最强的模型,并附上相对全场中位数的逐项能力剖面。

基准评测——智能水平与价格

将独立的智能评分与输入价格作图。虚线为价格/智能的帕累托前沿。

可靠性与成本

基于过去 7 天 OrcaRouter 生产流量测量。

模型
成功率(7 天)
p50
p99
错误率
$/百万(输入→输出)
tok/s
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
Qwen: Qwen3 Max100.0%3.91 s10.00 s
0.0%
$0.36 → $1.4364
OpenAI: GPT-5.2100.0%1.51 s8.31 s
0.0%
$1.75 → $14.00171
OpenAI: GPT-4.1 Nano100.0%1.36 s5.00 s
0.0%
$0.10 → $0.4099
qwen/qwen3.5-flash100.0%5.83 s10.00 s
0.0%
$0.10 → $0.40140
MiniMax M2.7 highspeed100.0%3.67 s3.67 s
0.0%
$0.60 → $2.4083
openai/gpt-5.2-2025-12-11100.0%2.50 s10.00 s
0.0%
$1.75 → $14.0074
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
OpenAI: GPT-4o (2024-05-13)100.0%3.13 s6.12 s
0.0%
$5.00 → $15.00122
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
Z.ai: GLM 4.6100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2042
openai/gpt-3.5-turbo-1106100.0%1.83 s4.15 s
0.0%
$1.00 → $2.00145
openai/gpt-4-turbo-2024-04-09100.0%7.00 s10.00 s
0.0%
$10.00 → $30.0028
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
openai/gpt-5.1-2025-11-13100.0%2.75 s4.19 s
0.0%
$1.25 → $10.0090
openai/gpt-3.5-turbo-0125100.0%10.00 s10.00 s
0.0%
$0.50 → $1.501512
openai/gpt-4.1-nano-2025-04-14100.0%1.57 s10.00 s
0.0%
$0.10 → $0.40131
openai/gpt-5-nano-2025-08-07100.0%10.00 s10.00 s
0.0%
$0.05 → $0.40650
Qwen3.7 Max100.0%3.89 s10.00 s
0.0%
$1.25 → $3.7556
DeepSeek: DeepSeek V3100.0%399 ms4.67 s
0.0%
$0.15 → $0.2958
openai/gpt-5.5-2026-04-23100.0%4.25 s10.00 s
0.0%
$10.00 → $45.00124
Qwen: Qwen3 VL 235B A22B Instruct100.0%10.00 s10.00 s
0.0%
$0.40 → $1.6074
grok/grok-4.3100.0%2.00 s3.33 s
0.0%
$1.25 → $2.50115
kimi/kimi-k2.5100.0%5.53 s10.00 s
0.0%
$0.60 → $3.0054
kimi/kimi-k2.6100.0%3.92 s10.00 s
0.0%
$0.95 → $4.0036
显示第 1 条-第 25 条,共 133 条

流量 — 生产流量

哪些模型真正承载着 OrcaRouter 的生产流量,按所选时间窗口内的 token 吞吐量排名。

流量排行榜正在预热

本期到目前为止,我们已统计到 — 个模型。当积累足够流量、能够公平地为模型排名时,流量排行榜便会解锁。

已统计模型数

在此期间,上方的总榜和可靠性榜已经上线。

验证 —— 与外部排名的一致性

社区排名与独立外部排名的吻合程度,以 Spearman ρ 和 Kendall τ 秩相关系数衡量。

热议 — 人气与口碑

社区正在讨论的话题 — 提及量、14 天热度走势与口碑情绪。仅作参考,绝不作为排名依据。