AI 模型排行榜

基於 OrcaRouter 真實生產流量與社群 Battle Mode 投票排名 —— 而非廠商自報的基準測試。

基於真實流量測量
100.0%
最高成功率(7 天)
openai/gpt-4.1-2025-04-14
399 ms
最快 p50 延遲
DeepSeek: DeepSeek V3
80.1%
最高社群勝率
Qwen3.7 Max (2026-05-20)

總榜 —— 社群勝率

盲測 Battle Mode 投票,採用 Bradley–Terry(Elo)模型排名。圓點表示評分,橫條表示 95% 信賴區間。同一區間內的模型在統計上持平。

風格校正
即將推出 — 需要更多對戰資料

⚔️ 盲測對戰

兩個匿名模型回答同一個提示詞。讀完兩邊再投票,接著揭曉各自是誰——你的投票會計入上方排行榜。

排名模型競技場評分方法票數勝·負·平
#1Qwen3.7 Max (2026-05-20)1746±140
盲測 · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
盲測 · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
盲測 · BT
281158·111·12
OpenAI: GPT-5.51521±81
盲測 · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
盲測 · BT
310149·149·12
Qwen3.7 Max1519±125
盲測 · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
盲測 · BT
247117·117·13
Qwen3.6 35B A3B Uncensored (Aggressive)1518±91
盲測 · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
盲測 · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
盲測 · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
盲測 · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
盲測 · BT
224119·93·12
MiniMax: MiniMax M31300±59
盲測 · BT
265127·126·12
Google: Gemma 4 31B1300±58
盲測 · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
盲測 · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
盲測 · BT
213100·101·12
Z.ai: GLM 5.21298±67
盲測 · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
盲測 · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
盲測 · BT
281151·118·12
OpenAI: GPT-5.41078±73
盲測 · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
盲測 · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
盲測 · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
盲測 · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
盲測 · BT
248118·118·12
Z.ai: GLM 5.11076±78
盲測 · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
盲測 · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
盲測 · BT
18871·105·12
#28Gemini 3.5 Flash852±123
盲測 · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
盲測 · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
盲測 · BT
12861·61·6

正面對戰

Battle Mode 兩兩對戰勝率——每個模型與各個對手正面交鋒的獲勝頻率。

分類領先者

各項能力——程式設計、數學、推理等——上最強的模型,並附上相對全場中位數的逐項能力剖面。

基準評測——智慧水準與價格

將獨立的智慧評分與輸入價格作圖。虛線為價格/智慧的帕累托前緣。

可靠性與成本

基於過去 7 天 OrcaRouter 生產流量測量。

模型
成功率(7 天)
p50
p99
錯誤率
$/百萬(輸入→輸出)
tok/s
openai/gpt-4.1-2025-04-14100.0%3.67 s7.44 s
0.0%
$2.00 → $8.0087
openai/gpt-5-2025-08-07100.0%10.00 s10.00 s
0.0%
$1.25 → $10.00363
tencent/Hunyuan-A13B-Instruct100.0%1.24 s1.24 s
0.0%
$0.14 → $0.57
kimi/kimi-k2.5100.0%5.53 s10.00 s
0.0%
$0.60 → $3.0054
MiniMax: MiniMax M2.7100.0%1.28 s10.00 s
0.0%
$0.30 → $1.2082
openai/gpt-4.1-nano-2025-04-14100.0%1.57 s10.00 s
0.0%
$0.10 → $0.40131
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
openai/gpt-4-turbo-2024-04-09100.0%7.00 s10.00 s
0.0%
$10.00 → $30.0027
OpenAI: GPT-5.1100.0%2.43 s4.63 s
0.0%
$1.25 → $10.00109
Qwen3.7 Max100.0%3.90 s10.00 s
0.0%
$1.25 → $3.7555
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
grok/grok-imagine-image100.0%4.76 s4.76 s
0.0%
— → —
openai/gpt-5.1-2025-11-13100.0%2.75 s4.19 s
0.0%
$1.25 → $10.0090
Z.ai: GLM 4.5100.0%4.25 s10.00 s
0.0%
$0.60 → $2.2058
MiniMax: MiniMax M2.5100.0%3.50 s4.63 s
0.0%
$0.30 → $1.20100
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.0070
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
grok/grok-4.3100.0%2.00 s3.33 s
0.0%
$1.25 → $2.50115
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
openai/gpt-5.5-2026-04-23100.0%4.25 s10.00 s
0.0%
$10.00 → $45.00124
qwen/qwen3-max-preview100.0%10.00 s10.00 s
0.0%
$0.86 → $3.4486
MiniMax M2.7 highspeed100.0%3.67 s3.67 s
0.0%
$0.60 → $2.4083
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
Qwen: Qwen3 VL 235B A22B Thinking100.0%8.00 s10.00 s
0.0%
$0.40 → $4.0035
Qwen: Qwen3 VL 8B Thinking100.0%7.50 s10.00 s
0.0%
$0.18 → $2.1067
显示第 1 条-第 25 条,共 133 条

流量 — 生產流量

哪些模型真正承載著 OrcaRouter 的生產流量,依所選時間窗口內的 token 吞吐量排名。

排名模型佔比趨勢
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22qwen3.6-plus
#23qwen3.6-35b-a3b
#24claude-sonnet-4.6
#25gemini-2.5-flash
显示第 1 条-第 25 条,共 141 条

另有 17 個模型低於此窗口的排名門檻。

驗證 —— 與外部排名的一致性

社群排名與獨立外部排名的吻合程度,以 Spearman ρ 和 Kendall τ 秩相關係數衡量。

熱議 — 人氣與口碑

社群正在討論的話題 — 提及量、14 天熱度走勢與口碑情緒。僅供參考,絕不作為排名依據。