Bảng xếp hạng mô hình AI

Xếp hạng dựa trên lưu lượng sản xuất thực tế của OrcaRouter và phiếu bầu cộng đồng trong Battle Mode — không phải benchmark do nhà cung cấp công bố.

Đo trên lưu lượng thực tế
100.0%
Tỷ lệ thành công cao nhất (7 ngày)
OpenAI: GPT-4o (2024-08-06)
399 ms
Độ trễ p50 nhanh nhất
DeepSeek: DeepSeek V3
80.1%
Tỷ lệ thắng cộng đồng cao nhất
Qwen3.7 Max (2026-05-20)

Tổng thể — tỷ lệ thắng cộng đồng

Phiếu bầu Battle Mode ẩn danh, xếp hạng bằng mô hình Bradley–Terry (Elo). Chấm thể hiện điểm xếp hạng; thanh thể hiện khoảng tin cậy 95%. Các mô hình trong cùng một dải là ngang bằng về mặt thống kê.

Kiểm soát phong cách
Sắp ra mắt — cần thêm dữ liệu đối đầu

⚔️ Đấu trường ẩn danh

Hai mô hình ẩn danh trả lời cùng một câu lệnh. Đọc cả hai, bình chọn người thắng, rồi xem ai đã viết gì — phiếu bầu của bạn được tính vào bảng xếp hạng phía trên.

HạngMô hìnhĐiểm đấu trườngPhương phápPhiếuT·B·H
#1Qwen3.7 Max (2026-05-20)1746±140
ẩn danh · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
ẩn danh · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
ẩn danh · BT
281158·111·12
OpenAI: GPT-5.51521±81
ẩn danh · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
ẩn danh · BT
310149·149·12
Qwen3.7 Max1519±125
ẩn danh · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
ẩn danh · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
ẩn danh · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
ẩn danh · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
ẩn danh · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
ẩn danh · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
ẩn danh · BT
224119·93·12
MiniMax: MiniMax M31300±59
ẩn danh · BT
265127·126·12
Google: Gemma 4 31B1300±58
ẩn danh · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
ẩn danh · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
ẩn danh · BT
213100·101·12
Z.ai: GLM 5.21298±67
ẩn danh · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
ẩn danh · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
ẩn danh · BT
281151·118·12
OpenAI: GPT-5.41078±73
ẩn danh · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
ẩn danh · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
ẩn danh · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
ẩn danh · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
ẩn danh · BT
248118·118·12
Z.ai: GLM 5.11076±78
ẩn danh · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
ẩn danh · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
ẩn danh · BT
18871·105·12
#28Gemini 3.5 Flash852±123
ẩn danh · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
ẩn danh · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
ẩn danh · BT
12861·61·6

Đối đầu trực tiếp

Tỷ lệ thắng từng cặp trong Battle Mode — mỗi mô hình thắng từng đối thủ trong đối đầu trực tiếp thường xuyên đến mức nào.

Mô hình dẫn đầu theo danh mục

Mô hình mạnh nhất ở từng năng lực — lập trình, toán học, suy luận và hơn thế nữa — với hồ sơ theo từng trục so với trung vị của nhóm.

Điểm chuẩn — trí tuệ so với giá

Điểm trí tuệ độc lập được vẽ theo giá đầu vào. Đường nét đứt là biên Pareto giá/trí tuệ.

Độ tin cậy & chi phí

Đo trên lưu lượng sản xuất OrcaRouter trong 7 ngày qua.

Mô hình
Thành công % (7 ngày)
p50
p99
Lỗi %
$/1Tr (vào→ra)
tok/s
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25162
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-5.2-Codex100.0%750 ms1.48 s
0.0%
$1.75 → $14.00101
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Z.ai: GLM 4.7100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2037
openai/gpt-3.5-turbo-1106100.0%1.83 s4.15 s
0.0%
$1.00 → $2.00143
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
openai/gpt-5.4-mini-2026-03-17100.0%2.00 s4.99 s
0.0%
$0.75 → $4.50174
Qwen: Qwen3 VL 235B A22B Thinking100.0%8.00 s10.00 s
0.0%
$0.40 → $4.0035
Z.ai: GLM 4.6100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2042
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
MiniMax: MiniMax M2.7100.0%1.28 s10.00 s
0.0%
$0.30 → $1.2082
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
OpenAI: GPT-4o-mini100.0%644 ms8.50 s
0.0%
$0.15 → $0.6068
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
Hiển thị 1 đến 25 trong tổng số 133

Lưu lượng — lưu lượng sản xuất

Những mô hình nào thực sự gánh lưu lượng sản xuất của OrcaRouter, xếp hạng theo thông lượng token trong khoảng thời gian đã chọn.

Bảng xếp hạng lưu lượng đang khởi động

Trong kỳ này chúng tôi đã thấy — mô hình. Bảng xếp hạng lưu lượng sẽ mở khi tích lũy đủ lưu lượng để xếp hạng mô hình một cách công bằng.

Số mô hình đã thấy

Trong khi đó, bảng Tổng thể và Độ tin cậy ở trên đã hoạt động.

Xác thực — mức độ đồng thuận với các bảng xếp hạng bên ngoài

Mức độ bám sát của bảng xếp hạng cộng đồng so với các bảng xếp hạng bên ngoài độc lập, đo bằng tương quan thứ hạng Spearman ρ và Kendall τ.

Bàn luận — mức độ phổ biến và cảm xúc

Điều cộng đồng đang bàn tán — số lượt nhắc đến, đà tăng trong 14 ngày và cảm xúc. Chỉ là bối cảnh, không bao giờ là tín hiệu xếp hạng.