AI 모델 리더보드

OrcaRouter의 실제 운영 트래픽과 커뮤니티 Battle Mode 투표를 기준으로 순위를 매깁니다. 공급업체가 발표한 벤치마크가 아닙니다.

실제 트래픽으로 측정
100.0%
최고 성공률(7일)
openai/gpt-5.4-2026-03-05
399 ms
가장 빠른 p50 지연 시간
DeepSeek: DeepSeek V3
80.1%
최고 커뮤니티 승률
Qwen3.7 Max (2026-05-20)

종합 — 커뮤니티 승률

블라인드 Battle Mode 투표를 Bradley–Terry(Elo) 모델로 순위화합니다. 점은 레이팅을, 막대는 95% 신뢰 구간을 나타냅니다. 같은 구간 내 모델은 통계적으로 동률입니다.

스타일 보정
곧 제공 — 더 많은 대결 데이터 필요

⚔️ 블라인드 대결

두 익명 모델이 같은 프롬프트에 답합니다. 둘 다 읽고 승자에게 투표한 뒤 누가 무엇을 썼는지 확인하세요. 투표는 위 순위에 반영됩니다.

순위모델아레나 레이팅방식투표 수승·패·무
#1Qwen3.7 Max (2026-05-20)1746±140
블라인드 · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
블라인드 · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
블라인드 · BT
281158·111·12
OpenAI: GPT-5.51521±81
블라인드 · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
블라인드 · BT
310149·149·12
Qwen3.7 Max1519±125
블라인드 · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
블라인드 · BT
247117·117·13
Qwen3.6 35B A3B Uncensored (Aggressive)1518±91
블라인드 · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
블라인드 · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
블라인드 · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
블라인드 · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
블라인드 · BT
224119·93·12
MiniMax: MiniMax M31300±59
블라인드 · BT
265127·126·12
Google: Gemma 4 31B1300±58
블라인드 · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
블라인드 · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
블라인드 · BT
213100·101·12
Z.ai: GLM 5.21298±67
블라인드 · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
블라인드 · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
블라인드 · BT
281151·118·12
OpenAI: GPT-5.41078±73
블라인드 · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
블라인드 · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
블라인드 · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
블라인드 · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
블라인드 · BT
248118·118·12
Z.ai: GLM 5.11076±78
블라인드 · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
블라인드 · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
블라인드 · BT
18871·105·12
#28Gemini 3.5 Flash852±123
블라인드 · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
블라인드 · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
블라인드 · BT
12861·61·6

맞대결

Battle Mode 1:1 승률 — 각 모델이 맞대결에서 각 상대를 이기는 빈도입니다.

카테고리 선두

코딩, 수학, 추론 등 각 역량에서 가장 강한 모델을, 전체 중앙값 대비 축별 프로필과 함께 보여 줍니다.

벤치마크 — 지능 대 가격

독립적인 지능 점수를 입력 가격에 대해 표시했습니다. 점선은 가격/지능 파레토 경계입니다.

신뢰성 및 비용

최근 7일간 OrcaRouter 운영 트래픽으로 측정.

모델
성공률(7일)
p50
p99
오류율
$/100만(입력→출력)
tok/s
openai/gpt-5.4-2026-03-05100.0%1.40 s2.18 s
0.0%
$5.00 → $22.50196
qwen/qwen3.5-flash100.0%5.83 s10.00 s
0.0%
$0.10 → $0.40140
openai/gpt-5-nano-2025-08-07100.0%10.00 s10.00 s
0.0%
$0.05 → $0.40650
tencent/Hunyuan-A13B-Instruct100.0%1.24 s1.24 s
0.0%
$0.14 → $0.57
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.00103
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
Qwen: Qwen3 VL 8B Instruct100.0%6.00 s10.00 s
0.0%
$0.18 → $0.7071
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
openai/gpt-5.5-pro-2026-04-23100.0%1.44 s2.11 s
0.0%
$60.00 → $270.0015
Qwen: Qwen3 VL 8B Thinking100.0%7.50 s10.00 s
0.0%
$0.18 → $2.1067
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25161
qwen/qwen3.6-flash-2026-04-16100.0%3.80 s10.00 s
0.0%
$0.25 → $1.50134
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Qwen3.7 Max (2026-05-20)100.0%28.13 s28.13 s
0.0%
$1.25 → $3.7512765
qwen/qwen3.5-plus-2026-02-15100.0%4.08 s10.00 s
0.0%
$0.12 → $0.6955
OpenAI: GPT-4.1 Mini100.0%1.83 s10.00 s
0.0%
$0.40 → $1.6092
openai/gpt-5.1-chat-latest100.0%2.38 s3.50 s
0.0%
$1.25 → $10.00110
OpenAI: GPT-5.3-Codex100.0%1.10 s2.89 s
0.0%
$1.75 → $14.0062
OpenAI: GPT-4o (2024-05-13)100.0%3.13 s6.12 s
0.0%
$5.00 → $15.00122
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
tencent/Hy3-preview100.0%1.77 s1.77 s
0.0%
$75.00 → $75.00
133 중 1-25

볼륨 — 프로덕션 트래픽

어떤 모델이 실제로 OrcaRouter 프로덕션 트래픽을 담당하는지를 선택한 기간의 토큰 처리량 기준으로 순위 매깁니다.

볼륨 순위를 준비하는 중입니다

이번 기간 동안 지금까지 —개 모델을 확인했습니다. 모델을 공정하게 순위 매길 만큼 트래픽이 쌓이면 볼륨 순위가 공개됩니다.

확인된 모델 수

그동안 위의 종합 및 신뢰성 보드는 이미 운영 중입니다.

검증 — 외부 순위와의 일치도

커뮤니티 순위가 독립적인 외부 순위를 얼마나 따라가는지를 Spearman의 ρ와 Kendall의 τ 순위 상관으로 측정합니다.

화제 — 인기 및 평판

커뮤니티에서 이야기되고 있는 주제 — 언급량, 14일간 추세, 평판 분위기. 참고용일 뿐 순위 지표로는 절대 사용되지 않습니다.