OrcaRouter의 실제 운영 트래픽과 커뮤니티 Battle Mode 투표를 기준으로 순위를 매깁니다. 공급업체가 발표한 벤치마크가 아닙니다.
블라인드 Battle Mode 투표를 Bradley–Terry(Elo) 모델로 순위화합니다. 점은 레이팅을, 막대는 95% 신뢰 구간을 나타냅니다. 같은 구간 내 모델은 통계적으로 동률입니다.
두 익명 모델이 같은 프롬프트에 답합니다. 둘 다 읽고 승자에게 투표한 뒤 누가 무엇을 썼는지 확인하세요. 투표는 위 순위에 반영됩니다.
| 순위 | 모델 | 아레나 레이팅 | 방식 | 투표 수 | 승·패·무 |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | 블라인드 · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | 블라인드 · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | 블라인드 · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | 블라인드 · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | 블라인드 · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | 블라인드 · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | 블라인드 · BT | 247 | 117·117·13 | ||
| OBQwen3.6 35B A3B Uncensored (Aggressive) | 블라인드 · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | 블라인드 · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | 블라인드 · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | 블라인드 · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | 블라인드 · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | 블라인드 · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | 블라인드 · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | 블라인드 · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | 블라인드 · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | 블라인드 · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | 블라인드 · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | 블라인드 · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | 블라인드 · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | 블라인드 · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | 블라인드 · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | 블라인드 · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | 블라인드 · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | 블라인드 · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | 블라인드 · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | 블라인드 · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | 블라인드 · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | 블라인드 · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | 블라인드 · BT | 128 | 61·61·6 |
Battle Mode 1:1 승률 — 각 모델이 맞대결에서 각 상대를 이기는 빈도입니다.
코딩, 수학, 추론 등 각 역량에서 가장 강한 모델을, 전체 중앙값 대비 축별 프로필과 함께 보여 줍니다.
독립적인 지능 점수를 입력 가격에 대해 표시했습니다. 점선은 가격/지능 파레토 경계입니다.
최근 7일간 OrcaRouter 운영 트래픽으로 측정.
| 모델 | 성공률(7일) | p50 | p99 | 오류율 | $/100만(입력→출력) | tok/s |
|---|---|---|---|---|---|---|
| openai/gpt-5.4-2026-03-05 | 100.0% | 1.40 s | 2.18 s | 0.0% | $5.00 → $22.50 | 196 |
| qwen/qwen3.5-flash | 100.0% | 5.83 s | 10.00 s | 0.0% | $0.10 → $0.40 | 140 |
| openai/gpt-5-nano-2025-08-07 | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.05 → $0.40 | 650 |
| TEtencent/Hunyuan-A13B-Instruct | 100.0% | 1.24 s | 1.24 s | 0.0% | $0.14 → $0.57 | — |
| OpenAI: GPT-3.5 Turbo 16k | 100.0% | 5.00 s | 7.07 s | 0.0% | $3.00 → $4.00 | 103 |
| OpenAI: GPT-4o (2024-08-06) | 100.0% | 2.86 s | 5.72 s | 0.0% | $2.50 → $10.00 | 86 |
| Qwen: Qwen3 VL 8B Instruct | 100.0% | 6.00 s | 10.00 s | 0.0% | $0.18 → $0.70 | 71 |
| OpenAI: GPT-5 Nano | 100.0% | 4.31 s | 10.00 s | 0.0% | $0.05 → $0.40 | 835 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| openai/gpt-5-chat-latest | 100.0% | 2.00 s | 3.40 s | 0.0% | $1.25 → $10.00 | 135 |
| openai/gpt-5.5-pro-2026-04-23 | 100.0% | 1.44 s | 2.11 s | 0.0% | $60.00 → $270.00 | 15 |
| Qwen: Qwen3 VL 8B Thinking | 100.0% | 7.50 s | 10.00 s | 0.0% | $0.18 → $2.10 | 67 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| OpenAI: GPT-5.4 Nano | 100.0% | 1.35 s | 10.00 s | 0.0% | $0.20 → $1.25 | 161 |
| qwen/qwen3.6-flash-2026-04-16 | 100.0% | 3.80 s | 10.00 s | 0.0% | $0.25 → $1.50 | 134 |
| OpenAI: GPT-5.4 Pro | 100.0% | 2.67 s | 4.72 s | 0.0% | $60.00 → $270.00 | 6 |
| Qwen3.7 Max (2026-05-20) | 100.0% | 28.13 s | 28.13 s | 0.0% | $1.25 → $3.75 | 12765 |
| qwen/qwen3.5-plus-2026-02-15 | 100.0% | 4.08 s | 10.00 s | 0.0% | $0.12 → $0.69 | 55 |
| OpenAI: GPT-4.1 Mini | 100.0% | 1.83 s | 10.00 s | 0.0% | $0.40 → $1.60 | 92 |
| openai/gpt-5.1-chat-latest | 100.0% | 2.38 s | 3.50 s | 0.0% | $1.25 → $10.00 | 110 |
| OpenAI: GPT-5.3-Codex | 100.0% | 1.10 s | 2.89 s | 0.0% | $1.75 → $14.00 | 62 |
| OpenAI: GPT-4o (2024-05-13) | 100.0% | 3.13 s | 6.12 s | 0.0% | $5.00 → $15.00 | 122 |
| Qwen: Qwen3.5-122B-A10B | 100.0% | 5.00 s | 10.00 s | 0.0% | $0.12 → $0.92 | 89 |
| Qwen: Qwen3.5-27B | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.09 → $0.69 | 50 |
| TEtencent/Hy3-preview | 100.0% | 1.77 s | 1.77 s | 0.0% | $75.00 → $75.00 | — |
어떤 모델이 실제로 OrcaRouter 프로덕션 트래픽을 담당하는지를 선택한 기간의 토큰 처리량 기준으로 순위 매깁니다.
이번 기간 동안 지금까지 —개 모델을 확인했습니다. 모델을 공정하게 순위 매길 만큼 트래픽이 쌓이면 볼륨 순위가 공개됩니다.
그동안 위의 종합 및 신뢰성 보드는 이미 운영 중입니다.
커뮤니티 순위가 독립적인 외부 순위를 얼마나 따라가는지를 Spearman의 ρ와 Kendall의 τ 순위 상관으로 측정합니다.
일일 스냅샷을 기반으로 각 모델의 최근 90일 아레나 레이팅을 보여 줍니다. 하락 배지는 지속적인 하락을 표시합니다.
커뮤니티에서 이야기되고 있는 주제 — 언급량, 14일간 추세, 평판 분위기. 참고용일 뿐 순위 지표로는 절대 사용되지 않습니다.