Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.
Голоса слепого Battle Mode, ранжированные моделью Bradley–Terry (Elo). Точки показывают рейтинг, полосы — 95% доверительный интервал. Модели в одной полосе статистически равны.
Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.
| Ранг | Модель | Рейтинг арены | Метод | Голоса | П·П·Н |
|---|---|---|---|---|---|
| #1 | Qwen3.7 Max (2026-05-20) | вслепую · BT | 168 | 129·32·7 | |
| #2 | DEDeepSeek: DeepSeek V4 Pro | вслепую · BT | 250 | 161·77·12 | |
| OpenAI: GPT-5.4 Pro | вслепую · BT | 281 | 158·111·12 | ||
| OpenAI: GPT-5.5 | вслепую · BT | 230 | 109·109·12 | ||
| Qwen: Qwen3.5-35B-A3B | вслепую · BT | 310 | 149·149·12 | ||
| Qwen3.7 Max | вслепую · BT | 224 | 84·130·10 | ||
| Anthropic: Claude Opus 4.7 | вслепую · BT | 247 | 117·117·13 | ||
| Qwen: Qwen3.6 35B A3B | вслепую · BT | 260 | 124·124·12 | ||
| Anthropic: Claude Opus 4.8 | вслепую · BT | 245 | 116·116·13 | ||
| Google: Gemma 4 26B A4B | вслепую · BT | 242 | 114·116·12 | ||
| Qwen: Qwen3.6 Plus | вслепую · BT | 278 | 108·158·12 | ||
| #12 | KIMoonshotAI: Kimi K2.7 Code | вслепую · BT | 224 | 119·93·12 | |
| MIMiniMax: MiniMax M3 | вслепую · BT | 265 | 127·126·12 | ||
| Google: Gemma 4 31B | вслепую · BT | 273 | 112·149·12 | ||
| OpenAI: GPT-5.5 Pro | вслепую · BT | 294 | 95·187·12 | ||
| Qwen: Qwen3.5-27B | вслепую · BT | 213 | 100·101·12 | ||
| ZAZ.ai: GLM 5.2 | вслепую · BT | 235 | 141·82·12 | ||
| #18 | MIMiniMax: MiniMax M2.7 | вслепую · BT | 226 | 81·133·12 | |
| Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview) | вслепую · BT | 281 | 151·118·12 | ||
| OpenAI: GPT-5.4 | вслепую · BT | 245 | 117·116·12 | ||
| Google: Gemini 3.1 Flash Lite Preview | вслепую · BT | 285 | 137·136·12 | ||
| MIMiniMax M2.7 highspeed | вслепую · BT | 246 | 117·117·12 | ||
| OpenAI: GPT-5.4 Nano | вслепую · BT | 308 | 196·100·12 | ||
| Qwen: Qwen3.7 Plus | вслепую · BT | 248 | 118·118·12 | ||
| ZAZ.ai: GLM 5.1 | вслепую · BT | 220 | 104·104·12 | ||
| KLKling: Kling 3.0 Turbo | вслепую · BT | 256 | 121·123·12 | ||
| Qwen: Qwen3.6 Flash | вслепую · BT | 188 | 71·105·12 | ||
| #28 | Gemini 3.5 Flash | вслепую · BT | 285 | 96·177·12 | |
| OpenAI: GPT-5.4 Mini | вслепую · BT | 206 | 75·122·9 | ||
| DEDeepSeek: DeepSeek V4 Flash | вслепую · BT | 128 | 61·61·6 |
Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.
Сильнейшая модель в каждой способности — программирование, математика, рассуждение и другие — с профилем по каждой оси относительно медианы среди всех.
Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.
Измерено на рабочем трафике OrcaRouter за последние 7 дней.
| Модель | Успех % (7 дн.) | p50 | p99 | Ошибки % | $/млн (вход→выход) | tok/s |
|---|---|---|---|---|---|---|
| openai/gpt-5.5-pro-2026-04-23 | 100.0% | 1.44 s | 2.11 s | 0.0% | $60.00 → $270.00 | 15 |
| Anthropic: Claude Opus 4.6 | 100.0% | 7.32 s | 10.00 s | 0.0% | $5.00 → $25.00 | 63 |
| GRgrok/grok-imagine-image | 100.0% | 4.76 s | 4.76 s | 0.0% | — → — | — |
| MIMiniMax M2.5 highspeed | 100.0% | 2.12 s | 2.12 s | 0.0% | $0.60 → $2.40 | — |
| openai/gpt-5.2-2025-12-11 | 100.0% | 2.50 s | 10.00 s | 0.0% | $1.75 → $14.00 | 74 |
| qwen/qwen3.6-plus-2026-04-02 | 100.0% | 4.18 s | 7.86 s | 0.0% | $0.28 → $1.65 | 56 |
| Anthropic: Claude Fable 5 | 100.0% | 7.36 s | 10.00 s | 0.0% | $10.00 → $50.00 | 73 |
| openai/gpt-5.4-mini-2026-03-17 | 100.0% | 2.00 s | 4.99 s | 0.0% | $0.75 → $4.50 | 174 |
| Qwen: Qwen3.5-27B | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.09 → $0.69 | 50 |
| openai/gpt-4o-mini-search-preview-2025-03-11 | 100.0% | 5.19 s | 5.19 s | 0.0% | $0.15 → $0.60 | — |
| OpenAI: GPT-5 Mini | 100.0% | 10.00 s | 10.00 s | 0.0% | $0.25 → $2.00 | 189 |
| openai/gpt-5.4-nano-2026-03-17 | 100.0% | 1.55 s | 3.30 s | 0.0% | $0.20 → $1.25 | 157 |
| Qwen: Qwen3.6 Flash | 100.0% | 3.85 s | 10.00 s | 0.0% | $0.25 → $1.50 | 303 |
| google/gemini-3.1-flash-lite | 100.0% | 986 ms | 4.90 s | 0.0% | $0.25 → $1.50 | 285 |
| OpenAI: GPT-4o (2024-11-20) | 100.0% | 1.83 s | 4.34 s | 0.0% | $2.50 → $10.00 | 177 |
| Qwen: Qwen3.6 35B A3B | 100.0% | 4.54 s | 10.00 s | 0.0% | $0.25 → $1.49 | 205 |
| DEDeepSeek: DeepSeek V3 | 100.0% | 399 ms | 4.67 s | 0.0% | $0.15 → $0.29 | 58 |
| OpenAI: GPT-5 | 100.0% | 10.00 s | 10.00 s | 0.0% | $1.25 → $10.00 | 1504 |
| openai/gpt-5.5-2026-04-23 | 100.0% | 4.25 s | 10.00 s | 0.0% | $10.00 → $45.00 | 124 |
| ZAZ.ai: GLM 5 | 100.0% | 7.50 s | 10.00 s | 0.0% | $1.00 → $3.20 | 51 |
| OpenAI: GPT-4 Turbo | 100.0% | 5.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 24 |
| openai/gpt-4-turbo-2024-04-09 | 100.0% | 7.00 s | 10.00 s | 0.0% | $10.00 → $30.00 | 28 |
| OpenAI: GPT-4.1 | 100.0% | 2.60 s | 5.46 s | 0.0% | $2.00 → $8.00 | 91 |
| OpenAI: GPT-5 Codex | 100.0% | 875 ms | 7.35 s | 0.0% | $1.25 → $10.00 | 129 |
| KIkimi/kimi-k2.6 | 100.0% | 3.92 s | 10.00 s | 0.0% | $0.95 → $4.00 | 36 |
Какие модели реально несут продакшн-трафик OrcaRouter — ранжировано по пропускной способности в токенах за выбранное окно.
| Ранг | Модель | Доля | Тренд |
|---|---|---|---|
| #1 | DEdeepseek-v4-flash | — | |
| #2 | DEdeepseek-v4-pro | — | |
| #3 | ZAglm-5.2 | — | |
| #4 | claude-opus-4.8 | ||
| #5 | DEdeepseek-chat | ||
| #6 | DEdeepseek-reasoner | ||
| #7 | MIminimax-m3 | ||
| #8 | claude-sonnet-5 | — | |
| #9 | claude-opus-4.7 | ||
| #10 | gpt-image-2-medium | — | |
| #11 | qwen3.7-max | ||
| #12 | qwen3.7-plus | ||
| #13 | gemini-3.5-flash | ||
| #14 | qwen3.5-35b-a3b | ||
| #15 | gpt-5.4-nano | ||
| #16 | gemini-2.5-flash-lite | ||
| #17 | gemini-3-flash-preview | ||
| #18 | KIkimi-k2.7-code | — | |
| #19 | gemini-embedding-2-preview | ||
| #20 | ZAglm-5.1 | ||
| #21 | claude-haiku-4.5 | ||
| #22 | GRgrok-4.5 | — | |
| #23 | qwen3.6-plus | ||
| #24 | OBqwen3.6-35b-a3b | ||
| #25 | claude-sonnet-4.6 |
Ещё 17 моделей ниже порога ранжирования для этого окна.
Насколько точно рейтинг сообщества повторяет независимые внешние рейтинги, измеряется ранговой корреляцией Спирмена ρ и Кендалла τ.
Рейтинг арены каждой модели за последние 90 дней по ежедневным срезам. Значок регрессии отмечает устойчивое падение.
О чём говорит сообщество — объём упоминаний, динамика за 14 дней и тональность. Только контекст, никогда не влияет на ранжирование.