Рейтинг моделей ИИ

Ранжирование по реальному рабочему трафику OrcaRouter и голосам сообщества в Battle Mode — а не по бенчмаркам от производителей.

Измерено на реальном трафике
100.0%
Лучшая доля успеха (7 дн.)
openai/gpt-5.5-pro-2026-04-23
399 ms
Самая низкая задержка p50
DeepSeek: DeepSeek V3
80.1%
Лучшая доля побед в сообществе
Qwen3.7 Max (2026-05-20)

Общий — доля побед в сообществе

Голоса слепого Battle Mode, ранжированные моделью Bradley–Terry (Elo). Точки показывают рейтинг, полосы — 95% доверительный интервал. Модели в одной полосе статистически равны.

Контроль стиля
Скоро — нужно больше данных дуэлей

⚔️ Слепая дуэль

Две анонимные модели отвечают на один и тот же запрос. Прочитайте оба ответа, проголосуйте за победителя, а затем узнайте, кто что написал — ваш голос идёт в рейтинг выше.

РангМодельРейтинг ареныМетодГолосаП·П·Н
#1Qwen3.7 Max (2026-05-20)1746±140
вслепую · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
вслепую · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
вслепую · BT
281158·111·12
OpenAI: GPT-5.51521±81
вслепую · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
вслепую · BT
310149·149·12
Qwen3.7 Max1519±125
вслепую · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
вслепую · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
вслепую · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
вслепую · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
вслепую · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
вслепую · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
вслепую · BT
224119·93·12
MiniMax: MiniMax M31300±59
вслепую · BT
265127·126·12
Google: Gemma 4 31B1300±58
вслепую · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
вслепую · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
вслепую · BT
213100·101·12
Z.ai: GLM 5.21298±67
вслепую · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
вслепую · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
вслепую · BT
281151·118·12
OpenAI: GPT-5.41078±73
вслепую · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
вслепую · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
вслепую · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
вслепую · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
вслепую · BT
248118·118·12
Z.ai: GLM 5.11076±78
вслепую · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
вслепую · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
вслепую · BT
18871·105·12
#28Gemini 3.5 Flash852±123
вслепую · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
вслепую · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
вслепую · BT
12861·61·6

Очные дуэли

Попарные показатели побед в Battle Mode — как часто каждая модель побеждает каждого соперника в очном сравнении.

Лидеры по категориям

Сильнейшая модель в каждой способности — программирование, математика, рассуждение и другие — с профилем по каждой оси относительно медианы среди всех.

Бенчмарки — интеллект против цены

Независимые оценки интеллекта в зависимости от цены ввода. Пунктирная линия — граница Парето по цене и интеллекту.

Надёжность и стоимость

Измерено на рабочем трафике OrcaRouter за последние 7 дней.

Модель
Успех % (7 дн.)
p50
p99
Ошибки %
$/млн (вход→выход)
tok/s
openai/gpt-5.5-pro-2026-04-23100.0%1.44 s2.11 s
0.0%
$60.00 → $270.0015
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
grok/grok-imagine-image100.0%4.76 s4.76 s
0.0%
— → —
MiniMax M2.5 highspeed100.0%2.12 s2.12 s
0.0%
$0.60 → $2.40
openai/gpt-5.2-2025-12-11100.0%2.50 s10.00 s
0.0%
$1.75 → $14.0074
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
Anthropic: Claude Fable 5100.0%7.36 s10.00 s
0.0%
$10.00 → $50.0073
openai/gpt-5.4-mini-2026-03-17100.0%2.00 s4.99 s
0.0%
$0.75 → $4.50174
Qwen: Qwen3.5-27B100.0%10.00 s10.00 s
0.0%
$0.09 → $0.6950
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Qwen: Qwen3.6 Flash100.0%3.85 s10.00 s
0.0%
$0.25 → $1.50303
google/gemini-3.1-flash-lite100.0%986 ms4.90 s
0.0%
$0.25 → $1.50285
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
Qwen: Qwen3.6 35B A3B100.0%4.54 s10.00 s
0.0%
$0.25 → $1.49205
DeepSeek: DeepSeek V3100.0%399 ms4.67 s
0.0%
$0.15 → $0.2958
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
openai/gpt-5.5-2026-04-23100.0%4.25 s10.00 s
0.0%
$10.00 → $45.00124
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
openai/gpt-4-turbo-2024-04-09100.0%7.00 s10.00 s
0.0%
$10.00 → $30.0028
OpenAI: GPT-4.1100.0%2.60 s5.46 s
0.0%
$2.00 → $8.0091
OpenAI: GPT-5 Codex100.0%875 ms7.35 s
0.0%
$1.25 → $10.00129
kimi/kimi-k2.6100.0%3.92 s10.00 s
0.0%
$0.95 → $4.0036
Отображение 1 до 25 из 133

Объём — продакшн-трафик

Какие модели реально несут продакшн-трафик OrcaRouter — ранжировано по пропускной способности в токенах за выбранное окно.

РангМодельДоляТренд
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22grok-4.5
#23qwen3.6-plus
#24qwen3.6-35b-a3b
#25claude-sonnet-4.6
Отображение 1 до 25 из 141

Ещё 17 моделей ниже порога ранжирования для этого окна.

Валидация — согласованность с внешними рейтингами

Насколько точно рейтинг сообщества повторяет независимые внешние рейтинги, измеряется ранговой корреляцией Спирмена ρ и Кендалла τ.

Обсуждения — популярность и тональность

О чём говорит сообщество — объём упоминаний, динамика за 14 дней и тональность. Только контекст, никогда не влияет на ранжирование.