Ranking modeli AI

Klasyfikacja na podstawie rzeczywistego ruchu produkcyjnego OrcaRouter i głosów społeczności w Battle Mode — a nie benchmarków podawanych przez dostawców.

Zmierzono na rzeczywistym ruchu
100.0%
Najwyższy wskaźnik sukcesu (7 dni)
openai/gpt-4.1-2025-04-14
399 ms
Najniższe opóźnienie p50
DeepSeek: DeepSeek V3
80.1%
Najwyższy współczynnik zwycięstw społeczności
Qwen3.7 Max (2026-05-20)

Ogólny — współczynnik zwycięstw społeczności

Głosy z Battle Mode na ślepo, uszeregowane modelem Bradleya–Terry’ego (Elo). Kropki pokazują ranking, słupki — 95% przedział ufności. Modele w jednym paśmie są statystycznie równe.

Kontrola stylu
Wkrótce — potrzeba więcej danych z pojedynków

⚔️ Ślepy pojedynek

Dwa anonimowe modele odpowiadają na ten sam prompt. Przeczytaj oba, zagłosuj na zwycięzcę, a potem zobacz, kto co napisał — Twój głos zasila ranking powyżej.

PozycjaModelRanking arenyMetodaGłosyZ·P·R
#1Qwen3.7 Max (2026-05-20)1746±140
na ślepo · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
na ślepo · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
na ślepo · BT
281158·111·12
OpenAI: GPT-5.51521±81
na ślepo · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
na ślepo · BT
310149·149·12
Qwen3.7 Max1519±125
na ślepo · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
na ślepo · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
na ślepo · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
na ślepo · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
na ślepo · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
na ślepo · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
na ślepo · BT
224119·93·12
MiniMax: MiniMax M31300±59
na ślepo · BT
265127·126·12
Google: Gemma 4 31B1300±58
na ślepo · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
na ślepo · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
na ślepo · BT
213100·101·12
Z.ai: GLM 5.21298±67
na ślepo · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
na ślepo · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
na ślepo · BT
281151·118·12
OpenAI: GPT-5.41078±73
na ślepo · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
na ślepo · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
na ślepo · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
na ślepo · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
na ślepo · BT
248118·118·12
Z.ai: GLM 5.11076±78
na ślepo · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
na ślepo · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
na ślepo · BT
18871·105·12
#28Gemini 3.5 Flash852±123
na ślepo · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
na ślepo · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
na ślepo · BT
12861·61·6

Bezpośrednie pojedynki

Parami liczone wskaźniki zwycięstw w Battle Mode — jak często każdy model pokonuje danego rywala w bezpośrednim starciu.

Liderzy kategorii

Najsilniejszy model w każdej zdolności — programowanie, matematyka, rozumowanie i inne — z profilem dla każdej osi względem mediany pola.

Benchmarki — inteligencja a cena

Niezależne wyniki inteligencji naniesione względem ceny wejścia. Linia przerywana to granica Pareto cena/inteligencja.

Niezawodność i koszt

Zmierzono na ruchu produkcyjnym OrcaRouter z ostatnich 7 dni.

Model
Sukces % (7 dni)
p50
p99
Błędy %
$/M (wej.→wyj.)
tok/s
openai/gpt-4.1-2025-04-14100.0%3.67 s7.44 s
0.0%
$2.00 → $8.0087
Qwen: Qwen3 VL 235B A22B Instruct100.0%10.00 s10.00 s
0.0%
$0.40 → $1.6074
openai/gpt-3.5-turbo-0125100.0%10.00 s10.00 s
0.0%
$0.50 → $1.501512
openai/gpt-3.5-turbo-1106100.0%1.67 s4.15 s
0.0%
$1.00 → $2.00145
OpenAI: GPT-4100.0%6.88 s8.12 s
0.0%
$30.00 → $60.00294
OpenAI: GPT-5100.0%10.00 s10.00 s
0.0%
$1.25 → $10.001504
openai/gpt-5.1-chat-latest100.0%2.38 s3.50 s
0.0%
$1.25 → $10.00110
MiniMax M2.7 highspeed100.0%3.67 s3.67 s
0.0%
$0.60 → $2.4083
OpenAI: GPT-4o (2024-11-20)100.0%1.83 s4.34 s
0.0%
$2.50 → $10.00177
OpenAI: GPT-5.1-Codex100.0%1.00 s1.83 s
0.0%
$1.25 → $10.0087
Qwen: Qwen3.5-122B-A10B100.0%5.00 s10.00 s
0.0%
$0.12 → $0.9289
Qwen: Qwen3.6 Flash100.0%3.85 s10.00 s
0.0%
$0.25 → $1.50303
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
MiniMax: MiniMax M2.7100.0%1.32 s10.00 s
0.0%
$0.30 → $1.2081
OpenAI: GPT-4.1 Nano100.0%1.36 s5.00 s
0.0%
$0.10 → $0.4099
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
Qwen3.7 Max100.0%3.89 s10.00 s
0.0%
$1.25 → $3.7556
OpenAI: GPT-5.3-Codex100.0%1.10 s2.89 s
0.0%
$1.75 → $14.0062
Qwen: Qwen3.7 Plus100.0%3.96 s10.00 s
0.0%
$0.35 → $1.4258
MiniMax: MiniMax M2.5100.0%3.50 s4.63 s
0.0%
$0.30 → $1.20100
openai/gpt-5.2-2025-12-11100.0%2.50 s10.00 s
0.0%
$1.75 → $14.0074
kimi/kimi-k2.6100.0%3.92 s10.00 s
0.0%
$0.95 → $4.0036
OpenAI: GPT-3.5 Turbo 16k100.0%5.00 s7.07 s
0.0%
$3.00 → $4.00103
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
Wyświetlanie od 1 do 25 z 133

Wolumen — ruch produkcyjny

Które modele faktycznie obsługują ruch produkcyjny OrcaRouter, uszeregowane według przepustowości tokenów w wybranym oknie.

PozycjaModelUdziałTrend
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22grok-4.5
#23qwen3.6-plus
#24qwen3.6-35b-a3b
#25claude-sonnet-4.6
Wyświetlanie od 1 do 25 z 141

+17 kolejnych modeli poniżej progu rankingowego dla tego okna.

Walidacja — zgodność z rankingami zewnętrznymi

Jak ściśle ranking społeczności odpowiada niezależnym rankingom zewnętrznym, mierzone korelacją rang Spearmana (ρ) i Kendalla (τ).

Szum — popularność i sentyment

O czym rozmawia społeczność — liczba wzmianek, dynamika z 14 dni i sentyment. Tylko kontekst, nigdy nie wpływa na ranking.