Ranking de modelos de IA

Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.

Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
OpenAI: GPT-4o (2024-08-06)
399 ms
Menor latência p50
DeepSeek: DeepSeek V3
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)

Geral — taxa de vitória da comunidade

Votos do Battle Mode às cegas, classificados por um modelo de Bradley–Terry (Elo). Os pontos mostram a pontuação; as barras, o intervalo de confiança de 95%. Modelos na mesma faixa estão estatisticamente empatados.

Controle de estilo
Em breve — precisa de mais dados de duelos

⚔️ Duelo às cegas

Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.

PosiçãoModeloPontuação da arenaMétodoVotosV·D·E
#1Qwen3.7 Max (2026-05-20)1746±140
às cegas · BT
168129·32·7
#2DeepSeek: DeepSeek V4 Pro1526±76
às cegas · BT
250161·77·12
OpenAI: GPT-5.4 Pro1523±81
às cegas · BT
281158·111·12
OpenAI: GPT-5.51521±81
às cegas · BT
230109·109·12
Qwen: Qwen3.5-35B-A3B1519±88
às cegas · BT
310149·149·12
Qwen3.7 Max1519±125
às cegas · BT
22484·130·10
Anthropic: Claude Opus 4.71518±103
às cegas · BT
247117·117·13
Qwen: Qwen3.6 35B A3B1518±91
às cegas · BT
260124·124·12
Anthropic: Claude Opus 4.81516±96
às cegas · BT
245116·116·13
Google: Gemma 4 26B A4B1516±91
às cegas · BT
242114·116·12
Qwen: Qwen3.6 Plus1515±125
às cegas · BT
278108·158·12
#12MoonshotAI: Kimi K2.7 Code1301±69
às cegas · BT
224119·93·12
MiniMax: MiniMax M31300±59
às cegas · BT
265127·126·12
Google: Gemma 4 31B1300±58
às cegas · BT
273112·149·12
OpenAI: GPT-5.5 Pro1299±68
às cegas · BT
29495·187·12
Qwen: Qwen3.5-27B1298±63
às cegas · BT
213100·101·12
Z.ai: GLM 5.21298±67
às cegas · BT
235141·82·12
#18MiniMax: MiniMax M2.71081±66
às cegas · BT
22681·133·12
Google: Nano Banana 2 (Gemini 3.1 Flash Image Preview)1079±105
às cegas · BT
281151·118·12
OpenAI: GPT-5.41078±73
às cegas · BT
245117·116·12
Google: Gemini 3.1 Flash Lite Preview1078±98
às cegas · BT
285137·136·12
MiniMax M2.7 highspeed1077±106
às cegas · BT
246117·117·12
OpenAI: GPT-5.4 Nano1077±102
às cegas · BT
308196·100·12
Qwen: Qwen3.7 Plus1076±90
às cegas · BT
248118·118·12
Z.ai: GLM 5.11076±78
às cegas · BT
220104·104·12
Kling: Kling 3.0 Turbo1074±91
às cegas · BT
256121·123·12
Qwen: Qwen3.6 Flash1073±70
às cegas · BT
18871·105·12
#28Gemini 3.5 Flash852±123
às cegas · BT
28596·177·12
OpenAI: GPT-5.4 Mini851±123
às cegas · BT
20675·122·9
DeepSeek: DeepSeek V4 Flash850±128
às cegas · BT
12861·61·6

Confrontos diretos

Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.

Líderes por categoria

O modelo mais forte em cada capacidade — programação, matemática, raciocínio e mais — com um perfil por eixo em relação à mediana do conjunto.

Benchmarks — inteligência vs. preço

Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.

Confiabilidade e custo

Medido no tráfego de produção do OrcaRouter nos últimos 7 dias.

Modelo
Sucesso % (7 d)
p50
p99
Erros %
$/M (entr.→saída)
tok/s
OpenAI: GPT-4o (2024-08-06)100.0%2.86 s5.72 s
0.0%
$2.50 → $10.0086
OpenAI: GPT-5.4 Nano100.0%1.35 s10.00 s
0.0%
$0.20 → $1.25162
openai/gpt-5.4-nano-2026-03-17100.0%1.55 s3.30 s
0.0%
$0.20 → $1.25157
Z.ai: GLM 5100.0%7.50 s10.00 s
0.0%
$1.00 → $3.2051
OpenAI: GPT-5.2-Codex100.0%750 ms1.48 s
0.0%
$1.75 → $14.00101
qwen/qwen3.6-plus-2026-04-02100.0%4.18 s7.86 s
0.0%
$0.28 → $1.6556
OpenAI: GPT-5.4 Pro100.0%2.67 s4.72 s
0.0%
$60.00 → $270.006
Z.ai: GLM 4.7100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2037
openai/gpt-3.5-turbo-1106100.0%1.83 s4.15 s
0.0%
$1.00 → $2.00143
openai/gpt-4o-mini-search-preview-2025-03-11100.0%5.19 s5.19 s
0.0%
$0.15 → $0.60
OpenAI: GPT-5 Mini100.0%10.00 s10.00 s
0.0%
$0.25 → $2.00189
Anthropic: Claude Opus 4.6100.0%7.32 s10.00 s
0.0%
$5.00 → $25.0063
openai/gpt-5.4-mini-2026-03-17100.0%2.00 s4.99 s
0.0%
$0.75 → $4.50174
Qwen: Qwen3 VL 235B A22B Thinking100.0%8.00 s10.00 s
0.0%
$0.40 → $4.0035
Z.ai: GLM 4.6100.0%10.00 s10.00 s
0.0%
$0.60 → $2.2042
openai/gpt-5.2-chat-latest100.0%1.57 s10.00 s
0.0%
$1.75 → $14.00112
OpenAI: GPT-4o100.0%902 ms10.00 s
0.0%
$2.50 → $10.0098
OpenAI: GPT-4o-mini (2024-07-18)100.0%5.00 s10.00 s
0.0%
$0.15 → $0.6032
openai/gpt-5-chat-latest100.0%2.00 s3.40 s
0.0%
$1.25 → $10.00135
MiniMax: MiniMax M2.7100.0%1.28 s10.00 s
0.0%
$0.30 → $1.2082
OpenAI: GPT-4 Turbo100.0%5.00 s10.00 s
0.0%
$10.00 → $30.0024
Z.ai: GLM 5.1100.0%4.59 s10.00 s
0.0%
$1.40 → $4.4067
OpenAI: GPT-4o-mini100.0%644 ms8.50 s
0.0%
$0.15 → $0.6068
OpenAI: GPT-5 Nano100.0%4.31 s10.00 s
0.0%
$0.05 → $0.40835
Google: Nano Banana Pro (Gemini 3 Pro Image Preview)100.0%5.00 s5.53 s
0.0%
— → —
Mostrando 1 - 25 ,de 133

Volume — tráfego de produção

Quais modelos realmente sustentam o tráfego de produção do OrcaRouter, classificados pela taxa de tokens na janela selecionada.

PosiçãoModeloParticipaçãoTendência
#1deepseek-v4-flash
#2deepseek-v4-pro
#3glm-5.2
#4claude-opus-4.8
#5deepseek-chat
#6deepseek-reasoner
#7minimax-m3
#8claude-sonnet-5
#9claude-opus-4.7
#10gpt-image-2-medium
#11qwen3.7-max
#12qwen3.7-plus
#13gemini-3.5-flash
#14qwen3.5-35b-a3b
#15gpt-5.4-nano
#16gemini-2.5-flash-lite
#17gemini-3-flash-preview
#18kimi-k2.7-code
#19gemini-embedding-2-preview
#20glm-5.1
#21claude-haiku-4.5
#22qwen3.6-plus
#23qwen3.6-35b-a3b
#24claude-sonnet-4.6
#25gemini-2.5-flash
Mostrando 1 - 25 ,de 141

+17 modelos abaixo do limite de classificação para esta janela.

Validação — concordância com rankings externos

O quão de perto o ranking da comunidade acompanha rankings externos independentes, medido pela correlação de postos de Spearman (ρ) e de Kendall (τ).

Buzz — popularidade e sentimento

Sobre o que a comunidade está falando — volume de menções, impulso de 14 dias e sentimento. Apenas contexto, nunca um sinal de classificação.