Ranking de modelos de IA

Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.

Atualizado em 2026-08-155 fontes de evidênciaModelos novos listados em 48 h
Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
OpenAI: GPT-5.4 Nano
330 ms
Menor latência p50
deepseek/deepseek-reasoner
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)

Classificação consolidada

Um ranking combinado por modelo — votos do LMArena, benchmarks independentes, adoção do ecossistema e evidências de produção do OrcaRouter, com pesos públicos fixos. Modelos novos entram desde o primeiro dia com base em evidências externas.

PosiçãoModeloPontuação compostaConfiabilidade$/1M mistoVolumeImpulsoEvidências
#1DeepSeek: DeepSeek V4 Flash79.299.34% · 423ms$0.22$0.147 → $0.295 per 1M tokens20%τ² 95.0τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 21.4%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#2Z.ai: GLM 5.272.999.37% · 7876ms$2.90$1.4 → $4.4 per 1M tokens2%τ² 99.1τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 5.7%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#3DeepSeek: DeepSeek V4 Pro70.199.98% · 934ms$0.66$0.442 → $0.884 per 1M tokens8%τ² 96.2τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 4.4%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#4MiniMax: MiniMax M363.0100.00% · 3127ms$0.75$0.3 → $1.2 per 1M tokens<1%τ² 88.9τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 2.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#5Anthropic: Claude Opus 4.862.099.47% · 4843ms$15.00$5 → $25 per 1M tokens<1%τ² 94.4τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.8%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#6Anthropic: Claude Fable 561.899.50% · 4739ms$30.00$10 → $50 per 1M tokens<1%τ² 98.5τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.4%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#7Z.ai: GLM 560.0100.00% · 4571ms$2.10$1 → $3.2 per 1M tokens<1%τ² 98.2τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#8Z.ai: GLM 5.160.0100.00% · 7076ms$2.90$1.4 → $4.4 per 1M tokens<1%τ² 97.7τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#9Google: Gemini 3.1 Pro Preview59.899.46% · 9136ms$7.00$2 → $12 per 1M tokens<1%τ² 95.6τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#10grok/grok-4.359.899.45% · 6985ms$1.88$1.25 → $2.5 per 1M tokens<1%τ² 97.7τ²-Bench — benchmark agêntico de uso de ferramentas, via Artificial Analysis.OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Fatia de tokens por laboratório
deepseek 44.0%openai 32.6%tencent 12.4%kimi 5.7%Outros 5.3%
40%
Preferência humana
LMArena · Bradley–Terry
30%
Benchmarks independentes
Artificial Analysis · SWE-bench
20%
Evidência de produção
OrcaRouter battles & traffic
10%
Adoção do ecossistema
OpenRouter token share

Confrontos diretos

Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.

Benchmarks — inteligência vs. preço

Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.

Duelo às cegas

Duas respostas anônimas, um voto. Suas batalhas alimentam os 20% de evidência de produção do rank consolidado.

⚔️ Duelo às cegas

Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.

Metodologia — como este ranking funciona

Cada número desta página é medido, nunca autodeclarado. Este é o método completo por trás do ranking combinado — as mesmas regras para cada modelo, todos os dias.

Uma pontuação combinada, pesos públicos fixos

Cada modelo recebe uma pontuação composta de quatro famílias de evidência independentes: preferência humana às cegas 40%, benchmarks independentes 30%, evidência de produção do OrcaRouter 20% e adoção do ecossistema 10%. Os pesos são fixos e públicos — sem ajustes editoriais, sem posição paga, sem envios de fornecedores.

O que alimenta cada família

A preferência humana vem do Elo comunitário do LMArena — votos cegos em pares nas arenas de texto e visão (CC-BY-4.0). Os benchmarks independentes combinam a Artificial Analysis (Intelligence Index mais programação, matemática, GPQA Diamond e τ²-Bench) com o SWE-bench Verified, a fração de issues reais do GitHub resolvidos. A evidência de produção é do próprio OrcaRouter: taxas de vitória no Blind Battle mais telemetria ao vivo do gateway — taxa de sucesso, latência e volume de tokens roteados. A adoção usa a participação de tokens publicada pelo OpenRouter.

Como as pontuações se tornam comparáveis

As fontes pontuam em escalas diferentes (Elo, índices 0–100, % resolvido), então cada sinal é padronizado contra o quadro atual e mapeado para 0–100: 50 é a média do quadro e cada 15 pontos valem um desvio padrão, com limites nos extremos. Um modelo precisa de pelo menos duas famílias de evidência independentes para ranquear, e o quadro lista o top 25 por pontuação composta.

Quadros por caso de uso

Os quadros de texto, programação, visão, matemática, raciocínio e agentes recalculam a mesma mistura sobre sinais adequados ao segmento — programação troca para os benchmarks de código e o SWE-bench Verified, visão usa a arena de visão do LMArena — e os Blind Battles só pareiam modelos do mesmo segmento.

Atualidade e jogo limpo

Os feeds externos são atualizados diariamente e a telemetria própria é ao vivo; modelos novos entram com evidência externa em até 48 horas após o lançamento. Nenhum número autodeclarado de fornecedor é usado em lugar algum, o buzz da comunidade aparece apenas como contexto e nunca alimenta uma posição, e toda fonte externa é creditada sob o quadro.

Perguntas frequentes

Como o ranking de modelos de IA é calculado?

Cada modelo recebe uma pontuação combinada de quatro famílias de evidência — preferência humana às cegas (LMArena), benchmarks independentes (Artificial Analysis, SWE-bench), confiabilidade de produção da OrcaRouter e adoção do ecossistema (OpenRouter) — com pesos públicos fixos de 40 / 30 / 20 / 10.

Por que um modelo recém-lançado já tem posição?

Modelos novos entram no ranking com base em evidências externas em até 48 horas após o lançamento. A posição se consolida à medida que batalhas da comunidade e tráfego de produção se acumulam.

Com que frequência a classificação é atualizada?

As fontes externas atualizam diariamente e a telemetria da OrcaRouter é ao vivo; a data de atualização aparece no topo.

Por que um modelo está fora da lista?

Um modelo precisa de pelo menos duas fontes de evidência independentes para ser classificado, e o quadro mostra o top 25 por pontuação composta — modelos com evidência insuficiente ficam de fora até que outra fonte os cubra.

Os casos de uso são classificados separadamente?

Sim — os botões acima da tabela consolidada alternam entre os rankings de texto, programação, visão, matemática, raciocínio e agentes, e as batalhas só pareiam modelos comparáveis.

Quando a posição de um modelo novo se consolida?

Quando um modelo reúne três famílias de evidências, incluindo as batalhas e o tráfego do próprio OrcaRouter, sua posição passa a se basear na combinação completa, e não apenas em evidências externas.

De onde vêm os dados?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, mais a telemetria de produção da OrcaRouter — tudo atribuído sob o quadro.

Fornecedores podem manipular o ranking?

Difícil: pesos públicos, nada de números autodeclarados, e batalhas cegas mais tráfego real ancoram cada pontuação.

Posso exportar ou incorporar esses dados?

Sim — exportação JSON/CSV, selo de posição incorporável e feed RSS de mudanças, grátis com atribuição. Links no rodapé.

Modelos novos, mudanças de rank e lançamentos — acompanhe:X · @OrcaRouterDiscord