Ranking de modelos de IA

Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.

Atualizado em 2026-08-235 fontes de evidênciaModelos novos listados em 48 h
Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
Google: Gemini 3.1 Flash Lite Preview
403 ms
Menor latência p50
DeepSeek: DeepSeek V3
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)

Classificação consolidada

Um ranking combinado por modelo — votos do LMArena, benchmarks independentes, adoção do ecossistema e evidências de produção do OrcaRouter, com pesos públicos fixos. Modelos novos entram desde o primeiro dia com base em evidências externas.

PosiçãoModeloPontuação compostaConfiabilidade$/1M mistoVolumeImpulsoEvidências
#1OpenAI: gpt-oss-120b65.799.47% · 910ms$0.10$0.03 → $0.17 per 1M tokens<1%AA Math 93.4Pontuação de matemática da Artificial Analysis.OR 0.6%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#2openai/gpt-5.2-2025-12-1165.199.11% · 2545ms$7.88$1.75 → $14 per 1M tokens<1%AA Math 99.0Pontuação de matemática da Artificial Analysis.OR 0.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#3DeepSeek: DeepSeek V4 Flash64.799.04% · 623ms$0.22$0.147 → $0.295 per 1M tokens20%AA Math 50.0Pontuação de matemática da Artificial Analysis.OR 18.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#4Z.ai: GLM 4.763.499.80% · 4066ms$1.40$0.6 → $2.2 per 1M tokens<1%AA Math 95.0Pontuação de matemática da Artificial Analysis.OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#5OpenAI: GPT-5.1-Codex63.399.05% · 1938ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 95.7Pontuação de matemática da Artificial Analysis.OR 0.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#6openai/gpt-5-2025-08-0762.799.25% · 2428ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 94.3Pontuação de matemática da Artificial Analysis.OR 0.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#7openai/gpt-5.1-2025-11-1362.799.10% · 2692ms$5.63$1.25 → $10 per 1M tokens<1%AA Math 94.0Pontuação de matemática da Artificial Analysis.OR 0.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#8openai/gpt-5-mini-2025-08-0762.499.00% · 1450ms$1.13$0.25 → $2 per 1M tokens<1%AA Math 90.7Pontuação de matemática da Artificial Analysis.OR 0.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#9OpenAI: GPT-5.1-Codex-Mini61.499.18% · 1125ms$1.13$0.25 → $2 per 1M tokens<1%AA Math 91.7Pontuação de matemática da Artificial Analysis.OR 0.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#10Google: Gemini 2.5 Pro59.999.50% · 5666ms$8.75$2.5 → $15 per 1M tokens<1%AA Math 87.7Pontuação de matemática da Artificial Analysis.OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Fatia de tokens por laboratório
deepseek 51.0%openai 25.3%tencent 7.9%obsidian 7.0%Outros 8.8%
40%
Preferência humana
LMArena · Bradley–Terry
30%
Benchmarks independentes
Artificial Analysis · SWE-bench
20%
Evidência de produção
OrcaRouter battles & traffic
10%
Adoção do ecossistema
OpenRouter token share

Confrontos diretos

Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.

Benchmarks — inteligência vs. preço

Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.

Duelo às cegas

Duas respostas anônimas, um voto. Suas batalhas alimentam os 20% de evidência de produção do rank consolidado.

⚔️ Duelo às cegas

Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.

Metodologia — como este ranking funciona

Cada número desta página é medido, nunca autodeclarado. Este é o método completo por trás do ranking combinado — as mesmas regras para cada modelo, todos os dias.

Uma pontuação combinada, pesos públicos fixos

Cada modelo recebe uma pontuação composta de quatro famílias de evidência independentes: preferência humana às cegas 40%, benchmarks independentes 30%, evidência de produção do OrcaRouter 20% e adoção do ecossistema 10%. Os pesos são fixos e públicos — sem ajustes editoriais, sem posição paga, sem envios de fornecedores.

O que alimenta cada família

A preferência humana vem do Elo comunitário do LMArena — votos cegos em pares nas arenas de texto e visão (CC-BY-4.0). Os benchmarks independentes combinam a Artificial Analysis (Intelligence Index mais programação, matemática, GPQA Diamond e τ²-Bench) com o SWE-bench Verified, a fração de issues reais do GitHub resolvidos. A evidência de produção é do próprio OrcaRouter: taxas de vitória no Blind Battle mais telemetria ao vivo do gateway — taxa de sucesso, latência e volume de tokens roteados. A adoção usa a participação de tokens publicada pelo OpenRouter.

Como as pontuações se tornam comparáveis

As fontes pontuam em escalas diferentes (Elo, índices 0–100, % resolvido), então cada sinal é padronizado contra o quadro atual e mapeado para 0–100: 50 é a média do quadro e cada 15 pontos valem um desvio padrão, com limites nos extremos. Um modelo precisa de pelo menos duas famílias de evidência independentes para ranquear, e o quadro lista o top 25 por pontuação composta.

Quadros por caso de uso

Os quadros de texto, programação, visão, matemática, raciocínio e agentes recalculam a mesma mistura sobre sinais adequados ao segmento — programação troca para os benchmarks de código e o SWE-bench Verified, visão usa a arena de visão do LMArena — e os Blind Battles só pareiam modelos do mesmo segmento.

Atualidade e jogo limpo

Os feeds externos são atualizados diariamente e a telemetria própria é ao vivo; modelos novos entram com evidência externa em até 48 horas após o lançamento. Nenhum número autodeclarado de fornecedor é usado em lugar algum, o buzz da comunidade aparece apenas como contexto e nunca alimenta uma posição, e toda fonte externa é creditada sob o quadro.

Perguntas frequentes

Como o ranking de modelos de IA é calculado?

Cada modelo recebe uma pontuação combinada de quatro famílias de evidência — preferência humana às cegas (LMArena), benchmarks independentes (Artificial Analysis, SWE-bench), confiabilidade de produção da OrcaRouter e adoção do ecossistema (OpenRouter) — com pesos públicos fixos de 40 / 30 / 20 / 10.

Por que um modelo recém-lançado já tem posição?

Modelos novos entram no ranking com base em evidências externas em até 48 horas após o lançamento. A posição se consolida à medida que batalhas da comunidade e tráfego de produção se acumulam.

Com que frequência a classificação é atualizada?

As fontes externas atualizam diariamente e a telemetria da OrcaRouter é ao vivo; a data de atualização aparece no topo.

Por que um modelo está fora da lista?

Um modelo precisa de pelo menos duas fontes de evidência independentes para ser classificado, e o quadro mostra o top 25 por pontuação composta — modelos com evidência insuficiente ficam de fora até que outra fonte os cubra.

Os casos de uso são classificados separadamente?

Sim — os botões acima da tabela consolidada alternam entre os rankings de texto, programação, visão, matemática, raciocínio e agentes, e as batalhas só pareiam modelos comparáveis.

Quando a posição de um modelo novo se consolida?

Quando um modelo reúne três famílias de evidências, incluindo as batalhas e o tráfego do próprio OrcaRouter, sua posição passa a se basear na combinação completa, e não apenas em evidências externas.

De onde vêm os dados?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, mais a telemetria de produção da OrcaRouter — tudo atribuído sob o quadro.

Fornecedores podem manipular o ranking?

Difícil: pesos públicos, nada de números autodeclarados, e batalhas cegas mais tráfego real ancoram cada pontuação.

Posso exportar ou incorporar esses dados?

Sim — exportação JSON/CSV, selo de posição incorporável e feed RSS de mudanças, grátis com atribuição. Links no rodapé.

Modelos novos, mudanças de rank e lançamentos — acompanhe:X · @OrcaRouterDiscord