Ranking de modelos de IA

Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.

Atualizado em 2026-08-095 fontes de evidênciaModelos novos listados em 48 h
Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
openai/gpt-4-turbo-2024-04-09
450 ms
Menor latência p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)

Classificação consolidada

Um ranking combinado por modelo — votos do LMArena, benchmarks independentes, adoção do ecossistema e evidências de produção do OrcaRouter, com pesos públicos fixos. Modelos novos entram desde o primeiro dia com base em evidências externas.

PosiçãoModeloPontuação compostaConfiabilidade$/1M mistoVolumeImpulsoEvidências
#1Anthropic: Claude Opus 574.299.77% · 3883ms$15.00$5 → $25 per 1M tokens<1%AA 63.1Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 1.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#2OpenAI: GPT-5.6 Luna73.899.44% · 3256ms$0.70$0.2 → $1.2 per 1M tokens12%AA 52.3Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 6.7%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#3OpenAI: GPT-5.4 Pro72.299.25% · 9000ms$165.00$60 → $270 per 1M tokens<1%AA 66.0Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).Win 58.7%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
#4MoonshotAI: Kimi K372.299.40% · 7738ms$9.00$3 → $15 per 1M tokens8%AA 59.7Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 2.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#5Z.ai: GLM 5.271.699.62% · 5211ms$2.90$1.4 → $4.4 per 1M tokens3%AA 52.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 4.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.Win 63.6%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
#6OpenAI: GPT-5.6 Sol69.899.34% · 6136ms$17.50$5 → $30 per 1M tokens<1%AA 60.9Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#7Qwen3.7 Max (2026-05-20)69.299.14% · 10000ms$2.50$1.25 → $3.75 per 1M tokens<1%AA 46.7Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.Win 80.1%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
#8OpenAI: GPT-5.6 Terra68.099.94% · 2586ms$7.00$2 → $12 per 1M tokens16%AA 56.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 1.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#9Anthropic: Claude Fable 567.399.41% · 4144ms$30.00$10 → $50 per 1M tokens<1%Arena 1494Elo da comunidade LMArena — votos humanos às cegas na arena de texto (CC-BY-4.0).AA 62.1Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.3%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#10Google: Gemini 3.6 Flash66.699.35% · 3928ms$4.50$1.5 → $7.5 per 1M tokens<1%Arena 1480Elo da comunidade LMArena — votos humanos às cegas na arena de texto (CC-BY-4.0).AA 51.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 3.5%Fatia de tokens do OpenRouter — adoção real do ecossistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Fatia de tokens por laboratório
deepseek 44.8%openai 29.5%tencent 11.0%kimi 7.9%Outros 6.8%
40%
Preferência humana
LMArena · Bradley–Terry
30%
Benchmarks independentes
Artificial Analysis · SWE-bench
20%
Evidência de produção
OrcaRouter battles & traffic
10%
Adoção do ecossistema
OpenRouter token share

Confrontos diretos

Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.

Benchmarks — inteligência vs. preço

Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.

Duelo às cegas

Duas respostas anônimas, um voto. Suas batalhas alimentam os 20% de evidência de produção do rank consolidado.

⚔️ Duelo às cegas

Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.

Metodologia — como este ranking funciona

Cada número desta página é medido, nunca autodeclarado. Este é o método completo por trás do ranking combinado — as mesmas regras para cada modelo, todos os dias.

Uma pontuação combinada, pesos públicos fixos

Cada modelo recebe uma pontuação composta de quatro famílias de evidência independentes: preferência humana às cegas 40%, benchmarks independentes 30%, evidência de produção do OrcaRouter 20% e adoção do ecossistema 10%. Os pesos são fixos e públicos — sem ajustes editoriais, sem posição paga, sem envios de fornecedores.

O que alimenta cada família

A preferência humana vem do Elo comunitário do LMArena — votos cegos em pares nas arenas de texto e visão (CC-BY-4.0). Os benchmarks independentes combinam a Artificial Analysis (Intelligence Index mais programação, matemática, GPQA Diamond e τ²-Bench) com o SWE-bench Verified, a fração de issues reais do GitHub resolvidos. A evidência de produção é do próprio OrcaRouter: taxas de vitória no Blind Battle mais telemetria ao vivo do gateway — taxa de sucesso, latência e volume de tokens roteados. A adoção usa a participação de tokens publicada pelo OpenRouter.

Como as pontuações se tornam comparáveis

As fontes pontuam em escalas diferentes (Elo, índices 0–100, % resolvido), então cada sinal é padronizado contra o quadro atual e mapeado para 0–100: 50 é a média do quadro e cada 15 pontos valem um desvio padrão, com limites nos extremos. Um modelo precisa de pelo menos duas famílias de evidência independentes para ranquear, e o quadro lista o top 25 por pontuação composta.

Quadros por caso de uso

Os quadros de texto, programação, visão, matemática, raciocínio e agentes recalculam a mesma mistura sobre sinais adequados ao segmento — programação troca para os benchmarks de código e o SWE-bench Verified, visão usa a arena de visão do LMArena — e os Blind Battles só pareiam modelos do mesmo segmento.

Atualidade e jogo limpo

Os feeds externos são atualizados diariamente e a telemetria própria é ao vivo; modelos novos entram com evidência externa em até 48 horas após o lançamento. Nenhum número autodeclarado de fornecedor é usado em lugar algum, o buzz da comunidade aparece apenas como contexto e nunca alimenta uma posição, e toda fonte externa é creditada sob o quadro.

Perguntas frequentes

Como o ranking de modelos de IA é calculado?

Cada modelo recebe uma pontuação combinada de quatro famílias de evidência — preferência humana às cegas (LMArena), benchmarks independentes (Artificial Analysis, SWE-bench), confiabilidade de produção da OrcaRouter e adoção do ecossistema (OpenRouter) — com pesos públicos fixos de 40 / 30 / 20 / 10.

Por que um modelo recém-lançado já tem posição?

Modelos novos entram no ranking com base em evidências externas em até 48 horas após o lançamento. A posição se consolida à medida que batalhas da comunidade e tráfego de produção se acumulam.

Com que frequência a classificação é atualizada?

As fontes externas atualizam diariamente e a telemetria da OrcaRouter é ao vivo; a data de atualização aparece no topo.

Por que um modelo está fora da lista?

Um modelo precisa de pelo menos duas fontes de evidência independentes para ser classificado, e o quadro mostra o top 25 por pontuação composta — modelos com evidência insuficiente ficam de fora até que outra fonte os cubra.

Os casos de uso são classificados separadamente?

Sim — os botões acima da tabela consolidada alternam entre os rankings de texto, programação, visão, matemática, raciocínio e agentes, e as batalhas só pareiam modelos comparáveis.

Quando a posição de um modelo novo se consolida?

Quando um modelo reúne três famílias de evidências, incluindo as batalhas e o tráfego do próprio OrcaRouter, sua posição passa a se basear na combinação completa, e não apenas em evidências externas.

De onde vêm os dados?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, mais a telemetria de produção da OrcaRouter — tudo atribuído sob o quadro.

Fornecedores podem manipular o ranking?

Difícil: pesos públicos, nada de números autodeclarados, e batalhas cegas mais tráfego real ancoram cada pontuação.

Posso exportar ou incorporar esses dados?

Sim — exportação JSON/CSV, selo de posição incorporável e feed RSS de mudanças, grátis com atribuição. Links no rodapé.

Modelos novos, mudanças de rank e lançamentos — acompanhe:X · @OrcaRouterDiscord