Ranking de modelos de IA

Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.

Atualizado em 2026-08-225 fontes de evidênciaModelos novos listados em 48 h
Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
Qwen: Qwen3 VL 235B A22B Thinking
416 ms
Menor latência p50
DeepSeek: DeepSeek V3
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)

Classificação consolidada

Um ranking combinado por modelo — votos do LMArena, benchmarks independentes, adoção do ecossistema e evidências de produção do OrcaRouter, com pesos públicos fixos. Modelos novos entram desde o primeiro dia com base em evidências externas.

PosiçãoModeloPontuação compostaConfiabilidade$/1M mistoVolumeImpulsoEvidências
#1Google: Gemini 3.6 Flash65.999.19% · 4146ms$4.50$1.5 → $7.5 per 1M tokens<1%Vision 1311Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 1.7%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#2Anthropic: Claude Fable 564.999.26% · 6787ms$30.00$10 → $50 per 1M tokens<1%Vision 1331Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.3%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#3Anthropic: Claude Opus 4.763.399.09% · 4345ms$15.00$5 → $25 per 1M tokens<1%Vision 1316Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.5%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#4Qwen: Qwen3.8 Max62.599.49% · 5607ms$4.00$2 → $6 per 1M tokens<1%Vision 1315Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.4%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#5Anthropic: Claude Opus 4.661.199.15% · 4592ms$15.00$5 → $25 per 1M tokens<1%Vision 1311Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#6Google: Gemini 3.1 Pro Preview58.899.37% · 10000ms$7.00$2 → $12 per 1M tokens<1%Vision 1294Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.3%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#7Anthropic: Claude Opus 4.858.799.32% · 8070ms$15.00$5 → $25 per 1M tokens<1%Vision 1290Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.4%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#8Anthropic: Claude Sonnet 4.658.799.16% · 2675ms$9.00$3 → $15 per 1M tokens<1%Vision 1282Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.8%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#9xAI: Grok 4.558.499.20% · 10000ms$4.00$2 → $6 per 1M tokens<1%Vision 1295Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 0.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
#10MiniMax: MiniMax M357.799.95% · 10000ms$0.75$0.3 → $1.2 per 1M tokens<1%Vision 1258Elo da arena de visão LMArena — votos às cegas em respostas multimodais.OR 2.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.

LMArena leaderboard dataset (CC-BY-4.0) — lmarena.ai · Source: OpenRouter (openrouter.ai/rankings) · SWE-bench Verified — swebench.com · Artificial Analysis — artificialanalysis.ai

Fatia de tokens por laboratório
deepseek 54.1%openai 23.5%tencent 7.8%obsidian 6.2%Outros 8.5%
40%
Preferência humana
LMArena · Bradley–Terry
30%
Benchmarks independentes
Artificial Analysis · SWE-bench
20%
Evidência de produção
OrcaRouter battles & traffic
10%
Adoção do ecossistema
OpenRouter token share

Confrontos diretos

Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.

Benchmarks — inteligência vs. preço

Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.

Duelo às cegas

Duas respostas anônimas, um voto. Suas batalhas alimentam os 20% de evidência de produção do rank consolidado.

⚔️ Duelo às cegas

Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.

Metodologia — como este ranking funciona

Cada número desta página é medido, nunca autodeclarado. Este é o método completo por trás do ranking combinado — as mesmas regras para cada modelo, todos os dias.

Uma pontuação combinada, pesos públicos fixos

Cada modelo recebe uma pontuação composta de quatro famílias de evidência independentes: preferência humana às cegas 40%, benchmarks independentes 30%, evidência de produção do OrcaRouter 20% e adoção do ecossistema 10%. Os pesos são fixos e públicos — sem ajustes editoriais, sem posição paga, sem envios de fornecedores.

O que alimenta cada família

A preferência humana vem do Elo comunitário do LMArena — votos cegos em pares nas arenas de texto e visão (CC-BY-4.0). Os benchmarks independentes combinam a Artificial Analysis (Intelligence Index mais programação, matemática, GPQA Diamond e τ²-Bench) com o SWE-bench Verified, a fração de issues reais do GitHub resolvidos. A evidência de produção é do próprio OrcaRouter: taxas de vitória no Blind Battle mais telemetria ao vivo do gateway — taxa de sucesso, latência e volume de tokens roteados. A adoção usa a participação de tokens publicada pelo OpenRouter.

Como as pontuações se tornam comparáveis

As fontes pontuam em escalas diferentes (Elo, índices 0–100, % resolvido), então cada sinal é padronizado contra o quadro atual e mapeado para 0–100: 50 é a média do quadro e cada 15 pontos valem um desvio padrão, com limites nos extremos. Um modelo precisa de pelo menos duas famílias de evidência independentes para ranquear, e o quadro lista o top 25 por pontuação composta.

Quadros por caso de uso

Os quadros de texto, programação, visão, matemática, raciocínio e agentes recalculam a mesma mistura sobre sinais adequados ao segmento — programação troca para os benchmarks de código e o SWE-bench Verified, visão usa a arena de visão do LMArena — e os Blind Battles só pareiam modelos do mesmo segmento.

Atualidade e jogo limpo

Os feeds externos são atualizados diariamente e a telemetria própria é ao vivo; modelos novos entram com evidência externa em até 48 horas após o lançamento. Nenhum número autodeclarado de fornecedor é usado em lugar algum, o buzz da comunidade aparece apenas como contexto e nunca alimenta uma posição, e toda fonte externa é creditada sob o quadro.

Perguntas frequentes

Como o ranking de modelos de IA é calculado?

Cada modelo recebe uma pontuação combinada de quatro famílias de evidência — preferência humana às cegas (LMArena), benchmarks independentes (Artificial Analysis, SWE-bench), confiabilidade de produção da OrcaRouter e adoção do ecossistema (OpenRouter) — com pesos públicos fixos de 40 / 30 / 20 / 10.

Por que um modelo recém-lançado já tem posição?

Modelos novos entram no ranking com base em evidências externas em até 48 horas após o lançamento. A posição se consolida à medida que batalhas da comunidade e tráfego de produção se acumulam.

Com que frequência a classificação é atualizada?

As fontes externas atualizam diariamente e a telemetria da OrcaRouter é ao vivo; a data de atualização aparece no topo.

Por que um modelo está fora da lista?

Um modelo precisa de pelo menos duas fontes de evidência independentes para ser classificado, e o quadro mostra o top 25 por pontuação composta — modelos com evidência insuficiente ficam de fora até que outra fonte os cubra.

Os casos de uso são classificados separadamente?

Sim — os botões acima da tabela consolidada alternam entre os rankings de texto, programação, visão, matemática, raciocínio e agentes, e as batalhas só pareiam modelos comparáveis.

Quando a posição de um modelo novo se consolida?

Quando um modelo reúne três famílias de evidências, incluindo as batalhas e o tráfego do próprio OrcaRouter, sua posição passa a se basear na combinação completa, e não apenas em evidências externas.

De onde vêm os dados?

LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, mais a telemetria de produção da OrcaRouter — tudo atribuído sob o quadro.

Fornecedores podem manipular o ranking?

Difícil: pesos públicos, nada de números autodeclarados, e batalhas cegas mais tráfego real ancoram cada pontuação.

Posso exportar ou incorporar esses dados?

Sim — exportação JSON/CSV, selo de posição incorporável e feed RSS de mudanças, grátis com atribuição. Links no rodapé.

Modelos novos, mudanças de rank e lançamentos — acompanhe:X · @OrcaRouterDiscord