Classificados pelo tráfego de produção real do OrcaRouter e pelos votos da comunidade no Battle Mode — e não por benchmarks divulgados pelos fornecedores.
Atualizado em 2026-08-095 fontes de evidênciaModelos novos listados em 48 h
Medido em tráfego real
100.0%
Maior taxa de sucesso (7 d)
openai/gpt-4-turbo-2024-04-09
450 ms
Menor latência p50
OpenAI: GPT-4o (2024-08-06)
80.1%
Maior taxa de vitória da comunidade
Qwen3.7 Max (2026-05-20)
Classificação consolidada
Um ranking combinado por modelo — votos do LMArena, benchmarks independentes, adoção do ecossistema e evidências de produção do OrcaRouter, com pesos públicos fixos. Modelos novos entram desde o primeiro dia com base em evidências externas.
AA 63.1Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 1.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.
AA 52.3Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 6.7%Fatia de tokens do OpenRouter — adoção real do ecossistema.
AA 66.0Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).Win 58.7%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
AA 59.7Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 2.0%Fatia de tokens do OpenRouter — adoção real do ecossistema.
AA 52.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 4.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.Win 63.6%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
AA 60.9Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.9%Fatia de tokens do OpenRouter — adoção real do ecossistema.
AA 46.7Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.1%Fatia de tokens do OpenRouter — adoção real do ecossistema.Win 80.1%Taxa de vitórias no Blind Battle da OrcaRouter — votos cegos da nossa comunidade.
AA 56.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 1.2%Fatia de tokens do OpenRouter — adoção real do ecossistema.
Arena 1494Elo da comunidade LMArena — votos humanos às cegas na arena de texto (CC-BY-4.0).AA 62.1Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 0.3%Fatia de tokens do OpenRouter — adoção real do ecossistema.
Arena 1480Elo da comunidade LMArena — votos humanos às cegas na arena de texto (CC-BY-4.0).AA 51.6Índice de inteligência da Artificial Analysis — benchmark composto independente (0–100).OR 3.5%Fatia de tokens do OpenRouter — adoção real do ecossistema.
Taxas de vitória aos pares no Battle Mode — com que frequência cada modelo vence cada rival no confronto direto.
Benchmarks — inteligência vs. preço
Pontuações de inteligência independentes plotadas em relação ao preço de entrada. A linha tracejada é a fronteira de Pareto preço/inteligência.
Duelo às cegas
Duas respostas anônimas, um voto. Suas batalhas alimentam os 20% de evidência de produção do rank consolidado.
⚔️ Duelo às cegas
Dois modelos anônimos respondem ao mesmo prompt. Leia os dois, vote no vencedor e depois veja quem escreveu o quê — seu voto alimenta o ranking acima.
Metodologia — como este ranking funciona
Cada número desta página é medido, nunca autodeclarado. Este é o método completo por trás do ranking combinado — as mesmas regras para cada modelo, todos os dias.
Uma pontuação combinada, pesos públicos fixos
Cada modelo recebe uma pontuação composta de quatro famílias de evidência independentes: preferência humana às cegas 40%, benchmarks independentes 30%, evidência de produção do OrcaRouter 20% e adoção do ecossistema 10%. Os pesos são fixos e públicos — sem ajustes editoriais, sem posição paga, sem envios de fornecedores.
O que alimenta cada família
A preferência humana vem do Elo comunitário do LMArena — votos cegos em pares nas arenas de texto e visão (CC-BY-4.0). Os benchmarks independentes combinam a Artificial Analysis (Intelligence Index mais programação, matemática, GPQA Diamond e τ²-Bench) com o SWE-bench Verified, a fração de issues reais do GitHub resolvidos. A evidência de produção é do próprio OrcaRouter: taxas de vitória no Blind Battle mais telemetria ao vivo do gateway — taxa de sucesso, latência e volume de tokens roteados. A adoção usa a participação de tokens publicada pelo OpenRouter.
Como as pontuações se tornam comparáveis
As fontes pontuam em escalas diferentes (Elo, índices 0–100, % resolvido), então cada sinal é padronizado contra o quadro atual e mapeado para 0–100: 50 é a média do quadro e cada 15 pontos valem um desvio padrão, com limites nos extremos. Um modelo precisa de pelo menos duas famílias de evidência independentes para ranquear, e o quadro lista o top 25 por pontuação composta.
Quadros por caso de uso
Os quadros de texto, programação, visão, matemática, raciocínio e agentes recalculam a mesma mistura sobre sinais adequados ao segmento — programação troca para os benchmarks de código e o SWE-bench Verified, visão usa a arena de visão do LMArena — e os Blind Battles só pareiam modelos do mesmo segmento.
Atualidade e jogo limpo
Os feeds externos são atualizados diariamente e a telemetria própria é ao vivo; modelos novos entram com evidência externa em até 48 horas após o lançamento. Nenhum número autodeclarado de fornecedor é usado em lugar algum, o buzz da comunidade aparece apenas como contexto e nunca alimenta uma posição, e toda fonte externa é creditada sob o quadro.
Perguntas frequentes
Como o ranking de modelos de IA é calculado?
Cada modelo recebe uma pontuação combinada de quatro famílias de evidência — preferência humana às cegas (LMArena), benchmarks independentes (Artificial Analysis, SWE-bench), confiabilidade de produção da OrcaRouter e adoção do ecossistema (OpenRouter) — com pesos públicos fixos de 40 / 30 / 20 / 10.
Por que um modelo recém-lançado já tem posição?
Modelos novos entram no ranking com base em evidências externas em até 48 horas após o lançamento. A posição se consolida à medida que batalhas da comunidade e tráfego de produção se acumulam.
Com que frequência a classificação é atualizada?
As fontes externas atualizam diariamente e a telemetria da OrcaRouter é ao vivo; a data de atualização aparece no topo.
Por que um modelo está fora da lista?
Um modelo precisa de pelo menos duas fontes de evidência independentes para ser classificado, e o quadro mostra o top 25 por pontuação composta — modelos com evidência insuficiente ficam de fora até que outra fonte os cubra.
Os casos de uso são classificados separadamente?
Sim — os botões acima da tabela consolidada alternam entre os rankings de texto, programação, visão, matemática, raciocínio e agentes, e as batalhas só pareiam modelos comparáveis.
Quando a posição de um modelo novo se consolida?
Quando um modelo reúne três famílias de evidências, incluindo as batalhas e o tráfego do próprio OrcaRouter, sua posição passa a se basear na combinação completa, e não apenas em evidências externas.
De onde vêm os dados?
LMArena (CC-BY-4.0), Artificial Analysis, SWE-bench e OpenRouter, mais a telemetria de produção da OrcaRouter — tudo atribuído sob o quadro.
Fornecedores podem manipular o ranking?
Difícil: pesos públicos, nada de números autodeclarados, e batalhas cegas mais tráfego real ancoram cada pontuação.
Posso exportar ou incorporar esses dados?
Sim — exportação JSON/CSV, selo de posição incorporável e feed RSS de mudanças, grátis com atribuição. Links no rodapé.