
O Que É um Roteador de LLM? A Camada de Seleção de Modelos, a Matemática Real e Quando Dispensá-lo
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Um roteador de LLM é uma camada de software que fica entre sua aplicação e os provedores de modelos e decide, para cada requisição, qual modelo deve respondê-la — um modelo barato e rápido como DeepSeek V4 Flash quando a tarefa é fácil, um modelo de ponta como Claude Opus 5 quando é realmente difícil. A questão é dinheiro: o DeepSeek V4 Flash custa $0,09 por milhão de tokens de entrada e o Claude Opus 5 custa $5,00, taxas diretas dos provedores de acordo com o catálogo de modelos da OrcaRouter, lidas em 2026-08-10 — uma diferença de 55× na mesma chamada. Envie os 80% fáceis do seu tráfego para o modelo barato e mantenha os 20% difíceis no modelo caro, e você estará puxando a maior alavanca de custo que a maioria das equipes nunca toca.
O que um roteador de LLM realmente é
Tirando o marketing, um roteador de modelos tem três funções, todas elas entediantes e todas valiosas. É um único endpoint: seu código chama uma URL compatível com OpenAI em vez de um SDK por provedor. Ele avalia a solicitação, estimando o quão difícil ela é, e a encaminha: tarefas fáceis para um modelo barato, raciocínio genuinamente difícil para um modelo de fronteira. E ele faz failover: se o provedor escolhido limitar sua taxa de requisições ou retornar um 5xx, o roteador tenta novamente com um modelo saudável, sem que seu aplicativo jamais veja o erro.
A etapa de decisão é onde os roteadores diferem, e o espectro é um já conhecido. Roteadores baseados em regras associam palavras-chave ou comprimento do prompt a um modelo — em menos de um milissegundo, previsíveis, frágeis quando preços ou modelos mudam. Roteadores semânticos incorporam o prompt e roteiam por significado, então "qual é o meu saldo?" e "quanto dinheiro eu tenho" seguem o mesmo caminho. Roteadores aprendidos observam o tráfego real e mudam para o modelo que está vencendo em qualidade por dólar. A mecânica de cada um — incluindo as faixas de precisão dos diferentes tipos de classificadores e o modo automático que avalia cada prompt — recebe tratamento completo em nosso guia, Auto Router for LLMs; aqui o ponto é que a inteligência de roteamento existe em um espectro, e qual ponto você precisa é uma decisão de produto, não uma lista de verificação de recursos.

Se você também já viu "AI router" usado para hardware de Wi-Fi com NPU — esse é um produto diferente que por acaso compartilha o nome, e nós desvendamos essa colisão no nosso guia de AI router. Tudo neste artigo é sobre a categoria de software.
O spread de preços é o que torna isso lucrativo.
Um roteador só se justifica quando os modelos diferem muito em preço, e neste momento eles diferem enormemente. Todas as tarifas abaixo são preços diretos do provedor por 1 milhão de tokens do catálogo de modelos OrcaRouter, lidos em 2026-08-10:

Veja a diferença de preços e o argumento se escreve sozinho. DeepSeek V4 Flash a US$ 0,09 contra Claude Opus 5 a US$ 5,00 é cerca de 55× de diferença apenas nos tokens de entrada, e a lacuna entre a camada barata e a camada de fronteira agora é uma característica permanente do mercado, e não um desconto único. Se o seu tráfego é uma mistura típica — a maioria de solicitações curtas e bem especificadas e uma minoria de raciocínio genuinamente difícil — rodar tudo na fronteira significa pagar o preço máximo pelos 80% fáceis.
É aqui que os resultados atuais da primeira página para "llm router" decepcionam. O verbete do glossário da Decagon, por exemplo, cita "GPT-4o, Claude 3.5 Sonnet e Gemini 1.5 Pro" a "$5–15 por milhão de tokens de entrada" — modelos que eram atuais há dois anos, com preços aproximadamente o dobro dos de hoje. O mercado mudou; a definição não. Essa é a maior razão para desconfiar de um explicador de roteador de LLM sem datas.
O que a pesquisa sobre poupança realmente diz
Os cálculos acima são reais, e a pesquisa também — mas o quadro honesto é uma faixa, não um número único.

Aqui está a aritmética calculada, com as premissas declaradas para que você possa ajustá-las. Um bot de suporte que lida com 100.000 conversas por mês, cada uma enviando 1.000 tokens de entrada e gerando 200 tokens de saída: rodar tudo no Claude Sonnet 5 custa cerca de US$ 400 por mês. Roteie os 80% fáceis para o DeepSeek V4 Flash e mantenha os 20% difíceis no Claude Sonnet 5, e o mesmo tráfego custa cerca de US$ 90 — aproximadamente 78% mais barato, antes de qualquer cache de prompt, o que ampliaria ainda mais a diferença.
A forma de economizar: roteamento agressivo economiza 60–85% quando seu tráfego é majoritariamente fácil, roteamento balanceado economiza 35–45%, e até mesmo roteamento conservador economiza 10–15%. O valor exato para você é uma propriedade do seu tráfego, medido em seus próprios prompts — não uma constante que você pode copiar de um post de blog.
Os três custos que o roteamento esconde
Os dois custos que ninguém inclui no verbete do glossário são latência e precisão, e há um terceiro que é mais sutil.
Latência.Cada requisição roteada paga um imposto de classificação antes mesmo de o modelo começar. Um classificador baseado em regras leva menos de um milissegundo; um pequeno modelo de embeddings ou classificador adiciona cerca de 50–200ms; um classificador de domínio treinado, ainda mais. Um bom roteador esconde a maior parte disso ao classificar enquanto prepara a requisição upstream, e um endpoint de roteamento em produção mediu uma sobrecarga ponta a ponta com mediana de aproximadamente 55ms — menos de 1% de um tempo de resposta normal. Mas se seu tráfego for em tempo real — um agente de voz, uma interface que precisa responder em 300ms — um salto de roteamento na casa das centenas de milissegundos pode ser a diferença entre utilizável e inutilizável. Essa única restrição é o motivo mais comum pelo qual uma equipe com um caso de uso legítimo de roteamento decide não rotear.
Precisão. Um roteador só é tão bom quanto o julgamento que orienta suas decisões de roteamento. Um classificador treinado em benchmarks genéricos pode errar com confiança no seu domínio: sua tarefa de sumarização "fácil" pode ser fácil para o modelo de fronteira e impossível para o modelo barato. O modo de falha é silencioso — o usuário apenas recebe uma saída pior e ninguém registra isso — e é por isso que todo roteador confiável vem com um piso de qualidade ou um modo balanceado.
Invalidação de cache. Tanto a OpenAI quanto a Anthropic oferecem descontos em prefixos de prompt repetidos, normalmente cerca de 90% de desconto nos tokens de entrada em leituras de cache. Se a sua camada de roteamento reescreve, reordena ou injeta um timestamp rotativo no prompt, ela invalida o prefixo e joga esse desconto fora. Um bom roteador passa o prompt byte a byte e deixa o cache do próprio provedor funcionar.
A recomendação: um roteador gerenciado com um nível mínimo de qualidade.
Se você executa mais de um modelo em produção, seu tráfego é uma mistura do fácil e do difícil, e seu volume é grande o suficiente para que uma porcentagem represente dinheiro de verdade, a recomendação é um roteador gerenciado que mantém um piso de qualidade e não cobra margem sobre tokens. Nosso próprio produto é o OrcaRouter, e é sobre ele que podemos falar em detalhes; a lista de verificação a seguir se aplica a qualquer roteador que você avaliar.
O modo automático do OrcaRouter — solicite o nome do modelo orcarouter/auto no endpoint compatível com o padrão OpenAI — avalia cada prompt e o roteia entre mais de 200 modelos. Ele inclui quatro políticas de roteamento, com Balanced como padrão: Cheapest envia para o modelo de menor custo que pode responder; Balanced envia para o modelo mais barato que atinge o padrão de qualidade; Quality envia para o modelo de maior pontuação, independentemente do preço; Adaptive aprende com o tráfego ao vivo e ajusta o roteamento à medida que avança. A avaliação é medida em menos de um milissegundo, a latência total adicionada fica abaixo de 50ms e, se o provedor escolhido aplicar rate limit ou retornar erros, o roteador faz failover no meio do fluxo para um modelo saudável em menos de 50ms. Não há markup em nenhuma camada: você paga a cada provedor exatamente o preço publicado — os US$ 0,09 ou US$ 5,00 citados acima são o que você paga — e o roteamento em si é gratuito.
Em termos de precisão, o ranking RouterArena de junho de 2026 atribui ao OrcaRouter 75,5%, contra 74,0% da alternativa monitorada mais próxima (de acordo com orcarouter.ai). Um único ranking não prova nada — trate-o como um único ponto de dados e faça sua própria avaliação com seus próprios prompts antes de confiar em qualquer roteador com tráfego de produção, incluindo o nosso. E, se você está tentando decidir se precisa de recursos de roteador ou de gateway, a distinção entre roteador e gateway é abordada no nosso guia, AI API Gateway in 2026.
Quando esta recomendação está errada
A skip list honesta, dita simplesmente:
A versão curta
Um roteador de LLM é a camada que escolhe qual modelo responde a cada solicitação — barato e rápido para a maioria fácil, de ponta para a minoria difícil, com failover quando um provedor cai. Compensa quando seus modelos diferem muito em preço (DeepSeek V4 Flash a $0.09 contra Claude Opus 5 a $5.00 por 1M de tokens de entrada é uma diferença de 55×) e seu tráfego é uma mistura de fácil e difícil. A pesquisa coloca o teto em torno de 85% de economia com um piso de qualidade, e o piso em qualquer valor que sua avaliação indicar. Isso custa latência e algum controle de precisão, e é a resposta errada para empresas de modelo único, orçamentos de latência abaixo de 300ms, gastos mínimos e equipes que não conseguem medir a qualidade da saída. Quando for o caso, execute-o atrás de um piso de qualidade sem marcação de tokens, roteie uma fatia primeiro e leia os logs de roteamento antes de acreditar na economia.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
