Cartão de título hero que diz 'O que é um roteador de LLM?' com o subtítulo 'A camada de seleção de modelos, a matemática real e quando ignorá-la', mostrando três cartões arredondados rotulados como ONE ENDPOINT, GRADE & ROUTE e FAILOVER em um fundo branco com detalhes em azul e ciano e o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

O Que É um Roteador de LLM? A Camada de Seleção de Modelos, a Matemática Real e Quando Dispensá-lo

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um roteador de LLM é uma camada de software que fica entre sua aplicação e os provedores de modelos e decide, para cada requisição, qual modelo deve respondê-la — um modelo barato e rápido como DeepSeek V4 Flash quando a tarefa é fácil, um modelo de ponta como Claude Opus 5 quando é realmente difícil. A questão é dinheiro: o DeepSeek V4 Flash custa $0,09 por milhão de tokens de entrada e o Claude Opus 5 custa $5,00, taxas diretas dos provedores de acordo com o catálogo de modelos da OrcaRouter, lidas em 2026-08-10 — uma diferença de 55× na mesma chamada. Envie os 80% fáceis do seu tráfego para o modelo barato e mantenha os 20% difíceis no modelo caro, e você estará puxando a maior alavanca de custo que a maioria das equipes nunca toca.

O que um roteador de LLM realmente é

Tirando o marketing, um roteador de modelos tem três funções, todas elas entediantes e todas valiosas. É um único endpoint: seu código chama uma URL compatível com OpenAI em vez de um SDK por provedor. Ele avalia a solicitação, estimando o quão difícil ela é, e a encaminha: tarefas fáceis para um modelo barato, raciocínio genuinamente difícil para um modelo de fronteira. E ele faz failover: se o provedor escolhido limitar sua taxa de requisições ou retornar um 5xx, o roteador tenta novamente com um modelo saudável, sem que seu aplicativo jamais veja o erro.

A etapa de decisão é onde os roteadores diferem, e o espectro é um já conhecido. Roteadores baseados em regras associam palavras-chave ou comprimento do prompt a um modelo — em menos de um milissegundo, previsíveis, frágeis quando preços ou modelos mudam. Roteadores semânticos incorporam o prompt e roteiam por significado, então "qual é o meu saldo?" e "quanto dinheiro eu tenho" seguem o mesmo caminho. Roteadores aprendidos observam o tráfego real e mudam para o modelo que está vencendo em qualidade por dólar. A mecânica de cada um — incluindo as faixas de precisão dos diferentes tipos de classificadores e o modo automático que avalia cada prompt — recebe tratamento completo em nosso guia, Auto Router for LLMs; aqui o ponto é que a inteligência de roteamento existe em um espectro, e qual ponto você precisa é uma decisão de produto, não uma lista de verificação de recursos.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Se você também já viu "AI router" usado para hardware de Wi-Fi com NPU — esse é um produto diferente que por acaso compartilha o nome, e nós desvendamos essa colisão no nosso guia de AI router. Tudo neste artigo é sobre a categoria de software.

O spread de preços é o que torna isso lucrativo.

Um roteador só se justifica quando os modelos diferem muito em preço, e neste momento eles diferem enormemente. Todas as tarifas abaixo são preços diretos do provedor por 1 milhão de tokens do catálogo de modelos OrcaRouter, lidos em 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

Veja a diferença de preços e o argumento se escreve sozinho. DeepSeek V4 Flash a US$ 0,09 contra Claude Opus 5 a US$ 5,00 é cerca de 55× de diferença apenas nos tokens de entrada, e a lacuna entre a camada barata e a camada de fronteira agora é uma característica permanente do mercado, e não um desconto único. Se o seu tráfego é uma mistura típica — a maioria de solicitações curtas e bem especificadas e uma minoria de raciocínio genuinamente difícil — rodar tudo na fronteira significa pagar o preço máximo pelos 80% fáceis.

É aqui que os resultados atuais da primeira página para "llm router" decepcionam. O verbete do glossário da Decagon, por exemplo, cita "GPT-4o, Claude 3.5 Sonnet e Gemini 1.5 Pro" a "$5–15 por milhão de tokens de entrada" — modelos que eram atuais há dois anos, com preços aproximadamente o dobro dos de hoje. O mercado mudou; a definição não. Essa é a maior razão para desconfiar de um explicador de roteador de LLM sem datas.

O que a pesquisa sobre poupança realmente diz

Os cálculos acima são reais, e a pesquisa também — mas o quadro honesto é uma faixa, não um número único.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Aqui está a aritmética calculada, com as premissas declaradas para que você possa ajustá-las. Um bot de suporte que lida com 100.000 conversas por mês, cada uma enviando 1.000 tokens de entrada e gerando 200 tokens de saída: rodar tudo no Claude Sonnet 5 custa cerca de US$ 400 por mês. Roteie os 80% fáceis para o DeepSeek V4 Flash e mantenha os 20% difíceis no Claude Sonnet 5, e o mesmo tráfego custa cerca de US$ 90 — aproximadamente 78% mais barato, antes de qualquer cache de prompt, o que ampliaria ainda mais a diferença.

A forma de economizar: roteamento agressivo economiza 60–85% quando seu tráfego é majoritariamente fácil, roteamento balanceado economiza 35–45%, e até mesmo roteamento conservador economiza 10–15%. O valor exato para você é uma propriedade do seu tráfego, medido em seus próprios prompts — não uma constante que você pode copiar de um post de blog.

Os três custos que o roteamento esconde

Os dois custos que ninguém inclui no verbete do glossário são latência e precisão, e há um terceiro que é mais sutil.

Latência.Cada requisição roteada paga um imposto de classificação antes mesmo de o modelo começar. Um classificador baseado em regras leva menos de um milissegundo; um pequeno modelo de embeddings ou classificador adiciona cerca de 50–200ms; um classificador de domínio treinado, ainda mais. Um bom roteador esconde a maior parte disso ao classificar enquanto prepara a requisição upstream, e um endpoint de roteamento em produção mediu uma sobrecarga ponta a ponta com mediana de aproximadamente 55ms — menos de 1% de um tempo de resposta normal. Mas se seu tráfego for em tempo real — um agente de voz, uma interface que precisa responder em 300ms — um salto de roteamento na casa das centenas de milissegundos pode ser a diferença entre utilizável e inutilizável. Essa única restrição é o motivo mais comum pelo qual uma equipe com um caso de uso legítimo de roteamento decide não rotear.

Precisão. Um roteador só é tão bom quanto o julgamento que orienta suas decisões de roteamento. Um classificador treinado em benchmarks genéricos pode errar com confiança no seu domínio: sua tarefa de sumarização "fácil" pode ser fácil para o modelo de fronteira e impossível para o modelo barato. O modo de falha é silencioso — o usuário apenas recebe uma saída pior e ninguém registra isso — e é por isso que todo roteador confiável vem com um piso de qualidade ou um modo balanceado.

Invalidação de cache. Tanto a OpenAI quanto a Anthropic oferecem descontos em prefixos de prompt repetidos, normalmente cerca de 90% de desconto nos tokens de entrada em leituras de cache. Se a sua camada de roteamento reescreve, reordena ou injeta um timestamp rotativo no prompt, ela invalida o prefixo e joga esse desconto fora. Um bom roteador passa o prompt byte a byte e deixa o cache do próprio provedor funcionar.

A recomendação: um roteador gerenciado com um nível mínimo de qualidade.

Se você executa mais de um modelo em produção, seu tráfego é uma mistura do fácil e do difícil, e seu volume é grande o suficiente para que uma porcentagem represente dinheiro de verdade, a recomendação é um roteador gerenciado que mantém um piso de qualidade e não cobra margem sobre tokens. Nosso próprio produto é o OrcaRouter, e é sobre ele que podemos falar em detalhes; a lista de verificação a seguir se aplica a qualquer roteador que você avaliar.

O modo automático do OrcaRouter — solicite o nome do modelo orcarouter/auto no endpoint compatível com o padrão OpenAI — avalia cada prompt e o roteia entre mais de 200 modelos. Ele inclui quatro políticas de roteamento, com Balanced como padrão: Cheapest envia para o modelo de menor custo que pode responder; Balanced envia para o modelo mais barato que atinge o padrão de qualidade; Quality envia para o modelo de maior pontuação, independentemente do preço; Adaptive aprende com o tráfego ao vivo e ajusta o roteamento à medida que avança. A avaliação é medida em menos de um milissegundo, a latência total adicionada fica abaixo de 50ms e, se o provedor escolhido aplicar rate limit ou retornar erros, o roteador faz failover no meio do fluxo para um modelo saudável em menos de 50ms. Não há markup em nenhuma camada: você paga a cada provedor exatamente o preço publicado — os US$ 0,09 ou US$ 5,00 citados acima são o que você paga — e o roteamento em si é gratuito.

Em termos de precisão, o ranking RouterArena de junho de 2026 atribui ao OrcaRouter 75,5%, contra 74,0% da alternativa monitorada mais próxima (de acordo com orcarouter.ai). Um único ranking não prova nada — trate-o como um único ponto de dados e faça sua própria avaliação com seus próprios prompts antes de confiar em qualquer roteador com tráfego de produção, incluindo o nosso. E, se você está tentando decidir se precisa de recursos de roteador ou de gateway, a distinção entre roteador e gateway é abordada no nosso guia, AI API Gateway in 2026.

Quando esta recomendação está errada

A skip list honesta, dita simplesmente:

A versão curta

Um roteador de LLM é a camada que escolhe qual modelo responde a cada solicitação — barato e rápido para a maioria fácil, de ponta para a minoria difícil, com failover quando um provedor cai. Compensa quando seus modelos diferem muito em preço (DeepSeek V4 Flash a $0.09 contra Claude Opus 5 a $5.00 por 1M de tokens de entrada é uma diferença de 55×) e seu tráfego é uma mistura de fácil e difícil. A pesquisa coloca o teto em torno de 85% de economia com um piso de qualidade, e o piso em qualquer valor que sua avaliação indicar. Isso custa latência e algum controle de precisão, e é a resposta errada para empresas de modelo único, orçamentos de latência abaixo de 300ms, gastos mínimos e equipes que não conseguem medir a qualidade da saída. Quando for o caso, execute-o atrás de um piso de qualidade sem marcação de tokens, roteie uma fatia primeiro e leia os logs de roteamento antes de acreditar na economia.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube