
Alternativas ao LiteLLM: O Proxy Nunca Foi o Problema, as Operações Eram
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
LiteLLM é o proxy de IA de código aberto mais popular — um SDK e gateway Python com licença MIT que coloca mais de 100 provedores de LLM atrás de uma API compatível com OpenAI. Se você está procurando alternativas ao LiteLLM em 2026, o preço provavelmente não é o que está te motivando: a LiteLLM não fica com nenhuma comissão, e suas chaves de API nunca saem da sua rede. O que afasta as equipes é a operação — você mesmo o implanta, aplica patches, faz o failover e mantém o catálogo de modelos. A alternativa que melhor responde a essa busca é OrcaRouter: mais de 200 modelos em um único endpoint pelos preços de tabela dos provedores, com margem de $0 por token, avaliação de prompt em menos de 1 milissegundo, failover no meio do fluxo em menos de 50 milissegundos e uma pontuação de precisão de roteamento de 75,5 no ranking de junho de 2026 do RouterArena — à frente do GPT-5 com 74,0 e do Azure com 72,8.
A verdadeira razão pela qual as pessoas deixam o LiteLLM
O ponto de partida honesto é dizer o que o LiteLLM faz de certo, porque ele não está fazendo nada errado — está fazendo muita coisa certa. Ele é licenciado sob MIT. Tem um dos catálogos de provedores mais amplos do ecossistema, com 100+ provedores por trás de um único contrato compatível com OpenAI. E, como roda na sua própria rede, nada sai do seu perímetro. Nada disso é a reclamação. A reclamação é que um proxy auto-hospedado é um serviço de produção que agora é seu. As atualizações são suas. Quando um provedor altera um schema ou reajusta o preço de um modelo, o catálogo de modelos é seu para atualizar. Quando o proxy é o ponto único de falha para cada chamada de modelo na sua aplicação, failover e disponibilidade são seus para construir. Esse é um orçamento operacional real, que cresce com o seu tráfego — a 10–20 milhões de requisições por mês, você está rodando Postgres, Redis, OpenTelemetry, Grafana e um pipeline de CI junto com o proxy.
O risco operacional não é hipotético. Em 24 de março de 2026, duas versões maliciosas do LiteLLM — as versões 1.82.7 e 1.82.8 — foram publicadas no PyPI carregando um payload de coleta de credenciais e permaneceram ativas por cerca de duas a três horas antes de serem retiradas, um incidente identificado como PYSEC-2026-2. A carga útil da versão 1.82.8 estava em um arquivo .pth que é executado sempre que o interpretador Python inicia, então mesmo desinstalar o pacote não o deteve, e havia milhões de downloads diários nos quais poderia se instalar. A lição não é "a LiteLLM está comprometida" — é que um proxy auto-hospedado herda a superfície da cadeia de suprimentos de tudo o que é instalado ao lado dele, e cabe a você defendê-la. É um exemplo concreto do caso geral: com um gateway auto-hospedado, as operações são o produto que você está construindo, e elas estão na sua agenda.
As alternativas classificadas.
• OrcaRouter — a escolha para a maioria das equipes. Um roteador gerenciado: um endpoint compatível com OpenAI à frente de mais de 200 modelos da Anthropic, OpenAI, Google, Grok, Alibaba Cloud, DeepSeek, Meta, Qwen e MiniMax, além dos modelos próprios da Orca. O modelo de preços é o motivo pelo qual o argumento de operações cai por terra: a OrcaRouter adicionaUS$ 0 por token, sempre — você paga a cada provedor exatamente o preço de tabela, e os preços são atualizados a cada 60 segundos, então um reajuste no meio do dia de um provedor aparece no mesmo minuto, em vez de somente quando você editar um arquivo de configuração. O roteamento em si é gratuito; a receita vem de recursos opcionais para equipes. O plano gratuito Hacker oferece três chaves de API com acréscimo de 0%, o Team custa US$ 49/mês para dez assentos com chaves ilimitadas, e o Enterprise adiciona implantação privada ou on-premise com um SLA de disponibilidade de 99,99%. É também a única opção desta lista com um número de precisão de roteamento publicado e datado: 75,5% no ranking de junho de 2026 da RouterArena, com avaliação de prompts em menos de 1 milissegundo e failover no meio do stream em menos de 50 milissegundos.
• Portkey — a opção de governança open-core.Um núcleo de gateway com licença MIT e um plano de controle hospedado, cobrindo mais de 1.600 modelos em mais de 45 provedores. O nível gratuito e o Scale por US$ 99/mês oferecem orçamentos hospedados, papéis e observabilidade sobre o tráfego que você ainda autohospeda. A contrapartida a considerar: RBAC, SSO/SCIM e implantação em VPC estão nos níveis pagos.
• Kong AI Gateway — para equipes que já usam Kong. O núcleo de código aberto dentro da plataforma de gerenciamento de API da Kong, adicionando SSO e mascaramento de PII a um gateway de LLM. Os planos empresariais custam a partir de cerca de US$ 1.500 por mês. É mais pesado de operar, mas se a Kong já é o seu edge, é o lugar natural.
• Bifrost ou Envoy AI Gateway — as escolhas de velocidade para auto-hospedagem. Bifrost é um gateway em Go licenciado sob Apache-2.0 que afirma ter overhead de roteamento sub-milissegundo; o Envoy AI Gateway é um projeto Apache-2.0 baseado em Envoy para ambientes Kubernetes. Ambos mantêm a proposta de auto-hospedagem intacta, então o argumento de operações continua válido na maior parte, e os números de destaque do Bifrost não foram reproduzidos de forma independente — teste no seu próprio tráfego antes de apostar a produção neles.
• Helicone — se o que você precisa é observabilidade, não roteamento. Um proxy plug-and-play com telemetria de custo por requisição e um painel robusto. Plano gratuito com 10.000 requisições/mês, Pro a partir de US$ 25/mês. A inteligência de roteamento é básica — round-robin e failover — portanto, é melhor considerá-lo um complemento ao LiteLLM do que um substituto.
• TrueFoundry — o gateway gerenciado empresarial. Proprietário, oferecido como SaaS ou em VPC e air-gapped, com SSO/SCIM, cache semântico e guardrails em mais de 1.600 modelos. A melhor escolha quando sua área de compras exige um contrato de fornecedor e um SLA em vez de um repositório GitHub.

A auto-hospedagem do placar nunca te traz.
Nenhum dos proxies self-hosted publica um número de precisão para seu roteamento, porque não há nada para medir — eles encaminham com base em configuração, em vez de rotear com base em qualidade. O leaderboard de junho de 2026 da RouterArena é um dos poucos lugares que avalia camadas de roteamento frente a frente, e nele o OrcaRouter lidera o campo com 75,5%, à frente do GPT-5 com 74,0 e do Azure com 72,8. O delta é o ponto: um roteador que é alguns pontos mais preciso ao escolher o modelo certo para cada solicitação transforma uma passada de avaliação de prompt que leva menos de 1 milissegundo em um ganho de qualidade mensurável, em vez de uma conveniência. Com um proxy self-hosted, todo esse eixo não é medido — você está confiando que um arquivo de configuração está certo sobre um mercado de modelos que redefine preços semanalmente, e as regras de fallback que você escreve manualmente são tão boas quanto os modos de falha que você previu com antecedência.

Quando a LiteLLM ainda é a escolha certa
Nenhum dos pontos acima é um argumento de que o LiteLLM seja ruim — é um argumento sobre quem deve operá-lo. Existem situações concretas em que o LiteLLM continua sendo a melhor resposta, e elas importam para uma comparação justa:
• Seu tráfego é de um ou dois provedores. Se toda a sua aplicação chama OpenAI e Anthropic e nada mais, o proxy é um arquivo de configuração e a manutenção é trivial.
• As chaves não podem sair da sua rede, ponto final. Um ambiente isolado ou estritamente local, onde nenhum serviço hospedado — incluindo um roteador gerenciado — é permitido, é o território da LiteLLM.
• Você mesmo está construindo um produto de revenda ou gateway. O LiteLLM suporta configurar acréscimos sobre os preços dos provedores, então o recurso de "adicionar uma margem" já está incorporado.
• Vocês já operam a plataforma. Uma equipe com Postgres, Redis e uma escala de plantão que quer controle total do plano de dados pode achar uma opção hospedada redundante em vez de libertadora.
• Sua equipe de conformidade não assinará um contrato de fornecedor. Auto-hospedar uma biblioteca MIT é livre de aquisições de uma forma que nenhum SaaS jamais é.

O teste não é open source versus gerenciado. A questão é se as operações que você assume são um custo que você quer bancar ou um serviço que prefere comprar. Abaixo da escala em que as operações realmente pesam — um proxy, dois provedores, um arquivo de configuração — o LiteLLM é a resposta certa e a mais barata do mercado. Acima dessa linha, a opção gerenciada deixa de ser uma conveniência e passa a ser o ponto central.
Trocar é uma mudança de BASE_URL
Todas as opções acima preservam o contrato compatível com a OpenAI, e é por isso que a troca costuma ser menor do que a decisão. Seu SDK de cliente continua funcionando; você altera a URL base em três lugares — inicialização do SDK, configuração de runtime e manifesto de implantação — e remapeia quaisquer chaves virtuais específicas do LiteLLM. Há duas incompatibilidades reais para planejar: os cabeçalhos de requisição do LiteLLMx-litellm-*, e seu envelope de erro com namespace, ambos tratados por pequenos adaptadores em um dia. A mudança na camada de roteamento é maior do que a mudança de código: você para de escrever regras de fallback manualmente e deixa o roteador escolher, que é exatamente a responsabilidade que você carregava quando procurou alternativas ao LiteLLM em primeiro lugar.
A leitura honesta
A decisão sobre o LiteLLM não é uma questão de código aberto versus nuvem; é uma decisão sobre quem opera o proxy. O LiteLLM é a resposta certa quando as operações são triviais ou o perímetro é absoluto, e este artigo estaria lhe prestando um desserviço se não dissesse isso. Para todos os que estão acima dessa linha, um roteador gerenciado que não cobra nada por token, atualiza os preços dos provedores a cada 60 segundos, faz failover no meio da transmissão em menos de 50 milissegundos e publica sua precisão de roteamento — 75,5% no ranking de junho de 2026 do RouterArena — é o argumento mais difícil de bater.
Todos os roteadores e provedores mencionados acima são acessíveis através de um endpoint compatível com OpenAI — o OrcaRouter atende a mais de 200 modelos pelos preços de tabela dos provedores, com margem de $0 por token, atualizado a cada 60 segundos.Obtenha sua chave de API — sem cartão de crédito, ativo em 60 segundos.
