Inferência segura sem margem, por uso ou por assinatura. Ou traga as suas próprias chaves. O roteamento adaptativo reduz a sua fatura.
Sem cartão de crédito · no ar em 60 segundos
from openai import OpenAIclient = OpenAI(base_url="https://api.orcarouter.ai/v1",api_key=ORCAROUTER_API_KEY,)resp = client.chat.completions.create(model="orcarouter/auto", # we grade + routemessages=[{"role": "user", "content": "..."}],)
Uma linha. Avaliamos cada prompt, roteamos para frontier ou OSS e adicionamos $0.
Registos completos, gastos em tempo real e um recibo por prompt. Sem caixas negras.
Ver um reciboFaça versões dos prompts e reutilize chamadas em cache sem mexer no código.
Versionar um promptDefina base_url como api.orcarouter.ai/v1 e troque a sua chave de API. Sem outras alterações de código.
Avaliado em menos de 1 ms, com failover, cache e registos completos incluídos.
Direto a cada fornecedor à tarifa publicada — acrescentamos $0 por token.
Preços ao vivo, lado a lado — o que pagaria diretamente ao fornecedor.
| Modelo | Roteado para | Entrada /M | Saída /M | Contexto | Qualidade |
|---|---|---|---|---|---|
| z-ai/glm-5.3NOVO | Zhipu AI | $1.26 | $3.96 | 1M | 9.0 |
| qwen/qwen3.8-27b-freeNOVO | Alibaba Cloud | — | — | 66K | 4.0 |
| qwen/qwen3.8-27bNOVO | Alibaba Cloud | $0.330 | $2.40 | 262K | 4.0 |
| deepseek/deepseek-v4-pro-0813NOVO | DeepSeek | $0.442 | $0.884 | 1M | 7.0 |
| grok/grok-4.6NOVO | — | $2.00 | $6.00 | 500K | 9.0 |
| meta/muse-spark-1.2NOVO | — | $1.25 | $4.25 | 1M | 8.0 |
| qwen/qwen3.8-maxNOVO | Alibaba Cloud | $2.00 | $6.00 | 1M | 9.0 |
| deepseek/deepseek-v4-flash-0731NOVO | DeepSeek | $0.147 | $0.295 | 1M | 6.0 |
| + Mais 194 modelos · preços atualizados a cada 60 s | |||||
Recargas e assinaturas pelo preço do provedor. Não acrescentamos nada.
Recarregue quando quiser. Preço público e recibo em cada chamada.
Recarrega a sua carteira em cada período. Valor integral, qualquer modelo, com crédito bónus nos planos maiores.
Utilize suas próprias chaves de provedor, limites de taxa e créditos.
Os planos abaixo são recursos de equipe, não preço por token.
A nossa receita vem de funcionalidades de equipa opcionais.
O que estamos construindo e por quê — nossos posts mais recentes.

Um roteador de IA fica entre seu app e muitos modelos e escolhe o melhor modelo para cada requisição. O OrcaRouter avalia cada prompt em menos de 1 ms e o roteia — frontier para raciocínio difícil, open source para o rotineiro — em mais de 200 modelos, sem margem por token.
Um roteador LLM classifica cada prompt e o direciona ao modelo com maior chance de responder bem ao menor custo. O OrcaRouter roteia com embeddings contextuais e aprendizado online do tráfego real — 75,5% de precisão no ranking público RouterArena.
Sim. O OrcaRouter é um gateway de IA de produção: um endpoint compatível com OpenAI com roteamento adaptativo, balanceamento de carga, failover automático, guardrails, firewall de agentes, cache de prompts e observabilidade por requisição.
Assim como um CDN entrega conteúdo da melhor borda, um AI CDN entrega inferência do melhor provedor: capacidade saudável, rápida e barata, prompts repetidos em cache, failover em quedas. O OrcaRouter cumpre esse papel em mais de 200 modelos.
O roteamento adaptativo aprende o equilíbrio qualidade/custo com o seu próprio tráfego. Aponte cada workspace para "o mais barato que passa na régua", a máxima qualidade ou o equilíbrio — ou deixe o orcarouter/auto ajustar a escolha a cada requisição.
Eles resolvem problemas diferentes — governança vs. escolha de modelo — mas você não precisa de dois sistemas: o OrcaRouter roteia por requisição e aplica orçamentos, guardrails e observabilidade no mesmo salto.
A avaliação do prompt leva menos de 1 ms e a latência adicional total fica abaixo de 50 ms — geralmente recuperada muitas vezes por provedores mais rápidos e tokens de prompt em cache.
Não. Você paga a tarifa publicada de cada provedor; o OrcaRouter adiciona US$ 0 por token e monetiza com os recursos opcionais Team e Enterprise.
Sim — troque o base_url para https://api.orcarouter.ai/v1 e seu código dos SDKs da OpenAI, Anthropic ou Google continua funcionando: Chat Completions, Responses, Embeddings, Images, Audio e streaming.
O OrcaRouter tenta novamente em capacidade reserva saudável do mesmo modelo ou de um equivalente antes de a resposta começar — quedas upstream não chegam aos seus usuários.
Troque uma linha. É essa a migração.
Supera GPT-5 e Azure no RouterArenaApoiado por pesquisa publicada
OrcaRouterOpera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.
providers@orcarouter.ai