Privado por arquitetura · Protegido em cada chamada

Um gateway. Todos os modelos. Seus dados continuam seus.

Inferência privada em 200+ modelos, protegida em cada chamada. Zero margem no pagamento por uso e nas assinaturas. Ou traga as suas próprias chaves.

Sem cartão de crédito · no ar em 60 segundos · nenhum prompt é registrado a menos que você ative

200+
modelos, um endpoint
0%
de markup por token, nunca
0 B
prompts armazenados por padrão
o registro fica desativado até você ativá-lo
40+%
de economia no custo de inferência
com roteamento adaptativo sensível ao cache
99%
de precisão no roteamento
com escalonamento para modelos de fronteira
<10ms
de latência de roteamento com failover automático
Todas as integrações
from openai import OpenAI
 
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=ORCAROUTER_API_KEY,
)
resp = client.chat.completions.create(
model="orcarouter/auto", # we grade + route
messages=[{"role": "user", "content": "..."}],
)

Uma linha. Avaliamos cada prompt, roteamos para frontier ou OSS e adicionamos $0.

Privacidade e segurança

Privado por arquitetura. Protegido em cada chamada.

O que você pergunta a uma IA continua sendo seu. O que seus agentes fazem é você quem aprova.

Seus dados

O que o modelo e nossos servidores conseguem ver.

  • Data Cloaking

    Mascarado.

    Nomes, e-mails e números de cartão são trocados por substitutos antes de chegar ao modelo que você chama, e restaurados na resposta.

    Em um clique
  • ZDR

    Nada é guardado.

    Os prompts não são registrados a menos que você ative o registro. Assine um acordo de retenção zero para bloqueá-lo.

    Padrão
  • PQC

    Resistente a computadores quânticos.

    Os logs que você escolher manter são selados com ML-KEM híbrido. A criptografia é open source: SCUTTLE.

    Padrão
  • Data Residency

    Sua região.

    Declare EUA, UE, Reino Unido, Ásia-Pacífico ou China, e seus relatórios de conformidade recebem essa região.

    Mediante solicitação
  • TEE

    Protegido até durante a execução.

    Enclaves atestados, com prova para cada resposta.

    Mediante solicitação

Seus agentes

O que passa e o que é executado.

  • Guardrails

    Bloqueado antes de ser cobrado.

    PII, segredos, jailbreaks e prompt injection são barrados antes de o modelo vê-los. Regras de padrão são gratuitas; uma regra avaliada por IA cobra só a própria verificação.

    Em um clique
  • Agent Firewall

    Cada chamada de ferramenta, avaliada.

    Cada chamada de ferramenta e MCP é permitida, enviada a uma pessoa para revisão ou bloqueada antes de ser executada.

    Monitoramento por padrão
  • Compliance Packs

    Mapeado para 32 frameworks.

    Uma política por regulamentação. Observe-a primeiro no tráfego real e depois ative a aplicação.

    Planos pagos

Também:Fila de aprovação humanaAmeaças classificadas segundo OWASP LLM Top 10 e MITRE ATLASO arquivo público de incidentes com agentes

O gateway

Roteie melhor. Gaste menos.

Roteie

Cada prompt é avaliado e enviado ao modelo que melhor responde.

Ver modelos

Observe

Registros quando você quiser, gastos em tempo real e um recibo por prompt.

Ver um recibo

Gerencie

Faça versões dos prompts e reutilize chamadas em cache sem mexer no código.

Versionar um prompt
Modelos

Todos os modelos. Uma lista de preços.

Os mais novos entre 200+ modelos, ao vivo, pelo preço do próprio fornecedor.

Ver todos os 200+ →
ModeloRoteado paraEntrada /MSaída /MContextoRota privada
openai/gpt-6.1-solTextoNOVOOpenAI Direct$2.00$10.001MSem rota privada
anthropic/claude-sonnet-5.5TextoNOVOAnthropic Direct$2.00$10.001MSem rota privada
typesafe/jev-1.13TextoNOVO—$0.042$0.04266KSem rota privada
openai/gpt-6-lunaTextoNOVOOpenAI Direct$0.100$0.5001MSem rota privada
openai/gpt-6-solTextoNOVOOpenAI Direct$2.00$10.001MSem rota privada
anthropic/claude-opus-5.5TextoNOVOAnthropic Direct$4.00$20.001MSem rota privada
grok/grok-4.7TextoNOVO—$2.00$6.00500KSem rota privada
orca/orcaverify-text1.0TextoNOVO—$2.00$2.00—Sem rota privada
+ Mais 194 modelos · preços atualizados a cada 60 s
Configuração

No ar em 60 segundos.

Passo 1

Aponte seu SDK para nós

Defina base_url como api.orcarouter.ai/v1 e troque a sua chave de API. Sem outras alterações de código.

→
Passo 2

Encaminhamos, protegemos e observamos

Avaliado em menos de 1 ms, com failover, cache e registos completos incluídos.

→
Passo 3

Você lança, em um só endpoint

Direto a cada fornecedor à tarifa publicada — acrescentamos $0 por token.

Preços

Nunca cobramos margem sobre os tokens que você compra.

A nossa receita vem de funcionalidades de equipa opcionais.

Hacker

Grátis
Para sempre. Zero markup em todos os tokens.
Roteie — 200+ modelos, failover automático
Observe — dashboard básico
Gerencie — versionamento de prompts
10 chaves de API · 0% de markup por token
Começar grátis

Enterprise

Personalizado
Compromissos de SLA e capacidade dedicada.
Tudo do Team
Assentos de equipe ilimitados
Acesso prioritário a novos modelos
Todos os recursos ocultos e em beta
Infraestrutura dedicada
SLA de 99.99% de uptime
Suporte dedicado e preços personalizados
Confiança e conformidade
Não confie só na nossa palavra. Os relatórios de auditoria estão disponíveis sob NDA, e nossa criptografia pós-quântica é de código aberto.
Pagar pelos tokens

Três formas de pagar pelos tokens.

Recargas e assinaturas pelo preço do provedor. Não acrescentamos nada.

Os planos acima são para recursos de equipe. Eles não alteram o preço dos tokens.

Do blog

Direto da casa de máquinas.

O que estamos construindo e por quê — nossos posts mais recentes.

Todos os posts →
FAQ

Privacidade, segurança e roteamento: respondido.

Vocês armazenam meus prompts ou treinam com eles?

Nunca treinamos com seus prompts. O conteúdo de prompts e respostas não é registrado a menos que o registro esteja ativado para seu espaço de trabalho; mantemos metadados (horário, modelo, tokens, custo, IP) para cobrança e segurança. Um acordo de retenção zero bloqueia esse registro.

Onde meus dados são processados?

Pelo provedor que serve o modelo escolhido, nas regiões desse provedor. A configuração de região de dados do seu workspace (EUA, UE, Reino Unido, Ásia-Pacífico ou China) marca seus relatórios de conformidade com essa região; ela ainda não fixa onde seus dados ficam armazenados nem onde a inferência é executada.

O que significa “resistente a computadores quânticos” aqui?

Os registros de requisições que você decide manter podem ser selados com criptografia pós-quântica híbrida (ML-KEM-768 + X25519), então uma cópia obtida hoje não poderá ser aberta por um futuro computador quântico. O código é aberto: SCUTTLE. Vem ativado por padrão no nosso serviço hospedado.

O que é um roteador de IA?

Um roteador de IA fica entre seu app e muitos modelos e escolhe o melhor modelo para cada requisição. O OrcaRouter avalia cada prompt em menos de 1 ms e o roteia — frontier para raciocínio difícil, open source para o rotineiro — em mais de 200 modelos, sem margem por token.

O que é um roteador LLM e como funciona?

Um roteador LLM classifica cada prompt e o direciona ao modelo com maior chance de responder bem ao menor custo. O OrcaRouter roteia com embeddings contextuais e aprendizado online do tráfego real — 75,5% de precisão no ranking público RouterArena.

O OrcaRouter é um gateway de IA?

Sim. O OrcaRouter é um gateway de IA de produção: um endpoint compatível com OpenAI com roteamento adaptativo, balanceamento de carga, failover automático, guardrails, firewall de agentes, cache de prompts e observabilidade por requisição.

O que é um AI CDN?

Assim como um CDN entrega conteúdo da melhor borda, um AI CDN entrega inferência do melhor provedor: capacidade saudável, rápida e barata, prompts repetidos em cache, failover em quedas. O OrcaRouter cumpre esse papel em mais de 200 modelos.

O que é roteamento adaptativo?

O roteamento adaptativo aprende o equilíbrio qualidade/custo com o seu próprio tráfego. Aponte cada workspace para "o mais barato que passa na régua", a máxima qualidade ou o equilíbrio — ou deixe o orcarouter/auto ajustar a escolha a cada requisição.

Preciso de um gateway de IA e de um roteador LLM?

Eles resolvem problemas diferentes — governança vs. escolha de modelo — mas você não precisa de dois sistemas: o OrcaRouter roteia por requisição e aplica orçamentos, guardrails e observabilidade no mesmo salto.

O roteamento adiciona latência?

A avaliação do prompt leva menos de 1 ms e a latência adicional total fica abaixo de 50 ms — geralmente recuperada muitas vezes por provedores mais rápidos e tokens de prompt em cache.

O OrcaRouter cobra margem sobre o preço dos tokens?

Não. Você paga a tarifa publicada de cada provedor; o OrcaRouter adiciona US$ 0 por token e monetiza com os recursos opcionais Team e Enterprise.

Posso manter meu código atual do SDK da OpenAI?

Sim — troque o base_url para https://api.orcarouter.ai/v1 e seu código dos SDKs da OpenAI, Anthropic ou Google continua funcionando: Chat Completions, Responses, Embeddings, Images, Audio e streaming.

O que acontece quando um provedor cai?

O OrcaRouter tenta novamente em capacidade reserva saudável do mesmo modelo ou de um equivalente antes de a resposta começar — quedas upstream não chegam aos seus usuários.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube