Privado por arquitectura · Protegido en cada llamada

Un gateway. Todos los modelos. Tus datos siguen siendo tuyos.

Inferencia privada en 200+ modelos, protegida en cada llamada. Sin margen en el pago por uso ni en las suscripciones. O usa tus propias claves.

Sin tarjeta de crédito · en marcha en 60 segundos · no se registran prompts a menos que tú lo actives

200+
modelos, un endpoint
0%
recargo por token, nunca
0 B
prompts guardados por defecto
el registro está desactivado hasta que lo actives
40+%
de ahorro en costes de inferencia
con enrutamiento adaptativo consciente de la caché
99%
precisión de enrutamiento
con escalado a modelos de frontera
<10ms
de latencia de enrutamiento con failover automático
Todas las integraciones
from openai import OpenAI
 
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=ORCAROUTER_API_KEY,
)
resp = client.chat.completions.create(
model="orcarouter/auto", # we grade + route
messages=[{"role": "user", "content": "..."}],
)

Una línea. Calificamos cada prompt, enrutamos a frontera u OSS y añadimos $0.

Privacidad y seguridad

Privado por arquitectura. Protegido en cada llamada.

Lo que le preguntas a una IA sigue siendo tuyo. Lo que hacen tus agentes lo apruebas tú.

Tus datos

Lo que pueden ver el modelo y nuestros servidores.

  • Data Cloaking

    Enmascarado.

    Los nombres, correos y números de tarjeta se sustituyen por marcadores antes de llegar al modelo al que llamas, y se restauran en la respuesta.

    Con un clic
  • ZDR

    No se guarda nada.

    Los prompts no se registran a menos que actives el registro. Firma un acuerdo de retención cero para bloquearlo.

    Predeterminado
  • PQC

    Resistente a los ordenadores cuánticos.

    Los registros que decidas conservar se sellan con ML-KEM híbrido. La criptografía es de código abierto: SCUTTLE.

    Predeterminado
  • Data Residency

    Tu región.

    Declara EE. UU., UE, Reino Unido, Asia-Pacífico o China, y tus informes de cumplimiento quedan etiquetados con esa región.

    Bajo solicitud
  • TEE

    Protegido incluso en ejecución.

    Enclaves atestiguados, con prueba para cada respuesta.

    Bajo solicitud

Tus agentes

Lo que pasa y lo que se ejecuta.

  • Guardrails

    Bloqueado antes de facturarse.

    PII, secretos, jailbreaks e inyección de prompts se detienen antes de que el modelo los vea. Las reglas de patrones son gratis; una regla evaluada por IA solo cobra su propia comprobación.

    Con un clic
  • Agent Firewall

    Cada llamada a herramientas, evaluada.

    Cada llamada a herramientas y MCP se permite, se envía a una persona para revisión o se bloquea antes de ejecutarse.

    Vigilancia por defecto
  • Compliance Packs

    Alineado con 32 marcos normativos.

    Una política por normativa. Obsérvala primero con tráfico real y después activa la aplicación.

    Planes de pago

Además:Cola de aprobación humanaAmenazas clasificadas según OWASP LLM Top 10 y MITRE ATLASEl archivo público de incidentes con agentes

La pasarela

Enruta mejor. Gasta menos.

Enrutar

Cada prompt se califica y se envía al modelo que mejor lo responde.

Ver modelos

Observar

Registros cuando los quieras, gasto en vivo y un recibo por prompt.

Ver un recibo

Gestionar

Versiona prompts y reutiliza llamadas en caché sin tocar el código.

Versionar un prompt
Modelos

Cada modelo. Una lista de precios.

Lo más nuevo de 200+ modelos, en vivo, al precio del propio proveedor.

Ver los 200+ →
ModeloEnrutado aEntrada /MSalida /MContextoRuta privada
openai/gpt-6.1-solTextoNUEVOOpenAI Direct$2.00$10.001MSin ruta privada
anthropic/claude-sonnet-5.5TextoNUEVOAnthropic Direct$2.00$10.001MSin ruta privada
typesafe/jev-1.13TextoNUEVO—$0.042$0.04266KSin ruta privada
openai/gpt-6-lunaTextoNUEVOOpenAI Direct$0.100$0.5001MSin ruta privada
openai/gpt-6-solTextoNUEVOOpenAI Direct$2.00$10.001MSin ruta privada
anthropic/claude-opus-5.5TextoNUEVOAnthropic Direct$4.00$20.001MSin ruta privada
grok/grok-4.7TextoNUEVO—$2.00$6.00500KSin ruta privada
orca/orcaverify-text1.0TextoNUEVO—$2.00$2.00—Sin ruta privada
+ 194 modelos más · precios cada 60 segundos
Configuración

En vivo en 60 segundos.

Paso 1

Apunte su SDK a nosotros

Apunta base_url a api.orcarouter.ai/v1 y cambia tu clave de API. Sin más cambios de código.

→
Paso 2

Enrutamos, protegemos y observamos

Calificado en menos de 1 ms, con failover, caché y registros completos incluidos.

→
Paso 3

Tú lanzas, en un solo endpoint

Directo a cada proveedor a su tarifa publicada: añadimos $0 por token.

Precios

Nunca aplicamos margen a los tokens que compras.

Nuestros ingresos vienen de funciones de equipo opcionales.

Hacker

Gratis
Para siempre. Cero recargo en todos los tokens.
Enrutar — 200+ modelos, failover automático
Observar — dashboard básico
Gestionar — versionado de prompts
10 claves API · 0% de recargo por token
Empieza gratis

Enterprise

Personalizado
Compromisos de SLA y capacidad dedicada.
Todo lo de Team
Puestos de equipo ilimitados
Acceso prioritario a modelos nuevos
Todas las funciones ocultas y en beta
Infraestructura dedicada
SLA de disponibilidad del 99.99%
Soporte dedicado y precios personalizados
Confianza y cumplimiento
No te fíes solo de nuestra palabra. Los informes de auditoría están disponibles bajo NDA y nuestra criptografía poscuántica es de código abierto.
Pagar los tokens

Tres formas de pagar tus tokens.

Recargas y suscripciones al precio del proveedor. No añadimos nada.

Los planes de arriba son para funciones de equipo. No cambian el precio de los tokens.

Del blog

Recién salido de la sala de máquinas.

Qué construimos y por qué — nuestros artículos más recientes.

Todos los artículos →
FAQ

Privacidad, seguridad y enrutamiento: respondido.

¿Guardáis mis prompts o entrenáis con ellos?

Nunca entrenamos con tus prompts. El contenido de prompts y respuestas no se registra salvo que el registro esté activado para tu espacio de trabajo; conservamos metadatos (hora, modelo, tokens, coste, IP) para facturación y seguridad. Un acuerdo de retención cero bloquea ese registro.

¿Dónde se procesan mis datos?

Lo procesa el proveedor que sirve el modelo que elijas, en sus propias regiones. La región de datos de tu espacio de trabajo (EE. UU., UE, Reino Unido, Asia-Pacífico o China) etiqueta tus informes de cumplimiento con esa región; todavía no fija dónde se guardan tus datos ni dónde se ejecuta la inferencia.

¿Qué significa aquí «resistente a la computación cuántica»?

Los registros de solicitudes que decidas conservar pueden sellarse con cifrado poscuántico híbrido (ML-KEM-768 + X25519), así que una copia robada hoy no podrá abrirla un futuro ordenador cuántico. El código es abierto: SCUTTLE. Está activado por defecto en nuestro servicio alojado.

¿Qué es un router de IA?

Un router de IA se sitúa entre tu aplicación y muchos modelos y elige el mejor modelo para cada petición. OrcaRouter califica cada prompt en menos de 1 ms y lo enruta — frontier para razonamiento difícil, open source para lo rutinario — entre más de 200 modelos sin margen por token.

¿Qué es un router LLM y cómo funciona?

Un router LLM clasifica cada prompt y lo asigna al modelo con más probabilidades de responder bien al menor coste. OrcaRouter enruta con embeddings contextuales y aprendizaje en línea del tráfico real: 75,5 % de precisión en el ranking público RouterArena.

¿Es OrcaRouter un gateway de IA?

Sí. OrcaRouter es un gateway de IA de producción: un endpoint compatible con OpenAI con enrutamiento adaptativo, balanceo de carga, failover automático, guardarraíles, firewall de agentes, caché de prompts y observabilidad por petición.

¿Qué es un AI CDN?

Igual que un CDN sirve contenido desde el mejor borde, un AI CDN sirve inferencia desde el mejor proveedor: capacidad sana, rápida y barata, prompts repetidos en caché y failover ante caídas. OrcaRouter cumple ese papel en más de 200 modelos.

¿Qué es el enrutamiento adaptativo?

El enrutamiento adaptativo aprende el equilibrio calidad/coste de tu propio tráfico. Apunta cada workspace a «lo más barato que supere el listón», la máxima calidad o el equilibrio — o deja que orcarouter/auto ajuste la elección en cada petición.

¿Necesito un gateway de IA y además un router LLM?

Resuelven problemas distintos — gobernanza vs. elección de modelo — pero no hacen falta dos sistemas: OrcaRouter enruta por petición y aplica presupuestos, guardarraíles y observabilidad en el mismo salto.

¿El enrutamiento añade latencia?

La calificación del prompt tarda menos de 1 ms y la latencia añadida total queda por debajo de 50 ms — normalmente recuperada con creces por proveedores más rápidos y tokens de prompt cacheados.

¿OrcaRouter recarga el precio de los tokens?

No. Pagas la tarifa publicada de cada proveedor; OrcaRouter añade 0 $ por token y monetiza con las funciones opcionales Team y Enterprise.

¿Puedo conservar mi código actual del SDK de OpenAI?

Sí: cambia base_url a https://api.orcarouter.ai/v1 y tu código de los SDK de OpenAI, Anthropic o Google sigue funcionando: Chat Completions, Responses, Embeddings, Images, Audio y streaming.

¿Qué pasa cuando un proveedor se cae?

OrcaRouter reintenta contra capacidad de respaldo sana del mismo modelo o uno equivalente antes de que empiece la respuesta, así las caídas upstream no llegan a tus usuarios.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube