Inferencia segura sin recargo, de pago por uso o por suscripción. O usa tus propias claves. El enrutamiento adaptativo reduce tu factura.
Sin tarjeta de crédito · en marcha en 60 segundos
from openai import OpenAIclient = OpenAI(base_url="https://api.orcarouter.ai/v1",api_key=ORCAROUTER_API_KEY,)resp = client.chat.completions.create(model="orcarouter/auto", # we grade + routemessages=[{"role": "user", "content": "..."}],)
Una línea. Calificamos cada prompt, enrutamos a frontera u OSS y añadimos $0.
Apunta base_url a api.orcarouter.ai/v1 y cambia tu clave de API. Sin más cambios de código.
Calificado en menos de 1 ms, con failover, caché y registros completos incluidos.
Directo a cada proveedor a su tarifa publicada: añadimos $0 por token.
Precios en vivo, lado a lado: lo que pagarías directamente al proveedor.
| Modelo | Enrutado a | Entrada /M | Salida /M | Contexto | Calidad |
|---|---|---|---|---|---|
| z-ai/glm-5.3NUEVO | Zhipu AI | $1.26 | $3.96 | 1M | 9.0 |
| qwen/qwen3.8-27b-freeNUEVO | Alibaba Cloud | — | — | 66K | 4.0 |
| qwen/qwen3.8-27bNUEVO | Alibaba Cloud | $0.330 | $2.40 | 262K | 4.0 |
| deepseek/deepseek-v4-pro-0813NUEVO | DeepSeek | $0.442 | $0.884 | 1M | 7.0 |
| grok/grok-4.6NUEVO | — | $2.00 | $6.00 | 500K | 9.0 |
| meta/muse-spark-1.2NUEVO | — | $1.25 | $4.25 | 1M | 8.0 |
| qwen/qwen3.8-maxNUEVO | Alibaba Cloud | $2.00 | $6.00 | 1M | 9.0 |
| deepseek/deepseek-v4-flash-0731NUEVO | DeepSeek | $0.147 | $0.295 | 1M | 6.0 |
| + 194 modelos más · precios cada 60 segundos | |||||
Recargas y suscripciones al precio del proveedor. No añadimos nada.
Recarga cuando quieras. Precio público y recibo en cada llamada.
Recarga tu monedero cada periodo. Importe íntegro, cualquier modelo, con crédito extra en los planes más grandes.
Utiliza tus propias claves de proveedor, límites de tasa y créditos.
Los planes de abajo son funciones de equipo, no precio por token.
Nuestros ingresos vienen de funciones de equipo opcionales.
Qué construimos y por qué — nuestros artículos más recientes.

Un router de IA se sitúa entre tu aplicación y muchos modelos y elige el mejor modelo para cada petición. OrcaRouter califica cada prompt en menos de 1 ms y lo enruta — frontier para razonamiento difícil, open source para lo rutinario — entre más de 200 modelos sin margen por token.
Un router LLM clasifica cada prompt y lo asigna al modelo con más probabilidades de responder bien al menor coste. OrcaRouter enruta con embeddings contextuales y aprendizaje en línea del tráfico real: 75,5 % de precisión en el ranking público RouterArena.
Sí. OrcaRouter es un gateway de IA de producción: un endpoint compatible con OpenAI con enrutamiento adaptativo, balanceo de carga, failover automático, guardarraíles, firewall de agentes, caché de prompts y observabilidad por petición.
Igual que un CDN sirve contenido desde el mejor borde, un AI CDN sirve inferencia desde el mejor proveedor: capacidad sana, rápida y barata, prompts repetidos en caché y failover ante caídas. OrcaRouter cumple ese papel en más de 200 modelos.
El enrutamiento adaptativo aprende el equilibrio calidad/coste de tu propio tráfico. Apunta cada workspace a «lo más barato que supere el listón», la máxima calidad o el equilibrio — o deja que orcarouter/auto ajuste la elección en cada petición.
Resuelven problemas distintos — gobernanza vs. elección de modelo — pero no hacen falta dos sistemas: OrcaRouter enruta por petición y aplica presupuestos, guardarraíles y observabilidad en el mismo salto.
La calificación del prompt tarda menos de 1 ms y la latencia añadida total queda por debajo de 50 ms — normalmente recuperada con creces por proveedores más rápidos y tokens de prompt cacheados.
No. Pagas la tarifa publicada de cada proveedor; OrcaRouter añade 0 $ por token y monetiza con las funciones opcionales Team y Enterprise.
Sí: cambia base_url a https://api.orcarouter.ai/v1 y tu código de los SDK de OpenAI, Anthropic o Google sigue funcionando: Chat Completions, Responses, Embeddings, Images, Audio y streaming.
OrcaRouter reintenta contra capacidad de respaldo sana del mismo modelo o uno equivalente antes de que empiece la respuesta, así las caídas upstream no llegan a tus usuarios.
Cambia una línea. Esa es la migración.
Supera a GPT-5 y Azure en RouterArenaRespaldado por investigación publicada
OrcaRouter¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.
providers@orcarouter.ai