Un nombre de modelo. Todos los modelos detrás.
Apunta tu cliente a orcarouter/auto y cada prompt es evaluado y enviado al modelo que cumple tu umbral de calidad al menor precio, con embeddings semánticos como mejora opcional.
- Cuatro objetivos por espacio de trabajo — Más barato, Equilibrado, Calidad o Adaptativo, que aprende el equilibrio a partir de tu propio tráfico.
- Aprendizaje en línea: el enrutador se actualiza continuamente a partir de resultados de producción en tiempo real, no de una prueba de referencia congelada.
- El enrutamiento añade menos de 1 ms por defecto; si activas el embedding semántico, pagas además la llamada de embedding. En ambos casos, la puntuación y el modelo elegido aparecen en cada recibo.
Más de 40 proveedores, un solo endpoint
La misma solicitud compatible con OpenAI llega a cualquier proveedor, y el balanceo con conciencia de estado distribuye la carga entre los que están disponibles. El estado, peso y prioridad por canal retiran automáticamente los proveedores con problemas de la rotación, y las particularidades específicas de cada proveedor se normalizan en el adaptador para que tu código cliente nunca tenga que ramificarse.
Un nombre. Todos los modelos.
Escribes orcarouter/auto una vez. A partir de entonces, cada prompt se analiza en tránsito y se envía al modelo que mejor lo responde al menor costo. Un nuevo modelo de frontera llega un martes y tu tráfico empieza a usarlo — sin migración, sin nueva versión del cliente, sin reunión.
Un valor predeterminado, no una caja negra.
Apunta un espacio de trabajo al objetivo que realmente deseas: el más económico, el de mayor calidad, equilibrado o adaptativo, que aprende el balance a partir de tu propio tráfico en lugar del benchmark de otro. Cada decisión que toma aparece en el recibo con la calificación que la produjo.