
¿Qué es un enrutador de LLM? La capa de selección de modelos, las matemáticas reales y cuándo omitirlo
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
Un enrutador de LLM es una capa de software que se sitúa entre tu aplicación y los proveedores de modelos y decide, para cada solicitud, qué modelo debe responderla: un modelo barato y rápido como DeepSeek V4 Flash cuando la tarea es fácil, un modelo de frontera como Claude Opus 5 cuando es realmente difícil. La cuestión es el dinero: DeepSeek V4 Flash cuesta $0.09 por millón de tokens de entrada y Claude Opus 5 cuesta $5.00, tarifas directas del proveedor del catálogo de modelos de OrcaRouter leído el 2026-08-10 — una diferencia de 55× en la misma llamada. Envía el 80 % fácil de tu tráfico hacia abajo y mantén el 20 % difícil hacia arriba, y estarás accionando la mayor palanca de costes que la mayoría de los equipos nunca tocan.
Qué es realmente un enrutador de LLM
Dejando de lado el marketing, un enrutador de modelos tiene tres tareas, todas aburridas y todas valiosas. Es un único endpoint: tu código llama a una URL compatible con OpenAI en lugar de un SDK por proveedor. Evalúa la solicitud, estimando su dificultad, y la enruta: las tareas fáciles a un modelo barato, el razonamiento realmente difícil a un modelo de vanguardia. Y conmuta por error: si el proveedor elegido te limita la tasa de peticiones o devuelve un 5xx, el enrutador reintenta con un modelo en buen estado sin que tu aplicación llegue a ver el error.
El paso de decisión es donde los routers difieren, y el espectro es uno conocido. Los routers basados en reglas comparan palabras clave o la longitud del prompt con un modelo: en menos de un milisegundo, predecibles, pero frágiles cuando cambian los precios o los modelos. Los routers semánticos incorporan el prompt y enrutan por significado, de modo que "¿cuál es mi saldo?" y "¿cuánto dinero tengo?" terminan en el mismo camino. Los routers aprendidos observan el tráfico real y se inclinan hacia el modelo que está ganando en calidad por dólar. La mecánica de cada uno —incluidos los rangos de precisión de los diferentes tipos de clasificadores y el modo automático que evalúa cada prompt— se trata en detalle en nuestra guía, Auto Router for LLMs; aquí el punto es que la inteligencia de enrutamiento existe en un espectro, y qué punto necesitas es una decisión de producto, no una lista de verificación de funciones.

Si también has visto que "AI router" se usa para hardware Wi-Fi con una NPU — ese es un producto diferente que casualmente comparte el nombre, y aclaramos esa colisión en nuestra guía de AI router. Todo en este artículo trata sobre la categoría de software.
El diferencial de precios es lo que lo hace rentable.
Un router solo cumple su función cuando los modelos difieren mucho en precio, y ahora mismo difieren enormemente. Todas las tarifas a continuación son precios directos del proveedor por 1M de tokens del catálogo de modelos OrcaRouter, leídos el 2026-08-10:

Basta con mirar la horquilla de precios y el argumento se explica solo. DeepSeek V4 Flash a $0.09 frente a Claude Opus 5 a $5.00 supone una diferencia de unas 55× solo en tokens de entrada, y la brecha entre la gama económica y la gama alta es ahora un rasgo permanente del mercado, no un descuento puntual. Si tu tráfico es una mezcla típica —una mayoría de solicitudes cortas y bien especificadas y una minoría de razonamientos realmente difíciles—, ejecutarlo todo en la gama alta significa pagar el precio máximo por el 80% fácil.
Esto es donde los resultados actuales de la primera página para "llm router" te decepcionan. La entrada del glosario de Decagon, por ejemplo, cita "GPT-4o, Claude 3.5 Sonnet y Gemini 1.5 Pro" a "$5–15 por millón de tokens de entrada" — modelos que eran actuales hace dos años a precios aproximadamente el doble de los de hoy. El mercado se movió; la definición no. Esa es la razón más importante para desconfiar de un explicador de LLM router sin fechas.
Lo que realmente dice la investigación sobre el ahorro
La aritmética anterior es real, y la investigación también — pero la imagen honesta es un rango, no un número único.

Aquí está la aritmética detallada, con los supuestos indicados para que puedas ajustarlos. Un bot de soporte que gestiona 100,000 conversaciones al mes, cada una enviando 1,000 tokens de entrada y generando 200 tokens de salida: ejecutar todo en Claude Sonnet 5 cuesta unos $400 al mes. Si enrutas el 80% fácil a DeepSeek V4 Flash y mantienes el 20% difícil en Claude Sonnet 5, el mismo tráfico cuesta unos $90 — aproximadamente un 78% más barato, antes de cualquier caché de prompts, lo que ampliaría aún más la diferencia.
La conclusión clave: el enrutamiento agresivo ahorra un 60–85% cuando tu tráfico es mayormente fácil, el enrutamiento equilibrado ahorra un 35–45%, e incluso el enrutamiento conservador ahorra un 10–15%. La cifra exacta para ti es una propiedad de tu tráfico, medida con tus propias indicaciones — no una constante que puedas copiar de una publicación de blog.
Los tres costos que el enrutamiento oculta
Los dos costos que nadie incluye en la entrada del glosario son la latencia y la precisión, y hay un tercero que es más sutil.
Latencia. Cada solicitud enrutada paga un costo de clasificación antes de que el modelo siquiera comience. Un clasificador basado en reglas tarda menos de un milisegundo; un pequeño modelo de embedding o clasificador añade aproximadamente 50–200 ms; un clasificador de dominio entrenado, más. Un buen enrutador oculta gran parte de esto al clasificar mientras prepara la solicitud ascendente, y un endpoint de enrutamiento en producción midió una sobrecarga de extremo a extremo de aproximadamente 55 ms de mediana — menos del 1% de un tiempo de respuesta normal. Pero si tu tráfico es en tiempo real — un agente de voz, una interfaz que debe responder dentro de 300 ms — un salto de enrutamiento de cientos de milisegundos puede ser la diferencia entre utilizable y no. Esa única restricción es la razón más común por la que un equipo con un caso de uso legítimo de enrutamiento decide no enrutar.
Precisión. Un enrutador solo es tan bueno como el criterio con el que enruta. Un clasificador entrenado con puntos de referencia generales puede equivocarse con confianza en tu dominio: tu tarea de resumen "fácil" podría ser fácil para el modelo de frontera e imposible para el modelo barato. El modo de fallo es silencioso — el usuario simplemente recibe una salida peor y nadie lo registra — por lo que todo enrutador creíble incluye un suelo de calidad o un modo equilibrado.
Invalidación de caché. Tanto OpenAI como Anthropic descuentan los prefijos de prompt repetidos, normalmente alrededor del 90% en los tokens de entrada en lecturas de caché. Si tu capa de enrutamiento reescribe, reordena o inyecta una marca de tiempo rotatoria en el prompt, invalida el prefijo y desperdicia ese descuento. Un buen enrutador pasa el prompt byte por byte y permite que el sistema de caché del proveedor haga su trabajo.
La recomendación: un router gestionado con un nivel mínimo de calidad.
Si ejecutas más de un modelo en producción, tu tráfico es una mezcla de fácil y difícil, y tu volumen es lo suficientemente grande como para que un porcentaje represente dinero real, la recomendación es un enrutador administrado que mantiene un piso de calidad y no cobra margen sobre los tokens. Nuestro propio producto es OrcaRouter, y es del que podemos hablar en detalle; la lista de verificación que sigue se aplica a cualquier enrutador que evalúes.
El modo automático de OrcaRouter — solicita el nombre del modelo orcarouter/auto en el endpoint estándar compatible con OpenAI — evalúa cada prompt y lo enruta entre más de 200 modelos. Incluye cuatro políticas de enrutamiento con Balanced como predeterminada: Cheapest envía al modelo de menor costo que pueda responder; Balanced envía al modelo más barato que supere el umbral de calidad; Quality envía al modelo con mayor puntuación sin importar el precio; Adaptive aprende de tu tráfico en vivo y ajusta el enrutamiento sobre la marcha. La evaluación se mide en menos de un milisegundo, la latencia adicional total se mantiene por debajo de 50 ms, y si el proveedor elegido limita la tasa o devuelve un error, el enrutador realiza una conmutación por error a mitad de la transmisión a un modelo en buen estado en menos de 50 ms. No hay recargo en ninguna capa: pagas a cada proveedor exactamente su precio publicado — las cifras de $0.09 o $5.00 anteriores son lo que pagas — y el enrutamiento en sí es gratuito.
En cuanto a precisión, la clasificación de RouterArena de junio de 2026 puntúa a OrcaRouter con un 75.5% frente a la alternativa más cercana rastreada con un 74.0% (según orcarouter.ai). Una clasificación no es prueba de nada: trátala como un único punto de datos y ejecuta tu propia evaluación con tus propios prompts antes de confiar cualquier router con tráfico de producción, incluido el nuestro. Y si estás tratando de decidir si necesitas funciones de router o de gateway en absoluto, la distinción entre router y gateway se cubre en nuestra guía, AI API Gateway in 2026.
Cuando esta recomendación es incorrecta
La lista de saltos honesta, expresada sin rodeos:
La versión corta
Un enrutador de LLM es la capa que elige qué modelo responde a cada solicitud: económico y rápido para la mayoría fácil, de frontera para la minoría difícil, con conmutación por error cuando un proveedor falla. Compensa cuando tus modelos difieren mucho en precio (DeepSeek V4 Flash a $0.09 frente a Claude Opus 5 a $5.00 por 1M de tokens de entrada es una diferencia de 55×) y tu tráfico es una mezcla de fácil y difícil. La investigación sitúa el techo en alrededor de un 85% de ahorro detrás de un piso de calidad, y el piso en lo que tu evaluación diga que es. Te cuesta latencia y algo de control de precisión, y es la respuesta equivocada para entornos de un solo modelo, presupuestos de latencia inferiores a 300 ms, gastos mínimos y equipos que no pueden medir la calidad de la salida. Cuando es lo correcto, ejecútalo detrás de un piso de calidad sin recargo de tokens, enruta primero una parte y lee los registros de enrutamiento antes de creer en los ahorros.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
