Tarjeta de título principal que dice '¿Qué es un enrutador de IA?' con el subtítulo 'Evalúa cada indicación, elige automáticamente tu mejor modelo', mostrando tres tarjetas redondeadas etiquetadas como EVALÚA 'Lee la indicación', RUTEA 'Elige el mejor modelo' y CONMUTA 'Cambia si un proveedor se cae' sobre un fondo blanco con acentos azul y cian. Logotipo de OrcaRouter compuesto en la esquina inferior derecha.
Guides & Insights

¿Qué es un router de IA? La capa de enrutamiento de LLM que elige tu modelo

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Un enrutador de IA es una capa de software entre tu aplicación y los proveedores de modelos que decide, para cada solicitud, qué modelo debe responderla. El prompt se evalúa por dificultad y se enruta a un modelo económico cuando es fácil y a un modelo de frontera cuando es difícil: la diferencia entre pagar DeepSeek V4 Flash $0.09 y Claude Opus 5 $5.00 por 1M de tokens de entrada por la misma llamada. El otro "enrutador de IA" que encontrarás en la primera página de esta misma búsqueda — el hardware Wi-Fi con un núcleo neuronal — es un producto diferente, y esa colisión de nombres es la razón por la que tan pocos de esos resultados ayudan.

Buscar «ai router» en agosto de 2026 devuelve sobre todo prensa especializada en redes domésticas. ASUS comercializa el ROG Rapture GT-BE19000AI como «el primer router gaming con IA del mundo»: un dispositivo Wi-Fi 7 con una NPU, 4 GB de RAM, 32 GB de almacenamiento y un motor Docker que ejecuta Home Assistant o AdGuard en el propio router. ZTE, junto con Tianyi Digital Life de China Telecom, lanzó un router doméstico Wi-Fi 7 «nativo de IA» que detecta cuándo sales de casa y reconfigura por sí solo la red del hogar inteligente. Son dispositivos realmente interesantes, pero no son lo que un desarrollador entiende por «router de IA». Este artículo trata sobre el router LLM: la categoría que se sitúa entre tu código y las API de los grandes modelos de lenguaje, y que elige qué modelo responde a cada prompt. Cubre los dos significados del nombre, qué hace exactamente el router, qué ahorra y qué cuesta, y los casos en los que no deberías usar uno.

Dos productos diferentes comparten el nombre

La frase "AI router" es una colisión, y los dos significados no tienen casi nada en común:

El hardware «router de IA». Un router Wi-Fi con funciones de IA integradas: una NPU para inferencia en el dispositivo, optimización del tráfico y, a veces, Docker. Algunos ejemplos son el ASUS ROG Rapture GT-BE19000AI (anunciado a principios de 2026) y el router doméstico de IA ZTE / Tianyi Digital Life (junio de 2026). Su función es gestionar tu red doméstica o la de una pequeña oficina.

El enrutador de LLM. Un servicio de software que recibe cada llamada API que hace tu aplicación y la reenvía al mejor modelo — el que supera tu listón de calidad al precio más bajo. Su trabajo es gastar bien tu presupuesto de modelos. Este es el "enrutador de IA" del que hablan los ingenieros de IA, y es el tema de este artículo.

Two-panel disambiguation card titled 'Two products, one name'. Left panel 'Wi-Fi hardware AI router' lists 'Processor: NPU core for on-device AI', 'Apps: runs Docker — Home Assistant, AdGuard', 'Trick: AI traffic optimisation, WiFi Insight', with a spot noting examples 'ASUS ROG Rapture GT-BE19000AI · ZTE / Tianyi home AI router' sourced to ASUS and ZTE product announcements Mar–Jun 2026. Right panel 'LLM model router' lists 'One endpoint: 200+ models behind one URL', 'Decision: grades every prompt', 'Route: picks the model per request', 'Reliability: fails over when a provider drops', with a spot noting 'The category this article explains'. OrcaRouter logo composited bottom-right.

La confusión importa más allá de la semántica. Quien busca "ai router" esperando encontrar la categoría de software se topa con una pared de reseñas de hardware; quien busca "ai router" para una nueva caja Wi-Fi obtiene marketing sobre NPU en lugar de cifras de rendimiento. Ningún SERP es honesto sobre la ambigüedad, que es exactamente el vacío que esta página llena: el significado de software, definido frente al de hardware.

Lo que realmente hace un enrutador de LLM

Quita el marketing y un enrutador de modelos tiene tres trabajos, todos aburridos y todos valiosos. Primero, es un único endpoint: tu código llama a una URL, compatible con OpenAI, en lugar de un SDK por proveedor. Segundo, califica la solicitud — leyendo el prompt y estimando qué tan difícil es — y la enruta: trabajo fácil a un modelo barato y rápido, razonamiento realmente difícil a un modelo de frontera. Tercero, conmuta por error: si el proveedor elegido te limita la tasa o devuelve un 5xx, el enrutador reintenta con un modelo saludable sin que tu aplicación llegue a ver el error.

El paso de decisión es donde los routers difieren, y el espectro es el mismo que cabría esperar. Los routers basados en reglas hacen coincidir palabras clave o la longitud del prompt con un modelo: en menos de un milisegundo, predecibles, pero frágiles cuando cambian los precios o los modelos. Los routers semánticos incrustan el prompt y enrutan por significado, de modo que «¿cuál es mi saldo?» y «cuánto dinero tengo» terminan en el mismo camino. Los routers aprendidos observan el tráfico real y se desplazan hacia el modelo que mejor rinde en calidad por dólar: el router de producción de Ramp describe esto como un bandido de muestreo de Thompson y le atribuye un recorte de costos de aproximadamente el 30 %, y la investigación RouteLLM de LMSYS informa de un router de factorización de matrices que mantuvo alrededor del 95 % de la puntuación de GPT-4 mientras enviaba solo el 14 % de las consultas al modelo fuerte. La mecánica más profunda de las políticas de enrutamiento recibe un tratamiento completo en nuestra guía, Auto Router for LLMs; aquí la cuestión es que la inteligencia de decisión existe en un espectro, y «qué punto del espectro necesitas» es una decisión de producto, no una lista de características.

El diferencial de precios es lo que lo hace rentable.

Un router solo cumple su función cuando los modelos difieren mucho en precio, y ahora mismo difieren enormemente. Todas las tarifas a continuación son precios directos del proveedor por 1M de tokens del catálogo de modelos OrcaRouter, leídos el 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' with the sub-line 'Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10', listing seven models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, MiniMax M3 $0.30/$1.20, GPT-5.6 Terra $1.00/$6.00, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00, Claude Opus 5 $5.00/$25.00, DeepSeek V4 Flash highlighted green and Claude Opus 5 highlighted red, with a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Rates per the OrcaRouter model catalogue, read 2026-08-10.' OrcaRouter logo composited bottom-right.

Lee la diferencia de precios y el argumento se escribe solo. DeepSeek V4 Flash a $0.09/$0.18 por 1M frente a Claude Opus 5 a $5.00/$25.00 supone una diferencia de aproximadamente 55× solo en tokens de entrada, y la brecha entre la gama económica y la gama de vanguardia es ahora una característica habitual del mercado, no un descuento puntual. Si tu tráfico es una combinación típica —una mayoría de solicitudes cortas y bien especificadas y una minoría de razonamientos realmente difíciles—, enviarlo todo a la gama de vanguardia significa pagar el precio máximo por el 80% fácil. Un router que desvíe las llamadas fáciles a la gama económica es donde reside el ahorro.

Las cifras medidas coinciden. Las investigaciones tipo RouteLLM reportan ahorros de hasta aproximadamente un 85 % a la vez que preservan una calidad de nivel frontera, pero solo cuando el enrutador se combina con un umbral mínimo de calidad que se niega a escatimar en las solicitudes que realmente necesitan el modelo frontera. Ramp reporta una reducción de alrededor del 30 % en tráfico de producción real sin una caída de calidad significativa. Los propios glosarios de los proveedores de enrutadores citan reducciones de coste por consulta del 50–70 % por enrutar el trabajo fácil lejos de los modelos frontera. La dispersión de las cifras es el panorama real: el techo depende del perfil de tu tráfico, y el suelo es lo que diga tu evaluación de calidad. Lo que no deberías creer es una cifra fija y única de «el enrutamiento ahorra X%», porque es una propiedad de tu carga de trabajo, no de los enrutadores en general.

Lo que el enrutamiento te cuesta

Los dos costos que nadie pone en la revisión de hardware son la latencia y la precisión, y ambos son reales.

Latencia. Cada solicitud enrutada paga un impuesto de clasificación antes de que el modelo siquiera comience. Un clasificador basado en reglas tarda menos de un milisegundo; un pequeño modelo de incrustación o clasificador añade aproximadamente 50–200 ms; un clasificador de dominio entrenado, más. La mayoría de los enrutadores ocultan gran parte de esto al clasificar mientras preparan la solicitud upstream, y un endpoint de enrutamiento en producción midió una sobrecarga de extremo a extremo de aproximadamente 55 ms de mediana — menos del 1% de un tiempo de respuesta normal. Pero si tu tráfico es en tiempo real — un agente de voz, una interfaz que debe responder en menos de 300 ms — un salto de enrutamiento de cientos de milisegundos puede ser la diferencia entre utilizable y no. Esa única restricción es la razón más común por la que un equipo con un caso de uso legítimo de enrutamiento decide no enrutar.

Exactitud. Un enrutador solo es tan bueno como el criterio que utiliza para enrutar. Un clasificador entrenado con puntos de referencia generales puede estar confiadamente equivocado en tu dominio: tu tarea de resumen "fácil" puede ser fácil para el modelo de frontera e imposible para el modelo barato. El modo de fallo es silencioso — el usuario solo obtiene una salida peor y nadie lo registra — por eso cada enrutador creíble incorpora un nivel mínimo de calidad o un modo equilibrado, y por qué un modo de coste agresivo debería ser un experimento, no una configuración predeterminada.

También hay un tercer costo sutil: el código del enrutador puede romper los descuentos de proveedor que ya tienes. Tanto OpenAI como Anthropic descuentan prefijos de prompt repetidos, típicamente alrededor de un 90% de descuento en tokens de entrada en lecturas de caché. Si tu capa de enrutamiento reescribe, reordena o inyecta una marca de tiempo rotatoria en el prompt, invalida el prefijo y desecha ese descuento. Un buen enrutador pasa el prompt byte por byte y deja que el caché del proveedor funcione; uno descuidado convierte silenciosamente tus aciertos de caché en llamadas a precio completo.

Router versus gateway, en un párrafo.

También verás que "AI gateway" se usa casi indistintamente, y vale la pena distinguirlos aunque la mayoría de los productos gestionados son ambas cosas. Un router responde qué modelo — costo, latencia, capacidad. Una puerta de enlace responde quién puede llamarlo — autenticación, límites de tokens, presupuestos, registros de auditoría, cumplimiento. Si necesitas gobernanza en torno a un equipo o un producto, necesitas funciones de puerta de enlace; si necesitas una combinación de modelos más económica, necesitas enrutamiento. La distinción operativa se trata a fondo en nuestra guía, AI API Gateway in 2026; la conclusión aquí es que "un router de IA" normalmente significa un producto con ambas partes, y deberías preguntar por cuál mitad estás pagando realmente.

Cuando realmente necesitas un router de IA

La lista sincera de disparadores, en lugar de un caso de marketing para enrutar siempre:

Tienes más de un modelo en producción. El enrutamiento es cómo mantienes la combinación racional a medida que llegan nuevos modelos y los precios cambian. Una empresa con un solo modelo no necesita nada de eso.

Tu tráfico es una mezcla de fácil y difícil. Si cada solicitud es igualmente difícil, el router no tiene nada que arbitrar. Clasificar y luego enrutar solo da resultados cuando hay una mayoría barata que capturar.

Tu volumen es lo suficientemente grande como para que un porcentaje importe. Un recorte del 40% sobre $50 mensuales de gasto son $20; sobre $50,000 es un puesto de trabajo.

Los fallos de los proveedores te están costando.La conmutación automática por error entre proveedores suele ser el primer beneficio real que sienten los equipos, antes que el ahorro de costes.

Quieres un contrato, una clave, un endpoint. El costo de integración de N proveedores es en sí mismo una razón para enrutar a través de uno.

Invierte esos y tienes la lista de exclusión: un solo modelo, dificultad uniforme, gasto trivial, o un presupuesto de latencia que un salto de clasificación rompe. Para esos equipos, un router es sobrecarga, y llamar directamente al proveedor es la mejor respuesta.

La recomendación: un router gestionado con un nivel mínimo de calidad.

Para un equipo que ha superado los desencadenantes anteriores, la recomendación es un router gestionado que mantiene un nivel mínimo de calidad y no aplica ningún margen adicional sobre los tokens. Nuestro propio producto es OrcaRouter, y es del que podemos hablar en detalle, por lo que los detalles a continuación son nuestros; la lista de verificación que sigue se aplica a cualquier router que evalúes.

El modo automático de OrcaRouter — solicita el nombre del modelo orcarouter/auto en el endpoint estándar compatible con OpenAI — evalúa cada prompt y lo enruta a través de más de 200 modelos. Incluye cuatro políticas con Balanced como predeterminada: Cheapest envía al modelo de menor costo que pueda responder, Balanced al modelo más barato que supere el umbral de calidad, Quality al modelo con mayor puntuación sin importar el precio, y Adaptive aprende de tu tráfico en vivo y ajusta el enrutamiento sobre la marcha. La evaluación se realiza en menos de un milisegundo, la latencia total añadida se mantiene por debajo de 50ms, y si el proveedor elegido limita la tasa o da error, el enrutador cambia a mitad de transmisión a un modelo saludable en menos de 50ms. No hay margen en ninguna capa: pagas a cada proveedor exactamente su precio publicado — los $0.09 o $5.00 de arriba son lo que pagas — y el enrutamiento en sí es gratuito.

Card titled 'What a managed AI router gives you' with the sub-line 'The six numbers that separate a router from a dashboard', listing six rows: 'One endpoint: 200+ models behind one OpenAI-compatible URL', 'Grading: under 1ms per prompt', 'Added latency: under 50ms total', 'Failover: mid-stream, under 50ms', 'Markup: $0 per token — provider list price passed through', 'Accuracy: RouterArena Jun 2026: 75.5 vs GPT-5 74.0', with a badge reading 'vs GPT-5 74.0' and a footer reading 'Grades across 200+ models · you pay each provider its exact price, we add $0. Per orcarouter.ai, fetched 2026-08-10. RouterArena contestants: GPT-5 74.0, Azure 72.8, Martian 61.6, NotDiamond 60.8.' OrcaRouter logo composited bottom-right.

En cuanto a precisión, la clasificación de RouterArena de junio de 2026 puntúa a OrcaRouter con un 75,5% frente a GPT-5 con 74,0, Azure con 72,8, Martian con 61,6 y NotDiamond con 60,8 (según orcarouter.ai). Una clasificación no prueba nada: trátala como un único punto de datos y ejecuta tu propia evaluación con tus propias consultas antes de confiarle a cualquier enrutador el tráfico de producción, incluido el nuestro. Esa es también la forma correcta de elegir entre enrutadores si no nos usas: pasa una porción del tráfico, mantén un plan de respaldo, fuerza tus consultas más difíciles y lee el registro de enrutamiento por solicitud antes de creerte la afirmación sobre el ahorro.

Cuando esta recomendación es incorrecta

Los casos en los que un router gestionado es la decisión equivocada, dicho sin rodeos:

Básicamente usas un solo modelo. Un router añade un salto y un impuesto de clasificación para nada. Llama directamente al proveedor y omite la capa.

Tus respuestas deben ser instantáneas. Si el requisito de extremo a extremo es de menos de unos 300 ms, el salto de enrutamiento más la lentitud de un modelo de gama media pueden romper tu presupuesto. Fija el modelo.

Tu volumen es mínimo. Routing te ahorra un porcentaje del gasto, y no puede ahorrarte un porcentaje de cero. Con menos de unos cientos de dólares al mes, tu tiempo vale más que los ahorros.

La elección del modelo debe ser auditable. Si una respuesta debe ser reproducible, o el modelo detrás de ella debe ser explicable a un revisor, la elección de un enrutador automático es una variable que debes justificar. Regístrala, fíjala o no enrutes.

No puedes medir la calidad. Sin una evaluación que te diga si la salida enrutada es lo suficientemente buena, no puedes saber si el enrutador está funcionando, y el enrutamiento agresivo por costos degradará silenciosamente una salida que nunca revisas.

Está aislado o sujeto a requisitos de cumplimiento. Si los modelos nunca deben salir de su red, un router administrado no es la forma adecuada en absoluto: ejecute una capa de enrutamiento de código abierto en su propia infraestructura.

Ya tienes una puerta de enlace de API. Si has invertido en una, amplía la existente en lugar de añadir un router paralelo. Las funciones de enrutamiento y de puerta de enlace convergen; una segunda capa es más gobernanza, no más valor.

La versión corta

Un router de IA, en el sentido que los ingenieros de IA le dan, es la capa de software que decide qué LLM responde cada solicitud — y el nombre se comparte, confusamente, con el hardware Wi-Fi que ejecuta Docker. Funciona clasificando cada prompt y enviando la mayoría fácil a un modelo barato, mientras mantiene la minoría difícil en los modelos de frontera, con conmutación por error cuando un proveedor se cae. Compensa cuando tus modelos difieren mucho en precio (DeepSeek V4 Flash a $0.09 frente a Claude Opus 5 a $5.00 por 1M de tokens de entrada es un margen de aproximadamente 55×) y tu tráfico es una mezcla de fácil y difícil; la investigación de la clase RouteLLM sitúa el techo de ahorro en torno al 85% con un suelo de calidad. Te cuesta latencia y algo de control de precisión, y es la respuesta equivocada para negocios con un solo modelo, presupuestos de latencia inferiores a 300 ms, gastos mínimos y equipos que no pueden medir la calidad de los resultados. Cuando sea adecuado, ejecútalo tras un suelo de calidad sin recargo por token, enruta primero una parte del tráfico y lee los registros de enrutamiento antes de creerte los ahorros.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube