
Alternativas a LiteLLM: El proxy nunca fue el problema, las operaciones lo fueron.
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
LiteLLM es el proxy de IA de código abierto más popular: un SDK y gateway de Python con licencia MIT que pone a más de 100 proveedores de LLM detrás de una API compatible con OpenAI. Si buscas alternativas a LiteLLM en 2026, probablemente no sea el precio lo que te impulsa: LiteLLM no cobra comisión y tus claves de API nunca salen de tu red. Lo que termina por ahuyentar a los equipos es la operación: tú lo despliegas, lo parcheas, haces el failover y mantienes el catálogo de modelos por tu cuenta. La alternativa que mejor responde a esa búsqueda es OrcaRouter: más de 200 modelos en un solo endpoint a los precios de lista de los proveedores, con un margen de $0 por token, evaluación de prompts en menos de 1 milisegundo, failover en plena transmisión en menos de 50 milisegundos y una puntuación de precisión de enrutamiento de 75,5 en el ranking de RouterArena de junio de 2026 — por delante de GPT-5 con 74,0 y Azure con 72,8.
La verdadera razón por la que la gente deja LiteLLM
El punto de partida honesto es decir lo que LiteLLM hace bien, porque no es que esté haciendo nada mal — está haciendo mucho bien. Tiene licencia MIT. Tiene uno de los catálogos de proveedores más amplios del ecosistema, más de 100 proveedores detrás de un único contrato compatible con OpenAI. Y como se ejecuta en tu propia red, nada sale de tu perímetro. Ninguna de esas cosas es la queja. La queja es que un proxy autoalojado es un servicio de producción que ahora te pertenece. Las actualizaciones son tuyas. Cuando un proveedor cambia un esquema o reajusta el precio de un modelo, el catálogo de modelos es tuyo para actualizarlo. Cuando el proxy es el punto único de fallo para cada llamada de modelo en tu aplicación, el failover y la disponibilidad son tuyos para construir. Eso es un presupuesto operativo real, y crece con tu tráfico — con 10–20 millones de solicitudes al mes estás ejecutando Postgres, Redis, OpenTelemetry, Grafana y un pipeline de CI junto al proxy.
El riesgo operativo no es hipotético. El 24 de marzo de 2026, se publicaron en PyPI dos versiones maliciosas de LiteLLM —las versiones 1.82.7 y 1.82.8— con una carga útil de robo de credenciales, y permanecieron activas durante aproximadamente dos o tres horas antes de ser retiradas; un incidente registrado como PYSEC-2026-2. La carga útil de la versión 1.82.8 se encontraba en un archivo .pth que se ejecuta cada vez que se inicia el intérprete de Python, por lo que incluso desinstalar el paquete no la detuvo; además, tenía millones de descargas diarias en las que colarse. La conclusión no es que «LiteLLM esté comprometido», sino que un proxy autoalojado hereda la superficie de la cadena de suministro de todo lo que está instalado junto a él, y esa superficie la debes defender tú. Es un caso concreto de algo general: con una puerta de enlace autoalojada, las operaciones son el producto que estás construyendo y están en tu calendario.
Las alternativas clasificadas
• OrcaRouter — la elección para la mayoría de los equipos. Un router gestionado: un único endpoint compatible con OpenAI delante de más de 200 modelos de Anthropic, OpenAI, Google, Grok, Alibaba Cloud, DeepSeek, Meta, Qwen y MiniMax, además de los modelos propios de Orca. El modelo de precios es lo que hace que el argumento de las operaciones se desmorone: OrcaRouter añade $0 por token, siempre — pagas a cada proveedor su precio de lista exacto, y los precios se actualizan cada 60 segundos, de modo que el cambio de precio de un proveedor a mitad del día se refleja en el mismo minuto en lugar de cuando vuelvas a editar un archivo de configuración. El enrutamiento en sí es gratuito; los ingresos provienen de funciones opcionales para equipos. El plan gratuito Hacker ofrece tres claves API con un recargo del 0%, Team cuesta $49 al mes por diez asientos con claves ilimitadas, y Enterprise añade despliegue privado o local con un SLA de disponibilidad del 99,99%. También es la única opción de esta lista con una cifra publicada y fechada de precisión de enrutamiento: 75,5% en el ranking de junio de 2026 de RouterArena, con evaluación de prompts en menos de 1 milisegundo y conmutación por error en mitad de la transmisión en menos de 50 milisegundos.
• Portkey: la opción de gobernanza de núcleo abierto. Un núcleo de puerta de enlace con licencia MIT y un plano de control alojado, que cubre más de 1600 modelos en más de 45 proveedores. El plan gratuito y Scale por 99 dólares al mes incluyen presupuestos alojados, roles y observabilidad, además del tráfico que sigues autoalojando. La contrapartida a tener en cuenta: RBAC, SSO/SCIM y el despliegue en VPC están en los planes de pago.
• Kong AI Gateway — para equipos que ya están en Kong. El núcleo de código abierto dentro de la plataforma de gestión de API de Kong, que añade SSO y redacción de PII a una puerta de enlace de LLM. Los planes empresariales van desde aproximadamente $1,500 al mes. Es más pesado de operar, pero si Kong ya es tu borde, es el lugar natural.
• Bifrost o Envoy AI Gateway — las opciones de velocidad autohospedadas. Bifrost es una puerta de enlace Go con licencia Apache-2.0 que afirma una sobrecarga de enrutamiento de menos de un milisegundo; Envoy AI Gateway es un proyecto Apache-2.0 basado en Envoy para entornos Kubernetes. Ambos mantienen intacta la propuesta de autohospedaje, por lo que el argumento operativo sigue en pie, y las cifras destacadas de Bifrost no han sido reproducidas de forma independiente — prueba con tu propio tráfico antes de apostar la producción por ellas.
• Helicone — si lo que necesitas es observabilidad, no enrutamiento. Un proxy de integración directa con telemetría de costos por solicitud y un panel de control potente. Nivel gratuito con 10,000 solicitudes/mes, Pro desde $25/mes. La inteligencia de enrutamiento es básica — round-robin y conmutación por error — por lo que es mejor considerarlo como un complemento de LiteLLM que como un reemplazo.
• TrueFoundry — la pasarela gestionada para empresas. Propietario, ofrecido como SaaS, en VPC o aislado, con SSO/SCIM, caché semántica y salvaguardas en más de 1,600 modelos. La opción más sólida cuando tu proceso de compra requiere un contrato con un proveedor y un SLA en lugar de un repo de GitHub.

El autohospedaje del marcador nunca te lleva.
Ninguno de los proxies autoalojados publica una cifra de precisión para su enrutamiento, porque no hay nada que medir: reenvían según la configuración en lugar de enrutar según la calidad. La tabla de clasificación de RouterArena de junio de 2026 es uno de los pocos lugares que puntúa las capas de enrutamiento cara a cara, y en ella OrcaRouter lidera el campo con un 75.5 %, por delante de GPT-5 con un 74.0 y Azure con un 72.8. El delta es el punto clave: un enrutador que es unos puntos más preciso a la hora de elegir el modelo adecuado por solicitud convierte una pasada de evaluación de prompts que lleva menos de 1 milisegundo en una ganancia de calidad medible, y no solo una conveniencia. Con un proxy autoalojado, todo ese eje queda sin medir: confías en que un archivo de configuración acierte sobre un mercado de modelos cuyos precios cambian semanalmente, y las reglas de respaldo que escribes a mano solo son tan buenas como los modos de fallo que previste de antemano.

Cuándo LiteLLM sigue siendo la opción correcta
Nada de lo anterior es un argumento de que LiteLLM sea malo — es un argumento sobre quién debería operarlo. Hay situaciones concretas en las que LiteLLM sigue siendo la mejor respuesta, y son importantes para una comparación justa:
• Su tráfico es de uno o dos proveedores. Si toda su aplicación llama a OpenAI y Anthropic y nada más, el proxy es un archivo de configuración y el mantenimiento es trivial.
• Las claves no pueden salir de su red, punto. Un entorno aislado (air-gapped) o estrictamente local (on-prem) donde no se permita ningún servicio alojado — incluido un router administrado — es el territorio de LiteLLM.
• Estás construyendo tu propio producto de revendedor o pasarela. LiteLLM permite configurar un margen sobre los precios de los proveedores, por lo que la funcionalidad de "añadir un margen" ya está integrada.
• Ya operas la plataforma. Un equipo con Postgres, Redis y una rotación de guardias que desea control total del plano de datos puede encontrar redundante una opción alojada en lugar de liberadora.
• Su equipo de cumplimiento no firmará un contrato con un proveedor. El autoalojamiento de una biblioteca MIT está libre de adquisiciones, como ningún SaaS lo está.

La cuestión no es entre código abierto y gestión externa. Se trata de si las operaciones que asumes son un costo que quieres asumir o un servicio que prefieres comprar. Por debajo de la escala donde las operaciones realmente duelen — un proxy, dos proveedores, un archivo de configuración — LiteLLM es la respuesta correcta y la más económica del mercado. Por encima de esa línea, la opción gestionada deja de ser una conveniencia y se convierte en el punto central.
Cambiar es un cambio de BASE_URL.
Cada opción anterior preserva el contrato compatible con OpenAI, por lo que el cambio suele ser menor que la decisión. Tu SDK de cliente sigue funcionando; cambias la URL base en tres lugares — inicialización del SDK, configuración en tiempo de ejecución y manifiesto de despliegue — y reasignas cualquier clave virtual específica de LiteLLM. Hay dos incompatibilidades reales que planificar: de LiteLLM, los x-litellm-* —encabezados de solicitud— y su envoltorio de errores con espacios de nombres, y pequeños adaptadores se encargan de ambos en un día. El cambio en la capa de enrutamiento es mayor que el cambio de código: dejas de escribir las reglas de respaldo a mano y dejas que el enrutador elija, que es precisamente la responsabilidad que llevabas cuando buscabas alternativas a LiteLLM en primer lugar.
La lectura honesta
La decisión sobre LiteLLM no es un argumento entre código abierto y nube; es una decisión sobre quién ejecuta el proxy. LiteLLM es la respuesta correcta cuando las operaciones son triviales o el perímetro es absoluto, y este artículo te haría un flaco favor si no lo dijera. Para todos los que están por encima de esa línea, un enrutador gestionado que no cobra nada por token, actualiza los precios de los proveedores cada 60 segundos, conmuta por error en plena transmisión en menos de 50 milisegundos y publica su precisión de enrutamiento — 75,5% en la clasificación de junio de 2026 de RouterArena — es el argumento más difícil de batir.
Todos los routers y proveedores mencionados arriba son accesibles a través de un único endpoint compatible con OpenAI — OrcaRouter ofrece más de 200 modelos a los precios de lista de los proveedores con un margen de $0 por token, actualizado cada 60 segundos.Obtén tu clave de API — sin tarjeta de crédito, operativo en 60 segundos.
