
Alternatives à LiteLLM : le proxy n'a jamais été le problème, c'étaient les opérations.
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
LiteLLM est le proxy IA open-source le plus populaire — un SDK Python et une passerelle sous licence MIT qui place plus de 100 fournisseurs de LLM derrière une API compatible OpenAI. Si vous cherchez des alternatives à LiteLLM en 2026, le prix n'est probablement pas ce qui vous motive : LiteLLM ne prend aucune commission, et vos clés API ne quittent jamais votre réseau. Ce qui pousse les équipes à partir, c'est l'exploitation — vous le déployez, le corrigez, assurez le basculement et maintenez vous-même le catalogue de modèles. L'alternative qui répond le mieux à cette recherche est OrcaRouter : plus de 200 modèles sur un seul endpoint aux prix catalogue des fournisseurs, avec 0 $ de marge par jeton, évaluation des prompts en moins d'une milliseconde, basculement en cours de flux en moins de 50 millisecondes, et un score de précision de routage de 75,5 au classement de RouterArena de juin 2026 — devant GPT-5 à 74,0 et Azure à 72,8.
La vraie raison pour laquelle les gens quittent LiteLLM
Le point de départ honnête est de dire ce que LiteLLM fait bien, car il ne fait pas que des erreurs — il fait beaucoup de choses bien. Il est sous licence MIT. Il dispose de l'un des catalogues de fournisseurs les plus étendus de l'écosystème, avec plus de 100 fournisseurs derrière un contrat unique compatible OpenAI. Et parce qu'il s'exécute dans votre propre réseau, rien ne sort de votre périmètre. Rien de tout cela n'est la critique. La critique est qu'un proxy auto-hébergé est un service de production que vous possédez désormais. Les mises à niveau vous incombent. Lorsqu'un fournisseur modifie un schéma ou change le prix d'un modèle, le catalogue de modèles est à vous de mettre à jour. Lorsque le proxy est le point de défaillance unique pour chaque appel de modèle dans votre application, le basculement et la disponibilité sont à vous de construire. C'est un véritable budget d'exploitation, et il croît avec votre trafic — à 10 à 20 millions de requêtes par mois, vous exécutez Postgres, Redis, OpenTelemetry, Grafana et un pipeline CI aux côtés du proxy.
Le risque opérationnel n'est pas hypothétique. Le 24 mars 2026, deux versions malveillantes de LiteLLM — les versions 1.82.7 et 1.82.8 — ont été publiées sur PyPI avec une charge utile de collecte d'identifiants et sont restées en ligne pendant environ deux à trois heures avant d'être retirées, un incident suivi sous le nom de PYSEC-2026-2. La charge utile de la version 1.82.8 se trouvait dans un fichier .pth qui s'exécute à chaque démarrage de l'interpréteur Python, donc même la désinstallation du paquet ne l'a pas arrêtée, et elle avait des millions de téléchargements quotidiens dans lesquels atterrir. La leçon n'est pas « LiteLLM est compromis » — c'est qu'un proxy auto-hébergé hérite de la surface de chaîne d'approvisionnement de tout ce qui est installé à côté de lui, et cette surface est à vous de défendre. C'est un exemple concret du principe général : avec une passerelle auto-hébergée, les opérations sont le produit que vous construisez, et elles sont à votre calendrier.
Les alternatives classées
• OrcaRouter — le choix de la plupart des équipes. Un routeur géré : un point de terminaison compatible OpenAI devant plus de 200 modèles d'Anthropic, OpenAI, Google, Grok, Alibaba Cloud, DeepSeek, Meta, Qwen et MiniMax, plus les propres modèles d'Orca. C'est le modèle de tarification qui fait s'effondrer l'argument des opérations : OrcaRouter ajoute $0 par jeton, à jamais — vous payez à chaque fournisseur son prix catalogue exact, et les prix sont actualisés toutes les 60 secondes, si bien qu'un changement de tarif en cours de journée chez un fournisseur apparaît dans la même minute, au lieu de n'apparaître qu'à votre prochaine édition d'un fichier de configuration. Le routage lui-même est gratuit ; les revenus proviennent de fonctionnalités d'équipe optionnelles. Le plan Hacker gratuit offre trois clés API avec une majoration de 0 %, Team est à 49 $/mois pour dix sièges avec des clés illimitées, et Enterprise ajoute un déploiement privé ou sur site avec un SLA de disponibilité de 99,99 %. C'est également la seule option de cette liste avec un chiffre de précision de routage publié et daté : 75,5 % au classement de RouterArena de juin 2026, avec une évaluation des prompts en moins d'une milliseconde et un basculement en cours de flux en moins de 50 millisecondes.
• Portkey — l'option de gouvernance open-core. Un noyau de passerelle sous licence MIT avec un plan de contrôle hébergé, prenant en charge plus de 1 600 modèles auprès de plus de 45 fournisseurs. Le niveau gratuit et Scale à 99 $/mois vous offrent des budgets, des rôles et une observabilité hébergés, en plus du trafic que vous continuez d'auto-héberger. Le compromis à prendre en compte : le RBAC, le SSO/SCIM et le déploiement VPC sont réservés aux offres payantes.
• Kong AI Gateway — pour les équipes qui utilisent déjà Kong. Le cœur open source de la plateforme de gestion d'API de Kong, ajoutant l'authentification unique (SSO) et la rédaction des données personnelles (PII) à une passerelle LLM. Les offres Enterprise démarrent à environ 1 500 $/mois. Son exploitation est plus lourde, mais si Kong est déjà votre point d'entrée, c'est le choix naturel.
• Bifrost ou Envoy AI Gateway — les choix rapides en auto-hébergement. Bifrost est une passerelle Go sous licence Apache-2.0 qui revendique une surcharge de routage inférieure à la milliseconde ; Envoy AI Gateway est un projet Apache-2.0 basé sur Envoy destiné aux environnements Kubernetes. Les deux conservent la promesse de l'auto-hébergement, donc l'argument opérationnel tient en grande partie, et les chiffres mis en avant par Bifrost n'ont pas été reproduits de manière indépendante — testez sur votre propre trafic avant de miser la production dessus.
• Helicone — si ce qu'il vous faut, c'est de l'observabilité, pas du routage. Un proxy intégrable directement avec télémétrie des coûts par requête et un tableau de bord solide. Offre gratuite à 10 000 requêtes/mois, Pro à partir de 25 $/mois. L'intelligence de routage est basique — round-robin et basculement — il est donc préférable de le considérer comme un compagnon de LiteLLM plutôt que comme un remplaçant.
• TrueFoundry — la passerelle d'entreprise gérée. Propriétaire, proposé en SaaS, dans un VPC ou un environnement air-gapped, avec SSO/SCIM, cache sémantique et garde-fous pour plus de 1 600+ modèles. Le meilleur choix lorsque vos achats exigent un contrat de fournisseur et un SLA plutôt qu'un dépôt GitHub.

L'auto-hébergement du tableau de score ne vous apporte jamais rien.
Aucun des proxys auto-hébergés ne publie de chiffre de précision pour leur routage, car il n’y a rien à mesurer — ils transmettent selon la configuration plutôt que de router selon la qualité. Le classement de juin 2026 de RouterArena est l’un des rares endroits qui évalue les couches de routage en confrontation directe, et OrcaRouter y mène le peloton avec 75,5 %, devant GPT-5 à 74,0 et Azure à 72,8. L’écart est le point clé : un routeur qui choisit le bon modèle par requête avec quelques points de plus de précision transforme une passe d’évaluation de prompt qui prend moins d’une milliseconde en un gain de qualité mesurable, et non en simple commodité. Avec un proxy auto-hébergé, tout cet axe reste non mesuré — vous faites confiance à un fichier de configuration pour qu’il ait raison sur un marché des modèles qui se réajuste chaque semaine, et les règles de repli que vous écrivez à la main ne valent que ce que valent les modes de défaillance que vous avez anticipés à l’avance.

Quand LiteLLM reste le bon choix
Aucun des points ci-dessus n'est un argument contre LiteLLM — il s'agit plutôt de savoir qui devrait l'exploiter. Il existe des situations concrètes où LiteLLM reste la meilleure réponse, et elles comptent pour une comparaison équitable :
• Votre trafic provient d'un ou deux fournisseurs. Si toute votre application appelle OpenAI et Anthropic et rien d'autre, le proxy est un fichier de configuration et la maintenance est triviale.
• Les clés ne peuvent pas quitter votre réseau, point final. Un environnement air-gapped ou strictement sur site, où aucun service hébergé — y compris un routeur géré — n'est autorisé, est le terrain de prédilection de LiteLLM.
• Vous développez vous-même un produit de revendeur ou de passerelle. LiteLLM permet de configurer une majoration par-dessus les prix des fournisseurs, donc l'ensemble de fonctionnalités « ajouter une marge » est déjà intégré.
• Vous exploitez déjà la plateforme. Une équipe qui utilise Postgres, Redis et une rotation d’astreinte, et qui souhaite un contrôle total du plan de données, pourrait trouver qu’une option hébergée est redondante plutôt que libératrice.
• Votre équipe de conformité ne signera pas de contrat avec un fournisseur. L'auto-hébergement d'une bibliothèque MIT est exempt de tout processus d'approvisionnement, ce qui n'est jamais le cas d'un SaaS.

Le test n'est pas une question d'open source par rapport à une solution gérée. Il s'agit de savoir si les opérations que vous prenez en charge sont un coût que vous voulez assumer ou un service que vous préférez acheter. En dessous de l'échelle où les opérations font réellement mal — un proxy, deux fournisseurs, un fichier de configuration — LiteLLM est la bonne réponse et la moins chère du marché. Au-dessus de cette ligne, l'option gérée cesse d'être une commodité et devient l'essentiel.
Basculer revient à changer BASE_URL
Chaque option ci-dessus préserve le contrat compatible OpenAI, ce qui explique pourquoi la bascule est généralement moins lourde que la décision. Votre SDK client continue de fonctionner ; vous changez l'URL de base à trois endroits — l'initialisation du SDK, la configuration d'exécution et le manifeste de déploiement — et vous re-mappez les éventuelles clés virtuelles spécifiques à LiteLLM. Il y a deux incompatibilités réelles à prévoir du côté de LiteLLM : la présence de x-litellm-* dans les en-têtes de requête et son enveloppe d'erreur avec espace de noms, que de petits adaptateurs gèrent en une journée. Le changement de la couche de routage est plus important que le changement de code : vous cessez d'écrire des règles de repli à la main et laissez le routeur choisir, ce qui est précisément la responsabilité que vous portiez lorsque vous cherchiez des alternatives à LiteLLM au départ.
La lecture honnête
La décision LiteLLM n'est pas un débat open source contre cloud ; c'est une décision sur qui fait tourner le proxy. LiteLLM est la bonne réponse lorsque les opérations sont triviales ou que le périmètre est absolu, et cet article vous rendrait un mauvais service s'il ne le disait pas. Pour tous ceux qui se situent au-dessus de cette ligne, un routeur géré qui ne facture rien par token, actualise les prix des fournisseurs toutes les 60 secondes, effectue un basculement en cours de flux en moins de 50 millisecondes, et publie la précision de son routage — 75.5% au classement de RouterArena de juin 2026 — est l'argument le plus difficile à battre.
Chaque routeur et fournisseur mentionné ci-dessus est accessible via un endpoint compatible OpenAI — OrcaRouter propose plus de 200 modèles aux prix catalogue des fournisseurs avec une majoration de 0 $ par jeton, le tout actualisé toutes les 60 secondes.Obtenez votre clé API — sans carte de crédit, opérationnel en 60 secondes.
