Carte de titre héro affichant « Qu'est-ce qu'un routeur LLM ? » avec le sous-titre « La couche de sélection des modèles, les vrais calculs, et quand s'en passer », montrant trois cartes arrondies étiquetées UN SEUL POINT DE TERMINAISON, ÉVALUER ET AIGUILLER et BASCULEMENT sur un fond blanc avec des accents bleus et cyan et le logo OrcaRouter composé en bas à droite.
Guides & Insights

Qu'est-ce qu'un routeur LLM ? La couche de sélection des modèles, les vrais calculs, et quand l'ignorer.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un routeur LLM est une couche logicielle qui se situe entre votre application et les fournisseurs de modèles et décide, pour chaque requête, quel modèle doit y répondre — un modèle bon marché et rapide comme DeepSeek V4 Flash lorsque la tâche est facile, un modèle de pointe comme Claude Opus 5 lorsqu'elle est véritablement difficile. Le but, c'est l'argent : DeepSeek V4 Flash coûte 0,09 $ par million de jetons d'entrée et Claude Opus 5 coûte 5,00 $, tarifs directs des fournisseurs du catalogue de modèles OrcaRouter lu le 10 août 2026 — un écart de 55× sur le même appel. Envoyez les 80 % faciles de votre trafic vers le bas et gardez les 20 % difficiles vers le haut, et vous actionnez le plus gros levier de coûts que la plupart des équipes ne touchent jamais.

Ce qu'est réellement un routeur LLM

Enlevez le marketing et un routeur de modèles a trois tâches, toutes ennuyeuses et toutes précieuses. C'est un point de terminaison unique : votre code appelle une URL compatible OpenAI au lieu d'un SDK par fournisseur. Il évalue la requête, estimant sa difficulté, et l'achemine : les tâches faciles vers un modèle bon marché, les raisonnements vraiment difficiles vers un modèle de pointe. Et il assure le basculement : si le fournisseur choisi vous limite en débit ou renvoie une erreur 5xx, le routeur réessaie avec un modèle sain sans que votre application ne voie jamais l'erreur.

L'étape de décision est là où les routeurs diffèrent, et le spectre est bien connu. Les routeurs basés sur des règles associent des mots-clés ou la longueur du prompt à un modèle — en moins d'une milliseconde, prévisibles, fragiles lorsque les prix ou les modèles changent. Les routeurs sémantiques intègrent le prompt et routent par le sens, de sorte que « quel est mon solde ? » et « combien d'argent j'ai » aboutissent sur le même chemin. Les routeurs entraînés observent le trafic réel et se tournent vers le modèle qui gagne en qualité par dollar. Les mécanismes de chacun — y compris les plages de précision des différents types de classifieurs et le mode automatique qui évalue chaque prompt — sont traités en détail dans notre guide, Auto Router for LLMs ; ici, le point est que l'intelligence de routage existe sur un spectre, et le point dont vous avez besoin est une décision produit, pas une liste de fonctionnalités.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Si vous avez aussi vu « AI router » utilisé pour du matériel Wi-Fi avec un NPU intégré — c'est un produit différent qui partage le même nom, et nous démêlons cette collision dans notre guide des routeurs IA. Tout dans cet article concerne la catégorie logicielle.

L'écart de prix est ce qui rend l'opération rentable.

Un routeur ne justifie sa place que lorsque les modèles diffèrent beaucoup en prix, et en ce moment ils diffèrent énormément. Tous les tarifs ci-dessous sont les prix directs des fournisseurs par 1M tokens du catalogue de modèles OrcaRouter, relevés le 10 août 2026 :

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

Lisez l'écart et l'argument s'écrit de lui-même. DeepSeek V4 Flash à 0,09 $ contre Claude Opus 5 à 5,00 $ représente une différence d'environ 55× rien que sur les tokens d'entrée, et l'écart entre le palier économique et le palier de pointe est désormais une caractéristique permanente du marché plutôt qu'une remise ponctuelle. Si votre trafic est un mélange typique — une majorité de requêtes courtes et bien spécifiées et une minorité de raisonnements vraiment difficiles — tout exécuter sur le palier de pointe signifie payer le prix fort pour les 80 % faciles.

Voici ce qui vous déçoit dans les résultats actuels de la première page pour « llm router ». L'entrée du glossaire de Decagon, par exemple, cite « GPT-4o, Claude 3.5 Sonnet et Gemini 1.5 Pro » à « 5–15 $ par million de jetons d'entrée » — des modèles qui étaient d'actualité il y a deux ans, à des prix environ deux fois supérieurs à ceux d'aujourd'hui. Le marché a évolué ; la définition, non. C'est la principale raison de se méfier d'une explication sur les routeurs LLM sans date.

Ce que la recherche sur l’épargne dit réellement

L'arithmétique ci-dessus est réelle, et la recherche l'est aussi — mais le tableau honnête est une fourchette, pas un nombre unique.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Voici le calcul détaillé, avec les hypothèses indiquées afin que vous puissiez les ajuster. Un bot d'assistance gérant 100 000 conversations par mois, chacune envoyant 1 000 jetons d'entrée et générant 200 jetons de sortie : tout faire fonctionner sur Claude Sonnet 5 coûte environ 400 $ par mois. Acheminez les 80 % faciles vers DeepSeek V4 Flash et gardez les 20 % difficiles sur Claude Sonnet 5 : le même trafic coûte alors environ 90 $, soit environ 78 % de moins, avant toute mise en cache des invites, ce qui élargirait encore l'écart.

Le point à retenir : le routage agressif permet d'économiser 60 à 85 % lorsque votre trafic est majoritairement simple, le routage équilibré permet d'économiser 35 à 45 %, et même le routage conservateur permet d'économiser 10 à 15 %. Le chiffre exact pour vous est une propriété de votre trafic, mesurée sur vos propres requêtes — pas une constante que vous pouvez copier depuis un article de blog.

Les trois coûts que le routage masque

Les deux coûts que personne ne mentionne dans l'entrée du glossaire sont la latence et la précision, et il y en a un troisième qui est plus subtil.

Latence.Chaque requête routée paie une taxe de classification avant même que le modèle ne démarre. Un classificateur à base de règles prend moins d'une milliseconde ; un petit modèle d'embedding ou de classification ajoute environ 50 à 200 ms ; un classificateur de domaine entraîné, davantage. Un bon routeur masque l'essentiel de ce coût en classifiant pendant qu'il prépare la requête en amont, et un point de terminaison de routage en production a mesuré un surcoût de bout en bout d'environ 55 ms en médiane — soit moins de 1 % d'un temps de réponse normal. Mais si votre trafic est en temps réel — un agent vocal, une interface qui doit répondre en moins de 300 ms — un saut de routage de plusieurs centaines de millisecondes peut faire la différence entre utilisable et inutilisable. Cette seule contrainte est la raison la plus courante pour laquelle une équipe ayant un cas d'usage légitime de routage décide de ne pas router.

Exactitude. Un routeur ne vaut que par le jugement sur lequel il s'appuie pour router. Un classifieur entraîné sur des benchmarks généraux peut se tromper avec assurance sur votre domaine : votre tâche de résumé « facile » peut être facile pour le modèle de pointe et impossible pour le modèle bon marché. Le mode de défaillance est silencieux — l'utilisateur obtient simplement de moins bons résultats et personne ne le consigne — c'est pourquoi tout routeur crédible est livré avec un plancher de qualité ou un mode équilibré.

Invalidation du cache. OpenAI et Anthropic accordent tous deux une remise sur les préfixes de prompt répétés, généralement d'environ 90 % sur les jetons d'entrée lors des lectures de cache. Si votre couche de routage réécrit, réordonne ou injecte un horodatage rotatif dans le prompt, elle invalide le préfixe et fait perdre cette remise. Un bon routeur transmet le prompt octet par octet et laisse le cache du fournisseur faire son travail.

La recommandation : un routeur géré avec un plancher de qualité.

Si vous utilisez plusieurs modèles en production, que votre trafic est un mélange de requêtes faciles et difficiles, et que votre volume est suffisamment important pour qu'un pourcentage représente une somme d'argent réelle, la recommandation est d'utiliser un routeur géré qui maintient un plancher de qualité et ne facture aucune marge sur les jetons. Notre propre produit est OrcaRouter, et c'est celui dont nous pouvons parler en détail ; la liste de contrôle qui suit s'applique à tout routeur que vous évaluez.

Le mode auto d'OrcaRouter — demandez le nom du modèle orcarouter/auto sur le point de terminaison standard compatible OpenAI — évalue chaque prompt et l'achemine vers plus de 200 modèles. Il propose quatre politiques de routage, Balanced étant la valeur par défaut : Cheapest envoie vers le modèle le moins cher capable de répondre ; Balanced envoie vers le modèle le moins cher qui atteint le seuil de qualité ; Quality envoie vers le modèle le mieux noté, quel que soit le prix ; Adaptive apprend de votre trafic en direct et ajuste le routage au fur et à mesure. L'évaluation est mesurée en moins d'une milliseconde, la latence totale ajoutée reste sous 50 ms, et si le fournisseur choisi limite le débit ou rencontre une erreur, le routeur bascule en cours de flux vers un modèle fonctionnel en moins de 50 ms. Il n'y a aucune majoration à aucun niveau : vous payez à chaque fournisseur son prix publié exact — les chiffres de 0,09 $ ou 5,00 $ ci-dessus correspondent à ce que vous payez — et le routage lui-même est gratuit.

En matière de précision, le classement RouterArena de juin 2026 attribue à OrcaRouter un score de 75,5 %, contre 74,0 % pour l’alternative suivie la plus proche (selon orcarouter.ai). Un classement ne prouve rien à lui seul — considérez-le comme un simple point de données et effectuez votre propre évaluation sur vos propres invites avant de confier du trafic de production à un routeur, y compris au nôtre. Et si vous cherchez à déterminer si vous avez besoin de fonctionnalités de routeur ou de passerelle, la distinction entre routeur et passerelle est expliquée dans notre guide, AI API Gateway in 2026.

Quand cette recommandation est erronée

La skip list honnête, en termes simples :

La version courte

Un routeur LLM est la couche qui choisit quel modèle répond à chaque requête — peu coûteux et rapide pour la majorité facile, haut de gamme pour la minorité difficile, avec bascule en cas de panne d'un fournisseur. Il est rentable lorsque vos modèles diffèrent beaucoup en prix (DeepSeek V4 Flash à 0,09 $ contre Claude Opus 5 à 5,00 $ pour 1 million de jetons d'entrée, soit un écart de 55×) et que votre trafic est un mélange de tâches faciles et difficiles. La recherche situe le plafond des économies autour de 85 % derrière un plancher de qualité, et le plancher à ce que votre évaluation dit qu'il est. Cela vous coûte de la latence et un certain contrôle de la précision, et c'est la mauvaise réponse pour les équipes mono-modèle, les budgets de latence inférieurs à 300 ms, les dépenses minimes et les équipes qui ne peuvent pas mesurer la qualité des réponses. Lorsque c'est approprié, exécutez-le derrière un plancher de qualité sans majoration de jetons, routez d'abord une partie du trafic, et lisez les journaux de routage avant de croire aux économies.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube