Grande carte de titre indiquant « Qu'est-ce qu'un routeur IA ? », avec le sous-titre « Note chaque prompt, sélectionne automatiquement votre meilleur modèle », montrant trois cartes arrondies intitulées GRADE « Lire le prompt », ROUTE « Choisir le meilleur modèle » et FAILOVER « Basculer si un fournisseur tombe » sur un fond blanc avec des accents bleus et cyan. Logo OrcaRouter composé en bas à droite.
Guides & Insights

Qu'est-ce qu'un routeur IA ? La couche de routage LLM qui sélectionne votre modèle.

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Un routeur IA est une couche logicielle entre votre application et les fournisseurs de modèles, qui décide, pour chaque requête, quel modèle doit y répondre. La requête est notée selon sa difficulté et acheminée vers un modèle bon marché quand elle est facile, et vers un modèle de pointe quand elle est difficile — soit la différence entre payer DeepSeek V4 Flash 0,09 $ et Claude Opus 5 5,00 $ pour 1M de jetons d'entrée pour le même appel. L'autre « routeur IA » que vous trouverez en première page de cette recherche exacte — le matériel Wi-Fi doté d'un cœur neuronal — est un produit différent, et cette collision de dénomination explique pourquoi si peu de ces résultats vous aident.

En août 2026, une recherche de « ai router » renvoie surtout des articles de presse sur les réseaux domestiques. ASUS commercialise le ROG Rapture GT-BE19000AI comme « le premier routeur de jeu IA au monde » — un appareil Wi-Fi 7 doté d'un NPU, de 4 Go de RAM, de 32 Go de stockage et d'un moteur Docker qui exécute Home Assistant ou AdGuard sur le routeur lui-même. ZTE, avec Tianyi Digital Life de China Telecom, a lancé un routeur domestique Wi-Fi 7 « à l'IA native » qui détecte quand vous quittez la maison et reconfigure tout seul le réseau de la maison intelligente. Ce sont des appareils vraiment intéressants, mais ils ne correspondent pas à ce qu'un développeur entend par « routeur IA ». Cet article porte sur le routeur LLM : la catégorie qui se situe entre votre code et les API de grands modèles de langage et qui choisit quel modèle répond à chaque requête. Il couvre les deux significations du nom, ce que fait réellement le routeur, ce qu'il permet d'économiser et ce qu'il coûte, ainsi que les cas où vous ne devriez pas en utiliser.

Deux produits différents partagent le même nom.

L'expression « AI router » est une collision, et les deux sens n'ont presque rien en commun :

Le matériel « routeur IA ». Un routeur Wi-Fi avec des fonctionnalités d'IA sur la boîte — un NPU pour l'inférence sur l'appareil, l'optimisation du trafic, parfois Docker. Des exemples sont l'ASUS ROG Rapture GT-BE19000AI (annoncé début 2026) et le routeur IA domestique ZTE / Tianyi Digital Life (juin 2026). Son rôle est de gérer votre réseau domestique ou celui d'un petit bureau.

Le routeur LLM. Un service logiciel qui reçoit chaque appel API que votre application effectue et le transmet au meilleur modèle — celui qui franchit votre seuil de qualité au prix le plus bas. Son rôle est de dépenser judicieusement votre budget de modèles. C’est le « routeur IA » dont parlent les ingénieurs en IA, et c’est le sujet de cet article.

Two-panel disambiguation card titled 'Two products, one name'. Left panel 'Wi-Fi hardware AI router' lists 'Processor: NPU core for on-device AI', 'Apps: runs Docker — Home Assistant, AdGuard', 'Trick: AI traffic optimisation, WiFi Insight', with a spot noting examples 'ASUS ROG Rapture GT-BE19000AI · ZTE / Tianyi home AI router' sourced to ASUS and ZTE product announcements Mar–Jun 2026. Right panel 'LLM model router' lists 'One endpoint: 200+ models behind one URL', 'Decision: grades every prompt', 'Route: picks the model per request', 'Reliability: fails over when a provider drops', with a spot noting 'The category this article explains'. OrcaRouter logo composited bottom-right.

La confusion ne relève pas que de la sémantique. Celui qui cherche « ai router » pour trouver la catégorie logicielle obtient une avalanche de tests matériels ; celui qui cherche « ai router » pour une nouvelle box Wi-Fi reçoit du marketing sur les NPU au lieu de chiffres de débit. Aucune de ces SERP ne reconnaît honnêtement l'ambiguïté, et c'est exactement la lacune que cette page comble — le sens logiciel, défini par opposition au sens matériel.

Ce que fait réellement un routeur LLM

Enlevez le marketing et un routeur de modèles a trois tâches, toutes ennuyeuses et toutes précieuses. Premièrement, c'est un point de terminaison unique : votre code appelle une seule URL, compatible OpenAI, au lieu d'un SDK par fournisseur. Deuxièmement, il évalue la requête — lit le prompt et estime sa difficulté — et l'achemine : le travail facile vers un modèle bon marché et rapide, le raisonnement vraiment difficile vers un modèle de pointe. Troisièmement, il assure le basculement : si le fournisseur choisi vous limite en débit ou renvoie une erreur 5xx, le routeur réessaie avec un modèle sain sans que votre application ne voie jamais l'erreur.

L'étape de décision est là où les routeurs diffèrent, et le spectre est le même que celui auquel on s'attend. Les routeurs basés sur des règles font correspondre des mots-clés ou la longueur du prompt à un modèle — en moins d'une milliseconde, prévisibles, mais fragiles lorsque les prix ou les modèles changent. Les routeurs sémantiques intègrent le prompt et routent selon le sens, de sorte que « quel est mon solde ? » et « combien d'argent j'ai » arrivent sur le même chemin. Les routeurs appris observent le trafic réel et se tournent vers le modèle qui l'emporte en qualité par dollar — le routeur de production de Ramp décrit cela comme un bandit à échantillonnage de Thompson et lui attribue une réduction des coûts d'environ 30 %, et la recherche RouteLLM de LMSYS fait état d'un routeur à factorisation matricielle qui a conservé environ 95 % du score de GPT-4 tout en n'envoyant que 14 % des requêtes au modèle fort. Les mécanismes plus profonds des politiques de routage font l'objet d'un traitement complet dans notre guide, Auto Router for LLMs ; ici, l'essentiel est que l'intelligence de décision existe sur un spectre, et « le point du spectre dont vous avez besoin » est une décision produit, et non une liste de fonctionnalités.

L'écart de prix est ce qui rend l'opération rentable.

Un routeur ne justifie sa place que lorsque les modèles diffèrent beaucoup en prix, et en ce moment ils diffèrent énormément. Tous les tarifs ci-dessous sont les prix directs des fournisseurs par 1M tokens du catalogue de modèles OrcaRouter, relevés le 10 août 2026 :

Price table card titled 'The price spread, per 1M tokens' with the sub-line 'Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10', listing seven models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, MiniMax M3 $0.30/$1.20, GPT-5.6 Terra $1.00/$6.00, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00, Claude Opus 5 $5.00/$25.00, DeepSeek V4 Flash highlighted green and Claude Opus 5 highlighted red, with a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Rates per the OrcaRouter model catalogue, read 2026-08-10.' OrcaRouter logo composited bottom-right.

Lisez l'écart et l'argument s'écrit tout seul. DeepSeek V4 Flash à $0.09/$0.18 par 1M contre Claude Opus 5 à $5.00/$25.00 représente environ une différence de 55× rien que sur les tokens d'entrée, et l'écart entre le palier économique et le palier de pointe est désormais une caractéristique régulière du marché plutôt qu'une remise ponctuelle. Si votre trafic est un mélange typique — une majorité de requêtes courtes et bien spécifiées et une minorité de raisonnements vraiment difficiles — envoyer tout au modèle de pointe signifie payer le prix fort pour les 80 % faciles. C'est dans un routeur qui aiguille les appels faciles vers le palier économique que se trouvent les économies.

Les chiffres mesurés concordent. Les recherches de la classe RouteLLM font état d'économies allant jusqu'à environ 85 % tout en préservant une qualité de niveau frontière — mais uniquement lorsque le routeur est associé à un plancher de qualité qui refuse de lésiner sur les requêtes qui nécessitent réellement les modèles de pointe. Ramp rapporte une réduction d'environ 30 % sur un trafic de production réel, sans baisse de qualité significative. Les glossaires des fournisseurs de routeurs citent des réductions de coût par requête de 50 à 70 % pour orienter les tâches faciles hors des modèles de pointe. L'éventail des chiffres est le reflet honnête de la réalité : le plafond dépend de la forme de votre trafic, et le plancher est ce que votre évaluation qualité en dit. Ce qu'il ne faut pas croire, c'est un chiffre unique et figé du type « le routage économise X % », car c'est une propriété de votre charge de travail, pas des routeurs en général.

Ce que le routage vous coûte

Les deux coûts que personne ne prend en compte dans l'évaluation du matériel sont la latence et la précision, et les deux sont bien réels.

Latence.Chaque requête routée paie un coût de classification avant même que le modèle ne démarre. Un classifieur basé sur des règles prend moins d'une milliseconde ; un petit modèle d'embedding ou de classification ajoute environ 50 à 200 ms ; un classifieur de domaine entraîné, davantage. La plupart des routeurs masquent l'essentiel de ce coût en classifiant pendant qu'ils préparent la requête en amont, et un endpoint de routage en production a mesuré une surcharge de bout en bout d'environ 55 ms en médiane — moins de 1 % d'un temps de réponse normal. Mais si votre trafic est en temps réel — un agent vocal, une interface qui doit répondre en moins de 300 ms — un saut de routage de plusieurs centaines de millisecondes peut faire la différence entre utilisable et inutilisable. Cette seule contrainte est la raison la plus courante pour laquelle une équipe ayant un cas d'usage de routage légitime décide de ne pas router.

Exactitude. Un routeur ne vaut que par le jugement sur lequel il fonde ses décisions de routage. Un classificateur entraîné sur des benchmarks génériques peut se tromper en toute confiance dans votre domaine : votre tâche de résumé « facile » pourrait être facile pour le modèle de pointe et impossible pour le modèle bon marché. Le mode de défaillance est silencieux — l'utilisateur obtient simplement une sortie de moindre qualité et personne ne le consigne — c'est pourquoi chaque routeur crédible est livré avec un plancher de qualité ou un mode équilibré, et pourquoi un mode agressif sur les coûts devrait être une expérimentation, et non une valeur par défaut.

Il y a aussi un troisième coût subtil : le code du routeur peut casser les réductions fournisseur que vous avez déjà. OpenAI et Anthropic offrent tous deux des réductions sur les préfixes de prompt répétés, typiquement environ 90 % de réduction sur les jetons d'entrée lors des lectures de cache. Si votre couche de routage réécrit, réordonne ou injecte un horodatage rotatif dans le prompt, elle invalide le préfixe et jette cette réduction aux oubliettes. Un bon routeur transmet le prompt octet pour octet et laisse le cache du fournisseur fonctionner ; un routeur négligent transforme silencieusement vos accès cache en appels au prix fort.

Routeur contre passerelle, en un paragraphe.

Vous verrez aussi « AI gateway » utilisé presque de manière interchangeable, et la distinction vaut la peine d'être faite même si la plupart des produits gérés cumulent les deux. Un routeur répond à la question quel modèle — coût, latence, capacité. Une passerelle répond à la question qui est autorisé à l'appeler — authentification, limites de débit de jetons, budgets, journaux d'audit, conformité. Si vous avez besoin de gouvernance autour d'une équipe ou d'un produit, vous avez besoin des fonctionnalités de passerelle ; si vous avez besoin d'un mélange de modèles moins cher, vous avez besoin du routage. La distinction opérationnelle est traitée en détail dans notre guide, AI API Gateway in 2026 ; ici, l'essentiel à retenir est qu'« un routeur AI » désigne généralement un produit qui combine les deux moitiés, et vous devriez demander pour quelle moitié vous payez réellement.

Quand vous avez réellement besoin d'un routeur IA

La liste honnête des déclencheurs, plutôt qu'un argumentaire marketing pour un routage systématique :

Vous exploitez plus d'un modèle en production. Le routage est ce qui vous permet de garder un mix rationnel à mesure que de nouveaux modèles arrivent et que les prix évoluent. Une organisation qui n'exploite qu'un seul modèle n'en a pas besoin.

Votre trafic est un mélange de requêtes faciles et difficiles. Si chaque requête est également difficile, le routeur n’a rien à arbitrer. Classifier puis router ne rapporte que lorsqu’il y a une majorité peu coûteuse à capter.

Votre volume est suffisamment important pour qu’un pourcentage compte. Une réduction de 40 % sur 50 $ de dépenses par mois équivaut à 20 $ ; sur 50 000 $, c’est un poste.

Les défaillances de fournisseurs vous coûtent cher. Le basculement automatique entre fournisseurs est souvent le premier avantage concret que les équipes constatent, avant même les économies de coûts.

Vous voulez un contrat, une clé, un point de terminaison. Le coût d'intégration de N fournisseurs est en soi une raison de passer par un seul.

Inversez ces critères et vous obtenez la liste des cas où l'on s'en passe : un modèle unique, une difficulté uniforme, un coût dérisoire, ou un budget de latence qu'une étape de classification fait exploser. Pour ces équipes, un routeur est un surcoût, et appeler directement le fournisseur est la meilleure réponse.

La recommandation : un routeur géré avec un plancher de qualité.

Pour une équipe qui a dépassé les seuils de déclenchement ci-dessus, la recommandation est un routeur géré qui maintient un plancher de qualité et ne facture aucune marge sur les jetons. Notre propre produit est OrcaRouter, et c'est celui que nous pouvons détailler ; les spécificités ci-dessous sont donc les nôtres ; la liste de contrôle qui suit s'applique à tout routeur que vous évaluez.

Le mode automatique d'OrcaRouter — demandez le nom du modèle orcarouter/auto sur le endpoint compatible OpenAI standard — évalue chaque prompt et le route vers plus de 200 modèles. Il comprend quatre politiques avec Balanced par défaut : Cheapest envoie au modèle le moins cher capable de répondre, Balanced au modèle le moins cher qui atteint le seuil de qualité, Quality au modèle le mieux noté quel que soit le prix, et Adaptive apprend de votre trafic en direct et ajuste le routage au fur et à mesure. Le scoring est mesuré en moins d'une milliseconde, la latence totale ajoutée reste sous 50 ms, et si le fournisseur choisi limite le débit ou rencontre une erreur, le routeur bascule en cours de flux vers un modèle sain en moins de 50 ms. Aucune marge n'est appliquée à aucun niveau : vous payez à chaque fournisseur son prix public exact — les chiffres de $0.09 ou $5.00 ci-dessus correspondent à ce que vous payez — et le routage lui-même est gratuit.

Card titled 'What a managed AI router gives you' with the sub-line 'The six numbers that separate a router from a dashboard', listing six rows: 'One endpoint: 200+ models behind one OpenAI-compatible URL', 'Grading: under 1ms per prompt', 'Added latency: under 50ms total', 'Failover: mid-stream, under 50ms', 'Markup: $0 per token — provider list price passed through', 'Accuracy: RouterArena Jun 2026: 75.5 vs GPT-5 74.0', with a badge reading 'vs GPT-5 74.0' and a footer reading 'Grades across 200+ models · you pay each provider its exact price, we add $0. Per orcarouter.ai, fetched 2026-08-10. RouterArena contestants: GPT-5 74.0, Azure 72.8, Martian 61.6, NotDiamond 60.8.' OrcaRouter logo composited bottom-right.

En matière de précision, le classement de juin 2026 de RouterArena attribue à OrcaRouter un score de 75,5 %, contre 74,0 pour GPT-5, 72,8 pour Azure, 61,6 pour Martian et 60,8 pour NotDiamond (selon orcarouter.ai). {{1}}Un seul classement ne prouve rien — traitez-le comme un simple point de données et exécutez votre propre évaluation sur vos propres prompts avant de confier du trafic de production à un routeur, y compris le nôtre.{{/1}} {{2}}C'est aussi la bonne façon de choisir entre les routeurs si vous n'utilisez pas le nôtre : faites passer une fraction de votre trafic, conservez un repli, forcez vos prompts les plus difficiles, et lisez le journal de routage par requête avant de croire aux promesses d'économies.{{/2}}

Quand cette recommandation est erronée

Les cas où un routeur géré est le mauvais choix, dit clairement :

Vous utilisez essentiellement un seul modèle. Un routeur ajoute un saut et une taxe de classification pour rien. Appelez directement le fournisseur et contournez la couche.

Vos réponses doivent être instantanées. Si l'exigence est de bout en bout sous environ 300 ms, le saut de routage plus la lenteur d'un modèle de niveau intermédiaire peuvent faire exploser votre budget. Épinglez le modèle.

Votre volume est minuscule. Le routage vous fait économiser un pourcentage des dépenses, et il ne peut pas vous faire économiser un pourcentage de zéro. En dessous de quelques centaines de dollars par mois, votre temps vaut plus que les économies réalisées.

Le choix du modèle doit être auditable. Si une réponse doit être reproductible, ou si le modèle qui la sous-tend doit être explicable à un réviseur, le choix d'un routeur automatique est une variable que vous devez justifier. Consignez-le, figez-le, ou ne routez pas.

Vous ne pouvez pas mesurer la qualité. Sans évaluation qui vous indique si la sortie routée est suffisamment bonne, vous ne pouvez pas savoir si le routeur fonctionne, et un routage agressif axé sur les coûts dégradera silencieusement des sorties que vous ne vérifiez jamais.

Vous êtes dans un environnement isolé (air-gapped) ou soumis à des exigences de conformité. Si les modèles ne doivent jamais quitter votre réseau, un routeur géré n'est pas du tout adapté — exécutez une couche de routage open source sur votre propre infrastructure.

Vous utilisez déjà une passerelle API. Si vous avez investi dans une, étendez la solution existante plutôt que d'ajouter un routeur parallèle. Les fonctionnalités de routage et de passerelle convergent ; une seconde couche apporte plus de gouvernance, pas plus de valeur.

La version courte

Un routeur d'IA, au sens où l'entendent les ingénieurs en IA, est la couche logicielle qui décide quel LLM répond à chaque requête — et le nom est partagé, de manière confuse, avec le matériel Wi-Fi qui exécute Docker. Il fonctionne en évaluant chaque prompt et en envoyant la majorité facile à un modèle économique tout en gardant la minorité difficile sur la frontière, avec basculement en cas de défaillance d'un fournisseur. Cela devient rentable lorsque vos modèles diffèrent beaucoup en prix (DeepSeek V4 Flash à 0,09 $ contre Claude Opus 5 à 5,00 $ par million de jetons d'entrée, soit un écart d'environ 55×) et que votre trafic est un mélange de tâches faciles et difficiles ; les recherches de type RouteLLM situent le plafond des économies autour de 85 % avec un plancher de qualité. Cela vous coûte de la latence et une partie du contrôle de la précision, et c'est la mauvaise réponse pour les équipes mono-modèle, les budgets de latence inférieurs à 300 ms, les dépenses minimes et les équipes qui ne peuvent pas mesurer la qualité des sorties. Quand c'est pertinent, exécutez-le derrière un plancher de qualité sans majoration de tokens, routez d'abord une partie du trafic, et lisez les journaux de routage avant de croire aux économies.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube