
Wat is een AI-router? De LLM-routinglaag die jouw model kiest
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Een AI-router is een softwarelaag tussen je applicatie en de modelproviders die voor elk verzoek beslist welk model het moet beantwoorden. De prompt wordt beoordeeld op moeilijkheidsgraad en doorgestuurd naar een goedkoop model als deze eenvoudig is en naar een frontier-model als deze moeilijk is — het verschil tussen $0,09 betalen aan DeepSeek V4 Flash en $5,00 aan Claude Opus 5 per 1M invoertokens voor dezelfde aanroep. De andere 'AI-router' die je op pagina één van deze exacte zoekopdracht vindt — de Wi-Fi-hardware met een neurale kern — is een ander product, en die naamgevingsbotsing is de reden dat zo weinig van die resultaten helpen.
Een zoekopdracht naar "ai router" in augustus 2026 levert voornamelijk persberichten over thuisnetwerken op. ASUS verkoopt de ROG Rapture GT-BE19000AI als "de eerste AI-gamingrouter ter wereld" — een Wi-Fi 7-apparaat met een NPU, 4 GB RAM, 32 GB opslag en een Docker-engine die Home Assistant of AdGuard op de router zelf draait. ZTE heeft samen met Tianyi Digital Life van China Telecom een "AI-native" Wi-Fi 7-thuisrouter uitgebracht die detecteert wanneer je het huis verlaat en zelf het smart-home-netwerk opnieuw configureert. Dat zijn oprecht interessante apparaten, maar ze zijn niet wat een ontwikkelaar bedoelt met "AI-router". Dit artikel gaat over de LLM-router: de categorie die zich tussen jouw code en de API's van grote taalmodellen bevindt en bepaalt welk model elke prompt beantwoordt. Het behandelt de twee betekenissen van de naam, wat de router daadwerkelijk doet, wat het bespaart en kost, en de gevallen waarin je er geen zou moeten gebruiken.
Twee verschillende producten delen de naam.
De term 'AI-router' is een botsing, en de twee betekenissen hebben bijna niets met elkaar gemeen:
• De hardware "AI-router". Een Wi-Fi-router met AI-functies aan boord — een NPU voor inferentie op het apparaat, verkeersoptimalisatie, soms Docker. Voorbeelden zijn de ASUS ROG Rapture GT-BE19000AI (aangekondigd begin 2026) en de ZTE / Tianyi Digital Life thuis-AI-router (juni 2026). Zijn taak is om je thuis- of kleinbedrijfsnetwerk te beheren.
• De LLM-router. Een softwaredienst die elke API-aanroep van uw applicatie ontvangt en deze doorstuurt naar het beste model — het model dat uw kwaliteitsnorm haalt tegen de laagste prijs. Zijn taak is om uw modelbudget goed te besteden. Dit is de "AI-router" waar AI-ingenieurs het over hebben, en het is het onderwerp van dit artikel.

De verwarring doet er meer toe dan alleen semantiek. Iemand die zoekt op 'ai router' voor de softwarecategorie wordt geconfronteerd met een muur van hardware-reviews; iemand die zoekt op 'ai router' voor een nieuwe wifi-box krijgt marketing over NPU's in plaats van doorvoercijfers. Geen van beide SERP's is eerlijk over de dubbelzinnigheid, en dat is precies de leemte die deze pagina opvult — de softwarebetekenis, afgezet tegen de hardwarebetekenis.
Wat een LLM-router daadwerkelijk doet
Haal de marketing weg en een modelrouter heeft drie taken, die allemaal saai en allemaal waardevol zijn. Ten eerste is het één endpoint: jouw code roept één URL aan, OpenAI-compatibel, in plaats van één SDK per provider. Ten tweede beoordeelt het het verzoek — het leest de prompt en schat in hoe moeilijk die is — en routeert het: eenvoudig werk naar een goedkoop, snel model, echt moeilijke redeneringen naar een baanbrekend model. Ten derde regelt het failover: als de gekozen provider je rate-limiteert of een 5xx retourneert, probeert de router het opnieuw bij een gezond model, zonder dat jouw applicatie de fout ooit ziet.
De beslissingsstap is waar routers verschillen, en het spectrum is hetzelfde dat je zou verwachten. Op regels gebaseerde routers koppelen trefwoorden of promptlengte aan een model — in minder dan een milliseconde, voorspelbaar, maar kwetsbaar wanneer prijzen of modellen veranderen. Semantische routers sluiten de prompt in en routeren op basis van betekenis, dus "wat is mijn saldo?" en "hoeveel geld heb ik" komen op hetzelfde pad terecht. Aangeleerde routers volgen het echte verkeer en verschuiven naar het model dat op dat moment wint op kwaliteit per dollar — de productierouter van Ramp beschrijft dit als een Thompson-sampling-bandiet en schrijft het een kostenverlaging van ongeveer 30% toe, en het RouteLLM-onderzoek van LMSYS rapporteert een matrixfactorisatierouter die ongeveer 95% van de score van GPT-4 behield terwijl slechts 14% van de query's naar het sterke model werd gestuurd. De diepere werking van routeringsbeleid krijgt een volledige eigen behandeling in onze gids Auto Router for LLMs; hier is het punt dat de beslissingsintelligentie op een spectrum bestaat, en "welk spectrumpunt je nodig hebt" is een productbeslissing, geen functiechecklist.
Het prijsverschil is wat het lonend maakt.
Een router verdient zijn bestaansrecht alleen als modellen sterk in prijs verschillen, en op dit moment verschillen ze enorm. Alle tarieven hieronder zijn directe providerprijzen per 1M tokens uit de OrcaRouter-modelcatalogus, gelezen op 2026-08-10:

Lees de spread en het argument schrijft zichzelf. DeepSeek V4 Flash voor $0.09/$0.18 per 1M tegen Claude Opus 5 voor $5.00/$25.00 is alleen al op invoertokens ruwweg een 55× verschil, en de kloof tussen de goedkope laag en de toplaag is nu een vast kenmerk van de markt in plaats van een eenmalige korting. Als je verkeer een typische mix is — een meerderheid van korte, goed gespecificeerde verzoeken en een minderheid van echt moeilijke redeneringen — betekent alles naar de toplaag sturen dat je de hoofdprijs betaalt voor de makkelijke 80%. Een router die de makkelijke calls naar de goedkope laag stuurt, is waar de besparingen zitten.
De gemeten cijfers komen overeen. Onderzoek in de RouteLLM-klasse rapporteert besparingen van tot ruwweg {{1}}85%{{/1}} met behoud van kwaliteit op frontier-niveau — maar alleen wanneer de router is gekoppeld aan een kwaliteitsdrempel die weigert te bezuinigen op verzoeken die echt het frontier-model nodig hebben. Ramp meldt een reductie van ongeveer {{2}}30%{{/2}} op daadwerkelijk productieverkeer zonder noemenswaardige kwaliteitsdaling. De eigen woordenlijsten van routerleveranciers noemen kostenreducties van {{3}}50–70%{{/3}} per query voor het routeren van eenvoudig werk weg van frontier-modellen. De spreiding van cijfers is het eerlijke beeld: het plafond hangt af van je verkeersprofiel, en de vloer is wat je kwaliteitsevaluatie zegt dat het is. Waar je niet in moet geloven is een enkel vast cijfer van "routeren bespaart {{4}}X%{{/4}}", want dat is een eigenschap van jouw workload, niet van routers in het algemeen.
Wat kost routing je?
De twee kosten die niemand in de hardware-review opneemt, zijn latentie en nauwkeurigheid, en beide zijn reëel.
Latentie. Elk gerouteerd verzoek betaalt een classificatieheffing voordat het model zelfs maar start. Een op regels gebaseerde classifier kost minder dan een milliseconde; een klein embedding- of classificatiemodel voegt ruwweg 50–200 ms toe; een getraind domeinclassificatiemodel nog meer. De meeste routers verbergen het grootste deel hiervan door te classificeren terwijl ze het upstream-verzoek voorbereiden, en één productie-routingendpoint mat een end-to-end overhead met een mediaan van ongeveer 55 ms — minder dan 1% van een normale responstijd. Maar als je verkeer realtime is — een voice-agent, een UI die binnen 300 ms moet antwoorden — kan een routinghop van honderden milliseconden het verschil maken tussen bruikbaar en onbruikbaar. Die ene beperking is de meest voorkomende reden waarom een team met een legitieme routing-use case besluit niet te routeren.
Nauwkeurigheid.Een router is slechts zo goed als het oordeel waarop hij routeert. Een classificator die getraind is op algemene benchmarks kan met grote stelligheid fout zitten over jouw domein: jouw "makkelijk" samenvattingstaak kan makkelijk zijn voor de frontier en onmogelijk voor het goedkope model. De faalmodus is stil — de gebruiker krijgt gewoon slechtere output en niemand logt het — wat de reden is waarom elke geloofwaardige router een kwaliteitsondergrens of een gebalanceerde modus levert, en waarom een agressieve kostenmodus een experiment zou moeten zijn, geen standaard.
Er is ook een subtiele derde kost: routercode kan de providerkortingen die je al hebt, breken. Zowel OpenAI als Anthropic geven korting op herhaalde promptprefixen, doorgaans rond 90% korting op invoertokens bij cachereads. Als je routeringslaag de prompt herschrijft, herordent of een roterende tijdstempel injecteert, maakt dat het prefix ongeldig en gooit die korting weg. Een goede router laat de prompt byte-voor-byte door en laat de eigen caching van de provider werken; een onzorgvuldige verandert stilletjes je cachehits in calls tegen de volledige prijs.
Router versus gateway, in één alinea
U zult ook zien dat "AI gateway" bijna door elkaar wordt gebruikt, en het onderscheid is de moeite waard, ook al zijn de meeste beheerde producten beide. Een router beantwoordt de vraag welk model — kosten, latentie, capaciteit. Een gateway beantwoordt de vraag wie hem mag aanroepen — authenticatie, token-rate-limits, budgetten, auditlogs, compliance. Als u governance nodig hebt rond een team of een product, hebt u gateway-functies nodig; als u een goedkopere modelmix nodig hebt, hebt u routing nodig. Het operationele onderscheid wordt uitgebreid behandeld in onze gids, AI API Gateway in 2026; hier is de conclusie dat "een AI-router" meestal een product betekent met beide helften, en u moet vragen voor welke helft u daadwerkelijk betaalt.
Wanneer je echt een AI-router nodig hebt
De eerlijke triggerlijst, in plaats van een marketingargument om altijd te routeren:
• Je draait meer dan één model in productie.Routing is hoe je de mix rationeel houdt wanneer nieuwe modellen verschijnen en prijzen veranderen. Een bedrijf met één model heeft dit allemaal niet nodig.
• Je verkeer is een mix van makkelijk en moeilijk. Als elk verzoek even moeilijk is, valt er voor de router geen arbitrage te behalen. Het principe 'eerst classificeren, dan routeren' loont alleen als er een goedkope meerderheid te vangen is.
• Uw volume is groot genoeg dat een percentage ertoe doet. Een verlaging van 40% op $50 aan maandelijkse uitgaven is $20; bij $50.000 is het een arbeidsplaats.
• Providerstoringen kosten u geld. Automatische failover tussen providers is vaak het eerste echte voordeel dat teams ervaren, nog vóór de kostenbesparingen.
• Je wilt één contract, één sleutel, één endpoint. De integratiekosten van N providers zijn op zichzelf al een reden om via één te routeren.
Draai die om en je hebt de overslaanlijst: één model, uniforme moeilijkheidsgraad, verwaarloosbare kosten, of een latentiebudget dat een classificatie-hop doorbreekt. Voor die teams is een router overhead, en het rechtstreeks aanroepen van de provider is het betere antwoord.
De aanbeveling: een beheerde router met een kwaliteitsondergrens.
Voor een team dat de bovenstaande triggers heeft doorstaan, is de aanbeveling een beheerde router die een kwaliteitsdrempel handhaaft en geen opslag op tokens rekent. Ons eigen product is OrcaRouter, en daar kunnen we in detail over vertellen, dus de specifieke punten hieronder zijn van ons; de checklist die daarop volgt, is van toepassing op elke router die u evalueert.
De auto-modus van OrcaRouter — vraag de modelnaam orcarouter/auto aan op de standaard OpenAI-compatibele endpoint — beoordeelt elke prompt en routeert deze naar meer dan 200 modellen. Het wordt geleverd met vier beleidsregels, met Balanced als standaard: Cheapest stuurt naar het model met de laagste kosten dat kan antwoorden, Balanced naar het goedkoopste model dat de kwaliteitsdrempel haalt, Quality naar het model met de hoogste score ongeacht de prijs, en Adaptive leert van je live verkeer en past de routering gaandeweg aan. Beoordeling wordt gemeten in minder dan een milliseconde, de totale extra latentie blijft onder 50 ms, en als de gekozen provider rate-limits toepast of fouten retourneert, schakelt de router mid-stream over naar een gezond model in minder dan 50 ms. Er is geen opslag in welke laag dan ook: je betaalt elke provider de exacte gepubliceerde prijs — de hierboven genoemde bedragen van $0,09 of $5,00 zijn wat je betaalt — en routing zelf is gratis.

Wat nauwkeurigheid betreft, scoort de RouterArena-ranglijst van juni 2026 OrcaRouter op 75,5% tegenover GPT-5 op 74,0, Azure op 72,8, Martian op 61,6 en NotDiamond op 60,8 (volgens orcarouter.ai). Eén ranglijst is geen bewijs van wat dan ook — behandel het als een enkel datapunt en voer je eigen evaluatie uit op je eigen prompts voordat je welke router dan ook productieverkeer toevertrouwt, inclusief de onze. Dat is ook de juiste manier om tussen routers te kiezen als je ons niet gebruikt: laat een deel van het verkeer erdoorheen lopen, houd een fallback aan, dwing je moeilijkste prompts erdoorheen en lees het routeringslog per verzoek voordat je de besparingsclaim gelooft.
Wanneer deze aanbeveling onjuist is
De gevallen waarin een managed router de verkeerde keuze is, duidelijk gesteld:
• Je gebruikt eigenlijk één model. Een router voegt een hop en een classificatietaks toe voor niets. Bel de provider rechtstreeks en sla de laag over.
• Je antwoorden moeten direct zijn. Als de vereiste end-to-end onder ruwweg 300 ms is, kunnen de routing-hop en de traagheid van een middenklasse-model je budget overschrijden. Zet het model vast.
• Je volume is minuscuul.Routing bespaart je een percentage van je uitgaven, en het kan je geen percentage van nul besparen. Bij minder dan een paar honderd dollar per maand is je tijd meer waard dan de besparing.
• De modelkeuze moet controleerbaar zijn.Als een antwoord reproduceerbaar moet zijn, of het model erachter verklaarbaar moet zijn voor een beoordelaar, is de keuze van een auto-router een variabele die je moet verantwoorden. Log het, pin het, of routeer niet.
• Je kunt kwaliteit niet meten.Zonder een evaluatie die je vertelt of de gerouteerde output goed genoeg is, kun je niet weten of de router werkt, en agressieve kostenroutering zal stilletjes de output verslechteren die je nooit controleert.
• U bent air-gapped of compliance-gebonden. Als modellen nooit uw netwerk mogen verlaten, is een beheerde router helemaal de verkeerde vorm — draai een open-source routeringslaag op uw eigen infrastructuur.
• Je draait al een API-gateway. Als je erin hebt geïnvesteerd, breid dan de bestaande uit in plaats van een parallelle router toe te voegen. Routing- en gatewayfuncties convergeren; een tweede laag is meer governance, niet meer waarde.
De korte versie
Een AI-router, in de zin die AI-ingenieurs ermee bedoelen, is de softwarelaag die bepaalt welke LLM elk verzoek beantwoordt — en de naam wordt verwarrend gedeeld met Wi-Fi-hardware waar Docker op draait. Het werkt door elke prompt te beoordelen en de gemakkelijke meerderheid naar een goedkoop model te sturen, terwijl de moeilijke minderheid op de frontier blijft, met failover wanneer een provider uitvalt. Het levert winst op wanneer je modellen sterk in prijs verschillen (DeepSeek V4 Flash voor $0,09 tegen Claude Opus 5 voor $5,00 per 1M invoertokens is ongeveer een 55× verschil) en je verkeer een mix is van gemakkelijk en moeilijk; onderzoek in de klasse van RouteLLM plaatst het plafond rond 85% besparing achter een kwaliteitsdrempel. Het kost je latentie en enige controle over nauwkeurigheid, en het is het verkeerde antwoord voor bedrijven met één model, latentiebudgetten van minder dan 300 ms, kleine uitgaven, en teams die de outputkwaliteit niet kunnen meten. Wanneer het juist is, draai het dan achter een kwaliteitsdrempel zonder tokenopslag, routeer eerst een deel van het verkeer, en lees de routeringslogboeken voordat je de besparingen gelooft.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
