Hero-titelkaart met de tekst 'Wat is een LLM-router?' met de subtitel 'De laag die modellen kiest, de echte wiskunde, en wanneer je het kunt overslaan', die drie afgeronde kaarten toont met de labels ONE ENDPOINT, GRADE & ROUTE en FAILOVER op een witte achtergrond met blauwe en cyaan accenten en het OrcaRouter-logo rechtsonder samengesteld.
Guides & Insights

Wat is een LLM-router? De modelkeuzelaag, de echte wiskunde, en wanneer je het kunt overslaan

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Een LLM-router is een softwarelaag die zich tussen uw applicatie en de modelproviders bevindt en voor elk verzoek beslist welk model het moet beantwoorden — een goedkoop, snel model zoals DeepSeek V4 Flash wanneer de taak eenvoudig is, een toonaangevend model zoals Claude Opus 5 wanneer het echt moeilijk is. Het gaat om geld: DeepSeek V4 Flash kost $0.09 per miljoen invoertokens en Claude Opus 5 kost $5.00, directe provider-tarieven uit de OrcaRouter-modelcatalogus gelezen op 2026-08-10 — een 55× verschil bij dezelfde aanroep. Stuur de gemakkelijke 80% van uw verkeer omlaag en houd de moeilijke 20% omhoog, en u trekt aan de grootste kostenhefboom die de meeste teams nooit aanraken.

Wat een LLM-router eigenlijk is

Afgezien van de marketing heeft een modelrouter drie taken, allemaal saai en allemaal waardevol. Het is een enkel eindpunt: je code roept één OpenAI-compatibele URL aan in plaats van een SDK per provider. Het beoordeelt de aanvraag, schat in hoe moeilijk die is, en routeert hem: eenvoudig werk naar een goedkoop model, echt lastig redeneren naar een frontiermodel. En het schakelt over: als de gekozen provider je een rate-limit oplegt of een 5xx retourneert, probeert de router het opnieuw via een gezond model, zonder dat je applicatie de fout ooit ziet.

{{1}}De beslissingsstap is waar routers verschillen, en het spectrum is bekend terrein.{{/1}} {{2}}Regelgebaseerde routers matchen trefwoorden of promptlengte aan een model — in minder dan een milliseconde, voorspelbaar, kwetsbaar zodra prijzen of modellen veranderen.{{/2}} {{3}}Semantische routers embedden de prompt en routeren op betekenis, zodat "wat is mijn saldo?" en "hoeveel geld heb ik" op hetzelfde pad terechtkomen.{{/3}} {{4}}Lerende routers volgen het echte verkeer en verschuiven naar het model dat op dat moment wint op kwaliteit per dollar.{{/4}} {{5}}De werking van elk — inclusief de nauwkeurigheidsbanden van de verschillende classificatietypen en de automatische modus die elke prompt beoordeelt — wordt volledig behandeld in onze gids, Auto Router for LLMs; hier gaat het erom dat routeringsintelligentie zich op een spectrum bevindt, en welk punt je nodig hebt is een productbeslissing, geen functiechecklist.{{/5}}

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Als je "AI-router" ook hebt zien gebruiken voor Wi-Fi-hardware met een NPU erop — dat is een ander product dat toevallig dezelfde naam deelt, en we ontwarren die botsing in onze AI-routergids. Alles in dit artikel gaat over de softwarecategorie.

Het prijsverschil is wat het lonend maakt.

Een router verdient zijn bestaansrecht alleen als modellen sterk in prijs verschillen, en op dit moment verschillen ze enorm. Alle tarieven hieronder zijn directe providerprijzen per 1M tokens uit de OrcaRouter-modelcatalogus, gelezen op 2026-08-10:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

Lees de spread en het argument schrijft zichzelf. DeepSeek V4 Flash voor $0,09 tegen Claude Opus 5 voor $5,00 is ongeveer een 55× verschil op alleen al de inputtokens, en de kloof tussen de goedkope laag en de toplaag is nu een permanent kenmerk van de markt in plaats van een eenmalige korting. Als je verkeer een typische mix is — een meerderheid van korte, goed gespecificeerde verzoeken en een minderheid van echt moeilijke redeneringen — betekent alles op de toplaag draaien dat je de hoofdprijs betaalt voor de gemakkelijke 80%.

Dit is waar de huidige resultaten op pagina één voor 'llm router' je teleurstellen. Het woordenlijstitem van Decagon noemt bijvoorbeeld 'GPT-4o, Claude 3.5 Sonnet en Gemini 1.5 Pro' voor '$5–15 per miljoen inputtokens' — modellen die twee jaar geleden actueel waren, tegen prijzen die ongeveer het dubbele van de huidige waren. De markt is veranderd; de definitie niet. Dat is de allerbelangrijkste reden om een uitleg over LLM-routers zonder datums te wantrouwen.

Wat het spaaronderzoek eigenlijk zegt

De bovenstaande rekenkunde is echt, en dat geldt ook voor het onderzoek — maar het eerlijke beeld is een bereik, geen enkel getal.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Hier is de uitgewerkte berekening, met de aannames vermeld zodat je ze kunt aanpassen. Een supportbot die 100.000 gesprekken per maand afhandelt, waarbij elk gesprek 1.000 invoertokens verstuurt en 200 uitvoertokens genereert: alles draaien op Claude Sonnet 5 kost ongeveer $400 per maand. Stuur de gemakkelijke 80% naar DeepSeek V4 Flash en houd de moeilijke 20% op Claude Sonnet 5, en hetzelfde verkeer kost ongeveer $90 — ruwweg 78% goedkoper, vóór eventuele prompt-caching, wat het verschil nog verder zou vergroten.

De belangrijkste conclusie: agressieve routering bespaart 60–85% wanneer uw verkeer grotendeels eenvoudig is, gebalanceerde routering bespaart 35–45%, en zelfs conservatieve routering bespaart 10–15%. Het exacte cijfer voor u is een eigenschap van uw verkeer, gemeten op uw eigen prompts — geen constante die u van een blogpost kunt kopiëren.

De drie kosten die routing verbergt

De twee kosten die niemand op de woordenlijstinvoer zet, zijn latentie en nauwkeurigheid, en er is een derde die subtieler is.

Latentie.Elk gerouteerd verzoek betaalt een classificatieheffing voordat het model zelfs maar start. Een op regels gebaseerde classifier zit onder een milliseconde; een klein embedding- of classificatiemodel voegt ruwweg 50–200 ms toe; een getraind domeinclassificatiemodel meer. Een goede router verbergt het grootste deel hiervan door te classificeren terwijl hij het upstream-verzoek voorbereidt, en één productie-routingendpoint mat een end-to-end overhead van ongeveer 55 ms mediaan — minder dan 1% van een normale responstijd. Maar als je verkeer realtime is — een spraakagent, een UI die binnen 300 ms moet antwoorden — kan een routinghop van honderden milliseconden het verschil maken tussen bruikbaar en niet. Die ene beperking is de meest voorkomende reden waarom een team met een legitieme routing-use case besluit niet te routen.

Nauwkeurigheid. Een router is slechts zo goed als het oordeel waarop hij routeert. Een classificator die is getraind op algemene benchmarks kan met vertrouwen fout zitten over jouw domein: jouw "makkelijk" samenvattingstaak zou makkelijk kunnen zijn voor het topmodel en onmogelijk voor het goedkope model. De faalmodus is stil — de gebruiker krijgt gewoon slechtere output en niemand logt het — daarom levert elke geloofwaardige router een kwaliteitsvloer of een gebalanceerde modus.

Cache-invalidatie. Zowel OpenAI als Anthropic geven korting op herhaalde promptprefixen, doorgaans rond 90% korting op invoertokens bij cachereads. Als je routinglaag de prompt herschrijft, herordent of een roterende tijdstempel injecteert, wordt het prefix ongeldig en gooi je die korting weg. Een goede router geeft de prompt byte-voor-byte door en laat de eigen caching van de provider werken.

De aanbeveling: een beheerde router met een kwaliteitsondergrens.

Als u meer dan één model in productie draait, is uw verkeer een mix van gemakkelijk en moeilijk, en is uw volume groot genoeg dat een percentage echt geld oplevert, dan is de aanbeveling een beheerde router die een kwaliteitsondergrens handhaaft en geen opslag op tokens rekent. Ons eigen product is OrcaRouter, en dat is degene waar we in detail over kunnen spreken; de checklist die volgt is van toepassing op elke router die u evalueert.

OrcaRouter's automatische modus — vraag de modelnaam orcarouter/auto op via de standaard OpenAI-compatibele endpoint — beoordeelt elke prompt en routeert deze over 200+ modellen. De modus wordt geleverd met vier routeringsstrategieën, met Balanced als standaardinstelling: Cheapest stuurt naar het goedkoopste model dat kan antwoorden; Balanced stuurt naar het goedkoopste model dat de kwaliteitsdrempel haalt; Quality stuurt naar het model met de hoogste score, ongeacht de prijs; Adaptive leert van je live verkeer en past de routering gaandeweg aan. De beoordeling kost minder dan een milliseconde, de totale toegevoegde latentie blijft onder de 50 ms, en als de gekozen provider een rate-limit oplegt of een fout retourneert, schakelt de router midstream binnen 50 ms over naar een gezond model. Er wordt op geen enkele laag opslag toegepast: je betaalt elke provider de exacte gepubliceerde prijs — de cijfers $0.09 of $5.00 hierboven zijn wat je betaalt — en de routering zelf is gratis.

Wat nauwkeurigheid betreft, scoort de RouterArena-ranglijst van juni 2026 OrcaRouter op 75.5% tegenover het dichtstbijzijnde gevolgde alternatief op 74.0% (volgens orcarouter.ai). Eén ranglijst is geen bewijs van iets — behandel het als een enkel datapunt en draai je eigen evaluatie op je eigen prompts voordat je welke router dan ook vertrouwt met productieverkeer, inclusief de onze. En als je probeert te beslissen of je routerfuncties of gatewayfuncties nodig hebt, wordt het onderscheid tussen router en gateway behandeld in onze gids, AI API Gateway in 2026.

Wanneer deze aanbeveling onjuist is

De eerlijke skip list, duidelijk gezegd:

De korte versie

Een LLM-router is de laag die bepaalt welk model elk verzoek beantwoordt — goedkoop en snel voor de makkelijke meerderheid, topklasse voor de moeilijke minderheid, met failover wanneer een provider uitvalt. Het loont wanneer je modellen sterk in prijs verschillen (DeepSeek V4 Flash voor $0,09 tegenover Claude Opus 5 voor $5,00 per 1M inputtokens is een 55× spreiding) en je verkeer een mix van makkelijk en moeilijk is. Het onderzoek plaatst het plafond rond 85% besparing achter een kwaliteitsdrempel en de ondergrens op wat je eval zegt dat het is. Het kost je latentie en enige nauwkeurigheidscontrole, en het is het verkeerde antwoord voor omgevingen met één model, latentiebudgetten onder 300 ms, kleine uitgaven en teams die de outputkwaliteit niet kunnen meten. Wanneer het juist is, draai het dan achter een kwaliteitsdrempel zonder token-toeslag, routeer eerst een deel, en lees de routeringslogboeken voordat je de besparingen gelooft.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube