
Was ist ein LLM-Router? Die Modellauswahl-Schicht, die echte Mathematik und wann man darauf verzichten sollte.
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Ein LLM-Router ist eine Softwareschicht, die zwischen Ihrer Anwendung und den Modellanbietern liegt und für jede Anfrage entscheidet, welches Modell sie beantworten soll – ein günstiges, schnelles Modell wie DeepSeek V4 Flash, wenn die Aufgabe einfach ist, ein Spitzenmodell wie Claude Opus 5, wenn sie wirklich schwierig ist. Es geht um Geld: DeepSeek V4 Flash kostet 0,09 $ pro Million Eingabe-Token und Claude Opus 5 kostet 5,00 $, Preise direkt vom Anbieter aus dem OrcaRouter-Modellkatalog, abgerufen am 10.08.2026 – ein 55-facher Unterschied bei demselben Aufruf. Schicken Sie die einfachen 80 % Ihres Traffics nach unten und halten Sie die schwierigen 20 % oben, dann betätigen Sie den größten Kostenhebel, den die meisten Teams nie anfassen.
Was ein LLM-Router eigentlich ist
Wenn man das Marketing beiseitelässt, hat ein Modell-Router drei Aufgaben, die alle langweilig und alle wertvoll sind. Er ist ein einziger Endpunkt: Ihr Code ruft eine OpenAI-kompatible URL auf, statt für jeden Anbieter ein eigenes SDK zu verwenden. Er bewertet die Anfrage, schätzt ein, wie schwierig sie ist, und leitet sie weiter: einfache Arbeit an ein günstiges Modell, wirklich schwierige Denkarbeit an ein Spitzenmodell. Und er bietet Failover: Wenn der gewählte Anbieter Sie drosselt oder einen 5xx-Fehler zurückgibt, versucht der Router es erneut mit einem gesunden Modell, ohne dass Ihre Anwendung den Fehler jemals sieht.
Der Entscheidungsschritt ist der Punkt, an dem sich Router unterscheiden, und das Spektrum ist ein bekanntes. Regelbasierte Router ordnen Keywords oder Prompt-Länge einem Modell zu — unter einer Millisekunde, vorhersehbar, zerbrechlich, wenn sich Preise oder Modelle ändern. Semantische Router betten den Prompt ein und leiten anhand der Bedeutung weiter, sodass „Wie hoch ist mein Kontostand?“ und „Wie viel Geld habe ich?“ auf demselben Pfad landen. Lernende Router beobachten echten Datenverkehr und verlagern sich zu dem Modell, das bei Qualität pro Dollar die Nase vorn hat. Die Mechanik jeder Variante — einschließlich der Genauigkeitsbereiche der verschiedenen Klassifikatortypen und des automatischen Modus, der jeden Prompt bewertet — wird in unserem Leitfaden „Auto Router for LLMs“ ausführlich behandelt; hier geht es darum, dass Routing-Intelligenz auf einem Spektrum existiert, und welchen Punkt man benötigt, ist eine Produktentscheidung, keine Feature-Checkliste.

Falls Sie „AI Router" auch schon für Wi-Fi-Hardware mit NPU gesehen haben — das ist ein anderes Produkt, das zufällig denselben Namen trägt, und wir entwirren diese Namenskollision in unserem AI-Router-Leitfaden. In diesem Artikel geht es ausschließlich um die Software-Kategorie.
Die Preisspanne ist es, die es rentabel macht.
Ein Router lohnt sich nur, wenn sich Modelle preislich stark unterscheiden – und genau jetzt unterscheiden sie sich enorm. Alle unten stehenden Preise sind direkte Anbieterpreise pro 1M Tokens aus dem OrcaRouter-Modellkatalog, abgerufen am 10.08.2026:

Betrachten Sie die Preisspanne und das Argument schreibt sich von selbst. DeepSeek V4 Flash für 0,09 $ gegenüber Claude Opus 5 für 5,00 $ ergibt allein bei den Eingabe-Tokens einen Unterschied von etwa 55×. Und die Kluft zwischen der günstigen und der Spitzenklasse ist inzwischen ein dauerhaftes Merkmal des Marktes und nicht nur ein einmaliger Rabatt. Wenn Ihr Traffic eine typische Mischung ist – eine Mehrheit kurzer, klar spezifizierter Anfragen und eine Minderheit wirklich schwieriger Denkaufgaben –, bedeutet es, alles über die Spitzenklasse laufen zu lassen, den Höchstpreis für die einfachen 80 % zu zahlen.
Hier lassen dich die aktuellen Top-Ergebnisse für „llm router" im Stich. Decagons Glossareintrag zitiert zum Beispiel „GPT-4o, Claude 3.5 Sonnet und Gemini 1.5 Pro" mit „$5–15 pro Million Input-Tokens" – Modelle, die vor zwei Jahren aktuell waren, zu Preisen, die heute etwa doppelt so hoch liegen. Der Markt hat sich bewegt; die Definition nicht. Das ist der wichtigste Grund, einem LLM-Router-Erklärer ohne Datumsangaben zu misstrauen.
Was die Sparforschung tatsächlich sagt
Die obige Rechnung ist real, und das gilt auch für die Forschung — aber das ehrliche Bild ist eine Spanne, keine einzelne Zahl.

Hier ist die durchgerechnete Rechnung, mit den Annahmen, die du anpassen kannst. Ein Support-Bot, der 100.000 Gespräche pro Monat verarbeitet, mit jeweils 1.000 Eingabe-Tokens und 200 Ausgabe-Tokens: Läuft alles über Claude Sonnet 5, kostet das etwa 400 $ pro Monat. Wenn die einfachen 80 % an DeepSeek V4 Flash gehen und die schwierigen 20 % bei Claude Sonnet 5 bleiben, kostet derselbe Traffic etwa 90 $ — also rund 78 % weniger — und das ohne Prompt-Caching, das die Lücke noch weiter vergrößern würde.
Das Fazit: aggressives Routing spart 60–85 %, wenn Ihr Datenverkehr überwiegend einfach ist, ausgewogenes Routing spart 35–45 %, und selbst konservatives Routing spart 10–15 %. Der genaue Wert für Sie ist eine Eigenschaft Ihres Datenverkehrs, gemessen an Ihren eigenen Prompts — keine Konstante, die Sie aus einem Blogbeitrag übernehmen können.
Die drei Kosten, die das Routing verbirgt
Die beiden Kosten, die niemand in den Glossareintrag aufnimmt, sind Latenz und Genauigkeit, und es gibt eine dritte, die subtiler ist.
Latenz. Jede geroutete Anfrage wird mit einem Klassifizierungs-Overhead belastet, bevor das Modell überhaupt startet. Ein regelbasierter Klassifikator liegt unter einer Millisekunde; ein kleines Embedding- oder Klassifikatormodell fügt etwa 50–200 ms hinzu; ein trainierter Domänenklassifikator mehr. Ein guter Router verbirgt einen Großteil davon, indem er klassifiziert, während er die vorgelagerte Anfrage vorbereitet, und ein Produktions-Routing-Endpunkt maß einen End-to-End-Overhead mit einem Median von etwa 55 ms — unter 1 % einer normalen Antwortzeit. Aber wenn Sie Echtzeit-Datenverkehr haben — ein Sprachagent, eine UI, die innerhalb von 300 ms antworten muss — kann ein Routing-Hop von mehreren hundert Millisekunden den Unterschied zwischen brauchbar und unbrauchbar ausmachen. Diese eine Einschränkung ist der häufigste Grund, warum sich ein Team mit einem legitimen Routing-Anwendungsfall entscheidet, nicht zu routen.
Genauigkeit. Ein Router ist nur so gut wie das Urteil, nach dem er routet. Ein auf allgemeinen Benchmarks trainierter Klassifikator kann in Ihrer Domäne selbstsicher falsch liegen: Ihre „einfache“ Zusammenfassungsaufgabe mag für das Frontier-Modell einfach sein und für das billige Modell unmöglich. Der Fehlermodus ist lautlos — der Benutzer erhält einfach schlechtere Ausgaben und niemand protokolliert es —, weshalb jeder seriöse Router eine Qualitätsuntergrenze oder einen ausgewogenen Modus mitliefert.
Cache-Invalidierung.Sowohl OpenAI als auch Anthropic gewähren Rabatte auf wiederholte Prompt-Präfixe, typischerweise etwa 90 % Rabatt auf Eingabe-Tokens bei Cache-Lesevorgängen. Wenn Ihre Routing-Ebene den Prompt umschreibt, umsortiert oder einen rotierenden Zeitstempel einfügt, macht sie das Präfix ungültig und wirft diesen Rabatt weg. Ein guter Router leitet den Prompt Byte für Byte weiter und lässt das eigene Caching des Anbieters arbeiten.
Die Empfehlung: ein Managed Router mit einer Qualitätsuntergrenze.
Wenn Sie mehr als ein Modell in Produktion betreiben, Ihr Traffic eine Mischung aus einfachen und schwierigen Anfragen ist und Ihr Volumen groß genug, dass ein Prozentsatz echtes Geld ausmacht, ist die Empfehlung ein verwalteter Router, der eine Qualitätsuntergrenze einhält und keine Aufschläge auf Tokens verlangt. Unser eigenes Produkt ist OrcaRouter, und darüber können wir im Detail sprechen; die folgende Checkliste gilt für jeden Router, den Sie bewerten.
OrcaRouters Auto-Modus — verwenden Sie den Modellnamen orcarouter/auto am standardmäßigen OpenAI-kompatiblen Endpunkt — bewertet jede Anfrage und leitet sie an über 200 Modelle weiter. Er umfasst vier Routing-Richtlinien, mit Balanced als Standardeinstellung: Cheapest sendet an das Modell mit den geringsten Kosten, das antworten kann; Balanced sendet an das günstigste Modell, das die Qualitätsanforderungen erfüllt; Quality sendet an das am besten bewertete Modell, unabhängig vom Preis; Adaptive lernt aus Ihrem Live-Traffic und passt das Routing dabei laufend an. Die Bewertung erfolgt in weniger als einer Millisekunde, die gesamte zusätzliche Latenz bleibt unter 50 ms, und wenn der gewählte Anbieter ein Rate-Limit setzt oder Fehler zurückgibt, wechselt der Router in unter 50 ms mitten im Stream auf ein gesundes Modell um. Es gibt auf keiner Ebene einen Aufschlag: Sie zahlen jedem Anbieter exakt dessen veröffentlichten Preis — die oben genannten Beträge von 0,09 $ oder 5,00 $ sind das, was Sie zahlen — und das Routing selbst ist kostenlos.
Was die Genauigkeit angeht, bewertet das RouterArena-Leaderboard vom Juni 2026 OrcaRouter mit 75,5 % gegenüber der nächstbesten verfolgten Alternative mit 74,0 % (laut orcarouter.ai). Ein einzelnes Leaderboard ist kein Beweis für irgendetwas – behandeln Sie es als einzelnen Datenpunkt und führen Sie Ihre eigene Auswertung mit Ihren eigenen Prompts durch, bevor Sie einem Router Produktionsverkehr anvertrauen, auch unserem. Und wenn Sie versuchen zu entscheiden, ob Sie überhaupt Router- oder Gateway-Funktionen benötigen, wird die Unterscheidung zwischen Router und Gateway in unserem Leitfaden „AI API Gateway in 2026" behandelt.
Wenn diese Empfehlung falsch ist
Die ehrliche Skip-Liste, einfach ausgedrückt:
Die Kurzfassung
Ein LLM-Router ist die Ebene, die entscheidet, welches Modell jede Anfrage beantwortet – günstig und schnell für die einfache Mehrheit, Spitzenklasse für die schwierige Minderheit, mit Failover, wenn ein Anbieter ausfällt. Er zahlt sich aus, wenn sich Ihre Modelle im Preis stark unterscheiden (DeepSeek V4 Flash bei 0,09 $ gegenüber Claude Opus 5 bei 5,00 $ pro 1 Million Input-Tokens ist eine 55-fache Spanne) und Ihr Datenverkehr eine Mischung aus einfach und schwierig ist. Die Forschung setzt die Obergrenze bei etwa 85 % Einsparungen hinter einer Qualitätsuntergrenze an, und die Untergrenze liegt bei dem, was Ihr Evaluierungssystem vorgibt. Es kostet Sie Latenz und etwas Kontrolle über die Genauigkeit, und es ist die falsche Antwort für Ein-Modell-Shops, Latenz-Budgets unter 300 ms, geringe Ausgaben und Teams, die die Ausgabequalität nicht messen können. Wenn es richtig ist, betreiben Sie es hinter einer Qualitätsuntergrenze ohne Token-Aufschlag, routen Sie zuerst einen Teilbereich und lesen Sie die Routing-Logs, bevor Sie den Einsparungen glauben.
In diesem Artikel verglichen2
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
