La card del titolo hero riporta 'Che cos'è un router LLM?' con il sottotitolo 'Il livello di selezione dei modelli, la vera matematica e quando evitarlo', mostra tre card arrotondate etichettate UN ENDPOINT, VALUTA & INSTRADA e FAILOVER su uno sfondo bianco con accenti blu e ciano e il logo OrcaRouter posizionato in basso a destra.
Guides & Insights

Cos'è un router LLM? Il livello di selezione del modello, la matematica reale e quando evitarlo

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un router LLM è uno strato software che si colloca tra la tua applicazione e i provider di modelli e decide, per ogni richiesta, quale modello debba rispondervi — un modello economico e veloce come DeepSeek V4 Flash quando il compito è semplice, un modello di frontiera come Claude Opus 5 quando è davvero difficile. Il punto è il denaro: DeepSeek V4 Flash costa $0.09 per milione di token di input e Claude Opus 5 costa $5.00, tariffe dirette dei provider secondo il catalogo modelli OrcaRouter letto il 2026-08-10 — una differenza di 55× sulla stessa chiamata. Instrada verso il basso l'80% facile del tuo traffico e verso l'alto il 20% difficile, e stai tirando la singola più grande leva di costo che la maggior parte dei team non tocca mai.

Cos'è realmente un router LLM

Togli il marketing e un router di modelli ha tre compiti, tutti noiosi e tutti preziosi. È un unico endpoint: il tuo codice chiama un solo URL compatibile con OpenAI invece di un SDK per ogni provider. Valuta la richiesta, stimando quanto sia difficile, e la instrada: il lavoro facile a un modello economico, il ragionamento davvero difficile a un modello all'avanguardia. E gestisce il failover: se il provider scelto ti limita la frequenza o restituisce un 5xx, il router riprova con un modello sano senza che la tua applicazione veda mai l'errore.

La fase decisionale è dove i router differiscono, e lo spettro è un concetto familiare. I router basati su regole abbinano parole chiave o lunghezza del prompt a un modello — in meno di un millisecondo, prevedibili, fragili quando prezzi o modelli cambiano. I router semantici incorporano il prompt e instradano in base al significato, così "qual è il mio saldo?" e "quanti soldi ho" convergono sullo stesso percorso. I router basati sull'apprendimento osservano il traffico reale e si spostano verso il modello che vince in termini di qualità per dollaro. I meccanismi di ciascuno — incluse le fasce di accuratezza dei diversi tipi di classificatore e la modalità automatica che valuta ogni prompt — sono trattati in dettaglio nella nostra guida, Auto Router for LLMs; qui il punto è che l'intelligenza di routing si colloca su uno spettro, e quale punto ti serve è una decisione di prodotto, non una checklist di funzionalità.

Flow card titled 'One request, three jobs' showing a horizontal pipeline: a request enters ONE ENDPOINT ('one OpenAI-compatible URL'), passes through GRADE & ROUTE ('easy to a cheap model, hard to a frontier model'), then FAILOVER ('provider down? retry a healthy model'), with a footer reading 'Grading under 1ms · mid-stream failover under 50ms' and the OrcaRouter logo composited bottom-right.

Se hai visto anche "AI router" usato per hardware Wi-Fi con una NPU a bordo — quello è un prodotto diverso che condivide il nome, e chiariamo questa omonimia nella nostra guida all'AI router. Tutto ciò che è contenuto in questo articolo riguarda la categoria software.

Lo spread di prezzo è ciò che lo rende redditizio.

Un router guadagna il suo mantenimento solo quando i modelli differiscono molto nel prezzo, e in questo momento differiscono enormemente. Tutte le tariffe di seguito sono prezzi diretti del fornitore per 1 milione di token dal catalogo modelli di OrcaRouter, letti il 10/08/2026:

Price table card titled 'The price spread, per 1M tokens' listing five models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00 (intro through Aug 31 2026), Claude Opus 5 $5.00/$25.00, with DeepSeek V4 Flash highlighted in blue and Claude Opus 5 highlighted, and a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10.'

La lettura dello spread e l'argomentazione si scrivono da sole. DeepSeek V4 Flash a $0.09 contro Claude Opus 5 a $5.00 significa una differenza di circa 55 volte sui soli token di input, e il divario tra il livello economico e quello frontier è ormai una caratteristica permanente del mercato, non più uno sconto una tantum. Se il tuo traffico è un mix tipico — una maggioranza di richieste brevi e ben specificate e una minoranza di ragionamenti davvero complessi — eseguire tutto sul livello frontier significa pagare il prezzo massimo per l'80% dei casi facili.

È qui che i risultati attuali di prima pagina per "llm router" ti deludono. La voce del glossario di Decagon, ad esempio, cita "GPT-4o, Claude 3.5 Sonnet e Gemini 1.5 Pro" a "$5–15 per milione di token di input" — modelli che erano attuali due anni fa a prezzi all'incirca doppi rispetto a quelli odierni. Il mercato si è mosso; la definizione no. Questo è il motivo principale per cui diffidare di un explainer sul router LLM privo di date.

Cosa dice realmente la ricerca sul risparmio

L'aritmetica qui sopra è reale, e lo è anche la ricerca — ma il quadro onesto è un intervallo, non un singolo numero.

Cost card titled 'One support bot, two ways' showing the monthly API cost for 100,000 conversations (1,000 input + 200 output tokens each): all traffic on Claude Sonnet 5 at $400/month versus routed traffic with 80% on DeepSeek V4 Flash and 20% on Claude Sonnet 5 at $90/month, with a highlighted note reading 'about 78% cheaper' and a footnote stating the assumptions: 100k conversations per month, introductory rates through Aug 31 2026, no caching, provider-direct rates per the OrcaRouter model catalogue read 2026-08-10.

Ecco il calcolo dettagliato, con le ipotesi dichiarate così puoi modificarle. Un bot di supporto che gestisce 100.000 conversazioni al mese, ciascuna con 1.000 token di input e che genera 200 token di output: eseguire tutto su Claude Sonnet 5 costa circa $400 al mese. Instrada l'80% facile verso DeepSeek V4 Flash e tieni il 20% difficile su Claude Sonnet 5, e lo stesso traffico costa circa $90 — circa il 78% in meno, prima di qualsiasi caching dei prompt, che amplierebbe ulteriormente il divario.

Il punto fondamentale: il routing aggressivo fa risparmiare il 60–85% quando il tuo traffico è per lo più facile, il routing bilanciato fa risparmiare il 35–45%, e anche il routing conservativo fa risparmiare il 10–15%. La cifra esatta per te è una proprietà del tuo traffico, misurata sui tuoi stessi prompt — non una costante che puoi copiare da un post di un blog.

I tre costi che il routing nasconde

I due costi che nessuno mette nella voce del glossario sono la latenza e l'accuratezza, e ce n'è un terzo più sottile.

Latenza. Ogni richiesta instradata paga una tassa di classificazione prima ancora che il modello inizi. Un classificatore basato su regole richiede meno di un millisecondo; un piccolo modello di embedding o classificatore aggiunge circa 50–200 ms; un classificatore di dominio addestrato ancora di più. Un buon router nasconde gran parte di questo classificando mentre prepara la richiesta a monte, e un endpoint di routing in produzione ha misurato un overhead end-to-end di circa 55 ms in mediana — meno dell'1% di un tempo di risposta normale. Ma se il tuo traffico è in tempo reale — un agente vocale, un'interfaccia che deve rispondere entro 300 ms — un salto di routing nell'ordine delle centinaia di millisecondi può fare la differenza tra utilizzabile e non. Questo singolo vincolo è il motivo più comune per cui un team con un legittimo caso d'uso di routing decide di non instradare.

Accuratezza. Un router vale quanto il giudizio su cui si basa per instradare. Un classificatore addestrato su benchmark generali può essere sicuro di sé ma sbagliato riguardo al tuo dominio: il tuo compito di sintesi "facile" potrebbe essere facile per il modello di frontiera e impossibile per il modello economico. La modalità di errore è silenziosa — l'utente riceve solo un output peggiore e nessuno lo registra — motivo per cui ogni router credibile include una soglia minima di qualità o una modalità bilanciata.

Invalidazione della cache. Sia OpenAI che Anthropic offrono sconti sui prefissi di prompt ripetuti, tipicamente intorno al 90% sui token di input in caso di letture della cache. Se il tuo livello di routing riscrive, riordina o inietta un timestamp rotante nel prompt, invalida il prefisso e vanifica quello sconto. Un buon router lascia passare il prompt byte per byte e lascia che sia il caching del provider a funzionare.

La raccomandazione: un router gestito con un livello minimo di qualità.

Se gestisci più di un modello in produzione, il tuo traffico è un mix di richieste facili e difficili, e il volume è abbastanza grande perché una percentuale valga denaro reale, la raccomandazione è un router gestito che mantenga una soglia minima di qualità e non applichi alcun ricarico sui token. Il nostro prodotto è OrcaRouter, ed è quello di cui possiamo parlare in dettaglio; la checklist che segue si applica a qualsiasi router tu valuti.

La modalità auto di OrcaRouter — richiedi il nome del modello orcarouter/auto sull'endpoint standard compatibile con OpenAI — valuta ogni prompt e lo instrada attraverso oltre 200 modelli. Include quattro policy di instradamento con Balanced come predefinita: Cheapest invia al modello a costo più basso che può rispondere; Balanced invia al modello più economico che supera la soglia di qualità; Quality invia al modello con il punteggio più alto, indipendentemente dal prezzo; Adaptive apprende dal tuo traffico live e modifica l'instradamento man mano. La valutazione richiede meno di un millisecondo, la latenza aggiuntiva totale rimane sotto i 50ms e se il provider scelto applica limiti di frequenza o restituisce errori, il router esegue un failover a metà flusso verso un modello funzionante in meno di 50ms. Non c'è alcun ricarico in nessun livello: paghi a ogni provider il suo prezzo pubblicato esatto — le cifre di $0.09 o $5.00 sopra indicate sono ciò che paghi — e l'instradamento stesso è gratuito.

Sull'accuratezza, la classifica di RouterArena di giugno 2026 assegna a OrcaRouter un punteggio del 75,5% contro il 74,0% dell'alternativa monitorata più vicina (secondo orcarouter.ai). Una classifica non è la prova di nulla: trattala come un singolo dato e fai una tua valutazione sui tuoi prompt prima di affidare il traffico di produzione a un router, incluso il nostro. E se stai cercando di decidere se ti servono funzionalità da router o da gateway, la distinzione tra router e gateway è trattata nella nostra guida AI API Gateway in 2026.

Quando questa raccomandazione è sbagliata

La lista skip onesta, detta chiaramente:

La versione breve

Un router LLM è il livello che sceglie quale modello risponde a ciascuna richiesta: economico e veloce per la maggioranza semplice, di frontiera per la minoranza difficile, con failover quando un fornitore cade. Conviene quando i tuoi modelli differiscono molto nel prezzo (DeepSeek V4 Flash a $0,09 contro Claude Opus 5 a $5,00 per 1M di token di input è uno spread di 55×) e il tuo traffico è un mix di facile e difficile. La ricerca colloca il tetto del risparmio intorno all'85% dietro una soglia di qualità, e la soglia a qualunque valore la tua valutazione dica. Costa latenza e un po' di controllo sull'accuratezza, ed è la risposta sbagliata per chi usa un solo modello, budget di latenza inferiori a 300 ms, spesa minima e team che non possono misurare la qualità dell'output. Quando è giusto, eseguilo dietro una soglia di qualità senza markup sui token, instrada prima una fetta e leggi i log di routing prima di credere ai risparmi.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube