
Cos'è un router LLM? Il livello di selezione del modello, la matematica reale e quando evitarlo
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Un router LLM è uno strato software che si colloca tra la tua applicazione e i provider di modelli e decide, per ogni richiesta, quale modello debba rispondervi — un modello economico e veloce come DeepSeek V4 Flash quando il compito è semplice, un modello di frontiera come Claude Opus 5 quando è davvero difficile. Il punto è il denaro: DeepSeek V4 Flash costa $0.09 per milione di token di input e Claude Opus 5 costa $5.00, tariffe dirette dei provider secondo il catalogo modelli OrcaRouter letto il 2026-08-10 — una differenza di 55× sulla stessa chiamata. Instrada verso il basso l'80% facile del tuo traffico e verso l'alto il 20% difficile, e stai tirando la singola più grande leva di costo che la maggior parte dei team non tocca mai.
Cos'è realmente un router LLM
Togli il marketing e un router di modelli ha tre compiti, tutti noiosi e tutti preziosi. È un unico endpoint: il tuo codice chiama un solo URL compatibile con OpenAI invece di un SDK per ogni provider. Valuta la richiesta, stimando quanto sia difficile, e la instrada: il lavoro facile a un modello economico, il ragionamento davvero difficile a un modello all'avanguardia. E gestisce il failover: se il provider scelto ti limita la frequenza o restituisce un 5xx, il router riprova con un modello sano senza che la tua applicazione veda mai l'errore.
La fase decisionale è dove i router differiscono, e lo spettro è un concetto familiare. I router basati su regole abbinano parole chiave o lunghezza del prompt a un modello — in meno di un millisecondo, prevedibili, fragili quando prezzi o modelli cambiano. I router semantici incorporano il prompt e instradano in base al significato, così "qual è il mio saldo?" e "quanti soldi ho" convergono sullo stesso percorso. I router basati sull'apprendimento osservano il traffico reale e si spostano verso il modello che vince in termini di qualità per dollaro. I meccanismi di ciascuno — incluse le fasce di accuratezza dei diversi tipi di classificatore e la modalità automatica che valuta ogni prompt — sono trattati in dettaglio nella nostra guida, Auto Router for LLMs; qui il punto è che l'intelligenza di routing si colloca su uno spettro, e quale punto ti serve è una decisione di prodotto, non una checklist di funzionalità.

Se hai visto anche "AI router" usato per hardware Wi-Fi con una NPU a bordo — quello è un prodotto diverso che condivide il nome, e chiariamo questa omonimia nella nostra guida all'AI router. Tutto ciò che è contenuto in questo articolo riguarda la categoria software.
Lo spread di prezzo è ciò che lo rende redditizio.
Un router guadagna il suo mantenimento solo quando i modelli differiscono molto nel prezzo, e in questo momento differiscono enormemente. Tutte le tariffe di seguito sono prezzi diretti del fornitore per 1 milione di token dal catalogo modelli di OrcaRouter, letti il 10/08/2026:

La lettura dello spread e l'argomentazione si scrivono da sole. DeepSeek V4 Flash a $0.09 contro Claude Opus 5 a $5.00 significa una differenza di circa 55 volte sui soli token di input, e il divario tra il livello economico e quello frontier è ormai una caratteristica permanente del mercato, non più uno sconto una tantum. Se il tuo traffico è un mix tipico — una maggioranza di richieste brevi e ben specificate e una minoranza di ragionamenti davvero complessi — eseguire tutto sul livello frontier significa pagare il prezzo massimo per l'80% dei casi facili.
È qui che i risultati attuali di prima pagina per "llm router" ti deludono. La voce del glossario di Decagon, ad esempio, cita "GPT-4o, Claude 3.5 Sonnet e Gemini 1.5 Pro" a "$5–15 per milione di token di input" — modelli che erano attuali due anni fa a prezzi all'incirca doppi rispetto a quelli odierni. Il mercato si è mosso; la definizione no. Questo è il motivo principale per cui diffidare di un explainer sul router LLM privo di date.
Cosa dice realmente la ricerca sul risparmio
L'aritmetica qui sopra è reale, e lo è anche la ricerca — ma il quadro onesto è un intervallo, non un singolo numero.

Ecco il calcolo dettagliato, con le ipotesi dichiarate così puoi modificarle. Un bot di supporto che gestisce 100.000 conversazioni al mese, ciascuna con 1.000 token di input e che genera 200 token di output: eseguire tutto su Claude Sonnet 5 costa circa $400 al mese. Instrada l'80% facile verso DeepSeek V4 Flash e tieni il 20% difficile su Claude Sonnet 5, e lo stesso traffico costa circa $90 — circa il 78% in meno, prima di qualsiasi caching dei prompt, che amplierebbe ulteriormente il divario.
Il punto fondamentale: il routing aggressivo fa risparmiare il 60–85% quando il tuo traffico è per lo più facile, il routing bilanciato fa risparmiare il 35–45%, e anche il routing conservativo fa risparmiare il 10–15%. La cifra esatta per te è una proprietà del tuo traffico, misurata sui tuoi stessi prompt — non una costante che puoi copiare da un post di un blog.
I tre costi che il routing nasconde
I due costi che nessuno mette nella voce del glossario sono la latenza e l'accuratezza, e ce n'è un terzo più sottile.
Latenza. Ogni richiesta instradata paga una tassa di classificazione prima ancora che il modello inizi. Un classificatore basato su regole richiede meno di un millisecondo; un piccolo modello di embedding o classificatore aggiunge circa 50–200 ms; un classificatore di dominio addestrato ancora di più. Un buon router nasconde gran parte di questo classificando mentre prepara la richiesta a monte, e un endpoint di routing in produzione ha misurato un overhead end-to-end di circa 55 ms in mediana — meno dell'1% di un tempo di risposta normale. Ma se il tuo traffico è in tempo reale — un agente vocale, un'interfaccia che deve rispondere entro 300 ms — un salto di routing nell'ordine delle centinaia di millisecondi può fare la differenza tra utilizzabile e non. Questo singolo vincolo è il motivo più comune per cui un team con un legittimo caso d'uso di routing decide di non instradare.
Accuratezza. Un router vale quanto il giudizio su cui si basa per instradare. Un classificatore addestrato su benchmark generali può essere sicuro di sé ma sbagliato riguardo al tuo dominio: il tuo compito di sintesi "facile" potrebbe essere facile per il modello di frontiera e impossibile per il modello economico. La modalità di errore è silenziosa — l'utente riceve solo un output peggiore e nessuno lo registra — motivo per cui ogni router credibile include una soglia minima di qualità o una modalità bilanciata.
Invalidazione della cache. Sia OpenAI che Anthropic offrono sconti sui prefissi di prompt ripetuti, tipicamente intorno al 90% sui token di input in caso di letture della cache. Se il tuo livello di routing riscrive, riordina o inietta un timestamp rotante nel prompt, invalida il prefisso e vanifica quello sconto. Un buon router lascia passare il prompt byte per byte e lascia che sia il caching del provider a funzionare.
La raccomandazione: un router gestito con un livello minimo di qualità.
Se gestisci più di un modello in produzione, il tuo traffico è un mix di richieste facili e difficili, e il volume è abbastanza grande perché una percentuale valga denaro reale, la raccomandazione è un router gestito che mantenga una soglia minima di qualità e non applichi alcun ricarico sui token. Il nostro prodotto è OrcaRouter, ed è quello di cui possiamo parlare in dettaglio; la checklist che segue si applica a qualsiasi router tu valuti.
La modalità auto di OrcaRouter — richiedi il nome del modello orcarouter/auto sull'endpoint standard compatibile con OpenAI — valuta ogni prompt e lo instrada attraverso oltre 200 modelli. Include quattro policy di instradamento con Balanced come predefinita: Cheapest invia al modello a costo più basso che può rispondere; Balanced invia al modello più economico che supera la soglia di qualità; Quality invia al modello con il punteggio più alto, indipendentemente dal prezzo; Adaptive apprende dal tuo traffico live e modifica l'instradamento man mano. La valutazione richiede meno di un millisecondo, la latenza aggiuntiva totale rimane sotto i 50ms e se il provider scelto applica limiti di frequenza o restituisce errori, il router esegue un failover a metà flusso verso un modello funzionante in meno di 50ms. Non c'è alcun ricarico in nessun livello: paghi a ogni provider il suo prezzo pubblicato esatto — le cifre di $0.09 o $5.00 sopra indicate sono ciò che paghi — e l'instradamento stesso è gratuito.
Sull'accuratezza, la classifica di RouterArena di giugno 2026 assegna a OrcaRouter un punteggio del 75,5% contro il 74,0% dell'alternativa monitorata più vicina (secondo orcarouter.ai). Una classifica non è la prova di nulla: trattala come un singolo dato e fai una tua valutazione sui tuoi prompt prima di affidare il traffico di produzione a un router, incluso il nostro. E se stai cercando di decidere se ti servono funzionalità da router o da gateway, la distinzione tra router e gateway è trattata nella nostra guida AI API Gateway in 2026.
Quando questa raccomandazione è sbagliata
La lista skip onesta, detta chiaramente:
La versione breve
Un router LLM è il livello che sceglie quale modello risponde a ciascuna richiesta: economico e veloce per la maggioranza semplice, di frontiera per la minoranza difficile, con failover quando un fornitore cade. Conviene quando i tuoi modelli differiscono molto nel prezzo (DeepSeek V4 Flash a $0,09 contro Claude Opus 5 a $5,00 per 1M di token di input è uno spread di 55×) e il tuo traffico è un mix di facile e difficile. La ricerca colloca il tetto del risparmio intorno all'85% dietro una soglia di qualità, e la soglia a qualunque valore la tua valutazione dica. Costa latenza e un po' di controllo sull'accuratezza, ed è la risposta sbagliata per chi usa un solo modello, budget di latenza inferiori a 300 ms, spesa minima e team che non possono misurare la qualità dell'output. Quando è giusto, eseguilo dietro una soglia di qualità senza markup sui token, instrada prima una fetta e leggi i log di routing prima di credere ai risparmi.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
