
Cos'è un router AI? Il layer di routing LLM che sceglie il tuo modello
- AlibabaNUOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.3 Flash2026-08-2658Intelligenza72Codice
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
Un router AI è un livello software tra la tua applicazione e i provider di modelli che decide, per ogni richiesta, quale modello debba rispondere. Il prompt viene valutato per difficoltà e instradato verso un modello economico quando è facile e verso un modello di frontiera quando è difficile: la differenza tra pagare DeepSeek V4 Flash $0.09 e Claude Opus 5 $5.00 per 1M token di input per la stessa chiamata. L'altro "router AI" che trovi in prima pagina di questa esatta ricerca — l'hardware Wi-Fi con un core neurale — è un prodotto diverso, e quella collisione di nomi è il motivo per cui così pochi di quei risultati sono utili.
Cercando "ai router" nell'agosto 2026 si trovano per lo più articoli di stampa specializzata in networking domestico. ASUS commercializza il ROG Rapture GT-BE19000AI come "il primo router da gaming AI al mondo" — un dispositivo Wi-Fi 7 con NPU, 4 GB di RAM, 32 GB di storage e un motore Docker che esegue Home Assistant o AdGuard direttamente sul router. ZTE, insieme a Tianyi Digital Life di China Telecom, ha lanciato un router domestico Wi-Fi 7 "nativo AI" che percepisce quando esci di casa e riconfigura da solo la rete della smart home. Sono dispositivi davvero interessanti, ma non sono ciò che uno sviluppatore intende per "AI router". Questo articolo parla dell'LLM router: la categoria che si colloca tra il tuo codice e le API dei modelli linguistici di grandi dimensioni e sceglie quale modello risponde a ogni prompt. Tratta i due significati del nome, cosa fa realmente il router, cosa fa risparmiare e cosa costa, e i casi in cui non dovresti usarlo.
Due prodotti diversi condividono lo stesso nome
La frase 'AI router' è una collisione, e i due significati non hanno quasi nulla in comune:
• L'hardware "router AI". Un router Wi-Fi con funzioni AI a bordo — un NPU per inferenza on-device, ottimizzazione del traffico, a volte Docker. Esempi: ASUS ROG Rapture GT-BE19000AI (annunciato a inizio 2026) e il router AI domestico ZTE / Tianyi Digital Life (giugno 2026). Il suo compito è gestire la rete di casa o di un piccolo ufficio.
• Il router LLM. Un servizio software che riceve ogni chiamata API effettuata dalla tua applicazione e la inoltra al modello migliore — quello che supera la tua soglia di qualità al prezzo più basso. Il suo compito è spendere bene il tuo budget per i modelli. Questo è il "router IA" di cui parlano gli ingegneri IA, ed è l'argomento di questo articolo.

La confusione conta più della semantica. Chi cerca "ai router" per trovare la categoria software ottiene un muro di recensioni hardware; chi cerca "ai router" per un nuovo dispositivo Wi-Fi riceve marketing su NPU invece che numeri di throughput. Nessuna SERP è onesta riguardo all'ambiguità, ed è esattamente il vuoto che questa pagina colma — il significato software, definito in contrapposizione a quello hardware.
Cosa fa realmente un router LLM
Togli il marketing e un router di modelli ha tre compiti, tutti noiosi e tutti preziosi. Primo: è un singolo endpoint: il tuo codice chiama un unico URL, compatibile con OpenAI, invece di un SDK per ogni provider. Secondo: valuta la richiesta — leggendo il prompt e stimandone la difficoltà — e la smista: il lavoro facile a un modello economico e veloce, il ragionamento davvero complesso a un modello di frontiera. Terzo: esegue il failover: se il provider scelto ti applica un rate limit o risponde con un 5xx, il router ritenta con un modello funzionante senza che la tua applicazione veda mai l'errore.
La fase decisionale è il punto in cui i router differiscono, e lo spettro è lo stesso che ci si aspetterebbe. I router basati su regole abbinano parole chiave o lunghezza del prompt a un modello — in meno di un millisecondo, prevedibili, ma fragili quando cambiano prezzi o modelli. I router semantici incorporano il prompt e instradano in base al significato, così "qual è il mio saldo?" e "quanti soldi ho" finiscono sullo stesso percorso. I router appresi osservano il traffico reale e si spostano verso il modello che vince in termini di qualità per dollaro — il router di produzione di Ramp descrive questo meccanismo come un bandito Thompson e gli attribuisce una riduzione dei costi di circa il 30%, e la ricerca RouteLLM di LMSYS riporta un router a fattorizzazione di matrici che ha mantenuto circa il 95% del punteggio di GPT-4 inviando solo il 14% delle query al modello più potente. Le meccaniche più profonde delle politiche di instradamento ricevono una trattazione completa nella nostra guida, Auto Router for LLMs; qui il punto è che l'intelligenza decisionale esiste su uno spettro, e "quale punto dello spettro ti serve" è una decisione di prodotto, non una checklist di funzionalità.
Lo spread di prezzo è ciò che lo rende redditizio.
Un router guadagna il suo mantenimento solo quando i modelli differiscono molto nel prezzo, e in questo momento differiscono enormemente. Tutte le tariffe di seguito sono prezzi diretti del fornitore per 1 milione di token dal catalogo modelli di OrcaRouter, letti il 10/08/2026:

Leggi il divario e l'argomentazione si scrive da sola. DeepSeek V4 Flash a $0,09/$0,18 per 1M contro Claude Opus 5 a $5,00/$25,00 rappresenta una differenza di circa 55× sui soli token di input, e il gap tra il livello economico e il livello avanzato è ormai una caratteristica regolare del mercato, non più uno sconto una tantum. Se il tuo traffico è un mix tipico — una maggioranza di richieste brevi e ben specificate e una minoranza di ragionamenti davvero complessi — inviare tutto al livello avanzato significa pagare il prezzo pieno per il facile 80%. Un router che smista le chiamate facili sul livello economico è dove si trovano i risparmi.
I numeri misurati concordano. La ricerca di tipo RouteLLM riporta risparmi fino a circa l'85% mantenendo una qualità di livello frontiera — ma solo quando il router è abbinato a un livello minimo di qualità che si rifiuta di lesinare sulle richieste che hanno davvero bisogno della frontiera. Ramp riporta una riduzione di circa il 30% sul traffico di produzione reale senza alcun calo di qualità significativo. I glossari dei fornitori di router citano riduzioni dei costi per query del 50–70% per instradare il lavoro facile lontano dai modelli di frontiera. Il ventaglio dei numeri è il quadro onesto: il tetto dipende dalla forma del tuo traffico, e il pavimento è quello che dice la tua valutazione della qualità. Ciò a cui non dovresti credere è una singola cifra fissa del tipo «l'instradamento fa risparmiare X%», perché è una proprietà del tuo carico di lavoro, non dei router in generale.
Cosa ti costa il routing
I due costi che nessuno considera nella recensione hardware sono la latenza e l'accuratezza, ed entrambi sono reali.
Latenza. Ogni richiesta instradata paga una tassa di classificazione prima ancora che il modello inizi. Un classificatore basato su regole richiede meno di un millisecondo; un piccolo modello di embedding o classificatore aggiunge circa 50–200ms; un classificatore di dominio addestrato anche di più. La maggior parte dei router nasconde gran parte di questo tempo classificando mentre prepara la richiesta a monte, e un endpoint di routing in produzione ha misurato un overhead end-to-end di circa 55ms in mediana — meno dell'1% di un tempo di risposta normale. Ma se il tuo traffico è in tempo reale — un agente vocale, un'interfaccia utente che deve rispondere entro 300ms — un salto di routing nell'ordine delle centinaia di millisecondi può fare la differenza tra utilizzabile e non. Questo singolo vincolo è la ragione più comune per cui un team con un legittimo caso d'uso di routing decide di non instradare.
Accuratezza. Un router è valido tanto quanto il giudizio su cui si basa per instradare. Un classificatore addestrato su benchmark generali può sbagliare con convinzione riguardo al tuo dominio: il tuo compito di sintesi "facile" potrebbe essere facile per il modello di frontiera e impossibile per quello economico. La modalità di errore è silenziosa — l'utente ottiene semplicemente un output peggiore e nessuno lo registra — ed è per questo che ogni router credibile include un livello minimo di qualità o una modalità bilanciata, ed è anche per questo che una modalità aggressiva di risparmio sui costi dovrebbe essere un esperimento, non un'impostazione predefinita.
C'è anche un terzo costo sottile: il codice del router può rompere gli sconti del provider che già hai. Sia OpenAI che Anthropic applicano sconti sui prefissi di prompt ripetuti, tipicamente circa il 90% di sconto sui token di input in letture cache. Se il tuo livello di routing riscrive, riordina o inietta un timestamp rotante nel prompt, invalida il prefisso e butta via quello sconto. Un buon router passa il prompt byte per byte e lascia che la cache del provider funzioni; uno negligente trasforma silenziosamente i tuoi cache hit in chiamate a prezzo pieno.
Router contro gateway, in un paragrafo.
Vedrete anche "AI gateway" usato quasi come sinonimo, e la distinzione merita di essere fatta anche se la maggior parte dei prodotti gestiti sono entrambi. Un router risponde a quale modello — costo, latenza, capacità. Un gateway risponde a chi può chiamarlo — autenticazione, limiti di frequenza dei token, budget, log di audit, conformità. Se avete bisogno di governance attorno a un team o a un prodotto, vi servono le funzionalità di gateway; se vi serve un mix di modelli più economico, vi serve il routing. La distinzione operativa è trattata in dettaglio nella nostra guida, AI API Gateway in 2026; qui il succo è che "un router AI" di solito indica un prodotto con entrambe le metà, e dovreste chiedervi per quale metà state effettivamente pagando.
Quando hai davvero bisogno di un router AI
L'elenco onesto dei trigger, piuttosto che un caso di marketing per il routing sempre attivo:
• Esegui più di un modello in produzione. Il routing è il modo in cui mantieni razionale il mix man mano che arrivano nuovi modelli e i prezzi cambiano. Un'azienda con un solo modello non ne ha bisogno.
• Il tuo traffico è un mix di facile e difficile. Se ogni richiesta è ugualmente difficile, il router non ha alcun margine di arbitraggio. L'approccio classifica-poi-instrada conviene solo quando c'è una maggioranza a basso costo da intercettare.
• Il tuo volume è abbastanza grande perché una percentuale conti. Un taglio del 40% su una spesa di 50$ al mese equivale a 20$; su 50.000$ equivale a un dipendente.
• I guasti dei provider ti costano. Il failover automatico tra provider è spesso il primo vero beneficio che i team percepiscono, prima del risparmio sui costi.
• Vuoi un solo contratto, una sola chiave, un solo endpoint. Il costo di integrazione di N provider è di per sé un motivo per passare attraverso uno.
Invertendo quelli, ottieni la lista di esclusione: un solo modello, difficoltà uniforme, spesa irrisoria, o un budget di latenza che un salto di classificazione sfora. Per questi team un router è un overhead, e chiamare direttamente il provider è la risposta migliore.
La raccomandazione: un router gestito con un livello minimo di qualità.
Per un team che ha superato i trigger sopra indicati, la raccomandazione è un router gestito che mantiene una soglia minima di qualità e non applica alcun ricarico sui token. Il nostro prodotto è OrcaRouter, ed è quello di cui possiamo parlare in dettaglio, quindi le specifiche qui sotto sono le nostre; la checklist che segue si applica a qualsiasi router tu valuti.
La modalità automatica di OrcaRouter — richiedi il nome del modello orcarouter/auto sull'endpoint standard compatibile con OpenAI — valuta ogni prompt e lo instrada attraverso oltre 200 modelli. Include quattro policy, con Balanced come predefinita: Cheapest invia al modello meno costoso che può rispondere, Balanced al modello più economico che supera la soglia di qualità, Quality al modello con il punteggio più alto, indipendentemente dal prezzo, e Adaptive impara dal tuo traffico in tempo reale e adatta l'instradamento al volo. La valutazione avviene in meno di un millisecondo, la latenza aggiuntiva totale rimane sotto i 50 ms, e se il provider scelto limita la frequenza o restituisce errori, il router effettua il failover a metà flusso verso un modello sano in meno di 50 ms. Non c'è alcun ricarico in nessun livello: paghi a ogni provider il suo esatto prezzo pubblicato — le cifre di $0.09 o $5.00 sopra indicate sono quello che paghi — e l'instradamento stesso è gratuito.

Sulla precisione, la classifica RouterArena di giugno 2026 assegna a OrcaRouter un punteggio del 75,5% contro il 74,0 di GPT-5, il 72,8 di Azure, il 61,6 di Martian e il 60,8 di NotDiamond (secondo orcarouter.ai). Una classifica non è una prova di nulla: trattala come un singolo dato e svolgi la tua valutazione sui tuoi prompt prima di affidare il traffico di produzione a qualunque router, incluso il nostro. Questo è anche il modo corretto per scegliere tra i router se non usi i nostri: instrada una parte del traffico, tieni un fallback, forza i tuoi prompt più difficili e leggi il log di routing per ogni richiesta prima di credere all'affermazione sul risparmio.
Quando questa raccomandazione è sbagliata
I casi in cui un router gestito è la scelta sbagliata, detto chiaramente:
• In pratica usi un solo modello. Un router aggiunge un hop e una tassa di classificazione per nulla. Chiama direttamente il provider e salta il livello.
• Le tue risposte devono essere immediate. Se il requisito è end-to-end sotto circa 300ms, il salto di routing più la lentezza di un modello di fascia media possono rompere il tuo budget. Fissa il modello.
• Il tuo volume è esiguo.Il routing ti fa risparmiare una percentuale della spesa, e non può farti risparmiare una percentuale su zero. Sotto poche centinaia di dollari al mese, il tuo tempo vale più del risparmio.
• La scelta del modello deve essere verificabile. Se una risposta deve essere riproducibile, o il modello che ne è alla base deve essere spiegabile a un revisore, la scelta di un router automatico è una variabile che devi giustificare. Registrala, fissala, oppure non instradare.
• Non puoi misurare la qualità. Senza una valutazione che ti dica se l'output instradato è abbastanza buono, non puoi sapere se il router funziona, e un routing aggressivo sui costi degraderà silenziosamente output che non controlli mai.
• Sei in una rete air-gapped o soggetto a vincoli di conformità. Se i modelli non devono mai lasciare la tua rete, un router gestito è del tutto inadatto — esegui un livello di routing open-source sulla tua infrastruttura.
• Hai già un gateway API.Se hai investito in uno, estendi quello esistente piuttosto che aggiungere un router parallelo. Le funzionalità di routing e gateway stanno convergendo; un secondo livello è più governance, non più valore.
La versione breve
Un router AI, nel senso in cui lo intendono gli ingegneri dell'AI, è il livello software che decide quale LLM risponde a ciascuna richiesta — e il nome è condiviso, confusamente, con l'hardware Wi-Fi che esegue Docker. Funziona valutando ogni prompt e inviando la maggioranza facile a un modello economico, tenendo la minoranza difficile sui modelli di frontiera, con failover quando un provider salta. Conviene quando i modelli differiscono molto di prezzo (DeepSeek V4 Flash a $0.09 contro Claude Opus 5 a $5.00 per 1M token di input, circa un divario di 55×) e il traffico è un misto di facile e difficile; la ricerca di classe RouteLLM colloca il tetto attorno all'85% di risparmio dietro una soglia di qualità. Costa latenza e un po' di controllo sull'accuratezza, ed è la risposta sbagliata per chi usa un modello singolo, budget di latenza inferiori a 300 ms, spesa minima e team che non possono misurare la qualità dell'output. Quando è la scelta giusta, eseguilo dietro una soglia di qualità senza ricarico sui token, instrada prima una parte del traffico, e leggi i log di routing prima di credere ai risparmi.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
