Card del titolo hero con la scritta 'Cos'è un router AI?' e il sottotitolo 'Valuta ogni prompt, seleziona automaticamente il tuo modello migliore', che mostra tre card arrotondate etichettate GRADE 'Leggi il prompt', ROUTE 'Scegli il miglior modello' e FAILOVER 'Commuta se un provider cade' su sfondo bianco con accenti blu e ciano. Logo OrcaRouter composito in basso a destra.
Guides & Insights

Cos'è un router AI? Il layer di routing LLM che sceglie il tuo modello

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un router AI è un livello software tra la tua applicazione e i provider di modelli che decide, per ogni richiesta, quale modello debba rispondere. Il prompt viene valutato per difficoltà e instradato verso un modello economico quando è facile e verso un modello di frontiera quando è difficile: la differenza tra pagare DeepSeek V4 Flash $0.09 e Claude Opus 5 $5.00 per 1M token di input per la stessa chiamata. L'altro "router AI" che trovi in prima pagina di questa esatta ricerca — l'hardware Wi-Fi con un core neurale — è un prodotto diverso, e quella collisione di nomi è il motivo per cui così pochi di quei risultati sono utili.

Cercando "ai router" nell'agosto 2026 si trovano per lo più articoli di stampa specializzata in networking domestico. ASUS commercializza il ROG Rapture GT-BE19000AI come "il primo router da gaming AI al mondo" — un dispositivo Wi-Fi 7 con NPU, 4 GB di RAM, 32 GB di storage e un motore Docker che esegue Home Assistant o AdGuard direttamente sul router. ZTE, insieme a Tianyi Digital Life di China Telecom, ha lanciato un router domestico Wi-Fi 7 "nativo AI" che percepisce quando esci di casa e riconfigura da solo la rete della smart home. Sono dispositivi davvero interessanti, ma non sono ciò che uno sviluppatore intende per "AI router". Questo articolo parla dell'LLM router: la categoria che si colloca tra il tuo codice e le API dei modelli linguistici di grandi dimensioni e sceglie quale modello risponde a ogni prompt. Tratta i due significati del nome, cosa fa realmente il router, cosa fa risparmiare e cosa costa, e i casi in cui non dovresti usarlo.

Due prodotti diversi condividono lo stesso nome

La frase 'AI router' è una collisione, e i due significati non hanno quasi nulla in comune:

L'hardware "router AI". Un router Wi-Fi con funzioni AI a bordo — un NPU per inferenza on-device, ottimizzazione del traffico, a volte Docker. Esempi: ASUS ROG Rapture GT-BE19000AI (annunciato a inizio 2026) e il router AI domestico ZTE / Tianyi Digital Life (giugno 2026). Il suo compito è gestire la rete di casa o di un piccolo ufficio.

Il router LLM. Un servizio software che riceve ogni chiamata API effettuata dalla tua applicazione e la inoltra al modello migliore — quello che supera la tua soglia di qualità al prezzo più basso. Il suo compito è spendere bene il tuo budget per i modelli. Questo è il "router IA" di cui parlano gli ingegneri IA, ed è l'argomento di questo articolo.

Two-panel disambiguation card titled 'Two products, one name'. Left panel 'Wi-Fi hardware AI router' lists 'Processor: NPU core for on-device AI', 'Apps: runs Docker — Home Assistant, AdGuard', 'Trick: AI traffic optimisation, WiFi Insight', with a spot noting examples 'ASUS ROG Rapture GT-BE19000AI · ZTE / Tianyi home AI router' sourced to ASUS and ZTE product announcements Mar–Jun 2026. Right panel 'LLM model router' lists 'One endpoint: 200+ models behind one URL', 'Decision: grades every prompt', 'Route: picks the model per request', 'Reliability: fails over when a provider drops', with a spot noting 'The category this article explains'. OrcaRouter logo composited bottom-right.

La confusione conta più della semantica. Chi cerca "ai router" per trovare la categoria software ottiene un muro di recensioni hardware; chi cerca "ai router" per un nuovo dispositivo Wi-Fi riceve marketing su NPU invece che numeri di throughput. Nessuna SERP è onesta riguardo all'ambiguità, ed è esattamente il vuoto che questa pagina colma — il significato software, definito in contrapposizione a quello hardware.

Cosa fa realmente un router LLM

Togli il marketing e un router di modelli ha tre compiti, tutti noiosi e tutti preziosi. Primo: è un singolo endpoint: il tuo codice chiama un unico URL, compatibile con OpenAI, invece di un SDK per ogni provider. Secondo: valuta la richiesta — leggendo il prompt e stimandone la difficoltà — e la smista: il lavoro facile a un modello economico e veloce, il ragionamento davvero complesso a un modello di frontiera. Terzo: esegue il failover: se il provider scelto ti applica un rate limit o risponde con un 5xx, il router ritenta con un modello funzionante senza che la tua applicazione veda mai l'errore.

La fase decisionale è il punto in cui i router differiscono, e lo spettro è lo stesso che ci si aspetterebbe. I router basati su regole abbinano parole chiave o lunghezza del prompt a un modello — in meno di un millisecondo, prevedibili, ma fragili quando cambiano prezzi o modelli. I router semantici incorporano il prompt e instradano in base al significato, così "qual è il mio saldo?" e "quanti soldi ho" finiscono sullo stesso percorso. I router appresi osservano il traffico reale e si spostano verso il modello che vince in termini di qualità per dollaro — il router di produzione di Ramp descrive questo meccanismo come un bandito Thompson e gli attribuisce una riduzione dei costi di circa il 30%, e la ricerca RouteLLM di LMSYS riporta un router a fattorizzazione di matrici che ha mantenuto circa il 95% del punteggio di GPT-4 inviando solo il 14% delle query al modello più potente. Le meccaniche più profonde delle politiche di instradamento ricevono una trattazione completa nella nostra guida, Auto Router for LLMs; qui il punto è che l'intelligenza decisionale esiste su uno spettro, e "quale punto dello spettro ti serve" è una decisione di prodotto, non una checklist di funzionalità.

Lo spread di prezzo è ciò che lo rende redditizio.

Un router guadagna il suo mantenimento solo quando i modelli differiscono molto nel prezzo, e in questo momento differiscono enormemente. Tutte le tariffe di seguito sono prezzi diretti del fornitore per 1 milione di token dal catalogo modelli di OrcaRouter, letti il 10/08/2026:

Price table card titled 'The price spread, per 1M tokens' with the sub-line 'Provider-direct rates per the OrcaRouter model catalogue, read 2026-08-10', listing seven models with input and output prices per 1M tokens: DeepSeek V4 Flash $0.09/$0.18, GPT-5.6 Luna $0.10/$0.60, MiniMax M3 $0.30/$1.20, GPT-5.6 Terra $1.00/$6.00, Gemini 3.6 Flash $1.50/$7.50, Claude Sonnet 5 $2.00/$10.00, Claude Opus 5 $5.00/$25.00, DeepSeek V4 Flash highlighted green and Claude Opus 5 highlighted red, with a footnote reading 'Input spread: DeepSeek V4 Flash $0.09 vs Claude Opus 5 $5.00 — about 55x. Rates per the OrcaRouter model catalogue, read 2026-08-10.' OrcaRouter logo composited bottom-right.

Leggi il divario e l'argomentazione si scrive da sola. DeepSeek V4 Flash a $0,09/$0,18 per 1M contro Claude Opus 5 a $5,00/$25,00 rappresenta una differenza di circa 55× sui soli token di input, e il gap tra il livello economico e il livello avanzato è ormai una caratteristica regolare del mercato, non più uno sconto una tantum. Se il tuo traffico è un mix tipico — una maggioranza di richieste brevi e ben specificate e una minoranza di ragionamenti davvero complessi — inviare tutto al livello avanzato significa pagare il prezzo pieno per il facile 80%. Un router che smista le chiamate facili sul livello economico è dove si trovano i risparmi.

I numeri misurati concordano. La ricerca di tipo RouteLLM riporta risparmi fino a circa l'85% mantenendo una qualità di livello frontiera — ma solo quando il router è abbinato a un livello minimo di qualità che si rifiuta di lesinare sulle richieste che hanno davvero bisogno della frontiera. Ramp riporta una riduzione di circa il 30% sul traffico di produzione reale senza alcun calo di qualità significativo. I glossari dei fornitori di router citano riduzioni dei costi per query del 50–70% per instradare il lavoro facile lontano dai modelli di frontiera. Il ventaglio dei numeri è il quadro onesto: il tetto dipende dalla forma del tuo traffico, e il pavimento è quello che dice la tua valutazione della qualità. Ciò a cui non dovresti credere è una singola cifra fissa del tipo «l'instradamento fa risparmiare X%», perché è una proprietà del tuo carico di lavoro, non dei router in generale.

Cosa ti costa il routing

I due costi che nessuno considera nella recensione hardware sono la latenza e l'accuratezza, ed entrambi sono reali.

Latenza. Ogni richiesta instradata paga una tassa di classificazione prima ancora che il modello inizi. Un classificatore basato su regole richiede meno di un millisecondo; un piccolo modello di embedding o classificatore aggiunge circa 50–200ms; un classificatore di dominio addestrato anche di più. La maggior parte dei router nasconde gran parte di questo tempo classificando mentre prepara la richiesta a monte, e un endpoint di routing in produzione ha misurato un overhead end-to-end di circa 55ms in mediana — meno dell'1% di un tempo di risposta normale. Ma se il tuo traffico è in tempo reale — un agente vocale, un'interfaccia utente che deve rispondere entro 300ms — un salto di routing nell'ordine delle centinaia di millisecondi può fare la differenza tra utilizzabile e non. Questo singolo vincolo è la ragione più comune per cui un team con un legittimo caso d'uso di routing decide di non instradare.

Accuratezza. Un router è valido tanto quanto il giudizio su cui si basa per instradare. Un classificatore addestrato su benchmark generali può sbagliare con convinzione riguardo al tuo dominio: il tuo compito di sintesi "facile" potrebbe essere facile per il modello di frontiera e impossibile per quello economico. La modalità di errore è silenziosa — l'utente ottiene semplicemente un output peggiore e nessuno lo registra — ed è per questo che ogni router credibile include un livello minimo di qualità o una modalità bilanciata, ed è anche per questo che una modalità aggressiva di risparmio sui costi dovrebbe essere un esperimento, non un'impostazione predefinita.

C'è anche un terzo costo sottile: il codice del router può rompere gli sconti del provider che già hai. Sia OpenAI che Anthropic applicano sconti sui prefissi di prompt ripetuti, tipicamente circa il 90% di sconto sui token di input in letture cache. Se il tuo livello di routing riscrive, riordina o inietta un timestamp rotante nel prompt, invalida il prefisso e butta via quello sconto. Un buon router passa il prompt byte per byte e lascia che la cache del provider funzioni; uno negligente trasforma silenziosamente i tuoi cache hit in chiamate a prezzo pieno.

Router contro gateway, in un paragrafo.

Vedrete anche "AI gateway" usato quasi come sinonimo, e la distinzione merita di essere fatta anche se la maggior parte dei prodotti gestiti sono entrambi. Un router risponde a quale modello — costo, latenza, capacità. Un gateway risponde a chi può chiamarlo — autenticazione, limiti di frequenza dei token, budget, log di audit, conformità. Se avete bisogno di governance attorno a un team o a un prodotto, vi servono le funzionalità di gateway; se vi serve un mix di modelli più economico, vi serve il routing. La distinzione operativa è trattata in dettaglio nella nostra guida, AI API Gateway in 2026; qui il succo è che "un router AI" di solito indica un prodotto con entrambe le metà, e dovreste chiedervi per quale metà state effettivamente pagando.

Quando hai davvero bisogno di un router AI

L'elenco onesto dei trigger, piuttosto che un caso di marketing per il routing sempre attivo:

Esegui più di un modello in produzione. Il routing è il modo in cui mantieni razionale il mix man mano che arrivano nuovi modelli e i prezzi cambiano. Un'azienda con un solo modello non ne ha bisogno.

Il tuo traffico è un mix di facile e difficile. Se ogni richiesta è ugualmente difficile, il router non ha alcun margine di arbitraggio. L'approccio classifica-poi-instrada conviene solo quando c'è una maggioranza a basso costo da intercettare.

Il tuo volume è abbastanza grande perché una percentuale conti. Un taglio del 40% su una spesa di 50$ al mese equivale a 20$; su 50.000$ equivale a un dipendente.

I guasti dei provider ti costano. Il failover automatico tra provider è spesso il primo vero beneficio che i team percepiscono, prima del risparmio sui costi.

Vuoi un solo contratto, una sola chiave, un solo endpoint. Il costo di integrazione di N provider è di per sé un motivo per passare attraverso uno.

Invertendo quelli, ottieni la lista di esclusione: un solo modello, difficoltà uniforme, spesa irrisoria, o un budget di latenza che un salto di classificazione sfora. Per questi team un router è un overhead, e chiamare direttamente il provider è la risposta migliore.

La raccomandazione: un router gestito con un livello minimo di qualità.

Per un team che ha superato i trigger sopra indicati, la raccomandazione è un router gestito che mantiene una soglia minima di qualità e non applica alcun ricarico sui token. Il nostro prodotto è OrcaRouter, ed è quello di cui possiamo parlare in dettaglio, quindi le specifiche qui sotto sono le nostre; la checklist che segue si applica a qualsiasi router tu valuti.

La modalità automatica di OrcaRouter — richiedi il nome del modello orcarouter/auto sull'endpoint standard compatibile con OpenAI — valuta ogni prompt e lo instrada attraverso oltre 200 modelli. Include quattro policy, con Balanced come predefinita: Cheapest invia al modello meno costoso che può rispondere, Balanced al modello più economico che supera la soglia di qualità, Quality al modello con il punteggio più alto, indipendentemente dal prezzo, e Adaptive impara dal tuo traffico in tempo reale e adatta l'instradamento al volo. La valutazione avviene in meno di un millisecondo, la latenza aggiuntiva totale rimane sotto i 50 ms, e se il provider scelto limita la frequenza o restituisce errori, il router effettua il failover a metà flusso verso un modello sano in meno di 50 ms. Non c'è alcun ricarico in nessun livello: paghi a ogni provider il suo esatto prezzo pubblicato — le cifre di $0.09 o $5.00 sopra indicate sono quello che paghi — e l'instradamento stesso è gratuito.

Card titled 'What a managed AI router gives you' with the sub-line 'The six numbers that separate a router from a dashboard', listing six rows: 'One endpoint: 200+ models behind one OpenAI-compatible URL', 'Grading: under 1ms per prompt', 'Added latency: under 50ms total', 'Failover: mid-stream, under 50ms', 'Markup: $0 per token — provider list price passed through', 'Accuracy: RouterArena Jun 2026: 75.5 vs GPT-5 74.0', with a badge reading 'vs GPT-5 74.0' and a footer reading 'Grades across 200+ models · you pay each provider its exact price, we add $0. Per orcarouter.ai, fetched 2026-08-10. RouterArena contestants: GPT-5 74.0, Azure 72.8, Martian 61.6, NotDiamond 60.8.' OrcaRouter logo composited bottom-right.

Sulla precisione, la classifica RouterArena di giugno 2026 assegna a OrcaRouter un punteggio del 75,5% contro il 74,0 di GPT-5, il 72,8 di Azure, il 61,6 di Martian e il 60,8 di NotDiamond (secondo orcarouter.ai). Una classifica non è una prova di nulla: trattala come un singolo dato e svolgi la tua valutazione sui tuoi prompt prima di affidare il traffico di produzione a qualunque router, incluso il nostro. Questo è anche il modo corretto per scegliere tra i router se non usi i nostri: instrada una parte del traffico, tieni un fallback, forza i tuoi prompt più difficili e leggi il log di routing per ogni richiesta prima di credere all'affermazione sul risparmio.

Quando questa raccomandazione è sbagliata

I casi in cui un router gestito è la scelta sbagliata, detto chiaramente:

In pratica usi un solo modello. Un router aggiunge un hop e una tassa di classificazione per nulla. Chiama direttamente il provider e salta il livello.

Le tue risposte devono essere immediate. Se il requisito è end-to-end sotto circa 300ms, il salto di routing più la lentezza di un modello di fascia media possono rompere il tuo budget. Fissa il modello.

Il tuo volume è esiguo.Il routing ti fa risparmiare una percentuale della spesa, e non può farti risparmiare una percentuale su zero. Sotto poche centinaia di dollari al mese, il tuo tempo vale più del risparmio.

La scelta del modello deve essere verificabile. Se una risposta deve essere riproducibile, o il modello che ne è alla base deve essere spiegabile a un revisore, la scelta di un router automatico è una variabile che devi giustificare. Registrala, fissala, oppure non instradare.

Non puoi misurare la qualità. Senza una valutazione che ti dica se l'output instradato è abbastanza buono, non puoi sapere se il router funziona, e un routing aggressivo sui costi degraderà silenziosamente output che non controlli mai.

Sei in una rete air-gapped o soggetto a vincoli di conformità. Se i modelli non devono mai lasciare la tua rete, un router gestito è del tutto inadatto — esegui un livello di routing open-source sulla tua infrastruttura.

Hai già un gateway API.Se hai investito in uno, estendi quello esistente piuttosto che aggiungere un router parallelo. Le funzionalità di routing e gateway stanno convergendo; un secondo livello è più governance, non più valore.

La versione breve

Un router AI, nel senso in cui lo intendono gli ingegneri dell'AI, è il livello software che decide quale LLM risponde a ciascuna richiesta — e il nome è condiviso, confusamente, con l'hardware Wi-Fi che esegue Docker. Funziona valutando ogni prompt e inviando la maggioranza facile a un modello economico, tenendo la minoranza difficile sui modelli di frontiera, con failover quando un provider salta. Conviene quando i modelli differiscono molto di prezzo (DeepSeek V4 Flash a $0.09 contro Claude Opus 5 a $5.00 per 1M token di input, circa un divario di 55×) e il traffico è un misto di facile e difficile; la ricerca di classe RouteLLM colloca il tetto attorno all'85% di risparmio dietro una soglia di qualità. Costa latenza e un po' di controllo sull'accuratezza, ed è la risposta sbagliata per chi usa un modello singolo, budget di latenza inferiori a 300 ms, spesa minima e team che non possono misurare la qualità dell'output. Quando è la scelta giusta, eseguilo dietro una soglia di qualità senza ricarico sui token, instrada prima una parte del traffico, e leggi i log di routing prima di credere ai risparmi.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube