Inferenza sicura senza ricarico, a consumo o in abbonamento. Oppure porta le tue chiavi. Il routing adattivo abbassa la tua fattura.
Senza carta di credito · online in 60 secondi
from openai import OpenAIclient = OpenAI(base_url="https://api.orcarouter.ai/v1",api_key=ORCAROUTER_API_KEY,)resp = client.chat.completions.create(model="orcarouter/auto", # we grade + routemessages=[{"role": "user", "content": "..."}],)
Una riga. Valutiamo ogni prompt, instradiamo a frontier o OSS e aggiungiamo $0.
Log completi, spesa in tempo reale e una ricevuta per prompt. Nessuna scatola nera.
Vedi una ricevutaGuardrail e un firewall per agenti che bloccano, non si limitano a registrare.
Vedi il firewallImposta base_url su api.orcarouter.ai/v1 e sostituisci la tua chiave API. Nessun'altra modifica al codice.
Valutato in meno di 1 ms, con failover, cache e log completi inclusi.
Direttamente a ogni provider alla sua tariffa pubblica: aggiungiamo $0 per token.
Prezzi live, affiancati: quanto pagheresti direttamente al provider.
| Modello | Instradato a | Input /M | Output /M | Contesto | Qualità |
|---|---|---|---|---|---|
| z-ai/glm-5.3NUOVO | Zhipu AI | $1.26 | $3.96 | 1M | 9.0 |
| qwen/qwen3.8-27b-freeNUOVO | Alibaba Cloud | — | — | 66K | 4.0 |
| qwen/qwen3.8-27bNUOVO | Alibaba Cloud | $0.330 | $2.40 | 262K | 4.0 |
| deepseek/deepseek-v4-pro-0813NUOVO | DeepSeek | $0.442 | $0.884 | 1M | 7.0 |
| grok/grok-4.6NUOVO | — | $2.00 | $6.00 | 500K | 9.0 |
| meta/muse-spark-1.2NUOVO | — | $1.25 | $4.25 | 1M | 8.0 |
| qwen/qwen3.8-maxNUOVO | Alibaba Cloud | $2.00 | $6.00 | 1M | 9.0 |
| deepseek/deepseek-v4-flash-0731NUOVO | DeepSeek | $0.147 | $0.295 | 1M | 6.0 |
| + 194 modelli in più · prezzi aggiornati ogni 60 secondi | |||||
Ricariche e abbonamenti al prezzo del provider. Non aggiungiamo nulla.
Ricarica quando vuoi. Prezzo pubblico, ricevuta a ogni chiamata.
Ricarica il tuo portafoglio a ogni periodo. Importo pieno, qualsiasi modello, con credito bonus sui piani più grandi.
Utilizza le tue chiavi provider, i limiti di frequenza e i crediti.
I piani sotto riguardano funzioni per team, non il prezzo dei token.
I nostri ricavi vengono dalle funzioni per team opzionali.
Cosa costruiamo e perché — i nostri articoli più recenti.

Un router IA sta tra la tua app e molti modelli e sceglie il modello migliore per ogni richiesta. OrcaRouter valuta ogni prompt in meno di 1 ms e lo instrada — frontier per il ragionamento difficile, open source per la routine — su oltre 200 modelli senza ricarico sui token.
Un router LLM classifica ogni prompt e lo abbina al modello con più probabilità di rispondere bene al costo più basso. OrcaRouter instrada con embedding contestuali e apprendimento online dal traffico reale: 75,5% di accuratezza nella classifica pubblica RouterArena.
Sì. OrcaRouter è un gateway IA di produzione: un endpoint compatibile OpenAI con routing adattivo, bilanciamento del carico, failover automatico, guardrail, firewall per agenti, cache dei prompt e osservabilità per richiesta.
Come un CDN serve i contenuti dal miglior edge, un AI CDN serve l'inferenza dal miglior provider: capacità sana, veloce ed economica, prompt ripetuti in cache, failover in caso di guasti. OrcaRouter svolge questo ruolo su oltre 200 modelli.
Il routing adattivo impara il compromesso qualità/costo dal tuo traffico. Punta ogni workspace su «il più economico che supera l'asticella», la massima qualità o l'equilibrio — o lascia che orcarouter/auto continui a calibrare la scelta a ogni richiesta.
Risolvono problemi diversi — governance vs scelta del modello — ma non servono due sistemi: OrcaRouter instrada per richiesta e applica budget, guardrail e osservabilità nello stesso hop.
La valutazione del prompt richiede meno di 1 ms e la latenza aggiuntiva totale resta sotto i 50 ms — di solito ripagata più volte da provider più veloci e token di prompt in cache.
No. Paghi la tariffa pubblicata di ogni provider; OrcaRouter aggiunge 0 $ per token e monetizza con le funzioni opzionali Team ed Enterprise.
Sì — sposta base_url su https://api.orcarouter.ai/v1 e il tuo codice SDK OpenAI, Anthropic o Google continua a funzionare: Chat Completions, Responses, Embeddings, Images, Audio e streaming.
OrcaRouter riprova su capacità di riserva sana per lo stesso modello o uno equivalente prima che la risposta inizi: i guasti upstream non arrivano ai tuoi utenti.
Cambia una riga. È tutta qui la migrazione.
Batte GPT-5 e Azure su RouterArenaSupportato da ricerca pubblicata
OrcaRouterGestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.
providers@orcarouter.ai