Una scheda titolo per la guida API di Claude Opus 5, che mostra una scheda gateway arrotondata con chip di codice che riportano POST /v1/messages e model: claude-opus-5, un'etichetta di prezzo che riporta $5 / $25 per 1M token, e quattro chip di modelli etichettati Claude, GPT, Gemini e Qwen collegati da linee sottili alla singola gateway.
Guides & Insights

API Claude Opus 5: come chiamarla, quanto costa e quando è eccessiva

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.

Due endpoint, un modello

La maggior parte dei tutorial per l'API Claude Opus 5 mostra solo la chiamata nativa di Anthropic e si ferma lì. In realtà esistono due dialetti, ed entrambi raggiungono gli stessi pesi.

Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.

OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.

Modelli cloud. Su Amazon Bedrock l'id è anthropic.claude-opus-5; su Google Vertex AI e Microsoft Foundry mantiene l'id di prima parte claude-opus-5. Questi percorsi sono per team già legati a un provider cloud; la via compatibile con OpenAI è quella che mantiene il tuo codice portabile.

Il modello non si cura di quale dialetto usi. Ciò che cambia è tutto ciò che sta attorno alla chiamata — fatturazione, chiavi, limiti di frequenza, failover e quanti altri modelli puoi raggiungere senza modificare il codice.

Cosa ottieni — e le due cose che rompono il vecchio codice

Claude Opus 5 è il modello di punta di Anthropic, fortemente incentrato sul ragionamento: una finestra di contesto da 1 milione di token (il massimo è anche quello predefinito), un limite di output di 128K, un cutoff delle conoscenze a maggio 2026 e input di testo, immagini e file con output di testo. Nella classifica indipendente Artificial Analysis ha registrato AA Coding 78,0, classificato #1 su 132, e AA Intelligence 63,1, classificato #2 su 134, con un GPQA Diamond di 93,2 e un punteggio Humanity's Last Exam di 54,9, al 24 luglio 2026. Le dichiarazioni di lancio di Anthropic — circa il doppio di Opus 4.8 su Frontier-Bench — sono gestite dal fornitore e non replicate in modo indipendente.

A spec and benchmark scoreboard for Claude Opus 5: 1M token context window, 128K max output, $5 / $25 list price, $0.50 per 1M cache read, AA Coding 78.0 ranked #1 of 132, and AA Intelligence 63.1 ranked #2 of 134.

Il pensiero è attivo per impostazione predefinita. Il pensiero adattivo decide quanto ragionare a ogni chiamata, controllato dal parametro output_config.effort, che accetta da low a max e per impostazione predefinita è high. Per i cicli di codifica e agentici, xhigh è il punto di partenza consigliato; low e medium sono genuinamente più forti su Opus 5 rispetto ai modelli precedenti, il che li rende adatti a carichi di lavoro reali piuttosto che a chiamate dimostrative. I token di ragionamento contano ai fini della fatturazione dell'output.

Due modifiche di rottura di Claude Opus 4.8 colpiscono chiunque copi un vecchio corpo della richiesta:

Un max_tokens basso ora tronca. Poiché il ragionamento viene eseguito per impostazione predefinita, un max_tokens dimensionato in base alla lunghezza prevista della risposta viene consumato prima dal ragionamento. Se trasferisci un carico di lavoro 4.8 senza modifiche, aspettati risposte troncate finché non aumenti il limite o riduci lo sforzo.

I parametri di campionamento vengono rifiutati. temperature, top_p e top_k con qualsiasi valore non predefinito restituiscono un errore 400, così come un prefill dell'assistente. Controlla l'output con effort, non temperature.

La disattivazione del thinking è soggetta a un limite. thinking: {"type": "disabled"} è accettato solo con effort high o inferiore; abbinandolo a xhigh o max restituisce un 400. Il modo sensato per ridurre i costi è abbassare l'effort, non disattivare il thinking.

Quanto costa realmente

Claude Opus 5 costa $5 per milione di token di input e $25 per milione di token di output — lo stesso prezzo di Claude Opus 4.8, che è la buona notizia silenziosa del rilascio. Le letture della cache costano $0.50 per milione (la cache del prompt richiede un prefisso minimo di 512 token e supporta TTL di 5 minuti e 1 ora). Una modalità veloce in anteprima di ricerca esegue lo stesso modello raggiungendo fino a 2,5 volte i token di output al secondo per $10 / $50, e l'API Batch restituisce i risultati in modo asincrono a metà prezzo.

A price comparison card for the Claude Opus 5 API: Opus 5 at $5/$25 with a $0.50 cache read, $10/$50 fast mode and roughly half-price Batch API, Claude Opus 4.8 at the same $5/$25, Claude Sonnet 5 at $3/$15 with $2/$10 intro pricing, Claude Haiku 4.5 at $1/$5, and a worked example of 100K tokens in plus 20K out billing $1.00 uncached or about $0.55 cached.

Una fattura concreta: una richiesta da 100K token che produce 20K token di output costa $0.50 per l'input e $0.50 per l'output — $1.00 non memorizzato nella cache. Se quel prompt da 100K viene servito dalla cache alla chiamata successiva, la parte di input scende a circa $0.05, per un totale di $0.55 per il round trip. Questa aritmetica della cache è la differenza tra l'essere Opus conveniente su contesti lunghi e ripetuti e il non esserlo affatto.

Il livello superiore e quello inferiore, per scala: Claude Fable 5 è il modello più capace di Anthropic a $10 / $50; Claude Sonnet 5 è a $3 / $15 (con $2 / $10 come prezzo di lancio fino al 31 agosto 2026); Claude Haiku 4.5 è a $1 / $5. Su OrcaRouter ognuno di questi viene inoltrato al prezzo di listino del fornitore senza markup per token, quindi il confronto sopra è anche ciò che paghi effettivamente.

Il caso con un solo endpoint

Se stai leggendo una guida API di Claude Opus 5, probabilmente hai già un'integrazione e una chiave, e la vera domanda è se vuoi una seconda integrazione e una seconda chiave per il prossimo modello che proverai. OrcaRouter risponde con un endpoint compatibile OpenAI davanti a 200+ modelli: lo stesso client, lo stesso URL di base e un ID modello diverso per ciascun modello — anthropic/claude-opus-5 oggi, un modello più economico quando il carico di lavoro smette di giustificare il livello Opus, un nuovo modello di frontiera la settimana in cui esce, tutto senza modificare il codice.

The OrcaRouter model page for anthropic/claude-opus-5, showing the $5.00 per million input and $25.00 per million output pricing, a 1,000,000-token context window, the released July 24, 2026 label, and both OpenAI-compatible and Anthropic-native endpoints.

Gli aspetti economici sono la parte onesta. OrcaRouter aggiunge $0 per token — paghi la tariffa pubblicata da ciascun provider, quindi Claude Opus 5 resta a $5 / $25 di Anthropic, e un taglio di prezzo del fornitore è attivo dalla nostra parte il giorno stesso in cui viene annunciato. Porta la tua chiave è un'opzione di prima classe: consegna la tua chiave API Anthropic esistente, mantieni i tuoi limiti di frequenza e i tuoi crediti, e il provider ti fattura direttamente. I guardrail — uno scudo PII e una policy sui contenuti — vengono applicati prima che la richiesta venga fatturata, non dopo. La pagina del modello per anthropic/claude-opus-5 mostra il prezzo in tempo reale, il contesto da 1M, e i numeri di throughput correnti, e il DSL di routing compone un failover in modo che un modello più economico risponda quando Opus 5 va in errore o quando la struttura del tuo traffico lo consente.

Dove Opus 5 è la risposta sbagliata

Essere il migliore non è la stessa cosa che essere adatto al tuo carico di lavoro, e ci sono tre punti in cui il flagship da $5 / $25 perde.

Chiamate ad alto volume e a basso rischio. Una pipeline di riepilogo o classificazione che processa 10M di token in ingresso al mese costa $50 su Claude Opus 5 contro $10 su Claude Haiku 4.5 — stesso endpoint, stessa chiave, basta cambiare un ID. Haiku non è Opus, ma per routing, estrazione e formattazione è abbastanza simile da rendere difficile giustificare il 5x.

Cicli lunghi per agenti. Opus 5 verifica il proprio lavoro senza che gli venga richiesto, quindi un'istruzione come "ricontrolla la tua risposta" ottimizzata per un modello più vecchio ora innesca un'eccessiva verifica e consuma token di ragionamento. A xhigh e max effort il budget di pensiero cresce volutamente. Se il tuo agente non necessita di ragionamento all'avanguardia, Claude Sonnet 5 a $3 / $15 è l'impostazione predefinita da cui la maggior parte dei team di produzione dovrebbe partire, e il livello di sforzo è dove puoi ridurlo.

Dove il modello non è nostro. OrcaRouter instrada e fattura; Anthropic esegue i pesi. L'endpoint, il markup zero, il failover e le protezioni sono nostri, ma la qualità dell'inferenza e il comportamento di sicurezza sono di Anthropic, e con BYOK il denaro va direttamente a loro. Questo è l'accordo detto chiaramente: paghi la tariffa del provider in ogni caso, e la domanda è se un unico endpoint per oltre 200 modelli ne valga la pena.

Il risultato finale

Chiama l'API Claude Opus 5 con l'endpoint Messages nativo se non hai altre integrazioni, e con l'endpoint compatibile OpenAI se vuoi un unico client per tutto. È il modello giusto quando il compito è difficile, il contesto è lungo e l'output vale $25 per milione di token — ed è il modello sbagliato quando il compito è di routine. La configurazione più pulita è quella che ti permette di cambiare idea: un solo endpoint, la tua chiave, margine di $0 e un ID modello che puoi sostituire nel giorno in cui il carico di lavoro cambia.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube