
Claude Opus 5 API: Como Chamá-la, Quanto Custa e Quando é Exagero
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.
Dois endpoints, um modelo
A maioria dos tutoriais para a API Claude Opus 5 mostra apenas a chamada nativa da Anthropic, e param por aí. Na verdade, existem dois dialetos, e ambos alcançam os mesmos pesos.
• Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.
• OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.
• Modelos em nuvem. No Amazon Bedrock, o id é anthropic.claude-opus-5; no Google Vertex AI e no Microsoft Foundry, ele mantém o id de primeira parte claude-opus-5. Esses caminhos são para equipes já comprometidas com um provedor de nuvem; a rota compatível com OpenAI é a que mantém seu código portátil.
O modelo não se importa com qual dialeto você usa. O que difere é tudo em torno da chamada — cobrança, chaves, limites de taxa, failover e quantos outros modelos você consegue alcançar sem mudar o código.
O que você obtém — e as duas coisas que quebram código antigo
O Claude Opus 5 é o carro-chefe da Anthropic com forte foco em raciocínio: uma janela de contexto de 1 milhão de tokens (o máximo também é o padrão), um limite de saída de 128K, um corte de conhecimento em maio de 2026 e entrada de texto, imagem e arquivo com saída de texto. No ranking independente da Artificial Analysis, ele registrou AA Coding 78.0, classificado em 1.º de 132 e AA Intelligence 63.1, classificado em 2.º de 134, com GPQA Diamond de 93.2 e uma pontuação de 54.9 no Humanity's Last Exam, em 24 de julho de 2026. As próprias afirmações de lançamento da Anthropic — aproximadamente o dobro do Opus 4.8 no Frontier-Bench — são conduzidas pelo fornecedor e não foram reproduzidas de forma independente.

O raciocínio está ativado por padrão. O raciocínio adaptativo decide quanto raciocinar em cada chamada, controlado pelo output_config.effort parâmetro, que aceita de low a max e tem como padrão high. Para loops de codificação e agentes, xhigh é o ponto de partida recomendado; low e medium são genuinamente mais fortes no Opus 5 do que eram em modelos anteriores, o que os torna viáveis para cargas de trabalho reais em vez de chamadas de brinquedo. Os tokens de raciocínio contam para sua fatura de saída.
Duas mudanças de quebra do Claude Opus 4.8 afetam quem copia um corpo de requisição antigo:
• Max_tokens apertado agora trunca. Como o raciocínio roda por padrão, um max_tokens dimensionado em torno do comprimento esperado da resposta é consumido pelo raciocínio primeiro. Se você migrar uma carga de trabalho 4.8 sem alterações, espere respostas truncadas até aumentar o limite ou reduzir o esforço.
• Os parâmetros de amostragem são rejeitados. temperature, top_p e top_k em qualquer valor não padrão retornam um erro 400, assim como um prefill de assistente. Controle a saída com effort, não com temperature.
• Desativar o pensamento é limitado. thinking: {"type": "disabled"} é aceito apenas no esforço high ou inferior; combiná-lo com xhigh ou max retorna um 400. A maneira sensata de reduzir custos é diminuir o esforço, não desativar o pensamento.
Quanto realmente custa
O Claude Opus 5 custa $5 por milhão de tokens de entrada e $25 por milhão de saída — o mesmo preço do Claude Opus 4.8, que é a boa notícia discreta do lançamento. As leituras de cache custam $0,50 por milhão (o cache de prompt exige um prefixo mínimo de 512 tokens e suporta TTLs de 5 minutos e 1 hora). Em pré-visualização de pesquisa, o modo rápido executa o mesmo modelo com até 2,5x mais tokens de saída por segundo por $10 / $50, e a API Batch retorna resultados de forma assíncrona pela metade do preço.

Uma fatura concreta: uma solicitação de 100 mil tokens que produz 20 mil tokens de saída custa $0.50 pela entrada e $0.50 pela saída — $1.00 sem cache. Se esse prompt de 100 mil tokens for servido do cache na próxima chamada, o custo de entrada cai para cerca de $0.05, para um $0.55 de ida e volta. Essa aritmética de cache é a diferença entre Opus ser acessível em contextos longos e repetidos e não ser acessível de forma alguma.
O nível acima e abaixo, para escala: Claude Fable 5 é o modelo mais capaz da Anthropic por $10 / $50; Claude Sonnet 5 é $3 / $15 (com $2 / $10 preço introdutório até 31 de agosto de 2026); Claude Haiku 4.5 é $1 / $5. Na OrcaRouter, cada um deles é repassado pelo preço de tabela do fornecedor, sem margem por token, então a comparação acima também é o que você realmente paga.
O caso de um único endpoint
Se você está lendo um guia de API do Claude Opus 5, provavelmente já tem uma integração e uma chave, e a verdadeira questão é se você quer uma segunda integração e uma segunda chave para o próximo modelo que experimentar. OrcaRouter responde a isso com um endpoint compatível com OpenAI à frente de 200+ modelos: o mesmo cliente, a mesma URL base e um ID de modelo diferente por modelo — anthropic/claude-opus-5 hoje, um modelo mais barato quando a carga de trabalho deixa de justificar o nível Opus, um novo modelo de fronteira na semana em que for lançado, tudo sem alteração de código.

A parte econômica é a honesta. A OrcaRouter adiciona $0 por token — você paga a taxa publicada de cada provedor, então o Claude Opus 5 permanece nos $5 / $25 da Anthropic, e uma redução de preço do fornecedor entra em vigor do nosso lado no mesmo dia em que é anunciada. Trazer sua própria chave é uma opção de primeira classe: entregue sua chave de API Anthropic existente, mantenha seus próprios limites de taxa e créditos, e o provedor cobra você diretamente. Salvaguardas — um escudo de PII e uma política de conteúdo — são aplicadas antes de a solicitação ser cobrada, não depois. A página do modelo para anthropic/claude-opus-5 mostra o preço em tempo real, o contexto de 1M e os números atuais de throughput, e o DSL de roteamento compõe um failover para que um modelo mais barato responda quando o Opus 5 apresentar erros ou quando o padrão do seu tráfego permitir.
Onde Opus 5 é a resposta errada
Ser o melhor não é o mesmo que ser o certo para a sua carga de trabalho, e há três pontos em que o carro-chefe de $5 / $25 perde.
• Chamadas de alto volume e baixo risco. Um pipeline de sumarização ou classificação processando 10M de tokens de entrada por mês custa $50 no Claude Opus 5 contra $10 no Claude Haiku 4.5 — mesmo endpoint, mesma chave, só muda o id. O Haiku não é o Opus, mas para roteamento, extração e formatação, ele é bom o suficiente para que o 5x seja difícil de justificar.
• Loops longos de agente. O Opus 5 verifica seu próprio trabalho sem ser solicitado, então uma instrução de "verifique sua resposta novamente" que foi ajustada para um modelo mais antigo agora dispara sobre-verificação e queima tokens de raciocínio. Nos níveis de esforço xhigh e max, o orçamento de raciocínio cresce por design. Se seu agente não precisa de raciocínio de fronteira, o Claude Sonnet 5 a $3 / $15 é o padrão a partir do qual a maioria das equipes de produção deve começar, e é no dial de esforço que você o reduz.
• Quando o modelo não é nosso. A OrcaRouter faz o roteamento e a cobrança; a Anthropic executa os pesos. O endpoint, o markup zero, o failover e as salvaguardas são nossos, mas a qualidade da inferência e o comportamento de segurança são da Anthropic, e com BYOK o dinheiro vai direto para eles. Esse é o acordo, dito claramente: você paga a tarifa do provedor de qualquer forma, e a questão é se um endpoint para 200+ modelos vale a pena.
Conclusão
Chame a API Claude Opus 5 com o endpoint nativo de Messages se você não tiver outra integração, e com o endpoint compatível com OpenAI se quiser um único cliente para tudo. É o modelo certo quando a tarefa é difícil, o contexto é longo e a saída vale US$ 25 por milhão de tokens — e é o modelo errado quando a tarefa é rotineira. A configuração mais limpa é aquela que permite que você mude de ideia: um endpoint, sua própria chave, margem de US$ 0 e um ID de modelo que você pode trocar no dia em que a carga de trabalho mudar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
