Una tarjeta de título para la guía de API de Claude Opus 5, que muestra una tarjeta de puerta de enlace redondeada con chips de código que indican POST /v1/messages y model: claude-opus-5, una etiqueta de precio que indica $5 / $25 por 1M de tokens, y cuatro chips de modelo etiquetados como Claude, GPT, Gemini y Qwen conectados por líneas finas a la única puerta de enlace.
Guides & Insights

Claude Opus 5 API: Cómo llamarlo, cuánto cuesta y cuándo es excesivo

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

The Claude Opus 5 API is live on the Messages endpoint and on every OpenAI-compatible gateway that carries it. To call it directly you POST to https://api.anthropic.com/v1/messages with the model id claude-opus-5 and the anthropic-version: 2023-06-01 header. To call it with an OpenAI-style client — the route that needs no new SDK — you point your base URL at https://api.orcarouter.ai/v1 and pass the model id anthropic/claude-opus-5, which is how OrcaRouter exposes it. The price is identical on both: $5 per million input tokens and $25 per million output, exactly the list rate with zero markup. It launched on July 24, 2026, and it is the current Opus tier — Claude Opus 4.8 costs the same $5 / $25 and scores lower on the independent benchmarks. The interesting decision is not which dialect to use; it is whether Opus-tier is what your workload actually needs.

Dos endpoints, un modelo

La mayoría de los tutoriales para la API de Claude Opus 5 muestran solo la llamada nativa de Anthropic, y se detienen ahí. En realidad hay dos dialectos, y ambos llegan a los mismos pesos.

Anthropic native — /v1/messages. POST to https://api.anthropic.com/v1/messages with two required headers: x-api-key with your key and anthropic-version: 2023-06-01. The body carries model: "claude-opus-5", a max_tokens, and a messages array. This is what the Anthropic Python and TypeScript SDKs send under the hood.

OpenAI-compatible — /v1/chat/completions. POST to https://api.orcarouter.ai/v1/chat/completions (or /v1/messages if you want the Anthropic dialect through the same host) with the model id anthropic/claude-opus-5. If you already run an OpenAI client, the switch is two lines: change base_url to https://api.orcarouter.ai/v1 and swap the API key. Nothing else in your request shape changes.

Modelos de nube. En Amazon Bedrock, el id es anthropic.claude-opus-5; en Google Vertex AI y Microsoft Foundry conserva el id de primera parte claude-opus-5. Esas rutas son para equipos que ya están comprometidos con un proveedor de nube; la ruta compatible con OpenAI es la que mantiene tu código portable.

Al modelo no le importa qué dialecto uses. Lo que difiere es todo lo que rodea a la llamada: facturación, claves, límites de velocidad, conmutación por error y a cuántos otros modelos puedes acceder sin cambiar el código.

Lo que obtienes — y las dos cosas que rompen el código antiguo

Claude Opus 5 es el buque insignia de Anthropic centrado en el razonamiento: una ventana de contexto de 1 millón de tokens (el máximo es también el predeterminado), un límite de salida de 128K, un corte de conocimiento de mayo de 2026, y entrada de texto, imagen y archivos con salida de texto. En el ranking independiente de Artificial Analysis, obtuvo AA Coding 78.0, clasificado #1 de 132, y AA Intelligence 63.1, clasificado #2 de 134, con un GPQA Diamond de 93.2 y una puntuación de 54.9 en Humanity's Last Exam, al 24 de julio de 2026. Las afirmaciones de lanzamiento de Anthropic — aproximadamente el doble que Opus 4.8 en Frontier-Bench — son realizadas por el proveedor y no han sido reproducidas de forma independiente.

A spec and benchmark scoreboard for Claude Opus 5: 1M token context window, 128K max output, $5 / $25 list price, $0.50 per 1M cache read, AA Coding 78.0 ranked #1 of 132, and AA Intelligence 63.1 ranked #2 of 134.

El pensamiento está activado por defecto. El pensamiento adaptativo decide cuánto razonar en cada llamada, controlado por el output_config.effort parámetro, que acepta low hasta max y tiene como valor predeterminado high. Para bucles de codificación y de agentes, xhigh es el punto de partida recomendado; low y medium son genuinamente más fuertes en Opus 5 de lo que eran en modelos anteriores, lo que los hace viables para cargas de trabajo reales en lugar de llamadas de prueba. Los tokens de razonamiento cuentan para tu factura de salida.

Dos cambios incompatibles de Claude Opus 4.8 afectan a cualquiera que copie un cuerpo de solicitud antiguo:

Un max_tokens ajustado ahora trunca. Debido a que el razonamiento se ejecuta por defecto, un max_tokens dimensionado aproximadamente para la longitud esperada de la respuesta se consume primero por el razonamiento. Si trasladas una carga de trabajo 4.8 sin cambios, espera respuestas truncadas hasta que aumentes el límite o reduzcas el esfuerzo.

Se rechazan los parámetros de muestreo. temperature, top_p y top_k en cualquier valor no predeterminado devuelven un error 400, al igual que un prefill del asistente. Controla la salida con effort, no con temperature.

Desactivar el pensamiento está limitado. thinking: {"type": "disabled"} solo se acepta con esfuerzo high o inferior; combinarlo con xhigh o max devuelve un 400. La forma sensata de reducir el coste es bajar el esfuerzo, no desactivar el pensamiento.

Lo que realmente cuesta

Claude Opus 5 se cotiza a $5 por millón de tokens de entrada y $25 por millón de salida — el mismo precio que Claude Opus 4.8, que es la buena noticia silenciosa del lanzamiento. Las lecturas de caché se facturan a $0.50 por millón (el almacenamiento en caché de prompts requiere un prefijo mínimo de 512 tokens y admite TTL de 5 minutos y 1 hora). En vista previa de investigación, un modo rápido ejecuta el mismo modelo a hasta 2.5 veces los tokens de salida por segundo por $10 / $50, y la API Batch devuelve resultados de forma asíncrona a mitad de precio.

A price comparison card for the Claude Opus 5 API: Opus 5 at $5/$25 with a $0.50 cache read, $10/$50 fast mode and roughly half-price Batch API, Claude Opus 4.8 at the same $5/$25, Claude Sonnet 5 at $3/$15 with $2/$10 intro pricing, Claude Haiku 4.5 at $1/$5, and a worked example of 100K tokens in plus 20K out billing $1.00 uncached or about $0.55 cached.

Una factura concreta: una solicitud de 100K tokens que produce 20K tokens de salida cobra $0.50 por entrada y $0.50 por salida — $1.00 sin caché. Si esa solicitud de 100K se sirve desde la caché en la siguiente llamada, la parte de entrada baja a aproximadamente $0.05, para un $0.55 de ida y vuelta. Esa aritmética de caché es la diferencia entre que Opus sea asequible en contextos largos y repetidos y que no lo sea en absoluto.

El nivel superior y el inferior, a modo de escala: Claude Fable 5 es el modelo más capaz de Anthropic a $10 / $50; Claude Sonnet 5 cuesta $3 / $15 (con $2 / $10 precio de lanzamiento hasta el 31 de agosto de 2026); Claude Haiku 4.5 cuesta $1 / $5. En OrcaRouter, cada uno de estos se transmite al precio de lista del proveedor sin margen por token, por lo que la comparación anterior es también lo que realmente pagas.

El caso de un solo endpoint.

Si estás leyendo una guía de API de Claude Opus 5, probablemente ya tengas una integración y una clave, y la pregunta real es si quieres una segunda integración y una segunda clave para el próximo modelo que pruebes. OrcaRouter responde a eso con un endpoint compatible con OpenAI delante de 200+ modelos: el mismo cliente, la misma URL base y un id de modelo distinto por modelo — anthropic/claude-opus-5 hoy, un modelo más barato cuando la carga de trabajo deja de justificar el nivel Opus, un nuevo modelo de frontera la semana en que se lance, todo sin cambiar el código.

The OrcaRouter model page for anthropic/claude-opus-5, showing the $5.00 per million input and $25.00 per million output pricing, a 1,000,000-token context window, the released July 24, 2026 label, and both OpenAI-compatible and Anthropic-native endpoints.

La parte económica es la honesta. OrcaRouter añade $0 por token — pagas la tarifa publicada de cada proveedor, así que Claude Opus 5 se mantiene en los $5 / $25 de Anthropic, y un recorte de precio de un proveedor está activo en nuestro sistema el mismo día en que se anuncia. Trae tu propia clave es una opción de primera clase: entrega tu clave de API existente de Anthropic, conserva tus propios límites de uso y créditos, y el proveedor te factura directamente. Las salvaguardas — un escudo de PII y una política de contenido — se aplican antes de que se facture la solicitud, no después. La página del modelo para anthropic/claude-opus-5 muestra el precio en vivo, el contexto de 1M y las cifras de rendimiento actuales, y el DSL de enrutamiento compone un failover para que un modelo más barato responda cuando Opus 5 falla o cuando el patrón de tu tráfico lo permite.

Donde Opus 5 es la respuesta incorrecta

Ser el mejor no es lo mismo que ser el adecuado para tu carga de trabajo, y hay tres aspectos en los que el buque insignia de $5 / $25 pierde.

Llamadas de alto volumen y bajo riesgo. Un pipeline de resumen o clasificación que procesa 10M tokens de entrada al mes cuesta $50 en Claude Opus 5 frente a $10 en Claude Haiku 4.5 — el mismo endpoint, la misma clave, un cambio de id. Haiku no es Opus, pero para enrutamiento, extracción y formateo está lo suficientemente cerca como para que el 5x sea difícil de justificar.

Bucles de agente largos. Opus 5 verifica su propio trabajo sin que se le pida, por lo que una instrucción "vuelve a comprobar tu respuesta" que fue ajustada para un modelo anterior ahora provoca una verificación excesiva y quema tokens de razonamiento. Con esfuerzo xhigh y max, el presupuesto de razonamiento aumenta por diseño. Si tu agente no necesita razonamiento de frontera, Claude Sonnet 5 a $3 / $15 es el valor predeterminado desde el que la mayoría de los equipos de producción deberían partir, y el selector de esfuerzo es donde lo reduces.

Cuando el modelo no es nuestro. OrcaRouter enruta y factura; Anthropic ejecuta los pesos. El endpoint, el margen cero, la conmutación por error y las salvaguardas son nuestros, pero la calidad de inferencia y el comportamiento de seguridad son de Anthropic, y con BYOK el dinero va directamente a ellos. Ese es el trato expresado sin rodeos: pagas la tarifa del proveedor de cualquier forma, y la pregunta es si un endpoint para más de 200 modelos vale la pena.

En resumen

Llame a la API de Claude Opus 5 con el endpoint nativo de Messages si no tiene otra integración, y con el endpoint compatible con OpenAI si quiere un solo cliente para todo. Es el modelo adecuado cuando la tarea es difícil, el contexto es largo y la salida vale $25 por millón de tokens — y es el modelo equivocado cuando la tarea es rutinaria. La configuración más limpia es la que le permite cambiar de opinión: un endpoint, su propia clave, $0 de margen y un ID de modelo que pueda cambiar el día en que la carga de trabajo lo haga.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube