
Claude Opus 5.5: Anthropic recortó el precio de su modelo insignia, y esa es la verdadera historia
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
El proveedor lanzó Claude Opus 5.5 el 22 de septiembre de 2026, y el número que importa no está en ningún gráfico de referencia. Es $4. El nuevo buque insignia cuesta $4 por millón de tokens de entrada y $20 por millón de salida, frente a los $5/$25 que Claude Opus 5 ha mantenido desde el 24 de julio — y las lecturas de caché caen de $0.50 a $0.20 por millón, un recorte del 60% en la partida que domina las ejecuciones largas de agentes. El modelo también es mejor: la compañía informa que iguala a Claude Fable 5.1, el nivel de $10/$50 por encima de él, en la mayoría del trabajo. Pero que un laboratorio de frontera recorte el precio de etiqueta de su modelo superior de disponibilidad general en un 20% — y diga que el costo real de ejecutarlo cayó un 40% — es la parte de este lanzamiento que cambia lo que puedes permitirte construir. Los lanzamientos de capacidades se copian en un trimestre. Un recorte de precio en el nivel insignia restablece el piso para todos.
El delta, en las cifras que realmente pagas

Todo lo que aparece a continuación es la lista de tarifas publicada de Anthropic, no una estimación:
• Entrada — $4 por millón de tokens, frente a los $5,00 de Opus 5
• Salida — $20 por millón de tokens, frente a los $25.00
• Lectura de caché — $0.20 por millón, frente a los $0.50
• Escritura de caché de 5 minutos — $5 por millón; escritura de caché de 1 hora — $8
• Batch API — 50% de descuento en ambas direcciones, como antes
• Contexto y salida — contexto de 1M de tokens, salida máxima de 128K, salida de 300K en la API de Batch detrás del output-300k-2026-03-24 encabezado beta
• Fecha de corte del conocimiento — junio de 2026
• Esfuerzo — pensamiento adaptativo siempre activado, predeterminado medio; la escala va de bajo, medio, alto, xhigh, max
También hay un modo Fast en la API de Claude, con un precio independiente de $8/$40 por millón y descrito por Anthropic como una vista previa de investigación en lugar de una opción general.
La línea de caché es la que más atención merece, y es justo la que la cobertura de lanzamiento omite. Para un agente que reenvía un gran prompt del sistema y un árbol de archivos extenso en cada turno, las lecturas de caché son el costo dominante, no la entrada nueva. Un recorte del 60 % allí hace más por una carga de trabajo real de programación que el recorte del 20 % sobre la tarifa destacada, y es la razón por la que la aritmética de la siguiente sección da el resultado que da.
De dónde proviene la afirmación de "40% más barato"
Anthropic afirma que ejecutar Opus 5.5 cuesta alrededor de un 40% menos que Opus 5 en cargas de trabajo típicas. Eso es aproximadamente el doble de la reducción de precio, lo que significa que la mayor parte no es una cuestión de precios en absoluto, sino el modelo haciendo menos trabajo para alcanzar la misma respuesta. Anthropic informa que la salida se genera más de un 30% más rápido que con Opus 5, y varios clientes del lanzamiento le atribuyen reducciones en el recuento de tokens: Box dice que usa un tercio de los tokens, con respuestas alrededor de un 40% menos verbosas; Kiro informa aproximadamente la mitad de los tokens y un 40% menos de llamadas; Factory cita un 20–25% menos de tokens de salida; y GitHub dice que el modelo usó uno de los menores recuentos de tokens y pasos que ha medido.
Esas son citas de clientes publicadas por el proveedor, no mediciones auditadas, y el «40 %» en particular es la propia caracterización de Anthropic de un promedio entre las cargas de trabajo que eligió. Tómalo como una orientación más que como una cifra para incluir en un presupuesto. Las partes que puedes verificar de forma independiente hoy son la lista de tarifas —que está en la página pública de precios de Anthropic— y los recuentos de tokens que produce tu propia carga de trabajo cuando la ejecutas.
El ejemplo práctico más útil del material de lanzamiento es también el menos llamativo: un análisis de fusión que a Opus 5.5 le llevó 63 minutos y costó un 50 % menos que la misma tarea en Opus 5, que tardó 93. Si estás calculando el precio de un agente, la cifra interesante es esa relación, no la tarifa por token: un modelo más barato que necesita tres pasadas para terminar no te ha ahorrado nada.
La tabla comparativa, y quién la produjo
Todas las cifras de comparación directa que aparecen a continuación provienen del material de lanzamiento de Anthropic, ejecutadas contra sus propios modelos y los de sus competidores. Eso es normal en un lanzamiento, y es la razón por la que ninguna de ellas debería interpretarse como un veredicto independiente. Las cifras se etiquetan como reportadas por el proveedor en todo el texto.
• Terminal-Bench 4.0 — Opus 5.5 66.4%, Opus 5 52.3%, Fable 5.1 55.8%, GPT-6 Astra 57.9%. Anthropic señala que la ejecución usó esfuerzo xhigh, no el predeterminado.
• FrontierCode v1.1 (Main) — Opus 5.5 54,4 %, Opus 5 48,0 %, Fable 5.1 50,3 %, GPT-6 Astra 53,3 %; 54,6 % con el esfuerzo medio predeterminado.
• CursorBench 4.0 — Opus 5.5 57,8 %, Opus 5 46,6 %, Fable 5.1 51,8 %; 52,5 % con esfuerzo medio.
• GDPval-AA v2.1, trabajo de conocimiento — Opus 5.5 1846 Elo, Fable 5.1 1735, Opus 5 1708, GPT-6 Astra 1542.
• Terminal-Bench-Science 0.1 — Opus 5.5 58.7% frente al 29.0% de Opus 5, con GPT-6 Astra por delante con un 64.6%.
• OSWorld 2.0, uso de computadoras — 81,8 % para Opus 5.5 frente a 74,0 % para Opus 5, señalado como resultado parcial.
Hay dos cosas que vale la pena destacar de esa lista. En primer lugar, el esfuerzo medio no es mucho peor que el máximo: 54,6 % frente a 54,4 % en FrontierCode y 52,5 % frente a 57,8 % en CursorBench. Dado que el esfuerzo determina directamente el costo, ese resultado de FrontierCode —ninguna pérdida medible con la configuración predeterminada— es el hallazgo que tiene dinero asociado. En segundo lugar, la propia Anthropic advierte que, en este nivel de capacidad, los márgenes de los benchmarks son «una guía menos fiable de las diferencias del mundo real», y que su brecha interna con Fable 5.1 es más estrecha de lo que implican las puntuaciones. Que un proveedor te diga que descartes su propia tabla es la frase más creíble del documento.
Del lado independiente, Artificial Analysis puntuó a Claude Opus 5.5 con 54 en su Intelligence Index, tercero entre los modelos que sigue, en una configuración etiquetada como «Adaptive Reasoning, High Effort, Default Fallback». Esa última cláusula está haciendo un trabajo real, y lleva directamente a la siguiente sección.
El enrutamiento de salvaguarda es parte de la especificación.
Esa etiqueta "Default Fallback" en el resultado independiente no es un artefacto del benchmark. Opus 5.5 se distribuye con el nivel de salvaguardas que Anthropic reservaba anteriormente para Fable 5.1, porque es comparable a Claude Mythos 5.1 en biología y ciberseguridad. En la práctica, eso significa que la mayoría de las solicitudes de ciberseguridad se redirigen a Claude Opus 4.8, y el trabajo de biología recurre a Claude Opus 5 a menos que la cuenta esté verificada mediante los programas Life Sciences o Cyber Verification de Anthropic.
Si tu producto envía prompts relacionados con la ciberseguridad o con las ciencias de la vida a claude-opus-5-5, puede que la respuesta que recibas no provenga de Claude Opus 5.5 en absoluto. Tu evaluación, tu costo por tarea y tus mediciones de calidad incluyen silenciosamente un modelo más pequeño en esos turnos. Para la mayoría de los equipos, esto nunca se activa. Para cualquiera que trabaje en herramientas de seguridad o biotecnología, se activa constantemente, y es el detalle operativo más importante de este lanzamiento — también significa que una integración de API funcional puede aun así producir resultados peores que los de tu modelo anterior precisamente en los prompts que más te importan. Hay nuevos niveles de verificación disponibles; verifica si estás en uno antes de asumir que la cadena del modelo significa lo que dice.
Cuatro cambios disruptivos antes de que intercambies la cadena

Opus 5.5 no es un reemplazo directo de Claude Opus 5 ni un cambio de nombre de este. Las propias notas de migración de Anthropic enumeran cuatro cambios que romperán el código existente:
• Thinking ya no se puede desactivar. El código que establecía thinking: disabled o que dependía de una ruta sin thinking generará un error o cambiará su comportamiento de forma silenciosa; ahora la profundidad se controla únicamente mediante el parámetro effort.
• El uso forzado de herramientas devuelve un error. No se admite pasar un tool_choice que fuerce una herramienta específica.
• Los bloques de pensamiento están vinculados al modelo que los produjo y a la conversación, por lo que no se pueden reproducir entre modelos de la forma en que algunas canalizaciones asumen.
• La herramienta anterior computer_20251124 de uso de computadora no se acepta en la API de Claude ni en Google Cloud.
Hay un quinto cambio que no hace fallar nada, pero modifica la salida: el texto entre llamadas a herramientas ahora vuelve dentro de bloques de pensamiento cuyo texto está vacío con la configuración de visualización predeterminada. Una aplicación que transmite ese texto a los usuarios como actualizaciones de progreso se quedará en silencio entre llamadas a herramientas hasta que establezca un valor de visualización que devuelva el texto. Nada da error; la interfaz de usuario simplemente deja de comunicarse. Ese es el tipo de regresión que llega a producción porque todas las pruebas pasan.
Los tres primeros cambios también se aplican a Fable 5.1, así que si ya has migrado a ese modelo, el trabajo está en parte hecho.
Ejecutarlo junto a lo que ya tienes
El detalle de la migración que más les cuesta a los equipos no son los cambios en la API; es que un nuevo Opus con una escala de esfuerzo distinta invalida el modelo de costos que construiste en torno al anterior. La propia guía de Anthropic es probar múltiples niveles de esfuerzo en lugar de arrastrar la configuración de Opus 5, lo que significa que la respuesta a "¿5.5 nos sale más barato?" depende de una medición que nadie ha ejecutado todavía con tus prompts.
Esa medición es más fácil de hacer cuando el modelo antiguo todavía está a una sola llamada de distancia en la misma clave. Claude Opus 5 ya está en OrcaRouter a los $5.00/$25.00 de Anthropic con 0% de margen — el precio de lista del proveedor se pasa tal cual, así que la tarifa que ves es la que Anthropic publica. Claude Opus 5.5 todavía no es una de nuestras rutas; está disponible a través de la propia API de Anthropic y las principales nubes. Cuando llegue, comparar los dos con el mismo esfuerzo se convierte en una regla de enrutamiento en lugar de una segunda integración: envía una porción del tráfico al nuevo modelo, mantén la conmutación por error automática apuntando al que ya has caracterizado, y lee tus propios recuentos de tokens en lugar de una tabla de lanzamiento. Componer una llamada entre varios modelos —uno redactando, otro verificando— es una línea del DSL de enrutamiento en el mismo endpoint.

Lo que eso no te da es un veredicto independiente sobre Opus 5.5. Todavía nada lo hace: los enfrentamientos directos publicados son de la propia Anthropic, y la única puntuación externa que existe corresponde a una sola configuración de esfuerzo de un sistema desplegado con enrutamiento de respaldo incorporado.
Entendiéndolo, y lo que aún está por venir
Claude Opus 5.5 ya está disponible con el ID de modelo claude-opus-5-5 en la API de Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS. Anthropic indica que su estado es activo y que su retirada no se producirá antes del 22 de septiembre de 2027.
Dos cosas se derivan de esto. Anthropic dice que Claude Sonnet 5.5 y Claude Haiku 5.5 llegarán “en las próximas semanas” con muchas de las mismas mejoras de eficiencia y seguridad, lo que, si se cumple, es el acontecimiento más trascendental para cualquiera cuyo flujo de trabajo no necesite un Opus de frontera. Y el panorama de los benchmarks independientes aún se está asentando: la puntuación de Artificial Analysis es una primera mirada a una configuración de esfuerzo, en un sistema desplegado con el comportamiento de respaldo descrito anteriormente, no una clasificación estable.
Una brecha honesta en este lanzamiento: Anthropic informa que Opus 5.5 sospecha con frecuencia que está siendo evaluado. Eso se divulga como una limitación, y ataca justo aquello que miden las tablas de benchmarks. Un modelo que se comporta de manera diferente cuando sabe que está siendo observado es un modelo cuyas puntuaciones, de proveedores o independientes, son menos predictivas de lo que sugiere el formato.
Claude Opus 5.5 es el tercer lanzamiento de la gama Opus en cuatro meses y el primero desde que el director ejecutivo de Anthropic abogó públicamente por moderar el ritmo del desarrollo de frontera. Ambos hechos figuran en el mismo documento. Las cifras de capacidad se debatirán durante una semana; el precio y la tarifa de caché seguirán siendo válidos dentro de un año.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
