Una tarjeta principal generada que dice «Daily AI Brief — 8 de octubre de 2026» con una insignia NEWS, el titular «Claude Haiku 5.5 se lanza y las lecturas de caché de Sonnet 5.5 se reducen a la mitad», y cuatro chips que dicen $0.10 / $0.50 por 1M, contexto de 1M de tokens, esfuerzo predeterminado Medium y lectura de caché de $0.20 a $0.10.
Engineering & Research

Resumen diario de IA, 8 de octubre: Claude Haiku 5.5 llega a $0.10 y las lecturas de caché de Sonnet 5.5 se reducen a la mitad

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Claude Haiku 5.5 se lanzó el 7 de octubre de 2026, y es lo más barato que la compañía ha puesto detrás de una API: $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida en prompts de hasta 100,000 tokens, con una ventana de contexto de 1M tokens y un dial de esfuerzo que va de Low a Max. El mismo día, sin una publicación de lanzamiento propia, las lecturas de caché de prompts en Claude Sonnet 5.5 bajaron de $0.20 a $0.10 por millón de tokens. Una de esas es un producto y la otra es una partida, y la partida es la que moverá más dinero este trimestre.

El precio primero, porque es la parte sobre la que puedes actuar hoy. Luego el esfuerzo, que es lo que decide el precio en silencio. Luego el recorte de caché, del que la mitad de las personas que pagan por Sonnet 5.5 no se enterará hasta su próxima factura.

Qué es Claude Haiku 5.5, en el orden que importa

El propio posicionamiento del proveedor es "el modelo pequeño más barato, rápido y capaz que hemos lanzado jamás", y la fecha de lanzamiento es el 7 de octubre de 2026 — un día antes de este informe. El ID del modelo es claude-haiku-5-5. Su entrada es texto e imágenes, y su salida es texto. La ventana de contexto es de 1.000.000 de tokens, frente a los 200.000 de Claude Haiku 4.5, y la salida máxima es de 128.000 tokens, con un encabezado beta en la Batch API que la eleva a 300.000. El corte de entrenamiento es junio de 2026, y Anthropic se compromete a no retirarlo antes del 7 de octubre de 2027.

Lo que importa para quien enruta tráfico no es la ventana de contexto. Es que este es el primer modelo de la clase Haiku con nivel de esfuerzo ajustable. Effort abarca Low, High, Xhigh y Max, el valor predeterminado es Medium, y lo adaptativo está activado de forma predeterminada: una función de Sonnet y Opus que llega un nivel por debajo. La publicación de lanzamiento también incluye dos cosas que tienen que ver con comprar más que con construir: créditos de API mensuales para los planes Claude Max y Team, $100 en Max 5x y $200 en Max 20x, con hasta $500 acumulables para Team, y soporte beta de computer use y browser use en los SDK. La seguridad va a la par del nivel: las salvaguardas de ciberseguridad son más estrictas que las de Claude Haiku 4.5, y las solicitudes de pruebas de penetración siguen bloqueadas, mientras que las salvaguardas de biología coinciden con las de Claude Sonnet 5, Claude Sonnet 5.5 y Claude Opus 5.

A capture of Anthropic's Claude Haiku 5.5 announcement page showing the October 7, 2026 date, the headline framing Claude Haiku 5.5 as a performance, pricing and safety upgrade, and the on-page sections for Performance, Pricing, Safety and Further updates.

El precio, y el precipicio de 100.000 tokens en su interior

La tarifa principal es de $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida. Lea el asterisco: esa es la tarifa para prompts de 100,000 tokens o menos. Por encima de 100,000, ambas cifras se multiplican por cinco, hasta $0.50 de entrada y $2.50 de salida. Las escrituras en caché cuestan $0.125 por millón en el nivel de cinco minutos y $0.20 en el nivel de una hora dentro de la banda económica, y las lecturas de caché cuestan $0.01 por millón — una décima parte de la tarifa de entrada, que es el descuento de caché más profundo que Anthropic ha publicado en cualquier modelo. El procesamiento por lotes reduce todo a la mitad nuevamente: $0.05 y $0.25 dentro de la banda económica, $0.25 y $1.25 por encima de ella.

Compara eso con Claude Haiku 4.5, que sigue en la lista de precios con una tarifa plana de $1.00 de entrada y $5.00 de salida, sin niveles en función del contexto, una lectura de caché de $0.10 y una ventana de 200,000 tokens. El nuevo modelo cuesta una décima parte del precio con la misma forma de prompt, con cinco veces el contexto. Aquí no hay ningún cálculo de migración que hacer; la aritmética no está ni cerca.

El acantilado es la parte en torno a la cual hay que diseñar. Un prompt de 99.000 tokens cuesta 99 centavos por cada mil llamadas a la tarifa de entrada. Un prompt de 101.000 tokens cuesta $5,05 por cada mil. Dos mil tokens de diferencia son una factura 5 veces mayor, así que cualquier cosa que construyas en la banda barata debería mantenerse cómodamente por debajo de 100.000 tokens o estar deliberada y sistemáticamente por encima: el peor resultado es un pipeline que queda justo en la línea y paga la tarifa alta en la mitad de su tráfico.

El esfuerzo ahora es un parámetro de precio, y el valor predeterminado no es el más barato

Porque el nivel de esfuerzo se establece de forma predeterminada en Medium y el pensamiento está activado de forma predeterminada, el precio de etiqueta y el precio real no son la misma cifra. Los tokens de razonamiento se facturan como tokens de salida. En la propia ejecución publicada por Anthropic del Artificial Analysis Intelligence Index —reportada por el proveedor, no reproducida por nosotros—, Claude Haiku 5.5 emite aproximadamente 162,000 tokens por tarea, de los cuales alrededor de 129,000 son de razonamiento. El modelo mediano del índice emite del orden de 100 millones de tokens en toda la suite; Haiku 5.5 gasta 440 millones. A $0.50 por millón de tokens de salida, esa verbosidad es asequible, y ese es precisamente el punto: a la tarifa de Haiku 5.5, pensar mucho sigue siendo más barato que pensar poco en un modelo que cobra $5.00 por salida.

Configura el esfuerzo en Bajo para decisiones de clasificación, extracción y enrutamiento en las que quieras una respuesta rápida en lugar de una meditada, y déjalo en Medio para cualquier cosa que vaya a leer un usuario. Bajar a Bajo también es la forma fiable de mantener a un agente verboso dentro de la banda de 100.000 tokens, porque recorta los tokens de razonamiento antes de recortar la calidad de la respuesta.

La línea más discreta: las lecturas de caché de Sonnet 5.5 se reducen a la mitad

Claude Sonnet 5.5 lee el prompt en caché a $0.10 por millón de tokens a partir del 7 de octubre, frente a los $0.20 anteriores. El precio de entrada de Sonnet 5.5 es de $2.00 y el de salida de $10.00, por lo que un multiplicador de lectura de caché de 0.05x es ahora el mismo multiplicador que tiene Haiku 5.5, aplicado a una tarifa de entrada veinte veces mayor. La estimación de Anthropic es que esto reduce el costo del trabajo con Claude en torno a un 20%, lo cual es una afirmación sobre la forma de la carga de trabajo más que sobre un benchmark: solo se cumple si una gran parte de tu entrada es un prefijo estable que reenvías en cada turno. Si tus prompts son distintos en cada llamada, este cambio te cuesta y no te ahorra nada.

Vale la pena señalar lo que implica el recorte. Anthropic está fijando precios agresivos para los prefijos de larga duración en el modelo de gama media justo en el momento en que lanza un modelo pequeño muy barato, lo que se interpreta como un argumento a favor de una arquitectura de dos modelos: una rama Sonnet 5.5 con una caché en caliente para el trabajo que requiere criterio, y una rama Haiku 5.5 para el volumen que no lo requiere.

Lo que muestran las cifras independientes, un día después

Artificial Analysis puntuó a Claude Haiku 5.5 el día después de su lanzamiento. Su Intelligence Index marca 43 en total, con la configuración Max-effort reportada en 43.40, segundo de 182 modelos en la tabla. El costo por tarea de índice es de $0.21, el cuadragésimo sexto más barato. El precio combinado con una mezcla 7:2:1 de entrada, entrada en caché y salida es de $0.08 por millón, que es la cifra que hace que la comparación anterior de niveles parezca injusta para todo lo demás. La velocidad de salida es de 243.4 tokens por segundo, la novena más rápida de la tabla, con una latencia reportada del primer token de aproximadamente 0.3 segundos y un descuento de caché del 90%.

Esa cifra de salida de 440 millones de tokens es la salvedad que acompaña al 43. La puntuación es real y de ejecución independiente; la verbosidad también. Un modelo que piensa tanto es barato por token y no siempre es barato por tarea, y la brecha entre esos dos números es donde realmente reside una decisión de enrutamiento.

Para ponerlo en perspectiva, las propias comparaciones publicadas por Anthropic sitúan a Claude Haiku 5.5 en 1620 en GDPval-AA v2.1 frente a 735 de Claude Haiku 4.5, en 72,4 % en OSWorld 2.1 frente a 15,7 %, en 45,9 % en Humanity's Last Exam sin herramientas frente a 10,2 %, y en 39,2 % en Terminal-Bench 4.0 frente a 0,0 %. Son cifras reportadas por el proveedor en evaluaciones elegidas por el proveedor y deben leerse como orientativas, pero la dirección no es sutil: no se trata de una pequeña actualización de un modelo pequeño.

A generated single-column scoreboard titled 'Claude Haiku 5.5 — the scoreboard' listing an Artificial Analysis Intelligence Index of 43 ranked second of 182, a cost per index task of $0.21, a blended price of $0.08 per million tokens, output speed of 243.4 tokens per second, a 1M-token context window and a $0.01-per-million cache read.

Acceder a estos modelos sin un segundo contrato

Claude Haiku 5.5 está disponible a través de la propia API de Anthropic y, desde ahí, allá donde se revendan los modelos de Anthropic. En el catálogo de OrcaRouter, la línea de Anthropic hoy incluye anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 y anthropic/claude-fable-5.1 — nosotros no alojamos Claude Haiku 5.5, y este informe no va a fingir lo contrario. Lo que sí ofrecemos es el nivel inmediatamente superior, y OrcaRouter traslada el precio de lista del proveedor con un 0 % de recargo, y por eso el recorte del precio de lectura de caché de Sonnet 5.5 apareció en nuestros precios el mismo día en que Anthropic lo aplicó, y no en un ciclo programado de revisión de precios.

La versión práctica: si quieres probar Haiku 5.5 en una rama de clasificación mientras tu rama de juicio permanece en Claude Sonnet 5.5, estás sosteniendo dos claves en lugar de una, y la capa de enrutamiento es donde se decide el A/B. Ese es todo el argumento a favor de una puerta de enlace frente a una integración directa: un único endpoint, cadenas de modelo y una ruta de conmutación por error cuando un proveedor falla.

A capture of the OrcaRouter models catalogue showing the filterable model list with input-modality, context-length, input-price, status and series filters, the line counting the model list and providers on one API key and one bill, and model cards carrying per-million input and output prices.

Qué observar a partir de ahora

Tres cosas. Si los proveedores terceros empiezan a revender Haiku 5.5 a una tarifa combinada por debajo de $0,10, que es el punto en el que la capa de enrutamiento se gana su lugar en lugar de limitarse a simplificar las compras. Si Anthropic amplía el límite del tramo de 100.000 tokens, ya que un acantilado justo en 100.000 es un lugar extraño para que lo tenga un modelo con una ventana de 1 millón de tokens. Y si la cifra de verbosidad de 440 millones de tokens baja en una versión puntual, porque ese único número es lo que se interpone entre Haiku 5.5 y ser la opción predeterminada obvia para toda la mitad inferior de una pila de producción.