
La verdadera historia de Claude Haiku 5.5 es el acantilado de los 100K: lo que el nuevo Haiku cobra más allá de los 100.000 tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Claude Haiku 5.5 llegó el 7 de octubre de 2026 con un precio destacado de 0,10 $ por millón de tokens de entrada y 0,50 $ por millón de tokens de salida, y el número que se repitió por todas partes fue el que la propia Anthropic puso en el anuncio: una reducción del 90 por ciento frente a la tarifa de Haiku 4.5 para esas mismas dos partidas. El 90 por ciento es real. También está acotado a la mitad de una sola dimensión de la factura, y en el momento en que una solicitud supera los 100.000 tokens, cada tarifa que contiene hace algo que la cobertura del lanzamiento pasó por alto en su mayor parte. Este artículo trata de esa línea límite — cuánto cuesta, qué cargas de trabajo la alcanzan realmente y por qué "un 90 por ciento más barato" es una afirmación sobre una porción de la factura y no sobre tu factura.
Los dos precios, y dónde cambian
Anthropic publica dos columnas para el modelo, y el cambio entre ellas es un único umbral sobre el tamaño de la solicitud en lugar de sobre cualquier ajuste del modelo que elijas:
• Nivel corto, igual o inferior a 100.000 tokens — $0,10 por millón de tokens de entrada, $0,50 por millón de tokens de salida (lista de Anthropic) • Nivel largo, más de 100.000 tokens — $0,50 por millón de tokens de entrada, $2,50 por millón de tokens de salida (lista de Anthropic) • Lecturas de caché — $0,01 por millón (nivel corto) y $0,05 por millón (nivel largo) • Batch API — 50 % de descuento en cualquiera de las dos columnas, y una longitud máxima de salida de 300.000 tokens • Salida máxima estándar — 128.000 tokens, con una ventana de contexto de 1 millón de tokens en ambos niveles

Esas son las tarifas publicadas por la propia Anthropic, no las medidas, y son la lista actual: los precios de un modelo tan nuevo no han tenido tiempo de moverse, aunque Anthropic no tiene ningún compromiso de mantenerlos.
Lea esos cuatro números en orden y la forma de esto es obvia. Cada tarifa en el nivel de contexto largo es exactamente cinco veces la tarifa de contexto corto, y el umbral es el mismo de 100.000 tokens para todas ellas a la vez. No hay una curva gradual, ni interpolación, ni banda intermedia — una solicitud de 99.000 tokens y una de 101.000 tokens difieren en un factor de cinco en cada token de la factura, no solo en los 2.000 tokens que cruzaron la línea. Esa es la parte que hace que esto sea un precipicio en lugar de una pendiente, y es la parte que el encuadre de "90 por ciento más barato" no puede ver.

Por qué el corte parece más grande de lo que es
Frente a Haiku 4.5, la comparación que hizo Anthropic, el tramo corto es una reducción genuina del 90 por ciento tanto en entrada como en salida: Haiku 4.5 costaba $1.00 y $5.00 por millón para las mismas dos columnas. El tramo largo es otra historia: $0.50 y $2.50 frente a los mismos $1.00 y $5.00 es un recorte del 50 por ciento, no del 90 por ciento. Así que la versión honesta de la afirmación de lanzamiento es que Claude Haiku 5.5 es un 90 por ciento más barato que Haiku 4.5 por debajo de 100,000 tokens y un 50 por ciento más barato por encima de ese umbral, que es exactamente la división que da la propia documentación de Anthropic una vez que lees ambas columnas en lugar de una. El porcentaje único no es incorrecto; es el porcentaje del tramo corto, presentado sin su condición.
Hay una segunda cosa que tira en la dirección opuesta, y es la más interesante porque es fácil pasarla por alto y difícil de sortear. Claude Haiku 5.5 viene con un nuevo tokenizador, y la propia guía de Anthropic sitúa el recuento de tokens de un texto dado aproximadamente un 30 por ciento más alto de lo que Haiku 4.5 producía para el mismo contenido. Lo que pagaras por token bajó y lo que pagas por token de *tu* texto subió alrededor de un tercio, en relación con la contabilidad del modelo anterior. La cifra neta declarada por Anthropic, que el modelo es aproximadamente un 75 por ciento más barato de ejecutar en promedio, ya incorpora esto —un recorte del 90 por ciento en el precio de lista menos una inflación de tokens de aproximadamente el 30 por ciento cae en esa zona en tráfico de contexto corto—, pero los dos efectos son separables y vale la pena separarlos. El movimiento de precio es un cambio de precio de lista que puedes leer en una página; el movimiento del tokenizador cambia cuántas unidades de ese precio consumen tus prompts existentes, y aparece en tus propios recuentos de tokens antes de aparecer en cualquier otro lugar.
Para una carga de trabajo que ya se mantenía cómodamente por debajo de los 100.000 tokens por llamada, el efecto práctico es una reducción directa del coste por llamada, compensada en parte por el tokenizador. Para una que no lo hacía, la aritmética va en sentido contrario dos veces en la mitad larga.
¿Qué hay realmente por encima de los 100.000 tokens?
El reflejo es clasificar los precios de contexto largo en «codificación agéntica y RAG, no nosotros». Eso es demasiado rápido, porque la línea de 100.000 tokens es una línea por solicitud, y el tamaño por solicitud no es lo mismo que el tamaño de la tarea. Algunos patrones la cruzan de forma rutinaria:
• Un agente que lee bases de código y mantiene un conjunto de trabajo amplio en contexto a lo largo de una sesión, en lugar de volver a recuperarlo en cada paso
• Análisis de documentos y contratos donde la entrada es un PDF largo más sus propias instrucciones y ejemplos few-shot — el tipo de prompt que tenía 60.000 tokens antes de que alguien añadiera los ejemplos
• Canalizaciones de ingesta que agrupan muchos elementos pequeños en una sola llamada para amortizar la sobrecarga por llamada y, al hacerlo, hacen que todo el lote cruce el umbral
• Productos de chat que mantienen un historial de conversación completo en línea en lugar de resumirlo, donde la solicitud crece de forma monótona hasta que algo la trunca
• Entradas de tipo transcripción de audio y de vídeo largo, que son exactamente el tráfico que se anuncia que una ventana de 1 millón de tokens permite habilitar
La ventana de contexto de 1 millón de tokens es la parte de la hoja de especificaciones que hace que valga la pena hablar del acantilado. Anthropic vende la capacidad de entregarle al modelo una solicitud muy grande, y el precio está estructurado de modo que los últimos 900.000 tokens de esa solicitud cuestan cinco veces lo que costaron los primeros 100.000. Ambos hechos son deliberados; simplemente se anuncian en lugares distintos. Si la ventana de contexto largo es la razón por la que estás considerando este modelo, la columna de contexto largo es tu columna, y el porcentaje de lanzamiento es de otro.
La presión que el precio ejerce sobre el nivel Flash
La intención declarada de Anthropic detrás del modelo es ocupar el extremo económico y de alto rendimiento de la pila, y la lista de precios refleja esa intención con claridad. El reportaje de Bloomberg sobre el lanzamiento lo enmarcó como Anthropic defendiendo su posición de menor costo frente a competidores de pesos abiertos más baratos, y el encuadre por parte del proveedor fue más allá: que el nuevo Haiku tiene un precio pensado para vender muy por debajo de sus rivales directos por un amplio margen.
La comparación solo es limpia en el tramo corto, donde $0,10 y $0,50 son agresivamente bajos. Por encima de 100.000 tokens, las tarifas de $0,50 y $2,50 ya no están por debajo del tramo corto de nadie; son cifras ordinarias de tramo medio. La afirmación de «margen amplio» del proveedor es una declaración sobre la primera columna de la tabla de tarifas, y Anthropic tiene derecho a formularla ahí —es una lectura precisa de las cifras que publica. No es una afirmación sobre lo que paga una carga de trabajo de contexto largo, y no debería citarse como tal.
El resto del modelo, brevemente
Claude Haiku 5.5 conserva las funciones que se lanzaron en la línea Sonnet y Opus en lugar de recortarlas para la clase de tamaño. Incluye pensamiento adaptativo con un ajuste de esfuerzo predeterminado en medio, y es el primer modelo de la clase Haiku con un control de esfuerzo ajustable que abarca de Low a Max. La fecha de corte de conocimiento es junio de 2026 y el ID del modelo es claude-haiku-5-5. Anthropic indica una fecha de retiro no anterior al 7 de octubre de 2027 —la misma fecha que el lanzamiento, un año después— y el modelo aparece en Amazon Bedrock, Google Cloud y Microsoft Azure junto con la propia API de Anthropic.

En cuanto a los benchmarks, todo lo que aparece en la publicación de lanzamiento lleva la misma etiqueta de procedencia y bien merecida: son cifras reportadas por el proveedor, medidas por la propia empresa que vende el modelo, sin ninguna reproducción independiente publicada en el momento de escribir esto.
• GDPval-AA v2.1 — 1.620 reportados por el proveedor para Claude Haiku 5.5, frente a 735 para Haiku 4.5 en el mismo entorno de pruebas
• AA-Briefcase v1.1 — 1.578 según el proveedor, frente a 614 de la generación anterior
• OSWorld 2.1 — 72,4 por ciento reportado por el proveedor, frente a 15,7 por ciento
• Terminal-Bench 4.0 — 39,2 reportado por el proveedor, frente a 0,0
• Humanity's Last Exam — 45,9 por ciento reportado por el proveedor, o 57,4 con uso de herramientas
El tamaño de esos deltas es la razón para señalarlos en lugar de citarlos. Un salto de 15,7 a 72,4 en un benchmark de agentes de SO medido por el propio proveedor del modelo es una cifra que hay que tomar con reservas hasta que un tercero ejecute el mismo harness. Artificial Analysis ha publicado su propio índice para el modelo a principios de octubre de 2026 —una cifra independiente de 43,395, con 0,329 en Terminal-Bench Hard y 0,444 en HLE—, y ese conjunto es el que hay que citar cuando la afirmación tenga que sobrevivir a una impugnación. Las cifras del proveedor y las cifras independientes no entran en conflicto; simplemente son harnesses distintos, y mezclarlas en una misma frase es la manera en que una entrada de blog acaba afirmando que una evaluación del proveedor es un hecho.
La nota sobre infraestructura, ya que tenemos una.
Anthropic vende Claude Haiku 5.5 a través de su propia API y a través de Bedrock, Google Cloud y Azure. Si estás decidiendo a cuál de ellos llamar, o lo estás añadiendo junto a los otros modelos que ya tienes en tu stack, ten en cuenta que el precio de lista del proveedor es el mismo se venda donde se venda, y OrcaRouter está diseñado para trasladar ese precio de lista sin margen alguno — así que un cambio de precio de Anthropic en este modelo está activo en nuestro lado el mismo día, en lugar de con retraso. Nuestro catálogo también incluye qwen/qwen3.8-flash a $0.15 y $0.47 por millón y z-ai/glm-5.3-flash a $0.15 y $0.50, la pareja que con más frecuencia acaba en la posición contigua a un modelo de la clase Haiku, con la misma clave y la misma factura — lo que hace que un stack mixto cueste un solo contrato en lugar de tres. No servimos Claude Haiku 5.5 nosotros mismos; para eso, llama directamente a Anthropic.
Un corolario práctico del precipicio, si enrutas más de un modelo: el límite de 100.000 tokens es un punto en el que una solicitud que antes era barata se vuelve cara sin que nada en la solicitud cambie de forma significativa. Si tu capa de enrutamiento puede conmutar por error, lo sensato es mantener el tráfico de contexto largo apuntando al modelo que sea realmente barato por encima del umbral y dejar que el tráfico de contexto corto recaiga en el que sea barato por debajo de él, en lugar de asumir que la tarifa anunciada de un modelo se aplica a ambos.
Qué sacar del lanzamiento
El recorte de precio es real y es grande, por debajo de los 100.000 tokens. El modelo es el primer Haiku con un conjunto de funciones ya desplegado por completo y un dial de esfuerzo, lo cual importa más para el uso agéntico que el precio. Los deltas de los benchmarks los reporta el proveedor y deberían etiquetarse como tales cada vez que se repitan. Y la lista de precios tiene un escalón en los 100.000 tokens que multiplica todas las tarifas por cinco de golpe — que es lo único de este lanzamiento que un lector de tu stack, y no un lector de la nota de prensa, más necesita saber antes de que se fije el presupuesto de tokens del próximo sprint.
Si quieres contrastar la aritmética con tu propio tráfico, los dos números que debes extraer son el percentil 95 del tamaño de tus solicitudes y tu proporción de gasto en solicitudes de más de 100.000 tokens. Si el primero está por debajo de la línea, te aplica el 90 por ciento y la cobertura del lanzamiento acertó con respecto a tu situación. Si el segundo representa una porción significativa de la factura, el número que importa es el 50, y vale la pena volver a calcular la estimación de costos para el modelo del stack que hayas elegido bajo el supuesto del 90.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
