
Claude Haiku 5.5 ya está disponible a $0.10 por millón de tokens: la afirmación del 75% y sus dos notas al pie
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Anthropic puso Claude Haiku 5.5 a disponibilidad general el 7 de octubre de 2026 a $0,10 por millón de tokens de entrada y $0,50 por millón de salida — las mismas dos cifras que OpenAI cobra por GPT-6 Luna, y una quinta parte de lo que Claude Haiku 4.5 cuesta desde 2025, cuando se lanzó a $1,00 y $5,00. El titular en la publicación de lanzamiento de Anthropic es que el nuevo modelo cuesta "alrededor de un 75% menos de ejecutar" que su predecesor en promedio, y esa es la cifra que todo resumen posterior ha repetido. Va acompañada de dos notas al pie que la mayoría de esos resúmenes omitió: por debajo de 100.000 tokens la reducción es del 90%, por encima es del 50%, y Claude Haiku 5.5 usa el tokenizador más reciente que comparte con Claude 4.7 y posteriores, así que el mismo texto cuenta como aproximadamente un 30% más de tokens que en Claude Haiku 4.5. Así que el 75% es una afirmación sobre una factura, no sobre una tarifa, y para cualquiera cuyos prompts sean largos esas son cosas distintas. La propia tabla comparativa del proveedor también incluye GPT-6 Luna y Claude Sonnet 5.5 como columnas junto a él, lo que hace que la documentación de lanzamiento sea inusualmente fácil de refutar.
La aritmética detrás de "75% menos"
Consulte primero la tabla de tarifas, porque no es uniforme. La entrada cuesta $0.10 por millón hasta 100,000 tokens y $0.50 por millón por encima de eso — cinco veces. La salida es $0.50 y luego $2.50. El almacenamiento en caché sigue el mismo escalón: una escritura de caché de cinco minutos cuesta $0.125 por millón por debajo del umbral y $0.625 por encima de él, una escritura de una hora cuesta $0.20 y $1.00, y una lectura de caché cuesta $0.01 y $0.05. La API de Message Batches aplica un 50% de descuento en ambos medidores, y en la ruta por lotes el modelo admite hasta 300,000 tokens de salida con el output-300k-2026-03-24 encabezado beta.
Ahora añade el tokenizador a eso, porque es donde la afirmación principal se vuelve interesante. Un prompt que medía 90.000 tokens en el tokenizador de Claude Haiku 4.5 mide aproximadamente 117.000 en el nuevo. No ha cambiado de tamaño, pero ha cruzado la línea de los 100.000 tokens, por lo que se factura a $0,50 por millón de entrada en lugar de $0,10. En Claude Haiku 4.5, ese mismo contenido costaba $0,09 de entrada ($1,00 por millón × 0,09 millones). En Claude Haiku 5.5 cuesta $0,0585. Eso es un recorte del 35% — real, y ni de lejos se acerca al 90%. La cifra del 90% se aplica a las solicitudes que se mantienen por debajo de la línea después de que el tokenizador las expande, que es donde vive una gran cantidad de tráfico de llamadas cortas: una llamada de clasificación de 20.000 tokens se convierte en 26.000 tokens, permanece en el primer tramo, y ahí el precio de entrada realmente es una décima parte de lo que era.
De eso se desprenden tres cosas, y merecen separarse en lugar de promediarse:
• Las llamadas cortas obtienen el descuento completo. Extracción, enrutamiento, clasificación y resumen de un documento que entra por debajo del límite: estas operaciones ven la cifra del 90 % tanto en la entrada como en la salida, menos la expansión del tokenizador.
• Las llamadas largas obtienen alrededor de un tercio de descuento, no tres cuartos. Una solicitud que supera los 100.000 tokens tras la retokenización paga $0,50 y $2,50 por millón —sigue siendo la mitad de las tarifas de Claude Haiku 4.5, pero el nivel en el que se ubica es cinco veces el nivel que anuncia el precio de etiqueta.
• El «75 % menos de media» es una cifra ponderada por el tráfico y es de Anthropic. Es la descripción que el propio proveedor hace de su propia combinación esperada, y Anthropic dice explícitamente que un prompt por debajo del umbral representaba alrededor del 90 % de las solicitudes al Haiku anterior. Si tu combinación no se parece a esa combinación, tu media no se parecerá a esa media, y la única manera de saberlo es contar tokens en tu propio tráfico, con el nuevo tokenizador, antes de fijar un presupuesto.

¿Qué más se lanzó junto con ello?
El modelo no es solo un precio. Varios de los detalles del lanzamiento cambian la forma en que escribes código contra él, y uno de ellos romperá un cliente existente.
• El pensamiento adaptativo está activado de forma predeterminada, con un control de esfuerzo que va de Bajo a Máximo y un valor predeterminado de medio. Este es el primer modelo de la clase Haiku con un ajuste de esfuerzo configurable, y es la palanca principal tanto en la calidad como en el costo por respuesta.
• Se rechazan los parámetros de muestreo. Enviar un temperature, top_p o top_k que no sea el predeterminado devuelve un 400. Cualquier migración que haya arrastrado esos argumentos fallará de forma ruidosa en la primera solicitud en lugar de degradarse silenciosamente, lo que al menos es un modo de fallo honesto.
• Contexto de 1M de tokens y hasta 128.000 tokens de salida en la API de Messages síncrona, con un corte de conocimiento de junio de 2026 y un compromiso de retirada no antes del 7 de octubre de 2027.
• Cinco plataformas desde el primer día: la API de Claude, Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform en AWS. Se trata de un lanzamiento el mismo día, en lugar de la disponibilidad por fases que suelen tener este tipo de presentaciones.
• Las herramientas también avanzaron.Los SDK de Python y TypeScript de Anthropic ahora admiten el uso de computadora y el uso de navegador en versión beta, y la compañía añadió créditos mensuales de API para los suscriptores de Max 5x ($100), Max 20x ($200) y Team (hasta $500 en un fondo común).
• La postura de seguridad es más limitada de lo que sugiere el precio. Anthropic dice que las salvaguardas cibernéticas de Claude Haiku 5.5 son más restrictivas que las de Claude Haiku 4.5, pero menos restrictivas que las de los recientes modelos de frontera —un uso defensivo más amplio de lo que permite Claude Sonnet 5.5, con las pruebas de penetración aún bloqueadas— y que las salvaguardas biológicas coinciden con las de Claude Sonnet 5, Claude Sonnet 5.5 y Claude Opus 5. Las evaluaciones de alineación mejoraron en general respecto al predecesor en la propia suite de Anthropic.
Lo que dice la tabla del proveedor y lo que dice la junta independiente
Anthropic publicó una tabla comparativa de referencia con tres columnas de comparación, y vale la pena leerla como un documento sobre cómo argumentan los proveedores. Cada cifra a continuación es reportada por el proveedor, producida con los entornos de evaluación de Anthropic, y nada de ello ha sido reproducido de forma independiente; donde aparece GPT-6 Luna, se trata de Anthropic ejecutando sus propias evaluaciones contra el modelo de un competidor.
• Trabajo del conocimiento — GDPval-AA v2.1 con 1620 para Claude Haiku 5.5, frente a 735 para Claude Haiku 4.5, 1437 para GPT-6 Luna y 1840 para Claude Sonnet 5.5. AA-Briefcase v1.1 con 1578, 614, 1336 y 1824.
• Uso de computadora — OSWorld 2.1 sin conexión con un 72,4% frente al 15,7%, el 48,9% y el 83,9%.
• Razonamiento — Humanity's Last Exam con un 45,9 % sin herramientas y un 57,4 % con ellas, frente a un 10,2 % y un 18,7 % de Claude Haiku 4.5, y un 56,9 % y un 64,5 % de Claude Sonnet 5.5.
• Codificación agéntica — Terminal-Bench 4.0 con un 39,2 % frente a 0,0 %, 16,4 % y 70,6 %. FrontierCode 1.1 (Main) con un 46,4 % frente al 42,4 % de GPT-6 Luna y el 52,1 % de Claude Sonnet 5.5.
• Lectura de gráficos — Chartography con un 46,4 % sin herramientas frente a 6,4 %, 29,1 % y 61,6 %.
En esa tabla, Claude Haiku 5.5 gana todas las filas frente tanto al Haiku anterior como a GPT-6 Luna, y pierde la mayoría de ellas frente a Claude Sonnet 5.5 — que es la forma honesta de un nivel pequeño: un gran salto generacional y, aun así, un nivel por debajo del modelo intermedio en el trabajo más difícil. Anthropic dice lo mismo en la publicación, recomendando Claude Sonnet 5.5 y Claude Opus 5.5 para codificación agéntica compleja, mientras posiciona el Haiku para compactación, resumen, clasificación y roles de subagente.
La imagen independiente es más matizada y requiere más atención. Artificial Analysis mide a Claude Haiku 5.5 con esfuerzo Max en 43 en su Intelligence Index v4.3.2, el segundo de 182 modelos, y 241,9 tokens de salida por segundo —rápido, como se anuncia. También mide un costo de $0,21 por tarea completada del Index, porque el modelo generó 440 millones de tokens de salida al ejecutar la suite frente a una mediana de 100 millones; el evaluador lo describe como muy verboso. GPT-6 Luna, con 38 en el mismo índice, cuesta $0,07 por tarea. Mismo precio de etiqueta, el triple en la factura. Eso no contradice la afirmación del lanzamiento —es el mismo fenómeno al que se refiere la afirmación del lanzamiento, visto desde el otro extremo: la tarifa es lo que pagas por token, y el número que realmente pagas es la tarifa multiplicada por los tokens, y Claude Haiku 5.5 gasta más de ellos por respuesta que sus rivales. El esfuerzo es la palanca; el valor predeterminado del modelo es medio, no Max, y un equipo que lo fije más bajo verá tanto una factura menor como una puntuación menor.
Llamándolo desde un solo lugar
La pregunta de migración que crea este lanzamiento no es «¿es mejor?», sino «¿cuánto me cuesta mi tráfico en él?», y esa respuesta depende de la longitud de tus prompts, tu tasa de aciertos de caché y el ajuste de esfuerzo que elijas. Llegar hasta ahí implica ejecutar tu propio conjunto de prompts en ambas generaciones —lo cual es barato de hacer detrás de un único endpoint y tedioso de hacer en dos.
Claude Haiku 5.5 en sí mismo aún no está en el catálogo de OrcaRouter, y decirlo con claridad es más útil que dar a entender lo contrario. El resto de la línea de Anthropic es: Claude Haiku 4.5, Claude Sonnet 5.5 y Claude Opus 5.5 se pueden invocar a través de nosotros hoy al precio de lista del proveedor con 0% de margen repercutido, así que la fase "antes" de una prueba de migración se ejecuta con la misma clave que conservarías después, y una rebaja del proveedor en esa fase entra en vigor de nuestro lado el mismo día. La fase "después" es la API de Anthropic hasta que el nuevo modelo llegue a un runtime que enrutamos. Lo que el endpoint compartido te ofrece mientras tanto es conmutación por error automática por debajo de la llamada, para que un modelo nuevo pueda cursar tráfico de producción sin que la ruta dependa de él, y el DSL de enrutamiento para el caso en que el escalado de Haiku a Sonnet pertenezca a la ruta en lugar de al código de tu aplicación.

Dos resultados de clientes en el lanzamiento merecen tomarse como pistas en lugar de como prueba. Asana informa de una reducción de más del 30 % en la latencia y de una inferencia hasta 2,5 veces más rápida por turno de agente; HubSpot informa de un 92,8 % en promedio en tres ejecuciones en su suite de CRM; AlphaSense informa de 0,84 frente a 0,76 en 400 consultas. Estos son números de clientes seleccionados por el proveedor en su propio anuncio, y su valor radica en indicarte qué cargas de trabajo probar primero, no en decirte lo que obtendrás.
¿Qué cambiaría el panorama?
La cifra del 75 % se resolverá de la misma manera en que se resuelve toda afirmación de un proveedor ponderada por tráfico: con tu propia factura. Lo que realmente queda abierto en el lado independiente es la cifra de costo por tarea. Si se sostiene a medida que se acumulan más ejecuciones, el resumen honesto de este lanzamiento es que Anthropic recortó la tarifa un 80 % y construyó un modelo que consume más tokens por respuesta, así que el ahorro efectivo es real, considerable, depende de la carga de trabajo y rara vez es la cifra del cartel. Si baja con los ajustes de esfuerzo y el uso de caché, el nivel se ve aún mejor. En cualquier caso, la cifra que hay que comprobar antes de una migración son tus propios tokens por tarea con el nuevo tokenizador; esa es la única cifra que la publicación de lanzamiento no puede darte.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
