
Claude Haiku 5.5 vs. Claude Haiku 4.5: una rebaja del 90% en el precio no es un ahorro del 90%
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Claude Haiku 5.5 tiene un precio de 0,10 $ por millón de tokens de entrada y 0,50 $ por millón de tokens de salida para prompts de hasta 100.000 tokens. Claude Haiku 4.5 cuesta 1 $ y 5 $, de tarifa plana, por toda la ventana de 200.000 tokens que siempre ha tenido. Anthropic cifra la diferencia en "un 90 % menos" en una nota al pie y en "alrededor de un 75 % menos de coste de ejecución" en la frase que aparece justo encima, y los once meses que separan a ambos modelos son exactamente la distancia entre esas dos cifras.
Eso no es un truco de marketing. Es la forma honesta de una generación de modelos que cambió su tokenizador, su configuración predeterminada de pensamiento y su ventana de contexto al mismo tiempo que su precio, y significa que cualquiera que cambie el id del modelo y espere que la factura se reduzca por un factor de diez quedará decepcionado por la aritmética, no por el producto.
Ambos modelos, tal como se envían
Todo lo que aparece a continuación es por millón de tokens, en dólares estadounidenses, y está tomado de la propia documentación de precios y modelos de Anthropic del 2026-10-08, a menos que se indique lo contrario.

• Entrada — Claude Haiku 5.5 $0,10 hasta 100.000 tokens, $0,50 por encima de eso; Claude Haiku 4.5 $1,00 independientemente de la longitud.
• Salida — Claude Haiku 5.5 $0.50 hasta 100,000 tokens, $2.50 por encima de eso; Claude Haiku 4.5 $5.00 independientemente de la longitud.
• Lecturas de caché — Claude Haiku 5.5 $0.01 hasta 100,000 tokens y $0.05 por encima; Claude Haiku 4.5 $0.10. Escrituras de caché — $0.125 y $0.625 frente a $1.25.
• Contexto — 1M de tokens frente a 200.000. Salida máxima — 128.000 tokens frente a 64.000.
• Pensamiento — Claude Haiku 5.5 es adaptativo y está activado por defecto con un dial de esfuerzo que se establece en medio de forma predeterminada; Claude Haiku 4.5 adopta la forma manual anterior y no tiene ningún parámetro de esfuerzo.
Puntuación independiente — el Artificial Analysis Intelligence Index v4.3.2 sitúa a Claude Haiku 5.5 (Max) en 43,40, segundo de 182 modelos, y a Claude 4.5 Haiku en 16,88, trigésimo de 61 — y el evaluador señala que la puntuación de 4.5 es estimada.
Velocidad — la misma fuente: 242 tokens de salida por segundo para Claude Haiku 5.5 frente a 89.7 para la generación 4.5, que es el único terreno en el que el modelo antiguo todavía parece sentirse cómodo.
Donde se rompe el relato de la décima parte del precio
Tres cosas merman el recorte, y solo la primera de ellas es la propia advertencia de Anthropic.
El tokenizador es el factor más importante. Claude Haiku 5.5 usa el tokenizador más reciente introducido con Claude 4.7, y la documentación de Anthropic dice que el mismo texto "cuenta aproximadamente un 30% más de tokens que en Claude Haiku 4.5". No estás pagando una décima parte de la tarifa por el mismo número de tokens; estás pagando una décima parte de la tarifa por aproximadamente 1,3 veces más tokens. La propia guía de migración del proveedor coloca esto como el segundo punto de su lista de verificación, por delante de cualquier cambio de código: vuelve a contar tus prompts y, después, revisa max_tokens y tus estimaciones de costos.
Los tokens de razonamiento se facturan como tokens de salida, y Claude Haiku 5.5 piensa por defecto. La página de lanzamiento de Anthropic es explícita en que el modelo es "muy verboso" por sí solo en los gráficos, y la medición independiente lo respalda con más contundencia que el proveedor: al evaluar el Intelligence Index, Artificial Analysis registró 440 millones de tokens de salida de Claude Haiku 5.5 frente a una mediana de 100 millones en general, y señaló al modelo como muy verboso. Una tarifa de entrada barata no ayuda a una carga de trabajo cuya factura es mayoritariamente de salida.
El tramo de 100.000 tokens es el tercero. Por encima de él, las tarifas son de $0,50 y $2,50 —la mitad de lo que cobraba Claude Haiku 4.5 por la misma solicitud—, lo que es una buena oferta y no es la oferta de la que habrá leído la mayoría de los lectores. Anthropic dice que los prompts por debajo del umbral representaron alrededor del 90% de las solicitudes al modelo Haiku anterior, que es la cifra que hace que el corte sea soportable como titular; también es la combinación de tráfico del propio proveedor, no la suya.

Lo que les cuesta el mismo trabajo a los dos modelos
El costo por tarea finalizada es la métrica que sobrevive a los tres efectos anteriores, porque le cobra al modelo todo lo que emitió, no solo lo que le enviaste.
Artificial Analysis sitúa a Claude Haiku 5.5 (Max) en $0.21 por tarea del Intelligence Index — la cifra que publica junto con una tarifa de entrada de $0.10 y de salida de $0.50. No publica ninguna cifra de costo por tarea para la generación 4.5 en absoluto; el recuadro indica "desconocido", porque el modelo nunca se ejecutó en el Index en una configuración de razonamiento. Lo que la página sí publica es una etiqueta de precio bruta de $1.00 y $5.00 y una puntuación medida distinta y más baja.
Entonces, la comparación honesta para un comprador no es 10x en tokens, sino algo más cercano a esto: una décima parte de la tarifa de entrada con un 30% más de tokens, la mitad de la tarifa de salida cuando superas los 100K, y un modelo que gasta más tokens de salida por respuesta que su predecesor — frente a un salto de capacidad de 16.88 a 43.40 en el mismo ranking independiente. La cifra del 75% que Anthropic cita para cargas de trabajo promedio es el dato sensato para planificar. También es una estimación combinada del proveedor sobre una mezcla de tráfico que no controlas.
La migración no es un simple cambio de id de modelo
Anthropic: su guía de migración consta de diez puntos para cualquiera que migre desde Claude Haiku 4.5, y varios son fallos graves más que consejos.
• El pensamiento manual se rompe — thinking: {"type": "enabled", "budget_tokens": N} devuelve un error. El pensamiento adaptativo lo reemplaza, y thinking.display tiene que configurarse en "summarized" si quieres ver el razonamiento en absoluto.
• Los parámetros de muestreo se rompen — temperature, top_p y top_k tienen que salir de la solicitud.
• La precarga del asistente falla: una conversación que termina con un turno del asistente devuelve un error; termínala con un turno del usuario.
• Cambios en el orden de los bloques — una respuesta puede comenzar con bloques de pensamiento, por lo que el código que lee el primer bloque de contenido como la respuesta debe seleccionar por tipo en su lugar.
• Los rechazos de respuesta son nuevos: el modelo ejecuta clasificadores de seguridad, puede devolver stop_reason: "refusal", y no hay respaldo del lado del servidor.
• La repetición está restringida — los bloques de pensamiento funcionan solo en la cuenta que los produjo, o en una cuenta vinculada a ella.
• Priority Tier no se transfiere — las organizaciones que tengan un compromiso de Priority Tier en Claude Haiku 4.5 deben planificar la capacidad por separado, porque el nivel no es compatible con Claude Haiku 5.5.
Dos de ellos merecen más atención que el resto. El motivo de parada por rechazo es un cambio en el flujo de control en cualquier bucle que asumiera que toda respuesta tiene contenido, y los bloques de pensamiento vinculados a la cuenta rompen cualquier cola que almacene conversaciones y las reproduzca a través de un conjunto de credenciales. Ninguno de los dos se manifiesta hasta producción.
Ejecutar ambos niveles con una sola clave
La pregunta práctica para la mayoría de los equipos no es cuál de estos dos modelos es mejor, porque la respuesta depende por completo de qué llamada se esté haciendo. Es si el tramo barato de una cascada puede actualizarse de forma independiente de todo lo que lo rodea.
Claude Haiku 4.5 está hoy en el catálogo de OrcaRouter al precio de lista de Anthropic con un 0 % de margen, así que la tarifa del proveedor se traslada directamente y cualquier cambio que Anthropic haga en ella aparece en nuestro lado el mismo día. Claude Sonnet 5.5 y Claude Opus 5.5 también están ahí, lo que significa que un pipeline de dos niveles —un modelo pequeño para la mayoría rutinaria, un modelo mayor para la escalada— puede construirse ya con una clave, un SDK y conmutación por error automática por debajo, y el tramo pequeño se cambia más adelante a Claude Haiku 5.5 como un cambio de model-id en lugar de una reescritura.
Claude Haiku 5.5 aún no está en el catálogo, y vale la pena decirlo claramente en lugar de dejarlo implícito. Una brecha el día del lanzamiento entre que un modelo se publique y que un modelo pueda enrutarse es normal, y no es una promesa sobre cuándo se cierra; los modelos que pueden invocarse desde nosotros esta mañana son los nombrados arriba.

¿Quién debería cambiar y qué llamada debería cambiar primero?
Si tu tráfico de Haiku 4.5 es clasificación, extracción, enrutamiento, compactación o resumen con prompts de menos de 100.000 tokens, cambia — la tarifa es una décima parte, la ventana es cinco veces más amplia, y el ajuste de esfuerzo te da una palanca de costos que el modelo anterior nunca tuvo. Presupuesta alrededor de un 75% menos y concilia con tus propios conteos de tokens después de una semana.
Si tus prompts superan de forma habitual los 100.000 tokens, estás comprando un descuento del 50 % en lugar de uno del 90 %, y el segundo tramo cambia la comparación de tal manera que merece la pena comparar precios: la tarifa de salida de 2,50 $ por encima de los 100 000 tokens está por encima de lo que varios modelos pequeños de la competencia cobran por toda la ventana.
Y si usas Haiku 4.5 porque era la única opción barata que cabía en un documento de 200.000 tokens, fíjate en qué ha cambiado. La ventana ahora es de un millón de tokens, lo que es un producto diferente, y la razón para conservar el modelo antiguo ha desaparecido discretamente junto con la razón por la que era barato.
