
Claude Haiku 5.5 vs. Claude Sonnet 5.5: una tarjeta de tarifas de 20x, una factura medida de 36x
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 112 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Claude Haiku 5.5 y Claude Sonnet 5.5 están separados por seis días y un nivel dentro de la misma familia, comparten una ventana de contexto de un millón de tokens y responden con la misma forma de API. En la tarifa publicada, el más barato cuesta un quinto de lo que cuesta el más caro en la banda en la que recaen la mayoría de las solicitudes. En el panel independiente de Artificial Analysis la brecha es incluso mayor: $0.21 para completar una tarea del Intelligence Index con Claude Haiku 5.5 frente a $7.60 con Claude Sonnet 5.5, para un Intelligence Index de 43 frente a 56. La señal que dio origen a este artículo lo planteaba como que Claude Haiku 5.5 era "mucho mejor que GPT-6 Luna" y "más cerca de Sonnet 5.5". La primera mitad de eso es más o menos lo que muestra el propio conjunto de comparación del proveedor. La segunda mitad es donde las mediciones dejan de coincidir con el marketing, y vale la pena ser precisos sobre cuál.
Dos modelos, separados por seis días y un nivel
Claude Haiku 5.5 se lanzó el 7 de octubre de 2026 con el ID de modelo claude-haiku-5-5. Es el reemplazo directo de Claude Haiku 4.5, acepta texto e imágenes y devuelve texto, y es el primer modelo de la clase Haiku al que Anthropic ha dado un ajuste de esfuerzo configurable — Bajo, Medio, Alto, Xhigh y Máx, con medium como valor predeterminado de la API. Anthropic lo llama "el modelo pequeño más barato, más rápido y más capaz que hemos lanzado", y su nota al pie matiza que es el más rápido a la velocidad estándar de cada modelo, todavía por detrás de los modelos Opus cuando estos se ejecutan en Modo rápido.
Claude Sonnet 5.5 llegó seis días antes, el 28 de septiembre de 2026, como claude-sonnet-5-5 — el nivel que Anthropic posiciona como la mejor combinación de velocidad e inteligencia, y el que recomienda para la programación agéntica compleja. La misma ventana de un millón de tokens. A diferencia de Claude Haiku 5.5, no tiene una franja de precios según la longitud del prompt, lo que resulta importar más que la ventaja de seis días.
Ambos están disponibles ahora en todas las plataformas, incluidas Amazon Web Services, Google Cloud y Microsoft Azure, y ambos conllevan un compromiso de retirada no antes de un año después del lanzamiento —el 7 de octubre de 2027 para Claude Haiku 5.5, el 28 de septiembre de 2027 para Claude Sonnet 5.5. Anthropic afirma que Claude Sonnet 5.5 está disponible con retención de datos cero, al igual que Claude Opus 5.5 y Claude Sonnet 5.
La tarjeta de tarifas, ambos lados, en un solo lugar.
Por millón de tokens, en dólares estadounidenses, según las tarifas publicadas de Anthropic:
• Entrada — Claude Haiku 5.5 $0.10 para prompts de hasta 100.000 tokens, $0.50 por encima de ese límite; Claude Sonnet 5.5 $2.00 fijo, sin escalones.
• Salida — Claude Haiku 5.5 $0.50 hasta 100,000 tokens, $2.50 por encima de eso; Claude Sonnet 5.5 $10.00 tarifa plana.
• Lecturas de caché — Claude Haiku 5.5 $0.01 en el tramo inferior y $0.05 por encima de él; Claude Sonnet 5.5 $0.10. Anthropic redujo a la mitad las lecturas de caché de Claude Sonnet 5.5 de $0.20 al mismo tiempo que el lanzamiento de Haiku, y afirma que, como las lecturas de caché representan una gran parte del uso de tokens agénticos, Claude Sonnet 5.5 ahora cuesta alrededor de un 20% menos en la mayoría del trabajo agéntico.
• Escrituras de caché — Claude Haiku 5.5: $0.125 por una escritura de cinco minutos y $0.20 por una escritura de una hora en la banda inferior, $0.625 y $1.00 por encima de esta; Claude Sonnet 5.5: $2.50 por una escritura de cinco minutos y $4.00 por una hora.
• Batch — la Batch API tiene un 50 % de descuento tanto en entrada como en salida. Eso sitúa a Claude Haiku 5.5 en $0.05 y $0.25 por debajo del umbral de 100.000 tokens, y en $0.25 y $1.25 por encima de él, frente a Claude Sonnet 5.5, a $1.00 y $5.00.
Si se leen esas líneas en conjunto, la forma es consistente: en la banda inferior se observa una brecha de entrada de 20x y una brecha de salida de 20x; por encima de la línea, 4x y 4x. El titular de Anthropic es «alrededor de un 75 % menos de coste de ejecución» en promedio frente a Claude Haiku 4.5, precisado en una nota al pie como un 90 % más barato por debajo de 100.000 tokens y un 50 % más barato por encima de esa cifra, con el cambio de tokenizador incluido en ese promedio.
El paso de 100.000 tokens es donde cambia la aritmética
Dos cosas tiran en direcciones opuestas, y solo una de ellas aparece en la lista de precios. Los precios caen con fuerza frente a Claude Haiku 4.5. Al mismo tiempo, Claude Haiku 5.5 incluye un tokenizador actualizado, similar a los de Claude Sonnet 5.5 y Claude Opus 5.5, que, según Anthropic, «usa un poco más de tokens por tarea», por lo que un prompt idéntico llega como un número mayor de tokens facturables del que tendría en la generación anterior. El promedio del 75 % es el neto de ambas cosas, y es una cifra del proveedor.
La línea de los 100.000 tokens es la parte que sorprende a la gente. Anthropic fija el precio de Claude Haiku 5.5 según la longitud del prompt: una solicitud cuyo prompt supera los 100.000 tokens paga los precios más altos por toda la solicitud, no solo por los tokens que superan el umbral. La longitud del prompt cuenta todos los tokens de entrada, incluidas las lecturas de caché y las escrituras de caché, y cada solicitud se tarifica por sí sola —una solicitud larga paga la banda más alta incluso cuando parte de su prompt es un acierto de caché, y las solicitudes anteriores conservan los precios que se les facturaron. Un pipeline de recuperación que se encuentra cómodamente en 90.000 tokens paga $0.10 y $0.50. Mueve la ventana un paso y toda la solicitud se vuelve a tarificar a $0.50 y $2.50. Claude Sonnet 5.5 no hace esto, porque toda la ventana de un millón de tokens se factura a precios estándar.
Se derivan dos consecuencias, que apuntan en direcciones opuestas. Primera, el cruce que la gente espera —que un contexto largo convierta al modelo caro en el más barato— no ocurre: Claude Haiku 5.5 por encima de la línea sigue siendo una cuarta parte de Claude Sonnet 5.5 en la tabla de tarifas. Segunda, la diferencia con la que contabas se reduce de 20x a 4x justo cuando tu carga de trabajo se vuelve intensa, que es justo cuando los números absolutos empiezan a importar. El escalón es la razón por la que un pipeline sensible a los costos necesita su propia línea presupuestaria en lugar de una tarifa por token.
Qué puntuación informa cada proveedor que obtiene
Todo lo que aparece en esta sección ha sido reportado por el proveedor y no ha sido reproducido por terceros. Anthropic publica el mismo conjunto de comparaciones en sus páginas de Claude Haiku 5.5 y Claude Sonnet 5.5, y en los puntos en que ambas páginas se solapan, coinciden:
• GDPval-AA v2.1, trabajo de conocimiento — 1.620 para Claude Haiku 5.5, frente a 1.840 para Claude Sonnet 5.5, 735 para Claude Haiku 4.5 y 1.437 para GPT-6 Luna.
• AA-Briefcase v1.1 — 1,578 para Claude Haiku 5.5, frente a 1,824 para Claude 5.5, 614 para Claude Haiku 4.5 y 1,336 para GPT-4 Luna.
• OSWorld 2.1, uso de computadora, subconjunto sin conexión — 72,4 % para Claude Haiku 5.5, frente a 83,9 % para Claude Sonnet 5.5, 15,7 % para Claude Haiku 4.5 y 48,9 % para GPT-6 Luna.
• Terminal-Bench 4.0, codificación agéntica — 39,2% para Claude Haiku 5.5, frente a 70,6% para Claude Sonnet 5.5, 0,0% para Claude Haiku 4.5 y 16,4% para GPT-6 Luna.
• FrontierCode 1.1, Main — 46,4% para Claude Haiku 5.5, frente a 52,1% para Claude Sonnet 5.5 en esfuerzo Xhigh, 42,4% para GPT-6 Luna. Anthropic también señala que Claude Sonnet 5.5 obtiene una puntuación más baja en esfuerzo Max que en Xhigh en este caso, lo que atribuye a un uso más frecuente de una habilidad de revisión de código que provoca tiempos de espera agotados o ediciones fuera del alcance.
• Cartografía, razonamiento visual sin herramientas — 46,4 % para Claude Haiku 5.5, frente a 61,6 % para Claude Sonnet 5.5, 6,4 % para Claude Haiku 4.5 y 29,1 % para GPT-6 Luna.
• Humanity's Last Exam — 45,9 % sin herramientas y 57,4 % con ellas para Claude Haiku 5.5; 64,5 % con herramientas para Claude Sonnet 5.5, 18,7 % para Claude Haiku 4.5, y 56,9 % sin herramientas para Claude Sonnet 5.5 en la misma página. Anthropic señala que las cifras de la familia GPT-6 podrían estar desactualizadas porque OpenAI corrigió un error de comprensión de imágenes y no se habían actualizado todas las puntuaciones de terceros.
Dos de esas líneas merecen leerse dos veces. En FrontierCode, los dos modelos están cerca en términos generales —46,4 % frente a 52,1 %—, y en Chartography, donde no hay herramientas detrás de las que esconderse, la diferencia es de 15 puntos. Terminal-Bench 4.0 no está nada cerca: 39,2 % frente a 70,6 % es una clase de capacidad distinta, y por eso la página de Claude Sonnet 5.5 de Anthropic sigue señalando a Claude Sonnet 5.5 y Claude Opus 5.5 para la codificación agéntica compleja, y presenta a Claude Haiku 5.5 como el modelo para trabajos acotados y de gran volumen.
Lo que aporta el consejo independiente
Los números de Anthropic comparan sus propios modelos entre sí y con un competidor. Un ranking independiente pone a ambos frente a todo el campo, y la cifra que reporta y que los proveedores omiten es el coste por tarea completada.
Artificial Analysis puntúa Claude Haiku 5.5 en Max effort con un Intelligence Index de 43, muy por encima de la mediana de 13 entre modelos comparables, generando 440 millones de tokens de salida en el Intelligence Index frente a una mediana de 100 millones —muy verboso— a $0,10 de entrada y $0,50 de salida por millón, y 242 tokens de salida por segundo. Su coste medido es de $0,21 por tarea del Intelligence Index.
El mismo ranking otorga a Claude Sonnet 5.5 una puntuación de 56, frente a una mediana de 26, y genera 410 millones de tokens de salida frente a una mediana de 88 millones, a $2.00 de entrada y $10.00 de salida con un 90% de descuento de caché. Su costo medido es de $7.60 por tarea del Intelligence Index.


Ponga esas dos líneas una al lado de la otra y la proporción lo cuenta todo. $0,21 frente a $7,60 es un poco más de 36 veces, y los dos modelos están casi igualados en verbosidad —440 M de tokens de salida frente a 410 M—, así que ese multiplicador se debe casi por completo a que la tarifa hace exactamente lo que dice que hará. En la tarifa del propio proveedor, la misma comparación es de 20 veces. Lo extra proviene de cosas que un precio por token no puede mostrar: el modelo más barato llega a su respuesta con menos tokens facturados por tarea en este ajuste de esfuerzo, y las lecturas de caché se facturan a una décima parte de la tarifa de Claude Sonnet 5.5. El mismo entorno de pruebas, las mismas tareas, medidas de forma independiente.

Dónde se agota realmente el nivel barato
Los números de clientes que publica Anthropic determinan la división con más frecuencia que los benchmarks, y todos apuntan en la misma dirección. Asana informa una latencia más de un 30 % menor en la finalización de tareas y una inferencia hasta 2,5 veces más rápida por turno de agente. Box informa una puntuación 11 puntos superior a Claude Haiku 4.5 con aproximadamente la mitad de latencia. HubSpot informa la mejor puntuación que ha visto en su propia suite, 92,8 % en promedio de tres ejecuciones, con la mayor tasa de aciertos y la menor tasa de falsos positivos. AlphaSense realiza alrededor de 8 millones de llamadas semanales a través de "Ask in Document" e informa una mejora estadísticamente significativa respecto a Claude Haiku 4.5, 0,84 frente a 0,76. Cognition informa que, con Claude Haiku 5.5 como sidekick, su agente Fusion mantiene una puntuación FrontierCode de 66,2.
Ninguno de esos es un agente de horizonte largo. Son soluciones puntuales: un paso bien definido, cada vez más rápidas y más baratas. Esa es la forma para la que está diseñado Claude Haiku 5.5, y también es la forma en la que la ventaja de coste de 36x es dinero real en lugar de un error de redondeo. La ventaja se multiplica con el volumen de llamadas y se evapora con la profundidad de las llamadas: cien mil llamadas de clasificación al día a $0,10 de entrada y $0,50 de salida es una partida que notas desaparecer, mientras que cien turnos de agente por sesión, cada uno releyendo el contexto acumulado, es una partida que crece de forma superlineal porque cada turno que supera el umbral paga el tramo superior.
El contraargumento de Claude Sonnet 5.5 es el coste por intento en lugar del coste por token. Anthropic afirma que se ejecuta un 30% más rápido que Claude Sonnet 5 y cuesta hasta un 30% menos para la mayoría del trabajo, y el ahorro proviene de necesitar menos tokens en lugar de tarifas más bajas. Los evaluadores externos ponen cifras a eso: Slack informa de aproximadamente un 14% menos de tokens de salida, Balyasny alrededor de 121k tokens por respuesta frente a 497k, Box 2,4 veces más rápido con un 12% menos de tokens, Lovable aproximadamente un tercio menos de llamadas a herramientas y alrededor de la mitad de ejecuciones de shell, Atlassian hasta un 30% más rápido con Rovo Agents, y Base44 3,6 iteraciones por compilación frente a 7,7 para Claude Opus 5. Un turno que da en el clavo vence a cuatro que no.
Hay un tercer factor que opera en sentido contrario. Anthropic ha trasladado el esfuerzo a un control a nivel de modelo en esta generación: el ajuste de esfuerzo de Claude Haiku 5.5 se establece una vez por solicitud, en lugar de dimensionarse como un presupuesto de razonamiento por solicitud, y el antiguo modo budget_tokens está obsoleto en los modelos 4.6 y no se acepta en los posteriores. Para una flota que llama a un mismo ID de modelo desde multitud de servicios, eso es una simplificación. Para cualquier cosa que dimensionara su propio razonamiento en cada llamada, supone una reescritura.
Ejecutar ambos detrás de un solo endpoint
La razón por la que vale la pena acertar con esta decisión es que la mitad equivocada de ella es costosa de revertir: recablear una ruta de producción de un ID de modelo a otro implica tocar cada punto de llamada que asumía el comportamiento del anterior. La forma más barata de averiguar a qué nivel pertenece una carga de trabajo es ejecutar ambos detrás de un mismo endpoint y mover el tráfico entre ellos mediante configuración en lugar de mediante refactorización.
Para eso está OrcaRouter. Claude Sonnet 5.5 está en el catálogo como anthropic/claude-sonnet-5.5, junto con Claude Sonnet 5, Claude Opus 5.5 y Claude Haiku 4.5 — el nivel Haiku anterior sigue disponible como punto de referencia mientras migras fuera de él. La plataforma aplica el precio de lista del proveedor sin ningún margen, así que los $2.00 y $10.00 de arriba son las tarifas que pagas, y lo mismo ocurre a la inversa: cuando un proveedor cambia los precios, el nuevo precio está activo aquí el mismo día, que es como nos llegó la reducción de lectura de caché de Claude Sonnet 5.5. Dos funciones hacen el trabajo que esta decisión en concreto necesita. La conmutación automática por error mantiene un modelo que aún estás evaluando fuera de tu ruta crítica por sí sola, y el DSL de enrutamiento te permite enviar llamadas de menos de 100 000 tokens al nivel barato y pasar las de contexto largo o horizonte largo al más caro en el mismo flujo de solicitudes, sin un segundo contrato ni un segundo SDK.
Para ser precisos sobre lo que está y no está alojado: Claude Sonnet 5.5 se puede enrutar a través de nosotros hoy. Claude Haiku 5.5 aún no está en el catálogo. Hasta que lo esté, reside en la propia API de Anthropic y en las tres plataformas en la nube enumeradas anteriormente.
Cómo decidir
Elige Claude Haiku 5.5 cuando la tarea sea acotada, de gran volumen y verificable —clasificación, extracción, enrutamiento, resumen, el trabajo por turno dentro de un agente que ya hayas construido—. La diferencia de tarifa de 20x es justamente el quid de la cuestión ahí, el paso de 100.000 tokens es evitable por diseño, y el coste de 0,21 $ por tarea medido de forma independiente demuestra que la ventaja se mantiene fuera del propio laboratorio del proveedor. Ajusta el dial de esfuerzo según la clase de tarea en lugar de dejarlo en el valor predeterminado; en un modelo de la clase Haiku, la diferencia entre Bajo y Máximo es un multiplicador de coste, no una preferencia de calidad.
Elige Claude Sonnet 5.5 cuando la tarea sea de horizonte largo, agéntica o no fluida —código que tenga que compilar, uso de computadora que tenga que dejar la pantalla en un estado conocido, cualquier cosa en la que una respuesta incorrecta cueste más que la respuesta terminal. Terminal-Bench 4.0 con un 70,6% frente a un 39,2% no es un matiz, es una clase de capacidad distinta, y la tarifa plana significa que un contexto largo no cambia silenciosamente el precio de toda la solicitud. Si tu carga de trabajo está genuinamente en un punto intermedio, la respuesta honesta es que ninguno de los modelos tiene todavía un amplio conjunto de reproducción por terceros que lo respalde, las puntuaciones del índice provienen de un único arnés de pruebas, y las cifras del proveedor citadas arriba son del propio proveedor.
¿Qué cambiaría esta respuesta?
Hay tres cosas que vale la pena vigilar, y ninguna de ellas es un lanzamiento de benchmarks. La primera es si las evaluaciones independientes de Claude Haiku 5.5 con esfuerzo Low, High y Xhigh —no solo Max— muestran la misma relación de coste por tarea, porque el dial de esfuerzo es la palanca más barata de la comparación y la que menos se mide. La segunda es si se mantiene el escalón de 100.000 tokens; una segunda banda, o ninguna banda en la próxima generación, cambiaría la aritmética para cada pipeline de recuperación en la línea más que cualquier puntuación individual de benchmark. La tercera es el tokenizador. Si un checkpoint posterior tokeniza el mismo texto a la tasa anterior, el promedio del 75 % de Anthropic se convierte en un mínimo en lugar de un objetivo, y la brecha frente a Claude Sonnet 5.5 se amplía sin que se mueva ninguno de los dos precios.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
