
Claude Haiku 5.5 apuntaba al nivel Flash de China. Solo la mitad de esa afirmación resiste el escrutinio.
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Un lector que escribe en chino planteó esta semana un argumento incisivo: Claude Haiku 5.5 parece diseñado para conquistar el mercado chino de gama media, porque se sitúa por debajo de DeepSeek V4.1 Flash y GLM 5.3 Flash en precio y supera a GLM 5.3 Flash en Terminal Bench 4.0 y en el Artificial Analysis Intelligence Index. Es una lectura más aguda que la mayoría de los comentarios de lanzamiento. También son dos afirmaciones con un mismo abrigo, y no tienen la misma cantidad de verdad.
Anthropic lanzó Claude Haiku 5.5 el 7 de octubre de 2026 —un lanzamiento público completo con un anuncio fechado, una ficha de sistema y una lista de precios publicada. Eso le da a la afirmación algo que los comentarios de mercado de segunda mano rara vez consiguen: números que puedes comprobar.
La auditoría que figura a continuación concluye que una de las mitades es más sólida de lo que decía el lector y que la otra es errónea en el benchmark concreto que cita. Vale la pena conocer ambos hallazgos, porque apuntan en direcciones opuestas.
La afirmación, formulada con precisión
Despojado hasta sus partes, el argumento tiene tres piezas.
• Precio — Claude Haiku 5.5 es más barato que DeepSeek V4.1 Flash y más barato que GLM 5.3 Flash.
• Puntuación independiente: se sitúa aproximadamente un punto por encima de GLM 5.3 Flash en el Artificial Analysis Intelligence Index.
• Benchmark de codificación — también obtiene un punto más que GLM 5.3 Flash en Terminal Bench 4.0.
Dos de ellos pueden contrastarse con tablas publicadas y se sostienen, con ajustes. El tercero puede contrastarse con esa misma tabla y arroja un resultado distinto de lo descrito.

La mitad del precio: cierta, y subestimada en una dirección, sobreestimada en otra.
La tarifa publicada de Anthropic para Claude Haiku 5.5 es de $0.10 por millón de tokens de entrada y $0.50 por millón de tokens de salida hasta un prompt de 100,000 tokens, y aumenta a $0.50 y $2.50 por encima de ese umbral. Las lecturas de entrada en caché cuestan $0.01 y las escrituras, $0.125. La ventana de contexto es de un millón de tokens; la salida máxima es de 128,000.
GLM 5.3 Flash, de Z.ai, figura a $0.15 y $0.50, con la entrada en caché a $0.026. DeepSeek V4.1 Flash figura a $0.30 y $1.20, con la entrada en caché a $0.006.
En cuanto a la tarifa principal, el lector tiene razón. Una tarifa de entrada de $0,10 está un tercio por debajo de GLM 5.3 Flash y dos tercios por debajo de DeepSeek V4.1 Flash, y una tarifa de salida de $0,50 coincide exactamente con GLM 5.3 Flash, mientras que se queda muy por debajo de la mitad de la de DeepSeek. Eso parece un aterrizaje deliberado: igualar el precio de salida del rival más barato, superarlo en el precio de entrada y dejar que la proporción hable por sí sola.
Donde mejora para la afirmación es en el coste medido por tarea finalizada. En el Intelligence Index v4.3.2 de Artificial Analysis, el coste del trabajo completo es de $0,21 para Claude Haiku 5.5, $0,25 para GLM 5.3 Flash y $0,27 para DeepSeek V4.1 Flash. La lista de precios dice que Claude Haiku 5.5 es 1,5 veces más barato que GLM 5.3 Flash en entrada; la medición dice que el trabajo finalizado cuesta aproximadamente una sexta parte menos. Sigue siendo el más barato de los tres, solo que no por el margen que sugiere la etiqueta.
La razón es la que la mayoría de las comparaciones de precios omite. Claude Haiku 5.5 es verboso. Artificial Analysis registró 162.164 tokens de salida para él mientras ejecutaba el Index, frente a 68.673 para GLM 5.3 Flash y 88.574 para DeepSeek V4.1 Flash. La propia documentación de Anthropic añade un segundo efecto: el modelo usa el tokenizador más reciente, compartido con Claude 4.7 y versiones posteriores, por lo que el mismo texto cuenta como aproximadamente un 30 % más de tokens que en el modelo al que reemplaza. Una tarifa más barata aplicada a más tokens es una tarifa más barata aplicada a más tokens.
Un detalle que solo aparece en una factura enrutada: nuestro propio catálogo incluye DeepSeek V4.1 Flash a $0.15 de entrada y $0.60 de salida con un multiplicador de 2× aplicado durante dos franjas diarias, 01:00–04:00 y 06:00–10:00 UTC. Dieciocho horas al día esa es la tarifa base; seis horas al día la tarifa de salida es $1.20. El tráfico por lotes que se puede programar fuera de esas franjas obtiene un precio de DeepSeek sustancialmente mejor de lo que sugiere la tarifa de lista destacada del proveedor, y el tráfico interactivo no. Si estás modelando esta comparación en serio, el calendario importa tanto como la tarjeta de tarifas.

La mitad de la puntuación: «aproximadamente un punto» es 1,6
En el Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 se mide en 43,40 en su configuración Max. GLM 5.3 Flash se mide en 41,81. DeepSeek V4.1 Flash se sitúa en 39,46.
Así que la parte de la afirmación que se refiere al índice es correcta en cuanto a dirección y se redondea a la baja: la diferencia es de 1,59 puntos, no de un punto. Es una ventaja real en un índice que se sitúa en los sesenta, y es el número que se cita en todos los resúmenes de este enfrentamiento.
Lo que no es, es una afirmación sobre los benchmarks subyacentes. Ambos proveedores publican sus propios conjuntos de evaluación, y no son los mismos conjuntos — Anthropic informa GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0 y FrontierCode para Claude Haiku 5.5; Z.ai informa su propia suite para GLM 5.3 Flash. El panel independiente es la única fila comparable de manzanas con manzanas disponible, que es exactamente por lo que se hace tanto hincapié en la brecha del índice y por lo que la siguiente sección importa.
La mitad de la codificación: esta es un empate absoluto, no una victoria
Terminal Bench 4.0, en la medición independiente compartida, registra 0.32828 para Claude Haiku 5.5 y 0.32828 para GLM 5.3 Flash. Idénticos hasta cinco decimales.
Ese es el número más citable de este enfrentamiento, y la afirmación es incorrecta al respecto. La fuente probable de la confusión es la fila contigua: el GLM-5.3 completo, el hermano que no es Flash, obtiene 0.4192 en el mismo benchmark. Si has visto "GLM" y "Terminal Bench" en una misma frase junto a un número un punto por encima de Claude Haiku 5.5, ese es el hermano, no el Flash.
Las otras tres filas que Artificial Analysis publica para ambos modelos son más interesantes que el empate, y no apuntan en una sola dirección:
• SciCode — 0,5498 para Claude Haiku 5.5 frente a 0,5162 para GLM 5.3 Flash. Una ventaja de 3,4 puntos para Anthropic.
• Humanity's Last Exam — 0,4439 frente a 0,3985. Una ventaja de 4,5 puntos para Anthropic.
AutomationBench, puntuación parcial — 0,3541 frente a 0,6037. Una ventaja de 25 puntos para GLM 5.3 Flash y, con diferencia, la mayor diferencia del conjunto.
Esa última fila es la que más importará a los equipos de compras, porque la automatización agéntica es donde los modelos de gama media se están desplegando realmente. En una métrica sobre si el modelo puede llevar a término una tarea de varios pasos, el modelo de pesos abiertos y más barato de ejecutar gana por un margen que empequeñece la diferencia de 1,6 puntos del índice en la dirección opuesta.
La velocidad se divide igual que el precio, solo que más aún. Artificial Analysis midió 424,6 segundos por tarea del Index para Claude Haiku 5.5 frente a 1035,4 segundos para GLM 5.3 Flash. El modelo de Anthropic lo consigue en menos de la mitad del tiempo de reloj, lo que en un bucle de agente es una cifra operativa mayor que la tasa de tokens.
Lo que la afirmación omite por completo
La comparación se plantea como una historia de precio y puntuación, que omite silenciosamente la dimensión en la que los dos modelos son menos parecidos. GLM 5.3 Flash tiene pesos abiertos, publicados bajo MIT, con 320 mil millones de parámetros totales y 18 mil millones activos. DeepSeek V4.1 Flash también tiene pesos abiertos, con 552 mil millones totales y 16 mil millones activos. Claude Haiku 5.5 es propietario, solo mediante API, sin recuento de parámetros publicado ni repositorio.
Eso no es una nota al pie para muchos compradores; es la primera línea del documento de requisitos. Un equipo que necesita ejecutar inferencia en su propia tenencia, hacer fine-tuning o mantener fija una versión del modelo durante años no está eligiendo entre estos tres por puntos de índice en absoluto: dos de los tres quedan descalificados antes de que se lea la columna de precio. El planteamiento del lector es una observación de posicionamiento de mercado y es justa; solo ocurre que la diferencia estructural va en contra del modelo que ese planteamiento defiende.
Ejecutar la comparación tú mismo
GLM 5.3 Flash y DeepSeek V4.1 Flash están ambos en el catálogo de OrcaRouter al precio de lista del proveedor con un 0 % de margen, lo que hace que el lado chino de esta comparación sea algo que puedes invocar hoy en lugar de modelar en una hoja de cálculo. Como la tarifa se transmite tal cual en lugar de combinarse, un cambio de precio del proveedor llega a nuestro lado el mismo día que llega al suyo, y la ventana de DeepSeek basada en calendario descrita arriba es visible en el mismo bloque de precios contra el que enrutarías. Una clave, un SDK, conmutación automática por error por debajo, y el DSL de enrutamiento si prefieres expresar un límite de coste en la ruta en lugar de en el código de la aplicación.
Claude Haiku 5.5 no está en nuestro catálogo. Se puede acceder a él mediante la propia API de Anthropic, y es mejor decirlo con claridad que dejarlo implícito.

Lo que el lector acertó, y qué hacer con ello
El instinto es acertado. Si quisieras que la oleada de modelos chinos de gama media, baratos y capaces, pareciera costosa, esta es, más o menos, la carta que jugarías: igualar la tasa de salida del rival más barato, reducir a la mitad su tasa de entrada, quedar 1,6 puntos de índice por delante y dejar que la cifra de precio por tarea terminada sostenga el argumento. Claude Haiku 5.5 hace eso, y lo hace siendo más del doble de rápido por tarea que el modelo al que está dirigido.
Lo que el lector entendió mal es más acotado y más interesante. Terminal Bench 4.0 no es una victoria; es un empate exacto. La ventaja de precio, cuando se cobra por el trabajo completo en lugar de por token, es de aproximadamente una sexta parte, no del 1,5× que sugiere la tarifa. Y el único benchmark donde los dos modelos están más distantes es el agéntico, donde GLM 5.3 Flash lidera por 25 puntos.
Así que la versión honesta de la afirmación es esta: Claude Haiku 5.5 apunta al segmento flash chino, gana esa comparación en el índice compuesto, en el costo por tarea finalizada y en la latencia; no gana en automatización agéntica ni en apertura, y la ventaja específica en los benchmarks de programación que hacía que el argumento pareciera decisivo no existe.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
