
Claude Haiku 5.5 vs GLM-5.3-FlashX: pagar 2,5 veces más por los mismos pesos, y si vale la pena
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 57 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 345 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Lo más útil que hay que saber sobre GLM-5.3-FlashX antes de compararlo con Claude Haiku 5.5 es que ejecuta los mismos pesos que GLM-5.3-Flash y cuesta 2,5 veces más llamarlo. Z.ai lanzó FlashX en su propia API el 18 de septiembre de 2026, a $0,37 por millón de tokens de entrada y $1,25 por millón de tokens de salida, frente a $0,15 y $0,50 del modelo base del que deriva. Nada del modelo cambió; lo que cambió es dónde se ejecuta y cuán rápido se promete que se ejecutará allí. Entender ese emparejamiento es todo el quid aquí, porque significa que esto no es una comparación entre dos niveles de capacidad — es una comparación entre un nivel de precio y un nivel de servicio, y Haiku 5.5 cae en medio de ese debate desde una dirección completamente distinta.
Dos modelos, cuatro precios, un umbral
Alinea las cuatro tarjetas de tarifas relevantes y la forma de la decisión se vuelve más clara que la de cualquier par individual:
• Claude Haiku 5.5, menos de 100,000 tokens — $0.10 de entrada, $0.50 de salida por millón (lista de Anthropic)
• Claude Haiku 5.5, más de 100.000 tokens — 0,50 $ de entrada, 2,50 $ de salida por millón (lista de Anthropic)
• GLM-5.3-Flash — $0.15 de entrada, $0.50 de salida por millón (lista de Z.ai)
• GLM-5.3-FlashX — $0.37 de entrada, $1.25 de salida por millón (lista de Z.ai)
• Contexto — 1 millón de tokens en los cuatro (publicado por el proveedor)
• Pesos abiertos — GLM-5.3-Flash y FlashX heredan los pesos con licencia MIT del modelo base; Claude Haiku 5.5 es cerrado (publicado por el proveedor)
• Puntuación independiente — GLM-5.3-Flash obtuvo 41.807 en el Artificial Analysis Intelligence Index; Claude Haiku 5.5 obtuvo 43.395 (Artificial Analysis)
Lo primero que hay que notar es que el precio de FlashX se sitúa casi exactamente sobre el nivel de contexto largo de Claude Haiku 5.5: $0.37 frente a $0.50 en entrada, $1.25 frente a $2.50 en salida. Eso no es una coincidencia del mercado; es lo que cuesta un nivel de servicio premium cuando el modelo subyacente es de peso medio y el proveedor cobra por rendimiento en lugar de por capacidad. Lo segundo es que GLM-5.3-FlashX es la versión cara de un modelo del que el nuevo Haiku de Anthropic es más barato en contexto corto y comparable en contexto largo. Lo tercero es que las cuatro cifras están dentro de un factor de cinco entre sí, lo que es una banda mucho más estrecha de lo que implica el planteamiento de "modelo barato frente a modelo caro" de la mayoría de las comparaciones directas.

Qué es FlashX realmente
GLM-5.3-FlashX no es un modelo nuevo. Es GLM-5.3-Flash servido en la infraestructura propia de Z.ai, anunciado como capaz de alcanzar hasta 200 tokens de salida por segundo en su punto máximo frente a la tasa medida del modelo base, y con un precio de 2,5 veces la tarifa de lista del modelo base. La propuesta de Z.ai es sencilla: las mismas respuestas, más de ellas por segundo, y pagas por el servicio en lugar de por los pesos. Para una carga de trabajo limitada por la capacidad de procesamiento —clasificación por lotes, extracción de gran volumen, cualquier cosa en la que la latencia sea la restricción y no el costo—, eso es algo coherente que vender y algo coherente que comprar.
Lo que no es es una mejora de capacidades, y el precio lo refleja con honestidad: si FlashX fuera un modelo mejor, Z.ai no podría cobrar por los pesos del modelo base por separado. El 2,5x es un recargo por servicio. Que merezca la pena pagarlo es una cuestión sobre el cuello de botella de tu carga de trabajo, y tiene una respuesta distinta para un pipeline limitado por latencia que para uno limitado por coste.
Artificial Analysis no tiene una página separada para FlashX en el momento de escribir esto, lo cual vale la pena decir con claridad en lugar de disimularlo: la cifra independiente que la tabla publica para GLM-5.3-Flash — 41,807 en el Intelligence Index, 52,14 tokens de salida por segundo medidos, 0,328 en Terminal-Bench Hard — es una cifra para el modelo base, no para la versión servida a 2,5x. La propia afirmación del proveedor sobre el rendimiento de FlashX es una cifra máxima y declarada por el proveedor. Ninguna entidad independiente ha publicado el rendimiento de FlashX en sí, así que cualquier comparación de la velocidad medida de Haiku 5.5 frente a la de FlashX es una comparación contra un número que Z.ai proporcionó sobre su propio servicio.
El multiplicador de 2,5x de Z.ai no es lo único que hace que FlashX sea caro en relación con su base. Como los pesos base tienen licencia MIT y los alojan terceros, una carga de trabajo que de verdad necesita más rendimiento del que proporciona el endpoint de un solo proveedor a menudo puede obtenerlo repartiéndola entre varios proveedores de los mismos pesos a un precio igual o cercano al base, en lugar de pagar el nivel premium de un solo proveedor. Esa es una alternativa real contra la que compite la tarifa de FlashX, y Z.ai lo sabe — que es, presumiblemente, la razón por la que su propuesta se apoya en el rendimiento máximo en lugar de en la singularidad.

Donde Haiku 5.5 y FlashX se separan
Pon a los dos frente a frente en las dimensiones que determinan una carga de trabajo real y la división es lo bastante clara como para elegir según ella:
• Precio con contexto inferior a 100K — Haiku 5.5 $0.10 / $0.50 frente a FlashX $0.37 / $1.25; Haiku gana en ambos frentes
• Precio para contexto superior a 100K — Haiku 5.5 $0.50 / $2.50 vs FlashX $0.37 / $1.25; FlashX gana en ambos lados
• Rendimiento — pico del proveedor de 200 tok/s para FlashX frente al servicio publicado por Anthropic para Haiku 5.5, que no anuncia un pico de ese tipo
• Índice independiente — Haiku 5.5 43.395 vs GLM-5.3-Flash 41.807 (Artificial Analysis; no hay una cifra independiente para el propio FlashX)
• Pesos — FlashX hereda pesos abiertos con licencia MIT; Haiku 5.5 es cerrado y solo disponible vía API
• Autoalojamiento — posible para FlashX mediante los pesos abiertos; no es posible para Haiku 5.5
• Conjunto de funciones de herramientas/agentes — dial de esfuerzo ajustable en Haiku 5.5, ausente en la línea GLM Flash
La celda interesante es la segunda. Claude Haiku 5.5 es un modelo cinco veces más barato que GLM-5.3-FlashX en solicitudes cortas y ligeramente más caro que este en las largas, porque la lista de precios de Haiku da un salto de 5x a los 100.000 tokens, mientras que FlashX cobra una tarifa plana. Si tu tráfico es mayormente corto, Haiku es la elección obvia solo por precio. Si es mayormente largo, FlashX no compite en absoluto con el precio del tramo corto de Haiku —compite con el tramo largo de Haiku, y gana esa comparación por aproximadamente un tercio.
La comparación de capacidades es más reñida de lo que a ninguno de los dos proveedores le gustaría. 41,807 frente a 43,395 en el mismo índice independiente representa una diferencia de menos del cuatro por ciento, muy dentro del ruido de la mayoría de las evaluaciones a nivel de aplicación y demasiado pequeña para justificar una elección por sí sola. Ninguno de los dos modelos domina al otro en razonamiento general; la decisión se toma en función de la tarifa y del rendimiento, no de cuál es más inteligente.

La diferencia de licencia es una diferencia real
Que FlashX sea de pesos abiertos desde su origen importa más que la diferencia de precio en un eje: puede autoalojarse y cualquiera puede servirlo. Claude Haiku 5.5 no puede ninguna de las dos cosas. Para un equipo con un requisito de cumplimiento de que la inferencia se realice en su propio hardware, o con suficiente volumen estable como para que amortizar una GPU sea más barato que pagar por token, la línea GLM es la única de las dos que responde siquiera a la pregunta. Para todos los demás —la mayoría, que quiere un modelo detrás de una API y preferiría no ejecutar la capa de servicio—, la licencia es una nota al pie y el precio es el argumento.
También significa que los dos modelos tienen modos de fallo distintos cuando un proveedor tiene un mal día. Un modelo cerrado servido únicamente por su proveedor y los socios de nube de ese proveedor se cae cuando estos se caen. Un modelo abierto con varios hosts independientes puede conmutarse por error entre ellos, siempre que haya algo que realice esa conmutación por error. Es una diferencia operativa real y es el tipo de cosa que solo aparece el día en que de verdad importa.
Enrutar ambos sin un segundo contrato
Si la decisión anterior no se reduce a un único ganador para tu tráfico —lo cual normalmente no ocurre, porque los dos modelos se superan mutuamente en distintas mitades de la lista de precios—, la pregunta práctica es cómo ejecutar ambos sin mantener dos integraciones. OrcaRouter sirve z-ai/glm-5.3-flash a $0.15 y $0.50 por millón al precio de lista del proveedor, junto con qwen/qwen3.8-flash y el resto de un catálogo de más de 200 modelos, con una sola clave y una sola factura. Un cambio de precio de Anthropic en Claude Haiku 5.5, o un cambio de Z.ai en la línea Flash, se transfiere sin margen de beneficio el mismo día en lugar de quedarse atrás respecto a la tarifa propia de un revendedor, por lo que las cifras anteriores siguen siendo las cifras que realmente pagas.
No servimos Claude Haiku 5.5, y no servimos GLM-5.3-FlashX — ninguno de los dos está en nuestro catálogo; para esos, llama directamente a Anthropic y a Z.ai. Lo que sí servimos es GLM-5.3-Flash, el modelo base que hay por debajo de FlashX, que es la elección correcta para las muchas cargas de trabajo en las que el sobrecoste de servicio de 2,5x compra un rendimiento que nadie pidió. Cuando una ruta de producción depende de verdad de uno de los dos modelos que no alojamos, nuestro failover es el mecanismo para probarlo sin apostar toda la ruta a ello: apunta la solicitud a ese modelo, mantén un modelo que funcione como respaldo y deja que la capa de enrutamiento decida cuál responde.
¿Cuál elegir?
Por debajo de 100.000 tokens por solicitud, Claude Haiku 5.5 gana en precio y se equipara a FlashX en capacidad lo bastante como para que la elección no sea reñida. Por encima de 100.000 tokens, GLM-5.3-FlashX es más barato que el nivel de contexto largo de Haiku 5.5 y es el modelo al que hay que recurrir si el tamaño de la solicitud es una propiedad de la tarea y no una elección —aunque el GLM-5.3-Flash base es aún más barato, y la única razón para pagar 2,5x es si necesitas específicamente el rendimiento anunciado de FlashX.
El enfoque que hay que descartar es que uno de estos sea la opción económica y el otro, la opción de rendimiento. Ambos son modelos de precio medio con tarifas planas y bien publicadas, y la variable interesante no es cuál es mejor, sino para cuál mitad de tu tráfico resulta más barato cada uno. Obtén primero tu distribución de tamaños de solicitud; la comparación de precios en dos columnas que aparece arriba te dirá el resto.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
