Una tarjeta principal titulada 'Empate exacto en 0.32828' con Claude Haiku 5.5 y GLM 5.3 Flash a cada lado del número, una fila que dice Terminal Bench 4.0 0.32828, una fila de Índice que dice 43.40 frente a 41.81, y el subtítulo 'Mismo número, diferentes máquinas'.
Guides & Insights

Claude Haiku 5.5 vs GLM 5.3 Flash: empate absoluto en el benchmark que ambos proveedores citan

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.

También es el número equivocado sobre el que decidir. Los dos modelos se separan drásticamente en todo lo demás, y el patrón de esa separación es lo bastante inusual como para que debería cambiar la forma en que lees las afirmaciones destacadas de cualquiera de los dos proveedores. Uno de ellos gana el índice compuesto y la cifra de costo por tarea. El otro gana casi todo lo que se parece a un despliegue real.

No están separados por capacidad. Están separados por forma.

Empieza con el único número que dice «estos son de la misma clase de modelo».

• SciCode — 0.5498 para Claude Haiku 5.5 frente a 0.5162 para GLM 5.3 Flash. Dos puntos para Anthropic, en un benchmark donde dos puntos son ruido.

• Terminal Bench 4.0 — 0,32828 frente a 0,32828. Un empate, exactamente.

• Ventana de contexto — un millón de tokens para ambos.

• Precio de salida, primer tramo — $0.50 por millón de tokens para ambos.

Cuatro filas, cuatro coincidencias casi exactas. Si te detuvieras aquí, concluirías que estos modelos son intercambiables y elegirías por precio. Esa conclusión sería errónea, y el siguiente conjunto de filas es la razón.

Donde divergen, la dirección es consistente

Las filas que sí los separan no están dispersas. Se agrupan en dos grupos, y cada modelo posee uno de los grupos de manera absoluta.

El grupo agéntico pertenece a GLM 5.3 Flash. La puntuación parcial de AutomationBench es de 0,6037 para GLM 5.3 Flash frente a 0,3541 para Claude Haiku 5.5 — una diferencia de 25 puntos, la mayor diferencia individual entre estos dos modelos en cualquier medición compartida. Tau-Bench Banking registra 0,4722 para GLM 5.3 Flash; Claude Haiku 5.5 no tiene ninguna cifra publicada en esa fila. GPQA registra 0,9121 para GLM 5.3 Flash; de nuevo, no hay ninguna cifra de Anthropic con la que comparar. En las medidas sobre si un modelo puede mantener cohesionada una tarea de varios pasos y usar herramientas de forma fiable dentro de un dominio estructurado, el modelo de Z.ai va por delante por un margen que empequeñece la diferencia del índice compuesto que va en la dirección opuesta.

El grupo composite y de costo pertenece a Claude Haiku 5.5. El Índice de Inteligencia de Artificial Analysis v4.3.2 marca 43,40 frente a 41,81 — 1,59 puntos, y la cifra que cita todo resumen de este enfrentamiento. El costo por tarea del Índice finalizada marca $0,21 frente a $0,25. El tiempo de reloj real por tarea del Índice marca 424,6 segundos frente a 1.035,4 segundos: el modelo de Anthropic termina en menos de la mitad del tiempo.

Esa es la forma de la elección. Claude Haiku 5.5 es más rápido, más barato por trabajo terminado y está más alto en el agregado. GLM 5.3 Flash es más fiable en la clase específica de trabajo para la que se compran los modelos baratos.

A two-column scoreboard titled 'Claude Haiku 5.5 vs GLM 5.3 Flash - the scoreboard' with rows Terminal Bench 4.0 0.32828 against 0.32828, SciCode 0.5498 against 0.5162, Humanity's Last Exam 0.4439 against 0.3985, AutomationBench 0.3541 against 0.6037, Index v4.3.2 43.40 against 41.81 and cost per task $0.21 against $0.25, footed 'Both figures per Artificial Analysis v4.3.2; Terminal Bench 4.0 is an exact tie.'

¿Cuál es el que hay que creer?

Ninguno de los dos, por sí solo — y el desacuerdo mismo es la información.

Un Índice de Inteligencia es una combinación ponderada de las categorías de razonamiento, ciencia, programación y agénticas. Está diseñado para responder "a grandes rasgos, qué tan capaz es este modelo" en un solo número, y hace bien ese trabajo. Lo que no puede hacer es decirte si una ventaja de 1.59 puntos proviene de las categorías en las que vive tu carga de trabajo o de aquellas que nunca toca. Aquí, la ventaja proviene sustancialmente de filas como SciCode y Humanity's Last Exam — 0.5498 contra 0.5162, y 0.4439 contra 0.3985 —, mientras que un déficit de 25 puntos recae sobre AutomationBench con el signo opuesto.

Un equipo que construye un asistente de programación en un bucle de terminal notará la ventaja de SciCode. Un equipo que construye un agente que tiene que completar un flujo de trabajo bancario de principio a fin notará la brecha de AutomationBench, y la notará todos los días. Los dos equipos están mirando el mismo índice y deberían llegar a conclusiones opuestas.

Lo práctico es leer el compuesto como un filtro en lugar de una clasificación. Si dos modelos están dentro de unos dos puntos de índice, el compuesto te ha dicho que están en la misma banda y no te ha dicho nada sobre cuál elegir. En ese punto, las únicas filas que vale la pena leer son las que coinciden con tu carga de trabajo — y si un proveedor no ha publicado una fila que necesitas, la ausencia es en sí misma un dato, no un vacío que deba llenarse con suposiciones.

La línea del tokenizador que nadie pone en la tabla comparativa

La propia documentación de Anthropic incluye una frase que cambia toda comparación de precios en la que intervenga Claude Haiku 5.5, y es fácil pasarla por alto. El modelo utiliza el tokenizador más reciente que comparte con Claude 4.7 y posteriores, el cual cuenta el mismo texto como aproximadamente un 30 % más de tokens que el modelo al que reemplaza.

Contrasta eso con la tarifa y la aritmética resulta menos halagüeña de lo que sugiere el precio anunciado. La tarifa de entrada de Claude Haiku 5.5 es de $0.10 por millón de tokens frente a los $0.15 de GLM 5.3 Flash —una ventaja de 1,5×. Si se necesitan un 30 % más de tokens para el mismo prompt, la ventaja efectiva en un texto idéntico se reduce considerablemente, aunque no desaparece. Las tarifas de salida son idénticas, a $0.50 en el primer nivel, así que el efecto del tokenizador se aplica sin nada que lo compense ahí.

El resultado medido es la versión honesta de la afirmación: según las propias cuentas de Artificial Analysis, Claude Haiku 5.5 generó 162.164 tokens de salida por tarea de Index frente a 68.673 de GLM 5.3 Flash —2,4 veces más—, y aun así quedó en $0,21 por tarea finalizada frente a $0,25. La ventaja de tarifa sobrevive a la verbosidad, y lo que queda de ella es menor de lo que indica la lista de tarifas.

Solo uno de estos dos tiene sus tarifas indicadas como planas. El precio de Claude Haiku 5.5 aumenta a partir de 100,000 tokens de prompt a $0.50 de entrada y $2.50 de salida; GLM 5.3 Flash no tiene un umbral equivalente publicado. Para la mayor parte del tráfico de chat y asistencia de código, ese escalón nunca se aplica. Para el trabajo con agentes de documentos largos o de contexto amplio, se aplica constantemente, y en ese punto la comparación se invierte muy por encima de lo que sugieren los números de primer nivel.

A capture of Anthropic's models-overview documentation table headed 'Lifecycle and reference', listing Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 with context windows, maximum outputs, prices per million tokens, latency and default effort, and showing Claude Haiku 5.5 as 'This model' at 1M context, 128K maximum output and 'From $0.10/$0.50'.

La línea que lo decide antes que cualquier número

Todo lo anterior asume que puedes elegir libremente entre estos dos modelos. Una gran parte de los equipos no puede, y la razón es una sola fila de la ficha de especificaciones que el debate sobre los benchmarks tiende a enterrar.

GLM 5.3 Flash es de pesos abiertos, publicado bajo la licencia MIT, con 320 mil millones de parámetros totales y 18 mil millones activos. Se puede descargar, autoalojar, ajustar finamente, cuantizar, fijar a una versión y ejecutar dentro de un entorno de inquilino que controlas. Claude Haiku 5.5 es propietario y solo API, sin recuento de parámetros publicado, sin licencia y sin repositorio.

Si tu documento de requisitos dice que el modelo debe ejecutarse en tu propio hardware, o que un checkpoint específico debe seguir siendo invocable durante los próximos tres años, esta comparación ya está decidida antes de que se lea la columna de precios. Eso no es un tecnicismo. Es la razón más común por la que los equipos terminan usando un modelo de pesos abiertos de gama media, y es la razón por la que una ventaja de 25 puntos en AutomationBench no es lo único que inclina la balanza hacia Z.ai.

También funciona en sentido contrario, y se aplica la misma honestidad. Anthropic publica un compromiso de retirada para Claude Haiku 5.5 de no antes de octubre de 2027, y mantiene el modelo en una API propia con una tarjeta de sistema y un conjunto de evaluación documentado. Una versión de pesos abiertos no es automáticamente más duradera: heredas la carga operativa junto con los pesos, y un archivo de licencia no es un contrato de soporte. Cuál de esas dos opciones quieres es una cuestión sobre tu equipo, no sobre los modelos.

Ambos lados en una misma tecla, si quieres zanjarlo empíricamente

GLM 5.3 Flash está en el catálogo de OrcaRouter al precio de lista de Z.ai con un 0% de recargo, repercutido en lugar de combinado, por lo que la tarifa indicada arriba es la tarifa que aparece en la factura y cualquier cambio que haga Z.ai llega a nuestro lado el mismo día. Claude Haiku 5.5 no está en nuestro catálogo —se puede acceder a él a través de la propia API de Anthropic— y es mejor decirlo que dejarlo implícito.

Lo que el catálogo sí facilita es la forma de prueba que este enfrentamiento realmente exige. La discrepancia entre el índice compuesto y las filas agénticas es una hipótesis sobre tu carga de trabajo, y la única manera de resolverlo es ejecutar ambos modelos sobre la misma traza. Con GLM 5.3 Flash en la ruta y una pata de Anthropic al otro lado de la misma puerta de enlace, eso se convierte en un cambio de configuración en lugar de dos integraciones — una API para más de 200 modelos, una clave, conmutación por error automática por debajo, y el DSL de enrutamiento cuando quieras dividir el tráfico por clase de tarea y leer el costo en una sola factura.

A capture of the OrcaRouter model page for GLM 5.3 Flash under z-ai/glm-5.3-flash, showing a 1M-token context window, 128K maximum output, text, image and video input, benchmarks published by Z.ai on 2026-08-26, the description of its 320B total and 18B active parameters, and a price strip of $0.15 input, $0.50 output and $0.030 cache read per million tokens.

El veredicto, expresado de la manera en que los números lo respaldan.

Si tu trabajo consiste en texto que entra y texto que sale, tus prompts se mantienen dentro del primer nivel de precios y pagas por token para un volumen real, Claude Haiku 5.5 es el mejor modelo aquí: mayor compuesto, más barato por tarea finalizada y más del doble de rápido por tarea. El titular del benchmark de terminal es un empate y no debería usarse para decidir nada.

Si tu trabajo consiste en un agente que tiene que completar un flujo de trabajo de varios pasos sin supervisión, GLM 5.3 Flash va por delante en el único benchmark compartido que mide exactamente eso, por 25 puntos, y es el más barato de los dos a la hora de modificar, porque puedes conservar los pesos.

El empate en 0.32828 es la imagen correcta para este par, pero no porque los modelos sean iguales. Es la única fila en la que dos modelos que no tienen casi nada más en común coinciden en la misma cifra, y tratar esa cifra como un resumen de la comparación es la forma en que se toma una decisión de adquisición basándose en el número menos informativo de la tabla.