Qwen 3.8 vs GLM-5.2: El primer benchmark donde realmente se superponen
Guides & Insights

Qwen 3.8 vs GLM-5.2: El primer benchmark donde realmente se superponen

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Estos dos modelos son la expresión más clara de apuestas opuestas en la IA china de peso abierto. El modelo de Zhipu, GLM-5.2, es ágil y probado: 753B parámetros totales con solo 40B activos, un índice de inteligencia de Artificial Analysis auditado de 51, pesos descargables desde junio de 2026, y un precio publicado de $0.95 / $3.00. El modelo de Alibaba, Qwen3.8-Max, es la apuesta maximalista: ~2.4T parámetros, un recuento de activos no revelado y — hasta hace poco — ningún número en absoluto.

La disponibilidad general el 3 de agosto de 2026 dio a este enfrentamiento algo que ningún otro artículo de esta serie tiene: un benchmark en el que ambos modelos tienen una puntuación. Alibaba informa Terminal-Bench 2.1 en 86.6; Artificial Analysis tiene GLM-5.2 auditado en 82.7 en esa misma prueba. Por primera vez, la afirmación de Qwen puede colocarse junto a un número de competidor medido de forma independiente en un terreno idéntico — con la importante salvedad de que solo uno de los dos fue producido por un árbitro.

Una nota para los desarrolladores: la forma más rápida de resolver esto es ejecutar ambos en tus propios prompts. OrcaRouter ofrece más de 200 modelos detrás de un endpoint compatible con OpenAI, para que puedas enfrentar a Qwen 3.8 Max contra GLM-5.2 en la misma tarea sin tener que configurar dos SDKs.

Veredicto TL;DR. En el único benchmark compartido, Qwen afirma una ventaja de 3.9 puntos en Terminal-Bench 2.1 (86.6 vs 82.7) — un resultado real si se replica, aunque la cifra de Qwen es autodeclarada y la de GLM está auditada. En todo lo demás, GLM-5.2 mantiene las ventajas prácticas: es ~2× más barato a $0.95 / $3.00 frente a los $2 / $6 de Qwen, sus pesos son descargables hoy, sus 40B de parámetros activos lo hacen realmente desplegable, y tiene una puntuación de índice independiente de 51 donde Qwen no tiene ninguna. Qwen responde con un contexto de tarifa plana de 1M de tokens, multimodalidad nativa de la que GLM carece, y un techo de potencial más alto. Lo ágil y probado todavía vence a lo grande y no verificado para producción — pero la brecha se redujo el 3 de agosto.

Conclusiones clave

Primera superposición directa de benchmarks en la serie: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (reportado por Alibaba) frente a GLM-5.2 82.7 (Artificial Analysis, auditado). Qwen lidera por 3.9 puntos, pero las dos cifras no son igualmente fiables.

GLM-5.2 cuesta aproximadamente la mitad del precio: $0.95 / $3.00 por 1M (AA combinado ~$0.90) frente a los de Qwen3.8-Max$2 / $6.

Los parámetros activos son la verdadera historia de la arquitectura: GLM-5.2 ejecuta 40B activos de 753B en total. Alibaba tiene aún sin revelar el recuento de parámetros activos de Qwen, lo que hace que su costo de inferencia sea imposible de modelar.

Los pesos de GLM se pueden descargar hoy; los de Qwen se prometen dentro de la semana, sin licencia ni repositorio todavía.

GLM-5.2 tiene un índice auditado de 51. Qwen3.8-Max permanece sin puntuar — aunque su predecesor Qwen3.7-Max obtuvo 46, por debajo de GLM.

Las ofertas únicas de Qwen: una ventana de 1M de tokens con tarifa plana sin recargo por prompts largos, más entrada nativa de texto/imagen/video y OmniDocBench 1.5 92.1. GLM-5.2 está centrado en texto.

Nota de precisión: todas las cifras de calidad de Qwen3.8-Max son reportadas por Alibaba y no verificadas por terceros. Las cifras de GLM-5.2 provienen de Artificial Analysis. Comparar una puntuación autodeclarada con una auditada en el mismo benchmark es informativo pero no concluyente: los entornos de evaluación del proveedor y los del evaluador difieren. El precio de Qwen es la tarifa GA y sustituye al descuento de vista previa de julio.

Las especificaciones y el precio, lado a lado

Aquí están los datos concretos, cada cifra atribuida a su fuente.

• Fabricante / estado — Qwen3.8-Max: Alibaba; GA (3 de agosto de 2026); GLM-5.2: Zhipu; lanzado en junio de 2026

• Arquitectura — Qwen3.8-Max: ~2.4T total, MoE dispersa; GLM-5.2: 753B total, MoE dispersa (Artificial Analysis)

• Parámetros activos — Qwen3.8-Max: Aún no revelados por Alibaba; GLM-5.2: 40B activos (Artificial Analysis)

• Ventana de contexto — Qwen3.8-Max: 1M tokens, tarifa plana (983,616 con razonamiento; salida máxima 131,072); GLM-5.2: 1M tokens (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (reportado por Alibaba); GLM-5.2: 82.7 (Artificial Analysis, auditado)

• AA Intelligence Index — Qwen3.8-Max: Aún sin puntuar; GLM-5.2: 51 (Artificial Analysis)

• Otras puntuaciones reportadas por el proveedor — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (reportado por Alibaba); GLM-5.2: la posición es medida por terceros

• Modalidades — Qwen3.8-Max: Texto, imagen y video de entrada → texto de salida; GLM-5.2: Centrado en texto

• Precios (entrada / salida) — Qwen3.8-Max: $2.00 / $6.00 por 1M, fijo; entrada en caché $0.25; GLM-5.2: $0.95 / $3.00 por 1M (AA combinado ~$0.90)

• Pesos abiertos — Qwen3.8-Max: Prometido esta semana (sin licencia aún); GLM-5.2: Sí — descargable hoy

Dos cosas enmarcan esta comparación, y la primera es el dato más útil de toda la serie.

Primero, la coincidencia en Terminal-Bench es genuinamente informativa. Terminal-Bench 2.1 mide si un modelo puede operar un shell real hasta completar la tarea — ejecutar comandos, leer la salida, recuperarse de errores. Es el proxy disponible más cercano a «puede esto funcionar como un agente de codificación en lugar de un sugeridor de código», y es el benchmark que ambos proveedores eligieron reportar. El 86,6 de Qwen frente al 82,7 auditado de GLM es una ventaja de 3,9 puntos a favor de Qwen.

La salvedad importa, pero no debe exagerarse. Los entornos de evaluación de proveedores y evaluadores difieren en scaffolding, política de reintentos y construcción de prompts, y esas decisiones pueden hacer variar una puntuación de Terminal-Bench en más de cuatro puntos. Por tanto, esto no es prueba de que Qwen sea el mejor modelo agéntico. Lo que sí establece es que la afirmación autoinformada de Qwen se sitúa en la misma banda competitiva que la de un modelo de frontera de pesos abiertos auditado, en lugar de en un territorio poco plausible. Esa es una posición significativamente más sólida que «sin puntuar».

Segundo, la comparación de arquitectura es donde GLM gana silenciosamente. GLM-5.2 activa 40B parámetros de 753B. Ese único número te dice su costo de servicio, su perfil de latencia y que un equipo bien equipado puede ejecutarlo. Alibaba todavía no ha publicado el recuento de parámetros activos de Qwen — lo que significa que, por todo lo que transmite el titular de 2.4T, nadie fuera de Alibaba puede estimar cuánto cuesta servir a Qwen3.8-Max o cómo se comportaría en un despliegue propio. En una comparación de Mixture-of-Experts, eso no es una nota al pie; es el número faltante más importante.

Ágil y probado vs grande y sin verificar

El argumento de GLM-5.2 se basa en una postura de ingeniería coherente: hacer más con menos, publicar las cifras y distribuir los pesos. Un modelo con 40B activos es barato de servir, rápido por construcción y desplegable por un equipo con un presupuesto de GPU serio pero no absurdo. Su índice auditado de 51 y su Terminal-Bench auditado de 82,7 significan que el comprador no está aceptando nada a ciegas. Y a $0.95 / $3.00, cuesta aproximadamente la mitad que Qwen.

El caso de Qwen3.8-Max es la apuesta opuesta: construir el modelo más grande que puedas y dejar que la capacidad justifique el costo. GA hizo que ese caso fuera mucho más sólido de lo que era, porque por fin hay cifras asociadas — GPQA Diamond 92.6 en ciencia de posgrado, OSWorld-Verified 86.1 en operación de GUI, FrontierSWE 73.5 frente a los 40.7 de un predecesor, y el Terminal-Bench 86.6 mencionado anteriormente. Son cifras de nivel frontera, y el casi duplicado en FrontierSWE es el tipo de salto generacional difícil de falsear por completo.

Pero persisten dos brechas, y son las mismas dos que importaron en julio. No hay ninguna puntuación independiente — Artificial Analysis y LMArena siguen sin puntuación en Qwen3.8-Max, por lo que toda afirmación de calidad es de Alibaba. Y no hay ninguna licencia, por lo que la promesa de pesos abiertos aún no puede evaluarse comercialmente.

El ancla histórica juega en contra de Qwen aquí más que en la mayoría de los enfrentamientos: el predecesor Qwen3.7-Max obtuvo 46 en el índice AA, por debajo de los 51 de GLM-5.2. Así que la afirmación implícita de Alibaba no es solo que Qwen3.8-Max es bueno, sino que saltó de estar por debajo de GLM a muy por encima en una sola generación. La mejora en FrontierSWE le da cierta credibilidad. Una puntuación independiente lo resolvería.

Coste en la práctica: dónde aterriza 2×

Tome un pipeline de codificación agéntico: 180.000 tokens de contexto del repositorio, 10.000 tokens de salida por ejecución.

GLM-5.2: 0,18M × $0,95 = $0,171, más 0,01M × $3,00 = $0,03. ≈ $0,20 por ejecución.

Qwen3.8-Max: 0.18M × $2 = $0.36, más 0.01M × $6 = $0.06. ≈ $0.42 por ejecución.

• A 3.000 ejecuciones/día: GLM ≈ $603/día; Qwen ≈ $1.260/día — aproximadamente $20.000/mes de diferencia.

• Con la entrada en caché de Qwen a $0.25/1M en un repositorio estable, su ejecución se reduce a ≈ $0.11, lo que de hecho es inferior al costo sin caché de GLM.

Esa última línea es lo más útil en la práctica de esta comparación. El precio anunciado de Qwen es el doble que el de GLM, pero su tasa de acierto de caché de $0.25 por 1M es lo bastante agresiva como para que un pipeline bien cacheado pueda cambiar el orden. Si tu agente relee un contexto mayormente sin cambios en cada turno — lo cual describe a la mayoría de los agentes de codificación — Qwen puede ser la opción más barata en la práctica a pesar de la peor tarifa. Los equipos que no configuren el caché pagarán el doble por nada.

Ambos modelos facturan los tokens de razonamiento como salida, por lo que las configuraciones con mucho razonamiento cuestan más que estas estimaciones en ambos casos.

Desplegabilidad: el eje que GLM domina

Ambos son modelos chinos de arquitectura MoE con pesos abiertos y soporte declarado de contexto de 1M de tokens, lo que convierte la capacidad de despliegue en la división práctica más marcada.

Los pesos de GLM-5.2 han estado disponibles para descargar desde junio, y con 40B activos es un objetivo realista de autoalojamiento — cuantificable, servible en un número razonable de GPUs y ya probado por la comunidad.

Los pesos de Qwen3.8-Max están prometidos para esta semana, pero el modelo insignia no es un objetivo realista para nadie: aproximadamente 1,2 TB en 4 bits frente a unos 141 GB por H200 implica ocho o más aceleradores de gama alta, y el número no revelado de parámetros activos hace imposible predecir el rendimiento resultante. Añade la licencia que falta y el autoalojamiento del modelo insignia no es, por ahora, un plan.

El simultáneamente anunciado Qwen3.8-27B es la respuesta genuina de Alibaba en este eje. También es de pesos abiertos y, según se informa, corre en unos 17 GB de VRAM — una sola tarjeta de gama alta, muy por debajo de la huella de GLM-5.2 —. Compite directamente en implementabilidad. Si tu interés en cualquiera de los dos modelos es ejecutarlo tú mismo, la comparación entre el Qwen 27B y el GLM-5.2 es la que de verdad importará, y es una lucha mucho más reñida que 2.4T frente a 753B.

Preguntas frecuentes

¿Es Qwen 3.8 mejor que GLM-5.2?

En el único benchmark que comparten, Qwen afirma una ventaja: Terminal-Bench 2.1 86.6 frente al 82.7 auditado de GLM. Pero la cifra de Qwen es autodeclarada y la de GLM fue medida por Artificial Analysis, y las diferencias en el entorno de evaluación pueden superar un margen de cuatro puntos. GLM-5.2 también ostenta un índice auditado de 51, donde Qwen no tiene puntuación independiente alguna. GLM es la opción más segura; Qwen tiene el techo no verificado más alto.

¿Cómo se comparan en Terminal-Bench 2.1?

Qwen3.8-Max reporta 86.6; Artificial Analysis midió GLM-5.2 en 82.7. Eso es una ventaja nominal de 3.9 puntos para Qwen y la primera superposición entre ellos en el mismo punto de referencia. Interprétese como evidencia de que Qwen es competitivo en esa banda, más que como prueba de que va por delante, ya que solo el número de GLM se produjo de forma independiente.

¿Cuál es más barato?

GLM-5.2 en la tarifa — $0.95 / $3.00 por 1M (AA combinado ~$0.90) frente a los $2 / $6 de Qwen, aproximadamente la mitad. Pero la entrada en caché de Qwen a $0.25 por 1M es lo suficientemente agresiva como para que un pipeline con mucha caché pueda terminar siendo más barato en Qwen que en GLM sin caché.

¿Cuántos parámetros activos utiliza Qwen 3.8 Max?

Alibaba nunca ha publicado la cifra, ni siquiera en su disponibilidad general. Esa es la cifra que determina el costo de servicio y la latencia en un modelo de mezcla de expertos, por lo que su ausencia es un vacío real. GLM-5.2, en contraste, está documentado con 40B activos de un total de 753B.

¿Cuál puedo realmente autoalojar?

GLM-5.2 hoy: los pesos ya están disponibles y con 40B activos lo hace manejable. Los pesos de Qwen3.8-Max se prometen para esta semana, pero el buque insignia necesita ocho o más GPUs de clase H200 con ~1.2TB en 4-bit, sin licencia publicada todavía. El Qwen3.8-27B, anunciado simultáneamente y con ~17GB de VRAM según lo reportado, es la opción de Qwen desplegable y se ajusta mejor al nicho de GLM.

¿Qwen 3.8 Max salió de la vista previa?

Sí, el 3 de agosto de 2026, con una tarjeta de tarifas publicada y un endpoint compatible con OpenAI y DashScope. La campaña de créditos Qoder con 90% de descuento de julio ya no describe cómo se vende.

¿Qué ofrece Qwen que GLM-5.2 no ofrece?

Multimodalidad nativa: entrada de imagen y video, con un 92.1 autoinformado en OmniDocBench para el análisis de documentos, y un contexto de 1M de tokens facturado a una tarifa plana sin recargo por prompts largos. GLM-5.2 está enfocado en texto, por lo que para pipelines de documentos, capturas de pantalla o video, Qwen no compite tanto con él sino que hace algo diferente.

En resumen

Qwen 3.8 vs GLM-5.2 es el enfrentamiento donde la disponibilidad general aportó la información más genuinamente nueva. Por primera vez, Qwen tiene una puntuación en un benchmark que un evaluador independiente también ha ejecutado, y se sitúa por encima de GLM: Terminal-Bench 2.1 86.6 frente a 82.7. Eso mueve a Qwen de "sin puntuación" a "plausiblemente competitivo en terreno medido", lo cual es un progreso real incluso teniendo en cuenta la salvedad autoinformada.

Pero GLM-5.2 conserva la corona en la práctica, y lo hace gracias a fortalezas poco glamurosas: la mitad del precio, un índice auditado de 51, 40B de parámetros activos que hacen predecible su economía y alcanzable su despliegue, y pesos que puedes descargar ahora mismo. Las respuestas de Qwen — un contexto de un millón de tokens a tarifa plana, multimodalidad nativa y un techo más alto — son significativas pero condicionales, y sus dos carencias de julio siguen sin cambios: sin puntuación independiente y sin licencia. Vigila tres cosas: la primera puntuación independiente del Intelligence Index para Qwen3.8-Max, si algún evaluador reproduce esa cifra de 86.6 en Terminal-Bench, y el lanzamiento de Qwen3.8-27B, que es donde estas dos filosofías chocarán de verdad. Hasta entonces, GLM-5.2 es lo que despliegas y Qwen3.8-Max es lo que evalúas — con la caché activada.

Comparados en este artículo3

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario