Una tarjeta de título generada que compara Xiaomi MiMo-V2.6-Pro y GLM-5.2. La tarjeta izquierda muestra Intelligence Index v4.3.2: 46, 42B activos por token, $0.18 combinado por 1M y GA - actual; la tarjeta derecha muestra Intelligence Index v4.3.2: 34, ~40B activos por token, $0.90 combinado por 1M y Obsoleta - GLM-5.3 lanzado. Un pie de página dice: Ambas puntuaciones en el Artificial Analysis Intelligence Index v4.3.2. Pesos con licencia MIT para ambos. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Guides & Insights

MiMo-V2.6-Pro vs GLM-5.2: Dos MoEs de pesos abiertos, y el benchmark que no debes restar

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La versión más perezosa de esta comparación pone el 72,57 de Xiaomi MiMo-V2.6-Pro junto al 46,2 de GLM-5.2, lo llama una victoria de 26 puntos y publica. Es incorrecto por una razón que no tiene nada que ver con qué modelo es mejor: esos dos números no son la misma medición. El 72,57 de Xiaomi es un promedio de tres en su propio harness con mini-swe-agent y nunca se ha enviado a una tabla pública; el 46,2 es una cifra de Pass@1 de un harness completamente distinto. La comparación honesta entre Xiaomi MiMo-V2.6-Pro y GLM-5.2 es otra, sobre una regla con la que ambos realmente se midieron —y en esa regla, la diferencia es real, pero es de doce puntos, no de veintiséis.

Según el Artificial Analysis Intelligence Index v4.3.2, consultado el 22 de septiembre de 2026, Xiaomi MiMo-V2.6-Pro obtiene una puntuación de 46. GLM-5.2 obtiene 34. Ambos son modelos de mezcla de expertos con pesos abiertos de laboratorios chinos, ambos funcionan con una ventana de contexto de 1M de tokens y ambos tienen un precio lo bastante bajo como para que la elección entre ellos dependa de la capacidad y el servicio, no del presupuesto. Ahí es donde termina el parecido, porque GLM-5.2 ha sido reemplazado por su propio creador, y la página en la que se escribe esta comparación incluye un aviso de obsolescencia.

Qué es cada modelo y en qué estado se encuentra

GLM-5.2 es el buque insignia de Z.ai, lanzado el 16 de junio de 2026. Es un transformer de mezcla de expertos con aproximadamente 753.000 millones de parámetros totales y alrededor de 40.000 millones activos por token, y se informó de que fue entrenado íntegramente en aceleradores Huawei Ascend en lugar de hardware Nvidia. Se distribuye con pesos abiertos bajo la licencia MIT con cuantizaciones FP8 e INT4, admite 1 millón de tokens de contexto con hasta 131.072 tokens de salida, y tiene un precio de 1,40 dólares por millón de tokens de entrada y 4,40 dólares por millón de salida en la propia API de Z.ai, con entrada en caché a 0,26 dólares y una tarifa combinada de 0,90 dólares. Artificial Analysis lo midió en 72,6 tokens de salida por segundo y 5,98 segundos hasta el primer token, con un coste de 1.559,05 dólares por ejecutar el índice completo.

Xiaomi MiMo-V2.6-Pro alcanzó la disponibilidad general el 22 de septiembre de 2026, con la aparición de sus repositorios de checkpoints de aprendizaje por refuerzo el día anterior. Es un modelo de mezcla de expertos disperso de 1,02 billones de parámetros totales y 42 mil millones de parámetros activados por token —un total mayor que el de GLM-5.2 y una cantidad de parámetros activos casi idéntica—, con una ventana de contexto de 1 millón de tokens, multimodalidad nativa en texto, imagen, video y audio, y pesos con licencia MIT. Xiaomi mantuvo los precios de la generación anterior en lugar de aumentarlos, por lo que figura a $0,43 y $0,87 por millón de tokens, con un descuento de caché del 99 % y un precio combinado de $0,18.

• Pesos — tanto con licencia MIT como descargables; esta es la única categoría en la que los dos son genuinamente iguales

• Parámetros activos — MiMo-V2.6-Pro 42B por token; GLM-5.2 alrededor de 40B. Prácticamente idénticos, lo que hace que la diferencia de puntuación sea un resultado del entrenamiento y no de la escala

• Parámetros totales — MiMo-V2.6-Pro 1.02T; GLM-5.2 aproximadamente 753B

• Puntuación del índice — MiMo-V2.6-Pro 46; GLM-5.2 34, ambos en Artificial Analysis v4.3.2

• Precio de lista — MiMo-V2.6-Pro $0.43 / $0.87 por 1M; GLM-5.2 $1.40 / $4.40, combinado $0.18 frente a $0.90

• Coste de ejecución del índice — MiMo-V2.6-Pro 206,66 $; GLM-5.2 1.559,05 $

• Velocidad — MiMo-V2.6-Pro 134,3 tokens de salida por segundo; GLM-5.2 72,6

• Tiempo hasta el primer token — MiMo-V2.6-Pro 2,15 segundos; GLM-5.2 5,98 segundos

• Estado — MiMo-V2.6-Pro actual y GA; GLM-5.2 obsoleto en Artificial Analysis, que ahora solo lo evalúa con la carga de trabajo de entrada predeterminada de 10k

A two-column scoreboard titled MiMo-V2.6-Pro vs GLM-5.2, subtitled Twelve index points in fourteen weeks, at the same active parameter count. The left column, Xiaomi MiMo-V2.6-Pro, reads Intelligence Index v4.3.2 46; active parameters 42B per token; blended rate per 1M $0.18; cost to run the index $206.66; speed 134.3 tokens per second; status GA, current. The right column, GLM-5.2, reads Intelligence Index v4.3.2 34; active parameters ~40B per token; blended rate per 1M $0.90; cost to run the index $1,559.05; speed 72.6 tokens per second; status deprecated, superseded by GLM-5.3. A footer notes GLM-5.2 is marked deprecated on Artificial Analysis, which now benchmarks it only at the default 10k input workload. The OrcaRouter logo is composited in the bottom-right corner.

El aviso de obsolescencia es el titular

Z.ai ya ha lanzado GLM-5.3, y la página de Artificial Analysis de GLM-5.2 lo dice directamente, marcando el modelo como obsoleto y limitando el trabajo continuo de benchmarks a una única carga de trabajo predeterminada. Eso cambia para qué sirve esta página. Si hoy estás eligiendo un modelo nuevo, la comparación que realmente te importa es MiMo-V2.6-Pro frente a GLM-5.3, no GLM-5.2, y en el mismo índice v4.3.2, GLM-5.3 con el máximo esfuerzo obtiene 45 frente al 46 de MiMo-V2.6-Pro. Un punto. Esa es una pelea de verdad, y es un artículo completamente distinto.

La comparación con GLM-5.2 todavía merece hacerse, por una razón concreta: es la ilustración más barata posible de lo rápido que avanzó la frontera de los pesos abiertos entre junio y septiembre de 2026. Doce puntos de índice en unas catorce semanas, con el recuento de parámetros activos prácticamente sin cambios. Lo que haya producido esa ganancia, no fue la escala.

En qué era bueno GLM-5.2, y si todavía lo es

El material de lanzamiento de GLM-5.2 se centró en la codificación y el trabajo agéntico de larga duración, y esas cifras siguen siendo válidas como descripción del modelo: SWE-bench Pro en 62,1 frente a 58,4 de GLM-5.1, Terminal-Bench 2.1 en 81,0 frente a 63,5, y FrontierSWE en 74,4 frente a 30,5. En el apartado de conocimiento y matemáticas, reportó GPQA-Diamond en 91,2, AIME 2026 en 99,2 y Humanity's Last Exam en 40,5. En aquel momento, lideró a todos los modelos en un benchmark de codificación agéntica de horizonte largo y ocupó el segundo puesto en una tabla de clasificación pública de desarrollo web. Son cifras reportadas por el proveedor en los sistemas de evaluación del propio proveedor, y la salvedad habitual se aplica a todas y cada una de ellas.

Los propios números publicados por Xiaomi para MiMo-V2.6-Pro no son comparables con ellos, y conviene ser preciso sobre por qué en lugar de hacer gestos al respecto. Xiaomi informa que el modelo pasa de 58,4 a 72,57 en DeepSWE v1.1 a lo largo de su ejecución de aprendizaje por refuerzo, evaluado con mini-swe-agent como promedio de tres, con su propio evaluador, con la ejecución documentada como 30 pasos y aproximadamente 750.000 trayectorias completadas en menos de seis días, con un gasto publicado de alrededor de 2,62 millones de dólares para el modelo Pro. Nada de eso es una entrada en una tabla de clasificación. Una entrada en una tabla de clasificación es una afirmación sobre una configuración específica bajo condiciones declaradas que un tercero puede volver a ejecutar, y la de Xiaomi no lo es. Un registro de seguimiento independiente incluye a GLM-5.2 con 46,2 en DeepSWE — Pass@1, una métrica diferente en la misma familia de tareas —, y poner 72,57 junto a 46,2 para producir un margen de 26 puntos es hacer aritmética con dos escalas diferentes. No debería hacerse, y es el error más común que circula sobre este par.

Screenshot of the Artificial Analysis model page for Xiaomi MiMo-V2.6-Pro, captured 22 September 2026. The header reads 46 Artificial Analysis Intelligence Index, ranked first of 114 in its class; 134.3 output tokens per second, ranked eleventh of 114; $0.435 input and $0.87 output per 1M tokens with a 99% cache discount; $0.13 cost per Intelligence Index task, ranked twelfth of 114; and 140M output tokens from the Intelligence Index. Technical specifications list reasoning Yes, input modality text, image, speech and video, output modality text, a 1M-token context window, 1.0T total parameters, 42B active parameters, an MIT licence and Hugging Face model weights, under a breadcrumb reading Xiaomi, Open weights model, Released September 2026. A comparison summary notes it cost $206.66 to evaluate MiMo-V2.6-Pro on the Intelligence Index.

Decidir entre ellos, y el enrutamiento que lo abarata

Si ambos son pesos abiertos bajo la misma licencia, los factores decisivos son qué puedes ejecutar y dónde puedes llamarlo. GLM-5.2 está en OrcaRouter como z-ai/glm-5.2 — un endpoint compatible con OpenAI, precio de lista del proveedor pasado con 0% de margen, por lo que un cambio de precio de Z.ai está activo en nuestro lado el mismo día. Xiaomi MiMo-V2.6-Pro no está en OrcaRouter; ningún modelo de Xiaomi lo está, y acceder a él significa la propia plataforma de Xiaomi o uno de los catálogos de terceros que lo incluyen. Preferimos decir eso que dejar que una página de modelo dé a entender lo contrario.

La consecuencia útil es que puedes mantener a los modelos actuales con una sola clave y evaluar al recién llegado frente a ellos sin un segundo contrato. Si MiMo-V2.6-Pro gana con tus prompts, lo habrás descubierto a bajo costo. Si no lo hace —y la brecha de doce puntos en el índice es más pequeña que lo grande que es la brecha de precio por token, así que el resultado depende de verdad de tu carga de trabajo— no habrás perdido nada más que la prueba. Enrutar a los dos detrás de un único endpoint con conmutación automática por error también responde a la objeción práctica contra un modelo que se lanzó esta semana: una única ruta de servicio es un único punto de fallo, y una vía a la que puedes recurrir como respaldo es lo que hace que un modelo nuevo sea seguro para ponerlo delante de tráfico real.

Screenshot of the OrcaRouter model page for GLM 5.2, captured 22 September 2026. The page lists the model id z-ai/glm-5.2, by Z.ai, dated 2026-06-16, marked FEATURED, with Tools, JSON and Reasoning badges, a 1M-token context window, a maximum output of 128K tokens, text-only input and output, $1.40 per 1M input tokens and $4.40 per 1M output tokens, 17.3M tokens of traffic over seven days, and a code sample calling the model through the OpenAI-compatible base URL api.orcarouter.ai/v1.

La respuesta corta

Si hoy estás en GLM-5.2 y te funciona, la pregunta sobre la actualización no es MiMo-V2.6-Pro, sino GLM-5.3, en la misma línea, con una diferencia de un punto respecto al modelo de Xiaomi y sin ningún costo de migración. Si estás eligiendo un camino desde cero y quieres pesos abiertos con la mejor puntuación medida de los tres, el 46 de MiMo-V2.6-Pro es la cifra, y sus 134,3 tokens por segundo y 0,13 $ por tarea de índice son las razones por las que no es una victoria por un margen estrecho. Si quieres el más seguro de los tres, GLM-5.2 es la respuesta incorrecta por una razón que no tiene nada que ver con lo bueno que era en junio: es el único de los tres que su propio proveedor ha dejado de desarrollar.

OrcaRouter pone más de 200 modelos detrás de un único endpoint compatible con OpenAI al precio de lista del proveedor con 0 % de margen, por lo que un cambio de precio del proveedor se aplica el mismo día.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario