
Muse Spark 1.2 vs GLM 5.2: El programador de código cerrado vs el generalista de código abierto
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligencia72Código
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
Dos modelos con contexto de un millón de tokens, cuyos precios difieren en quince centavos por millón de tokens, ambos orientados a trabajo de agentes con uso intensivo de código — y no comparten casi nada más.Muse Spark 1.2, que Meta lanzó el 5 de agosto de 2026 junto con un agente de terminal coentrenado llamado Muse Code, es de pesos cerrados, es más barato por token, obtiene 57 en el actual índice de inteligencia de Artificial Analysis y no puede responder sin razonar primero.GLM 5.2, el modelo insignia de pesos abiertos de Z.ai de mediados de junio, tiene licencia MIT, es autoalojable, es aproximadamente cinco veces más rápido en llegar al primer token y aun así mueve cuatro veces y media más tráfico real a través de nuestra pasarela: 213 millones de tokens en los últimos siete días frente a los 46 millones de Muse Spark 1.2. El modelo que obtiene mayor puntuación y es más barato por token es el que tiene menos tráfico. El abierto es el que la gente realmente enruta.
La versión honesta de ese hecho es de lo que trata este artículo. La puntuación y el precio son menos decisivos que cómo encaja un modelo en tu pipeline, y estos dos toman decisiones opuestas en cada eje que determina el encaje. Donde existen cifras independientes, provienen de Artificial Analysis; donde provienen de Meta o Z.ai, se etiquetan como reportadas por el proveedor; las cifras de latencia y tráfico son telemetría de producción propia de OrcaRouter durante siete días.
El contraste de especificaciones, una dimensión a la vez
• Precio — Muse Spark 1.2 a $1.25 de entrada / $4.25 de salida por millón de tokens, $0.15 en un acierto de caché; GLM 5.2 a $1.40 de entrada / $4.40 de salida, $0.26 en caché. Meta es más barato en todas las filas.
• Contexto — ambos 1,048,576 tokens. Salida máxima: Meta documenta un límite de 131,072 tokens para Muse Spark 1.2; GLM 5.2 declara 128,000.
• Razonamiento — el razonamiento es obligatorio en Muse Spark 1.2 en cinco niveles de esfuerzo (mínimo a xhigh, medio por defecto); GLM 5.2 ejecuta razonamiento híbrido controlado por reasoning_effort en alto o máximo, con razonamiento profundo activado por defecto.
• Entradas — Muse Spark 1.2 ofrece entrada de texto, imagen, video, audio y PDF; GLM 5.2 solo admite texto de entrada y salida.
• Pesos — Muse Spark 1.2 es cerrado, sin repositorio ni ruta de autoalojamiento; GLM 5.2 incluye pesos abiertos con licencia MIT, un modelo de mezcla de expertos de 753B parámetros con aproximadamente 40B activos por token.
• Edad — Muse Spark 1.2 tiene tres días de antigüedad al momento de escribir esto; GLM 5.2 ha estado en producción desde el 13 de junio, con ocho semanas de experiencia en campo y todo un ecosistema de hosts y herramientas construido a su alrededor.
El desfase del índice es de cuatro puntos. La trampa de la versión es real.
El Índice de Inteligencia actual de Artificial Analysis (v4.1.1) puntúa a Muse Spark 1.2 con 57, ocupando el puesto #12 de 185, y a GLM 5.2 con 53 — la puntuación más alta de pesos abiertos en la tabla, pero a cuatro puntos de distancia. La mayor parte de la cobertura todavía cita 54 para Muse Spark 1.2 porque eso fue lo que reportó la evaluación del día de lanzamiento; la recalificación de v4.1.1 le añadió 2.7 puntos, el mayor incremento de cualquier modelo en esa actualización. Si ves «54 vs 51» o «54 vs 53» en algún sitio, comprueba en qué versión del índice está cada número antes de asumir que la diferencia es real.
Vale la pena decir qué significa y qué no significa la brecha de cuatro puntos. Significa que en el compuesto de nueve benchmarks, el modelo cerrado de Meta se sitúa por delante del modelo abierto de Z.ai con un esfuerzo comparable. No significa que Muse Spark 1.2 supere a GLM 5.2 en todo, porque los dos modelos alcanzan sus puntuaciones por rutas diferentes. GLM 5.2 es un valor atípico en matemáticas y razonamiento — AIME 2026 con 99.2 — pero es notoriamente verboso y su punto débil es el trabajo profundo a escala de repositorio. Muse Spark 1.2 tiene la forma opuesta: fuerte en codificación de terminal y tareas con múltiples archivos, y muchísimo más barato de evaluar por tarea, porque consume muchos menos tokens mientras razona.

Dónde realmente divergen los benchmarks
En Terminal-Bench 2.1 los dos están más cerca de lo que sugiere la brecha del índice, y el origen importa más de lo habitual. En el mismo harness de Artificial Analysis, Muse Spark 1.2 obtiene 80.1 y GLM 5.2 obtiene 77.9. Meta afirma 82.9 para Muse Spark 1.2 en su propio harness; la mejor cifra reportada por Z.ai para GLM 5.2 es 82.7, lo que lo convirtió en el primer modelo de peso abierto por encima de 80 en ese benchmark. Mismo benchmark, cuatro números diferentes: el emparejamiento del harness mueve estas puntuaciones varios puntos en ambas direcciones, así que trate cualquier afirmación de un solo terminal-bench como un rango.
La divergencia a la que hay que prestar atención es DeepSWE 1.1, el benchmark que pone a prueba el razonamiento profundo, multiarchivo y a escala de repositorio en un bucle de agente largo. Meta reporta 59.3 para Muse Spark 1.2, una cifra del proveedor que ningún tercero ha reproducido todavía. El DeepSWE publicado de GLM 5.2 es 46.2, y su predecesor GLM-5.1 estaba en 18.0, así que esta es la dimensión en la que Z.ai más ha mejorado y en la que todavía va por detrás. Si tu carga de trabajo es "cambiar cincuenta archivos de forma coherente", esa brecha lo dice todo; si tu carga de trabajo son comandos de terminal y andamiaje, apenas se nota.
Otro hallazgo que contradice el encuadre evidente. La suite independiente Vals AI, que ejecuta cargas de trabajo de agentes por dominio, coloca a Muse Spark 1.2 en el quinto puesto general con 71.88% — y primero en Finance Agent, primero en TaxEval, y primero en el benchmark Legal Agent de Harvey, frente a 44, 136 y 31 modelos, respectivamente — mientras que Terminal-Bench 2.1 es solo su decimocuarto mejor dominio entre cincuenta. Meta vendió este modelo como un modelo de programación, y un evaluador independiente encontró que es más fuerte en agentes de documentos financieros, fiscales y legales. Si tu equipo redacta contratos o concilia libros contables, ese es el número más útil de este artículo.
La cuestión de los pesos abiertos es la verdadera bifurcación.
Todo lo anterior es cuestión de capacidad. La decisión es principalmente cuestión de propiedad, y aquí los dos no podrían estar más alejados.
GLM 5.2 tiene pesos abiertos con licencia MIT. Eso cambia la negociación, no solo la factura: puedes autoalojarlo si una carga de trabajo es sensible o el volumen es alto; puedes moverlo entre proveedores sin reintegrarlo, porque los pesos son tuyos; y cualquier proveedor que lo enrute tiene que competir en precio y latencia, que es por lo que la línea de pesos abiertos se abarata con el tiempo. El MoE de 753B no es un modelo para portátil — la mayoría de los equipos aún lo alquilarán en lugar de ejecutarlo — pero la opción de irte, o de ejecutar los mismos pesos internamente a un costo fijo, pone un piso a lo que cualquiera puede cobrarte.
Muse Spark 1.2 compra el paquete opuesto. Los pesos están cerrados y la única vía de primera parte es la Model API de Meta, que ahora también enrutamos. A cambio obtienes un producto co-entrenado: Muse Code, el agente de terminal que se lanzó con el modelo, fue ajustado con trayectorias de arnés obtenidas por muestreo de rechazo y ejecuta subagentes persistentes y seguros ante reinicios en un runtime de registro de eventos exacto en la reproducción, con /plan, /grill y /goal como habilidades incluidas. Eso es algo genuinamente diferente de "un buen modelo que conectas a tu propio arnés" — es un agente que funciona desde el primer momento. La desventaja es que solo funciona a la manera de Meta, en la herramienta de Meta, en macOS o Linux, sin cliente de Windows, sin MCP y sin complementos de IDE por ahora.

Precio por token, precio por tarea
Por token, Muse Spark 1.2 es más barato en entrada y salida, y sigue siendo más barato por tarea porque también es el modelo menos verboso. Artificial Analysis midió que GLM 5.2 quemó 141 millones de tokens de salida, el 95% de ellos tokens de razonamiento, solo para ejecutar el Intelligence Index en su lanzamiento — el modelo líder más verboso del panel. Muse Spark 1.2 quemó 95 millones en el mismo ejercicio a $0.40 por tarea. Más tokens a una tarifa más alta significa que el costo por tarea de GLM 5.2 se acumula de una manera que su precio de lista oculta, y esta es la forma correcta de comparar modelos de razonamiento: fijar el precio de la tarea completada, no la tarifa por millón de tokens.
Hay un tercer precio que solo uno de estos modelos tiene. Muse Spark 1.2 ofrece un nivel de colaborador a $0.10 de entrada / $0.20 de salida — un orden de magnitud por debajo del nivel estándar, y por debajo del precio de lista de GLM 5.2 por un margen similar. El costo de admisión es el permiso para que Meta entrene futuros modelos con tu tráfico, más un límite de 60 solicitudes por minuto que descarta la expansión en producción. Trátalo como una revisión legal con un descuento incluido, no como una SKU más barata; para un equipo que califique y opere bajo el límite, hace que la comparación de precios deje de ser reñida.
Latencia: los dos modelos se invierten.
Si la brecha del índice favorece a Meta, el perfil de latencia es donde GLM 5.2 gana de manera decisiva en cuanto a la sensación de uso. En los últimos siete días de tráfico real en OrcaRouter, Muse Spark 1.2 muestra un p50 de tiempo hasta el primer token de 8.13 segundos y un p95 de 10.00 segundos, y luego avanza a toda velocidad a 576 tokens de salida por segundo con una tasa de error de cero. GLM 5.2 muestra un p50 de 1.55 segundos — más de cinco veces más rápido hasta el primer token — pero gotea a 78.5 tokens de salida por segundo con una tasa de error del 0.16%. En el laboratorio, con el máximo esfuerzo, la brecha se amplía: Artificial Analysis midió el tiempo hasta el primer token de Muse Spark 1.2 en 26 segundos en xhigh, su ajuste de razonamiento más costoso.
Entonces, un modelo te hace esperar y luego entrega rápido; el otro comienza de inmediato y se toma su tiempo. Para cualquier cosa que un humano esté observando — un turno de chat, una sesión de terminal interactiva — GLM 5.2 se siente mejor, y es por eso que domina el tráfico interactivo a través de nuestra puerta de enlace. Para una generación larga, un parche grande o un borrador de documento, Muse Spark 1.2 terminará primero una vez que comience, porque su tasa de salida es siete veces la de GLM 5.2. Mide el número equivocado y elegirás el modelo equivocado por la razón equivocada.
Probar ambos sin un segundo contrato.
Ambos modelos están en el catálogo de OrcaRouter al precio de lista del proveedor — Muse Spark 1.2 a $1.25 y $4.25, GLM 5.2 a $1.40 y $4.40 — porque OrcaRouter transmite las tarifas del proveedor con un margen del 0%. Eso hace que los precios sean los de la factura, no los de la etiqueta, y significa que cambiar entre los dos es un cambio de una línea en la cadena del modelo con la misma clave, en lugar de una nueva integración. Si un proveedor reduce un precio, la reducción se refleja en nuestro lado el mismo día.
La capa de enrutamiento justifica su existencia precisamente porque los dos modelos son complementarios. La debilidad de Muse Spark 1.2 es un primer token lento y un precio alto a escala; la debilidad de GLM 5.2 es la verbosidad y el razonamiento en repositorios profundos. Una regla de enrutamiento que envía la pasada de planificación a Muse Spark 1.2 y el abanico de trabajadores paralelos a GLM 5.2 — o que cambia a GLM 5.2 cuando el endpoint de Muse Code es lento — no cuesta nada extra de construir, porque ambos están detrás de un único endpoint. Y para un modelo de tres días de antigüedad, la conmutación automática es la forma de probarlo sin apostar una ruta de producción por él.

Quién debería elegir cuál
Elija Muse Spark 1.2 cuando la unidad de trabajo es un artefacto grande y coherente y alguien puede esperar unos segundos para que se inicie: refactorizaciones de varios archivos, generación de repositorios completos, bucles largos de agente y — según Vals AI — trabajo con documentos financieros, fiscales y legales. El liderazgo en DeepSWE, la alta tasa de salida y el nivel de colaborador apuntan en la misma dirección. Está aceptando pesos cerrados, las herramientas de Meta y un primer token más lento, y debería leer los 82.9 y 59.3 de Meta como afirmaciones, no como hechos.
Elija GLM 5.2cuando la propiedad y la sensación importan más que la puntuación compuesta: pesos abiertos que puede autoalojar o mover, un primer token rápido para trabajo interactivo, un ecosistema de bancos de pruebas y herramientas que ya funciona con él, y la capacidad general de pesos abiertos más potente disponible. Acepte la verbosidad, el 46.2 DeepSWE y un precio de lista más alto por token incluso antes de la diferencia en el recuento de tokens.
La mayoría de los equipos encontrará que la respuesta honesta no es ninguna de las dos por sí sola. El abierto es el caballo de batalla por el que enrutas la mayor parte del tráfico; el cerrado es el especialista al que apuntas para las tareas profundas y los documentos sensibles. Cuatro puntos de índice de diferencia en un compuesto, un mundo de diferencia en quién posee los pesos: esa es la elección, y es mucho más clara que las puntuaciones.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
