
GLM-5.2 vs Kimi K3: ¿Más barato y rápido, o más grande y mejor?
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.2 y Kimi K3 llegaron con un mes de diferencia a mediados de 2026 y se invierten mutuamente casi a la perfección. Kimi K3, lanzado el 2026-07-16 con los pesos abiertos publicados a continuación el 2026-07-27, es el más grande y, sobre el papel, el mejor modelo: 2,8 billones de parámetros, 104.000 millones de ellos activos, y la puntuación más alta en prácticamente todos los benchmarks en los que se han probado los dos. GLM-5.2 está disponible desde el 2026-06-16, es el más pequeño de los dos con 753.000 millones de parámetros y 40.000 millones activos, y cuesta aproximadamente un tercio de lo que cuesta el otro por token de salida, responde más rápido en la mediana, y se distribuye bajo MIT en lugar de una licencia personalizada con desencadenantes de ingresos.
Esa es la decisión en un solo párrafo. Lo que sigue son las pruebas que la respaldan: la aritmética de precios de una tarea que quizá llegues a ejecutar de verdad, las mediciones en las que ambos están lo bastante cerca como para que la diferencia sea puro ruido, y una cifra muy popular que no es comparable con la cifra impresa justo al lado.
Dónde se sitúan los dos
Ambos están disponibles de forma general a través de las API propias de sus proveedores, ambos se pueden enrutar en OrcaRouter y ambos tienen pesos descargables. Las diferencias que importan antes de siquiera acercarte a un benchmark:
• Lanzado — GLM-5.2 el 2026-06-16 frente a Kimi K3 el 2026-07-16 (páginas de modelos de Artificial Analysis; la propia página del modelo de OrcaRouter para Kimi K3 lo sitúa un día antes, el 2026-07-15)
• Pesos — GLM-5.2 abierto bajo MIT frente a Kimi K3 abierto bajo la Licencia Kimi K3, que exige un acuerdo por separado a partir de 20 millones de dólares en ingresos anuales por modelo como servicio y una atribución prominente por encima de los 100 millones de usuarios mensuales (la investigación y el desarrollo internos están exentos)
• Tamaño — GLM-5.2 753B en total / 40B activos frente a Kimi K3 2,8T en total / 104B activos
• Contexto — GLM-5.2 1.000.000 tokens vs Kimi K3 1.048.576 tokens
• Entrada — GLM-5.2 texto de entrada, texto de salida vs Kimi K3 texto e imágenes de entrada, texto de salida
• Salida máxima publicada — GLM-5.2 128.000 tokens frente a no publicada en la página de OrcaRouter de Kimi K3
En OrcaRouter, ambos están detrás de una sola clave en un único endpoint compatible con OpenAI en https://api.orcarouter.ai/v1, y trasladamos el precio de lista del proveedor tal cual, sin añadir ningún margen, así que todas las cifras que aparecen a continuación son las del proveedor, no las nuestras.
Lo que cuesta un millón de tokens, en un trabajo que cuesta algo
Primero, las tarifas de los proveedores, leídas de las propias páginas de precios de los proveedores el 23/09/2026. Z.ai lista GLM-5.2 a $1.40 por millón de tokens de entrada, $0.26 por millón de tokens de entrada en caché y $4.40 por millón de tokens de salida. Moonshot lista Kimi K3 a $3.00 de entrada, $0.30 de lectura de caché, $15.00 de salida — más el cargo por escritura en caché de $3.00 por millón para una caché de cinco minutos y $6.00 por millón para una caché de una hora. Esos son precios publicados, no auditados de forma independiente, y cualquiera de los proveedores puede cambiarlos.
Asígnalos a un trabajo que consiste principalmente en leer: una revisión de una base de código de 600.000 tokens con una respuesta escrita de 8.000 tokens. En GLM-5.2, eso son 0,6 x $1,40 = $0,84 de entrada más 0,008 x $4,40 = $0,035 de salida, o unos $0,88. En Kimi K3, son 0,6 x $3,00 = $1,80 más 0,008 x $15,00 = $0,12, o unos $1,92. Aproximadamente 2,2 veces el costo para el mismo trabajo.
Ahora vuelve a ejecutarlo con el código ya presente en la caché del proveedor. La línea de entrada se reduce a la tarifa de lectura de caché, y los dos precios que estaban a 2,1x de distancia pasan a ser $0,26 frente a $0,30 por millón: una diferencia del 15%. Este es el número del que menos se habla en la comparación y el que más importa para un agente que vuelve a leer el mismo contexto en cada turno. También tiene un asterisco: Kimi K3 cobra por separado la escritura de la caché, y la página de GLM-5.2 no anuncia ningún cargo por escritura, por lo que un arranque en frío cuesta bastante más en Kimi K3 de lo que sugiere la cifra destacada de $3,00.
• Una lectura de 600k tokens con una respuesta de 8k — GLM-5.2 alrededor de $0.88 frente a Kimi K3 alrededor de $1.92
• La misma línea de entrada en caché — GLM-5.2 $0.16 frente a Kimi K3 $0.18 por 600k tokens

El modelo independiente coincide en la dirección, pero no en la magnitud. Artificial Analysis combina los tokens de aciertos de caché, de entrada y de salida en una proporción de 7:2:1 y suma los tokens de razonamiento que un modelo realmente consume, y sus cifras para estos dos —consultadas el 2026-09-23 bajo su índice v4.3.2— sitúan a GLM-5.2 en $0.902 por millón de tokens combinados, frente a los $2.31 de Kimi K3, y el costo de completar una de sus tareas de evaluación en $0.96, frente a los $2.00. Ejecutar una vez el Intelligence Index completo cuesta $1,559 en GLM-5.2 y $3,658 en Kimi K3.
Hay un detalle contraintuitivo oculto en ese modelo de costos. Kimi K3 usa menos tokens de salida por tarea que GLM-5.2 —48.000 frente a 64.000— y menos tokens de razonamiento, 32.000 frente a 51.000. Es el modelo más económico por unidad de trabajo y sigue costando aproximadamente el doble por tarea, porque su precio por token es 2,1 veces en la entrada y 3,4 veces en la salida. Barato por tarea y barato por token son propiedades distintas, y esta es una combinación en la que apuntan en direcciones opuestas.
La ventana de contexto, y lo que realmente cabe en ella
Los dos están dentro de un 5% de diferencia sobre el papel: 1.000.000 de tokens frente a 1.048.576. Presentar eso como una victoria de Kimi K3 sería una tontería. Ambos son modelos de un millón de tokens y la ventana no es un factor diferenciador; la pregunta honesta es qué puede seguir haciendo cada uno con texto enterrado en el medio de esta.
Eso es lo que mide la evaluación de razonamiento de contexto largo de Artificial Analysis, y es una de las brechas más amplias del conjunto de datos: Kimi K3 obtiene un 89% frente al 78% de GLM-5.2. Si tu trabajo consiste en cargar un corpus grande y hacer preguntas que requieran unir datos de extremos opuestos del mismo, los 48.576 tokens adicionales no son la razón para elegir Kimi K3 — la ventaja de once puntos en contexto largo sí lo es.
El mínimo bajo la ventana también difiere. GLM-5.2 publica una salida máxima de 128.000 tokens; la página de Kimi K3 no publica una cifra equivalente, así que no vamos a proporcionar ninguna. Si generas documentos largos en lugar de leerlos, vale la pena contrastar esa asimetría con tu propia carga de trabajo antes de comprar cualquiera de los dos.
Velocidad: el único eje que GLM-5.2 domina por completo
Dos mediciones independientes apuntan en la misma dirección aquí, lo cual vale la pena decir precisamente porque no coinciden en todo.
Nuestros propios datos de enrutamiento, durante los siete días hasta el 2026-09-23, muestran que GLM-5.2 responde con una mediana de 3,28 segundos hasta el primer token frente a los 8,09 segundos de Kimi K3, y transmite 68,1 tokens por segundo frente a 43,4. El tiempo hasta el primer token del percentil 95 de ambos modelos se sitúa exactamente en 10,00 segundos. Artificial Analysis, que mide por separado, sitúa a GLM-5.2 en 68,2 tokens de salida por segundo frente a los 36,7 de Kimi K3, en 41,29 segundos de extremo a extremo frente a 72,13, y en 33,95 segundos hasta la primera respuesta frente a 58,52.

Las dos fuentes discrepan en un punto, y merece la pena señalarlo en lugar de suavizarlo. Artificial Analysis sitúa a Kimi K3 ligeramente por delante en tiempo bruto hasta el primer token, 4,08 segundos frente a 4,62, mientras que nuestro propio enrutamiento coloca a GLM-5.2 casi dos veces y media más rápido en p50. Distintos endpoints, distintos proveedores upstream, distintas ventanas. Considera la dirección del rendimiento —GLM-5.2 claramente más rápido— como sólida, y considera cualquier cifra concreta de tiempo hasta el primer token, la nuestra o la suya, como una propiedad de una semana concreta.
También hay un dato en nuestra página de GLM-5.2 que no vamos a omitir en silencio: durante esos mismos siete días muestra una tasa de error del 9,2 %, frente al 0,26 % de Kimi K3. Una diferencia de ese tamaño tiene tantas probabilidades de deberse a una mala semana de los proveedores upstream que dan servicio a GLM-5.2 como de ser una propiedad del modelo, y siete días no son una ventana lo bastante larga para distinguirlo. Es el tipo de problema que el enrutamiento existe para resolver: cuando un proveedor falla una de cada once solicitudes, la conmutación por error automática mueve el tráfico sin que nadie tenga que avisar al equipo de guardia.

Benchmarks: una barrida real, más estrecha de lo que sugiere el titular
Kimi K3 gana casi todo aquello en lo que se han ejecutado ambos modelos. Estas son cifras de Artificial Analysis bajo la revisión del índice v4.3.2, ambos modelos en su configuración de razonamiento máximo, leídas el 2026-09-23:
• Índice de Inteligencia — Kimi K3 44 vs GLM-5.2 34
• AA-Briefcase v1.1 — 1510 vs 1233
• GDPval-AA v2.1 — 1524 vs 1358
• AutomationBench-AA — 58% frente a 28%
• Terminal-Bench 4.0 — 13% vs 1%
• SciCode — 59% vs 51%
• Humanity's Last Exam — 47% vs 41%
• GDP.pdf — 22 % frente a 10 %
• AA-LCR v1.1 — 89% vs 78%
• CritPt — 23 % vs 21 %
Dos advertencias antes de que alguien le haga captura de pantalla a esa lista.
Primero, la revisión del índice. La cobertura del lanzamiento de Kimi K3 en julio lo situaba en 57 en el Intelligence Index, con GLM-5.2 en 51. Las páginas en vivo de hoy dicen 44 y 34. No son la misma medición: Artificial Analysis revisa el índice y vuelve a puntuar los modelos conforme a él, y colocar una cifra de julio junto a una de septiembre es el error más fácil de cometer en este emparejamiento. La dirección es estable en todas las instantáneas; las cifras absolutas no son comparables entre revisiones.
En segundo lugar, los niveles. Terminal-Bench 4.0 con 13 % y 1 % es una evaluación exigente, y a esa altura la proporción te dice más que cualquiera de los dos números. AA-Omniscience, que sondea si un modelo conoce los límites de su propio conocimiento, sitúa a GLM-5.2 en 4 frente a los 20 de Kimi K3 — un mínimo que conviene conocer si piensas ejecutar cualquiera de los dos sin supervisión.
Un dato más que Artificial Analysis registra sobre la ficha de GLM-5.2: marca la configuración de razonamiento máximo como obsoleta en favor del más reciente GLM-5.3. Eso no cambia ninguna de las cifras anteriores, que son una instantánea de GLM-5.2 tal como se midió, pero sí significa que la hoja de ruta de Z.ai ha dejado atrás este modelo. En un endpoint enrutado, eso cuesta una cadena de modelo en lugar de una migración, que es el argumento principal para no codificar de forma fija ninguno de estos nombres en tu aplicación.
Agentes y uso de herramientas: donde la brecha es más amplia
Si un bloque de esa tabla debería decidir la compra, es este. El trabajo agéntico de horizonte largo es donde el margen de Kimi K3 es mayor y más consistente:
• AutomationBench-AA — 58 % frente a 28 %, una diferencia de 30 puntos
• GDPval-AA v2.1 — 1524 vs 1358
• AA-Briefcase v1.1 — 1510 vs 1233
• Terminal-Bench 4.0 — 13% vs 1%
El propio material de lanzamiento de Moonshot se apoya en la misma historia —la publicación de los pesos de K3 vino acompañada de un informe técnico que cubría la pila de entrenamiento con paralelismo de expertos del proveedor y un arnés de entorno de agente—, pero el material del proveedor es material del proveedor, y las cifras anteriores son las independientes.
El agregador de terceros LLM Stats, que ejecuta su propio compuesto sobre un conjunto de benchmarks compartido, llega a la misma conclusión desde una dirección diferente: de los once benchmarks que puntúa para ambos modelos, Kimi K3 se lleva los once, y sus puntuaciones por categoría colocan a Kimi K3 por delante en uso de herramientas (30.8 vs 19.6), agentes (38.3 vs 29.6) y programación (42.3 vs 34.8). Esos son los propios compuestos de LLM Stats bajo su propia ponderación, en un conjunto compartido que no es grande, así que trátalos como corroboración en lugar de como un resultado de laboratorio. Once de once sigue sin ser un resultado reñido.
Programación
Misma dirección, menor margen. En las evaluaciones de codificación que Artificial Analysis puntúa para ambos, Kimi K3 lidera SciCode con un 59% frente a un 51%; en el conjunto compartido de LLM Stats, se lleva DeepSWE, DeepSWE 1.1, FrontierSWE, SWE-Marathon, Program Bench y Terminal-Bench 2.1. Las cifras halagadoras de GLM-5.2 —99,2% en AIME 2026, 94,4% en HMMT 2025, 91,2% en GPQA según las recogen agregadores de terceros— están reportadas por el proveedor y no han sido reproducidas, y la mayoría de ellas miden matemáticas de competición en lugar de ingeniería de software.
La lectura práctica: para un agente de programación que se ejecuta durante mucho tiempo, edita muchos archivos y tiene que recuperarse de sus propios errores, el margen agéntico de Kimi K3 es una señal más relevante que las puntuaciones en matemáticas de cualquiera de los dos modelos. Para un asistente de código rápido, barato y en gran medida de una sola pasada, la ventaja de rendimiento de GLM-5.2 vale más que lo que cuesta la brecha en los benchmarks.
Donde estén lo suficientemente cerca como para que no importe.
• Precio de entrada en caché — $0.26 vs $0.30 por millón, una diferencia del 15% frente a una diferencia de 3.4x en la salida
• Ventana de contexto — 1.000.000 vs 1.048.576 tokens
• p95 del tiempo hasta el primer token — 10.00 s frente a 10.00 s con nuestro propio enrutamiento
• CritPt — 23 % vs 21 %
• Matemáticas — LLM Stats sitúa a GLM-5.2 ligeramente por delante en su compuesto de matemáticas (41,4 frente a 40,9), mientras que Kimi K3 lidera en matemáticas con imágenes; según la evidencia disponible, ninguno de los dos modelos domina la aritmética
Cualquiera que te diga que uno de estos modelos es el doble que el otro en todos los aspectos está leyendo una sola fila de la tabla.
Elige GLM-5.2 si…
Tú pagas la factura, y la factura es la restricción. GLM-5.2 cuesta aproximadamente un tercio del precio de salida, también es más barato en la línea de caché, tiene licencia MIT sin ningún desencadenante de ingresos que revisar, es más rápido en la mediana y mucho más rápido en streaming, y su ventana de un millón de tokens está lo bastante cerca de la de Kimi K3 como para que la diferencia nunca decida nada. Si tu carga de trabajo es texto de entrada y texto de salida, y consiste sobre todo en leer más que en largas cadenas de llamadas a herramientas, los puntos de benchmark adicionales de Kimi K3 son puntos que tu aplicación nunca recogerá.
Elige Kimi K3 si…
El trabajo es agéntico y extenso. La diferencia de 30 puntos en AutomationBench, las ventajas en GDPval y AA-Briefcase, el margen de once puntos en razonamiento de contexto largo y el barrido del conjunto compartido de LLM Stats apuntan todos en la misma dirección: Kimi K3 es el mejor modelo al que encargar una tarea de varios pasos y desentenderse. También es el único de los dos que acepta imágenes. Pagarás aproximadamente el doble por tarea por eso, y si tu conjunto de trabajo está en gran parte en caché, pagarás menos del doble — pero lo que lo respalda no es el precio, ni tampoco la velocidad.
Ambos son enrutables en OrcaRouter con una sola clave contra un único endpoint compatible con OpenAI, a los precios de lista de los proveedores sin nada añadido por encima, y ambos están detrás del mismo failover automático. Esa es la forma más barata de averiguar cuál quiere realmente tu carga de trabajo, porque cambiar entre ellos es una cadena de modelo, no un contrato.
Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
