
GLM-5.3 vs Kimi K3: Exprimir una base de 743B o construir una de 2.8T — ¿Qué apuesta rinde?
- openaiNUEVOOpenAI: GPT-6 Astra2026-09-0455Inteligencia77Código
- googleNUEVOGoogle: Gemini 3.8 Flash2026-09-0247Inteligencia76Código
- qwenNUEVOQwen: Qwen3.8 Max (0902)2026-09-0247Inteligencia72Código
- anthropicNUEVOAnthropic: Claude Fable 5.12026-09-0157Inteligencia82Código
- AlibabaNUEVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.3 Flash2026-08-2646Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1849Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1541Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1251Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0547Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0347Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2140Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Inteligencia49Código
La carrera china de pesos abiertos acaba de dividirse en dos respuestas a la misma pregunta. Moonshot AI construyó Kimi K3 desde cero — una base de mezcla de expertos de 2,8 billones de parámetros, el modelo de pesos abiertos más grande jamás lanzado, anunciado el 16 de julio de 2026 con los pesos publicados el 27 de julio. GLM-5.3 es la apuesta opuesta: Z.ai mantuvo la base exacta de 743 mil millones de parámetros que impulsó GLM-5.2 y dedicó todo el ciclo de lanzamiento al posentrenamiento, argumentando que el techo de inteligencia del modelo base nunca fue el problema. Ambos son modelos insignia de contexto de 1M centrados en código y agentes, y ambos afirman ser el mejor modelo abierto de programación del mercado. No pueden ser ambos la mejor forma de gastar el mismo presupuesto, y los benchmarks realmente se dividen por la mitad — lo que convierte esto menos en una comparación que en un referéndum sobre cómo construir el próximo modelo de frontera.
Dos apuestas sobre cómo construir un modelo de frontera
Z.ai llama a GLM-5.3 una "excavación profunda" más que una actualización generacional. La base es idéntica byte por byte al mismo modelo de 743B que GLM-5.2; el delta es enteramente de post-entrenamiento, ejecutado a través del framework de código abierto slime en tareas que abarcan sesiones completas de ingeniería: diagnosticar, corregir, verificar y desplegar en clústeres reales, sistemas de almacenamiento y bases de código, algunas de las cuales requieren varios días de trabajo de un ingeniero senior. Las ganancias reportadas por el proveedor son grandes: un salto del 50% en su propio Code Bench, Terminal-Bench 3.0 de 4.6 a 28.3, DeepSWE v1.1 de 46.2 a 66.9, y una capacidad cibernética que ha obligado a una revisión de seguridad antes de que se publiquen los pesos. Moonshot fue en la otra dirección. Kimi K3 es una base completamente nueva: 2.8T de parámetros totales con unos 104B activos por token (16 de 896 expertos), una arquitectura Kimi Delta Attention, entrada nativa de imagen y video, razonamiento siempre activo que no se puede desactivar, y una ventana de contexto de 1M tanto en entrada como en salida. Mientras Z.ai apuesta a que más del mismo modelo es suficiente, Moonshot apuesta a que la base misma era el techo.

El cara a cara, con procedencia adjunta
El único lugar donde ambos modelos aparecen en la misma página es la tabla de lanzamiento de Z.ai, así que de ahí provienen las cifras comparativas, etiquetadas como reportadas por el proveedor, no auditadas de forma independiente. Las cifras independientes de Kimi K3 coinciden con lo que Moonshot publicó en julio y con lo que mide Artificial Analysis, pero ningún laboratorio neutral ha ejecutado ambos todavía.
• Terminal-Bench 3.0 — GLM-5.3 con 28.3 frente a Kimi K3 con 17.4 (tabla de Z.ai). La brecha de codificación más grande del enfrentamiento, en la versión más nueva y difícil.
• Terminal-Bench 2.1 — GLM-5.3 con 88.2 frente a Kimi K3 con 88.3. Un empate técnico.
• DeepSWE v1.1 — GLM-5.3 obtiene 66.9 frente a Kimi K3 con 67.5. Kimi gana por poco.
• SWE-Marathon v1.1 — GLM-5.3 con 42.5 frente a Kimi K3 con 48.1. La mejor victoria en codificación de Kimi.
• ExploitGym — GLM-5.3 con 105/130 frente a Kimi K3 con 36/70. Una barrida casi total para GLM.
• GDPval-AA v2 (trabajo de conocimiento) — GLM-5.3 con 1.769 frente a Kimi K3 con 1.682.
• Acceso — GLM-5.3: suscripción al Coding Plan, pesos restringidos hasta aproximadamente el 28 de agosto. Kimi K3: API disponible a $3 / $15, pesos descargables desde el 27 de julio.

El foso de seguridad es la verdadera separación.
Si quitamos los benchmarks de codificación, la diferencia decisiva es la ciberseguridad. GLM-5.3 reporta 84.5 en CyberGym frente a los 80.0 de Kimi K3, y su puntuación en ExploitBench de 54.4 es casi el doble que los 32.2 de Kimi K3. En ExploitGym la brecha no es una diferencia, es otra categoría — 105 y 130 frente a 36 y 70 en las ejecuciones de 2 horas y 6 horas. Por eso los dos lanzamientos se sienten tan diferentes en la práctica: los pesos de Kimi K3 están al descubierto bajo una licencia MIT modificada, mientras que los de GLM-5.3 se están reteniendo para endurecer la seguridad, precisamente porque Z.ai dice que el modelo es lo bastante bueno para encontrar y explotar fallos que publicar los pesos de inmediato parecía irresponsable. Si tu trabajo implica auditar el código de otra persona, o defender el tuyo contra la búsqueda automatizada de vulnerabilidades, esta es la línea más relevante de toda la comparación — y también es la menos verificada de forma independiente.
Donde Kimi K3 contraataca
Las victorias de Kimi K3 se agrupan donde GLM-5.3 es más débil: el trabajo de repositorio a largo plazo. Mantiene la ventaja en DeepSWE y SWE-Marathon, lidera en Toolathlon Verified, y su ventana de salida de 1M de tokens significa que puede escribir una base de código completa o una larga traza de agente en una sola pasada. Su razonamiento siempre activo transmite la traza completa a la API, algo que los desarrolladores han calificado como mucho más útil para depurar agentes que las explicaciones resumidas opacas — con la salvedad operativa de que debes devolver los campos de razonamiento textualmente en las llamadas a herramientas, y no hay prefill de asistente. En el Intelligence Index de Artificial Analysis, Kimi K3 se sitúa en 57, cuarto en general, con un coste aproximado de 0,94 $ por tarea medido en su conjunto estándar. También es el modelo más caro que un laboratorio chino ha lanzado: 3 $ por millón de tokens de entrada y 15 $ por millón de salida, un precio de nivel Sonnet, mientras que a GLM-5.3 todavía no se le puede poner precio por token porque solo existe dentro de un plan de suscripción.
La realidad del acceso y el costo
Kimi K3 está disponible ahora mismo en OrcaRouter al precio de lista de Moonshot: 3 $ / 15 $ por millón de tokens, 0,30 $ por lecturas en caché, 0 % de margen — por lo que el trabajo de agente con contexto de 1M se puede invocar con la misma clave que el resto de tu stack, y los pesos abiertos son la opción de salida si quieres autoalojarlo. GLM-5.3 es el que resulta difícil de conseguir: una suscripción mensual de 18 $ a 168 $ con un sistema de puntos que gasta créditos a 6,9x en entrada y 24x en salida, precios fuera de horas punta que reducen a la mitad el gasto fuera de 14:00–18:00 hora de China, y sin API por token hasta que se complete la revisión de seguridad. La capa de enrutamiento en realidad aplana esta asimetría durante la ventana de dos semanas: cuando la API de GLM-5.3 aterrice en la misma clave, una llamada de panel puede ejecutar ambos modelos insignia de código abierto contra tus propias tareas y dejar que el juez los reconcilie — y si no puedes esperar, los pesos ya publicados de Kimi K3 lo convierten en el único de los dos que puedes desplegar hoy completamente en tus instalaciones.

¿Qué apuesta está pagando?
El veredicto honesto después de una semana es que ambas apuestas están dando resultados, pero en diferentes cargas de trabajo. Si tu trabajo es intensivo en terminal, cercano a la seguridad y orquestado por agentes, GLM-5.3 es la dirección más sólida según la evidencia que Z.ai ha publicado — y la brecha en ciberseguridad es lo suficientemente grande como para que valga la pena esperar dos semanas por los pesos para comprobarlo tú mismo. Si tu trabajo consiste en sesiones largas de repositorio, entrada multimodal, o cualquier cosa donde necesites los pesos hoy mismo, Kimi K3 es el único de los dos que está realmente disponible — y sus victorias en repositorios profundos son las que puedes verificar ahora mismo desde su API en vivo. Lo único que hay que tener claro: cada número en el cara a cara de esta comparación proviene de la propia tabla de Z.ai, así que trata las diferencias de codificación como direccionales hasta que un laboratorio independiente ejecute ambos. Eso es exactamente el tipo de verificación que traerá la espera de dos semanas.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
