
GPT-6 Luna vs GLM-5.3: el modelo de pesos abiertos que todavía no puedes descargar
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.3 es el mejor modelo. Obtiene 45 en el Índice de Inteligencia de Artificial Analysis con el máximo esfuerzo frente a GPT-6 Luna, que obtiene 37; iguala a Mythos 5 en evaluaciones seleccionadas de ciberseguridad según Z.ai, y es el modelo de pesos abiertos líder en varios de los rankings compuestos. Además, ahora mismo, es una API que alquilas en lugar de un modelo que posees: Z.ai retrasó la publicación de los pesos aproximadamente dos semanas por preocupaciones de ciberseguridad, y la descarga que se supone que es el objetivo principal de un buque insignia de pesos abiertos todavía no está disponible.
Ese retraso es la clave de este enfrentamiento, y cambia la aritmética de una forma que las tablas de precios pasan por alto. GPT-6 Luna llegó el 22 de septiembre de 2026 a $0.10 por millón de tokens de entrada y $0.50 por millón de salida, disponible de forma general, sin condiciones. GLM-5.3 llegó el 18 de agosto de 2026 a $1.40 y $4.40 —catorce veces la tarifa de entrada de Luna y casi nueve veces su tarifa de salida— con sus pesos retenidos. Así que la comparación no es abierto contra cerrado. Es un modelo cerrado al que puedes invocar hoy a una décima parte del costo, frente a un modelo abierto al que solo puedes invocar hoy, con un precio como si estuvieras comprando lo que aún no puedes tener.
Dos modelos, con un mes de diferencia, dos ofertas muy diferentes.
GPT-6 Luna es el nivel pequeño de la generación GPT-6 de OpenAI, lanzado junto a GPT-6 Sol a $2.00/$10.00 y por debajo del insignia GPT-6 Astra a $10.00/$50.00. Cuenta con una ventana de contexto de 1,050,000 tokens, un límite de salida de 128,000 tokens, entrada de texto e imágenes, y una escala de razonamiento que va de none a low, medium, high, xhigh y max — con medium como predeterminado. OpenAI lo describe como el modelo más eficiente de la familia para trabajo enfocado y de gran volumen, y la tarifa lo confirma: la entrada en caché a $0.01 por millón es una décima parte de una tarifa sin caché que ya de por sí es baja.
GLM-5.3 es el actual buque insignia de Z.ai para ingeniería de software compleja y trabajo agéntico de largo horizonte, lanzado el 18 de agosto de 2026. Es de entrada de texto y salida de texto, cuenta con una ventana de contexto de 1 M de tokens con un límite de salida de 128.000 tokens, y tiene el razonamiento siempre activado: no existe un modo sin razonamiento. Z.ai describe una mejora de aproximadamente el 50 % en la experiencia de programación respecto a GLM-5.2 y lo posiciona para la programación a escala de repositorio y la ingeniería autónoma de múltiples pasos. Los pesos, cuando se publiquen, serán la característica estrella; hoy, la API es lo que está en funcionamiento.
Lo que realmente dicen las dos tarjetas de tarifas
Una línea por dimensión, ambos lados en cada una:
• Entrada por 1M — GPT-6 Luna $0.10 vs GLM-5.3 $1.40
• Salida por 1M — GPT-6 Luna $0.50 vs GLM-5.3 $4.40
• Entrada en caché — GPT-6 Luna $0.01 por 1M frente a GLM-5.3 $0.26 por 1M, un 81 % de descuento sobre su propia tarifa de entrada
• Índice de Inteligencia AA — GPT-6 Luna 37 con esfuerzo máximo vs GLM-5.3 45 con esfuerzo máximo
• Puntuación con esfuerzo predeterminado — GPT-6 Luna 29 en su nivel medio predeterminado frente a GLM-5.3 con razonamiento siempre activo, medido al máximo
• Tokens de salida en la ejecución del índice — GPT-6 Luna 150M vs GLM-5.3 210M, frente a una mediana del ranking de 140M
• Costo de ejecutar el índice — GPT-6 Luna $122.39 frente a GLM-5.3 $2,503.48
• Costo por tarea de índice — GPT-6 Luna alrededor de $0.07 vs GLM-5.3 alrededor de $0.68
• Contexto y salida — GPT-6 Luna 1.050.000 de entrada / 128.000 de salida vs. GLM-5.3 1 M de entrada / 128.000 de salida
• Cláusula de contexto largo — GPT-6 Luna 2x de entrada y caché, 1,5x de salida por encima de 272K de entrada, solicitud completa frente a GLM-5.3 sin cláusula equivalente en la tarjeta publicada
• Interruptor de desactivación del razonamiento — GPT-6 Luna: de ninguno a máximo vs. GLM-5.3, siempre activado, sin modo sin razonamiento
• Pesos — GPT-6 Luna cerrado, solo API vs GLM-5.3 abierto por compromiso, lanzamiento retrasado

El impuesto a la verbosidad es el número que decide esto
La brecha de índice de ocho puntos es real y la brecha de precio es mayor, y ninguna es la cifra que más importa. La que importa son los tokens de salida por tarea terminada, porque ahí es donde una ventaja de capacidad de ocho puntos se paga por sí misma o no.
La ejecución del índice de Artificial Analysis es la comparación controlada más limpia disponible: la misma suite, el mismo arnés de prueba, ejecutados contra ambos modelos. GLM-5.3 generó 210 millones de tokens de salida al completarla. GPT-6 Luna generó 150 millones. Frente a una mediana del ranking de 140 millones, ambos son verbosos: GLM-5.3, un 50 % por encima de la mediana; GPT-6 Luna, alrededor de una décima parte por encima. Pero la dirección de esa diferencia se agrava en el precio frente al modelo de Z.ai: emite un 40 % más de tokens y cobra 8,8 veces más por cada uno.
Si juntamos los dos, el coste por tarea de indexación completada sale a unos $0,68 para GLM-5.3 frente a unos $0,07 para GPT-6 Luna — una brecha de aproximadamente diez veces, mayor que la proporción de la tarifa bruta, porque el modelo más caro también es el más verboso. Esa es la forma honesta de esta combinación. GLM-5.3 te compra ocho puntos de índice por diez veces el dinero por trabajo terminado, y si eso es una buena compra depende enteramente de si tu carga de trabajo es una en la que ocho puntos son la diferencia entre funcionar y no.
Para mucho tráfico de producción, no lo es. Para un agente de programación que trabaja en un repositorio al límite de lo que el modelo puede hacer, con frecuencia sí lo es, y ninguna ventaja de precio, por grande que sea, cierra una brecha de capacidad en una tarea que falla.
Por qué los pesos abiertos cambian la respuesta, y por qué el retraso la revierte
El argumento habitual a favor de un modelo insignia de pesos abiertos es que el precio por token es temporal. Alquilas hasta que tu volumen justifique la compra; entonces descargas el modelo y el coste marginal de un token pasa a ser la electricidad. Según ese argumento, los $1.40/$4.40 de GLM-5.3 no son en realidad catorce veces los $0.10 de GPT-6 Luna: son un precio puente en el camino hacia cero, y la tarifa más barata del modelo cerrado es un alquiler sin salida.
Ese argumento es correcto, y actualmente está suspendido. Z.ai retuvo los pesos durante aproximadamente dos semanas por hallazgos de ciberseguridad, lo que significa que la rampa de salida que justifica la prima aún no existe. Hasta que exista, GLM-5.3 es una API con tarificación por uso a diez veces el costo por tarea de un modelo que está cuatro puntos de índice por detrás de él en la tabla general y un punto por detrás en la tabla de programación — y el comprador está pagando precios de pesos abiertos por acceso a pesos cerrados.
Hay un punto de segundo orden que merece mención. El retraso no es un escándalo; es un proveedor tomándose en serio un hallazgo de capacidades, y un modelo que encuentra vulnerabilidades con eficacia es exactamente el tipo de modelo que un laboratorio debería ser cuidadoso a la hora de publicar como archivo descargable. Pero sí significa que la fecha de publicación de los pesos es ahora la fecha más importante de esta comparación, y no se ha publicado. Un equipo que elige entre estos dos modelos con un horizonte de doce meses está eligiendo entre un modelo cuyos términos pueden cambiar el mes que viene y un modelo cuyos términos no pueden — y solo uno de ellos tiene un precio acorde.
La superficie de migración es pequeña.
Ambos modelos hablan una superficie de chat completions compatible con OpenAI, ambos tienen una ventana de contexto de clase 1M y ambos limitan la salida a 128.000 tokens, por lo que un portado entre ellos está más cerca de un cambio de configuración que de una reescritura. Las diferencias que de verdad darán problemas son de comportamiento, no estructurales.
La cláusula de contexto largo de GPT-6 Luna es la costosa: las solicitudes de más de 272.000 tokens de entrada se facturan al doble de las tarifas de entrada y de caché, y a 1,5 veces la tarifa de salida, por la totalidad de la solicitud, así que una llamada de 300.000 tokens cuesta el doble de lo que cuesta ese mismo trabajo dividido en dos. La ficha publicada de GLM-5.3 no contiene ninguna cláusula equivalente, lo que, en solicitudes únicas realmente grandes, reduce considerablemente la diferencia de precio y puede invertirla en un trabajo con gran volumen de salida.
La configuración de razonamiento va justo en la dirección contraria. GLM-5.3 razona siempre activado y no ofrece ninguna forma de desactivarlo, lo que constituye una restricción insalvable para cualquier cosa sensible a la latencia: un clasificador o un enrutador no puede usarlo. GPT-6 Luna ofrece none, low, medium, high, xhigh y max, y el valor predeterminado es medium, donde obtiene 29 en lugar de 37. Ese único parámetro es la diferencia entre que GPT-6 Luna quede ocho puntos de índice por detrás del modelo de Z.ai y que quede dieciséis por detrás, y un equipo que migra sin configurarlo explícitamente está ejecutando la segunda configuración mientras cree que compró la primera.
GLM-5.3 está en OrcaRouter al precio de lista de Z.ai, con un precio de transferencia directa que traslada un cambio de tarifa del proveedor a nuestro lado el mismo día en lugar de esperar a que un revendedor renegocie, lo cual importa más de lo habitual en un modelo cuyo número destacado se espera que cambie cuando lleguen los pesos. GPT-6 Luna no está en nuestro catálogo a día de hoy y se accede a él a través de la propia API de OpenAI. Un equipo que use ambos, que es la configuración racional aquí dado lo diferentes que son en los extremos, usa una clave para GLM-5.3 junto con la que ya utilice para OpenAI, y mueve el tráfico entre un clasificador de cinco centavos y un agente de programación a escala de repositorio cambiando una ruta en lugar de un despliegue.

La llamada
Use GPT-6 Luna para cualquier cosa consumida por programas y de gran volumen. Clasificación, extracción, enrutamiento, resumen masivo, el bucle interno de un agente. A $0.10/$0.50, con la entrada en caché a un centavo y Batch a la mitad de la tarifa estándar, es un orden de magnitud más barato por tarea finalizada que GLM-5.3 y la brecha de ocho puntos en el índice no será visible en tu evaluación. Establece el parámetro effort explícitamente y mantén tus llamadas largas por debajo de 272,000 tokens.
Elige GLM-5.3 cuando la tarea sea la difícil y la respuesta importe más que la factura. Ingeniería de software a escala de repositorio, trabajo autónomo de varios pasos, cualquier cosa en la que ocho puntos de índice sean la diferencia entre que una tarea se complete y que falle. La verbosidad es un impuesto real y el coste de la tarea diez veces mayor también lo es, pero un modelo que termina es más barato que uno que tiene que reintentarse.
Y atentos a los pesos. El día en que Z.ai publique la descarga de GLM-5.3 es el día en que cambia el hecho central de esta comparación, y es la única fecha de esta página que aún no está en el calendario.

Comparados en este artículo2
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
