
GPT-6.1 Sol vs GLM-5.3: los pesos se enviaron, y la factura no se movió
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
OpenAI lanzó GPT-6.1 Sol el 29 de septiembre de 2026 en su keynote de DevDay, y Z.ai lanzó GLM-5.3 seis semanas antes, el 18 de agosto de 2026, y luego retuvo el checkpoint durante una semana. Esa retención ya terminó: zai-org/GLM-5.3 lleva en Hugging Face desde el 25 de agosto, un checkpoint BF16/FP8 de aproximadamente 753.000 millones de parámetros, de los cuales unos 40.000 millones están activos por token, y desde entonces ha superado los 1,4 millones de descargas. Así que la pregunta que la mayoría de las comparativas se han estado haciendo desde agosto —¿es un modelo abierto o uno de alquiler?— ya tiene respuesta, y la respuesta no cambió la aritmética. En la tabla independiente, GPT-6.1 Sol obtiene 51,8 y cuesta 0,72 $ por tarea de índice completada; GLM-5.3 obtiene 44,8 y cuesta 2,01 $. Ahora puedes poseer el modelo más barato por token y aun así pagar casi tres veces más por trabajo terminado.
Lo que cada modelo realmente es
GPT-6.1 Sol es el modelo GPT-6 de gama media de OpenAI, un escalón por debajo del insignia GPT-6 Astra y por encima del económico GPT-6 Luna. Tiene una ventana de contexto de 1,050,000 tokens con un límite de salida de 128,000 tokens y una fecha de corte de conocimiento del 30 de abril de 2026, y acepta texto, imágenes y archivos como entrada. El razonamiento va desde low hasta max con un valor predeterminado de medium; los none y minimal son valores que GPT-6 Sol aceptaba y que ahora devuelven un error, que la propia guía de migración de OpenAI aborda diciendo a los desarrolladores que sustituyan por low. Cuesta $2.00 por millón de tokens de entrada y $10.00 por millón de salida, con la entrada en caché a $0.10.
GLM-5.3 es el actual buque insignia de Z.ai para la ingeniería de software y el trabajo agéntico de horizonte largo, construido sobre la misma base de mezcla de expertos que GLM-5.2, con las mejoras procedentes del post-entrenamiento en lugar de un modelo más grande. Es de texto a texto —sin visión, a ningún precio—, con una ventana de 1M de tokens, un límite de salida de 128.000 tokens y el pensamiento activado de forma permanente. No existe un modo sin razonamiento, lo que constituye una restricción estricta para una llamada sensible a la latencia. Z.ai lo anuncia a 1,40 $ de entrada y 4,40 $ de salida por millón de tokens, con la entrada en caché a 0,26 $; nuestro propio catálogo lo ofrece a 1,26 $ y 3,96 $ con una lectura de caché de 0,234 $, así que la tarifa del proveedor es la cifra más conservadora y la que conviene tomar como base para argumentar.
La tabla de tarifas, y la línea que la invierte
Una línea por dimensión, ambos lados en cada una:
• Entrada — GPT-6.1 Sol $2.00 por 1M vs GLM-5.3 $1.40 por 1M; GLM es 30% más barato
• Salida — GPT-6.1 Sol $10.00 por 1M vs GLM-5.3 $4.40 por 1M; GLM es 56% más barato
• Entrada en caché — GPT-6.1 Sol $0.10 por 1M vs GLM-5.3 $0.26 por 1M; el orden se invierte, Sol es 2.6× más barato
• Cláusula de contexto largo — GPT-6.1 Sol vuelve a tarificar toda la solicitud por encima de 272,000 tokens de entrada a 2× en entrada y caché y 1.5× en salida vs GLM-5.3, sin cláusula equivalente en la ficha publicada
• Contexto y salida — 1,050,000 de entrada / 128,000 de salida vs 1M de entrada / 128,000 de salida; una diferencia del 5%, irrelevante
• Modalidad — texto, imagen y archivo de entrada, texto de salida vs solo texto
• Nivel mínimo de razonamiento — GPT-6.1 Sol bajo, medio (predeterminado), alto, xhigh, máximo vs GLM-5.3 siempre activo, sin nivel mínimo al que bajar
• Pesos — cerrado, solo API vs abierto, descargable, FP8
• Puntuación independiente, Artificial Analysis v4.3.2 con esfuerzo máximo — 51.8 vs 44.8
• Costo independiente por tarea del índice — $0.72 vs $2.01
• Tokens de salida para la ejecución del índice — 67 millones vs 210 millones
img src="2.png" alt="Un marcador comparativo generado de dos columnas titulado 'GPT-6.1 Sol vs GLM-5.3 - el marcador'. Columna izquierda 'GPT-6.1 Sol': filas que dicen 'Índice de inteligencia: 51.8', 'Coste por tarea del índice: $0.72', 'Precio de entrada: $2.00 por 1M', 'Precio de salida: $10.00 por 1M', 'Tokens de salida en la ejecución del índice: 67M', 'Pesos: cerrado'. Columna derecha 'GLM-5.3': filas que dicen 'Índice de inteligencia: 44.8', 'Coste por tarea del índice: $2.01', 'Precio de entrada: $1.40 por 1M', 'Precio de salida: $4.40 por 1M', 'Tokens de salida en la ejecución del índice: 210M', 'Pesos: abierto en Hugging Face'. Un pie de página dice 'Cifras independientes según Artificial Analysis v4.3.2 a máximo esfuerzo; precios de lista de los proveedores.' El logotipo de OrcaRouter se sitúa en la esquina inferior derecha." /> Ese último par es donde se decide este enfrentamiento, y no es un efecto sutil.

El problema de los 210 millones de tokens
Artificial Analysis ejecuta la misma batería de diez evaluaciones con cada modelo de la tabla y publica los recuentos de tokens que respaldan cada puntuación. GLM-5.3 generó aproximadamente 210 millones de tokens de salida al completar la ejecución. GPT-6.1 Sol generó 67 millones. Si se compara con la clase de comparación de cada modelo en la tabla, los 210 millones de GLM-5.3 se sitúan por encima de una mediana de clase de unos 140 millones, mientras que los 67 millones de Sol quedan muy por debajo de la mediana de unos 81 millones de la clase insignia en la que se puntúa. Dado que la salida es el lado caro de toda tarifa, el descuento anunciado del 56 % de GLM-5.3 en la línea de salida no resiste el contacto con la medición: emite 3,1× los tokens a 0,44× el precio, y 3,1 × 0,44 es 1,37; GLM-5.3 es el modelo más caro en esta carga de trabajo a pesar de una tarifa sustancialmente más barata.
La propia cifra de coste por tarea del consejo confirma la dirección y el tamaño aproximado. $2.01 frente a $0.72 es 2,8×, una brecha mayor de lo que implica la proporción de tokens por sí sola, porque GLM-5.3 también paga más en las líneas de entrada y de caché por tarea. Merece la pena ser precisos sobre lo que esto demuestra y lo que no: la ejecución del índice son diez evaluaciones fijas, y la verbosidad en ellas no es lo mismo que la verbosidad en tu tráfico. Pero para un comprador, los tokens son lo que se factura, y la forma de la diferencia es la misma en cualquier conjunto de tareas en el que el modelo tenga que producir una respuesta larga.
La compensación parcial es la línea de entrada en caché. La lectura de caché de GLM-5.3 es de $0,26 frente a una base de $1,40, y la de GPT-6.1 Sol es de $0,10 frente a una base de $2,00: Sol gana por un factor de 2,6 en una tarifa que domina cualquier carga de trabajo con un prefijo estable. Si tu tráfico es un corpus fijo grande con una respuesta de un párrafo, GLM-5.3 es claramente la opción más barata y deberías elegirla. Si tu tráfico se parece al tráfico para el que se crearon ambos modelos —bucles de agentes, ediciones a escala de repositorio, salidas generadas largas—, la ventaja de la entrada en caché se reduce a ruido frente a una proporción de tokens de 3×.
Dónde quedan los números del proveedor
Las cifras de lanzamiento de Z.ai son sólidas y, como siempre, no reproducidas. Terminal-Bench 2.1 en 88,2, DeepSWE v1.1 en 66,9, CyberGym en 84,5, ExploitBench en 54,4, AutomationBench en 48,2, GDPval-AA v2 en 1769 Elo. La única cifra que vale la pena leer dos veces es Terminal-Bench 3.0 en 28,3 —el benchmark sucesor, y la corrección de los 88,2 en el anterior. Un modelo puede ser excelente en el benchmark al que se orientó su postentrenamiento y normal en la siguiente generación del mismo benchmark.
Los números de lanzamiento de OpenAI para GPT-6.1 Sol están enmarcados por completo en torno al costo por tarea completada y no a la puntuación bruta: DeepSWE v1.1 supera el mejor resultado de GPT-6 Sol por 6,4 puntos porcentuales con un esfuerzo de razonamiento menor, AutomationBench 1.0.6 está 2,2 puntos por encima de Claude Opus 5.5 con esfuerzo medio, OSWorld 2.0 supera en siete puntos a GPT-6 Sol con esfuerzo máximo, y Terminal-Bench Science 0.1 más que duplica a GPT-6 Sol con menos de la mitad del costo por tarea. Ten en cuenta que estos son los arneses de OpenAI con los ajustes de OpenAI sobre el conjunto de benchmarks seleccionado por OpenAI, y que ninguno de ellos ha sido reproducido de forma independiente.
El solapamiento entre los conjuntos publicados de los dos proveedores es escaso, y la única comparación directa disponible es sobre el mismo benchmark: Z.ai informa 66.9 en DeepSWE v1.1, OpenAI informa 68.8 para GPT-6 Sol —el modelo al que reemplaza 6.1— y una mejora de 6.4 puntos para 6.1 Sol sobre su propio predecesor. Dos puntos de diferencia en la comparación reportada por el proveedor, y aproximadamente seis en el delta propio de OpenAI. Eso se acerca a una comparación controlada, y dice lo que dice el panel independiente: paridad casi total en capacidad, una brecha amplia en lo que cuesta terminar el trabajo.
Una API, o dos contratos
Ambos modelos están en OrcaRouter, que es la parte inusual de esta combinación. GPT-6.1 Sol llegó al catálogo al precio de lista del propio OpenAI el día del lanzamiento — $2.00 y $10.00 por millón de tokens, entrada en caché $0.10, con el tramo de 272,000 tokens a $4.00 y $15.00 trasladado exactamente tal como lo indica el proveedor — y GLM-5.3 se sitúa junto a él a $1.26 y $3.96 con una lectura de caché de $0.234. No se añade nada por encima de ninguno de los dos: la plataforma traslada el precio de lista del proveedor sin cambios, y por eso un recorte de precio del proveedor aparece en nuestro lado el mismo día en lugar de después de que un revendedor renegocie.

Eso importa más para este par específico que para la mayoría. La decisión entre ellos no es "cuál es mejor" — es un umbral en tu propia longitud de salida, y se moverá la primera vez que Z.ai ajuste su tarifa o OpenAI cambie el límite del nivel 6.1. Mantener ambos detrás de una sola clave, con conmutación automática entre ellos y una regla de enrutamiento que cambias en la configuración en lugar de en un despliegue, es lo que te permite probar ese umbral en tráfico real en lugar de discutir sobre él. Si la línea de caché de Sol gana en tu carga de trabajo, enruta por ella; si tus longitudes de respuesta se mantienen cortas y la tarifa plana de GLM-5.3 sin acantilado de contexto gana en el segmento, enruta por esa en su lugar — la misma clave, sin segundo contrato, sin segunda factura.

¿Cuál, si tienes que elegir hoy?
• Salidas generadas largas, bucles agénticos, trabajo intensivo en salida — GPT-6.1 Sol, y el margen se acerca al triple una vez aplicados los recuentos de tokens. Aquí es donde la tarjeta de tarifas miente y la medición no.
• Prefijo estable, respuesta corta — GLM-5.3. Sus tarifas de entrada en caché y de entrada son realmente mejores y la verbosidad nunca llega a pasar factura.
• Cualquier solicitud que supere los 272.000 tokens de entrada — GLM-5.3, porque GPT-6.1 Sol vuelve a tarificar toda la solicitud en ese umbral y la tarjeta de GLM-5.3 no tiene un tramo equivalente.
• Cualquier cosa con una imagen o un documento como entrada visual — GPT-6.1 Sol. GLM-5.3 es solo texto y esto no está ni cerca.
• Inferencia dentro de tu propio perímetro, o una cobertura frente a cambios en los términos de un proveedor — GLM-5.3, y ahora la descarga existe en lugar de ser una promesa. Presupuesta el hardware: el checkpoint es un artefacto FP8 grande y el autoalojamiento es una decisión de capital, no de API.
• Llamadas sensibles a la latencia — ninguno de los dos sin cuidado. GLM-5.3 no tiene forma de desactivar el razonamiento; GPT-6.1 Sol tiene un mínimo en bajo, y su propio tiempo hasta el primer token en la tabla independiente midió 332 segundos frente a una mediana de la tabla de 3,7.
Comparados en este artículo3
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
