
GLM 5.3 Prime: Los mismos pesos de GLM-5.3, a exactamente el doble de la tarifa
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
GLM 5.3 Prime cuesta $2.80 por millón de tokens de entrada y $8.80 por millón de tokens de salida. GLM-5.3, el modelo sobre el que se ejecuta, cuesta $1.40 y $4.40. Eso no es una diferencia de redondeo ni un margen promocional: es exactamente 2,0× en ambas líneas, y es lo único en lo que los dos productos discrepan. GLM 5.3 Prime no es un modelo nuevo. Lleva los propios pesos de GLM-5.3, los que Z.ai abrió el 25 de agosto de 2026, detrás de una pila de servicio más rápida. GLM-5.3 en sí se anunció el 14 de agosto de 2026 y llegó a la API el 18 de agosto. Nada del modelo subyacente cambió cuando apareció el ID Prime a finales de septiembre. Lo que cambió es que alguien le puso una segunda etiqueta de precio.
Si estás leyendo esto porque una lista de modelos te mostró un nombre desconocido junto a uno familiar, la respuesta corta es: estás viendo un nivel de servicio, no un lanzamiento. La respuesta larga merece dos minutos, porque la aritmética es inusualmente limpia y la procedencia es inusualmente turbia.
Qué es un nivel «Prime», en un párrafo
Un nivel de servicio es un segundo ID de producto apuntado a los mismos pesos, optimizado para el rendimiento en lugar del costo. No obtienes un modelo más grande, un contexto más largo, un mejor modo de razonamiento ni una superficie de herramientas más amplia. Obtienes tokens de salida más rápido, y pagas ese privilegio por cada token en lugar de por el tiempo de reloj que ahorraste. Ese intercambio es real y a veces correcto —un bucle de agente de varios pasos que realiza diez llamadas secuenciales realmente se beneficia de que cada llamada retorne antes—, pero es una compra de latencia, no una compra de capacidad, y debería tarificarse como tal.
La descripción del proveedor de GLM 5.3 Prime dice sin rodeos lo que normalmente se calla: es «la variante de alta velocidad del GLM-5.3 de Z.ai, que hereda todas sus capacidades y ofrece de 1,5 a 2× el rendimiento de salida mediante aceleración de inferencia». Capacidades completas. Misma ventana de contexto de 1.000.000 de tokens. Mismo límite de salida de 131.072 tokens. Texto de entrada, texto de salida. Razonamiento obligatorio, con bajo, alto y máximo como niveles de esfuerzo y máximo como predeterminado — idéntico al modelo base.
El tarifario, lado a lado
• Entrada — GLM 5.3 Prime $2.80 por 1M frente a GLM-5.3 $1.40 por 1M
• Salida — GLM 5.3 Prime $8.80 por 1M frente a GLM-5.3 $4.40 por 1M
• Entrada en caché — GLM 5.3 Prime $0.56 por 1M frente a GLM-5.3 $0.26 por 1M
• Multiplicador — 2.0× en las tres líneas, en ambas direcciones
• Contexto — 1,000,000 tokens en ambos
• Salida máxima — 131,072 tokens en ambos
• Razonamiento — obligatorio en ambos, los mismos tres niveles de esfuerzo, el mismo valor predeterminado
La línea de caché es la que la gente pasa por alto. Una lectura de caché es el token más barato que jamás comprarás a un modelo de frontera, y es donde las cargas de trabajo de agentes realmente gastan su presupuesto: el prompt del sistema, las definiciones de herramientas y la transcripción que va creciendo se vuelven a leer en cada turno. Duplicar la tarifa de caché duplica la partida más grande en una sesión larga de agente, lo que significa que la prima efectiva sobre una carga de trabajo real se acerca más a 2× de lo que sugiere la diferencia anunciada en los tokens de entrada nuevos. Si esperabas que la vía rápida fuera más barata en la práctica porque usas la caché de forma agresiva, no lo es.
¿Quién lo está vendiendo realmente?
Aquí es donde el listado se vuelve interesante, y donde un lector atento debería detenerse. La propia documentación de Z.ai, su resumen de modelos y su página de precios publicada no incluyen ninguna SKU Prime. Si buscas entre los ID de modelo del proveedor glm-5.3-prime no encuentras nada. El propio nivel de velocidad de Z.ai es un producto diferente en una línea completamente distinta: GLM-5.3-FlashX, que pertenece a la familia Flash, más económica, se lanzó el 18 de septiembre de 2026 y tiene un precio de $0.37 y $1.25 por millón de tokens.
Así que Prime es un producto del lado de la plataforma construido sobre los pesos de Z.ai. Dos detalles señalan de qué plataforma se trata. El primero es la formulación «throughput de salida de 1,5–2×», que es la misma redacción que usa un importante proveedor de nube para su propio modo de servicio acelerado —un modo que se habilita cambiando el ID del modelo, con capacidades y límites de uso explícitamente sin cambios. El segundo es que el listado nombra exactamente un proveedor upstream detrás del endpoint. Un único proveedor detrás de un SKU de nivel rápido no es como se sirve un modelo de pesos abiertos; es como se ve desde fuera el despliegue acelerado propio de una plataforma.
Nada de eso convierte a GLM 5.3 Prime en un mal producto. Lo convierte en un producto con un solo proveedor, lo cual es una cuestión de resiliencia que deberías plantearte antes de enrutar tráfico de producción a través de él.
Lo que vale la afirmación sobre la velocidad

La cifra de 1,5–2× es una afirmación de rendimiento (throughput) medida en las condiciones propias del proveedor, y el rendimiento es la métrica más sensible a esas condiciones. Los tokens de salida por segundo en una caché caliente con un prompt corto y un clúster inactivo no es el número que ve un agente de contexto largo. La medición independiente del modelo base sitúa a GLM-5.3 en aproximadamente 61 tokens de salida por segundo y a GLM-5.3-Flash en alrededor de 46, en un conjunto donde el promedio de la clase es 67, así que la opción más barata también es la más lenta, lo que es lo contrario de lo que sugieren los nombres. Esas son medianas de un conjunto de evaluación estandarizado, no picos.
También hay un costo más sutil. El esfuerzo de razonamiento predeterminado en ambos IDs es máximo, que es la configuración que produce las cadenas de pensamiento más largas. La velocidad y la verbosidad tiran en direcciones opuestas aquí: un nivel rápido que además razona a máxima longitud puede seguir siendo lento de extremo a extremo en un problema difícil, porque el cuello de botella es el número de tokens que el modelo decide generar, no la velocidad a la que los genera. Si tu carga de trabajo es intensiva en razonamiento, cambia a alto o bajo antes de pagar 2× por aceleración — el nivel de esfuerzo afectará más a tu latencia que el nivel de servicio.
Tres formas de comprar el mismo modelo

GLM-5.3 ahora existe en tres formas adquiribles, y no son tres modelos:
• GLM-5.3 a $1.40 / $4.40 — la tarifa base, capacidad completa, la versión con pesos abiertos publicados que puedes alojar tú mismo
• GLM 5.3 Prime a $2.80 / $8.80 — los mismos pesos mediante una pila acelerada, un único proveedor upstream, sin pesos de por medio
• GLM-5.3-FlashX a $0.37 / $1.25 — no es GLM-5.3 en absoluto, sino el nivel de velocidad de la familia Flash más económica, y con diferencia la forma más barata de comprar latencia
Esa tercera línea es la que vale la pena mirar con detenimiento. Si lo que realmente quieres son tokens más rápidos y eres flexible respecto de qué GLM los obtienes, FlashX ofrece aceleración en un modelo que ya cuesta aproximadamente una décima parte del modelo insignia, por menos de la mitad de lo que cuesta el modelo insignia sin acelerar. Prime solo tiene sentido si necesitas específicamente la calidad de razonamiento de GLM-5.3 y necesitas específicamente tenerla antes.
Dónde se sitúa esto de nuestro lado

Debemos ser claros sobre una cosa: OrcaRouter no aloja GLM 5.3 Prime, y tampoco alojamos GLM-5.3-FlashX. Ambas páginas de modelo devuelven un 404 en nuestro sitio. Si quieres el nivel acelerado, tendrás que comprarlo a la plataforma que lo vende, o desde la propia API del proveedor para el modelo base.
Lo que alojamos es GLM-5.3 y GLM-5.3-Flash, al precio de lista del proveedor y sin ningún margen por nuestra parte — los mismos $1.40 y $4.40 que ves en la tarifa propia de Z.ai, transferidos tal cual en lugar de recalculados. Eso importa más de lo que parece para un modelo cuyo precio ha cambiado dos veces en seis semanas. Como no añadimos ningún diferencial, un cambio de precio del proveedor está activo en nuestro lado el mismo día en que lo está en el suyo, sin necesidad de migración ni de ticket de soporte. Ambos ID están detrás de una sola clave de API junto con más de 200 modelos más, así que una prueba A/B entre GLM-5.3 y GLM-5.3-Flash es un cambio de una línea en el nombre del modelo en lugar de un segundo contrato, y la conmutación por error automática te cubre si un único proveedor upstream se degrada — que es el riesgo concreto que conlleva un nivel rápido de proveedor único.
¿Deberías pagar el 2×?
Págalo si un humano o un servicio en sentido ascendente está bloqueado esperando la respuesta, la carga de trabajo está limitada por la latencia en lugar de por el rendimiento, y ya has confirmado que el esfuerzo de razonamiento es el verdadero causante de tu latencia. No lo pagues si vas a ejecutar generación por lotes durante la noche, si tu volumen es lo bastante alto como para que un sobrecoste de 2× por token supere el tiempo real que ahorras, o si esperabas que el nivel fuera discretamente un modelo mejor. No lo es. Es GLM-5.3 con un cronómetro en marcha, y el cronómetro factura por token.
El planteamiento honesto para toda la familia GLM-5.3 en este momento es que Z.ai lanzó un modelo en agosto y el mercado ha pasado septiembre reempaquetándolo a cuatro precios diferentes. GLM 5.3 Prime es el más caro de esos paquetes. También es el que tiene el rastro documental más escaso, porque la empresa cuyo nombre aparece en los pesos no lo incluye en su listado. Eso no es motivo para evitarlo. Es un motivo para saber exactamente qué estás comprando antes de ponerlo en una ruta de producción.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
