
GLM 5.3 Prime vs GLM-5.3-Flash: una diferencia de precio de 18 veces entre dos modelos diferentes
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNUEVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencia76Código
Aquí está la comparación en una línea, para cualquiera que haya llegado con una decisión de compra ya medio tomada: GLM 5.3 Prime es GLM-5.3 vendido a través de un nivel de servicio acelerado a $2.80 y $8.80 por millón de tokens, y GLM-5.3-Flash es un modelo separado, nativamente multimodal, con sus propios pesos abiertos a $0.15 y $0.50. La diferencia entre ellos es de aproximadamente dieciocho veces tanto en entrada como en salida. Eso no es una diferencia de nivel — es un modelo diferente en una posición diferente dentro de la familia, y la única razón por la que los dos nombres aparecen uno al lado del otro en una lista de modelos es que ambos aparecieron con seis semanas de diferencia entre sí.
Equivocarse en esto sale caro en ambas direcciones. Si tratas a Flash como una versión barata de Prime, te sorprenderá lo que no puede hacer. Si tratas a Prime como un Flash más rápido, pagarás dieciocho veces de más por un modelo que no puede ver una imagen.
Empieza por lo que cada uno es en realidad
GLM-5.3-Flash es una mezcla de expertos multimodal de 320 mil millones de parámetros y 18 mil millones activos, lanzada el 26 de agosto de 2026 bajo la licencia MIT, con pesos en Hugging Face y ModelScope. Acepta texto, imágenes, vídeo y archivos de forma nativa en la misma solicitud, tiene una ventana de contexto de 1.000.000 de tokens y un límite de salida de 128.000 tokens, y fue preentrenada por separado en lugar de destilada del modelo insignia. Su diseño de atención híbrida lineal más dispersa reduce el cómputo de atención aproximadamente en un factor de tres y reduce la caché KV en más de cuatro veces en comparación con GLM-5.3, que es de donde proviene su ventaja de coste a nivel de arquitectura, no de un descuento.
GLM 5.3 Prime es GLM-5.3 — un modelo de mezcla de expertos dispersa con 40 mil millones de parámetros activos, anunciado el 14 de agosto de 2026, en la API desde el 18 de agosto, con los pesos abiertos el 25 de agosto — servido a través de una vía de alta velocidad. El mismo contexto de 1,000,000 de tokens, el mismo límite de salida de 131,072 tokens, texto de entrada y texto de salida, razonamiento obligatorio con esfuerzo low, high o max, con max como valor predeterminado. La documentación propia de Z.ai no incluye ningún SKU Prime; el nivel existe en una plataforma de terceros que nombra a un único proveedor upstream detrás de él.
El marcador

• Precio — GLM 5.3 Prime $2.80 / $8.80 por 1M frente a GLM-5.3-Flash $0.15 / $0.50 por 1M
• Entrada en caché — $0.56 por 1M frente a $0.03 por 1M
• Multiplicador — aproximadamente 18× en entrada y salida, antes de cualquier almacenamiento en caché
• Modalidad — solo texto frente a entrada de texto, imagen, video y archivos
• Parámetros — 40B activos en un MoE insignia frente a 320B totales / 18B activos
• Pesos — abiertos, bajo una licencia a medida con un umbral de ingresos frente a MIT, descargables hoy
• Salida máxima — 131,072 tokens frente a 128,000 tokens
• Contexto — 1,000,000 tokens en ambos
• Índice de inteligencia — GLM-5.3 obtiene 45 en el índice v4.3.2; GLM-5.3-Flash obtiene 42
• Costo por tarea del índice — $2.01 para el modelo insignia frente a $0.25 para Flash
• Velocidad — aproximadamente 61 tokens de salida por segundo frente a aproximadamente 46, ambas medianas medidas de forma independiente
• Acceso por suscripción — Prime no está en el Coding Plan de Z.ai; Flash sí, con 3× de cuota
Dos filas de esa lista merecen más que una viñeta. La primera es la brecha de inteligencia: tres puntos en el {{Artificial Analysis Intelligence Index}}, 45 frente a 42, bajo la revisión v4.3.2. Una revisión anterior de ese mismo índice situaba esos modelos en 60 y 57, y ese par más antiguo sigue circulando ampliamente en la cobertura de lanzamiento — no mezcles los dos, porque las cifras no son comparables entre revisiones. Tres puntos es una brecha estrecha que se manifiesta como una ligera mayor deriva en cadenas agénticas muy largas y una mayor sensibilidad a las instrucciones ambiguas, no como una clase distinta de modelo.
El segundo es la velocidad, y invierte la intuición que crean los nombres. Flash es el más lento de los dos en mediciones independientes —unos 46 tokens de salida por segundo frente a los 61 del modelo insignia, en una categoría donde la media es 67—. Flash se gana su nombre por el precio y por la multimodalidad, no por la latencia. Eso importa para la comparación, porque la razón habitual para recurrir a un modelo pequeño es que responde más rápido, y aquí no lo hace.
La decisión que realmente te corresponde tomar
Como los dos modelos difieren en tres ejes a la vez —modalidad, licencia y precio—, la elección suele resolverse en el primer eje y nunca llega a la aritmética. Flash lee imágenes y video; Prime no puede leer nada que no sea texto. Si tu carga de trabajo incluye una captura de pantalla, una página escaneada, una captura de interfaz o un fotograma de video, la comparación termina antes de que el precio entre en juego, y compras Flash.
Si tu carga de trabajo es texto puro y la pregunta es genuinamente sobre calidad, la respuesta honesta es que la brecha de tres puntos en el índice es todo lo que estás comprando por 18×. Que eso valga la pena depende por completo de si puedes verificar la salida. Cuando la respuesta es verificable —código que compila, una consulta que devuelve filas, una extracción estructurada que se valida contra un esquema—, el fallo ocasional de Flash es barato de detectar y barato de reintentar, y a una decimoctava parte del precio puedes reintentar muchísimas veces. Cuando la salida es prosa que una persona tiene que juzgar, o un plan largo de varios pasos sin ninguna comprobación intermedia, la brecha es más difícil de superar y la prima es más fácil de justificar.
Donde los pesos abiertos cambian las matemáticas
Flash tiene licencia MIT, y su cuantización usable más pequeña necesita del orden de 93 GB de memoria de acelerador — un único nodo de alta memoria para muchos equipos, y un error de redondeo en la factura para algunos. GLM-5.3 tiene una licencia personalizada que exige que los grandes operadores de modelos como servicio por encima de un umbral de ingresos pasen una revisión de seguridad, y su cuantización práctica más pequeña se sitúa en torno a los 217 GB, lo que constituye un despliegue de varios nodos para la mayoría.
Esa asimetría significa que la comparación real para un equipo de alto volumen no es los $8.80 de Prime frente a los $0.50 de Flash. Es los $8.80 de Prime frente a tu propio coste amortizado por millón de tokens de salida en hardware que ya posees, ejecutando pesos que puedes descargar hoy sin una conversación sobre licencias. Para un equipo con el hardware y el volumen, ese número con frecuencia es el más pequeño de los tres, y solo está disponible en el lado de Flash de esta comparación.
Comprar ambos, y comprarlos juntos

La mayoría de los sistemas de producción no necesitan elegir. El patrón que encaja con este par es un enrutador: Flash en la ruta predeterminada para trabajo de texto y multimodal, el modelo insignia en la escalada cuando una tarea es de horizonte largo o el primer intento falló una comprobación. Eso son dos ID de modelo y una función de decisión, y el costo de equivocarse un poco en la división son unos pocos centavos por cada mil solicitudes en lugar de un problema de arquitectura.
Alojamos GLM-5.3-Flash a $0.07 y $0.25 por millón de tokens — por debajo de los $0.15 y $0.50 de la lista del propio vendedor — y GLM-5.3 a la tarifa de lista del proveedor de $1.40 y $4.40, ambos sin margen añadido por nuestra parte — el precio de lista del proveedor se traslada tal cual en lugar de recalcularse, así que un cambio de tarifa del vendedor llega a nuestro lado el mismo día que llega al suyo. Ambos IDs están detrás de una sola clave junto con más de 200 otros modelos, lo que convierte la escalada de Flash al modelo insignia en un simple cambio de nombre de modelo dentro de una misma ruta de llamada en lugar de una segunda integración. La conmutación automática por error cubre el caso en que el único proveedor upstream detrás de un nivel rápido se degrada, y para un nivel como Prime, que lista exactamente un solo proveedor, eso no es una preocupación hipotética.
Deberíamos ser directos sobre los límites de eso: OrcaRouter no aloja GLM 5.3 Prime, y tampoco alojamos GLM-5.3-FlashX. Ambas páginas de modelo devuelven un 404 aquí. Si la aceleración de Prime es lo que necesitas, la comprarás en la plataforma que la vende.
Lo que realmente te diríamos

Si has leído hasta aquí buscando un ganador, la respuesta es que este par nunca fue una competencia. Flash gana en costo, en modalidad, en licencia y en capacidad de despliegue, y gana las cuatro por un amplio margen. La única pretensión del buque insignia son tres puntos de índice y unos 15 tokens de salida más por segundo, y cobra dieciocho veces el precio por ellos. Para la gran mayoría de las cargas de trabajo de texto, Flash es la opción predeterminada correcta y la carga de la prueba recae en la opción costosa.
Donde hay que tener cuidado es en el punto medio. Un equipo que necesita calidad de razonamiento de modelo insignia en texto y también necesita leer imágenes acabará ejecutando ambos modelos, y la tentación es enrutar todo al insignia porque es el que tiene la reputación. Ahí es donde el 18× se convierte silenciosamente en una partida real. Enruta el trabajo multimodal a Flash, escala en caso de fallo y comprueba cuál es tu tasa real de escalado antes de asumir que es alta.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
