
Ling-3.1-flash vs GLM-5.3-Flash: Cuatro veces el rendimiento frente a un punto de índice
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 151 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAIGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 104 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Ling-3.1-flash y GLM-5.3-Flash están a un punto de distancia en el Artificial Analysis Intelligence Index —41 frente a 42—, lo que hace que parezcan la misma decisión dos veces. No lo son. GLM-5.3-Flash genera salida a 53,0 tokens por segundo en la propia API de Z.ai; Ling-3.1-flash la genera a 211,0 tokens por segundo en la de InclusionAI. Eso es una diferencia cuádruple en rendimiento, y es mucho mayor que cualquier diferencia que el índice marque entre ellos. Uno de los modelos es el más capaz de los dos en casi todos los ejes de calidad y es abierto bajo licencia MIT. El otro es el que termina primero, es cerrado y no tiene precio, licencia ni checkpoint publicados. Elegir entre ellos es una cuestión de qué está esperando tu carga de trabajo.
El eje Ling-3.1-flash gana de forma contundente
La velocidad no es una nota al pie cuando eliges entre modelos del mismo nivel de capacidad y, aquí, es todo el argumento a favor del modelo Ant.
• Rendimiento de salida — {{1}}Ling-3.1-flash{{/1}} {{2}}211.0 tokens por segundo{{/2}} en la API de {{3}}Inclusion{{/3}} frente a {{4}}GLM-5.3-Flash{{/4}} {{5}}53.0 tokens por segundo{{/5}} en la de {{6}}Z.ai{{/6}}. Cuatro veces la tasa de generación.
• Tiempo hasta el primer token — Ling-3.1-flash 1,80 segundos frente a GLM-5.3-Flash 3,18 segundos. El modelo de Ant empieza a responder mientras el modelo de Z.ai todavía está pensando, lo cual importa más que el rendimiento en el uso interactivo y en streaming.
• Tiempo por tarea del Intelligence Index — Ling-3.1-flash: alrededor de 357 segundos frente a GLM-5.3-Flash: alrededor de 979 segundos. Una sola tarea de evaluación le lleva a GLM-5.3-Flash casi el triple de tiempo de principio a fin, porque es más lento tanto por token como al iniciar.
Para un bucle de agente que hace una docena de llamadas secuenciales, o un producto en el que una persona observa cómo llegan los tokens, eso no es un factor de desempate: es la razón principal para preferir un modelo. GLM-5.3-Flash es el mejor modelo sobre el papel y el más lento en la ruta de la solicitud.
Donde GLM-5.3-Flash es simplemente mejor
En todos los demás casos, y la lista es lo bastante larga como para que la ventaja de rendimiento tenga que ganarse su lugar.
• Fiabilidad del conocimiento — GLM-5.3-Flash obtiene +7,47 en AA-Omniscience, el mejor de los tres modelos de la gama Flash, con una tasa de alucinación del 27,6 % en las preguntas respondidas. Ling-3.1-flash obtiene +2,22 con una tasa de alucinación del 37,9 %. En una medida que penaliza más la invención que el rechazo, la brecha es real y apunta en la misma dirección que el índice.
• Conocimiento científico — GLM-5.3-Flash registra 0.912 en GPQA Diamond. Ling-3.1-flash no tiene publicada ninguna fila de GPQA Diamond. Lo mismo ocurre con DeepSeek V4.1 Flash (Max). Un modelo con 0.91 en preguntas de ciencia de nivel de posgrado es un instrumento distinto de uno que no ha sido medido en ellas.
• Modalidad — GLM-5.3-Flash acepta texto, imágenes y video. Ling-3.1-flash solo acepta texto. Esto no es una brecha de rendimiento que se pueda cerrar con un benchmark; es una capacidad que está ausente.
• Pesos y licencia — GLM-5.3-Flash es de pesos abiertos bajo MIT, descargable y autoalojable. Ling-3.1-flash no ha publicado ningún checkpoint, ni texto de licencia, y figura clasificado como propietario.
• Trabajo de conocimiento agéntico — GLM-5.3-Flash con 1.453,73 Elo en AA-Briefcase v1.1 frente a los 1.400,35 de Ling-3.1-flash, en un benchmark diseñado específicamente en torno a tareas de trabajo de conocimiento y no a la conducción de terminal.
• Precio — GLM-5.3-Flash se publica a $0.15 por millón de entrada y $0.50 por millón de salida en la API de Z.ai, frente a los $0.30 y $0.90 de Ling-3.1-flash. La mitad de la tarifa de entrada y aproximadamente la mitad de la tarifa de salida, de un modelo con una puntuación de índice más alta y pesos abiertos.

Las filas donde el modelo Ant responde
Ling-3.1-flash no es superado en todo. En el trabajo agéntico en terminal va ligeramente por delante y en coding-science está a la par:
• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. En la práctica, un empate, y ambos se sitúan por debajo del nivel de frontera.
• SciCode — Ling-3.1-flash 0.541 vs GLM-5.3-Flash 0.516. Una victoria por escaso margen.
AutomationBench-AA — 0.617 vs 0.604. Otra victoria ajustada.
• GDPval-AA — Ling-3.1-flash 1.621,75 Elo vs. GLM-5.3-Flash 1.646,86. GLM se lleva esta de vuelta.
Lea las cuatro líneas en conjunto y la forma queda clara. Cuando los dos modelos pueden separarse en absoluto, la separación queda dentro del ruido de una sola ejecución de evaluación. La diferencia de un punto en el índice entre ellos no es una clasificación; es un lanzamiento de moneda ligeramente inclinado hacia GLM por las filas de fiabilidad. Lo que no es un lanzamiento de moneda es la brecha de throughput de 4× y la brecha de precio de 2×, y ambas apuntan en la dirección opuesta.
También hay un detalle de servicio que vale la pena señalar, porque cambia el tamaño de esa brecha de rendimiento según desde dónde llames a un modelo. La propia API de Z.ai mide 53,0 tokens por segundo. La medición de siete días de nuestro propio catálogo para GLM-5.3-Flash en nuestras rutas muestra 150,6 tokens por segundo de salida con una latencia mediana de 4,2 segundos hasta el primer token. Los mismos pesos servidos desde un despliegue diferente se ejecutan casi tres veces más rápido. Las cifras de rendimiento de un proveedor son una propiedad del proveedor, no de un modelo.
Especificación, línea por línea
Sujeto primero en cada línea:
• Tamaño — Ling-3.1-flash 560B en total / 25B activos frente a GLM-5.3-Flash 320B en total / 18B activos.
• Contexto declarado — 1M de tokens en ambos. La fila de razonamiento de contexto largo de GLM-5.3-Flash mide 0.80 en AA-LCR; la de Ling-3.1-flash, 0.83. Ambos están cerca del 0.84 de DeepSeek V4.1 Flash (Max), es decir, el razonamiento de contexto largo ya no es un diferenciador en este nivel.
• Techo de salida — GLM-5.3-Flash 128.000 tokens en nuestro catálogo frente a Ling-3.1-flash sin un máximo publicado. Uno de estos se puede dimensionar para generación larga y el otro no.
• Índice — 41 vs 42.
• Rendimiento — 211,0 tokens por segundo frente a 53,0 en las API de los proveedores, 150,6 medidos en nuestras rutas.
• Pesos — propietarios sin licencia frente a abiertos bajo MIT.
• Modalidad — solo texto vs entrada de texto, imagen y video.
• Precio — $0.30 / $0.90 por millón de entrada / salida frente a $0.15 / $0.50 en la API de Z.ai.
Cómo ejecutar realmente esta comparación
GLM-5.3-Flash ya está en el catálogo de OrcaRouter, listado a $0.075 por millón de tokens de entrada, $0.25 por millón de tokens de salida y $0.0173 por millón de lecturas de caché — lee la ficha en vivo en lugar de este párrafo, porque las tarifas de servicio cambian y el arreglo de transferencia directa significa que un cambio de precio del proveedor se refleja en nuestro lado el mismo día. El valor de ese arreglo para esta comparación específica es que la apertura y la ventaja de precio de GLM-5.3-Flash son las dos cosas que lo convierten en la opción predeterminada sensata, y una ruta cerrada con 0 % de margen es la forma de seguir probando Ling-3.1-flash contra él sin añadir una relación con un proveedor.
Ling-3.1-flash no está en nuestro catálogo — una consulta a nuestra API pública de modelos devuelve not-found para el modelo bajo InclusionAI, y este artículo no dará a entender que lo servimos. Funciona mediante la propia API de Ant y las plataformas de terceros que distribuyen la versión, que es el alcance honesto de su disponibilidad.
La forma productiva de esta comparación no es la de «o lo uno o lo otro». GLM-5.3-Flash es abierto, el más barato, multimodal, más fiable en preguntas de conocimiento y está disponible a través de 23 proveedores: esa es la ruta por defecto. El argumento a favor de Ling-3.1-flash es el rendimiento y el TTFT en bucles agénticos, y su costo es que es cerrado, solo texto, más caro y accesible por menos puertas. Dirige el trabajo interactivo y sensible a la latencia hacia el modelo rápido, mantén el trabajo por lotes, intensivo en conocimiento y multimodal en el abierto, y coloca un respaldo entre ambos para que un upstream lento no se convierta en un producto lento.
¿Cuál elegir?
Si tus criterios de evaluación son la capacidad, el coste, la apertura y la modalidad, GLM-5.3-Flash gana este enfrentamiento y no por un margen especialmente estrecho: una puntuación de índice más alta, el mejor perfil de fiabilidad de conocimiento de su categoría, un 0.912 en GPQA Diamond, pesos MIT, entrada de vídeo, la mitad del precio y 23 proveedores respaldándolo. Si tus criterios incluyen cuánto espera un usuario o cuántas llamadas secuenciales puede hacer una tarea, Ling-3.1-flash es el modelo que termina, y su tasa de generación cuatro veces mayor no es un error de redondeo en un bucle de agente.
Lo que lo resolvería es un detalle de servicio que ningún proveedor publica en una forma comparable: el rendimiento entregado en tu carga de trabajo, a través de tu proveedor. Ambos modelos responden al mismo formato de chat-completions compatible con OpenAI, lo que significa que cambiar entre ellos es un cambio de configuración, no una migración — y para dos modelos separados por un punto de índice y un factor de cuatro en velocidad, medir ese único número con tu propio tráfico es un mejor uso de una tarde que leer otra fila de benchmark.


Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
