
LongCat-2.5-Preview vs. GLM-5.2: dos ventanas de 1M de tokens, una de ellas medida
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
LongCat-2.5-Preview y GLM-5.2 comparten la misma cifra destacada: una ventana de contexto de un millón de tokens. Esa única coincidencia está haciendo todo el trabajo en la mayoría de las comparaciones que se están escribiendo esta semana, y no basta para comparar dos modelos. GLM-5.2 está registrado públicamente desde el 16 de junio de 2026 con un perfil de benchmark público, una tarifa publicada y una puntuación de recuperación en contexto largo de un evaluador independiente. LongCat-2.5-Preview apareció en la plataforma de API LongCat de Meituan el 25 de septiembre de 2026 con una tarifa con descuento, un recuento de parámetros reportado por la cobertura especializada china y ningún benchmark publicado de ningún tipo. Una ventana está medida. La otra es una afirmación. Todo lo que sigue mantiene separadas esas dos categorías, porque una hoja de especificaciones y un resultado de prueba no son el mismo tipo de hecho.
Esta es la versión honesta del enfrentamiento, y es más útil que la halagadora.
Lo que cada lado ha publicado realmente
El registro de cambios de Meituan contiene una entrada con fecha — "Versión: 2026-09-25, LongCat-2.5-Preview ya disponible" — que enumera tres capacidades declaradas: comprensión de imágenes, codificación y compatibilidad con "Claude Code y otros entornos de desarrollo convencionales", mencionando a Hermes, OpenClaw, OpenCode y Kilo Code. La página de precios del proveedor indica una tarifa de pago por uso de $0,30 por millón de tokens de entrada no almacenados en caché, $0,006 por millón de tokens de entrada en caché y $1,20 por millón de tokens de salida, señalada en la propia página como un descuento por tiempo limitado. La ventana de contexto es de un millón de tokens y la salida máxima es de 131.072. La cifra de unos 1,6 billones de parámetros totales con alrededor de 48 mil millones activos por token, sobre una arquitectura de mezcla de expertos, proviene de los metadatos del propio sitio de Meituan y de la cobertura comercial china del listado, no de la documentación de la API. Ningún informe técnico, ninguna ficha de modelo y ninguna tabla de benchmarks acompañaron nada de esto. No hay repositorio de LongCat-2.5-Preview en HuggingFace ni ningún repositorio con ese nombre en la organización de GitHub de Meituan; los metadatos del catálogo de modelos que se incluyen con OpenCode registran los pesos abiertos como falsos.

GLM-5.2 de Z.ai ocupa la posición opuesta. Es un lanzamiento de junio con una tarifa que ofrecemos a precio de lista: $1.40 por millón de tokens de entrada, $0.26 por millón de tokens de entrada en caché y $4.40 por millón de tokens de salida en nuestro catálogo, con una ventana de contexto de 1,000,000 de tokens y 128,000 tokens de salida máxima. Sus puntuaciones publicadas provienen de dos lugares distintos, y la distinción importa: los números propios de Z.ai para AIME 2026, HMMT February 2026, GPQA-Diamond y la suite FrontierSWE son reportados por el proveedor; las cifras del Coding Index y del Intelligence Index que incluye nuestro catálogo provienen de Artificial Analysis, que realiza sus propias evaluaciones.
La única dimensión en la que son genuinamente iguales
Ambos modelos afirman tener exactamente 1.000.000 de tokens de contexto. Solo uno de ellos tiene una puntuación publicada que evalúa si un modelo todavía puede usar lo que hay ahí. Artificial Analysis registra una cifra de Long-Context Recall de 78,33 para GLM-5.2. LongCat-2.5-Preview no tiene un número equivalente, de nadie. Esa asimetría es todo el enfrentamiento en una línea: una ventana de un millón de tokens es una declaración sobre la capacidad de la arquitectura, no sobre si el modelo recupera correctamente en el token 900.000. La capacidad es barata de imprimir y costosa de verificar, por eso todos los proveedores la imprimen y casi ninguno publica la prueba de recuperación.
Así que si estás eligiendo entre estas dos para trabajo de contexto largo, estás eligiendo entre una opción con una puntuación de recall publicada y otra sin ella — y la que no la tiene es también la que tiene el perfil de benchmark no medido. Eso no es un argumento en su contra. Es un argumento en contra de tratarlas como intercambiables por el mero hecho de que coincida un número entero.

Cómo se ve la diferencia de precio en un trabajo real
Las tarifas no están cerca, y la dirección no es la que la gente espera de un retador chino de pesos abiertos frente a un laboratorio occidental de frontera. LongCat-2.5-Preview es aproximadamente 4,7 veces más barato en entrada sin caché y 3,7 veces más barato en salida que GLM-5.2 — una proporción que es aritmética sobre las dos tarifas publicadas, no una medición. En una pasada de procesamiento de documentos de 500.000 tokens que devuelve 20.000 tokens, eso son unos 17 centavos frente a unos 79 centavos. Ambos modelos tienen que leer el mismo documento. Solo uno de ellos tiene una puntuación publicada sobre si seguirá prestando atención al final de este.
Hay una segunda advertencia que corresponde mencionar en la misma frase: Meituan etiqueta su propio tarifario como un descuento por tiempo limitado. La cifra de $0.30 es la cifra promocional, y el proveedor no dice qué viene después. Un modelo de costos construido sobre un precio promocional tiene una fecha de vencimiento que no se puede leer. Esa es una razón para mantener barata la migración entre proveedores en lugar de una razón para evitar el modelo.
En OrcaRouter, las rutas que servimos están detrás de una sola clave al precio de lista del proveedor y con cero margen, así que un cambio de precio de un proveedor llega a tu factura el mismo día en lugar de en la próxima renovación, y la conmutación por error automática traslada una solicitud degradada a un proveedor en buen estado sin que tu aplicación se entere. GLM-5.2 es una de nuestras rutas. LongCat-2.5-Preview no lo es: no lo servimos, y nada de lo aquí dicho debe interpretarse como que afirmamos lo contrario. Z.ai también ha avanzado desde junio: GLM-5.3 está disponible en nuestro catálogo desde el 18 de agosto de 2026, así que una comparación planteada como «nuevo modelo frente a modelo actual» ya está presentando a GLM-5.2 como el modelo vigente en lugar de la vanguardia.

Qué resolvería esto, y qué no
• Una puntuación de Long-Context Recall para LongCat-2.5-Preview, de Meituan o de un evaluador independiente. Hasta que eso exista, su ventana de 1M es una afirmación sin ninguna prueba adjunta, y el 78,33 de GLM-5.2 es el único número en la comparación que responde a la misma pregunta.
• Una tarifa de proveedor sin el indicador de tiempo limitado. El precio con descuento te dice cuánto cuesta el modelo durante una promoción, no cuánto cuesta.
• Una tabla comparativa de cualquier tipo. No una posición en una clasificación — solo una ejecución de evaluación publicada, para que la comparación deje de ser una hoja de especificaciones frente a una página de resultados.
• Una confirmación de la entrada de imágenes. El registro de cambios presenta la comprensión de imágenes como una incorporación destacada, pero la respuesta de ejemplo en la propia documentación «Retrieve Model» de Meituan sigue mostrando input_modalities como ["text"] con una text->text cadena de modalidad. Es posible que esa muestra simplemente esté desactualizada. No obstante, es el contrato publicado por el proveedor, así que trate la entrada de imágenes como algo declarado, no como algo disponible. GLM-5.2, en cambio, es texto de entrada y texto de salida en nuestro catálogo, sin ninguna modalidad de imagen —así que, en esta dimensión, ninguno de los modelos le da una respuesta verificada, y uno de ellos le da una afirmación.
• Tus propios números. La brecha entre lo que se publica y lo que necesitas se cierra ejecutando ambos modelos en tus tareas, y la ventana gratuita de LongCat-2.5-Preview hace que eso sea barato ahora mismo. Un rastro de razonamiento que llega en un campo reasoning_content intercalado es el detalle del arnés que hay que comprobar primero, porque una herramienta que lo descarte en silencio perderá la mayor parte de la utilidad del modelo sin generar errores.
En qué situación deja esto a la comparación
Si necesitas tomar una decisión hoy y esta implica contexto largo, GLM-5.2 es el que realmente puedes evaluar: tiene recall publicado, una puntuación independiente de codificación de 68,8 y un Intelligence Index de 33,7 de Artificial Analysis, y un precio con el que puedes presupuestar. Esas cifras describen un modelo competente más que de frontera —el propio sucesor de Z.ai, GLM-5.3, lo supera—, pero describen algo. LongCat-2.5-Preview es una propuesta más barata, de contexto más amplio y totalmente carente de mediciones, cuya cualidad más atractiva, su precio, es explícitamente temporal. La postura correcta hacia él no es el escepticismo. Es una evaluación de dos semanas con tu propio sistema de puntuación incorporado, realizada antes de que desaparezca la tarifa promocional.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
