Una tarjeta de título principal generada que dice 'LongCat-2.5-Preview vs GLM-5.2' con el sobretítulo 'Misma ventana de 1M, solo uno de ellos medido', y dos paneles: 'LongCat-2.5-Preview: contexto de 1M, $0.30 / $1.20 por 1M, sin benchmark publicado' y 'GLM-5.2: contexto de 1M, AA Long-Context Recall 78.33'. Logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

LongCat-2.5-Preview vs. GLM-5.2: dos ventanas de 1M de tokens, una de ellas medida

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

LongCat-2.5-Preview y GLM-5.2 comparten la misma cifra destacada: una ventana de contexto de un millón de tokens. Esa única coincidencia está haciendo todo el trabajo en la mayoría de las comparaciones que se están escribiendo esta semana, y no basta para comparar dos modelos. GLM-5.2 está registrado públicamente desde el 16 de junio de 2026 con un perfil de benchmark público, una tarifa publicada y una puntuación de recuperación en contexto largo de un evaluador independiente. LongCat-2.5-Preview apareció en la plataforma de API LongCat de Meituan el 25 de septiembre de 2026 con una tarifa con descuento, un recuento de parámetros reportado por la cobertura especializada china y ningún benchmark publicado de ningún tipo. Una ventana está medida. La otra es una afirmación. Todo lo que sigue mantiene separadas esas dos categorías, porque una hoja de especificaciones y un resultado de prueba no son el mismo tipo de hecho.

Esta es la versión honesta del enfrentamiento, y es más útil que la halagadora.

Lo que cada lado ha publicado realmente

El registro de cambios de Meituan contiene una entrada con fecha — "Versión: 2026-09-25, LongCat-2.5-Preview ya disponible" — que enumera tres capacidades declaradas: comprensión de imágenes, codificación y compatibilidad con "Claude Code y otros entornos de desarrollo convencionales", mencionando a Hermes, OpenClaw, OpenCode y Kilo Code. La página de precios del proveedor indica una tarifa de pago por uso de $0,30 por millón de tokens de entrada no almacenados en caché, $0,006 por millón de tokens de entrada en caché y $1,20 por millón de tokens de salida, señalada en la propia página como un descuento por tiempo limitado. La ventana de contexto es de un millón de tokens y la salida máxima es de 131.072. La cifra de unos 1,6 billones de parámetros totales con alrededor de 48 mil millones activos por token, sobre una arquitectura de mezcla de expertos, proviene de los metadatos del propio sitio de Meituan y de la cobertura comercial china del listado, no de la documentación de la API. Ningún informe técnico, ninguna ficha de modelo y ninguna tabla de benchmarks acompañaron nada de esto. No hay repositorio de LongCat-2.5-Preview en HuggingFace ni ningún repositorio con ese nombre en la organización de GitHub de Meituan; los metadatos del catálogo de modelos que se incluyen con OpenCode registran los pesos abiertos como falsos.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

GLM-5.2 de Z.ai ocupa la posición opuesta. Es un lanzamiento de junio con una tarifa que ofrecemos a precio de lista: $1.40 por millón de tokens de entrada, $0.26 por millón de tokens de entrada en caché y $4.40 por millón de tokens de salida en nuestro catálogo, con una ventana de contexto de 1,000,000 de tokens y 128,000 tokens de salida máxima. Sus puntuaciones publicadas provienen de dos lugares distintos, y la distinción importa: los números propios de Z.ai para AIME 2026, HMMT February 2026, GPQA-Diamond y la suite FrontierSWE son reportados por el proveedor; las cifras del Coding Index y del Intelligence Index que incluye nuestro catálogo provienen de Artificial Analysis, que realiza sus propias evaluaciones.

La única dimensión en la que son genuinamente iguales

Ambos modelos afirman tener exactamente 1.000.000 de tokens de contexto. Solo uno de ellos tiene una puntuación publicada que evalúa si un modelo todavía puede usar lo que hay ahí. Artificial Analysis registra una cifra de Long-Context Recall de 78,33 para GLM-5.2. LongCat-2.5-Preview no tiene un número equivalente, de nadie. Esa asimetría es todo el enfrentamiento en una línea: una ventana de un millón de tokens es una declaración sobre la capacidad de la arquitectura, no sobre si el modelo recupera correctamente en el token 900.000. La capacidad es barata de imprimir y costosa de verificar, por eso todos los proveedores la imprimen y casi ninguno publica la prueba de recuperación.

Así que si estás eligiendo entre estas dos para trabajo de contexto largo, estás eligiendo entre una opción con una puntuación de recall publicada y otra sin ella — y la que no la tiene es también la que tiene el perfil de benchmark no medido. Eso no es un argumento en su contra. Es un argumento en contra de tratarlas como intercambiables por el mero hecho de que coincida un número entero.

A screenshot of OrcaRouter's own model page for Z.ai GLM-5.2 at /models/z-ai/glm-5.2, showing the z-ai/glm-5.2 identifier, a 1M-token context window, 128K maximum output, text input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-06-16, a p50 first-token figure of 5.13 s, $1.40 and $4.40 rate tiles, and the OpenAI-compatible code samples.

Cómo se ve la diferencia de precio en un trabajo real

Las tarifas no están cerca, y la dirección no es la que la gente espera de un retador chino de pesos abiertos frente a un laboratorio occidental de frontera. LongCat-2.5-Preview es aproximadamente 4,7 veces más barato en entrada sin caché y 3,7 veces más barato en salida que GLM-5.2 — una proporción que es aritmética sobre las dos tarifas publicadas, no una medición. En una pasada de procesamiento de documentos de 500.000 tokens que devuelve 20.000 tokens, eso son unos 17 centavos frente a unos 79 centavos. Ambos modelos tienen que leer el mismo documento. Solo uno de ellos tiene una puntuación publicada sobre si seguirá prestando atención al final de este.

Hay una segunda advertencia que corresponde mencionar en la misma frase: Meituan etiqueta su propio tarifario como un descuento por tiempo limitado. La cifra de $0.30 es la cifra promocional, y el proveedor no dice qué viene después. Un modelo de costos construido sobre un precio promocional tiene una fecha de vencimiento que no se puede leer. Esa es una razón para mantener barata la migración entre proveedores en lugar de una razón para evitar el modelo.

En OrcaRouter, las rutas que servimos están detrás de una sola clave al precio de lista del proveedor y con cero margen, así que un cambio de precio de un proveedor llega a tu factura el mismo día en lugar de en la próxima renovación, y la conmutación por error automática traslada una solicitud degradada a un proveedor en buen estado sin que tu aplicación se entere. GLM-5.2 es una de nuestras rutas. LongCat-2.5-Preview no lo es: no lo servimos, y nada de lo aquí dicho debe interpretarse como que afirmamos lo contrario. Z.ai también ha avanzado desde junio: GLM-5.3 está disponible en nuestro catálogo desde el 18 de agosto de 2026, así que una comparación planteada como «nuevo modelo frente a modelo actual» ya está presentando a GLM-5.2 como el modelo vigente en lugar de la vanguardia.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs GLM-5.2' with the subhead 'Six dimensions, and which side of each one has evidence behind it'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'GLM-5.2' (Z.ai, released 2026-06-16, independently scored): 1,000,000-token context, 128,000 max output, text to text only, $1.40 / $0.26 input, $4.40 output, coding index 68.8 at rank 30, long-context recall 78.33. Footnote credits OrcaRouter's catalogue and Artificial Analysis for the right column and notes LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Qué resolvería esto, y qué no

• Una puntuación de Long-Context Recall para LongCat-2.5-Preview, de Meituan o de un evaluador independiente. Hasta que eso exista, su ventana de 1M es una afirmación sin ninguna prueba adjunta, y el 78,33 de GLM-5.2 es el único número en la comparación que responde a la misma pregunta.

• Una tarifa de proveedor sin el indicador de tiempo limitado. El precio con descuento te dice cuánto cuesta el modelo durante una promoción, no cuánto cuesta.

• Una tabla comparativa de cualquier tipo. No una posición en una clasificación — solo una ejecución de evaluación publicada, para que la comparación deje de ser una hoja de especificaciones frente a una página de resultados.

• Una confirmación de la entrada de imágenes. El registro de cambios presenta la comprensión de imágenes como una incorporación destacada, pero la respuesta de ejemplo en la propia documentación «Retrieve Model» de Meituan sigue mostrando input_modalities como ["text"] con una text->text cadena de modalidad. Es posible que esa muestra simplemente esté desactualizada. No obstante, es el contrato publicado por el proveedor, así que trate la entrada de imágenes como algo declarado, no como algo disponible. GLM-5.2, en cambio, es texto de entrada y texto de salida en nuestro catálogo, sin ninguna modalidad de imagen —así que, en esta dimensión, ninguno de los modelos le da una respuesta verificada, y uno de ellos le da una afirmación.

• Tus propios números. La brecha entre lo que se publica y lo que necesitas se cierra ejecutando ambos modelos en tus tareas, y la ventana gratuita de LongCat-2.5-Preview hace que eso sea barato ahora mismo. Un rastro de razonamiento que llega en un campo reasoning_content intercalado es el detalle del arnés que hay que comprobar primero, porque una herramienta que lo descarte en silencio perderá la mayor parte de la utilidad del modelo sin generar errores.

En qué situación deja esto a la comparación

Si necesitas tomar una decisión hoy y esta implica contexto largo, GLM-5.2 es el que realmente puedes evaluar: tiene recall publicado, una puntuación independiente de codificación de 68,8 y un Intelligence Index de 33,7 de Artificial Analysis, y un precio con el que puedes presupuestar. Esas cifras describen un modelo competente más que de frontera —el propio sucesor de Z.ai, GLM-5.3, lo supera—, pero describen algo. LongCat-2.5-Preview es una propuesta más barata, de contexto más amplio y totalmente carente de mediciones, cuya cualidad más atractiva, su precio, es explícitamente temporal. La postura correcta hacia él no es el escepticismo. Es una evaluación de dos semanas con tu propio sistema de puntuación incorporado, realizada antes de que desaparezca la tarifa promocional.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario