Una tarjeta de título principal generada que dice «LongCat-2.5-Preview vs Grok 4.6» con el antetítulo «Uno tiene una tarjeta de benchmark, el otro tiene un sucesor», y dos paneles: «LongCat-2.5-Preview: contexto de 1M, retención cero mediante OpenCode» y «Grok 4.6: AA Coding 76.8, Grok 4.7 ya se lanzó». Logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

LongCat-2.5-Preview vs Grok 4.6: uno tiene una tarjeta de benchmark, el otro tiene un sucesor

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Comparar LongCat-2.5-Preview con Grok 4.6 resulta incómodo por una razón que no tiene nada que ver con la calidad de ninguno de los dos modelos: la pregunta tiene fecha de caducidad. Grok 4.6 se lanzó el 12 de agosto de 2026 y Grok 4.7 se lanzó el 21 de septiembre de 2026 —seis días antes de que se escriba esto— con las mismas tarifas de 2,00 / 6,00 USD por millón y la misma ventana de contexto de 500.000 tokens. LongCat-2.5-Preview, por su parte, llegó a la plataforma de API LongCat de Meituan el 25 de septiembre de 2026 sin ningún sucesor anunciado a la vista y sin ningún benchmark publicado. Así que la verdadera elección no es «qué modelo es mejor». Es si quieres una capacidad medida con un sucesor medido ya respaldándola, o una no medida que al menos es lo más actual.

Ese planteamiento es menos emocionante que un marcador y considerablemente más útil.

Empieza por lo que Grok 4.6 realmente tiene registrado

Grok 4.6 es un modelo bien documentado. En nuestro catálogo cuenta con una ventana de contexto de 500.000 tokens, entrada de texto, imagen y archivos, y una tarifa de $2,00 por millón de tokens de entrada, $6,00 por millón de tokens de salida y $0,50 por millón de tokens de entrada en caché, que pasa a $4,00 y $12,00 por encima de los 200.000 tokens de entrada. Su perfil independiente de Artificial Analysis incluye un Coding Index de 76,8 —quinto entre los modelos que sigue ese índice—, un Intelligence Index de 44,3 en el puesto dieciocho, GPQA Diamond con 94,9%, Humanity's Last Exam con 42,9%, SciCode con 56,5%, Terminal-Bench v2.1 con 88,4 y τ²-Bench para banca con 50,7. Su Long-Context Recall es 80,3.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview no tiene nada de eso. La entrada del registro de cambios de Meituan para el 25 de septiembre de 2026 es un aviso de disponibilidad con fecha que enumera tres capacidades declaradas —comprensión de imágenes, programación y compatibilidad con "Claude Code y otros entornos de desarrollo convencionales", incluidos Hermes, OpenClaw, OpenCode y Kilo Code— y nada que se parezca a un resultado. La página de precios del proveedor ofrece $0.30 por millón de tokens de entrada sin caché, $0.006 por millón de tokens de entrada en caché y $1.20 por millón de tokens de salida, marcados explícitamente como un descuento por tiempo limitado. La ventana de contexto es de 1.000.000 de tokens; la salida máxima es de 131.072. El recuento de parámetros de aproximadamente 1,6 billones en total / 48.000 millones activos proviene de los metadatos del sitio de Meituan y de la cobertura de la prensa especializada china, más que de la documentación. No hay ningún repositorio para él en HuggingFace ni en la organización de GitHub de Meituan, y los metadatos del catálogo que distribuye OpenCode registran los pesos abiertos como falsos.

La dimensión que un marcador pasaría por alto por completo

Estos dos modelos difieren en algo que ningún benchmark mide, y para muchos equipos eso decide la cuestión por sí solo: qué ocurre con los prompts que envías.

La propia documentación de OpenCode afirma que LongCat 2.5 Preview Free es servido por un proveedor que sigue una política de retención cero y no utiliza tus datos para entrenamiento; la tabla de privacidad de Zen le pone números — entrenamiento del modelo "No usado", retención de datos "0 días". La misma tabla de privacidad enumera treinta días de retención para Grok 4.6 y Grok 4.7. Ambas afirmaciones son de OpenCode, publicadas en las páginas de OpenCode, y describen específicamente el listado gratuito y el listado de comparación. Pero si estás apuntando un agente a un repositorio privado, esa es la diferencia entre una conversación que no tienes que tener con legal y una que sí tienes — y no tiene nada que ver con qué modelo obtiene mejor puntuación en SciCode.

A screenshot of OrcaRouter's own model page for xAI Grok 4.6 at /models/grok/grok-4.6, showing the grok/grok-4.6 identifier, a 500K-token context window, text + image + file input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-08-12, $2.00 and $6.00 rate tiles, and a performance strip whose first-token and token-traffic tiles both read 'Collecting' rather than a figure. The page copy describes Grok 4.6 as the current flagship of the Grok line and cites a headline GPQA Diamond score of 94.9.

Lo que "measured" te aporta y lo que no.

Los números de Grok 4.6 son mejores que los de LongCat-2.5-Preview en el único sentido que importa aquí: existen. Eso no es lo mismo que decir que Grok 4.6 sea un modelo mejor. Su Índice de Codificación de 76,8 está por debajo del de la generación de Grok 4.7, y el modelo contra el que se midió ya no es la frontera de su propia familia. Su sucesor publicado tiene un Índice de Inteligencia de 46,4 frente al 44,3 de Grok 4.6, y una Recuperación de Contexto Largo de 76,67 frente al 80,33 de Grok 4.6 —así que el sucesor no es mejor en todos los ejes, que es exactamente el tipo de detalle que oculta un número de generación.

También hay una salvedad sobre el servicio en vivo que vale la pena decir sin rodeos, porque va en contra de la lectura halagadora para ambos modelos. En nuestra propia muestra de playground de siete días, Grok 4.6 no registró ningún rendimiento medido ni tráfico de tokens, que es como se ve una ausencia de datos en esa columna, más que un veredicto de rendimiento. LongCat-2.5-Preview no tiene ninguna muestra de servicio nuestra en absoluto, porque no lo enrutamos. Así que cualquier comparación de latencia entre estos dos es unilateral de una forma que la prosa suele disimular: no se puede hacer benchmark de un modelo al que no se le envía tráfico.

Donde la capa de enrutamiento realmente ayuda aquí

Tres de los datos anteriores son del tipo para el que está hecho un router, no solo con el que es compatible. La tabla de tarifas de Grok 4.6 sube de escalón por encima de los 200.000 tokens de entrada, así que la misma tarea lógica puede facturarse a dos tarifas distintas según un número que tu aplicación ya conoce antes de enviar nada. Grok 4.6 tiene un sucesor publicado con tarifas idénticas, lo que significa que el cambio de uno a otro debería ser un cambio de una sola línea y nunca una reintegración. Y la propiedad más atractiva de LongCat-2.5-Preview —su precio— está etiquetada explícitamente como temporal por el proveedor.

En OrcaRouter ofrecemos Grok 4.6 al precio de lista de xAI con cero margen, de modo que un cambio de tarifa del proveedor llega a tu factura el mismo día y no en la próxima renovación, y la conmutación automática por error desplaza una solicitud degradada a un proveedor saludable sin que tu código sepa cuál respondió. Un DSL de enrutamiento cubre directamente el caso de precios por niveles, y la fusión de modelos cubre el caso en que el modelo que quieres para la lectura larga no es el modelo que quieres para la síntesis final. LongCat-2.5-Preview no es una de nuestras rutas — no lo servimos, y nada de lo aquí dicho afirma lo contrario. El objetivo de mencionarlo no es enviarte a otro sitio; es que un modelo que estás evaluando en lugar de ejecutando pertenece a la misma clave que los modelos que ejecutas, de modo que evaluarlo cueste una entrada de configuración en lugar de un proyecto entero.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs Grok 4.6' with the subhead 'One model has a measured card and a measured successor; the other has a rate card'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, data retention 0 days on the free listing per OpenCode. Right column 'Grok 4.6' (xAI, released 2026-08-12, successor shipped 2026-09-21): 500,000-token context, max output not published, text, image and file to text, $2.00 input up to 200K then $4.00, $6.00 output up to 200K then $12.00, coding index 76.8 at rank 5 by Artificial Analysis, long-context recall 80.33, data retention 30 days on the comparison listing per OpenCode. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

Cómo decidir

• Elige Grok 4.6 si necesitas una respuesta que puedas defender. Tiene una ficha independiente, un perfil de entrada documentado y un precio que no caduca. Su principal riesgo no es la calidad, sino la pertinencia: Grok 4.7 existe con las mismas tarifas, y el coste de quedarse en 4.6 por inercia es la diferencia entre un Intelligence Index de 44,3 y 46,4 que no tenías por qué pagar.

Elige LongCat-2.5-Preview si el factor decisivo es la retención o el alcance. El acceso con retención cero a través de OpenCode, una ventana de un millón de tokens, un límite de salida de 131.072 tokens y una tarifa aproximadamente una séptima parte de la de Grok 4.6 son ventajas reales — la primera de ellas verificada por la política de privacidad de un tercero, el resto afirmado únicamente por el proveedor.

• No elija entre ellos basándose en una tabla comparativa, porque solo existe una. La puntuación de codificación de 76,8 de Grok 4.6 y el recuerdo de contexto largo de 80,3 describen a Grok 4.6. Nada describe todavía a LongCat-2.5-Preview. Cualquiera que publique una puntuación de LongCat-2.5-Preview junto a una puntuación de Grok 4.6 esta semana está citando un modelo LongCat diferente o inventándose el número.

• Verifica el lado de entrada antes de construir sobre él. El registro de cambios de Meituan abre con comprensión de imágenes, pero la respuesta de ejemplo en su propia documentación de "Retrieve Model" todavía muestra input_modalities como ["text"] con una cadena de modalidad text->text — afirmado por el proveedor frente a un contrato publicado que dice lo contrario. Grok 4.6 acepta texto, imágenes y archivos sin tal ambigüedad. Y comprueba que tu entorno de pruebas exponga un campo reasoning_content intercalado antes de que concluyas cualquier cosa sobre la calidad de razonamiento de LongCat-2.5-Preview; un cliente que descarte ese campo fallará silenciosamente.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario