
LongCat-2.5-Preview vs Grok 4.6: uno tiene una tarjeta de benchmark, el otro tiene un sucesor
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Comparar LongCat-2.5-Preview con Grok 4.6 resulta incómodo por una razón que no tiene nada que ver con la calidad de ninguno de los dos modelos: la pregunta tiene fecha de caducidad. Grok 4.6 se lanzó el 12 de agosto de 2026 y Grok 4.7 se lanzó el 21 de septiembre de 2026 —seis días antes de que se escriba esto— con las mismas tarifas de 2,00 / 6,00 USD por millón y la misma ventana de contexto de 500.000 tokens. LongCat-2.5-Preview, por su parte, llegó a la plataforma de API LongCat de Meituan el 25 de septiembre de 2026 sin ningún sucesor anunciado a la vista y sin ningún benchmark publicado. Así que la verdadera elección no es «qué modelo es mejor». Es si quieres una capacidad medida con un sucesor medido ya respaldándola, o una no medida que al menos es lo más actual.
Ese planteamiento es menos emocionante que un marcador y considerablemente más útil.
Empieza por lo que Grok 4.6 realmente tiene registrado
Grok 4.6 es un modelo bien documentado. En nuestro catálogo cuenta con una ventana de contexto de 500.000 tokens, entrada de texto, imagen y archivos, y una tarifa de $2,00 por millón de tokens de entrada, $6,00 por millón de tokens de salida y $0,50 por millón de tokens de entrada en caché, que pasa a $4,00 y $12,00 por encima de los 200.000 tokens de entrada. Su perfil independiente de Artificial Analysis incluye un Coding Index de 76,8 —quinto entre los modelos que sigue ese índice—, un Intelligence Index de 44,3 en el puesto dieciocho, GPQA Diamond con 94,9%, Humanity's Last Exam con 42,9%, SciCode con 56,5%, Terminal-Bench v2.1 con 88,4 y τ²-Bench para banca con 50,7. Su Long-Context Recall es 80,3.

LongCat-2.5-Preview no tiene nada de eso. La entrada del registro de cambios de Meituan para el 25 de septiembre de 2026 es un aviso de disponibilidad con fecha que enumera tres capacidades declaradas —comprensión de imágenes, programación y compatibilidad con "Claude Code y otros entornos de desarrollo convencionales", incluidos Hermes, OpenClaw, OpenCode y Kilo Code— y nada que se parezca a un resultado. La página de precios del proveedor ofrece $0.30 por millón de tokens de entrada sin caché, $0.006 por millón de tokens de entrada en caché y $1.20 por millón de tokens de salida, marcados explícitamente como un descuento por tiempo limitado. La ventana de contexto es de 1.000.000 de tokens; la salida máxima es de 131.072. El recuento de parámetros de aproximadamente 1,6 billones en total / 48.000 millones activos proviene de los metadatos del sitio de Meituan y de la cobertura de la prensa especializada china, más que de la documentación. No hay ningún repositorio para él en HuggingFace ni en la organización de GitHub de Meituan, y los metadatos del catálogo que distribuye OpenCode registran los pesos abiertos como falsos.
La dimensión que un marcador pasaría por alto por completo
Estos dos modelos difieren en algo que ningún benchmark mide, y para muchos equipos eso decide la cuestión por sí solo: qué ocurre con los prompts que envías.
La propia documentación de OpenCode afirma que LongCat 2.5 Preview Free es servido por un proveedor que sigue una política de retención cero y no utiliza tus datos para entrenamiento; la tabla de privacidad de Zen le pone números — entrenamiento del modelo "No usado", retención de datos "0 días". La misma tabla de privacidad enumera treinta días de retención para Grok 4.6 y Grok 4.7. Ambas afirmaciones son de OpenCode, publicadas en las páginas de OpenCode, y describen específicamente el listado gratuito y el listado de comparación. Pero si estás apuntando un agente a un repositorio privado, esa es la diferencia entre una conversación que no tienes que tener con legal y una que sí tienes — y no tiene nada que ver con qué modelo obtiene mejor puntuación en SciCode.

Lo que "measured" te aporta y lo que no.
Los números de Grok 4.6 son mejores que los de LongCat-2.5-Preview en el único sentido que importa aquí: existen. Eso no es lo mismo que decir que Grok 4.6 sea un modelo mejor. Su Índice de Codificación de 76,8 está por debajo del de la generación de Grok 4.7, y el modelo contra el que se midió ya no es la frontera de su propia familia. Su sucesor publicado tiene un Índice de Inteligencia de 46,4 frente al 44,3 de Grok 4.6, y una Recuperación de Contexto Largo de 76,67 frente al 80,33 de Grok 4.6 —así que el sucesor no es mejor en todos los ejes, que es exactamente el tipo de detalle que oculta un número de generación.
También hay una salvedad sobre el servicio en vivo que vale la pena decir sin rodeos, porque va en contra de la lectura halagadora para ambos modelos. En nuestra propia muestra de playground de siete días, Grok 4.6 no registró ningún rendimiento medido ni tráfico de tokens, que es como se ve una ausencia de datos en esa columna, más que un veredicto de rendimiento. LongCat-2.5-Preview no tiene ninguna muestra de servicio nuestra en absoluto, porque no lo enrutamos. Así que cualquier comparación de latencia entre estos dos es unilateral de una forma que la prosa suele disimular: no se puede hacer benchmark de un modelo al que no se le envía tráfico.
Donde la capa de enrutamiento realmente ayuda aquí
Tres de los datos anteriores son del tipo para el que está hecho un router, no solo con el que es compatible. La tabla de tarifas de Grok 4.6 sube de escalón por encima de los 200.000 tokens de entrada, así que la misma tarea lógica puede facturarse a dos tarifas distintas según un número que tu aplicación ya conoce antes de enviar nada. Grok 4.6 tiene un sucesor publicado con tarifas idénticas, lo que significa que el cambio de uno a otro debería ser un cambio de una sola línea y nunca una reintegración. Y la propiedad más atractiva de LongCat-2.5-Preview —su precio— está etiquetada explícitamente como temporal por el proveedor.
En OrcaRouter ofrecemos Grok 4.6 al precio de lista de xAI con cero margen, de modo que un cambio de tarifa del proveedor llega a tu factura el mismo día y no en la próxima renovación, y la conmutación automática por error desplaza una solicitud degradada a un proveedor saludable sin que tu código sepa cuál respondió. Un DSL de enrutamiento cubre directamente el caso de precios por niveles, y la fusión de modelos cubre el caso en que el modelo que quieres para la lectura larga no es el modelo que quieres para la síntesis final. LongCat-2.5-Preview no es una de nuestras rutas — no lo servimos, y nada de lo aquí dicho afirma lo contrario. El objetivo de mencionarlo no es enviarte a otro sitio; es que un modelo que estás evaluando en lugar de ejecutando pertenece a la misma clave que los modelos que ejecutas, de modo que evaluarlo cueste una entrada de configuración en lugar de un proyecto entero.

Cómo decidir
• Elige Grok 4.6 si necesitas una respuesta que puedas defender. Tiene una ficha independiente, un perfil de entrada documentado y un precio que no caduca. Su principal riesgo no es la calidad, sino la pertinencia: Grok 4.7 existe con las mismas tarifas, y el coste de quedarse en 4.6 por inercia es la diferencia entre un Intelligence Index de 44,3 y 46,4 que no tenías por qué pagar.
Elige LongCat-2.5-Preview si el factor decisivo es la retención o el alcance. El acceso con retención cero a través de OpenCode, una ventana de un millón de tokens, un límite de salida de 131.072 tokens y una tarifa aproximadamente una séptima parte de la de Grok 4.6 son ventajas reales — la primera de ellas verificada por la política de privacidad de un tercero, el resto afirmado únicamente por el proveedor.
• No elija entre ellos basándose en una tabla comparativa, porque solo existe una. La puntuación de codificación de 76,8 de Grok 4.6 y el recuerdo de contexto largo de 80,3 describen a Grok 4.6. Nada describe todavía a LongCat-2.5-Preview. Cualquiera que publique una puntuación de LongCat-2.5-Preview junto a una puntuación de Grok 4.6 esta semana está citando un modelo LongCat diferente o inventándose el número.
• Verifica el lado de entrada antes de construir sobre él. El registro de cambios de Meituan abre con comprensión de imágenes, pero la respuesta de ejemplo en su propia documentación de "Retrieve Model" todavía muestra input_modalities como ["text"] con una cadena de modalidad text->text — afirmado por el proveedor frente a un contrato publicado que dice lo contrario. Grok 4.6 acepta texto, imágenes y archivos sin tal ambigüedad. Y comprueba que tu entorno de pruebas exponga un campo reasoning_content intercalado antes de que concluyas cualquier cosa sobre la calidad de razonamiento de LongCat-2.5-Preview; un cliente que descarte ese campo fallará silenciosamente.
Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
