
LongCat-2.5-Preview vs Kimi K3: la pregunta sobre la recuperación de contexto largo que nadie puede responder todavía
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Kimi K3 obtiene 88,67 en Long-Context Recall. Esa es la cifra más alta de cualquier modelo de nuestro catálogo para la cuestión concreta de si un modelo sigue utilizando información enterrada en lo más profundo de una entrada larga. LongCat-2.5-Preview no tiene ninguna puntuación de Long-Context Recall — de Artificial Analysis, de Meituan, de nadie. Y LongCat-2.5-Preview es el que anuncia una ventana de un millón de tokens como su característica principal. Esa discrepancia, un modelo cuya afirmación central es el contexto largo y para el que no existe ninguna medición de contexto largo, es toda la sustancia de esta comparación. Todo lo demás es secundario.
Vale la pena ser precisos sobre lo que el número faltante significa y lo que no, porque es fácil pasar de «no medido» a «probablemente malo», y ninguna de las dos direcciones se sostiene.
Lo que cada uno de los dos modelos puso en el registro
El Kimi K3 de MoonshotAI se lanzó el 15 de julio de 2026. Nuestro catálogo lo incluye con una ventana de contexto de 1.048.576 tokens, entrada de texto e imágenes, y una tarifa de $3,00 por millón de tokens de entrada, $0,30 por millón de entrada en caché y $15,00 por millón de salida. Su perfil independiente de Artificial Analysis arroja: Coding Index 76,2, noveno; Intelligence Index 43,6, decimonoveno; GPQA Diamond 93,5 %; Humanity's Last Exam 46,9 %; SciCode 59,5 %; Terminal-Bench v2.1 85,0; τ²-Bench banking 46,0. Y Long-Context Recall 88,67, el mejor de nuestro catálogo.

LongCat-2.5-Preview de Meituan apareció en la LongCat API Platform el 25 de septiembre de 2026. Su entrada del registro de cambios nombra tres capacidades declaradas —comprensión de imágenes, programación y compatibilidad con «Claude Code y otros entornos de desarrollo convencionales»—, y enumera Hermes, OpenClaw, OpenCode y Kilo Code. La página de precios indica $0.30 por millón de entrada no almacenada en caché, $0.006 por millón de entrada almacenada en caché y $1.20 por millón de salida, marcados como un descuento por tiempo limitado. Ventana de contexto 1,000,000; salida máxima 131,072. La cifra de ~1.6T de parámetros totales / ~48B activos proviene de los metadatos del sitio de Meituan y de la cobertura de la prensa especializada china, no de la documentación. No hay tabla de benchmarks, ni ficha del modelo, ni informe técnico, ni repositorio en HuggingFace o en la organización de GitHub de Meituan, y los metadatos del catálogo registran los pesos abiertos como falsos.
Por qué el número faltante importa más aquí que en cualquier otro enfrentamiento
Long-Context Recall no es una puntuación más entre muchas para estos dos modelos. Es la puntuación que pone a prueba aquello que ambos venden. Una ventana de un millón de tokens es una declaración sobre la capacidad de la arquitectura; la recuperación mide si el modelo todavía puede recuperar y usar un dato colocado en el token 900.000 en lugar del token 900. Los proveedores publican la primera porque es una especificación. Los evaluadores independientes publican la segunda porque es una prueba, y la mayoría de los modelos no rinden tan bien en ella como sugiere el tamaño de su ventana.
Así que la postura honesta es más limitada de lo que parece. El 88.67 de Kimi K3 no significa que Kimi K3 sea mejor modelo de contexto largo que LongCat-2.5-Preview. Significa que Kimi K3 es aquel para el que se ha planteado y respondido la pregunta. LongCat-2.5-Preview podría ser mejor. Podría ser sustancialmente peor. El punto es que actualmente nadie fuera de Meituan lo sabe, y una ventana de 1M impresa en una página de precios no es evidencia en ninguna dirección.

El panorama de costos, con la misma advertencia aritmética
Según las tarifas publicadas, LongCat-2.5-Preview es 10 veces más barato en entrada sin caché y 12,5 veces más barato en salida que Kimi K3. Una lectura de 500.000 tokens que devuelve 20.000 tokens cuesta aproximadamente $1,80 en Kimi K3 y aproximadamente 17 centavos en LongCat-2.5-Preview. Ambos son cálculos sobre precios de tarifa en lugar de mediciones, y la cifra de LongCat conlleva una advertencia adicional que la cifra de Kimi no tiene: Meituan etiqueta su propia tarifa como un descuento por tiempo limitado, por lo que se desconoce la cifra que sobrevivirá a la promoción.
Contrasta eso con la cuestión de la cobertura. Si estás procesando una entrada de 500.000 tokens y el recall de tu modelo a esa profundidad no se ha medido, la diferencia de costo no es un ahorro: es el precio de una tasa de fallos desconocida. Una solicitud de 17 centavos que omite silenciosamente la sección relevante es más costosa que una solicitud de 1,80 $ que la encuentra, porque de todos modos pagas la nueva ejecución y la depuración. Esta es la forma específica del riesgo, y es la razón por la que la falta de benchmark es un problema de costos y no solo de marketing.
Qué hacer mientras el número no existe
Genera el tuyo propio. Este es el raro caso en el que la ventana gratuita encaja de verdad con el hueco: llamar a LongCat-2.5-Preview a través de OpenCode no cuesta nada durante un periodo de duración no especificada, con una política de retención cero que OpenCode documenta —entrenamiento del modelo «Not used», retención de datos «0 days»—, lo que significa que puedes apuntarlo a un repositorio privado sin mantener antes una conversación sobre procesamiento de datos. Crea una prueba de aguja en el pajar a la profundidad que usas realmente, ejecútala en ambos modelos y tendrás el número que ningún proveedor ha publicado. Dos cosas que conviene comprobar antes de fiarte del resultado: que tu arnés de pruebas exponga el campo intercalado reasoning_content que devuelve el modelo, y que la entrada de imágenes funcione siquiera, ya que el registro de cambios de Meituan lo afirma mientras que su propio ejemplo «Retrieve Model» todavía muestra input_modalities como ["text"] con una text->text cadena.

La parte de OrcaRouter en este
Servimos Kimi K3 al precio de lista de MoonshotAI con cero recargo. LongCat-2.5-Preview no es una de nuestras rutas — no lo servimos, y nada en este texto debe interpretarse como que afirmamos hacerlo.
Para esta comparación en particular, la parte útil de un enrutador no es el precio. Es que el modelo que estás evaluando y el modelo en el que confías pueden estar detrás de la misma clave. El recall de 88.67 de Kimi K3 lo convierte en el modelo por el que enrutarías una pasada de contexto largo hoy; LongCat-2.5-Preview es el modelo contra el que quieres probarlo, porque si su recall se mantiene a una doceava parte del precio de salida, la economía del trabajo con documentos largos cambia. La fusión de modelos es el mecanismo que hace que eso sea concreto en lugar de teórico: una pasada de recuperación de contexto largo y un paso final de síntesis pueden ser dos modelos diferentes en una misma solicitud, así que el modelo barato no medido y el caro medido no tienen que ser una disyuntiva. La conmutación automática por error, entonces, cubre el caso en que uno de ellos se degrada, lo cual importa más de lo habitual cuando uno de tus dos candidatos no tiene un historial de servicio que puedas inspeccionar.
El veredicto, enunciado con su propia incertidumbre adjunta
Si necesitas que el trabajo de contexto largo sea fiable esta semana, Kimi K3 es la opción defendible: un recall de 88,67 es el mejor número disponible para la capacidad exacta en cuestión, y su perfil más amplio —Programación 76,2, Inteligencia 43,6, GPQA Diamond 93,5 %— es sólido más que espectacular, todo ello con fuentes independientes. Si estás dispuesto a pasar una tarde generando tu propia evaluación, LongCat-2.5-Preview es la apuesta más interesante: una ventana de un millón de tokens, un límite de salida de 131.072 tokens, acceso con retención cero y una lista de precios un orden de magnitud inferior a la de Kimi K3, todo ello basado en afirmaciones del proveedor que nadie ha probado aún en público.
Lo que no es defendible es tratarlos como equivalentes porque ambos indican un millón de tokens. Uno de ellos tiene un número asociado a esa ventana, y el otro tiene un precio. Son tipos de evidencia diferentes, y la brecha entre ellos es lo único de lo que realmente trata esta comparación.
