
LongCat-2.5-Preview vs. Qwen3.8-Max: un séptimo del precio y nada en la tabla de clasificación
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 610 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 189 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Meituan puso LongCat-2.5-Preview en su plataforma API el 25 de septiembre de 2026 con una entrada en el registro de cambios, una lista de precios y ningún tipo de benchmark — luego le puso un precio de aproximadamente una séptima parte de lo que Qwen3.8-Max cobra por la misma llamada. Esa no es una brecha pequeña, y no es una brecha segura. Qwen3.8-Max, el modelo insignia del proveedor, está disponible de forma general desde el 3 de agosto de 2026, cuenta con una clasificación independiente de Artificial Analysis, publica una instantánea con fecha que puedes fijar por nombre, y cobra 6,7× más por entrada y 5× más por salida. La pregunta que esta comparación debe responder no es qué modelo es mejor —nadie fuera de Meituan está en posición de responder eso todavía—. Es qué estás comprando con la diferencia, y si vale la pena comprar esa diferencia.
Lo que cada lado ha publicado realmente
Empieza por la procedencia, porque es lo que separa a estos dos con más nitidez de lo que lo haría cualquier benchmark.
LongCat-2.5-Preview llegó con una entrada fechada en el propio registro de cambios de Meituan —palabras del proveedor: «Versión: 2026-09-25 — LongCat-2.5-Preview ya disponible»—, una página de precios que lo incluye como el modelo de pago por uso actual de la plataforma y una guía de inicio rápido que cubre ambos formatos de conexión. La propia cuenta de Meituan en X lo describe como «1,6 T de parámetros. ~48 B activos. Una ventana de contexto de 1 M de tokens. Nativamente multimodal». Más allá de eso, no hay nada que leer. Ningún repositorio de la organización meituan-longcat de Hugging Face cubre este modelo —el repositorio más reciente de la organización es LongCat-Flash-Lite-Sparse, del 31 de julio—, y el catálogo de modelos de OpenCode, que lo sirve, lo registra como de pesos cerrados. Ni ficha de modelo, ni informe técnico, ni licencia, ni tabla de parámetros publicada por el proveedor, y ninguna evaluación independiente en ningún sitio: a 27 de septiembre no existe ninguna página de LongCat-2.5-Preview en Artificial Analysis.
Qwen3.8-Max es el caso opuesto en casi todos los aspectos. Se puso a disposición general el 3 de agosto de 2026 con una lista de precios publicada, y Alibaba lanzó una actualización con nombre, Qwen3.8-Max-0902, el 2 de septiembre. Artificial Analysis lo mide: Intelligence Index 45,4, puesto 15 de 145 modelos, y un Coding Index de 76,2, puesto 9 de 138. Registra GPQA Diamond 92,8 %, Humanity's Last Exam 43,1 %, SciCode 52,1 %, Long-Context Recall 80,3 %, Terminal-Bench 2.1 con 88,8 %, y τ-bench banking con 47,8 %. Ese es un modelo medido con un comprobante para cada cifra.
Así que el resumen honesto de la columna de evidencia está desequilibrado de una manera que no tiene nada que ver con la capacidad. Uno de estos modelos puede evaluarse antes de que te comprometas. El otro solo puede probarse.
La tarjeta de tarifas, línea por línea
Ambos son modelos de un millón de tokens con el mismo techo de salida, así que las fichas técnicas convergen exactamente donde una ficha técnica es menos útil:
• Entrada sin caché — LongCat-2.5-Preview $0,30 por 1M vs Qwen3.8-Max $2,00 por 1M, una diferencia de 6,7×.
• Entrada en caché — $0.006 por 1M frente a $0.25 por 1M, una diferencia de 41.7×.
• Salida — $1.20 por 1M vs $6.00 por 1M, una diferencia de 5×.
• Ventana de contexto — 1.048.576 tokens frente a 1.000.000 tokens. En la práctica, un empate.
• Salida máxima — 131.072 tokens en ambos. Idéntica.
• Puntuación independiente — ninguno publicado frente a AA Intelligence 45.4 y AA Coding 76.2.
Todas las cifras de LongCat que aparecen ahí provienen de la propia página de precios de Meituan, y la página etiqueta toda la columna como «Precio con descuento (por tiempo limitado)». Las cifras de Qwen3.8-Max son la tarifa de lista de Alibaba, tomadas de nuestra propia ficha de modelo, con una lectura de caché a $0,25 y una escritura de caché a $2,50 por millón. La instantánea de Artificial Analysis está fechada el 2 de septiembre de 2026.
La línea de entrada en caché es la que hay que mirar con atención. Una diferencia de 42× en las lecturas de caché es el número individual más grande de esta comparación, y recae en la dimensión en la que realmente viven las cargas de trabajo de los agentes. Un bucle de agente que reenvía un prompt de sistema y un esquema de herramientas de 100.000 tokens en cada turno paga la tarifa de caché por la mayoría de sus tokens, no la tarifa de entrada anunciada.
Una llamada de 150.000 tokens, con precios calculados de ambas formas
Toma una solicitud plausible con forma de agente: 150.000 tokens de entrada, 50.000 de ellos servidos desde caché, y una respuesta de 4000 tokens. Con la tarifa con descuento de Meituan, esa llamada cuesta $0,0501. Con la tarifa de lista de Qwen3.8-Max, la misma llamada cuesta $0,3365 — 6,7× más, o $50 frente a $337 por mil llamadas al día. Lleva la combinación a que todo esté en caché, que es el estado estacionario de un prompt repetido, y la relación se amplía a 12,3×: $0,006 frente a $0,074 por llamada.
Nada en esa aritmética depende de que LongCat-2.5-Preview sea bueno. Ese es precisamente el problema. El multiplicador que te ofrecen es real, y la palabra que lleva adjunta en la propia página del proveedor es «por tiempo limitado», sin fecha de finalización y sin precio sucesor declarado. Un descuento de 6,7× sin vencimiento publicado es una partida presupuestaria que no puedes poner en un plan; es una partida presupuestaria que vigilas.
También hay una asimetría de enrutamiento que conviene decir con claridad. Qwen3.8-Max es una ruta que servimos — qwen/qwen3.8-max y la versión fijada qwen/qwen3.8-max-0902 — al precio de lista de Alibaba sin ningún margen, así que un cambio de precio del proveedor llega a nuestro lado el mismo día, no semanas después. LongCat-2.5-Preview no es una de nuestras rutas, y no vamos a pretender lo contrario; en el lado barato de esta comparación, estás tratando con la propia API de Meituan y con la plataforma a través de la cual accedas a ella.
La única afirmación que contradice la propia API de Meituan
Este es el hallazgo que debería decidir el enfrentamiento para cualquiera cuya carga de trabajo no sea texto puro.
El registro de cambios de Meituan incluye la comprensión de imágenes como la incorporación más destacada de la generación 2.5: «Comprensión multimodal: nueva capacidad de comprensión de imágenes, capaz de analizar el contenido de las imágenes, con soporte para preguntas y respuestas intermodales, resumen de contenido y razonamiento visual complejo». La publicación en X dice «nativamente multimodal». Son afirmaciones del proveedor y, por sí solas, sería razonable tenerlas en cuenta al tomar una decisión.
Luego, el mismo sitio de documentación publica la respuesta de ejemplo para recuperar los metadatos propios de ese modelo, y el modelo que devuelve es solo texto. Para el id "LongCat-2.5-Preview", la carga útil muestra context_length: 1048576, input_modalities: ["text"], output_modalities: ["text"], y una cadena de modalidad de text->text. Ninguna entrada de imagen. No en una instantánea antigua — sino en el ejemplo práctico de la página que documenta el endpoint.
![A screenshot of Meituan's LongCat API documentation for the model-retrieval endpoint, showing the worked example response for 'LongCat-2.5-Preview': context_length 1048576, input_modalities ["text"], output_modalities ["text"] and modality "text->text". The word 'text' is visible in red against the grey page.](https://cms.orcarouter.ai/api/media/file/2-1349.png)
Eso no prueba que el modelo no pueda ver. Prueba que el proveedor no ha conciliado su prosa con su propio esquema de API, y significa que un comprador no puede facturar una carga de trabajo de visión basándose en esa frase del changelog hasta que alguien lo resuelva. Ponlo junto al otro lado: nuestro catálogo incluye Qwen3.8-Max, que acepta entrada de texto, imagen y vídeo, con visión entre sus capacidades declaradas, y hay una tabla de benchmark independiente que respalda al modelo. Si tu tarea es la comprensión de documentos, la clasificación de capturas de pantalla o el análisis de fotogramas de vídeo, la columna cara es la que tiene una modalidad de entrada verificada y la columna barata es la que tiene una sin resolver. Esa sola fila puede borrar todo el 6,7×.
A qué no se puede anclar una vista previa
Alibaba distribuye instantáneas fechadas. qwen/qwen3.8-max-0902es una compilación con nombre y congelada al mismo precio de $2/$6 que el modelo base, lo que significa que una regla de enrutamiento que la nombre seguirá devolviendo los mismos pesos el mes que viene. Los cambios de comportamiento llegan como un nuevo id que puedes adoptar según tu propio calendario.
LongCat-2.5-Preview no tiene tal identificador. El id del modelo es el id de vista previa, no hay sufijo de instantánea, no hay historial de versiones en la plataforma, y no hay entrada en el registro de cambios que te diga que los pesos se movieron — solo que el descuento es "por tiempo limitado". Es una vista previa en el sentido habitual: lo que está bajo el nombre puede cambiar, y te enterarías por tu salida en lugar de por una nota de lanzamiento.
La forma más barata de comprar la evidencia que falta es la ventana que Meituan abrió al otro lado de esto: OpenCode lista LongCat-2.5-Preview como gratuito por un periodo limitado, con el proveedor siguiendo una política de retención cero y sin entrenar con tus datos, y el 26 de septiembre dijo que la ventana dura dos semanas. Entrada gratis, salida gratis, lecturas de caché gratis. Esa es una forma legítima de construir la tabla de benchmark que nadie ha publicado: ejecuta tu propio corpus de evaluación contra él y tendrás un número donde el proveedor te dio una frase. Lo que no es, es un precio con el que puedas planificar: las dos semanas terminan, y el número al otro lado lo decide Meituan.
¿Quién debería elegir cuál?
Recurre a Qwen3.8-Max cuando la carga de trabajo sea la razón por la que compras el modelo en primer lugar. Si la entrada son imágenes o vídeo, si la respuesta tiene que ser reproducible de una compilación a otra, si un índice independiente es un requisito de adquisición, o si la tarea es el tipo de codificación agéntica de la que Terminal-Bench y el Coding Index son proxies, el 6.7× es el precio de poder verificar tu trabajo. En una clave, también se sitúa detrás de una cadena de respaldo, de modo que un modelo con puntuación puede absorber un mal día del no puntuado sin que tengas que ejecutar dos integraciones.

Recurre a LongCat-2.5-Preview cuando la carga de trabajo sea de gran volumen, de contexto corto, solo texto e interna —clasificación, extracción, resumen, reescritura masiva— y cuando el coste de equivocarse sea un reintento y no un cliente. Con ese perfil, la línea de entrada en caché no es un descuento: es toda la economía del trabajo, y 42× es una cifra que merece el esfuerzo de medirse. Aprovecha la ventana gratuita para generar el benchmark que no existe. No migres una ruta crítica a él.
Qué cambiaría este veredicto, en orden de importancia: una evaluación independiente de LongCat-2.5-Preview; una fecha de finalización publicada y un precio sucesor para el descuento; un historial de versiones con instantáneas fechadas; y una resolución de si la lista de modalidades es solo texto o no. Cualquiera de esas cosas hace que la columna barata sea más que un descuento. Hasta que al menos una se materialice, esta comparación no es un enfrentamiento entre dos modelos — es un enfrentamiento entre un precio que puedes verificar y una capacidad que no puedes.

Comparados en este artículo1
Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario
