Una tarjeta de título principal generada que dice 'LongCat-2.5-Preview vs MiniMax M3' con el antetítulo 'El asiento barato ya está ocupado', y dos paneles: 'LongCat-2.5-Preview: $0.30 / $1.20 por 1M, salida máxima de 131,072' y 'MiniMax M3: $0.30 / $1.20 por 1M, salida máxima de 512,000'. Logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

LongCat-2.5-Preview vs MiniMax M3: El asiento barato ya está ocupado

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La premisa de la mayoría de la cobertura de LongCat-2.5-Preview es que Meituan ha ofrecido precios más bajos que el resto. Contra MiniMax M3, esa premisa se desvanece al contacto. MiniMax M3 figura en nuestro catálogo a $0.30 por millón de tokens de entrada y $1.20 por millón de tokens de salida. La tarifa publicada de LongCat-2.5-Preview es de $0.30 por millón de tokens de entrada sin caché y $1.20 por millón de tokens de salida. No son cifras parecidas; son las mismas cifras. El único punto en el que difieren es la entrada en caché, donde Meituan cotiza $0.006 por millón frente a los $0.06 del proveedor establecido — una brecha de diez veces en la línea más barata de la factura. Así que la pregunta interesante no es si LongCat-2.5-Preview es barato. Es qué estás comprando y a qué renuncias cuando un nuevo modelo llega exactamente al precio del proveedor establecido.

La respuesta breve: un techo de salida mucho más alto, una base de evidencia mucho más delgada y un descuento de caché.

Mismo precio destacado, techos publicados muy diferentes

MiniMax M3 está en el registro desde el 31 de mayo de 2026. Nuestro catálogo lo incluye con una ventana de contexto de 1.048.576 tokens y una salida máxima de 512.000 tokens — más de lo que permiten la mayoría de los modelos, y cuatro veces los 131.072 de LongCat-2.5-Preview. Acepta texto, imágenes y vídeo como entrada y devuelve texto, con llamadas a herramientas, modo JSON y razonamiento expuestos.

A screenshot of Meituan's LongCat API Platform change-log page, headlined 'Version: 2026-09-25 - LongCat-2.5-Preview Now Available', listing the model's three stated features - multimodal image understanding, coding capability, and compatibility with Claude Code, Hermes, OpenClaw, OpenCode and Kilo Code - with the platform's Guide, API, Tools and Pricing navigation and its column of earlier dated releases visible.

LongCat-2.5-Preview, incluido en la LongCat API Platform de Meituan el 25 de septiembre de 2026, coincide en contexto con 1.000.000 de tokens y se queda muy corto en la salida con 131.072. Su perfil de entrada es la cuestión clave: el registro de cambios presenta la comprensión de imágenes como su incorporación principal, pero la respuesta de ejemplo en la propia documentación "Retrieve Model" de Meituan todavía muestra input_modalities/ como ["text"]/ con una text->text/ cadena de modalidad. MiniMax M3 también acepta vídeo, algo que LongCat-2.5-Preview no declara en absoluto. Si tu pipeline alimenta grabaciones de pantalla o secuencias de fotogramas, esta comparación termina aquí.

La asimetría de caché va en la dirección contraria y merece mencionarse a favor de Meituan, porque es la única dimensión en la que el nuevo modelo realmente se diferencia. $0.006 por millón de entrada en caché frente a $0.06 es una ventaja real para las cargas de trabajo de agentes que reenvían el mismo prefijo largo en cada turno —que es la mayoría de ellas—. También es la partida más propensa a cambiar sin aviso, ya que Meituan marca toda la tarjeta como un descuento por tiempo limitado.

La brecha de evidencia, medida honestamente en ambas direcciones

La posición de MiniMax M3 en los benchmarks no es sólida, y decirlo forma parte de hacer esta comparación correctamente. Artificial Analysis registra un Coding Index de 58.6 para él —cuadragésimo sexto de los modelos seguidos— y un Intelligence Index de 29.2 en el sexagésimo puesto. GPQA Diamond 92.9%, Humanity's Last Exam 39%, SciCode 47.1%, Long-Context Recall 83, τ²-Bench banking 15.3, Terminal-Bench v2.1 65.2. Las cifras publicadas por el propio MiniMax abarcan otro terreno: BrowseComp 83.5, rúbricas de GDPval 76.7, MCP Atlas 74.2, BankerToolBench 76.1. Son números reportados por el proveedor y pertenecen a una columna distinta de la de los independientes, pero existen, que es la palabra clave.

A screenshot of OrcaRouter's own model page for MiniMax M3 at /models/minimax/minimax-m3, showing the minimax/minimax-m3 identifier, a 1M-token context window, 512K maximum output, text + image + video input and text output, Vision, Tools, JSON and Reasoning capability chips, a release date of 2026-05-31, a p50 first-token figure of 3.35 s, $0.30 and $1.20 rate tiles, and the OpenAI-compatible code samples.

LongCat-2.5-Preview no tiene columna alguna. Ninguna tabla de benchmarks publicada, ninguna tarjeta de modelo, ningún informe técnico, ningún repositorio en HuggingFace ni en la organización de GitHub de Meituan, y metadatos del catálogo que registran los pesos abiertos como falsos. El recuento de parámetros de aproximadamente 1,6 billones en total / 48 mil millones activos se reporta a partir de los metadatos del sitio de Meituan y la cobertura de la prensa especializada china, en lugar de la documentación. Así que la afirmación precisa es: las puntuaciones de M3 son mediocres y provienen de fuentes independientes; las de LongCat-2.5-Preview están ausentes. Un modelo que puntúa en la cuarentena en el índice de programación es un valor conocido sobre el que puedes planificar. Un modelo sin puntuación es un tipo de riesgo diferente, y que el precio sea idéntico elimina la compensación que normalmente justificaría elegirlo.

Cuando el mismo precio cambia lo que deberías hacer

Cuando un nuevo modelo ofrece un precio más bajo que el resto, la jugada racional es evaluarlo: la ventaja es un descuento real. Cuando un nuevo modelo llega exactamente al mismo precio que un modelo establecido que se comercializa desde mayo, la ventaja no es el precio. Es la capacidad, y la capacidad es lo único que LongCat-2.5-Preview no ha publicado. Eso replantea la evaluación por completo: no estás evaluando si es más barato, estás evaluando si es mejor, en tus tareas, desde cero y sin evidencia en la que anclarte.

Hay un detalle de segundo orden que hace que esa prueba sea más barata de lo que parece. LongCat-2.5-Preview es gratuito e ilimitado a través de OpenCode durante una ventana de duración no declarada, con una política de retención cero que OpenCode documenta explícitamente —entrenamiento del modelo "No se usa", retención de datos "0 días", frente a treinta días en el listado de comparación. Así que el costo de generar tu propia evaluación es cercano a cero, y la política de retención significa que puedes ejecutarla contra código privado. El único detalle del harness que conviene resolver primero es que el modelo devuelve su traza de razonamiento de forma intercalada en un campo reasoning_content/; los clientes que analizan chat completions sin esperarlo descartarán el razonamiento en silencio y harán que el modelo parezca peor de lo que es.

A generated two-column scoreboard titled 'LongCat-2.5-Preview vs MiniMax M3' with the subhead 'Identical headline rates, four times the output ceiling, ten times the cache discount'. Left column 'LongCat-2.5-Preview' (Meituan, listed 2026-09-25, no benchmark published): 1,000,000-token context, 131,072 max output, text with image input claimed not confirmed, $0.30 uncached / $0.006 cached input, $1.20 output flagged limited-time, coding index not published, long-context recall not published, no repo and catalogue open_weights false. Right column 'MiniMax M3' (MiniMax, released 2026-05-31, independently scored): 1,048,576-token context, 512,000 max output described as four times as much, text, image and video to text, $0.30 uncached / $0.06 cached input, $1.20 output, coding index 58.6 at rank 46 and intelligence index 29.2 at rank 60 by Artificial Analysis, long-context recall 83. Footnote credits the left column to Meituan's changelog and pricing page and the right column to OrcaRouter's catalogue with index figures sourced to Artificial Analysis, and notes that LongCat-2.5-Preview is not routed by OrcaRouter. OrcaRouter logo bottom-right.

El argumento de enrutamiento, específico de una comparación al mismo precio

Servimos MiniMax M3 al precio de lista de MiniMax con cero margen de beneficio. LongCat-2.5-Preview no es una de nuestras rutas — no lo servimos, y nada de lo que aquí se dice debe interpretarse como que afirmamos lo contrario.

Un enfrentamiento a igual precio es exactamente el caso en el que el enrutamiento se gana su sustento en lugar de ser una simple conveniencia. Si dos modelos cuestan lo mismo, la decisión entre ellos es por solicitud y por tarea: M3 por su techo de salida de 512.000 tokens y su entrada de vídeo, y LongCat-2.5-Preview por el descuento del prefijo en caché en bucles de agente largos, una vez que te hayas convencido de su calidad. La fusión de modelos es el mecanismo que hace que eso sea literal: una pasada de recuperación y un paso de síntesis pueden ser modelos distintos en una sola solicitud, así que no estás obligado a elegir un ganador antes de tener pruebas. Y como repercutimos los precios de lista de los proveedores sin margen alguno, un cambio de tarifa de un proveedor llega a tu factura el mismo día en lugar de en la siguiente renovación de contrato, lo que importa más de lo habitual cuando una de las dos tarjetas es explícitamente promocional. La conmutación automática por error, por su parte, cubre el caso en el que un proveedor se degrada, y es más importante para el modelo que no tiene historial de servicio que se pueda inspeccionar.

Frecuentemente preguntado

• ¿Es LongCat-2.5-Preview más barato que MiniMax M3? No. En las tarjetas de precios publicadas, las tarifas de entrada y salida son idénticas: $0.30 y $1.20 por millón. La única ventaja de precio está en la entrada en caché, $0.006 frente a $0.06, y Meituan etiqueta toda su tarjeta como un descuento por tiempo limitado sin decir qué sigue.

• ¿Cuál tiene la salida utilizable más grande? MiniMax M3 por un amplio margen: 512.000 tokens frente a 131.072. Para la generación de textos extensos, la extracción estructurada de documentos grandes o cualquier cosa que escriba más de un capítulo, ese límite es la especificación decisiva.

• ¿Cuál puedo verificar? MiniMax M3, y la verificación no lo favorece: Coding 58.6 en el cuadragésimo sexto puesto y un Intelligence Index de 29.2 en el sexagésimo, según Artificial Analysis. LongCat-2.5-Preview no tiene ninguna evaluación publicada por nadie. Si aparece un benchmark de LongCat-2.5-Preview esta semana, trátalo como no verificable hasta que puedas rastrearlo hasta un evaluador con nombre.

• ¿Cuál debería poner en producción? Ninguno sin una prueba propia. Entre los dos, M3 es la opción de menor varianza porque sus debilidades están documentadas y sus modalidades de entrada están confirmadas; LongCat-2.5-Preview es la de mayor varianza, con una afirmación de contexto más grande, un techo de salida mucho más pequeño, un descuento por caché y cero evidencia pública. Pruébalo gratis mientras la ventana esté abierta; mantén ambos detrás de una sola clave, y deja que tus propios números tomen la decisión.