Una tarjeta destacada generada titulada MiniMax M3.1 Flash Preview vs MiniMax M3, con el subtítulo 'El modelo más nuevo de la línea no es el más seguro para llamar'. Una tarjeta izquierda dice 'MiniMax M3.1 Flash Preview: plan de tokens de $22-$132 al mes, sin tarifa por token publicada, sin pesos, pensamiento siempre activado'; una tarjeta derecha dice 'MiniMax M3: $0.30 / $1.20 por millón de tokens, pesos abiertos, el pensamiento se puede desactivar'. Un pie de página dice 'Ambos tienen una ventana de contexto de 1M de tokens. Cifras de MiniMax M3.1 Flash Preview según platform.minimax.io.'
Guides & Insights

MiniMax M3.1 Flash Preview vs MiniMax M3: cuando el modelo más nuevo es el más arriesgado

Autor

Magnus Corvin

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

La propia documentación del proveedor ahora enumera MiniMax-M3.1-Flash-Preview por encima de MiniMax-M3, y ese orden hace mucho trabajo persuasivo. Es el modelo de texto más reciente de la línea, conserva la misma ventana de contexto de un millón de tokens y añade un control de profundidad de pensamiento que el modelo anterior no tiene. Lo que la tabla no muestra es que el modelo anterior es el único de los dos que puedes descargar, poner precio por token, comparar con cualquier cosa o llamar sin suscripción — y que el nuevo ha eliminado un interruptor que MiniMax-M3 te daba.

Esta no es una historia sobre un modelo que ha sido reemplazado. Es una historia sobre un proveedor que divide su propia línea en un caballo de batalla de pago por uso y una vista previa con acceso por suscripción, y ambos no son intercambiables en ninguna dirección. Esto es lo que cada uno es en realidad.

Las dos fichas técnicas, una al lado de la otra

Empieza por lo que indican las propias páginas del proveedor para ambos, porque la forma de la diferencia se manifiesta aquí y no en una tabla de benchmarks.

• Anunciado — MiniMax-M3 el 1 de junio de 2026 con una nota de arquitectura, una hoja de benchmarks y una tabla de tarifas; MiniMax-M3.1-Flash-Preview el 27 de septiembre de 2026 con una entrada de documentación y una publicación en la cuenta de agente de MiniMax • Ventana de contexto — 1,000,000 tokens para ambos, según las propias tablas de modelos de MiniMax • Salida máxima — 512,000 tokens para MiniMax-M3 en nuestra entrada de catálogo, una cifra que MiniMax no publica por sí misma; no publicada para MiniMax-M3.1-Flash-Preview en ningún lugar • Modalidades de entrada — texto, imagen y vídeo de entrada, texto de salida, para ambos • Control de pensamiento — un parámetro thinking que se puede indicar a MiniMax-M3 que omita, y que se puede separar en un reasoning_details campo mediante reasoning_split; en MiniMax-M3.1-Flash-Preview el pensamiento es obligatorio y reasoning_split no se puede desactivar • Profundidad de pensamiento — no disponible en MiniMax-M3; una escala effort de low, medium, high, xhigh y max, con valor predeterminado max, en MiniMax-M3.1-Flash-Preview • Velocidad de salida publicada — aproximadamente 100+ tokens por segundo para MiniMax-M3, según la propia tabla de modelos de MiniMax; nada publicado para MiniMax-M3.1-Flash-Preview • Pesos — MiniMax-M3 es de pesos abiertos con un repositorio público; MiniMax-M3.1-Flash-Preview no tiene ninguno • Precios — $0.30 por millón de tokens de entrada y $1.20 por millón de salida para MiniMax-M3 a la tarifa del proveedor; no existe tarifa por token para MiniMax-M3.1-Flash-Preview • Acceso — MiniMax-M3 en pago por uso y en Token Plan, y enrutable a través de plataformas de terceros; MiniMax-M3.1-Flash-Preview solo en Token Plan y MiniMax Code

Dos de esas filas pertenecen a una categoría distinta del resto. La velocidad de salida publicada es una cifra del fabricante solo para el modelo anterior, así que el modelo más nuevo se vende como el rápido sin una cifra que lo respalde. Y el control de pensamiento ha ido en dirección opuesta a la del marketing: el modelo más nuevo ofrece un control más fino sobre cuánto piensa, a la vez que elimina tu capacidad de impedir que piense por completo.

El cambio que MiniMax eliminó

Este es el detalle con más probabilidades de pasar factura, y está documentado en lugar de oculto. Con MiniMax-M3, enviar thinking: {"type": "disabled"} en el endpoint compatible con OpenAI omite el razonamiento y devuelve una respuesta directa; en el endpoint compatible con Anthropic, el razonamiento está desactivado de forma predeterminada y se puede activar con adaptive. En MiniMax-M3.1-Flash-Preview, la misma solicitud devuelve HTTP 400 con el mensaje requires adaptive thinking. No existe ninguna forma admitida de obtener una respuesta sin razonamiento.

En la práctica, eso significa que una carga de trabajo que usaba MiniMax-M3 como un clasificador o enrutador barato y rápido —prompt corto de entrada, respuesta estructurada corta de salida, sin cadena de pensamiento— no tiene una ruta de actualización directa al modelo más nuevo. Puedes reducir effort a low, y la guía de MiniMax es explícita en que reducir el effort es la forma prevista de disminuir la latencia y los tokens del razonamiento en lugar de desactivarlo. Pero los tokens y la latencia no llegan a cero, y para un trabajo de extracción de gran volumen que escribe cuatro campos por llamada, «siempre piensa primero» tiene un perfil de costos distinto de «piensa cuando se le pide».

A generated two-column scoreboard titled 'MiniMax M3.1 Flash Preview vs MiniMax M3 — the scoreboard'. The left column, MiniMax M3.1 Flash Preview, reads 'AA Intelligence: none published', 'Thinking off: not allowed (HTTP 400)', 'Thinking depth: effort low to max', 'Published speed: none', 'Open weights: no', 'Per-token price: not published'. The right column, MiniMax M3, reads 'AA Intelligence: 29.2', 'Thinking off: supported', 'Thinking depth: not available', 'Published speed: 100+ tokens per second (vendor)', 'Open weights: yes', 'Per-token price: $0.30 / $1.20'. A footer reads 'MiniMax M3 figures per Artificial Analysis and MiniMax; MiniMax M3.1 Flash Preview has no independent scores of any kind.'

¿Qué se mide realmente en cada uno?

Un lado de esta comparación tiene números y el otro tiene una columna en blanco, y vale la pena ser preciso acerca de a quién pertenecen esos números.

El historial independiente de MiniMax-M3 es real: Artificial Analysis lo sitúa en 29,2 en el Intelligence Index —puesto 60 de 145—, con 58,6 en el Coding Index, 59,18 en su índice de matemáticas, 92,9% en GPQA Diamond dentro de la misma familia de índices, 83% de recuperación de contexto largo y 82,9% en IFBench. Esas son evaluaciones de terceros de un modelo que cualquiera puede descargar y volver a ejecutar. Los propios números de lanzamiento de MiniMax para M3 —BrowseComp con 83,5%, SWE-Bench Pro con 59,0%, Terminal-Bench 2.1 con 66,0%, MCP Atlas con 74,2%, OSWorld-Verified con 70%— son cifras del proveedor y no las hemos visto reproducidas.

MiniMax-M3.1-Flash-Preview no tiene ninguno de los dos. MiniMax no publicó ninguna tabla de benchmarks, y el modelo no aparece en el índice de Artificial Analysis, por lo que no hay puntuación independiente, ni índice de programación, ni cifra de recuperación en contextos largos, ni medición de alucinaciones. Cada caracterización que circula sobre él —"rápido", "fiable", "creado para el desarrollo cotidiano"— es el adjetivo del propio proveedor en la publicación de lanzamiento. Vale la pena decir esta ausencia con claridad porque es de doble filo: no se ha demostrado que nada sea peor, y no se ha demostrado que nada sea mejor.

Esa asimetría es toda la decisión. Puedes evaluar MiniMax-M3 esta tarde descargándolo o llamándolo, y puedes comparar esa evaluación con una tabla de clasificación pública. Con MiniMax-M3.1-Flash-Preview solo puedes usarlo y formarte una opinión privada.

Donde el modelo más nuevo gana de verdad

Sería fácil leer lo anterior como un argumento para ignorar el nuevo modelo, y esa tampoco es la conclusión correcta. Tres cosas son reales y específicas de él.

La escala de esfuerzo es una capacidad real, no un interruptor. Cinco niveles — bajo hasta máximo: permiten que un solo modelo atienda un renombrado de rutina y una refactorización de todo el repositorio con distintos costos de cómputo, y está documentado que resulta efectivo únicamente para MiniMax-M3.1-Flash-Preview. En MiniMax-M3, tu elección es binaria. Si tu problema es que no puedes predecir la latencia por tarea, una profundidad ajustable es exactamente el control que querías.

Es el modelo actual más destacado del proveedor, lo que significa que hereda todo lo que el linaje de la serie M ha aprendido desde junio, y MiniMax afirma explícitamente que es el modelo más reciente para razonamiento agéntico, uso de herramientas, programación y tareas de contexto largo. La maquinaria de uso de herramientas con pensamiento intercalado que introdujo M3 se mantiene, incluido el requisito de volver a añadir la respuesta completa —incluidos los bloques de pensamiento— al historial de mensajes.

Y acepta video, a un precio tipo Flash, dentro de una suscripción. MiniMax-M3 también lo hace, a un precio por token. Si ya estás pagando una licencia del Token Plan y tu única barrera para usar la entrada de video era el costo marginal por llamada, M3.1-Flash-Preview elimina esa barrera.

Donde el modelo más antiguo sigue siendo al que hay que recurrir

Tres casos, todos ellos sobre previsibilidad más que sobre calidad.

Cuando necesitas modelar costos. MiniMax-M3 tiene una tarifa: $0.30 por millón de tokens de entrada, $1.20 por millón de salida y una tarifa de lectura de caché de $0.06 por millón en nuestro catálogo. Puedes estimar la factura mensual de una carga de trabajo al centavo antes de ejecutarla. MiniMax-M3.1-Flash-Preview no tiene ninguna tarifa por token en ninguna parte de las páginas de MiniMax, así que su costo es tu suscripción dividida por lo mucho que la uses: bien para un presupuesto fijo, inútil para la economía unitaria.

Cuando necesitas que el modelo sea el modelo. MiniMax-M3 es de pesos abiertos: puedes descargarlo, ejecutarlo en tu propio hardware y saber que el artefacto que responderá a tus llamadas dentro de seis meses es el mismo que responde a ellas hoy. MiniMax-M3.1-Flash-Preview no tiene checkpoint, y el acceso de nivel preview significa que la pila de servicio, la composición de la cuota y la disponibilidad están totalmente controladas por el proveedor y están explícitamente sujetas a cambios.

Cuando necesitas una respuesta sin razonamiento. Como arriba —esta es la única regresión de capacidad en la comparación, y es la que sorprende a la gente, porque un modelo más nuevo que no puede hacer algo que el anterior sí podía no es un caso para el que alguien se prepare.

A headless Chromium screenshot of MiniMax's own model documentation page, showing the note that MiniMax-M3.1-Flash-Preview is available only through Token Plan and MiniMax Code for now, followed by the language model table in which MiniMax-M3.1-Flash-Preview is listed first with a 1,000,000-token context window and the description 'Frontier multimodal coding model with 1M context window and tunable thinking depth', above MiniMax-M3 with the same 1,000,000-token window, captured 28 September 2026.

Llamando a ambos desde un mismo lugar

Lo incómodo aquí es que los dos modelos se compran de manera distinta —uno por consumo, otro por suscripción—, y el instinto natural es tomar partido. Lo más útil es enrutar entre ellos según la forma de la tarea, lo que solo funciona si se puede acceder al lado por consumo desde el mismo lugar que a todo lo demás.

MiniMax-M3 en OrcaRouter tiene el precio de lista de MiniMax con 0% de margen añadido, por lo que los $0.30 y $1.20 en la tarifa son lo que cuesta una llamada, sin margen de plataforma adicional. Se encuentra en el mismo endpoint compatible con OpenAI que MiniMax M2.7 — la misma etiqueta de $0.30/$1.20 en una ventana de 200,000 tokens, también de pesos abiertos — y que más de 200 otros modelos, con una sola clave de API, con failover automático entre proveedores cuando un endpoint falla. Frente a nuestra propia telemetría, que es un tipo de número diferente al de un proveedor: durante los últimos siete días, M3 ha respondido a aproximadamente 238 tokens de salida por segundo con una p50 de unos 4.1 segundos hasta el primer token, con una tasa de error cercana al 0.15%, medida en el playground de OrcaRouter. Si quieres mantener a MiniMax-M3 como la mitad confiable de un pipeline y tratar a MiniMax-M3.1-Flash-Preview como la mitad experimental, la mitad confiable es una línea de configuración en lugar de una segunda relación con un proveedor. MiniMax-M3.1-Flash-Preview en sí no está en nuestro catálogo; la ruta hacia él es el propio Token Plan y producto de codificación del proveedor.

Lo que cambiaría este artículo es concreto y fácil de detectar. Una tabla de tarifas publicada para MiniMax-M3.1-Flash-Preview haría desaparecer la razón principal para preferir M3 por motivos económicos. Un conjunto de puntuaciones independientes sustituiría la columna en blanco por algo comparable. Un checkpoint descargable eliminaría la objeción de reproducibilidad. Hasta que llegue al menos uno de esos, MiniMax-M3 sigue siendo el modelo de este par al que se le pueden pedir cuentas — y el más nuevo sigue siendo la vista previa más rápida, mejor controlada y sin mediciones por la que MiniMax ha decidido cobrar por mes en lugar de por token.

A headless Chromium screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the model title 'MiniMax: MiniMax M3', a context length of 1,048,576 tokens, a maximum output of 512,000 tokens, and a pricing panel reading 0.300 US dollars per million input tokens, 1.20 per million output tokens and 0.060 per million cache-read tokens, captured 28 September 2026.