
MiniMax M3.1 Flash Preview ya está disponible en el Token Plan: lo que tu suscripción realmente desbloquea
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 468 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1329 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
MiniMax-M3.1-Flash-Preview se lanzó el 27 de septiembre de 2026, y la forma en que se lanzó es la historia. No es un modelo de pago por uso. El proveedor ha puesto su modelo de texto más reciente detrás de la misma Token Plan Subscription Key que ya cubre MiniMax-M3, MiniMax M2.7 y la variante M2.7-highspeed, así que, si ya tiene una licencia, no hay ninguna clave nueva que generar ni un segundo contrato que firmar. Lo que tampoco existe, a día de hoy, es un precio por token, una ficha del modelo, un benchmark publicado ni forma alguna de desactivar el pensamiento del modelo.
Esa combinación —acceso sin fricción combinado con condiciones económicas totalmente inéditas— es lo bastante inusual como para merecer un análisis detallado antes de que alguien conecte a ella una pipeline de producción. El resto de este artículo es lo que la propia documentación del proveedor dice en realidad, lo que de manera llamativa no dice, y la única línea de código que te dirá en menos de un minuto si este modelo encaja con tu forma de trabajar.
¿Qué aterrizó realmente el 27 de septiembre?
La documentación para desarrolladores de MiniMax ahora incluye una nota permanente, repetida en cada página de modelos de texto: MiniMax-M3.1-Flash-Preview solo está disponible por ahora a través de Token Plan y MiniMax Code. El modelo aparece en primer lugar en la propia tabla de modelos del proveedor, por encima de MiniMax-M3, y se describe como un modelo de codificación multimodal de vanguardia con una ventana de contexto de 1M y profundidad de razonamiento ajustable.
• Ventana de contexto — 1.000.000 de tokens, el mismo límite que tiene MiniMax-M3
• Modalidades de entrada — texto, imagen y vídeo, devuelve texto
• Profundidad de razonamiento — un ajuste de esfuerzo que acepta bajo, medio, alto, muy alto y máximo, con valor predeterminado máximo cuando se omite
• Soporte de protocolos — el mismo id de modelo funciona en el endpoint compatible con Anthropic de MiniMax, su endpoint compatible con OpenAI y su endpoint OpenAI Responses
• Disponibilidad — solo Token Plan y MiniMax Code; no en pago por uso
• Precio — no se publica ninguna tarifa por token en ningún sitio
• Pesos — ninguno; los dos repositorios públicos más recientes de la organización MiniMaxAI siguen siendo MiniMax-M3 y MiniMax-H3
• Benchmarks independientes — ninguno; el modelo no aparece en el índice de modelos de Artificial Analysis
La empresa lo anunció el mismo día en su cuenta de MiniMaxAgent, presentándolo para el desarrollo cotidiano y no para el trabajo de frontera: rápido y fiable, desde correcciones rápidas de errores hasta el desarrollo completo de funcionalidades. Ese es el cometido de un nivel Flash, no el de un buque insignia. La cobertura de agencias de terceros de PANews y KuCoin lo describió en los mismos términos y señaló que los desarrolladores habían detectado el modelo en el selector de MiniMax Code antes de que la empresa lo confirmara.

Qué clave usas importa más de lo habitual
Esta es la parte que pilla a la gente. MiniMax maneja dos tipos de credenciales distintos, y M3.1-Flash-Preview solo responde a una de ellas. La Token Plan Subscription Key proviene de Billing > Token Plan y cubre el uso de la suscripción y los Credits comprados. La API Key de pago por uso cubre los modelos por token. La documentación del proveedor es explícita en que las dos no son intercambiables, y que una Subscription Key puede existir antes de que se le asocie cualquier recurso de pago — en cuyo caso es una clave válida sin nada detrás.
Así que la prueba práctica no es "¿tengo una clave de API de MiniMax?" sino "¿tengo un asiento de Token Plan?". Los asientos existentes están cubiertos. La documentación señala que una Clave de Suscripción se vuelve utilizable cuando se asigna un asiento o acceso a Créditos, y que, una vez agotada la cuota de la suscripción, se recurre automáticamente al excedente de Créditos.
También hay una inconsistencia en la documentación que conviene conocer, porque confundirá a cualquiera que lea primero la página de precios. La nota al pie de cobertura de la página de precios de Token Plan todavía enumera la línea elegible como M3, M2.7, imagen y voz, con H3 excluido — no se ha actualizado para nombrar M3.1-Flash-Preview. Las páginas de los modelos dicen lo contrario: que M3.1-Flash-Preview está disponible en Token Plan y nada más. Ambas páginas son páginas de proveedor activas a día de hoy. Solo la clave que tienes en la mano lo zanja.
El 400 que te dice qué tipo de modelo es este
Todos los modelos de la serie M de MiniMax piensan antes de responder, pero M3.1-Flash-Preview es el primero que se niega a parar. Envía thinking: {"type": "disabled"} o reasoning_effort: "none" y la API devuelve HTTP 400 con el mensaje:
El modelo "MiniMax-M3.1-Flash-Preview" requiere pensamiento adaptativo; no se permite thinking.type="disabled" (incluido reasoning.effort=none) (2013)
La propia guía del proveedor es reducir el esfuerzo en lugar de intentar desactivar el pensamiento, y la escala es la palanca de latencia: una edición rutinaria en low y un cambio en todo el repositorio en xhigh son el mismo modelo haciendo distintas compensaciones. Dos detalles adicionales son específicos de este modelo. El parámetro reasoning_effort está documentado como efectivo solo para MiniMax-M3.1-Flash-Preview; no es un control general de la serie M. Y el conmutador de salida reasoning_split, que separa el pensamiento en el campo reasoning_content, actualmente no se puede establecer en false en este modelo.
Dónde aterriza el texto de pensamiento depende del protocolo: el endpoint compatible con Anthropic lo devuelve como un bloque de contenido de tipo thinking, mientras que el endpoint compatible con OpenAI lo devuelve en reasoning_content, y el endpoint de Responses lo devuelve como un elemento de salida de razonamiento. Si estabas extrayendo etiquetas <think> de la salida de MiniMax-M3, ese trabajo ya no es necesario en el modelo más reciente — y, en el caso de conversaciones con uso de herramientas intercalado, la respuesta completa, incluido el bloque de pensamiento, debe volver a añadirse al historial de mensajes o la cadena de razonamiento se rompe.
La promoción en curso ahora mismo
MiniMax Code está llevando a cabo una promoción de check-in del 28 de septiembre al 7 de octubre en UTC+8, duplicando los créditos gratuitos otorgados por inicios de sesión diarios y abriéndola tanto a usuarios nuevos como existentes. Los créditos reportados se aplican a todos los modelos compatibles, con M3.1-Flash-Preview y los modelos de video H3 mencionados como ejemplos. Por separado, la compañía dijo que las cuotas del Token Plan se restablecen para todos los usuarios en el lanzamiento y que se planean más restablecimientos durante el evento, con la elegibilidad mostrada en la aplicación.
Trata esos dos como declaraciones del proveedor transmitidas a través de la cobertura del lanzamiento: son términos promocionales con fechas asociadas, no comportamiento del producto, y esa misma cobertura señala que el anuncio no especificó la cantidad de créditos por check-in ni las reglas precisas para los días perdidos. La economía en estado estacionario es más fácil de exponer: Token Plan figura a $22 al mes para Plus, $55 para Max y $132 para Ultra, con ventanas de cuota móviles de 5 horas y semanales, dimensionadas por el proveedor en aproximadamente tres a cuatro, cuatro a cinco y seis a siete agentes concurrentes, respectivamente. Purchased Credits funcionan a 1.000 créditos por dólar y se deducen al precio de lista de pago por uso de cada modelo.
Las cuatro cosas que este modelo todavía no tiene
Nada de lo siguiente es una crítica al modelo; cada uno es un hueco que un equipo tiene que tener en cuenta al planificar, y los cuatro son verificables hoy.
• Sin precio. No hay ninguna tarifa por token para M3.1-Flash-Preview en ninguna página de MiniMax, por lo que no se puede comparar, en coste por token, con los $0.30 por millón de entrada y $1.20 por millón de salida de M3, ni con ninguna otra cosa.
• Sin benchmarks. MiniMax no publicó ninguna tabla de evaluación con este lanzamiento. Tampoco lo ha hecho nadie más: el modelo está ausente del índice de Analysis, por lo que su columna está genuinamente vacía, no solo porque sea pronto.
• Sin pesos. MiniMax-M3 se lanzó con pesos abiertos; M3.1-Flash-Preview no tiene repositorio ni checkpoint.
• Sin medición independiente. No hay cifras de velocidad de salida, latencia o tasa de errores de ningún tercero, ni tampoco de nuestra propia telemetría de enrutamiento, porque el modelo no está en nuestro catálogo.
Frente al lanzamiento de M3 en junio de 2026, que llegó con una nota de arquitectura, una hoja de benchmarks y una tarifa de precios desde el primer día, esta es una publicación deliberadamente discreta. La lectura plausible —y es una lectura, no un plan declarado— es que MiniMax quiere uso real dentro de su propio producto antes de decidir cuánto cuesta el modelo y si lo abre al público.

Lo que acertó la nota de avance filtrada
Cuatro días antes del lanzamiento, circuló un documento de vista previa transcrito en un repositorio público de socios que describía un MiniMax M3.1 con atención dispersa, cuantización de atención Q8KV4, expertos enrutados NVFP4, una cabeza de decodificación especulativa DSpark y un nuevo reasoning_effort campo que toma valores desde max hasta low. En ese momento lo escribimos como no verificado, porque lo era: no existían pesos, ni tarjeta de modelo, ni página de precios, ni id de modelo de API.
Una de esas cinco afirmaciones está ahora confirmada por la documentación del propio proveedor, y es el campo reasoning_effort —incluida la escala de máximo a bajo, que coincide exactamente con los valores incluidos en la versión. Las otras cuatro siguen sin confirmarse. La descripción publicada por MiniMax de M3.1-Flash-Preview solo dice que es un modelo de programación multimodal de frontera con un contexto de 1M y profundidad de pensamiento ajustable; no describe el esquema de atención, la cuantización ni la cabeza de decodificación. Cualquiera que repita las afirmaciones sobre atención dispersa y NVFP4 como especificación establecida está repitiendo la transcripción de un tercero, que es exactamente lo que el lanzamiento no confirmó.
Si quieres probarlo sin jugarte un pipeline en ello
La parte incómoda de una vista previa solo de Token-Plan es que la forma natural de evaluar un nuevo modelo — llamarlo desde tu stack existente y medirlo — es lo único que no puedes hacer limpiamente. No hay una tarifa por token con la que modelar, ni un perfil de latencia publicado, ni una estrategia de failover dentro del propio producto del proveedor si la vista previa se tambalea.
Esa es la situación para la que está pensada una capa de enrutamiento. Todo lo que puedes invocar hoy está detrás de un único endpoint compatible con OpenAI y una única clave de API, y los modelos contiguos a este ya están ahí: MiniMax-M3 a la tarifa del proveedor de 0,30 $ por millón de tokens de entrada y 1,20 $ por millón de salida, MiniMax M2.7 con el mismo precio de etiqueta y una ventana de 200.000 tokens y pesos abiertos, y los niveles Flash de DeepSeek y Qwen en la misma franja de precios. Los precios de nuestro lado son el precio de lista del proveedor trasladado con un 0 % de margen, así que cuando un proveedor baja una tarifa, llega aquí el mismo día en lugar de en un ciclo de renegociación. La conmutación por error automática hace que una dependencia de calidad de vista previa pueda situarse junto a una ruta de producción en lugar de por debajo, y cuando MiniMax publique una tarifa y un endpoint para MiniMax-M3.1-Flash-Preview, la pregunta pasa a ser una entrada en la tabla de enrutamiento en vez de un proyecto de migración. MiniMax-M3.1-Flash-Preview no está en nuestro catálogo, y la forma de acceder a él hoy es el propio Token Plan del proveedor y su producto de programación.
El resumen honesto para un equipo que lea esto el día del lanzamiento: el modelo está activo, es gratis en el margen si ya pagas un asiento de Token Plan, y carece por completo de precio y de medición en sus propios términos. Pruébalo dentro de MiniMax Code, mantén la pipeline de la que dependes en un modelo con una lista de tarifas y un historial comprobado, y estate atento a las dos cosas que convertirán esto de una curiosidad en una decisión: un precio publicado y las primeras puntuaciones independientes.

