
MiniMax M3.1: Lo que dicen los documentos filtrados de la vista previa — y lo que nadie ha confirmado
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 434 tok/s
- openaiNUEVOOpenAI: GPT-6 Luna2026-09-2237Inteligencia
- openaiNUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- anthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- grokNUEVOGrok 4.72026-09-2146Inteligencia
- OrcaNUEVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNUEVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencia69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligencia72Código
Hay un checkpoint de 250 GB en Hugging Face llamado MiniMax-M3.1-preview-private que nadie fuera de un puñado de socios de inferencia puede abrir. Hay un documento fechado el 22 de septiembre que se lee exactamente como la nota de arquitectura del proveedor, y que circula en un repositorio público de ingeniería de socios en lugar de en el sitio del propio proveedor. Y el 26 de septiembre, un observador de modelos ampliamente seguido publicó que MiniMax M3.1 es «el próximo modelo que llegará la semana que viene» y que ya está probando una vista previa de él. Junta esos tres elementos y tienes todo el registro público de MiniMax M3.1: un modelo cuyo nombre, cambios de arquitectura, número de pesos y semana de llegada están todos en circulación, y sobre ninguno de los cuales el proveedor ha dicho una palabra en público. El predecesor del que desciende, MiniMax M3, es otra historia: ese sí se lanzó, y es la razón por la que a alguien le importa este.
Así se ve desde fuera un modelo no publicado, y vale la pena ser precisos sobre la forma de la evidencia, porque los tres hilos no son igualmente sólidos. La existencia del checkpoint está corroborada: múltiples líneas independientes apuntan al mismo nombre de repositorio privado y al mismo número de archivos. El documento de arquitectura no está corroborado de esa manera —es la transcripción de un tercero, y podría ser auténtico, obsoleto o estar en parte inventado. La afirmación de la “semana entrante” es la expectativa de una persona, no un calendario. Todo en este artículo está etiquetado con la fuerza que realmente tiene, y nada de lo que hay aquí debería leerse como un anuncio de lanzamiento.
Lo que hace que MiniMax M3.1 merezca un artículo antes de que exista es su predecesor. MiniMax M3 fue, según la mayoría de las opiniones, el modelo de pesos abiertos más potente que MiniMax había lanzado: un modelo de 1M de tokens, de texto, imagen y vídeo, que alcanzó el Artificial Analysis Intelligence Index con 29.2 y sigue siendo uno de los pocos modelos abiertos capaces de mantener unido un contexto genuinamente largo. Si M3.1 llega en la última semana de septiembre, las cifras que le importan a un desarrollador no son la verosimilitud de la filtración, sino qué cambió en las capas y cuánto cuesta servirlo, y en ambos aspectos, el documento filtrado es inusualmente específico.
¿Qué está confirmado y qué solo circula?
La división honesta, a fecha de 27 de septiembre de 2026:
• Confirmado: no existe ninguna versión pública de MiniMax M3.1. La organización MiniMaxAI en Hugging Face devuelve 401 —la respuesta de la plataforma "no encontrado o no visible para ti"— para MiniMaxAI/MiniMax-M3.1, MiniMaxAI/MiniMax-M3.1-preview y MiniMaxAI/MiniMax-M3.1-preview-private por igual. Sus subidas públicas más recientes siguen siendo MiniMax-Music3 (7 de agosto de 2026) y MiniMax-H3 (28 de julio de 2026).
• Confirmado: MiniMax M3.1 no es enrutable en ningún sitio que podamos comprobar. Está ausente del catálogo de modelos de OrcaRouter y de los listados públicos que monitorizamos; el modelo MiniMax que puedes invocar hoy es MiniMax M3, en minimax/minimax-m3.
• Confirmado: MiniMax no ha publicado nada. Ni ficha del modelo, ni publicación de blog, ni página de precios, ni pesos, ni ID de modelo de API. No hay cobertura de prensa sobre un lanzamiento porque no ha habido ningún lanzamiento.
• En circulación: el documento de arquitectura. Se reproduce textualmente en un repositorio público — longsco/innoferra-eval, una suite de incorporación de socios para endpoints de modelos alojados, creada el 23 de septiembre de 2026 — bajo el nombre de archivo PREVIEW-20260922.md, con un encabezado que lo describe como un documento de proveedor compartido el 25 de septiembre y una advertencia de que «el nombre del modelo, la fecha de lanzamiento del proveedor y el lanzamiento público siguen sujetos al lanzamiento real». Esa es la cautela del propio documento, no la nuestra, y es la correcta: la copia de una nota de proveedor por parte de un tercero no es una declaración de MiniMax.
• En circulación: el checkpoint de 250 GB y su segunda entrega. La especificación de incorporación del repositorio registra un checkpoint multimodal privado en MiniMaxAI/MiniMax-M3.1-preview-private — 62 archivos, 48 archivos safetensors, aproximadamente 250 GB, cadena de arquitectura MiniMaxM3SparseForConditionalGeneration — y luego una segunda entrega más grande, MiniMax-M3.1-preview2-dspark-private, con 101 archivos y unos 236 GB, que añadió un borrador especulativo fp8 de 2,3 GB. Ambos son privados. No podemos abrir ninguno de los dos, y tú tampoco.
• En circulación: la cronología. La publicación del 26 de septiembre es la única fecha pública que alguien ha ofrecido, y «la próxima semana» es una expectativa. Considera la semana del 28 de septiembre como la ventana que hay que vigilar, no como una fecha.
El único documento que contiene el detalle de ingeniería
![A headless Chromium screenshot of the public GitHub page for the file PREVIEW-20260922.md inside the repository longsco/innoferra-eval, showing the file path models/minimax-m3.1/PREVIEW-20260922.md, the markdown body describing MiniMax M3.1's sparse attention across all layers, the Q8KV4 attention quantisation in E2M1 blocks of 16 with a per-block E4M3 scale of amax/6 clamped to [1/512, 448] and round-half-to-even thresholds, the W4A4 NVFP4 routed experts with FC1 row scale 2688 divided by the row absolute maximum and FC2 fixed scale 16, the DSpark speculative-decoding head with no confidence head, the new reasoning_effort field taking max/xhigh/high/medium/low, and the line 'No 3.1 baselines published yet; do not reuse M3 numbers as acceptance bars.'](https://cms.orcarouter.ai/api/media/file/2-1348.png)
Todo lo específico que se conoce sobre el diseño de MiniMax M3.1 se remonta a ese único archivo markdown, más dos acompañantes en el mismo repositorio: un documento de demostración de SGLang que describe cómo se pretende servir el checkpoint, y un spec.yaml que un endpoint de socio debe satisfacer. Si se lee el repositorio en su conjunto, parece un proveedor de inferencia haciendo exactamente lo que hace un proveedor de inferencia — recibir una entrega anticipada de MiniMax, anotar qué cambió y construir una suite de validación para ello. El repositorio no es un kit de prensa y no está escrito para persuadir a nadie.
Eso es un punto a su favor, y también es el límite de lo que demuestra. Nada en ello está firmado por MiniMax. Los tres documentos concuerdan entre sí de la manera en que concuerdan los documentos reales —las mismas constantes de cuantización, los mismos nombres de variables de entorno, las mismas banderas de lanzamiento— y discrepan de la manera en que discrepan las entregas reales: la vista previa del 22 de septiembre dice que el nuevo método de decodificación especulativa no tiene cabeza de confianza, y la segunda entrega de checkpoint incluyó una configuración preliminar con enable_confidence_head establecido en true. Una fabricación no suele incluir un arco de corrección. Pero "inusualmente coherente" no es "confirmado", y el modo de fallo para un lector es absorber las constantes que aparecen a continuación como el diseño publicado de MiniMax, cuando son, como mucho, el diseño privado de MiniMax tal como lo lee otra persona.
Los cinco cambios de ingeniería, según ese documento.
Aquí está la diferencia entre MiniMax M3 y MiniMax M3.1 tal como la describe el documento. Cada línea proviene del proveedor y no ha sido auditada; ninguna parte independiente ha medido ningún tipo de salida de MiniMax M3.1.
• Cobertura de atención. La atención completa de las tres primeras capas se sustituye por atención dispersa, de modo que todas las capas son dispersas. En MiniMax M3, las tres primeras capas eran el ancla de atención completa de la pila dispersa.
• Precisión de la atención — "Q8KV4". Las consultas, incluidas las consultas del indexador, salen de la proyección en BF16 y se convierten a FP8 E4M3. Las claves y los valores —de nuevo, incluidas las del indexador— se cuantifican a E2M1, cuatro bits, en bloques de 16, con una escala E4M3 por bloque de amax/6 limitada a [1/512, 448]. El documento insiste en que la escalera es redondeo a par más cercano con umbrales asimétricos, que la escala tensorial externa es exactamente 1 y que una magnitud cero debe codificarse como cero positivo. M3 usaba una ruta KV de ocho bits de la misma familia, por lo que esto vuelve a reducir a la mitad los bytes de KV.
• Precisión experta. Los expertos enrutados del MoE pasan de MXFP8 a W4A4 NVFP4, con el experto compartido deliberadamente excluido. Las dos proyecciones de expertos reciben esquemas de activación diferentes: FC1 usa una escala dinámica por fila de 2688 dividida por el máximo absoluto de la fila, con la escala de fila aplicada después del GEMM pero antes de la función de activación; FC2 usa una escala externa fija de 16. La consecuencia práctica, indicada explícitamente en el README del socio, es contundente: "un proveedor que ejecute el checkpoint a través de una ruta NVFP4 genérica sin estas producirá resultados numéricos silenciosamente distintos".
• Decodificación especulativa. La cabeza de predicción de múltiples tokens al estilo EAGLE ha desaparecido, reemplazada por un método que MiniMax llama DSpark —una cabeza de Markov básica y, en el documento del 22 de septiembre, ninguna cabeza de confianza—. Este es el cambio con el mayor efecto en lo que se siente al usar un endpoint servido, porque es la única palanca de velocidad por flujo del diseño. El motor de demostración que MiniMax distribuyó junto con el checkpoint no incluye DSpark, y el proveedor midió la diferencia: en el mismo marco de 80.000 tokens sin especulación, el rendimiento por flujo es de 63,9 tokens por segundo con concurrencia 1 y cae por debajo de 60 con concurrencia 4, así que la propia conclusión del documento es que, sin DSpark, la pila no puede mantener su objetivo de latencia bajo carga.
• Un nuevo campo de solicitud. MiniMax M3.1 añade un campo reasoning_effort de nivel superior que acepta max, xhigh, high, medium o low, inyectado en el prompt del sistema como una etiqueta de esfuerzo por la plantilla de chat. M3 solo tenía un conmutador de pensamiento con adaptive y disabled. El documento señala, de forma extraña y específica, que el campo se transporta sin validación y sin un valor predeterminado obligatorio —lo que el proveedor interpretó como permiso para aceptar o rechazar un valor no listado, y lo que significa que dos endpoints conformes podrían comportarse de manera diferente ante la misma solicitud.

Dos detalles en el checkpoint merecen señalarse por separado porque son el tipo de cosa que un post de lanzamiento omite. Primero, el checkpoint incluye tanto una configuración de preprocesador de imágenes como una configuración de preprocesador de video — MiniMax M3.1 es un modelo multimodal por construcción, no un modelo de texto con visión añadida a posteriori, y la propia recomendación del proveedor es no rechazar entradas de imagen en el nuevo stack. Segundo, la segunda entrega del checkpoint eliminó por completo las claves MTP y NEXTN y no añadió nada que las sustituya, y por eso el draft de DSpark tuvo que llegar como un artefacto separado de 2.3 GB. No hay una cabeza de draft en los pesos principales que se pueda activar.
Por qué no hay cifras de benchmark de M3.1, y por qué eso no es un descuido
Todo informe sobre filtraciones acaba llegando a la parte en la que o bien inventa una tabla de benchmarks o bien admite que no tiene ninguna. MiniMax M3.1 no tiene ninguna. La especificación del socio lo dice explícitamente, en un campo que existe únicamente para evitar que alguien cometa el error:
• "Aún no se han publicado las líneas base de 3.1; no reutilices los números de M3 como umbrales de aceptación."
Esa instrucción es la frase más útil de todo el corpus, porque la versión perezosa de este artículo escribe las puntuaciones de Artificial Analysis de MiniMax M3 bajo un encabezado de MiniMax M3.1. No debería hacerlo. El mismo repositorio ejecuta sondas AIME-25 y GPQA-Diamond contra el propio endpoint M3.1 de MiniMax y las registra como comparaciones entre compañero de equipo y proveedor, con las puntuaciones sin zanjar: en GPQA-Diamond, 0,904 para la ejecución del equipo frente a 0,813 para la del proveedor, y en un subconjunto de MMLU-Pro de 600 preguntas, 0,898 frente a 0,821. Esas son dos ejecuciones de la misma evaluación que no coinciden, no un resultado del modelo, y están etiquetadas como una vista previa con las repeticiones contadas. Cualquiera que cite hoy un único número de benchmark de MiniMax M3.1 está citando algo que todavía no existe.
Qué es MiniMax M3, para que la secuela pueda dimensionarse
MiniMax M3 se lanzó a finales de mayo de 2026 y se publicó en Hugging Face el 2 de junio — 428 mil millones de parámetros totales con 23 mil millones activos, 60 capas, 128 expertos enrutados con enrutamiento top-4, 4 cabezas KV frente a 64 cabezas de atención, y una ventana de contexto de 1.048.576 tokens con una salida máxima de 512.000. Por el lado independiente, Artificial Analysis le otorga 29,2 en el Intelligence Index, situándolo en el puesto 60 de 145 modelos muestreados, con 58,6 en el índice de codificación y una p50 de 3.348 milisegundos hasta el primer token en nuestra propia telemetría de enrutamiento. La propia cifra destacada de MiniMax para él es 83,5 en BrowseComp, que es una cifra del proveedor y no está auditada como tal.
Los precios son la parte que mejor envejece en un ciclo de filtraciones. MiniMax M3 cuesta $0,30 por millón de tokens de entrada y $1,20 por millón de tokens de salida, con lecturas en caché a $0,06 — y ya está disponible en OrcaRouter como minimax/minimax-m3, a la tarifa de lista del proveedor con 0% de recargo, así que si MiniMax pone el mismo precio a M3.1, la nueva tarifa estará activa de nuestro lado el mismo día en que exista, en lugar de un ciclo de facturación después.
El propósito de repetir todo eso no es la nostalgia. Es que la única razón por la que alguien está actualizando una página de organización de Hugging Face esta semana es que MiniMax M3 fue lo bastante bueno como para que su sucesor sea una cuestión de producción y no un deporte de espectadores —y que un modelo de 428 mil millones de parámetros con un contexto de 1M a $0.30/$1.20 marca un listón de precio-rendimiento que M3.1 tiene que superar, no solo un listón de capacidades.
El ángulo del listado anónimo, y por qué puede que ya se haya respondido
Un hilo de principios de septiembre merece cerrarse aquí. Una publicación anónima y sigilosa apareció en una plataforma de programación de terceros con un contexto de 1.000.000 de tokens, precio de $0 y niveles de razonamiento obligatorios, y la cubrimos bajo el nombre Space Bunny Alpha, señalando la tasa base de que toda publicación anónima de este tipo acaba siendo reclamada por un proveedor: Pony Alpha se convirtió en un modelo de Zhipu, Hunter Alpha pasó a ser de Xiaomi, Ox Alpha se convirtió en un lanzamiento de MiniMax con otro nombre. El tokenizador y las huellas de anomalías de esa publicación apuntaban a un checkpoint de vista previa de MiniMax. Si MiniMax M3.1 llega esta semana, la lectura más probable es que la publicación anónima fue su prueba de campo, y el misterio se resuelve por anuncio en lugar de con más trabajo forense. Eso es una inferencia, no una prueba, y es la última inferencia de este artículo.

Qué hay que tener en cuenta y qué hacer esta semana
Las señales que convertirían esto de una filtración en un lanzamiento son específicas y verificables, y no son las que suele seguir la mayoría de los comentarios. Un repositorio público en Hugging Face bajo la organización MiniMaxAI —no uno privado— con una tarjeta de modelo es el indicador único más fuerte; el historial de subidas de la organización es público y registra la fecha exacta de cada lanzamiento. Una página de modelo de MiniMax o un ID de modelo de API es la segunda. Un precio publicado es la tercera, y la que importa para un presupuesto. Una tabla de benchmarks en Artificial Analysis fechada después del lanzamiento es la cuarta, y la única que es independiente.
Hasta entonces, la postura práctica para cualquiera que esté construyendo no cambia con respecto a cualquier otra semana previa al lanzamiento: el modelo que puedes enrutar hoy es MiniMax M3, una sola clave API lo alcanza junto con más de 200 otros modelos, conmutación por error automática significa que una inestabilidad en el endpoint no se convierte en tu caída, y una ruta fijada o combinada a través del DSL de enrutamiento o un panel de modelos que responden juntos mediante fusión de modelos es cómo reduces el riesgo de un modelo que no has puesto en producción. Si llega M3.1, eso es un cambio de un ID de modelo, no una migración — que es todo el argumento para no construir una integración a medida contra una filtración.
Una cosa que este artículo no hará es pretender saber cuándo. El punto de control es real, los documentos son específicos, y la afirmación pública más reciente es una persona que dice "la próxima semana". De las tres, solo las dos primeras son cosas que puedes verificar por tu cuenta.
