Una tarjeta de título para Mistral Large 4 vs MiniMax M3, construida en torno a una diferencia mensual de $48 en 100 millones de tokens, con MiniMax M3 aceptando entrada de video y salida de 512K, y Mistral Large 4 una vista previa solo de imágenes.
Guides & Insights

Mistral Large 4 vs MiniMax M3: lo que cuesta cinco meses de progreso

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniMax M3 es el modelo más barato de esta clase, y lo ha sido desde el 31 de mayo de 2026. Con 0,30 $ por millón de tokens de entrada, 1,20 $ por millón de salida y 0,06 $ por millón en caché, es aproximadamente la mitad de caro que Mistral Large 4 en entrada y el doble de barato en salida; y, a diferencia del modelo más nuevo, se puede comprar hoy sin ninguna etiqueta de vista previa. Mistral Large 4, un modelo de pesos abiertos de 1,05 billones de parámetros en vista previa pública desde el 6 de octubre de 2026, cuesta 0,68 $ y 2,09 $ y promete los pesos para finales de mes. Dos buques insignia de pesos abiertos, con cinco meses de diferencia, y esos cinco meses se ven en exactamente un lugar: la puntuación independiente de M3 en el Intelligence Index, de 29,2, frente a una puntuación de Mistral Large 4 que aún no existe.

Esa es la forma honesta de esta comparación, y es más interesante de lo que sugiere una tabla de precios. M3 se construyó en torno a una apuesta arquitectónica específica —MiniMax Sparse Attention, sostenida durante más de un millón de tokens de contexto, con el vídeo como entrada de primera clase—, y sobre el papel gana en dos categorías que Mistral Large 4 no disputa: longitud de salida bruta y vídeo nativo. En todo lo demás, el modelo más nuevo es el que un comprador preferiría tener, a un precio que sigue siendo lo bastante bajo como para que la diferencia rara vez decida la compra.

Dos arquitecturas, dos apuestas

MiniMax M3 es el modelo fundacional de pesos abiertos insignia de MiniMax y el primero en combinar un rendimiento de vanguardia en programación y en agentes, una ventana de contexto de un millón de tokens y multimodalidad nativa en un solo lanzamiento. Acepta texto, imágenes y video, y devuelve texto, y está construido sobre MiniMax Sparse Attention, una arquitectura diseñada para sostener hasta 1.048.576 tokens de contexto con un mínimo garantizado de 512K. El pipeline de preentrenamiento se reconstruyó para escalar más allá de 100 billones de tokens con datos multimodales desde el primer paso, en lugar de agregarse después. Su salida máxima es de 512.000 tokens.

Mistral Large 4 hace una apuesta distinta. Es un modelo granular de mezcla de expertos, con 49.000 millones de parámetros activos de un total de 1,05 billones, con un codificador visual de 1.600 millones de parámetros, entrenado desde cero en 3.800 GPU NVIDIA Grace Blackwell dentro de los propios centros de datos europeos de Mistral, con datos que abarcan más de 160 idiomas. Acepta texto e imágenes —no vídeo— en un contexto de aproximadamente un millón de tokens, y Mistral lo posiciona en torno al despliegue soberano: infraestructura europea, pesos abiertos y la capacidad de ejecutarlo bajo tus propias políticas, con la ciberseguridad como caso de uso insignia.

• Ventana de contexto — MiniMax M3 1.048.576 tokens frente a Mistral Large 4, alrededor de 1.000.000

• Salida máxima — MiniMax M3 512.000 tokens vs Mistral Large 4 aún no documentado

• Modalidad de entrada — MiniMax M3 texto, imagen y vídeo vs Mistral Large 4 texto e imagen

• Precio de entrada — MiniMax M3 $0.30 por 1M vs Mistral Large 4 $0.68 por 1M

• Precio de salida — MiniMax M3 $1.20 por 1M vs Mistral Large 4 $2.09 por 1M

• Entrada en caché — MiniMax M3 $0.06 por 1M vs Mistral Large 4 $0.07 por 1M

• Parámetros — Mistral Large 4 1.05T en total / 49B activos vs MiniMax M3 no revelado

• Lanzado — MiniMax M3 31 de mayo de 2026 frente a Mistral Large 4 6 de octubre de 2026, vista previa

• Pesos — ambos con licencia abierta, los de Mistral Large 4 prometidos para finales de octubre de 2026

A two-column scoreboard comparing Mistral Large 4 and MiniMax M3 on input and output price, Artificial Analysis Index, input modalities, maximum output and release date.

El marcador no está reñido, y tampoco es justo.

En el Artificial Analysis Intelligence Index v4.3.2, MiniMax M3 obtiene 29,2 y ocupa el puesto 62 de 147 modelos. Ese es un resultado de mitad de tabla y no es una crítica al modelo — el índice se revisó después del lanzamiento de M3 e incluye evaluaciones que no existían cuando MiniMax estaba entrenando. Su subpuntuación en programación cuenta una historia mejor: 58,6 en el AA Coding index, el puesto 46 de 138, y un 65,2 % en Terminal-Bench 2.1. Registra un 92,9 % en GPQA Diamond, un 83 % en recuperación de contexto largo y un 47,1 % en SciCode.

Mistral Large 4 no tiene puntuación de Index en la misma tabla; la página está activa bajo el título «Mistral Large 4 Preview» y el número está ausente. Lo que Mistral sí publica es que ML4 lidera a DeepSeek V4 Pro 0813 y a Qwen3.8 Max en el Coding Agent Index combinado con un 49,8 %, y que en AutomationBench —657 flujos de trabajo empresariales en Gmail, Sheets, Slack y Salesforce— obtiene un 59,9 %, por delante de Kimi K3, MiMo-V2.6-Pro y DeepSeek V4 Pro. MiniMax no se menciona en ninguna de las dos comparaciones, lo que en sí mismo es una señal sobre qué modelo considera Mistral que es el verdadero competidor.

Así que la lectura justa es esta: M3 es un modelo capaz, económico y bien documentado, con una puntuación general de media tabla y un perfil de programación respetable, y tiene cinco meses. ML4 es un modelo de vista previa con un techo declarado más alto, ninguna puntuación general publicada y un conjunto de métricas agénticas que Artificial Analysis evaluó en privado y publicará en el Coding Agent Index cuando ese harness esté disponible. Si necesitas un número hoy, M3 te lo da. Si puedes esperar unas semanas, ML4 también te lo dará, y Mistral apuesta a que será mayor.

Donde M3 no tiene competencia alguna por parte de ML4

Dos filas en esa lista no son una disyuntiva, son una ausencia.

La entrada de vídeo es lo primero. M3 acepta vídeo de forma nativa, junto con texto e imágenes. Mistral Large 4 acepta texto e imágenes y nada más — el propio análisis en profundidad de Mistral se centra en el anclaje sobre imágenes satelitales de gigapíxeles y planos de ingeniería, lo que sigue siendo trabajo con imágenes. Si tu pipeline ingiere grabaciones de pantalla, metraje de vigilancia o documentación en vídeo, ML4 no puede ser el modelo, sea cual sea su precio. Esa no es una brecha que Mistral vaya a cerrar con un reajuste de precio.

La longitud de salida es lo segundo. M3 emite hasta 512.000 tokens en una sola respuesta. Mistral no ha publicado ningún límite de salida para ML4. Generar un artefacto estructurado largo en una sola pasada —un informe completo, un script de migración grande, una especificación completa— es la carga de trabajo en la que un límite de 512K vale más que un punto del Intelligence Index y, hasta que Mistral documente el límite de ML4, M3 es el único de los dos con el que puedes planificar esa carga de trabajo.

Las cifras agénticas de M3 reportadas por el proveedor refuerzan el mismo perfil. MiniMax lo sitúa en 83,5 en BrowseComp para la investigación web autónoma, 70 en OSWorld-verified para el uso de computadoras, 74,2 en MCP Atlas para el uso de herramientas, 76,7 en las rúbricas de GDPval y 59 en SWE Bench Pro. Esos datos provienen de las propias evaluaciones de MiniMax y no han sido reproducidos de forma independiente, y desentonan frente a su puntuación de 29,2 en el Index — que es precisamente por lo que importa la distinción entre proveedor e independiente. Un modelo puede liderar los benchmarks elegidos por un proveedor y quedar en mitad de la tabla en un promedio neutral de diez evaluaciones, y ambas cosas pueden ser ciertas.

¿Vale la pena el 2x?

La diferencia de precio aquí es realmente pequeña en términos absolutos, lo que cambia el cálculo en comparación con un desajuste frente a un modelo insignia cerrado. Pongamos un mes de cien millones de tokens con una proporción de entrada/salida de 4:1: 80 millones de tokens de entrada y 20 millones de salida. M3 cobra $24 más $24, un total de $48. Mistral Large 4 cobra $54.40 más $41.80, un total de $96.20. El sobrecoste es de unos $48 al mes —dinero real a escala, pero el tipo de diferencia que se paga con un solo fallo evitado.

El almacenamiento en caché reduce aún más la diferencia, y solo marginalmente a favor de M3: 0,06 $ frente a 0,07 $ por millón de tokens en caché es un error de redondeo a este nivel de precios. Ambos son lo bastante baratos como para que la decisión deba tomarse según la capacidad y la idoneidad, y no según la factura, lo cual es lo contrario de cómo se lee esta comparación a primera vista.

Lo que compra la prima es span. ML4 se entrenó cinco meses después con datos más nuevos, en una disposición de mezcla de expertos con un billón de parámetros y 49 mil millones activos, y Mistral está ejecutando aprendizaje por refuerzo en él a una tasa declarada de 33 mil millones de tokens por día con una ejecución que no se ha saturado. M3 está terminado; ML4 está mejorando a un ritmo publicado. Cuando un proveedor dice que el modelo que compras hoy es la versión más débil por la que jamás pagarás, y la prima sobre el incumbente es inferior a un dólar por millón de tokens, el modelo más nuevo suele ser la mejor opción predeterminada. La excepción son las dos cargas de trabajo anteriores, donde el modelo más antiguo es el único que encaja.

Enrutamiento alrededor del hueco

A screenshot of the OrcaRouter model page for MiniMax M3, showing the minimax/minimax-m3 route from MiniMax, its text, image and video input, and the $0.30 input and $1.20 output price per million tokens.

Este es un emparejamiento en el que ejecutar ambos no es una cobertura, sino la respuesta real, porque los dos modelos son fuertes en áreas disjuntas. Entrada de vídeo, salida de artefactos largos, o un bucle de uso de ordenador: M3. Análisis de documentos e imágenes, flujos de trabajo agénticos, o cualquier cosa que deba ejecutarse en infraestructura europea bajo tus propias políticas: ML4. No hay ninguna regla de enrutamiento que haga que uno de los dos sea redundante.

Ambos se encuentran detrás de un único endpoint compatible con OpenAI en OrcaRouter con 0% de recargo y los precios de lista de los proveedores se pasan sin modificar, lo que mantiene honesto un diferencial de precios de cinco meses — si MiniMax recorta la tarifa de M3 o Mistral pone fin a la tarifa de vista previa, el número contra el que se evalúa tu ruta cambia ese mismo día. El DSL de enrutamiento es lo que convierte las fortalezas inconexas en una única superficie de llamada: una regla que inspecciona la modalidad de la solicitud envía los payloads que contienen vídeo a M3 y todo lo demás a ML4, con la confianza de que las interrupciones momentáneas de disponibilidad de un modelo de vista previa son absorbidas por la conmutación por error automática en lugar de propagarse a tus usuarios. Cuando una única salida importa más que un único precio, la fusión de modelos puede ejecutar ambos y dejar que un panel elija, lo cual es una forma razonable de comprar el techo prometido por Mistral mientras se mantiene el comportamiento documentado de M3 como suelo.

A decision card headed When each one wins, matching MiniMax M3 to video input and 512K output at $0.30 and $1.20, and Mistral Large 4 to image and document work that runs in Europe.

Veredicto

MiniMax M3 es la respuesta correcta para dos cargas de trabajo y una respuesta defendible para una tercera. La entrada de vídeo, la generación de un solo paso de varios cientos de miles de tokens y los agentes de uso de computadora son su territorio, su precio es el más bajo de cualquier producto insignia de esta clase, y sus puntuaciones publicadas de mitad de tabla significan que sabes exactamente lo que obtienes. Que tenga cinco meses no es mucho para un modelo que no ha sido superado en su propio nicho.

Mistral Large 4 es la mejor opción predeterminada para todo lo demás. Un mes de cien millones de tokens cuesta unos 48 $ más, el número de parámetros y el linaje de entrenamiento europeo apuntan a un techo más alto, las afirmaciones sobre ciberseguridad son lo bastante específicas como para poder comprobarse, y los pesos abiertos prometidos más el despliegue en las instalaciones cumplen requisitos que la propuesta empresarial de solo API de M3 no cumple. El precio de esa apuesta es que te comprometes con un modelo cuya puntuación en el Independent Intelligence Index aún no se ha publicado y cuyo comportamiento, según Mistral, cambiará sustancialmente en cuestión de semanas.

Las dos fechas que resuelven esto: finales de octubre de 2026, cuando o bien se publiquen los pesos de ML4, o bien la promesa de pesos abiertos empiece a parecer poco sólida, y la publicación del Coding Agent Index, donde el 49,8 % evaluado de forma privada de Mistral se cruza con la puntuación pública de codificación del 58,6 % de M3 en la misma revisión. Hasta entonces, M3 es el modelo que puedes verificar y ML4 es el modelo por el que apuestas — y con un sobrecoste mensual de 48 $ por cien millones de tokens, esa no es una apuesta grande.