Una tarjeta de título principal para MiniMax M3 vs Muse Spark 1.2, con el subtítulo 'Precio por token, contexto, rendimiento y dónde divergen las pruebas comparativas', que muestra dos tarjetas redondeadas abstractas enfrentadas a ambos lados de un delgado divisor vertical, la tarjeta izquierda con acento azul y la derecha en cian, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

MiniMax M3 vs Muse Spark 1.2: una brecha de precio de 4x frente a un arrase en los benchmarks

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniMax M3 cuesta $0.30 por millón de tokens de entrada en nuestro catálogo. Muse Spark 1.2 cuesta $1.25. Es una diferencia de 4,2x en entrada y de 3,5x en salida, y es el dato más útil de este emparejamiento, porque en las mismas páginas del catálogo Muse Spark 1.2 supera a MiniMax M3 en todas las filas de benchmarks que ambos modelos comparten. Uno es la opción económica de pesos abiertos, con 512K de contexto útil garantizado por el proveedor y un techo de salida de 512K. El otro es un checkpoint de razonamiento de Meta que ya va una generación por detrás de su propia familia y aun así lo supera en puntuación en casi todos los apartados. El resto de esta página trata sobre cuál de esos dos hechos decide realmente una carga de trabajo, y la respuesta no es la misma para todas las cargas de trabajo.

Qué es realmente cada uno de estos modelos

Ambos se lanzaron este año y ninguno es nuevo. Eso importa, porque una página comparativa escrita como si cualquiera de los dos estuviera a punto de lanzarse se delata como anticuada en el plazo de un mes.

A screenshot of MiniMax's own launch blog post for MiniMax M3, dated 2026-06-01, headlined 'MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model', opening with the line 'MiniMax M3 is officially released today.' and showing the MSA architecture note and two rows of benchmark bar charts including SWE-Bench Pro, Terminal-Bench 2.1, BrowseComp and OSWorld-verified.

MiniMax M3 es un lanzamiento propio de MiniMax, anunciado en el blog del proveedor el 2026-06-01 bajo el titular «MiniMax M3: programación de frontera, contexto de 1M, multimodalidad nativa: todo en un solo modelo». La publicación comienza sin rodeos: «MiniMax M3 se lanza oficialmente hoy». Las tres afirmaciones de MiniMax sobre él son que alcanza un rendimiento de nivel frontera en programación y trabajo agéntico, que utiliza MSA (MiniMax Sparse Attention), una nueva arquitectura de atención propuesta por la empresa, y que es nativamente multimodal: acepta entrada de imagen y video y, en palabras de MiniMax, «puede operar una computadora de escritorio». MiniMax añade que estas tres capacidades son condiciones mínimas para los modelos de frontera de código cerrado, y que M3 es «el primer y único modelo de pesos abiertos que reúne las tres». Nuestro catálogo lista el modelo como disponible desde el 2026-05-31, un día antes de la fecha del blog.

Muse Spark 1.2 es de Meta. Nuestro catálogo lo data en 2026-08-05. No es un nuevo nivel: es un checkpoint actualizado sobre Muse Spark 1.1 con un rendimiento ligeramente superior, servido en el mismo nivel Standard a un precio idéntico, lo que lo convierte en una actualización directa en lugar de un producto independiente. Su característica distintiva es la superficie de entrada: texto, imágenes, vídeo, audio y PDF. La salida es texto.

Un dato de contexto corresponde aquí en lugar de quedar enterrado más adelante. Meta llevó la familia Muse Spark a un checkpoint 1.3 el 2 de septiembre de 2026, lo que convierte a 1.2 en la generación anterior de su propia línea. Eso ocurrió hace tres semanas, así que no es una noticia y esta página no lo trata como tal, pero quien elija entre estos dos hoy debería saber que está comparando un modelo MiniMax actual con uno de Meta ya superado.

Precio por millón de tokens, y lo que realmente cuesta una carga de trabajo

A screenshot of the OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2), showing the breadcrumb Home > Models > Meta > Muse Spark 1.2, the model title with a FEATURED badge, the line 'by Meta · 2026-08-05', capability chips reading Vision, Audio, Tools, JSON and Reasoning, the model description, and the stat strip reading INPUT $1.25 per 1M tokens, OUTPUT $4.25 per 1M tokens, P50 TTFT 4.82 s, P95 TTFT 10.00 s and TRAFFIC 79.6M tokens over 7 days.

Las tarifas publicadas, tomadas de la página de cada modelo en nuestro propio catálogo, que traslada el precio de lista del proveedor sin añadir ningún margen:

• Entrada — MiniMax M3 $0.30 por 1M de tokens vs Muse Spark 1.2 $1.25 por 1M de tokens

• Salida — MiniMax M3 $1.20 por 1M vs Muse Spark 1.2 $4.25 por 1M

• Lectura de caché — MiniMax M3 $0.060 por 1M vs Muse Spark 1.2 $0.150 por 1M

• Ratio — Muse Spark 1.2 es 4,2x en entrada, 3,5x en salida, 2,5x en lecturas de caché

Esas proporciones abstractas se vuelven concretas en la calculadora de costes de cada página. Configura ambas en 10 millones de tokens al mes con un 70 % de proporción de entrada —una forma razonable para una tarea de resumen o extracción, y el valor predeterminado con el que se distribuye el estimador— y MiniMax M3 sale a 5,70 $ al mes. Muse Spark 1.2 sale a 11,30 $ al mes. Activa el almacenamiento en caché de prompts y la misma carga de trabajo se queda en aproximadamente 4,86 $ frente a aproximadamente 9,63 $. La calculadora etiqueta ambos como estimaciones basadas en el precio de lista, lo cual es la advertencia correcta: los recuentos reales de tokens dependen del tokenizador del proveedor.

Para una carga de trabajo barata, la diferencia es dinero de café. La clave está en la forma de la curva, no en el valor absoluto: una carga de trabajo de cien millones de tokens con predominio de salida al mes pasa de tres cifras a cuatro solo por el lado de Muse Spark. Si el coste es la restricción que te hizo fijarte en esta combinación, ese es el número que debes modelar con tu propio tráfico.

Como trasladamos el precio de lista del proveedor directamente y sin margen, una rebaja de precio del proveedor se refleja de nuestro lado el mismo día en que se anuncia, y ambos modelos se enrutan aquí: una sola clave cubre a los dos, así que comparar sus precios entre sí no requiere un segundo contrato ni un cambio de código.

Ventana de contexto, y qué cabe realmente en ella

Esta es la sección en la que los dos se parecen más en una ficha técnica y menos en el uso.

• Ventana de contexto — MiniMax M3 1,048,576 tokens frente a Muse Spark 1.2 1,048,576 tokens

• Salida máxima — MiniMax M3 512.000 tokens vs Muse Spark 1.2 131.072 tokens

• Superficie de entrada — MiniMax M3 texto, imagen y video vs Muse Spark 1.2 texto, imagen, video, audio y PDF

• Superficie de salida — ambos emiten solo texto

• Parámetros estructurados — MiniMax M3 expone tools y tool_choice; Muse Spark 1.2 expone reasoning_effort y structured_outputs

Ambas ventanas son el mismo millón de tokens, así que la pregunta de “quién tiene más contexto” no tiene ganador. La fila de salida máxima es donde se separan: una respuesta de MiniMax M3 puede llegar hasta 512.000 tokens, aproximadamente cuatro veces el límite máximo de Muse Spark 1.2 de 131.072. Si tu trabajo es generación de formato largo —la reescritura completa de un archivo, un informe extenso, una salida a escala de transcripción—, esa diferencia es estructural, no incremental. Si tu trabajo consiste en respuestas cortas sobre una entrada larga, es irrelevante.

La fila de la superficie de entrada va en sentido contrario. Muse Spark 1.2 acepta audio y PDF directamente; la superficie de entrada documentada de MiniMax M3 se limita a imagen y video. Un pipeline que ingiere grabaciones de llamadas o documentos escaneados tiene una cantidad distinta de preprocesamiento que realizar en cada uno de estos dos.

Del lado de MiniMax, la afirmación sobre el contexto incluye una nota de arquitectura que conviene etiquetar claramente como propia del proveedor. MiniMax atribuye el comportamiento de contexto largo de M3 a MSA (MiniMax Sparse Attention), que nuestro catálogo describe como compatible con hasta 1M de tokens de contexto «con un mínimo garantizado de 512K». El enfoque de mínimo garantizado es de MiniMax; no hay ninguna medición independiente de ello que podamos señalar, así que considere el umbral de 512K como una afirmación del proveedor y no como una cifra comprobada.

Latencia y rendimiento en nuestra propia pasarela

Estas son las cifras de las que podemos hablar de forma más directa, porque son nuestros propios números. Abarcan los siete días hasta el 2026-09-23 y describen el tráfico de nuestra pasarela, no un benchmark de proveedor.

• tiempo p50 hasta el primer token — MiniMax M3 4,28 s vs Muse Spark 1.2 4,82 s

• tiempo hasta el primer token (p95) — MiniMax M3 10,00 s frente a Muse Spark 1.2 10,00 s

• Velocidad de salida — MiniMax M3 289 tok/s frente a Muse Spark 1.2 507 tok/s

• Tasa de error — MiniMax M3 0,12 % frente a Muse Spark 1.2 0,15 %

• Tráfico, últimos 7 días — MiniMax M3 153,8 M tokens vs Muse Spark 1.2 79,6 M tokens

Lea esto con honestidad y el panorama está dividido. En tiempo hasta el primer token, los dos están cerca: 4,28 frente a 4,82 segundos en la mediana, y el p95 es idéntico hasta la centésima en 10,00 segundos, lo cual es un artefacto de redondeo de que ambos se encuentren cerca del mismo techo, más que un empate real. En velocidad de salida no están cerca en absoluto: Muse Spark 1.2 transmite aproximadamente a 1,75 veces la tasa de MiniMax M3, lo que cambia cómo percibe una generación larga un usuario que la observa, incluso cuando el costo total es mayor. Las tasas de error están dentro de un margen de redondeo entre sí y ambas son bajas.

La fila de tráfico merece leerse como una señal, más que como un marcador: durante los mismos siete días, en nuestra puerta de enlace, MiniMax M3 movió aproximadamente el doble de tokens que Muse Spark 1.2. Eso es lo que está eligiendo el mercado, no lo que dicen las pruebas de referencia, y en este emparejamiento los dos discrepan.

Enrutar ambos detrás de un único endpoint también es la forma económica de averiguar cuál prefiere tu carga de trabajo, porque la conmutación por error significa que una degradación del lado del proveedor en cualquiera de los modelos pasa a una ruta funcional en lugar de generar un error.

Llamada a herramientas y trabajo agéntico de horizonte largo

Aquí es donde los dos se distancian más en cuanto a resultados medidos, y donde más importan las advertencias.

• Terminal-Bench v2.1 — MiniMax M3 52,4 vs Muse Spark 1.2 80,1

• tau_banking (uso de herramientas) — MiniMax M3 12.3 vs Muse Spark 1.2 34.8

• MCP Atlas — MiniMax M3 74.2 (reportado por el proveedor) vs Muse Spark 1.2 no medido

• BrowseComp — MiniMax M3 83.5 (reportado por el proveedor) vs Muse Spark 1.2 no medido

• OSWorld-Verified — MiniMax M3 70.0 (reportado por el proveedor) vs Muse Spark 1.2 no medido

Las dos primeras filas proceden del panel de referencia de nuestras propias páginas de catálogo y son las únicas filas agénticas que ambos modelos han completado. No están ni cerca: Muse Spark 1.2 más que duplica a MiniMax M3 en tau_banking y supera a Terminal-Bench v2.1 por casi 28 puntos. Si tu carga de trabajo es un agente de horizonte largo con una superficie de herramientas, esa es la mayor diferencia individual de esta página.

Las tres filas siguientes son los propios números de MiniMax, publicados en el artículo de lanzamiento. No son comparables con las dos primeras —distintos arneses de evaluación, sin auditoría independiente—, pero son las únicas cifras publicadas de MiniMax M3 en esas tareas, por lo que omitirlas subestimaría al modelo. Tómalas como datos reportados por el proveedor y nada más.

Una divergencia merece su propio párrafo, porque es el tipo de cosa que una página de comparación suele pasar por alto. La publicación de lanzamiento de MiniMax presenta Terminal-Bench 2.1 con 66,0 para M3, dentro de una imagen de gráfico sin una tabla numérica que la acompañe. La fila independiente de Terminal-Bench v2.1 en nuestra página de catálogo muestra 52,4 para el mismo modelo. Los nombres de las tareas son lo bastante similares como para que los lectores los encuentren uno al lado del otro, y las dos cifras difieren en más de 13 puntos. No vamos a declarar que una de ellas es incorrecta: la explicación probable es un arnés de pruebas distinto o una configuración de ejecución distinta, y la afirmación honesta es que el número del propio proveedor y el número auditado no coinciden, y que el del proveedor es el más alto.

Las listas de parámetros cuentan una historia más pequeña y más práctica. MiniMax M3 expone tools y tool_choice, por lo que la selección de herramientas se puede dirigir desde la solicitud. Muse Spark 1.2 expone reasoning_effort, así que, en cambio, se puede dirigir la profundidad del razonamiento. Ninguno de los dos expone el control del otro. Si el problema de control de tu aplicación es «hacer que llame a la función correcta», eso apunta en una dirección; si es «hacer que piense más en los casos difíciles», apunta en la otra.

Programación

La programación es la afirmación estrella de MiniMax M3 y el terreno donde la brecha medida le resulta más incómoda.

• Índice de Codificación AA — MiniMax M3 38.7 vs Muse Spark 1.2 72.2

• SciCode — MiniMax M3 43.1 vs Muse Spark 1.2 57.4

• SWE-Bench Pro — MiniMax M3 59,0 (según el proveedor) vs Muse Spark 1.2 no medido

• KernelBench Hard — MiniMax M3 28.8 (reportado por el proveedor) vs Muse Spark 1.2 sin medir

El posicionamiento de MiniMax para M3 está centrado en la programación: el titular de lanzamiento coloca "Frontier Coding" por delante del contexto de un millón de tokens y de la multimodalidad. Su propia cifra reportada de SWE-Bench Pro de 59.0 es un número sólido en el arnés del proveedor. Sin embargo, en las filas independientes de Coding Index y SciCode que ambos modelos han completado, Muse Spark 1.2 lidera por un amplio margen, y la diferencia de 33 puntos en el Coding Index es la segunda más grande de esta página después de tau_banking.

No hay ninguna forma honesta de presentar MiniMax M3 como el mejor modelo de codificación con la evidencia disponible. Lo que se puede decir es que las propias cifras de codificación del proveedor son altas y las independientes no lo son, con el mismo patrón que la divergencia de Terminal-Bench mencionada arriba. Cualquiera cuya decisión dependa de la codificación debería dar más peso a las filas auditadas que a los gráficos de la publicación de lanzamiento, y debería probar en su propio repositorio en lugar de hacerlo sobre cualquiera de los dos.

Donde están realmente cerca

Tres filas se niegan a producir un ganador, y decir eso es más útil que fabricar uno.

• GPQA Diamond — MiniMax M3 89,9 vs Muse Spark 1.2 90,4, una diferencia de 0,5 puntos que a efectos prácticos es un empate

• tiempo p95 hasta el primer token — ambos 10.00 s durante los últimos siete días en nuestra pasarela

• Ventana de contexto y modalidad de salida — idénticas en 1,048,576 tokens de entrada y salida solo de texto

En razonamiento científico de nivel de posgrado, los dos son efectivamente indistinguibles, y esa es la única fila de razonamiento en la que el modelo mucho más barato de MiniMax M3 se mantiene a la altura del más caro. Vale la pena recordarlo al leer los índices agregados: la diferencia entre estos modelos no es uniforme en todas las capacidades, se concentra en el trabajo agéntico y de programación, y es prácticamente nula en preguntas de opción múltiple con alta carga de conocimiento.

A self-built two-column scoreboard for MiniMax M3 vs Muse Spark 1.2: left column MiniMax M3 with Price in/out $0.30 / $1.20, Context window 1M tokens, Max output 512K tokens, AA Coding Index 38.7, tau_banking 12.3 and Output speed 289 tok/s; right column Muse Spark 1.2 with Price in/out $1.25 / $4.25, Context window 1M tokens, Max output 131K tokens, AA Coding Index 72.2, tau_banking 34.8 and Output speed 507 tok/s; footer 'Prices and speed from OrcaRouter gateway data; benchmark figures per Artificial Analysis.'

Elige MiniMax M3 si, elige Muse Spark 1.2 si

Los dos hechos del párrafo inicial se resuelven de forma distinta según lo que estés construyendo, así que aquí está la división sin evasivas.

• Elige MiniMax M3 si el costo por token es la restricción decisiva, si necesitas salida extensa más allá de 131,072 tokens, si necesitas pesos abiertos, si quieres entrada de video sin un pipeline separado, o si quieres trabajo de conocimiento intensivo en razonamiento a aproximadamente una cuarta parte del precio de entrada — GPQA Diamond es un empate técnico y esa es la fila donde el modelo barato se gana su lugar.

• Elige Muse Spark 1.2 si tu carga de trabajo es un agente de horizonte largo con herramientas, si necesitas las puntuaciones de codificación auditadas más altas, si quieres un control explícito de reasoning_effort, si necesitas ingerir audio o PDF directamente, o si necesitas una salida en streaming rápida — 507 tok/s frente a 289 tok/s es una diferencia visible, no una de benchmark.

• Si aún no sabe cuál, la evidencia decisiva no está en esta página. Ponga ambos modelos a prueba con una muestra de su propio tráfico y mídalo; la calculadora de precios de la página de cada modelo le dirá el lado del costo en un minuto, y las cifras de latencia de siete días que aparecen arriba son lo más parecido a un anticipo del lado del rendimiento.

Ambos están sobre una única API sin recargo sobre el precio de lista del proveedor, así que la prueba es un cambio de id de modelo en lugar de una migración, y la conmutación automática por error hace que un mal día en cualquiera de los proveedores se degrade en una respuesta más lenta en lugar de una interrupción.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario