Una tarjeta destacada generada titulada 'GPT-6.1 Sol vs MiniMax M3' con dos paneles redondeados: a la izquierda, 'GPT-6.1 Sol', que muestra 'OpenAI - lanzado el 29 de septiembre de 2026', '$2.00 de entrada / $10.00 de salida por 1M', 'Índice AA 51.8' y '$0.72 por tarea'; a la derecha, 'MiniMax M3', que muestra 'MiniMax - lanzado el 31 de mayo de 2026', '$0.30 de entrada / $1.20 de salida por 1M', 'Índice AA 29.2' y '$0.51 por tarea'; entre ellos, la línea 'Tarjeta más barata, factura más pequeña - 22.6 puntos de índice de diferencia'; pie de página 'Cifras: Artificial Analysis v4.3.2.' y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

GPT-6.1 Sol vs MiniMax M3: la tarifa más barata pierde en la factura

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

MiniMax M3 cuesta una fracción de lo que GPT-6.1 Sol cuesta — 0,30 $ por millón de tokens de entrada frente a 2,00 $, 1,20 $ por millón de tokens de salida frente a 10,00 $ — y, por la métrica que realmente se ejecuta, es más barato: 0,508 $ por tarea frente a 0,724 $ en la evaluación v4.3.2 de Artificial Analysis. Esa es una victoria genuina, y también es todo el argumento, porque la misma medición que le da a M3 la factura más baja le da a GPT-6.1 Sol una ventaja de 22,6 puntos en el índice, y el conjunto de benchmarks que mide si un modelo puede terminar trabajo agéntico en lugar de describirlo convierte la brecha en un muro. El proveedor lanzó GPT-6.1 Sol el 29 de septiembre de 2026. La empresa lanzó M3, su modelo de pesos abiertos de 428 mil millones de parámetros, el 31 de mayo de 2026.

Ambas están activas, ambas tienen precio y a ambas se llega con una sola llamada a la API. Lo que sigue es la aritmética que decide entre ellas, y los dos puntos en los que la aritmética no lo cuenta todo.

Lo que cada modelo realmente es

GPT-6.1 Sol es el buque insignia actual de OpenAI para razonamiento e ingeniería de software: un modelo cerrado, lanzado apenas una semana después del GPT-6 Sol al que reemplaza, y se vende al mismo precio de lista de $2.00 / $10.00 que su predecesor. Tiene una tarifa de $0.10 por entrada en caché, la mitad de lo que GPT-6 Sol cobraba por aciertos de caché, y es el modelo al que OpenAI señala cuando habla de codificación agéntica en lugar de chat.

MiniMax M3 es un modelo de mezcla de expertos con 428 mil millones de parámetros totales y 23 mil millones activos por token, publicado bajo la MiniMax Community License — una versión de pesos abiertos con una licencia personalizada de carácter no comercial, no aprobada por la OSI. Lo sirve un amplio abanico de proveedores de inferencia: Artificial Analysis registra quince hosts para M3 frente a ocho para GPT-6.1 Sol. Esa amplitud es la ventaja práctica de los pesos abiertos, y también es la razón por la que la competencia de precios en M3 ha sido más rápida que en el modelo cerrado.

La tarjeta de tarifas, y el medidor que la anula

A generated two-column scoreboard titled 'GPT-6.1 Sol vs MiniMax M3 - the scoreboard'. Left column 'GPT-6.1 Sol': Input $2.00 / 1M, Output $10.00 / 1M, AA Index 51.8, Cost per task $0.72, Output tokens 38,128, Time per task 640 s. Right column 'MiniMax M3': Input $0.30 / 1M, Output $1.20 / 1M, AA Index 29.2, Cost per task $0.51, Output tokens 48,192, Time per task 486 s. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Ponga en paralelo los dos tarifarios publicados y no hay punto de comparación.

• Entrada — GPT-6.1 Sol $2.00 por 1M vs MiniMax M3 $0.30 por 1M; M3 es un 85% más barato
• Salida — $10.00 por 1M vs $1.20 por 1M; M3 es un 88% más barato
• Entrada en caché — $0.10 por 1M vs $0.06 por 1M
• Costo por tarea de AA — $0.724 vs $0.508; M3 es un 30% más barato, no un 85%
• Tokens de salida por tarea — 38,128 vs 48,192; M3 escribe un 26% más
• Tiempo por tarea — 640 s vs 486 s
• Ventana de contexto — 1,050,000 vs 1,048,576 tokens; efectivamente iguales
• Salida máxima — 128,000 tokens vs 512,000; M3 escribirá una respuesta muy larga
• Entradas aceptadas — texto, imagen y archivo vs texto, imagen y video
• Posición en el índice — GPT-6.1 Sol 10.º de 147 modelos vs MiniMax M3 62.º

Las dos líneas baratas de arriba son las que ve una hoja de adquisiciones. La tercera línea es la que paga la factura, y dice que una ventaja del 85–88 % en la tarifa se convierte en una ventaja del 30 % en el mundo real, porque M3 emite más tokens por tarea y porque una tarea no es una cantidad fija de trabajo. Las tarifas ponen precio a los tokens; el trabajo se cotiza en tareas. Cualquier comparación que se detenga en las dos primeras líneas está comparando los números equivocados, en la unidad equivocada.

Donde el treinta por ciento deja de importar

El coste de la tarea es lo bastante parecido como para que la diferencia en el índice sea lo que decida para todo lo que vaya más allá del texto a granel. Artificial Analysis sitúa a GPT-6.1 Sol en 51,83 y a MiniMax M3 en 29,22 —una diferencia de 22,6 puntos, y que no se distribuye de manera uniforme en toda la suite. En las evaluaciones en las que se pide a un modelo que opere un terminal, edite un repositorio y verifique su propio trabajo, los dos modelos no están en la misma categoría:

• Terminal-Bench 4.0 — GPT-6.1 Sol 0.5606 vs MiniMax M3 0.0202
• Terminal-Bench Science — 0.5810 vs 0.0048
• AA-Omniscience — 41.53 vs 1.35
• MMLU-Pro — 0.8595 vs 0.7856
• AutomationBench — 0.6487 vs 0.2125
• τ²-bench — no publicado para GPT-6.1 Sol en esta ejecución vs 0.8889 para M3
• GPQA Diamond — no publicado para GPT-6.1 Sol en esta ejecución vs 0.9293 para M3
• CritPT — 0.3171 vs 0.0371

Lee eso con atención, porque no es una barrida limpia y las excepciones son la parte interesante. MiniMax M3 obtiene 0.8889 en τ²-bench, la evaluación de diálogo de uso de herramientas y atención al cliente, y 0.9293 en GPQA Diamond — una puntuación en ciencias de nivel de posgrado que supera todas las cifras de OpenAI publicadas en esta ejecución en particular. M3 es un razonador competente y un buen usuario conversacional de herramientas. En Terminal-Bench 4.0 obtiene 0.0202. Eso no es "peor"; es un modelo que no puede mantener en absoluto una tarea de repositorio de varios pasos, y ningún descuento en tokens hace que una tarea en la que el modelo falla sea más barata que la tarea que el modelo termina.

Hay un coste de segundo orden que la cifra por tarea oculta. M3 registra 48.192 tokens de salida por tarea y un tiempo hasta la primera respuesta de 23,0 frente a los 332,0 segundos de GPT-6.1 Sol: el modelo pequeño empieza a hablar casi de inmediato y luego razona extensamente. Si tu carga de trabajo es sensible a la latencia pero superficial, eso es un punto a favor de M3. Si es agéntica, la cantidad de tokens es lo que pagas y la puntuación final es lo que obtienes.

Nuestra propia ficha de modelo para GPT-6.1 Sol contiene los mismos números en la forma contra la que realmente enrutarías: la tarifa de 2,00 $ / 10,00 $, una ventana de contexto de 1.050.000 tokens, un p50 de 4,54 segundos hasta el primer token, y el índice y el bloque de benchmarks de Artificial Analysis en la misma página.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Qué valen aquí los pesos abiertos

Que M3 sea descargable es su argumento más fuerte, y vale la pena ser precisos sobre lo que eso te aporta. Te aporta términos de licencia que te permiten ejecutar el modelo dentro de tu propio perímetro —útil si los datos no pueden salir—, y te aporta la competencia de precios que surge de quince hosts independientes. No te aporta un despliegue barato: 428.000 millones de parámetros con 23.000 millones activos sigue necesitando hardware de inferencia serio, y la MiniMax Community License es una licencia personalizada con condiciones asociadas, no una sin restricciones. Para la mayoría de los equipos, «pesos abiertos» significa un mejor precio en inferencia alojada, no una caja en el rack.

La tarjeta OrcaRouter para MiniMax M3 es donde residen los números servidos: la tarifa de $0.30 / $1.20, la ventana de contexto de 1,048,576 tokens, la salida máxima de 512,000 tokens, entrada de texto/imagen/video, y un volumen de siete días de 56.4 millones de tokens entre los proveedores que lo enrutan.

A screenshot of the OrcaRouter model page for minimax/minimax-m3, showing the $0.30 input and $1.20 output per-million prices, a 10.60 s p50 time to first token, 56.4M tokens over seven days, a 1,048,576-token context window, 512,000 max output and text/image/video input, above the OpenAI-compatible code sample.

Ambos detrás de una misma tecla

La razón práctica por la que esta comparación es un cambio de configuración y no una migración es que ambos modelos son accesibles desde un único endpoint de OrcaRouter —una API para más de 200 modelos, con el precio de lista del proveedor transferido con un margen del 0 %, lo que significa que un cambio de tarifa de MiniMax aparece en tu factura el mismo día en que el proveedor lo publica, y no cuando lo haga un revendedor tras renegociar. Eso importa más para M3 que para su rival: la razón misma de enrutar a un modelo de pesos abiertos es que su precio y su lista de hosts están en movimiento, y un medidor de paso directo es el único tipo que sigue a un objetivo móvil.

La conmutación por error automática es la otra mitad. M3 es servido por muchos proveedores con confiabilidad variable, y la capa de enrutamiento puede mover una solicitud a otro host cuando uno se degrada, sin que quien llama sepa en qué host terminó. Esa es la manera honesta de adoptar un modelo cuyo puntaje en Terminal-Bench dice «no para la ruta crítica»: colócalo donde un reintento sea barato.

¿Cuál, si tienes que elegir hoy?

Si el trabajo es texto masivo —extracción, resumen, clasificación, diálogo, cualquier cosa donde la salida sea prosa y el modo de fallo sea una frase incorrecta en lugar de una compilación rota—, MiniMax M3 es la opción predeterminada correcta y el treinta por ciento es dinero real. Usa las cifras de GPQA y τ²-bench como evidencia: este es un modelo capaz que resulta ser barato.

Si el trabajo es agéntico —repositorios, terminales, cadenas de herramientas, cualquier cosa con un paso de verificación—, el 0.0202 en Terminal-Bench 4.0 es eliminatorio, y GPT-6.1 Sol con 0.5606 por $0.724 por tarea es mejor negocio incluso con un 85% más por token. La tarifa nunca fue lo que estabas comprando.

La respuesta útil es que no tienes que elegir una sola vez. Enruta el nivel superficial a M3, enruta el nivel agéntico a GPT-6.1 Sol, y mantén ambos detrás de una sola credencial: el DSL de enrutamiento compone los dos en una sola llamada cuando una tarea comienza como extracción y se convierte en un trabajo de reparación.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario