Título generado: GPT-6 Sol vs MiniMax M3, lo que no compra un precio de salida ocho veces mayor, con tarjetas de estadísticas que indican precio de salida $10.00 vs $1.20 por millón, Índice de Inteligencia 47.6 vs 29.2, y pesos cerrados vs abiertos, con un pie de página que indica Índice según Artificial Analysis v4.3.2; las tarifas de MiniMax M3 según MiniMax y las tarifas de GPT-6 Sol según la tarjeta de tarifas de OpenAI.
Guides & Insights

GPT-6 Sol vs MiniMax M3: lo que un precio de salida ocho veces mayor todavía no compra

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Lo primero que hay que decir sobre GPT-6 Sol frente a MiniMax M3es que la línea de precios no está reñida y la línea de puntuación tampoco, y apuntan en direcciones opuestas. MiniMax M3 es un modelo de pesos abiertos que puedes descargar y ejecutar por tu cuenta, y está listado a 0,30 $ por millón de tokens de entrada y 1,20 $ por millón de salida; GPT-6 Sol, el nivel intermedio de la generación GPT-6 lanzada el 22 de septiembre de 2026, cuesta 2,00 $ y 10,00 $ en las mismas unidades. Eso es un poco más de ocho veces la tarifa de salida. MiniMax M3 también acepta vídeo como modalidad de entrada, algo que GPT-6 Sol no hace: el modelo Sol admite texto, imagen y archivo. Lo que M3 no tiene es una puntuación que se acerque a la de Sol: 29,2 frente a 47,6 en el Índice de Inteligencia de Artificial Analysis, en la misma revisión v4.3.2 del tablero.

Esa asimetría lo es todo, y es una historia más interesante que un simple intercambio entre precio y calidad, porque la columna de pesos abiertos puede conservar algo que la columna cerrada no puede vender a ningún precio: los checkpoints de M3 están en Hugging Face y el modelo se puede ejecutar dentro de un perímetro de red. Si tienes que elegir entre estos dos, la pregunta útil no es cuál es mejor. Es cuál de las cuatro cosas distintas que estás comprando —precio, rendimiento, control o capacidad— puedes permitirte perder.

Cuatro dimensiones, y no se clasifican de la misma manera

• Precio de salida — GPT-6 Sol $10.00 por millón frente a MiniMax M3 $1.20 por millón
• Precio de entrada — GPT-6 Sol $2.00 por millón frente a MiniMax M3 $0.30 por millón
• Entrada en caché — GPT-6 Sol $0.20 por millón frente a MiniMax M3 $0.06 por millón
• Pesos — GPT-6 Sol cerrado, solo API frente a MiniMax M3 de pesos abiertos y autoalojable
• Modalidades de entrada — GPT-6 Sol texto, imagen y archivo frente a MiniMax M3 texto, imagen y vídeo
• Ventana de contexto — GPT-6 Sol 1,050,000 tokens frente a MiniMax M3 1,048,576 tokens
• Salida máxima — GPT-6 Sol 128,000 tokens frente a MiniMax M3 512,000 tokens
• Índice de inteligencia — GPT-6 Sol 47.6 frente a MiniMax M3 29.2
• Índice de programación — GPT-6 Sol no publicado en esta revisión frente a MiniMax M3 58.6
• Escalón de solicitudes largas — GPT-6 Sol vuelve a tarificar toda la solicitud por encima de 272,000 tokens de entrada frente a MiniMax M3 sin escalón en su ficha

Dos de esas líneas merecen más que una fila. El techo de salida máxima va en dirección opuesta a todo lo demás: M3 emitirá hasta 512.000 tokens en una sola respuesta, cuatro veces los 128.000 de GPT-6 Sol. Para una carga de trabajo que genera un archivo completo o un informe largo en una sola llamada, eso es una ventaja estructural, no un error de redondeo. Y el escalón de solicitudes largas es un costo real de GPT-6 Sol que M3 no tiene en absoluto — por encima de 272.000 tokens de entrada, Sol recalcula el precio de toda la solicitud a $4.00 / $15.00, mientras que la tarjeta de M3 no incluye ninguna cláusula equivalente. Con un prompt de 300.000 tokens, la comparación de la tarifa de salida no es de ocho veces, sino de doce veces y media.

Entonces, la clasificación honesta depende por completo de la carga de trabajo. Para clasificación o extracción de gran volumen, donde una respuesta incorrecta es barata y una respuesta lenta no, M3 a $0.30 / $1.20 sin penalización por contexto largo es la opción predeterminada sensata y Sol es dinero quemado. Para una tarea en la que la primera respuesta tiene que ser correcta —un plan de migración, una revisión de seguridad, un razonamiento que leerá una persona que actuará en función de él—, una brecha de índice de 18,4 puntos a ocho veces el precio de salida es un intercambio que la mayoría de los equipos acepta, porque la alternativa es pagarle a un humano para que lo arregle.

Generated comparison scoreboard titled GPT-6 Sol vs MiniMax M3, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, weights closed, Intelligence Index 47.6, context window 1,050,000 tokens, reprices above 272K input tokens. MiniMax M3: input $0.30 per million, output $1.20 per million, weights open and downloadable, Intelligence Index 29.2, context window 1,048,576 tokens, no long-request step. A footer reads MiniMax M3 figures per Artificial Analysis v4.3.2 and MiniMax; GPT-6 Sol figures per Artificial Analysis v4.3.2 and OpenAI.

Dónde las cifras publicadas de M3 son inusualmente buenas y dónde son escasas

Las cifras independientes más sólidas de MiniMax M3 no están donde uno esperaría de un modelo a este precio. La recuperación de contexto largo se sitúa en 83,0, lo que está 0,7 por debajo del 83,7 de GPT-6 Sol y, en la práctica, es un empate —en una ventana de un millón de tokens, a un sexto del precio de entrada. GPQA Diamond llega a 92,9, lo suficientemente cerca de la banda de vanguardia como para que la diferencia quede dentro del rango que cabría esperar de los ajustes de esfuerzo de razonamiento más que de la capacidad. Esas dos líneas son la razón por la que vale la pena tomarse a M3 en serio en lugar de archivarlo bajo “barato”.

Las partes débiles son igualmente claras y deberían señalarse en lugar de minimizarse. El uso de herramientas al estilo retail es deficiente: en tau-banking, M3 obtiene 15,3, y en la revisión más reciente de Terminal-Bench 4.0 obtiene 2,0. Ambas son mediciones de terceros, y ambas sugieren un modelo cuyo promedio de benchmarks esconde una debilidad específica y grande en el uso agéntico de herramientas frente a un servicio simulado. Las propias cifras reportadas por el proveedor pintan un panorama mucho mejor —SWE-Bench 59; BrowseComp 83,5; MCP Atlas 74,2; Terminal-Bench 2.1 con 66—, y son cifras del proveedor en su propio entorno de evaluación, lo cual es una afirmación y no una medición. Cualquier despliegue que dependa del uso de herramientas debería leer ambas cifras en conjunto y probarlo directamente.

Hay una cuestión de segundo orden sobre la propia comparación de benchmarks. GPT-6 Sol se mide con un conjunto de benchmarks más pequeño en nuestro catálogo que M3 —cinco puntuaciones frente a las veintitrés de M3— porque el proveedor publica menos y terceros han ejecutado menos de las pruebas sobre él. Un modelo con veintitrés cifras publicadas siempre parecerá estar evaluado de forma más exhaustiva que uno con cinco, y la diferencia es de documentación, no de capacidad.

Lo que los pesos abiertos realmente te aportan, más allá de una factura más baja

El autoalojamiento de M3 es la opción que GPT-6 Sol no puede igualar, y su valor no es principalmente financiero. A 0,30 $ / 1,20 $, la API es más barata que lo que le cuesta a la mayoría de los equipos ejecutar el hardware, así que la razón para descargarlo es una restricción, no una hoja de cálculo: datos que no pueden salir de un límite, una carga de trabajo sin ninguna dependencia externa aceptable, un ajuste fino, o un presupuesto de latencia que un endpoint compartido no puede cumplir. Los pesos abiertos son la única de esas cuatro a la que el modelo cerrado puede dar respuesta, y lo hace no estando disponible. La respuesta de GPT-6 Sol es que no necesitas ejecutarlo — lo cual es un argumento distinto, y cierto para un conjunto distinto de equipos.

El rendimiento merece su propia línea porque es el número que una demo nunca muestra. MiniMax M3 se mide en aproximadamente 495 tokens de salida por segundo en nuestra ventana móvil de siete días, y GPT-6 Sol en 244. M3 no es solo el modelo más barato de esta comparación, sino el más rápido en nuestras rutas por un factor de aproximadamente dos, lo que cambia lo que cuesta un trabajo por lotes tanto en tiempo de reloj como en dólares. La salvedad es que estas son ventanas móviles en un entorno de pruebas compartido, no un benchmark controlado, y cambian.

OrcaRouter model page for MiniMax M3 (minimax/minimax-m3) by MiniMax, dated 2026-05-31, tagged Vision, Tools, JSON and Reasoning, describing it as MiniMax's flagship open-weight foundation model with a 1M-token context window and text, image and video input, listing $0.30 per million input and $1.20 per million output, with a model-page note that it is available through OrcaRouter under the model id minimax/minimax-m3.

Ejecutando la pareja como un solo sistema

Ambos modelos están detrás de una única clave de OrcaRouter junto con más de 200 otras, lo que hace que la configuración interesante aquí sea una cascada que prioriza lo barato en lugar de una elección. Dirige el volumen a MiniMax M3, mantén GPT-6 Sol detrás de él para las solicitudes que no superen una comprobación o activen una señal de dificultad, y el coste combinado queda mucho más cerca de la tarifa de pesos abiertos que de la de Sol, mientras que las llamadas difíciles siguen recibiendo el modelo que obtiene 47.6. El DSL de enrutamiento de OrcaRouter es donde se expresa esa composición: una llamada puede nombrar varios modelos y las condiciones entre ellos en lugar de codificar un único endpoint por tarea.

Para los equipos que de verdad no logran decidirse, la fusión de modelos es la versión tosca de la misma idea: un panel de modelos responde en conjunto y las respuestas se combinan. Es poco adecuada para el trabajo de gran volumen y razonablemente adecuada para un prompt de alto riesgo que se ejecuta rara vez, donde la diferencia entre una respuesta de 29,2 y una de 47,6 es lo único que aparece en la página.

La conmutación por error importa más con un modelo de pesos abiertos que con uno cerrado, y por una razón concreta: M3 es servido por más de un proveedor de infraestructura, y los endpoints difieren. Una segunda ruta configurada con antelación hace que un host lento o degradado sea un reintento en lugar de una interrupción. Y, como nuestro catálogo traslada los precios de lista de los proveedores sin margen de beneficio, un cambio de tarifa de un proveedor se aplica en nuestro lado el mismo día —lo cual importa en una línea de salida de $1.20, donde que un proveedor mueva una sola tarifa de entrada en caché cambia visiblemente la factura.

Artificial Analysis model page for MiniMax-M3, described as an open-weights model released June 2026, showing an Intelligence rank of 18 of 117 with an Intelligence Index of 29 on a comparable-model median of 18, an output speed rating above average, a 1M-token context window, and support for text, image and video input with text output.

¿A cuál deberías llamar realmente?

Usa MiniMax M3 para volumen, para cualquier cosa que quiera una entrada de video, para cualquier cosa que necesite emitir más de 128.000 tokens en una sola respuesta, y para cualquier cosa que tenga que ejecutarse dentro de tu propio perímetro. Usa GPT-6 Sol para las solicitudes cuya respuesta es el producto, para bucles agénticos con uso intensivo de herramientas, donde las puntuaciones de tau-banking y Terminal-Bench 4.0 de M3 son una advertencia en lugar de una nota al pie, y para todo aquello en lo que una diferencia de 18 puntos en el índice justifique para ti ocho veces la tasa de salida. Usa ambos, y deja que un enrutador decida, si ninguna de esas dos opciones describe todo tu tráfico.

Una cosa que conviene comprobar antes de cualquiera de los dos, y es el mismo punto de control con el que este blog sigue topando: M3 ha sido el buque insignia de la línea de la serie M desde mayo de 2026 y sigue siendo el modelo más reciente de la serie M en nuestro catálogo, así que es realmente actual; pero GPT-6 Sol ya ha sido sustituido por GPT-6.1 Sol con las mismas tarifas de contexto corto y una entrada en caché más barata, y su propia página de GPT-6 Sol incluye un puntero a este último. Si la razón por la que te fijas en Sol aquí es la capacidad y no la integración de hace ocho días, fíjate primero en el sucesor.

Comparados en este artículo2

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario