Tarjeta principal generada titulada Claude Sonnet 5.5 vs MiniMax M3, con el subtítulo donde el modelo 15 veces más barato empata, con tres tarjetas de estadísticas: recall de contexto largo 82,7% vs 83,0%, Terminal-Bench 4.0 63,6% vs 2,0%, y coste por tarea 7,60 $ vs 0,51 $, con un pie de página que dice Todas las cifras según Artificial Analysis v4.3.2; especificaciones de MiniMax M3 según MiniMax.
Guides & Insights

Claude Sonnet 5.5 vs MiniMax M3: dónde el modelo 15× más barato realmente empata

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una fila en el tablero independiente donde MiniMax M3 y Claude Sonnet 5.5 son el mismo modelo, y no es la que cualquiera adivinaría. En recuperación de contexto largo, MiniMax M3 obtiene 83,0 % y Claude Sonnet 5.5 obtiene 82,7 %. MiniMax M3 cuesta $0,30 por millón de tokens de entrada y $1,20 por millón de salida. Claude Sonnet 5.5 cuesta $2,00 y $10,00. En todo el Índice de Inteligencia, el costo medido de M3 es de $0,51 por tarea frente a $7,60 de Claude Sonnet 5.5 — quince veces más barato, y en la única evaluación que mide si un modelo todavía puede encontrar algo en un documento muy largo, no está para nada por detrás.

Entonces abres las evaluaciones agénticas y el panorama se invierte con tal fuerza que deja de ser una comparación. En Terminal-Bench 4.0, que pide a un modelo manejar una shell y completar de verdad una tarea de software, MiniMax M3 obtiene un 2,0 % y Claude Sonnet 5.5 obtiene un 63,6 %. Una brecha de treinta veces en el único benchmark que más se parece al trabajo de producción no es una cuestión de precio, y ningún ahorro por token sobrevive a eso. La pregunta útil que plantea este enfrentamiento no es "cuál es mejor", sino cuál de estos dos modos de fallo puede absorber tu carga de trabajo: MiniMax M3 es el modelo de pesos abiertos, de un millón de tokens y con vídeo nativo que iguala a un modelo de frontera en recuperación y se derrumba en ejecución, y Claude Sonnet 5.5 es el modelo cerrado que se lanzó el 28 de septiembre de 2026 para hacer lo contrario.

Qué es cada uno, dicho claramente

MiniMax M3 es el modelo fundacional de pesos abiertos insignia del laboratorio chino, anunciado el 1 de junio de 2026 y descargable bajo la propia licencia comunitaria de MiniMax. Es una mezcla de expertos de aproximadamente 428 mil millones de parámetros totales, con unos 23 mil millones activos por token, y es nativamente multimodal en el sentido fuerte: entran texto, imagen y vídeo y sale texto, con el pipeline multimodal reconstruido desde el primer paso de preentrenamiento en lugar de añadido a posteriori. La ventana es de 1.048.576 tokens —con un mínimo utilizable garantizado de 512.000 en nuestra propia ficha de catálogo— y la salida máxima es de 512.000 tokens, que es nuestra cifra y no la del proveedor, porque MiniMax no publica ninguna. La arquitectura es MiniMax Sparse Attention, el tema del arXiv 2606.13392, y la afirmación del proveedor al respecto es más de 9× más rápida en el prellenado y más de 15× más rápida en la decodificación que la generación anterior con una ventana de un millón de tokens. Esas son cifras del proveedor y no las hemos visto reproducidas de forma independiente.

Artificial Analysis model page for MiniMax-M3, an open-weights model released June 2026, showing an Intelligence Index of 29, an output speed of 115.3 tokens per second, $0.30 per million input tokens and $1.20 per million output tokens, $0.51 per Intelligence Index task, a 1M-token context window, and text, image and video input.

Claude Sonnet 5.5 es el segundo modelo de la generación 5.5 de A​nthropic, con un día de antigüedad en el momento de escribir esto, y es cerrado. A​nthropic lo describe como la mejor combinación de velocidad e inteligencia de la línea, y sus especificaciones son 1.000.000 de tokens de contexto, 128.000 tokens de salida sincrónica con 300.000 en la Message Batches API, entrada de texto, imagen y archivos, razonamiento adaptativo con esfuerzo seleccionable, un corte de conocimiento de junio de 2026 y retención de datos cero disponible desde el lanzamiento. Su precio no se movió respecto a Claude Sonnet 5: 2,00 $ de entrada, 10,00 $ de salida, 0,20 $ por lecturas de caché, 2,50 $ por escrituras de caché. A​nthropic afirma que se ejecuta un 30 % más rápido y cuesta hasta un 30 % menos por tarea que Claude Sonnet 5 — cifras del proveedor, no reproducidas, y que deben leerse como afirmaciones sobre el número de tokens más que sobre las tarifas, ya que las tarifas son idénticas.

La forma del benchmark lo dice todo

Ambos modelos se miden en el mismo índice, revisión v4.3.2, y los resultados por evaluación son lo que hace que este emparejamiento sea interesante en lugar de desequilibrado.

• Recuperación de contexto largo — MiniMax M3 83.0% vs Claude Sonnet 5.5 82.7%, una diferencia de redondeo en un empate genuino

• SciCode — MiniMax M3 47.1% frente a Claude Sonnet 5.5 61.0%, una brecha real pero superable

• Humanity's Last Exam — MiniMax M3 39,0 % vs. Claude Sonnet 5,5 %

• Terminal-Bench 4.0 — MiniMax M3 2.0% vs Claude Sonnet 5.5 63.6%, donde la comparación deja de ser útil

• Índice de inteligencia — MiniMax M3 29 vs Claude Sonnet 5.5 56

• Costo por tarea de Index — MiniMax M3 $0.51 vs Claude Sonnet 5.5 $7.60

• Tokens de salida generados en todo el Índice — MiniMax M3 120M vs Claude Sonnet 5.5 410M

• Velocidad de salida — MiniMax M3 115,3 tokens/seg vs Claude Sonnet 5.5 138,7 tokens/seg

Lea esas filas en orden y emerge un modelo coherente. MiniMax M3 es competente en razonamiento estático y recuperación de información, y débil en ejecución sostenida. Su resultado en Terminal-Bench no es un déficit modesto; una puntuación del 2,0 % significa que el modelo esencialmente no completa las tareas, y el mismo patrón se observa en su puntuación en el benchmark de automatización de 0,21 frente a 0,71, y en una puntuación de omnisciencia de 1,35 frente a 32,3. Donde MiniMax M3 sí se mantiene firme es exactamente donde su arquitectura afirma tener una ventaja: una entrada genuinamente larga, leída y respondida. Eso es MSA haciendo exactamente aquello para lo que MiniMax lo comercializó.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs MiniMax M3, the scoreboard, with six matched rows: input price $2.00 vs $0.30, output price $10.00 vs $1.20, Intelligence Index 56 vs 29, cost per task $7.60 vs $0.51, long-context recall 82.7% vs 83.0%, and Terminal-Bench 4.0 63.6% vs 2.0%, with a footer reading All figures per Artificial Analysis v4.3.2; MiniMax M3 is open-weight under MiniMax's community licence.

La línea de costos añade un segundo punto menos evidente. MiniMax M3 no solo es más barato por token —1/6,7 en entrada y 1/8,3 en salida—, sino que además gasta menos tokens en llegar a una respuesta: aproximadamente 120 millones frente a 410 millones en la misma batería de pruebas. Dos efectos se multiplican hasta dar una brecha de quince veces por tarea. Parte de esa brecha es eficiencia genuina y parte es, sencillamente, que MiniMax M3 se rinde antes en las tareas en las que está fallando; una tarea barata que devuelve la respuesta equivocada no es un ahorro, y esta es la lección más barata del artículo.

La dimensión que la lista de precios no puede mostrar

MiniMax M3 tiene una propiedad que Claude Sonnet 5.5 no tiene y no puede adquirir: puedes llevarte los pesos. Eso sirve para exactamente una clase de comprador, y para ese comprador supera todo lo anterior. Si una solicitud no puede salir de una jurisdicción, no puede cruzar un límite de red, o tiene que ejecutarse donde no se puede alcanzar ninguna API, un modelo sin pesos descargables no es una opción a ningún precio, y un modelo de pesos abiertos de 428 mil millones de parámetros sí lo es. La misma propiedad es una desventaja en la dirección opuesta: el autoalojamiento de 428B parámetros con 23B activos es una decisión de capital, no una clave API, y las propias afirmaciones de atención dispersa de MiniMax existen porque la alternativa a un millón de tokens es infraestructura inasequible.

Para todos los demás, el planteamiento honesto es que esta es una disyuntiva entre construir y comprar, con una etiqueta de precio. Claude Sonnet 5.5 es el mejor modelo para cualquier tarea agéntica. MiniMax M3 es el mejor modelo para leer algo enorme y responder una pregunta al respecto, y es radicalmente mejor para procesar video, que Claude Sonnet 5.5 no acepta en absoluto: su superficie de entrada es texto, imágenes y archivos.

• Pesos — MiniMax M3 abierto bajo la licencia comunitaria de MiniMax vs. Claude Sonnet 5.5 cerrado

• Modalidad de entrada — MiniMax M3 texto, imagen y vídeo vs Claude Sonnet 5.5 texto, imagen y archivo

• Salida máxima — MiniMax M3 512.000 tokens según nuestro catálogo frente a Claude Sonnet 5.5 128.000 en modo síncrono, 300.000 en Batches

• Precios de caché — MiniMax M3 $0.06 por millón de lectura frente a Claude Sonnet 5.5 $0.20 de lectura y $2.50 de escritura

• Control de esfuerzo — pensamiento de MiniMax M3 habilitado, adaptativo o deshabilitado frente al pensamiento adaptativo de Claude Sonnet 5.5, donde deshabilitarlo ahora requiere la between_toolsforma

• Retención de datos — MiniMax M3 se rige por tu propio despliegue si es autoalojado, frente a Claude Sonnet 5.5, con retención de datos cero disponible por parte de Anthropic desde el lanzamiento

Ejecutar ambos sin ejecutar dos contratos

Combina un modelo chino de pesos abiertos y un modelo cerrado de Anthropic en un mismo pipeline y el coste operativo normalmente no son los tokens; es el segundo contrato, la segunda clave, el segundo conjunto de límites de peticiones y el segundo lugar donde puede producirse un fallo. OrcaRouter reduce todo eso a un único endpoint compatible con OpenAI que abarca más de 200 modelos, con el precio de lista del proveedor transferido sin cambios —sin margen añadido a ninguna de las partes—, failover automático entre proveedores upstream y un DSL de enrutamiento para componer varios modelos en una sola llamada. MiniMax M3 se puede enrutar aquí como minimax/minimax-m3 a los $0.30 y $1.20 de MiniMax, con lecturas de caché a $0.06, y es uno de los modelos con más tráfico del catálogo, lo que en sí mismo es una señal útil: la capa de enrutamiento puede decirte cuánta carga real soporta un modelo, no solo qué puntuación obtuvo.

Claude Sonnet 5.5 todavía no está en nuestro catálogo, y este artículo no va a fingir lo contrario. La vía para acceder a él hoy es la propia API de Anthropic. Claude Sonnet 5 se puede enrutar aquí con los mismos $2.00 y $10.00 y así ha sido desde el 30 de junio, y es el objetivo natural de despliegue progresivo y el socio de conmutación por error mientras su sucesor apenas tiene un día de vida.

Esa combinación —el intercambio de contexto largo y la ruta agéntica detrás de una sola credencial— es para lo que sirve un enrutador. MiniMax M3 transporta 63,2 millones de tokens de tráfico a la semana a través de este catálogo, frente a los 7,9 millones de Claude Sonnet 5, así que el modelo barato no es un sustituto teórico aquí; ya está soportando el volumen. Enrutar ambos desde una sola clave significa que la división es una decisión de configuración por la que puedes mover el tráfico, en lugar de un segundo contrato que tienes que firmar antes de poder probar el lado más barato.

OrcaRouter model page for minimax/minimax-m3, dated 2026-05-31, showing the Vision, Tools, JSON and Reasoning badges, a 1M-token context window, 512K maximum output, text, image and video input, $0.30 input and $1.20 output per million tokens, a p50 time to first token of 10.00 s, and 63.2M tokens of recent traffic.

Qué hacer con la corbata

Si tu carga de trabajo es la respuesta a preguntas a escala de documento —una entrada muy larga, una respuesta factual breve, una latencia tolerable—, el empate en contexto largo es real, y la ventaja de coste de quince veces de MiniMax M3 también lo es. Es un cambio directo y vale la pena probarlo esta semana.

Si tu carga de trabajo es agéntica, la línea de Terminal-Bench lo resuelve antes de que el precio entre en la conversación. Claude Sonnet 5.5 a $7.60 por tarea de Index frente a MiniMax M3 a $0.51 es un sobreprecio de 15× por un modelo que obtiene sesenta puntos más en la evaluación más parecida a tu tráfico de producción, y la opción quince veces más barata que falla la tarea es la cara. La medición que debes realizar con tus propios datos es tokens por tarea completada, no tokens por solicitud, porque esa es la única cifra de este artículo en la que la ventaja de precio de MiniMax M3 no se sostiene por defecto.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario