
GPT-6.1 Sol vs MiniMax M3: A Tabela de Preços Mais Barata Perde na Conta
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
MiniMax M3 cobra uma fração do que GPT-6.1 Sol cobra — US$ 0,30 por milhão de tokens de entrada contra US$ 2,00, US$ 1,20 por milhão de tokens de saída contra US$ 10,00 — e, pelo medidor que de fato roda, ele é mais barato: US$ 0,508 por tarefa contra US$ 0,724 na avaliação v4.3.2 da Artificial Analysis. Essa é uma vitória genuína, e também é todo o argumento, porque a mesma medição que dá ao M3 a conta menor dá ao GPT-6.1 Sol uma liderança de 22,6 pontos no índice, e o conjunto de benchmarks que mede se um modelo consegue concluir trabalho agêntico em vez de descrevê-lo transforma a diferença em um muro. O fornecedor lançou o GPT-6.1 Sol em 29 de setembro de 2026. A empresa lançou o M3, seu modelo de pesos abertos de 428 bilhões de parâmetros, em 31 de maio de 2026.
Ambos estão no ar, ambos têm preço definido, e ambos estão a uma chamada de API de distância. O que se segue é a aritmética que decide entre eles, e os dois pontos em que a aritmética não é a história completa.
O que cada modelo realmente é
GPT-6.1 Sol é o atual carro-chefe da OpenAI para raciocínio e engenharia de software — um modelo fechado, lançado apenas uma semana depois do GPT-6 Sol que ele substitui, e vendido pelo mesmo preço de tabela de US$ 2,00 / US$ 10,00 que seu predecessor. Ele tem uma tarifa de US$ 0,10 para entrada em cache, metade do que o GPT-6 Sol cobrava por acertos de cache, e é o modelo que a OpenAI indica quando fala de codificação agêntica em vez de chat.
O MiniMax M3 é um modelo de mistura de especialistas com 428 mil milhões de parâmetros totais e 23 mil milhões ativos por token, publicado sob a Licença Comunitária MiniMax — um lançamento de pesos abertos com uma licença personalizada de cariz não comercial, e não uma licença aprovada pela OSI. É servido por um amplo conjunto de fornecedores de inferência: a Artificial Analysis registra quinze hosts para o M3, contra oito para o GPT-6.1 Sol. Essa amplitude é a vantagem prática dos pesos abertos, e é também a razão pela qual a concorrência de preços no M3 tem sido mais rápida do que no modelo fechado.
A tabela de preços, e o medidor que se sobrepõe a ela

Coloque as duas tabelas de tarifas publicadas lado a lado e não há nem comparação.
• Entrada — GPT-6.1 Sol $2,00 por 1M vs. MiniMax M3 $0,30 por 1M; o M3 é 85% mais barato
• Saída — $10,00 por 1M vs. $1,20 por 1M; o M3 é 88% mais barato
• Entrada em cache — $0,10 por 1M vs. $0,06 por 1M
• Custo por tarefa AA — $0,724 vs. $0,508; o M3 é 30% mais barato, não 85%
• Tokens de saída por tarefa — 38.128 vs. 48.192; o M3 escreve 26% mais
• Tempo por tarefa — 640 s vs. 486 s
• Janela de contexto — 1.050.000 vs. 1.048.576 tokens; efetivamente equivalente
• Saída máxima — 128.000 tokens vs. 512.000; o M3 vai escrever uma única resposta muito longa
• Entradas aceitas — texto, imagem e arquivo vs. texto, imagem e vídeo
• Posição no índice — GPT-6.1 Sol em 10º de 147 modelos vs. MiniMax M3 em 62º
As duas linhas baratas no topo são as que uma planilha de compras vê. A terceira linha é a que paga a conta, e ela diz que uma vantagem de 85–88% na tabela de preços se torna uma vantagem de 30% no mundo real, porque o M3 emite mais tokens por tarefa e porque uma tarefa não é uma quantidade fixa de trabalho. As tabelas de preços precificam tokens; o trabalho é precificado em tarefas. Qualquer comparação que pare nas duas primeiras linhas está comparando os números errados, na unidade errada.
Onde os trinta por cento deixam de importar
O custo da tarefa é próximo o bastante para que a diferença no índice decida a questão para qualquer coisa além de texto em massa. A Artificial Analysis coloca o GPT-6.1 Sol em 51,83 e o MiniMax M3 em 29,22 — uma diferença de 22,6 pontos, e que não está distribuída de forma uniforme pela suíte. Nas avaliações que pedem que um modelo opere um terminal, edite um repositório e verifique o próprio trabalho, os dois modelos não estão na mesma categoria:
• Terminal-Bench 4.0 — GPT-6.1 Sol 0,5606 vs MiniMax M3 0,0202
• Terminal-Bench Science — 0,5810 vs 0,0048
• AA-Omniscience — 41,53 vs 1,35
• MMLU-Pro — 0,8595 vs 0,7856
• AutomationBench — 0,6487 vs 0,2125
• τ²-bench — não publicado para GPT-6.1 Sol nesta execução vs 0,8889 para M3
• GPQA Diamond — não publicado para GPT-6.1 Sol nesta execução vs 0,9293 para M3
• CritPT — 0,3171 vs 0,0371
Leia isso com atenção, porque não é uma vitória completa e as exceções são a parte interessante. O MiniMax M3 obtém 0,8889 no τ²-bench, a avaliação de diálogo para uso de ferramentas e atendimento ao cliente, e 0,9293 no GPQA Diamond — uma pontuação em ciências de nível de pós-graduação que supera todos os números da OpenAI publicados nesta execução específica. O M3 é competente em raciocínio e tem bom desempenho no uso de ferramentas em conversas. No Terminal-Bench 4.0, ele obtém 0,0202. Isso não é "pior"; é um modelo que não consegue manter de forma alguma a coerência de uma tarefa de repositório com várias etapas, e nenhum desconto em tokens torna uma tarefa em que o modelo falha mais barata do que a tarefa que o modelo conclui.
Há um custo de segunda ordem que o número por tarefa esconde. O M3 registra 48.192 tokens de saída por tarefa e um tempo até a primeira resposta de 23,0 segundos, contra os 332,0 segundos do GPT-6.1 Sol — o modelo pequeno começa a falar quase imediatamente e depois raciocina longamente. Se a sua carga de trabalho for sensível à latência, mas superficial, isso é um ponto a favor do M3. Se for agêntica, a contagem de tokens é o que você paga e a pontuação final é o que você obtém.
Nosso próprio cartão de modelo do GPT-6.1 Sol traz os mesmos números na forma contra a qual você realmente rotearia: a taxa de US$ 2,00 / US$ 10,00, uma janela de contexto de 1.050.000 tokens, um p50 de 4,54 segundos até o primeiro token, e o índice e o bloco de benchmarks da Artificial Analysis na mesma página.

Quanto valem aqui os pesos abertos
O fato de o M3 poder ser baixado é o argumento mais forte a seu favor, e vale a pena ser preciso sobre o que isso proporciona. Isso proporciona termos de licença que permitem executar o modelo dentro do seu próprio perímetro — útil se os dados não puderem sair — e proporciona a concorrência de preços que vem de quinze hosts. Isso não lhe proporciona uma implantação barata: 428 bilhões de parâmetros com 23 bilhões ativos ainda exigem hardware de inferência robusto, e a Mini Community License é uma licença personalizada com condições atreladas, não uma irrestrita. Para a maioria das equipes, "open weights" significa um preço melhor na inferência hospedada, não uma caixa no rack.
O card do OrcaRouter para o MiniMax M3 é onde ficam os números servidos: a tarifa de $0,30 / $1,20, a janela de contexto de 1.048.576 tokens, a saída máxima de 512.000 tokens, entrada de texto/imagem/vídeo, e um volume de 56,4 milhões de tokens em sete dias entre os provedores que o roteiam.

Ambos por trás de uma única chave
A razão prática pela qual esta comparação é uma mudança de configuração e não uma migração é que ambos os modelos são acessíveis a partir de um único endpoint OrcaRouter — uma API para mais de 200 modelos, com o preço de tabela do provedor repassado com 0% de margem, o que significa que uma mudança de tarifa da MiniMax chega à sua fatura no mesmo dia em que o fornecedor a publica, em vez de quando um revendedor renegocia. Isso importa mais para o M3 do que para o seu rival: a razão principal para rotear para um modelo de pesos abertos é que seu preço e sua lista de hosts estão em movimento, e um medidor de repasse é o único tipo que acompanha um alvo em movimento.
O failover automático é a outra metade. O M3 é servido por muitos provedores de confiabilidade variável, e a camada de roteamento pode mover uma requisição para outro host quando um se degrada, sem que o chamador saiba em qual host ela foi parar. Essa é a maneira honesta de adotar um modelo cuja pontuação no Terminal-Bench diz "não é para o caminho crítico" — coloque-o onde uma nova tentativa é barata.
Qual deles, se você tiver que escolher hoje?
Se o trabalho for texto em massa — extração, sumarização, classificação, diálogo, qualquer coisa em que o resultado seja prosa e o modo de falha seja uma frase errada em vez de uma build quebrada — o MiniMax M3 é o padrão correto e os trinta por cento são dinheiro real. Use os números do GPQA e do τ²-bench como sua evidência: este é um modelo capaz que por acaso é barato.
Se o trabalho for agêntico — repositórios, terminais, cadeias de ferramentas, qualquer coisa com uma etapa de verificação — o 0,0202 no Terminal-Bench 4.0 é eliminatório, e o GPT-6.1 Sol, com 0,5606 por US$ 0,724 por tarefa, é o melhor negócio, mesmo custando 85% mais por token. A tabela de tarifas nunca foi o que você estava comprando.
A resposta útil é que você não precisa escolher uma vez. Direcione o nível superficial para o M3, direcione o nível agêntico para o GPT-6.1 Sol e mantenha ambos atrás de uma única credencial — a DSL de roteamento combina os dois em uma única chamada quando uma tarefa começa como extração e se transforma em um trabalho de reparo.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
