
GPT-6 Sol vs. MiniMax M3: O que oito vezes o preço de saída ainda não compra
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A primeira coisa a dizer sobre GPT-6 Sol contra MiniMax M3 é que a linha de preço não está próxima e a linha de pontuação também não está, e elas apontam em direções opostas. O MiniMax M3 é um modelo de pesos abertos que você pode baixar e executar por conta própria, e está listado a US$ 0,30 por milhão de tokens de entrada e US$ 1,20 por milhão de saída; o GPT-6 Sol, o nível intermediário da geração GPT-6 lançada em 22 de setembro de 2026, custa US$ 2,00 e US$ 10,00 nas mesmas unidades. Isso é um pouco mais de oito vezes a taxa de saída. O MiniMax M3 também aceita vídeo como modalidade de entrada, o que o GPT-6 Sol não faz — o modelo Sol aceita texto, imagem e arquivo. O que o M3 não tem é uma pontuação nem de longe próxima da do Sol: 29,2 contra 47,6 no Intelligence Index da Artificial Analysis, no mesmo quadro de revisão v4.3.2.
Essa assimetria é a história inteira, e é uma história mais interessante do que uma simples troca entre preço e qualidade, porque a coluna de pesos abertos fica com algo que a coluna fechada não pode vender por preço nenhum: os checkpoints do M3 estão no Hugging Face e o modelo pode ser executado dentro de um perímetro de rede. Se você está escolhendo entre esses dois, a pergunta útil não é qual é melhor. É qual das quatro coisas separadas que você está comprando — preço, throughput, controle ou capacidade — você pode se dar ao luxo de perder.
Quatro dimensões, e elas não se classificam da mesma forma.
• Preço de saída — GPT-6 Sol US$ 10,00 por milhão vs. MiniMax M3 US$ 1,20 por milhão
• Preço de entrada — GPT-6 Sol US$ 2,00 por milhão vs. MiniMax M3 US$ 0,30 por milhão
• Entrada em cache — GPT-6 Sol US$ 0,20 por milhão vs. MiniMax M3 US$ 0,06 por milhão
• Pesos — GPT-6 Sol fechado, somente API vs. MiniMax M3 de pesos abertos e auto-hospedável
• Modalidades de entrada — GPT-6 Sol texto, imagem e arquivo vs. MiniMax M3 texto, imagem e vídeo
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs. MiniMax M3 1.048.576 tokens
• Saída máxima — GPT-6 Sol 128.000 tokens vs. MiniMax M3 512.000 tokens
• Índice de Inteligência — GPT-6 Sol 47,6 vs. MiniMax M3 29,2
• Índice de codificação — GPT-6 Sol não publicado nesta revisão vs. MiniMax M3 58,6
• Degrau para solicitações longas — GPT-6 Sol reprecifica toda a solicitação acima de 272.000 tokens de entrada vs. MiniMax M3 não tem degrau em sua tabela de preços
Duas dessas linhas merecem mais do que uma linha. O teto máximo de saída vai na direção oposta a todo o resto: o M3 emitirá até 512.000 tokens em uma única resposta, quatro vezes os 128.000 do GPT-6 Sol. Para uma carga de trabalho que gera um arquivo inteiro ou um relatório completo em uma única chamada, isso é uma vantagem estrutural, não um erro de arredondamento. E o escalão de solicitação longa é um custo real do GPT-6 Sol que o M3 não tem de forma alguma — acima de 272.000 tokens de entrada, o Sol reprecifica a solicitação inteira para $4,00 / $15,00, enquanto a ficha do M3 não traz cláusula equivalente. Em um prompt de 300.000 tokens, a comparação da tarifa de saída não é de oito vezes, e sim de doze vezes e meia.
Então, o ranking honesto depende inteiramente da carga de trabalho. Para classificação ou extração em alto volume, em que uma resposta errada é barata e uma resposta lenta não é, o M3 a US$ 0,30 / US$ 1,20 sem penalidade de contexto longo é o padrão sensato, e o Sol é dinheiro jogado fora. Para uma tarefa em que a primeira resposta precisa estar certa — um plano de migração, uma revisão de segurança, um raciocínio que será lido por uma pessoa que agirá com base nele — uma diferença de 18,4 pontos no índice a oito vezes o preço de saída é uma troca que a maioria das equipes aceita, porque a alternativa é pagar uma pessoa para corrigi-la.

Onde os números divulgados da M3 são excepcionalmente bons, e onde eles são fracos
Os números independentes mais fortes do MiniMax M3 não estão onde você esperaria de um modelo nessa faixa de preço. A recuperação em contexto longo chega a 83,0, o que fica 0,7 abaixo dos 83,7 do GPT-6 Sol e, na prática, é um empate — em uma janela de um milhão de tokens, a um sexto do preço de entrada. O GPQA Diamond vem com 92,9, perto o bastante da faixa de fronteira para que a diferença esteja dentro do intervalo que você esperaria de configurações de esforço de raciocínio, e não de capacidade. Essas duas linhas são o motivo pelo qual o M3 merece ser levado a sério, em vez de ser arquivado sob o rótulo de "barato".
As partes fracas são igualmente claras e devem ser declaradas em vez de disfarçadas. O uso de ferramentas no estilo varejo é ruim: no tau-banking, o M3 obtém 15,3, e na revisão mais recente do Terminal-Bench 4.0 obtém 2,0. Ambas são medições de terceiros, e ambas sugerem um modelo cuja média de benchmarks esconde uma fraqueza específica e grande no uso de ferramentas agênticas contra um serviço simulado. Os números relatados pelo próprio fornecedor pintam um quadro muito melhor — SWE-Bench Pro 59, BrowseComp 83,5, MCP Atlas 74,2, Terminal-Bench 2.1 com 66 — e esses são números do fornecedor em seu próprio harness, o que é uma alegação e não uma medição. Qualquer implantação que dependa do uso de ferramentas deve ler o par de números em conjunto e testá-la diretamente.
Há um ponto de segunda ordem sobre a própria comparação de benchmarks. O GPT-6 Sol é avaliado, no nosso catálogo, num conjunto menor de benchmarks do que o M3 — cinco pontuações contra as vinte e três do M3 — porque o fornecedor publica menos e terceiros executaram menos testes sobre ele. Um modelo com vinte e três números publicados parecerá sempre mais exaustivamente avaliado do que um com cinco, e a diferença é de documentação, não de capacidade.
O que os pesos abertos realmente lhe oferecem, além de uma conta menor
A auto-hospedagem do M3 é a opção que o GPT-6 Sol não consegue igualar, e seu valor não é principalmente financeiro. A US$ 0,30 / US$ 1,20, a API é mais barata do que o custo da maioria das equipes de operar o hardware, então o motivo para baixá-lo é uma restrição, não uma planilha: dados que não podem sair de um limite, uma carga de trabalho sem dependência externa aceitável, um ajuste fino ou um orçamento de latência que um endpoint compartilhado não consegue atender. Pesos abertos são o único daqueles quatro que o modelo fechado consegue responder, e ele responde a isso por não estar disponível. A resposta do GPT-6 Sol é que você não precisa executá-lo — o que é um argumento diferente, e verdadeiro para um conjunto diferente de equipes.
A taxa de transferência merece uma linha própria porque é o número que uma demonstração nunca mostra. O MiniMax M3 é medido em cerca de 495 tokens de saída por segundo na nossa janela móvel de sete dias, e o GPT-6 Sol em cerca de 244. O M3 não é apenas o modelo mais barato nesta comparação, é o mais rápido nas nossas rotas, por cerca de um fator de dois, o que muda o custo de um trabalho em lote tanto em tempo de relógio quanto em dólares. A ressalva é que estas são janelas móveis num playground compartilhado, não um benchmark controlado, e elas mudam.

Executando o par como um único sistema
Ambos os modelos ficam atrás de uma única chave do OrcaRouter, junto com mais de 200 outras, o que torna a configuração interessante aqui uma cascata do mais barato primeiro, em vez de uma escolha. Encaminhe o volume para o MiniMax M3, mantenha o GPT-6 Sol atrás dele para as requisições que falham numa verificação ou disparam um sinal de dificuldade, e o custo combinado fica muito mais próximo da taxa open-weight do que da do Sol, enquanto as chamadas difíceis ainda recebem o modelo que pontua 47.6. A DSL de roteamento do OrcaRouter é onde essa composição é expressa — uma chamada pode nomear vários modelos e as condições entre eles, em vez de codificar um endpoint por tarefa.
Para equipes que genuinamente não conseguem decidir, a fusão de modelos é a versão mais crua da mesma ideia: um painel de modelos responde em conjunto e as respostas são combinadas. É uma opção pouco adequada para trabalho em grande volume e razoavelmente adequada para um prompt executado raramente e de alto risco, em que a diferença entre uma resposta 29,2 e uma 47,6 é a única coisa na página.
O failover é mais importante com um modelo de pesos abertos do que com um modelo fechado, e por um motivo específico: o M3 é servido por mais de um provedor de infraestrutura, e os endpoints diferem. Uma segunda rota configurada antecipadamente faz com que um host lento ou degradado seja uma nova tentativa, e não uma indisponibilidade. E, como o nosso catálogo repassa os preços de tabela dos provedores sem qualquer acréscimo, uma alteração de tarifa de um fornecedor entra em vigor do nosso lado no mesmo dia — o que é relevante numa linha de saída de US$ 1,20, em que um fornecedor alterar uma única tarifa de entrada em cache altera visivelmente uma fatura.

Qual deles você deveria realmente chamar
Adote o MiniMax M3 para volume, para qualquer coisa que queira uma entrada de vídeo, para qualquer coisa que precise emitir mais de 128.000 tokens em uma única resposta e para qualquer coisa que tenha de ser executada dentro do seu próprio perímetro. Adote o GPT-6 Sol para as solicitações cuja resposta é o produto, para loops agênticos com uso intenso de ferramentas, em que as pontuações de tau-banking e Terminal-Bench 4.0 do M3 são um alerta, e não uma nota de rodapé, e para qualquer coisa em que uma diferença de 18 pontos no índice valha, para você, oito vezes a taxa de saída. Adote os dois e deixe um roteador decidir, se nenhuma dessas opções descrever todo o seu tráfego.
Uma coisa a verificar antes de qualquer um deles, e é o mesmo ponto de verificação com que este blog continua a esbarrar: o M3 tem sido o carro-chefe da linha M-series desde maio de 2026 e continua a ser o modelo M-series mais recente no nosso catálogo, por isso é genuinamente atual — mas o GPT-6 Sol já foi substituído pelo GPT-6.1 Sol com as mesmas tarifas de contexto curto e entrada em cache mais barata, e a própria página do GPT-6 Sol inclui um link para ele. Se o motivo pelo qual você está considerando o Sol aqui é a capacidade, e não a integração de oito dias, considere o sucessor primeiro.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
