
GPT-6 Sol Pro vs Claude Opus 5: A escada de esforço que ninguém coloca na tabela
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
GPT-6 Sol Pro e Claude Opus 5 são comparados constantemente, e quase sempre na configuração errada. A comparação que circula é Claude Opus 5 em seu esforço de raciocínio máximo contra GPT-6 Sol Pro em seu esforço de raciocínio máximo, o que produz uma diferença de três pontos no índice neutro e uma diferença de custo cinco vezes maior. Coloque ambos os modelos na configuração que seus próprios fornecedores enviam como padrão — e lembre-se de que "Pro" no primeiro nome é uma configuração de raciocínio, não um modelo separado — e a diferença de três pontos desaparece completamente. O que resta é a diferença de custo, e é a única parte da história que sobrevive ao contato com uma fatura de produção.
Isto não é um truque de apresentação. É a consequência direta de duas escalas de esforço que não estão calibradas entre si, publicadas por dois fornecedores que usam como referência os modelos mais antigos um do outro.
O que os dois modelos realmente são, antes de qualquer comparação
O GPT-6 Sol é o modelo de raciocínio de nível intermediário da OpenAI, com disponibilidade geral desde 22 de setembro de 2026, a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. Não há um identificador de modelo gpt-6-sol-pro na documentação para desenvolvedores da OpenAI — a página lista uma única entrada Sol, uma janela de contexto de 1.050.000 tokens, um máximo de entrada de 922.000 tokens, um limite de saída de 128.000 tokens, uma data de corte de conhecimento de 20 de abril de 2026 e uma escala de esforço de raciocínio com none, low, medium, high, xhigh e max, sendo medium o padrão. "Pro" é um valor do modo de raciocínio, o mesmo padrão de alias que a geração GPT-5.6 estabeleceu e que esta herdou. Existe uma entrada de catálogo de terceiros chamada GPT-5.6 Sol Pro, e ela agora indica US$ 2,00 e US$ 10,00 — os números do GPT-6 Sol —, o que é um artefato de nomenclatura, não um produto.
O Claude Opus 5 é um modelo real da Anthropic, com preço separado, disponível de forma geral desde 24 de julho de 2026 a US$ 5,00 de entrada e US$ 25,00 de saída por milhão de tokens. Sua janela de contexto é de 1.000.000 de tokens, seu limite de saída síncrona é de 128.000 e sua própria escala de esforço — output_config.effort — vai de low, medium, high, xhigh e max, com high como padrão. O raciocínio é adaptativo e ativado por padrão, algo inédito na família Opus.
Mais um fato que molda tudo abaixo, e que nenhuma página de comparação existente traz: a própria tabela de ciclo de vida da Anthropic lista o Claude Opus 5 como Ativo (legado), com um banner de migração apontando para o Claude Opus 5.5, que alcançou disponibilidade geral em 22 de setembro de 2026 a US$ 4,00 e US$ 20,00. Os gráficos de lançamento da OpenAI ainda usam o Opus 5 como referência, e não o 5.5. O modelo na comparação é o Opus da geração anterior.
As duas linhas de preço, linha por linha
Ambas são listas de fornecedores — os próprios números publicados da OpenAI e da Anthropic, repassados sem alteração pelas plataformas que os hospedam.
• Entrada — GPT-6 Sol $2,00 por milhão de tokens vs. Claude Opus 5 $5,00 por milhão de tokens
• Saída — GPT-6 Sol $10.00 por milhão de tokens vs Claude Opus 5 $25.00 por milhão de tokens
• Leitura de cache — GPT-6 Sol US$ 0,20 por milhão de tokens vs. Claude Opus 5 US$ 0,50 por milhão de tokens; ambos são 10% fixos da tarifa de entrada sem cache
• Gravação de cache — GPT-6 Sol US$ 2,50 por milhão de tokens com um único TTL vs Claude Opus 5 US$ 6,25 com um TTL de cinco minutos e US$ 10,00 com um TTL de uma hora; o TTL mais longo é uma opção que a OpenAI não oferece, e é o nível que a maioria das tabelas de comparação cita por engano, porque é o que aparece nos cartões do catálogo hospedado
• Tratamento de contexto longo — GPT-6 Sol reajusta o preço de uma solicitação acima de seu limite de entrada a uma taxa mais alta para toda a solicitação; Claude Opus 5 não aplica nenhuma sobretaxa de contexto longo, então uma solicitação de 900.000 tokens é cobrada à mesma taxa por token que uma de 9.000 tokens
• Lote — O GPT-6 Sol tem um endpoint de lote com desconto padrão, em comparação com a Message Batches API do Claude Opus 5, com 50% de desconto nos dois sentidos, e o desconto de lote da Anthropic se acumula com o cache de prompt
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Claude Opus 5 1.000.000 tokens
• Saída máxima — 128.000 tokens para ambos, com o Claude Opus 5 elevando isso para 300.000 na API Message Batches sob o cabeçalho beta output-300k-2026-03-24
A pilha de lote mais cache é a linha menos discutida desta lista e a que mais altera a aritmética. Um desconto de lote de 50% que se combina com uma leitura de cache a um décimo da tarifa de entrada é uma oferta diferente de um desconto de lote de 50% sozinho e, para trabalhos longos de síntese — em que também se aplica o teto de saída em lote de 300.000 tokens da Anthropic —, ela fecha uma parte significativa de uma lacuna que parece intransponível no preço de tabela.

A escada de esforço é a comparação real
Aqui está o número que deveria estar em cada um destes artigos. No Artificial Analysis, cuja estrutura de avaliação é a única neutra que publica uma escada completa de esforço para ambos os modelos, o Claude Opus 5 pontua 51 no esforço máximo e custa US$ 5,86 por tarefa de índice. Na sua configuração alta padrão, pontua 48 e custa US$ 3,61. O GPT-6 Sol pontua 48 no esforço máximo e custa US$ 1,06 — e 43 no esforço alto por US$ 0,37.
Leia essas duas linhas em conjunto. O Claude Opus 5, rodando na configuração de esforço que a Anthropic entrega como padrão, alcança exatamente a mesma pontuação de índice que o GPT-6 Sol rodando a todo vapor. A diferença que a cobertura de lançamento noticiou — três pontos — só existe se você comparar cada modelo no máximo de seu próprio dial, e o máximo do dial não é onde qualquer um dos modelos roda por padrão. A vantagem do Opus 5 no esforço máximo é real, e obtê-la custa aproximadamente cinco vezes e meia mais por tarefa concluída.
Duas ressalvas de honestidade deveriam acompanhar esses números, e ambas estão ausentes das páginas que os citam.
• A versão do índice muda. A pontuação do Opus 5 foi publicada como 61, 63, 54 e 51 ao longo de sucessivas revisões do índice Artificial Analysis desde julho. Nenhum desses valores está errado; cada um deles está errado sem o rótulo da sua versão. O 51 acima é o placar atual, e não é comparável a um 61 citado de um artigo do dia do lançamento.
• Os níveis de esforço não são calibrados entre fornecedores. Um "alto" em um modelo não é a mesma quantidade de raciocínio que um "alto" no outro. Pontuações correspondentes em configurações nominalmente diferentes são evidência sobre custo, não sobre equivalência de capacidade.
Onde o registro independente é mais tênue do que parece
O Claude Opus 5 tem oito semanas de medição por terceiros por trás de si e um conjunto de números de lançamento relatados pelo fornecedor que estão claramente identificados como tal — Frontier-Bench v0.1 em 43,3%, ARC-AGI-3 em 30,2%, GDPval-AA v2 em 1.861 Elo. Cada um deles foi medido em comparação com o GPT-5.6 Sol ou o Claude Fable 5, e não com o GPT-6 Sol. Não existe em lugar nenhum um resultado de harness compartilhado que coloque o Opus 5 e o GPT-6 Sol frente a frente nos próprios benchmarks da Anthropic, e o system card da Anthropic admite que o modelo não é, no geral, mais capaz do que o Claude Fable 5.
O registro independente também traz uma ressalva na direção oposta. Na avaliação AA-Omniscience da Artificial Analysis, a taxa de alucinação do Opus 5 é de 50%, quatorze pontos acima da do Opus 4.8 — a causa documentada é que as recusas caíram de cerca de 23% para 7%, de modo que o modelo responde a mais perguntas e erra em mais delas. A Vals AI divulgou separadamente que o Opus 5 e o Fable 5 usaram o Opus 4.8 como fallback de recusa durante execuções do Terminal-Bench; reclassificar as nove aprovações afetadas como falhas faz o Opus 5 passar de 84,64% para 81,27%. Essas não são constatações desqualificadoras, mas um artigo que argumenta que o Opus 5 é a escolha mais confiável precisa trazê-las anexadas.

O histórico independente do GPT-6 Sol é, esta semana, do tamanho de um único número: a pontuação do índice acima, medida no esforço máximo, com dezoito meses de lançamentos de modelos por trás dela em testes acumulados de terceiros. Essa assimetria — oito semanas de escrutínio contra um dia — é a razão honesta pela qual um comprador ainda pode pagar o prêmio de cinco vezes, e é uma razão melhor do que a manchete de três pontos.
Onde uma camada de roteamento altera a decisão
O Claude Opus 5 está no catálogo da OrcaRouter a $5,00 de entrada, $25,00 de saída, $0,50 de leitura de cache e $10,00 de gravação de cache por milhão de tokens, com uma janela de 1.000.000 de tokens, um limite de saída de 128.000 tokens e ambos os endpoints /v1/chat/completions e /v1/messages — preços de tabela do provedor repassados sem nenhuma margem adicional, de modo que uma mudança de preço da Anthropic entra em vigor do nosso lado no mesmo dia em que entra em vigor do lado deles. O valor de gravação de cache no cartão do modelo é a tarifa de TTL de uma hora; o nível de cinco minutos da Anthropic é $6,25, e citar um sem dizer qual é exatamente como os dois números acabam parecendo uma contradição.
O GPT-6 Sol não é uma das nossas rotas, portanto nada aqui é uma afirmação sobre o seu preço através de nós.

O que um único endpoint realmente oferece nesta disputa é a capacidade de sustentar ambas as respostas ao mesmo tempo. O argumento a favor do Opus 5 e o argumento a favor do Sol dependem ambos do esforço, e o esforço é um parâmetro por requisição, não um contrato. Uma equipe que roteia ambos os modelos por trás de uma única chave com failover automático pode enviar o trabalho que precisa do teto de esforço máximo do Opus 5 para o Opus 5 e a camada de volume para o Sol em esforço médio, sem uma segunda integração nem um segundo conjunto de limites de taxa. A DSL de roteamento compõe essa decisão na própria chamada, em vez de em um projeto de migração — o que importa aqui especificamente, porque a resposta correta para este par muda a cada requisição, não a cada trimestre.
A regra de decisão
Trabalho em volume com um padrão de qualidade conhecido — GPT-6 Sol em esforço médio ou alto. Quarenta pontos de índice a $0,25 por tarefa é a linha credível mais barata deste quadro, e o controle de esforço é um parâmetro documentado, não um palpite.
• Trabalho que exige o topo da faixa de capacidade e pode pagar por isso — Claude Opus 5 em xhigh ou max. Três pontos de índice acima do teto do Sol, de US$ 4,88 a US$ 5,86 por tarefa, e o único dos dois com um teto de saída em lote de 300.000 tokens.
• Tarefas em lote de grande corpus — Claude Opus 5, pelo argumento estrutural e não pelo argumento por token. Sem sobretaxa de contexto longo, um desconto de lote que se acumula com o cache, e um TTL de cache de uma hora para prefixos que duram mais que uma janela de cinco minutos.
• Qualquer coisa em que uma resposta errada sai caro — nenhum dos dois, no registro atual. A taxa de alucinação do Opus 5 subiu quatorze pontos neste lançamento, e o histórico de terceiros do Sol se resume a um único número.
• Se a comparação que lhe foi mostrada foi "Opus 5 max versus Sol max" — execute-a novamente com o esforço padrão antes de decidir. É aí que a decisão realmente é tomada, e é a única configuração que a cobertura existente nunca lhe mostra.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
