Cartão de título de destaque para Claude Opus 5.5 vs GPT-5.6 Sol, com o cabeçalho "Duas tabelas de lançamento que mal se sobrepõem", com selos indicando $4.00 vs $5.00, 66.4% vs 37.3%, e data de corte Jun vs Fev, além do logotipo do OrcaRouter no canto inferior direito.
Guides & Insights

Claude Opus 5.5 vs GPT-5.6 Sol: Duas Tabelas de Lançamento Que Mal se Sobrepõem

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque o Claude Opus 5.5 e o GPT-5.6 Sol lado a lado esta semana e a primeira coisa que você percebe não é um vencedor. É que os dois fornecedores publicaram tabelas de benchmark que quase não compartilham uma única linha. O material de lançamento do Claude Opus 5.5, lançado em 22 de setembro de 2026, o coloca 29 pontos à frente do GPT-5.6 Sol no Terminal-Bench 4.0. O material de lançamento do Sol, disponível em geral desde 9 de julho de 2026, lidera, em vez disso, com o Terminal-Bench 2.1, no qual o Sol Ultra marcou 91,9%, e o Artificial Analysis Coding Agent Index, no qual ficou em primeiro lugar com 80. Ambas as tabelas são reais. Ambas foram executadas pelo fornecedor que vence nelas. A pergunta útil não é qual modelo é melhor em abstrato — é qual benchmark, executado sob o harness de quem, diz algo sobre a sua carga de trabalho. Essa é uma pergunta mais difícil do que qualquer post de lançamento quer que você faça, e é aquela em torno da qual esta comparação foi construída.

Os dois modelos, lado a lado

A two-column scoreboard for Claude Opus 5.5 and GPT-5.6 Sol. Left column: price $4.00 / $20.00, 1M-token context, knowledge cutoff June 2026, Terminal-Bench 4.0 66.4%, FrontierCode v1.1 54.4%, GDPval-AA 1846 Elo. Right column: price $5.00 / $30.00, 1M-token context, knowledge cutoff February 16 2026, Terminal-Bench 2.1 91.9% Ultra, FrontierCode v1.1 47.5%, GDPval-AA 1588 Elo. A sourcing footer notes the Opus rows are vendor-reported by Anthropic and the Sol rows come from OpenAI's launch material.

• Fornecedor — Anthropic vs OpenAI

• Lançado — Claude Opus 5.5 em 22 de setembro de 2026 vs GPT-5.6 Sol em 9 de julho de 2026

• Preço por milhão de tokens — $4,00 de entrada / $20,00 de saída vs. $5,00 de entrada / $30,00 de saída

• Leitura de cache — US$ 0,20 por milhão no Opus 5.5; a taxa de cache do Sol é definida por plataforma e não é publicada como um valor único comparável.

• Janela de contexto — 1M tokens em ambos

• Saída máxima — 128K tokens em ambos, com 300K na Batch API da Anthropic por trás de um cabeçalho beta

• Data de corte de conhecimento — junho de 2026 para o Opus 5.5 vs. 16 de fevereiro de 2026 para o Sol

• Controle de raciocínio — pensamento adaptativo sempre ativado, padrão de médio esforço, a escala vai de baixo a máximo vs. uma configuração de esforço máximo de raciocínio, além de um modo Ultra que coordena subagentes paralelos

• Linha — Opus 5.5 é o primeiro de uma família 5.5, com Sonnet 5.5 e Haiku 5.5 prometidos para as próximas semanas, em comparação com Sol, que é o carro-chefe de uma família de três níveis ao lado de Terra e Luna

Duas dessas linhas fazem mais trabalho que as demais. A diferença de data de corte de conhecimento é de quatro meses, o que importa se seus prompts tocarem em algo que aconteceu nesta primavera. E o Opus 5.5 agora cobra menos que o Sol tanto no preço de entrada quanto no de saída — uma reviravolta em relação a três meses atrás, quando o Sol era a forma mais barata de obter resultados de nível frontier e o Claude Opus 5 estava em $5/$25.

As únicas linhas em que ambos os modelos realmente aparecem

Há exatamente uma tabela publicada que contém ambos os modelos, e é da Anthropic. Todos os números nela são informados pelo fornecedor, produzidos pela empresa que vende um dos dois modelos:

• Terminal-Bench 4.0 — Claude Opus 5.5 66,4% vs GPT-5.6 Sol 37,3%

• Terminal-Bench-Science 0.1 — 58,7% vs 22,4%

• FrontierCode v1.1 (Principal) — 54,4% vs 47,5%

• CursorBench 4.0 — 57,8% vs 41,7%

• AutomationBench — 40,0% vs 28,8%

• GDPval-AA v2.1 — 1846 Elo vs 1588

Isso é uma vitória completa, e as margens nas duas linhas do Terminal-Bench são grandes o suficiente para merecerem escrutínio em vez de aceitação. A própria nota de rodapé da Anthropic faz um pouco desse trabalho por você: a execução do Opus 5.5 no Terminal-Bench usou esforço xhigh em vez do padrão e, no esforço médio padrão, a vantagem do FrontierCode cai para 54,6% contra 47,5% — uma diferença de sete pontos em vez dos números de manchete. A Anthropic também acrescenta uma ressalva geral à tabela inteira, dizendo que, nesse nível de capacidade, as margens de benchmark são "um guia menos confiável para diferenças do mundo real" e que sua lacuna interna em relação ao Claude Fable 5.1 é menor do que as pontuações sugerem. Um fornecedor que relativiza a própria tabela é a frase mais confiável nela.

Note também o que está faltando nessa tabela: qualquer benchmark em que o modelo da OpenAI vence. Uma tabela de fornecedor que contém apenas linhas favoráveis não é evidência de um domínio total; é evidência de seleção de linhas.

O que os próprios números da OpenAI dizem

O material de lançamento do Sol conta uma história diferente, com benchmarks diferentes, em um harness diferente. Segundo o que foi divulgado em seu lançamento, em julho:

• Terminal-Bench 2.1 — 91,9% para o Sol Ultra e 88,8% para o Sol padrão, contra 88,0% do Claude Mythos 5 e 84,3% do Claude Fable 5

• Artificial Analysis Coding Agent Index — 80, descrito na época como o estado da arte, 2,8 pontos acima do Claude Fable 5

• Agents' Last Exam, fluxos de trabalho profissionais de longa duração — 53,6, que a OpenAI reportou como 13,1 pontos à frente do Claude Fable 5

• BrowseComp — 92,2%; OSWorld 2.0 — 62,6%; SWE-Bench Pro — 64,6%

Nenhuma dessas linhas inclui o Claude Opus 5.5, porque ele não existia em julho. A tabela da Sol foi montada para superar o Fable 5 e o Mythos 5, e consegue. Se ela supera o Opus 5.5 é algo simplesmente não respondido pelo material de nenhum dos dois fornecedores — as duas tabelas foram montadas com dois meses de diferença e contra adversários diferentes.

A linha do SWE-Bench Pro merece uma nota específica, porque é o único ponto em que o material de lançamento da OpenAI mostra seu modelo perdendo: 64,6% para o Sol contra 80% para o Claude Fable 5. A OpenAI respondeu questionando a validade do benchmark, estimando que cerca de 30% de suas tarefas estão quebradas. Isso pode muito bem ser verdade. É também um lembrete útil de que "este benchmark é falho" é uma alegação que ambos os laboratórios fazem, e sempre sobre o benchmark em que perdem.

O problema do harness, que a tabela de ninguém resolve

Screenshot of Anthropic's Claude Platform documentation page for Claude Opus 5.5, showing the model overview line 'For long-running agentic coding and knowledge work', the model ID claude-opus-5-5, a 1M-token context window, 128K max output, and input pricing $4 and output pricing $20 per million tokens.

A razão pela qual as duas tabelas não se conciliam não é que um fornecedor esteja mentindo. É que benchmarks de codificação agêntica medem um modelo mais um scaffold, e os scaffolds diferem. Terminal-Bench 4.0 e Terminal-Bench 2.1 são revisões diferentes da mesma ideia, executadas por pessoas diferentes, com orçamentos de ferramentas diferentes e regras de nova tentativa diferentes. Os números do Opus 5.5 da Anthropic foram produzidos no harness da Anthropic; os números do Sol da OpenAI, em ferramentas no estilo Codex. Mova qualquer um dos modelos para o harness do outro e as pontuações mudam.

Dados independentes, onde existem, descrevem uma disputa mais acirrada do que qualquer uma das duas tabelas. Um benchmark de agente de terceiros de agosto de 2026, executado em vários modelos em trabalho de aplicação real, nomeou o GPT-5.6 Sol como a melhor combinação de precisão, custo e velocidade — cerca de US$ 0,52 e cinco minutos por execução — enquanto o Claude Opus 5, e não o 5.5, foi o mais preciso, em 92% das execuções. Um ranking separado que abrange tarefas de código empresarial colocou o Claude Opus 5 em primeiro lugar, com 96,4%, e o GPT-5.6 Sol em terceiro, com 86,5%, comparando novamente o Sol com o Opus anterior, e não com o novo. Nenhum dos dois é um confronto direto com o Opus 5.5, e nenhum dos dois resolve nada. O que eles estabelecem é que, quando alguém que não é um fornecedor faz a comparação, as margens ficam pequenas.

A conclusão prática é parar de ler as tabelas como uma classificação e começar a lê-las como uma lista de hipóteses. Se o seu trabalho é automação de terminal de longo horizonte, a diferença da Anthropic no Terminal-Bench é uma hipótese que vale a pena testar nas suas próprias tarefas. Se for pesquisa profissional de várias etapas, o resultado do Agents' Last Exam da Sol é o mesmo tipo de hipótese. Nenhum dos números se transfere para a sua carga de trabalho sem uma execução.

Custo por tarefa concluída, que é o único custo que importa

Na tabela de preços, o Claude Opus 5.5 agora está mais barato nas duas direções: $4.00 contra $5.00 na entrada, $20.00 contra $30.00 na saída, e uma taxa de leitura de cache de $0.20, 60% abaixo do que o Claude Opus 5 cobrava. Para um agente que reenvia um prompt de sistema longo a cada turno, essa linha de cache é o custo dominante e a razão pela qual uma sessão de longa duração pode ficar substancialmente mais barata sem nenhuma alteração no prompt.

Mas o preço por token nunca decidiu a fatura de um agente. O argumento da OpenAI para o Sol no lançamento baseou-se na eficiência de tokens, e não no preço de tabela — ela relatou uma melhoria de 54% na eficiência de tokens em codificação, com tokens de saída e tempo decorrido inferiores à metade dos de Claude Fable 5, a um custo cerca de um terço menor. A Anthropic apresenta o argumento espelhado para o Opus 5.5: um custo cerca de 40% menor para rodar em cargas de trabalho típicas do que o Claude Opus 5, em uma tabela de preços que caiu apenas 20%, com declarações de clientes da Box, Kiro, Factory e GitHub citando todas grandes reduções em tokens ou etapas. Ambas as alegações apontam para o mesmo lado — vence o modelo que termina em menos turnos — e nenhuma delas é auditada de forma independente.

Onde existe matemática independente de custo por tarefa, ela atualmente favorece o Sol: uma análise publicada em setembro colocou o GPT-5.6 Sol a US$ 1,56 por problema resolvido no SWE-bench Verified, com 96,2% de sucesso, contra o Claude Opus 4.8, com 88,6%. Isso é o Sol medido contra um modelo mais antigo da Anthropic, não contra o Opus 5.5, então é um ponto de partida e não um veredito — mas é um lembrete de que um modelo que resolve o problema na primeira tentativa é mais barato do que um modelo mais barato que precisa de três passagens. A única medição que resolve isso para você é a sua própria tarefa, executada das duas formas, com as contagens de tokens à sua frente.

Isso é mais um problema de roteamento do que de compras, e vale a pena ser preciso sobre qual lado disso já é solucionável. O GPT-5.6 Sol está no OrcaRouter hoje pelo preço de tabela da própria OpenAI com 0% de markup — o preço de tabela do provedor repassado diretamente, então uma mudança de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de depois de uma sincronização. O Claude Opus 5.5 ainda não é uma das nossas rotas; ele está disponível pela API própria da Anthropic e pelas principais nuvens. Assim que ele chegar, a mesma chave atende aos dois, e é isso que transforma o experimento em uma regra de roteamento em vez de um segundo contrato e um segundo SDK: envie a carga de trabalho para o modelo que seus próprios números favorecerem, mantenha o failover automático apontado para o outro, e deixe uma linha de DSL de roteamento decidir a cada requisição em vez de a cada trimestre. Um corte de preço de qualquer um dos lados é uma mudança de configuração, não uma migração.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol), showing the model header, the Vision, Tools, JSON and Reasoning capability tags, and the attribution 'by OpenAI - 2026-07-09'.

Onde os dois genuinamente diferem

Retire os benchmarks e restam quatro diferenças, todas verificáveis:

• Data de corte de conhecimento. Junho de 2026 para o Opus 5.5, em comparação com 16 de fevereiro de 2026 para o Sol. Quatro meses são uma lacuna real para qualquer coisa que envolva bibliotecas recentes, eventos recentes ou APIs alteradas recentemente, e nenhum benchmark captura isso.

• Roteamento de salvaguarda. Opus 5.5 vem com salvaguardas da classe Fable 5.1: a maioria das solicitações de segurança cibernética é redirecionada para Claude Opus 4.8 e o trabalho de biologia recorre ao Claude Opus 5, a menos que a conta seja verificada. Se o seu produto estiver em qualquer um dos domínios, parte do seu tráfego está sendo respondida por um modelo menor. Sol não possui roteamento documentado equivalente, embora a OpenAI mencione suas próprias avaliações de segurança relacionadas a cibersegurança.

• Orquestração. O Sol oferece um modo Ultra que coordena vários subagentes paralelos, quatro por padrão, e uma configuração de esforço máximo de raciocínio. O Opus 5.5 não tem nenhum dos dois como recurso de plataforma; sua alavanca é o parâmetro effort, e a composição multimodelo é algo que você constrói ou roteia, em vez de algo que o fornecedor entrega a você.

• Economia da família. Sol é um de três níveis, com Terra e Luna abaixo dele — e o preço de Luna foi cortado em 80% e o de Terra em 20% em uma atualização de 30 de julho. Os irmãos mais baratos da Anthropic, Sonnet 5.5 e Haiku 5.5, foram anunciados, mas ainda não foram lançados. Se sua carga de trabalho for mista, a OpenAI atualmente oferece as opções mais baratas hoje.

Escolhendo entre eles

Escolha o Claude Opus 5.5 se o seu trabalho for codificação agêntica ou trabalho de conhecimento de longa duração, se o preço por token importar, se os seus prompts abordarem algo dos últimos quatro meses, ou se um contexto de 1M de tokens a $0,20 por milhão em cache for o que torna a sua arquitetura acessível. Comece com médio esforço, não a configuração alta herdada, e avalie se o baixo se sustenta.

Escolha o GPT-5.6 Sol se você quiser um modo de orquestração empacotado pelo fornecedor, se precisar de um nível mais barato abaixo do carro-chefe hoje em vez de daqui a algumas semanas, ou se sua carga de trabalho for do tipo que as próprias evidências de lançamento do Sol cobrem melhor — fluxos de trabalho profissionais de longo prazo e uso de computador, onde ele relatou seus resultados mais fortes.

Se você já usa o Claude Opus 5, observe que o Opus 5.5 não é uma substituição direta: o pensamento não pode mais ser desativado, o uso forçado de ferramentas retorna um erro, os blocos de pensamento ficam vinculados ao modelo e à conversa, e a antiga computer_20251124 ferramenta de uso do computador não é aceita na API Claude nem no Google Cloud. As três primeiras também se aplicam ao Claude Fable 5.1. Mudar para o Sol é uma integração totalmente diferente.

O que realmente resolveria esta comparação seria uma única execução independente de ambos os modelos com esforço equivalente, num harness equivalente, no mesmo conjunto de tarefas. Até esta semana, ninguém publicou uma. Até que alguém o faça, a posição honesta é a que as evidências sustentam: a tabela da Anthropic favorece o Opus 5.5 e foi produzida pela Anthropic; a tabela da OpenAI favorece o Sol e foi produzida pela OpenAI; os resultados independentes que existem comparam o Sol com o Opus anterior e descrevem uma corrida muito mais acirrada; e as duas linhas que vão decidir a sua fatura — tokens por tarefa concluída e volume de leitura de cache — são as duas linhas que nenhum dos fornecedores publica.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente