Cartão hero intitulado Claude Sonnet 5.5 vs GPT-6 Sol, com o subtítulo de que o nível de $2 agora tem dois flagships, com pílulas lendo mesmo preço: $2 / $10, Índice 56 vs 47, e contexto de 1M vs 1,05M, e um rodapé citando Artificial Analysis v4.3.2 e preços de fornecedores.
Guides & Insights

Claude Sonnet 5.5 vs GPT-6 Sol: o nível de US$ 2 agora tem dois carros-chefe

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Claude Sonnet 5.5 e GPT-6 Sol têm exatamente o mesmo preço — US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de tokens de saída — e chegaram com seis dias de diferença no final de setembro de 2026. Essa coincidência não é a parte interessante. A parte interessante é que, quando a Artificial Analysis avaliou ambos no seu Índice de Inteligência v4.3.2, o modelo de nível intermediário da Anthro​pic ficou à frente do modelo que a Open​AI vem vendendo como seu carro-chefe: 56 para o Claude Sonnet 5.5 contra 47 para o GPT-6 Sol. Na mesma revisão, o Claude Sonnet 5 — o modelo que o Sonnet 5.5 substitui — está em 38.

Portanto, isto já não é uma comparação de um escalão barato contra um escalão caro. É uma comparação de dois modelos ao mesmo preço, de dois laboratórios, com uma diferença de 18 pontos entre o da Anthro​pic e o seu próprio antecessor, e uma diferença de nove pontos a favor da Anthro​pic face ao lançamento de topo da Open​AI. Tudo o que se segue é uma tentativa de perceber quais dessas lacunas sobrevivem ao contacto com uma carga de trabalho real e quais são um artefacto de benchmark.

O que cada modelo realmente é

O Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic, lançado em 28 de setembro de 2026, cinco dias após o lançamento do Claude Opus 5.5 que o havia prometido. Ele carrega o id claude-sonnet-5-5 na Claude API, Amazon Bedrock, Google Cloud e Microsoft Foundry, mantém a janela de contexto de 1M de tokens e o teto de saída de 128K da categoria, e mantém exatamente os preços do Claude Sonnet 5: US$ 2 de entrada, US$ 10 de saída, US$ 0,20 por milhão para leituras de cache, US$ 2,50 para uma escrita de cache de cinco minutos. Ele está disponível com retenção zero de dados desde o primeiro dia, e o compromisso de descontinuação da Anthropic vai até 28 de setembro de 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

O GPT-6 Sol é o sucessor do modelo, chamado de forma confusa, GPT-5.6 Sol — aquele que a OrcaRouter ainda lista como disponível a $4 de entrada e $20 de saída, e que a Artificial Analysis marcou entretanto como obsoleto, com uma indicação para o GPT-6 Sol. O novo modelo foi lançado a 22 de setembro de 2026 a $2 / $10, com uma janela de contexto de 1.050.000 tokens, um limite de saída de 128K e uma tarifa escalonada: o valor principal de $2 / $10 aplica-se até 272.000 tokens de entrada, e tudo acima disso é cobrado a $4 / $15.

Esse último detalhe é o primeiro ponto em que o enquadramento de "preços idênticos" se rompe.

O empate de preço só é verdadeiro para prompts curtos.

Ambas as tabelas de preços indicam $2 e $10, e quase todas as comparações no dia do lançamento ficaram por aí. Coloque as duas lado a lado quanto aos termos que decidem a fatura:

• Preço anunciado — Claude Sonnet 5.5 $2 / $10 vs. GPT-6 Sol $2 / $10

• Tarifa de contexto longo — o Sonnet 5.5 cobra a janela completa de 1M pela tarifa padrão; o GPT-6 Sol dobra para US$ 4 / US$ 15 acima de 272.000 tokens de entrada

• Janela de contexto — 1.000.000 tokens vs 1.050.000 tokens

• Saída máxima — 128K tokens na API síncrona para ambos; o Sonnet 5.5 atinge 300K na Message Batches API por trás do output-300k-2026-03-24cabeçalho

• Desconto para lotes — 50% de desconto na entrada e na saída para o Sonnet 5.5; verifique os termos atuais da OpenAI para o Sol em vez de presumir paridade

• Leituras de cache — US$ 0,20 por milhão em ambos

Uma varredura de repositório de 800.000 tokens custa o dobro por token no GPT-6 Sol do que no Claude Sonnet 5.5, e esse é exatamente o tipo de carga de trabalho para o qual ambos os modelos são comercializados. Se seus prompts forem curtos, as tabelas de preços realmente empatam e o preço não deveria decidir nada. Se forem longos, ele já decidiu.

O placar da própria Anthropic, lido com atenção

A Anthropic publicou uma comparação de quatro colunas com o Claude Sonnet 5, o Claude Opus 5.5 e o GPT-6 Sol. Os números divulgados pelo fornecedor, que nenhum terceiro ainda reproduziu:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — Sonnet 5.5 70,6% vs Sonnet 5 10,3%

• FrontierCode 1.1, Principal — Sonnet 5.5 46,2% com esforço máximo, Sonnet 5 42,4%, Opus 5.5 54,4%, GPT-6 Sol 49,3%

• CursorBench 4.0 — Sonnet 5.5 55,5% vs Sonnet 5 34,1% vs Opus 5.5 57,8%

• GDPval-AA v2.1 — Sonnet 5.5 1844 vs Sonnet 5 1449 vs Opus 5.5 1846 vs GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 vs. Sonnet 5 1359 vs. Opus 5.5 1822 vs. GPT-6 Sol 1483

• Humanity's Last Exam, com ferramentas — Sonnet 5.5 64,5% vs Sonnet 5 54,9% vs Opus 5.5 67,7%

• OSWorld 2.1, parcial — Sonnet 5.5 80,1% vs Sonnet 5 57,0% vs Opus 5.5 81,8%

• Cartografia, sem ferramentas — Sonnet 5.5 61,6% vs Sonnet 5 15,6% vs Opus 5.5 64,4% vs GPT-6 Sol 53,6%

Duas dessas linhas trazem notas de rodapé, e ambas importam. Os números de GDPval-AA, AA-Briefcase e Chartography para o GPT-6 Sol são sinalizados pela Anthropic como medidos após uma correção de compreensão de imagens do lado da OpenAI, e o número do FrontierCode para o Sonnet 5.5 é seu resultado em Max-effort, que, conforme observa a Anthropic, ficou abaixo de seu próprio resultado Xhigh na mesma avaliação. Um fornecedor que se compara a um concorrente em um benchmark que ele mesmo executa, com notas de rodapé qualificando ambos os lados, não é evidência neutra. É a melhor evidência disponível no dia do lançamento, e não é a mesma coisa que medição.

O que os números independentes dizem, e o que eles não dizem

A Artificial Analysis publicou uma primeira execução independente: Index 56 na v4.3.2, custo de US$ 7,60 por tarefa do Index e um valor de verbosidade de 410M tokens de saída contra uma mediana de 88M. Esse número de verbosidade merece mais atenção do que está recebendo. Isso significa que o modelo tende a gastar uma grande quantidade de tokens no caminho até uma resposta, e é o mecanismo por trás da única alegação de eficiência que não vem da própria tabela da Anthropic.

A Anthropic afirma que o Claude Sonnet 5.5 gera saída 30% mais rápido que o Claude Sonnet 5 e custa "até 30% menos por tarefa" à mesma taxa por token. Essas duas afirmações juntas descrevem um modelo que faz o mesmo trabalho com menos tokens, não uma tabela de preços mais barata. Se isso se sustenta é exatamente para o que serve uma leitura de verbosidade de 410M tokens, e uma execução independente não basta para resolver a questão — mas basta para dizer que a frase de marketing e a contagem de tokens medida apontam em direções opostas, e a medida é a que aparece numa fatura.

Observe também o que o índice independente ainda não contém. Não há nenhuma replicação publicada de OSWorld, Terminal-Bench ou CursorBench feita por outra pessoa que não a Anthropic. E o 56 é um composto: ele não diz nada sobre qual das dez avaliações dentro dele gerou a diferença para o 47 do Sol. Uma vantagem composta de nove pontos pode esconder uma perda de quinze pontos na única avaliação da qual sua carga de trabalho depende.

Onde eles divergem de maneiras que uma tabela de preços não consegue mostrar

Preço e pontuação de índice são os dois eixos fáceis. Os que decidem uma migração são os comportamentais, e aqui os dois modelos não estão próximos.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

O Claude Sonnet 5.5 executa o pensamento adaptativo por padrão com alto como o esforço padrão, e remove três coisas que a geração anterior permitia: enviar thinking: {"type": "disabled"} agora retorna um 400 e deve ser substituído por between_tools; uso forçado de ferramentas — tool_choice definido como "any" ou uma ferramenta nomeada — retorna um 400 imediatamente; e a mais antiga computer_20251124 ferramenta de uso de computador é rejeitada na Claude API e no Google Cloud em favor de um conjunto de ferramentas. Os blocos de pensamento também agora estão vinculados ao modelo que os produziu, então uma conversa pode passar do Claude Sonnet 5 para o Claude Sonnet 5.5 e manter seu raciocínio, mas não pode voltar a sair com ele.

Se o seu loop de agente define tool_choice: "any" para forçar uma chamada válida em termos de esquema, o Claude Sonnet 5.5 rejeitará o pedido até que mude para auto com uso estrito de ferramentas ou saídas estruturadas. Esta é uma verdadeira tarefa de migração, e é o tipo de coisa que transforma uma simples troca do ID do modelo numa tarde inteira.

O custo de uma troca para o GPT-6 Sol é diferente em natureza, porque o modelo que ele substitui ainda está no catálogo e ainda recebe chamadas. O GPT-5.6 Sol não foi retirado; está marcado como obsoleto no Artificial Analysis, com preço o dobro do novo modelo, e ainda recebe tráfego. As próprias medições do OrcaRouter mostram que ele movimenta cerca de 95 milhões de tokens por semana, o que é um proxy razoável para quantas integrações ainda não migraram. Migrar para o GPT-6 Sol é uma decisão de preço que você pode tomar depois; você não precisa tomá-la agora.

Executando a comparação em uma chave

O problema prático de uma comparação entre dois fornecedores é que ela geralmente custa duas contas, dois caminhos de SDK e dois conjuntos de limites de taxa antes de você descobrir qualquer coisa. O OrcaRouter existe para eliminar isso: um endpoint compatível com OpenAI, mais de 200 modelos, preço de lista do provedor repassado sem markup, e failover automático entre provedores.

Ambos os modelos que importam aqui podem ser roteados nela hoje. O GPT-6 Sol está no catálogo a $2 / $10, com o nível de contexto longo intacto, e o Claude Sonnet 5 — o modelo no qual a maior parte do tráfego da Claude API ainda roda, com 150 tokens de saída por segundo medidos e um tempo p50 de primeiro token de cerca de cinco segundos — está na plataforma desde 30 de junho, pelos $2 / $10 da própria Anthropic.

O próprio Claude Sonnet 5.5 ainda não está no nosso catálogo. Embora isso seja verdade, o caminho honesto para chegar a ele é a própria API do fornecedor e as três nuvens que a Anthropic lista, e a forma honesta de avaliá-lo é apontá-lo para uma fatia de tráfego que você pode se dar ao luxo de perder. É para isso que serve a camada de roteamento: promova uma porcentagem, acompanhe a taxa de falhas e mantenha o modelo anterior como fallback em vez de como plano de rollback.

Qual deles vai para produção?

Escolha pela forma da carga de trabalho, e não pela pontuação composta.

O Claude Sonnet 5.5 é a melhor compra para trabalho com contexto longo, para qualquer coisa já escrita para a superfície de tool-use e computer-use da Anthropic, e para equipes cujos prompts rotineiramente ultrapassam um quarto de milhão de tokens — a janela de taxa fixa vale mais aí do que qualquer delta de índice. Aceite que a migração tem uma lista de verificação anexada: uso forçado de ferramentas, o botão de alternância de pensamento, os emparelhamentos da ferramenta advisor e uma mudança na ferramenta de computer-use.

GPT-6 Sol é a escolha de continuidade mais segura para uma stack no formato OpenAI, e também a mais barata se seus prompts forem curtos e suas integrações já estiverem prontas. Sua vantagem não é a capacidade — no compósito, ele fica atrás —, mas o fato de que seu antecessor ainda está em serviço e a migração não tem prazo.

Com os números disponíveis hoje, o Claude Sonnet 5.5 vence o confronto direto no índice independente e na economia de contexto longo, e não perde em nada que qualquer medição publicada seja ainda capaz de detectar além da confiança da própria tabela do fornecedor. Essa é uma afirmação mais estreita do que a feita no material de lançamento, e é a que vale a pena levar em conta.

O que mudaria a resposta seria uma segunda execução independente nas avaliações agênticas, e um número publicado de tokens por tarefa para ambos os modelos nas mesmas tarefas. Enquanto ambos não existirem, o índice composto é uma vantagem de nove pontos para o modelo mais barato de executar, e uma vantagem composta de nove pontos não é o mesmo que uma vantagem de nove pontos na sua carga de trabalho.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente