
GPT-6 vs Claude Opus 5.5: o modelo que todo mundo acabou de receber, contra o que ainda lidera
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 65 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Em 7 de outubro de 2026, o GPT-6 tornou-se o modelo com o qual mais de 1,2 bilhão de usuários semanais do ChatGPT conversam, e ainda assim não é o modelo com maior pontuação no ranking independente. O GPT-6 Sol — o nível que a OpenAI ativou para ChatGPT Plus, Pro, Business e Enterprise — pontua 47,6 no Intelligence Index v4.3.2 da Artificial Analysis. O Claude Opus 5.5, que a Anthropic lançou em 22 de setembro de 2026 a US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída, pontua 57,6 na mesma revisão. Dez pontos, na única métrica pela qual as equipes de marketing de ambos os fornecedores estão dispostas a serem avaliadas.
Essa lacuna é real e não vou minimizá-la. Mas ela também é o fato menos interessante sobre essa dupla em outubro, porque o que mudou esta semana não é um benchmark. O GPT-6 chegou ao ChatGPT para todos com uma capacidade que a OpenAI chama de Intelligent UI, e o modelo que alimenta os planos pagos desse lançamento é o GPT-6 Sol. Então a comparação útil já não é "qual API é melhor" — é "o que 1,2 bilhão de pessoas que acabaram de receber o GPT-6 realmente ganharam, e se isso é suficiente para que um desenvolvedor ou uma equipe pare de pagar pelo Claude Opus 5.5". As duas respostas diferem, e a diferença não são os dez pontos.
O que realmente mudou em 7 de outubro
Para ser preciso quanto à data, porque isto não é um lançamento: o GPT-6 Sol e o GPT-6 Luna foram disponibilizados a 22 de setembro de 2026 como modelos de API. O GPT-6 Astra, o modelo principal, é anterior a eles — a OpenAI lançou-o a 3 de setembro de 2026. O que aconteceu a 7 de outubro foi que o GPT-6 chegou ao separador Chat do ChatGPT a nível global para Plus, Pro, Business e Enterprise, com os níveis Free e Go a seguir a partir de 8 de outubro; o acesso empresarial ainda depende das definições de um administrador do local de trabalho. É um evento de distribuição, não um lançamento, e a distinção é importante para quem lê a cobertura mais antiga.
A capacidade que lhe está associada é a parte genuinamente nova. A Intelligent UI permite ao GPT-6 compor uma resposta a partir de texto, gráficos, botões clicáveis, formulários e gráficos de dados, escolhidos em função de cada pergunta, e transmitir a interface à medida que o modelo a gera. A própria forma como a OpenAI o enquadra é que uma comparação pode surgir lado a lado, uma explicação como um diagrama interativo e uma resposta em texto simples quando o texto é a resposta certa. Acompanham-no dois resultados internos comunicados pelo fornecedor: em tarefas agênticas quotidianas de elevado valor, o GPT-6 com esforço Extra High começa a responder no mesmo tempo que o GPT-5.6 com esforço Medium, obtendo ainda assim uma pontuação global melhor do que o GPT-5.6 com esforço Extra High; e em perguntas que exigem pesquisa na web, o GPT-6 Instant começa a responder, em média, 44% mais cedo do que o GPT-5.6 Instant. Ambos são números da OpenAI, reproduzidos do seu próprio anúncio, e nenhum deles tem ainda uma reprodução independente.
Duas tabelas de tarifas, e onde os dez pontos são comprados
Nenhum dos modelos mudou seu preço esta semana. Claude Opus 5.5 está a US$ 4,00 de entrada e US$ 20,00 de saída desde 22 de setembro. GPT-6 Sol está a US$ 2,00 e US$ 10,00 desde o mesmo dia. Uma linha por dimensão, com ambos os lados em cada uma:
• Entrada principal — GPT-6 Sol US$ 2,00 por 1M vs Claude Opus 5.5 US$ 4,00; Sol custa metade do preço
• Saída principal — GPT-6 Sol US$ 10,00 por 1M vs Claude Opus 5.5 US$ 20,00; novamente metade
• Cláusula de contexto longo — GPT-6 Sol muda o preço de toda a requisição para US$ 4,00 de entrada e US$ 15,00 de saída acima de 272.000 tokens de entrada; Claude Opus 5.5 não tem etapa comparável em sua janela de 1M
• Entrada em cache — GPT-6 Sol US$ 0,20 por 1M vs Claude Opus 5.5 US$ 0,20; mesmo nível
• Custo para executar a suíte completa do Intelligence Index — Claude Opus 5.5 US$ 5,98 por tarefa vs GPT-6 Sol US$ 1,04, uma diferença de 5,7× paga para obter aqueles dez pontos
• Janela de contexto — GPT-6 Sol 1.050.000 tokens vs Claude Opus 5.5 1.000.000, com um limite de saída de 128.000 tokens em ambos

A quarta linha é a que decide a maioria das implantações reais, e não é a que está na página de marketing. A sobretaxa de contexto longo do GPT-6 Sol é agressiva em relação ao seu próprio preço de destaque: se uma requisição ultrapassar 272.000 tokens de entrada, a requisição inteira é cobrada a US$ 4,00 e US$ 15,00, não apenas o excedente. Para um agente mantendo uma sessão longa com um documento grande no contexto, isso remove silenciosamente a maior parte da vantagem de metade do preço. O Claude Opus 5.5 não tem um escalão equivalente, então uma requisição de 400.000 tokens custa a mesma taxa por token que uma de 4.000 tokens.
Onde os dez pontos ficam, porque não estão distribuídos uniformemente
Um índice composto esconde seus próprios componentes, e este esconde um perfil excepcionalmente irregular. Extraia as avaliações individuais com as quais os números de ambos os fornecedores podem ser comparados:
• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6 Sol 47,9%, uma diferença de 13,5 pontos em raciocínio abstrato
• SciCode — Claude Opus 5.5 66,9% vs GPT-6 Sol 57,6%, uma diferença de 9,3 pontos em código de nível de pesquisa
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% vs GPT-6 Sol 43,9%
• Recordação de contexto longo — Claude Opus 5.5 84,7% vs GPT-6 Sol 83,7%, uma diferença de 1,0 ponto, a mais estreita nesta página
• Uso de ferramentas agênticas em múltiplos turnos — os dois modelos ficam a poucos pontos de distância na família τ²-Bench, em que ambos são fortes

A distribuição é a história inteira. No raciocínio no abstrato — uma questão difícil de exame, um problema de pesquisa sem resposta existente para copiar —, Claude Opus 5.5 está decisivamente à frente, e a diferença é ampla demais para ser ruído. Já em extrair um fato de uma entrada muito longa, os dois estão efetivamente no mesmo nível, e GPT-6 Sol tem a janela marginalmente maior. Se sua carga de trabalho for recuperação em documentos longos e trabalho com agentes em sessões longas, os dez pontos são, em grande parte, problema de outra pessoa. Se for raciocínio inédito, eles são seu problema, e custam a você 5,7× por tarefa para evitar.
O que o rollout do ChatGPT diz e não diz a você
Há uma tentação de ler "1,2 bilhão de usuários semanais agora têm o GPT-6" como evidência sobre capacidade. Não é. É evidência sobre distribuição, e a OpenAI deixa explícito que a implementação do ChatGPT é alimentada pelo GPT-6 Sol para os planos pagos e pelo GPT-6 Luna para o Free e o Go, ambos "ajustados para conversas do dia a dia" — um alvo de otimização diferente do produto de API. Os modelos por trás do Work e do Codex não são alterados por este lançamento, o que é o sinal mais claro no anúncio de que este é um evento de superfície de consumidor, e não um lançamento de capacidade. Qualquer pessoa que faça benchmarking do "GPT-6 que 1,2 bilhão de pessoas usam" deve saber que está medindo uma implantação ajustada para chat, não o endpoint da API.
O que a implantação muda é o padrão. Um modelo que está simplesmente disponível para todos acaba aparecendo em muito mais protótipos, ferramentas internas e projetos paralelos inacabados do que um modelo que você precisa escolher deliberadamente. Se você está escolhendo uma API para algo duradouro, essa familiaridade ambiente vale alguma coisa — mas não vale dez pontos de índice, e não vale 5,7× o custo por tarefa em um pipeline com uso intenso de raciocínio.
Executando ambos sem escolher
A resposta honesta para "devo trocar" aqui é que os dois modelos querem trabalhos diferentes, e a questão da troca é principalmente uma questão de roteamento. Ambos estão no catálogo da OrcaRouter — GPT-6 Sol a US$ 2,00/US$ 10,00 do fornecedor, com o nível de contexto longo de US$ 4,00/US$ 15,00 repassado sem alterações, e Claude Opus 5.5 a US$ 4,00/US$ 20,00 — atrás de uma chave e um endpoint compatível com OpenAI, com 0% de markup sobre o preço de tabela do provedor. Isso importa mais do que o normal em uma semana em que um fornecedor muda um lançamento para consumidores, porque nossa linha de preço é a do provedor, não a nossa.
O padrão que se encaixa nesse pareamento é uma divisão: envie o tráfego de documentos longos e de sessões longas para o que for mais barato entre os dois naquela contagem de tokens — que, acima de 272.000 tokens, não é mais o GPT-6 Sol — e envie o tráfego de raciocínio inédito para o Claude Opus 5.5, com o GPT-6 Sol mantido como um failover automático para que um limite de taxa em uma rota não se torne uma indisponibilidade do seu lado. Você não precisa resolver o argumento de dez pontos para lançar; precisa saber quais das suas requisições estão na parte da distribuição em que isso se aplica.

O veredito, tal como é
Claude Opus 5.5 é o modelo melhor na métrica que os dois laboratórios publicam, e não chega perto nas duas avaliações que mais importam para raciocínio difícil. O GPT-6 Sol custa metade do preço na tarifa anunciada, um quinto do custo por tarefa na suíte independente, e agora é o modelo padrão no aplicativo que a maioria dos seus colegas já tem aberto. Nenhum desses fatos mudou esta semana; o que mudou é que o GPT-6 deixou de ser algo que você tinha de escolher e passou a ser algo que você tem.
O ponto a observar é se o próximo movimento da OpenAI é um avanço de capacidade ou mais um passo de distribuição. O próprio anúncio dela estabelece essa expectativa de forma explícita — a empresa diz que quer que o ChatGPT construa, com o tempo, mais das interfaces de que as pessoas precisam — e isso é um roteiro sobre superfícies, não sobre pontos de índice. Se a sua decisão depende do índice, o Claude Opus 5.5 ainda ganha. Se depende do custo em volume e de o modelo ser um que todo mundo já conhece, o GPT-6 Sol é a opção padrão mais segura hoje, com a cláusula de contexto longo como a única linha da tabela de preços para a qual você precisa prever orçamento.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
