Card de título gerado com o texto "GPT-6 vs Claude Opus 5", com um chip com o texto "Opus 5 substituído por Claude Opus 5.5, 22 de setembro de 2026" e um chip com o texto "GPT-6 Sol substituído por GPT-6.1 Sol, 29 de setembro de 2026", e um rodapé com o texto "Ambos os modelos continuam sendo roteados; números do índice de acordo com a Artificial Analysis." O logotipo do OrcaRouter é composto no canto inferior direito.
Guides & Insights

GPT-6 vs Claude Opus 5: ambos os lados deste confronto já foram substituídos

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

The most useful thing to know about GPT-6 versus Claude Opus 5 is that both halves of the matchup are one generation behind their own vendors. Claude Opus 5 shipped on 24 July 2026 and was replaced by Claude Opus 5.5 on 22 September. GPT-6 Sol shipped on 22 September and was replaced by GPT-6.1 Sol on 29 September. If you searched for this comparison because you are choosing between them for new work, you are choosing between two models that each vendor has already moved past — and the honest version of this article is about when the older pair is still the right call, not about who wins.

O que os dois modelos realmente são

O Claude Opus 5 era o carro-chefe da Anthropic: uma janela de contexto de 1,000,000 tokens, 128,000 tokens de saída máxima, entrada de texto, imagem e arquivo, listado a $5.00 por milhão de tokens de entrada e $25.00 por milhão de tokens de saída, com uma taxa de $0.50 para entrada em cache e uma taxa de $10.00 para gravação de cache. É um único modelo com um único id, anthropic/claude-opus-5.

GPT-6 Sol é o nível intermediário de uma geração de três — GPT-6 Astra acima dele e GPT-6 Luna abaixo dele — com o mesmo contexto de mais de 1.000.000 de tokens (o catálogo lista 1.050.000 para o lado da OpenAI contra 1.000.000 do Opus 5), o mesmo teto de saída de 128.000 tokens e a mesma entrada de texto/imagem/arquivo. Ele é listado a US$ 2,00 / US$ 10,00, com uma taxa de entrada em cache de US$ 0,20 e uma taxa de gravação de cache de US$ 2,50. Sua tabela de preços traz uma etapa que a tabela da Anthropic não tem: qualquer solicitação acima de 272.000 tokens de entrada reajusta o preço de toda a solicitação para US$ 4,00 / US$ 15,00.

Isso representa uma diferença de preço por token de 2,5x a favor do Sol na ponta curta, e a diferença também se mantém no cache — um desconto de 90% sobre a entrada em cache no Sol, contra um desconto de 98% no Opus 5, o que reduz a diferença para US$ 0,20 contra US$ 0,50 por milhão, em vez de eliminá-la. Em uma carga de trabalho de contexto longo, a diferença cai pela metade, em vez de desaparecer.

• Entrada — GPT-6 Sol $2,00 por milhão vs Claude Opus 5 $5,00
• Saída — GPT-6 Sol $10,00 por milhão vs Claude Opus 5 $25,00
• Entrada em cache — GPT-6 Sol $0,20 por milhão vs Claude Opus 5 $0,50
• Gravações em cache — GPT-6 Sol $2,50 por milhão vs Claude Opus 5 $10,00
• Acima de 272 mil de entrada — GPT-6 Sol reprecifica toda a solicitação para $4,00 / $15,00; não há etapa equivalente no cartão do Opus 5
• Contexto e saída — 1.050.000 de entrada e 128.000 de saída vs 1.000.000 de entrada e 128.000 de saída

O conselho independente, onde a diferença é maior que o preço.

O preço favorece o GPT-6 Sol em 2,5x. O quadro favorece o Claude Opus 5 mais do que a diferença de preço sugeriria, o que é o oposto da narrativa habitual do modelo barato.

• AA Intelligence Index — Claude Opus 5 50,8, classificado em 11º; GPT-6 Sol 47,6, classificado em 14º
• AA Coding Index — Claude Opus 5 78,0, classificado em 2º nesse ranking; GPT-6 Sol 60,0
• GPQA Diamond — Claude Opus 5 93,2
• Humanity's Last Exam — Claude Opus 5 54,9 vs GPT-6 Sol 47,9
• Terminal-Bench 2.1 — Claude Opus 5 89,1
• Terminal-Bench 4.0 — Claude Opus 5 49,0 vs GPT-6 Sol 43,9
• τ-bench banking — Claude Opus 5 42,1
• SciCode — Claude Opus 5 56,4 vs GPT-6 Sol 57,6
• Long-context recall — Claude Opus 5 79,3 vs GPT-6 Sol 83,7

Duas linhas seguem o sentido oposto e vale a pena nomeá-las, porque o agregado as esconde. O GPT-6 Sol supera o Opus 5 em recall de contexto longo por 4,4 pontos e leva ligeira vantagem sobre ele em SciCode por 1,2. Portanto, a forma honesta não é "o Opus 5 é melhor em tudo" — é que o Opus 5 está decisivamente à frente nos rankings de programação e de agentes (uma liderança de 24 pontos no Coding Index é um tipo diferente de resultado), enquanto o Sol mantém a linha de recuperação em janela longa e empata numa das duas medidas de código científico.

Uma ressalva metodológica antes que qualquer um dos dois números seja citado em qualquer outro lugar: a Artificial Analysis não garante que duas páginas de modelo sejam renderizadas com a mesma revisão de índice no mesmo dia, e ela divide seus grupos de pares — modelos de pesos abertos são ranqueados contra outros modelos de pesos abertos da mesma classe de tamanho; modelos proprietários, dentro de uma faixa de preço para modelos proprietários. Ambos os modelos aqui são proprietários, então os dois números vêm do mesmo lado dessa linha, mas trate as diferenças de menos de um ponto como direção, e não como uma medição controlada. Cada fornecedor neste artigo é o fornecedor fazendo benchmark do próprio modelo contra o próprio antecessor e está rotulado como tal.

O que as duas substituições mudaram

Claude Opus 5.5 chegou em 22 de setembro a $4,00 / $20,00 — mais barato que o Opus 5 nas duas métricas, com uma tarifa de entrada em cache de $0,20 que corresponde à do Sol — e obtém 57,6 no mesmo Intelligence Index. Isso é 6,8 pontos acima do Opus 5 por 20% menos dinheiro. Qualquer argumento para manter o Opus 5 numa nova build tem que explicar por que vale a pena 6,8 pontos de índice e $1,00/$5,00 por milhão para ficar no checkpoint mais antigo.

GPT-6.1 Sol chegou em 29 de setembro pelo mesmo preço de US$ 2,00 / US$ 10,00 do GPT-6 Sol, com pontuação de 51,8 no índice, contra 47,6 do Sol, e uma taxa de US$ 0,10 para entrada em cache, que reduz pela metade a leitura em cache. É o mesmo preço com uma pontuação melhor e uma economia de cache melhor. O único argumento especificamente a favor do GPT-6 Sol é o mesmo que se aplica ao Opus 5: uma suíte de regressão que teve sua linha de base estabelecida com ele, na qual trocar o modelo invalida as comparações em que você já confia.

Há um segundo motivo, mais silencioso, para uma equipe continuar com o par mais antigo, e ele não tem a ver com benchmarks. Ambos são os checkpoints com o histórico de produção mais longo por trás deles. O Opus 5 está disponível para chamadas desde 24 de julho, e o GPT-6 Sol desde 22 de setembro, e as medições do avaliador independente sobre ambos vêm sendo feitas há tempo suficiente para mostrar uma forma, e não uma leitura isolada. Os últimos sete dias de tráfego do Sol nos nossos próprios dados de roteamento somam cerca de 2,1 milhões de tokens; os do Opus 5 somam cerca de 23,0 milhões. Isso é uma janela móvel, não um total acumulado de todo o período, e os valores mudam entre leituras — mas são um lembrete de que o Opus 5 ainda está fazendo trabalho real em produção mesmo depois que seu substituto foi lançado.

O perfil de latência e custo, que é onde o Sol se paga

• Tempo mediano até o primeiro token — GPT-6 Sol 6.785 ms vs Claude Opus 5 4.652 ms
• Velocidade mediana de saída — GPT-6 Sol 179,6 tokens/s vs Claude Opus 5 82,2 tokens/s
• Tráfego de sete dias observado do nosso lado — GPT-6 Sol ~2,1M tokens, Claude Opus 5 ~23,0M tokens

Sol responde ao seu primeiro token cerca de 2,1 segundos depois, mas então faz streaming a mais do dobro da taxa do Opus 5. Numa geração longa — o tipo de execução em que a saída tem milhares de tokens em vez de dezenas — esse segundo número domina, e um modelo barato que termina mais cedo vale mais do que a sua tabela de preços sugere. Numa chamada curta e sensível à latência, é o valor do primeiro token que o usuário sente.

Ambas são medições de serving do nosso próprio roteamento, coletadas ao longo de uma janela móvel de sete dias, e variam entre leituras. Elas são úteis para comparar o formato dos dois modelos, e não para citar como uma expectativa de nível de serviço.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs Claude Opus 5 — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7, Output speed 180 tok/s. The right column, Claude Opus 5, reads Input $5.00, Output $25.00, AA Intelligence 50.8, AA Coding 78.0, Long-context recall 79.3, Output speed 82 tok/s. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Executando o par enquanto a migração está indefinida

O motivo pelo qual vale a pena responder a essa comparação é que nenhuma das substituições é uma decisão de troca direta. Se suas avaliações foram construídas com base no Claude Opus 5, passar para o Opus 5.5 é uma redefinição de linha de base, não um upgrade; o mesmo vale para o GPT-6 Sol em relação ao GPT-6.1 Sol. A coisa útil a fazer nessa janela é rodar as duas gerações lado a lado no seu próprio tráfego, em vez de escolher com base no placar de outra pessoa.

Os quatro modelos estão no mesmo catálogo no OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol e GPT-6.1 Sol, chamados através de uma única API à frente de mais de 200 modelos, com o preço de tabela do fornecedor repassado com 0% de margem, de modo que um corte de preço do fornecedor chega aqui no mesmo dia, em vez de na sua próxima reconciliação — o que torna a comparação uma questão de roteamento, e não de compras. A DSL de roteamento permite dividir por tamanho de solicitação ou por proporção: envie uma fração do tráfego de produção para o checkpoint mais recente, compare-a com a linha de base nas suas próprias avaliações, amplie a fração quando os números se mantiverem, e mantenha o modelo mais antigo como alternativa até que isso aconteça. Failover automático entre provedores cobre o caso em que uma rota se degrada no meio da migração, que é o modo de falha que faz as pessoas abandonarem uma migração pela metade.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the Anthropic vendor label, a 2026-07-24 catalogue release date, a 1M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $5.00 per million input, $25.00 per million output, a 4.65 s median time to first token, a 10.00 s p95, and 23.0M tokens routed in seven days.Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Quem deve escolher qual, dado que ambos foram substituídos?

Se for começar algo novo: nenhum dos dois. O Claude Opus 5.5 é mais barato que o Claude Opus 5 e obtém 6,8 pontos a mais, e o GPT-6.1 Sol custa o mesmo que o GPT-6 Sol, com um índice melhor e uma leitura de cache reduzida pela metade. A única razão para começar com o par mais antigo é uma dependência rígida de um checkpoint que não pode ser alterado.

Se você já está executando um deles: a decisão é sobre a sua suíte de regressão, não sobre os rankings. O Claude Opus 5 continua sendo o modelo mais forte dos dois em codificação e em agentes, por uma margem ampla, então um pipeline de codificação que é estável nele deveria ser comparado com o Opus 5.5, em vez de migrar lateralmente para uma camada do GPT-6. Um pipeline de alto volume e sensível a custos no GPT-6 Sol tem a atualização mais fácil — mesmo preço, pontuação melhor, cache melhor — e a razão honesta para adiar é apenas que você ainda não executou novamente suas avaliações.

E se a resposta que você queria era simplesmente qual dos dois vence: o Claude Opus 5 vence, em quase todos os rankings, por 2,5x o dinheiro. O argumento do GPT-6 Sol nunca foi o de que ele era melhor. Era o de que era barato o suficiente para valer a diferença — e esse argumento agora pertence ao GPT-6.1 Sol pelo mesmo preço, com uma pontuação melhor.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente