Um cartão hero gerado para GPT-6.1 Sol vs Claude Opus 5.5, com o título "Uma lacuna real, distribuída de forma desigual", com dois cartões de informação com o texto "GPT-6.1 Sol: Intelligence Index 51,8, US$ 0,72 por tarefa do índice, recall de contexto longo 83,0%" e "Claude Opus 5.5: Intelligence Index 57,6, US$ 5,98 por tarefa do índice, recall de contexto longo 84,7%", um rodapé com o texto "Números segundo a Artificial Analysis, Intelligence Index v4.3.2, ambos os modelos representados na configuração de esforço máximo.", e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

GPT-6.1 Sol vs Claude Opus 5.5: Uma Lacuna Real, Distribuída de Forma Desigual

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A diferença de 5,8 pontos entre Claude Opus 5.5 e GPT-6.1 Sol no Artificial Analysis Intelligence Index é a maior de qualquer par deste conjunto e, ao contrário da maioria dos outros, não se fechará com uma mudança de configuração. O Claude Opus 5.5, lançado em 22 de setembro de 2026 e cobrado a US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída, pontua 57,6. O GPT-6.1 Sol, lançado em 29 de setembro de 2026 a US$ 2,00 e US$ 10,00, pontua 51,8. O Claude Opus 5.5 é o modelo com maior pontuação, por uma margem maior do que a que separa a maioria dos modelos de fronteira entre si, e custa 8,3× mais por tarefa para chegar lá — US$ 5,98 contra US$ 0,72. Até agora, o modelo caro está simplesmente vencendo, o que é a versão menos interessante desta comparação. O que faz valer a pena ler é que os 5,8 pontos não estão distribuídos uniformemente pela suíte: no único eixo que determina a maior parte do trabalho com documentos longos e sessões longas, os dois modelos estão a menos de dois pontos de distância um do outro.

Ambos são modelos de ponta na mesma faixa de mercado: janelas de contexto de classe 1M, tetos de saída de 128K, entrada de texto, imagem e arquivo, raciocínio estendido de um lado e uma escala de esforço de cinco níveis do outro. O Claude Opus 5.5 sucede o Claude Opus 5 e é posicionado para tarefas exigentes de raciocínio, programação e trabalho agêntico de longo horizonte; o GPT-6.1 Sol fica um nível abaixo do GPT-6 Astra e é posicionado para programação agêntica, uso de computador e trabalho profissional com muitos documentos. Eles visam as mesmas tarefas. A medição mostra que não são igualmente bons em todas elas.

Onde os 5.8 pontos realmente ficam

Um índice composto oculta seus componentes. Extraia as avaliações individuais e a lacuna deixa de parecer uma lacuna e começa a parecer um perfil.

• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6.1 Sol 52,9%, uma diferença de 8,5 pontos em raciocínio abstrato

• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, uma diferença de 12,7 pontos em código de nível de pesquisa

• Recall de contexto longo — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, uma diferença de 1,7 ponto na recuperação de fatos de uma entrada longa

• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% contra um valor do Sol não publicado na mesma revisão

• Janela de contexto — GPT-6.1 Sol 1.050.000 tokens vs Claude Opus 5.5 1.000.000 tokens, com um teto de saída de 128.000 tokens em ambos

• Custo por tarefa de indexação — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72

A distribuição é o que conta. Quando a tarefa é raciocínio abstrato — uma questão difícil de prova, um problema de programação de nível de pesquisa sem resposta existente para copiar — o Claude Opus 5.5 está decisivamente à frente, e uma diferença de 12,7 pontos no SciCode não é ruído. Quando a tarefa é encontrar o trecho certo em uma entrada muito longa e usá-lo, os dois modelos estão efetivamente no mesmo nível, e o GPT-6.1 Sol mantém essa posição com 50.000 tokens de capacidade a mais. Uma grande parte do trabalho com LLMs em produção é do segundo tipo: respostas aumentadas por recuperação, revisão de contratos e de documentos protocolados, análise de logs e transcrições, revisão de código em um grande repositório. Esse trabalho é medido pelo terceiro item, não pelos dois primeiros, e, nesse item, o premium compra 1,7 pontos.

Lendo as linhas do índice honestamente

Duas ressalvas pertencem ao lado daqueles números, em vez de no final da página.

As configurações diferem. O Artificial Analysis coloca o Claude Opus 5.5 em uma configuração "Max, Default Fallback" e o GPT-6.1 Sol em esforço máximo. Ambos são as configurações mais fortes sob as quais cada modelo é publicado, o que torna a comparação justa, mas é uma comparação de dois tetos, e não de dois padrões de lançamento. Os próprios padrões do Claude Opus 5.5 em uma API hospedada podem diferir da execução registrada no gráfico, e o esforço padrão do GPT-6.1 Sol é médio.

A linha do Terminal-Bench está deliberadamente em branco de um lado. Os 59,6% do Claude Opus 5.5 vêm da revisão da Artificial Analysis na qual foi publicado; o valor equivalente do GPT-6.1 Sol não está disponível em uma revisão correspondente. Citar um número de uma execução diferente do mesmo benchmark seria uma comparação falsa, e a atitude honesta é deixar a célula vazia em vez de preenchê-la com algo aproximadamente correto.

A verbosidade atua aqui na mesma direção que atuou contra os irmãos mais baratos: o Claude Opus 5.5 emite 260 milhões de tokens de saída na suíte de índices, contra 67 milhões do GPT-6.1 Sol, uma diferença de 3,9× a uma tarifa que já é o dobro. É daí que vem uma proporção de 8,3× por tarefa quando a tabela de preços mostra 2× na entrada e 2× na saída. O sobrepreço não é de 8,3× porque o modelo custa 8,3× — é de 8,3× porque custa 2× e pensa por 3,9× mais tempo.

O argumento a favor de pagar

Se o seu trabalho se assemelha aos dois primeiros pontos, o cálculo é simples e favorece o Claude Opus 5.5. Uma diferença de 12,7 pontos em código científico de nível de pesquisa, ou 8,5 pontos em raciocínio abstrato difícil, é a diferença entre um agente que fecha um ticket sem supervisão e um que precisa de um humano a cada três passos. A codificação agêntica sobre uma grande base de código é a carga de trabalho que ambos os fornecedores citam em primeiro lugar, e é a carga de trabalho onde a disparidade é maior. Pagar $5,98 em vez de $0,72 por tarefa para evitar uma execução falhada que custa vinte minutos a um engenheiro não é uma decisão difícil.

Há um segundo argumento que não tem nada a ver com pontuações. O Claude Opus 5.5 tem quinze dias de vida e gerou um conjunto de avaliações, análises e experiência de implantação de terceiros que um modelo com oito dias de vida não tem. Para um caminho de produção, a maturidade do conhecimento ao redor vale algo que o índice não precifica.

O argumento contra, e o número que o decide

O contra-argumento é a linha de contexto longo. Se a forma dominante do seu tráfego é "entrada grande, resposta curta" — e, para inúmeras equipes, é —, então o eixo pelo qual você está sendo cobrado não é o eixo que você consome. Em recall de contexto longo, os dois modelos estão separados por 1,7 pontos a uma proporção de preços de 8,3×, e o modelo mais barato tem a janela maior. Esse é o caso em que o valor adicional é real, medido e gasto em capacidade que a carga de trabalho nunca exercita.

O número decisivo, então, não é o índice. É a proporção das suas tarefas que se parecem com SciCode, e não com recall. Equipes que conseguem responder a essa pergunta a partir dos próprios logs devem respondê-la a partir dos próprios logs; uma suíte de benchmarks é um proxy para uma mistura de tarefas, e a mistura é a variável.

Ambos na mesma tecla, que é o que torna a pergunta respondível.

A screenshot of the OrcaRouter model page for anthropic/claude-opus-5.5, credited to Anthropic and dated 2026-09-22, showing text, image and file input with text output, a 1,000,000-token context window reading 1M tokens with a 128K maximum output, and a rate row reading $4.00 input and $20.00 output per million tokens alongside a 3.68 s median time to first token and a 36.5M seven-day traffic figure.A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window with 128,000 max output tokens and an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.

O Claude Opus 5.5 está no OrcaRouter com seus próprios $4.00 / $20.00, com leituras de cache a $0.20. O GPT-6.1 Sol está no OrcaRouter a $2.00 / $10.00, passando para $4.00 / $15.00 acima de 272.000 tokens de prompt, com leituras de cache a $0.10. Ambos pelo preço de lista do provedor, sem nada acrescentado, em uma única chave e uma única fatura.

Isso importa mais do que o habitual para este emparelhamento, porque os dois modelos não são substitutos — são uma decisão de encaminhamento. Envie o trabalho com documentos longos e de alto volume para o GPT-6.1 Sol, mantenha o trabalho de raciocínio difícil e modificação de código no Claude Opus 5.5, e ambos ficam atrás do mesmo endpoint com as mesmas credenciais. Se uma rota se degradar, o failover automático move a chamada em vez de falhá-la, e, como o encaminhamento é declarativo, pode ser expresso por classe de tarefa em vez de por aplicação. Testar a divisão é uma alteração de configuração, não uma migração.

A última coisa que vale a pena dizer é sobre o prazo de validade desta comparação. Ambos os modelos têm dias ou semanas de idade. O GPT-6.1 Sol tem uma configuração independente publicada; o Claude Opus 5.5 tem uma. Uma única execução por modelo é um instantâneo, e o modo de falha interessante não é que um desses números esteja errado — é que uma configuração de esforço médio, ou um segundo avaliador, redesenhe o perfil. Até lá, a leitura defensável é a que os componentes dão: uma lacuna decisiva em raciocínio difícil e código de pesquisa, uma pequena em trabalho com contexto longo, e uma fatura 8,3× que precisa ser justificada pela parte da sua carga de trabalho que se assemelha à primeira.

A generated scoreboard titled 'GPT-6.1 Sol vs Claude Opus 5.5 — the scoreboard' showing two columns on six shared rows: Intelligence Index 51.8 against 57.6; cost per index task $0.72 against $5.98; Humanity's Last Exam 52.9% against 61.4%; SciCode 54.2% against 66.9%; long-context recall 83.0% against 84.7%; context window 1,050,000 against 1,000,000 tokens. A footer reads 'Index, per-task cost and evaluation figures per Artificial Analysis, Intelligence Index v4.3.2.'

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente