
GPT-6.1 Sol vs Claude Opus 5.5: Uma Lacuna Real, Distribuída de Forma Desigual
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 143 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 293 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A diferença de 5,8 pontos entre Claude Opus 5.5 e GPT-6.1 Sol no Artificial Analysis Intelligence Index é a maior de qualquer par deste conjunto e, ao contrário da maioria dos outros, não se fechará com uma mudança de configuração. O Claude Opus 5.5, lançado em 22 de setembro de 2026 e cobrado a US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída, pontua 57,6. O GPT-6.1 Sol, lançado em 29 de setembro de 2026 a US$ 2,00 e US$ 10,00, pontua 51,8. O Claude Opus 5.5 é o modelo com maior pontuação, por uma margem maior do que a que separa a maioria dos modelos de fronteira entre si, e custa 8,3× mais por tarefa para chegar lá — US$ 5,98 contra US$ 0,72. Até agora, o modelo caro está simplesmente vencendo, o que é a versão menos interessante desta comparação. O que faz valer a pena ler é que os 5,8 pontos não estão distribuídos uniformemente pela suíte: no único eixo que determina a maior parte do trabalho com documentos longos e sessões longas, os dois modelos estão a menos de dois pontos de distância um do outro.
Ambos são modelos de ponta na mesma faixa de mercado: janelas de contexto de classe 1M, tetos de saída de 128K, entrada de texto, imagem e arquivo, raciocínio estendido de um lado e uma escala de esforço de cinco níveis do outro. O Claude Opus 5.5 sucede o Claude Opus 5 e é posicionado para tarefas exigentes de raciocínio, programação e trabalho agêntico de longo horizonte; o GPT-6.1 Sol fica um nível abaixo do GPT-6 Astra e é posicionado para programação agêntica, uso de computador e trabalho profissional com muitos documentos. Eles visam as mesmas tarefas. A medição mostra que não são igualmente bons em todas elas.
Onde os 5.8 pontos realmente ficam
Um índice composto oculta seus componentes. Extraia as avaliações individuais e a lacuna deixa de parecer uma lacuna e começa a parecer um perfil.
• Humanity's Last Exam — Claude Opus 5.5 61,4% vs GPT-6.1 Sol 52,9%, uma diferença de 8,5 pontos em raciocínio abstrato
• SciCode — Claude Opus 5.5 66,9% vs GPT-6.1 Sol 54,2%, uma diferença de 12,7 pontos em código de nível de pesquisa
• Recall de contexto longo — Claude Opus 5.5 84,7% vs GPT-6.1 Sol 83,0%, uma diferença de 1,7 ponto na recuperação de fatos de uma entrada longa
• Terminal-Bench 4.0 — Claude Opus 5.5 59,6% contra um valor do Sol não publicado na mesma revisão
• Janela de contexto — GPT-6.1 Sol 1.050.000 tokens vs Claude Opus 5.5 1.000.000 tokens, com um teto de saída de 128.000 tokens em ambos
• Custo por tarefa de indexação — Claude Opus 5.5 $5.98 vs GPT-6.1 Sol $0.72
A distribuição é o que conta. Quando a tarefa é raciocínio abstrato — uma questão difícil de prova, um problema de programação de nível de pesquisa sem resposta existente para copiar — o Claude Opus 5.5 está decisivamente à frente, e uma diferença de 12,7 pontos no SciCode não é ruído. Quando a tarefa é encontrar o trecho certo em uma entrada muito longa e usá-lo, os dois modelos estão efetivamente no mesmo nível, e o GPT-6.1 Sol mantém essa posição com 50.000 tokens de capacidade a mais. Uma grande parte do trabalho com LLMs em produção é do segundo tipo: respostas aumentadas por recuperação, revisão de contratos e de documentos protocolados, análise de logs e transcrições, revisão de código em um grande repositório. Esse trabalho é medido pelo terceiro item, não pelos dois primeiros, e, nesse item, o premium compra 1,7 pontos.
Lendo as linhas do índice honestamente
Duas ressalvas pertencem ao lado daqueles números, em vez de no final da página.
As configurações diferem. O Artificial Analysis coloca o Claude Opus 5.5 em uma configuração "Max, Default Fallback" e o GPT-6.1 Sol em esforço máximo. Ambos são as configurações mais fortes sob as quais cada modelo é publicado, o que torna a comparação justa, mas é uma comparação de dois tetos, e não de dois padrões de lançamento. Os próprios padrões do Claude Opus 5.5 em uma API hospedada podem diferir da execução registrada no gráfico, e o esforço padrão do GPT-6.1 Sol é médio.
A linha do Terminal-Bench está deliberadamente em branco de um lado. Os 59,6% do Claude Opus 5.5 vêm da revisão da Artificial Analysis na qual foi publicado; o valor equivalente do GPT-6.1 Sol não está disponível em uma revisão correspondente. Citar um número de uma execução diferente do mesmo benchmark seria uma comparação falsa, e a atitude honesta é deixar a célula vazia em vez de preenchê-la com algo aproximadamente correto.
A verbosidade atua aqui na mesma direção que atuou contra os irmãos mais baratos: o Claude Opus 5.5 emite 260 milhões de tokens de saída na suíte de índices, contra 67 milhões do GPT-6.1 Sol, uma diferença de 3,9× a uma tarifa que já é o dobro. É daí que vem uma proporção de 8,3× por tarefa quando a tabela de preços mostra 2× na entrada e 2× na saída. O sobrepreço não é de 8,3× porque o modelo custa 8,3× — é de 8,3× porque custa 2× e pensa por 3,9× mais tempo.
O argumento a favor de pagar
Se o seu trabalho se assemelha aos dois primeiros pontos, o cálculo é simples e favorece o Claude Opus 5.5. Uma diferença de 12,7 pontos em código científico de nível de pesquisa, ou 8,5 pontos em raciocínio abstrato difícil, é a diferença entre um agente que fecha um ticket sem supervisão e um que precisa de um humano a cada três passos. A codificação agêntica sobre uma grande base de código é a carga de trabalho que ambos os fornecedores citam em primeiro lugar, e é a carga de trabalho onde a disparidade é maior. Pagar $5,98 em vez de $0,72 por tarefa para evitar uma execução falhada que custa vinte minutos a um engenheiro não é uma decisão difícil.
Há um segundo argumento que não tem nada a ver com pontuações. O Claude Opus 5.5 tem quinze dias de vida e gerou um conjunto de avaliações, análises e experiência de implantação de terceiros que um modelo com oito dias de vida não tem. Para um caminho de produção, a maturidade do conhecimento ao redor vale algo que o índice não precifica.
O argumento contra, e o número que o decide
O contra-argumento é a linha de contexto longo. Se a forma dominante do seu tráfego é "entrada grande, resposta curta" — e, para inúmeras equipes, é —, então o eixo pelo qual você está sendo cobrado não é o eixo que você consome. Em recall de contexto longo, os dois modelos estão separados por 1,7 pontos a uma proporção de preços de 8,3×, e o modelo mais barato tem a janela maior. Esse é o caso em que o valor adicional é real, medido e gasto em capacidade que a carga de trabalho nunca exercita.
O número decisivo, então, não é o índice. É a proporção das suas tarefas que se parecem com SciCode, e não com recall. Equipes que conseguem responder a essa pergunta a partir dos próprios logs devem respondê-la a partir dos próprios logs; uma suíte de benchmarks é um proxy para uma mistura de tarefas, e a mistura é a variável.
Ambos na mesma tecla, que é o que torna a pergunta respondível.


O Claude Opus 5.5 está no OrcaRouter com seus próprios $4.00 / $20.00, com leituras de cache a $0.20. O GPT-6.1 Sol está no OrcaRouter a $2.00 / $10.00, passando para $4.00 / $15.00 acima de 272.000 tokens de prompt, com leituras de cache a $0.10. Ambos pelo preço de lista do provedor, sem nada acrescentado, em uma única chave e uma única fatura.
Isso importa mais do que o habitual para este emparelhamento, porque os dois modelos não são substitutos — são uma decisão de encaminhamento. Envie o trabalho com documentos longos e de alto volume para o GPT-6.1 Sol, mantenha o trabalho de raciocínio difícil e modificação de código no Claude Opus 5.5, e ambos ficam atrás do mesmo endpoint com as mesmas credenciais. Se uma rota se degradar, o failover automático move a chamada em vez de falhá-la, e, como o encaminhamento é declarativo, pode ser expresso por classe de tarefa em vez de por aplicação. Testar a divisão é uma alteração de configuração, não uma migração.
A última coisa que vale a pena dizer é sobre o prazo de validade desta comparação. Ambos os modelos têm dias ou semanas de idade. O GPT-6.1 Sol tem uma configuração independente publicada; o Claude Opus 5.5 tem uma. Uma única execução por modelo é um instantâneo, e o modo de falha interessante não é que um desses números esteja errado — é que uma configuração de esforço médio, ou um segundo avaliador, redesenhe o perfil. Até lá, a leitura defensável é a que os componentes dão: uma lacuna decisiva em raciocínio difícil e código de pesquisa, uma pequena em trabalho com contexto longo, e uma fatura 8,3× que precisa ser justificada pela parte da sua carga de trabalho que se assemelha à primeira.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
