Um cartão de título com o texto "Claude Opus 5.5 lidera o Coding Agent Index com 66", com o subtítulo "Tokens mais baratos, uma fatura de tarefas maior", e três cartões arredondados abaixo dele: Coding Agent Index 66, Custo por tarefa $13,04, aumento de 21%, e Claude Opus 5: 60 a $10,79.
Guides & Insights

Claude Opus 5.5 lidera o Coding Agent Index com 66 — e a conta de tarefas sobe 21%

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O fornecedor cortou os preços dos tokens do Claude Opus 5.5 em 20% em 22 de setembro de 2026. Dois dias depois, a Artificial Analysis publicou a medição do agente de codificação que mostra o que o corte fez à conta de um agente: o custo por tarefa subiu 21%, para US$ 13,04, ante os US$ 10,79 que o mesmo índice cobra pelo Claude Opus 5. A pontuação também subiu — 66 no Coding Agent Index, que a Artificial Analysis descreve como a mais alta já medida, seis pontos à frente do Claude Opus 5 e quatro à frente do Claude Fable 5.1 na mesma configuração. Ambas as coisas são verdadeiras ao mesmo tempo, e a razão pela qual são verdadeiras ao mesmo tempo é toda a história deste ranking. Um token mais barato do qual um modelo gasta mais não é uma tarefa mais barata, e no esforço máximo de raciocínio em longas execuções de agente, o Claude Opus 5.5 gasta muito mais deles.

O que o Coding Agent Index realmente avalia

Isto não é um ranking de modelos. Cada linha nele é um par de harness e modelo — um checkpoint executando dentro de um agente de codificação específico, numa configuração de esforço específica. A linha que todo mundo está citando é o Claude Opus 5.5 em esforço máximo dentro do Claude Code, que é o harness em relação ao qual a Anthropic desenvolve e ajusta. O 60 do Claude Opus 5 e o 62 do Claude Fable 5.1 vêm do mesmo harness e da mesma configuração de esforço, e é isso que os torna comparações honestas; uma linha para qualquer um dos modelos num agente de codificação diferente é uma medição diferente e não é impressa aqui como se fosse a mesma.

O índice tem versionamento, e a versão importa mais do que o nome da marca nele. O quadro atualmente publicado como v1.5 faz a média de três avaliações, cada uma com peso igual, cada uma relatada como pass@1 com média sobre três tentativas por tarefa:

Terminal-Bench 4.0 — trabalho agêntico de shell e linha de comando: navegar por um sistema de arquivos, usar ferramentas corretamente, recuperar-se de uma falha intermediária e concluir um fluxo de trabalho de várias etapas.

DeepSWE v1.1 — tarefas de engenharia de software, o trabalho de edição de repositórios.

SWE-Atlas-QnA — perguntas de compreensão de repositório, em que a resposta é encontrada ao ler uma base de código em vez de alterá-la.

Três avaliações, um número e uma coluna de custo por tarefa impressa ao lado dele. É por causa dessa coluna de custo que este índice é mais útil do que uma pontuação isolada, e é também por isso que o número principal é mais difícil de ler do que parece.

A two-column scoreboard comparing Claude Opus 5.5 against Claude Opus 5, both in the Claude Code harness at max reasoning effort: Coding Agent Index 66 vs 60, Terminal-Bench 4.0 63.1% vs 54.5%, DeepSWE v1.1 68.4% vs 62.5%, SWE-Atlas-QnA 66.4% vs 62.1%, cost per task $13.04 vs $10.79, and tokens per task 15.6M vs 11.4M.

Os três componentes, e de onde vieram os seis pontos

A Artificial Analysis publicou as linhas de componentes ao lado do composto, e elas não se movem de forma uniforme:

Terminal-Bench 4.063,1% para o Claude Opus 5.5 contra 54,5% para o Claude Opus 5, um ganho de 8,6 pontos. Esta é a maior melhoria individual do conjunto.

DeepSWE v1.168,4% contra 62,5%, um aumento de 5,9 pontos.

SWE-Atlas-QnA66,4% contra 62,1%, um aumento de 4,3 pontos.

Faça a média desses três e você obtém 66,0, que é o resultado composto. A forma do ganho é a parte interessante: o modelo teve o menor avanço ao ler uma base de código e o maior ao operar um shell. O Terminal-Bench é a avaliação mais próxima do que as pessoas realmente querem dizer com “agente de codificação” — um loop de longa duração em que o modelo escolhe comandos, lê a saída e decide o que fazer em seguida, sem nenhum humano no circuito entre as etapas. Um salto de 8,6 pontos aí é uma afirmação sobre o uso sustentado de ferramentas, não sobre geração de código.

Observe o que isso implica sobre onde esperar a melhoria. Se a sua carga de trabalho for "explicar este repositório", o Claude Opus 5.5 é uma atualização modesta em relação ao Claude Opus 5 — quatro pontos. Se a sua carga de trabalho for "executar até que a suíte de testes passe, corrigindo o que quebrar", é o maior salto da tabela.

Screenshot of the Artificial Analysis Coding Agent Benchmarks page, showing the Coding Agent Index v1.5 composite of three equally weighted evaluations — DeepSWE v1.1 at 113 tasks by Datacurve, Terminal-Bench 4.0 at 66 tasks by Laude Institute and SWE-Atlas-QnA at 124 tasks by Scale AI — with Claude Opus 5.5 at 66 at the top of the index highlight chart and a cost-per-task bar of about $13.

O número impresso ao lado da classificação: $13.04 por tarefa

Eis a aritmética que faz o corte de preço parecer diferente da forma como foi anunciado. O preço de tabela da Anthropic para o Claude Opus 5.5 é $4,00 por milhão de tokens de entrada e $20,00 por milhão de saída, abaixo de $5,00 e $25,00 para o Claude Opus 5, com leituras de cache reduzidas em 60%, para $0,20 por milhão. Cada uma dessas linhas está mais barata. A estimativa da Artificial Analysis de quanto custa uma tarefa no esforço máximo é mais alta mesmo assim:

Custo por tarefa — $13,04 para Claude Opus 5.5 contra $10,79 para Claude Opus 5, um aumento de 21% no mesmo índice, mesmo harness, mesma configuração de esforço.

Total de tokens por tarefa — aproximadamente 15,6M contra 11,4M, um aumento de cerca de 37%.

Tokens de saída por tarefa — aproximadamente 333.000 em comparação com 137.000, mais que o dobro. A saída é o lado caro, e é a linha que mais mudou.

Entrada em cache por tarefa — aproximadamente 14,6M contra 10,9M, um aumento de cerca de 34%. O corte de 60% na leitura de cache está fazendo um trabalho real aqui; só não é suficiente para compensar uma tarefa que lê um terço a mais de contexto.

Faça a soma com as tarifas publicadas e o quadro se revela. Considere apenas os tokens de saída: 333.000 tokens a US$ 20,00 por milhão resultam em cerca de US$ 6,66 — cerca de metade de toda a estimativa de US$ 13,04, vinda de um único item de linha que dobrou. A linha de leitura de cache é enorme em volume e quase sem custo: 14,6 milhões de tokens a US$ 0,20 por milhão ficam abaixo de US$ 3. O corte de 20% é real e o corte do cache é real; no esforço máximo em um loop de agente, eles são simplesmente superados por um modelo que pensa mais e escreve mais.

Isso tem uma consequência direta para a forma como você faz seu orçamento. Se sua equipe executa 500 tarefas de agentes de codificação por dia com esforço máximo, a diferença entre US$ 10,79 e US$ 13,04 é de cerca de US$ 1.125 por dia — aproximadamente US$ 34.000 por mês — para o mesmo número de tarefas. Esse é o número a colocar diante de quem aprova a mudança de modelo, e não é o número que o corte de preço sugere.

Por que $5.98 e $13.04 são ambos verdadeiros

Artificial Analysis publicou um valor diferente de custo por tarefa para o mesmo modelo dias antes, e ler os dois juntos sem os rótulos faz com que pareçam uma contradição. Não são — são duas avaliações diferentes, e a diferença é instrutiva.

No Intelligence Index, o artigo de 22 de setembro colocou o custo por tarefa do Claude Opus 5.5 em $5.98, praticamente o mesmo que os $5.86 do Claude Opus 5, apesar de cerca de 119.000 tokens de saída por tarefa contra 73.000 do Opus 5. Ali, o corte de preço e os tokens extras se anulam quase exatamente. No Coding Agent Index, no esforço máximo, no Claude Code, o mesmo modelo custa $13.04 contra $10.79.

Ambas são medições honestas de cargas de trabalho diferentes. Uma avaliação de perguntas e respostas é uma troca curta; uma tarefa de agente é um longo ciclo de chamadas de ferramentas com um contexto crescente, e esse crescimento se acumula na direção da saída, onde o preço é mais alto. A lição prática é que "o corte de preço compensa os tokens extras?" não tem uma resposta única — depende da duração da tarefa, e quanto mais longa e mais agêntica for a tarefa, pior fica a compensação. Se você estiver orçando com base em um benchmark de respostas curtas, vai subestimar a conta de um agente.

Três ressalvas que pertencem à linha

O 66 é um número do Claude Code, não um número de modelo puro. O índice emparelha modelos com harnesses de forma deliberada, partindo do argumento de que o roteamento de ferramentas, a lógica de retentativa e o gerenciamento de contexto são inseparáveis do desempenho medido de um agente. Isso favorece a Anthropic neste caso, porque o harness no qual ela é avaliada é o seu próprio. A Artificial Analysis sinaliza uma visualização de comparação de harnesses como "em breve"; até que ela exista, ninguém pode dizer quanto dos seis pontos de vantagem vem do checkpoint e quanto vem do andaime que o cerca.

O próprio número do Terminal-Bench 4.0 da Anthropic é superior a este componente e foi executado pela Anthropic. O material de lançamento informa 66.4% com esforço xhigh; o componente do Coding Agent Index é 63.1% no modo máximo, e a execução independente separada da Artificial Analysis mediu 59.6% em seu próprio harness, na mesma versão do benchmark. Três números, três configurações, três produtores. Os 63.1% da linha acima são o componente do próprio índice e só devem ser comparados com os outros números desse índice; os 66.4% do fornecedor são informados pelo próprio fornecedor, não foram reproduzidos por terceiros e pertencem a uma configuração de esforço diferente.

A revisão do índice muda. Este blog relatou diferentes linhas do Coding Agent Index no início de setembro, em uma versão anterior do mesmo painel, e esses números mais antigos não são comparáveis ao v1.5 — o próprio conjunto de avaliação mudou quando o Terminal-Bench 4.0 substituiu a versão anterior. Espelhos de terceiros ainda trazem snapshots desatualizados com rótulos de versões mais antigas. Se um número para Claude Opus 5.5 neste índice não for da linha atual do v1.5, não o coloque ao lado de um número do v1.5 e não calcule um delta entre os dois.

Screenshot of the OrcaRouter model page for Claude Opus 5.5, model id anthropic/claude-opus-5.5, showing the 2026-09-22 date by Anthropic, a 1M-token context window with 128K max output, text plus image plus file input, input $4.00 and output $20.00 per 1M tokens, and a Python snippet calling the model through api.orcarouter.ai.

O que realmente implantar

A classificação é um número de esforço máximo, e esforço máximo é a configuração que quase ninguém deveria usar por padrão. O Claude Opus 5.5 tem cinco configurações de esforço — baixo, médio, alto, xhigh e máximo — e o modelo usa médio por padrão. A Artificial Analysis não publicou linhas do Coding Agent Index nas configurações mais baixas, então a economia de custo nesse ponto não é quantificada neste índice; no Intelligence Index, o mesmo modelo no nível médio pontuou 51 — igualando o máximo do Claude Opus 5 — a $1.34 por tarefa. É nessa direção que estão as economias, e é uma configuração, não um modelo diferente.

O padrão realista é uma divisão: manter o esforço máximo nos longos loops autônomos, onde o ganho de 8,6 pontos no Terminal-Bench é o que você está comprando, e executar o trabalho rotineiro com um esforço menor, no qual o modelo ainda está bem à frente de onde o Claude Opus 5 parou. Como o esforço é um parâmetro de requisição, e não uma implantação, essa divisão é uma regra de roteamento, e os dois modelos ficam no mesmo catálogo — a Anthropic repassa os preços de tabela com 0% de margem, então um corte de preço do fornecedor entra em vigor em anthropic/claude-opus-5.5 no mesmo dia em que é anunciado, e não há um segundo contrato nem alteração de código envolvidos em fazer A/B dos dois contra as suas próprias tarefas. Especificamente para o caminho de esforço máximo, em que uma única tarefa pode ser uma longa execução sem supervisão, o failover automático é o que impede que um provedor travado custe a você o loop inteiro.

O que ainda não foi medido

Três coisas mudariam esse cenário e nenhuma delas existe ainda. Não há uma comparação de Claude Opus 5.5 com um checkpoint rival em que o esforço e o harness sejam equivalentes — toda comparação entre fornecedores disponível consiste em duas tabelas de fornecedores dispostas lado a lado. Não há nenhuma execução publicada do Coding Agent Index com esforço médio ou alto, que é onde estaria a maior parte do tráfego de produção. E a questão da atribuição do harness — quanto de um 66 é o modelo e quanto é o Claude Code — foi reconhecida pelo índice e adiada.

O que você pode usar hoje é mais restrito e mais útil do que um ranking. O Claude Opus 5.5 é genuinamente melhor em trabalho de agente sustentado conduzido por shell do que o Claude Opus 5 — esse é o único componente com um ganho grande, consistente e obtido de forma independente. Ele também custa mais por tarefa na configuração em que esse ganho foi medido, cerca de US$ 2,25 a mais por tarefa, e a redução de preço por token não chega a esse valor. Implante-o no esforço máximo onde o loop é longo e o custo de falha é alto; mantenha a configuração mais barata em todos os outros casos; e verifique novamente o índice quando as linhas de menor esforço aparecerem, porque é essa a configuração que a maioria das equipes realmente vai pagar. Se você está trocando apenas pela redução de preço, está comprando a coisa errada — o modelo é mais barato por token e mais caro por tarefa, e apenas um desses dois números aparece na sua fatura.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente