Cartão de título gerado para um artigo sobre o Epoch Capabilities Index, com a manchete 'Claude Opus 5.5 Lidera o Epoch Capabilities Index' sobre uma linha monoespaçada azul-clara com o texto '167.35 vs 166.51' e uma sublinha cinza com o texto 'Os dois primeiros em um composto de mais de 50 benchmarks', com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Claude Opus 5.5 lidera o Epoch Capabilities Index por 0,84 ponto

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O número é 0,84. Claude Opus 5.5 está em 167,35 no Epoch Capabilities Index conforme o arquivo que lemos em 2 de outubro de 2026, com GPT-6 Astra em 166,51 — uma diferença de menos de um ponto numa escala em que os intervalos de 95% publicados para os dois modelos se sobrepõem quase totalmente, 164,0 a 172,0 para o Opus 5.5 contra 163,14 a 171,05 para o Astra. Abaixo deles, Claude Sonnet 5.5 registrou 165,2 e Claude Fable 5.1 164,82, de modo que as quatro primeiras entradas de um composto independente de mais de cinquenta benchmarks estão separadas por 2,53 pontos e três delas carregam o nome do mesmo fornecedor. A ordenação é real no sentido de que as estimativas pontuais estão ordenadas. Não é real no sentido de que uma vantagem de 0,84 ponto sobrevive às suas próprias barras de erro, e tudo o que vale a pena dizer sobre essa tabela de classificação decorre de sustentar ambos esses fatos ao mesmo tempo.

O que o índice é, e o que 0,84 de um ponto não é

O Epoch Capabilities Index não é um placar de fornecedores. Ele é construído pela Epoch AI, uma organização de pesquisa independente, como um composto que reúne pontuações de mais de cinquenta benchmarks distintos em uma única escala de capacidade geral, inferindo a dificuldade relativa de cada benchmark a partir dos modelos que por acaso aparecem em vários deles ao mesmo tempo. A metodologia é apresentada em um artigo escrito com pesquisadores da equipe de AGI Safety & Alignment do Google DeepMind e financiado pela DeepMind, mas a Epoch afirma claramente que o índice é um produto próprio e que detém plenos direitos sobre ele — uma distinção que vale a pena manter quando a fonte de financiamento e o publicador de uma pontuação não são a mesma parte. O código é público.

Duas propriedades da escala importam mais do que a manchete. A primeira é que o ECI é deliberadamente ancorado, e não absoluto: as pontuações brutas são reescalonadas para que o Claude 3.5 Sonnet fique em 130 e o GPT-5 em 150, o que significa que um número neste índice só tem significado ao lado de outro número do mesmo arquivo, nunca isoladamente. A segunda é que o índice não tem teto. Não há um 100 a alcançar, portanto "topo do índice" é uma afirmação sobre uma data, não sobre um limite que alguém tenha atingido.

É por isso que a leitura honesta de 167,35 contra 166,51 não é “o Claude Opus 5.5 é o modelo mais capaz do mundo”. Ela é mais restrita e menos citável: na modelagem da Epoch das evidências disponíveis em 2 de outubro de 2026, os dois modelos são indistinguíveis no topo, e a ordenação entre eles é um critério de desempate, e não uma medição. Os intervalos publicados dizem isso diretamente — 164,0 a 172,0 e 163,14 a 171,05 compartilham a grande maioria de sua faixa. Qualquer pessoa que cite o 0,84 como veredito está citando um artefato de arredondamento.

O bloco da Anthropic, e o tamanho de um lançamento

O aspecto mais informativo da tabela não é quem está em primeiro lugar. São a terceira e a quarta linhas. Claude Sonnet 5.5, lançado em 28 de setembro e com pontuação 165,2, fica 0,38 ponto acima de Claude Fable 5.1, lançado em 1º de setembro com 164,82 — próximos o suficiente para que os dois estejam na mesma posição na prática, e próximos o suficiente para que o par fique apenas 2,15 pontos abaixo do topo da tabela. Sonnet é o produto de nível intermediário da linha da Anthropic, e Fable é o modelo que a empresa historicamente apontou para trabalho de raciocínio geral; que ambos agora margeiem a fronteira logo por baixo é a mudança substantiva nesta atualização, mais do que a identidade do líder.

O próprio salto geracional da Anthropic também está visível. O Claude Opus 5.5 é o sucessor do Claude Opus 5, que a Epoch pontua em 162,94, com um intervalo de 160,2 a 166,7. Isso representa uma melhoria de 4,41 pontos em cerca de dois meses, de um lançamento em 24 de julho a um em 22 de setembro — um movimento maior do que os 0,84 pontos que separam o primeiro e o segundo lugar atuais. Lido dessa forma, a quantidade interessante nesta tabela é a inclinação dentro da linha de um único fornecedor, não a diferença entre dois fornecedores no topo.

Onde a linha dos open-weights se estende

A Epoch separa os modelos por acessibilidade, o que torna a fronteira dos pesos abertos legível sem precisar adivinhar. A melhor entrada de pesos abertos é o Kimi K3, com 157,61, datado de 16 de julho e rotulado como não comercial. Atrás dele estão o DeepSeek V4 Pro 0813, com 155,38, e o DeepSeek V4.1 Flash, com 155,0, ambos irrestritos, depois o GLM-5.3-Flash, com 151,94, e o GLM-5.2, com 151,78. O modelo aberto mais próximo do topo está, portanto, 9,74 pontos atrás — uma lacuna dezoito vezes maior que a que separa o primeiro e o segundo lugar, e ampla o suficiente para que os intervalos não cheguem nem perto de se tocar.

Essa assimetria é o único achado duradouro da tabela. A fronteira fechada é um aglomerado dentro de três pontos; a distância da fronteira fechada até os melhores pesos disponíveis para download é uma ordem de magnitude maior. Um índice composto que permite comparar entre gerações de benchmark é exatamente a ferramenta para perceber isso, porque consegue dizer a mesma coisa em julho e em setembro, em vez de informar que um benchmark que está saturando ficou silencioso.

Vale a pena fixar algumas das linhas próximas para dar contexto, já que são os modelos com os quais os leitores realmente comparam o Opus 5.5:

• Claude Sonnet 5 — 156,34, lançado em 30 de junho, intervalo de 153,61 a 158,81

• Grok 4.6 — 156,61, lançado em 12 de agosto, intervalo de 154,66 a 158,93

• Gemini 3.8 Flash — 156,93, lançado em 2 de setembro, intervalo de 154,64 a 160,42

• Muse Spark 1.3 — 156.86, lançado em 2 de setembro, intervalo de 154.73 a 159.56

• GPT-5.6 Sol — 161.8, lançado em 9 de julho, intervalo de 159.26 a 165.26

Uma posição em índice não é uma fatura

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra on the Epoch Capabilities Index. Left column Claude Opus 5.5: ECI 167.35 with interval 164.0 to 172.0, released 22 September 2026, input $4.00, output $20.00, cache read $0.20, context 1M tokens with 128K output. Right column GPT-6 Astra: ECI 166.51 with interval 163.14 to 171.05, released 3 September 2026, input $10.00, output $50.00, cache read $1.00, context 1.05M tokens with 128K output and a long-context tier above 272K tokens. A footer line reads 'Index figures per the Epoch Capabilities Index file read 2 October 2026; prices per the OrcaRouter catalogue.'

Aqui a tabela de classificação deixa de ser a história completa, porque os dois modelos no topo não custam nem de longe a mesma coisa. Do nosso próprio catálogo, que traz ambos pelo preço de tabela do provedor, sem margem, Claude Opus 5.5 a $4,00/$20,00 com leituras de cache a $0,20 e GPT-6 Astra a $10,00/$50,00 com leituras de cache a $1,00 estão a 2,5 vezes de distância nas duas direções da tabela de preços. O Astra também sobe acima de 272.000 tokens de prompt, quando a entrada vai para $20,00 e a saída para $75,00; o Opus 5.5 mantém $4,00/$20,00 fixos ao longo de toda a sua janela de 1 milhão de tokens. Ambos entregam 128.000 tokens de saída.

Faça as contas que uma carga de trabalho de contexto longo realmente acarreta — um prefixo de 180.000 tokens servido a partir do cache, 5.000 tokens gerados. No Opus 5.5, isso é 180.000 tokens a US$ 0,20 por milhão, ou cerca de 3,6 centavos, mais 5.000 a US$ 20 por milhão, ou 10 centavos: aproximadamente 13,6 centavos. No GPT-6 Astra, são 180.000 a US$ 1,00, ou 18 centavos, mais 5.000 a US$ 50, ou 25 centavos: aproximadamente 43 centavos. Uma vantagem de 0,84 ponto e uma diferença de custo de 3,2 vezes não são o mesmo tipo de fato, e uma decisão de compra que pondera apenas a primeira ponderou o número menor.

Fable 5.1 apresenta o argumento pelo outro lado da mesma tabela de preços do fornecedor: a US$ 10,00/US$ 50,00, tem exatamente o mesmo preço do Astra, e obtém 164,82 — 2,53 pontos abaixo do Opus 5.5 pelo mesmo valor. O índice coloca as três entradas de fronteira da Anthropic a não mais de 2,53 pontos de diferença entre si, e sua tabela de preços as separa por um fator de 2,5, o que descreve muito melhor a escolha diante de um comprador do que qualquer ranking isolado.

Se você vai discutir sobre um número, discuta no seu próprio tráfego.

Screenshot of the Epoch Capabilities Index leaderboard page, showing the ranking list of models by capability score with the composite index chart above it.

A razão pela qual este índice vale a pena ser lido é que ele é medido por alguém que não os fornecedores — mas a estrutura do próprio índice composto define os termos do argumento. A calibração da Epoch, suas estimativas de dificuldade e seu tratamento de modelos que pulam benchmarks estão todos a montante do número na tabela, e nenhum deles é algo que um leitor possa reconstruir a partir de uma captura de tela. O mesmo vale para o benchmark principal de cada fornecedor, e é por isso que o movimento útil não é escolher um lado entre eles, mas compará-los em tráfego que você controla.

Ambos esses modelos são acessíveis com uma única chave de API no OrcaRouter, que repassa o preço de lista do provedor com 0% de margem: Claude Opus 5.5 a $4,00/$20,00 com leituras de cache a $0,20 e GPT-6 Astra a $10,00/$50,00 com seu nível acima de 272K aplicado exatamente como o provedor o define. Enviar o mesmo conjunto de prompts para ambos é uma mudança de configuração, e não um segundo contrato, e, onde ambos estão roteados, failover automático fica por baixo, o que importa para uma decisão tão próxima do piso de ruído. O leaderboard pode lhe dizer que os dois modelos são indistinguíveis. Só a sua própria avaliação pode lhe dizer qual deles é indistinguível no seu trabalho.

Screenshot of the OrcaRouter model page for Claude Opus 5.5 (anthropic/claude-opus-5.5), showing the model header, a 1M-token context window with up to 128K output, the Vision, Tools, JSON and Reasoning capability tags, and the input and output price figures per million tokens.

O que moveria esse número no próximo mês?

O arquivo da Epoch é vivo, e três coisas mudariam a leitura rapidamente. A primeira é qualquer nova avaliação de um modelo de fronteira que entre nos quatro primeiros, já que uma única observação adicional de benchmark move um composto mais quando o grupo está tão apertado do que quando há um líder claro. A segunda é a deriva dos intervalos de confiança — as entradas mais recentes carregam os mais amplos, porque foram avaliadas no menor número de benchmarks sobrepostos, então os lançamentos de setembro são as linhas mais propensas a mudar e os de julho as menos. A terceira é um benchmark atingir a saturação, que é exatamente a falha que o índice foi criado para sobreviver: quando um componente deixa de discriminar, a Epoch repondera a composição em vez de deixar a vantagem de um modelo evaporar com o teste.

Por ora, o resumo defensável é o mais restrito. Claude Opus 5.5 ocupa o primeiro lugar no Epoch Capabilities Index, com 167,35, com base em uma margem de 0,84 ponto que seu próprio intervalo de confiança não sustenta; Claude Sonnet 5.5 subiu da faixa intermediária da mesma linha para ficar a 2,15 pontos da liderança; e o campo de pesos abertos está mais de nove pontos atrás de todos eles. A liderança é uma questão de cara ou coroa entre dois fornecedores. Já a diferença de quatro pontos no preço entre eles não é.

Comparados neste artigo4

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente