
Claude Opus 5.5 lidera o Epoch Capabilities Index por 0,84 ponto
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O número é 0,84. Claude Opus 5.5 está em 167,35 no Epoch Capabilities Index conforme o arquivo que lemos em 2 de outubro de 2026, com GPT-6 Astra em 166,51 — uma diferença de menos de um ponto numa escala em que os intervalos de 95% publicados para os dois modelos se sobrepõem quase totalmente, 164,0 a 172,0 para o Opus 5.5 contra 163,14 a 171,05 para o Astra. Abaixo deles, Claude Sonnet 5.5 registrou 165,2 e Claude Fable 5.1 164,82, de modo que as quatro primeiras entradas de um composto independente de mais de cinquenta benchmarks estão separadas por 2,53 pontos e três delas carregam o nome do mesmo fornecedor. A ordenação é real no sentido de que as estimativas pontuais estão ordenadas. Não é real no sentido de que uma vantagem de 0,84 ponto sobrevive às suas próprias barras de erro, e tudo o que vale a pena dizer sobre essa tabela de classificação decorre de sustentar ambos esses fatos ao mesmo tempo.
O que o índice é, e o que 0,84 de um ponto não é
O Epoch Capabilities Index não é um placar de fornecedores. Ele é construído pela Epoch AI, uma organização de pesquisa independente, como um composto que reúne pontuações de mais de cinquenta benchmarks distintos em uma única escala de capacidade geral, inferindo a dificuldade relativa de cada benchmark a partir dos modelos que por acaso aparecem em vários deles ao mesmo tempo. A metodologia é apresentada em um artigo escrito com pesquisadores da equipe de AGI Safety & Alignment do Google DeepMind e financiado pela DeepMind, mas a Epoch afirma claramente que o índice é um produto próprio e que detém plenos direitos sobre ele — uma distinção que vale a pena manter quando a fonte de financiamento e o publicador de uma pontuação não são a mesma parte. O código é público.
Duas propriedades da escala importam mais do que a manchete. A primeira é que o ECI é deliberadamente ancorado, e não absoluto: as pontuações brutas são reescalonadas para que o Claude 3.5 Sonnet fique em 130 e o GPT-5 em 150, o que significa que um número neste índice só tem significado ao lado de outro número do mesmo arquivo, nunca isoladamente. A segunda é que o índice não tem teto. Não há um 100 a alcançar, portanto "topo do índice" é uma afirmação sobre uma data, não sobre um limite que alguém tenha atingido.
É por isso que a leitura honesta de 167,35 contra 166,51 não é “o Claude Opus 5.5 é o modelo mais capaz do mundo”. Ela é mais restrita e menos citável: na modelagem da Epoch das evidências disponíveis em 2 de outubro de 2026, os dois modelos são indistinguíveis no topo, e a ordenação entre eles é um critério de desempate, e não uma medição. Os intervalos publicados dizem isso diretamente — 164,0 a 172,0 e 163,14 a 171,05 compartilham a grande maioria de sua faixa. Qualquer pessoa que cite o 0,84 como veredito está citando um artefato de arredondamento.
O bloco da Anthropic, e o tamanho de um lançamento
O aspecto mais informativo da tabela não é quem está em primeiro lugar. São a terceira e a quarta linhas. Claude Sonnet 5.5, lançado em 28 de setembro e com pontuação 165,2, fica 0,38 ponto acima de Claude Fable 5.1, lançado em 1º de setembro com 164,82 — próximos o suficiente para que os dois estejam na mesma posição na prática, e próximos o suficiente para que o par fique apenas 2,15 pontos abaixo do topo da tabela. Sonnet é o produto de nível intermediário da linha da Anthropic, e Fable é o modelo que a empresa historicamente apontou para trabalho de raciocínio geral; que ambos agora margeiem a fronteira logo por baixo é a mudança substantiva nesta atualização, mais do que a identidade do líder.
O próprio salto geracional da Anthropic também está visível. O Claude Opus 5.5 é o sucessor do Claude Opus 5, que a Epoch pontua em 162,94, com um intervalo de 160,2 a 166,7. Isso representa uma melhoria de 4,41 pontos em cerca de dois meses, de um lançamento em 24 de julho a um em 22 de setembro — um movimento maior do que os 0,84 pontos que separam o primeiro e o segundo lugar atuais. Lido dessa forma, a quantidade interessante nesta tabela é a inclinação dentro da linha de um único fornecedor, não a diferença entre dois fornecedores no topo.
Onde a linha dos open-weights se estende
A Epoch separa os modelos por acessibilidade, o que torna a fronteira dos pesos abertos legível sem precisar adivinhar. A melhor entrada de pesos abertos é o Kimi K3, com 157,61, datado de 16 de julho e rotulado como não comercial. Atrás dele estão o DeepSeek V4 Pro 0813, com 155,38, e o DeepSeek V4.1 Flash, com 155,0, ambos irrestritos, depois o GLM-5.3-Flash, com 151,94, e o GLM-5.2, com 151,78. O modelo aberto mais próximo do topo está, portanto, 9,74 pontos atrás — uma lacuna dezoito vezes maior que a que separa o primeiro e o segundo lugar, e ampla o suficiente para que os intervalos não cheguem nem perto de se tocar.
Essa assimetria é o único achado duradouro da tabela. A fronteira fechada é um aglomerado dentro de três pontos; a distância da fronteira fechada até os melhores pesos disponíveis para download é uma ordem de magnitude maior. Um índice composto que permite comparar entre gerações de benchmark é exatamente a ferramenta para perceber isso, porque consegue dizer a mesma coisa em julho e em setembro, em vez de informar que um benchmark que está saturando ficou silencioso.
Vale a pena fixar algumas das linhas próximas para dar contexto, já que são os modelos com os quais os leitores realmente comparam o Opus 5.5:
• Claude Sonnet 5 — 156,34, lançado em 30 de junho, intervalo de 153,61 a 158,81
• Grok 4.6 — 156,61, lançado em 12 de agosto, intervalo de 154,66 a 158,93
• Gemini 3.8 Flash — 156,93, lançado em 2 de setembro, intervalo de 154,64 a 160,42
• Muse Spark 1.3 — 156.86, lançado em 2 de setembro, intervalo de 154.73 a 159.56
• GPT-5.6 Sol — 161.8, lançado em 9 de julho, intervalo de 159.26 a 165.26
Uma posição em índice não é uma fatura

Aqui a tabela de classificação deixa de ser a história completa, porque os dois modelos no topo não custam nem de longe a mesma coisa. Do nosso próprio catálogo, que traz ambos pelo preço de tabela do provedor, sem margem, Claude Opus 5.5 a $4,00/$20,00 com leituras de cache a $0,20 e GPT-6 Astra a $10,00/$50,00 com leituras de cache a $1,00 estão a 2,5 vezes de distância nas duas direções da tabela de preços. O Astra também sobe acima de 272.000 tokens de prompt, quando a entrada vai para $20,00 e a saída para $75,00; o Opus 5.5 mantém $4,00/$20,00 fixos ao longo de toda a sua janela de 1 milhão de tokens. Ambos entregam 128.000 tokens de saída.
Faça as contas que uma carga de trabalho de contexto longo realmente acarreta — um prefixo de 180.000 tokens servido a partir do cache, 5.000 tokens gerados. No Opus 5.5, isso é 180.000 tokens a US$ 0,20 por milhão, ou cerca de 3,6 centavos, mais 5.000 a US$ 20 por milhão, ou 10 centavos: aproximadamente 13,6 centavos. No GPT-6 Astra, são 180.000 a US$ 1,00, ou 18 centavos, mais 5.000 a US$ 50, ou 25 centavos: aproximadamente 43 centavos. Uma vantagem de 0,84 ponto e uma diferença de custo de 3,2 vezes não são o mesmo tipo de fato, e uma decisão de compra que pondera apenas a primeira ponderou o número menor.
Fable 5.1 apresenta o argumento pelo outro lado da mesma tabela de preços do fornecedor: a US$ 10,00/US$ 50,00, tem exatamente o mesmo preço do Astra, e obtém 164,82 — 2,53 pontos abaixo do Opus 5.5 pelo mesmo valor. O índice coloca as três entradas de fronteira da Anthropic a não mais de 2,53 pontos de diferença entre si, e sua tabela de preços as separa por um fator de 2,5, o que descreve muito melhor a escolha diante de um comprador do que qualquer ranking isolado.
Se você vai discutir sobre um número, discuta no seu próprio tráfego.

A razão pela qual este índice vale a pena ser lido é que ele é medido por alguém que não os fornecedores — mas a estrutura do próprio índice composto define os termos do argumento. A calibração da Epoch, suas estimativas de dificuldade e seu tratamento de modelos que pulam benchmarks estão todos a montante do número na tabela, e nenhum deles é algo que um leitor possa reconstruir a partir de uma captura de tela. O mesmo vale para o benchmark principal de cada fornecedor, e é por isso que o movimento útil não é escolher um lado entre eles, mas compará-los em tráfego que você controla.
Ambos esses modelos são acessíveis com uma única chave de API no OrcaRouter, que repassa o preço de lista do provedor com 0% de margem: Claude Opus 5.5 a $4,00/$20,00 com leituras de cache a $0,20 e GPT-6 Astra a $10,00/$50,00 com seu nível acima de 272K aplicado exatamente como o provedor o define. Enviar o mesmo conjunto de prompts para ambos é uma mudança de configuração, e não um segundo contrato, e, onde ambos estão roteados, failover automático fica por baixo, o que importa para uma decisão tão próxima do piso de ruído. O leaderboard pode lhe dizer que os dois modelos são indistinguíveis. Só a sua própria avaliação pode lhe dizer qual deles é indistinguível no seu trabalho.

O que moveria esse número no próximo mês?
O arquivo da Epoch é vivo, e três coisas mudariam a leitura rapidamente. A primeira é qualquer nova avaliação de um modelo de fronteira que entre nos quatro primeiros, já que uma única observação adicional de benchmark move um composto mais quando o grupo está tão apertado do que quando há um líder claro. A segunda é a deriva dos intervalos de confiança — as entradas mais recentes carregam os mais amplos, porque foram avaliadas no menor número de benchmarks sobrepostos, então os lançamentos de setembro são as linhas mais propensas a mudar e os de julho as menos. A terceira é um benchmark atingir a saturação, que é exatamente a falha que o índice foi criado para sobreviver: quando um componente deixa de discriminar, a Epoch repondera a composição em vez de deixar a vantagem de um modelo evaporar com o teste.
Por ora, o resumo defensável é o mais restrito. Claude Opus 5.5 ocupa o primeiro lugar no Epoch Capabilities Index, com 167,35, com base em uma margem de 0,84 ponto que seu próprio intervalo de confiança não sustenta; Claude Sonnet 5.5 subiu da faixa intermediária da mesma linha para ficar a 2,15 pontos da liderança; e o campo de pesos abertos está mais de nove pontos atrás de todos eles. A liderança é uma questão de cara ou coroa entre dois fornecedores. Já a diferença de quatro pontos no preço entre eles não é.
Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
