
Claude Sonnet 5.5 empata com Claude Fable 5.1 no Epoch Capabilities Index
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 221 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Um empate no topo de uma tabela de classificação costuma ser a coisa menos interessante dela. Este é a exceção, porque os dois modelos empatados no topo não custam o mesmo dinheiro. No arquivo do Epoch Capabilities Index atualizado em 1º de outubro de 2026, Claude Sonnet 5.5 e Claude Fable 5.1 marcam ambos 165 — linhas três e quatro de 253 modelos monitorados — dois pontos atrás de Claude Opus 5.5 e GPT-6 Astra, que por sua vez estão empatados em 167, e dois pontos à frente de Claude Opus 5, com 163. O Claude Sonnet 5.5 foi lançado em 28 de setembro de 2026 a US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de saída. O Claude Fable 5.1 foi lançado em 1º de setembro a US$ 10 e US$ 50. Um único número diz que os dois são intercambiáveis em capacidade geral. Cinco vezes o preço de saída diz que não são. Ambos se sustentam, e a razão pela qual se sustentam juntos é a parte da tabela que ninguém cita.
O que o índice realmente é, e quem está medindo
O ECI não é um placar de fornecedores. Ele é criado pela Epoch AI, uma organização de pesquisa independente, como um composto que reúne pontuações de mais de cinquenta benchmarks distintos em uma única escala de capacidade geral, inferindo a dificuldade relativa de cada benchmark a partir dos modelos que, por acaso, aparecem em vários deles ao mesmo tempo. A metodologia é apresentada em um artigo, “A Rosetta Stone for AI Benchmarks”, financiado pela Google DeepMind e escrito com pesquisadores de sua equipe de AGI Safety & Alignment — mas a Epoch afirma claramente que o índice é seu próprio produto e que detém plenos direitos sobre ele, e o código de ajuste é público. Essa distinção importa quando o financiador da pesquisa e o publicador da pontuação não são a mesma parte.
Duas propriedades da escala decidem como um número nela pode ser lido. A primeira é que o ECI é ancorado em vez de absoluto: os valores brutos são reescalonados de modo que Claude 3.5 Sonnet fica em 130 e GPT-5 em 150, o que significa que um número só significa algo ao lado de outro número do mesmo arquivo. A segunda é que não há teto. Não há um 100 para se aproximar, então “topo do índice” é uma afirmação sobre uma data e não sobre um limite que alguém tenha alcançado.
A terceira propriedade é a que transforma um empate em uma história. Os intervalos publicados ao lado de cada pontuação — intervalos bootstrap de 90%, construídos ao reamostrar quinhentas vezes os próprios resultados de benchmark observados de cada modelo — são idênticos para os dois modelos em 165: 162 a 169 para o Claude Sonnet 5.5 e 162 a 169 para o Claude Fable 5.1. As contagens que os produziram não são. O 165 do Claude Sonnet 5.5 é ajustado a partir de 11 avaliações de benchmark. O do Claude Fable 5.1 é ajustado a partir de 20.
Por que o mesmo intervalo não significa a mesma evidência
O ECI precisa de um mínimo de quatro avaliações de benchmark antes que um modelo seja sequer pontuado, pelo que ambos os números ultrapassam o limiar com folga. Mas o intervalo é uma afirmação sobre o quanto os próprios resultados de um modelo se dispersam, não sobre quantos são — é por isso que dois modelos podem apresentar a mesma faixa em torno da mesma estimativa pontual, enquanto um deles assenta em cerca de metade das evidências. Trate os dois 165 como igualmente firmes e terá lido o intervalo como uma correção de tamanho de amostra que ele não é.
A assimetria tem uma consequência prática para o timing. A Epoch reajusta o modelo inteiro de forma conjunta em todos os dados sempre que novas avaliações chegam, de modo que o valor de um modelo pode mudar sem que nada mude nesse modelo. O modelo que carrega 11 observações tem mais espaço para se mover do que o que carrega 20, o que torna o Claude Sonnet 5.5 o mais propenso dos dois a mudar na próxima revisão — em qualquer direção.
O próprio enquadramento da Epoch sobre a leitura atual é mais restrito do que as manchetes que produziu. O resumo da atualização feito pela organização abre com Claude Opus 5.5 a assumir o primeiro lugar com 167, ligeiramente à frente do GPT-6 Astra, e dedica a segunda frase ao facto de Claude Sonnet 5.5 ter “praticamente igualado” Claude Fable 5.1 com 165. Praticamente igualado é a expressão decisiva, e os intervalos publicados são a razão pela qual é a mais acertada.
Onde os dois perfis de fato divergem

Estar ao mesmo nível no composto não significa estar ao mesmo nível nas partes. A Epoch publica um painel por benchmark em cada página de modelo, e seis benchmarks aparecem tanto na página do Claude Sonnet 5.5 quanto na página do Claude Fable 5.1 — o que faz desses os únicos seis em que uma comparação em pé de igualdade está disponível a partir do próprio índice.
• Quebra-cabeças de Jogos de Mistério — Claude Sonnet 5.5 65% vs Claude Fable 5.1 58%
• Níveis 1–3 do FrontierMath (v2) — Claude Sonnet 5.5 89% vs Claude Fable 5.1 90%
• FrontierMath Nível 4 (v2) — Claude Sonnet 5.5 80% vs Claude Fable 5.1 88%
• OTIS Simulado AIME 2024–2025 — Claude Sonnet 5.5 100% vs Claude Fable 5.1 100%
• Benchmark de Montagem de Móveis — Claude Sonnet 5.5 75% vs Claude Fable 5.1 70%
• SimpleQA Verified — Claude Sonnet 5.5 47% vs Claude Fable 5.1 71%
Quatro pontos de variação para cima ou para baixo num índice composto tão disputado, e a divisão subjacente está longe de ser simétrica. O Claude Sonnet 5.5 está à frente onde o trabalho é do tipo jogos e multimodal — resolução de quebra-cabeças, montagem física — e está empatado em matemática de competição. O Claude Fable 5.1 está à frente por 8 pontos no nível mais difícil do FrontierMath e por 24 pontos no SimpleQA Verified, o conjunto de conhecimento de mundo em que uma pontuação de 47% contra 71% é a maior diferença isolada no painel compartilhado. Um comprador que escolhe entre esses dois modelos não está escolhendo entre duas leituras da mesma capacidade; está escolhendo entre um modelo mais barato que é mais forte em alguns trabalhos e um mais caro que é mais forte em outros, com um índice de capacidade geral que se recusa a separá-los.
O índice da Epoch também é explícito ao afirmar que uma liderança em um benchmark específico não precisa aparecer no composto. Os benchmarks não são ponderados por precisão, e um modelo especializado pode ficar com uma pontuação abaixo de um rival de formato diferente mesmo enquanto lidera testes individuais — a própria documentação diz isso diretamente. Isso não é um defeito sendo justificado; é justamente para isso que serve um composto que abrange mais de cinquenta testes.
Os dois instrumentos independentes apontam em direções opostas

Existe uma segunda medição independente em circulação, e ela não concorda com a primeira sobre qual destes dois modelos está à frente. No Artificial Analysis Intelligence Index, os números que o nosso próprio catálogo apresenta para os dois modelos são 56 para Claude Sonnet 5.5 e 53.4 para Claude Fable 5.1, extraídos da mesma revisão desse índice e, portanto, referentes à mesma amostra de modelos avaliados. Três pontos de diferença, a favor do modelo mais barato — ao passo que a Epoch os considera idênticos.
Nenhuma das leituras está errada, e a maneira de usá-las é observar em que discordam. Os dois índices cobrem conjuntos diferentes de benchmarks e os ponderam de forma diferente; o composto Epoch é construído para sobreviver à saturação dos benchmarks, enquanto o índice Artificial Analysis é um agregado direto de uma cesta diferente. Quando um par de modelos está tão próximo, a escolha do instrumento vale mais do que a diferença medida. Um leitor que quer o maior de dois números adjacentes deve olhar para o painel de benchmarks individuais compartilhados acima, e não para qualquer um dos números principais, porque esse é o único lugar em que os dois modelos são comparados entre si no mesmo teste.
Há mais um elemento de contexto que o índice composto não carrega, mas o Epoch carrega: a data de lançamento. O Claude Fable 5.1 ocupa hoje a quarta posição entre os 253 modelos monitorados. No momento do seu próprio lançamento, em 1 de setembro de 2026, ocupava a primeira posição entre os 247 modelos então monitorados. Seus pesos não mudaram. A fronteira simplesmente passou à frente dele seis posições em um mês — o que é o formato da tabela inteira e a razão pela qual uma leitura mensal do índice é um instantâneo, e não um veredito.
Quanto custa a diferença, e onde está o lado barato

Estar nivelados em capacidade geral, com uma diferença de 2,5 vezes na entrada e de 5 vezes na saída, é todo o conteúdo prático desta leitura. Ambos os modelos estão no nosso próprio catálogo — anthropic/claude-sonnet-5.5 a $2,00 por milhão na entrada e $10,00 por milhão na saída, com leituras de cache a $0,20, e anthropic/claude-fable-5.1 a $10,00 e $50,00, com leituras de cache a $0,25 — e ambos são repassados pelo preço de tabela do próprio provedor, sem nenhuma margem adicionada, de modo que uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia em que chega ao lado deles.
A recorrência importa mais do que a manchete. Considere uma carga de trabalho que envia um prefixo de 120.000 tokens do cache e gera 8.000 tokens de saída, executada uma vez por dia durante um mês. No Claude Sonnet 5.5, esse prefixo custa 120.000 tokens a US$ 0,20 por milhão, cerca de 2,4 centavos, mais 8.000 a US$ 10 por milhão, 8 centavos — aproximadamente 10,4 centavos por execução, ou cerca de US$ 3,12 ao longo de trinta dias. No Claude Fable 5.1, o mesmo prefixo é 120.000 a US$ 0,25, 3 centavos, mais 8.000 a US$ 50, 40 centavos — cerca de 43 centavos por execução, ou US$ 12,90 no mês. Ambos os modelos atendem à mesma janela de 1M tokens com saída de até 128K, então a diferença está na tabela de preços, não no teto.
Em contrapartida, os seis benchmarks compartilhados mostram em que direção o dinheiro extra compra algo. Uma equipe cujo trabalho se parece com o FrontierMath Tier 4 ou com recuperação factual aberta está comprando uma vantagem real de 8 a 24 pontos nesses testes ao pagar quatro vezes mais; uma equipe cujo trabalho se parece com resolução de quebra-cabeças ou montagem multimodal está comprando de 5 a 7 pontos na direção oposta enquanto paga o valor menor. Em uma única plataforma, essas não são duas decisões de aquisição. Ambos os modelos ficam atrás de uma chave de API entre mais de 200 modelos, então compará-los no seu próprio tráfego é uma mudança de configuração, e não um segundo contrato, e, onde ambos são roteados, há failover automático por baixo — o que importa quando dois instrumentos independentes discordam sobre qual deles está à frente.
O que moveria esta leitura
Três coisas mudariam isso, e apenas uma delas envolve qualquer um dos dois modelos.
O primeiro é mais avaliações de benchmark. Claude Sonnet 5.5 entrou no índice há quatro dias com 11 atrás dele; cada avaliação adicional estreita seu intervalo e pode mover sua estimativa pontual, e um reajuste conjunto significa que o movimento não se limita à nova linha.
O segundo é a chegada de outro modelo de fronteira. As quatro primeiras linhas abrangem quatro pontos, com dois empates dentro desse intervalo, de modo que um único recém-chegado bem avaliado cai dentro do agrupamento, e não abaixo dele — e os intervalos publicados, que se sobrepõem em todos os quatro, significam que a ordenação entre eles é um critério de desempate, e não uma medição.
O terceiro é o preço dos próprios modelos, que nenhum índice acompanha. A lacuna em que este artigo se centra é uma lacuna de tabela de preços: $2 e $10 contra $10 e $50 hoje. Uma alteração em qualquer uma das tabelas muda a decisão sem alterar uma única pontuação de capacidade.
O resumo defensável é o mais restrito. No composto da Epoch AI, em um arquivo atualizado em 1º de outubro de 2026, Claude Sonnet 5.5 e Claude Fable 5.1 têm o mesmo número — 165, empatados na terceira posição, com intervalos publicados idênticos baseados em quantidades diferentes de evidências. No instrumento separado da Artificial Analysis, os mesmos dois modelos estão separados por três pontos. Nos seis benchmarks em que o índice os compara diretamente, eles alternam a liderança por domínio, em vez de permanecerem empatados. E, na tabela de preços, eles não estão nem de longe próximos. A única coisa que esta leitura não sustentará é a frase pela qual ela provavelmente será citada: que os modelos são equivalentes.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
