
Claude Opus 5.5 vs Claude Fable 5.1: O modelo mais barato venceu o Índice Independente
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 177 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1323 tok/s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
A Anthropic agora vende dois modelos no topo de sua linha, e aquele que custa duas vezes e meia mais caro não é o que está no topo da tabela. Claude Opus 5.5, lançado em 22 de setembro de 2026 a US$ 4 por milhão de tokens de entrada e US$ 20 por milhão de tokens de saída, obtém 58 no Artificial Analysis Intelligence Index. Claude Fable 5.1, que ocupa a posição de carro-chefe desde 1º de setembro a US$ 10 de entrada e US$ 50 de saída, obtém 53. Os dois números vêm do mesmo avaliador, ambos foram medidos na mesma família de configuração, e a diferença segue na direção oposta à das etiquetas de preço. Esse é o fato a partir do qual esta comparação precisa começar, porque quase toda matéria de lançamento da última semana enquadra o Opus 5.5 como a versão com desconto do Fable 5.1 — um modelo mais barato que "acompanha" o modelo caro na maioria das tarefas. O número independente diz que o modelo com desconto está à frente.
Se isso deve mudar o que você implanta é uma questão diferente, e a resposta depende menos da diferença de cinco pontos do que de duas configurações que ninguém coloca numa manchete: a qual nível de esforço cada modelo recorre por padrão, e qual deles pode ser acelerado.
Os números independentes, e a única coisa que eles têm em comum

Artificial Analysis publica uma configuração por modelo, e, para ambos estes, ela é rotulada como "Raciocínio Adaptativo, Esforço Máximo, Fallback Padrão". Mesmo rótulo, mesmo avaliador, mesma execução — o que faz deste o confronto direto mais limpo que qualquer um dos modelos tem:
• Índice de Inteligência — Claude Opus 5.5 58, classificado em #1 de 210 vs Claude Fable 5.1 53, classificado em #4
• Velocidade de saída — Claude Fable 5.1 65,8 tokens/seg, abaixo da mediana de 71,0 do ranking vs Claude Opus 5.5, ainda não publicado no ranking
• Tempo até o primeiro token — Claude Fable 5.1 274,43s vs uma mediana do ranking de 3,83s; Claude Opus 5.5 ainda não publicado
• Verbosidade no Índice — Claude Opus 5.5 gerou 260M tokens de saída, contra uma mediana de 88M em todos os casos
• Preço — Claude Opus 5.5 $4,00 / $20,00 por milhão vs Claude Fable 5.1 $10,00 / $50,00
Duas dessas linhas precisam ser lidas, não citadas. A primeira é o rótulo "Max Effort": a pontuação de nenhum dos modelos reflete sua configuração padrão de lançamento, e os dois padrões não são iguais — mais sobre isso abaixo. A segunda é a linha de verbosidade, que vai contra o modo como o Opus 5.5 tem sido vendido. A história de eficiência da Anthropic é que o modelo chega à mesma resposta com menos tokens, e o material de lançamento cita parceiros que relatam de um terço a metade menos tokens de saída. No Index, medido em vez de citado, o Opus 5.5 emitiu 260M tokens contra uma mediana do ranking de 88M — cerca de três vezes mais verboso que o modelo típico com o qual está sendo comparado. As duas coisas podem ser verdade: ele pode usar menos tokens que o Claude Opus 5 e ainda assim ser um modelo verboso em termos absolutos. Mas, se você fez o orçamento com base na frase "menos tokens" e não na sua própria conta, a medição independente é a que deve ser conferida.
O que os US$ 6 extras por milhão compram

Retire os benchmarks e a diferença é uma tabela de preços. Tudo aqui vem da página de preços publicada da Anthropic, verificável hoje:
• Entrada — US$ 4,00 por milhão no Opus 5.5 vs US$ 10,00 no Fable 5.1
• Saída — $20,00 por milhão vs $50,00
• Leitura de cache — $0.20 por milhão no Opus 5.5 vs $0.25 no Fable 5.1
• Multiplicador de cache — Opus 5.5 cobra acertos de cache a 0,05x da entrada base; Fable 5.1 os cobra a 0,025x, um multiplicador melhor sobre uma base mais alta
• Gravação em cache — US$ 5 por milhão para uma janela de 5 minutos e US$ 8 por hora no Opus 5.5, versus US$ 12,50 e US$ 20 no Fable 5.1
• API em lote — Opus 5.5 cai para metade, para $2,00 / $10,00; Fable 5.1 cai para metade, para $5,00 / $25,00
• Modo rápido — o Opus 5.5 é compatível por US$ 8,00 / US$ 40,00 para até cerca de 2,5x a velocidade de saída; o Fable 5.1 não é compatível com o modo rápido de forma alguma
A linha de cache é a que merece uma segunda olhada, porque os dois modelos invertem o padrão habitual. O Fable 5.1 tem o multiplicador mais agressivo — 2,5% da entrada base contra 5% do Opus 5.5 —, mas, como sua base é US$ 10 em vez de US$ 4, sua leitura de cache ainda é a mais cara dos dois em dólares absolutos. Não há configuração em que o modelo premium leve vantagem em um token de contexto em cache. E o multiplicador não é algo que se possa portar: um loop de agente ajustado ao comportamento de cache do Fable 5.1 pagará proporcionalmente mais por acerto de cache no Opus 5.5, ainda que pague menos por token novo.
O modo rápido é a assimetria mais acentuada. A documentação da Anthropic lista o modo rápido para Claude Opus 5.5, Claude Opus 5 e Claude Opus 4.8 — Fable 5.1 está ausente dessa lista. Então o modelo mais barato tem uma alavanca de latência que o caro simplesmente não tem, a $8/$40, o que ainda está abaixo da taxa de saída padrão de $10/$50 do Fable 5.1. Se sua carga de trabalho for interativa o suficiente para que um primeiro token lento seja um problema de produto, observe que o tempo medido até o primeiro token do Fable 5.1 é de 274 segundos. Esse número é um artefato do raciocínio de esforço máximo, não um defeito, mas é o número que um avaliador registrou.
Os padrões não são os mesmos, e essa é a armadilha.
A própria documentação de modelos da Anthropic coloca os dois modelos lado a lado, e a linha que decide a maioria das comparações reais não é o preço. É o nível de esforço padrão: médio para o Claude Opus 5.5, alto para o Claude Fable 5.1. Ambos usam raciocínio adaptativo que não pode ser desativado; a profundidade é controlada apenas pelo parâmetro effort, numa escala que abrange low, medium, high, xhigh e max.
É por isso que a frase de lançamento "Opus 5.5 iguala Fable 5.1 na maioria dos trabalhos" e as tabelas de benchmark logo abaixo dela parecem discordar. As linhas de comparação direta da Anthropic para o Opus 5.5 são frequentemente rotuladas com uma configuração de esforço mais alta que a padrão — o número de 66,4% do Terminal-Bench 4.0 contra os 55,8% do Fable 5.1 foi executado com esforço xhigh, não com medium. Enquanto isso, os próprios números do Fable 5.1 foram produzidos em seu padrão mais alto. Dois modelos comparados em configurações de esforço diferentes não estão sendo comparados de forma alguma, e a Anthropic diz isso mesmo em seu próprio material de lançamento quando adverte que margens de benchmark nesse nível de capacidade são um guia menos confiável para a diferença no mundo real do que as pontuações dão a entender.
Na prática, isso transforma a decisão em um exercício de ajuste, e não de seleção. Se você migrar do Fable 5.1 para o Opus 5.5 e levar a sua effort configuração sem alterações, você terá mudado silenciosamente o quanto o modelo pensa, e todos os números de qualidade e de custo que você gerar daí em diante ficam confundidos. A orientação da Anthropic é testar vários níveis de effort em vez de portar as configurações do modelo antigo. Isso é barato de fazer e quase ninguém faz, porque significa rodar suas próprias avaliações duas vezes.
O único lugar em que a combinação se justifica
O padrão que justifica manter ambos é o loop do consultor: Opus 5.5 fazendo o trabalho, Fable 5.1 consultado nas decisões difíceis. A Anthropic mediu isso, e de fato adiciona precisão — a custo e latência maiores, que é o trade-off que você esperaria ao colocar o modelo mais lento no loop. O que mudou é a aritmética por trás disso. Quando a lacuna de capacidade era maior, pagar $10/$50 para supervisionar um trabalhador de $5/$25 obviamente valia a pena. Agora que o trabalhador obtém pontuação maior que o consultor no índice independente, a contribuição do consultor se restringe às tarefas específicas em que suas próprias avaliações superam o Opus 5.5, e essas são as tarefas que você mesmo precisa identificar. O loop ainda faz sentido para um subconjunto difícil; deixa de fazer sentido como configuração generalizada.
Ambos estão a uma tecla de distância.
O detalhe da migração que pega as equipes de surpresa aqui não é a superfície da API — é que estes são modelos do mesmo fornecedor com escalas de esforço diferentes, multiplicadores de cache diferentes e configurações padrão diferentes, e compará-los honestamente significa executar ambos com seus próprios prompts em uma configuração equivalente. Claude Opus 5.5 está no OrcaRouter pelo preço da própria Anthropic, de US$ 4,00 / US$ 20,00, e Claude Fable 5.1 está no OrcaRouter a US$ 10,00 / US$ 50,00 — preço de lista do provedor repassado com 0% de markup, então ambos os números mudam no dia em que a Anthropic os mudar, e nenhum deles implica um segundo contrato ou um segundo SDK.

É isso que torna a divisão prática, e não teórica. Enviar a maior parte do seu tráfego para o Opus 5.5 e fixar uma regra de roteamento que encaminha os casos genuinamente difíceis para o Fable 5.1 é uma configuração em um único endpoint, não duas integrações — e compor uma chamada para que um modelo redija enquanto o outro verifica é uma linha de routing-DSL, e não um pipeline que você precisa criar e manter. Se o caminho de escalonamento se revelar errado para a sua carga de trabalho, o failover automático mantém a solicitação chegando a um modelo que você já caracterizou, em vez de falhar por completo.
O que resolveria isso
O estado honesto desta comparação é que a Anthropic publicou uma tabela em que o modelo mais barato vence na maioria das linhas, a Artificial Analysis publicou outra em que ele vence de forma inequívoca, e ambas foram executadas com configurações de esforço que você não usa em produção. Nenhuma delas é uma comparação direta controlada com os padrões equivalentes, e nenhum terceiro realizou uma. A diferença que sobrevive a tudo isso — que o Claude Opus 5.5 é substancialmente mais barato em todas as linhas da tabela de preços, oferece suporte a um modo rápido que o Fable 5.1 não oferece, e não está atrás na única pontuação independente que ambos os modelos possuem — é grande o suficiente para que o ônus da prova tenha mudado de lado. Se você usa o Fable 5.1 por padrão, a questão já não é se o Opus 5.5 é bom o bastante; é quais tarefas específicas da sua carga de trabalho falham com esforço medium, porque essas são as únicas pelas quais você está pagando o prêmio.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
