
Claude Fable 5.1 vs Grok 4.6: Nove pontos de índice e um preço de saída oito vezes maior — o que a diferença realmente compra
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2123Inteligência49Código
Claude Fable 5.1 e Grok 4.6 são os dois modelos de fronteira fechados que delimitam a faixa de preço da geração atual. O novo carro-chefe da Anthropic, lançado em 1º de setembro de 2026, cobra US$ 10,00 por milhão de tokens de entrada e US$ 50,00 por milhão de tokens de saída, e na versão atual do Índice de Inteligência da Artificial Analysis ele marca 53 — primeiro dos 201 modelos que esse índice acompanha. O Grok 4.6 da SpaceXAI, disponível desde 12 de agosto, custa US$ 2,00 e US$ 6,00 pelas mesmas unidades e mede 44, vigésimo de 201. Nove pontos de índice os separam. Oito vezes o preço de saída os separa. Qual desses dois números uma determinada carga de trabalho deve levar em conta é toda a questão, e eles apontam em direções diferentes dependendo do que você está pedindo ao modelo para fazer.
Fontes, declaradas de antemão: a Artificial Analysis reavaliou seu Índice de Inteligência em setembro, portanto os números aqui são extraídos da versão atual, capturada em 10 de setembro de 2026, em vez da escala mais antiga ainda citada em grande parte da cobertura de agosto. Os escores do índice de versões diferentes não são comparáveis, e é por isso que os números abaixo podem parecer mais baixos do que o que você leu sobre cada modelo no lançamento. Tudo o que está rotulado como informado pelo fornecedor vem da ficha de avaliação do próprio laboratório lançador e não foi reproduzido por uma parte neutra. Essa ressalva pesa de forma desigual aqui — o Grok 4.6 passou por um mês de escrutínio externo, enquanto o Claude Fable 5.1 tem nove dias e a maior parte do que se sabe publicamente sobre seus números principais ainda é a palavra da Anthropic.
Dois laboratórios, duas coisas diferentes à venda.
O lançamento de setembro da Anthropic é uma jogada de capacidade com uma história de segurança atrelada a ela. O Claude Fable 5.1 é o gêmeo de disponibilidade geral do Claude Mythos 5.1, o irmão com restrições de segurança que só alcança organizações verificadas de cibersegurança e ciências da vida — mesmo modelo base, diferentes salvaguardas. O que a Anthropic está vendendo é o topo do índice independente, uma janela de contexto de 1M de tokens, até 128K de tokens de saída em uma única resposta, e um ecossistema de agentes construído em torno do Claude Code e dos aplicativos Claude. A proposta é direta: este é o modelo que você chama quando o trabalho é difícil o suficiente para que uma resposta errada custe mais do que os tokens custaram.
A SpaceXAI está vendendo algo mais restrito e, com o tempo, mais agressivo — o modelo mais barato que ainda é de classe de fronteira, com preço baixo o suficiente para tornar a construção de agentes em qualquer outra coisa algo extravagante. O Grok 4.6 não é uma expansão: é a mesma base do Grok 4.5 com um treinamento suplementar mais longo e aprendizado por reforço mais intenso, o que, segundo o fornecedor, garante "inteligência comparável ao GPT-5.6 Sol e ao Claude Fable 5". A US$ 2/US$ 6, e ainda dentro dos vinte primeiros do índice, esse é todo o argumento. É também uma estratégia, não apenas um preço. A SpaceXAI é dona da Cursor, lançou seu agente de navegador Grok Bot no dia anterior ao modelo e opera seus próprios aplicativos de chat para consumidores; um modelo de fronteira a preços de commodity é combustível para todos eles. A aritmética pública de Elon Musk — receita de IA ultrapassando todos os outros segmentos da empresa, 10 GW de computação — aponta na mesma direção. Este modelo não tem preço para maximizar a margem da API.
A ficha técnica, dimensão por dimensão
• Preço por 1 milhão de tokens — Claude Fable 5.1 $10.00 entrada / $50.00 saída vs Grok 4.6 $2.00 entrada / $6.00 saída.
• Entrada em cache — Claude Fable 5.1 $0.25 por 1M vs Grok 4.6 $0.50, e a Artificial Analysis lista um desconto efetivo de cache de 98% contra 75%.
• Preços de contexto longo — Claude Fable 5.1 precifica sua janela de forma fixa até 1M de tokens; Grok 4.6 recalcula o preço da solicitação inteira para $4,00 / $12,00 / $1,00 no momento em que ultrapassa 200K tokens de entrada, então seu desconto diminui exatamente onde ocorrem execuções longas de agentes.
• Contexto e saída — Claude Fable 5.1 possui uma janela de contexto de 1M de tokens e até 128K tokens de saída, contra a janela de contexto de 500K do Grok 4.6, um controle de esforço de raciocínio que vai de low a xhigh, e uma variante mais rápida com o dobro da velocidade.
• Pontuação, velocidade e custo independentes — a Artificial Analysis apresenta o Claude Fable 5.1 com 53 no seu atual Índice de Inteligência (#1 de 201), 67,2 tokens de saída por segundo e $7,63 por tarefa do Índice; o Grok 4.6 fica em 44 (#20 de 201), 52,8 tokens por segundo e $1,86 por tarefa. Ambos são classificados como "muito verbosos" ou "um tanto verbosos" por essa medição — 190M tokens de saída para o modelo Claude contra 94M para o Grok.
• Alegações de benchmarks de fornecedores — A Anthropic relata 52,6% no Terminal-Bench-Science 0.1 (mais que o dobro dos 24,7% do Claude Fable 5), 55,8% no Terminal-Bench 4.0 e 1.853 no GDPval-AA v2 para o Claude Fable 5.1. A SpaceXAI relata 65,9% no DeepSWE v1.1 e 69,9% no CursorBench v3.2 para o Grok 4.6, juntamente com 26% autorrelatados no Terminal-Bench v3.0 — a única linha na própria tabela do fornecedor que é notavelmente fraca.
• Onde cada um executa — a API da Anthropic, os aplicativos Claude, o Claude Code, o Amazon Bedrock, o Google Cloud e o Microsoft Foundry vs a API SpaceXAI, o Cursor, o Grok Build, o agente Grok Bot, os aplicativos de consumo Grok e o Amazon Bedrock GovCloud.
• Lançado — Claude Fable 5.1 em 1º de setembro de 2026; Grok 4.6 em 12 de agosto de 2026.

O que nove pontos de índice realmente representam
No índice independente atual, a ordem de setembro é inequívoca: Claude Fable 5.1 com 53 e primeiro de 201; Grok 4.6 com 44 e vigésimo. O índice recalculado precisa de um esclarecimento, porque é o tipo de coisa que faz os números da semana de lançamento parecerem errados em retrospectiva: a Artificial Analysis reformulou seu Intelligence Index em setembro, e as pontuações publicadas de ambos os modelos caíram quando isso aconteceu. Uma diferença de nove pontos é real, mas o índice é um composto ponderado — fortemente inclinado para o trabalho agêntico, com codificação, raciocínio científico e capacidade geral por trás — então ele comprime um quadro misto por dimensão em uma única linha.
A evidência por dimensão é mais ruidosa e mais útil. O número da própria Anthropic no Terminal-Bench-Science 0.1 — 52,6%, mais que o dobro dos 24,7% da geração anterior — visa exatamente os fluxos de trabalho científicos e de pesquisa de longo horizonte que interessam aos compradores de agentes, e nenhum modelo atual chega perto desse número nesse benchmark específico. A tabela de fornecedores da SpaceXAI é mais forte em engenharia de software (65,9% DeepSWE v1.1, 69,9% CursorBench v3.2) e mais fraca em loops de agentes com uso intensivo de terminal, onde os próprios 26% do Grok 4.6 no Terminal-Bench v3.0 ficam abaixo dos 34,6% do GPT-5.6 Sol Max e dos 34,1% do Claude Fable 5 Max. Ambas as tabelas são autorrelatadas pelos fornecedores e não foram reproduzidas; elas descrevem onde cada laboratório acredita ser forte, não quem vence.

As letras miúdas sobre tokens baratos
A vantagem de preço do Grok 4.6 é real e, em contexto curto e médio, é enorme: uma carga de trabalho com muita saída paga aproximadamente 83% menos por token gerado do que no Claude Fable 5.1. Mas a tabela de preços tem três arestas que uma comparação de fronteira geralmente ignora.
O primeiro é o limite de 200K. Ultrapassar 200.000 tokens de entrada reajusta o preço da solicitação inteira para $4/$12, não apenas os tokens acima da linha. Para uma execução longa de agente que acumula contexto — exatamente a carga de trabalho para a qual ambos os modelos são vendidos — a taxa efetiva dobra sem aviso e deixa de ser um quinto do preço do Claude. O segundo é a variante mais rápida, que custa o dobro da taxa base e é a única maneira anunciada de corrigir a velocidade de saída do modelo, que está abaixo da média. O terceiro são as chamadas de ferramentas do lado do servidor, cobradas separadamente por mil invocações.
A mudança de preços de setembro do Claude Fable 5.1 vai na outra direção. Os valores nominais de $10/$50 não mudaram, mas o preço de leitura de cache caiu 75%, para $0,25 por milhão de tokens, que é onde sessões agênticas longas realmente gastam seu dinheiro: relendo saídas de ferramentas, conteúdos de arquivos e turnos anteriores repetidamente. A Artificial Analysis mostra que o desconto efetivo de cache resultante é de 98%, contra 75% do Grok. Pagar um quarto de dólar por milhão de tokens relidos muda a aritmética de um agente de várias horas de uma forma que a tarifa anunciada nunca mostra.
O contrapeso honesto é a verbosidade, e é a razão pela qual a diferença real de custo não é de oito vezes. Como o modelo Claude emite cerca de duas vezes mais tokens para concluir a mesma tarefa de índice — 190M contra 94M do Grok — a medida de custo por tarefa da Artificial Analysis chega a US$ 7,63 para o Claude Fable 5.1 contra US$ 1,86 para o Grok 4.6. Isso é um fator de aproximadamente quatro, não oito, e é o número com o qual planejar um orçamento.
A diferença que nunca chega à mesa.
A latência é onde os dois modelos divergem para produtos interativos, e o resultado é o oposto do que o preço sugere. A Artificial Analysis mede o Claude Fable 5.1 em 67,2 tokens de saída por segundo — acima da média da sua classe — contra 52,8 para o Grok 4.6, que essa medição classifica abaixo da média; o resumo do índice para o Grok o descreveu explicitamente como mais lento que seus concorrentes, e é precisamente por isso que a SpaceXAI vende uma variante mais rápida pelo dobro do preço. O modelo da Anthropic também é, segundo essa mesma nota independente, o mais prolixo dos dois. Ou seja, o modelo barato é o mais lento, e o modelo caro escreve mais do que precisa: dois custos que puxam em direções opostas e nenhum dos quais aparece na tabela de preços.
Ligar para ambos sem se comprometer com nenhum hoje.
A consequência prática de uma lacuna de nove pontos, uma diferença de custo por tarefa de quatro vezes e um cartão de preços cheio de faixas é que a maioria das equipes deveria usar ambos, e a questão interessante é onde fica o ponto de troca. Isso é mais barato do que parece: Claude Fable 5.1 e Grok 4.6 estão ambos no OrcaRouter pelos preços de lista de seus provedores, com margem zero — os $2/$6 e os $10/$50 acima são os números que aparecem na fatura, e qualquer mudança de preço do fornecedor é repassada no mesmo dia em vez de ser absorvida pela margem do revendedor. Um único endpoint cobre ambos, portanto o padrão de escalada é uma regra de roteamento em vez de um segundo contrato: envie trabalho de alto volume e bem definido para o Grok 4.6, escale para o Claude Fable 5.1 quando a tarefa exigir o teto de raciocínio, e deixe o failover automático cobrir o caso em que o throughput do modelo mais barato é lento demais para um prazo. A DSL de roteamento expressa essa cadeia em um só lugar, e a fusão de modelos permite que um painel de modelos responda em conjunto quando uma tarefa é importante o suficiente para querer mais de uma opinião. A diferença de preço então deixa de ser uma decisão que você toma uma vez e se torna uma linha que você ajusta à medida que sua mistura de carga de trabalho muda.

Quem deve escolher qual
Escolha o Claude Fable 5.1 quando o custo de uma resposta errada ou abandonada dominar o custo dos tokens: pesquisa agêntica de horizonte longo, raciocínio complexo, trabalho regulado em que o envelope de segurança da Anthropic e seus controles faseados de retenção zero de dados importam, e tudo o que viver dentro do Claude Code. Escolha o Grok 4.6 quando o trabalho for de alto volume, bem delimitado e tolerante a throughput — codificação em lote, extração, geração, loops de agentes cujos turnos sejam curtos o bastante para permanecer abaixo da linha de reprecificação de 200K — e quando você estiver construindo agentes em que o modelo seja um componente e o custo por tarefa seja todo o business case.
Dois loops em aberto merecem atenção antes que qualquer escolha se consolide. A SpaceXAI já voltou a dar sinais do Grok 4.7 para o curto prazo, e se ele herdar a mesma faixa de preço com capacidade superior, o custo-benefício de hoje vira nível intermediário em poucas semanas. A Anthropic, por sua vez, tem mostrado um ritmo aproximadamente mensal e disposição para reduzir os preços de cache sem mexer nas tarifas principais, o que sugere que o próximo movimento nesse confronto pode vir do lado dos custos, e não do índice. Nenhum dos loops muda o que os modelos fazem hoje, mas ambos são motivos para manter o ID do modelo como um valor de configuração. Em um único endpoint com preço repassado e failover, isso é o padrão, e não um projeto.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
