
Claude Sonnet 5.5 vs Grok 4.6: A tabela de preços diz uma coisa, a fatura de tokens diz outra
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
A aritmética da manchete parece definida antes de o artigo começar. O Grok 4.6 custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída; o Claude Sonnet 5.5 custa US$ 2 e US$ 10. O modelo da SpaceXAI é 40% mais barato na saída, iguala na entrada e está em disponibilidade geral desde 12 de agosto de 2026 — tempo suficiente para que suas peculiaridades estejam documentadas, e não sejam apenas rumores. O modelo da Anthropic chegou em 28 de setembro de 2026, um dia antes de isto ser escrito, e é, com folga, a novidade mais recente da categoria.
Então você chega aos números independentes de eficiência, e a ordem se inverte. A Artificial Analysis mede modelos da classe GPT e Claude com base no custo por tarefa, ao lado de seu Intelligence Index, e na revisão v4.3.2 os dois modelos aqui custam US$ 1,86 por tarefa do índice para o Grok 4.6 e US$ 7,60 para o Claude Sonnet 5.5. O modelo com a tabela de preços mais barata é o mais caro de operar, por um fator de quatro. Descobrir por quê, e quando essa inversão se sustenta e quando não, é a comparação inteira.
Dois modelos, duas posições em suas próprias famílias.
Grok 4.6 é o atual carro-chefe da linha Grok — a própria documentação para desenvolvedores da SpaceXAI o lista como o mais recente, e ele sucedeu o Grok 4.5 com a mesma janela de contexto de 500.000 tokens, a mesma superfície de entrada de texto, imagem e arquivo e o mesmo preço base. Ele oferece suporte a esforço de raciocínio configurável, chamada nativa de ferramentas, saídas estruturadas e toda a superfície de amostragem e, como modelo OpenAI Responses de primeira classe, entra em frameworks de agentes existentes sem uma camada de tradução. A Artificial Analysis o posiciona com um Intelligence Index de 44, classificado em 31.º entre os 216 modelos que mede, com um valor de GPQA Diamond de 94,9%.

Claude 5.5 é o segundo da geração 5 da Anthropic e o modelo que a empresa posicionou como a melhor combinação e inteligência de sua linha. Ele é disponibilizado como claude-sonnet-5-5/ na Claude API e nas três principais nuvens, tem uma janela de contexto de 1M tokens com teto de saída síncrona de 128K, mantém as tarifas de US$ 2 / US$ 10 do Claude Sonnet 5 para entrada, saída e cache, e está disponível com retenção zero de dados. Na mesma revisão do índice, obtém 56 pontos e ocupa a terceira posição entre 216.
Portanto, os dois não estão realmente no mesmo mercado. Um é um modelo de fronteira de 500.000 tokens que está à venda há sete semanas a um preço enxuto. O outro é uma camada de uso geral de 1M de tokens que não custa mais por token do que seu antecessor e obtém doze pontos a mais na pontuação composta. A comparação vale a pena de qualquer forma, porque ambos são modelos com entrada a US$ 2, e é aí que as decisões de compra realmente começam.
O 4x que ninguém coloca num slide
As tabelas de tarifas precificam tokens. As faturas são denominadas em tarefas, e o número de tokens que um modelo gasta para chegar a uma resposta é uma escolha de design, e não uma constante. É aí que os dois divergem, e os números medidos são chocantes:
• Taxa de saída — Claude Sonnet 5.5 $10 por milhão vs. Grok 4.6 $6 por milhão
• Custo por tarefa do Intelligence Index — Claude Sonnet 5.5 US$ 7,60 vs Grok 4.6 US$ 1,86
• Verbosidade no Índice — Claude Sonnet 5.5 410M tokens de saída vs Grok 4.6 94M
• Índice de Inteligência — Claude Sonnet 5.5 56 vs Grok 4.6 44, ambos na v4.3.2
• Velocidade de saída — Grok 4.6 medido em 67,7 tokens por segundo, em comparação com uma mediana de 82,7; a Anthropic relata que o Claude Sonnet 5.5 gera saída 30%+ mais rápida que o Claude Sonnet 5, que a Artificial Analysis cronometrou em 78,7 tokens por segundo
A linha da verbosidade é o mecanismo. Um modelo que emite quatro vezes mais tokens não precisa de uma taxa de saída 67% mais alta para custar quatro vezes mais por tarefa — mas isso ajuda, e ambos os efeitos apontam na mesma direção aqui. O próprio enquadramento da Anthropic sustenta a interpretação em vez de a contradizer: o material de lançamento afirma que o Claude Sonnet 5.5 "custa até 30% menos por tarefa" do que o Claude Sonnet 5 a preços idênticos por token, o que é uma afirmação sobre contagens de tokens, não sobre taxas. Face a uma referência externa muito mais enxuta, a mesma propriedade torna-se o maior risco de custo do modelo.
Nada disso faz a lacuna do índice desaparecer. Doze pontos no composto representam uma diferença real de capacidade, e uma tarefa mais barata que falha não é mais barata. Isso significa que a pergunta honesta não é "qual taxa é menor", mas "quantos tokens a tarefa mais difícil consome", e esse número só existe depois que você executa sua própria carga de trabalho.

Contexto, esforço e a forma da integração
A segunda divergência é arquitetural e decide qual dos dois você pode adotar sem reescrever nada.

Claude Sonnet 5.5 altera seis comportamentos em relação ao Claude Sonnet 5, cinco deles que quebram compatibilidade. O envio de thinking: {"type": "disabled"}/ agora retorna um 400 e deve ser substituído por between_tools/. O uso forçado de ferramentas — tool_choice/ de "any"/ ou uma ferramenta nomeada — é rejeitado sumariamente, então um loop que força uma chamada válida pelo esquema precisa passar para auto/ com uso estrito de ferramentas ou saídas estruturadas. A mais antiga computer_20251124/ ferramenta de uso de computador é recusada na API Claude e no Google Cloud. Os blocos de pensamento agora estão vinculados ao modelo e à conta que os produziram, então uma conversa pode levar seu raciocínio adiante a partir do Claude Sonnet 5, mas não lateralmente para uma família de modelos diferente. E a ferramenta de aconselhamento não aceita mais Claude Opus 4.8, Claude Opus 4.7 ou Claude Sonnet 5 como consultores por trás de um executor Sonnet 5.5.
O Grok 4.6 não pede nada disso. É um modelo no formato OpenAI, com a superfície de amostragem intacta, e a migração do Grok 4.5 é uma mudança na string do modelo. A sua própria estrutura de custos, porém, tem um porém, e é uma imagem espelhada da da Anthropic: a tarifa de US$ 2 / US$ 6 se aplica até 200.000 tokens de entrada, e tudo o que passa disso é cobrado a US$ 4 / US$ 12. O Claude Sonnet 5.5 cobra a tarifa padrão em toda a janela de 1M.
Coloque os dois lado a lado e a escolha deixa de ser sobre qual fornecedor é mais barato:
• Prompts curtos, saída densa — o hábito mais enxuto de tokens do Grok 4.6 e a taxa de saída mais baixa vencem de forma decisiva
• Entradas muito longas — a taxa fixa de 1M do Claude Sonnet 5.5 começa a superar uma faixa que dobra bem antes do limite de contexto
• Grandes saídas individuais — O Sonnet 5.5 tem um teto de 128K que iguala o do Grok 4.6, e alcança 300K na API Message Batches por trás do output-300k-2026-03-24/ cabeçalho
• Código existente no formato OpenAI — o Grok 4.6 não precisa de alterações; o Sonnet 5.5 precisa do trabalho de uso de ferramentas e de raciocínio acima
Colocando ambos em um
Manter uma comparação entre dois fornecedores na cabeça é fácil. Executá-la é onde o custo se esconde: duas contas, dois conjuntos de limites, duas superfícies de cobrança e uma contagem de tokens que precisa ser medida duas vezes antes de significar alguma coisa.
O OrcaRouter resume isso em um único endpoint compatível com OpenAI, cobrindo mais de 200 modelos, com o preço de tabela do provedor repassado e sem markup, de modo que uma mudança de tarifa do fornecedor, seja do lado do Grok ou do Claude, entra em vigor aqui no mesmo dia, em vez de na próxima renovação de contrato. Toda a linha Grok 4.x está no catálogo com as próprias tarifas do fornecedor, e O Claude Sonnet 5 é roteável desde 30 de junho a $2 / $10 da Anthropic — o modelo que ainda responde pela maior parte do tráfego da API do Claude, medido em 150 tokens de saída por segundo com um tempo p50 de primeiro token de aproximadamente cinco segundos.
O Claude Sonnet 5.5 especificamente ainda não está no nosso catálogo. Enquanto não estiver, a via para o alcançar é a API do próprio fornecedor, e a forma de o testar sem apostar uma carga de trabalho num modelo que ninguém avaliou de forma independente para além de um único compósito é enviar-lhe uma percentagem do tráfego por trás de failover automático, com o Grok 4.6 ou o Claude Sonnet 5 a apanhar o que ele deixa cair. Experimentar um nível totalmente novo é uma decisão de encaminhamento, não um projeto de migração.
O que fazer com os números
Grok 4.6 é o modelo mais indicado para recorrer quando o trabalho é curto, a saída é densa e a integração já fala OpenAI. Ele é mensuravelmente mais enxuto por tarefa do que qualquer outra coisa nessa faixa de preço, seus controles de amostragem estão intactos, e sete semanas de disponibilidade significam que seus modos de falha já foram descobertos por outras pessoas.
O Claude Sonnet 5.5 é o melhor modelo quando a entrada é enorme, quando a pontuação composta é o que você está comprando, ou quando o trabalho é suficientemente agêntico para que uma diferença de doze pontos no índice e um teto de saída de 128K importem mais do que uma diferença de quatro vezes no custo por tarefa. A lista de verificação de migração é real, e é um dia de trabalho em vez de uma edição de string de modelo.
O que resolveria a questão é uma medição de tokens por tarefa no seu próprio tráfego, executada em ambos. Todos os números deste artigo que decidem o resultado — $1,86 contra $7,60, 94M contra 410M — são um proxy para esse único número, e ele é o único deles que você mesmo pode produzir.
Comparados neste artigo4
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
