
Claude Sonnet 5.5 vs Gemini 3.1 Pro: mais barato por token, onze vezes mais caro por tarefa
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 984 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 195 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Na tabela de preços, o Claude Sonnet 5.5 é o modelo mais barato e não chega perto em capacidade. Ele atingiu disponibilidade geral em 28 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída; o Gemini 3.1 Pro, anunciado em 19 de fevereiro de 2026 e ainda servido a partir de um endpoint de pré-visualização, custa US$ 2,00 e US$ 12,00. O Sonnet 5.5 também obtém 56 no Intelligence Index v4.3 da Artificial Analysis, contra 30 do Gemini 3.1 Pro Preview — uma diferença de vinte e seis pontos em um único harness. O contexto de 1.048.576 tokens do Gemini é o único número de destaque que ele vence de forma absoluta. No entanto, o mesmo avaliador relata que concluir uma tarefa aberta custa US$ 0,67 no modelo do Google e US$ 7,60 no da Anthropic, o que é um fator de onze na direção oposta. Ambos os números estão corretos, e a razão pela qual eles coexistem — um teto de saída de 65.536 tokens de um lado e um problema de verbosidade do outro — é o cerne desta comparação.
O que cada endpoint realmente é
Corrija as identidades antes da aritmética. O sujeito aqui é anthropic/claude-sonnet-5.5, lançado em 28 de setembro de 2026, entrada de texto, imagem e arquivo, contexto de 1.000.000 tokens, saída máxima de 128.000 tokens, pensamento adaptativo com um parâmetro de esforço definido por padrão como alto na Claude Platform. O oponente é google/gemini-3.1-pro-preview, lançado em 19 de fevereiro de 2026, entrada de texto, imagem, vídeo, áudio e arquivo, contexto de 1.048.576 tokens, saída máxima de 65.536 tokens. Um desses dois nomes traz uma palavra que o outro não traz, e não é decoração.
O sufixo de pré-visualização está anexado há sete meses. O Google lançou várias versões do Flash nesse período e nenhum sucessor para o nível Pro; o modelo que o 3.1 Pro substituiu está listado como desativado. Nada disso é um defeito no modelo — ele esteve ativo, estável e com preço correto o tempo todo —, mas significa que o endpoint com o qual você está integrando não é coberto por um compromisso de ciclo de vida de disponibilidade geral, e esta família já aposentou um modelo Pro. Trate isso como um item fixo, e não como uma nota de rodapé, porque isso muda o custo de uma decisão de arquitetura de vários anos se você errar.
Dois números que apontam em direções opostas
A comparação por token primeiro, porque é a que todo mundo executa e que favorece o modelo mais novo.
• Entrada — US$ 2,00 por milhão em ambos; um empate exato na tarifa anunciada
• Saída — US$ 10,00 para o Claude Sonnet 5.5 contra US$ 12,00 para o Gemini 3.1 Pro; o modelo da Anthropic é 17% mais barato
• Leitura de cache — $0.20 por milhão em ambos abaixo do limite do nível
• Gravação de cache — US$ 2,50 por milhão para a janela de cinco minutos no Claude Sonnet 5.5, contra US$ 0,375 no Gemini 3.1 Pro; o Google é cerca de sete vezes mais barato para gravar uma entrada de cache
• Contexto — 1.000.000 contra 1.048.576; uma diferença sem consequência prática
• Saída máxima — 128.000 tokens contra 65.536; o modelo da Anthropic tem quase o dobro do teto
• Modalidade de entrada — texto, imagem e arquivo versus texto, imagem, vídeo, áudio e arquivo
Depois, a comparação por tarefa, do mesmo avaliador, na mesma semana, numa configuração de esforço máximo de ambos os lados: US$ 7,60 para o Claude Sonnet 5.5 contra US$ 0,67 para o Gemini 3.1 Pro. Onze vezes. O mecanismo está documentado na mesma página, em vez de ser inferido — o Sonnet 5.5 gerou 410 milhões de tokens em toda a suíte de índices, contra uma mediana de 88 milhões do conjunto, algo que o avaliador descreve como muito verboso, enquanto o Gemini 3.1 Pro é descrito como bastante conciso. Quando um modelo escreve várias vezes mais que o outro, uma vantagem de 17% na tarifa de saída não sobrevive ao contato com a fatura.
A lição vai além destes dois modelos: uma tabela de preços precifica um token, e você é cobrado pelo trabalho concluído. Qualquer comparação que pare na tabela de preços está medindo a quantidade errada.
O limite de nível em 200.000 tokens
A precificação do Gemini 3.1 Pro não é linear, e o salto é grande o bastante para inverter partes da comparação acima. Abaixo de um prompt de 200.000 tokens, as tarifas são US$ 2,00 de entrada e US$ 12,00 de saída, com US$ 0,20 de leitura de cache. Acima desse limite, a chamada inteira é reprecificada em US$ 4,00 de entrada, US$ 18,00 de saída e US$ 0,40 de leitura de cache — a tarifa de entrada dobra, passando a ser exatamente o dobro da do Claude Sonnet 5.5, e a saída passa de 17% mais barata no lado da Anthropic para 80% mais cara no lado do Google.
O limite não é exótico. Um prompt de 200.000 tokens é uma base de código pequena, um conjunto extenso de contratos, algumas horas de transcrição ou um agente que já está trabalhando há algum tempo. O trabalho com contexto longo é precisamente aquilo para que uma janela de 1M de tokens é vendida, então o nível que mais recompensa a janela também é o nível em que a vantagem de preço desaparece. Se os seus prompts ultrapassarem rotineiramente 200.000 tokens, avalie o Gemini 3.1 Pro a $4,00 e $18,00, e não pelas tarifas da página de destino.
As gravações de cache merecem uma frase própria, porque se invertem na direção oposta e sobrevivem à mudança de nível. A US$ 0,375 por milhão contra US$ 2,50, o Gemini é muito mais barato para preencher um cache, e essa tarifa não muda quando você cruza a fronteira. Para um agente que reconstrói um prefixo grande a cada turno em vez de reutilizá-lo, essa única linha pode ser uma vantagem estrutural maior do que a tarifa de entrada — e é a única linha nesta comparação que nenhuma fronteira de nível toca.
O teto de 65.536 tokens, e por que ele decide a arquitetura
O número que mais muda o que você pode construir é a saída máxima: 65.536 tokens no Gemini 3.1 Pro contra 128.000 no Claude Sonnet 5.5. Um teto não é uma métrica de desempenho; é uma restrição sobre se uma tarefa cabe em uma única chamada.
Qualquer coisa que emita um artefato grande — um arquivo-fonte completo, um relatório longo, um documento completo, um conjunto de dados estruturado — acima de 65.536 tokens, no caso do Gemini, precisa ser decomposta em uma cadeia de chamadas com estado passado entre elas. A decomposição custa mais tokens de entrada a cada etapa, mais código de orquestração e um novo modo de falha nas emendas onde um bloco termina e o próximo começa. Uma segunda restrição agrava isso: o próprio material da Anthropic coloca o limiar prático do Sonnet 5.5 para trabalho longo confiável substancialmente mais alto, e o teto do Gemini é o mais restrito dos dois por um fator de dois. Se o seu artefato mais longo tiver 40.000 tokens, esta seção é irrelevante e você deve comparar pelo custo por tarefa. Se ele tiver 100.000, o teto já tomou a decisão por você.
Modalidade, o único eixo que o Gemini domina por completo
O Gemini 3.1 Pro aceita vídeo e áudio; o Claude Sonnet 5.5 aceita texto, imagens e arquivos e não aceita nenhum dos dois. Para uma carga de trabalho baseada em mídia — gravações de chamadas, capturas de tela, vídeo de produto, áudio de reunião — não há substituição disponível neste par, e a comparação de preços é irrelevante porque apenas um dos dois endpoints consegue aceitar a entrada. Para cargas de trabalho com texto e imagem, os conjuntos de capacidades se sobrepõem e a aritmética de preços acima é a que prevalece.
O outro número operacional do Gemini vale a pena ser discutido porque é fácil de passar despercebido em uma página que lidera com inteligência: nosso catálogo mede uma latência mediana de primeiro token de 10.000 ms em p e uma saída próxima de 1.283 tokens por segundo, com uma taxa de erro de sete dias de 56,8%. Esse é um modelo extremamente rápido com uma taxa de falha observada muito alta — uma combinação que se adequa a trabalho em lote com orçamentos generosos de repetição muito melhor do que se adequa a qualquer coisa que um usuário esteja esperando. Claude Sonnet 5.5 é o perfil mais lento e constante em comparação. A taxa de erro não aparece na página inicial de nenhum dos fornecedores; é o tipo de número que só aparece quando os modelos ficam atrás de um endpoint que os mede, o que é uma razão para avaliar ambos de um único lugar em vez de dois painéis.
O que encaminhar para onde
Envie-o para o Claude Sonnet 5.5 quando o trabalho for texto ou imagem, quando o padrão de qualidade for alto o bastante para que uma diferença de índice de vinte e seis pontos importe, quando os artefatos de saída forem longos o suficiente para precisar do teto de 128.000 tokens, ou quando a carga de trabalho for interativa e uma taxa de erro de 56,8% for inaceitável. Em tarefas estruturadas e delimitadas, a penalidade de verbosidade que produz a cifra de $7,60 praticamente evapora, e a vantagem por token se torna dinheiro de verdade.
Envie-o para o Gemini 3.1 Pro quando a entrada contiver vídeo ou áudio, quando os prompts permanecerem abaixo de 200.000 tokens e o volume for alto, quando você estiver gravando caches grandes com frequência e a gravação de cache de $0,375 se acumular, ou quando a tarefa estiver no formato de lote e o custo por tarefa for a única coluna que importa — a $0,67 por tarefa contra $7,60, você pode se dar ao luxo de muitas tentativas.
Ambos são roteáveis no OrcaRouter hoje. google/gemini-3.1-pro-preview e anthropic/claude-sonnet-5 são ambas entradas de catálogo ativas numa única credencial ao preço de tabela do fornecedor com 0% de acréscimo, o que significa que a divisão acima pode ser expressa como uma regra de roteamento em vez de como duas integrações — as solicitações com formato de mídia para um endpoint, as solicitações de texto e imagem para o outro, com failover se qualquer um deles começar a dar erro. O Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma; quando for listado, a mesma regra cobre-o sem uma nova chave.
O veredito honesto para este confronto: o Claude Sonnet 5.5 é o melhor modelo por uma margem ampla e o mais barato por token, e o Gemini 3.1 Pro é cerca de onze vezes mais barato por tarefa concluída em trabalho aberto, seis vezes mais barato para escrever um cache com ele, e o único dos dois que consegue ver um vídeo. Quem te cita a tabela de preços está descrevendo uma comparação que não existe; a que existe é sobre quais requisições você consegue delimitar.



Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
