Cartão de título principal gerado para Claude Sonnet 5.5 vs Gemini 3.1 Pro, com o subtítulo "Mais barato por token, onze vezes mais caro por tarefa", mostrando $2,00 e $10,00 por milhão de tokens contra $2,00 e $12,00, com um teto de saída de 65.536 tokens indicado à direita, e o logotipo do OrcaRouter composto no canto inferior direito.
Guides & Insights

Claude Sonnet 5.5 vs Gemini 3.1 Pro: mais barato por token, onze vezes mais caro por tarefa

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Na tabela de preços, o Claude Sonnet 5.5 é o modelo mais barato e não chega perto em capacidade. Ele atingiu disponibilidade geral em 28 de setembro de 2026 a US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída; o Gemini 3.1 Pro, anunciado em 19 de fevereiro de 2026 e ainda servido a partir de um endpoint de pré-visualização, custa US$ 2,00 e US$ 12,00. O Sonnet 5.5 também obtém 56 no Intelligence Index v4.3 da Artificial Analysis, contra 30 do Gemini 3.1 Pro Preview — uma diferença de vinte e seis pontos em um único harness. O contexto de 1.048.576 tokens do Gem​ini é o único número de destaque que ele vence de forma absoluta. No entanto, o mesmo avaliador relata que concluir uma tarefa aberta custa US$ 0,67 no modelo do Goog​le e US$ 7,60 no da Anthro​pic, o que é um fator de onze na direção oposta. Ambos os números estão corretos, e a razão pela qual eles coexistem — um teto de saída de 65.536 tokens de um lado e um problema de verbosidade do outro — é o cerne desta comparação.

O que cada endpoint realmente é

Corrija as identidades antes da aritmética. O sujeito aqui é anthropic/claude-sonnet-5.5, lançado em 28 de setembro de 2026, entrada de texto, imagem e arquivo, contexto de 1.000.000 tokens, saída máxima de 128.000 tokens, pensamento adaptativo com um parâmetro de esforço definido por padrão como alto na Claude Platform. O oponente é google/gemini-3.1-pro-preview, lançado em 19 de fevereiro de 2026, entrada de texto, imagem, vídeo, áudio e arquivo, contexto de 1.048.576 tokens, saída máxima de 65.536 tokens. Um desses dois nomes traz uma palavra que o outro não traz, e não é decoração.

O sufixo de pré-visualização está anexado há sete meses. O Google lançou várias versões do Flash nesse período e nenhum sucessor para o nível Pro; o modelo que o 3.1 Pro substituiu está listado como desativado. Nada disso é um defeito no modelo — ele esteve ativo, estável e com preço correto o tempo todo —, mas significa que o endpoint com o qual você está integrando não é coberto por um compromisso de ciclo de vida de disponibilidade geral, e esta família já aposentou um modelo Pro. Trate isso como um item fixo, e não como uma nota de rodapé, porque isso muda o custo de uma decisão de arquitetura de vários anos se você errar.

Dois números que apontam em direções opostas

A comparação por token primeiro, porque é a que todo mundo executa e que favorece o modelo mais novo.

• Entrada — US$ 2,00 por milhão em ambos; um empate exato na tarifa anunciada

• Saída — US$ 10,00 para o Claude Sonnet 5.5 contra US$ 12,00 para o Gemini 3.1 Pro; o modelo da Anthropic é 17% mais barato

• Leitura de cache — $0.20 por milhão em ambos abaixo do limite do nível

• Gravação de cache — US$ 2,50 por milhão para a janela de cinco minutos no Claude Sonnet 5.5, contra US$ 0,375 no Gemini 3.1 Pro; o Google é cerca de sete vezes mais barato para gravar uma entrada de cache

• Contexto — 1.000.000 contra 1.048.576; uma diferença sem consequência prática

• Saída máxima — 128.000 tokens contra 65.536; o modelo da Anthropic tem quase o dobro do teto

• Modalidade de entrada — texto, imagem e arquivo versus texto, imagem, vídeo, áudio e arquivo

Depois, a comparação por tarefa, do mesmo avaliador, na mesma semana, numa configuração de esforço máximo de ambos os lados: US$ 7,60 para o Claude Sonnet 5.5 contra US$ 0,67 para o Gemini 3.1 Pro. Onze vezes. O mecanismo está documentado na mesma página, em vez de ser inferido — o Sonnet 5.5 gerou 410 milhões de tokens em toda a suíte de índices, contra uma mediana de 88 milhões do conjunto, algo que o avaliador descreve como muito verboso, enquanto o Gemini 3.1 Pro é descrito como bastante conciso. Quando um modelo escreve várias vezes mais que o outro, uma vantagem de 17% na tarifa de saída não sobrevive ao contato com a fatura.

A lição vai além destes dois modelos: uma tabela de preços precifica um token, e você é cobrado pelo trabalho concluído. Qualquer comparação que pare na tabela de preços está medindo a quantidade errada.

O limite de nível em 200.000 tokens

A precificação do Gemini 3.1 Pro não é linear, e o salto é grande o bastante para inverter partes da comparação acima. Abaixo de um prompt de 200.000 tokens, as tarifas são US$ 2,00 de entrada e US$ 12,00 de saída, com US$ 0,20 de leitura de cache. Acima desse limite, a chamada inteira é reprecificada em US$ 4,00 de entrada, US$ 18,00 de saída e US$ 0,40 de leitura de cache — a tarifa de entrada dobra, passando a ser exatamente o dobro da do Claude Sonnet 5.5, e a saída passa de 17% mais barata no lado da Anthropic para 80% mais cara no lado do Google.

O limite não é exótico. Um prompt de 200.000 tokens é uma base de código pequena, um conjunto extenso de contratos, algumas horas de transcrição ou um agente que já está trabalhando há algum tempo. O trabalho com contexto longo é precisamente aquilo para que uma janela de 1M de tokens é vendida, então o nível que mais recompensa a janela também é o nível em que a vantagem de preço desaparece. Se os seus prompts ultrapassarem rotineiramente 200.000 tokens, avalie o Gemini 3.1 Pro a $4,00 e $18,00, e não pelas tarifas da página de destino.

As gravações de cache merecem uma frase própria, porque se invertem na direção oposta e sobrevivem à mudança de nível. A US$ 0,375 por milhão contra US$ 2,50, o Gemini é muito mais barato para preencher um cache, e essa tarifa não muda quando você cruza a fronteira. Para um agente que reconstrói um prefixo grande a cada turno em vez de reutilizá-lo, essa única linha pode ser uma vantagem estrutural maior do que a tarifa de entrada — e é a única linha nesta comparação que nenhuma fronteira de nível toca.

O teto de 65.536 tokens, e por que ele decide a arquitetura

O número que mais muda o que você pode construir é a saída máxima: 65.536 tokens no Gemini 3.1 Pro contra 128.000 no Claude Sonnet 5.5. Um teto não é uma métrica de desempenho; é uma restrição sobre se uma tarefa cabe em uma única chamada.

Qualquer coisa que emita um artefato grande — um arquivo-fonte completo, um relatório longo, um documento completo, um conjunto de dados estruturado — acima de 65.536 tokens, no caso do Gemini, precisa ser decomposta em uma cadeia de chamadas com estado passado entre elas. A decomposição custa mais tokens de entrada a cada etapa, mais código de orquestração e um novo modo de falha nas emendas onde um bloco termina e o próximo começa. Uma segunda restrição agrava isso: o próprio material da Anthropic coloca o limiar prático do Sonnet 5.5 para trabalho longo confiável substancialmente mais alto, e o teto do Gemini é o mais restrito dos dois por um fator de dois. Se o seu artefato mais longo tiver 40.000 tokens, esta seção é irrelevante e você deve comparar pelo custo por tarefa. Se ele tiver 100.000, o teto já tomou a decisão por você.

Modalidade, o único eixo que o Gemini domina por completo

O Gemini 3.1 Pro aceita vídeo e áudio; o Claude Sonnet 5.5 aceita texto, imagens e arquivos e não aceita nenhum dos dois. Para uma carga de trabalho baseada em mídia — gravações de chamadas, capturas de tela, vídeo de produto, áudio de reunião — não há substituição disponível neste par, e a comparação de preços é irrelevante porque apenas um dos dois endpoints consegue aceitar a entrada. Para cargas de trabalho com texto e imagem, os conjuntos de capacidades se sobrepõem e a aritmética de preços acima é a que prevalece.

O outro número operacional do Gemini vale a pena ser discutido porque é fácil de passar despercebido em uma página que lidera com inteligência: nosso catálogo mede uma latência mediana de primeiro token de 10.000 ms em p e uma saída próxima de 1.283 tokens por segundo, com uma taxa de erro de sete dias de 56,8%. Esse é um modelo extremamente rápido com uma taxa de falha observada muito alta — uma combinação que se adequa a trabalho em lote com orçamentos generosos de repetição muito melhor do que se adequa a qualquer coisa que um usuário esteja esperando. Claude Sonnet 5.5 é o perfil mais lento e constante em comparação. A taxa de erro não aparece na página inicial de nenhum dos fornecedores; é o tipo de número que só aparece quando os modelos ficam atrás de um endpoint que os mede, o que é uma razão para avaliar ambos de um único lugar em vez de dois painéis.

O que encaminhar para onde

Envie-o para o Claude Sonnet 5.5 quando o trabalho for texto ou imagem, quando o padrão de qualidade for alto o bastante para que uma diferença de índice de vinte e seis pontos importe, quando os artefatos de saída forem longos o suficiente para precisar do teto de 128.000 tokens, ou quando a carga de trabalho for interativa e uma taxa de erro de 56,8% for inaceitável. Em tarefas estruturadas e delimitadas, a penalidade de verbosidade que produz a cifra de $7,60 praticamente evapora, e a vantagem por token se torna dinheiro de verdade.

Envie-o para o Gemini 3.1 Pro quando a entrada contiver vídeo ou áudio, quando os prompts permanecerem abaixo de 200.000 tokens e o volume for alto, quando você estiver gravando caches grandes com frequência e a gravação de cache de $0,375 se acumular, ou quando a tarefa estiver no formato de lote e o custo por tarefa for a única coluna que importa — a $0,67 por tarefa contra $7,60, você pode se dar ao luxo de muitas tentativas.

Ambos são roteáveis no OrcaRouter hoje. google/gemini-3.1-pro-preview e anthropic/claude-sonnet-5 são ambas entradas de catálogo ativas numa única credencial ao preço de tabela do fornecedor com 0% de acréscimo, o que significa que a divisão acima pode ser expressa como uma regra de roteamento em vez de como duas integrações — as solicitações com formato de mídia para um endpoint, as solicitações de texto e imagem para o outro, com failover se qualquer um deles começar a dar erro. O Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma; quando for listado, a mesma regra cobre-o sem uma nova chave.

O veredito honesto para este confronto: o Claude Sonnet 5.5 é o melhor modelo por uma margem ampla e o mais barato por token, e o Gemini 3.1 Pro é cerca de onze vezes mais barato por tarefa concluída em trabalho aberto, seis vezes mais barato para escrever um cache com ele, e o único dos dois que consegue ver um vídeo. Quem te cita a tabela de preços está descrevendo uma comparação que não existe; a que existe é sobre quais requisições você consegue delimitar.

A two-column scoreboard for Claude Sonnet 5.5 and Gemini 3.1 Pro Preview across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column Gemini 3.1 Pro Preview: input $2.00 rising to $4.00 over 200K tokens, output $12.00 rising to $18.00, cache read $0.20, cache write $0.375, 1,048,576-token context with a 65,536-token max output, input modality text, image, video, audio and file, AA Intelligence Index v4.3 score 30, $0.67 per task on the index run. The card heading reads "Cheaper per token, eleven times dearer per finished task", and a footer line notes that Gemini 3.1 Pro remains a preview endpoint seven months after its February 19, 2026 announcement.Screenshot of the OrcaRouter model page for Google Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview), showing the model header, the 1,048,576-token context window, the 65,536-token maximum output, audio, file, image, text and video input, the Vision, Audio, Tools, JSON and Reasoning capability tags, a 10.00-second p50 time to first token, a "Public benchmarks by Google · 2026-02-19" line, and the $2.00 input and $12.00 output prices per million tokens.Screenshot of Artificial Analysis's model page for Gemini 3.1 Pro Preview, marked a proprietary model and released February 2026, showing In $2.00 and Out $12.00 with a 90% cache discount, the Intelligence Index score of 30, an output rate of 114 tokens per second, the $0.67 average cost per task, and 67M output tokens described as fairly concise against a median of 88M.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente