Cartão de título de destaque gerado para Claude Sonnet 5.5 vs DeepSeek V4 Pro, com o subtítulo 'Vinte pontos de índice e uma leitura de cache de US$ 0,022', mostrando US$ 2,00 e US$ 10,00 por milhão de tokens contra US$ 0,66 e US$ 1,98, com o logotipo OrcaRouter composto no canto inferior direito.
Guides & Insights

Claude Sonnet 5.5 vs DeepSeek V4 Pro: 20 pontos de índice e uma leitura de cache a $0,022

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Coloque as duas tabelas de preços lado a lado e a comparação parece decidida antes mesmo de começar. Claude Sonnet 5.5, com disponibilidade geral desde 28 de setembro de 2026, custa US$ 2,00 por milhão de tokens de entrada e US$ 10,00 por milhão de tokens de saída. DeepSeek V4 Pro, lançado em 24 de abril de 2026, custa US$ 0,66 e US$ 1,98. A saída é a linha que importa no trabalho com agentes, e US$ 10,00 contra US$ 1,98 é uma diferença de cinco para um — um dólar contra vinte centavos por cem mil tokens. Depois, veja o lado da capacidade, em que a Artificial Analysis coloca o Claude Sonnet 5.5 em 56 no Intelligence Index v4.3 e o DeepSeek V4 Pro em 36, uma diferença de vinte pontos no mesmo harness. É aí que está toda a tensão: o modelo da DeepSeek fica a um quinto do preço de saída e a cerca de dois terços da capacidade medida, e os dois fatos não se resolvem em uma única recomendação sem saber o que sua carga de trabalho realmente faz com um token.

O que cada modelo é, exatamente

A nomenclatura é o primeiro ponto em que esta comparação dá errado, então corrija isso aqui. O DeepSeek V4 Pro, como o listamos, é deepseek/deepseek-v4-pro, lançado em 24 de abril de 2026, um modelo com contexto de 1.048.576 tokens, saída máxima de 384.000 tokens e entrada apenas de texto. A Artificial Analysis acompanha um snapshot que rotula como DeepSeek V4 Pro 0813 — uma build de 13 de agosto — e os números citados abaixo vêm dessa linha. O lado Sonnet é o anthropic/claude-sonnet-5.5 da Anthropic, com entrada de texto, imagem e arquivo, contexto de 1M e saída máxima de 128K. Se você estiver comparando uma página de fornecedor com uma página de avaliador e os números não baterem, verifique o sufixo da build antes de concluir que um deles está errado.

O DeepSeek V4 Pro suporta apenas entrada de texto. O Claude Sonnet 5.5 também aceita imagens e ficheiros. Essa é a primeira diferença estrutural, e não é marginal: qualquer pipeline que ingira capturas de ecrã, PDFs ou diagramas não pode simplesmente trocar um pelo outro, porque um deles não consegue ver.

A tabela de preços, linha por linha

• Entrada — US$ 0,66 por milhão para o DeepSeek V4 Pro contra US$ 2,00 para o Claude Sonnet 5.5; o DeepSeek é 67% mais barato

• Saída — $1,98 por milhão contra $10,00; DeepSeek é 80% mais barato, a maior diferença individual nesta comparação

• Leitura de cache — US$ 0,022 por milhão contra US$ 0,20; o DeepSeek é 89% mais barato na linha que domina os longos loops de agentes

• Gravação de cache — US$ 2,50 por milhão para a janela de cinco minutos no Claude Sonnet 5.5; a linha do catálogo do DeepSeek V4 Pro não traz uma linha separada de gravação de cache

Contexto — 1.048.576 tokens em comparação com 1.000.000; o DeepSeek é marginalmente mais longo, uma distinção sem consequência prática.

• Saída máxima — 384.000 tokens contra 128.000; DeepSeek vence por um fator de três no teto que restringe a geração em massa

• Modalidade de entrada — somente texto versus texto, imagem e arquivo

• Raciocínio — ambos usam esforço de raciocínio configurável em vez de um orçamento fixo de pensamento, então a profundidade é um parâmetro da requisição em cada um

Há um detalhe de agendamento do lado da DeepSeek que uma comparação de tabela de preços vai esconder. Nossa linha de catálogo traz uma janela de preço por horário: entre 01:00 e 04:00 UTC, e novamente entre 06:00 e 10:00 UTC, as tarifas listadas são multiplicadas por dois. Nesses horários, o V4 Pro custa US$ 1,32 de entrada e US$ 3,96 de saída — ainda mais barato que o Claude Sonnet 5.5, em 34% e 60%, respectivamente, mas não mais pelas margens que os números de destaque sugerem. Vale a pena agendar cargas de trabalho em lote que podem ser agendadas, e vale a pena precificar as que não podem pela tarifa de pico, em vez da média. Esse também é o tipo de coisa que só aparece se você ler o catálogo, e não a página de marketing, o que é o argumento para colocar todos os modelos candidatos atrás de um único endpoint em vez de três contas de fornecedores.

Dois números de capacidade, um deles não independente

Do lado de terceiros, o ranking é inequívoco. A Artificial Analysis atribui ao Claude Sonnet 5.5 uma pontuação de 56 e ao DeepSeek V4 Pro de 36 no Intelligence Index v4.3, ambos numa configuração de raciocínio de esforço máximo. O mesmo avaliador coloca o Claude Opus 5 em 51 e o Gemini 3.1 Pro Preview em 30, portanto a pontuação 36 do V4 Pro coloca-o abaixo do anterior carro-chefe da Anthropic e acima da categoria Pro do Google — uma posição respeitável para um modelo a um quinto do preço, e muito longe do topo.

A inversão de custo por tarefa também aparece aqui e, neste confronto, segue a direção oposta à do último. O DeepSeek V4 Pro custa US$ 0,67 para ser avaliado na suíte de índices. O Claude Sonnet 5.5 custa US$ 7,60. Isso não é um erro de digitação nem um artefato de arredondamento: o modelo mais recente da Anthropic emite 410 milhões de tokens ao longo da suíte, contra uma mediana de 88 milhões, e a verbosidade do modelo DeepSeek não chega nem perto de fechar uma diferença de preço desse tamanho. Em tarefas abertas sem restrições, o modelo mais barato é mais barato por uma ordem de magnitude na prática, não apenas na tabela de preços.

Os números dos fornecedores precisam ser tratados com mais cuidado. A DeepSeek publica um valor de 96,2 no τ²-Bench para o V4 Pro, que é um número forte, mas é informado pelo fornecedor e o τ²-Bench foi desde então removido do índice Artificial Analysis em sua revisão v4.3 — portanto, é um valor que não pode ser colocado de forma independente na mesma escala que qualquer coisa que a Anthropic publique. A própria tabela de lançamento da Anthropic para o Claude Sonnet 5.5 traz suas próprias ressalvas, incluindo uma nota de rodapé de que a configuração de esforço Max obtém pontuação inferior à Xhigh no FrontierCode e uma observação de que dois dos benchmarks foram executados em uma implantação de pré-lançamento com um bug de saídas estruturadas. Coloque as tabelas dos dois fornecedores lado a lado e você terá dois documentos de marketing, não um ranking. Os únicos números neste artigo que pertencem a um mesmo eixo são as duas pontuações de índice e os dois custos por tarefa, porque um único avaliador produziu todos os quatro.

Por que o teto de produção importa mais do que o preço

O número nesta comparação que recebe menos atenção é o que muda a arquitetura: 384.000 tokens de saída contra 128.000.

O teto de saída não é uma funcionalidade de conforto. Ele decide se uma tarefa é uma chamada ou uma cadeia. Gerar um arquivo-fonte grande, emitir um documento completo, produzir um relatório estruturado longo, traduzir um capítulo de livro — qualquer coisa em que o artefato seja maior que 128.000 tokens — não pode ser feito numa única chamada ao Claude Sonnet 5.5, e precisa ser decomposto numa sequência com estado transportado entre chamadas. Decomposição significa mais tokens de entrada reenviados a cada etapa, mais leituras de cache, mais código de orquestração e uma nova classe de falha em que as emendas entre os blocos são onde os erros moram. Um modelo cinco vezes mais caro que elimina toda uma camada de orquestração pode sair mais barato em horas de engenharia antes de sair mais barato em tokens e, na direção oposta, uma tarefa que cabe numa única chamada é uma tarefa em que o teto nem entra na aritmética.

Portanto, a questão do teto vem antes da questão do preço. Se o seu artefato mais longo couber em menos de 128.000 tokens, ignore esta seção e compare com base no custo por tarefa concluída. Se não couber, calcule o custo do pipeline que você teria de construir, não apenas o dos tokens.

Custo de troca e o problema do fallback

A migração, em qualquer direção, é sobretudo uma questão de prompting, e não de código, com uma exceção que vale a pena incluir no orçamento.

Ambos os modelos configuram o raciocínio por meio de um parâmetro de esforço, mas são parâmetros de fornecedores diferentes, com níveis diferentes e padrões diferentes. Um prompt ajustado para uma configuração de esforço alto da Anthropic não é transferido para uma configuração de esforço da DeepSeek como uma troca equivalente; ele é transferido como uma nova medição. Espere gastar um dia por carga de trabalho restabelecendo a qualidade antes de confiar em uma projeção de custos, em qualquer um dos lados da mudança.

A exceção é a visão. O Claude Sonnet 5.5 lê imagens e arquivos; o DeepSeek V4 Pro lê apenas texto. Qualquer parte do seu pipeline que entregue a um modelo uma captura de tela, uma página digitalizada ou um gráfico renderizado não tem equivalente no DeepSeek, portanto uma migração completa só está disponível para o subconjunto do seu tráfego que tem formato de texto. Essa é uma linha divisória a traçar desde cedo, porque normalmente significa que a resposta não é um único modelo, mas uma divisão.

Ambos já estão no OrcaRouter hoje,deepseek/deepseek-v4-pro e anthropic/claude-sonnet-5 são ambos entradas ativas do catálogo,com o preço de tabela do provedor e 0% de markup, em uma única credencial. Isso importa mais exatamente neste tipo de comparação, em que o fator decisivo não é qual modelo é melhor em abstrato, mas para qual modelo uma determinada requisição deve ir. Uma divisão que manda o trabalho em grande volume só de texto para o modelo barato e o trabalho de visão para o caro é uma regra de roteamento, e émuito mais fácil de expressar quando ambos os endpoints respondem à mesma chave e à mesma política de failover. O próprio Claude Sonnet 5.5 ainda não é uma rota na nossa plataforma, então a versão atual dessa divisão combinao modelo da Anthropic com o DeepSeek V4 Pro em vez de substituí-lo.

A decisão, enunciada como regra

Envie-o para o Claude Sonnet 5.5 quando a tarefa precisar ver — imagens, PDFs, capturas de tela, saída renderizada —, quando o artefato for mais longo que uma página de prosa e você quiser que um modelo de fronteira o escreva, ou quando uma diferença de vinte pontos em um índice for a diferença entre um rascunho que um humano precisa reescrever e um que ele consegue lançar.

Envie para o DeepSeek V4 Pro quando a carga de trabalho for de texto de entrada, texto de saída, alto volume e tolerante a um teto mais baixo de qualidade de raciocínio: classificação, extração, sumarização, reescrita em massa, transformação de código com uma especificação clara, e qualquer coisa em que você, de outra forma, estaria pagando dez dólares por milhão de tokens de saída para mover palavras de um lado para o outro. O desconto de 89% na leitura de cache torna os loops de agente com contexto longo neste modelo estruturalmente baratos de uma forma que nada mais na comparação é.

O veredito honesto: esta não é uma corrida de capacidade que a DeepSeek está perdendo, é uma decisão de alocação de recursos que a maioria das equipes erra na direção de comprar capacidade que não usa. Se o seu tráfego é texto e o seu padrão de qualidade é "bom o suficiente para revisar" em vez de "bom o suficiente para lançar sem ler", o V4 Pro a 20% do preço de saída e $0.022 de leituras de cache é o padrão correto, e os vinte pontos de índice são um imposto que você atualmente se voluntaria a pagar.

A two-column scoreboard for Claude Sonnet 5.5 and DeepSeek V4 Pro across eight rows. Left column Claude Sonnet 5.5: input $2.00, output $10.00, cache read $0.20, cache write $2.50 for the five-minute window, 1M context with 128K max output, input modality text, image and file, AA Intelligence Index v4.3 score 56, $7.60 per task on the index run. Right column DeepSeek V4 Pro: input $0.66, output $1.98, cache read $0.022, no separate cache-write line, 1,048,576-token context with 384K max output, input modality text only, AA Intelligence Index v4.3 score 36, $0.67 per task on the index run. The card heading reads "Twenty index points against an 89% cache-read discount", and a footer line notes that a timed-pricing window multiplies the DeepSeek rates by two between 01:00-04:00 and 06:00-10:00 UTC.Screenshot of the OrcaRouter model page for DeepSeek V4 Pro (deepseek/deepseek-v4-pro), showing the model header, the 1,048,576-token context window with 384,000 maximum output tokens, text-only input, the Tools, JSON and Reasoning capability tags with no Vision tag, a 1.86-second p50 time to first token, a "Public benchmarks by DeepSeek · 2026-04-24" line, and the $0.66 input and $1.98 output prices per million tokens.Screenshot of Artificial Analysis's model page for "DeepSeek V4 Pro 0813 (Reasoning, Max Effort)", marked an open-weights model and released August 2026, showing In $1.32 and Out $3.96 with a 97% cache discount, the Intelligence Index score of 36, an output rate of 96.6 tokens per second, the $0.67 average cost per task, and 160M output tokens described as somewhat verbose against a median of 140M.

Comparados neste artigo3

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente