Cartão de destaque gerado com o título Claude Sonnet 5.5 vs Tencent HY4 Preview, subtítulo ambos os laboratórios estão vendendo a conta dos tokens, com três cartões de estatísticas: preço de saída por 1M $10,00 vs $2,50, pesos fechados vs Apache 2.0, e velocidade de saída medida 138,7 vs 22,3 tokens por segundo, com um rodapé lendo preço e velocidade do Tencent HY4 Preview por OrcaRouter's catalogue, lista de fornecedores 6 / 18 yuan por milhão; Claude Sonnet 5.5 por Anthropic.
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview: Ambos os laboratórios estão vendendo a conta dos tokens

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois lançamentos, com seis semanas de diferença, fazendo a mesma promessa com palavras diferentes. A alegação do fornecedor é que Claude Sonnet 5.5, lançado em 28 de setembro de 2026, custa "até 30% menos por tarefa" do que o Claude Sonnet 5 com taxas por token inalteradas. A segunda alegação é que a otimização de 7 de setembro para a versão hospedada do Tencent HY4 Preview, lançado pela primeira vez e de código aberto em 28 de agosto de 2026, reduz turnos de raciocínio e o consumo de tokens por tarefa na mesma qualidade de tarefa. Nenhum dos fornecedores aumentou ou diminuiu um preço para fazer essa alegação. Ambos estão dizendo que os tokens são o produto agora, e a parte interessante deste confronto é que apenas uma das duas alegações pode ser verificada em relação a um valor publicado por tarefa — porque apenas um desses dois modelos tem uma medição independente para verificar isso.

Essa assimetria não é uma crítica à Tencent. O HY4 Preview não tem página de modelo no Artificial Analysis, nenhuma pontuação independente do Intelligence Index e nenhum valor de custo por tarefa de terceiros. O que ele tem é uma tabela de benchmarks do fornecedor — Terminal-Bench 2.1 com 85,4, DeepSWE 64,3, uma avaliação cega interna em 203 tarefas de engenharia, nas quais teve média de 2,99 contra GLM-5.3 com 2,92 e Kimi K3 com 2,94 — e uma estreia pública com votação popular no ranking da WebDev Arena, em que a Tencent relata que ele ficou em torno do quinto lugar geral e em terceiro entre os modelos de pesos abertos. Todos esses são sinais reais. Nenhum deles é um custo por tarefa, o que significa que o número exato no qual ambos os fornecedores estão competindo está, para o HY4 Preview, indisponível.

O que cada lado de fato entregou

O Tencent HY4 Preview é uma mistura de especialistas com 770 bilhões de parâmetros, 49 bilhões ativos por token, 78 camadas, 256 especialistas roteados mais um especialista compartilhado, uma camada MTP nativa para decodificação especulativa e uma janela de contexto que ultrapassa um milhão de tokens. É somente texto por design — a Tencent o criou para agentes de codificação, uso complexo de ferramentas e trabalho de produtividade, não para imagens — e vem com raciocínio pesado por padrão, com três níveis configuráveis (alto, baixo, nenhum) e uma configuração de amostragem recomendada pelo fornecedor com temperatura 0.9 e top_p 1.0. Os pesos são Apache 2.0 e podem ser baixados do Hugging Face, GitHub, ModelScope e GitCode. A Tencent originalmente sinalizou dois pontos problemáticos na prévia, gastar mais tempo do que o necessário pensando e verificar demais o próprio trabalho, e a atualização de 7 de setembro visa exatamente esses pontos.

Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da A​nthropic e aquele que ela posiciona como a melhor combinação de velocidade e inteligência da linha. Um milhão de tokens de contexto, 128.000 tokens de saída de forma síncrona e 300.000 na API Message Batches, entrada de texto, imagem e arquivo, raciocínio adaptativo com esforço selecionável, data de corte de conhecimento em junho de 2026, retenção zero de dados disponível desde o lançamento e um piso de descontinuação em 28 de setembro de 2027. A tabela de preços não mudou em relação ao Claude Sonnet 5: US$ 2,00 por milhão de tokens de entrada, US$ 10,00 por milhão de tokens de saída, US$ 0,20 para leituras de cache e US$ 2,50 para gravações de cache. Pesos fechados, API da Anthro​pic, além de Bedrock, Goo​gle Cloud e Microsoft Foundry.

Coloque os dois um contra o outro e as posições são quase simétricas:

• Preço — Claude Sonnet 5.5 $2,00 de entrada / $10,00 de saída por milhão vs. Tencent HY4 Preview $0,83 de entrada / $2,50 de saída no nosso catálogo, a partir de uma lista de fornecedores de ¥6 / ¥18

• Leituras de cache — Claude Sonnet 5.5 $0,20 por milhão vs Tencent HY4 Preview $0,042 por milhão no nosso catálogo

• Pesos — Claude Sonnet 5.5 fechado vs. Tencent HY4 Preview Apache 2.0, disponível para download

• Contexto — Claude Sonnet 5.5 1.000.000 de tokens vs Tencent HY4 Preview 1.048.576 de tokens, efetivamente idênticos

• Saída máxima — Claude Sonnet 5.5 128.000 síncrono, 300.000 em Batches vs Tencent HY4 Preview 64.000 no nosso catálogo

• Modalidade de entrada — Claude Sonnet 5.5 texto, imagem e arquivo vs. Tencent HY4 Preview somente texto

• Pontuações independentes — Claude Sonnet 5.5 Intelligence Index 56 a US$ 7,60 por tarefa, revisão v4.3.2 vs. Tencent HY4 Preview, nenhuma publicada

• Velocidade de saída medida — Claude Sonnet 5.5 138,7 tokens/s vs. Tencent HY4 Preview 22,3 tokens/s no nosso próprio tráfego

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

A alegação que ambos os laboratórios estão fazendo, e por que uma delas é verificável

A​ abordagem da A​nthropic de "30% menos por tarefa" e a da T​encent de "menos turnos de raciocínio, menor consumo de tokens" são o mesmo projeto de engenharia descrito de duas direções: fazer o modelo gastar menos tokens para chegar à mesma resposta. A​ Anthropic deixa explícito que as tarifas não mudaram, o que significa que qualquer economia por tarefa tem de vir da contagem de tokens — e o painel independente permite ver a forma do problema em vez da dimensão da correção. O Claude Sonnet 5.5 gera 410 milhões de tokens de saída em toda a avaliação do Intelligence Index, contra 117 milhões do MiniMax M3 e 77 milhões do Grok 4.5. É um modelo verboso, medido, num painel que publica o número. Independentemente do que a melhoria de 30% em relação ao Claude Sonnet 5 represente, está a ser aplicada a uma base muito grande.

Para o HY4 Preview, o número equivalente não existe publicamente. A própria nota de otimização da Tencent é o único relato disso, e ela afirma o resultado sem um número: menos turnos, menos tokens de entrada e saída, mesma qualidade, validado por métricas de benchmark e avaliação humana numa dupla passagem. Isso é uma alegação de fornecedor no sentido estrito — declarada, plausível, não reproduzida — e é rotulada como tal aqui. Adotar um modelo de pré-visualização com base na alegação de economia de tokens de um fornecedor, quando a economia de tokens é justamente aquilo que você não consegue medir de fora, é exatamente a aposta que um lançamento de pré-visualização está pedindo que você faça.

Vale a pena conhecer um detalhe adicional antes que alguém planeje uma implantação auto-hospedada em torno dessa otimização. A mudança da Tencent em 7 de setembro se aplica à build que a Tencent disponibiliza em seus próprios endpoints hospedados. O snapshot de pesos abertos não foi atualizado — a data da última modificação do repositório do Hugging Face ainda é 28 de agosto —, portanto uma cópia auto-hospedada dos pesos executa o comportamento original, de raciocínio mais longo, que as notas da prévia sinalizaram. A versão otimizada e a versão para download não são o mesmo artefato.

Onde os pesos abertos realmente compensam é no mesmo lugar de sempre: uma implantação que não pode chamar uma API. Um modelo de 770B parâmetros com 49B ativos é uma decisão de datacenter, e não de estação de trabalho, então esta não é a história de classe laptop que um modelo de 30B conta — mas, para um comprador que precisa do modelo dentro do seu próprio perímetro, Apache 2.0 nessa escala é uma opção que o Claude Sonnet 5.5 não oferece a preço algum.

Experimentando uma prévia sem apostar um caminho de produção nela

Modelos de pré-visualização são o caso em que o roteamento deixa de ser uma otimização de custos e se torna um controle de risco. A razão para colocar um build de pré-visualização atrás de um roteador em vez de chamá-lo diretamente é que uma pré-visualização é definida pela possibilidade de mudar debaixo de você, e as duas coisas que você quer da camada à frente dela são uma divisão percentual e algo para capturar as falhas.

Essa é a forma que o OrcaRouter oferece: um endpoint compatível com OpenAI cobrindo mais de 200 modelos, preço de lista do provedor repassado sem nenhum acréscimo de margem, failover automático entre provedores upstream, e uma DSL de roteamento para compor chamadas a partir de vários modelos. O Tencent HY4 Preview é roteável aqui hoje como tencent/hy4-preview a $0,83 de entrada e $2,50 de saída por milhão de tokens, com leituras de cache a $0,042 ao longo de sua janela de 1.048.576 tokens — a mesma build, na tarifa do provedor, acessível com a chave que você já usa para todo o resto do catálogo. O Claude Sonnet 5 também é roteável aqui, a $2,00 e $10,00 da Anthropic, e tem sido desde 30 de junho; ele é um parceiro óbvio de failover enquanto um modelo com um dia de existência acumula evidências em produção.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 não é nosso. Foi lançado ontem, a API é da própria Anthropic, e esta página não vai sugerir o contrário — o objetivo do roteamento é que a maneira segura de executar um nível totalmente novo em produção é dar a ele uma fatia de tráfego com algo comprovado por trás, e isso só funciona quando ambas as pontas do arranjo estão em algum lugar que você possa alcançar de um único lugar. HY4 Preview está carregando 372 mil tokens de tráfego por semana aqui, que é o que uma prévia de dois dias parece antes que alguém se comprometa com ela; Claude Sonnet 5 vem carregando 7,9 milhões por semana desde 30 de junho, e essa é a diferença entre um candidato e um piso.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Para onde o dinheiro realmente vai

Apenas pelas tarifas, o HY4 Preview é quatro vezes mais barato na saída do que o Claude Sonnet 5.5 e quase cinco vezes mais barato nas leituras de cache, além de igualar a janela. Do lado medido, o Claude Sonnet 5.5 gera saída seis vezes mais rápido em nosso próprio tráfego — 138,7 tokens por segundo contra 22,3 —, que é o tipo de diferença que transforma uma vantagem de tarifa de quatro vezes em uma vantagem de tempo real muito menor e, ocasionalmente, em uma perda, quando o enfileiramento é levado em conta.

Entre esses dois fatos, a decisão se apoia em quatro perguntas que só o leitor pode responder. O trabalho precisa de uma imagem ou de um arquivo no prompt? O HY4 Preview é somente texto e isso encerra a discussão. Ele precisa concluir uma tarefa de software com várias etapas, em que a pontuação de 85,4 do HY4 Preview no Terminal-Bench 2.1 é um número da própria Tencent e não foi reproduzida? Então o status de pré-visualização é o risco que você está aceitando, e vale mais testar de novo a otimização de 7 de setembro do que confiar nela. A carga de trabalho precisa rodar dentro do seu próprio perímetro? Então os pesos Apache 2.0 são o fato decisivo. E o nível de capacidade composta importa mais do que a taxa? Então o 56 do Claude Sonnet 5.5, medido de forma independente, é o número a ponderar, a US$ 7,60 por tarefa do Index, com a ressalva de que não existe nenhum número equivalente do lado da Tencent com o qual compará-lo.

O que os dois lançamentos realmente demonstram é que a fronteira já superou as tabelas de preços. Dois laboratórios, com seis semanas de diferença, lançaram modelos e deram destaque ao consumo de tokens por tarefa, em vez do preço por milhão, e a consequência prática para um comprador é que o número útil não está mais na página de preços de nenhum dos fornecedores. É a contagem de tokens que sua própria carga de trabalho produz, medida nos dois modelos, e é o único número neste artigo que nenhum dos fornecedores pode fornecer a você.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente