
Claude Sonnet 5.5 vs Tencent HY4 Preview: Ambos os laboratórios estão vendendo a conta dos tokens
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 931 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 192 tok/s
- OrcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- xAISpaceXAI: Grok 4.62026-08-1244Inteligência77Código
Dois lançamentos, com seis semanas de diferença, fazendo a mesma promessa com palavras diferentes. A alegação do fornecedor é que Claude Sonnet 5.5, lançado em 28 de setembro de 2026, custa "até 30% menos por tarefa" do que o Claude Sonnet 5 com taxas por token inalteradas. A segunda alegação é que a otimização de 7 de setembro para a versão hospedada do Tencent HY4 Preview, lançado pela primeira vez e de código aberto em 28 de agosto de 2026, reduz turnos de raciocínio e o consumo de tokens por tarefa na mesma qualidade de tarefa. Nenhum dos fornecedores aumentou ou diminuiu um preço para fazer essa alegação. Ambos estão dizendo que os tokens são o produto agora, e a parte interessante deste confronto é que apenas uma das duas alegações pode ser verificada em relação a um valor publicado por tarefa — porque apenas um desses dois modelos tem uma medição independente para verificar isso.
Essa assimetria não é uma crítica à Tencent. O HY4 Preview não tem página de modelo no Artificial Analysis, nenhuma pontuação independente do Intelligence Index e nenhum valor de custo por tarefa de terceiros. O que ele tem é uma tabela de benchmarks do fornecedor — Terminal-Bench 2.1 com 85,4, DeepSWE 64,3, uma avaliação cega interna em 203 tarefas de engenharia, nas quais teve média de 2,99 contra GLM-5.3 com 2,92 e Kimi K3 com 2,94 — e uma estreia pública com votação popular no ranking da WebDev Arena, em que a Tencent relata que ele ficou em torno do quinto lugar geral e em terceiro entre os modelos de pesos abertos. Todos esses são sinais reais. Nenhum deles é um custo por tarefa, o que significa que o número exato no qual ambos os fornecedores estão competindo está, para o HY4 Preview, indisponível.
O que cada lado de fato entregou
O Tencent HY4 Preview é uma mistura de especialistas com 770 bilhões de parâmetros, 49 bilhões ativos por token, 78 camadas, 256 especialistas roteados mais um especialista compartilhado, uma camada MTP nativa para decodificação especulativa e uma janela de contexto que ultrapassa um milhão de tokens. É somente texto por design — a Tencent o criou para agentes de codificação, uso complexo de ferramentas e trabalho de produtividade, não para imagens — e vem com raciocínio pesado por padrão, com três níveis configuráveis (alto, baixo, nenhum) e uma configuração de amostragem recomendada pelo fornecedor com temperatura 0.9 e top_p 1.0. Os pesos são Apache 2.0 e podem ser baixados do Hugging Face, GitHub, ModelScope e GitCode. A Tencent originalmente sinalizou dois pontos problemáticos na prévia, gastar mais tempo do que o necessário pensando e verificar demais o próprio trabalho, e a atualização de 7 de setembro visa exatamente esses pontos.
Claude Sonnet 5.5 é o segundo modelo da geração 5.5 da Anthropic e aquele que ela posiciona como a melhor combinação de velocidade e inteligência da linha. Um milhão de tokens de contexto, 128.000 tokens de saída de forma síncrona e 300.000 na API Message Batches, entrada de texto, imagem e arquivo, raciocínio adaptativo com esforço selecionável, data de corte de conhecimento em junho de 2026, retenção zero de dados disponível desde o lançamento e um piso de descontinuação em 28 de setembro de 2027. A tabela de preços não mudou em relação ao Claude Sonnet 5: US$ 2,00 por milhão de tokens de entrada, US$ 10,00 por milhão de tokens de saída, US$ 0,20 para leituras de cache e US$ 2,50 para gravações de cache. Pesos fechados, API da Anthropic, além de Bedrock, Google Cloud e Microsoft Foundry.
Coloque os dois um contra o outro e as posições são quase simétricas:
• Preço — Claude Sonnet 5.5 $2,00 de entrada / $10,00 de saída por milhão vs. Tencent HY4 Preview $0,83 de entrada / $2,50 de saída no nosso catálogo, a partir de uma lista de fornecedores de ¥6 / ¥18
• Leituras de cache — Claude Sonnet 5.5 $0,20 por milhão vs Tencent HY4 Preview $0,042 por milhão no nosso catálogo
• Pesos — Claude Sonnet 5.5 fechado vs. Tencent HY4 Preview Apache 2.0, disponível para download
• Contexto — Claude Sonnet 5.5 1.000.000 de tokens vs Tencent HY4 Preview 1.048.576 de tokens, efetivamente idênticos
• Saída máxima — Claude Sonnet 5.5 128.000 síncrono, 300.000 em Batches vs Tencent HY4 Preview 64.000 no nosso catálogo
• Modalidade de entrada — Claude Sonnet 5.5 texto, imagem e arquivo vs. Tencent HY4 Preview somente texto
• Pontuações independentes — Claude Sonnet 5.5 Intelligence Index 56 a US$ 7,60 por tarefa, revisão v4.3.2 vs. Tencent HY4 Preview, nenhuma publicada
• Velocidade de saída medida — Claude Sonnet 5.5 138,7 tokens/s vs. Tencent HY4 Preview 22,3 tokens/s no nosso próprio tráfego

A alegação que ambos os laboratórios estão fazendo, e por que uma delas é verificável
A abordagem da Anthropic de "30% menos por tarefa" e a da Tencent de "menos turnos de raciocínio, menor consumo de tokens" são o mesmo projeto de engenharia descrito de duas direções: fazer o modelo gastar menos tokens para chegar à mesma resposta. A Anthropic deixa explícito que as tarifas não mudaram, o que significa que qualquer economia por tarefa tem de vir da contagem de tokens — e o painel independente permite ver a forma do problema em vez da dimensão da correção. O Claude Sonnet 5.5 gera 410 milhões de tokens de saída em toda a avaliação do Intelligence Index, contra 117 milhões do MiniMax M3 e 77 milhões do Grok 4.5. É um modelo verboso, medido, num painel que publica o número. Independentemente do que a melhoria de 30% em relação ao Claude Sonnet 5 represente, está a ser aplicada a uma base muito grande.
Para o HY4 Preview, o número equivalente não existe publicamente. A própria nota de otimização da Tencent é o único relato disso, e ela afirma o resultado sem um número: menos turnos, menos tokens de entrada e saída, mesma qualidade, validado por métricas de benchmark e avaliação humana numa dupla passagem. Isso é uma alegação de fornecedor no sentido estrito — declarada, plausível, não reproduzida — e é rotulada como tal aqui. Adotar um modelo de pré-visualização com base na alegação de economia de tokens de um fornecedor, quando a economia de tokens é justamente aquilo que você não consegue medir de fora, é exatamente a aposta que um lançamento de pré-visualização está pedindo que você faça.
Vale a pena conhecer um detalhe adicional antes que alguém planeje uma implantação auto-hospedada em torno dessa otimização. A mudança da Tencent em 7 de setembro se aplica à build que a Tencent disponibiliza em seus próprios endpoints hospedados. O snapshot de pesos abertos não foi atualizado — a data da última modificação do repositório do Hugging Face ainda é 28 de agosto —, portanto uma cópia auto-hospedada dos pesos executa o comportamento original, de raciocínio mais longo, que as notas da prévia sinalizaram. A versão otimizada e a versão para download não são o mesmo artefato.
Onde os pesos abertos realmente compensam é no mesmo lugar de sempre: uma implantação que não pode chamar uma API. Um modelo de 770B parâmetros com 49B ativos é uma decisão de datacenter, e não de estação de trabalho, então esta não é a história de classe laptop que um modelo de 30B conta — mas, para um comprador que precisa do modelo dentro do seu próprio perímetro, Apache 2.0 nessa escala é uma opção que o Claude Sonnet 5.5 não oferece a preço algum.
Experimentando uma prévia sem apostar um caminho de produção nela
Modelos de pré-visualização são o caso em que o roteamento deixa de ser uma otimização de custos e se torna um controle de risco. A razão para colocar um build de pré-visualização atrás de um roteador em vez de chamá-lo diretamente é que uma pré-visualização é definida pela possibilidade de mudar debaixo de você, e as duas coisas que você quer da camada à frente dela são uma divisão percentual e algo para capturar as falhas.
Essa é a forma que o OrcaRouter oferece: um endpoint compatível com OpenAI cobrindo mais de 200 modelos, preço de lista do provedor repassado sem nenhum acréscimo de margem, failover automático entre provedores upstream, e uma DSL de roteamento para compor chamadas a partir de vários modelos. O Tencent HY4 Preview é roteável aqui hoje como tencent/hy4-preview a $0,83 de entrada e $2,50 de saída por milhão de tokens, com leituras de cache a $0,042 ao longo de sua janela de 1.048.576 tokens — a mesma build, na tarifa do provedor, acessível com a chave que você já usa para todo o resto do catálogo. O Claude Sonnet 5 também é roteável aqui, a $2,00 e $10,00 da Anthropic, e tem sido desde 30 de junho; ele é um parceiro óbvio de failover enquanto um modelo com um dia de existência acumula evidências em produção.

Claude Sonnet 5.5 não é nosso. Foi lançado ontem, a API é da própria Anthropic, e esta página não vai sugerir o contrário — o objetivo do roteamento é que a maneira segura de executar um nível totalmente novo em produção é dar a ele uma fatia de tráfego com algo comprovado por trás, e isso só funciona quando ambas as pontas do arranjo estão em algum lugar que você possa alcançar de um único lugar. HY4 Preview está carregando 372 mil tokens de tráfego por semana aqui, que é o que uma prévia de dois dias parece antes que alguém se comprometa com ela; Claude Sonnet 5 vem carregando 7,9 milhões por semana desde 30 de junho, e essa é a diferença entre um candidato e um piso.

Para onde o dinheiro realmente vai
Apenas pelas tarifas, o HY4 Preview é quatro vezes mais barato na saída do que o Claude Sonnet 5.5 e quase cinco vezes mais barato nas leituras de cache, além de igualar a janela. Do lado medido, o Claude Sonnet 5.5 gera saída seis vezes mais rápido em nosso próprio tráfego — 138,7 tokens por segundo contra 22,3 —, que é o tipo de diferença que transforma uma vantagem de tarifa de quatro vezes em uma vantagem de tempo real muito menor e, ocasionalmente, em uma perda, quando o enfileiramento é levado em conta.
Entre esses dois fatos, a decisão se apoia em quatro perguntas que só o leitor pode responder. O trabalho precisa de uma imagem ou de um arquivo no prompt? O HY4 Preview é somente texto e isso encerra a discussão. Ele precisa concluir uma tarefa de software com várias etapas, em que a pontuação de 85,4 do HY4 Preview no Terminal-Bench 2.1 é um número da própria Tencent e não foi reproduzida? Então o status de pré-visualização é o risco que você está aceitando, e vale mais testar de novo a otimização de 7 de setembro do que confiar nela. A carga de trabalho precisa rodar dentro do seu próprio perímetro? Então os pesos Apache 2.0 são o fato decisivo. E o nível de capacidade composta importa mais do que a taxa? Então o 56 do Claude Sonnet 5.5, medido de forma independente, é o número a ponderar, a US$ 7,60 por tarefa do Index, com a ressalva de que não existe nenhum número equivalente do lado da Tencent com o qual compará-lo.
O que os dois lançamentos realmente demonstram é que a fronteira já superou as tabelas de preços. Dois laboratórios, com seis semanas de diferença, lançaram modelos e deram destaque ao consumo de tokens por tarefa, em vez do preço por milhão, e a consequência prática para um comprador é que o número útil não está mais na página de preços de nenhum dos fornecedores. É a contagem de tokens que sua própria carga de trabalho produz, medida nos dois modelos, e é o único número neste artigo que nenhum dos fornecedores pode fornecer a você.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
