Cartão de título principal para 'Tencent HY4 Preview vs tencent-hy3'. O título diz 'Seis vezes o preço — e o que o salto realmente compra'. Painel esquerdo 'Tencent HY4 Preview' (NOVO FLAGSHIP, 28 de ago de 2026) com chips '770B / 49B MoE', 'contexto de 1M', 'DeepSWE 64.3'. Painel direito 'tencent-hy3' (CAVALO DE BATALHA COMPROVADO) com chips '295B / 21B MoE', 'contexto de 256K', 'DeepSWE 28.0'. Um rodapé diz 'Preço ¥6/¥18 vs ¥1/¥4 por MTok. Benchmarks relatados pelo fornecedor.'
Guides & Insights

Tencent HY4 Preview vs tencent-hy3: Seis Vezes o Preço, e o que o Salto Realmente Compra

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY4 Preview é o primeiro modelo da família Hunyuan que faz seu próprio antecessor parecer barato de propósito: a Tencent o lista a seis vezes o preço de entrada do tencent-hy3 e quatro vezes e meia o preço de saída, e a apresentação de lançamento argumenta que o prêmio é merecido. Lançado e com código aberto em 28 de agosto de 2026, o Tencent HY4 Preview reporta uma pontuação de engenharia de software no DeepSWE que mais que dobra o 28,0 do Hy3, um 85,4 em operação de terminal no Terminal-Bench 2.1, e uma janela de contexto que salta de 256K para mais de um milhão de tokens. O tencent-hy3, que se tornou oficial em 6 de julho, é o cavalo de batalha maduro da família — 295B de parâmetros totais, 21B ativos, um quarto do contexto, e um preço mais próximo de um erro de arredondamento. Esta não é uma disputa que a ficha técnica deixe equilibrada. A questão é se a diferença vale o dinheiro para o que você realmente executa, e a resposta se divide por carga de trabalho.

O placar: onde os dois realmente divergem

Todo benchmark nos materiais da Tencent é relatado pelo fornecedor — executado nas próprias configurações de avaliação da Tencent no lançamento de cada modelo, não reproduzido por um laboratório independente, e, no caso do modelo principal, o modelo está público há menos de um dia. Trate as pontuações como o teto que a Tencent acredita ter atingido, e dê mais peso ao padrão do que a qualquer número isolado. O padrão é inconfundível, e está concentrado em trabalho de engenharia agêntica, em vez de conhecimento geral:

• DeepSWE — Tencent HY4 Preview: 64.3. tencent-hy3: 28.0. Este é o maior salto individual no pareamento, mais que dobrando em um benchmark de engenharia de software em escala de repositório, e é o número que separa um modelo de chat de um modelo ao qual você entrega um codebase inteiro.

• Terminal-Bench 2.1 — Tencent HY4 Preview: 85,4, que a Tencent afirma empatar com o Claude Opus 5 e superar o DeepSeek V4 Pro. tencent-hy3: 71,7, conforme relatado em seu lançamento em julho. Conduzir um terminal real até a conclusão em tarefas de várias etapas é exatamente o tipo de trabalho de horizonte longo em que o Hy3 era mais fraco.

• Verificado pela Toolathlon — Tencent HY4 Preview: 74,1, que a Tencent afirma superar o Qwen 3.8 Max e o GPT-5.6 Sol. Nenhum número comparável do Hy3 foi publicado.

• Teste cego interno — 163 especialistas avaliaram 203 tarefas de engenharia com 2,99/4,00 para o Tencent HY4 Preview, superando por pouco os 2,92 do GLM-5.3 e os 2,94 do Kimi K3. São revisores da Tencent avaliando tarefas da Tencent; encare isso como apenas indicativo.

A two-column comparison scoreboard titled 'Tencent HY4 Preview vs tencent-hy3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active params: 770B / 49B', 'Context window: 1M', 'DeepSWE: 64.3', 'Terminal-Bench 2.1: 85.4', 'Input price per MTok: ¥6 (~$0.85)', 'Output price per MTok: ¥18 (~$2.50)'. Right column 'tencent-hy3': 'Total / active params: 295B / 21B', 'Context window: 256K', 'DeepSWE: 28.0', 'Terminal-Bench 2.1: 71.7', 'Input price per MTok: ¥1 (~$0.14)', 'Output price per MTok: ¥4 (~$0.56)'. A footer reads 'Benchmarks vendor-reported by Tencent at each model's launch.'

O fio condutor: os ganhos estão na condução de terminais, na chamada de ferramentas e em tarefas em escala de repositório — o posicionamento de produtividade que a Tencent vem defendendo desde o Hy3, agora com a capacidade computacional para respaldá-lo.

O prêmio de preço, linha por linha

É aqui que a comparação deixa de ser sobre ostentação. Os preços de tabela da Tencent, por milhão de tokens:

Tencent HY4 Preview: 6 yuan (cerca de US$ 0,85). tencent-hy3: 1 yuan (cerca de US$ 0,14). Seis vezes.

• Saída — Tencent HY4 Preview: 18 yuan (~US$2,50). tencent-hy3: 4 yuan (~US$0,56). Quatro vezes e meia.

• Acerto de cache — Tencent HY4 Preview: 0,3 yuan. tencent-hy3: 0,25 yuan. Quase o mesmo, o que importa mais do que parece, porque loops agênticos reenviam constantemente o mesmo prompt de sistema e o prefixo da conversa.

Execute uma carga de trabalho realista de codificação agêntica pelo número combinado — digamos, 20 milhões de tokens de entrada e 4 milhões de tokens de saída por mês, um orçamento de agente para desenvolvedor único bem atarefado. Tencent HY4 Preview: 120 yuan mais 72 yuan, cerca de 192 yuan (~US$27). tencent-hy3: 20 yuan mais 16 yuan, cerca de 36 yuan (~US$5). O carro-chefe custa mais de cinco vezes mais para executar com a mesma mistura de tokens — e pedirá mais tokens de saída por tarefa, porque pensa por mais tempo.

Isso não é um motivo para evitar o Tencent HY4 Preview; o salto do DeepSWE é exatamente o tipo de capacidade que se compra com um plano premium. É um motivo para precificar a carga de trabalho antes de roteá-la. E é aí que a camada de roteamento mostra seu valor: o tencent-hy3 já está no OrcaRouter pelo preço de tabela do provedor — markup de 0%, então o número que você vê é o preço do próprio provedor que serve o modelo, não uma versão revendida e com markup — com failover automático entre provedores, e uma alteração de preço do fornecedor entra em vigor do nosso lado no mesmo dia.

Quatro vezes o contexto, o dobro da computação ativa.

{{1}}Arquitetura — Tencent HY4 Preview {{/1}}: 770B total, 49B ativo MoE. tencent-hy3: 295B total, 21B ativo. O carro-chefe emprega aproximadamente 2,3 vezes mais computação em cada token.

• Janela de contexto — Tencent HY4 Preview: mais de 1M de tokens. tencent-hy3: 256K. Um repositório completo ou um lote de documentos financeiros cabe na janela do modelo principal como uma única solicitação; no Hy3, a mesma tarefa exige fragmentação, recuperação ou um loop de agente.

• Controle de raciocínio — o tencent-hy3 oferece uma configuração de reasoning_effort por solicitação (no_think, low, high) além de uma camada de decodificação especulativa que o mantém rápido. O Tencent HY4 Preview, por admissão da própria Tencent, tende a pensar longamente antes da primeira saída e a se auto-verificar excessivamente em tarefas complexas — queimando tokens ao revisar o trabalho que já foi feito.

Essa última linha é a diferença oculta para uso sensível à latência. Hy3 pode ser instruído a responder diretamente; Tencent HY4 Preview, pelo menos nesta forma inicial, muitas vezes não consegue deixar de pensar. Para um chat de baixa latência ou um pipeline de extração de alto rendimento, a capacidade extra do carro-chefe é desperdiçada e seu raciocínio extra é um custo. Para um trabalho de engenharia em lote offline, o custo é exatamente o que compra a melhor resposta.

O imposto da prévia: o que a Hy3 ainda tem

{{1}}Preview{{/1}} está no nome do Tencent HY4 {{2}}Preview{{/2}} e ele se comporta como tal. Não há visão nem entrada multimodal — o modelo é {{3}}somente texto{{/3}}, então qualquer coisa relacionada a imagens ou vídeos permanece no modelo que você já usa para isso. O teste gratuito de duas semanas no WorkBuddy e no CodeBuddy é uma degustação, não um plano. A Tencent foi explícita: esta é uma {{4}}iteração inicial{{/4}} do Hy4, com melhorias de {{5}}pré-treinamento{{/5}} e {{6}}pós-treinamento{{/6}} ainda por vir, em um ritmo que produziu uma versão principal aproximadamente a cada {{7}}dois meses{{/7}} desde fevereiro. Benchmarks independentes para o carro-chefe: nenhum ainda, em nenhum lugar.

tencent-hy3 é o oposto de tudo isso. É um lançamento oficial e estável que está em produção desde julho. Seu nível gratuito vai até 30 de setembro. Seus níveis de raciocínio oferecem um controle em vez de um temperamento, e sua camada de decodificação especulativa e 21B parâmetros ativos fazem dele a metade barata, rápida e previsível desta família — o modelo que você aponta para o caminho padrão e esquece.

Screenshot of Tencent's official Hugging Face model card for the Hy4 Preview release, showing the model's open-weights download options, the 770B-parameter mixture-of-experts specification, and the million-token context window.

Quem deve escolher qual

Escolha {{KEEP}}Tencent HY4 Preview{{/KEEP}} quando o trabalho é o objetivo — uma tarefa difícil de engenharia de software, um contexto em escala de repositório, um fluxo de trabalho agêntico em que uma resposta melhor justifica cinco vezes a conta de tokens e você pode arcar com a latência de um modelo que pensa antes de falar. Escolha {{KEEP}}tencent-hy3{{/KEEP}} quando o trabalho é a restrição — alta vazão, baixa latência, um orçamento apertado, ou qualquer tarefa em que você queira que o modelo responda em vez de deliberar.

O padrão prático para um pareamento como esse é a escalada: direcionar o modelo barato e controlável pelo caminho padrão e escalar para o modelo principal somente quando a tarefa exigir. É para isso que serve o DSL de roteamento do OrcaRouter — compor vários modelos em uma única chamada para que a política seja configuração em vez de código — e o failover automático significa que o caminho do Hy3 continua servindo mesmo quando um provedor degrada. O OrcaRouter ainda não roteia o Tencent HY4 Preview; a Tencent não abriu o modelo para inferência de terceiros, então por enquanto ele roda no endpoint Tencent Cloud TokenHub do próprio fornecedor e em implantações self-hosted dos pesos abertos. O tencent-hy3, por sua vez, já está no catálogo hoje pelo preço de tabela do provedor — e no dia em que o modelo principal for aberto, ele se encaixa na mesma camada de roteamento da mesma forma, transformando a troca de um modelo para o outro em uma alteração de uma linha em vez de uma reescrita.

Screenshot of the OrcaRouter model page for tencent/hy3, showing its provider list price and availability through the one-API routing catalog — the half of this family that can be routed today.

O veredito é entediante no melhor sentido: o carro-chefe vale o preço premium exatamente pelo trabalho para o qual foi precificado, e o cavalo de batalha ainda é a escolha certa para tudo o que simplesmente precisa ser feito. A diferença de preço de seis vezes é real, a diferença entre 28 e 64 DeepSWE é real, e nenhuma anula a outra — você só precisa saber qual deles está comprando.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube