
Tencent HY4 Preview é open-source: 770B MoE, contexto de 1M e um preço que fica abaixo da fronteira
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0259Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0258Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0166Inteligência82Código
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
Tencent HY4 Preview, lançado e disponibilizado como código aberto em 28 de agosto de 2026, é o primeiro modelo aberto de pesos genuinamente competitivo de um laboratório chinês em meses, e seu número mais surpreendente é o preço. A Tencent o lista a 6 yuans (~US$ 0,85) por milhão de tokens de entrada e 18 yuans (~US$ 2,50) por milhão de tokens de saída — aproximadamente um décimo do que um modelo fechado de ponta cobra pela saída — enquanto publica um modelo de mistura de especialistas com 770 bilhões de parâmetros, dos quais 49 bilhões são ativos por token, com uma janela de contexto que ultrapassa um milhão de tokens. É o sucessor do Hy3 da família Hunyuan (295B no total, contexto de 256K) e quadruplica esse contexto, mais que dobrando a capacidade ativa. Os pesos podem ser baixados hoje do Hugging Face, GitHub, ModelScope e GitCode, e o mesmo modelo já está ativo nos produtos da própria Tencent: WorkBuddy, CodeBuddy nas versões nacional e internacional, o assistente Yuanbao e o aplicativo de espaço de trabalho ima. Para quem vem observando os modelos de pesos abertos ficarem aquém da fronteira em engenharia de software, este é o lançamento que finalmente torna a lacuna discutível — e as ressalvas são tão importantes quanto os números.
O posicionamento é deliberado. A Tencent apresenta o Tencent HY4 Preview como um modelo de produtividade para quatro domínios: engenharia de software, escritório e análise de dados, desenvolvimento de jogos e pesquisa científica. A ênfase em engenharia é o que o separa da multidão de generalistas — as notas de versão têm como destaque a compreensão de tarefas de longo horizonte, o planejamento e a depuração, não a qualidade do chat. Esse foco aparece tanto na lista de integrações quanto na tabela de benchmarks: o CodeBuddy recebe o modelo em seu IDE, o WorkBuddy o recebe em fluxos de trabalho de escritório (a Tencent o demonstra processando 72 documentos financeiros de uma só vez), e os desenvolvedores de jogos obtêm ganchos MCP para Unreal Engine 5 e Unity que transformam uma única frase em uma demo jogável.
O que realmente foi lançado
A ficha de especificações vale a pena ser lida linha por linha, porque cada linha muda o que um modelo de pesos abertos pode fazer.
• Arquitetura — Mixture-of-Experts com 770B de parâmetros totais e 49B ativos por token, uma proporção de esparsidade de aproximadamente 16:1 que mantém o custo de inferência em uma faixa que uma pequena equipe pode realmente pagar.
Janela de contexto — mais de 1 milhão de tokens, quatro vezes os 256K da Hy3. Tarefas de engenharia de longo horizonte — um repositório completo na janela, uma refatoração de múltiplos arquivos, um grande lote de documentos — tornam-se problemas de solicitação única.
• Pesos — lançamento aberto no estilo MIT em Hugging Face, GitHub, ModelScope e GitCode. Este é um modelo baixável e auto-hospedável, não um teaser hospedado.
• API — disponível no TokenHub da Tencent Cloud, o endpoint hospedado do próprio fornecedor, com preço de 6 yuan por milhão de tokens de entrada, 18 yuan por milhão de tokens de saída e 0,3 yuan por milhão de tokens para acertos de cache.
• Integração de produtos — WorkBuddy, CodeBuddy (nacional e internacional), Yuanbao e ima, ou seja, os mesmos pesos que a Tencent utiliza em seus próprios aplicativos são os que você pode baixar e executar.
Tencent também relata um número de engenharia de inferência que raramente aparece em uma nota de lançamento: uma melhoria de 31,8% na taxa de transferência ponta a ponta graças à fusão de operadores e à otimização de comunicação. O que faz isso ser mais do que uma nota de rodapé de especificação é que a Tencent afirma que o Tencent HY4 Preview encontrou os gargalos sozinho — o modelo analisou sua própria pilha de inferência, e as otimizações são relatadas como estáveis em diferentes comprimentos de contexto e níveis de concorrência. Esse é o tipo de detalhe que separa um modelo que um laboratório lança como artefato de pesquisa de um modelo que uma empresa espera que receba tráfego de produção. Em uma prévia que está pública há apenas alguns dias, também é exatamente o tipo de afirmação que ninguém fora da Tencent verificou até agora.
As pontuações que valem a pena citar
Cada benchmark que a Tencent publicou para o Tencent HY4 Preview é relatado pelo fornecedor — executado no próprio ambiente de avaliação da Tencent, não reproduzido por nenhum laboratório independente, e o modelo está público há apenas alguns dias. Leia-os como o teto que a Tencent acredita ter atingido, não como fato estabelecido.

O número principal é o Terminal Bench 2.1, um teste de quão bem um modelo opera um terminal real durante a codificação. A Tencent relata que o Tencent HY4 Preview obteve 85,4, o que segundo ela empata com o Claude Opus 5 e supera o DeepSeek V4 Pro, e também supera seu próprio antecessor Hy3 por 14,6 pontos. Esse número único está fazendo muito trabalho — é a afirmação que coloca um modelo de pesos abertos em paridade com os modelos de fronteira fechados mais caros em um teste difícil de codificação agêntica — e é a afirmação que mais precisa de confirmação independente.
O restante da tabela interna: DeepSWE, um benchmark de engenharia de software, salta de 28,0 no Hy3 para 64,3, o que a Tencent descreve como "reduzindo gradualmente a lacuna" com modelos de primeira linha. No Toolathlon-Verified, um teste de chamada de ferramentas, obtém 74,1, o que a Tencent afirma superar o Qwen 3.8 Max e o GPT-5.6 Sol e se aproximar do Kimi K3 e do Claude Opus 5. No APEX-Agents pass@1, fica em 37,1, um pouco atrás dos 37,2 do Kimi K3. E em um teste cego interno separado, 163 especialistas avaliaram 203 tarefas de engenharia com 2,99 em 4,00, superando por pouco os 2,92 do GLM-5.3 e os 2,94 do Kimi K3.
Dois padrões se destacam. Primeiro, todos os números fortes estão em trabalhos de engenharia agêntica — condução de terminal, chamada de ferramentas, tarefas em escala de repositório — e nenhum está em conhecimento ou raciocínio genéricos, o que é consistente com o posicionamento de produtividade, e não uma coincidência. Segundo, a Tencent tem o cuidado de descrever o DeepSWE e os demais como estreitando, não fechando, as lacunas. A única afirmação de paridade clara e comercializável é o empate no Terminal Bench 2.1, e é a afirmação que mais vale a pena testar com a sua própria carga de trabalho.
O que o preço realmente inclui
É no preço que o lançamento deixa de ser interessante e começa a ser disruptivo. Na lista de preços da Tencent, um milhão de tokens de entrada custa aproximadamente o mesmo que uma única chamada de API de nível médio em algumas plataformas. O valor de 18 yuans por milhão de tokens de saída (~US$ 2,50) fica muito abaixo do preço de US$ 25 por milhão de saída de um modelo de fronteira fechado de ponta, e a taxa de acerto de cache de 0,3 yuan torna loops de agente longos — em que o mesmo prompt de sistema e os prefixos de conversa são reenviados constantemente — excepcionalmente baratos de executar.
Este é também o único lugar onde a camada de roteamento altera a matemática. O OrcaRouter ainda não roteia o Tencent HY4 Preview — a Tencent não disponibilizou este modelo para plataformas de inferência de terceiros, então ele roda no endpoint TokenHub da própria Tencent Cloud e em implantações auto-hospedadas dos pesos abertos, e não afirmamos servir o que não servimos. Mas a disciplina que torna um corte de preço relevante é a mesma pela qual o resto do catálogo se rege: o OrcaRouter repassa os preços de tabela dos provedores sem nenhum markup, então quando um fornecedor como a Tencent precifica um token em 6 yuans, o valor que você paga do nosso lado é 6 yuans, não uma versão revendida e com markup, e no dia em que um fornecedor altera um preço, a mudança entra em vigor do nosso lado no mesmo dia. Uma única API para mais de 200 modelos, failover automático entre provedores quando um deles falha e um DSL de roteamento para compor modelos — esse é o mecanismo que carregará o Tencent HY4 Preview no momento em que ele se tornar roteável, juntamente com os outros modelos abertos e fechados já presentes no catálogo.

As partes que não cabem em uma ficha técnica
Duas afirmações no material de lançamento merecem atenção à parte, pois dizem respeito a como o modelo foi construído, e não ao que ele pontuou.
O primeiro é o ciclo de auto-aprimoramento. A Tencent afirma que o Tencent HY4 Preview participou de sua própria pesquisa e desenvolvimento — ele foi usado para otimizar os métodos de treinamento, a estratégia de dados, os sistemas de avaliação e os operadores subjacentes que o produziram. O ganho de throughput de 31,8% é o resultado público mais concreto desse ciclo: a Tencent o atribui a gargalos que o modelo identificou em sua própria pilha de servição. Esse é um ciclo inicial de autoaperfeiçoamento recursivo: um modelo ajudando a projetar a próxima versão de si mesmo. Não é incomum que um laboratório de fronteira relate partes disso, mas um modelo chinês de pesos abertos descrevendo publicamente o ciclo como uma capacidade entregue é uma mudança de patamar na forma como esses lançamentos falam sobre si mesmos.
{{1}}O segundo é o resultado matemático.{{/1}} A Tencent informa que o modelo avançou o limite inferior conhecido do volume do problema de Blaschke–Lebesgue — uma questão em aberto de longa data em geometria convexa sobre o corpo de largura constante de volume mínimo — {{2}}de 0.380799 para 0.41104{{/2}}, deixando-o a cerca de 2% do limite da conjectura do tetraedro de Meissner. {{3}}A Tencent também relata uma aceleração de 2,0x em uma simulação de bicamada de fosfolipídios com 32.512 átomos, com redução para 54,9 milissegundos por etapa, na área de pesquisa científica.{{/3}} {{4}}Esses são os tipos de resultados que normalmente valem a um modelo um artigo próprio; aqui, eles são destaques de lançamento e, como o restante do material de lançamento, são um relato da própria Tencent.{{/4}}
O que está faltando, honestamente
A Tencent lista as limitações conhecidas de forma clara, e elas importam para qualquer pessoa que decida o que construir sobre este modelo. Não há capacidade de visão nem entrada multimodal — o Tencent HY4 Preview é um modelo de texto, ponto final, então qualquer coisa relacionada a imagem ou vídeo pertence a outro modelo. A Tencent também sinaliza que o modelo apresenta comportamento de inicialização lenta em tarefas complexas — pensamento demorado antes da primeira saída — e uma tendência a se autoverificar em excesso, queimando tokens para conferir o trabalho que já realizou. Essa combinação é exatamente errada para chat sensível à latência e exatamente tolerável para trabalho de engenharia em lote offline, o que mostra onde a Tencent espera que você o execute.
E a ausência mais importante é a verificação. Ainda não há pontuações independentes para o Tencent HY4 Preview em lugar nenhum — nem num ranking público, nem num laboratório de avaliação terceirizado, nem mesmo numa entrada do Artificial Analysis. O modelo é novo demais para isso. O teste cego interno com especialistas é um sinal útil sobre como os revisores da própria Tencent o veem em comparação com GLM-5.3 e Kimi K3, mas são os revisores da Tencent avaliando tarefas da Tencent. Tudo o que vai além da ficha técnica é uma afirmação aguardando verificação.

Quem deve puxar os pesos hoje
A resposta honesta é que {{1}}este lançamento se divide claramente em dois públicos{{/1}}. Se você executa cargas de trabalho de engenharia na sua própria infraestrutura e a economia das APIs fechadas é o que está impedindo você, a prévia do Tencent HY4 vale um teste sério de fim de semana agora: {{2}}os pesos são abertos, a janela de contexto tem escala de repositório e o preço de tabela torna um longo loop agêntico acessível de uma forma que um modelo de US$ 25 por milhão de tokens de saída nunca será{{/2}}. Se você está executando chat de produção sensível à latência, ou qualquer coisa multimodal, ou qualquer coisa em que você não pode pagar por um modelo cuja única evidência são os benchmarks do próprio fornecedor, espere — {{3}}o ritmo de iteração de dois meses que a Tencent mantém desde fevereiro sugere que um lançamento completo do Hy4 não está longe{{/3}}, e a prévia é explicitamente uma iteração inicial com imperfeições conhecidas.
O meio-termo prático é um padrão de roteamento: execute o modelo comprovado no seu caminho crítico e o novo ao lado dele, alternando para o Tencent HY4 Preview em tarefas onde seu perfil de custo vence e revertendo automaticamente quando não vence. É para esse padrão que existe um roteador — o mesmo OrcaRouter que roteia Claude Opus 5, DeepSeek V4 Pro e Gemini 3.1 Pro pelos preços de tabela de seus provedores transportará este modelo no dia em que a Tencent o liberar. Até lá, os pesos estão no GitHub, a API está no Tencent Cloud, e a alegação de que um modelo de pesos abertos alcançou o nível mais alto de codificação agêntica finalmente tem um número específico associado a ela. O número é da Tencent. O teste é seu.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
