
Tencent Hy4 Preview roda no vLLM desde o primeiro dia: o MoE de pesos abertos de 770B que você realmente pode servir
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Quando o Tencent Hy4 Preview foi lançado em 28 de agosto de 2026, ele fez algo que a maioria dos flagships de classe frontier evita no primeiro dia: ele foi lançado executável. Além dos pesos abertos, a Tencent e a equipe do vLLM publicaram uma imagem Docker pré-construída, uma receita oficial de serving e suporte de framework integrado no próprio vLLM, de modo que o maior modelo de pesos abertos que a linha Hunyuan já produziu — 770 bilhões de parâmetros totais, 49 bilhões ativos por token — estava atrás de um endpoint compatível com OpenAI nas suas próprias GPUs poucas horas após o anúncio. Essa história de runtime no dia zero é a notícia sobre a qual este post trata, porque "roda no vLLM" não é uma nota de rodapé para um modelo desse tamanho. É a diferença entre um comunicado de imprensa e algo que você pode colocar em produção.
O restante do lançamento é o pacote habitual em formato de preview, {{1}}e as ressalvas importam tanto quanto os números{{/1}}. {{2}}A Tencent chama o Tencent Hy4 Preview de iteração inicial{{/2}}, {{3}}sinaliza raciocínio excessivamente longo e autoverificação excessiva como comportamento conhecido{{/3}}, {{4}}e publica uma tabela de benchmarks totalmente autorrelatada{{/4}} — {{5}}nenhum laboratório independente o avaliou ainda{{/5}}, {{6}}e o modelo tem dois dias de existência no momento em que escrevo{{/6}}. Nada disso muda a manchete prática: {{7}}os pesos são Apache 2.0{{/7}}, {{8}}a janela de contexto é de 1 milhão de tokens{{/8}}, {{9}}e o suporte a vLLM desde o primeiro dia significa que o caminho de auto-hospedagem é real, e não apenas aspiracional{{/9}}.
O que o Tencent Hy4 Preview realmente é
A Tencent posiciona o Tencent Hy4 Preview como o sucessor do Hy3 (295B no total, contexto de 256K), aproximadamente dobrando a capacidade ativa e quadruplicando a janela de contexto. A arquitetura merece ser lida linha por linha, porque cada linha muda o que um modelo de pesos abertos pode fazer no seu hardware.
• Arquitetura — Mixture-of-Experts com 770B de parâmetros totais e 49B ativos por token em 78 camadas. A primeira camada é densa; as outras 77 roteiam cada token por 256 especialistas roteados mais um especialista compartilhado, ativando os 8 principais. Essa taxa de esparsidade de aproximadamente 16:1 é o que mantém o custo de inferência em uma faixa que uma equipe séria pode realmente executar.
Janela de contexto — 1.048.576 tokens nativos, uma das mais amplas de qualquer modelo de pesos abertos. Um repositório completo, uma refatoração de vários arquivos, um lote de documentos longos: problemas de uma única solicitação.
• Atenção — Gated DeepSeek Sparse Attention (Gated DSA) com IndexCache, um design de atenção dispersa que calcula um novo índice disperso em apenas 21 das 78 camadas e o reutiliza nas outras 57. É por isso que servi-lo não é apenas "vLLM maior" — é preciso um backend que entenda de atenção dispersa.
• Decodificação especulativa integrada — uma camada MTP (predição de múltiplos tokens) com cerca de 10B no total / 0,7B de parâmetros ativos reside no modelo, para que vLLM e SGLang possam gerar tokens de rascunho sem que você hospede um modelo de rascunho separado.
• Pesos — Apache 2.0, em checkpoints BF16 e FP8, publicados no Hugging Face, ModelScope, GitCode e CNB.
O que "day-zero vLLM" realmente significa
O suporte integrado ao framework no dia do lançamento é o evento concreto por trás do sinal — a alteração no vLLM que adiciona o Tencent Hy4 Preview (PR #54160) foi integrada na mesma janela do lançamento, e a receita oficial tem como alvo o vLLM 0.29.0 ou mais recente. Na prática, isso significa que o caminho para servir o modelo é um único comando, não uma semana de depuração de kernel.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
As flags importam, e cada uma corresponde a algo no modelo em vez de ser um texto padrão:
• --attention-backend FLASHMLA_SPARSE — obrigatório, não opcional. A atenção esparsa Gated DSA do Tencent Hy4 Preview não funciona corretamente nos backends densos padrão, e esta flag é a que a receita oficial define.
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — ativa a camada MTP integrada do modelo para decodificação especulativa, três tokens de rascunho à frente. Não é necessário implantar um modelo de rascunho separado.
• --tool-call-parser hy_v4 e --reasoning-parser hy_v4 — os parsers personalizados que informam ao servidor como o Tencent Hy4 Preview emite chamadas de ferramentas e sua cadeia de pensamento, com --enable-auto-tool-choice permitindo que o modelo decida quando chamar ferramentas.
A Tencent recomenda temperatura 0.9 e top_p 1.0 para amostragem. O raciocínio usa como padrão uma cadeia de pensamento de esforço "high" voltada para matemática, programação e tarefas complexas; se você quiser uma resposta direta sem o pensamento longo, passe um esforço de raciocínio no_think na solicitação em vez de trocar os pesos.

O suporte no dia zero não é exclusivo do vLLM, o que é notável para um lançamento tão recente. A SGLang enviou uma imagem multiarquitetura pré-construída (lmsysorg/sglang:hy4-preview) com decodificação especulativa estilo NEXTN no mesmo dia, e o ecossistema Ascend obteve suporte no dia zero por meio do vLLM-Ascend usando pesos quantizados em W8A8 em 16 NPUs Atlas 800I A3. Lançamentos de pesos abertos geralmente levam semanas para o ecossistema de servidores acompanhar; este levou horas.
As pontuações que valem a pena citar
Every benchmark Tencent published for Tencent Hy4 Preview is vendor-reported — run on Tencent's own evaluation setup, unreproduced by any independent lab, and the model has been public for two days. Read them as the ceiling Tencent believes it hit, not as established fact. Independent verification will not exist until a third party runs it; nothing on the public leaderboards reflects this model yet.

O número de destaque é o Terminal Bench 2.1, um teste de quão bem um modelo opera um terminal real enquanto codifica. A Tencent reporta o Tencent Hy4 Preview com 85.4, valor que, segundo afirma, empata com o Claude Opus 5 e supera o DeepSeek V4 Pro, e que supera seu próprio predecessor, o Hy3, em 14.6 pontos. É esse número único que sustenta o lançamento — é a afirmação que coloca um modelo de pesos abertos em paridade com os modelos fechados de fronteira mais caros em um teste difícil de codificação agêntica — e é a afirmação que mais precisa de confirmação independente.
O restante da tabela interna, todos os números da própria Tencent: DeepSWE, um benchmark de engenharia de software, salta de 28,0 no Hy3 para 64,3. SWE-bench Pro chega a 65,7 e SWE-bench Multilingual a 82,9. No Toolathlon-Verified, um teste de chamada de ferramentas, a Tencent reporta 74,1, que afirma superar Qwen 3.8 Max e GPT-5.6 Sol e se aproximar de Kimi K3 e Claude Opus 5. No APEX-Agents pass@1, fica em 37,1, um pouco atrás dos 37,2 do Kimi K3. E em uma avaliação cega interna separada, 163 especialistas recrutados pela Tencent avaliaram 203 tarefas de engenharia com 2,99 de 4,00, superando ligeiramente os 2,92 do GLM-5.3 e os 2,94 do Kimi K3.
Dois padrões merecem destaque. Todos os números fortes estão em trabalho de engenharia agentiva — operação de terminal, chamada de ferramentas, tarefas em escala de repositório — e nenhum está em conhecimento ou raciocínio genéricos, o que se encaixa no posicionamento de produtividade, em vez de ser coincidência. E a Tencent descreve o DeepSWE e os demais como reduzindo, não eliminando, as lacunas; a única alegação de paridade clara e comercializável é o empate no Terminal Bench 2.1, e é a alegação que mais vale a pena testar com sua própria carga de trabalho.
Quanto realmente custa para rodar
{{1}}A matemática da auto-hospedagem{{/1}} é a primeira coisa sobre a qual precisamos ser honestos. Este não é um modelo de GPU única nem um modelo de desktop. O checkpoint {{2}}FP8{{/2}} está perto de um terabyte de pesos, e a receita oficial pressupõe paralelismo de tensores de {{3}}8{{/3}} — oito GPUs de alta largura de banda com interconexões rápidas (o hardware de referência da Tencent para {{2}}FP8{{/2}} é 8×B300{{4}}, com BF16 completo exigindo 16×B200). Se você não dispõe dessa infraestrutura, não vai auto-hospedá-lo de forma barata, e o backend de atenção esparsa significa que não há atalho para a memória do cache KV em um {{5}}contexto de 1M de tokens{{/5}}.
Um add-on da semana de lançamento altera parte desse cálculo para equipes que querem os pesos abertos sem a pegada do modelo principal. A equipe Hy da Tencent lançou uma versão GGUF comprimida do Tencent Hy4 Preview, reduzindo o lançamento de ~1,5 TB em BF16 para aproximadamente 200 GiB com um esquema de quantização mista por camada chamado MIX-STQ1_0 — os tensores de especialistas em massa caem para cerca de 1,3 bits, enquanto as camadas críticas do fluxo residual mantêm maior precisão. Nas próprias avaliações da Tencent, a variação de precisão é pequena — SWE-bench Multilingual de 82,9 para 81,3, MCP Atlas de 83,7 para 83,2, IFBench de 73,5 para 72,5 — uma troca que a empresa chama de quase sem perdas. São números da Tencent no próprio ambiente da Tencent, ainda não reproduzidos. Um modelo de 200 GiB ainda não é um modelo de GPU única, mas é uma aposta significativamente menor do que um checkpoint FP8 de quase um terabyte, e coloca o caminho de pesos abertos ao alcance de um nó multi-GPU menor do que a receita de oito B300 presume.
O caminho da API é onde o preço fica interessante. No TokenHub da Tencent Cloud, o Tencent Hy4 Preview custa 6 yuan (cerca de US$ 0,83) por milhão de tokens de entrada, 18 yuan (cerca de US$ 2,50) por milhão de tokens de saída e 0,3 yuan (cerca de US$ 0,04) por milhão de tokens para cache hits. A saída a cerca de US$ 2,50 por milhão fica muito abaixo do preço de US$ 25 por milhão de saída de um modelo de fronteira fechado de ponta, e a taxa barata de cache hits torna loops agênticos longos — em que o mesmo prompt de sistema e os prefixos de conversa são reenviados constantemente — excepcionalmente acessíveis.
A Tencent também está oferecendo acesso gratuito por duas semanas ao Tencent Hy4 Preview dentro do WorkBuddy e do CodeBuddy enquanto o modelo é novo, então a forma mais barata de experimentá-lo esta semana é de graça — e é no WorkBuddy que o posicionamento de produtividade se torna concreto. Em qualquer conversa do WorkBuddy, o seletor de modelo alterna entre Hy3 e Hy4 preview, então a divisão entre trabalho de produtividade de escritório e análise de um lado e codificação do outro é uma escolha por tarefa, e não uma decisão de implantação. Essa divisão corresponde a onde a Tencent mirou o modelo, e testes práticos no WorkBuddy mostram ele gerando artefatos complexos de uma só vez — um protótipo de jogo low-poly jogável a partir de um único prompt, uma revisão trimestral completa de negócios montada a partir de dez anexos com zero intervenções manuais e, na demonstração de testador que circulou esta semana, uma simulação de buraco negro. Estas são observações da comunidade sobre o próprio aplicativo da Tencent, e não benchmarks do fornecedor — mas são os primeiros sinais práticos do que o modelo faz em tarefas reais de múltiplas etapas, e são gratuitas para reproduzir antes de você gastar qualquer coisa.
A decisão de custo é exatamente onde uma camada de roteamento muda a matemática, e seremos honestos sobre a nossa própria participação nisso: o OrcaRouter ainda não roteia o Tencent Hy4 Preview, porque a Tencent não abriu este modelo para plataformas de inferência de terceiros — ele roda no endpoint TokenHub da própria Tencent Cloud e em implantações auto-hospedadas dos pesos abertos, e não afirmamos servir o que não servimos. O que a camada de roteamento traz é o framework de decisão em torno disso. Se você está escolhendo entre um nó de 8 GPUs e uma API, a mesma disciplina de repasse que rege o restante do catálogo se aplica no dia em que a Tencent abrir isso: o OrcaRouter repassa os preços de tabela dos provedores com margem zero, então um corte de preço do fornecedor entra em vigor do nosso lado no mesmo dia, em vez de ser revendido com margem. E, para um modelo lançado há dois dias cuja única evidência são os benchmarks do fornecedor, o failover automático é a forma segura de testá-lo — coloque o modelo comprovado no seu caminho crítico e o Tencent Hy4 Preview ao lado dele, alternando em tarefas onde o perfil de custo dele vence e revertendo no momento em que não vence, tudo por meio de uma única API e uma única chave.

Os limites que não cabem em uma ficha técnica
A Tencent lista as limitações conhecidas de forma clara, e elas devem moldar qualquer decisão de implantação. O Tencent Hy4 Preview é um modelo de texto, ponto final — sem visão ou entrada multimodal — então qualquer coisa relacionada a imagem ou vídeo pertence a um modelo diferente. A Tencent também sinaliza comportamento de início lento em tarefas complexas (longo raciocínio antes da primeira saída) e uma tendência a se auto-verificar excessivamente, gastando tokens para conferir trabalho que já foi feito. Essa combinação é exatamente errada para chat sensível à latência e exatamente tolerável para trabalho de engenharia em lote offline, o que indica onde a Tencent espera que você a execute.
Duas afirmações no material de lançamento merecem atenção à parte, porque dizem respeito a como o modelo foi construído, não à sua pontuação. A Tencent afirma que o Tencent Hy4 Preview participou do seu próprio desenvolvimento — ajudou a otimizar os métodos de treinamento, a estratégia de dados, as estruturas de avaliação e os operadores de baixo nível que o produziram, um ciclo inicial de autoaperfeiçoamento recursivo — e que otimizou autonomamente seu próprio sistema de inferência para um ganho de throughput de ponta a ponta de 31,8% em relação à linha de base. No aspecto científico, a Tencent relata que avançou o limite inferior conhecido do problema de Blaschke–Lebesgue em geometria convexa de 0,380799 para 0,41104, e uma aceleração de 2,0x em uma simulação de bicamada fosfolipídica com 32.512 átomos, reduzindo o tempo para 54,9 milissegundos por etapa. Como tudo o mais no dia do lançamento, essas são apenas as afirmações da própria Tencent.
E a ausência mais importante é a verificação. Ainda não existem pontuações independentes para o Tencent Hy4 Preview em lugar nenhum — nem em um ranking público, nem de um laboratório de avaliação terceirizado, nem em uma entrada do Artificial Analysis. O modelo é novo demais para isso. O teste cego interno de especialistas é um sinal útil sobre como os revisores da própria Tencent o veem em comparação com o GLM-5.3 e o Kimi K3, mas são os revisores da Tencent em tarefas da Tencent. Tudo o que está além da ficha técnica é uma afirmação aguardando verificação.
Quem deve executar o Tencent Hy4 Preview esta semana?
A resposta honesta se divide em três grupos esta semana, e um deles não precisa de nenhum hardware. Se você só quer sentir o que o Tencent Hy4 Preview faz, o acesso gratuito ao WorkBuddy é o caminho mais rápido — sem GPU, sem chave de API, abra uma conversa, alterne o seletor de modelo para Hy4 preview e entregue a ele uma tarefa de Work ou Coding. Se você tem GPUs e executa cargas de trabalho de engenharia em lote — tarefas de agentes de horizonte longo, análise em escala de repositório, avaliação offline — o modelo merece um teste sério agora: os pesos estão abertos, a janela de contexto é em escala de repositório, o caminho vLLM é um único comando, e a build GGUF da semana de lançamento reduz a barreira de hardware para um teste experimental. Se você está executando chat de produção sensível à latência, ou algo multimodal, ou qualquer coisa em que você não pode se dar ao luxo de um modelo cuja única evidência são os benchmarks do próprio fornecedor, espere — a Tencent iterou aproximadamente a cada dois meses desde fevereiro, e já disse que o próximo lote de modelos Hy4 está chegando, então a preview é explicitamente uma iteração inicial.
Para todos os demais, a postura útil é um padrão de roteamento: comprove-o ao lado de um modelo em que você já confia, a um custo do qual você pode se afastar, e escale-o apenas onde os números se sustentam na sua própria carga de trabalho. É para isso que existe um roteador — no dia em que a Tencent abrir este modelo para inferência de terceiros, ele entra no catálogo de uma API, mais de 200 modelos, com repasse de preço de tabela, como qualquer outro, e as ferramentas de failover e composição já estarão em vigor. Até lá, os pesos estão no Hugging Face, a API está no Tencent Cloud e o teste gratuito está no WorkBuddy — e a afirmação de que um modelo de pesos abertos alcançou o topo da codificação agêntica finalmente tem um número específico associado a ela. O número é da Tencent. O teste é seu.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
