
Tencent HY4 Preview vs Kimi K3: O Teste às Cegas que a Tencent Escolheu Publicar
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Tencent HY4 Preview vs Kimi K3 é o confronto único no lançamento deste modelo que a própria Tencent escolheu realizar. Em seu teste cego interno — 163 engenheiros, 203 tarefas de engenharia, avaliadas em uma escala de quatro pontos — o HY4 Preview obteve 2.99/4.00 contra 2.94 do Kimi K3, e a manchete da Tencent classificou o resultado como vitória. As letras miúdas dessa vitória merecem uma leitura atenta: o HY4 Preview venceu o Kimi K3 em 51.2% das tarefas, empatou em 7.9% e perdeu em 40.9%. Uma taxa de vitória líquida de 10 pontos é real, mas é uma margem estreita contra um modelo com um terço do total de parâmetros e menos da metade dos parâmetros ativos — e o teste inteiro foi conduzido pela Tencent.
O Kimi K3 é o carro-chefe de pesos abertos da Moonshot, com 2,8 trilhões de parâmetros, o maior modelo aberto já lançado, e o ponto de referência contra o qual todo laboratório chinês vem se medindo desde 16 de julho. A Tencent o escolheu como adversário porque ele é o padrão de pesos abertos — o que torna o trabalho deste artigo incomumente concreto: ler o único confronto direto que o desafiante se ofereceu para fazer, e decidir o quanto ele vale.
O benchmark que a Tencent escolheu publicar
O teste cego foi avaliado pelos próprios engenheiros da Tencent em tarefas de engenharia da própria Tencent, o que é a primeira coisa a se desconsiderar. Um conjunto de tarefas selecionado pela empresa é exatamente o ambiente onde um novo modelo tem seu melhor desempenho possível. Mesmo concedendo isso, o formato do resultado é informativo: 51,2% de vitórias contra 40,9% de derrotas é uma margem modesta, e a taxa de empate de 7,9% significa que os modelos estão bem equilibrados na maioria das tarefas. Nas tarefas difíceis, aquelas em que um modelo de fronteira se diferencia, a lacuna está onde sempre esteve — e o título da Tencent, "ligeiramente à frente do Kimi K3", tem redação honesta, o que não é o que todo laboratório publica.
Escala não é destino
A comparação de parâmetros torna o resultado impressionante ou suspeito, dependendo das suas crenças prévias. O Kimi K3 tem 2,8 trilhões de parâmetros totais, com 104 bilhões ativos — 896 especialistas, 16 ativos por token — e foi treinado para raciocinar em modo sempre ativo, com cadeia de pensamento exposta. O HY4 Preview tem 770 bilhões no total, com 49 bilhões ativos, um terço da escala total e menos da metade do poder computacional ativo. Um modelo menor conseguindo uma vitória apertada em um teste cego contra um modelo maior é a direção para a qual todo o campo de pesos abertos vem caminhando — o Qwen3.8-Max, com 2.4T, e o GLM-5.2, com 753B, vêm trocando golpes em benchmarks de agentes há meses —, então o resultado é plausível, e não absurdo. Também é, crucialmente, não verificado por ninguém fora da Tencent.
O placar

• Escala — HY4 Preview 770B total / 49B ativos vs Kimi K3 2.8T total / 104B ativos
• Contexto — HY4 Preview >1M tokens vs Kimi K3 1M tokens
• Preço por 1M — HY4 Preview ¥6 entrada / ¥18 saída (≈$0,85 / $2,50) vs Kimi K3 $3,00 entrada / $15,00 saída, acertos de cache $0,30
• Modalidade — HY4 Preview somente texto vs entrada nativa de imagem e vídeo do Kimi K3
• Raciocínio — HY4 Preview sem modo publicado vs. Kimi K3 com raciocínio sempre ativo e cadeia de pensamento transmitida em fluxo
• Pontuação independente — HY4 Preview: nenhuma vs Kimi K3: AA Intelligence Index 57, entre os três melhores do mundo no lançamento
Nas linhas em que ambos os lados reportam um número, os modelos se agrupam. A Tencent reporta o HY4 Preview com 37,1 no APEX-Agents, essencialmente nivelado com os 37,2 do Kimi K3 — um quase empate que o placar do teste cego preveria. O Toolathlon-Verified 74,1 e o DeepSWE 64,3 do HY4 Preview não têm equivalente no Kimi K3 em minhas mãos, e o FrontierSWE 81,2, o ProgramBench 77,8 e o BrowseComp 91,2 do Kimi K3 não têm equivalente no HY4 Preview. O placar é honesto ao mostrar que os dois cartões mal se sobrepõem, o que por si só é um alerta sobre tratar as linhas de qualquer fornecedor como uma descrição completa do modelo.
A visão é a maior diferença real.
Para um desenvolvedor escolhendo entre os dois hoje, a diferença estrutural não é inteligência — {{1}}é a modalidade de entrada{{/1}}. Kimi K3 {{2}}é nativamente multimodal{{/2}}: ele aceita entrada de imagem e vídeo através de seu codificador MoonViT-V2 e está entre os melhores modelos abertos em tarefas de visão, {{3}}ocupando o segundo lugar globalmente na arena de visão{{/3}}. Tencent HY4 Preview {{4}}é somente texto nesta prévia{{/4}}, e a Tencent disse que a visão {{5}}deve esperar pelo lançamento completo{{/5}}. Qualquer carga de trabalho que precise de capturas de tela, compreensão de interface ou fundamentação visual {{6}}é da Kimi K3 por padrão{{/6}}, independentemente do que o teste cego diz sobre o texto de engenharia. Se o seu trabalho é puramente código, documentos e saída de terminal, a diferença {{7}}não importa{{/7}}; no momento em que uma tarefa envolve olhar para algo, {{8}}isso decide o confronto{{/8}}.
A questão do custo
Por token, o HY4 Preview é drasticamente mais barato: cerca de US$ 0,85/US$ 2,50 contra US$ 3,00/US$ 15,00 do Kimi K3, com acertos de cache a ¥0,3 (cerca de quatro centavos de dólar) contra US$ 0,30. Mas os dois modelos têm comportamentos de token opostos que reduzem a diferença. O Kimi K3 raciocina sempre ligado e transmite sua cadeia de pensamento, o que infla os tokens de saída em toda solicitação; revisores notaram que o modelo é mais lento — cerca de 62 tokens por segundo — e pesado em tokens para loops de agente. O HY4 Preview, de acordo com a nota de lançamento da própria Tencent, "tende a um pensamento excessivamente longo e a uma autoverificação excessiva" em tarefas complexas. Ambos queimam tokens de saída extras; o HY4 Preview apenas cobra menos por eles. Uma comparação justa é o custo por tarefa concluída, e ninguém fora da Tencent mediu o do HY4 Preview ainda.
O veredito
O Tencent HY4 Preview é o desafiante mais barato, menor e não verificado que afirma ter uma vantagem estreita em teste cego sobre o padrão de pesos abertos; o Kimi K3 é o incumbente maior, verificado e com capacidade de visão que custa de quatro a cinco vezes mais por token e tem um Índice de Inteligência independente de 57. O cartão de benchmark de nenhum dos modelos é totalmente independente — os principais resultados do Kimi K3 também são relatados pela Moonshot, embora seu Índice 57 não seja. Se sua carga de trabalho for multimodal, o Kimi K3 é a única escolha neste confronto. Se for texto e engenharia, o HY4 Preview é a aposta de valor com um confronto direto real, ainda que conduzido pelo fornecedor, em seu nome, e o caminho barato é rotear o Kimi K3 na chave de produção — ele está ativo no OrcaRouter pelo preço de tabela de US$ 3,00/US$ 15,00 da Moonshot, repassado sem margem — enquanto você executa o HY4 Preview pela própria API da Tencent em cargas de trabalho sombra. Quando o HY4 Preview chegar a um roteador, a mesma chave e as mesmas regras de failover transportarão ambos, e a tarifa de ¥6/¥18 da Tencent será repassada sem alterações.


O que assistir
• {{1}}Uma repetição independente{{/1}} das tarefas de teste cego. {{2}}A taxa de vitória de 51,2%{{/2}} é a afirmação mais testável {{3}}neste lançamento{{/3}}, e um harness de terceiros resolveria isso em uma semana.
Se o HY4 Preview lançar com visão antes do lançamento completo do Hy4. Isso é o que converteria isso de um confronto de valor apenas textual em uma verdadeira batalha de flagships.
• Custo por tarefa concluída em harnesses agênticos padrão. Ambos os modelos consomem muitos tokens; quem for mais barato por tarefa finalizada vence o argumento de produção.
• A resposta da Kimi K3 à pressão de preços. Se a Moonshot cortar o preço de saída de US$ 15, o enquadramento "desafiante barato vs padrão caro" se inverte.
