Um cartão de título hero para a comparação 'Tencent HY4 Preview vs Kimi K3'. Um cartão central em estilo placar exibe 'Teste cego interno, escala de 4 pontos', com 'Tencent HY4 Preview 2.99' à esquerda e 'Kimi K3 2.94' à direita. O cartão à esquerda 'Tencent HY4 Preview' lista '770B / 49B ativos, pesos abertos', '¥6 / ¥18 por 1M', 'Pré-visualização somente texto'. O cartão à direita 'Kimi K3' lista '2.8T / 104B ativos, pesos abertos', '$3.00 / $15.00 por 1M', 'Visão nativa, Índice AA 57'. Um rodapé exibe 'Teste cego conduzido pela Tencent com 163 engenheiros em 203 tarefas; resultados divulgados pelo fornecedor.' O logotipo da OrcaRouter é inserido no canto inferior direito.
Guides & Insights

Tencent HY4 Preview vs Kimi K3: O Teste às Cegas que a Tencent Escolheu Publicar

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY4 Preview vs Kimi K3 é o confronto único no lançamento deste modelo que a própria Tencent escolheu realizar. Em seu teste cego interno — 163 engenheiros, 203 tarefas de engenharia, avaliadas em uma escala de quatro pontos — o HY4 Preview obteve 2.99/4.00 contra 2.94 do Kimi K3, e a manchete da Tencent classificou o resultado como vitória. As letras miúdas dessa vitória merecem uma leitura atenta: o HY4 Preview venceu o Kimi K3 em 51.2% das tarefas, empatou em 7.9% e perdeu em 40.9%. Uma taxa de vitória líquida de 10 pontos é real, mas é uma margem estreita contra um modelo com um terço do total de parâmetros e menos da metade dos parâmetros ativos — e o teste inteiro foi conduzido pela Tencent.

O Kimi K3 é o carro-chefe de pesos abertos da Moonshot, com 2,8 trilhões de parâmetros, o maior modelo aberto já lançado, e o ponto de referência contra o qual todo laboratório chinês vem se medindo desde 16 de julho. A Tencent o escolheu como adversário porque ele é o padrão de pesos abertos — o que torna o trabalho deste artigo incomumente concreto: ler o único confronto direto que o desafiante se ofereceu para fazer, e decidir o quanto ele vale.

O benchmark que a Tencent escolheu publicar

O teste cego foi avaliado pelos próprios engenheiros da Tencent em tarefas de engenharia da própria Tencent, o que é a primeira coisa a se desconsiderar. Um conjunto de tarefas selecionado pela empresa é exatamente o ambiente onde um novo modelo tem seu melhor desempenho possível. Mesmo concedendo isso, o formato do resultado é informativo: 51,2% de vitórias contra 40,9% de derrotas é uma margem modesta, e a taxa de empate de 7,9% significa que os modelos estão bem equilibrados na maioria das tarefas. Nas tarefas difíceis, aquelas em que um modelo de fronteira se diferencia, a lacuna está onde sempre esteve — e o título da Tencent, "ligeiramente à frente do Kimi K3", tem redação honesta, o que não é o que todo laboratório publica.

Escala não é destino

A comparação de parâmetros torna o resultado impressionante ou suspeito, dependendo das suas crenças prévias. O Kimi K3 tem 2,8 trilhões de parâmetros totais, com 104 bilhões ativos — 896 especialistas, 16 ativos por token — e foi treinado para raciocinar em modo sempre ativo, com cadeia de pensamento exposta. O HY4 Preview tem 770 bilhões no total, com 49 bilhões ativos, um terço da escala total e menos da metade do poder computacional ativo. Um modelo menor conseguindo uma vitória apertada em um teste cego contra um modelo maior é a direção para a qual todo o campo de pesos abertos vem caminhando — o Qwen3.8-Max, com 2.4T, e o GLM-5.2, com 753B, vêm trocando golpes em benchmarks de agentes há meses —, então o resultado é plausível, e não absurdo. Também é, crucialmente, não verificado por ninguém fora da Tencent.

O placar

A two-column scoreboard titled 'Tencent HY4 Preview vs Kimi K3 — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Blind test vs K3: 2.99 vs 2.94 (vendor-run)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Vision: not in preview'. Right column 'Kimi K3': 'Total / active: 2.8T / 104B', 'Context: 1M tokens', 'AA Intelligence Index: 57', 'FrontierSWE: 81.2 (vendor-reported)', 'Price: $3.00 / $15.00 per 1M', 'Vision: native, image + video'. Footer reads 'HY4 Preview figures are Tencent-reported; Kimi K3 Index 57 from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Escala — HY4 Preview 770B total / 49B ativos vs Kimi K3 2.8T total / 104B ativos

• Contexto — HY4 Preview >1M tokens vs Kimi K3 1M tokens

• Preço por 1M — HY4 Preview ¥6 entrada / ¥18 saída (≈$0,85 / $2,50) vs Kimi K3 $3,00 entrada / $15,00 saída, acertos de cache $0,30

• Modalidade — HY4 Preview somente texto vs entrada nativa de imagem e vídeo do Kimi K3

• Raciocínio — HY4 Preview sem modo publicado vs. Kimi K3 com raciocínio sempre ativo e cadeia de pensamento transmitida em fluxo

• Pontuação independente — HY4 Preview: nenhuma vs Kimi K3: AA Intelligence Index 57, entre os três melhores do mundo no lançamento

Nas linhas em que ambos os lados reportam um número, os modelos se agrupam. A Tencent reporta o HY4 Preview com 37,1 no APEX-Agents, essencialmente nivelado com os 37,2 do Kimi K3 — um quase empate que o placar do teste cego preveria. O Toolathlon-Verified 74,1 e o DeepSWE 64,3 do HY4 Preview não têm equivalente no Kimi K3 em minhas mãos, e o FrontierSWE 81,2, o ProgramBench 77,8 e o BrowseComp 91,2 do Kimi K3 não têm equivalente no HY4 Preview. O placar é honesto ao mostrar que os dois cartões mal se sobrepõem, o que por si só é um alerta sobre tratar as linhas de qualquer fornecedor como uma descrição completa do modelo.

A visão é a maior diferença real.

Para um desenvolvedor escolhendo entre os dois hoje, a diferença estrutural não é inteligência — {{1}}é a modalidade de entrada{{/1}}. Kimi K3 {{2}}é nativamente multimodal{{/2}}: ele aceita entrada de imagem e vídeo através de seu codificador MoonViT-V2 e está entre os melhores modelos abertos em tarefas de visão, {{3}}ocupando o segundo lugar globalmente na arena de visão{{/3}}. Tencent HY4 Preview {{4}}é somente texto nesta prévia{{/4}}, e a Tencent disse que a visão {{5}}deve esperar pelo lançamento completo{{/5}}. Qualquer carga de trabalho que precise de capturas de tela, compreensão de interface ou fundamentação visual {{6}}é da Kimi K3 por padrão{{/6}}, independentemente do que o teste cego diz sobre o texto de engenharia. Se o seu trabalho é puramente código, documentos e saída de terminal, a diferença {{7}}não importa{{/7}}; no momento em que uma tarefa envolve olhar para algo, {{8}}isso decide o confronto{{/8}}.

A questão do custo

Por token, o HY4 Preview é drasticamente mais barato: cerca de US$ 0,85/US$ 2,50 contra US$ 3,00/US$ 15,00 do Kimi K3, com acertos de cache a ¥0,3 (cerca de quatro centavos de dólar) contra US$ 0,30. Mas os dois modelos têm comportamentos de token opostos que reduzem a diferença. O Kimi K3 raciocina sempre ligado e transmite sua cadeia de pensamento, o que infla os tokens de saída em toda solicitação; revisores notaram que o modelo é mais lento — cerca de 62 tokens por segundo — e pesado em tokens para loops de agente. O HY4 Preview, de acordo com a nota de lançamento da própria Tencent, "tende a um pensamento excessivamente longo e a uma autoverificação excessiva" em tarefas complexas. Ambos queimam tokens de saída extras; o HY4 Preview apenas cobra menos por eles. Uma comparação justa é o custo por tarefa concluída, e ninguém fora da Tencent mediu o do HY4 Preview ainda.

O veredito

O Tencent HY4 Preview é o desafiante mais barato, menor e não verificado que afirma ter uma vantagem estreita em teste cego sobre o padrão de pesos abertos; o Kimi K3 é o incumbente maior, verificado e com capacidade de visão que custa de quatro a cinco vezes mais por token e tem um Índice de Inteligência independente de 57. O cartão de benchmark de nenhum dos modelos é totalmente independente — os principais resultados do Kimi K3 também são relatados pela Moonshot, embora seu Índice 57 não seja. Se sua carga de trabalho for multimodal, o Kimi K3 é a única escolha neste confronto. Se for texto e engenharia, o HY4 Preview é a aposta de valor com um confronto direto real, ainda que conduzido pelo fornecedor, em seu nome, e o caminho barato é rotear o Kimi K3 na chave de produção — ele está ativo no OrcaRouter pelo preço de tabela de US$ 3,00/US$ 15,00 da Moonshot, repassado sem margem — enquanto você executa o HY4 Preview pela própria API da Tencent em cargas de trabalho sombra. Quando o HY4 Preview chegar a um roteador, a mesma chave e as mesmas regras de failover transportarão ambos, e a tarifa de ¥6/¥18 da Tencent será repassada sem alterações.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Kimi K3 is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Kimi K3 (kimi/kimi-k3) showing the capability chips, a 1M-token context window, $3.00 per 1M input tokens and $15.00 per 1M output tokens, released July 15 2026 by MoonshotAI.

O que assistir

• {{1}}Uma repetição independente{{/1}} das tarefas de teste cego. {{2}}A taxa de vitória de 51,2%{{/2}} é a afirmação mais testável {{3}}neste lançamento{{/3}}, e um harness de terceiros resolveria isso em uma semana.

Se o HY4 Preview lançar com visão antes do lançamento completo do Hy4. Isso é o que converteria isso de um confronto de valor apenas textual em uma verdadeira batalha de flagships.

• Custo por tarefa concluída em harnesses agênticos padrão. Ambos os modelos consomem muitos tokens; quem for mais barato por tarefa finalizada vence o argumento de produção.

• A resposta da Kimi K3 à pressão de preços. Se a Moonshot cortar o preço de saída de US$ 15, o enquadramento "desafiante barato vs padrão caro" se inverte.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube