Cartela de título com os dizeres GPT-6 Astra vs Tencent HY4 Preview, com o subtítulo 'Os números de um modelo foram verificados por outra pessoa. Os do outro não — e 64.000 tokens de saída é onde o lado barato para', sobre uma ilustração gerada de um cubo lacrado certificado ao lado de um cubo aberto com camadas visíveis
Guides & Insights

GPT-6 Astra vs. Tencent HY4 Preview: um modelo tem uma trilha de auditoria e o outro tem uma tabela de benchmark

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY4 Preview e GPT-6 Astra são as duas rotas mais baratas para codificação agêntica quase de fronteira disponíveis hoje, se você ler os números dos próprios fornecedores, e são os dois modelos menos comparáveis nessa categoria, se você ler os de qualquer outra pessoa. O Tencent HY4 Preview foi lançado e disponibilizado como código aberto em 28 de agosto de 2026 sob a licença Apache 2.0, a US$ 0,834 por milhão de tokens de entrada e US$ 2,501 por milhão de tokens de saída, com uma arquitetura de mistura de especialistas de 770 bilhões de parâmetros, uma janela de contexto que ultrapassa um milhão de tokens e um teto de saída de 64.000 tokens. O GPT-6 Astra está em disponibilidade geral desde 3 de setembro de 2026 a US$ 10,00 e US$ 50,00, com uma janela de 1.050.000 tokens e saída máxima de 128.000. Os pontos fortes do Astra são respaldados por oito avaliações de terceiros publicadas; os do HY4 Preview são respaldados por execuções de terminal, chamada de ferramentas e avaliação cega da própria Tencent, e por nada mais. Essa assimetria não significa que o modelo mais barato seja mais fraco. Significa que uma dessas duas comparações pode ser verificada e a outra tem de ser acreditada, e as decisões práticas diferem em conformidade.

O que o lançamento do Apache 2.0 realmente lhe oferece

A licença é a parte desta comparação que uma tabela de preços não consegue expressar. O Tencent HY4 Preview não é um teaser alojado com branding de pesos abertos — os pesos podem ser descarregados do Hugging Face, do GitHub, do ModelScope e do GitCode, o que significa que o modelo sobrevive a qualquer decisão que a Tencent tome em relação aos seus próprios preços, ao seu próprio endpoint ou ao seu próprio interesse contínuo em servi-lo.

• Arquitetura — 770B de parâmetros totais, 49B ativos por token, 78 camadas, 256 especialistas roteados mais um especialista compartilhado, e uma camada nativa de previsão de múltiplos tokens para decodificação especulativabr /> • Características de serviço — 54,6 tokens de saída por segundo e tempo mediano de 6,26 segundos até o primeiro token, medidos nas rotas do OrcaRouter ao longo de uma janela móvel de sete diasbr /> • Contexto e limite — uma janela de 1.048.576 tokens contra uma saída máxima de 64.000 tokensbr /> • Superfície de entrada — somente texto; sem imagem, sem arquivo, sem áudiobr /> • Controle de raciocínio — três níveis, alto, baixo e nenhum, com alto como padrão, além de uma recomendação documentada de amostragem com temperatura 0,9 e top_p 1,0br /> • Confiabilidade — uma taxa de erro de 2,8% na mesma janela de sete dias, contra 10,3% na rota Astra

Esse último par de números é a informação mais acionável desta página, e é o tipo de dado que nenhum fornecedor publica sobre o próprio modelo. As pontuações de benchmark independentes da Astra são mais altas e sua rota vem falhando em aproximadamente uma requisição em cada dez na última semana, enquanto um modelo sem nenhuma pontuação independente vem falhando em uma em cada trinta e cinco. Nenhum dos números é uma afirmação sobre os próprios modelos — taxas de erro medem a rota, os limites de taxa e o upstream, não os pesos —, mas são os números que um sistema de produção realmente experimenta.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

Onde os números da Tencent podem ser conferidos com os de outra pessoa

Até onde as evidências publicadas mostram, esta é uma oportunidade genuinamente incomum: tanto a Astra quanto a HY4 Preview têm um valor no Terminal-Bench 2.1, e apenas um deles é reportado pelo fornecedor.

• Terminal-Bench 2.1, operando um terminal real — GPT-6 Astra 88,4, avaliado de forma independente; Tencent HY4 Preview 85,4, reportado pelo fornecedorbr /> • Chamada de ferramentas — Astra 41,4 no τ²-Banking, avaliado de forma independente; HY4 Preview 74,1 no Toolathlon-Verified, reportado pelo fornecedor, em um teste diferentebr /> • Engenharia de software — HY4 Preview 64,3 no DeepSWE, um aumento em relação aos 28,0 do seu antecessor Hy3, reportado pelo fornecedorbr /> • Tarefas de agente — HY4 Preview 37,1 pass@1 no APEX-Agents, reportado pelo fornecedorbr /> • Preferência humana — média de 2,99 de 4,00 em 203 tarefas de engenharia pontuadas por 163 especialistas, conduzida pelo fornecedor, contra GLM-5.3 com 2,92 e Kimi K3 com 2,94br /> • Índice independente — GPT-6 Astra 54,7 no Intelligence Index e 96,1 no GPQA Diamond, de terceiros; não existe índice equivalente para o HY4 Preview

A linha do Terminal-Bench é a que merece mais atenção. Uma diferença de 3 pontos entre um 88,4 independente e um 85,4 relatado pelo fornecedor está bem dentro da margem que um harness diferente, um scaffold diferente ou uma temperatura de amostragem diferente podem produzir, o que significa que a leitura honesta não é "a Astra é três pontos melhor", mas sim que "o modelo de pesos abertos mais barato desta faixa está reivindicando paridade, e a reivindicação é, no mínimo, plausível". A própria formulação da Tencent é cuidadosa nesse ponto: descreve o DeepSWE como "reduzindo gradualmente a lacuna", em vez de fechá-la, e a sua única alegação clara de paridade — o empate no Terminal-Bench com um modelo fechado de topo de um fornecedor diferente — é exatamente a alegação que mais precisa de uma segunda medição.

Há também uma mudança que vale a pena conhecer, porque altera a economia, e não as pontuações. Em 7 de setembro de 2026, a Tencent introduziu uma otimização na versão de pré-visualização em produção que, segundo ela, reduz turnos de raciocínio e o consumo de tokens por tarefa em trabalhos complexos. Como o modelo cobra por token, menos tokens por tarefa concluída reduzem o custo da tarefa, mesmo que a tarifa por token não tenha mudado. O tamanho dessa economia é uma medição da própria Tencent e ninguém fora da Tencent a reproduziu — mas o mecanismo é real e é a razão pela qual uma pré-visualização lançada em agosto pode ser materialmente mais barata de operar em outubro do que sugeria seu texto de lançamento.

O teto de 64.000 tokens é a especificação que decide as implantações

A meio da ficha técnica está a restrição que aperta primeiro, e não é a qualidade. A saída máxima do HY4 Preview é de 64.000 tokens contra os 128.000 da Astra, num modelo cujo propósito declarado são agentes de codificação e longas cadeias de uso de ferramentas. Um arquivo gerado, um patch de vários arquivos, um relatório estruturado longo — estas são as saídas que atingem um teto, e numa execução de agente a falha não é uma resposta ligeiramente pior, é uma resposta truncada que o pipeline circundante tem de detetar e tratar.

Ambos os modelos recebem cerca de um milhão de tokens de entrada, portanto o caso de leitura de documentos é genuinamente um empate. A diferença está inteiramente do lado da geração, e é de um fator de dois, não um erro de arredondamento. Acrescente a diferença na superfície de entrada — a Astra aceita imagens e arquivos, a HY4 Preview é apenas texto — e o quadro que emerge é uma divisão de trabalho clara, e não um ranking: o modelo de pesos abertos para ciclos de agente de texto para texto, em que o entregável é uma chamada de ferramenta ou um diff, e o modelo fechado para qualquer coisa que tenha de olhar para algo ou escrever algo longo.

O que 20× a taxa de produção proporciona, linha por linha

• Preço de entrada — Tencent HY4 Preview $0.834 por 1M vs GPT-6 Astra $10.00, cerca de 12×br /> • Preço de saída — HY4 Preview $2.501 por 1M vs Astra $50.00, cerca de 20×br /> • Entrada em cache — HY4 Preview $0.042 por 1M vs Astra $1.00, cerca de 24×br /> • Degrau de solicitação longa — a Astra reajusta o preço de toda a solicitação acima de 272.000 tokens de entrada para $20.00 e $75.00; a tabela de preços do HY4 Preview não tem degrau equivalentebr /> • Taxa efetiva de entrada em um prompt de 400.000 tokens — HY4 Preview inalterada em $0.834 vs Astra $20.00, cerca de 24×br /> • Custo por milhão de tokens de um loop de agente comum, proporção de 4:1 entre entrada e saída — HY4 Preview aproximadamente $1.17 vs Astra aproximadamente $18.00br /> • Custo de um mês de 100 milhões de tokens na mesma proporção — HY4 Preview aproximadamente $117 vs Astra aproximadamente $1.800

A linha de entrada em cache é a que escala pior para o lado mais caro, porque os loops de agente reenviam o mesmo prompt de sistema e o mesmo prefixo de conversa a cada turno. A $0,042 contra $1,00, os tokens mais baratos de um loop longo são 24 vezes mais baratos no modelo da Tencent, que é justamente a carga de trabalho em que uma pequena diferença por token se acumula mais rapidamente. O custo por tarefa, a métrica que resolveria isso de forma limpa, não é publicado pela Tencent de forma alguma — então a única maneira de obter o número que importa é rodar os dois modelos com o seu próprio conjunto de tarefas e ler o objeto de uso.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

O que um roteador acrescenta aqui, com as taxas de erro em mãos

Ambos os modelos estão no catálogo do OrcaRouter — tencent/hy4-preview e openai/gpt-6-astra — por trás de um único endpoint compatível com OpenAI, cada um ao preço de tabela do próprio provedor, repassado com 0% de markup. Esse último detalhe importa mais neste par do que na maioria dos casos, porque o preço de tabela do modelo da Tencent é publicado em yuan: os valores em dólar acima são o preço convertido que você realmente vê, não uma margem de revendedor, e, se a Tencent alterar o preço, a alteração entra em vigor aqui no mesmo dia, e não na próxima renovação de contrato.

A DSL de roteamento é onde os dois modelos deixam de ser alternativas. A regra natural para este par é a escalada na saída: envie o loop para o modelo barato e, quando uma resposta voltar truncada em relação ao teto de 64.000 tokens ou falhar na sua verificação de schema, repita aquela etapa contra openai/gpt-6-astra, que tem o dobro de espaço de saída. O failover automático é a outra metade do argumento, e não é teórico quando uma das duas rotas vem apresentando erro em uma a cada dez requisições na última semana — uma execução longa de agente presa a um único modelo morre com todo o seu contexto acumulado, e nenhum desses modelos é barato o suficiente para ser executado de novo desde o início por acidente.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

O que mudaria esta comparação

Três coisas, por ordem de quanto alterariam o cenário. Uma avaliação independente do HY4 Preview — o modelo está público há seis semanas, não tem índice de terceiros, nenhum número reproduzido do Terminal-Bench e nenhuma cifra de custo por tarefa, e a única avaliação cega, conduzida pelo fornecedor, é o único dado de preferência humana existente. Um custo publicado por tarefa concluída para ambos os modelos, que substituiria cada proporção neste artigo por um único número. E uma decisão da Tencent sobre inferência de terceiros, porque pesos Apache 2.0 podem ser servidos por qualquer um, e no momento em que anfitriões concorrentes disponibilizarem o HY4 Preview, o preço do lado barato desta comparação passa a ser um mercado e não uma tabela.

Até então, o resumo utilizável é mais restrito do que o post de lançamento de qualquer um dos fornecedores e mais honesto do que um placar: o GPT-6 Astra é o modelo cujas alegações de capacidade foram verificadas, com o dobro do teto de saída e uma rota que vem falhando em uma a cada dez requisições. O Tencent HY4 Preview é o modelo cujas alegações de capacidade não foram verificadas, com uma arquitetura publicada, uma licença aberta, um terço do preço e uma taxa de erro muito menor no mesmo período. Se o seu trabalho é entrada de texto e saída de texto e couber dentro de 64.000 tokens gerados, o modelo mais barato não é uma concessão — é a resposta certa, e a trilha de auditoria é a única coisa de que você abre mão.

A regra natural para este par é o escalonamento na saída: envie o loop para o modelo barato e, quando uma resposta voltar truncada em relação ao teto de 64.000 tokens ou falhar na verificação do seu esquema, tente novamente essa etapa com openai/gpt-6-astra, que tem o dobro de espaço de saída.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente