
GPT-6 Astra vs. Tencent HY4 Preview: um modelo tem uma trilha de auditoria e o outro tem uma tabela de benchmark
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 56 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 346 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Tencent HY4 Preview e GPT-6 Astra são as duas rotas mais baratas para codificação agêntica quase de fronteira disponíveis hoje, se você ler os números dos próprios fornecedores, e são os dois modelos menos comparáveis nessa categoria, se você ler os de qualquer outra pessoa. O Tencent HY4 Preview foi lançado e disponibilizado como código aberto em 28 de agosto de 2026 sob a licença Apache 2.0, a US$ 0,834 por milhão de tokens de entrada e US$ 2,501 por milhão de tokens de saída, com uma arquitetura de mistura de especialistas de 770 bilhões de parâmetros, uma janela de contexto que ultrapassa um milhão de tokens e um teto de saída de 64.000 tokens. O GPT-6 Astra está em disponibilidade geral desde 3 de setembro de 2026 a US$ 10,00 e US$ 50,00, com uma janela de 1.050.000 tokens e saída máxima de 128.000. Os pontos fortes do Astra são respaldados por oito avaliações de terceiros publicadas; os do HY4 Preview são respaldados por execuções de terminal, chamada de ferramentas e avaliação cega da própria Tencent, e por nada mais. Essa assimetria não significa que o modelo mais barato seja mais fraco. Significa que uma dessas duas comparações pode ser verificada e a outra tem de ser acreditada, e as decisões práticas diferem em conformidade.
O que o lançamento do Apache 2.0 realmente lhe oferece
A licença é a parte desta comparação que uma tabela de preços não consegue expressar. O Tencent HY4 Preview não é um teaser alojado com branding de pesos abertos — os pesos podem ser descarregados do Hugging Face, do GitHub, do ModelScope e do GitCode, o que significa que o modelo sobrevive a qualquer decisão que a Tencent tome em relação aos seus próprios preços, ao seu próprio endpoint ou ao seu próprio interesse contínuo em servi-lo.
• Arquitetura — 770B de parâmetros totais, 49B ativos por token, 78 camadas, 256 especialistas roteados mais um especialista compartilhado, e uma camada nativa de previsão de múltiplos tokens para decodificação especulativabr /> • Características de serviço — 54,6 tokens de saída por segundo e tempo mediano de 6,26 segundos até o primeiro token, medidos nas rotas do OrcaRouter ao longo de uma janela móvel de sete diasbr /> • Contexto e limite — uma janela de 1.048.576 tokens contra uma saída máxima de 64.000 tokensbr /> • Superfície de entrada — somente texto; sem imagem, sem arquivo, sem áudiobr /> • Controle de raciocínio — três níveis, alto, baixo e nenhum, com alto como padrão, além de uma recomendação documentada de amostragem com temperatura 0,9 e top_p 1,0br /> • Confiabilidade — uma taxa de erro de 2,8% na mesma janela de sete dias, contra 10,3% na rota Astra
Esse último par de números é a informação mais acionável desta página, e é o tipo de dado que nenhum fornecedor publica sobre o próprio modelo. As pontuações de benchmark independentes da Astra são mais altas e sua rota vem falhando em aproximadamente uma requisição em cada dez na última semana, enquanto um modelo sem nenhuma pontuação independente vem falhando em uma em cada trinta e cinco. Nenhum dos números é uma afirmação sobre os próprios modelos — taxas de erro medem a rota, os limites de taxa e o upstream, não os pesos —, mas são os números que um sistema de produção realmente experimenta.

Onde os números da Tencent podem ser conferidos com os de outra pessoa
Até onde as evidências publicadas mostram, esta é uma oportunidade genuinamente incomum: tanto a Astra quanto a HY4 Preview têm um valor no Terminal-Bench 2.1, e apenas um deles é reportado pelo fornecedor.
• Terminal-Bench 2.1, operando um terminal real — GPT-6 Astra 88,4, avaliado de forma independente; Tencent HY4 Preview 85,4, reportado pelo fornecedorbr /> • Chamada de ferramentas — Astra 41,4 no τ²-Banking, avaliado de forma independente; HY4 Preview 74,1 no Toolathlon-Verified, reportado pelo fornecedor, em um teste diferentebr /> • Engenharia de software — HY4 Preview 64,3 no DeepSWE, um aumento em relação aos 28,0 do seu antecessor Hy3, reportado pelo fornecedorbr /> • Tarefas de agente — HY4 Preview 37,1 pass@1 no APEX-Agents, reportado pelo fornecedorbr /> • Preferência humana — média de 2,99 de 4,00 em 203 tarefas de engenharia pontuadas por 163 especialistas, conduzida pelo fornecedor, contra GLM-5.3 com 2,92 e Kimi K3 com 2,94br /> • Índice independente — GPT-6 Astra 54,7 no Intelligence Index e 96,1 no GPQA Diamond, de terceiros; não existe índice equivalente para o HY4 Preview
A linha do Terminal-Bench é a que merece mais atenção. Uma diferença de 3 pontos entre um 88,4 independente e um 85,4 relatado pelo fornecedor está bem dentro da margem que um harness diferente, um scaffold diferente ou uma temperatura de amostragem diferente podem produzir, o que significa que a leitura honesta não é "a Astra é três pontos melhor", mas sim que "o modelo de pesos abertos mais barato desta faixa está reivindicando paridade, e a reivindicação é, no mínimo, plausível". A própria formulação da Tencent é cuidadosa nesse ponto: descreve o DeepSWE como "reduzindo gradualmente a lacuna", em vez de fechá-la, e a sua única alegação clara de paridade — o empate no Terminal-Bench com um modelo fechado de topo de um fornecedor diferente — é exatamente a alegação que mais precisa de uma segunda medição.
Há também uma mudança que vale a pena conhecer, porque altera a economia, e não as pontuações. Em 7 de setembro de 2026, a Tencent introduziu uma otimização na versão de pré-visualização em produção que, segundo ela, reduz turnos de raciocínio e o consumo de tokens por tarefa em trabalhos complexos. Como o modelo cobra por token, menos tokens por tarefa concluída reduzem o custo da tarefa, mesmo que a tarifa por token não tenha mudado. O tamanho dessa economia é uma medição da própria Tencent e ninguém fora da Tencent a reproduziu — mas o mecanismo é real e é a razão pela qual uma pré-visualização lançada em agosto pode ser materialmente mais barata de operar em outubro do que sugeria seu texto de lançamento.
O teto de 64.000 tokens é a especificação que decide as implantações
A meio da ficha técnica está a restrição que aperta primeiro, e não é a qualidade. A saída máxima do HY4 Preview é de 64.000 tokens contra os 128.000 da Astra, num modelo cujo propósito declarado são agentes de codificação e longas cadeias de uso de ferramentas. Um arquivo gerado, um patch de vários arquivos, um relatório estruturado longo — estas são as saídas que atingem um teto, e numa execução de agente a falha não é uma resposta ligeiramente pior, é uma resposta truncada que o pipeline circundante tem de detetar e tratar.
Ambos os modelos recebem cerca de um milhão de tokens de entrada, portanto o caso de leitura de documentos é genuinamente um empate. A diferença está inteiramente do lado da geração, e é de um fator de dois, não um erro de arredondamento. Acrescente a diferença na superfície de entrada — a Astra aceita imagens e arquivos, a HY4 Preview é apenas texto — e o quadro que emerge é uma divisão de trabalho clara, e não um ranking: o modelo de pesos abertos para ciclos de agente de texto para texto, em que o entregável é uma chamada de ferramenta ou um diff, e o modelo fechado para qualquer coisa que tenha de olhar para algo ou escrever algo longo.
O que 20× a taxa de produção proporciona, linha por linha
• Preço de entrada — Tencent HY4 Preview $0.834 por 1M vs GPT-6 Astra $10.00, cerca de 12×br /> • Preço de saída — HY4 Preview $2.501 por 1M vs Astra $50.00, cerca de 20×br /> • Entrada em cache — HY4 Preview $0.042 por 1M vs Astra $1.00, cerca de 24×br /> • Degrau de solicitação longa — a Astra reajusta o preço de toda a solicitação acima de 272.000 tokens de entrada para $20.00 e $75.00; a tabela de preços do HY4 Preview não tem degrau equivalentebr /> • Taxa efetiva de entrada em um prompt de 400.000 tokens — HY4 Preview inalterada em $0.834 vs Astra $20.00, cerca de 24×br /> • Custo por milhão de tokens de um loop de agente comum, proporção de 4:1 entre entrada e saída — HY4 Preview aproximadamente $1.17 vs Astra aproximadamente $18.00br /> • Custo de um mês de 100 milhões de tokens na mesma proporção — HY4 Preview aproximadamente $117 vs Astra aproximadamente $1.800
A linha de entrada em cache é a que escala pior para o lado mais caro, porque os loops de agente reenviam o mesmo prompt de sistema e o mesmo prefixo de conversa a cada turno. A $0,042 contra $1,00, os tokens mais baratos de um loop longo são 24 vezes mais baratos no modelo da Tencent, que é justamente a carga de trabalho em que uma pequena diferença por token se acumula mais rapidamente. O custo por tarefa, a métrica que resolveria isso de forma limpa, não é publicado pela Tencent de forma alguma — então a única maneira de obter o número que importa é rodar os dois modelos com o seu próprio conjunto de tarefas e ler o objeto de uso.

O que um roteador acrescenta aqui, com as taxas de erro em mãos
Ambos os modelos estão no catálogo do OrcaRouter — tencent/hy4-preview e openai/gpt-6-astra — por trás de um único endpoint compatível com OpenAI, cada um ao preço de tabela do próprio provedor, repassado com 0% de markup. Esse último detalhe importa mais neste par do que na maioria dos casos, porque o preço de tabela do modelo da Tencent é publicado em yuan: os valores em dólar acima são o preço convertido que você realmente vê, não uma margem de revendedor, e, se a Tencent alterar o preço, a alteração entra em vigor aqui no mesmo dia, e não na próxima renovação de contrato.
A DSL de roteamento é onde os dois modelos deixam de ser alternativas. A regra natural para este par é a escalada na saída: envie o loop para o modelo barato e, quando uma resposta voltar truncada em relação ao teto de 64.000 tokens ou falhar na sua verificação de schema, repita aquela etapa contra openai/gpt-6-astra, que tem o dobro de espaço de saída. O failover automático é a outra metade do argumento, e não é teórico quando uma das duas rotas vem apresentando erro em uma a cada dez requisições na última semana — uma execução longa de agente presa a um único modelo morre com todo o seu contexto acumulado, e nenhum desses modelos é barato o suficiente para ser executado de novo desde o início por acidente.

O que mudaria esta comparação
Três coisas, por ordem de quanto alterariam o cenário. Uma avaliação independente do HY4 Preview — o modelo está público há seis semanas, não tem índice de terceiros, nenhum número reproduzido do Terminal-Bench e nenhuma cifra de custo por tarefa, e a única avaliação cega, conduzida pelo fornecedor, é o único dado de preferência humana existente. Um custo publicado por tarefa concluída para ambos os modelos, que substituiria cada proporção neste artigo por um único número. E uma decisão da Tencent sobre inferência de terceiros, porque pesos Apache 2.0 podem ser servidos por qualquer um, e no momento em que anfitriões concorrentes disponibilizarem o HY4 Preview, o preço do lado barato desta comparação passa a ser um mercado e não uma tabela.
Até então, o resumo utilizável é mais restrito do que o post de lançamento de qualquer um dos fornecedores e mais honesto do que um placar: o GPT-6 Astra é o modelo cujas alegações de capacidade foram verificadas, com o dobro do teto de saída e uma rota que vem falhando em uma a cada dez requisições. O Tencent HY4 Preview é o modelo cujas alegações de capacidade não foram verificadas, com uma arquitetura publicada, uma licença aberta, um terço do preço e uma taxa de erro muito menor no mesmo período. Se o seu trabalho é entrada de texto e saída de texto e couber dentro de 64.000 tokens gerados, o modelo mais barato não é uma concessão — é a resposta certa, e a trilha de auditoria é a única coisa de que você abre mão.
A regra natural para este par é o escalonamento na saída: envie o loop para o modelo barato e, quando uma resposta voltar truncada em relação ao teto de 64.000 tokens ou falhar na verificação do seu esquema, tente novamente essa etapa com openai/gpt-6-astra, que tem o dobro de espaço de saída.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
