Um cartão de título principal para a comparação 'Tencent HY4 Preview vs Qwen3.8-Max'. Um banner central diz 'O duelo de pesos abertos de agosto', anotado 'Duas potências de peso aberto, com 25 dias de diferença'. O cartão esquerdo 'Tencent HY4 Preview' lista '770B / 49B ativos, lançado em 28 de ago', '¥6 / ¥18 por 1M', 'Sem pontuações independentes'. O cartão direito 'Qwen3.8-Max' lista '2.4T / ~95B ativos, lançado em 3 de ago', '$2.00 / $6.00 por 1M', 'AA Index 58'. Um rodapé diz 'Os números do HY4 Preview são fornecidos pelo fornecedor; as pontuações do Qwen3.8-Max conforme a Artificial Analysis.' O logotipo da OrcaRouter é inserido no canto inferior direito.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max: O Confronto de Agosto dos Modelos Open-Weight

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY4 Preview vs Qwen3.8-Max é a colisão para a qual este mês vinha se encaminhando. O Qwen3.8-Max da Ali​baba entrou em disponibilidade geral em 3 de agosto e se tornou o primeiro Qw​en da classe Max com pesos abertos em 12 de agosto; o Tencent HY4 Preview chegou nesta manhã, 25 dias depois, com uma ficha de lançamento que cita o Qwen3.8-Max diretamente — a Tencent reporta o HY4 Preview com 74,1 no Toolathlon-Verified, à frente do Qwen3.8-Max nesse benchmark. Ambos são carros-chefes chineses de pesos abertos, ambos com preços agressivos, e apenas um deles tem pontuações independentes.

Os dois modelos estão separados por mais do que escala — Qwen3.8-Max tem 2,4 trilhões de parâmetros contra os 770 bilhões do HY4 Preview — mas nos benchmarks de agente que importam para um comprador, eles miram o mesmo alvo: trabalho de longo horizonte em que um modelo lê, chama ferramentas e itera sem um humano no loop. Esse é exatamente o território onde a geração de pesos abertos de agosto está tentando provar que pode substituir os modelos de fronteira fechados, e o primeiro movimento da Tencent foi tentar atingir o maior lançamento aberto do mês.

O placar

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Escala — HY4 Preview 770B total / 49B ativos vs Qwen3.8-Max 2.4T total / ~95B ativos

• Contexto — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens na API (262K nativos em pesos abertos, extensível para ~1.01M)

• Preço por 1M — HY4 Preview ¥6 entrada / ¥18 saída (≈$0.85 / $2.50) vs Qwen3.8-Max $2.00 entrada / $6.00 saída, leituras de cache $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (relatado pelo fornecedor) vs Qwen3.8-Max 86.6

• Modalidade — ambos apenas texto em suas formas de pesos abertos; a API Qwen3.8-Max adiciona entrada de imagem e vídeo, a prévia do HY4 Preview não.

• Pontuação independente — HY4 Preview nenhuma vs Qwen3.8-Max AA Intelligence Index 58, Agentic Index 58

Os dois cartões contam a mesma história de lados opostos. No Terminal-Bench 2.1, os 86,6 da Qwen3.8-Max e os 85,4 da HY4 Preview estão separados por um ponto e meio — um ponto a favor da Qw​en, e o valor da HY4 não é auditado. No preço, a HY4 Preview é mais barata tanto na entrada quanto na saída por token. Na verificação, a Qwen3.8-Max tem um Intelligence Index independente de 58 e um Agentic Index de 58; a HY4 Preview não tem nada além da sua própria divulgação. A diferença é o padrão clássico de um desafiante que chega com preços melhores e alegações não comprovadas contra um incumbente verificado.

Lendo a afirmação da Toolathlon

O Toolathlon-Verified mede a confiabilidade do uso agêntico de ferramentas — com que consistência um modelo conduz uma ferramenta por uma tarefa completa com erros, recuperação e chamadas de múltiplas etapas. Os 74.1 da Tencent visam diretamente a parte mais forte do perfil do Qw​en3.8-Max, porque o Agentic Index de 58 do Qw​en e seus 86.1 no OSWorld-Verified são os números que tornaram crível a proposta agêntica da Ali​baba. O Qw​en3.8-Max também marca 82.8 no IFBench (seguimento de instruções) e 93.0 no PaperBench (trabalho agêntico de nível de pesquisa), ambos superando modelos como o GPT-5.6 Sol nas próprias tabelas do fornecedor. Então a Tencent escolheu o único benchmark em que afirma uma vitória direta sobre o maior modelo aberto do mês — e a afirmação é atualmente tão verificável quanto qualquer outra linha de fornecedor único: nada.

Verificado vs informado pelo fornecedor

Este é o eixo onde o confronto é menos justo, e vale a pena deixar a assimetria explícita. O Índice de Inteligência de 58 do Qwen3.8-Max vem da Artificial Analysis, seu Índice Agentic de 58 vem da Artificial Analysis, e os mesmos harnesses independentes que lhe deram essas pontuações também mediram seus pontos fracos: uma taxa de alucinação de 40% no AA-Omniscience, contra 23% na geração anterior, e enormes 64 turnos agentic por tarefa — o modelo trabalha muito, e você paga por cada turno. O Tencent HY4 Preview não tem nada dessa instrumentação. Seus pontos fortes são afirmações, e seus modos de falha — a própria Tencent sinaliza raciocínio longo e autoverificação excessiva — são admissões, não medições.

Para uma equipe que escolhe entre os dois, a lacuna de verificação não é abstrata. O comportamento de 64 turnos por tarefa do Qwen3.8-Max é um fator de custo real e mensurável: a US$ 2/US$ 6, ele ainda é o agente mais caro por tarefa concluída em algumas comparações de terceiros, e equipes relataram que a contagem de turnos corrói sua vantagem de preço. O comportamento equivalente do HY4 Preview é desconhecido — ele pode ser mais barato por tarefa do que seu preço por token, já baixo, sugere, ou seu hábito de autoverificação pode consumir a diferença. Ninguém pode lhe dizer qual ainda, porque ninguém fora da Tencent o executou.

Preço e aspectos práticos dos pesos abertos

Por token, o HY4 Preview é mais barato nos dois lados do balanço: ¥6/¥18 contra os $2.00/$6.00 do Qwen3.8-Max, e acertos de cache a ¥0.3 contra $0.25. Isso faz do HY4 Preview o modelo principal de pesos abertos mais barato tanto na entrada quanto na saída, ponto final. Mas "pesos abertos" vem com dois conjuntos diferentes de letras miúdas. O lançamento de pesos abertos do Qwen3.8-Max — o Qwen3.8-2.4T-A95B — é somente texto com raciocínio forçado, contexto nativo de 262K em vez dos 1M da API, e uma licença personalizada com condições por faixa de escala: requisitos de exibição do nome do modelo acima de 100 milhões de usuários mensais, e uma licença separada para grandes negócios de Model-as-a-Service. Os pesos do Tencent HY4 Preview estão no HuggingFace, no ModelScope e no GitHub desde esta manhã, mas seus termos exatos de licença e se os pesos correspondem à API servida não foram declarados com esse nível de clareza. Ambos os modelos são baixáveis; nenhum é trivial de adotar como substituto direto.

O resultado final

Qwen3.8-Max é a escolha mais segura em todos os aspectos em que a verificação compra segurança: pontuação independente em inteligência e trabalho agêntico, modos de falha conhecidos, uma licença estabelecida e três semanas de feedback de produção. Também é a escolha mais cara por token, e seu comportamento medido de uso intenso de turnos é um risco de custo conhecido. O Tencent HY4 Preview é a aposta de valor: mais barato tanto na entrada quanto na saída, uma alegação de desempenho comparável no Terminal-Bench e uma alegação direta de Toolathlon-Verified contra a Qw​en — tudo isso sem verificação no primeiro dia. Se você vai colocar um modelo de pesos abertos em produção esta semana, o Qwen3.8-Max é a escolha defensável e está ativo no OrcaRouter pelo preço de lista da Ali​baba — US$ 2,00/US$ 6,00, repassado sem margem. O HY4 Preview é o projeto de avaliação: execute-o pela API da própria Tencent contra suas próprias tarefas no estilo Toolathlon, mantenha o caminho de produção no modelo verificado e, quando as pontuações independentes chegarem — ou quando o HY4 Preview alcançar um roteador e sua tarifa de ¥6/¥18 se tornar um repasse no mesmo dia — a troca é uma regra de roteamento, não uma reescrita.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

O que assistir

• A primeira execução independente do HY4 Preview em um harness agêntico. O 74.1 verificado pelo Toolathlon é o número que a Tencent quer conquistar; um Índice Agêntico de terceiros seria a confirmação.

• Contagem de turnos medida do HY4 Preview. Os 64 turnos por tarefa do Qwen3.8-Max são o conto de advertência; se o HY4 Preview é mais barato por tarefa concluída é todo o argumento econômico.

• Os termos de licença dos pesos. Eles determinarão se "open" significa "utilizável na sua escala" para o HY4 Preview, assim como as condições da Licença Qwen3.8-Max o determinaram para o modelo da Ali​baba.

• Se algum dos fornecedores cortar o preço novamente. Em um mês em que dois carros-chefe de peso aberto foram lançados com preços agressivos, o repasse em um roteador torna qualquer corte adicional visível no mesmo dia.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube