Um cartão de título heroico para a comparação 'Tencent HY4 Preview vs GPT-5.6 Sol'. Um destaque central diz 'Toolathlon-Verified 74.1 - a reivindicação de pesos abertos contra a fronteira', anotado 'A Tencent afirma que seu modelo supera o GPT-5.6 Sol em chamadas de ferramentas agênticas'. Cartão esquerdo 'Tencent HY4 Preview' lista 'Pesos abertos, 770B / 49B ativos', '¥6 / ¥18 por 1M', 'Sem pontuações independentes'. Cartão direito 'GPT-5.6 Sol' lista 'API fechada, carro-chefe da OpenAI', '$4 / $20 base por 1M', 'Terminal-Bench 2.1: 88.8'. Um rodapé diz 'Números do HY4 Preview fornecidos pelo fornecedor; números do Sol amplamente reproduzidos.' O logotipo da OrcaRouter é composto no canto inferior direito.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol: A Afirmação sobre Chamada de Ferramentas que Coloca Pesos Abertos Contra a Fronteira

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY4 Preview é o primeiro modelo de pesos abertos em meses cuja ficha de lançamento afirma explicitamente uma vitória sobre o GPT-5.6 Sol. O número em questão é o Toolathlon-Verified, um benchmark para chamada de ferramentas agênticas, onde a Tencent reporta o HY4 Preview com 74,1 — à frente do Qwen3.8-Max e, segundo a comparação da própria Tencent, à frente do GPT-5.6 Sol. Em todas as outras dimensões, os dois modelos não são realmente pares: o GPT-5.6 Sol é o modelo de fronteira fechado, carro-chefe e medido de forma independente da Ope​nAI, e o Tencent HY4 Preview é um preview de pesos abertos de 770 bilhões de parâmetros lançado esta manhã com uma ficha de resultados reportada pelo fornecedor e sem verificação por terceiros.

Portanto, a questão interessante não é "qual modelo é mais inteligente" — mas sim se um desafiante de pesos abertos, a aproximadamente um sexto do preço de entrada da Sol, pode reivindicar de forma credível uma fatia da fronteira, e o que uma equipe deve fazer com uma afirmação que atualmente não é verificável.

A afirmação que torna isto um verdadeiro confronto.

Toolathlon-Verified mede o quão confiavelmente um modelo conduz uma ferramenta em uma tarefa completa de agente — lendo resultados, decidindo a próxima chamada, recuperando-se de erros — em vez de quão bem ele escreve uma única função. Isso importa porque a maior parte dos gastos reais com API em modelos de fronteira vai para loops de agentes, não para respostas de uma única tentativa. O 74.1 da Tencent nesse benchmark é a afirmação específica que colocou o HY4 Preview na conversa do GPT-5.6 Sol, e vale a pena refletir por um momento: é o tipo de número que, se resistir à replicação independente, torna real a conversa sobre custo entre pesos abertos e fronteira fechada. Se não resistir, vira mais um scorecard de fornecedor que evapora sob um harness de terceiros.

Duas maneiras de comprar inteligência

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Parâmetros — HY4 Preview 770B total / 49B ativos, pesos abertos vs GPT-5.6 Sol, contagem de parâmetros não divulgada, API fechada

• Contexto — HY4 Preview >1M tokens vs GPT-5.6 Sol 1.05M tokens, saída máxima de 128K

• Preço por 1M — HY4 Preview ¥6 entrada / ¥18 saída (≈$0,85 / $2,50) vs GPT-5.6 Sol $4,00 / $20,00 no nível básico, subindo para $8,00 / $30,00 para solicitações de grande contexto, leituras de cache $0,40

• Modalidades de entrada — HY4 Preview somente texto nesta prévia vs GPT-5.6 Sol entrada de texto e imagem

• Modos de raciocínio — HY4 Preview sem equivalente publicado vs modo Ultra do GPT-5.6 Sol (até 16 subagentes paralelos) e esforço de raciocínio Max

• Verificação independente — HY4 Preview: nenhum ainda, vs GPT-5.6 Sol: presente em todos os principais leaderboards, com classificação de contexto de 1,05M no topo dos testes compostos de contexto longo.

A coluna de preços é onde todo o confronto se resolve. No nível básico, o GPT-5.6 Sol custa US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída. O Tencent HY4 Preview custa cerca de US$ 0,85 e US$ 2,50 nas taxas de câmbio atuais. Para uma carga de trabalho que movimenta muitos tokens de saída — como faz a codificação agêntica — o modelo de pesos abertos custa aproximadamente um oitavo do modelo fechado, e essa diferença persiste mesmo com a ressalva de que os números do Sol vêm com muito mais verificação por trás deles.

Onde GPT-5.6 Sol ainda mantém a vantagem

A verificação é o primeiro diferencial. O GPT-5.6 Sol está em disponibilidade geral desde 9 de julho e, desde então, foi medido de forma independente: 88,8 no Terminal-Bench 2.1 no raciocínio base, 91,9 no modo Ultra, 53,6 no Agents' Last Exam (um recorde no lançamento), 94,6 no GPQA Diamond e 64,6 no SWE-bench Pro. A Ope​nAI também relata uma melhoria de 54% na eficiência de tokens em tarefas de programação agêntica em relação ao seu próprio carro-chefe anterior. Esses são números que você pode encontrar reproduzidos fora da documentação da própria Ope​nAI, o que é exatamente a propriedade que falta ao Tencent HY4 Preview hoje.

Capacidade é a segunda vantagem, e é estrutural em vez de marginal. O GPT-5.6 Sol aceita entrada de imagens; o HY4 Preview é somente texto nesta prévia, com a Tencent reconhecendo que a visão terá de esperar pelo lançamento completo. O GPT-5.6 Sol inclui o modo Ultra — uma configuração multiagente que coordena subagentes paralelos por três a quatro vezes o custo de tokens, útil exatamente para as tarefas de engenharia de longo horizonte onde os dois modelos realmente competiriam. E os caminhos de uso de computador e de chamada programática de ferramentas do Sol são documentados, exercitados em escala de produção e testados sob carga. A alegação Toolathlon-Verified da Tencent, se for replicável, reduz a lacuna de uso de ferramentas; ela não fecha as lacunas multimodal ou multiagente, que o HY4 Preview não tenta abordar.

Onde o HY4 Preview é genuinamente interessante

Deixando o teatro de benchmarks de lado, restam três coisas reais. Primeiro, o preço: a ¥6/¥18 — cerca de $0,85/$2,50 — a Tencent está subcotando todos os modelos de fronteira ocidentais em tokens de saída por um fator de quatro a oito, e subcotando seus próprios concorrentes chineses de pesos abertos na entrada. Segundo, os pesos abertos: um MoE com 49B ativos pode ser implantado em um único nó de uma forma que a arquitetura não divulgada da Sol jamais será, e os pesos já estão no HuggingFace, ModelScope e GitHub. Terceiro, o contexto e a trajetória de engenharia: o DeepSWE 64.3 e uma janela de contexto de mais de 1M visam as mesmas cargas de trabalho agênticas de longo horizonte que o modo Ultra da Sol almeja, a uma fração do custo.

A ressalva honesta é que nada disso sobreviveu ao contato com um benchmark independente. A história de auto-otimização que a Tencent conta — um ganho de 31,8% na taxa de transferência de ponta a ponta obtido pelo modelo ao iterar sobre sua própria pilha de inferência — é medida internamente. A vitória em teste cego sobre o GLM 5.3 e o Kimi K3 é realizada internamente. Tudo de interessante sobre o HY4 Preview é, hoje, uma alegação.

A decisão

Se você está construindo um sistema de produção hoje, o GPT-5.6 Sol é a escolha defensável, e ele é acessível por meio do OrcaRouter ao preço de tabela em camadas da própria Ope​nAI — $4.00/$20.00 no nível base, $8.00/$30.00 acima dele, repassados sem nenhum markup, então qualquer alteração de preço do fornecedor é refletida do nosso lado no mesmo dia. Se o seu fluxo de trabalho é baseado em agentes e faz uso intensivo de ferramentas, a estrutura em camadas significa que você deve verificar os tamanhos reais das suas entradas em relação ao limite de $272K tokens, em vez de assumir uma tarifa fixa.

Se você estiver disposto a realizar uma avaliação-sombra, o HY4 Preview é barato o suficiente para valer uma avaliação de verdade: roteie sua carga de trabalho de chamadas de ferramentas pelo Sol hoje, execute os mesmos prompts contra o HY4 Preview pela própria API da Tencent e compare em suas próprias tarefas no estilo Toolathlon. E se as pontuações independentes chegarem onde a Tencent diz que chegarão, o caminho para a troca é curto — o modelo de pesos abertos encaixa-se em um roteador e sua regra de failover troca os endpoints, com a tarifa de ¥6/¥18 do fornecedor repassada sem alterações. Essa é a estrutura honesta desse confronto: um modelo de fronteira verificado sobre o qual você pode construir hoje, enfrentando um desafiante aberto não verificado, barato o suficiente para testar e posicionado para fazer a conversa sobre preço girar em torno de toda a classe de pesos abertos.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

O que assistir

A primeira replicação independente do Toolathlon-Verified. Se um harness de terceiros confirmar o HY4 Preview na casa dos 70, o argumento de que "pesos abertos não conseguem fazer uso agentivo de ferramentas" colapsa.

• Se a Tencent lança visão antes do lançamento completo do Hy4. A versão somente texto limita o HY4 Preview a um subconjunto estrito das cargas de trabalho que o GPT-5.6 Sol processa.

Os custos reais de tokens da tendência de raciocínio prolongado do HY4 Preview. A ¥18 por milhão de tokens de saída, a autoverificação prolixa devora a vantagem de preço mais rápido do que em um modelo de $20.

• Se o preço em camadas da Sol sofre outro corte antes do lançamento completo da Hy4. O repasse em um roteador significa que uma queda é visível no mesmo dia.

Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube