
Tencent HY4 Preview vs GPT-5.6 Sol: A Afirmação sobre Chamada de Ferramentas que Coloca Pesos Abertos Contra a Fronteira
- AlibabaNOVOQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.3 Flash2026-08-2658Inteligência72Código
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianQwen3.8 27B2026-08-1552Inteligência68Código
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
Tencent HY4 Preview é o primeiro modelo de pesos abertos em meses cuja ficha de lançamento afirma explicitamente uma vitória sobre o GPT-5.6 Sol. O número em questão é o Toolathlon-Verified, um benchmark para chamada de ferramentas agênticas, onde a Tencent reporta o HY4 Preview com 74,1 — à frente do Qwen3.8-Max e, segundo a comparação da própria Tencent, à frente do GPT-5.6 Sol. Em todas as outras dimensões, os dois modelos não são realmente pares: o GPT-5.6 Sol é o modelo de fronteira fechado, carro-chefe e medido de forma independente da OpenAI, e o Tencent HY4 Preview é um preview de pesos abertos de 770 bilhões de parâmetros lançado esta manhã com uma ficha de resultados reportada pelo fornecedor e sem verificação por terceiros.
Portanto, a questão interessante não é "qual modelo é mais inteligente" — mas sim se um desafiante de pesos abertos, a aproximadamente um sexto do preço de entrada da Sol, pode reivindicar de forma credível uma fatia da fronteira, e o que uma equipe deve fazer com uma afirmação que atualmente não é verificável.
A afirmação que torna isto um verdadeiro confronto.
Toolathlon-Verified mede o quão confiavelmente um modelo conduz uma ferramenta em uma tarefa completa de agente — lendo resultados, decidindo a próxima chamada, recuperando-se de erros — em vez de quão bem ele escreve uma única função. Isso importa porque a maior parte dos gastos reais com API em modelos de fronteira vai para loops de agentes, não para respostas de uma única tentativa. O 74.1 da Tencent nesse benchmark é a afirmação específica que colocou o HY4 Preview na conversa do GPT-5.6 Sol, e vale a pena refletir por um momento: é o tipo de número que, se resistir à replicação independente, torna real a conversa sobre custo entre pesos abertos e fronteira fechada. Se não resistir, vira mais um scorecard de fornecedor que evapora sob um harness de terceiros.
Duas maneiras de comprar inteligência

• Parâmetros — HY4 Preview 770B total / 49B ativos, pesos abertos vs GPT-5.6 Sol, contagem de parâmetros não divulgada, API fechada
• Contexto — HY4 Preview >1M tokens vs GPT-5.6 Sol 1.05M tokens, saída máxima de 128K
• Preço por 1M — HY4 Preview ¥6 entrada / ¥18 saída (≈$0,85 / $2,50) vs GPT-5.6 Sol $4,00 / $20,00 no nível básico, subindo para $8,00 / $30,00 para solicitações de grande contexto, leituras de cache $0,40
• Modalidades de entrada — HY4 Preview somente texto nesta prévia vs GPT-5.6 Sol entrada de texto e imagem
• Modos de raciocínio — HY4 Preview sem equivalente publicado vs modo Ultra do GPT-5.6 Sol (até 16 subagentes paralelos) e esforço de raciocínio Max
• Verificação independente — HY4 Preview: nenhum ainda, vs GPT-5.6 Sol: presente em todos os principais leaderboards, com classificação de contexto de 1,05M no topo dos testes compostos de contexto longo.
A coluna de preços é onde todo o confronto se resolve. No nível básico, o GPT-5.6 Sol custa US$ 4,00 por milhão de tokens de entrada e US$ 20,00 por milhão de tokens de saída. O Tencent HY4 Preview custa cerca de US$ 0,85 e US$ 2,50 nas taxas de câmbio atuais. Para uma carga de trabalho que movimenta muitos tokens de saída — como faz a codificação agêntica — o modelo de pesos abertos custa aproximadamente um oitavo do modelo fechado, e essa diferença persiste mesmo com a ressalva de que os números do Sol vêm com muito mais verificação por trás deles.
Onde GPT-5.6 Sol ainda mantém a vantagem
A verificação é o primeiro diferencial. O GPT-5.6 Sol está em disponibilidade geral desde 9 de julho e, desde então, foi medido de forma independente: 88,8 no Terminal-Bench 2.1 no raciocínio base, 91,9 no modo Ultra, 53,6 no Agents' Last Exam (um recorde no lançamento), 94,6 no GPQA Diamond e 64,6 no SWE-bench Pro. A OpenAI também relata uma melhoria de 54% na eficiência de tokens em tarefas de programação agêntica em relação ao seu próprio carro-chefe anterior. Esses são números que você pode encontrar reproduzidos fora da documentação da própria OpenAI, o que é exatamente a propriedade que falta ao Tencent HY4 Preview hoje.
Capacidade é a segunda vantagem, e é estrutural em vez de marginal. O GPT-5.6 Sol aceita entrada de imagens; o HY4 Preview é somente texto nesta prévia, com a Tencent reconhecendo que a visão terá de esperar pelo lançamento completo. O GPT-5.6 Sol inclui o modo Ultra — uma configuração multiagente que coordena subagentes paralelos por três a quatro vezes o custo de tokens, útil exatamente para as tarefas de engenharia de longo horizonte onde os dois modelos realmente competiriam. E os caminhos de uso de computador e de chamada programática de ferramentas do Sol são documentados, exercitados em escala de produção e testados sob carga. A alegação Toolathlon-Verified da Tencent, se for replicável, reduz a lacuna de uso de ferramentas; ela não fecha as lacunas multimodal ou multiagente, que o HY4 Preview não tenta abordar.
Onde o HY4 Preview é genuinamente interessante
Deixando o teatro de benchmarks de lado, restam três coisas reais. Primeiro, o preço: a ¥6/¥18 — cerca de $0,85/$2,50 — a Tencent está subcotando todos os modelos de fronteira ocidentais em tokens de saída por um fator de quatro a oito, e subcotando seus próprios concorrentes chineses de pesos abertos na entrada. Segundo, os pesos abertos: um MoE com 49B ativos pode ser implantado em um único nó de uma forma que a arquitetura não divulgada da Sol jamais será, e os pesos já estão no HuggingFace, ModelScope e GitHub. Terceiro, o contexto e a trajetória de engenharia: o DeepSWE 64.3 e uma janela de contexto de mais de 1M visam as mesmas cargas de trabalho agênticas de longo horizonte que o modo Ultra da Sol almeja, a uma fração do custo.
A ressalva honesta é que nada disso sobreviveu ao contato com um benchmark independente. A história de auto-otimização que a Tencent conta — um ganho de 31,8% na taxa de transferência de ponta a ponta obtido pelo modelo ao iterar sobre sua própria pilha de inferência — é medida internamente. A vitória em teste cego sobre o GLM 5.3 e o Kimi K3 é realizada internamente. Tudo de interessante sobre o HY4 Preview é, hoje, uma alegação.
A decisão
Se você está construindo um sistema de produção hoje, o GPT-5.6 Sol é a escolha defensável, e ele é acessível por meio do OrcaRouter ao preço de tabela em camadas da própria OpenAI — $4.00/$20.00 no nível base, $8.00/$30.00 acima dele, repassados sem nenhum markup, então qualquer alteração de preço do fornecedor é refletida do nosso lado no mesmo dia. Se o seu fluxo de trabalho é baseado em agentes e faz uso intensivo de ferramentas, a estrutura em camadas significa que você deve verificar os tamanhos reais das suas entradas em relação ao limite de $272K tokens, em vez de assumir uma tarifa fixa.
Se você estiver disposto a realizar uma avaliação-sombra, o HY4 Preview é barato o suficiente para valer uma avaliação de verdade: roteie sua carga de trabalho de chamadas de ferramentas pelo Sol hoje, execute os mesmos prompts contra o HY4 Preview pela própria API da Tencent e compare em suas próprias tarefas no estilo Toolathlon. E se as pontuações independentes chegarem onde a Tencent diz que chegarão, o caminho para a troca é curto — o modelo de pesos abertos encaixa-se em um roteador e sua regra de failover troca os endpoints, com a tarifa de ¥6/¥18 do fornecedor repassada sem alterações. Essa é a estrutura honesta desse confronto: um modelo de fronteira verificado sobre o qual você pode construir hoje, enfrentando um desafiante aberto não verificado, barato o suficiente para testar e posicionado para fazer a conversa sobre preço girar em torno de toda a classe de pesos abertos.


O que assistir
A primeira replicação independente do Toolathlon-Verified. Se um harness de terceiros confirmar o HY4 Preview na casa dos 70, o argumento de que "pesos abertos não conseguem fazer uso agentivo de ferramentas" colapsa.
• Se a Tencent lança visão antes do lançamento completo do Hy4. A versão somente texto limita o HY4 Preview a um subconjunto estrito das cargas de trabalho que o GPT-5.6 Sol processa.
Os custos reais de tokens da tendência de raciocínio prolongado do HY4 Preview. A ¥18 por milhão de tokens de saída, a autoverificação prolixa devora a vantagem de preço mais rápido do que em um modelo de $20.
• Se o preço em camadas da Sol sofre outro corte antes do lançamento completo da Hy4. O repasse em um roteador significa que uma queda é visível no mesmo dia.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
