
GPT-6 Sol vs Tencent HY4 Preview: O modelo mais barato está carregando seiscentas vezes o tráfego
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Comparações entre um modelo de ponta e um modelo barato geralmente terminam na tabela de preços, e esta tem um desfecho melhor disponível. Tencent HY4 Preview e GPT-6 Sol são ambos roteados pelo OrcaRouter, o que significa que a mesma telemetria cobre os dois, e, na mesma janela móvel de sete dias, o modelo HY4 Preview movimentou cerca de 2,4 bilhões de tokens, contra cerca de 3,9 milhões do GPT-6 Sol. Isso não é um benchmark e não é um veredito; é uma janela móvel do tráfego de uma plataforma e será lida de forma diferente na próxima semana. Mas é um sinal real sobre o que as pessoas que constroem coisas realmente escolhem quando um modelo forte de pesos abertos custa um quarto do fechado, e é o tipo de número que uma ficha técnica não consegue produzir.
Os dois modelos também são um estudo sobre o que um benchmark pode e não pode dizer. O GPT-6 Sol, lançado em 22 de setembro de 2026 como o nível intermédio da geração GPT-6 da OpenAI, tem uma pontuação independente no Intelligence Index. O HY4 Preview, lançado e disponibilizado em código aberto pela Tencent em 28 de agosto de 2026, não tem página de modelo na Artificial Analysis, nenhum índice de terceiros e nenhum dado independente de custo por tarefa. Tudo o que foi publicado sobre o seu desempenho é medição da própria Tencent. Essa assimetria não faz do HY4 Preview o modelo mais fraco. Faz dele o menos auditado, e essas são afirmações diferentes.
As especificações, incluindo as duas que determinam a maioria das implantações
Preço de saída — GPT-6 Sol US$ 10,00 por milhão vs. Tencent HY4 Preview US$ 2,50 por milhão
Preço de entrada — GPT-6 Sol US$ 2,00 por milhão vs. Tencent HY4 Preview US$ 0,83 por milhão
Entrada em cache — GPT-6 Sol US$ 0,20 por milhão vs. Tencent HY4 Preview US$ 0,04 por milhão
Pesos — GPT-6 Sol fechado, somente API vs. HY4 Preview de código aberto sob Apache 2.0
Modalidades de entrada — GPT-6 Sol texto, imagem e arquivo vs. HY4 Preview somente texto
Janela de contexto — GPT-6 Sol 1.050.000 tokens vs. HY4 Preview 1.048.576 tokens
Saída máxima — GPT-6 Sol 128.000 tokens vs. HY4 Preview 64.000 tokens
Escalonamento para solicitações longas — GPT-6 Sol reprecifica toda a solicitação acima de 272.000 tokens de entrada para US$ 4,00 / US$ 15,00 vs. HY4 Preview sem escalonamento na sua tabela
Arquitetura — GPT-6 Sol não divulgada vs. HY4 Preview 770 bilhões de parâmetros totais, 49 bilhões ativos, 78 camadas, 256 especialistas roteados mais um compartilhado, camada nativa de previsão de múltiplos tokens
Pontuação independente — GPT-6 Sol 47,6 no Intelligence Index vs. HY4 Preview nenhuma publicada
Velocidade de saída medida — GPT-6 Sol cerca de 244 tokens por segundo vs. HY4 Preview cerca de 54, ambas as métricas móveis de sete dias
As duas linhas que decidem a maioria das implantações reais são as que ficam mais abaixo. A primeira é que o HY4 Preview não aceita entrada de imagem ou arquivo, o que o exclui de qualquer pipeline que precise olhar para alguma coisa. A segunda é o teto de saída: 64.000 tokens são metade dos 128.000 do GPT-6 Sol e, num modelo cujo propósito declarado são agentes de programação e longas cadeias de uso de ferramentas, essa é a restrição com que uma equipe se depara primeiro — não a qualidade, mas o ponto em que um arquivo gerado deixa de caber numa única resposta.
Em comparação, um quarto do preço de saída e um quinto do preço de entrada em cache permitem muitas tentativas. E a arquitetura do HY4 Preview está documentada de uma forma que a do GPT-6 Sol não está: a Tencent publicou o número de parâmetros, o número de camadas, o layout de especialistas e a camada de decodificação especulativa, o que significa que as características de serving são, ao menos em parte, previsíveis a partir do artigo, em vez de observáveis apenas por meio da API.

O que a tabela de benchmark do HY4 Preview realmente é
Os números publicados pela Tencent são fortes, e todos são conduzidos pelo próprio fornecedor. No Terminal-Bench 2.1, o modelo registra 85,4; no DeepSWE, 64,3; e em uma avaliação interna cega com 203 tarefas de engenharia, alcançou média de 2,99 contra 2,92 do GLM-5.3 e 2,94 do Kimi K3 — uma vantagem de sete centésimos de ponto em uma escala de dez pontos, em um estudo concebido pela Tencent. Ele também estreou no ranking da WebDev Arena, onde a Tencent relata que ficou em torno do quinto lugar geral e em terceiro entre os modelos de pesos abertos. O resultado da arena é votado pela multidão, e não pontuado pelo fornecedor, e é a evidência mais independente do conjunto; o resto é uma alegação, e uma alegação ainda vale a pena ser lida desde que seja rotulada como tal.
A lacuna que importa não é que esses números possam ser generosos — harnesses de fornecedores geralmente são, em ambos os sentidos. É que não há uma segunda medição com a qual compará-los. Um modelo com uma página do Artificial Analysis pode ser conferido; um modelo sem uma não pode, e a diferença aparece meses depois, quando alguém descobre que um número de manchete foi medido em um harness que ninguém mais consegue reproduzir. Nada aqui sugere que isso tenha acontecido com o HY4 Preview. Significa apenas que uma decisão de adoção que se apoia no 85,4 está apoiada em uma única fonte.
Na prática, isso significa que o HY4 Preview deve ser avaliado no seu próprio tráfego, e não na tabela, e a estrutura de custos torna isso barato de fazer — a um quarto da tarifa de saída do GPT-6 Sol, uma semana de tráfego sombra com os seus prompts reais custa menos do que uma única revisão de nível da API. Essa é a forma correta de diligência prévia para um modelo pouco medido, e é a forma que quase ninguém realmente faz.
A questão dos pesos abertos, que é a verdadeira linha divisória
HY4 Preview é de código aberto sob a licença Apache 2.0, com uma build FP8 licenciada de forma permissiva ao lado do checkpoint base. O GPT-6 Sol é fechado e não tem arquivo de licença porque não há nada para licenciar. Todo o resto nesta comparação é uma troca; esta é uma diferença de categoria.
O que isso lhe dá não é, sobretudo, uma fatura mais barata — a 2,50 dólares por milhão de tokens de saída, a API alojada já fica abaixo do custo que a maioria das equipas tem para operar um modelo de 770 mil milhões de parâmetros e, se o custo fosse todo o argumento, a licença permissiva seria irrelevante. O que isso lhe dá é uma implementação que não depende do endpoint de ninguém: pesos que não podem ser sujeitos a limitação de taxa, um checkpoint que pode ser quantizado para caber no hardware de que dispõe, um modelo que pode ser afinado e tráfego que pode permanecer dentro do perímetro de uma rede. A resposta do GPT-6 Sol a todas estas quatro questões é que não deveria precisar de nenhuma delas, o que é um argumento válido para um conjunto real de equipas e irrelevante para as equipas que precisam.
A separação por modalidade e a linha da licença apontam para o mesmo lado, o que vale a pena notar. Um modelo que lê apenas texto e é distribuído sob Apache 2.0 foi concebido para ser um componente — algo que você coloca dentro de um pipeline que controla, alimentando-o com texto que você já reconciliou. Um modelo que lê texto, imagens e arquivos e é acessível apenas por uma API foi concebido para ser o ponto de entrada, recebendo diretamente a entrada desorganizada. Esses são trabalhos diferentes, e uma comparação que os classifica em um único índice está respondendo a uma pergunta que nenhum dos fornecedores fez.

I don't see any Portuguese text to translate. Please send the text you'd like me to translate, and I'll return the English version with all markers preserved.
Ambos os modelos estão atrás de uma única chave OrcaRouter com mais de 200 outros, e o formato de roteamento que esse emparelhamento sugere é o inverso do óbvio. Coloque o HY4 Preview em primeiro lugar — ele é o modelo mais barato por um fator de quatro na saída, é o que tem a arquitetura documentada e, em nossas rotas, é o que carrega a carga — e mantenha o GPT-6 Sol atrás dele para as solicitações que precisam ler uma imagem, ou que precisam emitir mais de 64.000 tokens, ou que falham em uma verificação de qualidade. A composição é expressa no DSL de roteamento, e não no código da aplicação, então a fronteira entre os dois é uma regra que você pode editar sem fazer um deploy.
Os números de velocidade merecem uma ressalva e, em seguida, uma conclusão. O HY4 Preview é medido em cerca de 54 tokens de saída por segundo na nossa janela móvel, contra cerca de 244 do GPT-6 Sol, e ambas são observações de infraestrutura compartilhada, e não um benchmark controlado — o número da Tencent, em particular, reflete um modelo com uma contagem de parâmetros ativos muito grande, e 49 bilhões de ativos por token é muita aritmética por token de saída. Portanto, o modelo mais barato é o mais lento, por uma margem ampla, o que é exatamente a troca que um pipeline em lote fica feliz em fazer e um interativo não. A versão hospedada da Tencent também recebeu uma otimização de desempenho em 7 de setembro de 2026 que, segundo o fornecedor, reduz os turnos de raciocínio e o consumo de tokens por tarefa mantendo a mesma qualidade de tarefa — outro número declarado pelo fornecedor, mas que prevê uma fatura menor em vez de um fluxo mais rápido.
O failover é o que torna o emparelhamento seguro em qualquer ordem. Um modelo de pesos abertos com 770 mil milhões de parâmetros é servido por mais de um fornecedor de infraestrutura, e uma rota que consegue recorrer a uma alternativa significa que um host degradado é uma nova tentativa, e não uma indisponibilidade. O nosso catálogo repassa os preços de tabela dos fornecedores sem qualquer acréscimo, o que também significa que não tem de esperar pela tarifa do fornecedor cotada em moeda: a Tencent lista o HY4 Preview a 6 yuan de entrada e 18 yuan de saída por milhão, e o valor em dólares que a nossa página mostra é essa tarifa convertida, não a margem de um revendedor.

Para que serve realmente este par
Escolha o Tencent HY4 Preview para volume, para pipelines somente de texto que você controla, para qualquer coisa que precise rodar no seu próprio hardware e para qualquer carga de trabalho em que uma resposta errada possa ser detectada e tentada novamente — o preço faz de tentar novamente a alavanca de qualidade mais barata que você tem. Escolha o GPT-6 Sol quando a entrada for uma imagem ou um arquivo, quando uma resposta tiver de conter mais de 64.000 tokens, ou quando a resposta for para uma pessoa que vai agir com base nela sem conferir. Escolha os dois se o seu tráfego contiver um pouco de cada, o que quase certamente acontece.
Duas verificações finais. O HY4 Preview ainda está rotulado como preview e continua sendo o modelo mais recente da Tencent em nosso catálogo, então o nome é preciso, e não desatualizado — mas um preview pode mudar debaixo dos seus pés, e um checkpoint com licença permissiva pode ser substituído pela sua própria versão final sem aviso. E o GPT-6 Sol já foi substituído pelo GPT-6.1 Sol com tarifas idênticas para contexto curto, com o input em cache reduzido pela metade, de $0.20 para $0.10, e a própria página do modelo da OpenAI agora aponta os leitores para lá. Se o motivo de você estar considerando o Sol em vez do modelo da Tencent é a integração de oito dias, isso se mantém. Se for capacidade, o sucessor é o que você quer precificar.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
