Um cartão de título principal para '{{1}}Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B{{/1}}' com o subtítulo '{{2}}O Ponto Ideal Denso ou o Flagship MoE pelo Mesmo Preço{{/2}}', mostrando dois ícones de pilha de modelos com um sinal de igual entre eles e dois chips de etiqueta de preço idênticos rotulados {{3}}$0.074 / $0.295{{/3}}, com o logotipo da {{4}}OrcaRouter{{/4}} no canto inferior direito.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: O Ponto Ideal Denso ou o Carro-Chefe MoE pelo Mesmo Preço

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Aqui está a surpresa no centro deste confronto: {{1}}Tencent Hy-MT2-7B{{/1}}, um modelo denso de 7B, e {{2}}Tencent Hy-MT2-30B-A3B{{/2}}, o carro-chefe de mistura de especialistas com 30 bilhões de parâmetros no total e aproximadamente 3 bilhões ativos, ambos se tornaram acessíveis por meio de APIs hospedadas nesta semana — o 7B por volta de 19 de agosto de 2026, o 30B-A3B um dia depois, ambos fornecidos pela Tencent Cloud — pelo mesmo preço exato: {{3}}$0.074 por milhão de tokens de entrada e $0.295 por milhão de saída{{/3}}. A família foi lançada como código aberto em conjunto em {{4}}21 de maio de 2026{{/4}}, então nenhum dos modelos é novo; o preço idêntico da API é o que torna essa comparação genuinamente estranha. Normalmente, o modelo maior custa mais e você pondera o custo adicional em relação ao ganho. Aqui, o carro-chefe não custa nada extra por token, e a decisão se resume a uma única pergunta: o que, se é que algo, o 7B perde por ser denso e pequeno?

A surpresa do mesmo preço

A paridade de preço do 30B-A3B é a barganha do MoE cumprindo seu papel. Sua arquitetura armazena 30B de conhecimento, mas ativa apenas cerca de 3B por token, então a Tencent Cloud pode servi-lo pela mesma taxa por token que o 7B — mesmos $0.074 / $0.295, mesmo contexto de 8.192 tokens, mesmo suporte a saída estruturada, mesma limitação de não suportar chamada de funções. Na API, o modelo "profissional" não é mais caro. A desvantagem muda de lugar: para o uso de memória, a complexidade de servir e a latência, onde o design mais denso e simples do 7B tem vantagens estruturais que um preço por token não consegue expressar.

Especificações, lado a lado

Arquitetura — dense ~7B vs MoE 30B total / ~3B ativos.

Preço da API — $0.074 / $0.295 vs $0.074 / $0.295 por 1M tokens (idêntico).

Contexto — ambos 8.192 tokens.

Posicionamento — ponto de equilíbrio ideal versus carro-chefe de nível profissional.

FLORES-200 — 7B: 86,89 no XCOMET-XXL, ≈97,9% do Gemini 3.1 Pro (Think); 30B-A3B: a melhor pontuação de tradução geral da família (números informados pelo fornecedor).

Comparação entre Deep​Seek e K​imi — ambos superam o DeepSeek-V4-Pro e o Kimi K2.6 em modo de pensamento rápido, segundo o fornecedor.

Pegada — uma única A100 / RTX 4090 vs pesos na escala de 30B (um build quantizado de classe 18GB em disco e mais em VRAM).

Padrões de inferência — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B — the scoreboard'. Left column Hy-MT2-7B: Architecture dense 7B; API price $0.074 / $0.295; FLORES-200 86.89; Context 8,192; Footprint single GPU; Role balanced sweet spot. Right column Hy-MT2-30B-A3B: Architecture MoE 30B / 3B active; API price $0.074 / $0.295; FLORES-200 tops the family; Context 8,192; Footprint data-center VRAM; Role professional-grade. Footer: Prices identical as listed Aug 2026; figures vendor-reported.

Onde o 30B-A3B realmente vence

A Tencent posiciona o 30B-A3B como o membro de nível profissional da família, e as evidências que publica respaldam esse rótulo para um tipo específico de texto. Em material com alta densidade de domínio — cláusulas jurídicas, texto médico, documentação técnica — sua linha GEMBA no DomainMTBench é a mais forte da família, relatada em cerca de 99% da linha de base do Gemini 2.5 Pro, e sua pontuação de tradução geral supera a do 7B na curva FLORES da própria família. Esses 27B adormecidos de conhecimento extra são exatamente o tipo de capacidade que se manifesta quando uma frase carrega terminologia densa em vez de prosa comum: uma cláusula contratual de "indenização sobrevive à rescisão" não sobrecarrega muito um modelo de 7B, mas um documento completo de M&A com um glossário sobrecarrega. O 30B-A3B também é a aposta mais segura para pares de chinês para línguas minoritárias (tibetano, uigur, mongol), onde a Tencent relata seus melhores números.

Onde o 7B vence de qualquer forma

As vantagens do 7B são operacionais e reais. Primeiro, auto-hospedagem: o 7B cabe em uma única A100 ou RTX 4090 e tem a maior cobertura de frameworks — Transformers, vLLM, SGLang e llama.cpp via GGUF são todos exercitados. O 30B-A3B, mesmo quantizado, exige VRAM de escala de data center e poucas pessoas o colocaram em pilhas de serving de produção. Segundo, latência e simplicidade de serving: um 7B denso é mais fácil de manter aquecido, e sua amostragem recomendada é mais próxima de um decode padrão. Terceiro, na API, o preço idêntico significa que o 7B custa exatamente o mesmo por token que o principal — então a única razão para escolher o modelo menor é que, para texto geral limpo, a diferença de qualidade é fina demais para ser notada. O 7B já é aproximadamente 97,9% do Gemini 3.1 Pro (Think) no FLORES-200; os pontos extras do principal estão no topo de uma curva onde cada um é mais difícil de ver na prática.

A lacuna, medida com honestidade

Tudo nas duas últimas seções é avaliação da própria Tencent, e a leitura honesta é que os dois modelos são próximos o suficiente em tradução comum para que seu corpus decida. Em texto limpo geral, os ~97,9% do Gemini alcançados pelo 7B significam que a margem do modelo principal é medida em pequenas frações de XCOMET — reais em um ranking, difíceis de sentir em um ticket de suporte. Em texto denso de domínio e pares de línguas minoritárias, as vantagens relatadas de GEMBA e FLORES do modelo principal são exatamente onde um tradutor profissional (humano ou modelo) mostra seu valor, e onde uma retradução é mais cara. Não há benchmark independente para nenhum dos dois modelos no momento em que este texto é escrito; a única coisa em que ambas as fichas técnicas dos fornecedores concordam é que cada tamanho vence o DeepSeek-V4-Pro e o Kimi K2.6 no modo de raciocínio rápido da família.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-30B-A3B (captured August 23 2026) showing the MoE architecture (30B total / 3B active), Apache-2.0 license, and the professional-grade positioning.

Roteando a família

Nenhum dos dois modelos está no catálogo do OrcaRouter no momento em que este texto foi escrito; portanto, ambos são servidos por meio da nuvem própria da Tencent e de várias plataformas de terceiros. A lição de roteamento continua sendo a mais prática. Como os preços da API são idênticos, este é um caso clássico de roteamento de carga de trabalho em vez de uma escolha única: envie a fatia de tradução geral de alto volume para o modelo 7B e a fatia densa e com forte domínio para o 30B-A3B, com failover automático para que um pico de latência no endpoint MoE nunca interrompa o pipeline. Esse é o padrão que o DSL de roteamento do OrcaRouter compõe entre os mais de 200 modelos que carregamos — despacho ponderado por custo, preço de tabela do provedor repassado com margem de 0% — e ele se encaixa melhor nessa família do que na maioria, porque o fornecedor precificou os dois níveis para tornar a divisão economicamente neutra.

O veredito

Com preços de API idênticos, a resposta padrão é a 7B: mesmo custo por token, mais simples de auto-hospedar e quase empata em texto geral. Opte pela 30B-A3B quando o corpus for profissionalmente denso — tradução jurídica, médica, técnica ou para idiomas minoritários — onde a vantagem de domínio reportada do carro-chefe justifica a maior pegada e a latência. E se sua carga de trabalho for uma mistura de ambos, não escolha: roteie a parte geral para a 7B e a parte difícil para o carro-chefe. Isso não é um meio-termo entre os dois; é a única maneira de obter ambos pelo preço que a Tencent definiu.

A generated infographic titled 'Same price, different model' with two identical cards both labelled '$0.074 / $0.295 per 1M tokens': one 'Dense 7B — simpler to serve, near-flagship on clean text', the other 'MoE 30B-A3B — 30B knowledge, 3B active, professional domains', with the footer 'The MoE bargain: bigger model, same per-token cost.'

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube