
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B: O Ponto Ideal Denso ou o Carro-Chefe MoE pelo Mesmo Preço
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Aqui está a surpresa no centro deste confronto: {{1}}Tencent Hy-MT2-7B{{/1}}, um modelo denso de 7B, e {{2}}Tencent Hy-MT2-30B-A3B{{/2}}, o carro-chefe de mistura de especialistas com 30 bilhões de parâmetros no total e aproximadamente 3 bilhões ativos, ambos se tornaram acessíveis por meio de APIs hospedadas nesta semana — o 7B por volta de 19 de agosto de 2026, o 30B-A3B um dia depois, ambos fornecidos pela Tencent Cloud — pelo mesmo preço exato: {{3}}$0.074 por milhão de tokens de entrada e $0.295 por milhão de saída{{/3}}. A família foi lançada como código aberto em conjunto em {{4}}21 de maio de 2026{{/4}}, então nenhum dos modelos é novo; o preço idêntico da API é o que torna essa comparação genuinamente estranha. Normalmente, o modelo maior custa mais e você pondera o custo adicional em relação ao ganho. Aqui, o carro-chefe não custa nada extra por token, e a decisão se resume a uma única pergunta: o que, se é que algo, o 7B perde por ser denso e pequeno?
A surpresa do mesmo preço
A paridade de preço do 30B-A3B é a barganha do MoE cumprindo seu papel. Sua arquitetura armazena 30B de conhecimento, mas ativa apenas cerca de 3B por token, então a Tencent Cloud pode servi-lo pela mesma taxa por token que o 7B — mesmos $0.074 / $0.295, mesmo contexto de 8.192 tokens, mesmo suporte a saída estruturada, mesma limitação de não suportar chamada de funções. Na API, o modelo "profissional" não é mais caro. A desvantagem muda de lugar: para o uso de memória, a complexidade de servir e a latência, onde o design mais denso e simples do 7B tem vantagens estruturais que um preço por token não consegue expressar.
Especificações, lado a lado
• Arquitetura — dense ~7B vs MoE 30B total / ~3B ativos.
• Preço da API — $0.074 / $0.295 vs $0.074 / $0.295 por 1M tokens (idêntico).
• Contexto — ambos 8.192 tokens.
• Posicionamento — ponto de equilíbrio ideal versus carro-chefe de nível profissional.
• FLORES-200 — 7B: 86,89 no XCOMET-XXL, ≈97,9% do Gemini 3.1 Pro (Think); 30B-A3B: a melhor pontuação de tradução geral da família (números informados pelo fornecedor).
• Comparação entre DeepSeek e Kimi — ambos superam o DeepSeek-V4-Pro e o Kimi K2.6 em modo de pensamento rápido, segundo o fornecedor.
• Pegada — uma única A100 / RTX 4090 vs pesos na escala de 30B (um build quantizado de classe 18GB em disco e mais em VRAM).
• Padrões de inferência — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

Onde o 30B-A3B realmente vence
A Tencent posiciona o 30B-A3B como o membro de nível profissional da família, e as evidências que publica respaldam esse rótulo para um tipo específico de texto. Em material com alta densidade de domínio — cláusulas jurídicas, texto médico, documentação técnica — sua linha GEMBA no DomainMTBench é a mais forte da família, relatada em cerca de 99% da linha de base do Gemini 2.5 Pro, e sua pontuação de tradução geral supera a do 7B na curva FLORES da própria família. Esses 27B adormecidos de conhecimento extra são exatamente o tipo de capacidade que se manifesta quando uma frase carrega terminologia densa em vez de prosa comum: uma cláusula contratual de "indenização sobrevive à rescisão" não sobrecarrega muito um modelo de 7B, mas um documento completo de M&A com um glossário sobrecarrega. O 30B-A3B também é a aposta mais segura para pares de chinês para línguas minoritárias (tibetano, uigur, mongol), onde a Tencent relata seus melhores números.
Onde o 7B vence de qualquer forma
As vantagens do 7B são operacionais e reais. Primeiro, auto-hospedagem: o 7B cabe em uma única A100 ou RTX 4090 e tem a maior cobertura de frameworks — Transformers, vLLM, SGLang e llama.cpp via GGUF são todos exercitados. O 30B-A3B, mesmo quantizado, exige VRAM de escala de data center e poucas pessoas o colocaram em pilhas de serving de produção. Segundo, latência e simplicidade de serving: um 7B denso é mais fácil de manter aquecido, e sua amostragem recomendada é mais próxima de um decode padrão. Terceiro, na API, o preço idêntico significa que o 7B custa exatamente o mesmo por token que o principal — então a única razão para escolher o modelo menor é que, para texto geral limpo, a diferença de qualidade é fina demais para ser notada. O 7B já é aproximadamente 97,9% do Gemini 3.1 Pro (Think) no FLORES-200; os pontos extras do principal estão no topo de uma curva onde cada um é mais difícil de ver na prática.
A lacuna, medida com honestidade
Tudo nas duas últimas seções é avaliação da própria Tencent, e a leitura honesta é que os dois modelos são próximos o suficiente em tradução comum para que seu corpus decida. Em texto limpo geral, os ~97,9% do Gemini alcançados pelo 7B significam que a margem do modelo principal é medida em pequenas frações de XCOMET — reais em um ranking, difíceis de sentir em um ticket de suporte. Em texto denso de domínio e pares de línguas minoritárias, as vantagens relatadas de GEMBA e FLORES do modelo principal são exatamente onde um tradutor profissional (humano ou modelo) mostra seu valor, e onde uma retradução é mais cara. Não há benchmark independente para nenhum dos dois modelos no momento em que este texto é escrito; a única coisa em que ambas as fichas técnicas dos fornecedores concordam é que cada tamanho vence o DeepSeek-V4-Pro e o Kimi K2.6 no modo de raciocínio rápido da família.

Roteando a família
Nenhum dos dois modelos está no catálogo do OrcaRouter no momento em que este texto foi escrito; portanto, ambos são servidos por meio da nuvem própria da Tencent e de várias plataformas de terceiros. A lição de roteamento continua sendo a mais prática. Como os preços da API são idênticos, este é um caso clássico de roteamento de carga de trabalho em vez de uma escolha única: envie a fatia de tradução geral de alto volume para o modelo 7B e a fatia densa e com forte domínio para o 30B-A3B, com failover automático para que um pico de latência no endpoint MoE nunca interrompa o pipeline. Esse é o padrão que o DSL de roteamento do OrcaRouter compõe entre os mais de 200 modelos que carregamos — despacho ponderado por custo, preço de tabela do provedor repassado com margem de 0% — e ele se encaixa melhor nessa família do que na maioria, porque o fornecedor precificou os dois níveis para tornar a divisão economicamente neutra.
O veredito
Com preços de API idênticos, a resposta padrão é a 7B: mesmo custo por token, mais simples de auto-hospedar e quase empata em texto geral. Opte pela 30B-A3B quando o corpus for profissionalmente denso — tradução jurídica, médica, técnica ou para idiomas minoritários — onde a vantagem de domínio reportada do carro-chefe justifica a maior pegada e a latência. E se sua carga de trabalho for uma mistura de ambos, não escolha: roteie a parte geral para a 7B e a parte difícil para o carro-chefe. Isso não é um meio-termo entre os dois; é a única maneira de obter ambos pelo preço que a Tencent definiu.

Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
