
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: A escolha de qualidade no servidor ou um tradutor de 440MB em todos os celulares
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Os modelos Tencent Hy-MT2-7B e Tencent Hy-MT2-1.8B são os dois extremos da mesma família, lançados como código aberto juntos em 21 de maio de 2026, e ambos se tornaram utilizáveis por meio de APIs hospedadas nesta semana — o 7B por volta de 19 de agosto e o 1.8B um dia depois, cada um servido pela Tencent Cloud. Eles não são concorrentes no sentido usual, porque mal se sobrepõem em suas finalidades. O 7B é a opção de qualidade: um modelo denso que roda em uma única GPU ou em uma API a US$ 0,074 por milhão de tokens de entrada e US$ 0,295 por milhão de tokens de saída. O 1.8B é a opção para dispositivos: um modelo quantizado para 440 megabytes que roda em um telefone, totalmente offline, a US$ 0,044 / US$ 0,177 por milhão no nível de API. Se você está escolhendo entre eles, a resposta é determinada principalmente por onde a tradução precisa acontecer — e apenas secundariamente pelos benchmarks, que são muito mais próximos do que a diferença de quatro vezes na quantidade de parâmetros sugere.
A resposta de uma linha.
Escolha o 7B quando a tradução acontece em um data center e você quer a melhor qualidade por dólar de servidor — em uma API ou em uma única GPU classe A100. Escolha o 1.8B quando a tradução precisa acontecer em um dispositivo, offline, ou ao menor custo possível por token. Se ambos estão na mesma nuvem e o orçamento não é o fator decisivo, o 7B vence em qualidade. Se o conteúdo é confidencial, regulamentado ou precisa funcionar sem rede, o 1.8B é o único dos dois que consegue.
Especificações, lado a lado
• Parâmetros — 7B denso vs 1.8B denso.
• Pegada quantizada — FP8 e GGUF reduzidos a alguns GB vs 440MB via quantização de 1,25 bit da AngelSlim.
• FLORES-200 (XX⇔XX) — 86,89 vs 79,77 XCOMET-XXL, aproximadamente 97,9% vs 89,9% do Gemini 3.1 Pro (Think), segundo o fornecedor.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B supera as APIs comerciais da Microsoft e da Doubao em todas as três métricas.
• DomainMTBench (GEMBA) — 92.79 vs 91.08, relatado pelo fornecedor.
• Preço da API — $0.074 / $0.295 vs $0.044 / $0.177 por 1M de tokens (entrada/saída).
• Contexto — ambos 8.192 tokens.
• Implantação — uma A100 / RTX 4090 ou API na nuvem vs chips no dispositivo da Apple, Qualcomm e MediaTek, offline.

A lacuna de qualidade é real, mas mais estreita do que a lacuna de tamanho.
Tudo o que se segue é avaliação da própria Tencent, sem reprodução independente. No FLORES-200, o 7B fica oito pontos à frente do 1.8B no XCOMET (86,89 contra 79,77), a lacuna em que se baseia o posicionamento "equilibrado" versus "no dispositivo". Mas no DomainMTBench — o benchmark de tradução por domínio que cobre finanças, política e educação — o 1.8B fica a apenas 1,7 pontos GEMBA do 7B (91,08 contra 92,79). E a posição do 1.8B perante o mundo é o detalhe que segue surpreendendo a todos: a Tencent informa que ele supera as APIs comerciais de tradução da Microsoft e da Doubao em todas as três métricas do WMT25, e supera o Tower-Plus-72B, um modelo quarenta vezes maior. Portanto, em textos comuns de domínio, o modelo pequeno fica muito mais próximo do irmão maior do que quatro parâmetros sugeririam. A vantagem real do 7B aparece na cauda da tradução geral e em instruções difíceis, onde sua liderança no FLORES e suas pontuações mais altas em tarefas complexas no IFMTBench criam uma distância clara entre os dois.
O fork de implantação
{{1}}O 7B precisa de infraestrutura — seja uma API de nuvem ou uma única GPU classe A100, com as operações habituais associadas.{{/1}} {{2}}O 1.8B, com 440MB e a quantização de 1.25-bit da AngelSlim, roda nos mesmos chips que um aplicativo de telefone típico, é 1.5× mais rápido que a geração anterior Hy-MT1.5 e não precisa de rede alguma.{{/2}} {{3}}Isso transforma a privacidade de um recurso em um padrão: para contratos, registros médicos ou qualquer coisa regulamentada, os dados nunca saem do dispositivo, uma propriedade que nenhum preço por token pode comprar no lado do servidor.{{/3}} {{4}}O trade-off é visível na tradução geral estilo FLORES, onde a capacidade extra do 7B aparece — e em qualquer instrução complexa o suficiente para forçar o total de 83.14 IFMTBench do 1.8B contra o teto mais alto do 7B.{{/4}}

A matemática dos custos
No nível da API, ambos os modelos são baratos; o 1.8B é mais barato. A US$ 0,044 / US$ 0,177 contra US$ 0,074 / US$ 0,295 por milhão, o modelo pequeno fica cerca de 40% abaixo do 7B nos dois lados da conta — com um milhão de tokens de saída por dia, são aproximadamente US$ 70 por dia contra US$ 118. No dispositivo, o 1.8B custa zero por token, o número que domina qualquer comparação com servidores em volume. O contra-argumento do 7B não é o preço, mas a margem de manobra: se o seu corpus tende ao técnico, jurídico ou com forte carga de instruções, a margem de qualidade do 7B é exatamente o tipo de coisa que aparece como menos retraduções — e retraduções são o custo unitário real em MT profissional.

Roteamento dos dois tamanhos
Nenhum dos dois modelos está no catálogo da OrcaRouter no momento em que escrevo, então a leitura honesta é que ambos são servidos por meio da nuvem própria da Tencent e de várias plataformas de terceiros. O confronto ainda ensina a lição de roteamento em torno da qual este blog é construído: quando dois modelos se sobrepõem em capacidade, mas diferem em preço e latência, a implantação racional não é "escolher um", mas "rotear por carga de trabalho" — a fatia de alto volume e baixa dificuldade para o modelo pequeno e barato, a fatia difícil para o modelo de qualidade, com failover automático para que uma interrupção em qualquer um deles nunca paralise o pipeline. Esse é precisamente o padrão que o DSL de roteamento da OrcaRouter compõe entre os mais de 200 modelos que oferecemos, com o preço de tabela de cada provedor repassado com margem de 0%. Se a família de tradução da Tencent entrar no catálogo, é a próxima inquilina natural.
O veredito
Se a tradução acontece no seu data center, escolha o Tencent Hy-MT2-7B — pela API se você quiser zero operações, em uma única GPU se quiser ter o controle — e pare de ler. Se a tradução precisa acontecer em um dispositivo, offline ou sob um requisito de confidencialidade, escolha o Tencent Hy-MT2-1.8B e o tamanho de 440MB vence por definição. O único caso realmente difícil é uma carga de trabalho em nuvem de volume médio, onde a qualidade do 7B e o preço do 1.8B são ambos defensáveis. Nesse caso, não decida com base em benchmarks do fornecedor: a diferença GEMBA relatada é de menos de dois pontos, então execute ambos no seu próprio texto de domínio e deixe os seus dados escolherem.
