Um cartão de título hero com o título 'Tencent HY-MT2 1.8B ganha uma API hospedada', subtítulo 'O tradutor de 440MB da Tencent vai para a nuvem', mostrando um smartphone com um glifo de idioma, uma nuvem entregando um chip compacto de 440MB, um globo com 33 pontos, um selo de data com os dizeres 'Código aberto em 21 de maio de 2026 · API hospedada em 20 de agosto de 2026' e o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Tencent HY-MT2 1.8B Ganha uma API Hospedada: o Tradutor de 440MB da Tencent Vai para a Nuvem

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent HY-MT2 1.8B, o membro compacto da família de modelos de tradução Hy-MT2 que a Tencent Hunyuan lançou em código aberto em 21 de maio de 2026, agora pode ser chamado por meio de uma API comercial hospedada, em vez de apenas auto-hospedado — a listagem da API do modelo foi publicada em 20 de agosto de 2026, a aproximadamente US$ 0.044 por milhão de tokens de entrada e US$ 0.177 por milhão de tokens de saída. Essa data de listagem importa mais do que normalmente importaria, porque o 1.8B nunca foi apenas mais um checkpoint aberto: é o modelo que a Tencent criou para provar que um modelo de tradução quantizado de 440MB pode rodar inteiramente em um telefone, e nos três meses desde o lançamento de código aberto ele também está sendo distribuído no próprio mini-programa HyTranslate da Tencent e nos aplicativos iOS e Android que se seguiram. Este artigo é sobre o que a mudança do lançamento da API hospedada traz, o que o modelo realmente é e em quais números você deve confiar.

O que realmente mudou em 20 de agosto

Até agora, usar o Tencent HY-MT2 1.8B significava uma de duas coisas: carregar os pesos Apache-2.0 no transformers, vLLM, SGLang ou llama.cpp por conta própria, ou utilizar os produtos de tradução para consumidores da Tencent. A API hospedada é um terceiro caminho — você envia texto via HTTP, e a Tencent Cloud serve o endpoint de 1.8B. O modelo mantém o contexto de 8.192 tokens e o máximo de 4.096 tokens de saída, lida apenas com texto e custa cerca de US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída. Para equipes cujo volume de tradução é irregular, isso remove a exigência de "operar uma GPU" como pré-requisito para experimentar o modelo.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2: High-Performance Multilingual Translation Model (captured Aug 20, 2026), showing the English page header with the Tencent Cloud nav, the title 'Hy-MT2: High-Performance Multilingual Translation Model for Real Use', and the table of contents starting with the model name.

A outra metade da história são os aplicativos. O mini-programa HyTranslate foi lançado em maio junto com a versão de código aberto, com entrada por voz, predefinições de estilo e modo offline. Os aplicativos iOS e Android — que baixam o modelo local para tradução sem conexão — já foram disponibilizados. O modelo de 1,8B é o cavalo de batalha dessa história offline: com a quantização extrema de 1,25 bit da AngelSlim, ele encolhe para cerca de 440 MB de armazenamento e roda localmente em silício de telefones da Apple, Qualcomm e MediaTek, com a Tencent relatando inferência 1,5x mais rápida do que a versão de 4 bits da geração anterior em um Apple A15.

Que diabos é o 1.8B

HY-MT2-1.8B é um LM causal denso, apenas decodificador, construído sobre a arquitetura hunyuan_v1_dense — cerca de 2 bilhões de parâmetros na prática, apesar do nome 1.8B — com um template de chat e sem prompt de sistema padrão. Ele traduz entre 33 idiomas e mais cinco pares de idiomas minoritários e dialetos, incluindo chinês, inglês, japonês, coreano, francês, espanhol, russo, árabe, tailandês, vietnamita, indonésio, hindi, bengali, tâmil e os pares de dialetos tibetano, uigur, cazaque, mongol e cantonês. Diferentemente dos modelos clássicos de tradução codificador-decodificador, ele é ajustado por instruções: você envia um prompt com o idioma de destino e instruções opcionais, e ele pode preservar a estrutura de JSON e HTML, respeitar um glossário, adequar-se a um registro e usar o contexto ao redor para desambiguar. Essa classe de capacidade é a que os modelos irmãos 7B e 30B-A3B compartilham, e foi em conjunto com ela que o benchmark IFMTBench, da Tencent, foi lançado para avaliar.

Onde os benchmarks estão

Vale a pena ler com atenção as alegações de qualidade, porque quase todas são da própria Tencent e não foram reproduzidas por um laboratório independente até o momento desta publicação. A Tencent reporta que o HY-MT2-1.8B atinge 89,9% da pontuação média do Ge​mini 3.1 Pro no FLORES-200 (o 7B, 97,9%; o 30B-A3B, 98,6%), 96,7% do Ge​mini em seu conjunto de testes GEMBA-style do mundo real e 96,2% no DomainMTBench em oito domínios profissionais. Parte da cobertura da imprensa arredondou o número do FLORES-200 para baixo, para 88,1%; o README do fornecedor lista 89,9%. A Tencent também afirma que o 1.8B, no geral, supera as APIs comerciais de tradução mais usadas, de fornecedores como Microsoft e Doubao. Ainda não existem reproduções independentes; portanto, trate tudo isso como evidência direcional declarada pelo fornecedor, e não como fato auditado. O que não depende do fornecedor: o conjunto de idiomas 33+5 é fixo, a licença Apache-2.0 é real e um checkpoint quantizado de 440MB que roda em um celular é observável de forma independente.

A single-column spec scoreboard for Tencent HY-MT2 1.8B reading: Params: ~2B dense decoder-only; Languages: 33 + 5 dialect pairs; Released: May 21, 2026 · Apache-2.0; FLORES-200: 89.9% of Gemini 3.1 Pro; On-device: 440MB at 1.25-bit; API: ~$0.044 / $0.177 per 1M tokens; footer 'Benchmark figures vendor-reported; no independent scores yet.'

Como você usaria e quanto custa

• Auto-hospedado — pesos Apache-2.0 do Hugging Face ou ModelScope; execute com transformers (>=5.6.0), vLLM, SGLang ou builds GGUF do llama.cpp. O custo é a sua conta de GPU; a versão de 1,25 bit roda em dispositivos de classe CPU.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured Aug 20, 2026) showing the model header, the Tencent attribution, the Translation / Transformers / Safetensors tags, a 36-languages tag, the hunyuan_v1_dense architecture label, the arxiv 2605.22064 link, the apache-2.0 license, and the 2B-params model size.

• API hospedada — A Tencent Cloud oferece o modelo 1.8B a cerca de US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída no momento em que este texto foi escrito; a própria API do fornecedor e várias plataformas de terceiros o disponibilizam.

• Consumidor — o miniprograma HyTranslate e os aplicativos iOS/Android, incluindo tradução offline por meio do modelo baixado para o dispositivo.

Amostragem recomendada para o 1.8B: temperatura 0.7, top-p 0.6, top-k 20, penalidade de repetição 1.05, máximo de tokens 4096.

Se você está construindo um pipeline de tradução em vez de lançar um aplicativo de consumo, o interessante em um modelo como este é que seu preço é um alvo móvel — a Tencent já reduziu a tarifa da API Hy-MT2-Pro em junho. Esse é exatamente o cenário para o qual existe um roteador com margem de 0%: como o repasse é feito ao preço de tabela do provedor, um corte de preço do fornecedor aparece na fatura do mesmo dia, em vez de depois que seu gateway reajusta os preços. O modelo em si não está na lista da OrcaRouter no momento em que este texto foi escrito, então você mesmo hospedaria os pesos ou chamaria a API da Tencent Cloud diretamente; o argumento do failover e da chave única se aplica ao stack de tradução mais amplo que você construiria em torno dele, onde misturar um modelo pequeno no dispositivo para tráfego em massa barato com um modelo maior para pares difíceis é o tipo de composição que o roteamento foi criado para expressar.

A conclusão

O Tencent HY-MT2 1.8B já era interessante em maio como um tradutor Apache-2.0 do tamanho de um telefone; a listagem de API hospedada de 20 de agosto faz dele um candidato para equipes que querem avaliá-lo sem montar infraestrutura. Os números de qualidade são informados pelo fornecedor, o conjunto de idiomas é deliberadamente mainstream em vez de máximo, e o footprint no dispositivo é o que há de genuinamente distinto nele. Se os seus pares estiverem entre os 33 dele, agora está mais barato do que nunca descobrir se as alegações se confirmam para o seu conteúdo.