
Tencent HY-MT2 1.8B Ganha uma API Hospedada: o Tradutor de 440MB da Tencent Vai para a Nuvem
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 426 tok/s
- openaiNOVOOpenAI: GPT-6 Luna2026-09-2237Inteligência
- openaiNOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- anthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- grokNOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens · 183 tok/s
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
Tencent HY-MT2 1.8B, o membro compacto da família de modelos de tradução Hy-MT2 que a Tencent Hunyuan lançou em código aberto em 21 de maio de 2026, agora pode ser chamado por meio de uma API comercial hospedada, em vez de apenas auto-hospedado — a listagem da API do modelo foi publicada em 20 de agosto de 2026, a aproximadamente US$ 0.044 por milhão de tokens de entrada e US$ 0.177 por milhão de tokens de saída. Essa data de listagem importa mais do que normalmente importaria, porque o 1.8B nunca foi apenas mais um checkpoint aberto: é o modelo que a Tencent criou para provar que um modelo de tradução quantizado de 440MB pode rodar inteiramente em um telefone, e nos três meses desde o lançamento de código aberto ele também está sendo distribuído no próprio mini-programa HyTranslate da Tencent e nos aplicativos iOS e Android que se seguiram. Este artigo é sobre o que a mudança do lançamento da API hospedada traz, o que o modelo realmente é e em quais números você deve confiar.
O que realmente mudou em 20 de agosto
Até agora, usar o Tencent HY-MT2 1.8B significava uma de duas coisas: carregar os pesos Apache-2.0 no transformers, vLLM, SGLang ou llama.cpp por conta própria, ou utilizar os produtos de tradução para consumidores da Tencent. A API hospedada é um terceiro caminho — você envia texto via HTTP, e a Tencent Cloud serve o endpoint de 1.8B. O modelo mantém o contexto de 8.192 tokens e o máximo de 4.096 tokens de saída, lida apenas com texto e custa cerca de US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída. Para equipes cujo volume de tradução é irregular, isso remove a exigência de "operar uma GPU" como pré-requisito para experimentar o modelo.

A outra metade da história são os aplicativos. O mini-programa HyTranslate foi lançado em maio junto com a versão de código aberto, com entrada por voz, predefinições de estilo e modo offline. Os aplicativos iOS e Android — que baixam o modelo local para tradução sem conexão — já foram disponibilizados. O modelo de 1,8B é o cavalo de batalha dessa história offline: com a quantização extrema de 1,25 bit da AngelSlim, ele encolhe para cerca de 440 MB de armazenamento e roda localmente em silício de telefones da Apple, Qualcomm e MediaTek, com a Tencent relatando inferência 1,5x mais rápida do que a versão de 4 bits da geração anterior em um Apple A15.
Que diabos é o 1.8B
HY-MT2-1.8B é um LM causal denso, apenas decodificador, construído sobre a arquitetura hunyuan_v1_dense — cerca de 2 bilhões de parâmetros na prática, apesar do nome 1.8B — com um template de chat e sem prompt de sistema padrão. Ele traduz entre 33 idiomas e mais cinco pares de idiomas minoritários e dialetos, incluindo chinês, inglês, japonês, coreano, francês, espanhol, russo, árabe, tailandês, vietnamita, indonésio, hindi, bengali, tâmil e os pares de dialetos tibetano, uigur, cazaque, mongol e cantonês. Diferentemente dos modelos clássicos de tradução codificador-decodificador, ele é ajustado por instruções: você envia um prompt com o idioma de destino e instruções opcionais, e ele pode preservar a estrutura de JSON e HTML, respeitar um glossário, adequar-se a um registro e usar o contexto ao redor para desambiguar. Essa classe de capacidade é a que os modelos irmãos 7B e 30B-A3B compartilham, e foi em conjunto com ela que o benchmark IFMTBench, da Tencent, foi lançado para avaliar.
Onde os benchmarks estão
Vale a pena ler com atenção as alegações de qualidade, porque quase todas são da própria Tencent e não foram reproduzidas por um laboratório independente até o momento desta publicação. A Tencent reporta que o HY-MT2-1.8B atinge 89,9% da pontuação média do Gemini 3.1 Pro no FLORES-200 (o 7B, 97,9%; o 30B-A3B, 98,6%), 96,7% do Gemini em seu conjunto de testes GEMBA-style do mundo real e 96,2% no DomainMTBench em oito domínios profissionais. Parte da cobertura da imprensa arredondou o número do FLORES-200 para baixo, para 88,1%; o README do fornecedor lista 89,9%. A Tencent também afirma que o 1.8B, no geral, supera as APIs comerciais de tradução mais usadas, de fornecedores como Microsoft e Doubao. Ainda não existem reproduções independentes; portanto, trate tudo isso como evidência direcional declarada pelo fornecedor, e não como fato auditado. O que não depende do fornecedor: o conjunto de idiomas 33+5 é fixo, a licença Apache-2.0 é real e um checkpoint quantizado de 440MB que roda em um celular é observável de forma independente.

Como você usaria e quanto custa
• Auto-hospedado — pesos Apache-2.0 do Hugging Face ou ModelScope; execute com transformers (>=5.6.0), vLLM, SGLang ou builds GGUF do llama.cpp. O custo é a sua conta de GPU; a versão de 1,25 bit roda em dispositivos de classe CPU.

• API hospedada — A Tencent Cloud oferece o modelo 1.8B a cerca de US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída no momento em que este texto foi escrito; a própria API do fornecedor e várias plataformas de terceiros o disponibilizam.
• Consumidor — o miniprograma HyTranslate e os aplicativos iOS/Android, incluindo tradução offline por meio do modelo baixado para o dispositivo.
Amostragem recomendada para o 1.8B: temperatura 0.7, top-p 0.6, top-k 20, penalidade de repetição 1.05, máximo de tokens 4096.
Se você está construindo um pipeline de tradução em vez de lançar um aplicativo de consumo, o interessante em um modelo como este é que seu preço é um alvo móvel — a Tencent já reduziu a tarifa da API Hy-MT2-Pro em junho. Esse é exatamente o cenário para o qual existe um roteador com margem de 0%: como o repasse é feito ao preço de tabela do provedor, um corte de preço do fornecedor aparece na fatura do mesmo dia, em vez de depois que seu gateway reajusta os preços. O modelo em si não está na lista da OrcaRouter no momento em que este texto foi escrito, então você mesmo hospedaria os pesos ou chamaria a API da Tencent Cloud diretamente; o argumento do failover e da chave única se aplica ao stack de tradução mais amplo que você construiria em torno dele, onde misturar um modelo pequeno no dispositivo para tráfego em massa barato com um modelo maior para pares difíceis é o tipo de composição que o roteamento foi criado para expressar.
A conclusão
O Tencent HY-MT2 1.8B já era interessante em maio como um tradutor Apache-2.0 do tamanho de um telefone; a listagem de API hospedada de 20 de agosto faz dele um candidato para equipes que querem avaliá-lo sem montar infraestrutura. Os números de qualidade são informados pelo fornecedor, o conjunto de idiomas é deliberadamente mainstream em vez de máximo, e o footprint no dispositivo é o que há de genuinamente distinto nele. Se os seus pares estiverem entre os 33 dele, agora está mais barato do que nunca descobrir se as alegações se confirmam para o seu conteúdo.
