Um cartão de título hero para 'Tencent Hy-MT2-7B Agora Tem uma API Hospedada' com o subtítulo 'O Que um Tradutor de US$ 0,295 por Milhão de Tokens de Saída Muda', mostrando um ícone de serviço em nuvem, um glifo de tradução, uma linha de conexão de API e um chip de etiqueta de preço rotulado US$ 0,074 / US$ 0,295 por 1M de tokens, com o logotipo da OrcaRouter no canto inferior direito.
Guides & Insights

Tencent Hy-MT2-7B Agora Tem uma API Hospedada: O Que um Tradutor de US$ 0,295 por Milhão de Saída Muda

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Tencent Hy-MT2-7B, o modelo de tradução open-source lançado pela Tencent Hunyuan em 21 de maio de 2026, tornou-se chamável através de uma API hospedada esta semana: por volta de 19 de agosto de 2026, o modelo denso de 7B foi disponibilizado no endpoint hospedado da Tencent Cloud por US$ 0,074 por milhão de tokens de entrada e US$ 0,295 por milhão de tokens de saída, com uma janela de contexto de 8.192 tokens. Ele não chegou sozinho — Tencent Hy-MT2-1.8B e Tencent Hy-MT2-30B-A3B surgiram no mesmo backend em um dia. Os pesos estão no Hugging Face e no ModelScope há três meses; a novidade é que uma equipe agora pode chamar o modelo sem alugar uma GPU, compilar llama.cpp a partir do código-fonte ou distribuir o toolchain de 1,25 bit para dispositivos. Para uma carga de trabalho de tradução, essa é a diferença entre um experimento e uma decisão de produto.

O que acabou de ser lançado

O endpoint comercial é próprio da Tencent Cloud, exposto pela API do fornecedor e por várias plataformas de terceiros. Os três tamanhos rodam em um contexto de 8K com completions de 4.096 tokens; todos os três aceitam saída estruturada por meio de um esquema JSON no campo response_format, e nenhum deles implementa chamada de função. A especificação prática, em uma linha por dimensão:

Tencent Hy-MT2-7B — US$ 0,074 de entrada / US$ 0,295 de saída por 1M de tokens, contexto de 8.192, denso ~7B, saída estruturada suportada, sem chamadas de ferramentas.

Tencent Hy-MT2-1.8B — US$ 0,044 de entrada / US$ 0,177 de saída por 1M de tokens, contexto de 8.192, modelo denso de 1,8B, sem chamadas de ferramentas.

Tencent Hy-MT2-30B-A3B — US$ 0,074 de entrada / US$ 0,295 de saída por 1M de tokens, contexto de 8.192, MoE 30B total / 3B ativos, com suporte a saída estruturada, sem chamadas de ferramentas.

O preço de destaque é a taxa de saída do modelo 7B: menos de três décimos de centavo por mil tokens de saída, para um modelo que a Tencent afirma se equiparar a modelos uma ordem de magnitude maiores. A tradução é uma das poucas cargas de trabalho de LLM em que os tokens de saída representam quase toda a conta, então o preço de saída é o número que determina se um pipeline é viável em escala.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

O modelo por trás do endpoint

Hy-MT2 é a família de "pensamento rápido" da Tencent: em vez de gastar longas cadeias de raciocínio em cada frase, ela foi projetada para reagir como um tradutor profissional — refletindo quando a fonte é ambígua, sendo ágil quando não é. O 7B é o meio-termo equilibrado da família, um modelo denso com licença Apache-2.0, que cobre 33 idiomas, além de cinco pares de línguas minoritárias e dialetos chineses (entre eles tibetano, cazaque, mongol, uigur e cantonês). O que o diferencia de um LLM genérico que faz tradução é a capacidade de seguir instruções: ele mantém um termo de glossário ao longo de um documento, aplica um estilo especificado, deixa delimitadores e chaves JSON intactos e aceita instruções de personalização em linguagem simples. A Tencent disponibilizou o IFMTBench, um benchmark aberto exatamente para essa habilidade, junto com os pesos, e a interface para o consumidor — o miniprograma Tencent Hy Translate, com aplicativos para iOS e Android em desenvolvimento — é construída sobre essa família.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Os números, com o asterisco anexado.

Tudo o que segue é avaliação da própria Tencent, publicada na ficha do modelo e no relatório que a acompanha; nada disso foi reproduzido de forma independente até o momento em que este texto foi escrito. Na trilha de tradução geral XX⇔XX do FLORES-200, o modelo 7B pontua 86,89 no XCOMET-XXL, o que a Tencent estima em aproximadamente 97,9% do Gemini 3.1 Pro (Think). Em seu modo de "pensamento rápido", alega-se que ele supera modelos gerais de código aberto, incluindo DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B e Gemma4-26B-A4B. No WMT25, suas pontuações melhoram em todas as frentes em relação à geração anterior — 63,86/71,21/82,24 contra 61,59/68,85/75,91 do Hy-MT1.5-7B, com o maior ganho no GEMBA — e no DomainMTBench (finanças, política, educação) ele registra 94,92 XCOMET / 92,79 GEMBA. É no seguimento de instruções que ele mais visivelmente se distancia dos modelos de linguagem de tradução de um ano atrás: 89,73 simples / 72,67 complexas / 83,14 total no IFMTBench.

O que uma API hospedada muda em um pipeline de tradução

Hospedar o 7B por conta própria é realmente fácil, no que depender dessas coisas — ele roda em uma única A100 ou RTX 4090, e existem builds quantizados em FP8 e GGUF. Mas "fácil de auto-hospedar" não é "zero operações". O caminho GGUF atualmente depende do llama.cpp com o kernel STK da Tencent, o caminho FP8 precisa da stack certa, e alguém tem que monitorar isso. Um endpoint hospedado elimina tudo isso: sem GPU, sem compilar kernel, sem planejamento de capacidade, e um preço por token fixo independentemente da utilização. Para uma equipe processando milhões de frases traduzidas por dia, essa previsibilidade importa mais do que o benchmark de destaque — e é a razão pela qual esta semana importa mais do que o lançamento de maio.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

A pergunta sobre roteamento que ninguém está fazendo ainda

Como o modelo tem apenas três dias de existência no lado da API, a forma realista de adotá-lo é a mesma com que se adota qualquer provedor recém-lançado: colocá-lo atrás de uma regra de roteamento com failover automático, para que um endpoint não testado jamais derrube um caminho de produção, e deixar que o volume decida se ele merece um lugar permanente. É exatamente esse o padrão que o DSL de roteamento do OrcaRouter compõe entre os mais de 200 modelos que oferecemos — e vale ser preciso aqui: o Tencent Hy-MT2-7B não está no catálogo do OrcaRouter no momento em que escrevo, portanto esta não é uma história de "chame por nosso intermédio". O que está em pauta é o modelo de preços. O OrcaRouter repassa o preço de tabela de cada provedor com margem de 0%, então quando um fornecedor reduz a tarifa, a redução entra em vigor na plataforma no mesmo dia. Para uma carga de trabalho de tradução de alto volume, a pergunta a fazer a qualquer endpoint não é "qual é o preço no portal hoje", mas "qual é o preço de tabela real por token que o provedor cobra, e há algo entre ele e mim?". Com US$ 0,295/M de saída, o Tencent Hy-MT2-7B acabou de tornar essa pergunta interessante.

O que assistir em seguida

Três coisas decorrem desta semana. Primeiro, os modelos irmãos 1.8B e 30B-A3B agora são igualmente acionáveis, portanto, a decisão de "qual tamanho" é uma questão real de API, e não uma decisão de auto-hospedagem (a família tem suas próprias páginas de comparação, mas a versão resumida é: 1.8B para uso no dispositivo e o nível mais barato, 30B-A3B para domínios de nível profissional, 7B no meio). Segundo, a parceria da Tencent no WMT26 oferece prêmios para equipes que usam modelos Hy-MT nas tarefas de Tradução Automática Geral e Tradução de Legendas de Vídeo — um sinal de que a Tencent pretende que esta família seja o padrão aberto de tradução em MT competitiva. Terceiro, os aplicativos iOS e Android com inferência no dispositivo, se forem lançados como anunciado, farão do 1.8B o modelo de tradução aberto mais instalado do mundo. A API hospedada é a parte que mudou esta semana; a trajetória da família foi definida em maio.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube