
Tencent Hy-MT2-7B Agora Tem uma API Hospedada: O Que um Tradutor de US$ 0,295 por Milhão de Saída Muda
- DeepSeekNOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNOVOZ.ai: GLM 5.32026-08-1860Inteligência75Código
- obsidianNOVOQwen3.8 27B2026-08-1552Inteligência68Código
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
Tencent Hy-MT2-7B, o modelo de tradução open-source lançado pela Tencent Hunyuan em 21 de maio de 2026, tornou-se chamável através de uma API hospedada esta semana: por volta de 19 de agosto de 2026, o modelo denso de 7B foi disponibilizado no endpoint hospedado da Tencent Cloud por US$ 0,074 por milhão de tokens de entrada e US$ 0,295 por milhão de tokens de saída, com uma janela de contexto de 8.192 tokens. Ele não chegou sozinho — Tencent Hy-MT2-1.8B e Tencent Hy-MT2-30B-A3B surgiram no mesmo backend em um dia. Os pesos estão no Hugging Face e no ModelScope há três meses; a novidade é que uma equipe agora pode chamar o modelo sem alugar uma GPU, compilar llama.cpp a partir do código-fonte ou distribuir o toolchain de 1,25 bit para dispositivos. Para uma carga de trabalho de tradução, essa é a diferença entre um experimento e uma decisão de produto.
O que acabou de ser lançado
O endpoint comercial é próprio da Tencent Cloud, exposto pela API do fornecedor e por várias plataformas de terceiros. Os três tamanhos rodam em um contexto de 8K com completions de 4.096 tokens; todos os três aceitam saída estruturada por meio de um esquema JSON no campo response_format, e nenhum deles implementa chamada de função. A especificação prática, em uma linha por dimensão:
• Tencent Hy-MT2-7B — US$ 0,074 de entrada / US$ 0,295 de saída por 1M de tokens, contexto de 8.192, denso ~7B, saída estruturada suportada, sem chamadas de ferramentas.
• Tencent Hy-MT2-1.8B — US$ 0,044 de entrada / US$ 0,177 de saída por 1M de tokens, contexto de 8.192, modelo denso de 1,8B, sem chamadas de ferramentas.
• Tencent Hy-MT2-30B-A3B — US$ 0,074 de entrada / US$ 0,295 de saída por 1M de tokens, contexto de 8.192, MoE 30B total / 3B ativos, com suporte a saída estruturada, sem chamadas de ferramentas.
O preço de destaque é a taxa de saída do modelo 7B: menos de três décimos de centavo por mil tokens de saída, para um modelo que a Tencent afirma se equiparar a modelos uma ordem de magnitude maiores. A tradução é uma das poucas cargas de trabalho de LLM em que os tokens de saída representam quase toda a conta, então o preço de saída é o número que determina se um pipeline é viável em escala.

O modelo por trás do endpoint
Hy-MT2 é a família de "pensamento rápido" da Tencent: em vez de gastar longas cadeias de raciocínio em cada frase, ela foi projetada para reagir como um tradutor profissional — refletindo quando a fonte é ambígua, sendo ágil quando não é. O 7B é o meio-termo equilibrado da família, um modelo denso com licença Apache-2.0, que cobre 33 idiomas, além de cinco pares de línguas minoritárias e dialetos chineses (entre eles tibetano, cazaque, mongol, uigur e cantonês). O que o diferencia de um LLM genérico que faz tradução é a capacidade de seguir instruções: ele mantém um termo de glossário ao longo de um documento, aplica um estilo especificado, deixa delimitadores e chaves JSON intactos e aceita instruções de personalização em linguagem simples. A Tencent disponibilizou o IFMTBench, um benchmark aberto exatamente para essa habilidade, junto com os pesos, e a interface para o consumidor — o miniprograma Tencent Hy Translate, com aplicativos para iOS e Android em desenvolvimento — é construída sobre essa família.

Os números, com o asterisco anexado.
Tudo o que segue é avaliação da própria Tencent, publicada na ficha do modelo e no relatório que a acompanha; nada disso foi reproduzido de forma independente até o momento em que este texto foi escrito. Na trilha de tradução geral XX⇔XX do FLORES-200, o modelo 7B pontua 86,89 no XCOMET-XXL, o que a Tencent estima em aproximadamente 97,9% do Gemini 3.1 Pro (Think). Em seu modo de "pensamento rápido", alega-se que ele supera modelos gerais de código aberto, incluindo DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B e Gemma4-26B-A4B. No WMT25, suas pontuações melhoram em todas as frentes em relação à geração anterior — 63,86/71,21/82,24 contra 61,59/68,85/75,91 do Hy-MT1.5-7B, com o maior ganho no GEMBA — e no DomainMTBench (finanças, política, educação) ele registra 94,92 XCOMET / 92,79 GEMBA. É no seguimento de instruções que ele mais visivelmente se distancia dos modelos de linguagem de tradução de um ano atrás: 89,73 simples / 72,67 complexas / 83,14 total no IFMTBench.
O que uma API hospedada muda em um pipeline de tradução
Hospedar o 7B por conta própria é realmente fácil, no que depender dessas coisas — ele roda em uma única A100 ou RTX 4090, e existem builds quantizados em FP8 e GGUF. Mas "fácil de auto-hospedar" não é "zero operações". O caminho GGUF atualmente depende do llama.cpp com o kernel STK da Tencent, o caminho FP8 precisa da stack certa, e alguém tem que monitorar isso. Um endpoint hospedado elimina tudo isso: sem GPU, sem compilar kernel, sem planejamento de capacidade, e um preço por token fixo independentemente da utilização. Para uma equipe processando milhões de frases traduzidas por dia, essa previsibilidade importa mais do que o benchmark de destaque — e é a razão pela qual esta semana importa mais do que o lançamento de maio.

A pergunta sobre roteamento que ninguém está fazendo ainda
Como o modelo tem apenas três dias de existência no lado da API, a forma realista de adotá-lo é a mesma com que se adota qualquer provedor recém-lançado: colocá-lo atrás de uma regra de roteamento com failover automático, para que um endpoint não testado jamais derrube um caminho de produção, e deixar que o volume decida se ele merece um lugar permanente. É exatamente esse o padrão que o DSL de roteamento do OrcaRouter compõe entre os mais de 200 modelos que oferecemos — e vale ser preciso aqui: o Tencent Hy-MT2-7B não está no catálogo do OrcaRouter no momento em que escrevo, portanto esta não é uma história de "chame por nosso intermédio". O que está em pauta é o modelo de preços. O OrcaRouter repassa o preço de tabela de cada provedor com margem de 0%, então quando um fornecedor reduz a tarifa, a redução entra em vigor na plataforma no mesmo dia. Para uma carga de trabalho de tradução de alto volume, a pergunta a fazer a qualquer endpoint não é "qual é o preço no portal hoje", mas "qual é o preço de tabela real por token que o provedor cobra, e há algo entre ele e mim?". Com US$ 0,295/M de saída, o Tencent Hy-MT2-7B acabou de tornar essa pergunta interessante.
O que assistir em seguida
Três coisas decorrem desta semana. Primeiro, os modelos irmãos 1.8B e 30B-A3B agora são igualmente acionáveis, portanto, a decisão de "qual tamanho" é uma questão real de API, e não uma decisão de auto-hospedagem (a família tem suas próprias páginas de comparação, mas a versão resumida é: 1.8B para uso no dispositivo e o nível mais barato, 30B-A3B para domínios de nível profissional, 7B no meio). Segundo, a parceria da Tencent no WMT26 oferece prêmios para equipes que usam modelos Hy-MT nas tarefas de Tradução Automática Geral e Tradução de Legendas de Vídeo — um sinal de que a Tencent pretende que esta família seja o padrão aberto de tradução em MT competitiva. Terceiro, os aplicativos iOS e Android com inferência no dispositivo, se forem lançados como anunciado, farão do 1.8B o modelo de tradução aberto mais instalado do mundo. A API hospedada é a parte que mudou esta semana; a trajetória da família foi definida em maio.
