Cartão de destaque com o título "North Small Translate 1.0 vs Hy-MT2" e o subtítulo "Dois tradutores MoE, uma lacuna de evidências", acima de dois cartões: North Small Translate 1.0 (218B MoE / 25B ativos, um dado não nomeado do WMT26) e Hy-MT2-30B-A3B (30B MoE / 3B ativos, artigo, benchmark, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2: Dois tradutores MoE, uma lacuna de evidências

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Ambas essas famílias foram construídas com a mesma aposta — a de que uma rede esparsa de mistura de especialistas pós-treinada para tradução supera um modelo de uso geral ao qual se pede que traduza — e chegaram a ela por direções opostas. Hy-MT2, a família de tradução de três modelos da Tencent Hunyuan, encabeçada pelo Hy-MT2-30B-A3B MoE, foi disponibilizada como código aberto em 21 de maio de 2026 sob Apache 2.0, com um relatório técnico, um benchmark de código aberto e uma tabela de comparação completa. North Small Translate 1.0, o tradutor MoE de 218 bilhões de parâmetros e 25 bilhões ativos da Cohere, foi documentado em uma nota de versão datada de 9 de setembro de 2026, e sua evidência de qualidade resume-se a um único número sem nenhuma métrica associada a ele. As arquiteturas rimam. A documentação não, e essa diferença é a coisa mais útil de entender antes de escolher qualquer uma delas.

Uma família, três tamanhos contra um modelo grande

O Hy-MT2 não é um único modelo, mas sim uma família: um modelo denso de 1,8B para execução no dispositivo, um modelo denso de 7B para uma única GPU e o MoE 30B-A3B como carro-chefe, com três bilhões de parâmetros ativos por token. Todos os três são Apache 2.0, sem restrições de acesso, e foram lançados juntos com quantizações FP8, GGUF, de 2 bits e 1,25 bit, além do benchmark IFMTBench de seguimento de instruções e um artigo complementar. A Tencent informa que a família traduz entre 33 idiomas, além de cinco línguas e dialetos minoritários.

North Small Translate 1.0 é um único ponto no espaço de tamanhos, e um ponto grande: 218B de parâmetros totais, 25B ativos, 128 especialistas com oito ativados por token mais especialistas compartilhados, e atenção alternando numa proporção de 3:1 entre camadas de janela deslizante (janela de 4.096, RoPE) e camadas globais sem embeddings posicionais. Sua janela é de 16K de entrada e 16K de saída em inglês mais 49 outros idiomas, com árabe moderno padrão, alemão, francês, japonês, coreano, russo e ucraniano designados como tier one. Notavelmente, o formato não é novo — o Command A+ da Cohere, de maio de 2026, usava a mesma configuração 218B/25B — o que faz disto um pós-treino especializado em tradução de um núcleo existente, em vez de uma nova arquitetura.

Parâmetros — North Small Translate 1.0: 218B no total / 25B ativos vs. Hy-MT2-30B-A3B: 30B no total / 3B ativos, com variantes densas de 1,8B e 7B

Contexto — 16K de entrada e 16K de saída vs. janela de trabalho de 8K, a configuração anuncia até 262.144 posições

Idiomas — 50 (inglês + 49) vs. 33 mais 5 línguas e dialetos minoritários

Licença — CC BY-NC 4.0, uso comercial via Model Vault vs Apache 2.0, sem restrições

Evidências publicadas — um número não identificado da WMT26, relatado pelo fornecedor vs. um relatório técnico, um benchmark aberto, e resultados nomeados em FLORES-200, WMT25 GEMBA e XCOMET-XXL

Serviço — vLLM com cohere_melody>=0.9.0, decodificação greedy recomendada em comparação com transformers, vLLM, SGLang e llama.cpp

Anunciado — 9 de setembro de 2026 (pesos com acesso restrito no Hugging Face desde 14 de agosto) vs. 21 de maio de 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

A lacuna de evidências é a verdadeira história

O lançamento da Tencent veio com comprovantes. Há um artigo no arXiv, um benchmark que a empresa escreveu e disponibilizou em código aberto especificamente para medir a capacidade de seguir instruções de tradução, e uma tabela de resultados que nomeia seus concorrentes. O FLORES-200 inglês-para-X coloca o 30B-A3B em 93,85 contra o Gemini 3.1 Pro em 94,42 e o GPT-5.5 em 94,16. A métrica GEMBA da era WMT25 o coloca em 84,34 — a pontuação mais alta na própria comparação da Tencent, à frente do GPT-5.5 com 83,41 e 83,29 em seus dois modos, do Gemini 3.1 Pro com 82,23, do DeepSeek-V4-Pro com 81,99 e do Kimi K2.6 com 81,68. O XCOMET-XXL o coloca em 62,89, atrás de seu próprio irmão de 7B. No IFMTBench, ele alcança 85,7% de capacidade geral de seguir instruções, com uma subpontuação de 91,94% que fica a um centésimo de ponto do Gemini 3.1 Pro e uma subpontuação separada, 85,55%, em que lidera o modelo Gemini 3.1 Pro de forma absoluta.

Cada uma delas é medição da própria Tencent, e nenhuma foi reproduzida de forma independente. Mas têm nome, são comparáveis e são falsificáveis — o leitor sabe exatamente qual teste executar para contestar.

A nota de lançamento da Cohere oferece um único número: WMT26 83,60, subindo para 84,36 sob o que ela chama de fluxo de trabalho de tradução agêntico com múltiplas passagens. Nenhuma métrica é nomeada em nenhum lugar do cartão do modelo ou na documentação. Nenhuma página de resultados do WMT26 foi publicada para este modelo. O corpus de treinamento, a contagem de tokens e o pipeline de dados não são divulgados, ao passo que o relatório técnico de 2025 do Command A Translate descrevia uma técnica de filtragem por dificuldade em detalhes. Nada disso é evidência de um modelo pior. É evidência de menos evidência, o que é uma coisa diferente e importa tanto quanto quando você está decidindo o que colocar em produção.

O critério comum que nenhum dos lados realmente publicou

Há um ponto de contato genuíno entre as duas, e ele merece um parágrafo porque é o único lugar onde uma comparação justa poderia acontecer. A Tencent é parceira do WMT26, patrocinando uma tarefa de tradução de legendas de vídeo com prêmios financiados pela Hunyuan. O único número publicado da Cohere é um valor do WMT26. Assim, ambas as organizações estão dentro do mesmo ciclo de avaliação de 2026, e a única métrica em que um confronto direto poderia ser resolvido é justamente aquela em que apenas uma delas publicou algo — e o publicou sem nomear a métrica.

Essa é a lacuna a que se deve ficar atento. Se a Cohere atribuir um nome de métrica ao 83,60, ou se as páginas de resultados do WMT26 incluírem um sistema North Small Translate, a comparação passa a ser real. Até lá, empilhar os números FLORES-200 e GEMBA da Tencent contra o valor não rotulado do WMT26 da Cohere seria uma fabricação disfarçada de análise.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Licença e implantação

Hy-MT2 é Apache 2.0 sem restrições: uso comercial, ajuste fino, derivados e redistribuição, tudo sem precisar conversar com ninguém. North Small Translate 1.0 é CC BY-NC 4.0, gratuito para uso não comercial, com implantação comercial encaminhada pelo Model Vault da Cohere a um preço que não é divulgado. Para qualquer coisa que seja entregue a clientes, essa diferença resolve a decisão antes mesmo de os benchmarks serem lidos.

A história do hardware segue o mesmo padrão em sentido inverso. O Hy-MT2 vai de uma versão quantizada de 440MB que roda em um celular até o 30B-A3B, cujos três bilhões de parâmetros ativos mantêm o cálculo por token modesto para seu nível de qualidade; os ambientes de execução cobrem transformers, vLLM, SGLang e llama.cpp. O North Small Translate 1.0 publica o hardware mínimo por checkpoint — quatro B200s ou oito H100s para BF16, dois B200s ou quatro H100s para FP8, um B200 ou dois H100s para NVFP4 W4A16 — e recomenda decodificação greedy para corresponder à produção. A vantagem compensatória da Cohere é que o modelo roda no nível gratuito de sua API Chat V2, gratuito para chaves de teste e produção até que os limites de taxa sejam atingidos, então avaliá-lo não custa nada.

Você deveria mudar, e para o quê?

A questão da mudança é genuinamente assimétrica aqui. Passar do Hy-MT2 para o North Small Translate 1.0 não é uma melhoria de desempenho que você possa justificar atualmente — é uma aposta num modelo cuja única alegação pública é um número, em contraste com uma família que tem um relatório publicado e uma licença que permite implantação. O que vale a pena fazer é avaliar: o modelo da Cohere pode ser chamado gratuitamente, cobre cinquenta idiomas, incluindo um conjunto europeu mais amplo, e oferece 16K de saída por passada, o que a janela de trabalho de 8K do Hy-MT2 não oferece.

Essa avaliação é o caso em que uma camada de roteamento se justifica, porque a resposta honesta para a maioria das stacks multilíngues é que ambos os modelos permanecem. A OrcaRouter coloca um catálogo de mais de 200 modelos atrás de uma única chave, então experimentar um segundo modelo de tradução é uma mudança de configuração e não um segundo contrato com fornecedor ou uma alteração de código — você aponta o mesmo cliente compatível com OpenAI para um id de modelo diferente e compara no seu próprio texto. O preço de tabela do fornecedor é repassado a 0% de markup, então uma mudança de preço hospedado fica ativa do nosso lado no mesmo dia, sem nenhum spread sobreposto, e as cadeias de failover mantêm a produção no modelo que já funciona enquanto o novo está sendo avaliado. Nem o North Small Translate 1.0 nem o Hy-MT2 estão no nosso catálogo hoje, portanto isto não é uma recomendação para comprar qualquer um deles de nós — é o argumento para não fixar a decisão no código antes de ter executado o teste.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

O veredito

O Hy-MT2 da Tencent é a escolha mais segura e, pelas evidências, não há nem comparação: Apache 2.0, três tamanhos, um artigo, um benchmark aberto, quatro suítes de avaliação nomeadas e uma parceria com a WMT26. O North Small Translate 1.0 da Cohere é a opção mais interessante — 218 bilhões de parâmetros de MoE específico para tradução por trás de uma janela de saída de 16K e cinquenta idiomas, um nível de avaliação gratuito e um 83,60 que ninguém fora da Cohere verificou.

Se você precisar de uma decisão neste trimestre, fique com a família que tem as provas. Se você tiver um corpus e uma semana, passe uma parte dele pelo nível gratuito e descubra se o 83,60 sem nome da Cohere significa alguma coisa nos seus documentos — porque essa é uma pergunta que nenhuma tabela de fornecedor vai responder por você, e o único número que a Cohere escolheu publicar é precisamente aquele que ela se recusou a nomear.