
North Small Translate 1.0 vs Hy-MT2: Dois tradutores MoE, uma lacuna de evidências
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Ambas essas famílias foram construídas com a mesma aposta — a de que uma rede esparsa de mistura de especialistas pós-treinada para tradução supera um modelo de uso geral ao qual se pede que traduza — e chegaram a ela por direções opostas. Hy-MT2, a família de tradução de três modelos da Tencent Hunyuan, encabeçada pelo Hy-MT2-30B-A3B MoE, foi disponibilizada como código aberto em 21 de maio de 2026 sob Apache 2.0, com um relatório técnico, um benchmark de código aberto e uma tabela de comparação completa. North Small Translate 1.0, o tradutor MoE de 218 bilhões de parâmetros e 25 bilhões ativos da Cohere, foi documentado em uma nota de versão datada de 9 de setembro de 2026, e sua evidência de qualidade resume-se a um único número sem nenhuma métrica associada a ele. As arquiteturas rimam. A documentação não, e essa diferença é a coisa mais útil de entender antes de escolher qualquer uma delas.
Uma família, três tamanhos contra um modelo grande
O Hy-MT2 não é um único modelo, mas sim uma família: um modelo denso de 1,8B para execução no dispositivo, um modelo denso de 7B para uma única GPU e o MoE 30B-A3B como carro-chefe, com três bilhões de parâmetros ativos por token. Todos os três são Apache 2.0, sem restrições de acesso, e foram lançados juntos com quantizações FP8, GGUF, de 2 bits e 1,25 bit, além do benchmark IFMTBench de seguimento de instruções e um artigo complementar. A Tencent informa que a família traduz entre 33 idiomas, além de cinco línguas e dialetos minoritários.
North Small Translate 1.0 é um único ponto no espaço de tamanhos, e um ponto grande: 218B de parâmetros totais, 25B ativos, 128 especialistas com oito ativados por token mais especialistas compartilhados, e atenção alternando numa proporção de 3:1 entre camadas de janela deslizante (janela de 4.096, RoPE) e camadas globais sem embeddings posicionais. Sua janela é de 16K de entrada e 16K de saída em inglês mais 49 outros idiomas, com árabe moderno padrão, alemão, francês, japonês, coreano, russo e ucraniano designados como tier one. Notavelmente, o formato não é novo — o Command A+ da Cohere, de maio de 2026, usava a mesma configuração 218B/25B — o que faz disto um pós-treino especializado em tradução de um núcleo existente, em vez de uma nova arquitetura.
• Parâmetros — North Small Translate 1.0: 218B no total / 25B ativos vs. Hy-MT2-30B-A3B: 30B no total / 3B ativos, com variantes densas de 1,8B e 7B
• Contexto — 16K de entrada e 16K de saída vs. janela de trabalho de 8K, a configuração anuncia até 262.144 posições
• Idiomas — 50 (inglês + 49) vs. 33 mais 5 línguas e dialetos minoritários
• Licença — CC BY-NC 4.0, uso comercial via Model Vault vs Apache 2.0, sem restrições
• Evidências publicadas — um número não identificado da WMT26, relatado pelo fornecedor vs. um relatório técnico, um benchmark aberto, e resultados nomeados em FLORES-200, WMT25 GEMBA e XCOMET-XXL
• Serviço — vLLM com cohere_melody>=0.9.0, decodificação greedy recomendada em comparação com transformers, vLLM, SGLang e llama.cpp
• Anunciado — 9 de setembro de 2026 (pesos com acesso restrito no Hugging Face desde 14 de agosto) vs. 21 de maio de 2026

A lacuna de evidências é a verdadeira história
O lançamento da Tencent veio com comprovantes. Há um artigo no arXiv, um benchmark que a empresa escreveu e disponibilizou em código aberto especificamente para medir a capacidade de seguir instruções de tradução, e uma tabela de resultados que nomeia seus concorrentes. O FLORES-200 inglês-para-X coloca o 30B-A3B em 93,85 contra o Gemini 3.1 Pro em 94,42 e o GPT-5.5 em 94,16. A métrica GEMBA da era WMT25 o coloca em 84,34 — a pontuação mais alta na própria comparação da Tencent, à frente do GPT-5.5 com 83,41 e 83,29 em seus dois modos, do Gemini 3.1 Pro com 82,23, do DeepSeek-V4-Pro com 81,99 e do Kimi K2.6 com 81,68. O XCOMET-XXL o coloca em 62,89, atrás de seu próprio irmão de 7B. No IFMTBench, ele alcança 85,7% de capacidade geral de seguir instruções, com uma subpontuação de 91,94% que fica a um centésimo de ponto do Gemini 3.1 Pro e uma subpontuação separada, 85,55%, em que lidera o modelo Gemini 3.1 Pro de forma absoluta.
Cada uma delas é medição da própria Tencent, e nenhuma foi reproduzida de forma independente. Mas têm nome, são comparáveis e são falsificáveis — o leitor sabe exatamente qual teste executar para contestar.
A nota de lançamento da Cohere oferece um único número: WMT26 83,60, subindo para 84,36 sob o que ela chama de fluxo de trabalho de tradução agêntico com múltiplas passagens. Nenhuma métrica é nomeada em nenhum lugar do cartão do modelo ou na documentação. Nenhuma página de resultados do WMT26 foi publicada para este modelo. O corpus de treinamento, a contagem de tokens e o pipeline de dados não são divulgados, ao passo que o relatório técnico de 2025 do Command A Translate descrevia uma técnica de filtragem por dificuldade em detalhes. Nada disso é evidência de um modelo pior. É evidência de menos evidência, o que é uma coisa diferente e importa tanto quanto quando você está decidindo o que colocar em produção.
O critério comum que nenhum dos lados realmente publicou
Há um ponto de contato genuíno entre as duas, e ele merece um parágrafo porque é o único lugar onde uma comparação justa poderia acontecer. A Tencent é parceira do WMT26, patrocinando uma tarefa de tradução de legendas de vídeo com prêmios financiados pela Hunyuan. O único número publicado da Cohere é um valor do WMT26. Assim, ambas as organizações estão dentro do mesmo ciclo de avaliação de 2026, e a única métrica em que um confronto direto poderia ser resolvido é justamente aquela em que apenas uma delas publicou algo — e o publicou sem nomear a métrica.
Essa é a lacuna a que se deve ficar atento. Se a Cohere atribuir um nome de métrica ao 83,60, ou se as páginas de resultados do WMT26 incluírem um sistema North Small Translate, a comparação passa a ser real. Até lá, empilhar os números FLORES-200 e GEMBA da Tencent contra o valor não rotulado do WMT26 da Cohere seria uma fabricação disfarçada de análise.

Licença e implantação
Hy-MT2 é Apache 2.0 sem restrições: uso comercial, ajuste fino, derivados e redistribuição, tudo sem precisar conversar com ninguém. North Small Translate 1.0 é CC BY-NC 4.0, gratuito para uso não comercial, com implantação comercial encaminhada pelo Model Vault da Cohere a um preço que não é divulgado. Para qualquer coisa que seja entregue a clientes, essa diferença resolve a decisão antes mesmo de os benchmarks serem lidos.
A história do hardware segue o mesmo padrão em sentido inverso. O Hy-MT2 vai de uma versão quantizada de 440MB que roda em um celular até o 30B-A3B, cujos três bilhões de parâmetros ativos mantêm o cálculo por token modesto para seu nível de qualidade; os ambientes de execução cobrem transformers, vLLM, SGLang e llama.cpp. O North Small Translate 1.0 publica o hardware mínimo por checkpoint — quatro B200s ou oito H100s para BF16, dois B200s ou quatro H100s para FP8, um B200 ou dois H100s para NVFP4 W4A16 — e recomenda decodificação greedy para corresponder à produção. A vantagem compensatória da Cohere é que o modelo roda no nível gratuito de sua API Chat V2, gratuito para chaves de teste e produção até que os limites de taxa sejam atingidos, então avaliá-lo não custa nada.
Você deveria mudar, e para o quê?
A questão da mudança é genuinamente assimétrica aqui. Passar do Hy-MT2 para o North Small Translate 1.0 não é uma melhoria de desempenho que você possa justificar atualmente — é uma aposta num modelo cuja única alegação pública é um número, em contraste com uma família que tem um relatório publicado e uma licença que permite implantação. O que vale a pena fazer é avaliar: o modelo da Cohere pode ser chamado gratuitamente, cobre cinquenta idiomas, incluindo um conjunto europeu mais amplo, e oferece 16K de saída por passada, o que a janela de trabalho de 8K do Hy-MT2 não oferece.
Essa avaliação é o caso em que uma camada de roteamento se justifica, porque a resposta honesta para a maioria das stacks multilíngues é que ambos os modelos permanecem. A OrcaRouter coloca um catálogo de mais de 200 modelos atrás de uma única chave, então experimentar um segundo modelo de tradução é uma mudança de configuração e não um segundo contrato com fornecedor ou uma alteração de código — você aponta o mesmo cliente compatível com OpenAI para um id de modelo diferente e compara no seu próprio texto. O preço de tabela do fornecedor é repassado a 0% de markup, então uma mudança de preço hospedado fica ativa do nosso lado no mesmo dia, sem nenhum spread sobreposto, e as cadeias de failover mantêm a produção no modelo que já funciona enquanto o novo está sendo avaliado. Nem o North Small Translate 1.0 nem o Hy-MT2 estão no nosso catálogo hoje, portanto isto não é uma recomendação para comprar qualquer um deles de nós — é o argumento para não fixar a decisão no código antes de ter executado o teste.

O veredito
O Hy-MT2 da Tencent é a escolha mais segura e, pelas evidências, não há nem comparação: Apache 2.0, três tamanhos, um artigo, um benchmark aberto, quatro suítes de avaliação nomeadas e uma parceria com a WMT26. O North Small Translate 1.0 da Cohere é a opção mais interessante — 218 bilhões de parâmetros de MoE específico para tradução por trás de uma janela de saída de 16K e cinquenta idiomas, um nível de avaliação gratuito e um 83,60 que ninguém fora da Cohere verificou.
Se você precisar de uma decisão neste trimestre, fique com a família que tem as provas. Se você tiver um corpus e uma semana, passe uma parte dele pelo nível gratuito e descubra se o 83,60 sem nome da Cohere significa alguma coisa nos seus documentos — porque essa é uma pergunta que nenhuma tabela de fornecedor vai responder por você, e o único número que a Cohere escolheu publicar é precisamente aquele que ela se recusou a nomear.
