
North Small Translate 1.0 vs Hy-MT2-7B: Uma GPU Contra Duas B200s
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
O confronto mais acirrado em tradução aberta neste momento também pode ser o menos óbvio. Hy-MT2-7B é o filho do meio da família de tradução da Tencent Hunyuan, disponibilizado em código aberto sob a licença Apache 2.0 em 21 de maio de 2026, e roda em uma única RTX 4090 ou A100 com cerca de 16 GB de VRAM. North Small Translate 1.0 é o tradutor de mistura de especialistas esparsa de 218 bilhões de parâmetros da Cohere, documentado nas notas de lançamento da empresa em 9 de setembro de 2026, com uma implantação mínima de duas B200s em FP8 ou uma B200 em sua forma NVFP4 W4A16. Ambos são especialistas em tradução. Ambos são atuais. Um deles você pode servir a partir de uma estação de trabalho, e esse único fato reformula toda a comparação — porque o benchmark em que eles mais gostariam de ser avaliados em igualdade de condições não existe.
Comece com o envelope, não com as pontuações.
O custo de implantação é a dimensão que decide a maioria das integrações reais e, aqui, os dois modelos não estão nem perto. O Hy-MT2-7B é um modelo denso HunYuanDenseV1 de aproximadamente oito bilhões de parâmetros, com builds FP8 e GGUF publicados, além de versões MLX de 8 bits da comunidade para Apple silicon. As notas de implantação da Tencent listam transformers 5.6.0 ou posterior, vLLM, SGLang e llama.cpp como runtimes compatíveis, e as orientações de inferência limitam a geração a 8.192 tokens, ainda que a configuração anuncie até 262.144 posições. Uma única GPU moderna de consumidor ou de estação de trabalho dá conta do recado.
North Small Translate 1.0 é uma classe diferente de objeto. Seus 218B de parâmetros totais, com 25B ativos, são divididos entre 128 especialistas, com oito ativos por token, além de especialistas compartilhados, e a Cohere publica o hardware mínimo para cada um de seus três checkpoints: quatro B200s ou oito H100s para BF16, dois B200s ou quatro H100s para FP8, um B200 ou dois H100s para a versão NVFP4 W4A16. A execução do serviço ocorre via vLLM com cohere_melody>=0.9.0, e a Cohere recomenda decodificação gulosa para corresponder à produção. A saída carrega <|START_TEXT|> e <|END_TEXT|>, marcadores que não são registrados como tokens especiais.
• Formato — North Small Translate 1.0: 218B no total / 25B ativos, MoE esparso, 128 especialistas vs Hy-MT2-7B: denso, cerca de 8B
• Contexto — 16K de entrada e 16K de saída vs. janela de trabalho de 8K, a configuração anuncia até 262.144 posições
• Hardware mínimo — 1×B200 em W4A16, 2×B200 ou 4×H100 em FP8 vs uma única GPU da classe RTX 4090 em ~16GB
• Formatos publicados — BF16, FP8, NVFP4 W4A16 vs base, FP8, GGUF, além do MLX 8-bit da comunidade
• Idiomas — 50 (inglês + 49) vs 33 idiomas mais 5 línguas minoritárias e dialetos
• Licença — CC BY-NC 4.0, uso comercial via Model Vault vs Apache 2.0, sem restrições
• Qualidade reportada — WMT26 83,60, métrica não nomeada, relatada pelo fornecedor vs. tabelas de fornecedores nomeados em FLORES-200, WMT25 GEMBA, XCOMET-XXL e IFMTBench

O problema do benchmark
Eis o cerne honesto desta comparação: não podemos classificar esses dois modelos um contra o outro, e qualquer um que diga o contrário está inventando um número. A Tencent publicou quatro avaliações nomeadas. Na tradução de inglês para X do FLORES-200, o 7B registra 93.52, atrás dos 94.42 do Gemini 3.1 Pro e dos 94.16 do GPT-5.5, mas perto o bastante para importar. Na métrica GEMBA adjacente ao WMT25, ele obtém 82.24, contra 84.34 do 30B-A3B e 83.41 do GPT-5.5. No XCOMET-XXL, ele lidera tudo na tabela comparativa da Tencent com 63.86 — à frente de Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro e Kimi K2.6. Na pontuação de seguimento de instruções do IFMTBench, ele fica em 83.14%. Todos esses são números da própria Tencent, nenhum foi reproduzido de forma independente, e ainda assim são muito mais do que a Cohere ofereceu.
A Cohere publicou um único número: uma pontuação WMT26 de 83,60, que sobe para 84,36 em um fluxo de trabalho agêntico de múltiplas passagens. Nenhuma métrica é nomeada no cartão do modelo nem na nota de lançamento, e nenhuma página de resultados do WMT26 foi publicada para esse modelo. Essa assimetria não é prova de que o modelo da Cohere seja mais fraco ou mais forte. Significa que a comparação que um leitor mais deseja — mesmo teste, mesma métrica, ambos os modelos — não pode ser feita com evidências públicas, e a diferença de quatro pontos entre os dois próprios números da Cohere (83,60 a 84,36) já é maior do que a maioria das lacunas na tabela da Tencent.
Idiomas e o documento longo
O North Small Translate 1.0 cobre cinquenta idiomas e variantes de localidade, com árabe padrão moderno, alemão, francês, japonês, coreano, russo e ucraniano designados como de nível um, e aceita e emite 16.000 tokens em ambos os lados. O Hy-MT2-7B cobre trinta e três idiomas, além de cinco idiomas e dialetos minoritários, incluindo tibetano, uigur e cantonês. Nenhuma das listas é um superconjunto da outra — a Tencent alcança o cantonês e o uigur, a Cohere alcança um conjunto mais amplo de localidades europeias —, de modo que uma implantação multilíngue pode constatar que precisa de ambas apenas por questões de cobertura.
A janela de saída é a diferença mais discreta. Dezesseis mil tokens de saída significam um documento de procedimento completo em uma única passada, com terminologia e registro consistentes em todo o documento, porque o modelo viu tudo. Uma janela de 8K não, e a solução alternativa frase a frase reintroduz exatamente os problemas de consistência entre segmentos que benchmarks de seguimento de instruções de tradução como o IFMTBench foram criados para medir.

A licença, mais uma vez, decide mais do que a tabela.
O North Small Translate 1.0 está sob a licença CC BY-NC 4.0. Os pesos são gratuitos para trabalho não comercial, e a implantação comercial passa pelo Model Vault da Cohere sob uma licença adquirida, sem preço publicado. O Hy-MT2-7B é Apache 2.0 e sem restrições de acesso — uso comercial, ajuste fino e derivados, todos permitidos sem necessidade de conversa. Para um produto comercial, a ordem das operações é evidente: o Hy-MT2-7B pode ser implantado hoje e o modelo da Cohere pode ser avaliado hoje, e nenhuma linha de benchmark muda essa ordem.
A vantagem compensatória da Cohere é o nível gratuito. O North Small Translate 1.0 funciona no nível gratuito do Chat V2, gratuito tanto para chaves de teste quanto de produção até que os limites de taxa sejam atingidos, então uma avaliação não custa nada além de tempo. O Hy-MT2-7B tem uma API comercial hospedada — a Tencent precificou o nível hospedado da família em cerca de US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída — e a auto-hospedagem na sua própria GPU é o caminho genuinamente gratuito.
O que "multi-pass" realmente implica
A decisão da Cohere de publicar tanto um 83,60 quanto um 84,36 é o detalhe mais informativo em sua nota de lançamento, porque indica que a empresa acredita que um fluxo de trabalho supera uma única chamada. Essa é a mesma aposta que a Tencent fez com um mecanismo diferente: seu modelo principal 30B-A3B vence no GEMBA e no XCOMET, enquanto o Gemini 3.1 Pro vence no FLORES-200, o que significa que o melhor sistema não é um único modelo, mas um painel. A fusão de modelos do OrcaRouter executa vários modelos como um painel e concilia suas respostas em uma única chamada, o que é a versão em nível de plataforma da ideia de múltiplas passagens que ambos os fornecedores perseguem — e ela se combina com o lado do roteamento, onde uma única chave cobre um catálogo de mais de 200 modelos pelo preço de tabela do provedor, com 0% de margem, de modo que uma mudança de preço do fornecedor chega ao nosso lado no mesmo dia, em vez de na próxima renovação de contrato.
Essa formulação também resolve o problema de evidências com que este artigo começou. Quando dois fornecedores publicam benchmarks não sobrepostos e nenhum deles tem uma avaliação independente, a forma de escolher não é confiar numa tabela. É executar os dois nos seus próprios documentos e deixar a divergência surgir em texto real — que é exatamente para isso que servem um painel e uma cadeia de failover.

Qual deles, e quando?
Se você precisa de um modelo de tradução rodando em hardware que você já possui, em um produto comercial, sem uma conversa sobre licenciamento, o Hy-MT2-7B vence apenas pela força do envelope — e seus resultados publicados pelo fornecedor, embora não reproduzidos, são pelo menos nomeados, comparáveis e próximos da fronteira. Se você está traduzindo documentos longos para os cinquenta idiomas da Cohere, precisa de 16K de saída consistente por passagem e tem ou um orçamento de dois B200 ou disposição para executar a avaliação no nível gratuito da Cohere antes de decidir, o North Small Translate 1.0 é a máquina mais capaz em cada eixo divulgado.
O que nenhum dos dois modelos faz é eliminar a necessidade de testar. A Cohere deu-lhe um número sem nome e uma forma gratuita de o verificar. A Tencent deu-lhe uma tabela e um download do tamanho de uma GPU. O 83,60 é uma promessa, não um resultado — e o único lugar onde essa promessa se resolve é no seu próprio corpus.
