Cartão de destaque intitulado "North Small Translate 1.0 vs Hy-MT2-1.8B" com o subtítulo "218GB de modelo contra 440MB", acima de dois cartões: North Small Translate 1.0 (218B MoE, mínimo de 2x B200) e Hy-MT2-1.8B (1.8B denso, 440MB, roda em um celular) com um ícone de contorno de telefone.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 218 GB de modelo contra 440 MB

Autor

Elias Hawthorne

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Um destes cabe num celular. Hy-MT2-1.8B, o modelo de tradução em dispositivo da Tencent Hunyuan, aberto sob a licença Apache 2.0 em 21 de maio de 2026, é reduzido a 440 megabytes com a quantização de 1,25 bit do AngelSlim e roda em chips de celular da Apple, Qualcomm e MediaTek. North Small Translate 1.0, o modelo de mistura de especialistas de 218 bilhões de parâmetros que a Cohere documentou nas notas de versão em 9 de setembro de 2026, vem com um conjunto de pesos FP8 da ordem de 218 gigabytes e exige no mínimo dois B200s. Isso é cerca de quinhentas vezes o armazenamento para um deles, e a pergunta interessante não é qual é melhor — é para que cada um realmente serve, e qual licença permite que você o distribua.

A diferença de tamanho não é uma diferença de qualidade

É tentador ler 218B em comparação com 1,8B como um ranking direto de capacidade. Não é, por dois motivos. O primeiro é que o North Small Translate 1.0 é um modelo esparso de mistura de especialistas com apenas 25 bilhões de parâmetros ativos por token, então o custo computacional por token está em uma liga diferente da contagem de parâmetros. O segundo é que os dois modelos foram otimizados com objetivos diferentes: o 1,8B da Tencent foi criado para ser pequeno o suficiente para rodar offline em um celular, e o modelo da Cohere foi criado para manter um documento inteiro no contexto e traduzi-lo como uma unidade.

Essa diferença é legível nas janelas de contexto. A configuração do Hy-MT2-1.8B anuncia até 262.144 posições, mas a própria orientação de inferência da Tencent limita a geração a 8.192 tokens — a janela de trabalho prática é de 8K. O North Small Translate 1.0 documenta 16K de entrada e 16K de saída, o que é o dobro da janela de entrada e, mais importante, 16K completos de saída. Se sua unidade de trabalho é um manual de serviço, esse orçamento de saída é o recurso. Se sua unidade de trabalho é uma mensagem de chat, isso é irrelevante.

Total de parâmetros — North Small Translate 1.0: 218B MoE, 25B ativos vs Hy-MT2-1.8B: 1.8B denso

Contexto — 16K de entrada e 16K de saída vs janela de trabalho de 8K (a configuração anuncia até 262.144 posições; a orientação da Tencent indica 8.192)

Idiomas — 50 (inglês + 49) vs 33 idiomas mais 5 línguas minoritárias e dialetos

Licença — CC BY-NC 4.0, uso comercial via Model Vault vs Apache 2.0, sem restrições

Pegada quantizada — FP8 ~218GB, NVFP4 W4A16 ~109GB vs 440MB em 1,25-bit, FP8 e GGUF também publicados

Hardware mínimo — 2×B200 ou 4×H100 em FP8 vs um aparelho

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

O que a Tencent realmente lançou no 1.8B

O 1.8B é o menor membro de uma família de três modelos — 1.8B, 7B e um carro-chefe MoE 30B-A3B — todos lançados em conjunto com um benchmark complementar chamado IFMTBench, que mede o seguimento de instruções de tradução em vez da qualidade bruta da tradução. A Tencent lançou quantizações FP8, GGUF, de 2 bits e de 1,25 bits juntamente com os pesos base, e a versão de 1,25 bits é a que produz o valor de 440 MB e um alegado ganho de velocidade de inferência de 1,5x em relação à geração anterior Hy-MT1.5. O serving é suportado por meio do transformers 5.6.0 e versões posteriores, vLLM, SGLang e llama.cpp, com o caminho GGUF dependendo de um kernel STQ integrado ao llama.cpp. A amostragem recomendada é temperature 0.7, top_p 0.6, top_k 20, penalidade de repetição 1.05, e não há prompt de sistema padrão — o inverso da abordagem da Cohere.

Além disso, ao contrário do North Small Translate 1.0, é um modelo com adoção visível. O repositório no Hugging Face foi baixado mais de 23.000 vezes e tem cerca de 1.200 curtidas. O repositório principal da Cohere mostrava 26 downloads e zero curtidas quando isto foi escrito.

A licença é a diferença mais nítida

Esta é a parte que deveria decidir mais implantações do que a tabela de benchmark. O Hy-MT2-1.8B é Apache 2.0 sem restrições de acesso — uso comercial, ajuste fino, obras derivadas, redistribuição, tudo permitido. O North Small Translate 1.0 é CC BY-NC 4.0: os pesos são gratuitos para uso não comercial, e a implantação comercial exige uma licença adquirida por meio do Model Vault da Cohere, para o qual não há preço publicado.

Dito de forma simples: se você está construindo um produto, o modelo da Tencent é aquele que você pode lançar hoje sem uma conversa, e o da Cohere é aquele que você só pode avaliar. Essa assimetria não torna o modelo da Cohere pior, mas muda a ordem das operações — você avalia o da Cohere, e pode implantar o da Tencent.

A evidência de qualidade é assimétrica, e ambos os lados são relatados pelos fornecedores.

Nenhum dos modelos tem uma avaliação independente por trás, então trate cada número aqui como uma alegação de seu criador. A diferença está em quanto os criadores colocaram na mesa. A Tencent publicou uma tabela de comparação completa e um relatório técnico: no FLORES-200 de tradução do inglês para X, o Hy-MT2-1.8B registra 90,00 contra 94,42 do Gemini 3.1 Pro e 94,16 do GPT-5.5 — modestamente atrás dos modelos de fronteira, mas dentro de alguns pontos, de um modelo que cabe num celular. Na pontuação geral de seguimento de instruções do IFMTBench, o 1.8B fica em 69,36%, bem atrás do seu próprio irmão 30B-A3B, com 85,7%, e do Gemini 3.1 Pro, com 89,08%, o que é a leitura honesta do trade-off: o modelo minúsculo segue instruções de formatação e terminologia muito menos confiavelmente do que traduz.

A Cohere publicou um número — uma pontuação de 83,60 no WMT26, subindo para 84,36 com um fluxo de trabalho agêntico de múltiplas passagens — sem nenhum nome de métrica associado e sem uma página de resultados do WMT26 para conferi-la. Essa não é uma comparação que podemos fazer. Um único número sem nome não pode ser contraposto a uma tabela de benchmarks nomeados, e fingir o contrário seria a coisa mais enganosa que este artigo poderia fazer.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

O contrapeso da Tencent é que os seus números vêm de um lugar que um leitor pode inspecionar. O repositório Hy-MT2 publica a visão geral da família, os três tamanhos de modelo e os runtimes que cada um suporta ao lado da tabela de benchmarks — o que é justamente o que torna os números do FLORES-200 e do IFMTBench verificáveis em primeiro lugar, e o que faz o único número sem nome da Cohere se destacar por contraste.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Quanto custa ligar para cada um

O 1.8B da Tencent tem uma API comercial hospedada lançada em agosto de 2026, com preço de aproximadamente US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída — barato em termos absolutos, e cobrado por token. O modelo da Cohere roda no nível gratuito do Chat V2, gratuito para chaves de teste e de produção até que os limites de taxa sejam atingidos, então o custo de avaliação é zero, mas o custo de produção é um contrato que você tem de negociar. A auto-hospedagem inverte totalmente a aritmética: 440 MB em um celular versus dois B200s, uma diferença medida em ordens de magnitude, não em porcentagens.

A razão pela qual vale a pena mencionar essa diferença num texto sobre uma plataforma de roteamento é que o nível barato e o nível caro não são concorrentes — são duas posições numa cascata, e é para cascatas que serve um roteador. O OrcaRouter repassa o preço de tabela do fornecedor com 0% de margem, pelo que um corte de preço de um fornecedor num endpoint de tradução hospedado fica em vigor do nosso lado no mesmo dia, sem margem de revendedor para renegociar, e as cadeias de failover permitem que um modelo mais pequeno absorva a maior parte do tráfego enquanto um modelo mais pesado assume os pedidos em que ele falha. Experimente primeiro o barato, faça escalar nos casos difíceis e deixe que a camada de roteamento detenha a política, em vez do código da sua aplicação.

Qual deles você deve escolher

Se a sua tradução acontece em um dispositivo, offline, sob um orçamento de armazenamento por megabyte, ou dentro de um produto comercial sem apetite para uma negociação de licença, o Hy-MT2-1.8B é a resposta e o North Small Translate 1.0 não está na disputa. Se a sua unidade de trabalho é um documento longo em um dos cinquenta idiomas que a Cohere suporta, se você precisa de 16K de saída em uma única passagem, e se uma licença comercial é algo que sua organização está disposta a comprar, então o modelo da Cohere é a máquina mais capaz em todas as dimensões divulgadas — com a ressalva de que sua qualidade se baseia em um único número não reproduzido.

E, para a maioria das equipes, a resposta honesta é ambos, nessa ordem: o modelo de 440MB faz o trabalho rotineiro a um custo trivial, o modelo de 218B cuida dos documentos que importam, e a decisão sobre qual solicitação vai para onde é uma regra de roteamento, e não uma reescrita. A diferença entre esses dois modelos não é uma lacuna a ser fechada. É um espectro a ser usado.