
North Small Translate 1.0 vs Hy-MT2-1.8B: 218 GB de modelo contra 440 MB
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
Um destes cabe num celular. Hy-MT2-1.8B, o modelo de tradução em dispositivo da Tencent Hunyuan, aberto sob a licença Apache 2.0 em 21 de maio de 2026, é reduzido a 440 megabytes com a quantização de 1,25 bit do AngelSlim e roda em chips de celular da Apple, Qualcomm e MediaTek. North Small Translate 1.0, o modelo de mistura de especialistas de 218 bilhões de parâmetros que a Cohere documentou nas notas de versão em 9 de setembro de 2026, vem com um conjunto de pesos FP8 da ordem de 218 gigabytes e exige no mínimo dois B200s. Isso é cerca de quinhentas vezes o armazenamento para um deles, e a pergunta interessante não é qual é melhor — é para que cada um realmente serve, e qual licença permite que você o distribua.
A diferença de tamanho não é uma diferença de qualidade
É tentador ler 218B em comparação com 1,8B como um ranking direto de capacidade. Não é, por dois motivos. O primeiro é que o North Small Translate 1.0 é um modelo esparso de mistura de especialistas com apenas 25 bilhões de parâmetros ativos por token, então o custo computacional por token está em uma liga diferente da contagem de parâmetros. O segundo é que os dois modelos foram otimizados com objetivos diferentes: o 1,8B da Tencent foi criado para ser pequeno o suficiente para rodar offline em um celular, e o modelo da Cohere foi criado para manter um documento inteiro no contexto e traduzi-lo como uma unidade.
Essa diferença é legível nas janelas de contexto. A configuração do Hy-MT2-1.8B anuncia até 262.144 posições, mas a própria orientação de inferência da Tencent limita a geração a 8.192 tokens — a janela de trabalho prática é de 8K. O North Small Translate 1.0 documenta 16K de entrada e 16K de saída, o que é o dobro da janela de entrada e, mais importante, 16K completos de saída. Se sua unidade de trabalho é um manual de serviço, esse orçamento de saída é o recurso. Se sua unidade de trabalho é uma mensagem de chat, isso é irrelevante.
• Total de parâmetros — North Small Translate 1.0: 218B MoE, 25B ativos vs Hy-MT2-1.8B: 1.8B denso
• Contexto — 16K de entrada e 16K de saída vs janela de trabalho de 8K (a configuração anuncia até 262.144 posições; a orientação da Tencent indica 8.192)
• Idiomas — 50 (inglês + 49) vs 33 idiomas mais 5 línguas minoritárias e dialetos
• Licença — CC BY-NC 4.0, uso comercial via Model Vault vs Apache 2.0, sem restrições
• Pegada quantizada — FP8 ~218GB, NVFP4 W4A16 ~109GB vs 440MB em 1,25-bit, FP8 e GGUF também publicados
• Hardware mínimo — 2×B200 ou 4×H100 em FP8 vs um aparelho

O que a Tencent realmente lançou no 1.8B
O 1.8B é o menor membro de uma família de três modelos — 1.8B, 7B e um carro-chefe MoE 30B-A3B — todos lançados em conjunto com um benchmark complementar chamado IFMTBench, que mede o seguimento de instruções de tradução em vez da qualidade bruta da tradução. A Tencent lançou quantizações FP8, GGUF, de 2 bits e de 1,25 bits juntamente com os pesos base, e a versão de 1,25 bits é a que produz o valor de 440 MB e um alegado ganho de velocidade de inferência de 1,5x em relação à geração anterior Hy-MT1.5. O serving é suportado por meio do transformers 5.6.0 e versões posteriores, vLLM, SGLang e llama.cpp, com o caminho GGUF dependendo de um kernel STQ integrado ao llama.cpp. A amostragem recomendada é temperature 0.7, top_p 0.6, top_k 20, penalidade de repetição 1.05, e não há prompt de sistema padrão — o inverso da abordagem da Cohere.
Além disso, ao contrário do North Small Translate 1.0, é um modelo com adoção visível. O repositório no Hugging Face foi baixado mais de 23.000 vezes e tem cerca de 1.200 curtidas. O repositório principal da Cohere mostrava 26 downloads e zero curtidas quando isto foi escrito.
A licença é a diferença mais nítida
Esta é a parte que deveria decidir mais implantações do que a tabela de benchmark. O Hy-MT2-1.8B é Apache 2.0 sem restrições de acesso — uso comercial, ajuste fino, obras derivadas, redistribuição, tudo permitido. O North Small Translate 1.0 é CC BY-NC 4.0: os pesos são gratuitos para uso não comercial, e a implantação comercial exige uma licença adquirida por meio do Model Vault da Cohere, para o qual não há preço publicado.
Dito de forma simples: se você está construindo um produto, o modelo da Tencent é aquele que você pode lançar hoje sem uma conversa, e o da Cohere é aquele que você só pode avaliar. Essa assimetria não torna o modelo da Cohere pior, mas muda a ordem das operações — você avalia o da Cohere, e pode implantar o da Tencent.
A evidência de qualidade é assimétrica, e ambos os lados são relatados pelos fornecedores.
Nenhum dos modelos tem uma avaliação independente por trás, então trate cada número aqui como uma alegação de seu criador. A diferença está em quanto os criadores colocaram na mesa. A Tencent publicou uma tabela de comparação completa e um relatório técnico: no FLORES-200 de tradução do inglês para X, o Hy-MT2-1.8B registra 90,00 contra 94,42 do Gemini 3.1 Pro e 94,16 do GPT-5.5 — modestamente atrás dos modelos de fronteira, mas dentro de alguns pontos, de um modelo que cabe num celular. Na pontuação geral de seguimento de instruções do IFMTBench, o 1.8B fica em 69,36%, bem atrás do seu próprio irmão 30B-A3B, com 85,7%, e do Gemini 3.1 Pro, com 89,08%, o que é a leitura honesta do trade-off: o modelo minúsculo segue instruções de formatação e terminologia muito menos confiavelmente do que traduz.
A Cohere publicou um número — uma pontuação de 83,60 no WMT26, subindo para 84,36 com um fluxo de trabalho agêntico de múltiplas passagens — sem nenhum nome de métrica associado e sem uma página de resultados do WMT26 para conferi-la. Essa não é uma comparação que podemos fazer. Um único número sem nome não pode ser contraposto a uma tabela de benchmarks nomeados, e fingir o contrário seria a coisa mais enganosa que este artigo poderia fazer.

O contrapeso da Tencent é que os seus números vêm de um lugar que um leitor pode inspecionar. O repositório Hy-MT2 publica a visão geral da família, os três tamanhos de modelo e os runtimes que cada um suporta ao lado da tabela de benchmarks — o que é justamente o que torna os números do FLORES-200 e do IFMTBench verificáveis em primeiro lugar, e o que faz o único número sem nome da Cohere se destacar por contraste.

Quanto custa ligar para cada um
O 1.8B da Tencent tem uma API comercial hospedada lançada em agosto de 2026, com preço de aproximadamente US$ 0,044 por milhão de tokens de entrada e US$ 0,177 por milhão de tokens de saída — barato em termos absolutos, e cobrado por token. O modelo da Cohere roda no nível gratuito do Chat V2, gratuito para chaves de teste e de produção até que os limites de taxa sejam atingidos, então o custo de avaliação é zero, mas o custo de produção é um contrato que você tem de negociar. A auto-hospedagem inverte totalmente a aritmética: 440 MB em um celular versus dois B200s, uma diferença medida em ordens de magnitude, não em porcentagens.
A razão pela qual vale a pena mencionar essa diferença num texto sobre uma plataforma de roteamento é que o nível barato e o nível caro não são concorrentes — são duas posições numa cascata, e é para cascatas que serve um roteador. O OrcaRouter repassa o preço de tabela do fornecedor com 0% de margem, pelo que um corte de preço de um fornecedor num endpoint de tradução hospedado fica em vigor do nosso lado no mesmo dia, sem margem de revendedor para renegociar, e as cadeias de failover permitem que um modelo mais pequeno absorva a maior parte do tráfego enquanto um modelo mais pesado assume os pedidos em que ele falha. Experimente primeiro o barato, faça escalar nos casos difíceis e deixe que a camada de roteamento detenha a política, em vez do código da sua aplicação.
Qual deles você deve escolher
Se a sua tradução acontece em um dispositivo, offline, sob um orçamento de armazenamento por megabyte, ou dentro de um produto comercial sem apetite para uma negociação de licença, o Hy-MT2-1.8B é a resposta e o North Small Translate 1.0 não está na disputa. Se a sua unidade de trabalho é um documento longo em um dos cinquenta idiomas que a Cohere suporta, se você precisa de 16K de saída em uma única passagem, e se uma licença comercial é algo que sua organização está disposta a comprar, então o modelo da Cohere é a máquina mais capaz em todas as dimensões divulgadas — com a ressalva de que sua qualidade se baseia em um único número não reproduzido.
E, para a maioria das equipes, a resposta honesta é ambos, nessa ordem: o modelo de 440MB faz o trabalho rotineiro a um custo trivial, o modelo de 218B cuida dos documentos que importam, e a decisão sobre qual solicitação vai para onde é uma regra de roteamento, e não uma reescrita. A diferença entre esses dois modelos não é uma lacuna a ser fechada. É um espectro a ser usado.
