Cartão de destaque para o confronto intitulado “North Small Translate 1.0 vs NLLB-200”, com o subtítulo “50 idiomas contra 200”, acima de dois cartões: North Small Translate 1.0 (218B MoE / 25B ativos, 2026, contexto de 16K) e NLLB-200 (carro-chefe MoE de 54,5B, 2022, 200 idiomas).
Guides & Insights

North Small Translate 1.0 vs NLLB-200: 50 idiomas contra 200

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O modelo mais recente cobre um quarto dos idiomas. North Small Translate 1.0, que a Cohere documentou em suas notas de lançamento em 9 de setembro de 2026, traduz entre inglês e outros 49 idiomas. NLLB-200, a família No Language Left Behind que a Meta lançou em julho de 2022, cobre 200. Se a contagem de idiomas fosse toda a comparação, este seria um artigo curto, mas não é: os dois modelos são máquinas diferentes, construídas para trabalhos diferentes, e a diferença de quatro anos entre eles aparece de maneiras que nada têm a ver com quantos idiomas aparecem em uma lista. O que segue é para que cada um é realmente bom, quanto custa executá-los e para onde o licenciamento leva você.

O número da cobertura, sinceramente

Duzentos versus cinquenta é real e é o motivo mais citado para manter o NLLB-200 em uma stack. A Meta o treinou em mais de 18 bilhões de pares de frases com ênfase explícita em línguas de baixos recursos, e ele traduz diretamente entre qualquer par em vez de pivotar pelo inglês — uma escolha de design que importa enormemente para, digamos, bengali para tâmil, onde um sistema que pivota pelo inglês perde qualidade duas vezes.

O que o número esconde é que a sobreposição entre as duas listas é a parte comercialmente útil. As cinquenta línguas do North Small Translate 1.0 incluem alemão, francês, espanhol, português, italiano, holandês, polonês, tcheco, japonês, coreano, chinês simplificado e tradicional, árabe, hebraico, híndi, bengali, tâmil, telugu, tailandês, turco, vietnamita, indonésio, malaio, russo e ucraniano — as línguas que representam a esmagadora maioria do volume de localização empresarial. O NLLB-200 cobre todas essas também, além de cerca de 150 outras que o North Small Translate 1.0 não abrange de forma alguma. Portanto, a questão não é qual lista é mais longa. É se o seu tráfego inclui línguas que apenas uma das duas suporta.

Duas máquinas diferentes

A lacuna de arquitetura é a parte que determina o que você pode construir. O maior checkpoint lançado do NLLB-200 é um modelo de mistura de especialistas com gating esparso de cerca de 54,5 bilhões de parâmetros, e suas versões densas equivalentes têm 3,3B, 1,3B e vão até um 600M destilado. Todos eles são modelos sequência-a-sequência do tipo codificador-decodificador da linhagem M2M-100: você entrega ao tokenizador um segmento de origem, e ele retorna um segmento traduzido. Não há template de chat, nem prompt de sistema, nem estrutura multiturno, e os checkpoints lançados são construídos em torno da tradução em nível de segmento: o próprio model card da Meta afirma que o modelo foi treinado com comprimentos de entrada não superiores a 512 tokens e alerta que sequências mais longas degradam. O orçamento combinado do tokenizador para origem e destino é de 1.024 tokens. O model card do NLLB-200 também o descreve como um modelo de pesquisa não disponibilizado para implantação em produção, e observa que não se destina à tradução de documentos — a distinção que mais nitidamente o separa do que a Cohere construiu.

North Small Translate 1.0 é a forma oposta. É um MoE esparso apenas decodificador com 218 bilhões de parâmetros totais e 25 bilhões ativos por token, 128 especialistas com oito ativos mais especialistas compartilhados, e atenção que alterna camadas de janela deslizante (janela 4.096, RoPE) com camadas de atenção global que não possuem embeddings posicionais. Ele roda atrás de um template de chat com uma instrução de sistema padrão, e sua janela é de 16K tokens de entrada e 16K tokens de saída. Esse orçamento de saída é a pista: este é um modelo criado para receber um documento e devolver um documento, não um modelo criado para receber uma frase.

Parâmetros totais — North Small Translate 1.0: 218B MoE (25B ativos) vs. NLLB-200: 54,5B MoE carro-chefe, 600M–3,3B densos

Arquitetura — MoE causal somente decodificador com template de chat vs. seq2seq codificador-decodificador sem template de chat

Contexto — 16K de entrada e 16K de saída vs. nível de segmento, orçamento combinado de 1.024 tokens do tokenizador

Idiomas — 50 (inglês + 49) vs 200

Pares diretos — Estratificação centrada no inglês vs qualquer-para-qualquer sem um pivô em inglês

Licença — CC BY-NC 4.0 vs CC BY-NC 4.0

Pegada mínima — 1×B200 em W4A16, 2×B200 em FP8 vs ~37GB de VRAM em 4-bit para o 54B, 600M roda em qualquer lugar

Anunciado — 9 de setembro de 2026 (pesos com acesso restrito no Hugging Face desde 14 de agosto) vs julho de 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

O que o NLLB-200 ainda domina

Três coisas, e não são sentimentais. A primeira é a cauda longa: se você precisa de oromo, tigrínia, ou qualquer uma das cerca de 150 línguas fora da lista do North Small Translate 1.0, a decisão já está tomada. A segunda é o footprint na ponta pequena — o checkpoint destilado de 600M tem 1,4 milhão de downloads e roda em hardware que não conseguiria nem carregar os pesos da Cohere, o que o torna o único dos dois que se encaixa em uma implantação air-gapped ou de edge sem truques de quantização. A terceira é a maturidade: o NLLB-200 tem quatro anos de ferramentas, forks de quantização e histórias de guerra de produção por trás dele, além de um artigo revisado por pares na Nature de junho de 2024 descrevendo como foi construído. A Cohere publicou uma nota de lançamento.

A contrapartida no outro sentido é igualmente concreta. A ficha técnica do NLLB-200 descreve-o como um modelo de pesquisa que não foi lançado para implantação em produção, e seu checkpoint principal de 54B é um peso-pesado — cerca de 350 GB de armazenamento e algo na ordem de 108–120 GB de VRAM para servir sem compressão. A Meta não vende um endpoint NLLB hospedado. Executá-lo em escala é problema seu, e é um problema real.

A armadilha do licenciamento em ambos os lados

Esta é a parte que surpreende as pessoas, porque os dois modelos têm a mesma licença e não é a que a maioria das equipes presume. Tanto o NLLB-200 quanto o North Small Translate 1.0 são lançados sob a licença Creative Commons Attribution-NonCommercial 4.0. Nenhum dos dois pode ser usado em um produto comercial conforme publicado. A restrição de uso não comercial do NLLB-200 tem sido polêmica o suficiente para que exista um projeto comunitário chamado Open-NLLB especificamente para tentar criar um derivado comercialmente utilizável, o que esbarra diretamente na licença da qual ele deriva. O caminho da Cohere é mais limpo: comprar uma licença comercial e implantar por meio do Model Vault, com os pesos FP8 gratuitos no Hugging Face apenas para trabalho não comercial.

Há uma assimetria que vale a pena destacar. A Cohere executa o North Small Translate 1.0 na camada gratuita de sua API Chat V2, gratuita para chaves de teste e de produção até que os limites de taxa sejam atingidos — assim você pode fazer uma avaliação real a custo zero e só assinar algo se for colocar em produção. O NLLB-200 fornece apenas os pesos e nada mais.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Implantando qualquer um deles

O North Small Translate 1.0 é disponibilizado em três checkpoints — BF16, FP8 e NVFP4 W4A16 — com o hardware mínimo publicado para cada um: quatro B200 ou oito H100 para BF16, dois B200 ou quatro H100 para FP8, e um único B200 ou dois H100 para W4A16. A disponibilização é feita por meio do vLLM com cohere_melody>=0.9.0, e a Cohere recomenda decodificação greedy, correspondendo à sua configuração de produção. A saída é envolvida pelos marcadores <|START_TEXT|> e <|END_TEXT|>, que não são registrados como tokens especiais, portanto um skip_special_tokens=True ingênuo deixará esses marcadores na sua saída.

O NLLB-200 é implantado pelos caminhos padrão do transformers ou do fairseq, com uma tolerância muito maior a hardware pequeno, já que os checkpoints destilados de 600M e 1,3B são os que a maioria das pessoas realmente executa. O MoE de 54B é o que exige planejamento.

A questão de roteamento que este confronto realmente representa

Nem o North Small Translate 1.0 nem o NLLB-200 estão nocatálogo do OrcaRouter hoje, então este não é um artigo sobre escolher um da nossa prateleira. Vale a pena nomear a forma do problema de qualquer maneira, porque "um modelo para os idiomas de primeiro nível, outro para a cauda longa" é uma política de roteamento — e uma política de roteamento é o tipo de coisa que deveria viver na configuração em vez de no código da aplicação. O DSL de roteamento do OrcaRouter expressa exatamente isso como YAML mais regras CEL, então uma regra de par de idiomas pode enviar pares europeus para um modelo e recorrer a outro quando um par não é suportado, e cadeias de failover significam que um upstream que começa a retornar erros não se torna sua interrupção. Isso é uma chave e uma integração em um catálogo de mais de 200 modelos pelo preço de tabela do provedor com 0% de markup, em vez de um segundo contrato de fornecedor para cada modelo de tradução que você decidir experimentar.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

Por qual deles você deve optar

Se a sua estratégia de conteúdo envolve idiomas além dos cinquenta da Cohere, fique com o NLLB-200 e considere isso resolvido — nenhuma dose de modernidade arquitetural compensa um idioma ausente. Se você está fazendo localização empresarial para os idiomas listados pela Cohere, trabalha no nível de um documento em vez de uma frase, e está disposto a comprar uma licença comercial, o North Small Translate 1.0 é o modelo mais capaz em todas as dimensões divulgadas pela documentação, com a ressalva importante de que sua única evidência de qualidade é um número de fornecedor não reproduzido. Se você está prototipando e não tem orçamento, o nível gratuito da Cohere torna essa avaliação quase gratuita, o que é uma posição de partida melhor do que a do NLLB-200, em que o preço de descobrir é o aluguel de uma GPU.

A maneira útil de ter os dois fatos em mente ao mesmo tempo: o NLLB-200 é o modelo que alcança os idiomas que nenhum outro alcança, e foi criado em 2022 para tradução de pesquisa em nível de frase. O North Small Translate 1.0 é o modelo que faz menos idiomas, mas melhor, e foi criado em 2026 para documentos. Escolher entre eles não é, na verdade, um julgamento de qualidade. É uma questão sobre quais idiomas você realmente entrega.