North Small Translate 1.0 cartão de destaque encabeçado pelo nome do modelo e pela linha "modelo de tradução de 218B da Cohere, documentado apenas nas notas de versão", acima de um cartão que lista 218B no total / 25B ativos MoE, 50 idiomas e 16K de entrada / 16K de saída, ao lado de um motivo de documento marcado como "sem post de lançamento".
Guides & Insights

North Small Translate 1.0: O Modelo Grande Mais Silencioso da Cohere Até Agora

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

North Small Translate 1.0 é um modelo de tradução de mistura de especialistas com 218 bilhões de parâmetros da Cohere e do Cohere Labs, e chegou do jeito que muito poucos lançamentos em escala de fronteira chegam: com uma nota de lançamento e nada mais. O changelog da Cohere data o anúncio em 9 de setembro de 2026, mas os três checkpoints já estavam no Hugging Face atrás de uma barreira de acesso desde 14 de agosto — três semanas e meia de pesos sem post no blog, sem cobertura da imprensa e sem thread de lançamento. Quando isto foi escrito, o repositório principal mostrava zero curtidas, 26 downloads no último mês e uma única discussão da comunidade sem resposta. Um modelo de 218B com uma pontuação WMT26 de 83,60 relatada pelo fornecedor que quase ninguém notou vale a pena explicar, então aqui está o que a documentação e o repositório de fato estabelecem, separado daquilo que eles não estabelecem.

Os números que a Cohere assinou

Comece pelas especificações, porque não são ambíguas e são a parte desta versão que é plenamente conhecível. O North Small Translate 1.0 é um modelo de mistura de especialistas esparso, apenas com descodificador — a mesma arquitetura que a Cohere usou para o Command A+ em maio de 2026 — com 128 especialistas, oito ativados por token, além de especialistas compartilhados que são executados em cada token. O router aplica uma ativação sigmoide sobre os logits dos especialistas e normaliza através da seleção top-k. A atenção alterna numa proporção de 3:1 entre camadas de janela deslizante (janela 4096, RoPE) e camadas de atenção global que não têm quaisquer embeddings posicionais.

Parâmetros — 218B no total, 25B ativos por token

Contexto — entrada de 16K e saída de 16K

Idiomas — inglês mais 49 outros, 50 no total

Idiomas de primeiro nível — Árabe Padrão Moderno, Alemão, Francês, Japonês, Coreano, Russo, Ucraniano

Pontos de verificação — BF16, FP8 e NVFP4 W4A16

Hardware mínimo — BF16: 4×B200 ou 8×H100; FP8: 2×B200 ou 4×H100; W4A16: 1×B200 ou 2×H100

Licença — CC BY-NC 4.0, com uso comercial direcionado ao Model Vault da Cohere

Qualidade reportada — WMT26 83.60, subindo para 84.36 com um fluxo de trabalho de tradução agêntico de múltiplas passagens

Duas dessas linhas merecem mais do que um marcador. A janela de contexto é de 16K de saída, o que é incomum para um modelo de tradução e é a diferença entre traduzir um parágrafo e traduzir um documento de procedimento inteiro em uma única passagem. E o número agêntico — 84,36 contra 83,60 — é a Cohere descrevendo um fluxo de trabalho, não um modelo: múltiplas passagens, presumivelmente com um agente decidindo o que retraduzir. Essa é a mesma ideia que a Cohere vendeu como "Deep Translation" com o Command A Translate em agosto de 2025, e ela reaparece aqui em escala maior.

Single-model scoreboard for North Small Translate 1.0 with six rows reading Total parameters 218B MoE, Active parameters 25B, Context 16K in / 16K out, Languages 50, License CC BY-NC 4.0, and WMT26 score 83.60 (unaudited), with a footer noting the figures come from Cohere's model card and release note and that the WMT26 metric is unnamed and not independently reproduced.

O que o repositório mostra que a nota de versão não mostra.

A nota de versão é um documento de marketing; o repositório é o documento de engenharia, e alguns detalhes ali importam mais do que as especificações de destaque. O serving é suportado por meio do vLLM com cohere_melody>=0.9.0, e a Cohere recomenda decodificação greedy explicitamente "correspondendo à implantação em produção" — um modelo de tradução que manda desativar a amostragem é um modelo de tradução voltado para o determinismo, não para a escrita criativa. A saída é envolta em marcadores <|START_TEXT|> e <|END_TEXT|>, e a análise espera a biblioteca melody da Cohere. Esses marcadores não estão registrados como tokens especiais, então definir skip_special_tokens=True não os removerá — uma pequena armadilha que produzirá lixo visível de tags em uma integração ingênua.

Há também um template de chat com uma instrução de sistema padrão que apresenta o modelo sob o nome "North Small Translate" e afirma que ele foi criado pela Cohere. Mensagens de sistema por conversa são anexadas a esse padrão em vez de substituí-lo — há um espaço separado platform_instruction_override caso você precise deslocá-lo. É o tipo de encanamento que indica que este é um modelo de chat pós-treinado vestindo uma tarefa de tradução, não um encoder-decoder clássico.

Onde ele se posiciona na linha da Cohere

A linhagem é o contexto mais útil para interpretar este lançamento, e ela está documentada. O Command A Translate, anunciado em 28 de agosto de 2025, foi o primeiro modelo de tradução automática da Cohere — 111B parâmetros, uma janela de 16K dividida em 8K de entrada e 8K de saída, 23 idiomas, e uma versão de pesquisa CC-BY-NC. O North Small Translate 1.0 mais que dobra o número de idiomas, para 50, triplica o número de parâmetros ativos, para 25B, mantém a janela total em 16K, mas torna toda ela utilizável para saída, e troca um único modelo quase denso por um MoE esparso com a mesma pegada que a Cohere já usa em outros pontos da linha North.

A leitura honesta é que este é um derivado especializado do núcleo MoE atual da Cohere, pós-treinado para tradução, em vez de uma nova arquitetura. A ficha do modelo diz exatamente isso em uma linha — ele foi "pós-treinado especificamente para qualidade de tradução" — e não divulga nada sobre o corpus de treinamento, a contagem de tokens ou o pipeline de dados. O relatório técnico do Command A Translate descreveu em detalhes uma técnica de dados com filtragem por dificuldade; nada equivalente foi publicado para este modelo.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

O que realmente não está confirmado

É aqui que um lançamento silencioso precisa ser conduzido com cuidado, porque a ausência de ruído corta nos dois sentidos. A seguir estão coisas que ninguém fora da Cohere sabe atualmente:

O que o WMT26 83.60 mede. Nenhuma métrica é indicada na ficha do modelo ou na nota de lançamento, e nenhuma página de resultados do WMT26 foi publicada para este modelo. "83.60" sem o nome de uma métrica é um número, não um resultado.

Se a pontuação é reproduzível. Nenhum grupo independente executou este modelo. Todos os números neste artigo são da própria Cohere.

O que o fluxo de trabalho agêntico de múltiplas passagens realmente é. O número 84,36 é descrito em uma única oração. Trata-se de uma alegação em nível de sistema anexada a um cartão de modelo, e o sistema não é especificado.

Quanto custa uma licença comercial. A Cohere encaminha as empresas para o departamento de vendas e o Model Vault. Nenhum preço é publicado na página de documentação.

Se um post de blog está por vir. A Cohere tem um blog. O Command A Translate ganhou um post completo. Este modelo recebeu uma nota de versão.

Nada disso é uma acusação. É a diferença entre um modelo que você pode avaliar e um produto que você pode comprar e, neste momento, o North Small Translate 1.0 está firmemente no primeiro caso — além de uma coisa que você pode usar de graça.

O nível gratuito é a parte que você pode realmente testar hoje.

Ao contrário de um lançamento exclusivamente de pesos, este tem uma superfície ativa: o North Small Translate 1.0 está no plano gratuito da Cohere por meio da API Chat V2, e a nota de lançamento da Cohere diz que ele é gratuito tanto para chaves de teste quanto para chaves de produção até que os limites de taxa sejam atingidos. Essa é uma janela de avaliação excepcionalmente permissiva — você não precisa de um contrato pago para passar tráfego real por ele. Os pesos, por outro lado, são o conjunto FP8 no Hugging Face sob a licença CC BY-NC 4.0, então a auto-hospedagem para fins comerciais está fora de questão sem um acordo do Model Vault.

A forma prática da decisão, então: avalie pela API sem custo e pague apenas se decidir colocá-la em produção. Esse é um teste de baixo risco, e é exatamente para isso que uma camada de roteamento é feita. Se você já chama tradução através do OrcaRouter — uma única chave para um catálogo de mais de 200 modelos, com o preço de tabela do fornecedor repassado com 0% de markup — a pergunta avaliável não é "devo migrar", mas sim "isto supera o que já uso nos meus próprios documentos?", e você pode responder passando o mesmo texto pelos dois. Um fornecedor que reduz o preço é uma alteração ao vivo do nosso lado no mesmo dia, porque não há spread de revendedor adicionado por cima. E, para um modelo com um único benchmark não reproduzido e sem avaliação de terceiros, o failover é o mecanismo que permite experimentá-lo sem apostar um caminho de produção nele: o seu tráfego continua fluindo para o modelo que já funciona enquanto o novo é avaliado com entradas reais.

Screenshot of Cohere's Release Notes page showing the date badge September 9, 2026 above the heading "Announcing Cohere's North Small Translate", followed by the key features list (218 billion total parameters with 25 billion active, free-tier Chat V2 API, FP8 open weights under CC BY-NC 4.0, suggested hardware two H100s or one B200) and the technical details listing model name north-small-translate-1-0, context length 16K and FP8 open-weights format.

O que transformaria isto de uma nota de versão em um lançamento?

Três coisas fariam o North Small Translate 1.0 passar de uma entrada de documentação para um concorrente de verdade, e todas as três são observáveis de fora. Primeira: uma métrica nomeada para o número do WMT26 — um 83,60 com uma métrica associada pode ser comparado, e um sem métrica não pode. Segunda: uma primeira reprodução independente, seja ela proveniente da própria campanha de avaliação do WMT26, seja de um terceiro executando testes no estilo FLORES sobre os pesos FP8. Terceira: um post de lançamento de fato, o que sinalizaria que a Cohere pretende vender isto, e não apenas tê-lo publicado.

Até então, a postura correta é a que as evidências sustentam: um especialista em tradução MoE de 218B genuinamente interessante, com um caminho de avaliação gratuito, cinquenta idiomas e uma janela de saída do tamanho de um documento, cujas alegações de qualidade repousam inteiramente na palavra de seu fabricante. A Cohere lançou quatro modelos com capacidade de tradução em treze meses e apenas um deles ganhou um post no blog. Qual desses dois fatos é o mais informativo é a pergunta sobre a qual vale a pena refletir.