
North Small Translate 1.0: O Modelo Grande Mais Silencioso da Cohere Até Agora
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 por 1M de tokens
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleNOVOGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenNOVOQwen: Qwen3.8 Max (0902)2026-09-0240Inteligência72Código
- anthropicNOVOAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligência69Código
North Small Translate 1.0 é um modelo de tradução de mistura de especialistas com 218 bilhões de parâmetros da Cohere e do Cohere Labs, e chegou do jeito que muito poucos lançamentos em escala de fronteira chegam: com uma nota de lançamento e nada mais. O changelog da Cohere data o anúncio em 9 de setembro de 2026, mas os três checkpoints já estavam no Hugging Face atrás de uma barreira de acesso desde 14 de agosto — três semanas e meia de pesos sem post no blog, sem cobertura da imprensa e sem thread de lançamento. Quando isto foi escrito, o repositório principal mostrava zero curtidas, 26 downloads no último mês e uma única discussão da comunidade sem resposta. Um modelo de 218B com uma pontuação WMT26 de 83,60 relatada pelo fornecedor que quase ninguém notou vale a pena explicar, então aqui está o que a documentação e o repositório de fato estabelecem, separado daquilo que eles não estabelecem.
Os números que a Cohere assinou
Comece pelas especificações, porque não são ambíguas e são a parte desta versão que é plenamente conhecível. O North Small Translate 1.0 é um modelo de mistura de especialistas esparso, apenas com descodificador — a mesma arquitetura que a Cohere usou para o Command A+ em maio de 2026 — com 128 especialistas, oito ativados por token, além de especialistas compartilhados que são executados em cada token. O router aplica uma ativação sigmoide sobre os logits dos especialistas e normaliza através da seleção top-k. A atenção alterna numa proporção de 3:1 entre camadas de janela deslizante (janela 4096, RoPE) e camadas de atenção global que não têm quaisquer embeddings posicionais.
• Parâmetros — 218B no total, 25B ativos por token
• Contexto — entrada de 16K e saída de 16K
• Idiomas — inglês mais 49 outros, 50 no total
• Idiomas de primeiro nível — Árabe Padrão Moderno, Alemão, Francês, Japonês, Coreano, Russo, Ucraniano
• Pontos de verificação — BF16, FP8 e NVFP4 W4A16
• Hardware mínimo — BF16: 4×B200 ou 8×H100; FP8: 2×B200 ou 4×H100; W4A16: 1×B200 ou 2×H100
• Licença — CC BY-NC 4.0, com uso comercial direcionado ao Model Vault da Cohere
• Qualidade reportada — WMT26 83.60, subindo para 84.36 com um fluxo de trabalho de tradução agêntico de múltiplas passagens
Duas dessas linhas merecem mais do que um marcador. A janela de contexto é de 16K de saída, o que é incomum para um modelo de tradução e é a diferença entre traduzir um parágrafo e traduzir um documento de procedimento inteiro em uma única passagem. E o número agêntico — 84,36 contra 83,60 — é a Cohere descrevendo um fluxo de trabalho, não um modelo: múltiplas passagens, presumivelmente com um agente decidindo o que retraduzir. Essa é a mesma ideia que a Cohere vendeu como "Deep Translation" com o Command A Translate em agosto de 2025, e ela reaparece aqui em escala maior.

O que o repositório mostra que a nota de versão não mostra.
A nota de versão é um documento de marketing; o repositório é o documento de engenharia, e alguns detalhes ali importam mais do que as especificações de destaque. O serving é suportado por meio do vLLM com cohere_melody>=0.9.0, e a Cohere recomenda decodificação greedy explicitamente "correspondendo à implantação em produção" — um modelo de tradução que manda desativar a amostragem é um modelo de tradução voltado para o determinismo, não para a escrita criativa. A saída é envolta em marcadores <|START_TEXT|> e <|END_TEXT|>, e a análise espera a biblioteca melody da Cohere. Esses marcadores não estão registrados como tokens especiais, então definir skip_special_tokens=True não os removerá — uma pequena armadilha que produzirá lixo visível de tags em uma integração ingênua.
Há também um template de chat com uma instrução de sistema padrão que apresenta o modelo sob o nome "North Small Translate" e afirma que ele foi criado pela Cohere. Mensagens de sistema por conversa são anexadas a esse padrão em vez de substituí-lo — há um espaço separado platform_instruction_override caso você precise deslocá-lo. É o tipo de encanamento que indica que este é um modelo de chat pós-treinado vestindo uma tarefa de tradução, não um encoder-decoder clássico.
Onde ele se posiciona na linha da Cohere
A linhagem é o contexto mais útil para interpretar este lançamento, e ela está documentada. O Command A Translate, anunciado em 28 de agosto de 2025, foi o primeiro modelo de tradução automática da Cohere — 111B parâmetros, uma janela de 16K dividida em 8K de entrada e 8K de saída, 23 idiomas, e uma versão de pesquisa CC-BY-NC. O North Small Translate 1.0 mais que dobra o número de idiomas, para 50, triplica o número de parâmetros ativos, para 25B, mantém a janela total em 16K, mas torna toda ela utilizável para saída, e troca um único modelo quase denso por um MoE esparso com a mesma pegada que a Cohere já usa em outros pontos da linha North.
A leitura honesta é que este é um derivado especializado do núcleo MoE atual da Cohere, pós-treinado para tradução, em vez de uma nova arquitetura. A ficha do modelo diz exatamente isso em uma linha — ele foi "pós-treinado especificamente para qualidade de tradução" — e não divulga nada sobre o corpus de treinamento, a contagem de tokens ou o pipeline de dados. O relatório técnico do Command A Translate descreveu em detalhes uma técnica de dados com filtragem por dificuldade; nada equivalente foi publicado para este modelo.

O que realmente não está confirmado
É aqui que um lançamento silencioso precisa ser conduzido com cuidado, porque a ausência de ruído corta nos dois sentidos. A seguir estão coisas que ninguém fora da Cohere sabe atualmente:
• O que o WMT26 83.60 mede. Nenhuma métrica é indicada na ficha do modelo ou na nota de lançamento, e nenhuma página de resultados do WMT26 foi publicada para este modelo. "83.60" sem o nome de uma métrica é um número, não um resultado.
• Se a pontuação é reproduzível. Nenhum grupo independente executou este modelo. Todos os números neste artigo são da própria Cohere.
• O que o fluxo de trabalho agêntico de múltiplas passagens realmente é. O número 84,36 é descrito em uma única oração. Trata-se de uma alegação em nível de sistema anexada a um cartão de modelo, e o sistema não é especificado.
• Quanto custa uma licença comercial. A Cohere encaminha as empresas para o departamento de vendas e o Model Vault. Nenhum preço é publicado na página de documentação.
• Se um post de blog está por vir. A Cohere tem um blog. O Command A Translate ganhou um post completo. Este modelo recebeu uma nota de versão.
Nada disso é uma acusação. É a diferença entre um modelo que você pode avaliar e um produto que você pode comprar e, neste momento, o North Small Translate 1.0 está firmemente no primeiro caso — além de uma coisa que você pode usar de graça.
O nível gratuito é a parte que você pode realmente testar hoje.
Ao contrário de um lançamento exclusivamente de pesos, este tem uma superfície ativa: o North Small Translate 1.0 está no plano gratuito da Cohere por meio da API Chat V2, e a nota de lançamento da Cohere diz que ele é gratuito tanto para chaves de teste quanto para chaves de produção até que os limites de taxa sejam atingidos. Essa é uma janela de avaliação excepcionalmente permissiva — você não precisa de um contrato pago para passar tráfego real por ele. Os pesos, por outro lado, são o conjunto FP8 no Hugging Face sob a licença CC BY-NC 4.0, então a auto-hospedagem para fins comerciais está fora de questão sem um acordo do Model Vault.
A forma prática da decisão, então: avalie pela API sem custo e pague apenas se decidir colocá-la em produção. Esse é um teste de baixo risco, e é exatamente para isso que uma camada de roteamento é feita. Se você já chama tradução através do OrcaRouter — uma única chave para um catálogo de mais de 200 modelos, com o preço de tabela do fornecedor repassado com 0% de markup — a pergunta avaliável não é "devo migrar", mas sim "isto supera o que já uso nos meus próprios documentos?", e você pode responder passando o mesmo texto pelos dois. Um fornecedor que reduz o preço é uma alteração ao vivo do nosso lado no mesmo dia, porque não há spread de revendedor adicionado por cima. E, para um modelo com um único benchmark não reproduzido e sem avaliação de terceiros, o failover é o mecanismo que permite experimentá-lo sem apostar um caminho de produção nele: o seu tráfego continua fluindo para o modelo que já funciona enquanto o novo é avaliado com entradas reais.

O que transformaria isto de uma nota de versão em um lançamento?
Três coisas fariam o North Small Translate 1.0 passar de uma entrada de documentação para um concorrente de verdade, e todas as três são observáveis de fora. Primeira: uma métrica nomeada para o número do WMT26 — um 83,60 com uma métrica associada pode ser comparado, e um sem métrica não pode. Segunda: uma primeira reprodução independente, seja ela proveniente da própria campanha de avaliação do WMT26, seja de um terceiro executando testes no estilo FLORES sobre os pesos FP8. Terceira: um post de lançamento de fato, o que sinalizaria que a Cohere pretende vender isto, e não apenas tê-lo publicado.
Até então, a postura correta é a que as evidências sustentam: um especialista em tradução MoE de 218B genuinamente interessante, com um caminho de avaliação gratuito, cinquenta idiomas e uma janela de saída do tamanho de um documento, cujas alegações de qualidade repousam inteiramente na palavra de seu fabricante. A Cohere lançou quatro modelos com capacidade de tradução em treze meses e apenas um deles ganhou um post no blog. Qual desses dois fatos é o mais informativo é a pergunta sobre a qual vale a pena refletir.
