Tarjeta principal de North Small Translate 1.0 encabezada con el nombre del modelo y la línea «el modelo de traducción de 218B de Cohere, documentado solo en las notas de la versión», sobre una tarjeta que enumera 218B totales / 25B activos MoE, 50 idiomas y 16K de entrada / 16K de salida, junto a un motivo de documento etiquetado «sin publicación de lanzamiento».
Guides & Insights

North Small Translate 1.0: el modelo grande más silencioso de Cohere hasta ahora

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

North Small Translate 1.0 es un modelo de traducción de mezcla de expertos de 218 mil millones de parámetros de Cohere y Cohere Labs, y llegó tal como lo hacen muy pocos lanzamientos a escala de frontera: con una nota de lanzamiento y nada más. El registro de cambios de Cohere fecha el anuncio el 9 de septiembre de 2026, pero los tres checkpoints ya llevaban en Hugging Face detrás de una puerta de acceso desde el 14 de agosto: tres semanas y media de pesos sin entrada de blog, sin cobertura de prensa y sin hilo de lanzamiento. Cuando se escribió esto, el repositorio principal mostraba cero «me gusta», 26 descargas en el último mes y una única discusión de la comunidad sin respuesta. Un modelo de 218B con una puntuación WMT26 reportada por el proveedor de 83.60 que casi nadie ha notado merece una explicación, así que esto es lo que la documentación y el repositorio realmente establecen, separado de lo que no.

Las cifras a las que Cohere puso su nombre

Comienza por las especificaciones, porque no son ambiguas y son la parte de este lanzamiento que se puede conocer por completo. North Small Translate 1.0 es un modelo de mezcla de expertos dispersa solo con decodificador — la misma forma que Cohere usó para Command A+ en mayo de 2026 — con 128 expertos, ocho activados por token, más expertos compartidos que se ejecutan en cada token. El enrutador aplica una activación sigmoide sobre los logits de los expertos y normaliza a través de la selección top-k. La atención alterna en una proporción de 3:1 entre capas de ventana deslizante (ventana 4.096, RoPE) y capas de atención global que no llevan embeddings posicionales en absoluto.

Parámetros — 218B en total, 25B activos por token

Contexto — 16K de entrada y 16K de salida

Idiomas — inglés y otros 49 más, 50 en total

Idiomas de primer nivel — árabe estándar moderno, alemán, francés, japonés, coreano, ruso, ucraniano

Puntos de control — BF16, FP8 y NVFP4 W4A16

Hardware mínimo — BF16: 4×B200 u 8×H100; FP8: 2×B200 o 4×H100; W4A16: 1×B200 o 2×H100

Licencia — CC BY-NC 4.0, con el uso comercial dirigido al Model Vault de Cohere

Calidad reportada — WMT26 83,60, aumentando a 84,36 con un flujo de trabajo de traducción agéntico de múltiples pasadas

Dos de esas líneas merecen más que una viñeta. La ventana de contexto es de 16K salida, lo cual es inusual para un modelo de traducción y marca la diferencia entre traducir un párrafo y traducir todo un documento de procedimiento en una sola pasada. Y la cifra agéntica —84,36 frente a 83,60— es Cohere describiendo un flujo de trabajo, no un modelo: múltiples pasadas, presumiblemente con un agente que decide qué volver a traducir. Esa es la misma idea que Cohere vendió como "Deep Translation" con Command A Translate en agosto de 2025, y reaparece aquí a mayor escala.

Single-model scoreboard for North Small Translate 1.0 with six rows reading Total parameters 218B MoE, Active parameters 25B, Context 16K in / 16K out, Languages 50, License CC BY-NC 4.0, and WMT26 score 83.60 (unaudited), with a footer noting the figures come from Cohere's model card and release note and that the WMT26 metric is unnamed and not independently reproduced.

Lo que el repositorio muestra que la nota de la versión no

La nota de lanzamiento es un documento de marketing; el repositorio es el de ingeniería, y algunos detalles de allí importan más que las especificaciones principales. El servicio se admite a través de vLLM con cohere_melody>=0.9.0, y Cohere recomienda decodificación greedy explícitamente «coincidiendo con el despliegue en producción» — un modelo de traducción que te dice que desactives el muestreo es un modelo de traducción orientado al determinismo, no a la escritura creativa. La salida se envuelve en <|START_TEXT|> y <|END_TEXT|> marcadores, y el parseo espera la biblioteca melody de Cohere. Esos marcadores no están registrados como tokens especiales, así que establecer skip_special_tokens=True no los eliminará — una pequeña trampa que producirá residuos de etiquetas visibles en una integración ingenua.

También hay una plantilla de chat con una instrucción de sistema predeterminada que presenta el modelo con el nombre "North Small Translate" y afirma que está creado por Cohere. Los mensajes de sistema por conversación se añaden a ese valor predeterminado en lugar de reemplazarlo — hay un espacio platform_instruction_override aparte si necesitas desplazarlo. Es el tipo de infraestructura que te indica que este es un modelo de chat postentrenado con una tarea de traducción encima, no un codificador-decodificador clásico.

Dónde se ubica en la línea de Cohere

El linaje es el contexto más útil para leer este lanzamiento, y está documentado. Command A Translate, anunciado el 28 de agosto de 2025, fue el primer modelo de traducción automática de Cohere: 111B de parámetros, una ventana de 16K dividida en 8K de entrada y 8K de salida, 23 idiomas y una versión de investigación CC-BY-NC. North Small Translate 1.0 más que duplica el número de idiomas hasta 50, triplica el número de parámetros activos hasta 25B, mantiene la ventana total en 16K pero hace que toda ella sea utilizable para la salida, y cambia un único modelo más bien denso por un MoE disperso con la misma huella que Cohere ya usa en otras partes de la línea North.

La lectura honesta es que esto es un derivado especializado del núcleo MoE actual de Cohere, entrenado posteriormente para traducción, y no una arquitectura nueva. La ficha del modelo lo dice en una línea —fue "entrenado específicamente para la calidad de traducción"— y no revela nada sobre el corpus de entrenamiento, el número de tokens ni el pipeline de datos. El informe técnico de Command A Translate describió en detalle una técnica de filtrado de datos por dificultad; no se ha publicado nada equivalente para este modelo.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

¿Qué no está confirmado de verdad?

Aquí es donde un lanzamiento silencioso debe manejarse con cuidado, porque la ausencia de ruido corta en ambos sentidos. Lo siguiente son cosas que nadie fuera de Cohere conoce actualmente:

Qué mide el 83.60 de WMT26. No se menciona ninguna métrica en la ficha del modelo ni en la nota de la versión, y no se ha publicado ninguna página de resultados de WMT26 correspondiente a este modelo. "83.60" sin el nombre de una métrica es un número, no un resultado.

Si la puntuación se reproduce. Ningún grupo independiente ha ejecutado este modelo. Todas las cifras de este artículo son de Cohere.

Qué es en realidad el flujo de trabajo agéntico de múltiples pasadas. La cifra de 84.36 se describe en una sola cláusula. Es una afirmación a nivel de sistema adjunta a una tarjeta de modelo, y el sistema no se especifica.

Cuánto cuesta una licencia comercial. Cohere dirige a las empresas a ventas y a Model Vault. No se publica ningún precio en la página de documentación.

Si habrá una entrada de blog. Cohere tiene un blog. Command A Translate recibió una completa. Este modelo recibió una nota de lanzamiento.

Nada de eso es una acusación. Es la diferencia entre un modelo que puedes evaluar y un producto que puedes comprar, y ahora mismo North Small Translate 1.0 es decididamente lo primero — además de una cosa que puedes usar gratis.

El nivel gratuito es la parte que realmente puedes probar hoy.

A diferencia de una simple publicación de pesos, esta tiene una superficie activa: North Small Translate 1.0 está en el nivel gratuito de Cohere a través de la Chat V2 API, y la nota de lanzamiento de Cohere dice que es gratis tanto para claves de prueba como para claves de producción hasta que se alcancen los límites de frecuencia. Esa es una ventana de evaluación inusualmente permisiva: no necesitas un contrato de pago para enviarle tráfico real. Los pesos, mientras tanto, son el conjunto FP8 en Hugging Face bajo CC BY-NC 4.0, así que el autoalojamiento con fines comerciales queda descartado sin un acuerdo de Model Vault.

La forma práctica de la decisión, entonces, es esta: evalúa a través de la API sin costo y paga solo si decides lanzarlo. Es una prueba de bajo riesgo, y es justo el tipo de cosa para la que está hecha una capa de enrutamiento. Si ya usas la traducción a través de OrcaRouter — una sola clave para un catálogo de más de 200 modelos, el precio de lista del proveedor se traslada con un 0 % de margen — la pregunta que se puede evaluar no es “¿migro?” sino “¿esto supera a lo que ya uso en mis propios documentos?”, y puedes responderla pasando el mismo texto por ambos. Un proveedor que baja su precio es un cambio en vivo de nuestro lado el mismo día, porque no hay ningún margen de revendedor añadido por encima. Y para un modelo con un único benchmark no reproducido y sin evaluación de terceros, la conmutación por error es el mecanismo que te permite probarlo sin poner en juego una ruta de producción por él: tu tráfico sigue fluyendo hacia el modelo que ya funciona mientras el nuevo se evalúa con entradas reales.

Screenshot of Cohere's Release Notes page showing the date badge September 9, 2026 above the heading "Announcing Cohere's North Small Translate", followed by the key features list (218 billion total parameters with 25 billion active, free-tier Chat V2 API, FP8 open weights under CC BY-NC 4.0, suggested hardware two H100s or one B200) and the technical details listing model name north-small-translate-1-0, context length 16K and FP8 open-weights format.

¿Qué haría que esto pasara de ser una nota de lanzamiento a un lanzamiento?

Tres cosas convertirían a North Small Translate 1.0 de una entrada de documentación en un competidor real, y las tres son observables desde fuera. Primera, una métrica con nombre para la cifra de WMT26: un 83.60 con una métrica adjunta se puede comparar, y uno sin ella, no. Segunda, una primera reproducción independiente, ya sea que provenga de la propia campaña de evaluación de WMT26 o de un tercero que ejecute pruebas al estilo FLORES sobre los pesos FP8. Tercera, una publicación de lanzamiento real, que señalaría que Cohere tiene la intención de vender esto en lugar de simplemente haberlo publicado.

Hasta entonces, la postura correcta es la que respaldan las evidencias: un especialista en traducción MoE de 218B genuinamente interesante, con una vía de evaluación gratuita, cincuenta idiomas y una ventana de salida de la longitud de un documento, cuyas afirmaciones de calidad se sustentan enteramente en la palabra de su creador. Cohere ha lanzado cuatro modelos capaces de traducir en trece meses y solo uno de ellos recibió una entrada de blog. Cuál de esos dos hechos es más informativo es la pregunta sobre la que vale la pena detenerse.