Tarjeta hero para el enfrentamiento titulado «North Small Translate 1.0 vs NLLB-200» con el subtítulo «50 idiomas contra 200», por encima de dos tarjetas: North Small Translate 1.0 (218B MoE / 25B activos, 2026, contexto de 16K) y NLLB-200 (MoE insignia de 54,5B, 2022, 200 idiomas).
Guides & Insights

North Small Translate 1.0 vs NLLB-200: 50 idiomas frente a 200

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El modelo más reciente cubre una cuarta parte de los idiomas. North Small Translate 1.0, que Cohere documentó en sus notas de la versión del 9 de septiembre de 2026, traduce entre el inglés y otros 49 idiomas. NLLB-200, la familia No Language Left Behind que Meta lanzó en julio de 2022, cubre 200. Si la cantidad de idiomas fuera toda la comparación, este sería un artículo breve, pero no lo es: los dos modelos son máquinas diferentes construidas para trabajos diferentes, y la brecha de cuatro años entre ellos se manifiesta de maneras que no tienen nada que ver con cuántos idiomas aparecen en una lista. Lo que sigue es para qué sirve realmente cada uno, cuánto cuesta ejecutarlos y adónde te lleva el licenciamiento.

El número de cobertura, sinceramente

Doscientos frente a cincuenta es real, y es la razón más citada para mantener NLLB-200 en un stack. Meta lo entrenó con más de 18.000 millones de pares de oraciones con un énfasis explícito en idiomas de bajos recursos, y traduce directamente entre cualquier par en lugar de pivotar a través del inglés —una decisión de diseño que importa enormemente para, por ejemplo, bengalí a tamil, donde un sistema con pivote en inglés pierde calidad dos veces.

Lo que oculta el número es que la superposición entre las dos listas es la parte comercialmente útil. Los cincuenta idiomas de North Small Translate 1.0 incluyen alemán, francés, español, portugués, italiano, neerlandés, polaco, checo, japonés, coreano, chino simplificado y tradicional, árabe, hebreo, hindi, bengalí, tamil, telugu, tailandés, turco, vietnamita, indonesio, malayo, ruso y ucraniano — los idiomas que representan la abrumadora mayoría del volumen de localización empresarial. NLLB-200 también cubre todos esos, además de aproximadamente 150 más que North Small Translate 1.0 no toca en absoluto. Así que la pregunta no es cuál de las listas es más larga. Es si tu tráfico incluye idiomas que solo uno de los dos admite.

Dos máquinas diferentes

La brecha arquitectónica es la parte que determina lo que puedes construir. El checkpoint publicado más grande de NLLB-200 es un modelo de mezcla de expertos con compuerta dispersa de aproximadamente 54.5 mil millones de parámetros, y sus hermanos densos funcionan con 3.3B, 1.3B y hasta un destilado de 600M. Todos son modelos de secuencia a secuencia con arquitectura encoder-decoder de la línea M2M-100: le entregas al tokenizador un segmento de origen y devuelve un segmento traducido. No hay plantilla de chat, ni prompt de sistema, ni estructura multiturno, y los checkpoints publicados están construidos en torno a la traducción a nivel de segmento: la propia tarjeta de modelo de Meta indica que el modelo se entrenó con longitudes de entrada que no superan los 512 tokens, y advierte que las secuencias más largas se degradan. El presupuesto combinado del tokenizador para origen y destino es de 1,024 tokens. La tarjeta de NLLB-200 también lo describe como un modelo de investigación no publicado para despliegue en producción, y señala que no está pensado para la traducción de documentos, la distinción que más nítidamente lo separa de lo que construyó Cohere.

North Small Translate 1.0 es la forma opuesta. Es un MoE disperso de solo decodificador con 218 mil millones de parámetros totales y 25 mil millones activos por token, 128 expertos con ocho activos más expertos compartidos, y una atención que alterna capas de ventana deslizante (ventana 4.096, RoPE) con capas de atención global que no llevan incrustaciones posicionales. Funciona detrás de una plantilla de chat con una instrucción de sistema predeterminada, y su ventana es de 16K tokens de entrada y 16K tokens de salida. Ese presupuesto de salida lo dice todo: este es un modelo construido para que se le entregue un documento y se le pida un documento de vuelta, no un modelo construido para que se le entregue una frase.

Parámetros totales — North Small Translate 1.0: 218B MoE (25B activos) vs NLLB-200: 54,5B MoE insignia, 600M–3,3B densos

Arquitectura — MoE causal de solo decodificador con plantilla de chat frente a seq2seq codificador-decodificador sin plantilla de chat

Contexto — 16K de entrada y 16K de salida frente a nivel de segmento, presupuesto del tokenizador de 1.024 tokens combinados

Idiomas — 50 (inglés + 49) vs 200

Pares directos — estratificación centrada en el inglés frente a cualquier-a-cualquiera sin un pivote en inglés

Licencia — CC BY-NC 4.0 vs CC BY-NC 4.0

Huella mínima — 1×B200 en W4A16, 2×B200 en FP8 frente a ~37 GB de VRAM a 4 bits para el 54B, el 600M se ejecuta en cualquier parte

Anunciado — 9 de septiembre de 2026 (pesos con acceso restringido en Hugging Face desde el 14 de agosto) vs. julio de 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

Lo que NLLB-200 todavía domina

Tres cosas, y no son sentimentales. La primera es la cola larga: si necesitas oromo, tigriña o cualquiera de las aproximadamente 150 lenguas fuera de la lista de North Small Translate 1.0, la decisión ya está tomada. La segunda es la huella en el extremo pequeño —el checkpoint destilado de 600M acumula 1,4 millones de descargas y funciona en hardware que ni siquiera cargaría los pesos de Cohere, lo que lo convierte en el único de los dos que encaja en un despliegue aislado o en el borde sin trucos de cuantización. La tercera es la madurez: NLLB-200 tiene cuatro años de herramientas, forks de cuantización e historias de guerra de producción a sus espaldas, además de un artículo de Nature revisado por pares de junio de 2024 que describe cómo se construyó. Cohere ha publicado una nota de lanzamiento.

La contrapartida es igualmente concreta. La ficha del modelo de NLLB-200 lo describe como un modelo de investigación que no se lanzó para su implementación en producción, y su checkpoint insignia de 54B es un peso pesado: aproximadamente 350GB de almacenamiento y del orden de 108–120GB de VRAM para servirlo sin comprimir. Meta no vende un endpoint NLLB alojado. Ejecutarlo a escala es tu problema, y es un problema real.

La trampa de las licencias en ambos lados

Esta es la parte que sorprende a la gente, porque los dos modelos llevan la misma licencia y no es la que la mayoría de los equipos supone. Tanto NLLB-200 como North Small Translate 1.0 se publican bajo Creative Commons Attribution-NonCommercial 4.0. Ninguno es utilizable en un producto comercial tal como se publica. La restricción no comercial de NLLB-200 ha sido lo bastante polémica como para que exista un proyecto comunitario llamado Open-NLLB específicamente para intentar crear un derivado utilizable comercialmente, lo que choca directamente con la licencia de la que deriva. La ruta de Cohere es más limpia: comprar una licencia comercial y desplegar a través de Model Vault, con los pesos FP8 gratuitos en Hugging Face solo para trabajo no comercial.

Hay una asimetría que vale la pena señalar. Cohere ejecuta North Small Translate 1.0 en el nivel gratuito de su Chat V2 API, gratis para claves de prueba y de producción hasta que se alcancen los límites de frecuencia; así que puedes hacer una evaluación real a costo cero y firmar algo solo si lo lanzas. NLLB-200 te da los pesos y nada más.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Desplegando cualquiera de los dos

North Small Translate 1.0 se distribuye en tres checkpoints —BF16, FP8 y NVFP4 W4A16— con un hardware mínimo publicado para cada uno: cuatro B200 u ocho H100 para BF16, dos B200 o cuatro H100 para FP8, y un único B200 o dos H100 para W4A16. El servicio se realiza a través de vLLM con cohere_melody>=0.9.0, y Cohere recomienda decodificación greedy, lo que coincide con su configuración de producción. La salida se envuelve en los marcadores <|START_TEXT|> y <|END_TEXT|>, que no están registrados como tokens especiales, por lo que un skip_special_tokens=True ingenuo los dejará en tu salida.

NLLB-200 se despliega a través de las rutas estándar de transformers o fairseq con una tolerancia mucho mayor para hardware pequeño, ya que los checkpoints destilados de 600M y 1.3B son los que la mayoría de la gente realmente ejecuta. El MoE de 54B es el que requiere planificación.

La cuestión de enrutamiento que este enfrentamiento realmente representa

Ni North Small Translate 1.0 ni NLLB-200 figuran en el catálogo de OrcaRouter hoy, así que este no es un artículo sobre elegir uno de nuestra estantería. Vale la pena nombrar la forma del problema de todos modos, porque «un modelo para los idiomas de primer nivel, otro para la cola larga» es una política de enrutamiento — y una política de enrutamiento es el tipo de cosa que debería vivir en la configuración en lugar del código de la aplicación. El DSL de enrutamiento de OrcaRouter expresa exactamente eso como YAML más reglas CEL, de modo que una regla de par de idiomas puede enviar los pares europeos a un modelo y recurrir a otro cuando un par no es compatible, y las cadenas de conmutación por error significan que un upstream que empieza a devolver errores no se convierta en tu caída. Eso es una clave y una integración en un catálogo de más de 200 modelos al precio de lista del proveedor con 0 % de margen, en lugar de un segundo contrato con un proveedor para cada modelo de traducción que decidas probar.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

Cuál deberías elegir

Si tu estrategia de contenido abarca idiomas fuera de los cincuenta de Cohere, quédate con NLLB-200 y dalo por sentado: ninguna cantidad de modernidad arquitectónica compensa la falta de un idioma. Si estás haciendo localización empresarial a los idiomas que Cohere enumeró, trabaja dentro de un documento en lugar de una oración, y estás dispuesto a comprar una licencia comercial, North Small Translate 1.0 es el modelo más capaz en todas las dimensiones que la documentación revela, con la advertencia importante de que su única evidencia de calidad es una cifra de proveedor no reproducida. Si estás haciendo prototipos y no tienes presupuesto, el nivel gratuito de Cohere hace que esa evaluación sea casi gratuita, lo cual es una mejor posición inicial que la de NLLB-200, donde el precio de averiguarlo es alquilar una GPU.

La manera útil de mantener ambos hechos a la vez: NLLB-200 es el modelo que llega a los idiomas a los que ningún otro llega, y se creó en 2022 para la traducción de investigación a nivel de oración. North Small Translate 1.0 es el modelo que hace menos idiomas, pero mejor, y se creó en 2026 para documentos. Elegir entre ambos no es realmente un juicio de calidad. Es una cuestión de qué idiomas lanzas realmente.