Carte principale pour l’affrontement intitulé « North Small Translate 1.0 vs NLLB-200 », avec le sous-titre « 50 langues contre 200 », au-dessus de deux cartes : North Small Translate 1.0 (218B MoE / 25B actifs, 2026, contexte 16K) et NLLB-200 (54.5B MoE phare, 2022, 200 langues).
Guides & Insights

North Small Translate 1.0 vs NLLB-200 : 50 langues contre 200

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Le nouveau modèle couvre un quart des langues. North Small Translate 1.0, que Cohere a documenté dans ses notes de version du 9 septembre 2026, traduit entre l'anglais et 49 autres langues. NLLB-200, la famille No Language Left Behind publiée par Meta en juillet 2022, en couvre 200. Si le nombre de langues constituait toute la comparaison, cet article serait court, mais ce n'est pas le cas : les deux modèles sont des machines différentes conçues pour des tâches différentes, et l'écart de quatre ans entre eux se manifeste d'une manière qui n'a rien à voir avec le nombre de langues figurant sur une liste. Ce qui suit décrit ce pour quoi chacun est réellement utile, ce qu'ils coûtent à exploiter et où la licence vous mène.

Le chiffre de couverture, honnêtement.

Deux cents contre cinquante, c’est bien réel, et c’est la raison la plus citée pour garder NLLB-200 dans une stack. Meta l’a entraîné sur plus de 18 milliards de paires de phrases avec une insistance explicite sur les langues à faibles ressources, et il traduit directement entre n’importe quelle paire plutôt que de passer par l’anglais — un choix de conception qui compte énormément pour, disons, le bengali vers le tamoul, où un système à pivot anglais perd en qualité deux fois.

Ce que le nombre dissimule, c’est que le chevauchement entre les deux listes est la partie commercialement utile. Les cinquante langues de North Small Translate 1.0 comprennent l’allemand, le français, l’espagnol, le portugais, l’italien, le néerlandais, le polonais, le tchèque, le japonais, le coréen, le chinois simplifié et le chinois traditionnel, l’arabe, l’hébreu, l’hindi, le bengali, le tamoul, le télougou, le thaï, le turc, le vietnamien, l’indonésien, le malais, le russe et l’ukrainien — les langues qui représentent la grande majorité du volume de localisation en entreprise. NLLB-200 couvre aussi toutes celles-ci, plus environ 150 autres que North Small Translate 1.0 ne touche pas du tout. La question n’est donc pas de savoir quelle liste est la plus longue. Elle est de savoir si votre trafic comprend des langues que seule l’une des deux prend en charge.

Deux machines différentes

L'écart d'architecture est la partie qui détermine ce que vous pouvez construire. Le plus grand checkpoint publié de NLLB-200 est un modèle de mélange d'experts à portes éparses d'environ 54,5 milliards de paramètres, et ses homologues denses fonctionnent à 3,3B, 1,3B, et jusqu'à un modèle distillé de 600M. Tous sont des modèles encodeur-décodeur de séquence à séquence dans la lignée M2M-100 : vous donnez au tokenizer un segment source, il renvoie un segment traduit. Il n'y a pas de template de chat, pas de prompt système, pas de structure multi-tours, et les checkpoints publiés sont conçus autour de la traduction au niveau du segment : la propre fiche modèle de Meta indique que le modèle a été entraîné avec des longueurs d'entrée ne dépassant pas 512 tokens, et avertit que les séquences plus longues se dégradent. Le budget combiné du tokenizer pour la source et la cible est de 1 024 tokens. La fiche de NLLB-200 le décrit également comme un modèle de recherche non publié pour un déploiement en production, et note qu'il n'est pas destiné à la traduction de documents — la distinction qui le sépare le plus nettement de ce que Cohere a construit.

North Small Translate 1.0 est de forme opposée. C'est un MoE creux de type décodeur seul, avec 218 milliards de paramètres au total et 25 milliards actifs par token, 128 experts avec huit actifs plus des experts partagés, et une attention qui alterne des couches à fenêtre glissante (fenêtre 4 096, RoPE) et des couches d'attention globale qui ne portent aucun embedding positionnel. Il tourne derrière un template de chat avec une instruction système par défaut, et sa fenêtre est de 16K tokens en entrée et 16K tokens en sortie. Ce budget de sortie est l'indice révélateur : c'est un modèle conçu pour qu'on lui confie un document et qu'on lui demande un document en retour, pas un modèle conçu pour qu'on lui confie une phrase.

Paramètres totaux — North Small Translate 1.0 : 218B MoE (25B actifs) vs NLLB-200 : 54,5B MoE phare, 600M–3,3B dense

Architecture — MoE causal à décodeur uniquement avec gabarit de chat vs seq2seq encodeur-décodeur sans gabarit de chat

Contexte — 16K en entrée et 16K en sortie par rapport au niveau du segment, budget du tokenizer de 1 024 tokens combinés

Langues — 50 (anglais + 49) vs 200

Paires directes — hiérarchisation centrée sur l’anglais vs tout-à-tout sans pivot anglais

Licence — CC BY-NC 4.0 vs CC BY-NC 4.0

Empreinte minimale — 1×B200 en W4A16, 2×B200 en FP8 contre ~37 Go de VRAM en 4 bits pour le 54B, le 600M tourne partout

Annoncé — 9 septembre 2026 (poids à accès restreint sur Hugging Face depuis le 14 août) vs juillet 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

Ce que NLLB-200 possède encore

Trois choses, et elles ne sont pas sentimentales. La première est la longue traîne : si vous avez besoin de l'oromo, du tigrigna ou de l'une des quelque 150 langues absentes de la liste de North Small Translate 1.0, la décision est déjà prise. La deuxième est l'empreinte aux petites tailles — le checkpoint distillé de 600 M cumule 1,4 million de téléchargements et tourne sur du matériel qui ne pourrait même pas charger les poids de Cohere, ce qui en fait le seul des deux qui convient à un déploiement en réseau isolé ou en périphérie sans astuces de quantification. La troisième est la maturité : NLLB-200 a derrière lui quatre ans d'outillage, de forks de quantification et de retours d'expérience de production, ainsi qu'un article de Nature évalué par les pairs, publié en juin 2024, décrivant comment il a été construit. Cohere a publié une note de version.

Le compromis dans l'autre sens est tout aussi concret. La fiche de modèle de NLLB-200 le décrit comme un modèle de recherche qui n'a pas été publié pour un déploiement en production, et son point de contrôle phare de 54B est un poids lourd — environ 350 Go de stockage, et de l'ordre de 108–120 Go de VRAM pour le servir sans compression. Meta ne vend pas de point de terminaison NLLB hébergé. Le faire tourner à l'échelle est votre problème, et c'en est un vrai.

Le piège des licences des deux côtés

C'est la partie qui surprend les gens, car les deux modèles portent la même licence, et ce n'est pas celle que la plupart des équipes supposent. NLLB-200 et North Small Translate 1.0 sont tous deux publiés sous licence Creative Commons Attribution-NonCommercial 4.0. Ni l'un ni l'autre n'est utilisable dans un produit commercial en l'état. La restriction non commerciale de NLLB-200 a été suffisamment controversée pour qu'un projet communautaire appelé Open-NLLB existe précisément afin de tenter de créer un dérivé utilisable commercialement, ce qui se heurte directement à la licence dont ce dérivé est issu. La voie de Cohere est plus nette : acheter une licence commerciale et déployer via Model Vault, avec les poids FP8 gratuits sur Hugging Face pour un usage non commercial uniquement.

Il y a une asymétrie qui mérite d’être signalée. Cohere exécute North Small Translate 1.0 sur le niveau gratuit de son API Chat V2, gratuit pour les clés d’essai et de production jusqu’à ce que les limites de débit soient atteintes — vous pouvez donc mener une véritable évaluation à coût nul et ne signer quoi que ce soit que si vous mettez en production. NLLB-200 vous donne les poids et rien d’autre.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Déployer l'un ou l'autre

North Small Translate 1.0 est livré en trois checkpoints — BF16, FP8 et NVFP4 W4A16 — avec une configuration matérielle minimale publiée pour chacun : quatre B200 ou huit H100 pour BF16, deux B200 ou quatre H100 pour FP8, et un seul B200 ou deux H100 pour W4A16. Le service passe par vLLM avec cohere_melody>=0.9.0, et Cohere recommande le décodage glouton, correspondant à sa configuration de production. La sortie est encadrée par les marqueurs <|START_TEXT|> et <|END_TEXT|> qui ne sont pas enregistrés comme tokens spéciaux, donc un skip_special_tokens=True naïf les laissera dans votre sortie.

NLLB-200 se déploie via les voies standard de transformers ou fairseq avec une tolérance bien plus large pour le matériel modeste, car les checkpoints distillés de 600M et 1,3B sont ceux que la plupart des utilisateurs font réellement tourner. Le MoE de 54B est celui qui nécessite une planification.

La question de routage que représente réellement cette confrontation

Ni North Small Translate 1.0 ni NLLB-200 ne figurent dans le catalogue d’OrcaRouter aujourd’hui, donc il ne s’agit pas d’un article sur le choix de l’un d’eux sur notre étagère. Cela vaut quand même la peine de nommer la forme du problème, car « un modèle pour les langues de premier niveau, un autre pour la longue traîne » est une politique de routage — et une politique de routage est le genre de chose qui devrait vivre dans la configuration plutôt que dans le code applicatif. Le DSL de routage d’OrcaRouter exprime exactement cela sous forme de YAML et de règles CEL, de sorte qu’une règle par paire de langues peut envoyer les paires européennes vers un modèle et se rabattre sur un autre lorsqu’une paire n’est pas prise en charge, et les chaînes de basculement signifient qu’un service en amont qui commence à renvoyer des erreurs ne devient pas votre panne. C’est une seule clé et une seule intégration sur un catalogue de plus de 200 modèles au prix catalogue du fournisseur avec 0 % de marge, plutôt qu’un contrat avec un second fournisseur pour chaque modèle de traduction que vous décidez d’essayer.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

Lequel devriez-vous choisir

Si votre stratégie de contenu touche à des langues en dehors des cinquante de Cohere, gardez NLLB-200 et considérez la question comme réglée — aucun degré de modernité architecturale ne compense une langue manquante. Si vous faites de la localisation d’entreprise vers les langues listées par Cohere, travaillez à l’échelle d’un document plutôt que d’une phrase, et êtes prêt à acheter une licence commerciale, North Small Translate 1.0 est le modèle le plus capable sur chaque dimension divulguée par la documentation, avec l’importante réserve que sa seule preuve de qualité est un chiffre de fournisseur non reproduit. Si vous faites du prototypage et n’avez pas de budget, l’offre gratuite de Cohere rend cette évaluation presque gratuite, ce qui constitue un meilleur point de départ que celui de NLLB-200, où le coût pour le découvrir est une location de GPU.

La façon utile de tenir les deux faits à la fois : NLLB-200 est le modèle qui atteint les langues que personne d’autre n’atteint, et il a été conçu en 2022 pour la traduction de recherche au niveau des phrases. North Small Translate 1.0 est le modèle qui fait moins de langues, mais mieux, et il a été conçu en 2026 pour les documents. Choisir entre les deux n’est pas vraiment un jugement de qualité. C’est une question de savoir quelles langues vous livrez réellement.