Hero-kaart voor de confrontatie met als titel "North Small Translate 1.0 vs NLLB-200" en als ondertitel "50 talen tegenover 200", boven twee kaarten: North Small Translate 1.0 (218B MoE / 25B actief, 2026, context van 16K) en NLLB-200 (54,5B MoE-vlaggenschip, 2022, 200 talen).
Guides & Insights

North Small Translate 1.0 vs NLLB-200: 50 talen tegenover 200

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het nieuwere model dekt een kwart van de talen. North Small Translate 1.0, dat Cohere in zijn release-opmerkingen van 9 september 2026 documenteerde, vertaalt tussen het Engels en 49 andere talen. NLLB-200, de familie No Language Left Behind die Meta in juli 2022 uitbracht, dekt er 200. Als het aantal talen de hele vergelijking was, zou dit een kort artikel zijn, maar dat is het niet: de twee modellen zijn verschillende machines die voor verschillende taken zijn gebouwd, en de vier jaar die tussen hen liggen komen tot uiting op manieren die niets te maken hebben met hoeveel talen er op een lijst staan. Wat volgt is waar elk model echt goed in is, wat ze kosten om te draaien, en waar de licenties je naartoe sturen.

Het dekkingsnummer, eerlijk gezegd

Tweehonderd tegenover vijftig is reëel en het is de meest aangehaalde reden om NLLB-200 in een stack te houden. Meta trainde het op meer dan 18 miljard zinsparen met een expliciete nadruk op talen met weinig bronnen, en het vertaalt rechtstreeks tussen elk paar in plaats van te pivoteren via het Engels — een ontwerpkeuze die enorm veel uitmaakt voor bijvoorbeeld Bengaals naar Tamil, waar een systeem met een Engelse pivot tweemaal aan kwaliteit inboet.

Wat het aantal verbergt, is dat de overlap tussen de twee lijsten het commercieel nuttige deel is. De vijftig talen van North Small Translate 1.0 omvatten Duits, Frans, Spaans, Portugees, Italiaans, Nederlands, Pools, Tsjechisch, Japans, Koreaans, Vereenvoudigd en Traditioneel Chinees, Arabisch, Hebreeuws, Hindi, Bengaals, Tamil, Telugu, Thai, Turks, Vietnamees, Indonesisch, Maleis, Russisch en Oekraïens — de talen die goed zijn voor de overgrote meerderheid van het lokalisatievolume voor ondernemingen. NLLB-200 dekt al die talen ook, plus ongeveer 150 meer die North Small Translate 1.0 helemaal niet aandoet. De vraag is dus niet welke lijst langer is. Het is of uw verkeer talen bevat die slechts één van de twee ondersteunt.

Twee verschillende machines

De architectuurkloof is het onderdeel dat bepaalt wat je kunt bouwen. Het grootste vrijgegeven checkpoint van NLLB-200 is een mixture-of-experts-model met sparse gating van ongeveer 54,5 miljard parameters, en de dense varianten in dezelfde familie draaien op 3,3 miljard, 1,3 miljard en tot een gedistilleerde 600 miljoen. Allemaal zijn het encoder-decoder sequence-to-sequence-modellen uit de M2M-100-lijn: je geeft de tokenizer een bronsegment, en die retourneert een vertaald segment. Er is geen chatsjabloon, geen systeemprompt, geen multi-turnstructuur, en de vrijgegeven checkpoints zijn gebouwd rond vertaling op segmentniveau: Meta's eigen modelkaart vermeldt dat het model is getraind met invoerlengtes van niet meer dan 512 tokens, en waarschuwt dat langere sequenties verslechteren. Het gecombineerde budget van de tokenizer voor bron en doel is 1.024 tokens. De kaart van NLLB-200 beschrijft het ook als een onderzoeksmodel dat niet is vrijgegeven voor productie-implementatie, en merkt op dat het niet bedoeld is voor documentvertaling — het onderscheid dat het het scherpst afbakent van wat Cohere heeft gebouwd.

North Small Translate 1.0 is de tegenovergestelde vorm. Het is een decoder-only sparse MoE met 218 miljard totale parameters en 25 miljard actieve per token, 128 experts met acht actieve plus gedeelde experts, en attention die sliding-window-lagen (window 4.096, RoPE) afwisselt met globale attention-lagen die geen positionele embeddings bevatten. Het draait achter een chat-sjabloon met een standaard systeeminstructie, en het window is 16K tokens aan invoer en 16K tokens aan uitvoer. Dat outputbudget is de aanwijzing: dit is een model dat gebouwd is om een document aangereikt te krijgen en gevraagd te worden een document terug te geven, niet een model dat gebouwd is om een zin aangereikt te krijgen.

Totaal aantal parameters — North Small Translate 1.0: 218B MoE (25B actief) vs NLLB-200: 54,5B MoE-vlaggenschip, 600M–3,3B dense

Architectuur — decoder-only causale MoE met chatsjabloon versus encoder-decoder seq2seq zonder chatsjabloon

Context — 16K in en 16K uit vs. segmentniveau, tokenizerbudget van 1.024 tokens gecombineerd

Talen — 50 (Engels + 49) vs 200

Directe paren — Engels-centrische gelaagdheid versus any-to-any zonder een Engelse spil

Licentie — CC BY-NC 4.0 vs CC BY-NC 4.0

Minimale voetafdruk — 1×B200 bij W4A16, 2×B200 bij FP8 tegenover ~37GB VRAM bij 4-bit voor de 54B; 600M draait overal

Aangekondigd — 9 september 2026 (gewichten met toegangsbeperking op Hugging Face sinds 14 augustus) versus juli 2022

Two-column scoreboard comparing North Small Translate 1.0 and NLLB-200 across six rows: Parameters 218B MoE / 25B active vs 54.5B MoE flagship; Context 16K in / 16K out vs segment-level, 1,024 tokens; Languages 50 vs 200; Direct pairs English-centric tiering vs any-to-any no pivot; License CC BY-NC 4.0 vs CC BY-NC 4.0; Minimum hardware 1x B200 at W4A16 vs 600M distilled, any GPU.

Wat NLLB-200 nog steeds bezit

Drie dingen, en ze zijn niet sentimenteel. Het eerste is de lange staart: als je Oromo, Tigrinya of een van de ongeveer 150 talen buiten de lijst van North Small Translate 1.0 nodig hebt, is de beslissing al genomen. Het tweede is de voetafdruk aan de kleine kant — het gedistilleerde 600M-checkpoint is 1,4 miljoen downloads diep en draait op hardware die de Cohere-gewichten niet eens zou laden, waardoor het de enige van de twee is die in een air-gapped of edge-implementatie past zonder kwantisatietrucs. Het derde is volwassenheid: NLLB-200 heeft vier jaar aan tooling, kwantisatie-forks en productie-oorlogsverhalen achter zich, plus een peer-reviewed Nature-artikel uit juni 2024 dat beschrijft hoe het is gebouwd. Cohere heeft een release note gepubliceerd.

De afweging andersom is even concreet. In de modelkaart van NLLB-200 wordt het beschreven als een onderzoeksmodel dat niet is vrijgegeven voor productie-implementatie, en het vlaggenschipcheckpoint van 54B is een zwaargewicht — ruwweg 350 GB opslag, en in de orde van 108–120 GB VRAM om het ongecomprimeerd te serveren. Meta verkoopt geen gehost NLLB-endpoint. Het op schaal draaien ervan is jouw probleem, en het is een reëel probleem.

De licentievalkuil aan beide zijden

Dit is het deel dat mensen verrast, want de twee modellen hebben dezelfde licentie, en het is niet degene die de meeste teams verwachten. Zowel NLLB-200 als North Small Translate 1.0 zijn uitgebracht onder Creative Commons Attribution-NonCommercial 4.0. Geen van beide is zoals gepubliceerd bruikbaar in een commercieel product. De niet-commerciële beperking van NLLB-200 is omstreden genoeg geweest dat er speciaal een communityproject genaamd Open-NLLB bestaat om te proberen een commercieel bruikbare afgeleide te maken, wat direct botst met de licentie waarvan het is afgeleid. De route van Cohere is zuiverder: koop een commerciële licentie en implementeer via Model Vault, met de FP8-gewichten gratis op Hugging Face, alleen voor niet-commercieel werk.

Er is één asymmetrie die het vermelden waard is. Cohere draait North Small Translate 1.0 op de gratis tier van zijn Chat V2 API — gratis voor trial- en productiesleutels totdat de rate limits worden bereikt — dus je kunt een echte evaluatie uitvoeren zonder kosten en pas iets ondertekenen als je het ook echt in productie neemt. NLLB-200 geeft je weights en verder niets.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Een van beide implementeren

North Small Translate 1.0 wordt geleverd in drie checkpoints — BF16, FP8 en NVFP4 W4A16 — met voor elk de gepubliceerde minimale hardware: vier B200's of acht H100's voor BF16, twee B200's of vier H100's voor FP8, en één B200 of twee H100's voor W4A16. Serving verloopt via vLLM met cohere_melody>=0.9.0, en Cohere raadt greedy decoding aan, overeenkomstig de productieconfiguratie. De uitvoer wordt omhuld door <|START_TEXT|>- en <|END_TEXT|>-markeringen die niet als speciale tokens zijn geregistreerd, dus een naïeve skip_special_tokens=True laat ze in je uitvoer staan.

NLLB-200 wordt uitgerold via de standaardpaden van transformers of fairseq, met een veel ruimere tolerantie voor kleine hardware, aangezien de gedistilleerde checkpoints van 600M en 1,3B degene zijn die de meeste mensen daadwerkelijk draaien. De 54B MoE is degene die planning vereist.

De routeringsvraag die deze confrontatie eigenlijk vertegenwoordigt

Noch North Small Translate 1.0, noch NLLB-200 staat inde catalogus van OrcaRouter vandaag, dus dit is geen artikel over het kiezen van een van beide uit ons assortiment. Toch is het de moeite waard om de vorm van het probleem te benoemen, want "één model voor de talen van het eerste niveau, een ander voor de lange staart" is een routeringsbeleid — en een routeringsbeleid is iets dat in configuratie thuishoort en niet in applicatiecode. De routerings-DSL van OrcaRouter drukt precies dat uit als YAML plus CEL-regels, zodat een regel per talenpaar Europese paren naar het ene model kan sturen en kan terugvallen op een ander wanneer een paar niet wordt ondersteund, en failover-ketens betekenen dat een upstream die fouten begint te retourneren niet jouw storing wordt. Dat is één sleutel en één integratie over een catalogus van meer dan 200 modellen tegen de lijstprijs van de provider met 0% opslag, in plaats van een tweede leverancierscontract voor elk vertaalmodel dat je besluit uit te proberen.

Screenshot of the facebook/nllb-200-distilled-600M model card on Hugging Face showing the cc-by-nc-4.0 license tag and 196 languages tag, 1,420,772 downloads last month and 970 likes, the model tree with 152 adapters, 380 finetunes and 29 quantizations, and the Intended Use section describing NLLB-200 as a research model for single sentence translation among 200 languages that is not released for production deployment and was trained with input lengths not exceeding 512 tokens.

Welke je moet pakken

Als je contentstrategie talen raakt buiten de vijftig talen van Cohere, houd dan NLLB-200 aan en beschouw dat als beslist — geen enkele mate van architecturale moderniteit compenseert voor een ontbrekende taal. Als je bedrijfslokalisatie doet naar de talen die Cohere heeft vermeld, als je binnen een document werkt in plaats van binnen een zin, en als je bereid bent een commerciële licentie te kopen, dan is North Small Translate 1.0 het capabelere model op elke dimensie die de documentatie onthult, met de belangrijke kanttekening dat het enige kwaliteitsbewijs één niet-gereproduceerd cijfer van de leverancier is. Als je aan het prototypen bent en geen budget hebt, maakt het gratis instapniveau van Cohere die evaluatie bijna gratis, wat een betere uitgangspositie is dan die van NLLB-200, waar de prijs om erachter te komen een GPU-huur is.

De nuttige manier om beide feiten tegelijk vast te houden: NLLB-200 is het model dat de talen bereikt die niemand anders bereikt, en het is in 2022 gebouwd voor onderzoeksvertaling op zinsniveau. North Small Translate 1.0 is het model dat het met minder talen beter doet, en het is in 2026 gebouwd voor documenten. Kiezen tussen hen is niet echt een kwaliteitsoordeel. Het is een kwestie van welke talen je daadwerkelijk uitbrengt.