
North Small Translate 1.0 vs. NLLB-200: 50 Sprachen gegen 200
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Das neuere Modell deckt ein Viertel der Sprachen ab. North Small Translate 1.0, das Cohere in seinen Versionshinweisen am 9. September 2026 dokumentierte, übersetzt zwischen Englisch und 49 anderen Sprachen. NLLB-200, die im Juli 2022 von Meta veröffentlichte Familie No Language Left Behind, deckt 200 Sprachen ab. Wäre die Sprachenzahl der ganze Vergleich, wäre dies ein kurzer Artikel, aber das ist sie nicht: Die beiden Modelle sind unterschiedliche Maschinen, die für unterschiedliche Aufgaben gebaut wurden, und die vierjährige Kluft zwischen ihnen zeigt sich in Bereichen, die nichts damit zu tun haben, wie viele Sprachen auf einer Liste stehen. Im Folgenden geht es darum, wofür jedes von beiden tatsächlich gut ist, was sie im Betrieb kosten und wohin einen die Lizenzierung schickt.
Die Coverage-Zahl, ehrlich gesagt
Zweihundert gegenüber fünfzig ist real, und es ist der am häufigsten genannte Grund, NLLB-200 in einem Stack zu behalten. Meta hat es auf mehr als 18 Milliarden Satzpaaren trainiert, mit ausdrücklichem Schwerpunkt auf ressourcenarmen Sprachen, und es übersetzt direkt zwischen jedem Paar, statt über Englisch zu pivotieren – eine Designentscheidung, die enorm wichtig ist für etwa Bengalisch nach Tamil, wo ein Englisch-Pivot-System zweimal an Qualität verliert.
Was die Zahl verbirgt, ist, dass die Überschneidung zwischen den beiden Listen der kommerziell nützliche Teil ist. Zu den fünfzig Sprachen von North Small Translate 1.0 gehören Deutsch, Französisch, Spanisch, Portugiesisch, Italienisch, Niederländisch, Polnisch, Tschechisch, Japanisch, Koreanisch, Vereinfachtes und Traditionelles Chinesisch, Arabisch, Hebräisch, Hindi, Bengalisch, Tamil, Telugu, Thai, Türkisch, Vietnamesisch, Indonesisch, Malaiisch, Russisch und Ukrainisch — die Sprachen, auf die die überwältigende Mehrheit des Lokalisierungsvolumens von Unternehmen entfällt. NLLB-200 deckt all diese ebenfalls ab, plus ungefähr 150 weitere, die North Small Translate 1.0 überhaupt nicht berührt. Die Frage ist also nicht, welche Liste länger ist. Sie lautet, ob in Ihrem Traffic Sprachen enthalten sind, die nur einer der beiden unterstützt.
Zwei verschiedene Maschinen
Der Architekturunterschied ist der Teil, der bestimmt, was man bauen kann. Der größte veröffentlichte Checkpoint von NLLB-200 ist ein Mixture-of-Experts-Modell mit spärlichem Gating und ungefähr 54,5 Milliarden Parametern, und seine dichten Geschwistermodelle liegen bei 3,3 Mrd., 1,3 Mrd. und bis hinunter zu einem destillierten 600 Mio. Sie alle sind Encoder-Decoder-Sequenz-zu-Sequenz-Modelle aus der M2M-100-Linie: Man übergibt dem Tokenizer ein Quellsegment, und er gibt ein übersetztes Segment zurück. Es gibt keine Chat-Vorlage, keinen System-Prompt, keine Multi-Turn-Struktur, und die veröffentlichten Checkpoints sind auf Übersetzung auf Segmentebene ausgelegt: Metas eigene Modellkarte gibt an, dass das Modell mit Eingabelängen von höchstens 512 Token trainiert wurde, und warnt, dass längere Sequenzen zu Qualitätsverlusten führen. Das kombinierte Budget des Tokenizers für Quelle und Ziel beträgt 1.024 Token. Die Modellkarte von NLLB-200 beschreibt es außerdem als Forschungsmodell, das nicht für den Produktionseinsatz freigegeben wurde, und merkt an, dass es nicht für die Dokumentübersetzung gedacht ist — der Unterschied, der es am deutlichsten von dem trennt, was Cohere gebaut hat.
North Small Translate 1.0 hat die entgegengesetzte Form. Es ist ein Decoder-only-Sparse-MoE mit 218 Milliarden Gesamtparametern und 25 Milliarden aktiven Parametern pro Token, 128 Experten mit acht aktiven plus gemeinsam genutzten Experten und einer Attention, die zwischen Sliding-Window-Schichten (Fenster 4.096, RoPE) und globalen Attention-Schichten abwechselt, die keine Positions-Embeddings tragen. Es läuft hinter einem Chat-Template mit einer Standard-Systemanweisung, und sein Fenster umfasst 16K Token Eingabe und 16K Token Ausgabe. Dieses Ausgabebudget ist der entscheidende Hinweis: Dies ist ein Modell, dem man ein Dokument übergibt und ein Dokument zurückverlangt, nicht ein Modell, dem man einen Satz übergibt.
• Gesamtparameter — North Small Translate 1.0: 218B MoE (25B aktiv) vs. NLLB-200: 54,5B MoE-Flaggschiff, 600M–3,3B dense
• Architektur — reines Decoder-Causal-MoE mit Chat-Template vs. Encoder-Decoder-Seq2Seq ohne Chat-Template
• Kontext — 16K Eingabe und 16K Ausgabe vs. Segmentebene, Tokenizer-Budget 1.024 Token kombiniert
• Sprachen — 50 (Englisch + 49) vs. 200
• Direkte Paare — englischzentrierte Staffelung vs. Any-to-Any ohne englische Pivotsprache
• Lizenz — CC BY-NC 4.0 vs CC BY-NC 4.0
• Minimaler Footprint — 1×B200 bei W4A16, 2×B200 bei FP8 vs. ~37 GB VRAM bei 4 Bit für das 54B, 600M läuft überall
• Angekündigt — 9. September 2026 (Gewichte seit dem 14. August auf Hugging Face gesperrt) vs. Juli 2022

Was NLLB-200 noch besitzt
Drei Dinge, und sie sind nicht sentimental. Das erste ist der Long Tail: Wenn Sie Oromo, Tigrinya oder eine der rund 150 Sprachen benötigen, die außerhalb der Liste von North Small Translate 1.0 liegen, ist die Entscheidung bereits gefallen. Das zweite ist der Footprint am unteren Ende – der destillierte 600M-Checkpoint verzeichnet 1,4 Millionen Downloads und läuft auf Hardware, die nicht einmal die Cohere-Gewichte laden würde, was ihn zum einzigen der beiden macht, der ohne Quantisierungstricks in ein Air-gapped- oder Edge-Deployment passt. Das dritte ist die Reife: NLLB-200 hat vier Jahre Tooling, Quantisierungs-Forks und War Stories aus dem Produktivbetrieb hinter sich, dazu einen peer-reviewten Nature-Artikel vom Juni 2024, der beschreibt, wie es gebaut wurde. Cohere hat eine Release Note veröffentlicht.
Der Trade-off in die andere Richtung ist ebenso konkret. Die Modellkarte von NLLB-200 beschreibt es als Forschungsmodell, das nicht für den Produktionseinsatz freigegeben wurde, und sein Flaggschiff-Checkpoint mit 54B ist ein Schwergewicht – rund 350 GB Speicher und in der Größenordnung von 108–120 GB VRAM, um es unkomprimiert bereitzustellen. Meta verkauft keinen gehosteten NLLB-Endpunkt. Der Betrieb im großen Maßstab ist Ihr Problem – und es ist ein echtes Problem.
Die Lizenzierungsfalle auf beiden Seiten
Das ist der Teil, der die Leute überrascht, denn die beiden Modelle tragen dieselbe Lizenz, und es ist nicht die, die die meisten Teams annehmen. Sowohl NLLB-200 als auch North Small Translate 1.0 werden unter Creative Commons Attribution-NonCommercial 4.0 veröffentlicht. Keines von beiden ist in der veröffentlichten Form in einem kommerziellen Produkt nutzbar. Die nichtkommerzielle Beschränkung von NLLB-200 war umstritten genug, dass es eigens ein Community-Projekt namens Open-NLLB gibt, das versucht, ein kommerziell nutzbares Derivat zu erstellen, was direkt mit der Lizenz kollidiert, von der es abgeleitet ist. Coheres Weg ist sauberer: eine kommerzielle Lizenz kaufen und über Model Vault bereitstellen, wobei die FP8-Gewichte auf Hugging Face kostenlos sind, allerdings nur für nichtkommerzielle Arbeit.
Es gibt eine Asymmetrie, die es wert ist, hervorgehoben zu werden. Cohere betreibt North Small Translate 1.0 im kostenlosen Tarif seiner Chat V2 API – kostenlos für Test- und Produktionsschlüssel, bis die Ratenlimits erreicht sind –, sodass Sie eine echte Evaluierung zu null Kosten durchführen und erst dann etwas unterschreiben müssen, wenn Sie ausliefern. NLLB-200 gibt Ihnen Gewichte und sonst nichts.

Bereitstellen eines von beiden
North Small Translate 1.0 wird in drei Checkpoints ausgeliefert – BF16, FP8 und NVFP4 W4A16 – mit veröffentlichter Mindesthardware für jeden: vier B200 oder acht H100 für BF16, zwei B200 oder vier H100 für FP8 und eine einzelne B200 oder zwei H100 für W4A16. Das Serving läuft über vLLM mit cohere_melody>=0.9.0, und Cohere empfiehlt Greedy Decoding, was der Produktionskonfiguration entspricht. Die Ausgabe wird in <|START_TEXT|> und <|END_TEXT|> Marker eingebettet, die nicht als spezielle Tokens registriert sind, sodass ein naives skip_special_tokens=True sie in Ihrer Ausgabe belässt.
NLLB-200 lässt sich über die gängigen transformers- oder fairseq-Pfade bereitstellen, mit deutlich größerer Toleranz gegenüber kleiner Hardware, da die destillierten 600M- und 1,3B-Checkpoints diejenigen sind, die die meisten tatsächlich ausführen. Das 54B-MoE ist dasjenige, das Planung erfordert.
Die Routing-Frage, die dieses Matchup tatsächlich darstellt
Weder North Small Translate 1.0 noch NLLB-200 ist in OrcaRouters Katalog heute vertreten, also geht es in diesem Beitrag nicht darum, eines davon aus unserem Regal zu nehmen. Es lohnt sich trotzdem, die Form des Problems zu benennen, denn „ein Modell für die Tier-1-Sprachen, ein anderes für den Long Tail“ ist eine Routing-Richtlinie – und eine Routing-Richtlinie gehört in die Konfiguration und nicht in den Anwendungscode. Die Routing-DSL von OrcaRouter drückt genau das als YAML plus CEL-Regeln aus, sodass eine Sprachpaar-Regel europäische Paare an ein Modell senden und auf ein anderes ausweichen kann, wenn ein Paar nicht unterstützt wird, und Failover-Ketten bedeuten, dass ein Upstream, der anfängt, Fehler zurückzugeben, nicht zu Ihrem Ausfall wird. Das ist ein Schlüssel und eine Integration, die über einen Katalog von mehr als 200 Modellen hinweg funktioniert, zum Listenpreis des Anbieters mit 0 % Aufschlag, statt eines zweiten Anbietervertrags für jedes Übersetzungsmodell, das Sie ausprobieren möchten.

Zu welchem du greifen solltest
Wenn Ihre Content-Strategie Sprachen außerhalb der fünfzig von Cohere berührt, halten Sie an NLLB-200 fest und betrachten Sie das als geklärt – kein Maß an architektonischer Modernität wiegt eine fehlende Sprache auf. Wenn Sie Unternehmenslokalisierung in die von Cohere aufgeführten Sprachen durchführen, eher innerhalb eines Dokuments als satzweise arbeiten und bereit sind, eine kommerzielle Lizenz zu erwerben, ist North Small Translate 1.0 das leistungsfähigere Modell in jeder Dimension, die die Dokumentation offenlegt – mit dem wichtigen Vorbehalt, dass sein einziger Qualitätsbeleg eine einzige nicht reproduzierte Herstellerangabe ist. Wenn Sie Prototyping betreiben und kein Budget haben, macht die kostenlose Stufe von Cohere diese Evaluierung nahezu kostenlos, was eine bessere Ausgangsposition ist als die von NLLB-200, wo der Preis dafür, es herauszufinden, eine GPU-Miete ist.
Der nützliche Ansatz, beide Fakten gleichzeitig im Blick zu behalten: NLLB-200 ist das Modell, das die Sprachen erreicht, die sonst niemand abdeckt, und es wurde 2022 für satzweise Übersetzung in der Forschung entwickelt. North Small Translate 1.0 ist das Modell, das weniger Sprachen besser beherrscht, und es wurde 2026 für Dokumente entwickelt. Die Wahl zwischen ihnen ist nicht wirklich ein Qualitätsurteil. Es ist eine Frage dessen, welche Sprachen Sie tatsächlich ausliefern.
