
North Small Translate 1.0: Coheres bisher leisestes großes Modell
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
North Small Translate 1.0 ist ein Mixture-of-Experts-Übersetzungsmodell mit 218 Milliarden Parametern von Cohere und Cohere Labs, und es kam so auf den Markt, wie es nur sehr wenige Veröffentlichungen im Frontier-Maßstab tun: mit einem Versionshinweis und sonst nichts. Coheres Changelog datiert die Ankündigung auf den 9. September 2026, aber die drei Checkpoints lagen bereits seit dem 14. August hinter einem Gate auf Hugging Face – dreieinhalb Wochen Gewichte ohne Blogbeitrag, ohne Presseberichterstattung und ohne Launch-Thread. Als dies geschrieben wurde, zeigte das Haupt-Repository null Likes, 26 Downloads im letzten Monat und eine einzige unbeantwortete Community-Diskussion. Ein 218B-Modell mit einem vom Anbieter angegebenen WMT26-Score von 83,60, das kaum jemand bemerkt hat, ist es wert, erklärt zu werden. Hier ist also, was die Dokumentation und das Repository tatsächlich belegen – getrennt von dem, was sie nicht belegen.
Die Zahlen, für die Cohere seinen Namen hergegeben hat
Beginnen Sie mit den Spezifikationen, denn sie sind eindeutig und sie sind der Teil dieses Releases, der vollständig bekannt sein kann. North Small Translate 1.0 ist ein Decoder-only-Sparse-Mixture-of-Experts-Modell — dieselbe Form, die Cohere im Mai 2026 für Command A+ verwendet hat — mit 128 Experten, von denen acht pro Token aktiviert werden, plus gemeinsam genutzte Experten, die bei jedem Token ausgeführt werden. Der Router verwendet eine Sigmoid-Aktivierung über den Experten-Logits und normalisiert über die Top-k-Auswahl hinweg. Die Attention wechselt im Verhältnis 3:1 zwischen Sliding-Window-Schichten (Fenster 4.096, RoPE) und globalen Attention-Schichten, die überhaupt keine Positions-Embeddings enthalten.
• Parameter — insgesamt 218 Mrd., 25 Mrd. aktiv pro Token
• Kontext — 16K Eingabe und 16K Ausgabe
• Sprachen — Englisch plus 49 weitere, insgesamt 50
• Tier-1-Sprachen — Modernes Hocharabisch, Deutsch, Französisch, Japanisch, Koreanisch, Russisch, Ukrainisch
• Checkpoints — BF16, FP8 und NVFP4 W4A16
• Mindesthardware — BF16: 4×B200 oder 8×H100; FP8: 2×B200 oder 4×H100; W4A16: 1×B200 oder 2×H100
• Lizenz — CC BY-NC 4.0, wobei die kommerzielle Nutzung an Cohere's Model Vault weitergeleitet wird
• Gemeldete Qualität — WMT26 83,60, steigend auf 84,36 mit einem agentischen Mehrdurchlauf-Übersetzungsworkflow
Zwei dieser Zeilen verdienen mehr als einen Aufzählungspunkt. Das Kontextfenster beträgt 16K Ausgabe, was für ein Übersetzungsmodell ungewöhnlich ist und den Unterschied ausmacht zwischen der Übersetzung eines Absatzes und der eines ganzen Verfahrensdokuments in einem Durchgang. Und die agentische Zahl – 84,36 gegenüber 83,60 – ist Coheres Beschreibung eines Workflows, nicht eines Modells: mehrere Durchläufe, vermutlich mit einem Agenten, der entscheidet, was neu übersetzt wird. Das ist dieselbe Idee, die Cohere im August 2025 als „Deep Translation“ mit Command A Translate verkauft hat, und sie taucht hier in größerem Maßstab wieder auf.

Was das Repository zeigt, der Versionshinweis aber nicht.
Serving wird über vLLM unterstützt mit cohere_melody>=0.9.0, und Cohere empfiehlt ausdrücklich Greedy-Decoding, das „passend zum Produktions-Deployment“ ist — ein Übersetzungsmodell, das einem sagt, Sampling abzuschalten, ist ein Übersetzungsmodell, das auf Determinismus ausgerichtet ist, nicht auf kreatives Schreiben. Die Ausgabe wird in <|START_TEXT|> und <|END_TEXT|> Marker eingehüllt, und das Parsing erwartet Coheres melody Bibliothek. Diese Marker sind nicht als spezielle Tokens registriert, daher wird das Setzen von skip_special_tokens=True sie nicht entfernen — eine kleine Falle, die bei einer naiven Integration sichtbaren Tag-Müll erzeugt.
Es gibt außerdem ein Chat-Template mit einer Standard-Systemanweisung, die das Modell unter dem Namen „North Small Translate“ präsentiert und angibt, dass es von Cohere entwickelt wurde. Systemnachrichten pro Konversation werden angehängt an diese Standardanweisung, statt sie zu ersetzen – es gibt einen separaten platform_instruction_override-Slot, wenn Sie sie verdrängen müssen. Es ist die Art von Infrastruktur, die Ihnen verrät, dass dies ein post-trainiertes Chat-Modell ist, das eine Übersetzungsaufgabe trägt, und kein klassischer Encoder-Decoder.
Wo es in der Produktlinie von Cohere steht
Die Abstammungslinie ist der nützlichste Kontext für die Einordnung dieses Releases, und sie ist dokumentiert. Command A Translate, angekündigt am 28. August 2025, war Coheres erstes Modell für maschinelle Übersetzung – 111B Parameter, ein 16K-Fenster, aufgeteilt in 8K Eingabe und 8K Ausgabe, 23 Sprachen und eine Forschungsveröffentlichung unter CC-BY-NC. North Small Translate 1.0 mehr als verdoppelt die Sprachenzahl auf 50, verdreifacht die Anzahl aktiver Parameter auf 25B, behält das Gesamtfenster bei 16K bei, macht es aber vollständig für die Ausgabe nutzbar, und tauscht ein einzelnes, eher dichtes Modell gegen ein spärliches MoE mit demselben Footprint, den Cohere bereits anderswo in der North-Linie verwendet.
Die ehrliche Lesart ist, dass es sich hier um ein spezialisiertes Derivat von Coheres aktuellem MoE-Kern handelt, das für Übersetzung nachtrainiert wurde, und nicht um eine neue Architektur. Die Modellkarte sagt genau das in einer Zeile – es wurde „speziell für Übersetzungsqualität nachtrainiert“ – und gibt nichts über den Trainingskorpus, die Token-Anzahl oder die Datenpipeline preis. Der technische Bericht zu Command A Translate beschrieb eine Datenmethode zur Schwierigkeitsfilterung im Detail; für dieses Modell wurde nichts Vergleichbares veröffentlicht.

Was ist wirklich nicht bestätigt?
Hier muss eine leise Veröffentlichung sorgfältig gehandhabt werden, denn die Abwesenheit von Lärm wirkt in beide Richtungen. Das Folgende sind Dinge, die derzeit niemand außerhalb von Cohere kennt:
• Was WMT26 83.60 misst. Weder auf der Modellkarte noch in den Versionshinweisen wird eine Metrik genannt, und es wurde keine WMT26-Ergebnisseite zu diesem Modell veröffentlicht. „83.60“ ohne Metriknamen ist eine Zahl, kein Ergebnis.
• Ob sich die Punktzahl reproduzieren lässt. Keine unabhängige Gruppe hat dieses Modell ausgeführt. Jede Zahl in diesem Artikel stammt von Cohere selbst.
• Worum es sich bei dem agentischen Multi-Pass-Workflow tatsächlich handelt. Die Zahl 84,36 wird in einem einzigen Halbsatz erwähnt. Es ist eine Aussage auf Systemebene, die an eine Modellkarte geknüpft ist, und das System wird nicht angegeben.
• Was eine kommerzielle Lizenz kostet. Cohere verweist Unternehmen an den Vertrieb und an Model Vault. Auf der Docs-Seite wird kein Preis veröffentlicht.
• Ob ein Blogbeitrag kommt. Cohere hat einen Blog. Command A Translate bekam einen vollständigen. Dieses Modell bekam einen Versionshinweis.
Nichts davon ist ein Vorwurf. Es ist der Unterschied zwischen einem Modell, das man bewerten kann, und einem Produkt, das man kaufen kann, und im Moment ist North Small Translate 1.0 genau Ersteres – plus eine Sache, die man kostenlos nutzen kann.
Der kostenlose Tarif ist der Teil, den Sie heute tatsächlich testen können.
Anders als bei einem reinen Gewichte-Release gibt es hier eine Live-Oberfläche: North Small Translate 1.0 ist über die Chat V2 API in Coheres kostenloser Stufe verfügbar, und in Coheres Versionshinweis heißt es, dass es für Test- und Produktionsschlüssel kostenlos ist, bis die Rate Limits erreicht werden. Das ist ein ungewöhnlich großzügiges Evaluierungsfenster – man braucht keinen kostenpflichtigen Vertrag, um echten Traffic darüber laufen zu lassen. Die Gewichte hingegen sind das FP8-Set auf Hugging Face unter CC BY-NC 4.0, sodass Self-Hosting für kommerzielle Zwecke ohne eine Model-Vault-Vereinbarung nicht infrage kommt.
Die praktische Gestalt der Entscheidung also: über die API kostenlos testen und nur zahlen, wenn Sie sich für den Einsatz entscheiden. Das ist ein risikoarmer Test, und genau dafür ist eine Routing-Schicht gebaut. Wenn Sie Übersetzungen bereits über OrcaRouter abrufen — ein Schlüssel für einen Katalog von mehr als 200 Modellen, Anbieter-Listenpreis weitergegeben zu 0 % Aufschlag — dann lautet die bewertbare Frage nicht „Soll ich migrieren?“, sondern „Ist das besser als das, was ich bereits für meine eigenen Dokumente abrufe?“, was Sie beantworten können, indem Sie denselben Text durch beide laufen lassen. Ein Anbieter, der seinen Preis senkt, ist bei uns am selben Tag eine Live-Änderung, weil kein Händleraufschlag obendrauf liegt. Und bei einem Modell mit einem einzigen nicht reproduzierten Benchmark und ohne Bewertung durch Dritte ist Failover der Mechanismus, mit dem Sie es ausprobieren können, ohne einen Produktionspfad darauf zu verwetten: Ihr Datenverkehr fließt weiter zum Modell, das bereits funktioniert, während das neue mit echten Eingaben bewertet wird.

Was würde dies von einer Release Note zu einem Release machen?
Drei Dinge würden North Small Translate 1.0 von einem Dokumentationseintrag zu einem echten Konkurrenten machen, und alle drei sind von außen beobachtbar. Erstens eine benannte Metrik für die WMT26-Zahl – eine 83.60 mit einer zugeordneten Metrik lässt sich vergleichen, eine ohne nicht. Zweitens eine erste unabhängige Reproduktion, ob sie nun aus der eigentlichen WMT26-Evaluierungskampagne stammt oder von einem Dritten, der FLORES-artige Tests mit den FP8-Gewichten durchführt. Drittens ein tatsächlicher Launch-Post, der signalisieren würde, dass Cohere beabsichtigt, dies zu verkaufen, anstatt es lediglich veröffentlicht zu haben.
Bis dahin ist die richtige Haltung die, die die Beweislage stützt: ein wirklich interessanter 218B-MoE-Übersetzungsspezialist mit einem kostenlosen Evaluierungspfad, fünfzig Sprachen und einem Ausgabefenster in Dokumentlänge, dessen Qualitätsversprechen einzig auf dem Wort seines Herstellers beruhen. Cohere hat in dreizehn Monaten vier übersetzungsfähige Modelle veröffentlicht, und nur eines davon bekam einen Blogbeitrag. Welche dieser beiden Tatsachen aussagekräftiger ist, ist die Frage, mit der man sich beschäftigen sollte.
