Hero-Karte mit der Überschrift „North Small Translate 1.0 vs. Hy-MT2“ und dem Untertitel „Zwei MoE-Übersetzer, eine Evidenzlücke“, über zwei Karten: North Small Translate 1.0 (218B MoE / 25B aktiv, eine unbenannte WMT26-Angabe) und Hy-MT2-30B-A3B (30B MoE / 3B aktiv, Paper, Benchmark, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs. Hy-MT2: Zwei MoE-Übersetzer, eine Evidenzlücke

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Beide dieser Familien beruhten auf derselben Wette — dass ein spärliches Mixture-of-Experts-Netzwerk, das für Übersetzung nachtrainiert wurde, ein Allzweckmodell schlägt, das man um Übersetzung bittet — und sie sind aus entgegengesetzten Richtungen darauf gekommen. Hy-MT2, Tencent Hunyuans dreimodellige Übersetzungsfamilie, angeführt vom Hy-MT2-30B-A3B MoE, wurde am 21. Mai 2026 unter Apache 2.0 als Open Source freigegeben, zusammen mit einem technischen Bericht, einem Open-Source-Benchmark und einer vollständigen Vergleichstabelle. North Small Translate 1.0, Coheres MoE-Übersetzer mit 218 Milliarden Parametern und 25 Milliarden aktiven Parametern, wurde in einer auf den 9. September 2026 datierten Release Note dokumentiert, und seine Qualitätsbelege belaufen sich auf eine einzige Zahl, ohne dass eine Metrik dazu angegeben wird. Die Architekturen reimen sich. Die Dokumentation nicht, und dieser Unterschied ist das Nützlichste, was man verstehen sollte, bevor man sich für eine der beiden entscheidet.

Eine Familie, drei Größen gegen ein großes Modell

Hy-MT2 ist nicht ein einzelnes Modell, sondern eine Reihe: ein dichtes 1,8B-Modell für On-Device-Arbeit, ein dichtes 7B-Modell für eine einzelne GPU und das 30B-A3B-MoE als Flaggschiff mit drei Milliarden pro Token aktiven Parametern. Alle drei stehen unter Apache 2.0, sind ohne Zugangsbeschränkung und werden zusammen mit FP8-, GGUF-, 2-Bit- und 1,25-Bit-Quantisierungen sowie dem IFMTBench-Benchmark für Instruction-Following und einem begleitenden Paper veröffentlicht. Tencent berichtet, dass die Familie zwischen 33 Sprachen sowie fünf Minderheitensprachen und Dialekten übersetzt.

North Small Translate 1.0 ist ein einzelner Punkt im Größenraum – und ein großer: 218B Gesamtparameter, 25B aktive, 128 Experten mit acht pro Token aktivierten plus geteilten Experten, und die Attention wechselt im Verhältnis 3:1 zwischen Sliding-Window-Schichten (Fenster 4.096, RoPE) und globalen Schichten, die keine positionsbezogenen Embeddings tragen. Sein Fenster umfasst 16K Eingabe und 16K Ausgabe über Englisch plus 49 weitere Sprachen, wobei Modernes Standardarabisch, Deutsch, Französisch, Japanisch, Koreanisch, Russisch und Ukrainisch als Tier-1 eingestuft sind. Bemerkenswert ist, dass die Form nicht neu ist – Coheres Command A+ vom Mai 2026 verwendete dieselbe 218B/25B-Konfiguration –, was dies eher zu einem übersetzungsspezialisierten Post-Train eines bestehenden Kerns als zu einer neuen Architektur macht.

Parameter — North Small Translate 1.0: 218B gesamt / 25B aktiv vs. Hy-MT2-30B-A3B: 30B gesamt / 3B aktiv, mit 1,8B und 7B dichten Geschwistermodellen

Kontext — 16K rein und 16K raus vs. 8K Arbeitsfenster, die Konfiguration verspricht bis zu 262.144 Positionen

Sprachen — 50 (Englisch + 49) gegenüber 33 plus 5 Minderheitensprachen und Dialekten

Lizenz — CC BY-NC 4.0, kommerziell über Model Vault vs. Apache 2.0, ohne Zugangsbeschränkung

Veröffentlichte Belege — eine ungenannte WMT26-Zahl, vom Anbieter gemeldet vs. ein technischer Bericht, ein offener Benchmark und namentlich genannte Ergebnisse zu FLORES-200, WMT25 GEMBA und XCOMET-XXL

Bereitstellung — vLLM mit cohere_melody>=0.9.0, Greedy-Decoding empfohlen gegenüber transformers, vLLM, SGLang und llama.cpp

Angekündigt — 9. September 2026 (Gewichte auf Hugging Face seit dem 14. August zugangsbeschränkt) vs. 21. Mai 2026

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-30B-A3B across six rows: Parameters 218B MoE / 25B active vs 30B MoE / 3B active; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Evidence one unnamed WMT26 figure vs FLORES-200 93.85 and GEMBA 84.34; Technical report none published vs arXiv paper and IFMTBench. Footer notes all figures are vendor-reported by Tencent and Cohere and none is independently reproduced.

Die Beweislücke ist die eigentliche Geschichte

Tencents Veröffentlichung kam mit Belegen. Es gibt ein Paper auf arXiv, einen Benchmark, den das Unternehmen eigens geschrieben und als Open Source veröffentlicht hat, um die Befolgung von Übersetzungsanweisungen zu messen, und eine Ergebnistabelle, in der die Wettbewerber genannt werden. FLORES-200 Englisch-nach-X setzt das 30B-A3B auf 93.85 – gegenüber Gemini 3.1 Pro mit 94.42 und GPT-5.5 mit 94.16. Die GEMBA-Metrik aus der WMT25-Ära setzt es auf 84.34 – den höchsten Wert in Tencents eigenem Vergleich, vor GPT-5.5 mit 83.41 und 83.29 in seinen beiden Modi, Gemini 3.1 Pro mit 82.23, DeepSeek-V4-Pro mit 81.99 und Kimi K2.6 mit 81.68. XCOMET-XXL platziert es bei 62.89 hinter seinem eigenen 7B-Geschwistermodell. Bei IFMTBench erreicht es eine Gesamt-Anweisungsbefolgung von 85.7 %, mit einem Teilwert von 91.94 %, der nur einen Hundertstelpunkt von Gemini 3.1 Pro entfernt liegt, und einem separaten Teilwert von 85.55 %, bei dem es das Modell Gemini 3.1 Pro klar anführt.

Jede einzelne davon ist eine Messung von Tencent selbst, und keine wurde unabhängig reproduziert. Doch sie sind benannt, sie sind vergleichbar, und sie sind falsifizierbar – ein Leser weiß genau, welchen Test er durchführen muss, um zu widersprechen.

Coheres Versionshinweis nennt genau eine Zahl: WMT26 83,60, die unter dem, was das Unternehmen als agentischen Multi-Pass-Übersetzungs-Workflow bezeichnet, auf 84,36 steigt. Auf der Modellkarte oder in der Dokumentation wird nirgends eine Metrik genannt. Für dieses Modell wurde keine WMT26-Ergebnisseite veröffentlicht. Trainingskorpus, Tokenanzahl und Datenpipeline werden nicht offengelegt, wohingegen der technische Bericht von Command A Translate aus dem Jahr 2025 eine Technik zur Schwierigkeitsfilterung detailliert beschrieben hatte. Nichts davon ist ein Beleg für ein schlechteres Modell. Es ist ein Beleg für weniger Belege, was etwas anderes ist und genauso wichtig ist, wenn man entscheidet, was man in Produktion einsetzt.

Der gemeinsame Maßstab, den keine der beiden Seiten tatsächlich veröffentlicht hat

Es gibt einen echten Berührungspunkt zwischen den beiden, und er ist einen Absatz wert, weil er der einzige Ort ist, an dem ein fairer Vergleich möglich wäre. Tencent ist WMT26-Partner und sponsert eine Aufgabe zur Übersetzung von Video-Untertiteln mit von Hunyuan finanzierten Auszeichnungen. Coheres einzige veröffentlichte Zahl ist ein WMT26-Wert. Beide Organisationen befinden sich also im selben Evaluierungszyklus 2026, und die eine Metrik, bei der ein direkter Vergleich entschieden werden könnte, ist genau die, bei der nur eine der beiden überhaupt etwas veröffentlicht hat – und sie veröffentlicht hat, ohne die Metrik zu nennen.

Das ist die Lücke, die man im Auge behalten sollte. Wenn Cohere der 83.60 einen Metriknamen zuordnet oder wenn die Ergebnisseiten von WMT26 ein System namens North Small Translate enthalten, wird der Vergleich belastbar. Bis dahin wäre es eine als Analyse getarnte Erfindung, Tencents FLORES-200- und GEMBA-Zahlen Coheres unbeschriftetem WMT26-Wert gegenüberzustellen.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Lizenz und Bereitstellung

Hy-MT2 ist Apache 2.0 ohne Zugangsbeschränkungen: kommerzielle Nutzung, Fine-Tuning, Derivate und Weiterverbreitung, alles ohne Rücksprache. North Small Translate 1.0 steht unter CC BY-NC 4.0, kostenlos für nichtkommerzielle Nutzung, wobei kommerzieller Einsatz über Cohere's Model Vault abgewickelt wird – zu einem Preis, der nicht veröffentlicht wird. Für alles, was an Kunden ausgeliefert wird, entscheidet dieser Unterschied die Frage, bevor die Benchmarks überhaupt gelesen werden.

Die Hardware-Geschichte folgt demselben Muster in umgekehrter Richtung. Hy-MT2 reicht von einem 440 MB großen quantisierten Build, der auf einem Handset läuft, bis zum 30B-A3B, dessen drei Milliarden aktive Parameter den Rechenaufwand pro Token für seine Qualitätsklasse bescheiden halten; die Runtimes decken transformers, vLLM, SGLang und llama.cpp ab. North Small Translate 1.0 veröffentlicht die Mindesthardware pro Checkpoint — vier B200 oder acht H100 für BF16, zwei B200 oder vier H100 für FP8, eine B200 oder zwei H100 für NVFP4 W4A16 — und empfiehlt Greedy Decoding, um die Produktion abzubilden. Der ausgleichende Vorteil von Cohere ist, dass das Modell im kostenlosen Tarif seiner Chat-V2-API läuft, kostenlos für Trial- und Production-Keys, bis die Rate Limits erreicht sind, sodass die Evaluierung nichts kostet.

Sollten Sie wechseln, und wozu?

Die Wechselfrage ist hier wirklich asymmetrisch. Der Wechsel von Hy-MT2 zu North Small Translate 1.0 ist kein Leistungs-Upgrade, das Sie derzeit rechtfertigen können – er ist eine Wette auf ein Modell, dessen einzige öffentliche Angabe eine einzige Zahl ist, abgewogen gegen eine Familie mit einem veröffentlichten Bericht und einer einsetzbaren Lizenz. Was sich lohnt, ist zu evaluieren: Das Cohere-Modell ist kostenlos aufrufbar, deckt fünfzig Sprachen ab, darunter ein breiteres europäisches Spektrum, und liefert 16K Ausgabe pro Durchlauf, was das 8K-Arbeitsfenster von Hy-MT2 nicht bietet.

Diese Bewertung ist genau der Fall, in dem eine Routing-Schicht ihren Wert beweist, denn die ehrliche Antwort für die meisten mehrsprachigen Stacks lautet, dass beide Modelle bleiben. OrcaRouter stellt einen Katalog von mehr als 200 Modellen hinter einen einzigen Schlüssel, sodass das Ausprobieren eines zweiten Übersetzungsmodells eine Konfigurationsänderung ist und kein zweiter Anbietervertrag oder eine Codeänderung — Sie richten denselben OpenAI-kompatiblen Client auf eine andere Modell-ID und vergleichen mit Ihrem eigenen Text. Die Listenpreise der Anbieter werden weitergegeben mit 0 % Aufschlag, sodass eine Preisänderung beim Hosting noch am selben Tag auf unserer Seite aktiv ist, ohne dass ein zusätzlicher Spread obendrauf kommt, und Failover-Ketten halten die Produktion auf dem Modell, das bereits funktioniert, während das neue bewertet wird. Weder North Small Translate 1.0 noch Hy-MT2 sind heute in unserem Katalog, das ist also keine Empfehlung, eines von beiden bei uns zu kaufen — es ist das Argument dafür, die Entscheidung nicht fest zu verdrahten, bevor Sie den Test durchgeführt haben.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Das Urteil

Tencent's Hy-MT2 ist die sicherere Wahl, und das ist nach der Beweislage nicht knapp: Apache 2.0, drei Größen, ein Paper, ein offener Benchmark, vier benannte Evaluations-Suites und eine WMT26-Partnerschaft. North Small Translate 1.0 von Cohere ist das interessantere Modell – 218 Milliarden Parameter eines übersetzungsspezifischen MoE hinter einem 16K-Ausgabefenster und fünfzig Sprachen, eine kostenlose Evaluierungsstufe und eine 83,60, die niemand außerhalb von Cohere überprüft hat.

Wenn Sie in diesem Quartal eine Entscheidung brauchen, nehmen Sie die Familie mit den Belegen. Wenn Sie einen Korpus und eine Woche haben, lassen Sie einen Teil davon durch die kostenlose Stufe laufen und finden Sie heraus, ob die unbenannte 83,60 von Cohere für Ihre Dokumente irgendetwas bedeutet — denn das ist eine Frage, die keine Anbietertabelle für Sie beantworten wird, und die eine Zahl, die Cohere zu veröffentlichen wählte, ist genau diejenige, deren Nennung Cohere verweigerte.