
North Small Translate 1.0 vs. Hy-MT2-1.8B: 218 GB Modell gegen 440 MB
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 pro 1 Mio. Tokens
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Eines davon passt auf ein Handy. Hy-MT2-1.8B, Tencent Hunyuans On-Device-Übersetzungsmodell, das am 21. Mai 2026 unter Apache 2.0 als Open Source veröffentlicht wurde, schrumpft unter AngelSlims 1,25-Bit-Quantisierung auf 440 Megabyte und läuft auf Telefon-Silizium von Apple, Qualcomm und MediaTek. North Small Translate 1.0, das 218-Milliarden-Parameter-Mixture-of-Experts-Modell, das Cohere am 9. September 2026 in seinen Versionshinweisen dokumentierte, wird mit einem FP8-Gewichtssatz in der Größenordnung von 218 Gigabyte ausgeliefert und verlangt mindestens zwei B200. Das ist etwa fünfhundertmal so viel Speicher für eines von ihnen, und die interessante Frage ist nicht, welches besser ist – sondern wofür jedes einzelne tatsächlich gedacht ist und welche Lizenz es Ihnen erlaubt, es auszuliefern.
Der Größenunterschied ist kein Qualitätsunterschied
Es ist verlockend, 218B im Vergleich zu 1,8B als direkte Rangfolge der Leistungsfähigkeit zu lesen. Das ist es nicht, aus zwei Gründen. Der erste ist, dass North Small Translate 1.0 ein Sparse-Mixture-of-Experts-Modell ist, bei dem nur 25 Milliarden Parameter pro Token aktiv sind, sodass der Rechenaufwand pro Token in einer anderen Liga als die Parameteranzahl liegt. Der zweite ist, dass die beiden Modelle auf unterschiedliche Ziele hin optimiert wurden: Das 1,8B-Modell von Tencent wurde so gebaut, dass es klein genug ist, um offline auf einem Handy zu laufen, und Coheres Modell wurde gebaut, um ein ganzes Dokument im Kontext zu halten und es als Einheit zu übersetzen.
Dieser Unterschied ist in den Kontextfenstern ablesbar. Die Konfiguration von Hy-MT2-1.8B verspricht bis zu 262.144 Positionen, doch die eigene Inferenzempfehlung von Tencent begrenzt die Generierung auf 8.192 Token – das praktische Arbeitsfenster liegt bei 8K. North Small Translate 1.0 dokumentiert 16K Eingabe und 16K Ausgabe, was doppelt so groß wie das Eingabefenster ist und, was noch wichtiger ist, volle 16K Ausgabe. Wenn Ihre Arbeitseinheit ein Servicehandbuch ist, ist dieses Ausgabebudget das entscheidende Merkmal. Wenn Ihre Arbeitseinheit eine Chatnachricht ist, ist es irrelevant.
• Gesamtparameter — North Small Translate 1.0: 218B MoE, 25B aktiv vs. Hy-MT2-1.8B: 1,8B dense
• Kontext — 16K rein und 16K raus gegenüber einem 8K-Arbeitsfenster (die Konfiguration gibt bis zu 262.144 Positionen an; Tencent empfiehlt 8.192)
• Sprachen — 50 (Englisch + 49) vs. 33 Sprachen plus 5 Minderheitensprachen und Dialekte
• Lizenz — CC BY-NC 4.0, kommerziell über Model Vault vs. Apache 2.0, ohne Zugangsbeschränkung
• Quantisierter Speicherbedarf — FP8 ~218 GB, NVFP4 W4A16 ~109 GB gegenüber 440 MB bei 1,25 Bit; FP8 und GGUF ebenfalls veröffentlicht
• Minimale Hardware — 2×B200 oder 4×H100 bei FP8 vs. einem Handset

Was Tencent im 1.8B tatsächlich ausgeliefert hat
Das 1.8B ist das kleinste Mitglied einer Familie aus drei Modellen – 1.8B, 7B und ein 30B-A3B-MoE-Flaggschiff –, die alle zusammen mit einem Begleit-Benchmark namens IFMTBench veröffentlicht wurden, der die Befolgung von Übersetzungsanweisungen statt der rohen Übersetzungsqualität misst. Tencent lieferte FP8-, GGUF-, 2-Bit- und 1,25-Bit-Quantisierungen zusammen mit den Basisgewichten aus, und die 1,25-Bit-Version ist diejenige, die die 440MB-Angabe und eine behauptete 1,5-fache Inferenz-Beschleunigung gegenüber der vorherigen Hy-MT1.5-Generation liefert. Serving wird über transformers 5.6.0 und später, vLLM, SGLang und llama.cpp unterstützt, wobei der GGUF-Pfad von einem in llama.cpp aufgenommenen STQ-Kernel abhängt. Empfohlenes Sampling ist Temperatur 0,7, top_p 0,6, top_k 20, Repetition Penalty 1,05, und es gibt keinen Standard-System-Prompt – das Gegenteil von Coheres Ansatz.
Anders als North Small Translate 1.0 ist es außerdem ein Modell mit sichtbarer Akzeptanz. Das Hugging-Face-Repository wurde mehr als 23.000 Mal heruntergeladen und verzeichnet rund 1.200 Likes. Coheres Haupt-Repository zeigte zum Zeitpunkt dieses Textes 26 Downloads und null Likes.
Die Lizenz ist der schärfere Unterschied
Dies ist der Punkt, der für mehr Deployments ausschlaggebend sein sollte als die Benchmark-Tabelle. Hy-MT2-1.8B steht unter Apache 2.0 ohne Gating – kommerzielle Nutzung, Fine-Tuning, abgeleitete Werke, Weiterverbreitung: alles erlaubt. North Small Translate 1.0 steht unter CC BY-NC 4.0: Die Gewichte sind für nichtkommerzielle Nutzung kostenlos, und für den kommerziellen Einsatz ist eine käuflich zu erwerbende Lizenz über Cohere's Model Vault erforderlich, für die kein Preis veröffentlicht ist.
Um es klar zu sagen: Wenn Sie ein Produkt entwickeln, ist das Modell von Tencent dasjenige, das Sie heute ohne ein Gespräch ausliefern können, und das von Cohere ist dasjenige, das Sie nur evaluieren können. Diese Asymmetrie macht das Cohere-Modell nicht schlechter, aber sie ändert die Reihenfolge der Arbeitsschritte – Sie evaluieren das von Cohere, und das von Tencent können Sie einsetzen.
Qualitätsnachweise sind asymmetrisch, und beide Seiten sind Anbieterangaben.
Keines der beiden Modelle hat eine unabhängige Evaluierung hinter sich, daher sollte jede Zahl hier als eine Behauptung ihres jeweiligen Herstellers behandelt werden. Der Unterschied liegt darin, wie viel die Hersteller auf den Tisch gelegt haben. Tencent hat eine vollständige Vergleichstabelle und einen technischen Bericht veröffentlicht: Bei der FLORES-200-Übersetzung von Englisch nach X erzielt Hy-MT2-1.8B 90,00 gegenüber 94,42 von Gemini 3.1 Pro und 94,16 von GPT-5.5 – bescheiden hinter den Frontier-Modellen, aber nur wenige Punkte dahinter, von einem Modell, das auf ein Telefon passt. Beim Gesamtwert von IFMTBench für die Befolgung von Anweisungen landet das 1.8B-Modell bei 69,36 % und damit deutlich hinter seinem eigenen 30B-A3B-Geschwistermodell mit 85,7 % und Gemini 3.1 Pro mit 89,08 %, was die ehrliche Einschätzung des Kompromisses ist: Das winzige Modell befolgt Formatierungs- und Terminologieanweisungen weit weniger zuverlässig, als es übersetzt.
Cohere hat eine einzige Zahl veröffentlicht – einen WMT26-Score von 83,60, der mit einem agentischen Multi-Pass-Workflow auf 84,36 steigt –, ohne Angabe eines Metriknamens und ohne eine WMT26-Ergebnisseite, mit der man sie abgleichen könnte. Das ist kein Vergleich, den wir anstellen können. Eine einzelne unbenannte Zahl lässt sich nicht einer Tabelle benannter Benchmarks gegenüberstellen, und vorzugeben, es sei anders, wäre das Irreführendste, was dieser Artikel tun könnte.

Tencents Gegengewicht ist, dass seine Zahlen von einer Stelle stammen, die ein Leser einsehen kann. Das Hy-MT2-Repository veröffentlicht die Familienübersicht, die drei Modellgrößen und die Laufzeitumgebungen, die jede einzelne unterstützt, zusammen mit der Benchmark-Tabelle – was die FLORES-200- und IFMTBench-Werte überhaupt erst überprüfbar macht und wodurch Coheres einzelne unbenannte Zahl im Kontrast auffällig wird.

Was es kostet, jeden Einzelnen anzurufen
Tencents 1,8B-Modell verfügt über eine gehostete kommerzielle API, die im August 2026 eingeführt wurde und mit rund 0,044 US-Dollar pro Million Eingabe-Tokens und 0,177 US-Dollar pro Million Ausgabe-Tokens bepreist ist – absolut günstig und pro Token abgerechnet. Coheres Modell läuft im kostenlosen Tarif von Chat V2, kostenlos für Test- und Produktionsschlüssel, bis die Ratenlimits erreicht sind, sodass die Evaluierungskosten null betragen, die Produktionskosten aber ein Vertrag sind, den man aushandeln muss. Self-Hosting stellt die Rechnung völlig auf den Kopf: 440 MB auf einem Mobiltelefon gegenüber zwei B200s, ein Unterschied, der in Größenordnungen statt in Prozent gemessen wird.
Der Grund, warum sich diese Lücke in einem Beitrag über eine Routing-Plattform zu erwähnen lohnt, ist, dass die günstige Stufe und die teure Stufe keine Konkurrenten sind – sie sind zwei Positionen in einer Kaskade, und Kaskaden sind genau das, wofür ein Router da ist. OrcaRouter gibt den Listenpreis des Anbieters mit 0 % Aufschlag weiter, sodass eine Preissenkung eines Anbieters für einen gehosteten Übersetzungsendpunkt bei uns noch am selben Tag live ist, ohne einen Reseller-Aufschlag, über den neu verhandelt werden müsste, und Failover-Ketten lassen ein kleineres Modell den Großteil des Verkehrs auffangen, während ein schwereres Modell die Anfragen übernimmt, bei denen es versagt. Versuch zuerst das günstige, eskaliere bei den schwierigen Fällen und lass die Routing-Schicht die Richtlinie halten statt deinen Anwendungscode.
Welches du wählen solltest
Wenn Ihre Übersetzung auf einem Gerät, offline, unter einem Speicherbudget pro Megabyte oder in einem kommerziellen Produkt ohne Lust auf eine Lizenzverhandlung stattfindet, ist Hy-MT2-1.8B die Antwort und North Small Translate 1.0 ist nicht im Rennen. Wenn Ihre Arbeitseinheit ein langes Dokument in einer der fünfzig Sprachen ist, die Cohere unterstützt, wenn Sie 16K Ausgabe in einem einzigen Durchgang benötigen und wenn eine kommerzielle Lizenz etwas ist, das Ihre Organisation zu kaufen bereit ist, dann ist Coheres Modell die leistungsfähigere Maschine auf jeder offengelegten Dimension – mit der Einschränkung, dass seine Qualität auf einer einzigen nicht reproduzierten Zahl beruht.
Und für die meisten Teams lautet die ehrliche Antwort beides, in dieser Reihenfolge: Das 440MB-Modell erledigt die Routinearbeit zu vernachlässigbaren Kosten, das 218B-Modell übernimmt die Dokumente, auf die es ankommt, und die Entscheidung darüber, welche Anfrage wohin geht, ist eine Routing-Regel und kein Rewrite. Die Kluft zwischen diesen beiden Modellen ist keine Kluft, die geschlossen werden muss. Sie ist ein Spektrum, das genutzt werden sollte.
