Hero-Karte mit der Überschrift „North Small Translate 1.0 vs Hy-MT2-7B“ und dem Untertitel „One GPU against two B200s“, über zwei Karten: North Small Translate 1.0 (218B MoE / 25B aktiv, CC BY-NC 4.0) und Hy-MT2-7B (8B dense, etwa 16GB VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 gegen Hy-MT2-7B: Eine GPU gegen zwei B200

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das derzeit engste Duell im Bereich der offenen Übersetzung ist vielleicht zugleich das am wenigsten offensichtliche. Hy-MT2-7B ist das mittlere Kind von Tencent Hunyuans Übersetzungsfamilie, am 21. Mai 2026 unter Apache 2.0 als Open Source veröffentlicht, und läuft auf einer einzelnen RTX 4090 oder A100 mit etwa 16 GB VRAM. North Small Translate 1.0 ist Coheres Übersetzer mit 218 Milliarden Parametern auf Basis eines sparse Mixture-of-Experts, dokumentiert in den Versionshinweisen des Unternehmens vom 9. September 2026, mit einer Mindestbereitstellung von zwei B200 bei FP8 oder einem B200 in seiner NVFP4-W4A16-Form. Beide sind Übersetzungsspezialisten. Beide sind aktuell. Einen von beiden kann man von einer Workstation aus betreiben, und allein diese Tatsache stellt den gesamten Vergleich in ein neues Licht – denn der Benchmark, an dem sie am liebsten zu gleichen Bedingungen gemessen werden möchten, existiert nicht.

Beginne mit dem Umschlag, nicht mit den Ergebnissen.

Die Bereitstellungskosten sind die Dimension, die die meisten realen Integrationen entscheidet, und hier liegen die beiden Modelle nicht nahe beieinander. Hy-MT2-7B ist ein dichtes HunYuanDenseV1-Modell mit rund acht Milliarden Parametern und veröffentlichten FP8- und GGUF-Builds sowie 8-Bit-MLX-Versionen aus der Community für Apple Silicon. In Tenscent...

North Small Translate 1.0 ist eine andere Art von Objekt. Seine insgesamt 218 Mrd. Parameter, von denen 25 Mrd. aktiv sind, sind auf 128 Experten aufgeteilt, wobei acht pro Token aktiv sind, plus gemeinsam genutzte Experten, und Cohere veröffentlicht die Mindesthardware für jeden seiner drei Checkpoints: vier B200 oder acht H100 für BF16, zwei B200 oder vier H100 für FP8, ein B200 oder zwei H100 für den NVFP4-W4A16-Build. Das Serving läuft über vLLM mit cohere_melody>=0.9.0, und Cohere empfiehlt Greedy-Decoding, um der Produktion zu entsprechen. Die Ausgabe trägt <|START_TEXT|> und <|END_TEXT|> Marker, die nicht als spezielle Token registriert sind.

Form — North Small Translate 1.0: 218B gesamt / 25B aktiv, sparse MoE, 128 Experten vs. Hy-MT2-7B: dense, etwa 8B

Kontext — 16K rein und 16K raus vs. 8K Arbeitsfenster, die Konfiguration verspricht bis zu 262.144 Positionen

Mindesthardware — 1×B200 bei W4A16, 2×B200 oder 4×H100 bei FP8 vs. eine einzelne GPU der RTX-4090-Klasse in ~16 GB

Veröffentlichte Formate — BF16, FP8, NVFP4 W4A16 vs. Basis, FP8, GGUF, plus Community-MLX-8-Bit

Sprachen — 50 (Englisch + 49) vs. 33 Sprachen plus 5 Minderheitensprachen und Dialekte

Lizenz — CC BY-NC 4.0, kommerziell über Model Vault vs. Apache 2.0, ohne Zugangsbeschränkung

Gemeldete Qualität — WMT26 83,60, Metrik unbenannt, vom Anbieter gemeldet vs. Tabellen benannter Anbieter auf FLORES-200, WMT25 GEMBA, XCOMET-XXL und IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Das Benchmark-Problem

Hier ist der ehrliche Kern dieses Vergleichs: Wir können diese beiden Modelle nicht gegeneinander einordnen, und wer dir etwas anderes erzählt, erfindet eine Zahl. Tencent hat vier benannte Evaluierungen veröffentlicht. Bei der FLORES-200-Übersetzung von Englisch nach X erzielt das 7B-Modell 93,52 und liegt damit hinter den 94,42 von Gemini 3.1 Pro und den 94,16 von GPT-5.5, aber nah genug dran, um relevant zu sein. Bei der WMT25-nahen GEMBA-Metrik erreicht es 82,24 gegenüber den 84,34 des 30B-A3B und den 83,41 von GPT-5.5. Bei XCOMET-XXL führt es mit 63,86 alles in Tencents Vergleichstabelle an – vor Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro und Kimi K2.6. Beim Instruction-Following-Wert von IFMTBench landet es bei 83,14 %. All dies sind Tencents eigene Zahlen, keine davon wurde unabhängig reproduziert, und sie sind immer noch weit mehr, als Cohere vorgelegt hat.

Cohere hat eine einzige Zahl veröffentlicht: einen WMT26-Score von 83,60, der unter einem agentischen Multi-Pass-Workflow auf 84,36 steigt. Weder auf der Modellkarte noch im Versionshinweis wird eine Metrik genannt, und es wurde keine WMT26-Ergebnisseite für dieses Modell veröffentlicht. Diese Asymmetrie ist kein Beweis dafür, dass Coheres Modell schwächer oder stärker ist. Sie bedeutet, dass der Vergleich, den ein Leser am meisten sucht – gleicher Test, gleiche Metrik, beide Modelle –, anhand öffentlich zugänglicher Belege nicht angestellt werden kann, und die Vier-Punkte-Spanne zwischen Coheres eigenen beiden Zahlen (83,60 bis 84,36) ist bereits größer als die meisten Abstände in Tencents Tabelle.

Sprachen und das lange Dokument

North Small Translate 1.0 deckt fünfzig Sprachen und Locale-Varianten ab, wobei Modernes Standardarabisch, Deutsch, Französisch, Japanisch, Koreanisch, Russisch und Ukrainisch der obersten Stufe zugeordnet sind, und akzeptiert und emittiert 16.000 Tokens sowohl bei der Eingabe als auch bei der Ausgabe. Hy-MT2-7B deckt dreiunddreißig Sprachen plus fünf Minderheitensprachen und Dialekte ab, darunter Tibetisch, Uigurisch und Kantonesisch. Keine der beiden Listen ist eine Obermenge der anderen — Tencent erreicht Kantonesisch und Uigurisch, Cohere erreicht eine breitere Palette europäischer Locales — daher kann ein mehrsprachiger Einsatz feststellen, dass er beide allein aufgrund der Abdeckung benötigt.

Das Ausgabefenster ist der leisere Unterschied. Sechzehntausend Token Ausgabe bedeuten ein vollständiges Verfahrensdokument in einem Durchgang, mit über das gesamte Dokument hinweg konsistenter Terminologie und konsistentem Register, weil das Modell alles davon gesehen hat. Ein 8K-Fenster nicht, und die satzweise Behelfslösung führt genau die segmentübergreifenden Konsistenzprobleme wieder ein, die zu messen Instruction-Following-Benchmarks für Übersetzung wie IFMTBench entwickelt wurden.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Die Lizenz entscheidet wieder einmal mehr als die Tabelle.

North Small Translate 1.0 steht unter CC BY-NC 4.0. Die Gewichte sind für nichtkommerzielle Arbeit kostenlos, und der kommerzielle Einsatz läuft über Coheres Model Vault unter einer gekauften Lizenz ohne veröffentlichten Preis. Hy-MT2-7B ist Apache 2.0 und ohne Zugangsbeschränkung — kommerzielle Nutzung, Fine-Tuning und Ableitungen sind alle ohne Rückfrage erlaubt. Für ein kommerzielles Produkt ergibt sich die Reihenfolge der Arbeitsschritte von selbst: Hy-MT2-7B ist heute einsetzbar und Coheres Modell ist heute evaluierbar, und keine Benchmark-Zeile ändert diese Reihenfolge.

Der ausgleichende Vorteil von Cohere ist der kostenlose Tarif. North Small Translate 1.0 läuft im kostenlosen Tarif von Chat V2, der sowohl für Test- als auch für Produktionsschlüssel kostenlos ist, bis die Rate Limits erreicht sind, sodass eine Evaluation nichts außer Zeit kostet. Hy-MT2-7B hat eine gehostete kommerzielle API – Tencent hat den gehosteten Tarif der Familie auf ungefähr 0,044 US-Dollar pro Million Eingabe-Tokens und 0,177 US-Dollar pro Million Ausgabe-Tokens festgelegt – und das Selbsthosting auf Ihrer eigenen GPU ist der wirklich kostenlose Weg.

Was „multi-pass“ tatsächlich impliziert

Coheres Entscheidung, sowohl eine 83,60 als auch eine 84,36 zu veröffentlichen, ist das aussagekräftigste Detail in der Versionshinweis, denn sie zeigt, dass das Unternehmen glaubt, dass ein Workflow besser ist als ein einzelner Aufruf. Das ist dieselbe Wette, die Tencent mit einem anderen Mechanismus eingegangen ist: Sein Flaggschiff 30B-A3B gewinnt bei GEMBA und XCOMET, während Gemini 3.1 Pro bei FLORES-200 gewinnt, was bedeutet, dass das beste System nicht ein einzelnes Modell ist, sondern ein Gremium. OrcaRouters Modellfusion betreibt mehrere Modelle als Gremium und bringt ihre Antworten innerhalb eines einzigen Aufrufs in Einklang – die Version der Multi-Pass-Idee auf Plattformebene, die beide Anbieter verfolgen – und sie lässt sich mit der Routing-Seite kombinieren, wo ein Schlüssel einen Katalog von mehr als 200 Modellen zum Listenpreis des Anbieters mit 0 % Aufschlag abdeckt, sodass eine Preisänderung eines Anbieters noch am selben Tag bei uns ankommt und nicht erst bei der nächsten Vertragsverlängerung.

Diese Rahmung löst auch das Evidenzproblem, mit dem dieser Artikel begann. Wenn zwei Anbieter nicht überlappende Benchmarks veröffentlichen und keiner von beiden eine unabhängige Bewertung vorweisen kann, besteht die Wahl nicht darin, einer Tabelle zu vertrauen. Sie besteht darin, beide mit den eigenen Dokumenten laufen zu lassen und die Abweichung an echtem Text sichtbar werden zu lassen – genau dafür sind ein Panel und eine Failover-Kette da.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Welches, und wann

Wenn Sie ein Übersetzungsmodell benötigen, das auf Hardware läuft, die Sie bereits besitzen, in einem kommerziellen Produkt, ohne ein Lizenzierungsgespräch, dann gewinnt Hy-MT2-7B allein aufgrund des Rahmens – und seine vom Anbieter veröffentlichten Ergebnisse sind, so unbestätigt sie auch sein mögen, zumindest benannt, vergleichbar und nahe an der Frontier. Wenn Sie lange Dokumente in Coheres fünfzig Sprachen übersetzen, 16K konsistente Ausgabe pro Durchlauf benötigen und entweder ein Budget für zwei B200 oder die Bereitschaft haben, die Evaluierung vor Ihrer Entscheidung im kostenlosen Tarif von Cohere durchzuführen, dann ist North Small Translate 1.0 auf jeder offengelegten Achse die leistungsfähigere Maschine.

Keines der beiden Modelle macht das Testen überflüssig. Cohere hat Ihnen eine unbenannte Zahl und eine kostenlose Möglichkeit gegeben, sie zu überprüfen. Tencent hat Ihnen eine Tabelle und einen Download in GPU-Größe geliefert. Die 83,60 ist ein Versprechen, kein Ergebnis – und der einzige Ort, an dem dieses Versprechen eingelöst wird, ist Ihr eigener Korpus.