Eine Hero-Titelkarte für 'Tencent Hy-MT2-7B vs. Tencent Hy-MT2-1.8B' mit dem Untertitel 'Die serverseitige Qualitätswahl oder ein 440-MB-Übersetzer auf jedem Telefon', die ein Server-Symbol und ein Smartphone-Symbol mit einer Waage dazwischen, einen 440-MB-Chip und zwei Modellnamen-Etiketten zeigt, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Die serverseitige Qualitätswahl oder ein 440-MB-Übersetzer auf jedem Smartphone

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent Hy-MT2-7B und Tencent Hy-MT2-1.8B sind die beiden Endpunkte derselben Familie, die zusammen am 21. Mai 2026 als Open Source veröffentlicht wurden und beide in dieser Woche über gehostete APIs aufrufbar wurden – die 7B etwa am 19. August und die 1.8B einen Tag später, jeweils von Tencent Cloud bereitgestellt. Sie sind im üblichen Sinne keine Konkurrenten, denn ihre Einsatzzwecke überlappen sich kaum. Die 7B ist die Qualitätswahl: ein dichtes Modell, das auf einer einzelnen GPU läuft, oder über eine API zu 0,074 $ pro Million Input- und 0,295 $ pro Million Output-Tokens. Die 1.8B ist die On-Device-Wahl: ein auf 440 Megabyte quantisiertes Modell, das vollständig offline auf einem Telefon läuft, auf der API-Ebene zu 0,044 $ / 0,177 $ pro Million. Wenn man sich zwischen ihnen entscheidet, hängt die Antwort meistens davon ab, wo die Übersetzung stattfinden muss – und erst in zweiter Linie von Benchmarks, die viel näher beieinander liegen, als es die vierfache Parameterlücke vermuten lässt.

Die einzeilige Antwort

Wählen Sie die 7B, wenn die Übersetzung in einem Rechenzentrum stattfindet und Sie die beste Qualität pro Server-Dollar wünschen – auf einer API oder auf einer einzelnen GPU der A100-Klasse. Wählen Sie die 1.8B, wenn die Übersetzung auf einem Gerät, offline oder zu den geringstmöglichen Kosten pro Token erfolgen muss. Wenn beide in derselben Cloud leben und das Budget nicht der entscheidende Faktor ist, gewinnt die 7B bei der Qualität. Wenn der Inhalt vertraulich, reguliert ist oder ohne Netzwerk funktionieren muss, ist die 1.8B die einzige der beiden, die das kann.

Technische Daten im Vergleich

Parameter — 7B dense gegenüber 1.8B dense.

Quantisierter Footprint — FP8 und GGUF bis auf wenige GB, gegenüber 440 MB via AngelSlim-1,25-Bit-Quantisierung.

FLORES-200 (XX⇔XX) — 86,89 vs. 79,77 XCOMET-XXL, also etwa 97,9 % vs. 89,9 % von Gemini 3.1 Pro (Think), laut Herstellerangaben.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B übertrifft die kommerziellen APIs von Microsoft und Doubao bei allen drei Metriken.

DomainMTBench (GEMBA) — 92,79 vs. 91,08, vom Anbieter gemeldet.

API-Preis — 0,074 $ / 0,295 $ gegenüber 0,044 $ / 0,177 $ pro 1M Token (Eingabe/Ausgabe).

Kontext — beide 8.192 Tokens.

Bereitstellung — eine A100 / RTX 4090 oder Cloud-API vs. Apples, Qualcomms und MediaTeks On-Device-Chips, offline.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

Die Qualitätslücke ist real, aber schmaler als die Größenlücke.

Alle folgenden Angaben sind Tencents eigene Auswertung und wurden nicht unabhängig reproduziert. Bei FLORES-200 liegt das 7B-Modell acht XCOMET-Punkte vor dem 1.8B-Modell (86,89 gegenüber 79,77) – genau auf dieser Lücke basiert die Positionierung als „balanced“ gegenüber „on-device“. Doch bei DomainMTBench – dem Domänen-Übersetzungs-Benchmark für Finanzen, Politik und Bildung – landet das 1.8B-Modell nur 1,7 GEMBA-Punkte hinter dem 7B-Modell (91,08 gegenüber 92,79). Und das Abschneiden des 1.8B-Modells gegenüber der breiteren Konkurrenz ist das Detail, das immer wieder überrascht: Tencent berichtet, dass es die kommerziellen Übersetzungs-APIs von Microsoft und Doubao bei allen drei WMT25-Metriken schlägt und Tower-Plus-72B übertrifft – ein Modell, das vierzigmal so groß ist. Bei gewöhnlichen Domänentexten liegt das kleine Modell also deutlich näher an seinem großen Geschwistermodell, als es das Vierfache an Parametern vermuten ließe. Der eigentliche Vorsprung des 7B-Modells zeigt sich am langen Ende der allgemeinen Übersetzung und bei schwierigen Anweisungen, wo sein FLORES-Vorsprung und seine höheren IFMTBench-Werte für komplexe Aufgaben einen klaren Abstand zwischen den beiden schaffen.

Der Deployment-Fork

Das 7B braucht Infrastruktur – entweder eine Cloud-API oder eine einzelne GPU der A100-Klasse, samt dem üblichen Betriebsaufwand. Das 1.8B läuft bei 440 MB mit AngelSlims 1,25-Bit-Quantisierung auf denselben Chips wie eine typische Handy-App, ist 1,5× schneller als die vorherige Hy-MT1.5-Generation und benötigt überhaupt kein Netzwerk. Das macht Datenschutz von einer Funktion zum Standard: Bei Verträgen, Patientenakten oder allem, was Regulierungen unterliegt, verlassen die Daten niemals das Gerät – eine Eigenschaft, die sich auf der Serverseite durch keinen Preis pro Token erkaufen lässt. Der Zielkonflikt zeigt sich bei allgemeiner Übersetzung im FLORES-Stil, wo die zusätzliche Kapazität des 7B durchschlägt – und bei jeder Anweisung, die komplex genug ist, um die 83,14 IFMTBench-Gesamtpunktzahl des 1.8B gegen die höhere Obergrenze des 7B antreten zu lassen.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

Die Kostenmathematik

Auf der API-Ebene sind beide Modelle günstig; das {{1}}1.8B{{/1}}-Modell ist günstiger. Bei 0,044 $ / 0,177 $ gegenüber 0,074 $ / 0,295 $ pro Million liegt das kleine Modell auf beiden Seiten der Rechnung etwa 40 % unter dem {{2}}7B{{/2}}-Modell – bei konstant einer Million Output-Tokens pro Tag sind das etwa 70 $ pro Tag gegenüber 118 $. Auf dem Gerät kostet das {{3}}1.8B{{/3}}-Modell null pro Token – eine Zahl, die bei hohem Volumen jeden Serververgleich dominiert. Das Gegenargument des {{4}}7B{{/4}}-Modells ist nicht der Preis, sondern die Leistungsreserve: Wenn Ihr Korpus überwiegend technische, juristische oder anweisungsintensive Inhalte umfasst, ist die Qualitätsreserve des {{5}}7B{{/5}}-Modells genau das, was sich in weniger Neuübersetzungen niederschlägt – und Neuübersetzungen sind die eigentlichen Stückkosten in der professionellen maschinellen Übersetzung.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

Routing der beiden Größen

Keines der beiden Modelle befindet sich zum Zeitpunkt dieses Artikels im Katalog von OrcaRouter, daher ist die ehrliche Einordnung, dass beide über Tencents eigene Cloud und mehrere Drittanbieter-Plattformen bereitgestellt werden. Der Vergleich vermittelt dennoch die Routing-Lektion, um die sich dieser Blog dreht: Wenn zwei Modelle sich in ihren Fähigkeiten überschneiden, sich aber in Preis und Latenz unterscheiden, ist die rationale Bereitstellung nicht „eines auswählen“, sondern „nach Arbeitslast routen“ – den mengenmäßig umfangreichen, anspruchslosen Teil an das günstige kleine Modell, den schwierigen Teil an das Qualitätsmodell, mit automatischem Failover, sodass ein Ausfall eines der beiden die Pipeline niemals zum Stillstand bringt. Genau dieses Muster bildet die Routing-DSL von OrcaRouter über die 200+ Modelle hinweg ab, die wir führen, wobei die Listenpreise der einzelnen Anbieter ohne Aufschlag durchgereicht werden. Wenn Tencents Übersetzungsfamilie in den Katalog aufgenommen wird, ist sie der natürliche nächste Mieter.

Das Urteil

Wenn Übersetzung in Ihrem Rechenzentrum stattfindet, nehmen Sie Tencent Hy-MT2-7B — über die API, wenn Sie null Betriebsaufwand möchten, auf einer einzelnen GPU, wenn Sie es selbst betreiben möchten — und hören Sie auf zu lesen. Wenn Übersetzung auf einem Gerät, offline oder unter einer Geheimhaltungsanforderung stattfinden muss, nehmen Sie Tencent Hy-MT2-1.8B, und der 440-MB-Fußabdruck gewinnt per Definition. Der einzige wirklich schwierige Fall ist eine Cloud-Workload mit mittlerem Volumen, bei der sowohl die Qualität der 7B als auch der Preis der 1.8B vertretbar sind. Entscheiden Sie dort nicht anhand von Anbieter-Benchmarks: Die gemeldete GEMBA-Lücke liegt unter zwei Punkten, also führen Sie beide mit Ihrem eigenen Domänentext aus und lassen Sie Ihre Daten entscheiden.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube