
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: Die serverseitige Qualitätswahl oder ein 440-MB-Übersetzer auf jedem Smartphone
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
Tencent Hy-MT2-7B und Tencent Hy-MT2-1.8B sind die beiden Endpunkte derselben Familie, die zusammen am 21. Mai 2026 als Open Source veröffentlicht wurden und beide in dieser Woche über gehostete APIs aufrufbar wurden – die 7B etwa am 19. August und die 1.8B einen Tag später, jeweils von Tencent Cloud bereitgestellt. Sie sind im üblichen Sinne keine Konkurrenten, denn ihre Einsatzzwecke überlappen sich kaum. Die 7B ist die Qualitätswahl: ein dichtes Modell, das auf einer einzelnen GPU läuft, oder über eine API zu 0,074 $ pro Million Input- und 0,295 $ pro Million Output-Tokens. Die 1.8B ist die On-Device-Wahl: ein auf 440 Megabyte quantisiertes Modell, das vollständig offline auf einem Telefon läuft, auf der API-Ebene zu 0,044 $ / 0,177 $ pro Million. Wenn man sich zwischen ihnen entscheidet, hängt die Antwort meistens davon ab, wo die Übersetzung stattfinden muss – und erst in zweiter Linie von Benchmarks, die viel näher beieinander liegen, als es die vierfache Parameterlücke vermuten lässt.
Die einzeilige Antwort
Wählen Sie die 7B, wenn die Übersetzung in einem Rechenzentrum stattfindet und Sie die beste Qualität pro Server-Dollar wünschen – auf einer API oder auf einer einzelnen GPU der A100-Klasse. Wählen Sie die 1.8B, wenn die Übersetzung auf einem Gerät, offline oder zu den geringstmöglichen Kosten pro Token erfolgen muss. Wenn beide in derselben Cloud leben und das Budget nicht der entscheidende Faktor ist, gewinnt die 7B bei der Qualität. Wenn der Inhalt vertraulich, reguliert ist oder ohne Netzwerk funktionieren muss, ist die 1.8B die einzige der beiden, die das kann.
Technische Daten im Vergleich
• Parameter — 7B dense gegenüber 1.8B dense.
• Quantisierter Footprint — FP8 und GGUF bis auf wenige GB, gegenüber 440 MB via AngelSlim-1,25-Bit-Quantisierung.
• FLORES-200 (XX⇔XX) — 86,89 vs. 79,77 XCOMET-XXL, also etwa 97,9 % vs. 89,9 % von Gemini 3.1 Pro (Think), laut Herstellerangaben.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B übertrifft die kommerziellen APIs von Microsoft und Doubao bei allen drei Metriken.
• DomainMTBench (GEMBA) — 92,79 vs. 91,08, vom Anbieter gemeldet.
• API-Preis — 0,074 $ / 0,295 $ gegenüber 0,044 $ / 0,177 $ pro 1M Token (Eingabe/Ausgabe).
• Kontext — beide 8.192 Tokens.
• Bereitstellung — eine A100 / RTX 4090 oder Cloud-API vs. Apples, Qualcomms und MediaTeks On-Device-Chips, offline.

Die Qualitätslücke ist real, aber schmaler als die Größenlücke.
Alle folgenden Angaben sind Tencents eigene Auswertung und wurden nicht unabhängig reproduziert. Bei FLORES-200 liegt das 7B-Modell acht XCOMET-Punkte vor dem 1.8B-Modell (86,89 gegenüber 79,77) – genau auf dieser Lücke basiert die Positionierung als „balanced“ gegenüber „on-device“. Doch bei DomainMTBench – dem Domänen-Übersetzungs-Benchmark für Finanzen, Politik und Bildung – landet das 1.8B-Modell nur 1,7 GEMBA-Punkte hinter dem 7B-Modell (91,08 gegenüber 92,79). Und das Abschneiden des 1.8B-Modells gegenüber der breiteren Konkurrenz ist das Detail, das immer wieder überrascht: Tencent berichtet, dass es die kommerziellen Übersetzungs-APIs von Microsoft und Doubao bei allen drei WMT25-Metriken schlägt und Tower-Plus-72B übertrifft – ein Modell, das vierzigmal so groß ist. Bei gewöhnlichen Domänentexten liegt das kleine Modell also deutlich näher an seinem großen Geschwistermodell, als es das Vierfache an Parametern vermuten ließe. Der eigentliche Vorsprung des 7B-Modells zeigt sich am langen Ende der allgemeinen Übersetzung und bei schwierigen Anweisungen, wo sein FLORES-Vorsprung und seine höheren IFMTBench-Werte für komplexe Aufgaben einen klaren Abstand zwischen den beiden schaffen.
Der Deployment-Fork
Das 7B braucht Infrastruktur – entweder eine Cloud-API oder eine einzelne GPU der A100-Klasse, samt dem üblichen Betriebsaufwand. Das 1.8B läuft bei 440 MB mit AngelSlims 1,25-Bit-Quantisierung auf denselben Chips wie eine typische Handy-App, ist 1,5× schneller als die vorherige Hy-MT1.5-Generation und benötigt überhaupt kein Netzwerk. Das macht Datenschutz von einer Funktion zum Standard: Bei Verträgen, Patientenakten oder allem, was Regulierungen unterliegt, verlassen die Daten niemals das Gerät – eine Eigenschaft, die sich auf der Serverseite durch keinen Preis pro Token erkaufen lässt. Der Zielkonflikt zeigt sich bei allgemeiner Übersetzung im FLORES-Stil, wo die zusätzliche Kapazität des 7B durchschlägt – und bei jeder Anweisung, die komplex genug ist, um die 83,14 IFMTBench-Gesamtpunktzahl des 1.8B gegen die höhere Obergrenze des 7B antreten zu lassen.

Die Kostenmathematik
Auf der API-Ebene sind beide Modelle günstig; das {{1}}1.8B{{/1}}-Modell ist günstiger. Bei 0,044 $ / 0,177 $ gegenüber 0,074 $ / 0,295 $ pro Million liegt das kleine Modell auf beiden Seiten der Rechnung etwa 40 % unter dem {{2}}7B{{/2}}-Modell – bei konstant einer Million Output-Tokens pro Tag sind das etwa 70 $ pro Tag gegenüber 118 $. Auf dem Gerät kostet das {{3}}1.8B{{/3}}-Modell null pro Token – eine Zahl, die bei hohem Volumen jeden Serververgleich dominiert. Das Gegenargument des {{4}}7B{{/4}}-Modells ist nicht der Preis, sondern die Leistungsreserve: Wenn Ihr Korpus überwiegend technische, juristische oder anweisungsintensive Inhalte umfasst, ist die Qualitätsreserve des {{5}}7B{{/5}}-Modells genau das, was sich in weniger Neuübersetzungen niederschlägt – und Neuübersetzungen sind die eigentlichen Stückkosten in der professionellen maschinellen Übersetzung.

Routing der beiden Größen
Keines der beiden Modelle befindet sich zum Zeitpunkt dieses Artikels im Katalog von OrcaRouter, daher ist die ehrliche Einordnung, dass beide über Tencents eigene Cloud und mehrere Drittanbieter-Plattformen bereitgestellt werden. Der Vergleich vermittelt dennoch die Routing-Lektion, um die sich dieser Blog dreht: Wenn zwei Modelle sich in ihren Fähigkeiten überschneiden, sich aber in Preis und Latenz unterscheiden, ist die rationale Bereitstellung nicht „eines auswählen“, sondern „nach Arbeitslast routen“ – den mengenmäßig umfangreichen, anspruchslosen Teil an das günstige kleine Modell, den schwierigen Teil an das Qualitätsmodell, mit automatischem Failover, sodass ein Ausfall eines der beiden die Pipeline niemals zum Stillstand bringt. Genau dieses Muster bildet die Routing-DSL von OrcaRouter über die 200+ Modelle hinweg ab, die wir führen, wobei die Listenpreise der einzelnen Anbieter ohne Aufschlag durchgereicht werden. Wenn Tencents Übersetzungsfamilie in den Katalog aufgenommen wird, ist sie der natürliche nächste Mieter.
Das Urteil
Wenn Übersetzung in Ihrem Rechenzentrum stattfindet, nehmen Sie Tencent Hy-MT2-7B — über die API, wenn Sie null Betriebsaufwand möchten, auf einer einzelnen GPU, wenn Sie es selbst betreiben möchten — und hören Sie auf zu lesen. Wenn Übersetzung auf einem Gerät, offline oder unter einer Geheimhaltungsanforderung stattfinden muss, nehmen Sie Tencent Hy-MT2-1.8B, und der 440-MB-Fußabdruck gewinnt per Definition. Der einzige wirklich schwierige Fall ist eine Cloud-Workload mit mittlerem Volumen, bei der sowohl die Qualität der 7B als auch der Preis der 1.8B vertretbar sind. Entscheiden Sie dort nicht anhand von Anbieter-Benchmarks: Die gemeldete GEMBA-Lücke liegt unter zwei Punkten, also führen Sie beide mit Ihrem eigenen Domänentext aus und lassen Sie Ihre Daten entscheiden.
