Eine Hero-Titelkarte für „Tencent HY-MT2 1.8B erhält eine gehostete API“, Untertitel „Tencents 440-MB-Übersetzer geht in die Cloud“, die ein Smartphone mit einem Sprachglyphen zeigt, eine Cloud, die einen kompakten 440-MB-Chip liefert, einen Globus mit 33 Punkten, ein Datumsabzeichen mit „Open-Source am 21. Mai 2026 · Gehostete API am 20. August 2026“ und das OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Tencent HY-MT2 1.8B erhält eine gehostete API: Tencents 440-MB-Übersetzer geht in die Cloud

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent HY-MT2 1.8B, das kompakte Mitglied der Hy-MT2-Übersetzungsfamilie, das Tencent Hunyuan am 21. Mai 2026 als Open Source veröffentlichte, ist nun über eine gehostete kommerzielle API nutzbar statt nur selbst gehostet – die API-Listung des Modells wurde am 20. August 2026 zu etwa 0,044 US-Dollar pro Million Input-Tokens und 0,177 US-Dollar pro Million Output-Tokens verfügbar. Dieses Listungsdatum ist wichtiger als sonst, denn die 1.8B war nie nur ein weiterer offener Checkpoint: Es ist das Modell, das Tencent baute, um zu beweisen, dass ein 440 MB großes quantisiertes Übersetzungsmodell vollständig auf einem Telefon laufen kann, und in den drei Monaten seit der Open-Source-Veröffentlichung wird es auch in Tencents eigenem HyTranslate-Mini-Programm und den darauf folgenden iOS- und Android-Apps ausgeliefert. In diesem Artikel geht es darum, was das gehostete API-Angebot ändert, was das Modell tatsächlich ist und welchen Zahlen Sie vertrauen sollten.

Was hat sich am 20. August tatsächlich geändert?

Bisher bedeutete die Verwendung von Tencent HY-MT2 1.8B eine von zwei Möglichkeiten: entweder die Apache-2.0-Gewichte selbst in transformers, vLLM, SGLang oder llama.cpp zu laden oder die Verbraucher-Übersetzungsprodukte von Tencent zu nutzen. Die gehostete API ist ein dritter Weg – Sie senden Text über HTTP, und Tencent Cloud stellt den 1.8B-Endpunkt bereit. Das Modell behält seinen Kontext von 8.192 Token und eine maximale Ausgabelänge von 4.096 Token bei, verarbeitet ausschließlich Text und kostet etwa 0,044 $ pro Million Eingabe-Token und 0,177 $ pro Million Ausgabe-Token. Für Teams mit stark schwankendem Übersetzungsvolumen entfällt damit die Hürde, eine GPU betreiben zu müssen, um das Modell auszuprobieren.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2: High-Performance Multilingual Translation Model (captured Aug 20, 2026), showing the English page header with the Tencent Cloud nav, the title 'Hy-MT2: High-Performance Multilingual Translation Model for Real Use', and the table of contents starting with the model name.

Die andere Hälfte der Geschichte sind die Apps. Das HyTranslate-Mini-Programm wurde zusammen mit der Open-Source-Veröffentlichung im Mai eingeführt und bietet Spracheingabe, Stilvorlagen und einen Offline-Modus. Die iOS- und Android-Apps – die das On-Device-Modell für die netzwerkfreie Übersetzung herunterladen – sind seitdem erschienen. Das 1.8B-Modell ist das Arbeitstier dieser Offline-Geschichte: Mit AngelSlims 1,25-Bit-Extremquantisierung schrumpft es auf etwa 440 MB Speicherplatz und läuft lokal auf Apple-, Qualcomm- und MediaTek-Smartphone-Chips, wobei Tencent eine 1,5-mal schnellere Inferenz als der 4-Bit-Build der vorherigen Generation auf einem Apple A15 berichtet.

Was zur 1.8B ist

HY-MT2-1.8B ist ein dichtes, rein dekoderbasiertes kausales Sprachmodell, das auf der hunyuan_v1_dense-Architektur aufbaut — trotz des Namens 1.8B in der Praxis etwa 2 Milliarden Parameter — mit einer Chat-Vorlage und ohne standardmäßigen System-Prompt. Es übersetzt zwischen 33 Sprachen plus fünf Minderheitensprach- und Dialektpaaren, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Spanisch, Russisch, Arabisch, Thailändisch, Vietnamesisch, Indonesisch, Hindi, Bengalisch, Tamil sowie die tibetischen, uigurischen, kasachischen, mongolischen und kantonesischen Dialektpaare. Anders als die klassischen Encoder-Decoder-Übersetzungsmodelle ist es per Instruction-Tuning optimiert: Man gibt ihm die Zielsprache und optionale Anweisungen vor, und es kann JSON- und HTML-Struktur bewahren, ein Glossar berücksichtigen, ein bestimmtes Sprachregister treffen und den umgebenden Kontext zur Disambiguierung nutzen. Diese Fähigkeitsklasse teilen die Schwestermodelle 7B und 30B-A3B, und zu ihrer Bewertung wurde Tencents IFMTBench-Benchmark zusammen mit ihnen veröffentlicht.

Wo die Benchmarks stehen

Die Qualitätsangaben verdienen eine sorgfältige Lektüre, denn fast alle stammen von Tencent selbst und wurden zum Zeitpunkt dieses Textes von keinem unabhängigen Labor reproduziert. Tencent berichtet für HY-MT2-1.8B einen Wert von 89.9% des durchschnittlichen FLORES-200-Ergebnisses von Ge​mini 3.1 Pro (die 7B bei 97.9%, die 30B-A3B bei 98.6%), 96.7% von Ge​mini bei dessen praxisnahen Testset im GEMBA-Stil und 96.2% bei DomainMTBench über acht Berufsdomänen hinweg. Einige Presseberichte rundeten den FLORES-200-Wert auf 88.1% ab; die README des Anbieters listet 89.9%. Tencent behauptet außerdem, dass das 1.8B-Modell insgesamt die gängigen kommerziellen Übersetzungs-APIs von Anbietern wie Microsoft und Doubao übertrifft. Unabhängige Reproduktionen existieren noch nicht, daher behandeln Sie all das als herstellerberichtete Richtungsnachweise und nicht als geprüfte Tatsachen. Was nicht vom Hersteller abhängt: Der Satz aus 33+5 Sprachen ist festgelegt, die Apache-2.0-Lizenz ist real, und ein quantisierter Checkpoint von 440MB, der auf einem Telefon läuft, ist unabhängig beobachtbar.

A single-column spec scoreboard for Tencent HY-MT2 1.8B reading: Params: ~2B dense decoder-only; Languages: 33 + 5 dialect pairs; Released: May 21, 2026 · Apache-2.0; FLORES-200: 89.9% of Gemini 3.1 Pro; On-device: 440MB at 1.25-bit; API: ~$0.044 / $0.177 per 1M tokens; footer 'Benchmark figures vendor-reported; no independent scores yet.'

Wie Sie es verwenden würden, und was es kostet

• Selbst gehostet — Apache-2.0-Gewichte von Hugging Face oder ModelScope; ausführbar mit transformers (>=5.6.0), vLLM, SGLang oder llama.cpp-GGUF-Builds. Die Kosten sind Ihre GPU-Rechnung; der 1,25-Bit-Build läuft auf Geräten der CPU-Klasse.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured Aug 20, 2026) showing the model header, the Tencent attribution, the Translation / Transformers / Safetensors tags, a 36-languages tag, the hunyuan_v1_dense architecture label, the arxiv 2605.22064 link, the apache-2.0 license, and the 2B-params model size.

• Gehostete API — Tencent Cloud stellt das 1.8B-Modell zum Zeitpunkt dieses Schreibens für etwa 0,044 $ pro Million Eingabe-Tokens und 0,177 $ pro Million Ausgabe-Tokens bereit; die eigene API des Anbieters und mehrere Drittanbieter-Plattformen bieten es an.

• Verbraucher — HyTranslate-Mini-Programm und die iOS/Android-Apps, einschließlich Offline-Übersetzung über das heruntergeladene On-Device-Modell.

Empfohlenes Sampling für das 1.8B-Modell: Temperatur 0,7, Top-p 0,6, Top-k 20, Repetition Penalty 1,05, maximale Token 4096.

Wenn Sie eine Übersetzungs-Pipeline bauen, anstatt eine Consumer-App auszuliefern, ist das Interessante an einem solchen Modell, dass sein Preis ein bewegliches Ziel ist – Tencent hat seinen Hy-MT2-Pro-API-Tarif bereits im Juni gesenkt. Genau für dieses Szenario gibt es einen Router mit 0 % Aufschlag: Da die Durchreichung zum Listenpreis des Anbieters erfolgt, erscheint eine Preissenkung des Anbieters auf der Rechnung desselben Tages, anstatt erst, nachdem Ihr Gateway die Preise neu berechnet hat. Das Modell selbst steht zum Zeitpunkt dieses Schreibens nicht auf der Liste von OrcaRouter, Sie müssten also die Gewichte selbst hosten oder direkt die API von Tencent Cloud aufrufen; das Argument für Failover und einen einzigen Schlüssel gilt für den breiteren Übersetzungs-Stack, den Sie darum herum aufbauen würden, wo die Mischung eines kleinen On-Device-Modells für günstigen Massenverkehr mit einem größeren Modell für schwierige Sprachpaare genau die Art von Komposition ist, für deren Ausdruck Routing geschaffen wurde.

Das Fazit

Tencent HY-MT2 1.8B war bereits im Mai als ein handygroßer Apache-2.0-Übersetzer interessant; die Auflistung als gehostete API am 20. August macht ihn zu einem Kandidaten für Teams, die ihn testen möchten, ohne eine Infrastruktur aufzubauen. Die Qualitätszahlen stammen vom Anbieter, das Sprachset ist bewusst eher Mainstream als maximal, und der Fußabdruck auf dem Gerät ist das wirklich Besondere daran. Wenn Ihre Sprachpaare in den 33 enthalten sind, ist es jetzt billiger denn je herauszufinden, ob die Behauptungen für Ihre Inhalte zutreffen.