
Tencent HY-MT2 1.8B erhält eine gehostete API: Tencents 440-MB-Übersetzer geht in die Cloud
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 426 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 183 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
Tencent HY-MT2 1.8B, das kompakte Mitglied der Hy-MT2-Übersetzungsfamilie, das Tencent Hunyuan am 21. Mai 2026 als Open Source veröffentlichte, ist nun über eine gehostete kommerzielle API nutzbar statt nur selbst gehostet – die API-Listung des Modells wurde am 20. August 2026 zu etwa 0,044 US-Dollar pro Million Input-Tokens und 0,177 US-Dollar pro Million Output-Tokens verfügbar. Dieses Listungsdatum ist wichtiger als sonst, denn die 1.8B war nie nur ein weiterer offener Checkpoint: Es ist das Modell, das Tencent baute, um zu beweisen, dass ein 440 MB großes quantisiertes Übersetzungsmodell vollständig auf einem Telefon laufen kann, und in den drei Monaten seit der Open-Source-Veröffentlichung wird es auch in Tencents eigenem HyTranslate-Mini-Programm und den darauf folgenden iOS- und Android-Apps ausgeliefert. In diesem Artikel geht es darum, was das gehostete API-Angebot ändert, was das Modell tatsächlich ist und welchen Zahlen Sie vertrauen sollten.
Was hat sich am 20. August tatsächlich geändert?
Bisher bedeutete die Verwendung von Tencent HY-MT2 1.8B eine von zwei Möglichkeiten: entweder die Apache-2.0-Gewichte selbst in transformers, vLLM, SGLang oder llama.cpp zu laden oder die Verbraucher-Übersetzungsprodukte von Tencent zu nutzen. Die gehostete API ist ein dritter Weg – Sie senden Text über HTTP, und Tencent Cloud stellt den 1.8B-Endpunkt bereit. Das Modell behält seinen Kontext von 8.192 Token und eine maximale Ausgabelänge von 4.096 Token bei, verarbeitet ausschließlich Text und kostet etwa 0,044 $ pro Million Eingabe-Token und 0,177 $ pro Million Ausgabe-Token. Für Teams mit stark schwankendem Übersetzungsvolumen entfällt damit die Hürde, eine GPU betreiben zu müssen, um das Modell auszuprobieren.

Die andere Hälfte der Geschichte sind die Apps. Das HyTranslate-Mini-Programm wurde zusammen mit der Open-Source-Veröffentlichung im Mai eingeführt und bietet Spracheingabe, Stilvorlagen und einen Offline-Modus. Die iOS- und Android-Apps – die das On-Device-Modell für die netzwerkfreie Übersetzung herunterladen – sind seitdem erschienen. Das 1.8B-Modell ist das Arbeitstier dieser Offline-Geschichte: Mit AngelSlims 1,25-Bit-Extremquantisierung schrumpft es auf etwa 440 MB Speicherplatz und läuft lokal auf Apple-, Qualcomm- und MediaTek-Smartphone-Chips, wobei Tencent eine 1,5-mal schnellere Inferenz als der 4-Bit-Build der vorherigen Generation auf einem Apple A15 berichtet.
Was zur 1.8B ist
HY-MT2-1.8B ist ein dichtes, rein dekoderbasiertes kausales Sprachmodell, das auf der hunyuan_v1_dense-Architektur aufbaut — trotz des Namens 1.8B in der Praxis etwa 2 Milliarden Parameter — mit einer Chat-Vorlage und ohne standardmäßigen System-Prompt. Es übersetzt zwischen 33 Sprachen plus fünf Minderheitensprach- und Dialektpaaren, darunter Chinesisch, Englisch, Japanisch, Koreanisch, Französisch, Spanisch, Russisch, Arabisch, Thailändisch, Vietnamesisch, Indonesisch, Hindi, Bengalisch, Tamil sowie die tibetischen, uigurischen, kasachischen, mongolischen und kantonesischen Dialektpaare. Anders als die klassischen Encoder-Decoder-Übersetzungsmodelle ist es per Instruction-Tuning optimiert: Man gibt ihm die Zielsprache und optionale Anweisungen vor, und es kann JSON- und HTML-Struktur bewahren, ein Glossar berücksichtigen, ein bestimmtes Sprachregister treffen und den umgebenden Kontext zur Disambiguierung nutzen. Diese Fähigkeitsklasse teilen die Schwestermodelle 7B und 30B-A3B, und zu ihrer Bewertung wurde Tencents IFMTBench-Benchmark zusammen mit ihnen veröffentlicht.
Wo die Benchmarks stehen
Die Qualitätsangaben verdienen eine sorgfältige Lektüre, denn fast alle stammen von Tencent selbst und wurden zum Zeitpunkt dieses Textes von keinem unabhängigen Labor reproduziert. Tencent berichtet für HY-MT2-1.8B einen Wert von 89.9% des durchschnittlichen FLORES-200-Ergebnisses von Gemini 3.1 Pro (die 7B bei 97.9%, die 30B-A3B bei 98.6%), 96.7% von Gemini bei dessen praxisnahen Testset im GEMBA-Stil und 96.2% bei DomainMTBench über acht Berufsdomänen hinweg. Einige Presseberichte rundeten den FLORES-200-Wert auf 88.1% ab; die README des Anbieters listet 89.9%. Tencent behauptet außerdem, dass das 1.8B-Modell insgesamt die gängigen kommerziellen Übersetzungs-APIs von Anbietern wie Microsoft und Doubao übertrifft. Unabhängige Reproduktionen existieren noch nicht, daher behandeln Sie all das als herstellerberichtete Richtungsnachweise und nicht als geprüfte Tatsachen. Was nicht vom Hersteller abhängt: Der Satz aus 33+5 Sprachen ist festgelegt, die Apache-2.0-Lizenz ist real, und ein quantisierter Checkpoint von 440MB, der auf einem Telefon läuft, ist unabhängig beobachtbar.

Wie Sie es verwenden würden, und was es kostet
• Selbst gehostet — Apache-2.0-Gewichte von Hugging Face oder ModelScope; ausführbar mit transformers (>=5.6.0), vLLM, SGLang oder llama.cpp-GGUF-Builds. Die Kosten sind Ihre GPU-Rechnung; der 1,25-Bit-Build läuft auf Geräten der CPU-Klasse.

• Gehostete API — Tencent Cloud stellt das 1.8B-Modell zum Zeitpunkt dieses Schreibens für etwa 0,044 $ pro Million Eingabe-Tokens und 0,177 $ pro Million Ausgabe-Tokens bereit; die eigene API des Anbieters und mehrere Drittanbieter-Plattformen bieten es an.
• Verbraucher — HyTranslate-Mini-Programm und die iOS/Android-Apps, einschließlich Offline-Übersetzung über das heruntergeladene On-Device-Modell.
Empfohlenes Sampling für das 1.8B-Modell: Temperatur 0,7, Top-p 0,6, Top-k 20, Repetition Penalty 1,05, maximale Token 4096.
Wenn Sie eine Übersetzungs-Pipeline bauen, anstatt eine Consumer-App auszuliefern, ist das Interessante an einem solchen Modell, dass sein Preis ein bewegliches Ziel ist – Tencent hat seinen Hy-MT2-Pro-API-Tarif bereits im Juni gesenkt. Genau für dieses Szenario gibt es einen Router mit 0 % Aufschlag: Da die Durchreichung zum Listenpreis des Anbieters erfolgt, erscheint eine Preissenkung des Anbieters auf der Rechnung desselben Tages, anstatt erst, nachdem Ihr Gateway die Preise neu berechnet hat. Das Modell selbst steht zum Zeitpunkt dieses Schreibens nicht auf der Liste von OrcaRouter, Sie müssten also die Gewichte selbst hosten oder direkt die API von Tencent Cloud aufrufen; das Argument für Failover und einen einzigen Schlüssel gilt für den breiteren Übersetzungs-Stack, den Sie darum herum aufbauen würden, wo die Mischung eines kleinen On-Device-Modells für günstigen Massenverkehr mit einem größeren Modell für schwierige Sprachpaare genau die Art von Komposition ist, für deren Ausdruck Routing geschaffen wurde.
Das Fazit
Tencent HY-MT2 1.8B war bereits im Mai als ein handygroßer Apache-2.0-Übersetzer interessant; die Auflistung als gehostete API am 20. August macht ihn zu einem Kandidaten für Teams, die ihn testen möchten, ohne eine Infrastruktur aufzubauen. Die Qualitätszahlen stammen vom Anbieter, das Sprachset ist bewusst eher Mainstream als maximal, und der Fußabdruck auf dem Gerät ist das wirklich Besondere daran. Wenn Ihre Sprachpaare in den 33 enthalten sind, ist es jetzt billiger denn je herauszufinden, ob die Behauptungen für Ihre Inhalte zutreffen.
