Eine Hero-Titelkarte für „Tencent Hy-MT2-7B hat jetzt eine gehostete API“ mit dem Untertitel „Was ein Übersetzer für $0.295 pro Million Output verändert“, die ein Cloud-Dienst-Symbol, eine Übersetzungsglyphe, eine API-Verbindungslinie und einen Preisschild-Chip mit der Beschriftung „$0.074 / $0.295 pro 1M Token“ zeigt, mit dem OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Tencent Hy-MT2-7B hat jetzt eine gehostete API: Was ein Übersetzer für 0,295 $ pro Million Output-Token verändert

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Tencent Hy-MT2-7B, das Open-Source-Übersetzungsmodell, das Tencent Hunyuan am 21. Mai 2026 veröffentlicht hat, ist diese Woche über eine gehostete API aufrufbar geworden: Etwa am 19. August 2026 wurde das Dense-7B-Modell über den gehosteten Endpunkt der Tencent Cloud verfügbar, zu 0,074 US-Dollar pro Million Input-Tokens und 0,295 US-Dollar pro Million Output-Tokens, mit einem Kontextfenster von 8.192 Tokens. Es kam nicht allein – Tencent Hy-MT2-1.8B und Tencent Hy-MT2-30B-A3B erschienen innerhalb eines Tages auf demselben Backend. Die Gewichte liegen seit drei Monaten auf Hugging Face und ModelScope; neu ist, dass ein Team das Modell nun aufrufen kann, ohne eine GPU zu mieten, llama.cpp aus dem Quellcode zu bauen oder die 1,25-Bit-On-Device-Toolchain auszuliefern. Für eine Übersetzungs-Workload ist das der Unterschied zwischen einem Experiment und einer Produktentscheidung.

Was ist gerade erschienen?

Der kommerzielle Endpunkt ist Tencent Clouds eigener, bereitgestellt über die API des Anbieters und mehrere Drittanbieter-Plattformen. Die drei Größen laufen jeweils in einem 8K-Kontext mit 4.096-Token-Vervollständigungen; alle drei akzeptieren strukturierte Ausgaben über ein JSON-Schema im Feld response_format, und keine von ihnen implementiert Funktionsaufrufe. Die praktische Spezifikation, eine Zeile pro Dimension:

Tencent Hy-MT2-7B — 0,074 $ Input / 0,295 $ Output pro 1M Token, 8.192 Kontext, dense ~7B, strukturierte Ausgabe unterstützt, keine Tool-Calls.

Tencent Hy-MT2-1.8B — $0,044 Input / $0,177 Output pro 1M Tokens, 8.192 Kontext, dichtes 1,8B-Modell, keine Tool-Calls.

Tencent Hy-MT2-30B-A3B — 0,074 $ Eingabe / 0,295 $ Ausgabe pro 1M Tokens, 8.192 Kontext, MoE 30B gesamt / 3B aktiv, unterstützt strukturierte Ausgabe, keine Tool-Aufrufe.

Das Preishighlight ist die Ausgaberate der 7B: unter drei Zehntel Cent pro tausend Ausgabe-Tokens für ein Modell, von dem Tencent behauptet, dass es mit Modellen mithalten kann, die um eine Größenordnung größer sind. Übersetzung ist eine der wenigen LLM-Workloads, bei denen Ausgabe-Tokens fast die gesamte Rechnung ausmachen. Deshalb ist der Ausgabepreis die Zahl, die darüber entscheidet, ob eine Pipeline bei hohem Volumen wirtschaftlich tragfähig ist.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Das Modell hinter dem Endpoint

Hy-MT2 ist Tencents Familie für „schnelles Denken“: Statt bei jedem Satz lange Gedankenketten zu verbrauchen, ist es darauf ausgelegt, wie ein professioneller Übersetzer zu reagieren – gründlich, wo die Quelle mehrdeutig ist, schnell, wo sie es nicht ist. Die 7B-Variante ist das ausgewogene Mittelstück der Familie, ein dichtes Modell, das unter Apache-2.0 lizenziert ist und 33 Sprachen sowie fünf chinesische Minderheitensprachen und Dialektpaare abdeckt (darunter Tibetisch, Kasachisch, Mongolisch, Uigurisch und Kantonesisch). Was es von einem allgemeinen LLM unterscheidet, das Übersetzungen anfertigt, ist die Befolgung von Anweisungen: Es hält einen Glossarbegriff über ein Dokument hinweg ein, wendet einen vorgegebenen Stil an, lässt Trennzeichen und JSON-Schlüssel unangetastet und nimmt Personalisierungsanweisungen in einfacher Sprache entgegen. Tencent hat IFMTBench, einen offenen Benchmark genau für diese Fähigkeit, zusammen mit den Gewichten veröffentlicht, und die Verbraucherseite – das Tencent Hy Translate Mini-Programm, mit iOS- und Android-Apps in Vorbereitung – basiert auf dieser Familie.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

Die Zahlen mit dem angehängten Sternchen.

Alles unten Stehende ist Tencents eigene Bewertung, die auf der Modellkarte und im begleitenden Bericht veröffentlicht wurde; nichts davon wurde zum Zeitpunkt dieses Schreibens unabhängig reproduziert. Auf dem allgemeinen Übersetzungs-Track XX⇔XX von FLORES-200 erzielt das 7B-Modell 86,89 XCOMET-XXL, was Tencent auf etwa 97,9 % von Gemini 3.1 Pro (Think) beziffert. Im „fast-thinking“-Modus soll es Open-Source-Allzweckmodelle übertreffen, darunter DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B und Gemma4-26B-A4B. Bei WMT25 verbessern sich seine Ergebnisse durchweg gegenüber der vorherigen Generation – 63,86/71,21/82,24 gegenüber 61,59/68,85/75,91 von Hy-MT1.5-7B, mit dem größten Zuwachs bei GEMBA – und bei DomainMTBench (Finanzen, Politik, Bildung) verzeichnet es 94,92 XCOMET / 92,79 GEMBA. Seine Instruktionsbefolgung ist der Bereich, in dem es sich am deutlichsten von Übersetzungs-Sprachmodellen von vor einem Jahr abhebt: 89,73 einfach / 72,67 komplex / 83,14 gesamt auf IFMTBench.

Was eine gehostete API für eine Übersetzungspipeline ändert

Das Selbsthosting des 7B ist wirklich einfach, was solche Dinge angeht – es läuft auf einer einzelnen A100 oder RTX 4090, und es gibt quantisierte FP8- und GGUF-Builds. Aber „einfach selbst zu hosten“ ist nicht „Null-Betriebsaufwand“. Der GGUF-Pfad hängt derzeit von llama.cpp mit dem STQ-Kernel von Tencent ab, der FP8-Pfad benötigt den richtigen Stack, und jemand muss es beaufsichtigen. Ein gehosteter Endpunkt nimmt das alles vom Tisch: keine GPU, kein Kernel-Build, keine Kapazitätsplanung und ein Preis pro Token, der unabhängig von der Auslastung konstant bleibt. Für ein Team, das täglich Millionen übersetzter Sätze verarbeitet, ist diese Vorhersehbarkeit wichtiger als der beworbene Benchmark – und sie ist der Grund, warum diese Woche mehr zählt als der Launch im Mai.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

Die Routing-Frage, die noch niemand stellt.

Da das Modell auf der API-Seite erst drei Tage alt ist, ist der realistische Weg, es zu übernehmen, derselbe, wie man jeden brandneuen Anbieter übernimmt: Man platziert es hinter einer Routing-Regel mit automatischem Failover, sodass ein ungetesteter Endpunkt niemals einen Produktionspfad lahmlegen kann, und lässt das Volumen entscheiden, ob es einen dauerhaften Platz verdient. Genau dieses Muster bildet die Routing-DSL von OrcaRouter über die 200+ Modelle ab, die wir führen – und hier ist es wichtig, präzise zu sein: Tencent Hy-MT2-7B steht derzeit nicht im Katalog von OrcaRouter, daher ist dies keine Geschichte darüber, es über uns aufzurufen. Was hier von Belang ist, ist das Preismodell. OrcaRouter gibt den Listenpreis jedes Anbieters mit 0% Aufschlag weiter. Sobald ein Anbieter den Preis senkt, ist die Senkung noch am selben Tag auf der Plattform aktiv. Bei einem Übersetzungs-Workflow mit hohem Volumen lautet die Frage an einen Endpunkt nicht: „Was kostet es heute im Portal?“, sondern: „Wie hoch ist der tatsächliche Listenpreis pro Token, den der Anbieter verlangt, und befindet sich etwas zwischen ihm und mir?“ Mit 0,295 $/M Output hat Tencent Hy-MT2-7B diese Frage gerade interessant gemacht.

Was als Nächstes ansehen

Daraus ergeben sich drei Dinge für diese Woche. Erstens sind die 1.8B- und 30B-A3B-Geschwistermodelle jetzt gleichermaßen aufrufbar, sodass die Entscheidung „welche Größe“ eine echte API-Frage ist und keine Frage des Selbsthostings (die Familie hat eigene Vergleichsseiten, aber die Kurzfassung lautet: 1.8B für On-Device und die günstigste Stufe, 30B-A3B für professionelle Domänen, 7B dazwischen). Zweitens bietet Tencents WMT26-Partnerschaft Preise für Teams, die Hy-MT-Modelle in den Aufgaben Allgemeine Maschinelle Übersetzung und Video-Untertitel-Übersetzung einsetzen – ein Zeichen dafür, dass Tencent diese Familie als offenen Übersetzungsstandard im wettbewerbsorientierten MT etablieren will. Drittens werden die iOS- und Android-Apps mit On-Device-Inferenz, falls sie wie angekündigt erscheinen, das 1.8B zum meistinstallierten offenen Übersetzungsmodell der Welt machen. Die gehostete API ist der Teil, der sich diese Woche geändert hat; die Entwicklung der Familie wurde im Mai festgelegt.

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube