Een hero-titelkaart voor 'Tencent HY-MT2 1.8B krijgt een gehoste API', met ondertitel 'de 440MB-vertaler van Tencent gaat naar de cloud', met een smartphone met een taalpictogram, een cloud die een compacte 440MB-chip aflevert, een wereldbol met 33 stippen, een datumbadge met 'Open-sourced 21 mei 2026 · Gehoste API 20 aug 2026', en het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

Tencent HY-MT2 1.8B krijgt een gehoste API: Tencent's 440MB-vertaler gaat naar de cloud

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent HY-MT2 1.8B, {{1}}het compacte lid van de Hy-MT2-vertaalfamilie{{/1}} dat Tencent Hunyuan op 21 mei 2026 als open source uitbracht, is nu aanroepbaar via een gehoste commerciële API in plaats van alleen zelf gehost — {{2}}de API-vermelding van het model ging live op 20 augustus 2026, voor ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens{{/2}}. Die listedatum is belangrijker dan normaal, omdat de 1.8B nooit zomaar een ander open checkpoint was: {{3}}het is het model dat Tencent bouwde om te bewijzen dat een gekwantiseerd vertaalmodel van 440 MB volledig op een telefoon kan draaien{{/3}}, en in de drie maanden sinds de open-source release wordt het ook meegeleverd in Tencent's eigen HyTranslate-miniprogramma en de iOS- en Android-apps die daarna volgden. {{4}}Dit artikel gaat over wat de lancering van de gehoste API verandert, wat het model werkelijk is en welke cijfers je moet vertrouwen{{/4}}.

Wat er op 20 augustus daadwerkelijk veranderde

Tot nu toe betekende het gebruiken van Tencent HY-MT2 1.8B een van twee dingen: zelf de Apache-2.0-gewichten laden in transformers, vLLM, SGLang of llama.cpp, of gebruikmaken van Tencent's consumentenvertaalproducten. De gehoste API is een derde pad — je stuurt tekst via HTTP, en Tencent Cloud bedient het 1.8B-eindpunt. Het model behoudt zijn context van 8.192 tokens en een maximale output van 4.096 tokens, verwerkt alleen tekst en wordt geprijsd op ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens. Voor teams met een piekerig vertaalvolume verdwijnt daarmee de drempel van "een GPU moeten beheren" om het model uit te proberen.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2: High-Performance Multilingual Translation Model (captured Aug 20, 2026), showing the English page header with the Tencent Cloud nav, the title 'Hy-MT2: High-Performance Multilingual Translation Model for Real Use', and the table of contents starting with the model name.

De andere helft van het verhaal zijn de apps. De HyTranslate-miniprogramma werd in mei gelanceerd, samen met de open-source release, met spraakinvoer, stijlpresets en offline modus. De iOS- en Android-apps — die het on-device-model downloaden voor vertaling zonder netwerk — zijn inmiddels uitgebracht. De 1.8B is het werkpaard van dat offline verhaal: met AngelSlim's 1.25-bit extreme kwantisatie krimpt het tot ongeveer 440MB aan opslag en draait het lokaal op Apple-, Qualcomm- en MediaTek-telefoonchips, waarbij Tencent 1.5x snellere inferentie rapporteert dan de 4-bit build van de vorige generatie op een Apple A15.

Wat de 1.8B is

HY-MT2-1.8B is een dicht, decoder-only causaal taalmodel dat is gebouwd op de hunyuan_v1_dense-architectuur — in de praktijk ongeveer 2 miljard parameters, ondanks de naam 1.8B — met een chat-sjabloon en geen standaard systeemprompt. Het vertaalt tussen 33 talen plus vijf minderheidstaal- en dialectparen, waaronder Chinees, Engels, Japans, Koreaans, Frans, Spaans, Russisch, Arabisch, Thais, Vietnamees, Indonesisch, Hindi, Bengaals, Tamil, en de Tibetaanse, Oeigoerse, Kazachse, Mongoolse en Kantonese dialectparen. In tegenstelling tot de klassieke encoder-decoder-vertaalmodellen is het instructie-gefinetuned: je geeft het een prompt met de doeltaal en optionele instructies, en het kan JSON- en HTML-structuur behouden, een woordenlijst respecteren, een register matchen en omliggende context gebruiken om te ondubbelzinnigen. Dat soort mogelijkheden delen de zustermodellen 7B en 30B-A3B, en het is waarvoor Tencent's IFMTBench-benchmark tegelijkertijd werd uitgebracht om te beoordelen.

Waar de benchmarks staan

De kwaliteitsclaims zijn het waard om zorgvuldig te lezen, omdat bijna allemaal afkomstig zijn van Tencent zelf en op het moment van schrijven niet door een onafhankelijk laboratorium zijn gereproduceerd. Tencent rapporteert HY-MT2-1.8B op 89,9% van het gemiddelde FLORES-200-resultaat van Ge​mini 3.1 Pro (de 7B op 97,9%, de 30B-A3B op 98,6%), op 96,7% van Ge​mini op zijn real-world GEMBA-stijl testset, en op 96,2% op DomainMTBench over acht professionele domeinen. Sommige persberichten rondden het FLORES-200-cijfer af naar 88,1%; de README van de leverancier vermeldt 89,9%. Tencent claimt ook dat de 1.8B over het geheel genomen beter presteert dan reguliere commerciële vertaal-API's van aanbieders zoals Microsoft en Doubao. Onafhankelijke reproducties bestaan nog niet, dus behandel dit alles als door de leverancier gerapporteerd richtinggevend bewijs in plaats van gecontroleerd feit. Wat niet afhankelijk is van de leverancier: de taalverzameling van 33+5 talen staat vast, de Apache-2.0-licentie is echt, en een gekwantiseerd checkpoint van 440MB dat op een telefoon draait, is onafhankelijk waarneembaar.

A single-column spec scoreboard for Tencent HY-MT2 1.8B reading: Params: ~2B dense decoder-only; Languages: 33 + 5 dialect pairs; Released: May 21, 2026 · Apache-2.0; FLORES-200: 89.9% of Gemini 3.1 Pro; On-device: 440MB at 1.25-bit; API: ~$0.044 / $0.177 per 1M tokens; footer 'Benchmark figures vendor-reported; no independent scores yet.'

Hoe je het zou gebruiken, en wat het kost

• Zelf gehost — Apache-2.0-gewichten van Hugging Face of ModelScope; draaien met transformers (>=5.6.0), vLLM, SGLang of llama.cpp-GGUF-builds. De kosten zijn je GPU-rekening; de 1,25-bit-build draait op apparaten van CPU-klasse.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured Aug 20, 2026) showing the model header, the Tencent attribution, the Translation / Transformers / Safetensors tags, a 36-languages tag, the hunyuan_v1_dense architecture label, the arxiv 2605.22064 link, the apache-2.0 license, and the 2B-params model size.

• Gehoste API — Tencent Cloud biedt de 1.8B op het moment van schrijven aan voor ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens; de eigen API van de leverancier en verschillende platforms van derden bieden het aan.

• Consument — HyTranslate mini-programma en de iOS/Android-apps, inclusief offline vertaling via het gedownloade on-device-model.

Aanbevolen sampling voor de 1.8B: temperatuur 0.7, top-p 0.6, top-k 20, herhalingsstraf 1.05, maximale tokens 4096.

Als je een vertaalpijplijn bouwt in plaats van een consumentenapp uit te brengen, is het interessante aan een model als dit dat de prijs een bewegend doelwit is — Tencent verlaagde het tarief voor zijn Hy-MT2-Pro API al in juni. Dat is precies het scenario waarvoor een router met 0% opslag bestaat: omdat de doorberekening tegen de lijstprijs van de provider gebeurt, verschijnt een prijsverlaging van de leverancier op de factuur van dezelfde dag in plaats van pas nadat je gateway heeft herprijsd. Het model zelf staat op het moment van schrijven niet op de lijst van OrcaRouter, dus je zou de gewichten zelf hosten of rechtstreeks de API van Tencent Cloud aanroepen; het failover- en single-key-argument geldt voor de bredere vertaalstack die je eromheen zou bouwen, waarbij het combineren van een klein on-device model voor goedkoop bulkverkeer met een groter model voor moeilijke taalparen het soort compositie is dat routing bedoeld is om uit te drukken.

De bottom line

Tencent HY-MT2 1.8B was in mei al interessant als een Apache-2.0-vertaalmodel ter grootte van een telefoon; de vermelding in de gehoste API van 20 augustus maakt het een kandidaat voor teams die het willen evalueren zonder infrastructuur op te zetten. De kwaliteitscijfers zijn door de leverancier opgegeven, de talenset is bewust mainstream in plaats van maximaal, en de on-device voetafdruk is er het meest onderscheidende aan. Als uw talenparen binnen die 33 vallen, is het nu goedkoper dan ooit om te ontdekken of de beweringen voor uw inhoud standhouden.