
Tencent HY-MT2 1.8B krijgt een gehoste API: Tencent's 440MB-vertaler gaat naar de cloud
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 426 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 183 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Tencent HY-MT2 1.8B, {{1}}het compacte lid van de Hy-MT2-vertaalfamilie{{/1}} dat Tencent Hunyuan op 21 mei 2026 als open source uitbracht, is nu aanroepbaar via een gehoste commerciële API in plaats van alleen zelf gehost — {{2}}de API-vermelding van het model ging live op 20 augustus 2026, voor ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens{{/2}}. Die listedatum is belangrijker dan normaal, omdat de 1.8B nooit zomaar een ander open checkpoint was: {{3}}het is het model dat Tencent bouwde om te bewijzen dat een gekwantiseerd vertaalmodel van 440 MB volledig op een telefoon kan draaien{{/3}}, en in de drie maanden sinds de open-source release wordt het ook meegeleverd in Tencent's eigen HyTranslate-miniprogramma en de iOS- en Android-apps die daarna volgden. {{4}}Dit artikel gaat over wat de lancering van de gehoste API verandert, wat het model werkelijk is en welke cijfers je moet vertrouwen{{/4}}.
Wat er op 20 augustus daadwerkelijk veranderde
Tot nu toe betekende het gebruiken van Tencent HY-MT2 1.8B een van twee dingen: zelf de Apache-2.0-gewichten laden in transformers, vLLM, SGLang of llama.cpp, of gebruikmaken van Tencent's consumentenvertaalproducten. De gehoste API is een derde pad — je stuurt tekst via HTTP, en Tencent Cloud bedient het 1.8B-eindpunt. Het model behoudt zijn context van 8.192 tokens en een maximale output van 4.096 tokens, verwerkt alleen tekst en wordt geprijsd op ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens. Voor teams met een piekerig vertaalvolume verdwijnt daarmee de drempel van "een GPU moeten beheren" om het model uit te proberen.

De andere helft van het verhaal zijn de apps. De HyTranslate-miniprogramma werd in mei gelanceerd, samen met de open-source release, met spraakinvoer, stijlpresets en offline modus. De iOS- en Android-apps — die het on-device-model downloaden voor vertaling zonder netwerk — zijn inmiddels uitgebracht. De 1.8B is het werkpaard van dat offline verhaal: met AngelSlim's 1.25-bit extreme kwantisatie krimpt het tot ongeveer 440MB aan opslag en draait het lokaal op Apple-, Qualcomm- en MediaTek-telefoonchips, waarbij Tencent 1.5x snellere inferentie rapporteert dan de 4-bit build van de vorige generatie op een Apple A15.
Wat de 1.8B is
HY-MT2-1.8B is een dicht, decoder-only causaal taalmodel dat is gebouwd op de hunyuan_v1_dense-architectuur — in de praktijk ongeveer 2 miljard parameters, ondanks de naam 1.8B — met een chat-sjabloon en geen standaard systeemprompt. Het vertaalt tussen 33 talen plus vijf minderheidstaal- en dialectparen, waaronder Chinees, Engels, Japans, Koreaans, Frans, Spaans, Russisch, Arabisch, Thais, Vietnamees, Indonesisch, Hindi, Bengaals, Tamil, en de Tibetaanse, Oeigoerse, Kazachse, Mongoolse en Kantonese dialectparen. In tegenstelling tot de klassieke encoder-decoder-vertaalmodellen is het instructie-gefinetuned: je geeft het een prompt met de doeltaal en optionele instructies, en het kan JSON- en HTML-structuur behouden, een woordenlijst respecteren, een register matchen en omliggende context gebruiken om te ondubbelzinnigen. Dat soort mogelijkheden delen de zustermodellen 7B en 30B-A3B, en het is waarvoor Tencent's IFMTBench-benchmark tegelijkertijd werd uitgebracht om te beoordelen.
Waar de benchmarks staan
De kwaliteitsclaims zijn het waard om zorgvuldig te lezen, omdat bijna allemaal afkomstig zijn van Tencent zelf en op het moment van schrijven niet door een onafhankelijk laboratorium zijn gereproduceerd. Tencent rapporteert HY-MT2-1.8B op 89,9% van het gemiddelde FLORES-200-resultaat van Gemini 3.1 Pro (de 7B op 97,9%, de 30B-A3B op 98,6%), op 96,7% van Gemini op zijn real-world GEMBA-stijl testset, en op 96,2% op DomainMTBench over acht professionele domeinen. Sommige persberichten rondden het FLORES-200-cijfer af naar 88,1%; de README van de leverancier vermeldt 89,9%. Tencent claimt ook dat de 1.8B over het geheel genomen beter presteert dan reguliere commerciële vertaal-API's van aanbieders zoals Microsoft en Doubao. Onafhankelijke reproducties bestaan nog niet, dus behandel dit alles als door de leverancier gerapporteerd richtinggevend bewijs in plaats van gecontroleerd feit. Wat niet afhankelijk is van de leverancier: de taalverzameling van 33+5 talen staat vast, de Apache-2.0-licentie is echt, en een gekwantiseerd checkpoint van 440MB dat op een telefoon draait, is onafhankelijk waarneembaar.

Hoe je het zou gebruiken, en wat het kost
• Zelf gehost — Apache-2.0-gewichten van Hugging Face of ModelScope; draaien met transformers (>=5.6.0), vLLM, SGLang of llama.cpp-GGUF-builds. De kosten zijn je GPU-rekening; de 1,25-bit-build draait op apparaten van CPU-klasse.

• Gehoste API — Tencent Cloud biedt de 1.8B op het moment van schrijven aan voor ongeveer $0,044 per miljoen invoertokens en $0,177 per miljoen uitvoertokens; de eigen API van de leverancier en verschillende platforms van derden bieden het aan.
• Consument — HyTranslate mini-programma en de iOS/Android-apps, inclusief offline vertaling via het gedownloade on-device-model.
Aanbevolen sampling voor de 1.8B: temperatuur 0.7, top-p 0.6, top-k 20, herhalingsstraf 1.05, maximale tokens 4096.
Als je een vertaalpijplijn bouwt in plaats van een consumentenapp uit te brengen, is het interessante aan een model als dit dat de prijs een bewegend doelwit is — Tencent verlaagde het tarief voor zijn Hy-MT2-Pro API al in juni. Dat is precies het scenario waarvoor een router met 0% opslag bestaat: omdat de doorberekening tegen de lijstprijs van de provider gebeurt, verschijnt een prijsverlaging van de leverancier op de factuur van dezelfde dag in plaats van pas nadat je gateway heeft herprijsd. Het model zelf staat op het moment van schrijven niet op de lijst van OrcaRouter, dus je zou de gewichten zelf hosten of rechtstreeks de API van Tencent Cloud aanroepen; het failover- en single-key-argument geldt voor de bredere vertaalstack die je eromheen zou bouwen, waarbij het combineren van een klein on-device model voor goedkoop bulkverkeer met een groter model voor moeilijke taalparen het soort compositie is dat routing bedoeld is om uit te drukken.
De bottom line
Tencent HY-MT2 1.8B was in mei al interessant als een Apache-2.0-vertaalmodel ter grootte van een telefoon; de vermelding in de gehoste API van 20 augustus maakt het een kandidaat voor teams die het willen evalueren zonder infrastructuur op te zetten. De kwaliteitscijfers zijn door de leverancier opgegeven, de talenset is bewust mainstream in plaats van maximaal, en de on-device voetafdruk is er het meest onderscheidende aan. Als uw talenparen binnen die 33 vallen, is het nu goedkoper dan ooit om te ontdekken of de beweringen voor uw inhoud standhouden.
