{{1}}Een hero-titelkaart voor 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B' met de ondertitel 'De server-side kwaliteitskeuze of een 440MB-vertaler op elke telefoon'{{/1}}, {{2}}met een serverpictogram en een smartphonepictogram met een weegschaal ertussen{{/2}}, {{3}}een 440MB-chip en twee modelnaamlabels{{/3}}, {{4}}met het OrcaRouter-logo in de rechteronderhoek.{{/4}}
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: De server-side kwaliteitskeuze of een 440MB-vertaler op elke telefoon

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Tencent Hy-MT2-7B en Tencent Hy-MT2-1.8B zijn de twee uitersten van dezelfde familie, die op 21 mei 2026 samen als opensource zijn uitgebracht, en beide zijn deze week via gehoste API's aanroepbaar geworden — de 7B rond 19 augustus en de 1.8B een dag later, elk aangeboden via Tencent Cloud. Ze zijn niet elkaars concurrenten in de gebruikelijke zin, omdat ze nauwelijks overlappen in hun doel. De 7B is de kwaliteitskeuze: een dicht model dat op één GPU draait of via een API, voor $0,074 per miljoen invoertokens en $0,295 per miljoen uitvoertokens. De 1.8B is de keuze voor on-device: een model dat is gekwantiseerd tot 440 megabyte en op een telefoon draait, volledig offline, voor $0,044 / $0,177 per miljoen op de API-laag. Als je tussen beide moet kiezen, wordt het antwoord vooral bepaald door waar de vertaling moet plaatsvinden — en pas in de tweede plaats door benchmarks, die veel dichter bij elkaar liggen dan de viervoudige parameterkloof doet vermoeden.

Het antwoord in één regel

Kies de 7B wanneer vertaling plaatsvindt in een datacenter en je de beste kwaliteit per serverdollar wilt — via een API of op een enkele A100-class GPU. Kies de 1.8B wanneer vertaling op een apparaat moet plaatsvinden, offline, of tegen de laagst mogelijke kosten per token. Als beide in dezelfde cloud draaien en budget niet de doorslaggevende factor is, wint de 7B op kwaliteit. Als de inhoud vertrouwelijk is, gereguleerd, of zonder netwerk moet werken, is de 1.8B de enige van de twee die dat kan.

Specs naast elkaar

Parameters — 7B dense versus 1.8B dense.

Gekwantiseerde footprint — FP8 en GGUF tot een paar GB versus 440MB via AngelSlim 1,25-bit kwantisatie.

FLORES-200 (XX⇔XX) — 86.89 versus 79.77 XCOMET-XXL, ongeveer 97,9% versus 89,9% van Gemini 3.1 Pro (Think), door leverancier gerapporteerd.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B verslaat de commerciële API's van Microsoft en Doubao op alle drie de metrieken.

DomainMTBench (GEMBA) — 92,79 vs 91,08, volgens de leverancier.

API-prijs — $0.074 / $0.295 vs $0.044 / $0.177 per 1M tokens (input/output).

Context — beide 8.192 tokens.

Implementatie — één A100 / RTX 4090 of cloud-API vs. Apple, Qualcomm en MediaTek on-device chips, offline.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

De kwaliteitskloof is reëel, maar smaller dan de omvangskloof.

Het volgende is allemaal Tencent's eigen evaluatie, niet door anderen gereproduceerd. Op FLORES-200 zit de 7B acht XCOMET-punten voor op de 1.8B (86.89 tegen 79.77), en dat is het gat waarop de positionering "gebalanceerd" versus "op het apparaat" is gebouwd. Maar op DomainMTBench — de domeinvertaalbenchmark die financiën, politiek en onderwijs bestrijkt — komt de 1.8B binnen 1.7 GEMBA-punten van de 7B (91.08 tegen 92.79). En de positie van de 1.8B ten opzichte van de bredere wereld is het detail dat mensen blijft verrassen: Tencent meldt dat hij de commerciële vertaal-API's van Microsoft en Doubao verslaat op alle drie de WMT25-metrieken en beter presteert dan Tower-Plus-72B, een model dat veertig keer zo groot is. Dus op gewone domeintekst zit het kleine model veel dichter bij zijn grote broer dan vier parameters zouden doen vermoeden. De echte voorsprong van de 7B zit in de staart van het algemene vertaalwerk en bij moeilijke instructies, waar zijn FLORES-voorsprong en zijn hogere IFMTBench-scores voor complexe taken duidelijk water tussen de twee leggen.

De deployment fork

De 7B {{1}}heeft infrastructuur nodig — ofwel een cloud-API of één GPU uit de A100-klasse, met de gebruikelijke operaties eraan verbonden{{/1}}. De 1.8B, met 440MB en AngelSlims 1,25-bit-kwantorisering, draait op dezelfde chips als een typische telefoonapp, is 1,5× sneller dan de vorige Hy-MT1.5-generatie en heeft helemaal geen netwerk nodig. Daarmee verandert privacy van een optie in een standaard: voor contracten, medische dossiers of andere gereguleerde zaken verlaten de gegevens nooit het apparaat — een eigenschap die geen enkele prijs per token aan de serverzijde kan kopen. De afruil is zichtbaar bij algemene vertalingen in FLORES-stijl, waar de extra capaciteit van de 7B zich laat zien — en bij elke instructie die complex genoeg is om de 83,14 IFMTBench-totaalscore van de 1.8B te laten stuiten op het hogere plafond van de 7B.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

De kostenberekening

Op de API-laag zijn beide modellen goedkoop; de 1.8B is goedkoper. Bij $0,044 / $0,177 versus $0,074 / $0,295 per miljoen ligt het kleine model aan beide kanten van de rekening ongeveer 40% onder de 7B — bij een constante output van één miljoen tokens per dag komt dat op ruwweg $70 per dag versus $118. Op het apparaat kost de 1.8B nul per token, en dat is het getal dat bij volume elke serververgelijking domineert. Het tegenargument van de 7B is niet de prijs, maar de headroom: als je corpus overwegend technisch, juridisch of instructie-intensief is, is de kwaliteitsmarge van de 7B precies datgene wat zich uit in minder hervertalingen — en hervertalingen zijn de werkelijke eenheidskost in professionele MT.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

De twee maten routeren

Geen van beide modellen staat op het moment van schrijven in de catalogus van OrcaRouter, dus de eerlijke framing is dat beide worden aangeboden via Tencent's eigen cloud en verschillende platforms van derden. De onderlinge vergelijking leert nog steeds de routeringsles waar deze blog om draait: wanneer twee modellen elkaar overlappen qua capaciteiten maar verschillen in prijs en latentie, is de rationele inzet niet 'kies er één' maar 'routeer op basis van werkbelasting' — het deel met hoog volume en lage moeilijkheidsgraad naar het goedkope kleine model, het moeilijke deel naar het kwaliteitsmodel, met automatische failover zodat een uitval in een van beide de pipeline nooit doet stagneren. Dat is precies het patroon dat de routerings-DSL van OrcaRouter samenstelt over de 200+ modellen die we wél voeren, waarbij de catalogusprijs van elke provider wordt doorberekend met 0% opslag. Als de vertaalfamilie van Tencent zich bij de catalogus voegt, is het de natuurlijke volgende huurder.

Het vonnis

Als vertaling in uw datacenter plaatsvindt, neem dan Tencent Hy-MT2-7B — via de API als u nul operaties wilt, op een enkele GPU als u het zelf wilt beheren — en stop met lezen. Als vertaling op een apparaat, offline of onder een vertrouwelijkheidsvereiste moet plaatsvinden, neem dan Tencent Hy-MT2-1.8B en de 440MB-voetafdruk wint per definitie. Het enige echt lastige geval is een cloudworkload met gemiddeld volume waarbij zowel de kwaliteit van de 7B als de prijs van de 1.8B verdedigbaar zijn. Beslis daar niet op basis van leveranciersbenchmarks: het gerapporteerde GEMBA-verschil is minder dan twee punten, dus draai beide op uw eigen domeintekst en laat uw gegevens de keuze bepalen.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube