Una hero card per il titolo 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B' con il sottotitolo 'La scelta di qualità lato server o un traduttore da 440MB su ogni telefono', che mostra un'icona di server e un'icona di smartphone con una bilancia tra di loro, un chip da 440MB e due etichette con i nomi dei modelli, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: La scelta di qualità lato server o un traduttore da 440MB su ogni telefono

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent Hy-MT2-7B e Tencent Hy-MT2-1.8B sono i due estremi della stessa famiglia, rilasciati insieme come open source il 21 maggio 2026, e questa settimana entrambi sono diventati richiamabili tramite API ospitate: il 7B intorno al 19 agosto e l'1.8B un giorno dopo, ciascuno servito da Tencent Cloud. Non sono concorrenti nel senso usuale, perché ciò per cui sono pensati si sovrappone a malapena. Il 7B è la scelta per la qualità: un modello denso che gira su una singola GPU o tramite API a $0.074 per milione di token di input e $0.295 per milione di token di output. L'1.8B è la scelta per l'on-device: un modello quantizzato fino a 440 megabyte che gira su un telefono, completamente offline, a $0.044 / $0.177 per milione sul livello API. Se devi scegliere tra i due, la risposta è determinata soprattutto da dove deve avvenire la traduzione — e solo secondariamente dai benchmark, che sono molto più vicini di quanto suggerisca il divario di parametri di quattro volte.

La risposta di una riga

Scegli la 7B quando la traduzione avviene in un data center e vuoi la migliore qualità per dollaro di server — su un'API o su una singola GPU di classe A100. Scegli la 1.8B quando la traduzione deve avvenire su un dispositivo, offline, o al costo più basso possibile per token. Se entrambe vivono nello stesso cloud e il budget non è il fattore decisivo, la 7B vince in qualità. Se il contenuto è riservato, regolamentato o deve funzionare senza rete, la 1.8B è l'unica delle due che può farlo.

Specifiche a confronto

Parametri — 7B dense vs 1.8B dense.

Impronta quantizzata — FP8 e GGUF ridotti a pochi GB rispetto a 440MB tramite quantizzazione AngelSlim 1.25-bit.

FLORES-200 (XX⇔XX) — 86.89 vs 79.77 XCOMET-XXL, circa il 97.9% vs 89.9% di Gemini 3.1 Pro (Think), secondo quanto dichiarato dal fornitore.

WMT25 — 7B: 63.86/71.21/82.24; 1.8B supera le API commerciali di Microsoft e Doubao su tutte e tre le metriche.

DomainMTBench (GEMBA) — 92.79 vs 91.08, riportato dal fornitore.

prezzo API — $0,074 / $0,295 rispetto a $0,044 / $0,177 per 1M di token (input/output).

Contesto — entrambi 8.192 token.

Distribuzione — una A100 / RTX 4090 o API cloud vs chip on-device di Apple, Qualcomm e MediaTek, offline.

A two-column scoreboard titled 'Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B — the scoreboard'. Left column Hy-MT2-7B: Params 7B dense; FLORES-200 86.89; DomainMTBench GEMBA 92.79; API price $0.074 / $0.295; Deployment GPU or API; Best for quality in the cloud. Right column Hy-MT2-1.8B: Params 1.8B dense; FLORES-200 79.77; DomainMTBench GEMBA 91.08; API price $0.044 / $0.177; Deployment 440MB on-device; Best for offline and edge. Footer: Figures vendor-reported, unreproduced.

Il divario di qualità è reale, ma più contenuto del divario dimensionale.

Tutto quanto segue è una valutazione di Tencent, non replicata. Su FLORES-200, il 7B supera l'1.8B di otto punti XCOMET (86,89 contro 79,77), ed è su questo divario che si basa il posizionamento "balanced" rispetto a "on-device". Ma su DomainMTBench — il benchmark di traduzione di dominio che copre finanza, politica e istruzione — l'1.8B si attesta entro 1,7 punti GEMBA dal 7B (91,08 contro 92,79). E la posizione dell'1.8B rispetto al mondo esterno è il dettaglio che continua a sorprendere: Tencent riporta che supera le API di traduzione commerciali di Microsoft e Doubao in tutte e tre le metriche WMT25, e supera Tower-Plus-72B, un modello quaranta volte più grande. Quindi sui testi di dominio ordinario, il modello piccolo è molto più vicino al suo fratello grande di quanto quattro parametri suggerirebbero. Il vero vantaggio del 7B emerge sulla coda della traduzione generale e sulle istruzioni difficili, dove il suo vantaggio su FLORES e i punteggi più alti nei task complessi di IFMTBench creano un chiaro divario tra i due.

Il fork di distribuzione

{{1}}Il 7B richiede infrastruttura — o un'API cloud o una singola GPU di classe A100, con il solito corredo di operazioni.{{/1}} {{2}}Il 1.8B, da 440MB con la quantizzazione a 1,25 bit di AngelSlim, gira sugli stessi chip di una tipica app per smartphone, è 1,5× più veloce della precedente generazione Hy-MT1.5 e non necessita affatto di rete.{{/2}} {{3}}Questo trasforma la privacy da una funzionalità a un'impostazione predefinita: per contratti, cartelle cliniche o qualsiasi dato regolamentato, i dati non lasciano mai il dispositivo, una caratteristica che nessun prezzo per token può comprare lato server.{{/3}} {{4}}Il compromesso è evidente nella traduzione generale in stile FLORES, dove emerge la capacità extra del 7B — e in qualsiasi istruzione abbastanza complessa da spingere il totale di 83,14 del 1.8B su IFMTBench contro il tetto più alto del 7B.{{/4}}

A screenshot of the Hugging Face model card for tencent/Hy-MT2-1.8B (captured August 23 2026) showing the model name and the on-device positioning with 33-language support and the 440MB AngelSlim quantization claim.

La matematica dei costi

Sull'API, entrambi i modelli sono economici; il 1.8B è più economico. A $0,044 / $0,177 contro $0,074 / $0,295 per milione, il modello piccolo costa circa il 40% in meno rispetto al 7B su entrambe le voci della fattura — con un flusso costante di un milione di token di output al giorno, circa $70 al giorno contro $118. On-device, il 1.8B costa zero per token, ed è questo il numero che domina qualsiasi confronto server ad alto volume. Il punto a favore del 7B non è il prezzo ma il margine di qualità: se il tuo corpus è prevalentemente tecnico, legale o ricco di istruzioni, il margine qualitativo del 7B è esattamente ciò che si manifesta in meno ritraduzioni — e le ritraduzioni sono il vero costo unitario nella traduzione automatica professionale.

A generated infographic titled 'The deployment fork' with two branches: a cloud-server card labelled 'Hy-MT2-7B — server: one GPU or the API, $0.074 / $0.295' and a smartphone card labelled 'Hy-MT2-1.8B — on-device: 440MB, offline, free per token', with the footer 'Same family, released May 21 2026; both now API-callable.'

Instradamento delle due dimensioni

Nessuno dei due modelli è presente nel catalogo di OrcaRouter al momento in cui scrivo, quindi l'inquadramento onesto è che entrambi sono serviti tramite il cloud di Tencent e diverse piattaforme di terze parti. Il confronto insegna comunque la lezione sul routing attorno a cui ruota questo blog: quando due modelli si sovrappongono per capacità ma differiscono per prezzo e latenza, la distribuzione razionale non è "sceglierne uno" ma "instradare per carico di lavoro" — la fascia ad alto volume e bassa difficoltà al modello piccolo ed economico, la fascia difficile al modello di qualità, con failover automatico così che un'interruzione dell'uno o dell'altro non blocchi mai la pipeline. È esattamente il pattern che il DSL di routing di OrcaRouter compone tra i 200+ modelli che effettivamente offriamo, con il prezzo di listino di ciascun provider applicato senza alcun margine. Se la famiglia di traduzione di Tencent entrasse nel catalogo, sarebbe il naturale prossimo inquilino.

Il verdetto

{{1}}Se la traduzione avviene nel tuo data center, scegli Tencent Hy-MT2-7B — tramite API se vuoi zero operazioni, su una singola GPU se vuoi possederla — e smetti di leggere.{{/1}} {{2}}Se la traduzione deve avvenire su un dispositivo, offline, o in presenza di requisiti di riservatezza, scegli Tencent Hy-MT2-1.8B{{/2}} {{3}}e l'impronta di 440MB vince per definizione.{{/3}} {{4}}L'unico caso davvero difficile è un carico di lavoro cloud di volume medio{{/4}} {{5}}dove sia la qualità del 7B che il prezzo dell'1.8B sono entrambi difendibili.{{/5}} {{6}}In quel caso, non decidere in base ai benchmark dei vendor:{{/6}} {{7}}il divario GEMBA riportato è sotto i due punti, quindi esegui entrambi sul tuo testo di dominio{{/7}} {{8}}e lascia che siano i tuoi dati a scegliere.{{/8}}

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube