
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B: La scelta di qualità lato server o un traduttore da 440MB su ogni telefono
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Tencent Hy-MT2-7B e Tencent Hy-MT2-1.8B sono i due estremi della stessa famiglia, rilasciati insieme come open source il 21 maggio 2026, e questa settimana entrambi sono diventati richiamabili tramite API ospitate: il 7B intorno al 19 agosto e l'1.8B un giorno dopo, ciascuno servito da Tencent Cloud. Non sono concorrenti nel senso usuale, perché ciò per cui sono pensati si sovrappone a malapena. Il 7B è la scelta per la qualità: un modello denso che gira su una singola GPU o tramite API a $0.074 per milione di token di input e $0.295 per milione di token di output. L'1.8B è la scelta per l'on-device: un modello quantizzato fino a 440 megabyte che gira su un telefono, completamente offline, a $0.044 / $0.177 per milione sul livello API. Se devi scegliere tra i due, la risposta è determinata soprattutto da dove deve avvenire la traduzione — e solo secondariamente dai benchmark, che sono molto più vicini di quanto suggerisca il divario di parametri di quattro volte.
La risposta di una riga
Scegli la 7B quando la traduzione avviene in un data center e vuoi la migliore qualità per dollaro di server — su un'API o su una singola GPU di classe A100. Scegli la 1.8B quando la traduzione deve avvenire su un dispositivo, offline, o al costo più basso possibile per token. Se entrambe vivono nello stesso cloud e il budget non è il fattore decisivo, la 7B vince in qualità. Se il contenuto è riservato, regolamentato o deve funzionare senza rete, la 1.8B è l'unica delle due che può farlo.
Specifiche a confronto
• Parametri — 7B dense vs 1.8B dense.
• Impronta quantizzata — FP8 e GGUF ridotti a pochi GB rispetto a 440MB tramite quantizzazione AngelSlim 1.25-bit.
• FLORES-200 (XX⇔XX) — 86.89 vs 79.77 XCOMET-XXL, circa il 97.9% vs 89.9% di Gemini 3.1 Pro (Think), secondo quanto dichiarato dal fornitore.
• WMT25 — 7B: 63.86/71.21/82.24; 1.8B supera le API commerciali di Microsoft e Doubao su tutte e tre le metriche.
• DomainMTBench (GEMBA) — 92.79 vs 91.08, riportato dal fornitore.
• prezzo API — $0,074 / $0,295 rispetto a $0,044 / $0,177 per 1M di token (input/output).
• Contesto — entrambi 8.192 token.
• Distribuzione — una A100 / RTX 4090 o API cloud vs chip on-device di Apple, Qualcomm e MediaTek, offline.

Il divario di qualità è reale, ma più contenuto del divario dimensionale.
Tutto quanto segue è una valutazione di Tencent, non replicata. Su FLORES-200, il 7B supera l'1.8B di otto punti XCOMET (86,89 contro 79,77), ed è su questo divario che si basa il posizionamento "balanced" rispetto a "on-device". Ma su DomainMTBench — il benchmark di traduzione di dominio che copre finanza, politica e istruzione — l'1.8B si attesta entro 1,7 punti GEMBA dal 7B (91,08 contro 92,79). E la posizione dell'1.8B rispetto al mondo esterno è il dettaglio che continua a sorprendere: Tencent riporta che supera le API di traduzione commerciali di Microsoft e Doubao in tutte e tre le metriche WMT25, e supera Tower-Plus-72B, un modello quaranta volte più grande. Quindi sui testi di dominio ordinario, il modello piccolo è molto più vicino al suo fratello grande di quanto quattro parametri suggerirebbero. Il vero vantaggio del 7B emerge sulla coda della traduzione generale e sulle istruzioni difficili, dove il suo vantaggio su FLORES e i punteggi più alti nei task complessi di IFMTBench creano un chiaro divario tra i due.
Il fork di distribuzione
{{1}}Il 7B richiede infrastruttura — o un'API cloud o una singola GPU di classe A100, con il solito corredo di operazioni.{{/1}} {{2}}Il 1.8B, da 440MB con la quantizzazione a 1,25 bit di AngelSlim, gira sugli stessi chip di una tipica app per smartphone, è 1,5× più veloce della precedente generazione Hy-MT1.5 e non necessita affatto di rete.{{/2}} {{3}}Questo trasforma la privacy da una funzionalità a un'impostazione predefinita: per contratti, cartelle cliniche o qualsiasi dato regolamentato, i dati non lasciano mai il dispositivo, una caratteristica che nessun prezzo per token può comprare lato server.{{/3}} {{4}}Il compromesso è evidente nella traduzione generale in stile FLORES, dove emerge la capacità extra del 7B — e in qualsiasi istruzione abbastanza complessa da spingere il totale di 83,14 del 1.8B su IFMTBench contro il tetto più alto del 7B.{{/4}}

La matematica dei costi
Sull'API, entrambi i modelli sono economici; il 1.8B è più economico. A $0,044 / $0,177 contro $0,074 / $0,295 per milione, il modello piccolo costa circa il 40% in meno rispetto al 7B su entrambe le voci della fattura — con un flusso costante di un milione di token di output al giorno, circa $70 al giorno contro $118. On-device, il 1.8B costa zero per token, ed è questo il numero che domina qualsiasi confronto server ad alto volume. Il punto a favore del 7B non è il prezzo ma il margine di qualità: se il tuo corpus è prevalentemente tecnico, legale o ricco di istruzioni, il margine qualitativo del 7B è esattamente ciò che si manifesta in meno ritraduzioni — e le ritraduzioni sono il vero costo unitario nella traduzione automatica professionale.

Instradamento delle due dimensioni
Nessuno dei due modelli è presente nel catalogo di OrcaRouter al momento in cui scrivo, quindi l'inquadramento onesto è che entrambi sono serviti tramite il cloud di Tencent e diverse piattaforme di terze parti. Il confronto insegna comunque la lezione sul routing attorno a cui ruota questo blog: quando due modelli si sovrappongono per capacità ma differiscono per prezzo e latenza, la distribuzione razionale non è "sceglierne uno" ma "instradare per carico di lavoro" — la fascia ad alto volume e bassa difficoltà al modello piccolo ed economico, la fascia difficile al modello di qualità, con failover automatico così che un'interruzione dell'uno o dell'altro non blocchi mai la pipeline. È esattamente il pattern che il DSL di routing di OrcaRouter compone tra i 200+ modelli che effettivamente offriamo, con il prezzo di listino di ciascun provider applicato senza alcun margine. Se la famiglia di traduzione di Tencent entrasse nel catalogo, sarebbe il naturale prossimo inquilino.
Il verdetto
{{1}}Se la traduzione avviene nel tuo data center, scegli Tencent Hy-MT2-7B — tramite API se vuoi zero operazioni, su una singola GPU se vuoi possederla — e smetti di leggere.{{/1}} {{2}}Se la traduzione deve avvenire su un dispositivo, offline, o in presenza di requisiti di riservatezza, scegli Tencent Hy-MT2-1.8B{{/2}} {{3}}e l'impronta di 440MB vince per definizione.{{/3}} {{4}}L'unico caso davvero difficile è un carico di lavoro cloud di volume medio{{/4}} {{5}}dove sia la qualità del 7B che il prezzo dell'1.8B sono entrambi difendibili.{{/5}} {{6}}In quel caso, non decidere in base ai benchmark dei vendor:{{/6}} {{7}}il divario GEMBA riportato è sotto i due punti, quindi esegui entrambi sul tuo testo di dominio{{/7}} {{8}}e lascia che siano i tuoi dati a scegliere.{{/8}}
