
Tencent HY-MT2 1.8B ottiene un'API ospitata: il traduttore da 440MB di Tencent va sul cloud.
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 426 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
Tencent HY-MT2 1.8B, il membro compatto della famiglia di modelli di traduzione Hy-MT2 che Tencent Hunyuan ha rilasciato come open source il 21 maggio 2026, è ora utilizzabile tramite un'API commerciale ospitata, non solo in modalità self-hosted: la scheda dell'API del modello è andata online il 20 agosto 2026, a circa 0,044 dollari per milione di token di input e 0,177 dollari per milione di token di output. Questa data di pubblicazione conta più di quanto non farebbe di solito, perché il modello 1.8B non è mai stato solo un altro checkpoint aperto: è il modello che Tencent ha creato per dimostrare che un modello di traduzione quantizzato da 440MB può girare interamente su un telefono, e nei tre mesi successivi alla release open source è stato anche integrato nel mini-programma HyTranslate di Tencent e nelle app iOS e Android che ne sono seguite. Questo articolo spiega cosa cambia con il lancio dell'API ospitata, cosa è realmente questo modello e a quali numeri dovete credere.
Cosa è effettivamente cambiato il 20 agosto
Finora, usare Tencent HY-MT2 1.8B significava una delle due cose: caricare da soli i pesi Apache-2.0 in transformers, vLLM, SGLang o llama.cpp, oppure usare i prodotti di traduzione consumer di Tencent. L'API ospitata rappresenta una terza via — invii il testo via HTTP e Tencent Cloud gestisce l'endpoint 1.8B. Il modello mantiene il suo contesto di 8,192 token e un output massimo di 4,096 token, gestisce solo testo ed è prezzato a circa $0.044 per milione di token in input e $0.177 per milione di token in output. Per i team il cui volume di traduzione è a picchi, ciò elimina il requisito minimo del "dover gestire una GPU" per provare il modello.

L'altra metà della storia riguarda le app. Il mini-programma HyTranslate è stato lanciato a maggio insieme al rilascio open-source, con input vocale, preset di stile e modalità offline. Le app iOS e Android — che scaricano il modello on-device per la traduzione senza connessione — sono state rilasciate da allora. Il modello da 1.8B è il cavallo di battaglia di quella storia offline: con l'estrema quantizzazione a 1,25 bit di AngelSlim si riduce a circa 440MB di spazio di archiviazione e gira localmente sui chip telefonici Apple, Qualcomm e MediaTek, con Tencent che riporta un'inferenza 1,5 volte più veloce rispetto alla build a 4 bit della generazione precedente su un Apple A15.
Cos'è il 1.8B?
HY-MT2-1.8B è un modello linguistico causale denso, di tipo decoder-only, costruito sull'architettura hunyuan_v1_dense — circa 2 miliardi di parametri in pratica, nonostante il nome 1.8B — con un template di chat e nessun system prompt predefinito. Traduce fra 33 lingue, più cinque coppie di lingue minoritarie e dialettali, tra cui cinese, inglese, giapponese, coreano, francese, spagnolo, russo, arabo, tailandese, vietnamita, indonesiano, hindi, bengali, tamil e le coppie dialettali di tibetano, uiguro, kazako, mongolo e cantonese. A differenza dei classici modelli di traduzione encoder-decoder, è ottimizzato tramite istruzioni: gli si fornisce un prompt con la lingua di destinazione e istruzioni opzionali, ed è in grado di preservare la struttura di JSON e HTML, rispettare un glossario, adeguarsi a un registro e usare il contesto circostante per disambiguare. Questa classe di capacità è ciò che condividono i modelli fratelli 7B e 30B-A3B, ed è ciò che il benchmark IFMTBench di Tencent, rilasciato insieme ai modelli, serve a valutare.
Dove si collocano i benchmark
Le dichiarazioni sulla qualità meritano un'attenta lettura, poiché quasi tutte provengono da Tencent stessa e, al momento in cui scriviamo, non sono state replicate da un laboratorio indipendente. Tencent riporta che HY-MT2-1.8B raggiunge l'89,9% del punteggio medio FLORES-200 di Gemini 3.1 Pro (il 7B il 97,9%, il 30B-A3B il 98,6%), il 96,7% di Gemini sul suo set di test reale in stile GEMBA e il 96,2% su DomainMTBench in otto domini professionali. Alcune coperture stampa hanno arrotondato il dato FLORES-200 per difetto all'88,1%; il README del fornitore elenca l'89,9%. Tencent afferma inoltre che il modello 1.8B supera complessivamente le principali API di traduzione commerciale di fornitori come Microsoft e Doubao. Non esistono ancora riproduzioni indipendenti, quindi trattate tutto ciò come evidenza direzionale fornita dal produttore, piuttosto che come fatto verificato. Ciò che non dipende dal fornitore: il set linguistico 33+5 è fisso, la licenza Apache-2.0 è reale e un checkpoint quantizzato da 440MB che girerà su un telefono è osservabile in modo indipendente.

Come lo useresti, e quanto costa
• Self-hosted — pesi Apache-2.0 da Hugging Face o ModelScope; esegui con transformers (>=5.6.0), vLLM, SGLang, o build GGUF di llama.cpp. Il costo è la tua fattura GPU; la build a 1,25 bit gira su dispositivi di classe CPU.

• API ospitata — Tencent Cloud offre il modello da 1,8B a circa $0,044 per milione di token in ingresso e $0,177 per milione di token in uscita al momento in cui scriviamo; l'API del fornitore stesso e diverse piattaforme di terze parti lo ospitano.
• Consumer — Il mini-program HyTranslate e le app per iOS/Android, inclusa la traduzione offline tramite il modello scaricato sul dispositivo.
Campionamento consigliato per il modello 1.8B: {{1}}temperatura 0.7{{/1}}, {{2}}top-p 0.6{{/2}}, {{3}}top-k 20{{/3}}, {{4}}penalità di ripetizione 1.05{{/4}}, {{5}}token massimi 4096{{/5}}.
Se stai costruendo una pipeline di traduzione piuttosto che distribuire un'app consumer, la cosa interessante di un modello come questo è che il suo prezzo è un bersaglio mobile — Tencent ha già tagliato la tariffa API del suo Hy-MT2-Pro a giugno. Questo è esattamente lo scenario per cui esiste un router con markup 0%: poiché il pass-through avviene al prezzo di listino del fornitore, un taglio di prezzo del fornitore compare nella fattura del giorno stesso, non dopo che il tuo gateway ricalcola i prezzi. Il modello stesso non è nell'elenco di OrcaRouter al momento della scrittura, quindi dovresti auto-ospitare i pesi o chiamare direttamente l'API di Tencent Cloud; l'argomento del failover e della chiave singola si applica allo stack di traduzione più ampio che costruiresti attorno ad esso, dove mescolare un piccolo modello on-device per traffico bulk a basso costo con un modello più grande per le coppie difficili è il tipo di composizione che il routing è stato creato per esprimere.
La conclusione
Tencent HY-MT2 1.8B era già interessante a maggio come traduttore Apache-2.0 delle dimensioni di un telefono; la pubblicazione dell'API hosted del 20 agosto lo rende un candidato per i team che vogliono valutarlo senza dover mettere in piedi un'infrastruttura. I numeri di qualità sono dichiarati dal fornitore, il set di lingue è volutamente mainstream piuttosto che massimale, e l'ingombro on-device è la cosa davvero distintiva. Se le vostre coppie linguistiche rientrano nei suoi 33, ora è più conveniente che mai scoprire se le affermazioni reggono per i vostri contenuti.
