
Tencent Hy-MT2-7B ora ha un'API hosted: cosa cambia un traduttore da $0,295 per milione di output
- DeepSeekNUOVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M di token
- z-aiNUOVOZ.ai: GLM 5.32026-08-1860Intelligenza75Codice
- obsidianNUOVOQwen3.8 27B2026-08-1552Intelligenza68Codice
- qwenNUOVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenza69Codice
- grokNUOVOSpaceXAI: Grok 4.62026-08-1261Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
Tencent Hy-MT2-7B, il modello di traduzione open-source rilasciato da Tencent Hunyuan il 21 maggio 2026, è diventato richiamabile tramite un'API ospitata questa settimana: intorno al 19 agosto 2026, il modello dense da 7B è stato attivato sull'endpoint ospitato di Tencent Cloud a 0,074 $ per milione di token di input e 0,295 $ per milione di token di output, con una finestra di contesto di 8.192 token. Non è arrivato da solo — Tencent Hy-MT2-1.8B e Tencent Hy-MT2-30B-A3B sono stati attivati sullo stesso backend entro un giorno. I pesi sono su Hugging Face e ModelScope da tre mesi; la novità è che un team ora può chiamare il modello senza noleggiare una GPU, compilare llama.cpp dal sorgente o distribuire la toolchain on-device da 1,25 bit. Per un carico di lavoro di traduzione, questa è la differenza tra un esperimento e una decisione di prodotto.
Cosa è appena stato rilasciato
L'endpoint commerciale è di proprietà di Tencent Cloud, esposto tramite l'API del fornitore e diverse piattaforme di terze parti. Le tre dimensioni operano ciascuna in un contesto di 8K con completamenti da 4.096 token; tutte e tre accettano output strutturato tramite uno schema JSON nel campo response_format, e nessuna implementa il function calling. Le specifiche pratiche, in una riga per dimensione:
• Tencent Hy-MT2-7B — $0,074 in / $0,295 out per 1M di token, contesto di 8.192, denso ~7B, output strutturato supportato, nessuna tool call.
• Tencent Hy-MT2-1.8B — $0,044 in ingresso / $0,177 in uscita per 1M di token, contesto di 8.192, 1,8B denso, nessuna chiamata a strumenti.
• Tencent Hy-MT2-30B-A3B — $0,074 in ingresso / $0,295 in uscita per 1M di token, contesto di 8.192, MoE 30B totali / 3B attivi, output strutturato supportato, nessuna chiamata a strumenti.
Il prezzo di punta è il tasso di output del modello 7B: meno di tre decimi di centesimo per mille token di output, per un modello che, secondo Tencent, regge il confronto con modelli più grandi di un ordine di grandezza. La traduzione è uno dei pochi carichi di lavoro LLM in cui i token di output rappresentano quasi l'intero costo, quindi il prezzo di output è il numero che determina se una pipeline è sostenibile su larga scala.

Il modello alla base dell'endpoint
{{1}}Hy-MT2{{/1}} è la famiglia "fast-thinking" di Tencent: invece di dedicare lunghe catene di pensiero a ogni frase, è progettato per reagire come farebbe un traduttore professionista — si sofferma dove la fonte è ambigua, rapido dove non lo è. La {{2}}7B{{/2}} è il punto di equilibrio della famiglia, un modello denso con licenza {{3}}Apache-2.0{{/3}}, che copre 33 lingue più cinque coppie di lingue minoritarie e dialetti cinesi (tra cui tibetano, kazako, mongolo, uiguro e cantonese). Ciò che lo distingue da un LLM generico che fa traduzione è la capacità di seguire le istruzioni: mantiene un termine di glossario per tutto il documento, applica uno stile specificato, lascia intatti delimitatori e chiavi JSON e accetta istruzioni di personalizzazione in linguaggio semplice. Tencent ha rilasciato {{4}}IFMTBench{{/4}}, un benchmark aperto proprio per questa capacità, insieme ai pesi, e il lato consumer — il mini-programma Tencent Hy Translate, con app iOS e Android in arrivo — è costruito su questa famiglia.

I numeri, con l'asterisco attaccato
Tutto ciò che segue è la valutazione condotta da Tencent stessa, pubblicata sulla scheda del modello e nel report allegato; nulla di tutto ciò è stato riprodotto in modo indipendente al momento della stesura. Sul percorso di traduzione generale XX⇔XX di FLORES-200, il modello da 7B ottiene 86,89 XCOMET-XXL, che Tencent colloca a circa il 97,9% di Gemini 3.1 Pro (Think). Nella sua modalità "fast-thinking" si sostiene che superi i modelli generali open-source, tra cui DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B e Gemma4-26B-A4B. Su WMT25 i punteggi migliorano su tutta la linea rispetto alla generazione precedente — 63,86/71,21/82,24 contro i 61,59/68,85/75,91 di Hy-MT1.5-7B, con il guadagno maggiore su GEMBA — e su DomainMTBench (finanza, politica, istruzione) registra 94,92 XCOMET / 92,79 GEMBA. Il suo instruction-following è l'ambito in cui si distingue più visibilmente dai modelli di traduzione di un anno fa: 89,73 semplice / 72,67 complesso / 83,14 totale su IFMTBench.
Cosa cambia un'API ospitata per una pipeline di traduzione
Fare self-hosting del 7B è davvero facile, per quanto riguarda questo genere di cose: gira su una singola A100 o RTX 4090, ed esistono build quantizzate FP8 e GGUF. Ma "facile da self-hostare" non è "zero operazioni". Il percorso GGUF attualmente dipende da llama.cpp con il kernel STQ di Tencent, il percorso FP8 richiede lo stack giusto, e qualcuno deve sorvegliarlo. Un endpoint ospitato elimina tutto questo: niente GPU, niente build del kernel, niente pianificazione della capacità, e un prezzo per token fisso indipendentemente dall'utilizzo. Per un team che elabora milioni di frasi tradotte al giorno, quella prevedibilità conta più del benchmark principale — ed è il motivo per cui questa settimana conta più di quanto non facesse il lancio di maggio.

La domanda sul routing che ancora nessuno si sta ponendo
Because the model is three days old on the API side, the realistic way to adopt it is the way you adopt any brand-new provider: put it behind a routing rule with automatic failover so an untested endpoint can never take down a production path, and let the volume decide whether it earns a permanent slot. That is precisely the pattern OrcaRouter's routing DSL composes across the 200+ models we do carry — and it is worth being precise here: Tencent Hy-MT2-7B is not on OrcaRouter's catalogue as of this writing, so this is not a "call it through us" story. What is on-topic is the pricing model. OrcaRouter passes through each provider's list price with 0% markup, so when a vendor cuts the rate, the cut is live on the platform the same day. For a high-volume translation workload, the question to ask of any endpoint is not "what's the portal price today" but "what is the actual per-token list price the provider charges, and does anything sit between it and me." At $0.295/M output, Tencent Hy-MT2-7B just made that question interesting.
Cosa guardare dopo
Da questa settimana derivano tre cose. Primo, i modelli gemelli 1.8B e 30B-A3B sono ora ugualmente chiamabili, quindi la decisione su "quale dimensione" è una vera questione API piuttosto che una decisione di self-hosting (la famiglia ha le proprie pagine di confronto, ma in breve: 1.8B per l'on-device e il livello più economico, 30B-A3B per ambiti professionali, 7B nel mezzo). Secondo, la partnership di Tencent con WMT26 offre premi ai team che utilizzano i modelli Hy-MT nei compiti di traduzione automatica generale e traduzione di sottotitoli video — un segnale che Tencent intende che questa famiglia sia il default open per la traduzione nella MT competitiva. Terzo, le app iOS e Android con inferenza on-device, se verranno rilasciate come annunciato, renderanno il modello 1.8B il modello di traduzione open più installato al mondo. L'API ospitata è la parte che è cambiata questa settimana; la traiettoria della famiglia è stata fissata a maggio.
