Una hero card con titolo 'Tencent Hy-MT2-7B Now Has a Hosted API' e sottotitolo 'What a $0.295-per-Million-Output Translator Changes', che mostra un'icona di servizio cloud, un glifo di traduzione, una linea di connettore API e un chip di prezzo etichettato $0.074 / $0.295 per 1M token, con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Tencent Hy-MT2-7B ora ha un'API hosted: cosa cambia un traduttore da $0,295 per milione di output

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Tencent Hy-MT2-7B, il modello di traduzione open-source rilasciato da Tencent Hunyuan il 21 maggio 2026, è diventato richiamabile tramite un'API ospitata questa settimana: intorno al 19 agosto 2026, il modello dense da 7B è stato attivato sull'endpoint ospitato di Tencent Cloud a 0,074 $ per milione di token di input e 0,295 $ per milione di token di output, con una finestra di contesto di 8.192 token. Non è arrivato da solo — Tencent Hy-MT2-1.8B e Tencent Hy-MT2-30B-A3B sono stati attivati sullo stesso backend entro un giorno. I pesi sono su Hugging Face e ModelScope da tre mesi; la novità è che un team ora può chiamare il modello senza noleggiare una GPU, compilare llama.cpp dal sorgente o distribuire la toolchain on-device da 1,25 bit. Per un carico di lavoro di traduzione, questa è la differenza tra un esperimento e una decisione di prodotto.

Cosa è appena stato rilasciato

L'endpoint commerciale è di proprietà di Tencent Cloud, esposto tramite l'API del fornitore e diverse piattaforme di terze parti. Le tre dimensioni operano ciascuna in un contesto di 8K con completamenti da 4.096 token; tutte e tre accettano output strutturato tramite uno schema JSON nel campo response_format, e nessuna implementa il function calling. Le specifiche pratiche, in una riga per dimensione:

Tencent Hy-MT2-7B — $0,074 in / $0,295 out per 1M di token, contesto di 8.192, denso ~7B, output strutturato supportato, nessuna tool call.

Tencent Hy-MT2-1.8B — $0,044 in ingresso / $0,177 in uscita per 1M di token, contesto di 8.192, 1,8B denso, nessuna chiamata a strumenti.

Tencent Hy-MT2-30B-A3B — $0,074 in ingresso / $0,295 in uscita per 1M di token, contesto di 8.192, MoE 30B totali / 3B attivi, output strutturato supportato, nessuna chiamata a strumenti.

Il prezzo di punta è il tasso di output del modello 7B: meno di tre decimi di centesimo per mille token di output, per un modello che, secondo Tencent, regge il confronto con modelli più grandi di un ordine di grandezza. La traduzione è uno dei pochi carichi di lavoro LLM in cui i token di output rappresentano quasi l'intero costo, quindi il prezzo di output è il numero che determina se una pipeline è sostenibile su larga scala.

A single-column scoreboard titled 'Tencent Hy-MT2-7B — the scoreboard' listing six rows: Params dense 7B; Price $0.074 / $0.295 per 1M; Context 8,192 tokens; FLORES-200 86.89 (~97.9% of Gemini 3.1 Pro Think); WMT25 63.86 / 71.21 / 82.24; License Apache-2.0, with the footer 'All figures vendor-reported; API price as listed Aug 2026.'

Il modello alla base dell'endpoint

{{1}}Hy-MT2{{/1}} è la famiglia "fast-thinking" di Tencent: invece di dedicare lunghe catene di pensiero a ogni frase, è progettato per reagire come farebbe un traduttore professionista — si sofferma dove la fonte è ambigua, rapido dove non lo è. La {{2}}7B{{/2}} è il punto di equilibrio della famiglia, un modello denso con licenza {{3}}Apache-2.0{{/3}}, che copre 33 lingue più cinque coppie di lingue minoritarie e dialetti cinesi (tra cui tibetano, kazako, mongolo, uiguro e cantonese). Ciò che lo distingue da un LLM generico che fa traduzione è la capacità di seguire le istruzioni: mantiene un termine di glossario per tutto il documento, applica uno stile specificato, lascia intatti delimitatori e chiavi JSON e accetta istruzioni di personalizzazione in linguaggio semplice. Tencent ha rilasciato {{4}}IFMTBench{{/4}}, un benchmark aperto proprio per questa capacità, insieme ai pesi, e il lato consumer — il mini-programma Tencent Hy Translate, con app iOS e Android in arrivo — è costruito su questa famiglia.

A screenshot of the Hugging Face model card for tencent/Hy-MT2-7B (captured August 23 2026) showing the model name, Apache-2.0 license, and the family description covering 33 languages plus five minority-language and dialect pairs.

I numeri, con l'asterisco attaccato

Tutto ciò che segue è la valutazione condotta da Tencent stessa, pubblicata sulla scheda del modello e nel report allegato; nulla di tutto ciò è stato riprodotto in modo indipendente al momento della stesura. Sul percorso di traduzione generale XX⇔XX di FLORES-200, il modello da 7B ottiene 86,89 XCOMET-XXL, che Tencent colloca a circa il 97,9% di Gemini 3.1 Pro (Think). Nella sua modalità "fast-thinking" si sostiene che superi i modelli generali open-source, tra cui DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B e Gemma4-26B-A4B. Su WMT25 i punteggi migliorano su tutta la linea rispetto alla generazione precedente — 63,86/71,21/82,24 contro i 61,59/68,85/75,91 di Hy-MT1.5-7B, con il guadagno maggiore su GEMBA — e su DomainMTBench (finanza, politica, istruzione) registra 94,92 XCOMET / 92,79 GEMBA. Il suo instruction-following è l'ambito in cui si distingue più visibilmente dai modelli di traduzione di un anno fa: 89,73 semplice / 72,67 complesso / 83,14 totale su IFMTBench.

Cosa cambia un'API ospitata per una pipeline di traduzione

Fare self-hosting del 7B è davvero facile, per quanto riguarda questo genere di cose: gira su una singola A100 o RTX 4090, ed esistono build quantizzate FP8 e GGUF. Ma "facile da self-hostare" non è "zero operazioni". Il percorso GGUF attualmente dipende da llama.cpp con il kernel STQ di Tencent, il percorso FP8 richiede lo stack giusto, e qualcuno deve sorvegliarlo. Un endpoint ospitato elimina tutto questo: niente GPU, niente build del kernel, niente pianificazione della capacità, e un prezzo per token fisso indipendentemente dall'utilizzo. Per un team che elabora milioni di frasi tradotte al giorno, quella prevedibilità conta più del benchmark principale — ed è il motivo per cui questa settimana conta più di quanto non facesse il lancio di maggio.

A screenshot of the Tencent Cloud techpedia page for Hy-MT2 (captured August 23 2026, English) showing the header 'Hy-MT2: High-Performance Multilingual Translation Model', the 2026-05-21 publication date, and a summary line about translating across 33 languages.

La domanda sul routing che ancora nessuno si sta ponendo

Because the model is three days old on the API side, the realistic way to adopt it is the way you adopt any brand-new provider: put it behind a routing rule with automatic failover so an untested endpoint can never take down a production path, and let the volume decide whether it earns a permanent slot. That is precisely the pattern OrcaRouter's routing DSL composes across the 200+ models we do carry — and it is worth being precise here: Tencent Hy-MT2-7B is not on OrcaRouter's catalogue as of this writing, so this is not a "call it through us" story. What is on-topic is the pricing model. OrcaRouter passes through each provider's list price with 0% markup, so when a vendor cuts the rate, the cut is live on the platform the same day. For a high-volume translation workload, the question to ask of any endpoint is not "what's the portal price today" but "what is the actual per-token list price the provider charges, and does anything sit between it and me." At $0.295/M output, Tencent Hy-MT2-7B just made that question interesting.

Cosa guardare dopo

Da questa settimana derivano tre cose. Primo, i modelli gemelli 1.8B e 30B-A3B sono ora ugualmente chiamabili, quindi la decisione su "quale dimensione" è una vera questione API piuttosto che una decisione di self-hosting (la famiglia ha le proprie pagine di confronto, ma in breve: 1.8B per l'on-device e il livello più economico, 30B-A3B per ambiti professionali, 7B nel mezzo). Secondo, la partnership di Tencent con WMT26 offre premi ai team che utilizzano i modelli Hy-MT nei compiti di traduzione automatica generale e traduzione di sottotitoli video — un segnale che Tencent intende che questa famiglia sia il default open per la traduzione nella MT competitiva. Terzo, le app iOS e Android con inferenza on-device, se verranno rilasciate come annunciato, renderanno il modello 1.8B il modello di traduzione open più installato al mondo. L'API ospitata è la parte che è cambiata questa settimana; la traiettoria della famiglia è stata fissata a maggio.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube