Scheda in evidenza intitolata "North Small Translate 1.0 vs Hy-MT2-7B" con il sottotitolo "Una GPU contro due B200", sopra due schede: North Small Translate 1.0 (MoE da 218B / 25B attivi, CC BY-NC 4.0) e Hy-MT2-7B (dense da 8B, circa 16GB di VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B: una GPU contro due B200

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il confronto più serrato nel campo della traduzione aperta in questo momento potrebbe anche essere il meno ovvio. Hy-MT2-7B è il figlio di mezzo della famiglia di traduzione di Tencent Hunyuan, reso open source con licenza Apache 2.0 il 21 maggio 2026, e gira su una singola RTX 4090 o A100 con circa 16 GB di VRAM. North Small Translate 1.0 è il traduttore sparse mixture-of-experts da 218 miliardi di parametri di Cohere, documentato nelle note di rilascio dell'azienda il 9 settembre 2026, con una distribuzione minima di due B200 in FP8 o una B200 nella sua forma NVFP4 W4A16. Entrambi sono specialisti della traduzione. Entrambi sono attuali. Uno dei due può essere servito da una workstation, e questo singolo fatto ridefinisce l'intero confronto — perché il benchmark su cui vorrebbero maggiormente essere giudicati a parità di condizioni non esiste.

Parti dalla busta, non dai punteggi

Il costo di distribuzione è la dimensione che decide la maggior parte delle integrazioni reali, e qui i due modelli non sono vicini. Hy-MT2-7B è un modello denso HunYuanDenseV1 di circa otto miliardi di parametri con build FP8 e GGUF pubblicate, più versioni comunitarie MLX a 8 bit per Apple silicon. Le note di distribuzione di Tencent elencano transformers 5.6.0 o successivo, vLLM, SGLang e llama.cpp come runtime supportati, e le linee guida per l'inferenza limitano la generazione a 8.192 token anche se la configurazione dichiara fino a 262.144 posizioni. Una singola GPU moderna consumer o workstation è sufficiente.

North Small Translate 1.0 è un oggetto di una classe diversa. I suoi 218B di parametri totali con 25B attivi sono distribuiti su 128 esperti con otto attivi per token più esperti condivisi, e Cohere pubblica l'hardware minimo per ciascuno dei suoi tre checkpoint: quattro B200 o otto H100 per BF16, due B200 o quattro H100 per FP8, un B200 o due H100 per la build NVFP4 W4A16. Il serving avviene tramite vLLM con cohere_melody>=0.9.0, e Cohere raccomanda la decodifica greedy per corrispondere alla produzione. L'output riporta <|START_TEXT|> e <|END_TEXT|> marcatori che non sono registrati come token speciali.

Forma — North Small Translate 1.0: 218B totale / 25B attivi MoE sparso, 128 esperti vs Hy-MT2-7B: denso, circa 8B

Contesto — 16K in ingresso e 16K in uscita rispetto a una finestra di lavoro di 8K, la configurazione dichiara fino a 262.144 posizioni

Hardware minimo — 1×B200 a W4A16, 2×B200 o 4×H100 a FP8 rispetto a una singola GPU di classe RTX 4090 in ~16GB

Formati pubblicati — BF16, FP8, NVFP4 W4A16 rispetto alla base, FP8, GGUF, oltre a MLX 8-bit della community

Lingue — 50 (inglese + 49) vs 33 lingue più 5 lingue minoritarie e dialetti

Licenza — CC BY-NC 4.0, uso commerciale tramite Model Vault vs Apache 2.0, senza restrizioni di accesso

Qualità dichiarata — WMT26 83.60, metrica non specificata, dati dichiarati dal fornitore vs tabelle di fornitori nominati su FLORES-200, WMT25 GEMBA, XCOMET-XXL e IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Il problema del benchmark

Ecco il nocciolo onesto di questo confronto: non possiamo stabilire una classifica tra questi due modelli, e chiunque ti dica il contrario si sta inventando un numero. Tencent ha pubblicato quattro valutazioni denominate. Su FLORES-200 per la traduzione dall'inglese verso X, il 7B totalizza 93,52, dietro il 94,42 di Gemini 3.1 Pro e il 94,16 di GPT-5.5, ma abbastanza vicino da contare. Sulla metrica GEMBA, affine a WMT25, ottiene 82,24 contro l'84,34 del 30B-A3B e l'83,41 di GPT-5.5. Su XCOMET-XXL supera tutto nella tabella comparativa di Tencent con 63,86 — davanti a Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro e Kimi K2.6. Sul punteggio di IFMTBench per la capacità di seguire le istruzioni si attesta all'83,14%. Tutti questi sono numeri di Tencent, nessuno di essi è stato riprodotto in modo indipendente, e restano comunque ben più di quanto abbia offerto Cohere.

Cohere ha pubblicato un'unica cifra: un punteggio WMT26 di 83,60, che sale a 84,36 in un flusso di lavoro agentico multi-pass. Nessuna metrica è indicata sulla model card o nella nota di rilascio, e non è stata pubblicata alcuna pagina di risultati WMT26 relativa a questo modello. Questa asimmetria non è una prova che il modello di Cohere sia più debole o più forte. Significa che il confronto che un lettore desidera di più — stesso test, stessa metrica, entrambi i modelli — non può essere effettuato sulla base di prove pubbliche, e la differenza di quattro punti tra le due cifre di Cohere (da 83,60 a 84,36) è già più ampia della maggior parte dei divari nella tabella di Tencent.

Le lingue e il documento lungo

North Small Translate 1.0 copre cinquanta lingue e varianti locali, con arabo standard moderno, tedesco, francese, giapponese, coreano, russo e ucraino designati come tier-one, e accetta ed emette 16.000 token in entrambe le direzioni. Hy-MT2-7B copre trentatré lingue più cinque lingue minoritarie e dialetti, tra cui tibetano, uiguro e cantonese. Nessuno dei due elenchi è un sovrainsieme dell'altro — Tencent raggiunge cantonese e uiguro, Cohere raggiunge un insieme più ampio di locale europei — quindi un deployment multilingue potrebbe scoprire che, solo per motivi di copertura, necessita di entrambi.

La finestra di output è la differenza più silenziosa. Sedicimila token di output significano un documento procedurale completo in un'unica passata, con terminologia e registro coerenti lungo tutto il testo perché il modello ha visto tutto. Una finestra da 8K non lo fa, e la soluzione alternativa frase per frase reintroduce esattamente i problemi di coerenza tra segmenti che benchmark di instruction-following per la traduzione come IFMTBench sono stati creati per misurare.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

La licenza, ancora una volta, decide più della tabella

North Small Translate 1.0 è CC BY-NC 4.0. I pesi sono gratuiti per lavori non commerciali, e l'implementazione commerciale passa attraverso Model Vault di Cohere con una licenza acquistata e senza un prezzo pubblicato. Hy-MT2-7B è Apache 2.0 e senza restrizioni di accesso — uso commerciale, fine-tuning e derivati tutti consentiti senza dover contattare nessuno. Per un prodotto commerciale, l'ordine delle operazioni si impone da sé: Hy-MT2-7B è implementabile oggi e il modello di Cohere è valutabile oggi, e nessuna riga di benchmark cambia quest'ordine.

Il vantaggio compensativo di Cohere è il livello gratuito. North Small Translate 1.0 viene eseguito sul livello gratuito di Chat V2, gratuito sia per le chiavi di prova che per quelle di produzione fino al raggiungimento dei limiti di velocità, quindi una valutazione non costa nulla se non il tempo. Hy-MT2-7B dispone di un'API commerciale ospitata — Tencent ha fissato il prezzo del livello ospitato della famiglia a circa 0,044 $ per milione di token in input e 0,177 $ per milione di token in output — e l'auto-hosting sulla propria GPU è la via davvero gratuita.

Cosa implica davvero "multi-pass"

La decisione di Cohere di pubblicare sia un 83,60 sia un 84,36 è il dettaglio più informativo nella sua nota di rilascio, perché indica che l'azienda ritiene che un workflow batta una singola chiamata. È la stessa scommessa fatta da Tencent con un meccanismo diverso: il suo flagship 30B-A3B vince su GEMBA e XCOMET mentre Gemini 3.1 Pro vince su FLORES-200, il che significa che il sistema migliore non è un singolo modello ma un panel. La fusione di modelli di OrcaRouter esegue diversi modelli come panel e riconcilia le loro risposte all'interno di una singola chiamata, ovvero la versione a livello di piattaforma dell'idea multi-pass che entrambi i fornitori inseguono — e si compone con il lato routing, dove una chiave copre un catalogo di oltre 200 modelli al prezzo di listino del provider con markup dello 0%, così una variazione di prezzo del fornitore arriva dalla nostra parte lo stesso giorno invece che al rinnovo contrattuale successivo.

Quell'impostazione risolve anche il problema delle prove con cui si apriva questo articolo. Quando due fornitori pubblicano benchmark non sovrapposti e nessuno dei due dispone di una valutazione indipendente, il modo per scegliere non è fidarsi di una tabella. È eseguirli entrambi sui tuoi documenti e lasciare che il disaccordo emerga su testo reale — che è esattamente lo scopo di un panel e di una catena di failover.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Quale, e quando

Se ti serve un modello di traduzione che giri su hardware che già possiedi, in un prodotto commerciale, senza dover affrontare una discussione sulle licenze, Hy-MT2-7B vince solo in virtù dell'involucro — e i suoi risultati pubblicati dal fornitore, per quanto non riprodotti, sono quantomeno nominati, confrontabili e vicini alla frontiera. Se traduci documenti lunghi nelle cinquanta lingue di Cohere, hai bisogno di 16K di output coerente per passata e disponi o di un budget per due B200 o della volontà di eseguire la valutazione sul livello gratuito di Cohere prima di decidere, North Small Translate 1.0 è la macchina più capace su ogni asse dichiarato.

Quello che nessuno dei due modelli fa è eliminare la necessità di testare. Cohere ti ha dato un numero senza nome e un modo gratuito per verificarlo. Tencent ti ha dato una tabella e un download grande quanto una GPU. L'83.60 è una promessa, non un risultato — e l'unico posto in cui quella promessa trova risposta è il tuo corpus.