Card hero intitolata "North Small Translate 1.0 vs Hy-MT2-1.8B" con il sottotitolo "218GB di modello contro 440MB", sopra due card: North Small Translate 1.0 (218B MoE, minimo 2x B200) e Hy-MT2-1.8B (1.8B dense, 440MB, funziona su un telefono) con un'icona che raffigura il contorno di un telefono.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B: 218GB di modello contro 440MB

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Uno di questi entra in un telefono. Hy-MT2-1.8B, il modello di traduzione on-device di Tencent Hunyuan, reso open source con licenza Apache 2.0 il 21 maggio 2026, si riduce a 440 megabyte con la quantizzazione a 1,25 bit di AngelSlim e gira sul silicio per telefoni di Apple, Qualcomm e MediaTek. North Small Translate 1.0, il modello mixture-of-experts da 218 miliardi di parametri che Cohere ha documentato nelle sue note di rilascio il 9 settembre 2026, distribuisce un set di pesi FP8 nell'ordine dei 218 gigabyte e richiede come minimo due B200. Si tratta di circa cinquecento volte lo spazio di archiviazione di uno dei due, e la domanda interessante non è quale sia migliore — è a cosa serva ciascuno, e quale licenza ti permetta di distribuirlo.

Il divario di dimensioni non è un divario di qualità

È allettante leggere 218B rispetto a 1.8B come una classifica diretta delle capacità. Non lo è, per due motivi. Il primo è che North Small Translate 1.0 è un modello a miscela di esperti sparsa con solo 25 miliardi di parametri attivi per token, quindi il calcolo per token si trova in una categoria diversa rispetto al conteggio dei parametri. Il secondo è che i due modelli sono stati ottimizzati per obiettivi diversi: il 1.8B di Tencent è stato costruito per essere abbastanza piccolo da funzionare offline su un dispositivo mobile, e il modello di Cohere è stato costruito per mantenere un intero documento nel contesto e tradurlo come un'unità.

Questa differenza è leggibile nelle finestre di contesto. La configurazione di Hy-MT2-1.8B dichiara fino a 262.144 posizioni, ma le stesse linee guida di inferenza di Tencent limitano la generazione a 8.192 token: la finestra di lavoro effettiva è di 8K. North Small Translate 1.0 documenta 16K in ingresso e 16K in uscita, ovvero il doppio della finestra di input e, cosa ancora più importante, ben 16K di output. Se la vostra unità di lavoro è un manuale di servizio, quel budget di output è la funzionalità che conta. Se la vostra unità di lavoro è un messaggio di chat, è irrilevante.

Parametri totali — North Small Translate 1.0: 218B MoE, 25B attivi vs Hy-MT2-1.8B: 1,8B denso

Contesto — 16K in ingresso e 16K in uscita rispetto a una finestra di lavoro di 8K (la configurazione dichiara fino a 262.144 posizioni; le indicazioni di Tencent parlano di 8.192)

Lingue — 50 (inglese + 49) vs 33 lingue più 5 lingue minoritarie e dialetti

Licenza — CC BY-NC 4.0, uso commerciale tramite Model Vault vs Apache 2.0, senza restrizioni di accesso

Impronta quantizzata — FP8 ~218GB, NVFP4 W4A16 ~109GB rispetto a 440MB a 1,25-bit, pubblicati anche FP8 e GGUF

Hardware minimo — 2×B200 o 4×H100 a FP8 rispetto a un telefono cellulare

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Cosa ha effettivamente rilasciato Tencent nel modello 1.8B

Il modello 1.8B è il membro più piccolo di una famiglia di tre modelli — 1.8B, 7B e un modello di punta MoE 30B-A3B — tutti rilasciati insieme a un benchmark complementare chiamato IFMTBench che misura la capacità di seguire istruzioni di traduzione anziché la qualità grezza della traduzione. Tencent ha distribuito quantizzazioni FP8, GGUF, a 2 bit e a 1.25 bit insieme ai pesi di base, e la versione a 1.25 bit è quella che produce il valore di 440MB e un presunto speedup inferenziale di 1.5x rispetto alla precedente generazione Hy-MT1.5. Il serving è supportato tramite transformers 5.6.0 e versioni successive, vLLM, SGLang e llama.cpp, con il percorso GGUF che dipende da un kernel STQ integrato in llama.cpp. Il campionamento consigliato è temperature 0.7, top_p 0.6, top_k 20, penalità di ripetizione 1.05, e non esiste un system prompt predefinito — l'inverso dell'approccio di Cohere.

Inoltre, a differenza di North Small Translate 1.0, è un modello con un'adozione visibile. Il repository Hugging Face è stato scaricato più di 23.000 volte e ha circa 1.200 like. Il repository principale di Cohere mostrava 26 download e zero like al momento in cui questo è stato scritto.

La licenza è la differenza più netta

Questa è la parte che dovrebbe determinare più implementazioni di quanto faccia la tabella dei benchmark. Hy-MT2-1.8B è Apache 2.0 senza limitazioni di accesso — uso commerciale, fine-tuning, opere derivate, ridistribuzione, tutto consentito. North Small Translate 1.0 è CC BY-NC 4.0: i pesi sono gratuiti per uso non commerciale, e l'implementazione commerciale richiede una licenza acquistata tramite Model Vault di Cohere, per la quale non è pubblicato alcun prezzo.

Detto in parole povere: se stai costruendo un prodotto, il modello di Tencent è quello che puoi rilasciare oggi senza una conversazione, mentre quello di Cohere è quello che puoi solo valutare. Questa asimmetria non rende il modello di Cohere peggiore, ma cambia l'ordine delle operazioni — quello di Cohere lo valuti, quello di Tencent puoi distribuirlo.

L'evidenza sulla qualità è asimmetrica, ed entrambe le parti sono dichiarate dai fornitori.

Nessuno dei due modelli ha una valutazione indipendente alle spalle, quindi considera ogni numero qui come un'affermazione del suo creatore. La differenza sta in quanto i creatori hanno messo sul tavolo. Tencent ha pubblicato una tabella comparativa completa e un report tecnico: nella traduzione dall'inglese a X di FLORES-200, Hy-MT2-1.8B registra 90,00 contro i 94,42 di Gemini 3.1 Pro e i 94,16 di GPT-5.5 — modestamente dietro i modelli di frontiera ma a pochi punti di distanza, da un modello che entra in un telefono. Sul punteggio complessivo di instruction-following di IFMTBench, il modello da 1.8B si attesta al 69,36%, ben dietro il suo stesso fratello 30B-A3B all'85,7% e Gemini 3.1 Pro all'89,08%, che è la lettura onesta del compromesso: il modello minuscolo segue istruzioni di formattazione e terminologia con un'affidabilità molto inferiore rispetto a quanto traduca.

Cohere ha pubblicato un solo dato — un punteggio WMT26 di 83,60, che sale a 84,36 con un flusso di lavoro agentico a più passaggi — senza alcun nome di metrica associato e senza una pagina dei risultati WMT26 con cui verificarlo. Non è un confronto che possiamo fare. Un singolo numero senza nome non può essere messo a confronto con una tabella di benchmark con nomi, e fingere il contrario sarebbe la cosa più fuorviante che questo articolo potrebbe fare.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Il contrappeso di Tencent è che i suoi numeri provengono da fonti che un lettore può ispezionare. Il repository Hy-MT2 pubblica la panoramica della famiglia, le tre dimensioni dei modelli e i runtime supportati da ciascuno, insieme alla tabella dei benchmark — ed è questo che rende quantomeno verificabili i valori di FLORES-200 e IFMTBench, e che fa risaltare per contrasto l'unico numero senza nome di Cohere.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Quanto costa chiamare ciascuno

Il modello 1.8B di Tencent ha un'API commerciale ospitata lanciata ad agosto 2026, con un prezzo di circa 0,044 $ per milione di token di input e 0,177 $ per milione di token di output — economico in termini assoluti e prezzato per token. Il modello di Cohere gira sul livello gratuito di Chat V2, gratuito per le chiavi di prova e di produzione fino al raggiungimento dei limiti di frequenza, quindi il costo di valutazione è zero ma il costo di produzione è un contratto che devi negoziare. L'hosting autonomo ribalta completamente l'aritmetica: 440MB su un telefono contro due B200, una differenza misurata in ordini di grandezza anziché in percentuali.

Il motivo per cui vale la pena menzionare quel divario in un articolo su una piattaforma di routing è che il livello economico e quello costoso non sono concorrenti — sono due posizioni in una cascata, e le cascate sono proprio ciò per cui serve un router. OrcaRouter applica il prezzo di listino del provider con uno 0% di ricarico, quindi un taglio di prezzo del fornitore su un endpoint di traduzione ospitato è attivo dalla nostra parte lo stesso giorno, senza alcun margine di rivenditore da rinegoziare, e le catene di failover consentono a un modello più piccolo di assorbire la maggior parte del traffico mentre un modello più pesante prende le richieste in cui fallisce. Prova prima quello economico, fai escalation sui casi difficili e lascia che sia il livello di routing a mantenere la policy anziché il codice della tua applicazione.

Quale dovresti scegliere

Se la tua traduzione avviene su un dispositivo, offline, con un budget di archiviazione per megabyte, o all'interno di un prodotto commerciale che non ha alcuna propensione a negoziare una licenza, Hy-MT2-1.8B è la risposta e North Small Translate 1.0 non è in gara. Se la tua unità di lavoro è un documento lungo in una delle cinquanta lingue supportate da Cohere, se hai bisogno di 16K di output in una sola passata, e se una licenza commerciale è qualcosa che la tua organizzazione è disposta ad acquistare, allora il modello di Cohere è la macchina più capace su ogni dimensione divulgata — con l'avvertenza che la sua qualità si basa su un singolo valore non riprodotto.

E per la maggior parte dei team la risposta onesta è entrambi, in quest'ordine: il modello da 440MB svolge il lavoro di routine a un costo irrisorio, il modello da 218B gestisce i documenti che contano, e la decisione su quale richiesta vada dove è una regola di instradamento, non una riscrittura. Il divario tra questi due modelli non è un divario da colmare. È uno spettro da usare.