
North Small Translate 1.0 vs Hy-MT2: due traduttori MoE, una lacuna di evidenze
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Entrambe queste famiglie sono nate dalla stessa scommessa — che una rete sparse mixture-of-experts post-addestrata per la traduzione batta un modello general-purpose a cui si chiede di tradurre — e vi sono arrivate da direzioni opposte. Hy-MT2, la famiglia di traduzione a tre modelli di Tencent Hunyuan, capeggiata dall'Hy-MT2-30B-A3B MoE, è stata resa open source il 21 maggio 2026 con licenza Apache 2.0, corredata da un technical report, un benchmark open source e una tabella comparativa completa. North Small Translate 1.0, il traduttore MoE di Cohere da 218 miliardi di parametri e 25 miliardi attivi, è stato documentato in una release note datata 9 settembre 2026, e le sue prove di qualità si riducono a un singolo numero senza alcuna metrica associata. Le architetture si assomigliano. La documentazione no, e questa differenza è la cosa più utile da capire prima di scegliere l'una o l'altra.
Una famiglia, tre dimensioni contro un unico grande modello
Hy-MT2 non è un singolo modello ma una gamma: un modello denso da 1,8B per l'esecuzione su dispositivo, un modello denso da 7B per una singola GPU e il MoE 30B-A3B come modello di punta con tre miliardi di parametri attivi per token. Tutti e tre sono Apache 2.0, senza restrizioni, e sono rilasciati insieme alle quantizzazioni FP8, GGUF, a 2 bit e a 1,25 bit, oltre al benchmark IFMTBench di instruction following e a un paper di accompagnamento. Tencent riferisce che la famiglia traduce tra 33 lingue più cinque lingue minoritarie e dialetti.
North Small Translate 1.0 è un singolo punto nello spazio delle dimensioni, e pure grande: 218B parametri totali, 25B attivi, 128 esperti con otto attivati per token più esperti condivisi, e attenzione che si alterna in un rapporto 3:1 tra layer a finestra scorrevole (finestra 4.096, RoPE) e layer globali privi di embedding posizionali. La sua finestra è di 16K in input e 16K in output su inglese più altre 49 lingue, con arabo standard moderno, tedesco, francese, giapponese, coreano, russo e ucraino designati di primo livello. È interessante notare che la struttura non è nuova — Command A+ di Cohere di maggio 2026 usava la stessa configurazione 218B/25B — il che rende questo un post-addestramento specializzato per la traduzione di un nucleo esistente, più che una nuova architettura.
• Parametri — North Small Translate 1.0: 218B totali / 25B attivi vs Hy-MT2-30B-A3B: 30B totali / 3B attivi, con varianti dense da 1,8B e 7B
• Contesto — 16K in ingresso e 16K in uscita rispetto a una finestra di lavoro di 8K, la configurazione dichiara fino a 262.144 posizioni
• Lingue — 50 (inglese + 49) vs 33 più 5 lingue minoritarie e dialetti
• Licenza — CC BY-NC 4.0, uso commerciale tramite Model Vault vs Apache 2.0, senza restrizioni di accesso
• Prove pubblicate — una cifra WMT26 non nominata, riportata dal fornitore rispetto a un rapporto tecnico, un benchmark aperto e risultati nominati su FLORES-200, WMT25 GEMBA e XCOMET-XXL
• Servizio — vLLM con cohere_melody>=0.9.0, decodifica greedy consigliata rispetto a transformers, vLLM, SGLang e llama.cpp
• Annunciato — 9 settembre 2026 (pesi gated su Hugging Face dal 14 agosto) vs 21 maggio 2026

Il divario di prove è la vera storia
Il rilascio di Tencent è arrivato con prove a supporto. C'è un paper su arXiv, un benchmark che l'azienda ha scritto e reso open source appositamente per misurare la capacità di seguire le istruzioni nella traduzione, e una tabella di risultati che nomina i suoi concorrenti. FLORES-200 da inglese a X colloca il 30B-A3B a 93,85 contro Gemini 3.1 Pro a 94,42 e GPT-5.5 a 94,16. La metrica GEMBA dell'era WMT25 lo colloca a 84,34 — il punteggio più alto nel confronto dello stesso Tencent, davanti a GPT-5.5 a 83,41 e 83,29 nelle sue due modalità, Gemini 3.1 Pro a 82,23, DeepSeek-V4-Pro a 81,99 e Kimi K2.6 a 81,68. XCOMET-XXL lo colloca a 62,89, dietro il suo stesso fratello 7B. Su IFMTBench raggiunge l'85,7% di capacità complessiva di seguire le istruzioni, con un sotto-punteggio del 91,94% che si colloca a un centesimo di punto da Gemini 3.1 Pro e un sotto-punteggio separato, 85,55%, dove è nettamente in testa al modello Gemini 3.1 Pro.
Ognuna di queste è una misurazione propria di Tencent e nessuna è stata riprodotta in modo indipendente. Ma hanno un nome, sono comparabili e sono falsificabili — un lettore sa esattamente quale test eseguire per argomentare.
La nota di rilascio di Cohere offre una sola cifra: WMT26 83,60, che sale a 84,36 con quello che definisce un flusso di lavoro di traduzione agentico a più passaggi. Nessuna metrica è nominata da nessuna parte nella model card o nella documentazione. Nessuna pagina di risultati WMT26 è stata pubblicata per questo modello. Il corpus di addestramento, il conteggio dei token e la pipeline dati non sono resi noti, mentre il rapporto tecnico del 2025 di Command A Translate aveva descritto in dettaglio una tecnica di filtraggio per difficoltà. Niente di tutto ciò è prova di un modello peggiore. È la prova che ci sono meno prove, il che è una cosa diversa e conta altrettanto quando si decide cosa mettere in produzione.
Il metro di paragone condiviso che nessuna delle due parti ha effettivamente pubblicato
C'è un solo vero punto di contatto tra le due, e vale un paragrafo perché è l'unico luogo in cui potrebbe avvenire un confronto equo. Tencent è partner di WMT26, sponsorizzando un task di traduzione di sottotitoli video con premi finanziati da Hunyuan. L'unico numero pubblicato da Cohere è un dato WMT26. Quindi entrambe le organizzazioni rientrano nello stesso ciclo di valutazione del 2026, e l'unica metrica su cui si potrebbe dirimere un confronto diretto è proprio quella su cui solo una delle due ha pubblicato qualcosa — e l'ha pubblicato senza nominare la metrica.
Questo è il divario da tenere d'occhio. Se Cohere associa un nome di metrica all'83,60, o se le pagine dei risultati di WMT26 includono un sistema North Small Translate, il confronto diventa reale. Fino ad allora, mettere a confronto i numeri FLORES-200 e GEMBA di Tencent con la cifra WMT26 non etichettata di Cohere sarebbe una falsificazione mascherata da analisi.

Licenza e distribuzione
Hy-MT2 è Apache 2.0 senza gating: uso commerciale, fine-tuning, derivati e ridistribuzione, il tutto senza dover sostenere una conversazione. North Small Translate 1.0 è CC BY-NC 4.0, gratuito per uso non commerciale, con il deployment commerciale instradato tramite Model Vault di Cohere a un prezzo che non viene pubblicato. Per qualsiasi cosa destinata ai clienti, questa differenza risolve la decisione prima ancora di leggere i benchmark.
La storia dell'hardware segue lo stesso schema, ma al contrario. Hy-MT2 spazia da una build quantizzata da 440MB che gira su un telefono fino al 30B-A3B, i cui tre miliardi di parametri attivi mantengono contenuto il calcolo per token per la sua fascia di qualità; i runtime coprono transformers, vLLM, SGLang e llama.cpp. North Small Translate 1.0 pubblica l'hardware minimo per checkpoint — quattro B200 o otto H100 per BF16, due B200 o quattro H100 per FP8, una B200 o due H100 per NVFP4 W4A16 — e raccomanda la decodifica greedy per allinearsi alla produzione. Il vantaggio compensativo di Cohere è che il modello gira sul livello gratuito della sua API Chat V2, gratuita per le chiavi di prova e di produzione fino al raggiungimento dei limiti di frequenza, quindi valutarlo non costa nulla.
Dovresti passare, e a cosa
La questione del passaggio qui è genuinamente asimmetrica. Passare da Hy-MT2 a North Small Translate 1.0 non è un miglioramento delle prestazioni che tu possa attualmente giustificare — è una scommessa su un modello la cui unica rivendicazione pubblica è un numero, contrapposta a una famiglia con un rapporto pubblicato e una licenza utilizzabile in produzione. Ciò che vale la pena fare è valutare: il modello Cohere è gratuito da invocare, copre cinquanta lingue, incluso un insieme europeo più ampio, e ti offre 16K di output per passaggio, cosa che la finestra di lavoro da 8K di Hy-MT2 non fa.
Quella valutazione è il caso in cui uno strato di routing si ripaga da solo, perché la risposta onesta per la maggior parte degli stack multilingue è che entrambi i modelli restano. OrcaRouter mette un catalogo di oltre 200 modelli dietro un'unica chiave, così provare un secondo modello di traduzione è una modifica di configurazione e non un secondo contratto con un fornitore o una modifica al codice — basta puntare lo stesso client compatibile con OpenAI su un ID modello diverso e confrontare sul proprio testo. Il prezzo di listino del fornitore viene passato a 0% di ricarico, quindi una variazione del prezzo applicato dal fornitore è attiva dalla nostra parte lo stesso giorno, senza alcuno spread aggiunto sopra, e le catene di failover mantengono la produzione sul modello che già funziona mentre quello nuovo viene valutato. Né North Small Translate 1.0 né Hy-MT2 sono oggi nel nostro catalogo, quindi questa non è una raccomandazione ad acquistare l'uno o l'altro da noi — è l'argomento per non codificare in modo rigido la decisione prima di aver eseguito il test.

Il verdetto
Hy-MT2 di Tencent è la scelta più sicura e, stando alle prove, non c'è partita: Apache 2.0, tre dimensioni, un paper, un benchmark aperto, quattro suite di valutazione denominate e una partnership con WMT26. North Small Translate 1.0 di Cohere è quella più interessante — 218 miliardi di parametri di MoE specifico per la traduzione dietro una finestra di output da 16K e cinquanta lingue, un tier di valutazione gratuito e un 83,60 che nessuno al di fuori di Cohere ha verificato.
Se ti serve una decisione questo trimestre, scegli la famiglia che ha le prove. Se hai un corpus e una settimana, fai passare una parte di esso attraverso il livello gratuito e scopri se l'83,60 senza nome di Cohere significa qualcosa sui tuoi documenti — perché è una domanda a cui nessuna tabella di un fornitore risponderà al posto tuo, e l'unico numero che Cohere ha scelto di pubblicare è proprio quello che ha rifiutato di nominare.
