
North Small Translate 1.0 vs Hy-MT2 : deux traducteurs MoE, une lacune de preuves
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Ces deux familles reposent sur le même pari — celui qu'un réseau de type mixture-of-experts clairsemé, post-entraîné pour la traduction, l'emporte sur un modèle généraliste auquel on demande de traduire — et elles y sont parvenues par des directions opposées. Hy-MT2, la famille de traduction à trois modèles de Tencent Hunyuan, menée par le MoE Hy-MT2-30B-A3B, a été rendue open source le 21 mai 2026 sous licence Apache 2.0, avec un rapport technique, un benchmark open source et un tableau comparatif complet. North Small Translate 1.0, le traducteur MoE de Cohere à 218 milliards de paramètres dont 25 milliards actifs, a été documenté dans une note de version datée du 9 septembre 2026, et ses preuves de qualité se résument à un seul chiffre, sans la moindre métrique associée. Les architectures se ressemblent. La documentation, non, et cette différence est la chose la plus utile à comprendre avant de choisir l'une ou l'autre.
Une famille, trois tailles face à un grand modèle
Hy-MT2 n'est pas un modèle unique mais une gamme : un modèle dense 1,8B pour le travail sur appareil, un modèle dense 7B pour un seul GPU, et le 30B-A3B MoE comme modèle phare avec trois milliards de paramètres actifs par token. Tous les trois sont sous Apache 2.0, sans restriction d'accès, et publiés ensemble avec des quantifications FP8, GGUF, 2 bits et 1,25 bit, ainsi que le benchmark de suivi d'instructions IFMTBench et un article d'accompagnement. Tencent rapporte que la famille traduit entre 33 langues, plus cinq langues minoritaires et dialectes.
North Small Translate 1.0 est un point unique dans l'espace des tailles — et un grand : 218B de paramètres au total, 25B actifs, 128 experts avec huit activés par token plus des experts partagés, et une attention alternant selon un rapport 3:1 entre des couches à fenêtre glissante (fenêtre 4 096, RoPE) et des couches globales dépourvues d'embeddings positionnels. Sa fenêtre est de 16K en entrée et 16K en sortie pour l'anglais plus 49 autres langues, l'arabe standard moderne, l'allemand, le français, le japonais, le coréen, le russe et l'ukrainien étant désignés de premier niveau. Fait notable, la forme n'est pas nouvelle — Command A+ de Cohere, de mai 2026, utilisait la même configuration 218B/25B — ce qui en fait un post-entraînement spécialisé en traduction d'un cœur existant plutôt qu'une nouvelle architecture.
• Paramètres — North Small Translate 1.0 : 218B au total / 25B actifs vs Hy-MT2-30B-A3B : 30B au total / 3B actifs, avec des variantes denses de 1,8B et 7B
• Contexte — 16K en entrée et 16K en sortie par rapport à une fenêtre de travail de 8K, la configuration annonce jusqu’à 262 144 positions
• Langues — 50 (anglais + 49) contre 33 plus 5 langues minoritaires et dialectes
• Licence — CC BY-NC 4.0, commerciale via Model Vault vs Apache 2.0, sans restriction
• Preuves publiées — un chiffre WMT26 non nommé, rapporté par le fournisseur vs un rapport technique, un benchmark ouvert, et des résultats nommés sur FLORES-200, WMT25 GEMBA et XCOMET-XXL
• Service — vLLM avec cohere_melody>=0.9.0, décodage glouton recommandé vs transformers, vLLM, SGLang et llama.cpp
• Annoncé — 9 septembre 2026 (poids à accès restreint sur Hugging Face depuis le 14 août) vs 21 mai 2026

Le déficit de preuves est le véritable enjeu
La publication de Tencent s’est accompagnée de preuves à l’appui. Il y a un article sur arXiv, un benchmark que l’entreprise a rédigé et publié en open source spécialement pour mesurer le suivi des instructions de traduction, et un tableau de résultats nommant ses concurrents. FLORES-200 anglais-vers-X place le 30B-A3B à 93,85 contre Gemini 3.1 Pro à 94,42 et GPT-5.5 à 94,16. La métrique GEMBA de l’ère WMT25 le place à 84,34 — le score le plus élevé dans la propre comparaison de Tencent, devant GPT-5.5 à 83,41 et 83,29 dans ses deux modes, Gemini 3.1 Pro à 82,23, DeepSeek-V4-Pro à 81,99 et Kimi K2.6 à 81,68. XCOMET-XXL le place à 62,89, derrière son propre modèle frère 7B. Sur IFMTBench, il atteint 85,7 % de suivi global des instructions, avec un sous-score de 91,94 % qui se situe à un centième de point de Gemini 3.1 Pro et un sous-score distinct, 85,55 %, où il devance sans conteste le modèle Gemini 3.1 Pro.
Chacune d’entre elles est une mesure propre à Tencent, et aucune n’a été reproduite de manière indépendante. Mais elles sont nommées, elles sont comparables et elles sont falsifiables — un lecteur sait exactement quel test exécuter pour contester.
La note de version de Cohere n’avance qu’un seul chiffre : WMT26 83,60, qui monte à 84,36 dans ce qu’elle appelle un workflow de traduction agentique à passes multiples. Aucune métrique n’est nommée nulle part sur la fiche du modèle ni dans la documentation. Aucune page de résultats WMT26 n’a été publiée pour ce modèle. Le corpus d’entraînement, le nombre de tokens et le pipeline de données ne sont pas divulgués, alors que le rapport technique 2025 de Command A Translate décrivait en détail une technique de filtrage par difficulté. Rien de tout cela n’est la preuve d’un modèle moins bon. C’est la preuve de moins de preuves, ce qui est une chose différente et compte tout autant lorsqu’on décide ce qu’on met en production.
Le critère commun qu’aucune des deux parties n’a réellement publié
Il existe un véritable point de contact entre les deux, et il mérite un paragraphe, car c’est le seul endroit où une comparaison équitable pourrait avoir lieu. Tencent est partenaire de WMT26, parrainant une tâche de traduction de sous-titres vidéo avec des prix financés par Hunyuan. L’unique chiffre publié par Cohere est une donnée WMT26. Ainsi, les deux organisations se trouvent dans le même cycle d’évaluation 2026, et la seule métrique sur laquelle une confrontation directe pourrait être tranchée est précisément celle pour laquelle une seule des deux a publié quoi que ce soit — et l’a publiée sans nommer la métrique.
C’est l’écart à surveiller. Si Cohere associe un nom de métrique au 83,60, ou si les pages de résultats WMT26 incluent un système North Small Translate, la comparaison devient réelle. D’ici là, opposer les chiffres FLORES-200 et GEMBA de Tencent au chiffre WMT26 non étiqueté de Cohere serait une fabrication déguisée en analyse.

Licence et déploiement
Hy-MT2 est sous licence Apache 2.0, sans restriction d'accès : utilisation commerciale, fine-tuning, dérivés et redistribution, le tout sans même avoir à en discuter. North Small Translate 1.0 est sous CC BY-NC 4.0, gratuit pour un usage non commercial, le déploiement commercial passant par le Model Vault de Cohere à un prix non publié. Pour tout ce qui est livré aux clients, cette différence tranche la décision avant même que les benchmarks ne soient lus.
L’histoire du matériel suit le même schéma, mais en sens inverse. Hy-MT2 s’étend d’une version quantifiée de 440 Mo qui tourne sur un téléphone portable jusqu’au 30B-A3B, dont les trois milliards de paramètres actifs maintiennent un calcul par token modeste pour sa catégorie de qualité ; les runtimes couvrent transformers, vLLM, SGLang et llama.cpp. North Small Translate 1.0 publie le matériel minimum par checkpoint — quatre B200 ou huit H100 pour BF16, deux B200 ou quatre H100 pour FP8, un B200 ou deux H100 pour NVFP4 W4A16 — et recommande le décodage glouton pour correspondre à la production. L’avantage compensateur de Cohere est que le modèle s’exécute sur l’offre gratuite de son API Chat V2, gratuite pour les clés d’essai et de production jusqu’à atteindre les limites de débit, donc l’évaluer ne coûte rien.
Devriez-vous changer, et vers quoi ?
La question du basculement est véritablement asymétrique ici. Passer de Hy-MT2 à North Small Translate 1.0 n'est pas une amélioration de performance que vous pouvez justifier actuellement — c'est un pari sur un modèle dont la seule affirmation publique est un chiffre, mis en balance avec une famille qui dispose d'un rapport publié et d'une licence déployable. Ce qu'il vaut la peine de faire, c'est d'évaluer : le modèle Cohere peut être appelé gratuitement, couvre cinquante langues, y compris un ensemble européen plus large, et fournit 16K de sortie par passe, ce que la fenêtre de travail de 8K de Hy-MT2 ne permet pas.
Cette évaluation est précisément le cas où une couche de routage justifie son existence, car la réponse honnête pour la plupart des piles multilingues est que les deux modèles restent en place. OrcaRouter place un catalogue de plus de 200 modèles derrière une seule clé, de sorte qu'essayer un second modèle de traduction relève d'un changement de configuration et non d'un second contrat fournisseur ni d'une modification de code — vous pointez le même client compatible OpenAI vers un autre identifiant de modèle et comparez sur votre propre texte. Le prix catalogue du fournisseur est répercuté à 0 % de marge, donc tout changement de prix hébergé est effectif de notre côté le jour même, sans marge supplémentaire ajoutée par-dessus, et les chaînes de basculement maintiennent la production sur le modèle qui fonctionne déjà pendant que le nouveau est évalué. Ni North Small Translate 1.0 ni Hy-MT2 ne figurent dans notre catalogue aujourd'hui, il ne s'agit donc pas d'une recommandation d'acheter l'un ou l'autre chez nous — c'est l'argument pour ne pas figer la décision par du code avant d'avoir réalisé le test.

Le verdict
Le Hy-MT2 de Tencent est le choix le plus sûr, et ce n'est même pas serré au vu des preuves : Apache 2.0, trois tailles, une publication, un benchmark ouvert, quatre suites d'évaluation nommées et un partenariat WMT26. Le North Small Translate 1.0 de Cohere est le plus intéressant — 218 milliards de paramètres de MoE spécialisé en traduction derrière une fenêtre de sortie de 16K et cinquante langues, un niveau d'évaluation gratuit, et un 83,60 que personne en dehors de Cohere n'a vérifié.
Si vous devez prendre une décision ce trimestre, choisissez la famille qui a les preuves. Si vous avez un corpus et une semaine, faites-en passer une partie par l'offre gratuite et découvrez si le 83,60 non nommé de Cohere signifie quoi que ce soit sur vos documents — car c'est une question à laquelle aucun tableau de fournisseur ne répondra à votre place, et le seul nombre que Cohere a choisi de publier est précisément celui qu'elle a refusé de nommer.
