
North Small Translate 1.0 vs Hy-MT2-7B : un GPU contre deux B200
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
La confrontation la plus serrée en traduction ouverte actuellement pourrait aussi être la moins évidente. Hy-MT2-7B est l'enfant du milieu de la famille de traduction de Tencent Hunyuan, publié en open source sous Apache 2.0 le 21 mai 2026, et il tourne sur une seule RTX 4090 ou A100 avec environ 16 Go de VRAM. North Small Translate 1.0 est le traducteur à mélange d'experts clairsemé de 218 milliards de paramètres de Cohere, documenté dans les notes de version de l'entreprise le 9 septembre 2026, avec un déploiement minimal de deux B200 en FP8 ou d'un B200 dans sa forme NVFP4 W4A16. Les deux sont des spécialistes de la traduction. Les deux sont actuels. L'un d'eux peut être servi depuis une station de travail, et ce seul fait recadre toute la comparaison — car le benchmark sur lequel ils aimeraient le plus être jugés à armes égales n'existe pas.
Commencez par l'enveloppe, pas les scores
Le coût de déploiement est la dimension qui décide de la plupart des intégrations réelles, et sur ce point, les deux modèles ne sont pas proches. Hy-MT2-7B est un modèle dense HunYuanDenseV1 d'environ huit milliards de paramètres, avec des versions FP8 et GGUF publiées, ainsi que des versions MLX 8 bits communautaires pour les puces Apple. Les notes de déploiement de Tencent indiquent transformers 5.6.0 ou une version ultérieure, vLLM, SGLang et llama.cpp comme environnements d'exécution pris en charge, et les recommandations d'inférence plafonnent la génération à 8 192 tokens, même si la configuration annonce jusqu'à 262 144 positions. Un seul GPU moderne grand public ou de station de travail suffit.
North Small Translate 1.0 relève d'une classe d'objet différente. Ses 218B de paramètres totaux, dont 25B actifs, sont répartis sur 128 experts avec huit actifs par jeton ainsi que des experts partagés, et Cohere publie le matériel minimum pour chacun de ses trois checkpoints : quatre B200 ou huit H100 pour le BF16, deux B200 ou quatre H100 pour le FP8, un B200 ou deux H100 pour la version NVFP4 W4A16. Le service d'inférence passe par vLLM avec cohere_melody>=0.9.0, et Cohere recommande le décodage glouton pour correspondre à la production. La sortie porte <|START_TEXT|> et <|END_TEXT|>, des marqueurs qui ne sont pas enregistrés comme jetons spéciaux.
• Architecture — North Small Translate 1.0 : 218B au total / 25B actifs en MoE clairsemé, 128 experts vs Hy-MT2-7B : dense, environ 8B
• Contexte — 16K en entrée et 16K en sortie par rapport à une fenêtre de travail de 8K, la configuration annonce jusqu’à 262 144 positions
• Configuration matérielle minimale — 1×B200 en W4A16, 2×B200 ou 4×H100 en FP8 contre un seul GPU de classe RTX 4090 en ~16 Go
• Formats publiés — BF16, FP8, NVFP4 W4A16 par rapport à la base, FP8, GGUF, plus MLX 8 bits de la communauté
• Langues — 50 (anglais + 49) contre 33 langues plus 5 langues minoritaires et dialectes
• Licence — CC BY-NC 4.0, commerciale via Model Vault vs Apache 2.0, sans restriction
• Qualité déclarée — WMT26 83,60, métrique non nommée, déclarée par le fournisseur vs tableaux de fournisseurs nommés sur FLORES-200, WMT25 GEMBA, XCOMET-XXL et IFMTBench

Le problème de référence
Voici le cœur honnête de cette comparaison : nous ne pouvons pas classer ces deux modèles l'un par rapport à l'autre, et quiconque vous dit le contraire invente un chiffre. Tencent a publié quatre évaluations nommées. Sur la traduction anglais-vers-X de FLORES-200, le 7B affiche 93,52, derrière les 94,42 de Gemini 3.1 Pro et les 94,16 de GPT-5.5, mais suffisamment proche pour compter. Sur la métrique GEMBA proche de WMT25, il obtient 82,24 contre 84,34 pour le 30B-A3B et 83,41 pour GPT-5.5. Sur XCOMET-XXL, il devance tous les autres dans le tableau comparatif de Tencent avec 63,86 — devant Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro et Kimi K2.6. Sur le score de suivi d'instructions d'IFMTBench, il atteint 83,14 %. Tous ces chiffres sont ceux de Tencent, aucun n'a été reproduit de façon indépendante, et ils représentent encore bien plus que ce que Cohere a proposé.
Cohere a publié un seul chiffre : un score WMT26 de 83,60, qui passe à 84,36 avec un flux de travail agentique à passes multiples. Aucune métrique n'est nommée sur la fiche du modèle ni dans la note de version, et aucune page de résultats WMT26 n'a été publiée pour ce modèle. Cette asymétrie ne prouve pas que le modèle de Cohere soit plus faible ou plus fort. Elle signifie que la comparaison que le lecteur souhaite le plus — même test, même métrique, les deux modèles — ne peut pas être établie à partir d'éléments publics, et l'écart de quatre points entre les deux chiffres de Cohere eux-mêmes (83,60 à 84,36) est déjà plus grand que la plupart des écarts du tableau de Tencent.
Langues et le long document
North Small Translate 1.0 couvre cinquante langues et variantes locales, avec l’arabe standard moderne, l’allemand, le français, le japonais, le coréen, le russe et l’ukrainien classés en première catégorie, et il accepte et émet 16 000 jetons des deux côtés. Hy-MT2-7B couvre trente-trois langues plus cinq langues minoritaires et dialectes, dont le tibétain, l’ouïghour et le cantonais. Aucune des deux listes n’est un sur-ensemble de l’autre — Tencent atteint le cantonais et l’ouïghour, Cohere atteint un ensemble plus large de locales européennes — de sorte qu’un déploiement multilingue peut constater qu’il a besoin des deux, ne serait-ce que pour des raisons de couverture.
La fenêtre de sortie est la différence la plus discrète. Seize mille jetons de sortie signifient un document de procédure complet en une seule passe, avec une terminologie et un registre cohérents sur l'ensemble, parce que le modèle a tout vu. Une fenêtre de 8 K ne le permet pas, et la solution de contournement phrase par phrase réintroduit exactement les problèmes de cohérence entre segments que des benchmarks de suivi d'instructions en traduction comme IFMTBench ont été conçus pour mesurer.

La licence, encore une fois, décide plus que le tableau.
North Small Translate 1.0 est sous CC BY-NC 4.0. Les poids sont gratuits pour un usage non commercial, et le déploiement commercial passe par Model Vault de Cohere sous licence achetée, sans prix publié. Hy-MT2-7B est sous Apache 2.0 et sans restriction d'accès — usage commercial, fine-tuning et œuvres dérivées tous permis sans échange préalable. Pour un produit commercial, l'ordre des opérations s'impose de lui-même : Hy-MT2-7B est déployable aujourd'hui et le modèle de Cohere est évaluable aujourd'hui, et aucune ligne de benchmark ne change cet ordre.
L'avantage compensateur de Cohere, c'est son niveau gratuit. North Small Translate 1.0 fonctionne sur le niveau gratuit de Chat V2, gratuit aussi bien pour les clés d'essai que de production jusqu'à atteindre les limites de débit, si bien qu'une évaluation ne coûte rien d'autre que du temps. Hy-MT2-7B dispose d'une API commerciale hébergée — Tencent a fixé le tarif du niveau hébergé de la famille à environ 0,044 $ par million de jetons d'entrée et 0,177 $ par million de jetons de sortie — et l'auto-hébergement sur votre propre GPU est la voie réellement gratuite.
Ce que « multi-pass » implique réellement
La décision de Cohere de publier à la fois un 83,60 et un 84,36 est le détail le plus instructif de sa note de version, car elle indique que l’entreprise est convaincue qu’un flux de travail vaut mieux qu’un appel unique. C’est le même pari que Tencent a fait avec un mécanisme différent : son modèle phare 30B-A3B l’emporte sur GEMBA et XCOMET, tandis que Gemini 3.1 Pro l’emporte sur FLORES-200, ce qui signifie que le meilleur système n’est pas un modèle unique mais un panel. La fusion de modèles d’OrcaRouter exécute plusieurs modèles comme un panel et réconcilie leurs réponses au sein d’un seul appel, ce qui constitue la version au niveau de la plateforme de l’idée de passes multiples que les deux fournisseurs poursuivent — et elle se combine avec le volet routage, où une seule clé couvre un catalogue de plus de 200 modèles au prix catalogue du fournisseur avec 0 % de marge, de sorte qu’un changement de tarif d’un fournisseur se répercute de notre côté le jour même plutôt qu’au prochain renouvellement de contrat.
Cette façon de présenter les choses résout aussi le problème de preuves avec lequel cet article s'ouvre. Quand deux fournisseurs publient des benchmarks qui ne se recoupent pas et qu’aucun des deux ne dispose d’une évaluation indépendante, la façon de choisir n’est pas de se fier à un tableau. C’est de les exécuter tous les deux sur vos propres documents et de laisser le désaccord apparaître sur du texte réel — ce à quoi servent précisément un panel et une chaîne de basculement.

Lequel, et quand
Si vous avez besoin d’un modèle de traduction tournant sur du matériel que vous possédez déjà, dans un produit commercial, sans discussion sur les licences, Hy-MT2-7B l’emporte sur la seule base de son enveloppe — et ses résultats publiés par son fournisseur, aussi non reproduits soient-ils, sont au moins nommés, comparables et proches de la frontière. Si vous traduisez de longs documents dans les cinquante langues de Cohere, que vous avez besoin de 16K de sortie cohérente par passe et que vous disposez soit d’un budget de deux B200, soit de la volonté de lancer l’évaluation sur l’offre gratuite de Cohere avant de décider, North Small Translate 1.0 est la machine la plus capable sur tous les axes divulgués.
Ce qu’aucun des deux modèles ne fait, c’est supprimer le besoin de tester. Cohere vous a donné un nombre non nommé et un moyen gratuit de le vérifier. Tencent vous a donné un tableau et un téléchargement de la taille d’un GPU. Le 83,60 est une promesse, pas un résultat — et le seul endroit où cette promesse se règle, c’est sur votre propre corpus.
