Carte hero intitulée « North Small Translate 1.0 vs Hy-MT2-7B » avec le sous-titre « Un GPU contre deux B200s », au-dessus de deux cartes : North Small Translate 1.0 (218B MoE / 25B actifs, CC BY-NC 4.0) et Hy-MT2-7B (8B dense, environ 16 Go de VRAM, Apache 2.0).
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-7B : un GPU contre deux B200

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

La confrontation la plus serrée en traduction ouverte actuellement pourrait aussi être la moins évidente. Hy-MT2-7B est l'enfant du milieu de la famille de traduction de Tencent Hunyuan, publié en open source sous Apache 2.0 le 21 mai 2026, et il tourne sur une seule RTX 4090 ou A100 avec environ 16 Go de VRAM. North Small Translate 1.0 est le traducteur à mélange d'experts clairsemé de 218 milliards de paramètres de Cohere, documenté dans les notes de version de l'entreprise le 9 septembre 2026, avec un déploiement minimal de deux B200 en FP8 ou d'un B200 dans sa forme NVFP4 W4A16. Les deux sont des spécialistes de la traduction. Les deux sont actuels. L'un d'eux peut être servi depuis une station de travail, et ce seul fait recadre toute la comparaison — car le benchmark sur lequel ils aimeraient le plus être jugés à armes égales n'existe pas.

Commencez par l'enveloppe, pas les scores

Le coût de déploiement est la dimension qui décide de la plupart des intégrations réelles, et sur ce point, les deux modèles ne sont pas proches. Hy-MT2-7B est un modèle dense HunYuanDenseV1 d'environ huit milliards de paramètres, avec des versions FP8 et GGUF publiées, ainsi que des versions MLX 8 bits communautaires pour les puces Apple. Les notes de déploiement de Tencent indiquent transformers 5.6.0 ou une version ultérieure, vLLM, SGLang et llama.cpp comme environnements d'exécution pris en charge, et les recommandations d'inférence plafonnent la génération à 8 192 tokens, même si la configuration annonce jusqu'à 262 144 positions. Un seul GPU moderne grand public ou de station de travail suffit.

North Small Translate 1.0 relève d'une classe d'objet différente. Ses 218B de paramètres totaux, dont 25B actifs, sont répartis sur 128 experts avec huit actifs par jeton ainsi que des experts partagés, et Cohere publie le matériel minimum pour chacun de ses trois checkpoints : quatre B200 ou huit H100 pour le BF16, deux B200 ou quatre H100 pour le FP8, un B200 ou deux H100 pour la version NVFP4 W4A16. Le service d'inférence passe par vLLM avec cohere_melody>=0.9.0, et Cohere recommande le décodage glouton pour correspondre à la production. La sortie porte <|START_TEXT|> et <|END_TEXT|>, des marqueurs qui ne sont pas enregistrés comme jetons spéciaux.

Architecture — North Small Translate 1.0 : 218B au total / 25B actifs en MoE clairsemé, 128 experts vs Hy-MT2-7B : dense, environ 8B

Contexte — 16K en entrée et 16K en sortie par rapport à une fenêtre de travail de 8K, la configuration annonce jusqu’à 262 144 positions

Configuration matérielle minimale — 1×B200 en W4A16, 2×B200 ou 4×H100 en FP8 contre un seul GPU de classe RTX 4090 en ~16 Go

Formats publiés — BF16, FP8, NVFP4 W4A16 par rapport à la base, FP8, GGUF, plus MLX 8 bits de la communauté

Langues — 50 (anglais + 49) contre 33 langues plus 5 langues minoritaires et dialectes

Licence — CC BY-NC 4.0, commerciale via Model Vault vs Apache 2.0, sans restriction

Qualité déclarée — WMT26 83,60, métrique non nommée, déclarée par le fournisseur vs tableaux de fournisseurs nommés sur FLORES-200, WMT25 GEMBA, XCOMET-XXL et IFMTBench

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-7B across six rows: Parameters 218B MoE / 25B active vs 8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Minimum hardware 1x B200 at W4A16 vs 1x RTX 4090, 16GB; Evidence one unnamed WMT26 figure vs FLORES-200 93.52, GEMBA 82.24. Footer notes all benchmark figures are vendor-reported and neither model is independently reproduced.

Le problème de référence

Voici le cœur honnête de cette comparaison : nous ne pouvons pas classer ces deux modèles l'un par rapport à l'autre, et quiconque vous dit le contraire invente un chiffre. Tencent a publié quatre évaluations nommées. Sur la traduction anglais-vers-X de FLORES-200, le 7B affiche 93,52, derrière les 94,42 de Gemini 3.1 Pro et les 94,16 de GPT-5.5, mais suffisamment proche pour compter. Sur la métrique GEMBA proche de WMT25, il obtient 82,24 contre 84,34 pour le 30B-A3B et 83,41 pour GPT-5.5. Sur XCOMET-XXL, il devance tous les autres dans le tableau comparatif de Tencent avec 63,86 — devant Gemini 3.1 Pro, GPT-5.5, DeepSeek-V4-Pro et Kimi K2.6. Sur le score de suivi d'instructions d'IFMTBench, il atteint 83,14 %. Tous ces chiffres sont ceux de Tencent, aucun n'a été reproduit de façon indépendante, et ils représentent encore bien plus que ce que Cohere a proposé.

Cohere a publié un seul chiffre : un score WMT26 de 83,60, qui passe à 84,36 avec un flux de travail agentique à passes multiples. Aucune métrique n'est nommée sur la fiche du modèle ni dans la note de version, et aucune page de résultats WMT26 n'a été publiée pour ce modèle. Cette asymétrie ne prouve pas que le modèle de Cohere soit plus faible ou plus fort. Elle signifie que la comparaison que le lecteur souhaite le plus — même test, même métrique, les deux modèles — ne peut pas être établie à partir d'éléments publics, et l'écart de quatre points entre les deux chiffres de Cohere eux-mêmes (83,60 à 84,36) est déjà plus grand que la plupart des écarts du tableau de Tencent.

Langues et le long document

North Small Translate 1.0 couvre cinquante langues et variantes locales, avec l’arabe standard moderne, l’allemand, le français, le japonais, le coréen, le russe et l’ukrainien classés en première catégorie, et il accepte et émet 16 000 jetons des deux côtés. Hy-MT2-7B couvre trente-trois langues plus cinq langues minoritaires et dialectes, dont le tibétain, l’ouïghour et le cantonais. Aucune des deux listes n’est un sur-ensemble de l’autre — Tencent atteint le cantonais et l’ouïghour, Cohere atteint un ensemble plus large de locales européennes — de sorte qu’un déploiement multilingue peut constater qu’il a besoin des deux, ne serait-ce que pour des raisons de couverture.

La fenêtre de sortie est la différence la plus discrète. Seize mille jetons de sortie signifient un document de procédure complet en une seule passe, avec une terminologie et un registre cohérents sur l'ensemble, parce que le modèle a tout vu. Une fenêtre de 8 K ne le permet pas, et la solution de contournement phrase par phrase réintroduit exactement les problèmes de cohérence entre segments que des benchmarks de suivi d'instructions en traduction comme IFMTBench ont été conçus pour mesurer.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

La licence, encore une fois, décide plus que le tableau.

North Small Translate 1.0 est sous CC BY-NC 4.0. Les poids sont gratuits pour un usage non commercial, et le déploiement commercial passe par Model Vault de Cohere sous licence achetée, sans prix publié. Hy-MT2-7B est sous Apache 2.0 et sans restriction d'accès — usage commercial, fine-tuning et œuvres dérivées tous permis sans échange préalable. Pour un produit commercial, l'ordre des opérations s'impose de lui-même : Hy-MT2-7B est déployable aujourd'hui et le modèle de Cohere est évaluable aujourd'hui, et aucune ligne de benchmark ne change cet ordre.

L'avantage compensateur de Cohere, c'est son niveau gratuit. North Small Translate 1.0 fonctionne sur le niveau gratuit de Chat V2, gratuit aussi bien pour les clés d'essai que de production jusqu'à atteindre les limites de débit, si bien qu'une évaluation ne coûte rien d'autre que du temps. Hy-MT2-7B dispose d'une API commerciale hébergée — Tencent a fixé le tarif du niveau hébergé de la famille à environ 0,044 $ par million de jetons d'entrée et 0,177 $ par million de jetons de sortie — et l'auto-hébergement sur votre propre GPU est la voie réellement gratuite.

Ce que « multi-pass » implique réellement

La décision de Cohere de publier à la fois un 83,60 et un 84,36 est le détail le plus instructif de sa note de version, car elle indique que l’entreprise est convaincue qu’un flux de travail vaut mieux qu’un appel unique. C’est le même pari que Tencent a fait avec un mécanisme différent : son modèle phare 30B-A3B l’emporte sur GEMBA et XCOMET, tandis que Gemini 3.1 Pro l’emporte sur FLORES-200, ce qui signifie que le meilleur système n’est pas un modèle unique mais un panel. La fusion de modèles d’OrcaRouter exécute plusieurs modèles comme un panel et réconcilie leurs réponses au sein d’un seul appel, ce qui constitue la version au niveau de la plateforme de l’idée de passes multiples que les deux fournisseurs poursuivent — et elle se combine avec le volet routage, où une seule clé couvre un catalogue de plus de 200 modèles au prix catalogue du fournisseur avec 0 % de marge, de sorte qu’un changement de tarif d’un fournisseur se répercute de notre côté le jour même plutôt qu’au prochain renouvellement de contrat.

Cette façon de présenter les choses résout aussi le problème de preuves avec lequel cet article s'ouvre. Quand deux fournisseurs publient des benchmarks qui ne se recoupent pas et qu’aucun des deux ne dispose d’une évaluation indépendante, la façon de choisir n’est pas de se fier à un tableau. C’est de les exécuter tous les deux sur vos propres documents et de laisser le désaccord apparaître sur du texte réel — ce à quoi servent précisément un panel et une chaîne de basculement.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Lequel, et quand

Si vous avez besoin d’un modèle de traduction tournant sur du matériel que vous possédez déjà, dans un produit commercial, sans discussion sur les licences, Hy-MT2-7B l’emporte sur la seule base de son enveloppe — et ses résultats publiés par son fournisseur, aussi non reproduits soient-ils, sont au moins nommés, comparables et proches de la frontière. Si vous traduisez de longs documents dans les cinquante langues de Cohere, que vous avez besoin de 16K de sortie cohérente par passe et que vous disposez soit d’un budget de deux B200, soit de la volonté de lancer l’évaluation sur l’offre gratuite de Cohere avant de décider, North Small Translate 1.0 est la machine la plus capable sur tous les axes divulgués.

Ce qu’aucun des deux modèles ne fait, c’est supprimer le besoin de tester. Cohere vous a donné un nombre non nommé et un moyen gratuit de le vérifier. Tencent vous a donné un tableau et un téléchargement de la taille d’un GPU. Le 83,60 est une promesse, pas un résultat — et le seul endroit où cette promesse se règle, c’est sur votre propre corpus.