Carte héros intitulée « North Small Translate 1.0 vs Hy-MT2-1.8B » avec le sous-titre « 218GB de modèle contre 440MB », au-dessus de deux cartes : North Small Translate 1.0 (218B MoE, 2x B200 minimum) et Hy-MT2-1.8B (1.8B dense, 440MB, fonctionne sur un téléphone) avec une icône de contour de téléphone.
Guides & Insights

North Small Translate 1.0 vs Hy-MT2-1.8B : 218 Go de modèle contre 440 Mo

Auteur

Elias Hawthorne

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'un d'eux tient sur un téléphone. Hy-MT2-1.8B, le modèle de traduction embarqué de Tencent Hunyuan, open source sous Apache 2.0 le 21 mai 2026, se réduit à 440 mégaoctets grâce à la quantification 1,25 bit d'AngelSlim et tourne sur les puces mobiles d'Apple, Qualcomm et MediaTek. North Small Translate 1.0, le modèle à mélange d'experts de 218 milliards de paramètres que Cohere a documenté dans ses notes de version le 9 septembre 2026, livre un ensemble de poids FP8 de l'ordre de 218 gigaoctets et nécessite au minimum deux B200. Cela représente environ cinq cents fois le stockage nécessaire pour l'un d'eux, et la question intéressante n'est pas de savoir lequel est meilleur — mais à quoi sert réellement chacun d'eux, et quelle licence permet de le distribuer.

L’écart de taille n’est pas un écart de qualité.

Il est tentant de lire 218 B face à 1,8 B comme un classement direct des capacités. Ce n’est pas le cas, pour deux raisons. La première est que North Small Translate 1.0 est un modèle de mélange d’experts clairsemé avec seulement 25 milliards de paramètres actifs par token, de sorte que la puissance de calcul par token se situe dans une catégorie différente de celle du nombre de paramètres. La seconde est que les deux modèles ont été optimisés selon des objectifs différents : le modèle 1,8 B de Tencent a été conçu pour être suffisamment petit pour fonctionner hors ligne sur un téléphone portable, et le modèle de Cohere a été conçu pour contenir tout un document dans son contexte et le traduire comme un tout.

Cette différence est lisible dans les fenêtres de contexte. La configuration de Hy-MT2-1.8B annonce jusqu’à 262 144 positions, mais les recommandations d’inférence de Tencent plafonnent la génération à 8 192 tokens — la fenêtre de travail pratique est de 8 K. North Small Translate 1.0 documente 16 K en entrée et 16 K en sortie, ce qui représente le double de la fenêtre d’entrée et, plus important encore, 16 K complets de sortie. Si votre unité de travail est un manuel de service, ce budget de sortie est la fonctionnalité. Si votre unité de travail est un message de chat, il est sans importance.

Paramètres totaux — North Small Translate 1.0 : 218B MoE, 25B actifs vs Hy-MT2-1.8B : 1,8B dense

Contexte — 16K en entrée et 16K en sortie par rapport à une fenêtre de travail de 8K (la configuration annonce jusqu’à 262,144 positions ; les recommandations de Tencent indiquent 8,192)

Langues — 50 (anglais + 49) contre 33 langues plus 5 langues minoritaires et dialectes

Licence — CC BY-NC 4.0, commerciale via Model Vault vs Apache 2.0, sans restriction

Empreinte quantifiée — FP8 ~218 Go, NVFP4 W4A16 ~109 Go contre 440 Mo en 1,25 bit ; FP8 et GGUF également publiés

Matériel minimum — 2×B200 ou 4×H100 en FP8 contre un téléphone

Two-column scoreboard comparing North Small Translate 1.0 and Hy-MT2-1.8B across six rows: Parameters 218B MoE / 25B active vs 1.8B dense; Context 16K in / 16K out vs 8K working window; Languages 50 vs 33 + 5 dialects; License CC BY-NC 4.0 vs Apache 2.0; Footprint about 218GB at FP8 vs 440MB at 1.25-bit; Minimum hardware 2x B200 vs a handset. Footer notes Hy-MT2 figures are vendor-reported by Tencent and Cohere's WMT26 83.60 is unaudited with an unnamed metric.

Ce que Tencent a réellement livré dans le 1,8B

Le 1.8B est le plus petit membre d’une famille de trois modèles — 1.8B, 7B et un modèle phare MoE 30B-A3B — tous publiés en même temps qu’un benchmark compagnon appelé IFMTBench, qui mesure le suivi d’instructions de traduction plutôt que la qualité brute de traduction. Tencent a livré des quantifications FP8, GGUF, 2 bits et 1,25 bit aux côtés des poids de base, et c’est la version 1,25 bit qui produit le chiffre de 440 Mo et une accélération d’inférence annoncée de 1,5x par rapport à la génération précédente Hy-MT1.5. Le serving est pris en charge via transformers 5.6.0 et versions ultérieures, vLLM, SGLang et llama.cpp, le chemin GGUF dépendant d’un noyau STQ intégré à llama.cpp. L’échantillonnage recommandé est : température 0,7, top_p 0,6, top_k 20, pénalité de répétition 1,05, et il n’y a pas de prompt système par défaut — l’inverse de l’approche de Cohere.

C’est aussi, contrairement à North Small Translate 1.0, un modèle dont l’adoption est visible. Le dépôt Hugging Face a été téléchargé plus de 23 000 fois et compte environ 1 200 likes. Le dépôt principal de Cohere affichait 26 téléchargements et zéro like au moment de la rédaction.

La licence est la différence la plus nette

C’est l’élément qui devrait peser davantage dans les déploiements que le tableau de benchmarks. Hy-MT2-1.8B est sous Apache 2.0, sans contrôle d’accès — utilisation commerciale, fine-tuning, œuvres dérivées, redistribution, tout est autorisé. North Small Translate 1.0 est sous CC BY-NC 4.0 : les poids sont gratuits pour un usage non commercial, et le déploiement commercial nécessite l’achat d’une licence via Model Vault de Cohere, pour laquelle aucun prix n’est publié.

Pour le dire simplement : si vous construisez un produit, le modèle de Tencent est celui que vous pouvez livrer dès aujourd'hui sans discussion, et celui de Cohere est celui que vous ne pouvez qu'évaluer. Cette asymétrie ne rend pas le modèle de Cohere moins bon, mais elle change l'ordre des opérations — vous évaluez celui de Cohere, et vous pouvez déployer celui de Tencent.

Les preuves de qualité sont asymétriques, et les deux parties sont déclarées par les fournisseurs.

Aucun des deux modèles ne dispose d’une évaluation indépendante à l’appui, alors considérez chaque chiffre ici comme une affirmation de son fabricant. La différence tient à ce que les fabricants ont mis sur la table. Tencent a publié un tableau comparatif complet et un rapport technique : sur FLORES-200, pour la traduction de l’anglais vers X, Hy-MT2-1.8B obtient 90,00 contre 94,42 pour Gemini 3.1 Pro et 94,16 pour GPT-5.5 — modestement en retrait par rapport aux modèles de pointe, mais à quelques points seulement, de la part d’un modèle qui tient sur un téléphone. Pour le score global de suivi des instructions d’IFMTBench, le 1.8B atteint 69,36 %, loin derrière son propre frère 30B-A3B à 85,7 % et Gemini 3.1 Pro à 89,08 %, ce qui constitue l’interprétation honnête du compromis : le minuscule modèle respecte les consignes de formatage et de terminologie avec bien moins de fiabilité qu’il ne traduit.

Cohere a publié un seul chiffre — un score WMT26 de 83,60, qui passe à 84,36 avec un workflow agentique à passages multiples — sans nom de métrique associé et sans page de résultats WMT26 pour le vérifier. Ce n'est pas une comparaison que nous pouvons faire. Un seul nombre non nommé ne peut pas être confronté à un tableau de benchmarks nommés, et prétendre le contraire serait la chose la plus trompeuse que cet article pourrait faire.

Screenshot of Cohere's documentation page for North Small Translate showing the Capabilities panel (Multilingual), the Pricing panel stating the model is free for trial and production keys until rate limits are reached with commercial use via Model Vault, the Specifications panel listing Context Window 16K tokens, Max Output Tokens 16K tokens, Model Size 218B total / 25B active and Suggested Hardware 2 x H100 or 1 x B200, and the API Endpoints panel giving Model ID north-small-translate-1-0 on Chat V2.

Le contrepoids de Tencent est que ses chiffres proviennent d'un endroit qu'un lecteur peut inspecter. Le dépôt Hy-MT2 publie l'aperçu de la famille, les trois tailles de modèle et les runtimes que chacun prend en charge, aux côtés du tableau de benchmark — ce qui rend les chiffres FLORES-200 et IFMTBench vérifiables tout court, et ce qui rend le seul nombre non nommé de Cohere frappant par contraste.

Screenshot of the Tencent-Hunyuan Hy-MT2 GitHub repository showing the English README model introduction with the Tencent Hy logo, the family of three sizes (1.8B, 7B and 30B-A3B MoE) supporting translation among 33 languages, the AngelSlim 1.25-bit quantization reducing the 1.8B model to 440 MB with 1.5x faster inference, the IFMTBench benchmark open-sourced with the release, and the claim that the 7B and 30B-A3B outperform DeepSeek-V4-Pro and Kimi K2.6 in fast-thinking mode.

Combien coûte chacun à appeler

Le modèle 1,8B de Tencent dispose d'une API commerciale hébergée, lancée en août 2026, facturée environ 0,044 $ par million de tokens d'entrée et 0,177 $ par million de tokens de sortie — bon marché en valeur absolue, et facturée au token. Le modèle de Cohere fonctionne sur le palier gratuit de Chat V2, gratuit pour les clés d'essai et de production jusqu'à ce que les limites de débit soient atteintes, donc le coût d'évaluation est nul, mais le coût de production est un contrat à négocier. L'auto-hébergement renverse entièrement l'arithmétique : 440 Mo sur un téléphone portable contre deux B200, une différence qui se mesure en ordres de grandeur plutôt qu'en pourcentages.

La raison pour laquelle cet écart mérite d’être mentionné dans un article consacré à une plateforme de routage, c’est que le palier bon marché et le palier coûteux ne sont pas concurrents — ce sont deux positions dans une cascade, et les cascades sont précisément à quoi sert un routeur. OrcaRouter répercute le prix catalogue du fournisseur avec une marge de 0 %, de sorte qu’une baisse de prix d’un fournisseur sur un point de terminaison de traduction hébergé est effective de notre côté le jour même, sans marge de revendeur à renégocier, et les chaînes de basculement permettent à un modèle plus petit d’absorber l’essentiel du trafic tandis qu’un modèle plus puissant prend en charge les requêtes qu’il ne parvient pas à traiter. Essayez d’abord le moins cher, montez en gamme sur les cas difficiles, et laissez la couche de routage porter la politique plutôt que votre code applicatif.

Lequel vous devriez choisir

Si votre traduction s’effectue sur un appareil, hors ligne, dans le cadre d’un budget de stockage par mégaoctet, ou au sein d’un produit commercial peu enclin à négocier une licence, Hy-MT2-1.8B est la solution et North Small Translate 1.0 n’entre pas en ligne de compte. Si votre unité de travail est un long document dans l’une des cinquante langues prises en charge par Cohere, si vous avez besoin de 16 K de sortie en une seule passe, et si une licence commerciale est quelque chose que votre organisation est prête à acheter, alors le modèle de Cohere est la machine la plus performante sur chaque dimension divulguée — avec cette réserve que sa qualité repose sur un seul chiffre non reproduit.

Et pour la plupart des équipes, la réponse honnête est : les deux, dans cet ordre : le modèle 440 Mo effectue le travail de routine à un coût dérisoire, le modèle 218B traite les documents qui comptent, et la décision de savoir quelle requête va où relève d'une règle de routage plutôt que d'une réécriture. L'écart entre ces deux modèles n'est pas un écart à combler. C'est un spectre à utiliser.