
Tencent Hy-MT2-7B vs Tencent Hy-MT2-1.8B : Le choix qualité côté serveur ou un traducteur de 440 Mo sur chaque téléphone
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Tencent Hy-MT2-7B et Tencent Hy-MT2-1.8B sont les deux extrémités de la même famille, publiés en open source ensemble le 21 mai 2026, et tous deux sont devenus accessibles via des API hébergées cette semaine — le 7B vers le 19 août et le 1.8B un jour plus tard, chacun servi par Tencent Cloud. Ils ne sont pas concurrents au sens habituel, car leurs usages se chevauchent à peine. Le 7B est le choix qualité : un modèle dense qui fonctionne sur un seul GPU ou via une API à 0,074 $ par million de jetons d'entrée et 0,295 $ par million de jetons de sortie. Le 1.8B est le choix pour l'appareil : un modèle quantifié à 440 mégaoctets qui fonctionne sur un téléphone, entièrement hors ligne, à 0,044 $ / 0,177 $ par million sur le plan API. Si vous devez choisir entre eux, la réponse est surtout déterminée par l'endroit où la traduction doit avoir lieu — et seulement dans un second temps par les benchmarks, qui sont bien plus proches que ne le laisse supposer l'écart de paramètres quadruple.
La réponse en une ligne
Choisissez le 7B lorsque la traduction se fait dans un centre de données et que vous voulez la meilleure qualité par dollar de serveur — sur une API ou sur un seul GPU de classe A100. Choisissez le 1.8B lorsque la traduction doit se faire sur un appareil, hors ligne, ou au coût le plus bas possible par jeton. Si les deux se trouvent dans le même cloud et que le budget n'est pas le facteur décisif, le 7B l'emporte en qualité. Si le contenu est confidentiel, réglementé ou doit fonctionner sans réseau, le 1.8B est le seul des deux qui le peut.
Spécifications, côte à côte
• Paramètres — 7B dense vs 1,8B dense.
• Empreinte quantifiée — FP8 et GGUF jusqu'à quelques Go contre 440 Mo via la quantification AngelSlim à 1,25 bit.
• FLORES-200 (XX⇔XX) — 86.89 contre 79.77 XCOMET-XXL, soit environ 97.9 % contre 89.9 % de Gemini 3.1 Pro (Think), selon le fournisseur.
• WMT25 — 7B : 63.86/71.21/82.24 ; la 1.8B bat les API commerciales de Microsoft et Doubao sur les trois métriques.
• DomainMTBench (GEMBA) — 92.79 contre 91.08, rapporté par le fournisseur.
• Prix de l'API — $0.074 / $0.295 contre $0.044 / $0.177 par 1M de jetons (entrée/sortie).
• Contexte — les deux à 8 192 tokens.
• Déploiement — un A100 / RTX 4090 ou API cloud vs puces embarquées d'Apple, Qualcomm et MediaTek, hors ligne.

L'écart de qualité est réel mais plus étroit que l'écart de taille.
Tout ce qui suit est une évaluation de Tencent elle-même, non reproduite. Sur FLORES-200, le 7B devance le 1.8B de huit points XCOMET (86,89 contre 79,77), écart sur lequel repose le positionnement « équilibré » par rapport à « sur appareil ». Mais sur DomainMTBench — le benchmark de traduction sectorielle couvrant la finance, la politique et l'éducation — le 1.8B se situe à 1,7 point GEMBA du 7B (91,08 contre 92,79). Et la position du 1.8B face au reste du monde est le détail qui ne cesse de surprendre : Tencent indique qu'il bat les API de traduction commerciales de Microsoft et de Doubao sur l'ensemble des trois métriques WMT25, et qu'il surpasse Tower-Plus-72B, un modèle quarante fois plus grand. Ainsi, sur les textes sectoriels ordinaires, le petit modèle est bien plus proche de son grand frère que ne le laisseraient supposer quatre paramètres. Le véritable avantage du 7B apparaît sur la queue de la traduction générale et sur les instructions difficiles, où son avance sur FLORES et ses scores plus élevés aux tâches complexes d'IFMTBench creusent un net écart entre les deux.
Le fork de déploiement
Le 7B nécessite une infrastructure — soit une API cloud, soit un GPU de classe A100, avec les opérations habituelles associées. Le 1.8B, à 440 Mo avec la quantification 1,25 bits d'AngelSlim, fonctionne sur les mêmes puces qu'une application téléphonique typique, est 1,5 fois plus rapide que la génération précédente Hy-MT1.5, et n'a pas besoin de réseau du tout. Cela transforme la confidentialité d'une fonctionnalité en un paramètre par défaut : pour les contrats, les dossiers médicaux ou tout ce qui est réglementé, les données ne quittent jamais l'appareil, une propriété qu'aucun prix par jeton ne peut acheter côté serveur. Le compromis est visible sur la traduction générale de type FLORES, où la capacité supplémentaire du 7B se manifeste — et sur toute instruction suffisamment complexe pour pousser le total IFMTBench de 83,14 du 1.8B contre le plafond plus élevé du 7B.

Le calcul des coûts
Du côté de l'API, les deux modèles sont bon marché ; le 1.8B est moins cher. À 0,044 $ / 0,177 $ contre 0,074 $ / 0,295 $ par million, le petit modèle se situe environ 40 % en dessous du 7B sur les deux postes de facturation — avec un flux régulier d'un million de tokens de sortie par jour, cela représente environ 70 $ par jour contre 118 $. Sur l'appareil, le 1.8B coûte zéro par token, un chiffre qui domine toute comparaison avec des serveurs à volume élevé. Le contre-argument du 7B n'est pas le prix mais la marge de manœuvre : si votre corpus est plutôt technique, juridique ou riche en instructions, la marge de qualité du 7B est précisément le genre d'atout qui se traduit par moins de retraductions — et les retraductions sont le véritable coût unitaire en MT professionnelle.

Router les deux tailles
Aucun des deux modèles ne figure au catalogue d'OrcaRouter à l'heure actuelle, donc pour être honnête, les deux sont servis via le cloud de Tencent et plusieurs plateformes tierces. Ce duel enseigne néanmoins la leçon de routage qui est au cœur de ce blog : quand deux modèles se chevauchent en capacités mais diffèrent en prix et en latence, le déploiement rationnel n'est pas de « n'en choisir qu'un » mais de « router selon la charge de travail » — la tranche à fort volume et faible difficulté vers le petit modèle bon marché, la tranche difficile vers le modèle de qualité, avec bascule automatique pour qu'une panne de l'un ou de l'autre ne bloque jamais le pipeline. C'est exactement le schéma que le DSL de routage d'OrcaRouter compose à travers les plus de 200 modèles que nous proposons, avec le prix catalogue de chaque fournisseur répercuté à 0 % de marge. Si la famille de traduction de Tencent rejoint le catalogue, elle en sera la prochaine locataire naturelle.
Le verdict
Si la traduction se fait dans votre centre de données, prenez Tencent Hy-MT2-7B — via l'API si vous voulez zéro opération, sur un seul GPU si vous voulez le posséder — et arrêtez de lire. Si la traduction doit se faire sur un appareil, hors ligne, ou sous une exigence de confidentialité, prenez Tencent Hy-MT2-1.8B et l'empreinte de 440 Mo l'emporte par définition. Le seul cas réellement difficile est une charge de travail cloud de volume moyen, où la qualité du 7B et le prix du 1.8B sont tous deux défendables. Là, ne décidez pas sur la base des benchmarks des fournisseurs : l'écart GEMBA rapporté est de moins de deux points, alors exécutez les deux sur votre propre texte de domaine et laissez vos données choisir.
