
Tencent HY-MT2 1.8B obtient une API hébergée : le traducteur de 440 Mo de Tencent passe au cloud.
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 426 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 183 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1312 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 115 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Tencent HY-MT2 1.8B, le membre compact de la famille de modèles de traduction Hy-MT2 que Tencent Hunyuan a publié en open source le 21 mai 2026, est désormais accessible via une API commerciale hébergée, et non plus seulement en auto-hébergement — la fiche API du modèle a été mise en ligne le 20 août 2026, à environ 0,044 $ par million de jetons en entrée et 0,177 $ par million de jetons en sortie. Cette date de mise en ligne compte plus que d'habitude, car le 1.8B n'a jamais été un simple checkpoint ouvert : c'est le modèle que Tencent a construit pour prouver qu'un modèle de traduction quantifié de 440 Mo peut fonctionner entièrement sur un téléphone, et, depuis les trois mois qui ont suivi la publication en open source, il est également intégré au mini-programme HyTranslate de Tencent ainsi qu'aux applications iOS et Android qui ont suivi. Cet article explique ce que change le lancement de l'API hébergée, ce qu'est réellement ce modèle et à quels chiffres vous devriez vous fier.
Qu'est-ce qui a réellement changé le 20 août
Jusqu'à présent, utiliser Tencent HY-MT2 1.8B revenait à l'une des deux choses suivantes : charger vous-même les poids Apache-2.0 dans transformers, vLLM, SGLang ou llama.cpp, ou utiliser les produits de traduction grand public de Tencent. L'API hébergée constitue une troisième voie : vous envoyez du texte par HTTP, et Tencent Cloud sert le point de terminaison 1.8B. Le modèle conserve son contexte de 8 192 jetons et une sortie maximale de 4 096 jetons, ne traite que le texte, et est facturé environ 0,044 $ par million de jetons en entrée et 0,177 $ par million de jetons en sortie. Pour les équipes dont le volume de traduction connaît des pics, cela supprime le plancher « devoir faire tourner un GPU » pour essayer le modèle.

L'autre moitié de l'histoire, ce sont les applications. La mini-programme HyTranslate, lancée en même temps que la sortie open source en mai, propose la saisie vocale, des styles prédéfinis et un mode hors ligne. Les applications iOS et Android — qui téléchargent le modèle embarqué pour une traduction sans connexion — ont depuis été déployées. Le modèle 1.8B est le pilier de cette expérience hors ligne : grâce à la quantification extrême à 1,25 bit d'AngelSlim, il se réduit à environ 440 Mo de stockage et fonctionne localement sur les puces Apple, Qualcomm et MediaTek, avec des performances d'inférence 1,5x plus rapides que la version 4 bits de la génération précédente sur un Apple A15, selon Tencent.
C'est quoi, ce 1.8B ?
HY-MT2-1.8B est un modèle de langage causal (LM) dense, exclusivement décodeur, construit sur l'architecture hunyuan_v1_dense — environ 2 milliards de paramètres en pratique malgré le nom 1.8B — avec un modèle de chat et sans invite système par défaut. Il traduit entre 33 langues, plus cinq paires de langues minoritaires et de dialectes, dont le chinois, l'anglais, le japonais, le coréen, le français, l'espagnol, le russe, l'arabe, le thaï, le vietnamien, l'indonésien, l'hindi, le bengali, le tamoul, ainsi que les paires dialectales tibétain, ouïghour, kazakh, mongol et cantonais. Contrairement aux modèles de traduction classiques de type encodeur-décodeur, il est ajusté par instructions : on l'invoque avec la langue cible et des instructions facultatives, et il peut préserver la structure JSON et HTML, honorer un glossaire, s'adapter à un registre et utiliser le contexte environnant pour lever les ambiguïtés. Cette classe de capacités est ce que partagent les modèles frères 7B et 30B-A3B, et ce pour quoi le benchmark IFMTBench de Tencent a été publié en parallèle afin de l'évaluer.
Où en sont les benchmarks
Les affirmations concernant la qualité méritent d'être lues attentivement, car presque toutes émanent de Tencent elle-même et n'ont pas été reproduites par un laboratoire indépendant à ce jour. Tencent indique que HY-MT2-1.8B atteint 89,9 % du score moyen FLORES-200 de Ge{{1}}{{/1}}mini 3.1 Pro (la version 7B à 97,9 %, la version 30B-A3B à 98,6 %), 96,7 % de Ge{{2}}{{/2}}mini sur son ensemble de test de type GEMBA reposant sur des cas réels, et 96,2 % sur DomainMTBench dans huit domaines professionnels. Certains articles de presse ont arrondi le chiffre FLORES-200 à 88,1 % ; le README du fournisseur indique 89,9 %. Tencent affirme également que le modèle 1.8B surpasse globalement les API de traduction commerciales courantes de fournisseurs tels que Microsoft et Doubao. Il n'existe pas encore de reproductions indépendantes ; il faut donc considérer tout cela comme des indications directionnelles rapportées par le fournisseur, et non comme des faits vérifiés. Ce qui ne dépend pas du fournisseur : l'ensemble de 33+5 langues est fixe, la licence Apache-2.0 est réelle, et un checkpoint quantifié de 440 Mo qui tourne sur un téléphone est observable de manière indépendante.

Comment l'utiliser, et ce que ça coûte
• Auto-hébergé — poids Apache-2.0 de Hugging Face ou ModelScope ; exécution avec transformers (>=5.6.0), vLLM, SGLang, ou compilations GGUF de llama.cpp. Le coût se limite à votre facture GPU ; la version 1.25-bit fonctionne sur des appareils de classe CPU.

• API hébergée — Tencent Cloud propose le modèle 1.8B à environ 0,044 $ par million de jetons d’entrée et 0,177 $ par million de jetons de sortie au moment de la rédaction ; l’API propre du fournisseur et plusieurs plateformes tierces le proposent également.
• Consommateur — HyTranslate mini-programme et applications iOS/Android, y compris la traduction hors ligne via le modèle téléchargé sur l'appareil.
Échantillonnage recommandé pour le 1.8B : température 0.7, top-p 0.6, top-k 20, pénalité de répétition 1.05, max tokens 4096.
Si vous construisez un pipeline de traduction plutôt que de livrer une application grand public, ce qui est intéressant avec un modèle comme celui-ci, c'est que son prix est une cible mouvante — Tencent a déjà réduit le tarif de son API Hy-MT2-Pro en juin. C'est exactement le scénario pour lequel un routeur à marge de 0 % existe : parce que la refacturation se fait au tarif catalogue du fournisseur, une baisse de prix du fournisseur apparaît sur la facture du jour même, plutôt qu'après que votre passerelle a renégocié les prix. Le modèle lui-même ne figure pas au catalogue d'OrcaRouter au moment où nous écrivons ces lignes, vous devrez donc héberger vous-même les poids ou appeler directement l'API de Tencent Cloud ; l'argument du basculement et de la clé unique s'applique à la pile de traduction plus large que vous construiriez autour, où mélanger un petit modèle embarqué pour les gros volumes à bas coût et un modèle plus grand pour les paires difficiles est le genre de composition que le routage a été conçu pour exprimer.
En résumé
Tencent HY-MT2 1.8B était déjà intéressant en mai comme traducteur Apache-2.0 tenant dans un téléphone ; son inscription du 20 août sur l'API hébergée en fait un candidat pour les équipes qui veulent l'évaluer sans déployer d'infrastructure. Les chiffres de qualité sont fournis par le fournisseur, l'ensemble de langues est délibérément grand public plutôt que maximal, et l'empreinte sur l'appareil est ce qui le distingue véritablement. Si vos paires de langues figurent parmi ses 33, il est désormais plus économique que jamais de vérifier si ces affirmations tiennent pour votre contenu.
