
Tencent Hy-MT2-7B dispose désormais d'une API hébergée : ce que change un traducteur à 0,295 $ par million de sorties
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Tencent Hy-MT2-7B, le modèle de traduction open source Tencent Hunyuan sorti le 21 mai 2026, est devenu accessible cette semaine via une API hébergée : vers le 19 août 2026, le modèle dense de 7B a été mis en service sur l'endpoint hébergé de Tencent Cloud à 0,074 $ par million de tokens d'entrée et 0,295 $ par million de tokens de sortie, avec une fenêtre de contexte de 8 192 tokens. Il n'est pas arrivé seul : Tencent Hy-MT2-1.8B et Tencent Hy-MT2-30B-A3B ont été mis en ligne sur le même backend en l'espace d'une journée. Les poids sont sur Hugging Face et ModelScope depuis trois mois ; ce qui est nouveau, c'est qu'une équipe peut désormais appeler le modèle sans louer de GPU, compiler llama.cpp depuis les sources, ni déployer la chaîne d'outils embarquée en 1,25 bit. Pour une charge de travail de traduction, c'est la différence entre une expérimentation et une décision produit.
Ce qui vient d'être publié
Le endpoint commercial est propre à Tencent Cloud, exposé via l'API du fournisseur et plusieurs plateformes tierces. Les trois tailles fonctionnent chacune dans un contexte de 8K avec des complétions de 4 096 jetons ; toutes les trois acceptent une sortie structurée via un schéma JSON dans leur champ response_format, et aucune d'entre elles n'implémente l'appel de fonction. La spécification pratique, en une ligne par dimension :
• Tencent Hy-MT2-7B — $0,074 en entrée / $0,295 en sortie par 1M de tokens, contexte de 8 192, dense ~7B, sortie structurée prise en charge, pas d'appels d'outils.
• Tencent Hy-MT2-1.8B — 0,044 $ en entrée / 0,177 $ en sortie pour 1M de tokens, contexte de 8 192, 1,8B dense, sans appels d'outils.
• Tencent Hy-MT2-30B-A3B — 0,074 $ en entrée / 0,295 $ en sortie pour 1M de jetons, contexte de 8 192, MoE 30B total / 3B actifs, sortie structurée prise en charge, pas d'appels d'outils.
Le prix phare est le tarif de sortie du modèle 7B : moins de trois dixièmes de centime par millier de jetons de sortie, pour un modèle que Tencent affirme soutenir la comparaison avec des modèles dix fois plus grands. La traduction est l'un des rares cas d'utilisation de LLM où les jetons de sortie représentent presque la totalité de la facture, si bien que le prix de sortie est le chiffre qui détermine si un pipeline est viable à grande échelle.

Le modèle derrière le point de terminaison
Hy-MT2 est la famille « à réflexion rapide » de Tencent : plutôt que de consacrer de longues chaînes de pensée à chaque phrase, elle est conçue pour réagir comme le ferait un traducteur professionnel — en réfléchissant là où la source est ambiguë, et en allant vite là où elle ne l'est pas. Le 7B est le milieu équilibré de la famille, un modèle dense sous licence Apache-2.0, couvrant 33 langues plus cinq paires de dialectes et langues minoritaires chinoises (dont le tibétain, le kazakh, le mongol, l'ouïghour et le cantonais). Ce qui le distingue d'un LLM générique faisant de la traduction, c'est le suivi d'instructions : il conserve un terme de glossaire sur tout un document, applique un style spécifié, laisse les délimiteurs et les clés JSON intacts, et accepte des instructions de personnalisation en langage clair. Tencent a publié IFMTBench, un benchmark ouvert pour exactement cette compétence, en même temps que les poids, et la face grand public — la mini-application Tencent Hy Translate, avec des applications iOS et Android en préparation — repose sur cette famille.

Les nombres, avec l'astérisque attaché.
Tout ce qui suit est l'évaluation propre de Tencent, publiée sur la fiche du modèle et dans le rapport qui l'accompagne ; rien de tout cela n'a été reproduit de manière indépendante au moment où nous écrivons ces lignes. Sur le volet de traduction générale XX⇔XX de FLORES-200, le modèle 7B obtient 86.89 XCOMET-XXL, ce que Tencent estime à environ 97.9 % de Gemini 3.1 Pro (Think). Dans son mode « fast-thinking », il surpasserait les modèles généraux open source, notamment DeepSeek-V4-Pro, Kimi K2.6, Qwen3.5-397B-A17B et Gemma4-26B-A4B. Sur WMT25, ses scores s'améliorent sur toute la ligne par rapport à la génération précédente — 63.86/71.21/82.24 contre 61.59/68.85/75.91 pour Hy-MT1.5-7B, avec le plus grand gain sur GEMBA — et sur DomainMTBench (finance, politique, éducation), il affiche 94.92 XCOMET / 92.79 GEMBA. C'est dans le suivi d'instructions qu'il se démarque le plus visiblement des modèles de langage de traduction d'il y a un an : 89.73 simple / 72.67 complexe / 83.14 total sur IFMTBench.
Ce qu'une API hébergée change pour un pipeline de traduction
L'auto-hébergement du 7B est vraiment facile pour ce genre de choses — il tourne sur un seul A100 ou RTX 4090, et des versions quantifiées FP8 et GGUF existent. Mais « facile à auto-héberger » ne signifie pas « zéro opérations ». Le chemin GGUF dépend actuellement de llama.cpp avec le noyau STQ de Tencent, le chemin FP8 nécessite la pile logicielle appropriée, et quelqu'un doit le surveiller de près. Un point de terminaison hébergé élimine tout cela : pas de GPU, pas de compilation de noyau, pas de planification de capacité, et un prix par jeton qui est fixe quelle que soit l'utilisation. Pour une équipe qui traite des millions de phrases traduites par jour, cette prévisibilité compte plus que le benchmark principal — et c'est la raison pour laquelle cette semaine compte plus que le lancement de mai.

La question de routage que personne ne pose encore
Étant donné que le modèle n'a que trois jours côté API, la façon réaliste de l'adopter est la même que pour tout nouveau fournisseur : le placer derrière une règle de routage avec basculement automatique, afin qu'un endpoint non testé ne puisse jamais faire tomber un chemin de production, et laisser le volume décider s'il mérite une place permanente. C'est précisément le schéma que le DSL de routage d'OrcaRouter compose parmi les 200+ modèles que nous proposons — et il vaut la peine d'être précis ici : Tencent Hy-MT2-7B n'est pas au catalogue d'OrcaRouter au moment où j'écris ces lignes, ce n'est donc pas une histoire de « appelez-le via nous ». Ce qui est pertinent, c'est le modèle de tarification. OrcaRouter répercute le prix catalogue de chaque fournisseur avec une marge de 0 %, de sorte que lorsqu'un fournisseur baisse son tarif, la baisse est effective sur la plateforme le jour même. Pour une charge de travail de traduction à volume élevé, la question à poser à tout endpoint n'est pas « quel est le prix affiché sur le portail aujourd'hui » mais « quel est le prix catalogue réel par jeton que le fournisseur facture, et y a-t-il quelque chose entre lui et moi ». À 0,295 $/M en sortie, Tencent Hy-MT2-7B vient de rendre cette question intéressante.
Que regarder ensuite
Trois choses découlent de cette semaine. Premièrement, les modèles frères 1.8B et 30B-A3B sont désormais également appelables via API, de sorte que la décision « quelle taille » est une vraie question d'API plutôt qu'une décision d'auto-hébergement (la famille dispose de ses propres pages de comparaison, mais la version courte est : 1.8B pour l'embarqué et le niveau le moins cher, 30B-A3B pour les domaines professionnels, 7B entre les deux). Deuxièmement, le partenariat de Tencent avec WMT26 offre des récompenses aux équipes utilisant les modèles Hy-MT dans les tâches de traduction automatique générale et de traduction de sous-titres vidéo — un signal que Tencent entend faire de cette famille la référence ouverte en traduction automatique compétitive. Troisièmement, les applications iOS et Android avec inférence sur l'appareil, si elles sortent comme annoncé, feront du 1.8B le modèle de traduction ouvert le plus installé au monde. L'API hébergée est la partie qui a changé cette semaine ; la trajectoire de la famille a été fixée en mai.
