
Tencent Hy-MT2-7B vs Tencent Hy-MT2-30B-A3B : le point idéal dense ou le vaisseau amiral MoE au même prix
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
Voici la surprise au cœur de cette confrontation : Tencent Hy-MT2-7B, un modèle dense de 7B, et Tencent Hy-MT2-30B-A3B, le fleuron à mixture d'experts avec 30 milliards de paramètres au total et environ 3 milliards d'actifs, sont tous deux devenus appelables via des API hébergées cette semaine — le 7B vers le 19 août 2026, le 30B-A3B le lendemain, tous deux servis par Tencent Cloud — au même prix exact : 0,074 $ par million de jetons d'entrée et 0,295 $ par million de jetons de sortie. La famille a été open-sourcée ensemble le 21 mai 2026, donc aucun des deux modèles n'est nouveau ; c'est le prix d'API identique qui rend cette comparaison vraiment étrange. Habituellement, le modèle plus gros coûte plus cher et on pèse la prime par rapport au gain. Ici, le fleuron ne coûte rien de plus par jeton, et la décision se résume à une seule question : à quoi, le cas échéant, le 7B renonce-t-il en étant dense et petit ?
La surprise du même prix
La parité de prix du 30B-A3B, c'est l'offre MoE qui fait son travail. Son architecture contient 30B de connaissances stockées mais n'active qu'environ 3B par jeton, ce qui permet à Tencent Cloud de le servir au même tarif par jeton que le 7B — mêmes 0,074 $ / 0,295 $, même contexte de 8 192 jetons, même prise en charge des sorties structurées, même limitation d'absence d'appel de fonction. Sur l'API, le modèle « professionnel » n'est pas plus cher. La contrepartie se déplace ailleurs : vers l'empreinte mémoire, la complexité de service et la latence, où la conception plus dense et plus simple du 7B offre des avantages structurels qu'un prix par jeton ne peut pas exprimer.
Spécifications, côte à côte
• Architecture — dense ~7B vs MoE 30B total / ~3B actifs.
• Prix API — 0,074 $ / 0,295 $ contre 0,074 $ / 0,295 $ par million de jetons (identique).
• Contexte — les deux à 8 192 tokens.
• Positionnement — point idéal équilibré vs flagship de qualité professionnelle.
• FLORES-200 — 7B : 86,89 XCOMET-XXL, ≈97,9 % de Gemini 3.1 Pro (Think) ; 30B-A3B : le meilleur score de traduction générale de la famille (chiffres communiqués par le fournisseur).
• DeepSeek / Kimi comparaison — les deux surpassent DeepSeek-V4-Pro et Kimi K2.6 en mode de réflexion rapide, selon le fournisseur.
• Empreinte — une seule A100 / RTX 4090 contre des poids à l’échelle 30B (une version quantifiée de classe 18 Go sur disque et plus en VRAM).
• Paramètres d’inférence par défaut — temp 0.7, top_p 0.6, top_k 20 vs temp 0.7, top_p 1.0, top_k -1.

Là où le 30B-A3B gagne réellement.
Tencent positionne le 30B-A3B comme le membre professionnel de la famille, et les preuves qu'il publie confirment cette étiquette pour un type de texte spécifique. Sur les matériaux à forte dominante de domaine — clauses juridiques, textes médicaux, documentation technique — sa ligne GEMBA sur DomainMTBench est la plus forte de la famille, rapportée à environ 99 % de la référence Gemini 2.5 Pro, et son score de traduction générale dépasse celui du 7B sur la courbe FLORES de la famille. Ces 27B de connaissances supplémentaires dormantes sont exactement le type de capacité qui se manifeste lorsqu'une phrase contient une terminologie dense plutôt qu'une prose ordinaire : une clause contractuelle « indemnification shall survive termination » ne pèse pas lourd sur un modèle 7B, mais un document M&A complet avec un glossaire, si. Le 30B-A3B est également le choix le plus sûr pour les paires chinois-vers-langues-minoritaires (tibétain, ouïghour, mongol), où Tencent rapporte ses meilleurs chiffres.
Là où le 7B gagne de toute façon.
Les avantages du 7B sont opérationnels, et ils sont bien réels. Premièrement, l'auto-hébergement : le 7B tient sur un seul A100 ou RTX 4090 et a la plus large couverture de frameworks — Transformers, vLLM, SGLang et llama.cpp via GGUF sont tous éprouvés. Le 30B-A3B, même quantifié, exige une VRAM à l'échelle d'un centre de données, et rares sont ceux qui l'ont fait passer par des piles de service en production. Deuxièmement, la latence et la simplicité de service : un 7B dense est plus facile à garder chaud, et son échantillonnage recommandé est plus proche d'un décodage standard. Troisièmement, sur l'API, le prix identique signifie que le 7B coûte exactement le même prix par token que le modèle phare — donc la seule raison de choisir le modèle plus petit est que, pour du texte général propre, l'écart de qualité est trop mince pour être remarqué. Le 7B atteint déjà environ 97,9 % de Gemini 3.1 Pro (Think) sur FLORES-200 ; les points supplémentaires du modèle phare s'ajoutent en haut d'une courbe où chacun est plus difficile à percevoir en pratique.
L'écart, honnêtement mesuré
Tout ce qui figure dans les deux dernières sections provient de l'évaluation propre de Tencent, et la lecture honnête est que les deux modèles sont suffisamment proches en traduction ordinaire pour que ce soit votre corpus qui tranche. Sur du texte général propre, le score de la 7B (environ 97,9 % de celui de Gemini) signifie que la marge du modèle phare se mesure en petites fractions XCOMET — réelle dans un classement, difficile à ressentir dans un ticket d'assistance. Sur les textes spécialisés denses et les paires de langues minoritaires, les avances GEMBA et FLORES rapportées pour le modèle phare se situent exactement là où un traducteur professionnel (humain ou modèle) gagne sa vie, et où une retraduction coûte le plus cher. Il n'existe à ce jour aucun benchmark indépendant pour l'un ou l'autre modèle ; le seul point sur lequel les deux fiches du fournisseur s'accordent est que chaque taille bat DeepSeek-V4-Pro et Kimi K2.6 en mode de raisonnement rapide de la famille.

Acheminer la famille
À ce jour, aucun des deux modèles n'est au catalogue d'OrcaRouter : ils sont donc tous deux servis via le cloud de Tencent et plusieurs plateformes tierces. La leçon de routage reste la leçon pratique. Comme les prix des API sont identiques, c'est un cas d'école pour le routage de charge de travail plutôt que pour un choix unique : envoyer la partie de traduction générale à fort volume vers le 7B et la partie dense, fortement spécialisée, vers le 30B-A3B, avec bascule automatique afin qu'un pic de latence sur le point de terminaison MoE ne bloque jamais le pipeline. C'est le schéma que le DSL de routage d'OrcaRouter compose parmi les plus de 200 modèles que nous proposons — répartition pondérée par coût, prix catalogue du fournisseur transmis sans marge, à 0 % — et il convient mieux à cette famille qu'à la plupart des autres, car le fournisseur a tarifé les deux niveaux pour rendre la répartition économiquement neutre.
Le verdict
À prix d'API identiques, la réponse par défaut est le 7B : même coût par jeton, plus simple à auto-héberger, et à un cheveu près sur les textes généraux. Prenez le 30B-A3B lorsque le corpus est professionnellement dense — juridique, médical, technique ou traduction en langues minoritaires — là où l'avantage de domaine annoncé du modèle phare justifie l'empreinte plus lourde et la latence. Et si votre charge de travail est un mélange des deux, ne faites pas de choix : acheminez la partie générale vers le 7B et la partie difficile vers le modèle phare. Ce n'est pas un compromis entre les deux ; c'est la seule façon d'obtenir les deux au prix fixé par Tencent.

Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
