
Tencent HY4 Preview vs tencent-hy3 : six fois le prix, et ce que le bond apporte réellement
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0259Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0166Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
Tencent HY4 Preview est le premier modèle de la famille Hunyuan à rendre délibérément son prédécesseur bon marché : Tencent le facture à six fois le prix d'entrée de tencent-hy3 et à quatre fois et demie son prix de sortie, et le document de lancement soutient que cette prime est justifiée. Publié en open source le 28 août 2026, Tencent HY4 Preview affiche un score en ingénierie logicielle sur DeepSWE qui fait plus que doubler le 28,0 de Hy3, un 85,4 en pilotage de terminaux sur Terminal-Bench 2.1, et une fenêtre de contexte qui passe de 256K à plus d'un million de jetons. tencent-hy3, officialisé le 6 juillet, est le cheval de trait mature de la famille — 295B de paramètres au total, 21B actifs, un quart de la fenêtre de contexte, et un prix qui tient presque de l'erreur d'arrondi. Ce n'est pas un match que la fiche technique laisse serré. La question est de savoir si l'écart vaut le prix pour ce que vous faites tourner réellement, et la réponse se divise selon la charge de travail.
Le tableau des scores : là où les deux divergent réellement.
Chaque benchmark dans les documents de Tencent est rapporté par le fournisseur — exécuté sur les configurations d'évaluation propres à Tencent lors du lancement de chaque modèle, non reproduit par un laboratoire indépendant, et pour le modèle phare, celui-ci est public depuis moins d'une journée. Considérez les scores comme le plafond que Tencent pense avoir atteint, et accordez plus de poids à la tendance qu'à un chiffre isolé. La tendance est sans équivoque, et elle se concentre sur le travail d'ingénierie agentique plutôt que sur les connaissances générales :
• DeepSWE — Tencent HY4 Preview : 64.3. tencent-hy3 : 28.0. C'est le plus grand bond en avant du duo, un résultat qui a plus que doublé sur un benchmark d'ingénierie logicielle à l'échelle d'un dépôt, et c'est le chiffre qui sépare un modèle de chat d'un modèle auquel on confie tout un codebase.
• Terminal-Bench 2.1 — Tencent HY4 Preview : 85,4, que Tencent dit égaler Claude Opus 5 et surpasser DeepSeek V4 Pro. tencent-hy3 : 71,7 comme indiqué lors de son lancement en juillet. Mener un véritable terminal à son terme sur des tâches en plusieurs étapes est exactement le genre de travail à long horizon dans lequel Hy3 était le plus faible.
• Toolathlon-Verified — Tencent HY4 Preview : 74,1, que Tencent dit surpasser Qwen 3.8 Max et GPT-5.6 Sol. Aucun chiffre comparable pour Hy3 n'a été publié.
• Test aveugle interne — 163 experts ont évalué 203 tâches d’ingénierie à 2,99/4,00 pour Tencent HY4 Preview, devançant légèrement GLM-5.3 avec 2,92 et Kimi K3 avec 2,94. Ce sont les évaluateurs de Tencent sur les tâches de Tencent ; à considérer comme indicatif.

Le fil conducteur : les gains portent sur la conduite de terminal, l'appel d'outils et les tâches à l'échelle des dépôts — le positionnement axé sur la productivité que Tencent défend depuis Hy3, désormais soutenu par la puissance de calcul nécessaire.
La prime de prix, ligne par ligne
C'est là que la comparaison cesse d'être une question de vantardise. Les prix catalogue de Tencent, par million de jetons :
• Entrée — Tencent HY4 Preview : 6 yuans (~0,85 $US). tencent-hy3 : 1 yuan (~0,14 $US). Six fois.
• Sortie — Tencent HY4 Preview : 18 yuan (~2,50 $US). tencent-hy3 : 4 yuan (~0,56 $US). Quatre fois et demie.
• Cache hit — Tencent HY4 Preview : 0,3 yuan. tencent-hy3 : 0,25 yuan. Presque les mêmes, ce qui compte plus qu'il n'y paraît, car les boucles agentiques renvoient constamment le même prompt système et le même préfixe de conversation.
Exécutez une charge de travail réaliste de codage agentique à travers le volume combiné — disons 20 millions de jetons d'entrée et 4 millions de jetons de sortie par mois, un budget d'agent pour un développeur solo bien occupé. Tencent HY4 Preview : 120 yuans plus 72 yuans, environ 192 yuans (~27 $US). tencent-hy3 : 20 yuans plus 16 yuans, environ 36 yuans (~5 $US). Le produit phare coûte cinq fois plus, voire plus, à exécuter avec le même mélange de jetons — et il demandera davantage de jetons de sortie par tâche, car il réfléchit plus longtemps.
Ce n'est pas une raison d'éviter Tencent HY4 Preview ; le bond DeepSWE est exactement le type de capacité pour lequel on paie un prix premium. C'est une raison de chiffrer la charge de travail avant de la router vers ce modèle. Et c'est là que la couche de routage justifie son existence : tencent-hy3 est déjà sur OrcaRouter au prix catalogue du fournisseur — 0 % de marge, donc le montant que vous voyez est le prix du fournisseur qui sert le modèle, et non une version revendue et majorée de ce prix — avec basculement automatique entre fournisseurs, et tout changement de prix du fournisseur est répercuté de notre côté le jour même.
Quatre fois plus de contexte, le double de calcul actif.
Architecture — Tencent HY4 Preview : 770B au total, 49B actifs en MoE. tencent-hy3 : 295B au total, 21B actifs. Le modèle phare consacre environ 2,3 fois plus de calcul à chaque jeton.
• Fenêtre de contexte — Tencent HY4 Preview : plus d’1M de tokens. tencent-hy3 : 256K. Un dépôt complet ou un lot de documents financiers tient dans la fenêtre du modèle phare en une seule requête ; sur Hy3, la même tâche nécessite un découpage, une recherche ou une boucle d’agent.
• Contrôle du raisonnement — {{1}}tencent-hy3 propose un paramètre reasoning_effort par requête (no_think, low, high) ainsi qu'une couche de décodage spéculatif qui le maintient rapide{{/1}}. {{2}}Tencent HY4 Preview, de l'aveu même de Tencent, tend à réfléchir longuement avant la première sortie et à se sur-vérifier sur les tâches complexes — brûlant des jetons à revérifier un travail déjà effectué{{/2}}.
Cette dernière phrase est la différence cachée pour les cas sensibles à la latence. On peut demander à Hy3 de répondre directement ; Tencent HY4 Preview, au moins dans cette version précoce, ne peut souvent pas s'empêcher de réfléchir. Pour un chat à faible latence ou un pipeline d'extraction à haut débit, la capacité supplémentaire du modèle phare est perdue et sa réflexion supplémentaire est une taxe. Pour un travail d'ingénierie par lots hors ligne, la taxe est précisément ce qui permet d'obtenir la meilleure réponse.
La taxe de l'aperçu : ce que Hy3 a encore
"Preview" figure dans le nom de Tencent HY4 Preview et il se comporte comme tel. Il n'y a pas de vision ni d'entrée multimodale — le modèle est uniquement textuel, donc tout ce qui est lié aux images ou aux vidéos reste sur le modèle que vous utilisez déjà pour cela. L'essai gratuit de deux semaines sur WorkBuddy et CodeBuddy est un avant-goût, pas un abonnement. Tencent a été explicite : il s'agit d'une itération précoce de Hy4, avec des améliorations de pré-entraînement et de post-entraînement à venir, à un rythme qui a produit une version majeure environ tous les deux mois depuis février. Benchmarks indépendants pour le modèle phare : aucun pour l'instant, nulle part.
tencent-hy3 est le contraire de tout cela. C'est une version officielle et stable qui est en production depuis juillet. Son offre gratuite court jusqu'au 30 septembre. Ses niveaux de raisonnement offrent un réglage plutôt qu'une humeur, et sa couche de décodage spéculatif ainsi que ses 21B paramètres actifs en font la moitié peu coûteuse, rapide et prévisible de cette famille — le modèle que vous orientez vers le chemin par défaut et que vous oubliez.

Qui devrait choisir quoi
Choisissez Tencent HY4 Preview lorsque le travail est le point central — une tâche d’ingénierie logicielle difficile, un contexte à l’échelle du dépôt, un flux de travail agentique où une meilleure réponse justifie cinq fois la facture de jetons et où vous pouvez vous permettre la latence d’un modèle qui réfléchit avant de parler. Choisissez tencent-hy3 lorsque le travail est la contrainte — un débit élevé, une faible latence, un budget serré, ou toute tâche où vous voulez que le modèle réponde plutôt que de délibérer.
Le modèle pratique pour un tel appariement est l'escalade : acheminer le modèle économique et contrôlable sur le chemin par défaut et ne faire remonter vers le modèle phare que lorsque la tâche l'exige. C'est à cela que sert le DSL de routage d'OrcaRouter — composer plusieurs modèles en un seul appel afin que la politique relève de la configuration plutôt que du code — et le basculement automatique garantit que la voie de Hy3 continue de servir même lorsqu'un fournisseur se dégrade. OrcaRouter ne route pas encore Tencent HY4 Preview ; Tencent n'a pas ouvert le modèle à l'inférence par des tiers, si bien que pour l'instant il fonctionne sur le propre point de terminaison TokenHub de Tencent Cloud et sur des déploiements auto-hébergés des poids ouverts. tencent-hy3, en revanche, figure aujourd'hui au catalogue, au prix affiché par le fournisseur — et le jour où le modèle phare sera ouvert, il s'intégrera à la même couche de routage de la même manière, transformant le passage d'un modèle à l'autre en un changement d'une seule ligne plutôt qu'en une réécriture.

Le verdict est ennuyeux dans le meilleur sens du terme : le produit phare vaut le supplément pour exactement le travail pour lequel il est tarifé, et le cheval de bataille reste le bon choix pour tout ce qui doit simplement être fait. L'écart de prix de six fois est réel, l'écart DeepSWE de 28 à 64 est réel, et aucun n'annule l'autre — il suffit de savoir lequel on achète.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
