
Tencent Hy4 Preview fonctionne dans vLLM dès le premier jour : le MoE open-weight de 770B que vous pouvez réellement servir
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Lorsque Tencent Hy4 Preview a été lancé le 28 août 2026, il a fait quelque chose que la plupart des modèles phares de classe frontière négligent le jour de leur sortie : il était livré fonctionnel. Parallèlement aux poids ouverts, Tencent et l'équipe vLLM ont publié une image Docker préconstruite, une recette de déploiement officielle, et ont intégré la prise en charge du framework dans vLLM lui-même, de sorte que le plus grand modèle à poids ouverts que la gamme Hunyuan ait produit — 770 milliards de paramètres au total, 49 milliards actifs par jeton — se trouvait derrière un endpoint compatible OpenAI sur vos propres GPU à quelques heures de l’annonce. Cette histoire de runtime dès le jour de lancement est le sujet de cet article, car « fonctionne dans vLLM » n’est pas une note de bas de page pour un modèle de cette taille. C’est la différence entre un communiqué de presse et une chose que l’on peut mettre en production.
Le reste du lancement suit le format habituel d’une préversion, et les mises en garde comptent autant que les chiffres. Tencent qualifie Tencent Hy4 Preview d’itération précoce, signale les raisonnements trop longs et la sur-vérification excessive comme des comportements connus, et publie un tableau de benchmarks entièrement auto-déclaré — aucun laboratoire indépendant ne l’a encore évalué, et le modèle n’a que deux jours au moment où j’écris ces lignes. Rien de tout cela ne change l’essentiel en pratique : les poids sont sous licence Apache 2.0, la fenêtre de contexte est d’un million de jetons, et le support vLLM dès le premier jour fait du déploiement en auto-hébergement une voie concrète plutôt qu’une simple aspiration.
Ce qu'est réellement Tencent Hy4 Preview
Tencent positionne Tencent Hy4 Preview comme le successeur de Hy3 (295B au total, contexte de 256K), doublant approximativement la capacité active et quadruplant la fenêtre de contexte. L'architecture mérite d'être lue ligne par ligne, car chaque ligne modifie ce qu'un modèle open-weight est autorisé à faire sur votre matériel.
• Architecture — Mixture-of-Experts avec 770B de paramètres au total et 49B actifs par jeton sur 78 couches. La première couche est dense ; les 77 autres acheminent chaque jeton à travers 256 experts routés plus un expert partagé, en activant les 8 premiers. Ce ratio de sparsité d'environ 16:1 est ce qui maintient le coût d'inférence dans une fourchette qu'une équipe sérieuse peut réellement faire tourner.
• Fenêtre de contexte — 1 048 576 jetons en natif, l'une des plus larges de tout modèle à poids ouverts. Un dépôt complet, une refactorisation multi-fichiers, un lot de documents longs : des problèmes résolus en une seule requête.
• Attention — Gated DeepSeek Sparse Attention (Gated DSA) avec IndexCache, une architecture d'attention sparse qui calcule un nouvel index sparse sur seulement 21 des 78 couches et le réutilise sur les 57 autres. C'est pourquoi servir ce modèle ne se résume pas à « un vLLM plus gros » — il faut un backend qui comprend l'attention sparse.
• Décodage spéculatif intégré — une couche MTP (prédiction multi-tokens) d’environ 10B de paramètres au total / 0,7B actifs se trouve à l’intérieur du modèle, de sorte que vLLM et SGLang peuvent générer des tokens de brouillon sans que vous ayez à héberger un modèle de brouillon séparé.
Poids — Apache 2.0, dans les checkpoints BF16 et FP8, publiés sur Hugging Face, ModelScope, GitCode et CNB.
Ce que « day-zero vLLM » signifie réellement
Le support de framework fusionné le jour du lancement est l'événement concret derrière le signal — le changement vLLM qui ajoute Tencent Hy4 Preview (PR #54160) a été intégré dans la même fenêtre que la sortie, et la recette officielle cible vLLM 0.29.0 ou plus récent. En pratique, cela signifie que le chemin de service se résume à une seule commande, pas à une semaine de débogage de noyau.
docker run --gpus all -p 8000:8000 --ipc=host -v ~/.cache/huggingface:/root/.cache/huggingface vllm/vllm-openai:hy4-preview tencent/Hy4-preview-FP8 --tensor-parallel-size 8 --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' --attention-backend FLASHMLA_SPARSE --tool-call-parser hy_v4 --reasoning-parser hy_v4 --enable-auto-tool-choice --served-model-name hy4-preview
Les indicateurs comptent, et chacun correspond à quelque chose dans le modèle plutôt que d'être un simple texte générique.
• --attention-backend FLASHMLA_SPARSE — obligatoire, pas facultatif. L'attention sparse Gated DSA de Tencent Hy4 Preview ne fonctionne pas correctement sur les backends denses par défaut, et ce flag est celui que définit la recette officielle.
• --speculative-config '{"num_speculative_tokens":3,"method":"mtp"}' — active la couche MTP intégrée du modèle pour le décodage spéculatif, trois jetons de brouillon en avance. Aucun modèle de brouillon séparé à déployer.
• --tool-call-parser hy_v4 et --reasoning-parser hy_v4 — les analyseurs personnalisés qui indiquent au serveur comment Tencent Hy4 Preview émet les appels d'outil et sa chaîne de pensée, avec --enable-auto-tool-choice laissant le modèle décider quand appeler les outils.
Tencent recommande une température de 0,9 et un top_p de 1,0 pour l'échantillonnage. Le raisonnement utilise par défaut un effort « élevé » de chaîne de pensée destiné aux mathématiques, au codage et aux tâches complexes ; si vous souhaitez une réponse directe sans la longue réflexion, vous transmettez un effort de raisonnement no_think dans la requête plutôt que d'échanger les poids.

Le support dès le premier jour n'est pas exclusif à vLLM, ce qui est en soi remarquable pour une sortie aussi récente. SGLang a publié le même jour une image multi-architecture préconstruite (lmsysorg/sglang:hy4-preview) avec un décodage spéculatif de type NEXTN, et l'écosystème Ascend a obtenu un support immédiat via vLLM-Ascend en utilisant des poids quantifiés W8A8 sur 16 NPU Atlas 800I A3. Les versions à poids ouverts mettent souvent des semaines avant que l'écosystème de déploiement ne suive ; cette fois, cela n'a pris que quelques heures.
Les scores dignes d'être cités
Chaque benchmark que Tencent a publié pour Tencent Hy4 Preview est rapporté par le fournisseur — exécuté sur le propre environnement d'évaluation de Tencent, non reproduit par aucun laboratoire indépendant, et le modèle est public depuis deux jours. Interprétez-les comme le plafond que Tencent pense avoir atteint, et non comme un fait établi. Une vérification indépendante n'existera pas tant qu'un tiers ne l'aura pas exécutée ; rien sur les classements publics ne reflète encore ce modèle.

Le chiffre phare est Terminal Bench 2.1, un test qui mesure la capacité d'un modèle à piloter un véritable terminal tout en codant. Tencent annonce que Tencent Hy4 Preview obtient 85,4, un résultat qui, selon ses affirmations, égalerait Claude Opus 5 et dépasserait DeepSeek V4 Pro, et qui battrait son propre prédécesseur Hy3 de 14,6 points. Ce chiffre unique porte toute l'annonce — c'est l'affirmation qui place un modèle à poids ouverts à égalité avec les modèles de pointe propriétaires les plus chers sur un test exigeant de codage agentique — et c'est l'affirmation qui a le plus besoin d'une confirmation indépendante.
Le reste du tableau interne, tous des chiffres de Tencent : DeepSWE, un benchmark de génie logiciel, bondit de 28,0 sur Hy3 à 64,3. SWE-bench Pro atteint 65,7 et SWE-bench Multilingual 82,9. Sur Toolathlon-Verified, un test d'appel d'outils, Tencent annonce 74,1, un score qu'elle affirme supérieur à Qwen 3.8 Max et GPT-5.6 Sol, et proche de Kimi K3 et Claude Opus 5. Sur APEX-Agents pass@1, elle se situe à 37,1, à un cheveu derrière les 37,2 de Kimi K3. Et dans une autre évaluation interne à l'aveugle, 163 experts recrutés par Tencent ont noté 203 tâches d'ingénierie à 2,99 sur 4,00, dépassant de peu les 2,92 de GLM-5.3 et les 2,94 de Kimi K3.
Deux tendances méritent d'être notées. Tous les bons chiffres portent sur le travail d'ingénierie agentique — pilotage de terminal, appel d'outils, tâches à l'échelle du dépôt — et aucun sur les connaissances ou le raisonnement génériques, ce qui correspond au positionnement de productivité plutôt qu'à une coïncidence. Et Tencent décrit DeepSWE et les autres comme réduisant, et non comblant, les écarts ; la seule affirmation de parité propre et commercialisable est l'égalité sur Terminal Bench 2.1, et c'est l'affirmation qui mérite le plus d'être testée avec votre propre charge de travail.
Ce qu'il en coûte réellement pour le faire fonctionner
Pour être honnête, les maths de l’auto-hébergement sont la première chose à considérer. Ce n’est ni un modèle pour GPU unique, ni un modèle de bureau. Le checkpoint FP8 pèse près d’un téraoctet de poids, et la recette officielle suppose un parallélisme tensoriel de 8 — huit GPU à haute bande passante avec interconnexions rapides (le matériel de référence de Tencent pour le FP8 est de 8×B300, le BF16 complet exigeant 16×B200). Si vous n’avez pas cette empreinte, vous n’allez pas l’auto-héberger à moindre coût, et le backend d’attention sparse signifie qu’il n’y a pas de raccourci autour de la mémoire pour le cache KV dans un contexte de 1M de jetons.
Un supplément de la semaine de lancement modifie une partie de l'équation pour les équipes qui veulent les poids ouverts sans l'empreinte du produit phare. L'équipe Hy de Tencent a publié une version GGUF compressée de Tencent Hy4 Preview, réduisant la version BF16 d'environ 1,5 To à environ 200 GiB grâce à un schéma de quantification mixte par couche qu'elle appelle MIX-STQ1_0 — la plupart des tenseurs d'experts descendent à environ 1,3 bits tandis que les couches critiques pour le flux résiduel conservent une précision supérieure. Selon les propres évaluations de Tencent, la variation de précision est faible — SWE-bench Multilingual 82.9 à 81.3, MCP Atlas 83.7 à 83.2, IFBench 73.5 à 72.5 — un compromis que le fournisseur qualifie de quasi sans perte. Ce sont les chiffres de Tencent sur sa propre configuration, non reproduits jusqu'à présent. Un modèle de 200 GiB n'est toujours pas un modèle mono-GPU, mais c'est un pari nettement plus petit qu'un checkpoint FP8 de près d'un téraoctet, et il rend la voie des poids ouverts accessible à un nœud multi-GPU plus petit que la configuration à huit B300 ne le suppose.
Le chemin API est là où le prix devient intéressant. Sur le TokenHub de Tencent Cloud, Tencent Hy4 Preview est listé à 6 yuans (~0,83 $US) par million de jetons d'entrée, 18 yuans (~2,50 $US) par million de jetons de sortie, et 0,3 yuan (~0,04 $US) par million de jetons pour les hits de cache. La sortie à environ 2,50 $ le million est bien en dessous du prix de sortie de 25 $ le million d'un modèle frontal fermé de premier plan, et le taux de hit de cache peu coûteux rend les longues boucles agentiques — où le même prompt système et les préfixes de conversation sont constamment renvoyés — exceptionnellement abordables.
Tencent propose également un accès gratuit de deux semaines à l'aperçu Tencent Hy4 dans WorkBuddy et CodeBuddy tant que le modèle est nouveau, donc le moyen le moins cher de l'essayer cette semaine est gratuit — et c'est dans WorkBuddy que le positionnement sur la productivité devient concret. Dans toute conversation WorkBuddy, le sélecteur de modèle bascule entre Hy3 et l'aperçu Hy4, de sorte que la répartition entre travail de productivité bureautique et d'analyse d'un côté, et code de l'autre, est un choix par tâche plutôt qu'une décision de déploiement. Cette répartition correspond à l'orientation que Tencent a donnée au modèle, et les tests pratiques dans WorkBuddy le montrent en train de générer d'un seul coup des artefacts complexes — un prototype de jeu low-poly jouable à partir d'une seule invite, une revue trimestrielle complète assemblée à partir de dix pièces jointes sans aucune intervention manuelle, et, dans la démo de test qui a circulé cette semaine, une simulation de trou noir. Ce sont des observations de la communauté sur l'application propre de Tencent, et non des benchmarks du fournisseur — mais ce sont les premiers signaux concrets de ce que le modèle fait sur de vraies tâches multi-étapes, et vous pouvez les reproduire gratuitement avant de dépenser quoi que ce soit.
La décision de coût est précisément là où une couche de routage change la donne, et nous serons honnêtes quant à notre propre rôle : OrcaRouter ne route pas encore Tencent Hy4 Preview, car Tencent n'a pas ouvert ce modèle aux plateformes d'inférence tierces — il fonctionne sur le endpoint TokenHub propre à Tencent Cloud et sur des déploiements auto-hébergés des poids ouverts, et nous ne prétendons pas servir ce que nous ne servons pas. Ce que la couche de routage apporte, c'est le cadre décisionnel qui l'entoure. Si vous choisissez entre un nœud à 8 GPU et une API, la même discipline de répercussion directe qui s'applique au reste du catalogue s'appliquera le jour où Tencent ouvrira l'accès : OrcaRouter transmet les prix catalogue des fournisseurs sans aucune marge, de sorte qu'une baisse de prix chez un fournisseur est en vigueur chez nous le jour même, plutôt que d'être revendue et majorée. Et pour un modèle vieux de deux jours dont la seule preuve est les benchmarks de son fournisseur, le basculement automatique est le moyen sûr de le tester — placez le modèle éprouvé sur votre chemin critique et Tencent Hy4 Preview à côté, en le faisant intervenir sur les tâches où son profil de coût est gagnant et en revenant au modèle éprouvé dès qu'il ne l'est plus, le tout via une seule API et une seule clé.

Les limites qui ne tiennent pas sur une fiche technique
Tencent énonce clairement les limitations connues, et elles devraient guider toute décision de déploiement. Tencent Hy4 Preview est un modèle de texte, un point c’est tout — pas de vision ni d’entrée multimodale — donc tout ce qui touche de près ou de loin à l’image ou à la vidéo relève d’un autre modèle. Tencent signale également un démarrage lent sur les tâches complexes (longue réflexion avant la première sortie) et une tendance à la sur-vérification, dépensant des tokens à revérifier un travail déjà effectué. Cette combinaison est précisément inadaptée aux chats sensibles à la latence et tout à fait acceptable pour les travaux d’ingénierie par lots hors ligne, ce qui indique bien où Tencent vous attend à l’exécuter.
Deux affirmations de la documentation de lancement méritent une attention particulière, car elles portent sur la façon dont le modèle a été construit, et non sur ses scores. Tencent affirme que {{1}}Tencent Hy4 Preview a participé à son propre développement — il a contribué à optimiser les méthodes d'entraînement, la stratégie de données, les cadres d'évaluation et les opérateurs de bas niveau qui l'ont produit, une première boucle d'auto-amélioration récursive — et qu'il a optimisé de manière autonome son propre système d'inférence pour un gain de débit de bout en bout de 31,8 % par rapport à la référence{{/1}}. Sur le plan scientifique, Tencent rapporte {{2}}avoir fait progresser la borne inférieure connue du problème de Blaschke–Lebesgue en géométrie convexe de 0,380799 à 0,41104, et avoir obtenu une accélération de 2,0x sur une simulation de bicouche phospholipidique de 32 512 atomes, ramenée à 54,9 millisecondes par étape{{/2}}. Comme tout le reste au lancement, ce sont les propres déclarations de Tencent.
Et l'absence la plus importante est la vérification. Il n'existe encore aucun score indépendant pour Tencent Hy4 Preview — ni sur un classement public, ni de la part d'un laboratoire d'évaluation tiers, ni dans une entrée Artificial Analysis. Le modèle est trop récent pour cela. Le test aveugle interne d'experts est un signal utile sur la façon dont les propres évaluateurs de Tencent le perçoivent par rapport à GLM-5.3 et Kimi K3, mais ce sont les évaluateurs de Tencent sur des tâches de Tencent. Tout ce qui va au-delà de la fiche technique est une affirmation en attente de vérification.
Qui devrait exécuter Tencent Hy4 Preview cette semaine
La réponse honnête se divise en trois groupes cette semaine, et l'un d'eux n'a besoin d'aucun matériel. Si vous voulez simplement voir ce que fait Tencent Hy4 Preview, l'accès gratuit à WorkBuddy est la voie la plus rapide — pas de GPU, pas de clé API, ouvrez une conversation, basculez le sélecteur de modèle sur Hy4 preview, et confiez-lui une tâche Work ou Coding. Si vous avez des GPU et que vous exécutez des charges de travail d'ingénierie par lots — tâches agentiques à long horizon, analyse à l'échelle d'un dépôt, évaluation hors ligne — le modèle mérite un test sérieux dès maintenant : les poids sont ouverts, la fenêtre de contexte est à l'échelle d'un dépôt, la voie vLLM est une seule commande, et la build GGUF de la semaine de lancement abaisse la barre matérielle pour un essai. Si vous exécutez un chat de production sensible à la latence, ou quelque chose de multimodal, ou tout ce qui ne peut pas se permettre un modèle dont la seule preuve est les benchmarks de son propre fournisseur, attendez — Tencent a itéré environ tous les deux mois depuis février et a déjà annoncé que la prochaine série de modèles Hy4 arrive, donc la preview est explicitement une itération précoce.
Pour tous les autres, la posture utile est un schéma de routage : prouvez-le à côté d'un modèle auquel vous faites déjà confiance, à un coût dont vous pouvez vous dégager, et ne le faites passer à l'échelle que là où ses chiffres tiennent la route sur votre propre charge de travail. C'est à cela que sert un routeur — le jour où Tencent ouvrira ce modèle à l'inférence par des tiers, il rejoindra le catalogue à API unique, plus de 200 modèles et pass-through au prix catalogue, comme n'importe quel autre, et les outils de basculement et de composition seront déjà en place. D'ici là, les poids sont sur Hugging Face, l'API est sur Tencent Cloud, et l'essai gratuit est dans WorkBuddy — et l'affirmation qu'un modèle à poids ouverts a atteint le haut du classement du codage agentique a enfin un chiffre précis pour l'étayer. Le chiffre est celui de Tencent. Le test est le vôtre.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
