
Tencent HY4 Preview est open-source : 770B MoE, contexte de 1M et un prix qui défie les modèles de pointe
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0259Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0258Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0166Intelligence82Code
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
Tencent HY4 Preview, publié et open-sourcé le 28 août 2026, est le premier modèle ouvert véritablement compétitif au niveau des modèles de pointe issu d'un laboratoire chinois depuis des mois, et son chiffre le plus surprenant est le prix. Tencent le propose à 6 yuans (~0,85 USD) par million de jetons en entrée et 18 yuans (~2,50 USD) par million de jetons en sortie — soit environ un dixième de ce qu'un modèle propriétaire de premier plan facture pour la sortie — tout en publiant un modèle mixture-of-experts de 770 milliards de paramètres, dont 49 milliards actifs par jeton, avec une fenêtre de contexte qui dépasse le million de jetons. Il succède au Hy3 de la famille Hunyuan (295B au total, contexte de 256K) et quadruple cette fenêtre de contexte tout en doublant la capacité active. Les poids sont téléchargeables dès aujourd'hui sur Hugging Face, GitHub, ModelScope et GitCode, et le même modèle est déjà intégré dans les produits de Tencent : WorkBuddy, CodeBuddy dans les versions nationale et internationale, l'assistant Yuanbao et l'application d'espace de travail ima. Pour tous ceux qui ont vu les modèles open-weight échouer à atteindre le niveau des frontières en matière de génie logiciel, c'est la sortie qui rend enfin cet écart discutable — et les réserves sont aussi importantes que les chiffres.
Le positionnement est délibéré. Tencent présente Tencent HY4 Preview comme un modèle de productivité pour quatre domaines : le génie logiciel, la bureautique et l'analyse de données, le développement de jeux et la recherche scientifique. L'accent mis sur l'ingénierie est ce qui le distingue de la masse des modèles généralistes — les notes de version mettent en avant la compréhension des tâches à long horizon, la planification et le débogage, et non la qualité conversationnelle. Cette orientation se reflète autant dans la liste des intégrations que dans le tableau des benchmarks : CodeBuddy accueille le modèle dans son IDE, WorkBuddy l'intègre dans les flux de travail bureautiques (Tencent le montre en train d'absorber 72 documents financiers en une seule passe), et les développeurs de jeux disposent de hooks MCP vers Unreal Engine 5 et Unity qui transforment une simple phrase en démo jouable.
Ce qui a réellement été livré
La fiche technique vaut la peine d'être lue ligne par ligne, car chaque ligne change ce qu'un modèle à poids ouverts est autorisé à faire.
Architecture — Mixture-of-Experts avec 770B de paramètres au total et 49B actifs par jeton, un ratio de parcimonie d'environ 16:1 qui maintient le coût d'inférence dans une fourchette qu'une petite équipe peut réellement se permettre.
• Fenêtre de contexte — plus d'un million de tokens, quatre fois les 256K de Hy3. Les tâches d'ingénierie à long horizon — un dépôt complet dans la fenêtre, une refactorisation multi-fichiers, un lot de documents volumineux — deviennent des problèmes à une seule requête.
• Poids — diffusion ouverte de type MIT sur Hugging Face, GitHub, ModelScope et GitCode. Il s'agit d'un modèle téléchargeable et auto-hébergeable, pas d'un aperçu hébergé.
• API — disponible sur le TokenHub de Tencent Cloud, le point de terminaison hébergé du fournisseur, au prix de 6 yuans par million de jetons d'entrée, 18 yuans par million de jetons de sortie et 0,3 yuan par million de jetons pour les succès de cache.
• Intégration produit — WorkBuddy, CodeBuddy (domestique et international), Yuanbao et ima, ce qui signifie que les mêmes poids que Tencent déploie dans ses propres applications sont ceux que vous pouvez récupérer et exécuter.
Tencent also reports an inference-engineering figure that rarely makes a launch note: a 31.8% end-to-end throughput improvement from operator fusion and communication optimization. What makes it more than a spec-sheet footnote is that Tencent says Tencent HY4 Preview found the bottlenecks itself — the model analyzed its own inference stack, and the optimizations are reported stable across context lengths and concurrency levels. That is the kind of detail that separates a model a lab ships as a research artifact from a model a company expects production traffic to hit. On a preview that has been public for only a few days, it is also exactly the kind of claim nobody outside Tencent has verified yet.
Les scores dignes d'être cités
Every benchmark Tencent published for Tencent HY4 Preview is vendor-reported — run on Tencent's own evaluation setup, unreproduced by any independent lab, and the model has been public for only a few days. Read them as the ceiling Tencent believes it hit, not as established fact.

Le chiffre principal est Terminal Bench 2.1, un test qui évalue la capacité d'un modèle à piloter un vrai terminal en codant. Tencent annonce un score de 85,4 pour Tencent HY4 Preview, qui selon lui fait jeu égal avec Claude Opus 5 et dépasse DeepSeek V4 Pro, et qui devance son prédécesseur Hy3 de 14,6 points. Ce seul chiffre pèse lourd — c'est l'affirmation qui place un modèle à poids ouverts au même niveau que les modèles propriétaires fermés les plus chers sur un test exigeant de codage agentique — et c'est l'affirmation qui a le plus besoin d'une confirmation indépendante.
Le reste du tableau interne : {{1}}DeepSWE, un benchmark de génie logiciel, passe de 28,0 sur Hy3 à 64,3, ce que Tencent décrit comme « une réduction progressive de l'écart » avec les modèles de premier rang.{{/1}} {{2}}Sur Toolathlon-Verified, un test d'appel d'outils, il obtient 74,1, un score que Tencent affirme supérieur à Qwen 3.8 Max et GPT-5.6 Sol, et proche de Kimi K3 et Claude Opus 5.{{/2}} {{3}}Sur APEX-Agents pass@1, il atteint 37,1, soit un cheveu derrière les 37,2 de Kimi K3.{{/3}} {{4}}Et dans un test aveugle interne distinct, 163 experts ont noté 203 tâches d'ingénierie à 2,99 sur 4,00{{/4}}, devançant légèrement {{5}}les 2,92 de GLM-5.3 et les 2,94 de Kimi K3.{{/5}}
Deux tendances ressortent. Premièrement, chaque chiffre solide concerne le travail d'ingénierie agentique — pilotage de terminal, appel d'outils, tâches à l'échelle du dépôt — et aucun ne concerne la connaissance générique ou le raisonnement, ce qui est cohérent avec le positionnement de productivité plutôt qu'une coïncidence. Deuxièmement, Tencent prend soin de décrire DeepSWE et les autres comme réduisant, et non comblant, les écarts. La seule affirmation de parité propre et commercialisable est l'égalité sur Terminal Bench 2.1, et c'est l'affirmation qui mérite le plus d'être testée avec votre propre charge de travail.
Ce que le prix comprend réellement
La tarification est le point où cette sortie cesse d'être intéressante pour devenir disruptive. Au prix catalogue de Tencent, un million de jetons d'entrée coûte à peu près ce que coûte un seul appel API de milieu de gamme sur certaines plateformes. Le chiffre de 18 yuans par million de jetons de sortie (~2,50 $US) se situe bien en dessous du prix de 25 $ par million de jetons de sortie d'un grand modèle propriétaire de pointe, et le tarif de 0,3 yuan en cas de succès de cache rend les longues boucles agentiques — où le même prompt système et les mêmes préfixes de conversation sont renvoyés en permanence — exceptionnellement peu coûteuses à exécuter.
C'est aussi le seul endroit où la couche de routage change la donne. OrcaRouter ne route pas encore Tencent HY4 Preview — Tencent n'a pas ouvert ce modèle aux plateformes d'inférence tierces, il tourne donc sur le endpoint TokenHub de Tencent Cloud et sur des déploiements auto-hébergés des poids ouverts, et nous ne prétendons pas servir ce que nous ne servons pas. Mais la discipline qui fait qu'une baisse de prix compte est la même que celle qui régit le reste du catalogue : OrcaRouter transmet les prix catalogue des fournisseurs sans aucune marge, donc quand un fournisseur comme Tencent fixe le prix d'un token à 6 yuans, le montant que vous payez de notre côté est de 6 yuans, et non une version revendue avec une marge ajoutée, et le jour où un fournisseur modifie un prix, le changement est répercuté de notre côté le jour même. Une API pour plus de 200 modèles, un basculement automatique entre fournisseurs quand l'un d'eux a des ratés, et un DSL de routage pour composer les modèles — c'est ce mécanisme qui portera Tencent HY4 Preview dès qu'il deviendra routable, aux côtés des autres modèles ouverts et fermés déjà présents dans le catalogue.

Les éléments qui ne tiennent pas sur une fiche technique
Deux affirmations dans les supports de lancement méritent une attention particulière, car elles portent sur la manière dont le modèle a été construit, et non sur ce qu'il a obtenu comme score.
The first is the self-improvement loop. Tencent says Tencent HY4 Preview participated in its own research and development — it was used to optimize the training methods, data strategy, evaluation systems, and underlying operators that produced it. The 31.8% throughput gain is the most concrete public output of that loop: Tencent credits it to bottlenecks the model identified in its own serving stack. That is an initial recursive self-enhancement cycle: a model helping design the next version of itself. It is not unusual for a frontier lab to report pieces of this, but a Chinese open-weight model publicly describing the loop as a shipped capability is a step-change in how these releases talk about themselves.
The second is the mathematics result. Tencent reports that the model advanced the known volume lower bound of the Blaschke–Lebesgue problem — a long-standing open question in convex geometry about the minimum-volume body of constant width — from 0.380799 to 0.41104, bringing it within roughly 2% of the Meissner tetrahedron conjecture's bound. Tencent also reports a 2.0x speedup on a 32,512-atom phospholipid bilayer simulation, down to 54.9 milliseconds per step, in the scientific-research lane. These are the kinds of results that usually get a model its own paper; here they are launch bullets, and like the rest of the launch material they are Tencent's own account.
Qu'est-ce qui manque, honnêtement
Tencent énumère clairement les limitations connues, et elles comptent pour quiconque décide quoi construire sur ce modèle. Il n'y a pas de vision ni d'entrée multimodale — Tencent HY4 Preview est un modèle textuel, point final, donc tout ce qui touche à l'image ou à la vidéo appartient à un modèle différent. Tencent signale également que le modèle présente un comportement de démarrage lent sur les tâches complexes — une longue réflexion avant la première sortie — et une tendance à se sur-vérifier, gaspillant des jetons à revérifier un travail déjà fait. Cette combinaison est exactement ce qu'il ne faut pas pour un chat sensible à la latence, et parfaitement tolérable pour un travail d'ingénierie par lots hors ligne, ce qui vous indique où Tencent s'attend à ce que vous l'exécutiez.
And the most important absence is verification. There are no independent scores for Tencent HY4 Preview anywhere yet — not on a public leaderboard, not from a third-party eval lab, not even an Artificial Analysis entry. The model is too new for that. The internal expert blind test is a useful signal about how Tencent's own reviewers see it against GLM-5.3 and Kimi K3, but it is Tencent's reviewers on Tencent's tasks. Everything above the spec sheet is a claim awaiting a check.

Qui devrait soulever les poids aujourd'hui ?
La réponse honnête est que cette version se divise clairement en deux publics. Si vous exécutez des charges de travail d’ingénierie sur votre propre infrastructure et que ce sont les coûts des API fermées qui vous ont retenu jusqu’ici, Tencent HY4 Preview mérite un vrai test de week-end dès maintenant : les poids sont ouverts, la fenêtre de contexte est à l’échelle d’un référentiel, et le prix affiché rend une longue boucle agentique abordable d’une manière qu’un modèle à 25 dollars par million de tokens de sortie ne le sera jamais. Si vous gérez un chat de production sensible à la latence, ou quelque chose de multimodal, ou tout ce qui ne peut pas se permettre un modèle dont la seule preuve est les benchmarks de son propre fournisseur, attendez — la cadence d’itération de deux mois que Tencent maintient depuis février suggère qu’une version complète de Hy4 n’est pas loin, et l’aperçu est explicitement une itération précoce avec des défauts connus.
La voie médiane pragmatique est un modèle de routage : exécutez le modèle éprouvé sur votre chemin critique et le nouveau modèle à côté de lui, en basculant vers Tencent HY4 Preview pour les tâches où son profil de coût est gagnant et avec repli automatique dans le cas contraire. C'est pour ce schéma qu'un routeur existe — le même OrcaRouter qui achemine Claude Opus 5, DeepSeek V4 Pro et Gemini 3.1 Pro aux prix catalogue de leurs fournisseurs acheminera ce modèle dès que Tencent l'ouvrira. D'ici là, les poids sont sur GitHub, l'API est sur Tencent Cloud, et l'affirmation selon laquelle un modèle à poids ouverts a atteint le sommet du codage agentique a enfin un chiffre précis à lui associer. Le chiffre appartient à Tencent. Le test vous appartient.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
