
Tencent HY4 Preview vs Kimi K3 : le test à l'aveugle que Tencent a choisi de publier
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Tencent HY4 Preview contre Kimi K3 est la seule confrontation du lancement de ce modèle que Tencent elle-même a choisi de réaliser. Dans son test interne en aveugle — 163 ingénieurs, 203 tâches d'ingénierie, notées sur une échelle de quatre points — HY4 Preview a obtenu 2,99/4,00 contre 2,94 pour Kimi K3, et le titre de Tencent a qualifié cela de victoire. Les petites lignes de cette victoire méritent d'être lues lentement : HY4 Preview a battu Kimi K3 sur 51,2 % des tâches, a fait match nul sur 7,9 % et a perdu sur 40,9 %. Un taux de victoire net de 10 points est réel, mais c'est une avance étroite contre un modèle dont le nombre total de paramètres est d'un tiers et dont les paramètres actifs sont moins de la moitié — et l'ensemble du test a été mené par Tencent.
Kimi K3 est le fleuron open-weight de Moonshot avec 2,8 billions de paramètres, le plus grand modèle open jamais publié, et le point de référence auquel chaque laboratoire chinois se mesure depuis le 16 juillet. Tencent l'a choisi comme adversaire parce qu'il est la norme open-weight — ce qui rend la tâche de cet article inhabituellement concrète : lire le seul face-à-face que le challenger a proposé, et décider de ce qu'il vaut.
Le benchmark que Tencent a choisi de publier
Le test à l'aveugle a été noté par les propres ingénieurs de Tencent sur les propres tâches d'ingénierie de Tencent, ce qui est la première chose à relativiser. Un ensemble de tâches sélectionné par l'entreprise est précisément l'environnement où un nouveau modèle donne sa meilleure performance possible. Même en accordant cela, la forme du résultat est instructive : 51,2 % de victoires contre 40,9 % de défaites est une marge modeste, et le taux d'égalité de 7,9 % signifie que les modèles sont très proches sur la plupart des tâches. Sur les tâches difficiles, celles où un modèle de pointe se démarque, l'écart est là où il est toujours — et le titre de Tencent, « slightly ahead of Kimi K3 », est formulé honnêtement, ce qui n'est pas ce que tous les laboratoires publient.
La taille n'est pas une fatalité.
La comparaison des paramètres rend le résultat soit impressionnant, soit suspect, selon vos a priori. Kimi K3 compte 2,8 billions de paramètres au total, dont 104 milliards d'actifs — 896 experts, 16 actifs par jeton — et il a été entraîné à raisonner en continu avec une chaîne de pensée exposée. HY4 Preview compte 770 milliards au total, dont 49 milliards d'actifs, soit un tiers de l'échelle totale et moins de la moitié de la puissance de calcul active. Un modèle plus petit qui remporte une victoire étroite dans un test en aveugle face à un modèle plus grand représente la direction que suit l'ensemble du secteur open-weight — Qwen3.8-Max, à 2,4 billions, et GLM-5.2, à 753 milliards, s'affrontent sur les benchmarks agentiques depuis des mois — le résultat est donc plausible plutôt que farfelu. Il est aussi, et c'est crucial, non vérifié par quiconque en dehors de Tencent.
Le tableau d'affichage

• Échelle — HY4 Preview 770B total / 49B actifs vs Kimi K3 2.8T total / 104B actifs
• Contexte — HY4 Preview >1M tokens vs Kimi K3 1M tokens
• Prix par 1M — HY4 Preview 6 ¥ entrée / 18 ¥ sortie (≈0,85 $ / 2,50 $) vs Kimi K3 3,00 $ entrée / 15,00 $ sortie, hits de cache 0,30 $
• Modalité — HY4 Preview uniquement texte vs Kimi K3 entrée native d’images et de vidéos
• Raisonnement — HY4 Preview : aucun mode publié vs Kimi K3 : raisonnement toujours actif avec chaîne de pensée diffusée en continu
• Score indépendant — HY4 Preview : aucun, vs Kimi K3 : AA Intelligence Index 57, parmi les trois premiers au niveau mondial à sa sortie.
Sur les lignes où les deux côtés rapportent un chiffre, les modèles se regroupent. Tencent indique HY4 Preview à 37,1 sur APEX-Agents, essentiellement à égalité avec le 37,2 de Kimi K3 — une quasi-égalité que le tableau de bord du test en aveugle prédirait. Le Toolathlon-Verified 74,1 et le DeepSWE 64,3 de HY4 Preview n'ont pas d'équivalent Kimi K3 entre mes mains, et le FrontierSWE 81,2, le ProgramBench 77,8 et le BrowseComp 91,2 de Kimi K3 n'ont pas d'équivalent HY4 Preview. Le tableau de bord est honnête : les deux cartes se recouvrent à peine, ce qui constitue en soi un avertissement contre le fait de considérer les lignes de l'un ou l'autre fournisseur comme une description complète du modèle.
La vision est la plus grande différence réelle.
Pour un développeur qui doit choisir entre les deux aujourd’hui, l’écart structurel ne réside pas dans l’intelligence, mais dans la modalité d’entrée. Kimi K3 est nativement multimodal : il accepte les entrées image et vidéo via son encodeur MoonViT-V2 et figure parmi les meilleurs modèles ouverts en vision, se classant deuxième mondialement sur le vision arena. Tencent HY4 Preview est limité au texte dans cette version d’aperçu, et Tencent a indiqué que la vision devra attendre la version complète. Toute charge de travail nécessitant des captures d’écran, la compréhension d’interfaces ou l’ancrage visuel revient de fait à Kimi K3, quel que soit ce que le test à l’aveugle dit sur le texte technique. Si votre travail est purement code, documents et sortie de terminal, cet écart n’a pas d’importance ; dès qu’une tâche implique de regarder quelque chose, il décide de l’issue.
La question du coût
Par token, HY4 Preview est nettement moins cher : environ 0,85 $/2,50 $ contre 3,00 $/15,00 $ pour Kimi K3, avec des hits de cache à 0,3 ¥ (environ quatre cents) contre 0,30 $. Mais les deux modèles ont des comportements de token opposés qui réduisent l'écart. Kimi K3 raisonne en permanence et diffuse sa chaîne de pensée, ce qui gonfle les tokens de sortie à chaque requête ; les testeurs ont noté que le modèle est plus lent — environ 62 tokens par seconde — et très gourmand en tokens pour les boucles d'agent. HY4 Preview, selon la note de version de Tencent elle-même, « tend vers une réflexion excessivement longue et une auto-vérification excessive » sur les tâches complexes. Les deux brûlent des tokens de sortie supplémentaires ; HY4 Preview les facture simplement moins cher. Une comparaison juste est le coût par tâche accomplie, et personne en dehors de Tencent n'a encore mesuré celui de HY4 Preview.
Le verdict
Tencent HY4 Preview est le challenger moins cher, plus petit et non vérifié qui revendique un léger avantage lors de tests à l'aveugle par rapport au standard à poids ouverts ; Kimi K3 est le titulaire plus grand, vérifié, capable de vision, qui coûte quatre à cinq fois plus cher par jeton et dispose d'un indice d'intelligence indépendant de 57. Aucune des fiches de référence des deux modèles n'est entièrement indépendante — les scores principaux de Kimi K3 sont également rapportés par Moonshot, même si son indice de 57 ne l'est pas. Si votre charge de travail est multimodale, Kimi K3 est le seul choix dans cette confrontation. S'il s'agit de texte et d'ingénierie, HY4 Preview est le meilleur rapport qualité-prix, avec un véritable face-à-face à son actif, bien que mené par le fournisseur, et la solution économique consiste à router Kimi K3 sur la clé de production — il est disponible sur OrcaRouter au prix catalogue de Moonshot de 3,00 $/15,00 $, transmis sans marge — pendant que vous exécutez HY4 Preview via l'API de Tencent sur des charges de travail fantômes. Lorsque HY4 Preview atteindra un routeur, la même clé et les mêmes règles de bascule achemineront les deux, et le tarif de Tencent de ¥6/¥18 sera transmis sans changement.


Que regarder
• Une reprise indépendante des tâches de test à l’aveugle. Le taux de victoire de 51,2 % est la revendication la plus testable de ce lancement, et un harnais tiers la réglerait en une semaine.
• Que la HY4 Preview embarque la vision avant la sortie complète de la Hy4. C'est ce qui ferait passer cette comparaison de valeurs, purement sur le papier, à une véritable bataille de flagships.
• Coût par tâche accomplie sur les harnais agentiques standard. Les deux modèles sont gourmands en jetons ; celui qui est le moins cher par tâche terminée remporte l'argument de production.
• La réponse de Kimi K3 à la pression sur les prix. Si Moonshot réduit le tarif de sortie de 15 $, le cadre « challenger bon marché vs standard coûteux » s'inverse.
