
Tencent HY4 Preview vs GPT-5.6 Sol : la revendication d'appel d'outils qui oppose les poids ouverts aux modèles de pointe
- AlibabaNOUVEAUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.3 Flash2026-08-2658Intelligence72Code
- DeepSeekNOUVEAUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 par million de tokens
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianQwen3.8 27B2026-08-1552Intelligence68Code
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
Tencent HY4 Preview est le premier modèle open-weight depuis des mois dont la fiche de lancement revendique explicitement une victoire sur GPT-5.6 Sol. Le chiffre en question est Toolathlon-Verified, un benchmark pour l'appel d'outils agentique, sur lequel Tencent rapporte HY4 Preview à 74,1 — devant Qwen3.8-Max et, selon la propre comparaison de Tencent, devant GPT-5.6 Sol. Sur toutes les autres dimensions, les deux modèles ne sont pas vraiment comparables : GPT-5.6 Sol est le modèle de pointe d'OpenAI — fermé, phare, mesuré indépendamment — tandis que Tencent HY4 Preview est un aperçu open-weight de 770 milliards de paramètres publié ce matin avec un tableau de scores fourni par le fournisseur et aucune vérification par un tiers.
Donc la question intéressante n'est pas « quel modèle est le plus intelligent » — mais de savoir si un challenger à poids ouverts, à environ un sixième du prix d'entrée de Sol, peut légitimement revendiquer une part de la frontière, et ce qu'une équipe devrait faire d'une revendication actuellement invérifiable.
L'affirmation qui fait de ceci une véritable confrontation.
Toolathlon-Verified mesure la fiabilité avec laquelle un modèle pilote un outil tout au long d'une tâche agentique complète — lecture des résultats, décision de l'appel suivant, récupération après erreurs — plutôt que sa capacité à écrire une fonction unique. C'est important car la plus grande part des dépenses réelles en API sur les modèles frontières est consacrée aux boucles agentiques, et non aux complétions à un seul passage. Le score de 74,1 de Tencent sur ce benchmark est l'affirmation précise qui a introduit HY4 Preview dans la conversation de GPT-5.6 Sol, et il mérite qu'on s'y attarde un instant : c'est le genre de chiffre qui, s'il résiste à une réplication indépendante, rend concrète la conversation sur le coût entre modèles open-weight et frontières fermées. S'il ne résiste pas, il devient un autre palmarès de fournisseur qui s'évapore sous un harnais tiers.
Deux façons d'acheter de l'intelligence

• Paramètres — HY4 Preview 770B au total / 49B actifs, poids ouverts vs GPT-5.6 Sol, nombre de paramètres non divulgué, API fermée
• Contexte — HY4 Preview >1M de tokens vs GPT-5.6 Sol 1,05M de tokens, sortie maximale 128K
• Prix par 1M — HY4 Preview ¥6 en entrée / ¥18 en sortie (≈0,85 $ / 2,50 $) vs GPT-5.6 Sol 4,00 $ / 20,00 $ au niveau de base, passant à 8,00 $ / 30,00 $ pour les requêtes à grand contexte, lectures de cache 0,40 $
• Modalités d’entrée — HY4 Preview texte uniquement dans cet aperçu vs GPT-5.6 Sol entrée texte et image
• Modes de raisonnement — HY4 Preview n'a pas d'équivalent publié par rapport au mode Ultra de GPT-5.6 Sol (jusqu'à 16 sous-agents parallèles) et à l'effort de raisonnement maximal
• Vérification indépendante — HY4 Preview aucune pour l’instant vs GPT-5.6 Sol présent sur tous les principaux classements, avec un classement en contexte de 1,05M dans le haut du tableau des tests composites à long contexte.
La colonne des prix est là où se joue tout le match. Au niveau de base, GPT-5.6 Sol coûte 4,00 $ pour un million de jetons d'entrée et 20,00 $ pour un million de jetons de sortie. Tencent HY4 Preview coûte environ 0,85 $ et 2,50 $ aux taux de change actuels. Pour une charge de travail qui déplace beaucoup de jetons de sortie — ce que fait le codage agentique — le modèle open-weight est proposé à environ un huitième du prix du modèle fermé, et cet écart persiste même en tenant compte du fait que les chiffres de Sol sont accompagnés d'une bien plus grande vérification.
Là où GPT-5.6 Sol conserve encore son avantage.
La vérification est le premier atout. GPT-5.6 Sol est en disponibilité générale depuis le 9 juillet et a été mesuré indépendamment depuis : 88,8 sur Terminal-Bench 2.1 en raisonnement de base, 91,9 en mode Ultra, 53,6 sur Agents' Last Exam (un record à sa sortie), 94,6 sur GPQA Diamond, et 64,6 sur SWE-bench Pro. OpenAI rapporte également une amélioration de 54 % de l'efficacité des jetons sur les tâches de programmation agentique par rapport à son précédent fleuron. Ce sont des chiffres que vous pouvez trouver reproduits en dehors de la documentation d'OpenAI elle-même, ce qui est exactement la propriété qui manque aujourd'hui à Tencent HY4 Preview.
La capacité est le deuxième avantage, et il est structurel plutôt que marginal. GPT-5.6 Sol accepte les entrées d'images ; HY4 Preview est en texte uniquement dans cette préversion, Tencent reconnaissant que la vision devra attendre la version complète. GPT-5.6 Sol est doté du mode Ultra — une configuration multi-agents qui coordonne des sous-agents parallèles pour trois à quatre fois le coût en tokens, utile précisément pour les tâches d'ingénierie à long horizon où les deux modèles seraient réellement en concurrence. De plus, les voies d'utilisation de l'ordinateur et d'appel d'outils programmatiques de Sol sont documentées, utilisées à l'échelle de la production et testées en charge. La revendication Toolathlon-Verified de Tencent, si elle se confirme, réduit l'écart en matière d'utilisation d'outils ; elle ne comble pas les écarts multimodaux ou multi-agents, que HY4 Preview ne tente pas de combler.
Là où HY4 Preview est véritablement intéressant.
Mettons de côté le théâtre des benchmarks : il reste trois choses concrètes. Premièrement, le prix : à 6 ¥/18 ¥ — environ 0,85 $/2,50 $ — Tencent sous-cote tous les modèles frontières occidentaux sur les tokens de sortie d'un facteur quatre à huit, et sous-cote ses propres pairs chinois à poids ouverts sur les tokens d'entrée. Deuxièmement, les poids ouverts : un MoE à 49B de paramètres actifs est déployable sur un nœud unique, contrairement à l'architecture non divulguée de Sol qui ne le sera jamais, et les poids sont déjà sur HuggingFace, ModelScope et GitHub. Troisièmement, le contexte et la trajectoire d'ingénierie : DeepSWE 64.3 et une fenêtre de contexte de plus d'1M visent les mêmes charges de travail agentiques à long horizon que cible le mode Ultra de Sol, pour une fraction du coût.
La réserve honnête est que rien de tout cela n'a survécu au contact d'un benchmark indépendant. Le récit d'auto-optimisation que raconte Tencent — un gain de débit de bout en bout de 31,8 % grâce au modèle itérant sur sa propre pile d'inférence — est mesuré en interne. La victoire en test à l'aveugle contre GLM 5.3 et Kimi K3 est réalisée en interne. Toute chose intéressante concernant HY4 Preview n'est, aujourd'hui, qu'une affirmation.
La décision
Si vous construisez un système de production aujourd'hui, GPT-5.6 Sol est le choix défendable, et il est accessible via OrcaRouter au prix de liste par paliers d'OpenAI — $4.00/$20.00 au palier de base, $8.00/$30.00 au-dessus, répercuté sans aucune marge, de sorte que tout changement de prix du fournisseur s'applique de notre côté le jour même. Si votre flux de travail est agentique et fortement axé sur les outils, la structure par paliers signifie que vous devriez vérifier vos tailles d'entrée réelles par rapport au seuil de $272K-token plutôt que de supposer un tarif unique.
Si vous êtes prêt à mener une évaluation en mode miroir, HY4 Preview est assez peu coûteux pour mériter une véritable évaluation : faites transiter votre charge de travail d'appels d'outils par Sol dès aujourd'hui, exécutez les mêmes prompts sur HY4 Preview via l'API de Tencent elle-même, puis comparez sur vos propres tâches de type Toolathlon. Et si les scores indépendants correspondent à ce que Tencent annonce, le chemin de basculement est court — le modèle à poids ouverts s'intègre dans un routeur et votre règle de basculement permute les endpoints, le tarif ¥6/¥18 du fournisseur étant répercuté tel quel. Telle est la structure honnête de ce face-à-face : un modèle de pointe vérifié sur lequel vous pouvez bâtir dès aujourd'hui, face à un concurrent à poids ouverts non vérifié, assez abordable pour être testé et positionné pour faire du débat tarifaire un sujet concernant toute la catégorie des modèles à poids ouverts.


Que regarder
• La première réplication indépendante de Toolathlon-Verified. Si un harnais tiers confirme que HY4 Preview obtient des scores dans les 70, l'argument selon lequel « les poids ouverts ne peuvent pas faire d'utilisation d'outils agentique » s'effondre.
• Si Tencent déploie la vision avant la sortie complète d'Hy4. La version texte uniquement limite HY4 Preview à un sous-ensemble strict des charges de travail que GPT-5.6 Sol gère.
• Les factures de tokens réelles de la tendance à la réflexion longue de HY4 Preview. À 18 ¥ par million en sortie, une auto-vérification verbeuse ronge l'avantage de prix plus rapidement que sur un modèle à 20 $.
• Si la tarification par paliers de Sol subit une nouvelle baisse avant le lancement complet de Hy4. La répercussion sur un routeur signifie qu'une baisse est visible le jour même.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
