Une carte de titre héroïque pour la comparaison « Tencent HY4 Preview vs GPT-5.6 Sol ». Un point central indique « Toolathlon-Vérifié 74.1 – la revendication open-weight contre la frontière », avec la note « Tencent annonce que son modèle devance GPT-5.6 Sol sur l’appel d’outils agentique ». La carte de gauche « Tencent HY4 Preview » liste « Poids ouverts, 770B / 49B actifs », « ¥6 / ¥18 par 1M », « Aucun score indépendant ». La carte de droite « GPT-5.6 Sol » liste « API fermée, fleuron d’OpenAI », « $4 / $20 de base par 1M », « Terminal-Bench 2.1 : 88.8 ». Un pied de page indique « Chiffres de HY4 Preview fournis par le vendeur ; chiffres de Sol largement reproduits. » Le logo OrcaRouter est composé dans le coin inférieur droit.
Guides & Insights

Tencent HY4 Preview vs GPT-5.6 Sol : la revendication d'appel d'outils qui oppose les poids ouverts aux modèles de pointe

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tencent HY4 Preview est le premier modèle open-weight depuis des mois dont la fiche de lancement revendique explicitement une victoire sur GPT-5.6 Sol. Le chiffre en question est Toolathlon-Verified, un benchmark pour l'appel d'outils agentique, sur lequel Tencent rapporte HY4 Preview à 74,1 — devant Qwen3.8-Max et, selon la propre comparaison de Tencent, devant GPT-5.6 Sol. Sur toutes les autres dimensions, les deux modèles ne sont pas vraiment comparables : GPT-5.6 Sol est le modèle de pointe d'Ope​nAI — fermé, phare, mesuré indépendamment — tandis que Tencent HY4 Preview est un aperçu open-weight de 770 milliards de paramètres publié ce matin avec un tableau de scores fourni par le fournisseur et aucune vérification par un tiers.

Donc la question intéressante n'est pas « quel modèle est le plus intelligent » — mais de savoir si un challenger à poids ouverts, à environ un sixième du prix d'entrée de Sol, peut légitimement revendiquer une part de la frontière, et ce qu'une équipe devrait faire d'une revendication actuellement invérifiable.

L'affirmation qui fait de ceci une véritable confrontation.

Toolathlon-Verified mesure la fiabilité avec laquelle un modèle pilote un outil tout au long d'une tâche agentique complète — lecture des résultats, décision de l'appel suivant, récupération après erreurs — plutôt que sa capacité à écrire une fonction unique. C'est important car la plus grande part des dépenses réelles en API sur les modèles frontières est consacrée aux boucles agentiques, et non aux complétions à un seul passage. Le score de 74,1 de Tencent sur ce benchmark est l'affirmation précise qui a introduit HY4 Preview dans la conversation de GPT-5.6 Sol, et il mérite qu'on s'y attarde un instant : c'est le genre de chiffre qui, s'il résiste à une réplication indépendante, rend concrète la conversation sur le coût entre modèles open-weight et frontières fermées. S'il ne résiste pas, il devient un autre palmarès de fournisseur qui s'évapore sous un harnais tiers.

Deux façons d'acheter de l'intelligence

A two-column scoreboard titled 'Tencent HY4 Preview vs GPT-5.6 Sol — the scoreboard'. Left column 'Tencent HY4 Preview': 'Params: 770B / 49B active, open weights', 'Context: >1M tokens', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'APEX-Agents: 37.1', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'GPT-5.6 Sol': 'Params: undisclosed, closed API', 'Context: 1.05M tokens, 128K max output', 'Terminal-Bench 2.1: 88.8 (91.9 Ultra)', 'Agents' Last Exam: 53.6', 'Price: $4 / $20 base per 1M', 'Independent score: on all major leaderboards'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; GPT-5.6 Sol figures widely reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

• Paramètres — HY4 Preview 770B au total / 49B actifs, poids ouverts vs GPT-5.6 Sol, nombre de paramètres non divulgué, API fermée

• Contexte — HY4 Preview >1M de tokens vs GPT-5.6 Sol 1,05M de tokens, sortie maximale 128K

• Prix par 1M — HY4 Preview ¥6 en entrée / ¥18 en sortie (≈0,85 $ / 2,50 $) vs GPT-5.6 Sol 4,00 $ / 20,00 $ au niveau de base, passant à 8,00 $ / 30,00 $ pour les requêtes à grand contexte, lectures de cache 0,40 $

• Modalités d’entrée — HY4 Preview texte uniquement dans cet aperçu vs GPT-5.6 Sol entrée texte et image

• Modes de raisonnement — HY4 Preview n'a pas d'équivalent publié par rapport au mode Ultra de GPT-5.6 Sol (jusqu'à 16 sous-agents parallèles) et à l'effort de raisonnement maximal

• Vérification indépendante — HY4 Preview aucune pour l’instant vs GPT-5.6 Sol présent sur tous les principaux classements, avec un classement en contexte de 1,05M dans le haut du tableau des tests composites à long contexte.

La colonne des prix est là où se joue tout le match. Au niveau de base, GPT-5.6 Sol coûte 4,00 $ pour un million de jetons d'entrée et 20,00 $ pour un million de jetons de sortie. Tencent HY4 Preview coûte environ 0,85 $ et 2,50 $ aux taux de change actuels. Pour une charge de travail qui déplace beaucoup de jetons de sortie — ce que fait le codage agentique — le modèle open-weight est proposé à environ un huitième du prix du modèle fermé, et cet écart persiste même en tenant compte du fait que les chiffres de Sol sont accompagnés d'une bien plus grande vérification.

Là où GPT-5.6 Sol conserve encore son avantage.

La vérification est le premier atout. GPT-5.6 Sol est en disponibilité générale depuis le 9 juillet et a été mesuré indépendamment depuis : 88,8 sur Terminal-Bench 2.1 en raisonnement de base, 91,9 en mode Ultra, 53,6 sur Agents' Last Exam (un record à sa sortie), 94,6 sur GPQA Diamond, et 64,6 sur SWE-bench Pro. Ope​nAI rapporte également une amélioration de 54 % de l'efficacité des jetons sur les tâches de programmation agentique par rapport à son précédent fleuron. Ce sont des chiffres que vous pouvez trouver reproduits en dehors de la documentation d'Ope​nAI elle-même, ce qui est exactement la propriété qui manque aujourd'hui à Tencent HY4 Preview.

La capacité est le deuxième avantage, et il est structurel plutôt que marginal. GPT-5.6 Sol accepte les entrées d'images ; HY4 Preview est en texte uniquement dans cette préversion, Tencent reconnaissant que la vision devra attendre la version complète. GPT-5.6 Sol est doté du mode Ultra — une configuration multi-agents qui coordonne des sous-agents parallèles pour trois à quatre fois le coût en tokens, utile précisément pour les tâches d'ingénierie à long horizon où les deux modèles seraient réellement en concurrence. De plus, les voies d'utilisation de l'ordinateur et d'appel d'outils programmatiques de Sol sont documentées, utilisées à l'échelle de la production et testées en charge. La revendication Toolathlon-Verified de Tencent, si elle se confirme, réduit l'écart en matière d'utilisation d'outils ; elle ne comble pas les écarts multimodaux ou multi-agents, que HY4 Preview ne tente pas de combler.

Là où HY4 Preview est véritablement intéressant.

Mettons de côté le théâtre des benchmarks : il reste trois choses concrètes. Premièrement, le prix : à 6 ¥/18 ¥ — environ 0,85 $/2,50 $ — Tencent sous-cote tous les modèles frontières occidentaux sur les tokens de sortie d'un facteur quatre à huit, et sous-cote ses propres pairs chinois à poids ouverts sur les tokens d'entrée. Deuxièmement, les poids ouverts : un MoE à 49B de paramètres actifs est déployable sur un nœud unique, contrairement à l'architecture non divulguée de Sol qui ne le sera jamais, et les poids sont déjà sur HuggingFace, ModelScope et GitHub. Troisièmement, le contexte et la trajectoire d'ingénierie : DeepSWE 64.3 et une fenêtre de contexte de plus d'1M visent les mêmes charges de travail agentiques à long horizon que cible le mode Ultra de Sol, pour une fraction du coût.

La réserve honnête est que rien de tout cela n'a survécu au contact d'un benchmark indépendant. Le récit d'auto-optimisation que raconte Tencent — un gain de débit de bout en bout de 31,8 % grâce au modèle itérant sur sa propre pile d'inférence — est mesuré en interne. La victoire en test à l'aveugle contre GLM 5.3 et Kimi K3 est réalisée en interne. Toute chose intéressante concernant HY4 Preview n'est, aujourd'hui, qu'une affirmation.

La décision

Si vous construisez un système de production aujourd'hui, GPT-5.6 Sol est le choix défendable, et il est accessible via OrcaRouter au prix de liste par paliers d'Ope​nAI — $4.00/$20.00 au palier de base, $8.00/$30.00 au-dessus, répercuté sans aucune marge, de sorte que tout changement de prix du fournisseur s'applique de notre côté le jour même. Si votre flux de travail est agentique et fortement axé sur les outils, la structure par paliers signifie que vous devriez vérifier vos tailles d'entrée réelles par rapport au seuil de $272K-token plutôt que de supposer un tarif unique.

Si vous êtes prêt à mener une évaluation en mode miroir, HY4 Preview est assez peu coûteux pour mériter une véritable évaluation : faites transiter votre charge de travail d'appels d'outils par Sol dès aujourd'hui, exécutez les mêmes prompts sur HY4 Preview via l'API de Tencent elle-même, puis comparez sur vos propres tâches de type Toolathlon. Et si les scores indépendants correspondent à ce que Tencent annonce, le chemin de basculement est court — le modèle à poids ouverts s'intègre dans un routeur et votre règle de basculement permute les endpoints, le tarif ¥6/¥18 du fournisseur étant répercuté tel quel. Telle est la structure honnête de ce face-à-face : un modèle de pointe vérifié sur lequel vous pouvez bâtir dès aujourd'hui, face à un concurrent à poids ouverts non vérifié, assez abordable pour être testé et positionné pour faire du débat tarifaire un sujet concernant toute la catégorie des modèles à poids ouverts.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback), with GPT-5.6 Sol (max) visible in the near-top rows — the only model in this matchup with an independent index. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol) showing a 1.05M-token context window, 128K max output, base pricing of $4.00 per 1M input and $20.00 per 1M output tokens, and a July 9 2026 release date.

Que regarder

• La première réplication indépendante de Toolathlon-Verified. Si un harnais tiers confirme que HY4 Preview obtient des scores dans les 70, l'argument selon lequel « les poids ouverts ne peuvent pas faire d'utilisation d'outils agentique » s'effondre.

• Si Tencent déploie la vision avant la sortie complète d'Hy4. La version texte uniquement limite HY4 Preview à un sous-ensemble strict des charges de travail que GPT-5.6 Sol gère.

• Les factures de tokens réelles de la tendance à la réflexion longue de HY4 Preview. À 18 ¥ par million en sortie, une auto-vérification verbeuse ronge l'avantage de prix plus rapidement que sur un modèle à 20 $.

• Si la tarification par paliers de Sol subit une nouvelle baisse avant le lancement complet de Hy4. La répercussion sur un routeur signifie qu'une baisse est visible le jour même.

Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube