Carte hero générée intitulée Claude Sonnet 5.5 vs Tencent HY4 Preview, avec pour sous-titre que les deux laboratoires facturent la note des tokens, avec trois cartes de statistiques : prix de sortie par million 10,00 $ vs 2,50 $, poids fermés vs Apache 2.0, et vitesse de sortie mesurée 138,7 vs 22,3 tokens par seconde, avec un pied de page indiquant le prix et la vitesse de Tencent HY4 Preview selon le catalogue d'OrcaRouter, liste du fournisseur 6 / 18 yuans par million ; Claude Sonnet 5.5 selon Anthropic.
Guides & Insights

Claude Sonnet 5.5 vs Tencent HY4 Preview : les deux laboratoires vendent la facture des tokens

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Deux lancements, à six semaines d'intervalle, qui font la même promesse avec des mots différents. L'affirmation du fournisseur est que Claude Sonnet 5.5, livré le 28 septembre 2026, coûte « jusqu'à 30 % de moins par tâche » que Claude Sonnet 5, à tarifs par token inchangés. La seconde affirmation est que l'optimisation du 7 septembre de la version hébergée de Tencent HY4 Preview, d'abord publiée et ouverte en open source le 28 août 2026, réduit le nombre de tours de raisonnement et la consommation de tokens par tâche à qualité de tâche égale. Aucun des deux fournisseurs n'a augmenté ou baissé un prix pour avancer cette affirmation. Les deux vous disent que les tokens sont désormais le produit, et le plus intéressant dans cette confrontation, c'est que seule l'une des deux affirmations peut être vérifiée par rapport à un chiffre publié par tâche — car seul l'un de ces deux modèles dispose d'une mesure indépendante pour la vérifier.

Cette asymétrie n’est pas une critique à l’encontre de Tencent. HY4 Preview n’a pas de page de modèle Artificial Analysis, pas de score indépendant à l’Intelligence Index, et aucun chiffre de coût par tâche provenant d’un tiers. Ce qu’il a, c’est un tableau de benchmarks du fournisseur — Terminal-Bench 2.1 à 85,4, DeepSWE 64,3, une évaluation interne en aveugle sur 203 tâches d’ingénierie où il a obtenu une moyenne de 2,99 face à 2,92 pour GLM-5.3 et 2,94 pour Kimi K3 — et une première apparition publique votée par la foule sur le classement WebDev Arena, où Tencent indique qu’il se classe autour de la cinquième place au classement général et à la troisième place parmi les modèles à poids ouverts. Tous ces éléments sont de véritables signaux. Aucun d’entre eux n’est un coût par tâche, ce qui signifie que le chiffre exact sur lequel les deux fournisseurs sont en concurrence est, pour HY4 Preview, indisponible.

Ce que chaque camp a réellement livré

Tencent HY4 Preview est un mélange d'experts de 770 milliards de paramètres, avec 49 milliards de paramètres actifs par token, 78 couches, 256 experts routés plus un expert partagé, une couche MTP native pour le décodage spéculatif, et une fenêtre de contexte qui dépasse le million de tokens. Il est uniquement textuel par conception — T​encent l'a conçu pour les agents de codage, l'utilisation complexe d'outils et le travail de productivité, et non pour les images — et il privilégie par défaut un raisonnement intensif, avec trois niveaux configurables (élevé, faible, aucun) et un réglage d'échantillonnage recommandé par le fournisseur : température 0,9 et top_p 1,0. Les poids sont sous Apache 2.0 et téléchargeables depuis Hugging Face, GitHub, ModelScope et GitCode. T​encent avait initialement signalé deux aspérités dans la préversion : passer plus de temps que nécessaire à réfléchir et sur-vérifier son propre travail. La mise à jour du 7 septembre cible précisément ces points.

Claude Sonnet 5.5 est le deuxième modèle de la génération 5.5 d'Anthropic et celui qu'Anthropic positionne comme la meilleure combinaison de vitesse et d'intelligence de la gamme. Un million de tokens de contexte, 128 000 tokens de sortie en mode synchrone et 300 000 via l'API Message Batches, des entrées texte, image et fichier, une réflexion adaptative à effort sélectionnable, une date de coupure des connaissances en juin 2026, une rétention zéro des données disponible dès le lancement, et un plancher de retrait au 28 septembre 2027. La grille tarifaire n'a pas changé par rapport à Claude Sonnet 5 : 2,00 $ par million de tokens d'entrée, 10,00 $ par million de tokens de sortie, 0,20 $ pour les lectures du cache et 2,50 $ pour les écritures dans le cache. Poids fermés, API Anthropic, ainsi que Bedrock, Google Cloud et Microsoft Foundry.

Alignez les deux l’un contre l’autre et les positions sont presque symétriques :

• Prix — Claude Sonnet 5.5 2,00 $ en entrée / 10,00 $ en sortie par million vs Tencent HY4 Preview 0,83 $ en entrée / 2,50 $ en sortie sur notre catalogue, à partir d'une liste de fournisseurs de 6 ¥ / 18 ¥

• Lectures de cache — Claude Sonnet 5.5 0,20 $ par million contre Tencent HY4 Preview 0,042 $ par million sur notre catalogue

• Poids — Claude Sonnet 5.5 fermé vs Tencent HY4 Preview Apache 2.0, téléchargeable

• Contexte — Claude Sonnet 5.5 1 000 000 de jetons vs Tencent HY4 Preview 1 048 576 jetons, en pratique identiques

• Sortie maximale — Claude Sonnet 5.5 128 000 en synchrone, 300 000 sur Batches contre Tencent HY4 Preview 64 000 sur notre catalogue

• Modalité d'entrée — Claude Sonnet 5.5 texte, image et fichier vs Tencent HY4 Preview texte uniquement

• Scores indépendants — Claude Sonnet 5.5 Intelligence Index 56 à 7,60 $ par tâche, révision v4.3.2 vs Tencent HY4 Preview : aucune publication

• Vitesse de sortie mesurée — Claude Sonnet 5.5 138,7 tokens/s contre Tencent HY4 Preview 22,3 tokens/s sur notre propre trafic

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Tencent HY4 Preview, the scoreboard, with six matched rows: output price $10.00 vs $2.50, cache read $0.20 vs $0.042, context window 1,000,000 vs 1,048,576 tokens, maximum output 128K and 300K on Batches vs 64K, input modality text, image and file vs text only, and weights closed vs Apache 2.0, with a footer reading Tencent HY4 Preview price per OrcaRouter's catalogue, vendor list 6 / 18 yuan per million; no independent scores published. Claude Sonnet 5.5 per Anthropic.

L'affirmation que formulent les deux laboratoires, et pourquoi l'un d'eux est vérifiable.

Le « 30 % de moins par tâche » d'Anthropic et le « moins de tours de raisonnement, une consommation de tokens réduite » de Tencent décrivent le même projet d'ingénierie vu sous deux angles : faire en sorte que le modèle dépense moins de tokens pour aboutir à la même réponse. Anthropic précise explicitement que les tarifs n'ont pas changé, ce qui signifie que toute économie par tâche doit provenir du nombre de tokens — et le classement indépendant permet de voir la forme du problème plutôt que l'ampleur de la correction. Claude Sonnet 5.5 génère 410 millions de tokens de sortie sur l'ensemble de l'évaluation Intelligence Index, contre 117 millions pour MiniMax M3 et 77 millions pour Grok 4.5. C'est un modèle verbeux, mesuré, sur un classement qui publie le chiffre. Quelle que soit l'ampleur de l'amélioration de 30 % par rapport à Claude Sonnet 5, elle s'applique à une base très importante.

Pour HY4 Preview, le chiffre équivalent n’existe pas publiquement. La note d’optimisation de T​encent elle-même est le seul compte rendu qui en existe, et elle énonce le résultat sans chiffre : moins de tours, moins de tokens en entrée et en sortie, même qualité, validée par des métriques de benchmark et une évaluation humaine en double passage. C’est une affirmation de fournisseur au sens strict — énoncée, plausible, non reproduite — et elle est étiquetée comme telle ici. Adopter un modèle preview sur la foi d’une affirmation de fournisseur concernant l’économie de tokens, alors que l’économie de tokens est précisément ce que l’on ne peut pas mesurer de l’extérieur, est exactement le pari qu’une version preview vous demande de faire.

Un autre écueil mérite d'être connu avant que quiconque planifie un déploiement auto-hébergé autour de cette optimisation. Le changement du 7 septembre de T​encent s'applique au build que T​encent sert sur ses propres points de terminaison hébergés. L'instantané à poids ouverts n'a pas été actualisé — la date de dernière modification du dépôt Hugging Face est toujours le 28 août — de sorte qu'une copie auto-hébergée des poids exécute le comportement d'origine, à raisonnement plus long, que les notes de préversion signalaient. La version optimisée et la version téléchargeable ne sont pas le même artefact.

Là où les poids ouverts s’avèrent réellement payants, c’est au même endroit que toujours : un déploiement qui ne peut pas appeler une API. Un modèle de 770B de paramètres dont 49B actifs relève d’une décision de datacenter plutôt que de station de travail, donc ce n’est pas le récit de classe portable que raconte un modèle 30B — mais pour un acheteur qui a besoin du modèle à l’intérieur de son propre périmètre, Apache 2.0 à cette échelle est une option que Claude Sonnet 5.5 n’offre à aucun prix.

Essayer un aperçu sans engager un chemin de production dessus

Les modèles en préversion sont le cas où le routage cesse d’être une optimisation des coûts pour devenir une maîtrise des risques. Si l’on place une build de préversion derrière un routeur plutôt que de l’appeler directement, c’est parce qu’une préversion se définit par la possibilité de changer sous vos pieds, et les deux choses que l’on attend de la couche placée devant elle sont une répartition en pourcentage et un moyen d’intercepter les défaillances.

Voilà la forme que propose OrcaRouter : un point de terminaison compatible OpenAI couvrant plus de 200 modèles, le prix catalogue du fournisseur répercuté sans marge ajoutée, un basculement automatique entre fournisseurs amont, et un DSL de routage pour composer des appels à partir de plusieurs modèles. Tencent HY4 Preview est routable ici dès aujourd'hui sous tencent/hy4-preview à 0,83 $ en entrée et 2,50 $ en sortie par million de tokens, avec 0,042 $ pour les lectures de cache sur sa fenêtre de 1 048 576 tokens — la même version, au tarif du fournisseur, accessible depuis la clé que vous utilisez déjà pour tout le reste du catalogue. Claude Sonnet 5 est routable ici aussi, aux 2,00 $ et 10,00 $ d'A​nthropic, et ce depuis le 30 juin ; il fait un partenaire de basculement évident pendant qu'un modèle vieux d'un jour accumule des preuves en production.

OrcaRouter model page for tencent/hy4-preview, dated 2026-08-28, showing the Tools, JSON and Reasoning badges, a 1M-token context window, text-only input, $0.83 input and $2.50 output per million tokens, a p50 time to first token of 3.71 s, and 372.4K tokens of recent traffic.

Claude Sonnet 5.5 lui-même ne figure pas dans notre catalogue. Il est sorti hier, la route vers lui passe par l’API d’Anthropic elle-même, et cette page ne va pas laisser entendre le contraire — l’idée derrière le conseil de routage est que la façon sûre d’exploiter un tout nouveau palier en production consiste à lui allouer une fraction de trafic adossée à quelque chose d’éprouvé, et cela ne fonctionne que si les deux extrémités de l’arrangement se trouvent dans un endroit accessible depuis un seul point. HY4 Preview achemine ici 372 000 tokens de trafic par semaine, ce à quoi ressemble un aperçu vieux de deux jours avant que quiconque s’y soit engagé ; Claude Sonnet 5 achemine 7,9 millions par semaine depuis le 30 juin, et c’est la différence entre un candidat et un socle.

OrcaRouter model page for anthropic/claude-sonnet-5, dated 2026-06-30, showing a 1M-token context window, 128K maximum output, text, image and file input, $2.00 input and $10.00 output per million tokens, a p50 time to first token of 4.87 s, and 7.9M tokens of recent traffic.

Où va réellement l'argent

Si l'on s'en tient aux seuls tarifs, HY4 Preview est quatre fois moins cher en sortie que Claude Sonnet 5.5 et presque cinq fois moins cher sur les lectures de cache, et il offre une fenêtre identique. Côté mesures, Claude Sonnet 5.5 génère ses sorties six fois plus vite sur notre propre trafic — 138,7 jetons par seconde contre 22,3 —, un écart de cet ordre qui transforme un avantage tarifaire de quatre fois en un avantage en temps d'horloge bien plus réduit, et parfois en une perte, dès lors que l'on tient compte de la mise en file d'attente.

Entre ces deux faits, la décision repose sur quatre questions auxquelles seul le lecteur peut répondre. Le travail nécessite-t-il une image ou un fichier dans le prompt ? HY4 Preview est limité au texte, et cela met fin au débat. Doit-il accomplir une tâche logicielle en plusieurs étapes, où le score de 85,4 de HY4 Preview à Terminal-Bench 2.1 est un chiffre de T​encent lui-même et non reproduit ? Alors le statut de préversion est le risque que vous acceptez, et l'optimisation du 7 septembre mérite d'être testée à nouveau plutôt que d'être prise pour acquise. La charge de travail doit-elle s'exécuter à l'intérieur de votre propre périmètre ? Alors les poids Apache 2.0 sont le fait décisif. Et le niveau de capacité composite importe-t-il davantage que le tarif ? Alors le 56 mesuré indépendamment de Claude Sonnet 5.5 est le chiffre à soupeser, à 7,60 $ par tâche Index, avec la réserve qu'aucun chiffre équivalent n'existe du côté de T​encent pour le comparer.

Ce que ces deux lancements démontrent vraiment, c’est que la frontière a dépassé les grilles tarifaires. Deux laboratoires, à six semaines d’intervalle, ont livré des modèles et mis en avant la consommation de tokens par tâche plutôt que le prix par million, et la conséquence pratique pour un acheteur est que le chiffre utile ne figure plus sur la page tarifaire de l’un ou l’autre fournisseur. C’est le nombre de tokens que votre propre charge de travail produit, mesuré sur les deux modèles, et c’est le seul chiffre de cet article qu’aucun des deux fournisseurs ne peut vous donner.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement