Une carte-titre principale pour la comparaison « Tencent HY4 Preview vs Qwen3.8-Max ». Une bannière centrale indique « Le face-à-face open-weight d'août », annotée « Deux fleurons open-weight, à 25 jours d'écart ». La carte de gauche « Tencent HY4 Preview » indique « 770B / 49B actifs, lancé le 28 août », « ¥6 / ¥18 par million », « Aucun score indépendant ». La carte de droite « Qwen3.8-Max » indique « 2,4T / ~95B actifs, lancé le 3 août », « 2,00 $ / 6,00 $ par million », « AA Index 58 ». Un pied de page indique « Les chiffres de HY4 Preview sont déclarés par le fournisseur ; les scores de Qwen3.8-Max selon Artificial Analysis. » Le logo OrcaRouter est incrusté dans le coin inférieur droit.
Guides & Insights

Tencent HY4 Preview vs Qwen3.8-Max : Le duel d'août des modèles à poids ouverts

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tencent HY4 Preview vs Qwen3.8-Max est la collision qui se préparait ce mois-ci. Le Qwen3.8-Max d'Ali​baba est passé en disponibilité générale le 3 août et est devenu le premier Qw​en de classe Max à poids ouverts le 12 août ; Tencent HY4 Preview a débarqué ce matin, 25 jours plus tard, avec une fiche de lancement qui nomme Qwen3.8-Max directement — Tencent annonce que HY4 Preview obtient 74,1 sur Toolathlon-Verified, devant Qwen3.8-Max sur ce benchmark. Les deux sont des fleurons chinois à poids ouverts, les deux sont tarifés pour se vendre, et un seul d'entre eux a des scores indépendants.

Les deux modèles sont séparés par plus que leur échelle — Qwen3.8-Max compte 2,4 billions de paramètres contre 770 milliards pour HY4 Preview — mais sur les benchmarks agentiques qui comptent pour un acheteur, ils visent la même cible : le travail à long horizon où un modèle lit, appelle des outils et itère sans humain dans la boucle. C'est exactement le territoire où la génération open-weight d'août cherche à prouver qu'elle peut remplacer les modèles frontières fermés, et la première initiative de Tencent a été de viser la plus grosse sortie open du mois.

Le tableau d'affichage

A two-column scoreboard titled 'Tencent HY4 Preview vs Qwen3.8-Max — the scoreboard'. Left column 'Tencent HY4 Preview': 'Total / active: 770B / 49B', 'Context: >1M tokens', 'Terminal-Bench 2.1: 85.4 (vendor-reported)', 'Toolathlon-Verified: 74.1 (vendor-reported)', 'Price: ¥6 / ¥18 per 1M', 'Independent score: none'. Right column 'Qwen3.8-Max': 'Total / active: 2.4T / ~95B', 'Context: 1M tokens', 'Terminal-Bench 2.1: 86.6', 'AA Agentic Index: 58', 'Price: $2.00 / $6.00 per 1M', 'Independent score: AA Intelligence 58'. Footer reads 'HY4 Preview figures are Tencent-reported and unreproduced; Qwen3.8-Max scores from Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

• Échelle — HY4 Preview 770B total / 49B actifs vs Qwen3.8-Max 2.4T total / ~95B actifs

• Contexte — HY4 Preview >1M tokens vs Qwen3.8-Max 1M tokens sur l'API (262K natifs en poids ouverts, extensible à ~1,01M)

• Prix par 1M — HY4 Preview ¥6 en entrée / ¥18 en sortie (≈$0.85 / $2.50) contre Qwen3.8-Max $2.00 en entrée / $6.00 en sortie, lectures de cache $0.25

• Terminal-Bench 2.1 — HY4 Preview 85.4 (rapporté par le fournisseur) vs Qwen3.8-Max 86.6

• Modalité — les deux sont uniquement textuels dans leurs versions à poids ouverts ; l’API Qwen3.8-Max ajoute les entrées d’image et de vidéo, tandis que HY4 Preview preview ne le fait pas.

• Score indépendant — HY4 Preview : aucun vs Qwen3.8-Max : AA Intelligence Index 58, Agentic Index 58

Les deux fiches racontent la même histoire sous des angles opposés. Sur Terminal-Bench 2.1, les 86,6 de Qwen3.8-Max et les 85,4 de HY4 Preview sont séparés par un point et demi — un point en faveur de Qwen, et le chiffre de HY4 n'est pas audité. Côté prix, HY4 Preview est moins cher à la fois en entrée et en sortie par jeton. Côté vérification, Qwen3.8-Max affiche un indice d'intelligence indépendant de 58 et un indice agentique de 58 ; HY4 Preview n'a que ses propres communiqués. Cet écart correspond au schéma classique d'un challenger qui arrive avec de meilleurs prix et des affirmations non prouvées face à un acteur établi et vérifié.

Lecture de la revendication Toolathlon

Toolathlon-Verified mesure la fiabilité de l'utilisation d'outils agentiques — avec quelle constance un modèle conduit un outil à travers une tâche complète comportant des erreurs, de la récupération et des appels en plusieurs étapes. Le 74.1 de Tencent vise directement le point le plus fort du profil de Qwen3.8-Max, car l'indice agentique de Qwen de 58 et son OSWorld-Verified de 86.1 sont les chiffres qui ont rendu crédible le discours agentique d'Alibaba. Qwen3.8-Max affiche également 82.8 sur IFBench (suivi d'instructions) et 93.0 sur PaperBench (travail agentique de niveau recherche), surpassant tous deux des modèles comme GPT-5.6 Sol dans les propres tableaux du fournisseur. Tencent a donc choisi le seul benchmark où il revendique une victoire directe sur le plus grand modèle ouvert du mois — et cette affirmation est actuellement aussi vérifiable que n'importe quelle autre ligne d'un seul fournisseur : pas du tout.

Vérifié vs signalé par le fournisseur

C'est l'axe où l'affrontement est le moins équitable, et l'asymétrie mérite d'être explicitée. L'indice d'intelligence de 58 du Qwen3.8-Max provient d'Artificial Analysis, son indice agentique de 58 provient d'Artificial Analysis, et les mêmes bancs d'essai indépendants qui lui ont attribué ces scores ont également mesuré ses faiblesses : un taux d'hallucination de 40 % sur AA-Omniscience, en hausse par rapport aux 23 % de la génération précédente, et un nombre considérable de 64 tours agentiques par tâche — le modèle travaille dur, et chaque tour se paie. Tencent HY4 Preview ne dispose d'aucune de ces mesures. Ses points forts relèvent d'affirmations, et ses modes d'échec — Tencent lui-même signale une réflexion longue et une sur-auto-vérification — sont des aveux, pas des mesures.

Pour une équipe qui doit choisir entre les deux, l'écart de vérification n'est pas abstrait. Le comportement de Qwen3.8-Max, avec ses 64 tours par tâche, est un facteur de coût réel et mesuré : à 2 $ / 6 $, il reste l'agent le plus cher par tâche accomplie dans certaines comparaisons de tiers, et des équipes ont signalé que le nombre de tours érode son avantage tarifaire. Le comportement équivalent de HY4 Preview est inconnu — il pourrait être moins cher par tâche que ne le suggère son prix déjà bas par jeton, ou son habitude d'auto-vérification pourrait engloutir la différence. Personne ne peut encore vous dire lequel, car personne en dehors de Tencent ne l'a exécuté.

Prix et aspects pratiques des poids ouverts

Par token, HY4 Preview est moins cher des deux côtés de l’équation : ¥6/¥18 contre 2,00 $/6,00 $ pour Qwen3.8-Max, et des cache hits à ¥0,3 contre 0,25 $. Cela fait de HY4 Preview le flagship open-weight le plus abordable tant en entrée qu’en sortie, point final. Mais les « open weights » s’accompagnent de deux ensembles de mentions en petits caractères. La publication des poids de Qwen3.8-Max — le Qwen3.8-2.4T-A95B — est en texte seul avec le raisonnement forcé, un contexte natif de 262K au lieu du 1M de l’API, et une licence personnalisée avec des conditions par paliers : exigences d’affichage du nom du modèle au-delà de 100 millions d’utilisateurs mensuels, et une licence séparée pour les grandes entreprises de Model-as-a-Service. Les poids de Tencent HY4 Preview sont sur HuggingFace, ModelScope et GitHub depuis ce matin, mais ses conditions de licence exactes et la correspondance entre les poids et l’API servie n’ont pas été précisées avec ce niveau de clarté. Les deux modèles sont téléchargeables ; aucun n’est trivial à intégrer.

En résumé

Qw{{1}}en{{/1}}3.8-Max est le choix le plus sûr dans tous les domaines où la vérification apporte de la sécurité : évalué indépendamment sur l'intelligence et le travail agentique, modes de défaillance connus, licence stable, et trois semaines de retours en production. C'est aussi le choix le plus cher par jeton, et son comportement mesuré, très gourmand en tours de dialogue, représente un risque de coût connu. Tencent HY4 Preview est le pari valeur : moins cher en entrée comme en sortie, revendication Terminal-Bench comparable, et une revendication Toolathlon-Verified directe contre Qw{{1}}en{{/1}} — tout cela non vérifié dès le premier jour. Si vous mettez un modèle open-weight en production cette semaine, Qw{{1}}en{{/1}}3.8-Max est le choix défendable et il est disponible sur OrcaRouter au prix catalogue d'Ali{{2}}baba{{/2}} — $2.00/$6.00, répercuté sans marge. HY4 Preview est le projet d'évaluation : exécutez-le via l'API de Tencent sur vos propres tâches de type Toolathlon, gardez le chemin de production sur le modèle vérifié, et quand les scores indépendants arriveront — ou quand HY4 Preview atteindra un routeur et que son tarif de ¥{{3}}6/¥18{{/3}} sera répercuté le jour même — le changement est une règle de routage, pas une réécriture.

A screenshot of the Artificial Analysis Intelligence Index leaderboard (captured August 28, 2026) showing Claude Opus 5 (max) and Claude Opus 5 (xhigh) at the top of the ranking, followed by Claude Fable 5 (with fallback) and GPT-5.6 Sol (max). Qwen3.8-Max is indexed further down and outside this capture. Tencent HY4 Preview does not appear: it launched today and has no independent index.A screenshot of the OrcaRouter model page for Qwen3.8-Max (qwen/qwen3.8-max) showing text, image and video input chips, a 1M-token context window, $2.00 per 1M input tokens and $6.00 per 1M output tokens, released August 3 2026.

Que regarder

• La première exécution indépendante de HY4 Preview sur un harnais agentique. Le 74.1 vérifié par Toolathlon est le chiffre que Tencent veut atteindre ; un indice agentique tiers serait la confirmation.

• Le nombre de tours mesuré de HY4 Preview. Les 64 tours par tâche de Qwen3.8-Max servent de mise en garde ; la question de savoir si HY4 Preview est moins cher par tâche accomplie constitue tout l'argument économique.

• Les conditions de licence sur les poids. Elles détermineront si « open » signifie « utilisable à votre échelle » pour HY4 Preview, comme les conditions de la licence Qwen3.8-Max l'ont fait pour le modèle d'Ali​baba.

• Que l'un ou l'autre fournisseur baisse à nouveau ses prix. Dans un mois où deux modèles phares à poids ouvert ont été lancés avec des prix agressifs, la répercussion sur un routeur rend toute nouvelle baisse visible le jour même.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube