Carton-titre portant l'inscription « GPT-6 Astra vs Tencent HY4 Preview », avec le texte d'accompagnement « Les chiffres d'un modèle ont été vérifiés par quelqu'un d'autre. Ce n'est pas le cas de l'autre — et 64 000 jetons de sortie, c'est là que le côté bon marché s'arrête », sur une illustration générée représentant un cube certifié scellé à côté d'un cube ouvert aux couches visibles
Guides & Insights

GPT-6 Astra vs Tencent HY4 Preview : un modèle dispose d'une piste d'audit et l'autre a un tableau de benchmarks

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Tencent HY4 Preview et GPT-6 Astra sont les deux voies les moins chères vers un codage agentique proche de la frontière disponibles aujourd'hui si l'on en croit les chiffres des fournisseurs eux-mêmes, et ce sont les deux modèles les moins comparables de ce niveau si l'on en croit ceux de quiconque d'autre. Tencent HY4 Preview a été publié et open-sourcé le 28 août 2026 sous licence Apache 2.0, à 0,834 $ par million de jetons d'entrée et 2,501 $ par million de jetons de sortie, avec une architecture mixture-of-experts de 770 milliards de paramètres, une fenêtre de contexte qui dépasse le million de jetons et un plafond de sortie de 64 000 jetons. GPT-6 Astra est disponible en général depuis le 3 septembre 2026 à 10,00 $ et 50,00 $, avec une fenêtre de 1 050 000 jetons et une sortie maximale de 128 000. Les points forts d'Astra sont étayés par huit évaluations tierces publiées ; ceux de HY4 Preview le sont par les propres tests de Tencent sur le terminal, l'appel d'outils et l'évaluation en aveugle, et par rien d'autre. Cette asymétrie ne signifie pas que le modèle le moins cher est le plus faible. Elle signifie que l'une de ces deux comparaisons peut être vérifiée et que l'autre doit être crue, et que les décisions pratiques diffèrent en conséquence.

Ce que la version Apache 2.0 vous apporte réellement

La licence est la partie de cette comparaison qu'une grille tarifaire ne peut pas exprimer. Tencent HY4 Preview n'est pas un aperçu hébergé avec une image de marque open-weight — les poids sont téléchargeables depuis Hugging Face, GitHub, ModelScope et GitCode, ce qui signifie que le modèle survit à toute décision que Tencent prend concernant sa propre tarification, son propre endpoint ou son propre intérêt à continuer de le servir.

• Architecture — 770B paramètres au total, 49B actifs par token, 78 couches, 256 experts routés plus un expert partagé, et une couche native de prédiction multi-token pour le décodage spéculatifbr /> • Caractéristiques de service — 54,6 jetons de sortie par seconde et un temps médian jusqu'au premier token de 6,26 secondes, mesurés sur les routes d'OrcaRouter sur une fenêtre glissante de sept joursbr /> • Contexte et plafond — une fenêtre de 1 048 576 tokens pour une sortie maximale de 64 000 tokensbr /> • Surface d'entrée — texte uniquement ; ni image, ni fichier, ni audiobr /> • Contrôle du raisonnement — trois niveaux, high, low et none, high étant la valeur par défaut, plus une recommandation d'échantillonnage documentée : temperature 0.9 et top_p 1.0br /> • Fiabilité — un taux d'erreur de 2,8 % sur la même fenêtre de sept jours, contre 10,3 % sur la route Astra

Cette dernière paire de chiffres est ce qu’il y a de plus exploitable sur cette page, et c’est le genre de chiffre qu’aucun fournisseur ne publie à propos de son propre modèle. Les scores d’Astra aux benchmarks indépendants sont plus élevés, et sa route échoue sur environ une requête sur dix depuis une semaine, tandis qu’un modèle dépourvu de tout score indépendant échoue sur une sur trente-cinq. Aucun de ces chiffres ne dit quoi que ce soit sur les modèles eux-mêmes — les taux d’erreur mesurent la route, les limites de débit et l’amont, pas les poids — mais ce sont les chiffres qu’un système en production rencontre réellement.

Comparison card with two columns. GPT-6 Astra: $10.00/$50.00 per 1M, cached input $1.00, $20.00/$75.00 whole-request reprice above 272K input, 1,050,000 context / 128,000 max output, 54.7 index and 88.4 Terminal-Bench 2.1 third-party, 10.3% error and 70.6 tok/s over a rolling seven-day OrcaRouter route window. Tencent HY4 Preview: $0.834/$2.501 per 1M, cached input $0.042, 770B MoE with 49B active and Apache 2.0 weights, 1,048,576 context / 64,000 max output, 85.4 Terminal-Bench 2.1 and 74.1 Toolathlon vendor-reported with no independent index, 2.8% error and 54.6 tok/s over the same window

Où les chiffres de Tencent peuvent être recoupés avec ceux de quelqu'un d'autre

Pour autant que les preuves publiées le montrent, il s’agit d’une occasion véritablement inhabituelle : Astra et HY4 Preview ont tous deux un chiffre Terminal-Bench 2.1, et un seul d’entre eux est rapporté par le fournisseur.

• Terminal-Bench 2.1, en pilotant un véritable terminal — GPT-6 Astra 88,4, évalué indépendamment ; Tencent HY4 Preview 85,4, déclaré par le fournisseurbr /> • Appel d'outils — Astra 41,4 sur τ²-Banking, évalué indépendamment ; HY4 Preview 74,1 sur Toolathlon-Verified, déclaré par le fournisseur, sur un test différentbr /> • Ingénierie logicielle — HY4 Preview 64,3 sur DeepSWE, contre 28,0 pour son prédécesseur Hy3, déclaré par le fournisseurbr /> • Tâches d'agent — HY4 Preview 37,1 pass@1 sur APEX-Agents, déclaré par le fournisseurbr /> • Préférence humaine — une moyenne de 2,99 sur 4,00 pour 203 tâches d'ingénierie notées par 163 experts, réalisée par le fournisseur, contre 2,92 pour GLM-5.3 et 2,94 pour Kimi K3br /> • Indice indépendant — GPT-6 Astra 54,7 à l'Intelligence Index et 96,1 à GPQA Diamond, par un tiers ; il n'existe pas d'indice équivalent pour HY4 Preview

La ligne Terminal-Bench est celle sur laquelle il vaut la peine de s'attarder. Un écart de 3 points entre un 88,4 indépendant et un 85,4 rapporté par le fournisseur se situe bien dans la plage qu'un harnais différent, un échafaudage différent ou une température d'échantillonnage différente peuvent produire, ce qui signifie que la lecture honnête n'est pas « Astra est meilleur de trois points » mais « le modèle à poids ouverts le moins cher de ce palier revendique la parité, et cette revendication est au moins plausible ». La formulation de Tencent elle-même est prudente sur ce point : elle décrit DeepSWE comme « réduisant progressivement l'écart » plutôt que le comblant, et sa seule revendication de parité claire — l'égalité sur Terminal-Bench avec un modèle fermé de premier plan d'un autre fournisseur — est exactement celle qui a le plus besoin d'une seconde mesure.

Il y a aussi un changement qu'il vaut la peine de connaître, car il déplace l'économie plutôt que les scores. Le 7 septembre 2026, Tencent a déployé une optimisation dans le build d'aperçu en direct dont il affirme qu'elle réduit les tours de raisonnement et la consommation de tokens par tâche sur les travaux complexes. Comme le modèle facture au token, moins de tokens par tâche terminée réduit le coût de la tâche, même si le tarif par token n'a pas bougé. L'ampleur de cette économie est une mesure de Tencent elle-même et personne en dehors de Tencent ne l'a reproduite — mais le mécanisme est réel et c'est la raison pour laquelle un aperçu publié en août peut être sensiblement moins cher à exploiter en octobre que ne le laissait entendre sa note de lancement.

Le plafond de 64 000 tokens est la caractéristique qui détermine les déploiements

À mi-chemin dans la fiche technique se trouve la contrainte qui se fait sentir en premier, et ce n’est pas la qualité. La sortie maximale de HY4 Preview est de 64 000 tokens, contre 128 000 pour Astra, sur un modèle dont l’objectif annoncé est les agents de codage et les longues chaînes d’utilisation d’outils. Un fichier généré, un patch multi-fichiers, un long rapport structuré — ce sont les sorties qui atteignent un plafond, et lors d’une exécution d’agent, l’échec n’est pas une réponse légèrement moins bonne, mais une réponse tronquée que le pipeline environnant doit détecter et gérer.

Les deux modèles absorbent environ un million de tokens en entrée, donc sur le cas de la lecture de documents, c'est véritablement match nul. La différence se situe entièrement du côté de la génération, et il s'agit d'un facteur deux, pas d'une erreur d'arrondi. Ajoutez à cela la différence au niveau des entrées — Astra accepte les images et les fichiers, HY4 Preview est limité au texte — et le tableau qui se dessine est une répartition claire des tâches plutôt qu'un classement : le modèle à poids ouverts pour les boucles d'agents en entrée texte / sortie texte où le livrable est un appel d'outil ou un diff, et le modèle fermé pour tout ce qui doit regarder quelque chose ou écrire quelque chose de long.

Ce que permet d’obtenir un débit de sortie 20×, ligne par ligne

• Prix d'entrée — Tencent HY4 Preview 0,834 $ par million contre GPT-6 Astra 10,00 $, environ 12×br /> • Prix de sortie — HY4 Preview 2,501 $ par million contre Astra 50,00 $, environ 20×br /> • Entrée mise en cache — HY4 Preview 0,042 $ par million contre Astra 1,00 $, environ 24×br /> • Palier pour requêtes longues — Astra refacture toute la requête au-delà de 272 000 jetons d'entrée à 20,00 $ et 75,00 $ ; la fiche tarifaire de HY4 Preview n'a pas de palier équivalentbr /> • Tarif effectif des entrées pour une invite de 400 000 jetons — HY4 Preview inchangé à 0,834 $ contre 20,00 $ pour Astra, environ 24×br /> • Coût par million de jetons d'une boucle d'agent ordinaire, 4:1 entrées/sorties — HY4 Preview environ 1,17 $ contre Astra environ 18,00 $br /> • Coût d'un mois de 100 millions de jetons au même ratio — HY4 Preview environ 117 $ contre Astra environ 1 800 $

La ligne des entrées mises en cache est celle qui évolue le plus mal du côté coûteux, car les boucles d'agents renvoient le même prompt système et le même préfixe de conversation à chaque tour. À 0,042 $ contre 1,00 $, les tokens les moins chers d'une longue boucle sont 24 fois moins chers sur le modèle Tencent, ce qui correspond précisément à la charge de travail où une petite différence par token se cumule le plus vite. Le coût par tâche, la métrique qui trancherait proprement, n'est pas publié du tout par Tencent — le seul moyen d'obtenir le chiffre qui compte est donc de faire tourner les deux modèles sur votre propre jeu de tâches et de lire l'objet d'utilisation.

Text card headed 'The 64,000-token ceiling decides more deployments than quality does' with rows: max output 128,000 on GPT-6 Astra vs 64,000 on Tencent HY4 Preview; context 1,050,000 vs 1,048,576; input surface text image file vs text only; what breaks first is a generated file or multi-file patch; failure mode is silent truncation

Ce qu'un routeur apporte ici, avec les taux d'erreur en main

Les deux modèles figurent au catalogue OrcaRouter — tencent/hy4-preview et openai/gpt-6-astra — derrière un seul point de terminaison compatible OpenAI, chacun au tarif catalogue propre à son fournisseur, répercuté avec 0 % de marge. Ce dernier détail compte davantage pour ce duo que pour la plupart des autres, car le tarif catalogue du modèle Tencent est publié en yuans : les montants en dollars ci-dessus correspondent au taux converti que vous voyez réellement, et non à une marge de revendeur ; et si Tencent modifie le prix, le changement est effectif ici le jour même plutôt qu'à la prochaine reconduction de contrat.

Le DSL de routage est le point où les deux modèles cessent d'être des alternatives. La règle naturelle pour ce duo est l'escalade en sortie : envoyer la boucle au modèle bon marché, et lorsqu'une réponse revient tronquée par rapport au plafond de 64 000 tokens ou échoue à votre vérification de schéma, relancer cette étape sur openai/gpt-6-astra, qui dispose de deux fois plus de marge de sortie. Le basculement automatique constitue l'autre moitié de l'argument, et il n'a rien de théorique quand l'une des deux routes renvoie des erreurs sur une requête sur dix depuis une semaine — une longue exécution d'agent figée sur un seul modèle meurt avec son contexte accumulé, et aucun de ces deux modèles n'est assez bon marché pour être relancé depuis le début par accident.

Text card headed 'Checked by somebody else, or checked by the vendor' with rows: GPT-6 Astra 54.7 Intelligence Index against none published for HY4 Preview; Terminal-Bench 2.1 88.4 independently evaluated vs 85.4 Tencent-reported; Tencent's 7 September reasoning-turn optimisation, unreproduced outside the vendor; and route error 10.3% on the Astra route vs 2.8% on the HY4 route over a rolling seven-day window

Qu'est-ce qui changerait cette comparaison

Trois éléments, par ordre de l’impact qu’ils auraient. Une évaluation indépendante de HY4 Preview — le modèle est public depuis six semaines, ne dispose d’aucun indice tiers, d’aucun chiffre Terminal-Bench reproduit et d’aucune donnée de coût par tâche, et la seule évaluation à l’aveugle menée par le fournisseur est l’unique donnée de préférence humaine existante. Un coût publié par tâche terminée pour les deux modèles, qui remplacerait chaque ratio de cet article par un seul chiffre. Et une décision de Tencent sur l’inférence par des tiers, car les poids Apache 2.0 peuvent être servis par n’importe qui, et dès que des hébergeurs concurrents déploieront HY4 Preview, le prix du côté le moins cher de cette comparaison deviendra un marché plutôt qu’un tarif catalogue.

D'ici là, le résumé exploitable est plus étroit que l'article de lancement de l'un ou l'autre fournisseur et plus honnête qu'un tableau de scores : GPT-6 Astra est le modèle dont les affirmations de capacités ont été vérifiées, avec un plafond de sortie deux fois plus élevé et une route sur laquelle une requête sur dix échoue. Tencent HY4 Preview est le modèle dont les affirmations de capacités n'ont pas été vérifiées, avec une architecture publiée, une licence ouverte, un tiers du prix et un taux d'erreur bien plus faible sur la même période. Si votre travail est du texte en entrée, du texte en sortie et tient dans 64 000 jetons générés, le modèle le moins cher n'est pas un compromis — c'est la bonne réponse, et la piste d'audit est la seule chose à laquelle vous renoncez.

La règle naturelle pour ce duo, c'est l'escalade en sortie : envoyez la boucle au modèle peu coûteux, et lorsqu'une réponse revient tronquée par rapport au plafond de 64 000 tokens ou échoue à votre contrôle de schéma, réessayez cette étape avec openai/gpt-6-astra, qui dispose de deux fois plus d'espace de sortie.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement