Carte de titre indiquant GPT-6 Astra vs Solar Pro 4, avec le sous-titre « Douze points d'indice, une fenêtre de 512K d'un côté, et un ratio de prix qui change le dimanche », sur une illustration générée de deux machines cubiques lumineuses avec des étiquettes de prix au bas
Guides & Insights

GPT-6 Astra vs Solar Pro 4 : Douze points d'indice et un ratio de prix qui change le dimanche

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Sur les deux évaluations menées indépendamment que ce duo a en commun, GPT-6 Astra devance Solar Pro 4 d’une large marge sur les connaissances générales et d’une marge plus étroite là où les modèles sont réellement utilisés. Artificial Analysis place GPT-6 Astra à 54,7 sur son Intelligence Index et à 96,1 sur GPQA Diamond ; le même évaluateur place Solar Pro 4 à 42 et 86,8. Sur les tâches agentiques, l’écart se réduit à onze et six points sur Terminal-Bench 2.1 et τ²-Banking. Par ailleurs, l’histoire du prix comporte une échéance que presque personne n’y a associée : la promotion actuelle de Solar Pro 4 se termine à 00:00 UTC le dimanche 11 octobre 2026, date à laquelle le modèle passe de 0,09 $ à 0,15 $ par million de jetons d’entrée et de 0,36 $ à 0,60 $ par million de jetons de sortie. Donc la question à laquelle cette comparaison doit répondre n’est pas de savoir quel modèle est meilleur. C’est de savoir si un écart de capacité d’environ douze points et demi justifie un tarif de sortie entre 42 et 139 fois plus élevé, et cette réponse est une propriété de votre charge de travail plutôt que de l’un ou l’autre des modèles.

Les grilles tarifaires, y compris celle qui change ce week-end

Le prix catalogue de Solar Pro 4 est de 0,30 $ pour l'entrée, 0,06 $ pour l'entrée mise en cache et 1,20 $ pour la sortie par million de tokens, et Upstage le propose en dessous du prix catalogue de façon continue depuis son lancement. Le barème figurant sur la page de tarification d'Upstage est explicite, il n'est donc pas nécessaire de deviner sur quel chiffre baser son budget :

• Promotion Upstage jusqu'au 11 octobre 2026, 00:00 UTC — 0,09 $ en entrée, 0,018 $ en cache, 0,36 $ en sortie pour 1 M de tokensbr /> • Promotion Upstage à partir du 11 octobre 2026 — 0,15 $ en entrée, 0,03 $ en cache, 0,60 $ en sortie pour 1 M de tokens, affichée sans date de fin, ce qui implique de prévoir un budget en conséquencebr /> • Tarif catalogue d'Upstage — 0,30 $ en entrée, 0,06 $ en cache, 1,20 $ en sortie pour 1 M de tokensbr /> • GPT-6 Astra jusqu'à 272 000 tokens en entrée — 10,00 $ en entrée, 1,00 $ en cache, 12,50 $ en écriture de cache, 50,00 $ en sortie pour 1 M de tokensbr /> • GPT-6 Astra au-delà de 272 000 tokens en entrée — 20,00 $ en entrée, 2,00 $ en cache, 25,00 $ en écriture de cache, 75,00 $ en sortie pour 1 M de tokens, appliqué à l'ensemble de la requête dès que le seuil est franchi

Lus comme des ratios, cela donne 11× en entrée et 5,6× en sortie aux tarifs post-promotion de Solar Pro 4, 33× et 42× par rapport à son prix catalogue, et 111× et 139× si les deux modèles sont mesurés sur les chiffres promotionnels actuels. L'écart est aussi grand parce que les deux côtés de la fraction bougent : la carte d'Astra est au sommet du marché et Solar Pro 4 se situe actuellement près du bas de celui-ci.

Les règles relatives au contexte long sont l’autre ligne qui mérite d’être lue deux fois, car elles ne sont pas symétriques. Le seuil d’Astra se situe à 272 000 tokens et sa règle consiste en une re-tarification de toute la requête — chaque token d’une requête longue est facturé au double du tarif d’entrée et à 1,5× le tarif de sortie, pas seulement les tokens au-delà de la limite. La fiche d’Upstage ne prévoit pas de palier équivalent, de sorte qu’une requête Solar Pro 4 de 400 000 tokens est facturée exactement au même tarif par token qu’une requête de 4 000 tokens. Si vos prompts dépassent régulièrement un quart de million de tokens, le tarif d’entrée effectif d’Astra est de 20,00 $ plutôt que de 10,00 $, et l’écart que vous payez se creuse précisément sur la charge de travail où un modèle à contexte 512K entre en concurrence.

D'où vient l'écart de douze points

Les deux modèles disposent de chiffres provenant de tiers, ce qui rend cette comparaison plus facile que la plupart dans cette catégorie. La tendance est cohérente entre eux : les gains de Solar Pro 4 par rapport à son propre prédécesseur étaient concentrés sur les tâches agentiques, et c’est là qu’il est le plus proche d’Astra.

• Intelligence Index — GPT-6 Astra 54,7, Solar Pro 4 42br /> • GPQA Diamond, science de niveau universitaire — Astra 96,1, Solar Pro 4 86,8br /> • Terminal-Bench 2.1, pilotage d'un vrai terminal — Astra 88,4, Solar Pro 4 75,1br /> • τ²-Banking, utilisation d'outils face aux politiques — Astra 41,4, Solar Pro 4 35,0br /> • Rappel de contexte long, AA-LCR — Astra 80,7, Solar Pro 4 71br /> • Coût d'exécution de la tâche d'évaluation moyenne — Astra 0,0516 $, Solar Pro 4 entre 0,0039 $ et 0,0155 $br /> • Temps d'horloge par tâche d'évaluation — Astra environ 8,6 minutes, sur un modèle qui renvoie environ 70 tokens par seconde

La ligne du coût par tâche est celle qui recadre le débat. Exécuter une seule tâche d’évaluation difficile sur Solar Pro 4 coûte entre quatre et treize cents selon le palier de promotion qui s’applique, contre cinq cents sur Astra aux tarifs standard. « Quarante-deux fois le prix de sortie » et « treize fois le coût par tâche » sont deux affirmations vraies au sujet de la même paire de modèles, et c’est la seconde qui apparaît sur une facture. La différence, c’est qu’Astra, selon les mesures d’Artificial Analysis, parvient à sa réponse en utilisant moins de tokens que le prédécesseur de Solar Pro 4 — 43 000 tokens de sortie par tâche — et qu’il reste le modèle le plus coûteux pour terminer une tâche, mais loin d’être 42× plus cher.

Deux réserves sur la colonne Solar Pro 4. Il est plus lent qu'Astra en termes de temps d'horloge par tâche, même s'il utilise moins de jetons, et ses scores agentiques publiés s'accompagnent d'une particularité qu'il vaut la peine de connaître : lors de l'évaluation de son prédécesseur, il a amélioré son score d'honnêteté en grande partie en refusant de répondre, ne tentant de répondre qu'à 41 % des questions contre 92 % pour Pro 3. Pour un agent qui doit agir, un refus est souvent préférable à une réponse fausse mais assurée — mais cela change la façon dont on lit toute comparaison de taux de réussite.

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

La comparaison qu'aucune de leurs cartes ne vous donne

Les lignes de référence ci-dessus sont appariées : chaque camp a réalisé la même évaluation. Les lignes absentes sont les plus intéressantes, car les deux fournisseurs ne s’accordent pas sur ce qu’il faut publier.

• Effort de raisonnement — Astra expose cinq niveaux nommés (low, medium, high, xhigh, max) ; Solar Pro 4 documente un reasoning_effort paramètre avec au moins un réglage medium, et la documentation d'Upstage sur cette échelle est mincebr /> • Architecture — Le nombre de paramètres d'Astra n'est pas divulgué ; celui de Solar Pro 4 non plus, si bien qu'aucune des deux parties n'offre la transparence sur l'économie de service que proposent leurs cadets moins chersbr /> • Comportement en contexte long sous charge — Astra publie un seuil de coût et un score de rappel documenté ; Upstage publie la fenêtre et aucune évaluation de rappel qui lui soit proprebr /> • Surface d'entrée — Astra accepte le texte, l'image et le fichier ; Solar Pro 4 est un modèle textebr /> • Plafond de modalité — 128 000 tokens de sortie maximum des deux côtés, ce qui est un endroit inhabituel pour qu'un modèle bon marché atteigne la parité et constitue la spécification la plus utile de la fiche technique de Solar Pro 4 pour les travaux de génération longue

La ligne sur l’effort de raisonnement compte plus qu’il n’y paraît. Un modèle qui vous permet de baisser le budget de réflexion est un modèle dont le prix effectif par requête facile est bien inférieur à son tarif affiché, car vous payez moins de jetons de raisonnement sur un travail qui n’en a pas besoin. Les deux fournisseurs exposent le paramètre ; aucun ne publie ce que les niveaux coûtent en jetons, ce qui signifie que le seul moyen de déterminer le véritable facteur multiplicateur entre ces deux modèles est de le mesurer sur votre propre trafic.

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

Le seuil de rentabilité, énoncé simplement

Ignorez un instant les points d’index et gardez la charge de travail fixe. Si votre application relève de l’extraction, de la classification, du résumé ou de la sortie structurée sur des documents allant jusqu’à un demi-million de jetons, Solar Pro 4 fait le travail à un tarif qu’Astra ne peut même pas approcher, et il n’a pas du tout besoin de l’échelle de raisonnement — aucune différence de qualité plausible dans une tâche d’extraction JSON ne vaut 42× sur la sortie. Si votre application est un agent à long horizon qui planifie, appelle des outils, se remet d’une étape échouée et doit finir, l’écart de onze points sur Terminal-Bench et l’écart de six points sur τ²-Banking sont les chiffres qui prédisent s’il finira, et une exécution d’agent échouée coûte le prix total de l’exécution, plus celui de la nouvelle tentative.

Le cas véritablement difficile est celui du milieu : des tâches de raisonnement courtes, ardues, à essai unique, où l'avantage d'Astra sur GPQA est important et où son coût par tâche ne représente encore que quelques centimes. Là, le facteur décisif n'est pas la grille tarifaire mais le nombre de tokens — et la seule mesure qui répond à cette question consiste à exécuter vos propres prompts sur les deux modèles et à lire les données d'utilisation. C'est aussi le cas où une baisse de prix frappe le plus fort, parce que le modèle le moins cher est celui que l'on teste face au modèle le plus cher, et qu'une variation de 67 % du tarif du modèle le moins cher change l'arithmétique du test entre lundi et aujourd'hui.

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

Pourquoi il s'agit d'une décision de routage plutôt que d'un bon de commande

GPT-6 Astra figure dans le catalogue OrcaRouter sous openai/gpt-6-astra aux tarifs catalogue d'OpenAI, répercutés avec 0 % de marge, ce qui explique précisément pourquoi une comparaison comme celle-ci se résout en une règle plutôt qu'en un contrat. La famille Solar d'Upstage est un cas de figure différent, et la formulation honnête est celle que nous employons toujours : OrcaRouter ne route aucun modèle Upstage, donc Solar Pro 4 n'est pas disponible ici — il provient de l'API propre d'Upstage et de plusieurs plateformes tierces, et la grille tarifaire ci-dessus est la leur, pas la nôtre.

Ce à quoi sert réellement un routeur dans ce couplage, c'est la répartition par niveau. Le modèle économique et le modèle coûteux se trouvent derrière un seul point de terminaison compatible OpenAI, une règle de routage dirige le trafic d'extraction vers le niveau qui lui convient, et le basculement automatique promeut un appel vers le modèle plus puissant lorsque le moins coûteux renvoie une erreur ou produit une sortie que votre parseur rejette. Ce dernier mécanisme est la réponse pratique au risque de mauvais routage que crée cette comparaison : le mode de défaillance coûteux n'est pas de choisir le mauvais modèle, mais de choisir le mauvais modèle et de le payer deux fois.

Que faire avant dimanche ?

Si Solar Pro 4 est un candidat pour votre stack, c’est la semaine la moins chère que vous obtiendrez pour le tester. Le tarif promotionnel reste en vigueur jusqu’à 00:00 UTC le 11 octobre, le tarif d’après-promotion de 0,15 $ et 0,60 $ est déjà un tiers en dessous du prix catalogue, et les éléments de preuve publiés par le modèle lui-même — les chiffres Terminal-Bench et τ²-Banking — décrivent un travail que vous pouvez reproduire sur votre propre ensemble de tâches en un après-midi. Exécutez les deux modèles sur les mêmes prompts, maintenez les paramètres de raisonnement constants, et enregistrez les tokens par tâche terminée plutôt que les tokens par appel. Le nombre qui en ressort est le seul multiple qui compte, et ce ne sera pas 42×. Décidez ensuite, en sachant que si le côté le moins cher gagne, le prix auquel vous le testiez expire dimanche — et si le côté le plus cher gagne, les douze points et demi d’indice sont ceux que vous payez.

GPT-6 Astra figure au catalogue d'OrcaRouter sous openai/gpt-6-astraaux tarifs catalogue d'OpenAI, répercutés avec 0 % de marge.