Une carte de titre générée pour la tarification de GPT-6 Astra, avec trois pastilles de statistiques affichant « Tarif catalogue : 10,00 $ en entrée / 1,00 $ en cache / 50,00 $ en sortie par million », « Traitement par lots : 5,00 $ / 25,00 $ - Mode rapide : 20,00 $ / 100,00 $ » et « Seuil de rentabilité par rapport à GPT-5.6 Sol : 40 % des tokens », avec en note de bas de page « Modèle publié le 3 septembre 2026. Tarifs relevés sur la page de tarification d'OpenAI le 16 septembre 2026. »
Guides & Insights

Tarification de GPT-6 Astra : pourquoi trois prix différents sont tous corrects, et combien coûte réellement une tâche

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

L'essentiel d'abord : GPT-6 Astra coûte 10,00 $ par million de jetons d'entrée, 1,00 $ par million de jetons d'entrée mis en cache et 50,00 $ par million de jetons de sortie sur le palier standard d'OpenAI. C'est le prix catalogue d'OpenAI lui-même, relevé sur la page tarifaire d'OpenAI le 16 septembre 2026 — et la date compte, car le modèle a été tarifé différemment à différents moments et les lecteurs continuent de tomber sur ces autres chiffres. GPT-6 Astra est lui-même sorti le 3 septembre 2026, treize jours avant cette page. Ce n'est ni un article de lancement ni un article d'annonce ; c'est la page de référence d'un modèle désormais en disponibilité générale et, depuis cette semaine, déployé de manière générale. GPT-5.6 Sol apparaît ci-dessous comme la référence de prix au-dessus de laquelle Astra est vendu, non comme le sujet.

La raison pour laquelle une grille tarifaire a besoin d’une page entière, c’est que les chiffres en circulation ne concordent pas. Cherchez le prix de ce modèle et vous trouverez 10 $/50 $ chez OpenAI, un tarif par lots de 5 $/25 $, Azure qui annonce à la fois 10 $/50 $ et 11 $/55 $, et au moins un point de terminaison affiché à 20 $/100 $. Aucun de ces montants n’est une faute de frappe, et aucun n’est le prix catalogue modifié en douce. Il s’agit de différents niveaux de service et de différents revendeurs, et savoir les distinguer fait toute la différence entre un budget et une supposition.

La grille tarifaire, avec chaque ligne étiquetée et datée.

Tout ce qui figure dans cette section a été lu dans la documentation tarifaire et la documentation relative aux modèles de l'API d'Ope​AI elle-même, en date du 16 septembre 2026. Lorsqu'un chiffre provient d'une autre source, la phrase qui le contient le précise.

Standard, requêtes d'au plus 272 000 jetons d'entrée — 10,00 $ par million de jetons d'entrée, 1,00 $ par million de jetons d'entrée mis en cache, 12,50 $ par million d'écritures de cache, 50,00 $ par million de jetons de sortie (grille tarifaire propre à Ope​nAI, consultée le 2026-09-16).

La ligne d’écriture de cache est bien réelle, et on la rate souvent — la première fois que vous envoyez un préfixe, il s’agit d’une écriture à 12,50 $ par 1 M, et non d’une lecture à 1,00 $. Les écritures de cache sont facturées à 1,25 fois le tarif d’entrée standard.

Standard, requêtes de plus de 272 000 jetons d'entrée — 20,00 $ par million de jetons d'entrée, 2,00 $ pour les jetons d'entrée mis en cache, 25,00 $ pour les écritures de cache, 75,00 $ pour les jetons de sortie. L'intégralité de la requête est refacturée, et non seulement les jetons qui dépassent le seuil (tableau de tarification d'Ope​nAI, consulté le 2026-09-16).

Batch and Flex — moitié du tarif standard : 5,00 $ en entrée, 0,50 $ en entrée mise en cache, 6,25 $ pour les écritures de cache, 25,00 $ en sortie par million (table de tarification d'Ope​nAI elle-même, consultée le 16/09/2026). Au-delà de 272K de tokens d'entrée, le tarif Batch est de 10,00 $ / 1,00 $ / 12,50 $ / 37,50 $.

Mode rapide — double du tarif standard : 20,00 $ en entrée, 2,00 $ en entrée mise en cache, 25,00 $ pour les écritures de cache, 100,00 $ en sortie par million (le propre tableau tarifaire d'Ope​nAI, consulté le 2026-09-16).

Caractéristiques du modèle qui déterminent la facture — fenêtre de contexte 1 050 000 jetons, entrée maximale 922 000, sortie maximale 128 000, date limite de connaissances 2026-04-30, prise en charge des jetons de raisonnement : oui, valeurs d'effort de raisonnement low / medium / high / xhigh / max (documentation officielle du modèle d'Ope​nAI, consultée le 2026-09-16).

Si vous voulez la version en une seule phrase : sur le niveau standard, une requête qui reste sous 272 K jetons d’entrée coûte 10 $ par million en entrée et 50 $ par million en sortie, les lectures en cache représentent un dixième du tarif d’entrée, et tout le reste dans cet article est soit une réduction pour accepter un traitement plus lent, soit un supplément pour franchir un seuil.

Pourquoi vous verrez un nombre différent, et lequel est lequel

Cinq éléments distincts produisent un devis qui n'est pas $10/$50. Quatre d'entre eux peuvent être rattachés à de la documentation ; un ne le peut pas, et nous le dirons plutôt que de deviner.

$5/$25 correspond au palier batch, et c’est le prix pratiqué par Ope​nAI lui-même. Il ne s’agit pas d’une remise de revendeur ni d’un tarif d’entreprise négocié. La page de tarification d’Ope​nAI indique le traitement batch à la moitié du tarif standard, et la ligne batch d’Astra indique 5,00 $ en entrée et 25,00 $ en sortie. Si une source vous annonce 5 $/25 $ comme s’il s’agissait d’un modèle différent, c’est le même modèle, les mêmes poids, sur la file d’attente plus lente. Le batch est la bonne réponse pour les exécutions d’évaluation nocturnes et la mauvaise réponse pour tout ce qui est interactif.

« $11/$55 correspond exactement à une majoration de 10 % sur le prix catalogue, et Ope​nAI documente une majoration de 10 % pour les points de terminaison de résidence. » La page tarifaire d’Ope​nAI indique que les points de terminaison de résidence sont facturés avec une majoration de 10 % pour les modèles publiés à partir du 5 mars 2026. GPT-6 Astra est sorti le 3 septembre 2026, il est donc concerné. Multipliez le prix catalogue par 1,1 et vous obtenez 11,00 $ et 55,00 $ au centime près. Cela explique bien d’où vient le devis plus élevé de type Azure — un point de terminaison lié à la résidence qui répercute une majoration documentée, plutôt qu’un revendeur qui inventerait une marge. Nous devons être précis sur la limite de cette affirmation : la majoration est documentée par Ope​nAI, et le calcul correspond exactement, mais l’offre Azure spécifique que nous avons vue n’indique pas elle-même qu’il s’agit d’un point de terminaison de résidence. Considérez cela comme l’explication probable, et non comme une explication confirmée.

$20/$100 correspond au tarif du mode Fast d’OpenAI pour ce modèle. C’est celui qui ressemble le plus à un chiffre bidon et qui l’est le moins. Le mode Fast double chaque ligne, et la ligne Fast standard d’Astra est de 20,00 $ en entrée et 100,00 $ en sortie par million. Un point de terminaison qui annonce 20 $/100 $ annonce un niveau de service différent — le traitement prioritaire — et non un prix catalogue différent ni un modèle différent. Si vous voyez ce chiffre à côté du nom d’Astra, la question à poser est de savoir quel niveau de traitement, et non quel fournisseur.

Il existe des prix inférieurs au prix catalogue, et ils constituent la marge de quelqu'un d'autre. Les passerelles et revendeurs tiers annoncent Astra en dessous du prix catalogue. Une passerelle affiche publiquement un prix environ 20 % inférieur au tarif d'Ope​nAI. C'est une décision commerciale de cet opérateur, et non un changement de prix d'Ope​nAI — et elle s'accompagne des conditions de traitement des données et de fiabilité que cet opérateur applique. Nous n'allons pas les nommer ni considérer leur remise comme une preuve du prix de ce modèle, car elle constitue une preuve au sujet de leur activité, et non de la grille tarifaire d'Ope​nAI.

Ce que nous n'avons pas pu vérifier. Nous avons vu une fiche de routeur indiquer le modèle comme gpt-6-astra, avec un palier batch à $5/$25 et un alias évolutif de la forme ~openai/gpt-astra-latest. Le chiffre du batch correspond à ce qui figure sur la page d'OpenAI. L'alias est une construction de passerelle : la documentation des modèles d'OpenAI ne répertorie qu'une seule entrée sous snapshots, et il s'agit du simple gpt-6-astra, sans forme datée ni alias -latest. Ne mettez pas un alias de passerelle dans une configuration comme si le fournisseur l'avait publié. Par ailleurs, nous n'avons trouvé aucune documentation OpenAI pour un niveau facturé séparément tel que « Astra Pro », « Astra-Medium » ou similaire. « Pro » apparaît dans la dénomination des offres ChatGPT, pas dans la grille tarifaire de l'API, et une fiche de routeur ne constitue pas de la documentation du fournisseur. Si vous avez besoin de faire confirmer un niveau, confirmez-le sur la page d'OpenAI.

A single-column rate-card graphic for GPT-6 Astra listing Input $10.00 per 1M, Cached input $1.00 per 1M, Cache writes $12.50 per 1M, Output $50.00 per 1M, Over 272K input $20.00 / $75.00 per 1M, and Batch tier $5.00 / $25.00 per 1M, footnoted 'OpenAI standard rates read September 16, 2026. Batch is half the standard rate.'

Astra aux côtés du reste de la grille tarifaire OpenAI

Un prix n’a de sens qu’à côté des alternatives figurant sur la même carte. Ce sont tous les tarifs standard d’OpenAI, tous relevés le 16 septembre 2026, tous par million de tokens, tous pour une entrée inférieure ou égale à 272 K.

GPT-6 Astra — 10,00 $ en entrée / 1,00 $ en cache / 12,50 $ en écriture / 50,00 $ en sortie.

GPT-5.6 Sol — 4,00 $ en entrée / 0,40 $ en cache / 5,00 $ en écriture / 20,00 $ en sortie.

GPT-5.6 Terra — 2,00 $ en entrée / 0,20 $ en cache / 2,50 $ en écriture / 12,00 $ en sortie.

GPT-5.6 Luna — 0,20 $ en entrée / 0,02 $ en cache / 0,25 $ en écriture / 1,20 $ en sortie.

Les versions à contexte long — Astra 20,00 $ / 2,00 $ / 25,00 $ / 75,00 $ ; Sol 8,00 $ / 0,80 $ / 10,00 $ / 30,00 $ ; Terra 4,00 $ / 0,40 $ / 5,00 $ / 18,00 $ ; Luna 0,40 $ / 0,04 $ / 0,50 $ / 1,80 $.

Il y a une promotion en cours sous ce tableau, et c’est elle qui détermine le multiple dont tout le monde débat. La page de tarification d’Ope​nAI indique que le tarif promotionnel de GPT-5.6 Sol est disponible au moins jusqu’au 21 novembre 2026. Comparé au tarif promotionnel en vigueur aujourd’hui, Astra est 2,5x Sol sur absolument chaque ligne — 2,5x en entrée, 2,5x en entrée mise en cache, 2,5x en sortie. Comparé au tarif non promotionnel de Sol, soit 5,00 $ en entrée et 30,00 $ en sortie, Astra est 2x en entrée et environ 1,67x en sortie. Les deux multiples sont arithmétiquement corrects et décrivent les deux mêmes modèles le même jour. La différence tient entièrement au tarif de Sol que vous utilisez comme dénominateur, et la réponse honnête à « Astra est-elle 2,5x Sol ? » est : oui, jusqu’au 21 novembre 2026, ou jusqu’à ce qu’Ope​nAI mette fin à la promotion, selon ce qui arrive en premier.

Nous développons longuement ce point parce qu’il s’agit de l’erreur la plus courante dans la couverture de ce modèle, y compris sur ce blog. Un multiple par token qui choisit silencieusement un taux Sol et ne le nomme pas n’est pas un fait concernant Astra. C’est un fait concernant le moment où la phrase a été écrite.

A screenshot of OpenAI's own API pricing page, captured September 16, 2026, showing short-context and long-context rates per 1M tokens for gpt-6-astra ($10.00 input, $1.00 cached input, $12.50 cache writes, $50.00 output; long context $20.00 / $2.00 / $25.00 / $75.00) alongside gpt-5.6-sol, gpt-5.6-terra and gpt-5.6-luna, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026 and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Coût par tâche, et non coût par jeton

Dans sa propre présentation, OpenAI affirme que comparer les prix des jetons pour ce modèle est une comparaison erronée, car Astra est conçu pour mener à bien un travail de longue haleine avec moins de jetons et moins de reprises. Cette affirmation mérite d’être prise suffisamment au sérieux pour faire le calcul plutôt que de la répéter. Voici donc un exemple détaillé, avec les hypothèses énoncées d’emblée, afin que vous puissiez les modifier pour qu’elles correspondent à votre propre charge de travail.

La charge de travail : une exécution d'agent de 200 appels, à l'image d'une migration nocturne. Chaque appel transporte 10 000 jetons d'entrée, dont 8 000 lectures de cache et 2 000 nouveaux, et produit 500 jetons de sortie. Sur l'ensemble de l'exécution, cela représente 400 000 jetons d'entrée nouveaux, 1 600 000 jetons d'entrée mis en cache et 100 000 jetons de sortie, plus une seule écriture de cache de 10 000 jetons pour amorcer le préfixe. Niveau standard, sous 272K par requête, donc aucun supplément de contexte long ne s'applique.

GPT-6 Astra — frais 0,4 M x 10,00 $ = 4,00 $ ; en cache 1,6 M x 1,00 $ = 1,60 $ ; écriture 0,01 M x 12,50 $ = 0,13 $ ; sortie 0,1 M x 50,00 $ = 5,00 $. Total 10,73 $.

GPT-5.6 Sol à son tarif promotionnel — frais : 1,60 $ ; en cache : 0,64 $ ; écriture : 0,05 $ ; sortie : 2,00 $. Total : 4,29 $.

GPT-5.6 Sol à son tarif non promotionnel — entrée 2,00 $ ; en cache 0,80 $ ; écriture 0,06 $ ; sortie 3,00 $. Total 5,86 $.

GPT-5.6 Terra — nouveaux 0,80 $ ; en cache 0,32 $ ; écriture 0,03 $ ; sortie 1,20 $. Total 2,35 $.

GPT-5.6 Luna — frais $0.08 ; en cache $0.03 ; écriture $0.00 ; sortie $0.12. Total $0.23.

Ainsi, à nombre de tokens identique, Astra représente environ 46 fois Luna et 4,6 fois Terra. Personne n’achète Luna pour accomplir un travail de l’ampleur d’Astra, et cette note de bas de page est exactement la raison pour laquelle les comparaisons de coût par token entre ces deux modèles relèvent du théâtre. C’est la comparaison avec Sol qui tranche vraiment, alors voici le chiffre qui compte.

Le seuil de rentabilité est de 40 %. Comme Astra coûte exactement 2,5 fois plus cher que Sol sur chaque ligne au tarif promotionnel de Sol, Astra peut consommer jusqu'à 40 % des tokens de Sol pour une même tâche et aboutir à la même facture — et cela vaut pour n'importe quelle combinaison d'entrée fraîche, d'entrée mise en cache et de sortie, car le ratio est uniforme. Si Astra utilise un tiers des tokens de Sol, il revient moins cher ; s'il en utilise la moitié, il est plus cher. Face au tarif non promotionnel de Sol, le seuil de rentabilité se détend à environ 55 % sur ce mélange à forte composante de cache, car le multiple de sortie d'Astra tombe à 1,67x tandis que son multiple d'entrée tombe à 2x.

Ce seul chiffre est celui qui est utile, et c’est là que l’affirmation du fournisseur et la mesure indépendante cessent de concorder. OpenAI indique Terminal-Bench 4.0 à 57,9 % pour Astra, contre 37,3 % pour GPT-5.6 Sol, avec un coût d’API estimé par tâche inférieur d’environ 9 % — selon le fournisseur. Artificial Analysis, dans une évaluation indépendante publiée le 9 septembre 2026, a mesuré Astra utilisant environ un tiers des tokens de Sol par tâche sur son Coding Agent Index, et a néanmoins constaté qu’Astra coûtait 7,09 $ par tâche à effort maximal — environ 15 % de plus que Sol (max) — pour un score supérieur de 7 points. Sur son Intelligence Index, la même évaluation situait Astra entre 0,82 $ et 3,26 $ par tâche selon les niveaux d’effort, soit environ 60 % plus cher que Sol à effort maximal.

Ces deux affirmations peuvent être vraies en même temps, et l’écart entre elles est le constat honnête. Les économies de jetons sont réelles et importantes — un tiers est exactement le genre de chiffre qui franchit un seuil de rentabilité de 40 % — mais les économies mesurées sur les jetons de sortie ne réduisent pas les lignes de lecture du cache et d’entrée fraîche qui dominent une longue session d’agent. Le fait qu’Astra soit moins cher par tâche que Sol dépend de votre mix, et le sens de l’écart s’inverse selon les charges de travail. Quiconque vous dit que c’est simplement moins cher, ou simplement 2,5 fois plus cher, cite une ligne de la facture comme s’il s’agissait du total.

Qu'est-ce qui détermine réellement la facture sur ce modèle ?

Trois choses dominent, et toutes trois sont spécifiques à l’usage prévu pour Astra.

Les tokens de raisonnement sont des tokens de sortie. Ils sont facturés 50,00 $ par million, au même tarif que la sortie visible. La page du modèle d'OpenAI répertorie les valeurs d'effort prises en charge : low, medium, high, xhigh et max, et il n'existe aucun réglage de désactivation — le plancher est plus élevé que sur les modèles plus anciens. Selon la mesure indépendante de l'Intelligence Index, l'écart entre un effort faible et un effort maximal allait de 0,82 $ à 3,26 $ par tâche, soit un facteur de quatre pour un travail identique. Le niveau d'effort est le plus grand levier de coût que vous maîtrisez, et il vaut la peine de le définir par appel plutôt que globalement.

Les tentatives répétées multiplient tout. Un agent qui échoue et se réexécute paie de nouveau pour tout le préfixe. C'est le mécanisme derrière l'affirmation d'OpenAI sur la réduction du nombre de tentatives, et c'est aussi pourquoi l'arithmétique par jeton induit en erreur dans les deux sens : un modèle qui coûte 2,5 fois plus par jeton mais termine en une seule passe peut battre un modèle moins cher qui en nécessite trois. Si vous évaluez Astra par rapport à quoi que ce soit, mesurez les tâches accomplies par dollar, et non les jetons par dollar.

Le contexte long est le mode conçu, et il est surtaxé. La fenêtre est de 1 050 000 tokens. Dépassez 272 000 tokens d'entrée dans une seule requête et toute la requête est refacturée à 20,00 $ en entrée et 75,00 $ en sortie par million de tokens — pas seulement le dépassement. Une requête de 280 000 tokens coûte environ le double d'une requête de 270 000 pour environ 4 % d'entrée en plus. Sur un modèle conçu pour le travail à long horizon, c'est le moyen le plus simple de faire exploser un budget sans s'en apercevoir, et c'est pourquoi découper une tâche à long horizon en requêtes de moins de 272 K est généralement moins cher que de l'envoyer en entier, même si le modèle est capable de la traiter en entier.

Le contrepoids, c’est la mise en cache, et c’est là que les longues sessions d’agents permettent réellement d’économiser de l’argent. Les lectures mises en cache coûtent 1,00 $, contre 10,00 $ pour une lecture non mise en cache, soit une réduction de 90 %, et une longue session renvoie le même préfixe des dizaines de fois. L’écriture en cache de 12,50 $ n’est payée qu’une seule fois. Sur l’exemple détaillé ci-dessus, si chaque appel devait renvoyer son préfixe de 8 000 jetons sans mise en cache, la facture d’Astra passerait de 10,73 $ à environ 25,00 $ — le cache fait plus pour le budget que toute autre ligne prise isolément.

L'enregistrement sur le multiple

Plusieurs pages de ce blog, dont GPT-6 Astra vs GPT-5.6 Sol : vaut-il la peine de payer 2,5 fois le prix ? et La demande pour GPT-6 Astra suspend les nouvelles inscriptions à ChatGPT Pro à 200 $, indiquent qu'Astra est affiché à 2,5 fois le prix des tokens de GPT-5.6 Sol. Ce chiffre a été calculé par rapport au tarif promotionnel de Sol, soit 4,00 $ en entrée et 20,00 $ en sortie, qui est le tarif que la page de tarifs d’Ope​nAI affiche aujourd'hui et décrit comme promotionnel, disponible au moins jusqu'au 21 novembre 2026.

Le multiple n’a donc pas cessé d’être exact — il a acquis une date d’expiration que les pages antérieures ne portaient pas. Par rapport au tarif non promotionnel de Sol de 5,00 $ en entrée et 30,00 $ en sortie, Astra est à 2x en entrée et à environ 1,67x en sortie, et non à 2,5x. Les pages qui indiquent 2,5x doivent se lire comme portant sur la fenêtre promotionnelle ; le sens de la comparaison ne change pas, mais l’ampleur de l’écart se réduit d’un cinquième à un tiers dès que la promotion prend fin. Quiconque établit un budget au-delà du 21 novembre 2026 doit utiliser 5,00 $ et 30,00 $ comme dénominateur Sol et 2x / 1,67x comme multiple Astra. Nous ne reformulons pas les arguments de ces pages — le raisonnement sur les benchmarks et la fiabilité qui s’y trouve se tient de lui-même — nous ne faisons que corriger le dénominateur par rapport auquel ils ont été calculés.

La question du « gratuit », tranchée sans faux-fuyants.

Il n'existe pas de niveau gratuit pour ce modèle, ni de voie API gratuite pour y accéder. Les utilisateurs de ChatGPT Free et Go n'ont pas du tout accès à GPT-6 Astra. Les abonnés Plus n'y ont accès que via ChatGPT Work et Co​dex, pas dans le chat standard. L'API est facturée dès le premier token à 10,00 $ par million de tokens en entrée, et le moyen légitime le moins cher de réduire ce montant est le niveau batch à 5,00 $ par million, ce qui vous coûte de la latence plutôt que de la capacité. Quiconque fait la promotion d'un accès API gratuit à GPT-6 Astra revend quelque chose — généralement un pool de crédits d'essai sur une passerelle tierce avec ses propres conditions d'utilisation des données. Ce n'est pas forcément une mauvaise affaire, mais ce n'est pas gratuit, et ce n'est pas Ope​nAI.

Il est bon de savoir, si vous planifiez vos capacités autour d’un abonnement plutôt que de l’API : le 10 septembre 2026, Ope​nAI a suspendu les nouvelles inscriptions et les mises à niveau vers son offre ChatGPT Pro à 200 $, invoquant la demande pour Astra. L’offre à 100 $, Plus, Go, l’API ainsi que les comptes Business et Enterprise sont restés ouverts. Les consommateurs ont été rationnés ; l’accès via l’API et l’accès entreprise, non. Si votre plan dépend du quota d’utilisation d’un abonnement grand public, c’est le risque à modéliser.

Le routage, et ce qu’un routeur ne corrige pas

Astra est l'un des modèles disponibles via OrcaRouter sous openai/gpt-6-astra, aux mêmes tarifs de 10,00 $ en entrée et 50,00 $ en sortie que ceux facturés par le fournisseur, avec la tarification par paliers au-delà de 272K indiquée sur notre page de modèle. Nous répercutons le prix catalogue du fournisseur avec 0 % de marge, ce qui compte davantage sur ce modèle que sur la plupart : les chiffres de cet article ont déjà bougé une fois au cours de la vie du modèle, et un prix répercuté évolue le jour où le fournisseur le modifie, plutôt que lorsque quelqu'un se souvient de mettre à jour un tableau.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, captured September 16, 2026, showing $10.00 per 1M input tokens and $50.00 per 1M output tokens, a 1M-token context window, 128K maximum output, text, image and file input, p50 time to first token of 6.70 s and 181.0M tokens of traffic over 7 days.

L'argument honnête en faveur du routage ici n'est pas le prix, car il n'y a aucune remise à vous vendre — c'est que le calcul de coûts ci-dessus dépend de la charge de travail et vous ne saurez pas de quel côté du seuil de rentabilité de 40 % vous vous situez avant de l'avoir exécuté. Placer Astra derrière un point de terminaison unique aux côtés de Sol, Terra et Luna signifie que vous pouvez mesurer les tâches terminées par dollar sur votre propre trafic et changer de modèle sans second contrat ni modification du code. Le DSL de routage vous permet de composer un appel sur plusieurs modèles plutôt que d'engager un chemin de production sur un seul, et le basculement automatique couvre le cas que ce modèle a déjà démontré deux fois — à savoir que la demande pour ce modèle peut dépasser la capacité.

Les compromis sont tout aussi réels et méritent d'être nommés. Un routeur est un saut dans le chemin de la requête, et sur un modèle dont l'argument de vente est le travail autonome à long horizon, ce saut est une chose de plus dans le domaine de défaillance ; si votre tolérance à cela est nulle, appelez le fournisseur directement. Plusieurs éléments de cet article n'existent que dans le cadre d'une relation directe : l'option Zero Data Retention qu'OpenAI propose aux clients API éligibles sur les points de terminaison pris en charge est soumise à l'approbation d'OpenAI, et l'activation en entreprise — qui est désactivée par défaut au lancement et activée par les administrateurs selon leur grille tarifaire applicable — est un accord entre vous et OpenAI, et non quelque chose qu'un routeur peut accorder. OpenAI documente également que Fast mode pour ce modèle n'est pas disponible avec la résidence des données dans l'UE, donc si vous avez besoin à la fois de résidence et de vitesse, cette contrainte suit le modèle, pas la route. Et une marge de 0 % d'un routeur n'est pas une remise : nous ne sommes pas moins chers qu'un accès direct, nous sommes au même prix avec moins d'intégrations à maintenir.

Que regarder

Une date et un chiffre. La date est le 21 novembre 2026, date à laquelle le tarif promotionnel de Sol n'est plus garanti — s'il expire, le multiple d'Astra par rapport à Sol passe de 2,5x à 2x en entrée et à 1,67x en sortie, et toutes les comparaisons de coût par tâche en circulation deviennent d'un cinquième à un tiers plus favorables à Astra sans que rien ne change chez Astra. Le chiffre est votre propre seuil de rentabilité : exécutez une tâche représentative à long horizon sur les deux modèles, comptez les tâches terminées et le total en dollars, et vous obtiendrez une réponse plus utile que tout ce qui a été publié, y compris cette page.

Placer Astra derrière un point d'accès unique aux côtés de Sol, Terra et Luna vous permet de mesurer les tâches accomplies par dollar sur votre propre trafic et de changer de modèle sans second contrat ni modification du code.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement