
GPT-6 Astra API : l’ID du modèle, le point de terminaison, et ce que coûte réellement une tâche à long horizon
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures OpenAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.
Si un modèle vieux de treize jours mérite une page cette semaine, c'est que les voies d'accès ont changé après le lancement, et la voie API est désormais la voie ordinaire. Lorsqu'OpenAI a livré Astra le 3 septembre, l'entreprise a décrit un déploiement plutôt qu'une disponibilité. Au 8 septembre, elle disait que le modèle était entièrement déployé auprès des utilisateurs Plus, Pro, Business et Enterprise dans Codex et ChatGPT Work, et pendant la semaine du 14 septembre, AWS le référençait sur Bedrock et Microsoft Foundry le proposait en disponibilité générale. Pour un appelant d'API, cette séquence importe moins qu'il n'y paraît — le point de terminaison est en service et documenté depuis le début —, mais cela signifie que les questions d'achat à son sujet ont désormais des réponses qu'elles n'avaient pas le jour du lancement. Tout ce qui suit a été lu dans la documentation du modèle, la page de tarification et la page de contrôle des données d'OpenAI le 16 septembre 2026, et tout ce qui vient d'ailleurs le précise dans la phrase qui le contient.
L'identifiant du modèle, et la question du snapshot à laquelle il a été répondu honnêtement
La chaîne à transmettre est gpt-6-astra — en minuscules, avec traits d’union, sans préfixe de fournisseur. C’est le seul identifiant documenté par OpenAI pour ce modèle.
Si vous cherchez un instantané daté à épingler, il n'y en a pas à trouver, et nous n'allons pas inventer un suffixe d'apparence plausible. La page de modèle d'OpenAI pour GPT-6 Astra ne répertorie qu'une seule entrée sous Snapshots, et c'est le simple gpt-6-astra. Il n'y a pas de -2026-09-03 sous forme datée, ni aucun -latest alias du côté du fournisseur. Nous avons vu, au cours de nos recherches, un alias dynamique de la forme ~openai/gpt-astra-latest dans la liste d'un routeur ; il s'agit d'une construction de passerelle bâtie par-dessus l'identifiant du fournisseur, et non de quelque chose que OpenAI publie, et elle ne doit pas figurer dans votre configuration comme si c'en était une.
La conséquence pratique est faible, mais il vaut la peine de le préciser. Vous pouvez récupérer l’objet du modèle pour confirmer à quoi vous vous adressez :
curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"
Épinglez l'identifiant nu dans une valeur de configuration plutôt que de le taper dans une douzaine de sites d'appel. Si OpenAI ajoute plus tard des snapshots datés, l'identifiant nu devient la cible mouvante et votre valeur épinglée commence à changer sous vos pieds — un seul endroit à modifier fait la différence entre une modification de deux minutes et un après-midi passé à faire du grep.
Le point de terminaison : URL de base, compatibilité et une requête qui s'exécute
The base URL is https://api.openai.com/v1. Per OpenAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.
Concernant la compatibilité : il s'agit de l'API first-party d'OpenAI, qui est le format de communication sur lequel tous les SDK et clients compatibles avec OpenAI ont été conçus. Tout ce qui parle ce format pourra dialoguer avec gpt-6-astra sans shim — vous changez la chaîne du modèle et, si vous migrez depuis un modèle OpenAI plus ancien, les noms des paramètres ci-dessous. Les nouveaux développements devraient utiliser l'API Responses : c'est l'interface sur laquelle OpenAI documente le contrôle du raisonnement de ce modèle, c'est là que résident les outils intégrés, et la prise en charge de Chat Completions pour les modèles les plus récents a historiquement été la plus superficielle des deux.
Un appel en streaming minimal, avec l'effort de raisonnement défini :
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-6-astra", "input": "Listez les fichiers que vous modifieriez pour retirer ce service de l'API d'authentification héritée.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'
Et la même chose en Python, qui est là où la plupart des lecteurs passeront réellement leur temps :
from openai import OpenAI
client = OpenAI()
stream = client.responses.create(model="gpt-6-astra", input="Listez les fichiers que vous modifieriez pour faire migrer ce service hors de l'API d'authentification héritée.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)
for event in stream:
if event.type == "response.output_text.delta": print(event.delta, end="")
Trois choses dans cette requête sont spécifiques à ce modèle plutôt que copiées d'un guide de démarrage générique.
• L’effort de raisonnement est un levier de coût, pas seulement un levier de qualité. La page des modèles d’OpenAI répertorie les valeurs prises en charge : low, medium, high, xhigh et max. Notez où commence cette liste : il n’y a ni none ni minimal pour GPT-6 Astra, donc le plancher a été relevé. Les jetons de raisonnement sont facturés comme des jetons de sortie à 50,00 $ par million, ce qui signifie que faire passer l’effort de high à max est une décision qui a un prix, et non une amélioration de qualité gratuite.
• Le streaming est pris en charge, et c’est la façon honnête de gérer les longs tours. Une seule requête sur ce modèle peut émettre jusqu’à 128 000 jetons de sortie. Attendre que cela arrive dans un seul corps de réponse, sans visibilité sur sa progression, c’est ainsi qu’on finit par deviner les délais d’expiration.
• La mise en cache des invites est ici explicite.L'API Responses documente un prompt_cache_breakpoint sur le contenu textuel, image et fichier, avec un mode explicit, qui marque « la fin exacte d'un préfixe d'invite réutilisable » et hérite de son TTL du prompt_cache_options.ttl de la requête. Sur un modèle dont le tarif d'entrée mise en cache représente un dixième de son tarif non mise en cache, l'endroit où vous placez cette frontière est la ligne la plus déterminante de votre requête.

Ce que signifie réellement une fenêtre de 1 050 000 tokens
Les chiffres documentés sont une fenêtre de contexte de 1 050 000 tokens, une entrée maximale de 922 000 tokens, une sortie maximale de 128 000 tokens, et une date limite de connaissances au 30 avril 2026.
Commencez par l’arithmétique que les gens négligent : 922 000 plus 128 000 égale 1 050 000. La fenêtre est partagée entre ce que vous envoyez et ce que le modèle peut renvoyer, et le plafond de sortie y est réservé. Vous ne pouvez pas envoyer 1 050 000 tokens en entrée ; le plafond pratique pour une seule requête est de 922 000, et moins que cela si vous voulez de la place pour une vraie réponse.
Qu’est-ce qu’un million de tokens permet d’acheter dans les unités dans lesquelles vous travaillez réellement ? Les conversions de tokens en texte sont approximatives, et celles-ci sont les nôtres plutôt que celles d’OpenAI, mais elles sont du bon ordre de grandeur : à environ quatre caractères par token, 1 050 000 tokens représentent de l’ordre de 750 000 mots, ou quelque chose comme cent mille lignes de code. C’est un dépôt de taille moyenne, dans son intégralité, avec encore de la place pour la sortie d’outils qu’un agent génère pendant qu’il travaille. Le cas à long horizon pour lequel le modèle est vendu est exactement celui-ci : un agent qui a lu un fichier il y a une heure et peut encore voir ce qu’il contenait, au lieu d’un agent qui a compacté la matinée en un paragraphe de résumé.
Puis la partie qui a sa place sur une page de coûts plutôt que sur une page de spécifications. La documentation du modèle d’OpenAI indique que les prompts de plus de 272 000 jetons d’entrée sont facturés à 2x les tarifs d’entrée et de cache, et 1,5x les tarifs de sortie pour la requête complète. La page de tarification le présente comme une deuxième ligne : le contexte long sur GPT-6 Astra est à 20,00 $ en entrée, 2,00 $ en entrée mise en cache et 75,00 $ en sortie. Ainsi, les trois quarts supérieurs de cette fenêtre constituent une tranche tarifaire, pas seulement une marge de manœuvre. Une exécution dont la transcription dépasse 272 000 jetons paie le double sur chaque jeton d’entrée — y compris les jetons mis en cache — pour toute la requête, et c’est la variation la plus importante de l’économie de ce modèle. Elle est détaillée intégralement ci-dessous.
Un autre mécanisme qu’il vaut la peine de connaître, car c’est la reconnaissance par le fournisseur lui-même qu’une fenêtre ne constitue pas toute la réponse. Pour Codex, OpenAI décrit une approche de contexte expérimentale livrée avec Astra, dans laquelle les notes persistent d’une fenêtre de contexte à l’autre au lieu d’une compaction répétée en un seul résumé, les fenêtres antérieures restant interrogeables afin que les exigences et les résultats de tests issus des messages et des sorties d’outils antérieurs restent trouvables. OpenAI la qualifie d’expérimentale, indique qu’elle est activée dans le config.toml de Codex et affirme qu’elle deviendra la valeur par défaut pour Astra. Si vous construisez l’équivalent vous-même sur l’API, c’est la structure à copier : des notes durables plus un historique récupérable, plutôt qu’un seul prompt héroïque.
Et la limite du nombre lui-même : une grande fenêtre est une capacité, pas une garantie d'attention sur toute son étendue. Les chiffres de long horizon rapportés par le fournisseur constituent un meilleur guide du comportement que le nombre de tokens — OpenAI rapporte OSWorld 2.0 à 72,6 % à environ 40 minutes par tâche, et Terminal-Bench 4.0 à 57,9 % contre 37,3 % pour GPT-5.6 Sol. Ce sont les chiffres d'OpenAI eux-mêmes, que nous n'avons pas reproduits, et le tableau indépendant est proche mais pas identique : Artificial Analysis a mesuré Astra à 59,1 % sur Terminal-Bench v4.0 contre 52,0 % pour Claude Fable 5.1 et 39,9 % pour GPT-5.6 Sol. Les deux s'accordent sur le fait que l'écart de long horizon par rapport à la génération précédente est réel ; ni l'un ni l'autre ne remplace l'exécution de votre propre tâche.
Modalités d’entrée, et la question du fichier laissée honnêtement ouverte
La page du modèle d'OpenAI répertorie les modalités d'entrée texte et image, avec sortie texte. Pas d'audio, pas de vidéo, pas de génération d'images sur ce modèle.
L’entrée d’image se présente comme une partie de contenu dans un message utilisateur. Le type de partie est input_image, et l’image est fournie soit sous forme d’URL entièrement qualifiée, soit sous forme d’URL de données base64 sur image_url, soit sous forme de file_id provenant de l’API Files. Il existe un paramètre detail facultatif pouvant prendre la valeur auto, low, high ou original, avec auto par défaut. La structure est :
{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "qu'est-ce qui a changé dans cette capture d'écran ?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}
La documentation sur la vision d’OpenAI répertorie les formats PNG, JPEG, WEBP et GIF non animé comme acceptés, jusqu’à 512 Mo de charge utile totale par requête et jusqu’à 1 500 images par requête, les images dépassant 30 000 patches étant rejetées plutôt que redimensionnées à la baisse. Il s’agit des limites générales de vision de la plateforme, et non de limites propres à Astra, et les images sont facturées en tokens comme n’importe quelle autre entrée.
Maintenant, la question avec laquelle les lecteurs arrivent réellement, et la réponse honnête. Pouvez-vous envoyer des fichiers ou des PDF ?Nous n'avons pas pu confirmer la prise en charge de documents en entrée pour ce modèle dans la documentation d'OpenAI, et nous n'allons pas laisser entendre que cela fonctionne. L'API Responses définit bien une partie de contenu input_file, donc la mécanique existe bel et bien dans l'API de façon générale ; mais la page d'OpenAI consacrée à GPT-6 Astra indique le texte et l'image comme modalités d'entrée et ne mentionne pas les fichiers, et nous n'avons trouvé aucune déclaration d'OpenAI documentant une entrée PDF pour ce point de terminaison. Une fiche de routeur pour le même modèle mentionne effectivement les fichiers aux côtés du texte et de l'image — considérez cela comme une information rapportée par le routeur, c'est-à-dire ce qu'un routeur consigne à propos d'une route, et non ce que le fournisseur garantit. Si l'ingestion de documents est essentielle à votre charge de travail, testez-la sur le point de terminaison réel avant de bâtir quoi que ce soit dessus, et prévoyez une solution de repli OCR vers texte. C'est la différence entre un après-midi de tests et une réécriture.
La gamme tarifaire complète, et une simulation à long terme chiffrée
Chaque chiffre de cette section a été relevé sur la page de tarification d'OpenAI elle-même le 16 septembre 2026, et tous sont exprimés par million de jetons au niveau Standard, sauf indication contraire sur la ligne.
• Contexte court, jusqu’à 272K en entrée — 10,00 $ en entrée, 1,00 $ en entrée mise en cache, 12,50 $ pour l’écriture du cache, 50,00 $ en sortie.
• Contexte long, au-delà de 272K en entrée — 20,00 $ en entrée, 2,00 $ en entrée mise en cache, 25,00 $ pour l'écriture du cache, 75,00 $ en sortie, appliqués à la requête complète.
• Batch and Flex — la moitié du tarif Standard : 5,00 $ / 0,50 $ / 6,25 $ / 25,00 $ en contexte court, 10,00 $ / 1,00 $ / 12,50 $ / 37,50 $ en contexte long.
• Mode rapide — double du Standard : 20,00 $ / 2,00 $ / 25,00 $ / 100,00 $ contexte court, 40,00 $ / 4,00 $ / 50,00 $ / 150,00 $ contexte long. OpenAI précise que le mode rapide n'est pas disponible pour GPT-6 Astra avec résidence des données dans l'UE.
• Résidence des données — Les points de terminaison qui l’utilisent entraînent une majoration de 10 % pour les modèles publiés à compter du 5 mars 2026. GPT-6 Astra est éligible, donc un déploiement avec résidence des données se situe 10 % au-dessus de chaque chiffre ci-dessus.
Le point à retenir est le tarif des entrées mises en cache. 1,00 $ contre 10,00 $ représente une remise de 90 % sur la partie du prompt que vous envoyez à nouveau — et pour la charge de travail d’un agent, c’est presque tout le prompt. Les écritures dans le cache sont facturées à 12,50 $, soit 1,25 fois le tarif des entrées non mises en cache, donc le seuil de rentabilité est simple : 100 000 jetons envoyés deux fois sans cache coûtent 2,00 $, tandis qu’écrire ce préfixe une fois et le relire une fois coûte 1,35 $. La mise en cache est rentable dès la deuxième réutilisation, et un agent qui travaille sur la même transcription pendant cent tours la réutilise cent fois.
Ce qui nous amène à l'arithmétique qui détermine réellement si ce modèle est abordable, car le tarif affiché n'est pas le montant qui figure sur la facture. Voici une exécution modélisée — la nôtre, fondée sur les tarifs publiés d'OpenAI, et non une facture mesurée — pour le type de tâche pour lequel le modèle est vendu : un agent de codage autonome effectuant une migration à l'échelle d'un dépôt sur quelques heures, 120 appels au modèle, une transcription de travail qui fait en moyenne environ 500 000 tokens d'entrée par appel au fur et à mesure qu'elle s'accumule, 80 % de ces entrées servies depuis le cache, et 400 000 tokens de sortie sur l'ensemble de l'exécution, y compris le raisonnement.
Aux tarifs Standard à contexte court :
• Entrée non mise en cache — 12 M de tokens × 10,00 $ = 120,00 $
• Entrée mise en cache — 48 M tokens × 1,00 $ = 48,00 $
• Sortie — 0,4 M de tokens × 50,00 $ = 20,00 $
• Total ≈ 188,00 $ pour l'exécution
La même exécution dans la bande de contexte long, ce qui est ce qu'obtient réellement une transcription qui dépasse 272 000 tokens par appel :
• Entrée non mise en cache — 12M tokens × 20,00 $ = 240,00 $
• Entrée mise en cache — 48 M tokens × 2,00 $ = 96,00 $
• Sortie — 0,4 M jetons × 75,00 $ = 30,00 $
• Total ≈ 366,00 $ pour l'exécution
Deux conclusions en découlent, et aucune n'est visible dans le taux affiché. Premièrement, l'endroit où réside votre transcription vaut autant que le modèle que vous choisissez — la tâche identique coûte environ le double selon qu'elle franchit ou non le seuil de 272K, ce qui fait de la discipline de contexte (récupérer les bons 100K plutôt que de transporter 600K) une technique de maîtrise des coûts sur ce modèle, et non pas seulement de performance. Deuxièmement, la mise en cache vaut plus que ne le suggère la remise : sans aucun succès de cache, le premier scénario représente 600,00 $ d'entrée au lieu de 168,00 $, et l'exécution coûte environ 620 $ plutôt que 188 $. Activez la mise en cache avant d'augmenter l'effort de raisonnement.
Pour la référence, le même mélange de tokens sur GPT-5.6 Sol, aux tarifs que la page de tarification d'Ope nAI affichait le 16 septembre — 4,00 $ en entrée, 0,40 $ en entrée mise en cache, 20,00 $ en sortie en contexte court — revient à environ 75,20 $, et à la ligne contexte long de Sol (8,00 $ / 0,80 $ / 30,00 $), à environ 146,40 $. Cela place cette exécution à environ 2,5x sur l'une ou l'autre bande tarifaire. Deux mises en garde concernant ce multiple, car il a déjà causé de la confusion ailleurs : le chiffre de Sol est un tarif promotionnel — Ope nAI indique que la promotion est offerte au moins jusqu'au 21 novembre 2026 — tandis que celui d'Astra est le tarif catalogue ; le multiple mesure donc les deux grilles tarifaires du jour plutôt qu'un fait stable à propos des modèles, et il diminue si la promotion prend fin. Et le « 2,5x » plus ancien qui circule pour Astra est parfois calculé par rapport à la liste de Sol avant promotion, soit 5,00 $/30,00 $, ce qui donne 2x en entrée et environ 1,67x en sortie. Précisez de quel tarif de Sol vous parlez, sinon le chiffre ne vaut rien.
Une ligne de plus : le palier Batch divise tout cela par deux, ce qui ramène la première exécution à environ 94 $. Que vous puissiez l’utiliser dépend de la section suivante.

Zéro rétention de données, et la remise qui se disqualifie elle-même
OpenAI déclare que la conservation nulle des données (Zero Data Retention, ZDR) est disponible pour les clients API éligibles sur les points de terminaison pris en charge, sous réserve d'approbation — et les deux parties de cette phrase ont leur importance. Il ne s'agit pas d'une bascule en libre-service : l'éligibilité est soumise à l'approbation préalable d'OpenAI et à l'acceptation d'exigences supplémentaires, et vous l'activez en contactant le service commercial. Une fois approuvée, elle se configure au niveau de l'organisation ou du projet dans Paramètres → Organisation → Contrôles des données, dans l'onglet Conservation des données, où un projet peut hériter de la valeur par défaut de l'organisation, définir explicitement la ZDR, sélectionner Modified Abuse Monitoring, ou désactiver les deux.
Ce que cela change en pratique : ZDR exclut le contenu client des journaux de surveillance des abus, remplaçant la conservation par défaut pouvant aller jusqu'à 30 jours, et le paramètre store sur /v1/responses et /v1/chat/completions est traité comme false même si une requête tente de le définir sur true.
Le détail qui compte le plus sur une page consacrée aux coûts : /v1/batches ne figure pas sur la liste des points de terminaison éligibles à la ZDR. La page des contrôles de données d'OpenAI le répertorie comme non éligible, avec l'état de l'application conservé jusqu'à sa suppression. Ainsi, sur GPT-6 Astra, la remise de 50 % du niveau Batch et la conservation des données zéro (Zero Data Retention) sont mutuellement exclusives — une charge de travail soumise à des contraintes de conformité qui a besoin de la ZDR doit prévoir le tarif Standard, et non le tarif batch, et le montant de 94 $ ci-dessus ne lui est pas accessible.
Trois autres mises en garde, énoncées clairement parce qu’une page qui survend le ZDR est pire qu’une page qui l’omet. Le ZDR n’est pas absolu : dans le cadre d’« Eyes Off », OpenAI se réserve le droit de rendre des modèles inéligibles au ZDR pour des clients spécifiques, avec un préavis écrit, et dans le cadre de « Safety Retention », le contenu peut être conservé et examiné par un humain lorsque les classificateurs signalent un risque grave. Les entrées d’images et de fichiers signalées pour un risque potentiel de CSAM sont conservées pour un examen manuel même sous ZDR. Et le ZDR s’arrête à la frontière d’OpenAI — si votre agent appelle un serveur MCP distant ou l’API d’un autre fournisseur, ce trafic est régi par la politique de conservation de ce tiers, pas par celle-ci. Par ailleurs, la résidence des données est un contrôle différent du ZDR, nécessite sa propre approbation et un avenant « Modified Retention » en dehors des États-Unis, et comporte la majoration de 10 % mentionnée ci-dessus. Si vous comptez sur la mise en cache sous ZDR, consultez la page d’OpenAI sur les contrôles des données pour savoir ce que la mise en cache conserve ; nous n’allons pas afficher de chiffre de conservation pour cela que nous n’aurions pas pu lire nous-mêmes sur cette page.
Les limites de débit telles que documentées, et celle qui mord la première
La page du modèle d’OpenAI publie ces limites par palier pour GPT-6 Astra — requêtes et jetons par minute, puis la limite de file d’attente par lots :
• Niveau 1 — 500 RPM, 500 000 TPM, file d'attente de lots 1 500 000
• Niveau 2 — 5 000 RPM, 1 000 000 TPM, file d'attente par lots 3 000 000
• Niveau 3 — 5,000 RPM, 2,000,000 TPM, file d'attente par lots 100,000,000
• Niveau 4 — 10 000 tr/min, 4 000 000 TPM, file d'attente par lots 200 000 000
• Niveau 5 — 15 000 tr/min, 40 000 000 TPM, file d'attente de lots 15 000 000 000
Deux limites que nous qualifierons de non documentées plutôt que de les renseigner : il n’existe aucune limite publiée pour le niveau gratuit, car GPT-6 Astra ne fait pas du tout partie du niveau gratuit ; et nous n’avons trouvé aucun plafond publié au-dessus du niveau 5 ni de tableau de limites distinct pour Fast mode. Si un fournisseur n’a pas publié de limite, considérez cette absence comme non résolue — ne partez pas du principe qu’elle est illimitée.
Le premier chiffre qui limite une charge de travail d’agent, c’est le seuil de 500 000 TPM du niveau 1. Un seul appel sur ce modèle peut contenir une transcription de 500 000 jetons, ce qui signifie qu’une seule requête peut consommer une minute entière de votre budget de jetons sur le niveau d’entrée. Une fenêtre de contexte d’un million de jetons n’est pas très utile pour un agent qui squatte la même transcription sur 120 tours si le niveau ne peut pas faire passer les jetons. Dimensionnez le niveau en fonction du volume de jetons de l’exemple détaillé ci-dessus, et non du nombre de requêtes — et notez que la progression de niveau dépend des dépenses et de l’historique du compte, il vaut donc mieux l’établir avant une échéance que pendant celle-ci.
Azure et AWS Bedrock, une ligne chacun
• Microsoft Azure — GPT-6 Astra est déployable dans Microsoft Foundry sous le même identifiant gpt-6-astra, la couverture de Foundry faisant remonter la disponibilité générale au début du mois de septembre 2026 et signalant des déploiements Global Standard et US Data Zone, aucune EU Data Zone au lancement, et des tarifs égaux ou proches de la liste d'OpenAI avec une ligne pour le contexte long. Nous tenons cela de la couverture de Foundry plutôt que de la page catalogue de Microsoft elle-même, que nous n'avons pas pu joindre aujourd'hui — vérifiez la liste des déploiements, l'ensemble des régions et les tarifs en vigueur dans la documentation de Microsoft avant de planifier un déploiement sur cette base.
• AWS Bedrock — répertorié sous openai.gpt-6-astra, disponible via les API Bedrock prises en charge et confirmé dans le récapitulatif hebdomadaire d'AWS daté du 15 septembre 2026, avec le périmètre de gouvernance propre à Bedrock (isolation des points de terminaison VPC, chiffrement KMS, Guardrails) et la déclaration d'AWS selon laquelle les données d'inférence ne sont pas utilisées pour l'entraînement des modèles. D'après les informations rapportées, l'inférence en région et l'inférence géographique interrégionale sur Bedrock sont facturées 10 % au-dessus des tarifs de base ; d'après notre lecture, ce chiffre est de source secondaire, donc vérifiez la page de tarification d'AWS.
Aucune des deux voies ne change le modèle. Toutes deux changent l'approvisionnement, ce qui, pour un lecteur d'entreprise, est tout l'enjeu : un déploiement Foundry ou Bedrock peut s'inscrire dans un engagement cloud existant, hériter de son IAM, de sa journalisation et de son périmètre réseau, et atterrir sur une facture que la finance a déjà approuvée — ce qui fait souvent la différence entre un pilote et quelque chose qui est réellement livré. La contrepartie, c'est que vous adoptez le cycle de vie du modèle du cloud et le tarif du cloud, et les deux clouds sont annoncés à un niveau égal ou supérieur à la grille d'OpenAI, plutôt qu'inférieur.
Où un routeur trouve sa place, y compris les éléments qui plaident contre lui
GPT-6 Astra figure dans le catalogue OrcaRouter sous openai/gpt-6-astra, et OrcaRouter répercute le prix catalogue du fournisseur avec une marge de 0 % — le prix du fournisseur est notre prix, et toute évolution du prix du fournisseur est répercutée sur votre facture le jour même plutôt qu'au renouvellement. Sur un modèle à ce prix, ce n'est pas une simple question d'arrondi : le calcul ci-dessus est le même que celui que vous paieriez en direct.

L’argument honnête en faveur du routage ici n’est pas le prix, c’est la réversibilité. Astra coûte environ 2,5 fois le modèle en dessous et son coût varie selon un seuil que votre architecture contrôle, donc la plupart des équipes veulent l’essayer sur une portion de trafic réel avant d’engager un chemin de production. Avec une seule clé, vous pouvez le placer derrière le même point de terminaison que les modèles que vous exécutez déjà, lui envoyer une partie du trafic et basculer automatiquement vers quelque chose de moins cher lorsqu’il ne justifie pas la différence — un changement de configuration plutôt qu’une migration, avec une API unique couvrant plus de 200 modèles, un DSL de routage qui compose plusieurs modèles en un seul appel, et la fusion de modèles lorsque vous voulez un panel qui répond ensemble.
Les points qui plaident contre, énoncés sans détour. Un routeur, c’est un saut de plus dans le chemin de la requête et un acteur de plus dans le flux de données — et avec ce modèle, ce n’est pas hypothétique, car ZDR est approuvé au niveau de chaque organisation chez OpenAI et une requête routée n’est pas automatiquement couverte par votre approbation ZDR. Si vous envoyez des données réglementées, vérifiez les conditions de données de la route avant de les envoyer, et soyez prêt à appeler directement le fournisseur pour cette charge de travail. Le routage ajoute aussi un composant qui peut défaillir ou ajouter de la latence, et il rend le remplacement des modèles si facile qu’il est possible de changer ce qui répond à vos utilisateurs sans le passer en revue. Rien de tout cela ne l’emporte sur l’argument en faveur de l’essai et de la réversibilité pour la plupart des équipes ; tout cela vaut la peine d’être su avant de décider que le routeur est gratuit. Nous avons opposé les plateformes de routage les unes aux autres dans un article séparé plutôt que de répéter la comparaison ici.
Trois questions qui n’appellent pas de réponses en une seule proposition.
Puis-je affiner GPT-6 Astra, ou l'utiliser avec l'API Assistants ? Non, sur les deux plans, et il s'agit d'une limite de conception plutôt que d'une configuration que vous auriez manquée. La page du modèle d'OpenAI indique Chat Completions, Responses et Batch comme points de terminaison pris en charge et mentionne explicitement Fine-tuning et Assistants comme non pris en charge, et il n'existe aucune ligne GPT-6 Astra dans le tableau tarifaire d'affinage d'OpenAI. Si votre architecture dépend d'un modèle phare affiné, Astra doit plutôt être guidé par des prompts, ce qui déplace le coût de l'entraînement vers les jetons d'entrée — et à 10,00 $ par million sur un grand prompt système, cela représente une véritable ligne budgétaire plutôt qu'une simple note de bas de page.
Le modèle refusera-t-il un travail de sécurité que je suis autorisé à effectuer ? Parfois, oui, et cela vaut la peine de le savoir avant de construire. GPT-6 Astra est le premier modèle d’OpenAI à atteindre le seuil de capacité critique en cybersécurité au titre du Preparedness Framework de l’entreprise, et dans sa version livrée, il refuse les tâches cyber avancées telles que l’écriture d’exploits de preuve de concept. OpenAI déclare qu’il prévoit d’élargir l’accès avec des garde-fous moins restrictifs via son programme Daybreak. Pour un défenseur, cela se manifeste comme un refus qui n’est ni une limite de débit ni un bug — tenez-en compte dans votre gestion des erreurs plutôt que de réessayer dans le vide.
Ai-je besoin d'une approbation spéciale pour appeler ce modèle ? Pas pour le point de terminaison standard — il n'y a ni liste d'attente ni étape d'approbation pour appeler gpt-6-astra, juste un compte avec facturation. Ce pour quoi une approbation peut être nécessaire, c'est tout ce qui l'entoure : Zero Data Retention, qui est conditionné à une demande ; la résidence des données hors des États-Unis, qui nécessite son propre avenant ; et une augmentation de palier, si vous comptez faire passer des volumes de tokens à l'échelle d'agents via un compte Tier 1. Le modèle est la partie facile de l'achat.
Ce qu’il faut surveiller, et qui doit bouger maintenant
Si vous développez sur ce modèle, les quatre choses à surveiller relèvent toutes du fournisseur et sont toutes datées. Que OpenAI publie ou non un instantané daté pour gpt-6-astra — ce qui transformerait l’identifiant brut en cible mouvante et donnerait tout son sens à l’épinglage. Que le seuil de 272 000 tokens évolue, car cette seule ligne pèse plus dans votre facture que n’importe quel benchmark de la page. Que les tarifs de Bedrock et de Foundry convergent vers la grille d’OpenAI ou restent au-dessus, car cela détermine la voie d’approvisionnement autant que le modèle. Et que le programme Daybreak change ce que le point de terminaison refusera, ce qui, pour les équipes de sécurité, fait la différence entre un outil utilisable et une démo.
Quant à savoir qui doit agir, la séparation est nette. Si vous payez déjà GPT-5.6 Sol à des tarifs promotionnels pour du travail d'agent à long horizon, le facteur 2,5 est bien réel et la question est étroite : le taux d'achèvement des tâches sur votre propre charge de travail compense-t-il l'écart de prix ? Testez-le sur une portion de trafic réel pour le découvrir — l'exemple détaillé ci-dessus vous indique ce que coûte cette portion avant même de commencer. Si votre travail consiste en du chat à contexte court ou de la classification à grand volume, ce n'est pas votre modèle ; le nouveau tarif pour le contexte long et le tarif de sortie de 50,00 $ en font une façon coûteuse de faire ce que GPT-5.6 Luna fait pour une fraction du prix. Et si vous êtes une entreprise avec une exigence de conformité, commencez par la discussion sur le ZDR, car elle conditionne la remise Batch, le supplément lié à la résidence et votre choix de voie — et rien de tout cela n'est une décision que l'on peut prendre le jour où l'on en a besoin.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
