
GPT-6 Astra Ultrafast fonctionne sur Blackwell : NVIDIA nomme le matériel derrière le 8x
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 223 tok/s
- OpenAINOUVEAUOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAINOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAINOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Le 1er octobre 2026, NVIDIA a publié un article de Dion Harris intitulé « Comment les GPU NVIDIA contribuent à accélérer GPT-6 Astra Ultrafast d'OpenAI », et la phrase qui en constitue le cœur est la première fois que l'une ou l'autre des deux entreprises dit sur quoi tourne ce niveau de service : « GPT-6 Astra Ultrafast, exécuté sur des GPU NVIDIA Blackwell, est désormais disponible dans l'API OpenAI et pour les utilisateurs éligibles de ChatGPT Work et de Codex. » Voilà pour la nouvelle, et elle est plus limitée que ne le laisse entendre le titre. GPT-6 Astra, le modèle, a été publié le 3 septembre 2026. Le niveau de service Ultrafast qui le surplombe est devenu largement disponible le 29 septembre 2026. L'affirmation de vitesse — une génération de tokens jusqu'à 8 fois plus rapide qu'en mode standard Astra — avait déjà deux jours lorsque NVIDIA l'a reprise.
Ce qui soulève la question à laquelle le post répond vraiment : non pas « quelle est sa vitesse » mais « à qui appartient le silicium ».

Trois choses que le post a réellement ajoutées
Si l’on écarte la reformulation, la publication du 1er octobre apporte trois faits.
• Le matériel — Blackwell. La documentation Ultrafast d'OpenAI elle-même, publiée le 30 septembre, décrit la vitesse de ce niveau, sa configuration et ses limites de débit, sans nommer le moindre GPU. L'attribution au silicium repose donc sur une source unique : le fournisseur du matériel. Cela ne la rend pas fausse pour autant ; cela en fait une affirmation d'un fournisseur au sujet de son propre équipement, et il vaut la peine de la présenter comme telle.
• Deux ingénieurs nommés — Philippe Tillet, responsable de l'inférence chez OpenAI, et Uday Ruddarraju, directeur technique du calcul chez OpenAI, tous deux cités officiellement quant à l'origine de cette accélération.
• Le public visé — « les utilisateurs éligibles de ChatGPT Work et Codex », ce qui est plus large que le cadrage réservé à l'API avec lequel ce niveau a été lancé. La documentation d'OpenAI elle-même indique encore qu'Ultrafast pour GPT-6 Astra est « disponible pour tous les utilisateurs de l'API avec des limites de débit faibles », et cette mise en garde sur les limites faibles n'a pas été officiellement retirée.
Les deux citations, et pourquoi elles sont la partie intéressante
La contribution de Tillet est une boucle plutôt qu'un benchmark. L'investissement de NVIDIA dans l'outillage et la documentation, dit-il, « nous a permis de rendre nos modèles exceptionnellement bons en programmation », et Astra peut alors « transformer cette connaissance en noyaux hautes performances qui rendent le matériel NVIDIA séduisant ». Ruddarraju est plus direct sur l'orientation du travail : « Nous avons utilisé nos modèles internes pour optimiser l'inférence sur les GPU NVIDIA. »
Si on les lit ensemble, il s’agit d’une affirmation sur le déploiement plutôt que sur la capacité : les modèles de pointe d’OpenAI sont désormais suffisamment performants pour écrire des noyaux GPU qu’OpenAI les utilise pour optimiser sa propre pile de service. C’est également cohérent avec la seule section de l’article de NVIDIA qui ne porte pas du tout sur la semaine de lancement — une rubrique intitulée « Amélioration continue des performances », qui soutient que l’inférence déployée devient plus rapide avec le temps parce qu’OpenAI ne cesse de diriger ses propres modèles vers le logiciel NVIDIA sur lequel elle s’exécute.
Rien de tout cela n’est une mesure. Ce sont deux ingénieurs qui décrivent un processus, publié par l’entreprise qui a vendu les GPU. La lecture honnête est que ce processus est plausible, facile à croire et infalsifiable de l’extérieur — ce qui est aussi vrai de chaque chiffre de vitesse dans cette histoire.
Blackwell ici, Cerebras là
Ce que ce post fait de plus utile, c’est d’exposer une fracture que personne n’a expliquée. Le 13 août 2026, OpenAI a présenté en avant-première un palier rapide sur un modèle différent — GPT-5.6 Sol tournant « jusqu’à 14× » plus vite — et a désigné Cerebras comme le partenaire derrière cette offre, décrivant un matériel wafer-scale générant jusqu’à 750 jetons de sortie par seconde. Sept semaines plus tard, le palier rapide sur Astra tourne sur Blackwell, et le chiffre est de 8x.
Deux paliers rapides, deux réponses matérielles, l'une étant un partenaire spécialisé et l'autre le plus grand fournisseur de l'entreprise elle-même. Aucun des deux fournisseurs n'a publié de comparaison entre les deux chemins de service, et aucun évaluateur indépendant n'a mesuré ni l'un ni l'autre. Notez également ce que fait la publication de NVIDIA avec le second nom : « Rubin » n'apparaît qu'une fois, dans la citation de Tillet à propos de modèles qui écrivent des kernels pour « les GPU Blackwell et Rubin ». Il s'agit d'une déclaration sur ce que les modèles d'OpenAI peuvent programmer, et non d'une déclaration affirmant que quoi que ce soit est servi sur Rubin aujourd'hui.
Le numéro que NVIDIA n'a pas imprimé
Il y a un chiffre dans cette histoire qu'aucune des deux entreprises n'a placé à côté du 8x, et c'est celui qui détermine si une équipe active le palier. La grille tarifaire Ultrafast publiée par OpenAI répertorie gpt-6-astra à 60,00 $ par million de jetons d'entrée, 6,00 $ pour l'entrée mise en cache, 75,00 $ pour l'écriture de cache et 300,00 $ pour la sortie. Le même modèle au palier standard est à 10,00 $ et 50,00 $, avec l'entrée mise en cache à 1,00 $ et l'écriture de cache à 12,50 $. Chaque colonne correspond exactement à six fois le tarif standard.
• Le multiplicateur — 6,00x sur l'entrée, la sortie, l'entrée mise en cache et l'écriture de cache. Pas « jusqu'à ». Six.
• Le plafond — 8x, le chiffre que les deux fournisseurs citent avec « jusqu'à » accolé et sans conditions précisées.
• Ce que cela signifie — le multiple de prix se situe en dessous du meilleur cas revendiqué par le palier lui-même. Au plafond, l'opération est avantageuse ; pour tout ce qui est inférieur à 6x sur votre trafic, vous payez plus par unité de temps gagnée que ne le laisse entendre le marketing. C'est pourquoi le seul test pertinent de ce palier est une mesure sur vos propres requêtes.
• Le palier de contexte long — au-delà de 272 000 jetons d'entrée, les tarifs Ultrafast passent à $120.00 en entrée et $450.00 en sortie, soit six fois les tarifs par palier de la catégorie standard elle-même.
• Les petits caractères opérationnels — OpenAI documente une échelle Ultrafast de jetons par minute de 500 000 pour les niveaux d'utilisation 1 à 3, 1 000 000 pour le niveau 4 et 5 000 000 pour le niveau 5 ; Ultrafast ne prend en charge que la résidence des données aux États-Unis et le traitement mondial, sans point de terminaison de traitement régional dans l'UE ni dans d'autres régions hors États-Unis ; et la documentation recommande WebSockets pour Ultrafast « en particulier pour les applications agentiques qui effectuent de nombreux appels d'outils en succession rapide », en avertissant que « sans connexion persistante, la surcharge réseau peut réduire les gains de latence. »

Ce dernier point est celui sur lequel il faut agir. Une équipe qui active le palier et laisse du HTTP par requête en dessous a payé six fois le tarif pour rendre une partie du gain de vitesse à l'établissement de connexion — une façon documentée et évitable de gaspiller l'argent.
À quoi cela ressemble depuis un seul point de terminaison
GPT-6 Astra est sur OrcaRouter en tant que openai/gpt-6-astra : une fenêtre de contexte de 1 050 000 tokens, jusqu'à 128 000 tokens de sortie, des entrées texte, image et fichier, et le prix catalogue d'OpenAI répercuté directement à 10,00 $ en entrée et 50,00 $ en sortie par million de tokens, passant à 20,00 $ et 75,00 $ au-delà de 272 000 tokens d'entrée. Son benchmark phare du catalogue est de 96,1 sur GPQA Diamond.
Le palier Ultrafast n'est pas disponible sur OrcaRouter, et il ne peut pas l'être : c'est un attribut d'un compte OpenAI soumis à un contrôle d'accès, et non un identifiant de modèle, ce qui explique pourquoi openai/gpt-6-astra-ultrafastrenvoie « model-not-found ». Si vous activez ce palier, il réside dans votre intégration OpenAI directe. Ce qu'un point de terminaison de plus de 200 modèles avec 0 % de margevous apporte dans cette situation, ce n'est pas la voie rapide — c'est le contrôle. Parce que le prix catalogue du fournisseur est répercuté plutôt que majoré, un changement de tarif d'OpenAI arrive de notre côté le jour même où il arrive du leur, et comme la voie Astra standard est déjà en place, l'expérience qui tranche cette décision tient en une ligne de configuration : le même prompt, le palier standard, et un modèle moins cher à côté, sur la même clé. C'est ce qui s'approche le plus d'un benchmark de latence que la plupart des équipes auront l'occasion de réaliser, et sa mise en place ne coûte rien.

Qu’est-ce qui n’a pas encore été mesuré ?
Trois éléments sont vérifiables aujourd'hui. Le palier existe, il figure sur la grille tarifaire à exactement six fois le tarif standard, et à compter du 1er octobre, il est publiquement attribué aux GPU NVIDIA Blackwell.
Une chose n’est pas au rendez-vous : le multiplicateur sur votre trafic. Aucun fournisseur n’a publié de distribution de latence pour le palier à un niveau de concurrence déclaré, et aucun tiers n’a reproduit le 8x. Il n’existe pas non plus de benchmark comparant Astra sur Ultrafast à Astra en standard, et il ne devrait pas y en avoir de flatteur — c’est le même checkpoint sur un chemin plus rapide, donc des paramètres identiques devraient produire des réponses identiques à des vitesses différentes. Si vos deux voies divergent sur les mêmes prompts, vous avez un rapport de bug, pas une fonctionnalité.
Donc, le résumé utile du 1er octobre est plus mince que ne le laisse entendre l’annonce. C’est le même niveau au même prix, avec le même plafond de vitesse non vérifié, désormais affublé d’une étiquette matérielle. Cette étiquette compte — elle vous dit sur quelle gamme d’accélérateurs OpenAI fait monter en charge cela, et elle vous dit que l’histoire du niveau rapide est passée d’un partenaire spécialisé au plus grand fournisseur de GPU du secteur en moins de deux mois. Simplement, elle ne vous dit rien sur votre propre budget de latence, et aucune publication ne le fera.
