
GPT-6.1 Sol Ultrafast déployé sur l'API, Codex et ChatGPT fonctionnent
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
OpenAI déploie le mode Ultrafast pour GPT-6.1 Sol — le palier de service le plus rapide qu'elle propose, et la première fois que le palier Sol proche d'Astra en dispose d'un. Ce déploiement place GPT-6.1 Sol dans la même catégorie que GPT-6 Astra Ultrafast dans l'API, dans Codex et dans ChatGPT Work, et il arrive avec une grille tarifaire publiée plutôt qu'une liste d'attente : 12,00 $ par million de tokens d'entrée et 60,00 $ par million de tokens de sortie, exactement six fois ce que la version standard de GPT-6.1 Sol coûte. L'affirmation de vitesse affichée est « jusqu'à 8x ». La partie intéressante, c'est ce que cette expression mesure, et la réponse n'est pas le modèle que vous êtes sur le point de payer.
Le journal des modifications destiné aux développeurs contient l'entrée datée du 8 octobre : « Ajout du mode Ultrafast pour GPT-6.1 Sol dans l'API Responses. Utilisez gpt-6.1-sol avec service_tier: "ultrafast" pour réduire le délai entre les jetons de sortie générés. Il est disponible pour tous les utilisateurs de l'API, sous réserve des limites de débit, avec un traitement à l'échelle mondiale et une résidence des données aux États-Unis et dans l'UE. » La page de documentation d'Ultrafast indique désormais « largement disponible pour GPT-6 Astra et GPT-6.1 Sol, avec un accès en avant-première pour GPT-5.6 Sol », et la page consacrée à la vitesse côté ChatGPT confirme la partie liée à l'abonnement : Ultrafast est disponible dans Codex et ChatGPT Work avec l'offre Pro à 500 $ et sur les offres Enterprise et Edu éligibles.
Ultrafast est un niveau de service, pas un second modèle
Rien ne change du côté des poids. Même checkpoint, même fenêtre de contexte de 1 050 000 jetons, même entrée maximale de 922 000 jetons, même plafond de sortie de 128 000 jetons, même date limite de connaissances au 30 avril 2026, mêmes réponses. Ce que vous achetez, c'est une priorité d'ordonnancement : le modèle génère les jetons plus rapidement, et la formulation employée par OpenAI est délibérément étroite — le niveau « réduit le temps entre les jetons de sortie générés ». Il ne rend pas le modèle plus intelligent et il ne raccourcit pas la phase de réflexion.
Cette distinction est toute la décision. Pour une boucle d’agent qui enchaîne quarante appels d’outils, le gain se cumule, car la sortie de chaque tour arrive plus tôt. Pour une seule requête de raisonnement difficile qui passe la majeure partie de son temps réel à délibérer, vous pouvez payer six fois plus et regarder le même spinner.
L'échelle des niveaux, une fois, en termes simples :
• Batch and Flex — moitié du tarif Standard, la voie économique pour les tâches que personne n'attend
• Standard — 2,00 $ en entrée / 0,10 $ en cache / 2,50 $ pour l'écriture en cache / 10,00 $ en sortie par million de tokens
• Fast — deux fois le tarif Standard, soit 4,00 $ / 0,20 $ / 5,00 $ / 20,00 $ ; OpenAI a renommé le traitement Priority en mode Fast le 30 juillet 2026
• Ultra rapide — six fois Standard, ou 12,00 $ / 0,60 $ / 15,00 $ / 60,00 $
• Au-delà de 272 K jetons d'entrée — l'ensemble de la requête est refacturé à 2x les tarifs d'entrée et de cache, et à 1,5x la sortie ; Ultrafast long-context est à 24,00 $ / 1,20 $ / 30,00 $ / 90,00 $
L’arithmétique que personne ne met sur la page marketing
Six fois le prix pour huit fois la vitesse n'est pas une opération à perte, et ce n'est pas non plus un repas gratuit. Ultrafast est facturé par token : une tâche qui coûte 1,00 $ au tarif Standard coûte 6,00 $ au tarif Ultrafast — et se termine en environ un huitième du temps. L'économie ne se trouve pas dans la facture, mais dans le temps d'horloge. Vous payez cinq dollars de plus pour éliminer les sept huitièmes du temps d'attente de cette tâche, et savoir si c'est bon marché ou absurde dépend entièrement de la valeur par minute de la personne ou du pipeline qui attend à l'autre bout.
Deux implications en découlent, et ce sont celles que l’on oublie :
• Le travail interactif, c'est le oui facile. Un développeur qui regarde un diff atterrir, un agent qui ne peut pas avancer tant qu'il n'a pas lu le résultat — voilà les cas où la latence est le produit. Une sortie huit fois plus rapide sur une boucle de quarante tours n'est pas une amélioration marginale pour la perception humaine ; c'est la différence entre un outil que l'on utilise et un outil que l'on met en arrière-plan.
• Pour le travail planifié et par lots, dire non est facile. Si une tâche a de toute façon jusqu'au matin, Ultrafast est une facture 6x pour rien, et la voie Batch à moitié prix est juste là.
L’entrée mise en cache mérite un second regard, car elle évolue elle aussi : 0,60 $ par million sur Ultrafast contre 0,10 $ sur Standard, soit toujours 5 % du tarif d’entrée non mise en cache. Les agents avec mise en cache du prompt qui renvoient un grand prompt système à chaque tour constateront que la remise liée au cache évolue avec le palier au lieu de les en protéger.

D'où vient le chiffre « jusqu'à 8x »
C'est la partie à lire attentivement, car c'est là que le titre du déploiement et la documentation du déploiement décrivent discrètement des choses différentes.
La seule mesure de vitesse spécifique à un modèle qu’OpenAI publie est cette phrase : « GPT-6 Astra Ultrafast génère des tokens jusqu’à 8 fois plus vite que GPT-6 Astra en mode Standard dans Codex. » Il s’agit d’un chiffre pour Astra, mesuré dans Codex. Aucun facteur équivalent n’a été publié pour GPT-6.1 Sol. Le document qui traite d’Ultrafast pour ce modèle indique qu’il réduit le temps entre les tokens de sortie générés et renvoie à une grille tarifaire ; il n’avance aucun chiffre. La page de vitesse côté ChatGPT reprend la phrase sur Astra et s’arrête là.
Donc, l’interprétation honnête de « jusqu’à 8 fois plus rapide » est la suivante : c’est l’argument phare de ce niveau, issu du modèle frère qui est sur Ultrafast depuis le 29 septembre, et c’est une allégation de fournisseur qu’aucun tiers indépendant n’a reproduite pour l’un comme pour l’autre modèle. Cela peut très bien se vérifier pour GPT-6.1 Sol — les deux tournent sur la même pile de service et le mécanisme du niveau est le même — mais personne en dehors d’OpenAI n’a publié de mesure de tokens par seconde pour la variante Sol, et le « jusqu’à » joue un vrai rôle dans cette phrase.
Il vaut également mieux garder les niveaux séparés par modèle, car le plus ancien reste un dossier inachevé. Ultrafast a été annoncé le 13 août 2026 pour GPT-5.6 Sol, avec une vitesse « jusqu'à 14 fois supérieure au traitement Standard », en aperçu limité pour certains clients. Trois mois plus tard, la documentation indique toujours que GPT-5.6 Sol bénéficie d'un « accès en aperçu » et la grille tarifaire d'Ultrafast ne contient que deux lignes : GPT-6 Astra et GPT-6.1 Sol. Un chiffre de 14x qui n'a jamais atteint la disponibilité générale et n'a aucun tarif publié est une affirmation, pas un produit.

Qui peut réellement l’activer ?
Le côté API est vaste ; le côté abonnement est étroit, et cette différence prend les gens au dépourvu.
• API — disponible pour tous les utilisateurs de l'API sur gpt-6.1-sol, soumis à des limites de débit distinctes de celles de Standard et Fast. Cela signifie un second budget à surveiller, pas seulement un second prix.
• Limites de débit ultrarapides pour GPT-6.1 Sol — 1 000 000 de tokens par minute avec Build, 4 000 000 avec Launch, 40 000 000 avec Grow. OpenAI a simplifié ses paliers d'utilisation de cinq à trois le 6 octobre ; ces trois noms correspondent donc à l'échelle actuelle, et non à une dénomination héritée du passé.
• Résidence des données — GPT-6.1 Sol prend en charge la résidence des données aux États-Unis et dans l'UE ainsi que le traitement mondial, y compris avec Fast et Ultrafast. L'Ultrafast d'Astra n'obtient pas la résidence dans l'UE, donc si votre charge de travail est épinglée à l'UE, il s'agit de la première configuration Ultrafast que vous pouvez acheter tout court.
• Codex et ChatGPT Work — Ultrafast est disponible avec le forfait Pro à 500 $ ainsi que sur les forfaits Enterprise et Edu éligibles. Les administrateurs Enterprise le trouvent désactivé par défaut et doivent l’activer par utilisateur ou par espace de travail.
• Chat — non inclus. GPT-6.1 Sol lui-même vit dans Work et Codex ; l’interface Chat grand public n’en fait pas partie.
• Comment la facturation fonctionne avec un abonnement — l'utilisation incluse est consommée à 8 fois le tarif Standard, et les crédits achetés ou le paiement à l'usage Enterprise sont facturés à 6 fois le tarif Standard. Ces deux chiffres méritent d'être connus avant de laisser l'option activée.
Un détail d’implémentation détermine si vous ressentez le moindre gain de vitesse. Les recommandations d’OpenAI sont sans ambiguïté à ce sujet : utilisez WebSockets, « en particulier pour les applications agentiques qui effectuent de nombreux appels d’outils en succession rapide », car « sans connexion persistante, la surcharge réseau peut réduire les gains de latence ». Si votre client ouvre une nouvelle connexion HTTP à chaque appel, la surcharge par requête peut engloutir tout l’avantage du palier que vous venez de payer 6 fois plus cher. HTTP fonctionne toujours. Il ne vaut peut-être simplement pas le palier.
Ce que nous routons, et ce que nous ne routons pas
Le GPT-6.1 Sol de gamme standard est disponible sur OrcaRouter sous la référence openai/gpt-6.1-sol au tarif propre du fournisseur, soit 2,00 $ en entrée et 10,00 $ en sortie par million de tokens, servi à 0 % de marge — le prix catalogue du fournisseur répercuté tel quel, si bien que lorsque OpenAI modifie un tarif, le changement se retrouve sur votre facture le jour même où il apparaît sur la grille tarifaire, et non à votre prochain renouvellement de contrat. La même clé et le même endpoint prennent en charge plus de 200 modèles, de sorte qu'un appel à GPT-6.1 Sol et un appel à Claude ou Qwen se trouvent derrière une seule intégration, avec basculement automatique et sans second contrat, et le DSL de routage composera les modèles en un seul appel lorsqu'une tâche nécessite plus d'un avis.
Ultrafast ne fait pas partie de ces modèles, et il serait trompeur de laisser entendre le contraire. C'est un indicateur de niveau de service sur un compte OpenAI — vous envoyez service_tier: "ultrafast"à gpt-6.1-solet OpenAI facture votre propre compte aux tarifs ci-dessus — il s'inscrit donc dans votre intégration OpenAI directe. Si vous l'activez, gardez le trafic soumis aux paliers sur votre clé de fournisseur et acheminez le trafic à volume standard via nous. C'est la répartition honnête, et c'est aussi la moins chère pour tout ce qui n'attend pas après un humain.

Quoi en faire aujourd'hui
Si vous disposez d'un siège Codex ou ChatGPT Work sur Pro $500, l'option est déjà là et l'essai ne vous coûte rien d'autre que le multiplicateur d'usage — exécutez la même tâche des deux manières et voyez si la boucle que vous exécutez réellement comporte suffisamment de tours pour que le facteur huit se manifeste. Si vous êtes sur l'API, l'expérience qui vaut la peine d'être menée est plus étroite que ne le suggère l'annonce : mesurez quelle part de votre latence correspond à la génération de tokens et quelle part correspond à la réflexion du modèle, puis dirigez Ultrafast vers la partie qu'il peut réellement compresser.
Et si vous avez le choix entre Fast à 2x et Ultrafast à 6x pour la même requête, Fast est le palier arrivé en premier, celui dont on peut déduire le comportement à partir d'une simple grille tarifaire. Ultrafast est nouveau pour ce modèle, sans prix établi par la mesure indépendante de quiconque, et ne vaut exactement que ce que votre propre chronomètre en dit.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
