
GPT-5.6 Sol Ultrafast : la version Ultrafast lancée à 6× le prix standard, mais ce modèle n'est encore disponible qu'en aperçu
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 362 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
L'attente est terminée pour le palier, mais pas pour ce modèle. Lors du DevDay du 29 septembre 2026, le fournisseur a fait d'Ultrafast quelque chose que l'on peut acheter : le nouveau forfait ChatGPT Pro 500 à 500 $ par mois l'inclut, l'API publie désormais une grille tarifaire Ultrafast à six fois le tarif standard — 60,00 $ en entrée / 300,00 $ en sortie par million de tokens sur GPT-6 Astra — et la documentation Codex du fournisseur confirme que les paliers Pro ne comportent aucune limite d'utilisation de cinq heures, une fenêtre qui s'applique à Plus. Tout cela est déclaré par le fournisseur, publié dans son propre récapitulatif DevDay, ses pages d'aide et sa documentation développeur. Ce qui n'a pas bougé, c'est le modèle dont cette page parle. GPT-5.6 Sol Ultrafast, annoncé le 13 août 2026 comme le palier de service accéléré par Cerebras pour GPT-5.6 Sol à un débit allant jusqu'à 14× le débit standard et 750 tokens de sortie par seconde, est toujours en accès en avant-première uniquement — organisé par l'intermédiaire de l'équipe de compte du fournisseur — et n'a toujours pas de tarif publié qui lui soit propre. Le palier a été déployé. La variante Sol, elle, attend toujours.
Deux mouvements tarifaires se sont produits depuis que nous avons rédigé cet article pour la première fois, et ils vont dans des directions opposées. Le modèle sous-jacent est devenu moins cher : le GPT-5.6 Sol standard est désormais facturé 4,00 $ par million de tokens d'entrée et 20,00 $ par million de tokens de sortie — tarif promotionnel d'OpenAI, que le fournisseur indique comme disponible au moins jusqu'au 21 novembre 2026 — et non les 5,00 $ / 30,00 $ en vigueur en août. Le niveau de vitesse qui vient s'y ajouter a été tarifé pour la première fois, et il n'est pas bon marché : Ultrafast sur GPT-6 Astra est facturé 60,00 $ / 300,00 $ par million. Chaque chiffre de cet article a été revérifié par rapport à la grille tarifaire publiée par OpenAI, à sa référence API et à sa documentation tarifaire Codex le 30 septembre 2026.
Ce qu'est réellement le mode Ultrafast
Ultrafast est un niveau de service, et non un nouveau modèle. OpenAI l'a annoncé le 13 août 2026 comme le premier produit de son partenariat de calcul de janvier 2026 avec le fabricant de puces Cerebras — un accord estimé à environ 10 milliards de dollars sur trois ans. Là où l'inférence standard GPT-5.6 Sol s'exécute sur des clusters de GPU et passe une grande partie de son temps à déplacer les poids entre la mémoire et les unités de calcul, Ultrafast charge les poids du modèle dans 44 Go de SRAM sur puce, sur les puces à l'échelle du wafer de Cerebras ; un modèle de la taille de Sol s'étend sur plusieurs wafers, en couches, de sorte que les poids se trouvent là où s'effectue le calcul. Le résultat est un plafond de débit déterminé par le silicium plutôt que par la bande passante mémoire.
L'histoire du matériel a évolué le 18 août 2026. Lors de son événement Supernova, Cerebras a dévoilé le CS-4, le système à l'échelle du rack de nouvelle génération construit sur sa plateforme Nexus — trois puces Wafer-Scale Engine par rack, jusqu'à 2× la vitesse de génération de tokens du CS-3 précédent et, selon Cerebras, plus de 1 000 tokens par seconde sur des modèles dépassant 10 000 milliards de paramètres. Ce sont les affirmations de Cerebras pour un système en accès anticipé, pas encore disponible au grand public. Depuis le dévoilement, un seul post sur X affirme que le CS-4 sert déjà GPT-5.6 Sol à environ 1 300 tokens par seconde — ce qui va dans le même sens que les chiffres de Cerebras, mais n'est confirmé par personne pour l'instant. Considérez-le comme un signal précoce : plausible, non vérifié, et à revérifier avant de planifier votre capacité autour de ces données.
La partie qui compte pour votre code : l’identifiant du modèle, les poids, le comportement de raisonnement et la sortie sont identiques au GPT-5.6 Sol standard. OpenAI présente Ultrafast comme « plus de travail utile par seconde » plutôt que comme un niveau de qualité, et l’aperçu exécute le modèle phare complet — la vitesse ne vient pas du remplacement par un modèle moins cher. Ce qui change, c’est la vitesse à laquelle les jetons sont générés.
Ne confondez pas Ultrafast avec le mode rapide. Le mode rapide est un niveau distinct et payant sur du matériel standard : jusqu'à environ 2,5× la vitesse de sortie, avec un supplément de 2× par token, sans aucun changement de qualité — il a été renommé depuis Priority Processing le 30 juillet 2026, et sur GPT-5.6 Sol, il coûte 8,00 $ en entrée / 40,00 $ en sortie par million. Ultrafast, c'est autre chose — du matériel Cerebras, jusqu'à 14× sur GPT-5.6 Sol et jusqu'à 8× sur GPT-6 Astra, au tarif de 6× le prix standard sur Astra et encore sans tarif sur Sol. Les deux noms se retrouvent désormais côte à côte dans le même sélecteur de modèle, ce qui reste l'élément le plus déroutant de cette version.
À quelle vitesse — les chiffres qui comptent

Le chiffre principal est 14×, et il nécessite une définition. OpenAI affirme qu'Ultrafast génère jusqu'à 750 tokens de sortie par seconde, contre un traitement standard GPT-5.6 Sol. Il s'agit d'un débit pour les tokens de sortie, et non d'une affirmation générale selon laquelle « tout tourne 14× plus vite » — le temps de requête de bout en bout inclut également le traitement des entrées et le raisonnement du modèle lui-même, c'est pourquoi 14× est qualifié de maximum.
• Débit de sortie maximal — jusqu'à 750 jetons de sortie par seconde, selon l'annonce d'OpenAI (2026-08-13).
Par rapport au traitement standard — jusqu’à 14× plus rapide, d’après la même annonce ; les gains réels varient selon la longueur d’entrée et le type de tâche.
• Humanity's Last Exam, 2 500 questions — OpenAI/Cerebras rapportent que GPT-5.6 Sol Ultrafast termine en 11 heures 11 minutes, contre 78 heures 27 minutes pour Claude Fable 5, avec une précision comparable. Chiffres rapportés par les fournisseurs, et la comparaison couvre les piles matérielles de deux fournisseurs — à interpréter comme une indication directionnelle, pas comme un verdict.
• GDP-Val, de bout en bout — Cerebras rapporte une accélération globale de 5,6× sans perte de qualité mesurable. Également rapporté par le fournisseur.
• Fast mode et Ultrafast comparés — Fast mode plafonne à environ 2,5× la vitesse de sortie pour un surcoût de 2×, plafonné à la même limite d'environ 272 K tokens que la tarification standard. Ultrafast représente le bond le plus important : 14× sur GPT-5.6 Sol selon l'annonce d'août, et jusqu'à 8× sur GPT-6 Astra dans Codex d'après la documentation actuelle d'OpenAI, avec une couverture du lancement qui l'établit à jusqu'à 300 tokens de sortie par seconde.
• CS-4, le prochain matériel — Cerebras affirme que le rack CS-4 délivre plus de 1 000 tokens par seconde sur des modèles de plus de 10 billions de paramètres, soit jusqu'à 2× la génération de tokens du CS-3. Un rapport non vérifié de la communauté situe GPT-5.6 Sol sur CS-4 à environ 1 300 tokens par seconde — même direction, pas encore confirmé par OpenAI ou Cerebras.
Une mise en garde avant de citer le 14× : il s'agit d'un plafond de débit de sortie sur le matériel d'un seul fournisseur, et les comparaisons indépendantes du lancement d'août allaient d'environ 7× à 11× selon la partie de la charge de travail mesurée. La même discipline s'applique au signal de vitesse du CS-4 — le chiffre d'environ 1 300 jetons/s pour GPT-5.6 Sol sur CS-4 provient d'un seul post X, et ni OpenAI ni Cerebras ne l'ont confirmé. Considérez tout cela comme des affirmations de fournisseurs et de la communauté, et non comme des verdicts de benchmark.
Ce que coûte Ultrafast aujourd'hui — et pourquoi cela ne valorise toujours pas Sol

Voici, énoncé simplement, l'état de la question tarifaire au 2026-09-30. Ultrafast a un tarif publié — pour GPT-6 Astra, et uniquement pour GPT-6 Astra. La page de tarification d'OpenAI comporte désormais une colonne Ultrafast aux côtés de Standard, Batch, Flex et Fast : 60,00 $ en entrée / 6,00 $ en entrée mise en cache / 75,00 $ en écritures de cache / 300,00 $ en sortie par million de tokens en contexte court, doublant à 120,00 $ / 12,00 $ / 150,00 $ / 450,00 $ au-delà d'environ 272K tokens. Cela représente six fois le tarif Astra standard, alors que le mode fast est à deux fois — et c'est le premier chiffre concret qu'OpenAI a associé à ce palier. La carte ci-dessus est notre propre instantané du 2026-08-18, et ses montants en dollars ont été supplantés à double titre, par la baisse du tarif standard, puis désormais par cette ligne Ultrafast. Ce qui manque encore à ce tableau, c'est un quelconque tarif Ultrafast pour GPT-5.6 Sol : la colonne Ultrafast ne répertorie exactement qu'un seul modèle, gpt-6-astra. Le palier est tarifé ; ce modèle ne l'est pas.
Ce que vous pouvez chiffrer aujourd’hui, modèle par modèle :
• Standard GPT-5.6 Sol — 4,00 $ en entrée / 20,00 $ en sortie par million de tokens pour les prompts allant jusqu’à environ 272 K tokens. OpenAI indique qu’il s’agit d’un tarif promotionnel disponible au moins jusqu’au 21 novembre 2026. C’est le modèle de référence que vous pouvez appeler dès maintenant.
• Mode rapide — 8,00 $ / 40,00 $ en contexte court sur GPT-5.6 Sol, passant au double, soit 16,00 $ / 60,00 $, au-delà d'environ 272K tokens. Deux fois le tarif standard pour une vitesse de sortie jusqu'à environ 2,5× supérieure, et sur Sol, c'est encore ce qui se fait de plus rapide que vous puissiez réellement acheter.
• Cache de prompts — les lectures du cache sont facturées à 0,40 $ par million (90 % de réduction par rapport à l’entrée non mise en cache) ; les écritures dans le cache sont facturées à 5,00 $ par million.
• Palier de contexte long — les entrées au-delà d’environ 272 K jetons sont facturées à 8,00 $ / 30,00 $ en traitement standard, dans la fenêtre d’environ 1,05 M de jetons du modèle et avec une sortie maximale de 128 K jetons.
• Batch API — 2,00 $ / 10,00 $ pour le contexte court et 4,00 $ / 15,00 $ pour le contexte long, une réduction forfaitaire de 50 % avec un délai d'environ 24 heures.
Pour GPT-5.6 Sol, le chiffre Astra est le meilleur indice disponible, et rien de plus. OpenAI facture Ultrafast à 6× le tarif standard du modèle sous-jacent ; appliquez ce multiplicateur aux 4 $ / 20 $ de Sol et vous obtenez 24 $ / 120 $ par million. C’est de l’arithmétique, pas un tarif publié — OpenAI n’a rien dit au sujet d’un tarif Sol Ultrafast, et les cohortes de prévisualisation d’août n’ont pas du tout été facturées à un tarif par palier. Prévoyez en vous basant sur Sol standard à 4 $ / 20 $ ou sur le mode rapide à 8 $ / 40 $ jusqu’à ce que le fournisseur publie la ligne.
Comment l'utiliser — largement disponible sur Astra, encore sur demande pour Sol
L'accès s'est scindé en deux le 29 septembre, et cette scission va à l'encontre du modèle dont traite cette page. Ultrafast est désormais largement disponible sur GPT-6 Astra : la documentation de l'API d'OpenAI indique qu'il est ouvert à tous les utilisateurs de l'API avec des limites de débit basses — 500 000 tokens par minute pour les niveaux d'utilisation 1 à 3, 1 million pour le niveau 4, 5 millions pour le niveau 5 — et qu'il est intégré à ChatGPT Work et Codex dans le nouveau forfait Pro 500 ainsi que dans les forfaits Enterprise et Edu éligibles, où un propriétaire d'espace de travail doit l'activer, et où il n'est pas pris en charge pour les espaces de travail qui nécessitent une inférence en dehors des États-Unis. GPT-5.6 Sol Ultrafast n'a pas suivi le mouvement. La même documentation le décrit encore comme un accès en aperçu via une équipe de compte OpenAI, et la description du paramètre lui-même dans le schéma de l'API indique toujours « currently available for gpt-5.6-sol » — une mention qui traîne désormais derrière le reste de la documentation au lieu de le précéder. Si vous voulez ce niveau aujourd'hui, c'est sur Astra qu'il vous le faut.
La question de l'interface est elle aussi réglée. TestingCatalog a rapporté le 2026-09-26 qu'un sélecteur de vitesse proposant Standard, Fast et Ultrafast se trouvait, non publié, dans le Responses API Playground ; trois jours plus tard, OpenAI a lancé la version grand public de exactement cela, Ultrafast étant désormais une option dans le sélecteur de modèle de ChatGPT Work et Codex sur Pro 500. Nous avions signalé cette observation comme la lecture, par une publication, d'une interface non publiée, et précisé qu'OpenAI n'en avait rien confirmé. Elle voyait juste sur la direction, et le déploiement qu'elle annonçait est arrivé au DevDay plutôt qu'après.
Les cohortes d'aperçu qu'OpenAI a nommées en août étaient le codage, le commerce, la recherche financière, le support et d'autres charges de travail interactives — des équipes dont les agents effectuent de nombreux appels par requête et pour lesquelles la latence de réponse est le goulot d'étranglement. Jane Street, Rogo et Podium figuraient parmi les premiers testeurs nommés. Si votre charge de travail est un chat à un seul tour, le niveau de vitesse importe bien moins que pour une boucle d'agent à 40 appels. La réponse pratique dépend désormais du modèle dont vous parlez : sur GPT-6 Astra, vous pouvez définir service_tier: "ultrafast" dès cet après-midi, et sur GPT-5.6 Sol, vous ne le pouvez toujours pas.
Ce que vous pouvez faire aujourd'hui — la réponse pratique

Alors que GPT-5.6 Sol Ultrafast reste derrière la porte de l'aperçu, les deux modèles phares sont en ligne sur OrcaRouter au tarif du fournisseur, avec 0 $ de marge par token — ID du modèle openai/gpt-5.6-sol via le point de terminaison compatible OpenAI à l'adresse api.orcarouter.ai/v1, et GPT-6 Astra à côté, au tarif standard de 10,00 $ / 50,00 $, c'est le modèle sur lequel OpenAI a désormais ajouté un palier Ultrafast et que nous n'acheminons pas à ce palier. La capture ci-dessous date d'août 2026 et affiche encore la ligne alors en vigueur de 5,00 $ / 30,00 $ ; le tarif Sol actuel est de 4,00 $ / 20,00 $, que nous répercutons tel quel. C'est cette répercussion qui fait que les mouvements de prix du fournisseur nous parviennent le jour même : 4,00 $ en entrée / 20,00 $ en sortie, les mêmes chiffres qu'OpenAI publie, sans marge par token ajoutée par-dessus. Si vous disposez déjà d'un client OpenAI, la migration consiste à changer l'URL de base et l'ID du modèle ; rien d'autre. La même clé et le même point de terminaison donnent accès à plus de 200 modèles, donc Sol côtoie ses propres modèles frères — GPT-5.6 Terra à 2,00 $ / 12,00 $ et GPT-5.6 Luna à 0,20 $ / 1,20 $ — ainsi que les modèles à poids ouverts auxquels vous le compareriez, et vous pouvez acheminer selon la difficulté au lieu de réintégrer chacun d'eux.
Deux spécificités d’OrcaRouter méritent d’être mentionnées sur une page consacrée à la vitesse. BYOK : apportez votre propre clé OpenAI, et OpenAI vous facture directement selon ses propres tarifs — OrcaRouter n’ajoute 0 $ par token et préserve intacts vos limites de débit et vos crédits chez votre fournisseur. Guardrails : le PII Shield et la politique de contenu s’exécutent avant la facturation, de sorte qu’une requête bloquée reçoit un 400 propre et n’est jamais facturée, et l’Agent Firewall évalue les appels d’outils et MCP avant leur exécution. Ultrafast est largement disponible sur GPT-6 Astra, mais pas selon des conditions routables et pas pour Sol — il s’agit d’un palier à accès contrôlé facturé 6 fois le tarif standard, et nous ne le proposons pas. Si OpenAI venait un jour à le proposer selon des conditions standard, le brancher sur le même endpoint ne représenterait qu’un changement de model-id ; la configuration que vous mettez en place aujourd’hui reste valable.
La limite honnête — quand Ultrafast n'est pas la réponse
Cinq points où l’histoire de la vitesse ne tient toujours pas, maintenant que la moitié s’est réglée :
Disponible ne veut pas dire accessible pour vous. Ultrafast a été ouvert à tous les utilisateurs de l’API sur GPT-6 Astra, mais il a été ouvert avec de faibles limites de débit, il est toujours décrit comme soumis à contrôle d’accès dans le schéma d’OpenAI, il ne prend pas en charge le traitement régional dans l’UE ou dans d’autres régions hors États-Unis, et dans les espaces de travail Enterprise, il est désactivé jusqu’à ce qu’un propriétaire l’active. Sur GPT-5.6 Sol, rien ne s’est ouvert du tout. Vérifiez votre propre accès avant de concevoir une architecture sur l’un ou l’autre.
14× est un maximum, pas une garantie. Il s’agit d’un plafond de débit de sortie sur le matériel Cerebras ; la latence de bout en bout inclut toujours le traitement des entrées, le temps de raisonnement du modèle et votre propre réseau. Une requête à forte intensité de raisonnement peut passer la majeure partie de son temps réel à raisonner, là où l’accélération mise en avant diminue.
L'un des modèles a un prix, et l'autre n'en a pas. Le tarif Astra Ultrafast est publié — 6× le tarif standard — et il n'existe nulle part de ligne Ultrafast pour GPT-5.6 Sol. Établissez votre budget sur la base de Sol standard à 4 $ / 20 $ ou du mode rapide à 8 $ / 40 $, et considérez tout chiffre de « coût GPT-5.6 Sol Ultrafast » que vous voyez, y compris l'extrapolation de 24 $ / 120 $ ci-dessus, comme un calcul arithmétique plutôt qu'une grille tarifaire.
Les benchmarks sont déclarés par le fournisseur. L'exécution HLE de 11 heures et le chiffre de 5,6× pour GDP-Val sont des chiffres OpenAI/Cerebras issus de l'annonce d'août ; les estimations indépendantes de l'accélération vont d'environ 7× à 11× selon ce qui est mesuré. Ajoutez le signal CS-4 à cette liste : le chiffre d'environ 1 300 tokens/s pour GPT-5.6 Sol sur CS-4 provient d'un seul post sur X et n'a aucune confirmation indépendante. Les nouveaux chiffres d'Astra Ultrafast — 8× dans Codex, 6× le prix — sont également ceux d'OpenAI.
Et celui qui coûte de l'argent plutôt que du temps : il ne corrigera pas un goulot d'étranglement que vous n'avez pas. Si vos agents sont lents à cause de votre propre orchestration, de la latence des outils ou de prompts à forte charge d'entrée, un chemin de sortie plus rapide ne déplace que légèrement la queue de latence. La décision d'appariement de palier — GPT-5.6 Sol à 4 $ / 20 $ contre GPT-5.6 Terra à 2 $ / 12 $ contre GPT-5.6 Luna à 0,20 $ / 1,20 $ — fait encore plus bouger votre facture que n'importe quel palier de vitesse.
En résumé. Ultrafast n'est plus un niveau de liste d'attente dont on ne peut que lire des informations. Depuis le 29 septembre 2026, OpenAI le commercialise : inclus avec le forfait ChatGPT Pro 500 à 500 $ dans Work et Codex, ouvert à tous les utilisateurs de l'API sur GPT-6 Astra avec des limites de débit faibles, et facturé six fois le tarif standard — 60 $ / 300 $ par million en contexte court. GPT-5.6 Sol Ultrafast, l'aperçu d'août autour duquel cette page a été construite, n'a pas bougé : toujours à accès contrôlé, toujours limité à gpt-5.6-sol dans le schéma de l'API, toujours sans prix, et le chiffre d'environ 1 300 jetons/s rapporté pour Sol sur le CS-4 de Cerebras reste encore un unique post X non vérifié. Le GPT-5.6 Sol standard à 4 $ / 20 $ est ce que vous pouvez appeler aujourd'hui sur OrcaRouter avec 0 $ de marge ; GPT-6 Astra à 10 $ / 50 $ est ce que vous pouvez appeler si vous voulez le modèle qui a obtenu la ligne Ultrafast.
Ultrafast coûte désormais vraiment de l'argent sur GPT-6 Astra — 6× le tarif standard, ou inclus dans le forfait Pro 500 à 500 $ — tandis que GPT-5.6 Sol Ultrafast reste en preview. Le GPT-5.6 Sol complet est disponible sur OrcaRouter à 4 $ / 20 $ par million de tokens, sans marge, prêt pour votre propre clé.
Comparés dans cet article2
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
