
GPT-5.6 Sol Ultrafast : vitesse 14×, 750 Tok/s — CS-4 serait d'environ 1 300, pas encore de prix
- z-aiNOUVEAUZ.ai: GLM 5.32026-08-1860Intelligence75Code
- obsidianNOUVEAUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligence68Code
- qwenNOUVEAUQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligence69Code
- grokNOUVEAUSpaceXAI: Grok 4.62026-08-1261Intelligence77Code
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
Le mode Ultrafast de GPT-5.6 Sol est le niveau de service à accélération matérielle du modèle phare — le même modèle GPT-5.6 Sol complet exécuté sur des puces wafer-scale de Cerebras au lieu de grappes de GPU, offrant jusqu'à 14 fois la vitesse du traitement standard et jusqu'à 750 tokens de sortie par seconde sur le niveau qu'OpenAI a annoncé en août. Le 18 août 2026, Cerebras a dévoilé le système CS-4 de nouvelle génération sur lequel ce niveau va s'étendre, et un premier rapport non vérifié affirme que GPT-5.6 Sol sur CS-4 atteint déjà environ 1 300 tokens par seconde. Ce n'est pas un modèle plus petit ni une distillation : seuls le matériel et l'ordonnancement ont changé, et l'intelligence est préservée. Ce qui lui manque encore, c'est un prix — en date du 19 août 2026, Ultrafast est une préversion limitée de l'API, sans grille tarifaire publiée, de sorte que le chiffre sur lequel vous pouvez concrètement baser votre budget aujourd'hui est celui du niveau standard de la page officielle du modèle GPT-5.6 Sol : 5 $ par million de tokens en entrée et 30 $ par million de tokens en sortie, répercutés sans aucune majoration. Cet article explique ce qu'est ce mode, la réalité des chiffres de vitesse annoncés — y compris le nouveau matériel CS-4 et ce qui reste non vérifié — ce qu'il coûte (avec la réponse honnête « pas encore de prix »), et que faire en attendant sa disponibilité générale.
Ce qu'est réellement le mode Ultrafast
Ultrafast est un niveau de service (serving tier), pas un nouveau modèle. OpenAI l'a annoncé le 13 août 2026 comme premier produit de son partenariat de calcul de janvier 2026 avec le fabricant de puces Cerebras — un accord estimé à environ 10 milliards de dollars sur trois ans. Alors que l'inférence standard de GPT-5.6 Sol s'exécute sur des grappes de GPU et passe une grande partie de son temps à déplacer les poids entre mémoire et calcul, Ultrafast charge les poids du modèle dans 44 Go de SRAM sur puce sur les puces à l'échelle du wafer de Cerebras ; un modèle de la taille de Sol s'étend sur plusieurs wafers en couches, de sorte que les poids se trouvent là où se trouve le calcul. Le résultat est un plafond de débit fixé par le silicium plutôt que par la bande passante mémoire.
L'histoire du matériel a évolué le 18 août 2026. Lors de son événement Supernova, Cerebras a dévoilé le CS-4, le système à l'échelle du rack de nouvelle génération construit sur sa plateforme Nexus — trois puces Wafer-Scale Engine par rack, jusqu'à 2× la vitesse de génération de tokens du CS-3 précédent et, selon Cerebras, plus de 1 000 tokens par seconde sur des modèles dépassant 10 000 milliards de paramètres. Ce sont les affirmations de Cerebras pour un système en accès anticipé, pas encore disponible au grand public. Depuis le dévoilement, un seul post sur X affirme que le CS-4 sert déjà GPT-5.6 Sol à environ 1 300 tokens par seconde — ce qui va dans le même sens que les chiffres de Cerebras, mais n'est confirmé par personne pour l'instant. Considérez-le comme un signal précoce : plausible, non vérifié, et à revérifier avant de planifier votre capacité autour de ces données.
La partie qui compte pour votre code : l’identifiant du modèle, les poids, le comportement de raisonnement et la sortie sont identiques au GPT-5.6 Sol standard. OpenAI présente Ultrafast comme « plus de travail utile par seconde » plutôt que comme un niveau de qualité, et l’aperçu exécute le modèle phare complet — la vitesse ne vient pas du remplacement par un modèle moins cher. Ce qui change, c’est la vitesse à laquelle les jetons sont générés.
Ne confondez pas Ultrafast avec l'actuel fast mode. Fast mode est un palier distinct et achetable sur matériel standard : jusqu'à environ 2,5× la vitesse de sortie pour une prime de 2× par token (10 $ en entrée / 60 $ en sortie par 1M), sans changement de qualité. Ultrafast est tout autre chose — du matériel Cerebras, jusqu'à 14×, et pour l'instant aucun prix du tout.
À quelle vitesse — les chiffres qui comptent

Le chiffre principal est 14×, et il nécessite une définition. OpenAI affirme qu'Ultrafast génère jusqu'à 750 tokens de sortie par seconde, contre un traitement standard GPT-5.6 Sol. Il s'agit d'un débit pour les tokens de sortie, et non d'une affirmation générale selon laquelle « tout tourne 14× plus vite » — le temps de requête de bout en bout inclut également le traitement des entrées et le raisonnement du modèle lui-même, c'est pourquoi 14× est qualifié de maximum.
• Débit de sortie maximal — jusqu’à 750 jetons de sortie par seconde, selon l’annonce d’OpenAI (2026-08-13).
• Vs traitement standard — jusqu'à 14× plus rapide, selon la même annonce ; les gains réels varient selon la longueur de l'entrée et le type de tâche.
• Humanity's Last Exam, 2 500 questions — OpenAI/Cerebras rapportent que GPT-5.6 Sol Ultrafast a terminé en 11 heures 11 minutes contre 78 heures 27 minutes pour Claude Fable 5, avec une précision comparable. Rapporté par les fournisseurs, et la comparaison couvre les piles matérielles de deux fournisseurs — à lire comme une indication, pas un verdict.
• GDP-Val, de bout en bout — Cerebras rapporte une accélération globale de 5,6× sans perte de qualité mesurable. Également rapporté par le fournisseur.
• Référence du mode rapide — le palier de vitesse achetable existant plafonne à environ 2,5× la vitesse de sortie pour un supplément de prix de 2×.
• CS-4, le prochain matériel — Cerebras affirme que le rack CS-4 délivre plus de 1 000 tokens par seconde sur des modèles de plus de 10 billions de paramètres, soit jusqu'à 2× la génération de tokens du CS-3. Un rapport non vérifié de la communauté situe GPT-5.6 Sol sur CS-4 à environ 1 300 tokens par seconde — même direction, pas encore confirmé par OpenAI ou Cerebras.
Une mise en garde avant de citer le 14× : les reportages indépendants sur le lancement citent une comparaison de vitesse de génération d’environ 11× par rapport à Claude Fable 5, tandis que les propres chiffres de Cerebras impliquent environ 7× pour le temps total de test sur la même exécution — la différence réside dans la partie de la charge de travail que l’on mesure. La même rigueur s’applique au signal de vitesse du CS-4 : le chiffre d’environ 1 300 tokens/s est parti d’un simple post sur X, et ni OpenAI ni Cerebras ne l’ont confirmé. Tous ces chiffres proviennent de fournisseurs ou de la communauté et ont été annoncés cette semaine, et aucun n’a encore été vérifié de manière indépendante. Traitez-les comme des affirmations, pas comme des verdicts de benchmark.
Ce que cela coûte — et l'écart honnête

Voici l'état de la question des prix au 2026-08-19, dit clairement : Ultrafast n'a pas de prix publié. OpenAI n'en a pas annoncé, et l'aperçu n'apparaît sur aucune grille tarifaire publique. Les rapports selon lesquels les créneaux d'accès anticipé sont groupés ou gratuits relèvent de la spéculation, pas d'une politique — et tant qu'OpenAI n'aura pas fixé le prix du niveau, tout chiffre « GPT-5.6 Sol Ultrafast cost » que vous trouverez ailleurs n'est qu'une supposition.
Ce que vous pouvez tarifer aujourd'hui, c'est le reste de la gamme GPT-5.6 Sol, vérifié par rapport aux tarifs publiés par OpenAI le 2026-08-18 :
• Standard GPT-5.6 Sol — 5,00 $ en entrée / 30,00 $ en sortie par million de jetons. Le modèle de référence, que vous pouvez appeler dès maintenant.
• Mode rapide — 10,00 $ / 60,00 $, un surcoût de 2× pour une vitesse de sortie jusqu’à environ 2,5×. C’est ce qui se rapproche le plus d’un palier de vitesse que vous pouvez réellement acheter.
• Lecture du cache de prompt — 0,50 $ par 1 M (90 % de réduction par rapport à l’entrée fraîche) ; les écritures de cache sont facturées à 6,25 $ par 1 M.
• Palier de contexte long — les entrées dépassant environ 272K jetons sont facturées à $10.00 / $45.00.
• Batch API — $2.50 / $15.00, une remise fixe de 50 % avec un délai d'environ 24 heures.
Pour contextualiser la prime à attendre : le mode rapide a établi un précédent à 2× le tarif standard pour 2,5× la vitesse. Si Ultrafast suit une courbe similaire, il se situera bien au-dessus du tarif standard de 5 $ / 30 $ — et les commentaires autour de l’aperçu s’attendent exactement à cela, car la capacité de wafers de Cerebras est rare et coûteuse. Mais une prime attendue n’est pas un prix. Planifiez en fonction du Sol standard ou du mode rapide jusqu’à ce qu’une grille tarifaire existe.
Comment l'utiliser — la réalité de l'aperçu
L'accès est la deuxième lacune assumée. Ultrafast est disponible via l'API OpenAI pour un groupe sélectionné de clients sur la base d'une liste d'attente, annoncé le 13 août 2026, OpenAI déclarant que l'accès sera élargi « à mesure que la capacité augmente ». Il n'y a pas de date de disponibilité générale. Les cohortes d'avant-première annoncées sont le codage, le commerce, la recherche financière, le support et d'autres charges de travail interactives — des équipes dont les agents effectuent de nombreux appels par requête et où la latence des réponses est le goulot d'étranglement. Jane Street, Rogo et Podium font partie des premiers testeurs nommés.
Le modèle d'utilisation pour lequel il est conçu : réponse aux incidents (lecture de journaux, de traces et de diffs pendant qu'une panne est en cours), recherche financière et détection de fraude sur des données en mouvement, support client en temps réel et voix (où un silence d'une demi-seconde est perçu comme une coupure), paiement en ligne, et compression de lots de recherche nocturnes en sessions interactives. Si votre charge de travail est un chat à tour unique, le facteur 14× compte beaucoup moins que pour une boucle d'agent à 40 appels.
Ce que vous pouvez faire aujourd'hui — la réponse pratique

Bien qu'Ultrafast soit en version préliminaire, le GPT-5.6 Sol complet est disponible dès maintenant — et sur OrcaRouter, le niveau standard est proposé au tarif du fournisseur avec une majoration de 0 $ par jeton, sous l'identifiant de modèle openai/gpt-5.6-sol via l'endpoint compatible OpenAI à l'adresse api.orcarouter.ai/v1. Si vous disposez déjà d'un client OpenAI, la migration se résume à un changement d'URL de base et d'identifiant de modèle ; rien d'autre. La même clé et le même endpoint prennent en charge plus de 200 modèles, de sorte que Sol se trouve aux côtés de GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 et des modèles à poids ouverts auxquels vous le compareriez — et vous pouvez router par difficulté au lieu de réintégrer chacun d'eux.
Deux spécificités d'OrcaRouter méritent d'être mentionnées sur une page de vitesse. BYOK : apportez votre propre clé OpenAI et OpenAI vous facture directement à ses propres tarifs — OrcaRouter ajoute 0 $ par jeton et préserve vos limites de débit et vos crédits fournisseur. Guardrails : le PII Shield et la politique de contenu s'exécutent avant la facturation, de sorte qu'une requête bloquée renvoie un 400 propre et n'est jamais facturée, et le pare-feu d'agents évalue les appels d'outils et MCP avant leur exécution. Quand — et si — Ultrafast atteint la disponibilité générale à un prix routable, le brancher sur le même endpoint est un changement d'ID de modèle ; la configuration que vous construisez aujourd'hui est conservée.
La limite honnête — quand Ultrafast n'est pas la réponse
Quatre points où l'histoire du 14× ne tient pas, ne concevez donc pas votre architecture ni votre budget autour d'un chiffre qui n'est pas arrêté :
14× est un maximum, pas une garantie. Il s'agit d'un plafond de débit de sortie sur le matériel Cerebras ; la latence de bout en bout inclut toujours le traitement de l'entrée, le temps de raisonnement du modèle et votre propre réseau. Un prompt qui demande beaucoup de raisonnement peut passer la majeure partie de son temps d'horloge à réfléchir, là où l'accélération annoncée se réduit.
Il n'a ni prix ni date de disponibilité générale. Au 19 août 2026, vous ne pouvez pas acheter Ultrafast — vous pouvez seulement demander un accès anticipé, et le matériel CS-4 qui le sous-tend est en accès anticipé plutôt qu'en disponibilité générale. Prévoyez un budget sur la base du Sol standard (5 $ / 30 $) ou du mode rapide (10 $ / 60 $), et considérez tout prix Ultrafast vu en ligne comme non vérifié.
Les benchmarks sont rapportés par les fournisseurs. Le run HLE de 11 heures et le chiffre de 5,6× GDP-Val sont des chiffres OpenAI/Cerebras issus de l'annonce ; les estimations indépendantes vont d'environ 7× à 11× selon ce qui est mesuré. Ajoutez à cette liste le signal de vitesse du CS-4 : le chiffre d'environ 1 300 tokens/s pour GPT-5.6 Sol sur CS-4 provient d'un seul post X et n'a aucune confirmation indépendante. Aucun de ces éléments n'est encore vérifié indépendamment.
Cela ne corrigera pas un goulot d'étranglement que vous n'avez pas. Si vos agents sont lents en raison de votre propre orchestration, de la latence des outils ou de prompts très volumineux, un chemin de sortie plus rapide ne déplace que très légèrement la queue de latence. Le choix du palier — GPT-5.6 Sol à $5 / $30 contre GPT-5.6 Terra à $2 / $12 contre GPT-5.6 Luna à $0.20 / $1.20 — continue de faire varier votre facture plus que n'importe quel palier de vitesse.
L'essentiel. GPT-5.6 Sol Ultrafast est le niveau de service le plus rapide qu'OpenAI ait lancé pour son modèle phare — les mêmes poids sur du matériel Cerebras, avec un débit jusqu'à 14× supérieur et 750 tokens de sortie par seconde sur le niveau annoncé. Le nouveau CS-4 de Cerebras (dévoilé le 18 août 2026) pousserait GPT-5.6 Sol vers ~1 300 tokens par seconde, mais ce chiffre provient d'un seul post X non vérifié. Au 19 août 2026, Ultrafast est un aperçu sur liste d'attente sans prix public. Si vous cherchez un chiffre pour établir votre budget, la réponse honnête est qu'il n'y en a pas encore. Le GPT-5.6 Sol standard à 5 $ / 30 $ est ce que vous pouvez utiliser dès aujourd'hui, le mode rapide à 10 $ / 60 $ est le palier de vitesse achetable, et OrcaRouter fait transiter les deux sans aucune marge sur votre propre clé. Mettez en place le routage dès maintenant — et quand Ultrafast aura un prix et une date, il suffira de changer l'ID du modèle.
Jusqu'à ce qu'Ultrafast obtienne un prix, le GPT-5.6 Sol complet est en ligne sur le GPT-5.6 Sol sur OrcaRouter à 5 $ / 30 $ par million de jetons, zéro marge, prêt pour votre propre clé.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
