Editoriale flat-vectorillustratie voor de hero van een technologieblog over ultrasnelle AI-inferentie: {{1}}een grote afgeronde modelchip in diepblauw met een zachte cyaan gloed op een lichte achtergrond, {{/1}}{{2}}een gestileerde bliksemschicht en een snelheidsmeter met de naald op maximum ernaast, {{/2}}{{3}}snelle tokenstromen die langs een horizontale snelheidslijn racen met bewegingslijnen, {{/3}}en een kleine stopwatch. Witte achtergrond met zachte blauw-cyaan gradiëntaccenten en één subtiele warme highlight; minimale platte lijniconen; strakke moderne geometrische schreefloze typografie; geen leesbare tekst, geen letters, geen woorden, geen watermerk, geen logo's van derden, 16:9-compositie.
Guides & Insights

GPT-5.6 Sol Ultrafast: Ultrafast uitgebracht tegen 6× de standaardprijs, maar dit model is nog steeds alleen een preview

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het wachten is voorbij voor de tier, maar niet voor dit model. Op DevDay op 29 september 2026 maakte de leverancier van Ultrafast iets wat je kunt kopen: het nieuwe ChatGPT Pro 500-abonnement van $500 per maand bundelt het, de API publiceert nu een Ultrafast-tariefkaart tegen zes keer het standaardtarief — $60.00 input / $300.00 output per miljoen tokens op GPT-6 Astra — en de Codex-documentatie van de leverancier bevestigt dat de Pro-tiers helemaal geen gebruikslimiet van vijf uur hebben, een venster dat geldt voor Plus. Dat alles is door de leverancier vermeld en gepubliceerd in de eigen DevDay-samenvatting, help Pagina's en ontwikkelaarsdocumentatie van de leverancier. Wat niet is veranderd, is het model waar deze pagina over gaat. GPT-5.6 Sol Ultrafast, aangekondigd op 13 augustus 2026 als de Cerebras-versnelde servingtier voor GPT-5.6 Sol met tot 14× de standaarddoorvoer en 750 outputtokens per seconde, is nog steeds alleen beschikbaar als previewtoegang — geregeld via het accountteam van de leverancier — en heeft nog steeds geen eigen gepubliceerde prijs. De tier is uitgebracht. De Sol-variant wacht nog steeds.

Sinds we dit voor het eerst schreven, zijn er twee prijsbewegingen geweest, en ze wijzen in tegengestelde richtingen. Het onderliggende model werd goedkoper: standaard GPT-5.6 Sol rekent nu $4,00 per miljoen inputtokens en $20,00 per miljoen output — OpenAI's promotietarief, waarvan de leverancier zegt dat het ten minste tot 21 november 2026 beschikbaar is — niet de $5,00 / $30,00 die in augustus gangbaar waren. De snelheidslaag daarboven kreeg voor het eerst een prijs, en die is niet goedkoop: Ultrafast op GPT-6 Astra rekent $60,00 / $300,00 per miljoen. Elk cijfer in dit stuk is op 2026-09-30 opnieuw gecontroleerd aan de hand van OpenAI's gepubliceerde tariefkaart, de API-referentie en de Codex-prijsdocumentatie.

Wat de Ultrafast-modus eigenlijk is

Ultrafast is een servicelaag, geen nieuw model. OpenAI kondigde het op 13 augustus 2026 aan als het eerste product van zijn compute-partnerschap van januari 2026 met chipfabrikant Cerebras — een deal die naar verluidt ongeveer $10 miljard over drie jaar waard is. Terwijl standaard GPT-5.6 Sol-inferentie op GPU-clusters draait en veel van zijn tijd besteedt aan het verplaatsen van gewichten tussen geheugen en rekenkracht, laadt Ultrafast de gewichten van het model in 44 GB on-chip SRAM op de wafer-scale chips van Cerebras; een model ter grootte van Sol beslaat meerdere wafers in lagen, zodat de gewichten zitten waar de rekenkracht zit. Het resultaat is een doorvoerplafond dat door silicium wordt bepaald in plaats van door geheugenbandbreedte.

Het hardwareverhaal ging verder op 2026-08-18. Tijdens zijn Supernova-evenement onthulde Cerebras de CS-4, het rackschaalsysteem van de volgende generatie gebouwd op zijn Nexus-platform — drie Wafer-Scale Engine-chips per rack, tot 2× de token-generatiesnelheid van de eerdere CS-3, en volgens Cerebras meer dan 1.000 tokens per seconde op modellen met meer dan 10 biljoen parameters. Dat zijn Cerebras' claims voor een systeem in early access, nog niet algemeen beschikbaar. Sinds de onthulling beweert een enkel bericht op X dat CS-4 al GPT-5.6 Sol bedient met ongeveer 1.300 tokens per seconde — qua richting consistent met Cerebras' eigen cijfers, maar tot nu toe door niemand bevestigd. Beschouw het als een vroeg signaal: aannemelijk, onbevestigd, en de moeite waard om opnieuw te controleren voordat je er capaciteit omheen plant.

Het deel dat voor jouw code telt: het model-ID, de gewichten, het redeneergedrag en de output zijn identiek aan de standaard GPT-5.6 Sol. OpenAI presenteert Ultrafast als "meer nuttig werk per seconde" in plaats van een kwaliteitsniveau, en de preview draait het volledige vlaggenschip — snelheid komt niet voort uit het inwisselen voor een goedkoper model. Wat verandert is hoe snel tokens eruit komen.

Verwar Ultrafast niet met Fast mode. Fast mode is een apart aan te schaffen niveau op standaardhardware: tot ongeveer 2,5× de outputsnelheid tegen een 2×-toeslag per token, zonder kwaliteitsverandering — het werd op 30 juli 2026 omgedoopt van Priority Processing, en op GPT-5.6 Sol is het $8,00 input / $40,00 output per 1 miljoen tokens. Ultrafast is iets anders — Cerebras-hardware, tot 14× op GPT-5.6 Sol en tot 8× op GPT-6 Astra, kost 6× het standaardtarief op Astra en is op Sol nog steeds niet geprijsd. De twee namen staan nu naast elkaar in dezelfde modelkiezer, wat nog steeds het meest verwarrende aspect van deze release is.

Hoe snel — de cijfers die ertoe doen

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Het kerncijfer is 14×, en dat heeft een definitie nodig. OpenAI zegt dat Ultrafast tot 750 outputtokens per seconde genereert ten opzichte van de standaard GPT-5.6 Sol-verwerking. Dat is een doorvoergetal voor outputtokens, geen ongenuanceerde bewering dat 'alles 14× sneller draait' — de end-to-end-verwerkingstijd van een verzoek omvat ook de invoerverwerking en de eigen redenering van het model, en daarom wordt 14× als maximum aangeduid.

• Maximale outputdoorvoer — tot 750 outputtokens per seconde, volgens de aankondiging van OpenAI (13-08-2026).

• T.o.v. standaardverwerking — tot 14× sneller, volgens dezelfde aankondiging; werkelijke voordelen variëren per invoerlengte en taaktype.

• Humanity's Last Exam, 2.500 vragen — OpenAI/Cerebras rapporteren dat GPT-5.6 Sol Ultrafast in 11 uur en 11 minuten afrondt, tegenover 78 uur en 27 minuten voor Claude Fable 5, met vergelijkbare nauwkeurigheid. Gerapporteerd door leveranciers, en de vergelijking omvat de hardwarestacks van twee leveranciers — lees het als richtinggevend, niet als een eindoordeel.

• GDP-Val, end-to-end — Cerebras meldt 5,6× sneller in totaal zonder meetbaar kwaliteitsverlies. Ook door de leverancier gerapporteerd.

• Fast mode en Ultrafast vergeleken — Fast mode komt uit op ongeveer 2,5× outputsnelheid voor een prijspremie van 2×, met een maximum op dezelfde ~272K-tokengrens als standaardprijzen. Ultrafast is de grotere sprong: 14× op GPT-5.6 Sol volgens de aankondiging van augustus, en tot 8× op GPT-6 Astra in Codex volgens de huidige documentatie van OpenAI, waarbij de lanceringsdekking dat op maximaal 300 outputtokens per seconde stelt.

• CS-4, de volgende hardware — Cerebras beweert dat het CS-4-rack meer dan 1.000 tokens per seconde levert op modellen boven de 10 biljoen parameters, tot 2× de token-generatie van CS-3. Een onbevestigd communityrapport plaatst GPT-5.6 Sol op CS-4 op ~1.300 tokens per seconde — zelfde richting, nog niet bevestigd door OpenAI of Cerebras.

Een waarschuwing voordat je de 14× citeert: het is een plafond voor de outputdoorvoer op de hardware van één leverancier, en onafhankelijke vergelijkingen van de augustuslancering varieerden van 7× tot 11×, afhankelijk van welk deel van een workload werd gemeten. Dezelfde discipline geldt voor het snelheidssignaal van CS-4 — het cijfer van ~1.300 tokens/s voor GPT-5. Sol op CS-4 begon als één X-post en noch OpenAI noch Cerebras heeft het bevestigd. Behandel dit allemaal als leveranciers- en communityclaims, niet als leveranciersverdicts.

Wat Ultrafast nu kost — en waarom dat Sol nog steeds niet prijst

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Hier is de stand van zaken rond de prijskwestie op 2026-09-30, eenvoudig uiteengezet. Ultrafast heeft een gepubliceerd tarief — voor GPT-6 Astra, en alleen voor GPT-6 Astra. De prijspagina van OpenAI bevat nu een kolom Ultrafast naast Standard, Batch, Flex en Fast: $60,00 input / $6,00 gecachte input / $75,00 cache-schrijfacties / $300,00 output per miljoen tokens in korte context, en verdubbelt tot $120,00 / $12,00 / $150,00 / $450,00 na ongeveer 272K tokens. Dat is zes keer het standaardtarief voor Astra, terwijl de Fast-modus twee keer bedraagt — en het is het eerste harde cijfer dat OpenAI voor dit niveau heeft genoemd. De kaart hierboven is onze eigen momentopname van 2026-08-18, en de dollarcijfers daarin zijn tweemaal achterhaald: door de verlaging van het standaardtarief en nu door deze Ultrafast-rij. Wat in die tabel nog ontbreekt, is een Ultrafast-tarief voor GPT-5.6 Sol: de kolom Ultrafast vermeldt precies één model, gpt-6-astra. Het niveau heeft een prijs; dit model niet.

Wat je vandaag kunt prijzen, model per model:

• Standard GPT-5.6 Sol — $4,00 invoer / $20,00 uitvoer per 1 miljoen tokens voor prompts tot ongeveer 272K tokens. OpenAI vermeldt dit als promotieprijs die ten minste tot en met 21 november 2026 beschikbaar is. Dit is de basislijn die u nu kunt aanroepen.

• Snelle modus — $8,00 / $40,00 voor korte context op GPT-5.6 Sol, verdubbelt naar $16,00 / $60,00 voorbij ongeveer 272K tokens. Het dubbele van het standaardtarief voor tot ongeveer 2,5× de outputsnelheid, en op Sol is het nog steeds het snelste dat je daadwerkelijk kunt kopen.

• Prompt-cache — cache-leesbewerkingen kosten $0,40 per 1 miljoen (90% goedkoper dan nieuwe input); cache-schrijfbewerkingen kosten $5,00 per 1 miljoen.

• Long-context-tier — inputs boven 272K tokens worden bij standaardverwerking gefactureerd tegen $8,00 / $30,00, binnen het venster van ~1,05M tokens van het model en een maximale output van 128K tokens.

• Batch API — $2,00 / $10,00 voor korte context en $4,00 / $15,00 voor lange context, een vaste korting van 50% met een doorlooptijd van ongeveer 24 uur.

Voor GPT-5.6 Sol is het Astra-getal de best beschikbare aanwijzing en niets meer. OpenAI rekent voor Ultrafast 6× het standaardtarief van het onderliggende model; pas die vermenigvuldigingsfactor toe op de $4 / $20 van Sol en je komt uit op $24 / $120 per miljoen. Dat is een rekensom, geen gepubliceerde prijs — OpenAI heeft niets gezegd over een Sol Ultrafast-tarief, en de previewcohorten van augustus werden helemaal niet tegen een tier-tarief gefactureerd. Ga uit van standaard Sol tegen $4 / $20 of fast mode tegen $8 / $40 totdat de leverancier de rij publiceert.

Hoe je het gebruikt — breed beschikbaar op Astra, nog steeds een aanvraag voor Sol

De toegang viel op 29 september in tweeën uiteen, en die splitsing gaat in tegen het model dat deze pagina behandelt. Ultrafast is nu breed beschikbaar op GPT-6 Astra: de API-documentatie van OpenAI zegt dat het openstaat voor alle API-gebruikers met lage limieten — 500.000 tokens per minuut op gebruiksniveaus 1–3, 1 miljoen op niveau 4, 5 miljoen op niveau 5 — en het wordt meegeleverd in ChatGPT Work en Codex bij het nieuwe Pro 500-abonnement en bij in aanmerking komende Enterprise- en Edu-abonnementen, waar een werkruimte-eigenaar het moet inschakelen, en waar het niet wordt ondersteund voor werkruimten die inferentie buiten de Verenigde Staten vereisen. GPT-5.6 Sol Ultrafast ging niet mee. Dezelfde documentatie beschrijft het nog steeds als preview-toegang via een OpenAI-accountteam, en de beschrijving van de parameter zelf in het API-schema luidt nog steeds "currently available for gpt-5.6-sol" — een regel die nu achterloopt op de rest van de documentatie in plaats van erop vooruit te lopen. Als je dat niveau vandaag wilt, wil je het op Astra.

De interfacekwestie is ook beslecht. TestingCatalog meldde op 2026-09-26 dat een snelheidsselector met Standard, Fast en Ultrafast ongepubliceerd in de Responses API Playground stond; drie dagen later bracht OpenAI de consumentenversie van precies dat uit, met Ultrafast nu als optie in de modelkiezer in ChatGPT Work en Codex op Pro 500. We markeerden die waarneming als de interpretatie van niet-uitgebrachte UI door één publicatie en zeiden dat OpenAI niets ervan had bevestigd. Het klopte qua richting, en de uitrol waar het op wees, kwam op DevDay, niet erna.

De preview-cohorten die OpenAI in augustus noemde, waren coding, commerce, financieel onderzoek, support en andere interactieve workloads — teams waarvan de agents veel calls per request doen en waar responstijd de bottleneck is. Jane Street, Rogo en Podium behoorden tot de genoemde vroege testers. Als jouw workload een single-turn chat is, maakt de snelheidstier veel minder uit dan bij een agent-loop met 40 calls. Het praktische antwoord hangt nu af van over welk model je het hebt: op GPT-6 Astra kun je vanmiddag nog service_tier: "ultrafast" instellen, en op GPT-5.6 Sol kan dat nog steeds niet.

Wat je vandaag kunt doen — het praktische antwoord

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Terwijl GPT-5.6 Sol Ultrafast achter de preview-deur blijft, zijn beide vlaggenschipmodellen live op OrcaRouter tegen het provider-tarief met $0 opslag per token — model-ID openai/gpt-5.6-sol via het OpenAI-compatibele endpoint op api.orcarouter.ai/v1, en GPT-6 Astra daarnaast tegen het standaardtarief van $10.00 / $50.00, het model waar OpenAI nu een Ultrafast-tier bovenop heeft gezet en dat wij niet op dat tier routeren. De onderstaande capture is van augustus 2026 en toont nog de toenmalige $5.00 / $30.00-prijs; het huidige Sol-tarief is $4.00 / $20.00, en dat is wat wij doorgeven. Die doorberekening is de reden dat prijswijzigingen van de leverancier dezelfde dag nog aan onze kant doorkomen: $4.00 input / $20.00 output, dezelfde cijfers die OpenAI publiceert, zonder extra opslag per token. Als je al een OpenAI-client hebt, is de migratie een kwestie van de base-URL en het model-ID aanpassen; meer niet. Dezelfde sleutel en hetzelfde endpoint bedienen 200+ modellen, dus Sol staat naast zijn eigen broertjes en zusjes — GPT-5.6 Terra voor $2.00 / $12.00 en GPT-5.6 Luna voor $0.20 / $1.20 — en de open-weight modellen waarmee je het zou vergelijken, en je kunt routeren op basis van moeilijkheidsgraad in plaats van elk model afzonderlijk opnieuw te integreren.

Twee specifieke kenmerken van OrcaRouter zijn het vermelden waard op een snelheidspagina. BYOK: neem je eigen OpenAI-sleutel mee en OpenAI factureert je rechtstreeks tegen zijn eigen tarieven — OrcaRouter voegt $0 per token toe en laat de rate limits en credits van je provider intact. Guardrails: het PII Shield en het contentbeleid worden uitgevoerd vóór facturatie, dus een geblokkeerd verzoek retourneert een schone 400 en wordt nooit in rekening gebracht, en de Agent Firewall beoordeelt tool- en MCP-aanroepen voordat ze worden uitgevoerd. Ultrafast zelf is breed beschikbaar op GPT-6 Astra, maar niet onder routeerbare voorwaarden en niet voor Sol — het is een toegangsgecontroleerde tier die tegen 6× het standaardtarief wordt gefactureerd, en wij bieden het niet aan. Als OpenAI het ooit onder standaardvoorwaarden aanbiedt, is het aansluiten ervan op hetzelfde endpoint een wijziging van het model-id; de setup die je vandaag bouwt, blijft van toepassing.

De eerlijke grens — wanneer Ultrafast niet het antwoord is

Vijf plekken waar het snelheidsverhaal nog steeds geen stand houdt, nu de helft ervan is bezonken:

Beschikbaar is niet hetzelfde als beschikbaar voor jou. Ultrafast is opengesteld voor alle API-gebruikers op GPT-6 Astra, maar het ging open met lage limieten, het wordt in het schema van OpenAI nog steeds omschreven als met toegangsbeheer, het ondersteunt geen verwerking in de EU of andere regio's buiten de VS, en in Enterprise-workspaces staat het uit totdat een eigenaar het inschakelt. Op GPT-5.6 Sol ging helemaal niets open. Controleer je eigen toegang voordat je op een van beide gaat bouwen.

14× is een maximum, geen garantie. Het is een plafond voor de uitvoer-doorvoer op Cerebras-hardware; end-to-end latency omvat nog steeds invoerverwerking, de redeneertijd van het model en je eigen netwerk. Een redeneerintensieve prompt kan het grootste deel van de werkelijke tijd aan denken besteden, waardoor de geadverteerde versnelling krimpt.

Het heeft een prijs bij het ene model en geen prijs bij het andere. Het Astra Ultrafast-tarief is gepubliceerd — 6× standaard — en er is nergens een Ultrafast-rij voor GPT-5.6 Sol. Begroot op basis van standaard Sol tegen $4 / $20 of fast mode tegen $8 / $40, en beschouw elke "GPT-5.6 Sol Ultrafast cost"-waarde die je ziet, inclusief de $24 / $120-extrapolatie hierboven, als rekenwerk en niet als een tariefkaart.

De benchmarks zijn afkomstig van de leverancier zelf. De HLE-run van 11 uur en het GDP-Val-cijfer van 5,6× zijn cijfers van OpenAI/Cerebras uit de aankondiging van augustus; onafhankelijke schattingen van de versnelling variëren van ongeveer 7× tot 11×, afhankelijk van wat er wordt gemeten. Zet het CS-4-signaal ook op die lijst: het cijfer van ~1.300 tokens/s voor GPT-5.6 Sol op CS-4 komt uit één enkele X-post en heeft geen onafhankelijke bevestiging. De nieuwe Astra Ultrafast-cijfers — 8× in Codex, 6× de prijs — zijn ook van OpenAI zelf.

En dat ene dat geld in plaats van tijd kost: het lost geen knelpunt op dat je niet hebt. Als je agents traag zijn door je eigen orchestratie, tool-latentie of inputintensieve prompts, verschuift een sneller uitvoerpad de staart slechts in geringe mate. De beslissing over het matchen van niveaus — GPT-5.6 Sol voor $4 / $20 versus GPT-5.6 Terra voor $2 / $12 versus GPT-5.6 Luna voor $0.20 / $1.20 — beïnvloedt je factuur nog altijd meer dan welk snelheidsniveau dan ook.

Kort gezegd. Ultrafast is niet langer een wachtlijst-tier waar je alleen maar over kunt lezen. Sinds 29 september 2026 verkoopt OpenAI het: inbegrepen bij het ChatGPT Pro 500-abonnement van $500 in Work en Codex, toegankelijk voor alle API-gebruikers op GPT-6 Astra met lage snelheidslimieten, en geprijsd op zes keer het standaardtarief — $60 / $300 per miljoen korte context. GPT-5.6 Sol Ultrafast, de augustuspreview waarop deze pagina was gebaseerd, is niet veranderd: nog steeds met toegangscontrole, nog steeds beperkt tot gpt-5.6-sol in het API-schema, nog steeds zonder prijs, en het cijfer van ~1.300 tokens/s dat voor Sol op Cerebras' CS-4 werd gemeld, is nog steeds slechts één niet-geverifieerde X-post. Standaard GPT-5.6 Sol voor $4 / $20 is wat je vandaag kunt aanroepen op OrcaRouter met $0 markup; GPT-6 Astra voor $10 / $50 is wat je kunt aanroepen als je het model wilt dat de Ultrafast-rij kreeg.

Ultrafast kost nu echt geld op GPT-6 Astra — 6× het standaardtarief, of zit het gebundeld in het $500 Pro 500-abonnement — terwijl GPT-5.6 Sol Ultrafast een preview blijft. De volledige GPT-5.6 Sol is live op OrcaRouter voor $4 / $20 per miljoen tokens zonder opslag, klaar voor je eigen sleutel.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt