
GPT-5.6 Sol Ultrafast: 14× snelheid, 750 Tok/s — CS-4 naar verluidt ~1.300, nog geen prijs
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaNIEUWMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
- grokxAI: Grok 4.52026-07-0856Intelligentie72Coderen
GPT-5.6 Sol Ultrafast mode is de hardware-versnelde serveerlaag voor het vlaggenschip — hetzelfde volledige GPT-5.6 Sol-model dat op Cerebras wafer-scale chips draait in plaats van GPU-clusters, en dat tot 14× de snelheid van standaardverwerking biedt en tot 750 uitvoertokens per seconde op de laag die OpenAI in augustus aankondigde. Op 2026-08-18 onthulde Cerebras het CS-4-systeem van de volgende generatie, waarop deze laag wordt uitgerold, en een eerste, ongeverifieerd rapport beweert dat GPT-5.6 Sol op CS-4 al ruwweg 1.300 tokens per seconde serveert. Het is geen kleiner model en geen destillatie: alleen de hardware en de planning zijn veranderd, en de intelligentie blijft behouden. Wat het nog niet heeft is een prijs — per 2026-08-19 is Ultrafast een beperkte API-preview zonder gepubliceerde tariefkaart, dus het getal waarop je vandaag daadwerkelijk je budget kunt baseren is de standaardlaag op de live GPT-5.6 Sol-modelpagina: $5 per miljoen invoertokens en $30 per miljoen uitvoertokens, doorberekend zonder opslag. Dit artikel behandelt wat de modus is, hoe snel de getallen werkelijk zijn — inclusief de nieuwe CS-4-hardware en wat nog ongeverifieerd is — wat het kost (inclusief het eerlijke 'nog geen prijs'-antwoord), en wat je moet doen totdat het algemeen beschikbaar is.
Wat de Ultrafast-modus eigenlijk is
Ultrafast is een serving-tier, geen nieuw model. OpenAI kondigde het op 13 augustus 2026 aan als het eerste product van zijn compute-partnerschap van januari 2026 met chipmaker Cerebras — een deal die naar verluidt circa 10 miljard dollar over drie jaar bedraagt. Waar standaard GPT-5.6 Sol-inferentie draait op GPU-clusters en veel tijd besteedt aan het verplaatsen van gewichten tussen geheugen en rekenkracht, laadt Ultrafast de gewichten van het model in 44 GB on-chip SRAM op de wafer-scale-chips van Cerebras; een model van Sol's omvang beslaat meerdere wafers in lagen, waardoor de gewichten zich bevinden waar de rekenkracht is. Het resultaat is een doorvoerplafond dat wordt bepaald door silicium in plaats van door geheugenbandbreedte.
Het hardwareverhaal ging verder op 2026-08-18. Tijdens zijn Supernova-evenement onthulde Cerebras de CS-4, het rackschaalsysteem van de volgende generatie gebouwd op zijn Nexus-platform — drie Wafer-Scale Engine-chips per rack, tot 2× de token-generatiesnelheid van de eerdere CS-3, en volgens Cerebras meer dan 1.000 tokens per seconde op modellen met meer dan 10 biljoen parameters. Dat zijn Cerebras' claims voor een systeem in early access, nog niet algemeen beschikbaar. Sinds de onthulling beweert een enkel bericht op X dat CS-4 al GPT-5.6 Sol bedient met ongeveer 1.300 tokens per seconde — qua richting consistent met Cerebras' eigen cijfers, maar tot nu toe door niemand bevestigd. Beschouw het als een vroeg signaal: aannemelijk, onbevestigd, en de moeite waard om opnieuw te controleren voordat je er capaciteit omheen plant.
Het deel dat voor jouw code telt: het model-ID, de gewichten, het redeneergedrag en de output zijn identiek aan de standaard GPT-5.6 Sol. OpenAI presenteert Ultrafast als "meer nuttig werk per seconde" in plaats van een kwaliteitsniveau, en de preview draait het volledige vlaggenschip — snelheid komt niet voort uit het inwisselen voor een goedkoper model. Wat verandert is hoe snel tokens eruit komen.
Verwar Ultrafast niet met de bestaande snelle modus. Snelle modus is een aparte, betaalde tier op standaardhardware: tot ruwweg 2,5× uitvoersnelheid tegen een 2× premie per token ($10 invoer / $60 uitvoer per 1M), zonder kwaliteitsverandering. Ultrafast is iets anders — Cerebras-hardware, tot 14×, en voorlopig helemaal geen prijs.
Hoe snel — de cijfers die ertoe doen

Het kerncijfer is 14×, en dat heeft een definitie nodig. OpenAI zegt dat Ultrafast tot 750 outputtokens per seconde genereert ten opzichte van de standaard GPT-5.6 Sol-verwerking. Dat is een doorvoergetal voor outputtokens, geen ongenuanceerde bewering dat 'alles 14× sneller draait' — de end-to-end-verwerkingstijd van een verzoek omvat ook de invoerverwerking en de eigen redenering van het model, en daarom wordt 14× als maximum aangeduid.
• Maximale outputdoorvoer — tot 750 outputtokens per seconde, volgens de aankondiging van OpenAI (2026-08-13).
• Vergeleken met standaard verwerking — tot 14× sneller, volgens dezelfde aankondiging; de daadwerkelijke snelheidswinst varieert afhankelijk van de invoerlengte en het taaktype.
• Humanity's Last Exam, 2.500 vragen — OpenAI/Cerebras melden dat GPT-5.6 Sol Ultrafast in 11 uur en 11 minuten klaar is, versus 78 uur en 27 minuten voor Claude Fable 5, met vergelijkbare nauwkeurigheid. Gemeld door de leveranciers, en de vergelijking bestrijkt de hardware-stacks van twee leveranciers — lees het als richtinggevend, niet als een oordeel.
• GDP-Val, end-to-end — Cerebras meldt 5,6× sneller in totaal zonder meetbaar kwaliteitsverlies. Ook door de leverancier gerapporteerd.
• Basislijn snelle modus — de bestaande verkrijgbare snelheidscategorie bereikt maximaal ongeveer 2,5× de outputsnelheid voor 2× de prijs.
• CS-4, de volgende hardware — Cerebras beweert dat het CS-4-rack meer dan 1.000 tokens per seconde levert op modellen boven de 10 biljoen parameters, tot 2× de token-generatie van CS-3. Een onbevestigd communityrapport plaatst GPT-5.6 Sol op CS-4 op ~1.300 tokens per seconde — zelfde richting, nog niet bevestigd door OpenAI of Cerebras.
Eén kanttekening voordat u de 14× aanhaalt: onafhankelijke berichtgeving over de lancering verwijst naar een ~11× generatiesnelheidsvergelijking met Claude Fable 5, terwijl de eigen cijfers van Cerebras ~7× impliceren voor de totale testtijd bij dezelfde run — het verschil is welk deel van een workload je meet. Hetzelfde principe geldt voor het snelheidssignaal van de CS-4: het ~1.300 tokens/s-cijfer begon als een enkele X-post, en noch OpenAI noch Cerebras heeft dit bevestigd. Al deze cijfers zijn deze week door leveranciers of de community aangekondigd, en geen ervan is onafhankelijk geverifieerd. Beschouw ze als beweringen, niet als benchmarkoordelen.
Wat het kost — en de eerlijke kloof

Hier is de stand van de prijskwestie op 2026-08-19, ronduit gezegd: Ultrafast heeft geen gepubliceerde prijs. OpenAI heeft er geen aangekondigd, en de preview verschijnt op geen enkele openbare tarieflijst. Berichten dat early-access-sloten gebundeld of gratis zijn, zijn speculatie, geen beleid — en totdat OpenAI de laag prijst, is elk "GPT-5.6 Sol Ultrafast cost"-getal dat je elders vindt een gok.
Wat u vandaag kunt prijzen is de rest van de GPT-5.6 Sol-lijn, geverifieerd tegen de gepubliceerde tarieven van OpenAI op 2026-08-18:
• Standard GPT-5.6 Sol — $5.00 input / $30.00 output per 1M tokens. De baseline die je nu kunt aanroepen.
• Snelle modus — $10.00 / $60.00, een 2× toeslag voor tot ruwweg 2,5× uitvoersnelheid. Dit is het dichtst bij een snelheidsniveau dat je daadwerkelijk kunt kopen.
• Promptcache lezen — $0,50 per 1M (90% korting op nieuwe invoer); het schrijven naar de cache wordt gefactureerd tegen $6,25 per 1M.
• Long-context tier — invoer van meer dan ongeveer 272K tokens kost $10,00 / $45,00.
• Batch API — $2,50 / $15,00, een vaste korting van 50% met een doorlooptijd van ongeveer 24 uur.
Ter context van de te verwachten meerprijs: de fast mode zette het precedent met 2× het standaardtarief voor 2,5× de snelheid. Als Ultrafast een soortgelijke curve volgt, komt het ruim boven de standaard $5 / $30 uit — en het commentaar rond de preview verwacht precies dat, omdat Cerebras-wafercapaciteit schaars en duur is. Maar een verwachte meerprijs is geen prijs. Plan uitgaande van standaard Sol of fast mode totdat er een tariefkaart is.
Hoe gebruik je het — de preview-realiteit
Toegang is de tweede eerlijke hiaat. Ultrafast is beschikbaar via de OpenAI API voor een selecte groep klanten op wachtlijstbasis, aangekondigd op 13 augustus 2026, waarbij OpenAI zegt dat de toegang zal worden uitgebreid "naarmate de capaciteit groeit." Er is geen datum voor algemene beschikbaarheid. De aangekondigde preview-cohorten zijn programmeren, handel, financieel onderzoek, ondersteuning en andere interactieve workloads — teams waarvan de agents veel aanroepen per verzoek doen en waar responslatentie het knelpunt is. Jane Street, Rogo en Podium behoren tot de genoemde vroege testers.
Het gebruiksdoel waarvoor het is ontworpen: incidentrespons (logs, traces en diffs lezen terwijl een storing live is), financieel onderzoek en fraudedetectie op stromende data, realtime klantondersteuning en spraak (waar een halve seconde stilte als verbroken overkomt), e-commerce-afhandeling en het comprimeren van nachtelijke onderzoeksbatches tot interactieve sessies. Als je workload een eenmalige chat is, doet de 14× er veel minder toe dan bij een agent-lus van 40 aanroepen.
Wat je vandaag kunt doen — het praktische antwoord

Hoewel Ultrafast in preview is, is de volledige GPT-5.6 Sol nu live — en op OrcaRouter wordt de standaard tier aangeboden tegen het provider-tarief met $0 markup per token, als model-ID openai/gpt-5.6-sol via het OpenAI-compatibele endpoint op api.orcarouter.ai/v1. Als je al een OpenAI-client hebt, is migratie een wijziging van de basis-URL en het model-ID; niets anders. Dezelfde sleutel en hetzelfde endpoint ondersteunen 200+ modellen, dus Sol staat naast GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 en de open-weight-modellen waarmee je het zou vergelijken — en je kunt routeren op basis van moeilijkheid in plaats van elk model afzonderlijk te integreren.
Twee specifieke kenmerken van OrcaRouter zijn het vermelden waard op een snelheidspagina. BYOK: gebruik je eigen OpenAI-sleutel en OpenAI factureert je rechtstreeks tegen de eigen tarieven — OrcaRouter voegt $0 per token toe en laat de snelheidslimieten en credits van je provider intact. Guardrails: het PII Shield en het contentbeleid worden vóór facturatie uitgevoerd, dus een geblokkeerd verzoek retourneert een nette 400 en wordt nooit in rekening gebracht, en de Agent Firewall beoordeelt tool- en MCP-aanroepen voordat ze worden uitgevoerd. Wanneer — en als — Ultrafast algemeen beschikbaar wordt tegen een routeerbare prijs, is het aansluiten op hetzelfde endpoint een model-ID-wijziging; de opzet die je vandaag bouwt, blijft behouden.
De eerlijke grens — wanneer Ultrafast niet het antwoord is
Vier punten waarop het 14×-verhaal niet standhoudt, dus stem je architectuur en budget niet af op een getal dat niet vaststaat:
14× is een maximum, geen garantie. Het is een uitvoerdoorvoerplafond op Cerebras-hardware; de end-to-end latentie omvat nog steeds invoerverwerking, de redeneertijd van het model en je eigen netwerk. Een redeneerintensieve prompt kan het grootste deel van de kloktijd besteden aan denken, waar de aangekondigde versnelling afneemt.
Het heeft geen prijs en geen GA-datum. Vanaf 2026-08-19 kun je Ultrafast niet kopen — je kunt alleen preview-toegang aanvragen, en de CS-4-hardware erachter is in early access in plaats van algemeen beschikbaar. Houd rekening met standaard Sol ($5 / $30) of snelle modus ($10 / $60), en beschouw elke Ultrafast-prijs die je online ziet als onbevestigd.
De benchmarks zijn door leveranciers gerapporteerd. {{1}}De 11-uur durende HLE-run en het 5,6× GDP-Val-cijfer zijn OpenAI/Cerebras-getallen uit de aankondiging;{{/1}} {{2}}onafhankelijke schattingen variëren van ruwweg 7× tot 11×, afhankelijk van wat er wordt gemeten.{{/2}} Voeg het CS-4-snelheidssignaal aan die lijst toe: {{3}}het cijfer van ~1.300 tokens/s voor GPT-5.6 Sol op CS-4 komt uit één enkele X-post en heeft geen onafhankelijke bevestiging.{{/3}} {{4}}Geen van deze cijfers is al onafhankelijk geverifieerd.{{/4}}
Het verhelpt geen knelpunt dat je niet hebt. Als je agents traag zijn vanwege je eigen orchestratie, tool-latentie of input-intensieve prompts, schuift een snellere uitvoerroute de staart slechts licht op. De beslissing over laagkeuze — GPT-5.6 Sol voor $5 / $30 versus GPT-5.6 Terra voor $2 / $12 versus GPT-5.6 Luna voor $0.20 / $1.20 — beïnvloedt je factuur nog steeds meer dan welk snelheidsniveau dan ook.
Kortom. GPT-5.6 Sol Ultrafast is de snelste tier die OpenAI voor zijn vlaggenschip heeft uitgebracht — dezelfde gewichten op Cerebras-hardware, met tot 14× de doorvoer en 750 uitvoertokens per seconde op de aangekondigde tier. Cerebras' nieuwe CS-4 (onthuld op 2026-08-18) zou GPT-5.6 Sol naar ~1.300 tokens per seconde stuwen, maar dat cijfer is één enkele onbevestigde X-post. Per 2026-08-19 is Ultrafast een wachtlijstpreview zonder openbare prijs. Als je op zoek bent naar een getal om je budget op te baseren, is het eerlijke antwoord dat er nog geen is. Standaard GPT-5.6 Sol voor $5 / $30 is wat je vandaag kunt aanroepen, de snelle modus voor $10 / $60 is de verkrijgbare snelheidstier, en OrcaRouter stuurt beide door zonder opslag op je eigen key. Bouw de routing nu — en wanneer Ultrafast een prijs en een datum krijgt, is het slechts één model-id-wijziging verder.
Totdat Ultrafast een prijs krijgt, is de volledige GPT-5.6 Sol live op de GPT-5.6 Sol op OrcaRouter voor $5 / $30 per miljoen tokens, zonder opslag, klaar voor je eigen sleutel.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
