
GPT-6.1 Sol Ultrafast rolt uit naar de API, Codex en ChatGPT Work
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
OpenAI rolt Ultrafast-modus uit voor GPT-6.1 Sol — de snelste servicelaag die het verkoopt, en de eerste keer dat de bijna-Astra Sol-tier er een heeft. De zet plaatst GPT-6.1 Sol in dezelfde categorie als GPT-6 Astra Ultrafast in de API, in Codex en in ChatGPT Work, en het komt met een gepubliceerde tariefkaart in plaats van een wachtlijst: $12,00 per miljoen invoertokens en $60,00 per miljoen uitvoertokens, precies zes keer wat standaard GPT-6.1 Sol kost. De snelheidsclaim op de verpakking is "tot 8x". Het interessante deel is wat die frase meet, en het antwoord is niet het model waarvoor je op het punt staat te betalen.
De changelog voor ontwikkelaars bevat de vermelding van 8 oktober: "Ultrafast-modus toegevoegd voor GPT-6.1 Sol in de Responses API. Gebruik gpt-6.1-sol met service_tier: "ultrafast" om de tijd tussen gegenereerde outputtokens te verkorten. Het is beschikbaar voor alle API-gebruikers, onder voorbehoud van ratelimieten, met wereldwijde verwerking en dataresidentie in de VS en de EU." De documentatiepagina van Ultrafast vermeldt nu "breed beschikbaar voor GPT-6 Astra en GPT-6.1 Sol, met preview-toegang voor GPT-5.6 Sol", en de snelheidspagina aan de ChatGPT-kant bevestigt het abonnementsdeel: Ultrafast is beschikbaar in Codex en ChatGPT Work op Pro $500 en op in aanmerking komende Enterprise- en Edu-abonnementen.
Ultrafast is een serviceniveau, geen tweede model
Er verandert niets aan de gewichten. Hetzelfde checkpoint, hetzelfde contextvenster van 1.050.000 tokens, dezelfde maximale invoer van 922.000 tokens, hetzelfde uitvoerplafond van 128.000 tokens, dezelfde kennisafsluitdatum van 30 april 2026, dezelfde antwoorden. Wat je koopt is een planningsprioriteit: het model genereert tokens sneller, en OpenAI's eigen framing is bewust nauw — de tier "verkort de tijd tussen gegenereerde uitvoertokens". Het maakt het model niet slimmer, en het maakt de denkfase niet korter.
Dat onderscheid is de hele beslissing. Voor een agentlus die veertig tool-aanroepen achter elkaar doet, wordt de winst steeds groter omdat de uitvoer van elke beurt eerder aankomt. Voor één enkele moeilijke redeneeropdracht die het grootste deel van zijn kloktijd aan nadenken besteedt, kun je zes keer zoveel betalen en naar dezelfde spinner kijken.
De niveauladder, in één keer, in gewone taal:
• Batch and Flex — de helft van Standard, het goedkope spoor voor werk waar niemand op wacht
• Standaard — $2,00 invoer / $0,10 in cache / $2,50 cache schrijven / $10,00 uitvoer per miljoen tokens
• Fast — tweemaal Standard, of $4,00 / $0,20 / $5,00 / $20,00; OpenAI heeft Priority processing op 30 juli 2026 omgedoopt tot Fast mode
• Ultrasnel — zes keer Standard, of $12.00 / $0.60 / $15.00 / $60.00
• Boven 272K invoertokens — het hele verzoek wordt opnieuw geprijsd tegen 2x de invoer- en cachetarieven en 1,5x de uitvoer; Ultrafast long-context kost $24.00 / $1.20 / $30.00 / $90.00
De rekensom die niemand op de marketingpagina zet
Zes keer de prijs voor acht keer de snelheid is geen verliesgevende transactie, en het is ook geen gratis lunch. Ultrafast wordt per token gefactureerd, dus een taak die $1,00 kost bij Standard kost $6,00 bij Ultrafast — en is in ongeveer een achtste van de tijd klaar. De besparing zit niet in de factuur, maar in de kloktijd. Je betaalt vijf dollar extra om zeven achtste van de wachtrijtijd voor die taak weg te nemen, en of dat goedkoop of absurd is, hangt volledig af van wat de persoon of de pijplijn die aan de andere kant wacht, per minuut waard is.
Hieruit volgen twee implicaties, en dat zijn nu juist degene die over het hoofd worden gezien:
• Interactief werk is het makkelijke ja. Een ontwikkelaar die een diff ziet landen, een agent die niet verder kan voordat hij het resultaat heeft gelezen — dat zijn de gevallen waarin de latentie het product is. Acht keer snellere output in een lus van veertig beurten is geen marginale verbetering voor de menselijke waarneming; het is het verschil tussen een tool die je gebruikt en een tool die je op de achtergrond laat draaien.
• Gepland en batchwerk is de makkelijke nee. Als een job toch tot de ochtend de tijd heeft, is Ultrafast een 6x-rekening voor niets, en de Batch-lane tegen halve prijs ligt daar gewoon.
Gecachte invoer verdient een tweede blik, want die beweegt ook: $0,60 per miljoen op Ultrafast tegenover $0,10 op Standard, nog steeds 5% van het tarief voor niet-gecachte invoer. Agents met prompt-caching die elke beurt een grote systeemprompt opnieuw versturen, zullen merken dat de cachekorting meeschaalt met de tier in plaats van hen ertegen te beschermen.

Waar het getal "tot 8x" vandaan komt
Dit is het deel om te delen, omdat het de kop en de documentatie van de uitrol zijn die stilletjes verschillende dingen beschrijven.
De enige modelspecifieke snelheidsmeting die OpenAI publiceert, is deze zin: "GPT-6 Astra Ultrafast genereert tokens tot 8x sneller dan GPT-6 Astra in Standard-modus in Codex." Dat is een Astra-cijfer, gemeten in Codex. Er is geen equivalent gepubliceerd veelvoud voor GPT-6.1 Sol. Het document dat Ultrafast voor dit model behandelt, zegt dat het de tijd tussen gegenereerde uitvoertokens verkort en verwijst naar een prijstabel; er wordt geen getal aan gegeven. De snelheidspagina aan de ChatGPT-kant herhaalt de Astra-zin en stopt daar.
Dus de eerlijke lezing van "tot 8x sneller" is: het is de headline van de tier, afkomstig van het zustermodel dat sinds 29 september op Ultrafast draait, en het is een leveranciersclaim die geen enkele onafhankelijke partij voor een van beide modellen heeft gereproduceerd. Het kan best kloppen voor GPT-6.1 Sol — de twee draaien op dezelfde servingstack en het mechanisme van de tier is hetzelfde — maar niemand buiten OpenAI heeft een tokens-per-seconde-meting voor de Sol-variant gepubliceerd, en het "tot" is in die zin van wezenlijk belang.
Het is ook de moeite waard om de tiers per model gescheiden te houden, omdat de oudere nog altijd niet af is. Ultrafast werd op 13 augustus 2026 aangekondigd voor GPT-5.6 Sol met "tot 14x sneller dan Standard processing", in beperkte preview voor geselecteerde klanten. Drie maanden later zegt de documentatie nog steeds dat GPT-5.6 Sol "preview access" heeft en de Ultrafast-prijstabel bevat precies twee rijen — GPT-6 Astra en GPT-6.1 Sol. Een 14x-getal dat nooit algemene beschikbaarheid heeft bereikt en geen gepubliceerd tarief heeft, is een claim, niet een product.

Wie kan het daadwerkelijk aanzetten?
De API-kant is breed, de abonnementskant is smal, en dat verschil overrompelt mensen.
• API — beschikbaar voor alle API-gebruikers op gpt-6.1-sol — met afzonderlijke snelheidslimieten ten opzichte van Standard en Fast. Dat betekent een tweede budget om in de gaten te houden, niet alleen een tweede prijs.
• Ultrasnelle rate limits voor GPT-6.1 Sol — 1.000.000 tokens per minuut op Build, 4.000.000 op Launch, 40.000.000 op Grow. OpenAI heeft zijn gebruiksniveaus op 6 oktober teruggebracht van vijf naar drie, dus die drie namen vormen de huidige ladder, niet een verouderde.
• Dataresidentie — GPT-6.1 Sol ondersteunt dataresidentie in de VS en de EU en wereldwijde verwerking, ook onder Fast en Ultrafast. Astra's Ultrafast krijgt geen EU-residentie, dus als je workload aan de EU gebonden is, is dit de eerste Ultrafast-configuratie die je überhaupt kunt kopen.
• Codex en ChatGPT Work — Ultrafast is beschikbaar op het Pro $500-abonnement en op in aanmerking komende Enterprise- en Edu-abonnementen. Enterprise-beheerders krijgen het standaard uitgeschakeld en moeten het per gebruiker of per werkruimte inschakelen.
• Chat — niet inbegrepen. GPT-6.1 Sol zelf bevindt zich in Work en Codex; het consumentgerichte Chat-oppervlak maakt hier geen deel van uit.
• Hoe het wordt gefactureerd bij een abonnement — inbegrepen verbruik wordt verbruikt tegen 8x het Standaardtarief, en gekochte credits of Enterprise pay-as-you-go worden gefactureerd tegen 6x het Standaardtarief. Beide cijfers zijn het weten waard voordat je het ingeschakeld laat.
Eén implementatiedetail bepaalt of je überhaupt iets van de snelheid merkt. OpenAI's advies is onomwonden: gebruik WebSockets, "vooral voor agentische applicaties die veel toolaanroepen snel achter elkaar doen", want "zonder een persistente verbinding kan netwerkoverhead de latentiewinsten verminderen". Als je client voor elke aanroep een nieuwe HTTP-verbinding opent, kan overhead per verzoek het volledige voordeel van de tier waarvoor je net 6x zoveel hebt betaald, opeten. HTTP werkt nog steeds. Het is alleen misschien de tier niet waard.
Wat we routeren, en wat niet
GPT-6.1 Sol uit de standaardcategorie staat op OrcaRouter als openai/gpt-6.1-sol tegen het eigen tarief van de aanbieder van $2,00 voor input en $10,00 voor output per miljoen tokens, geleverd met 0% opslag — de lijstprijs van de leverancier wordt doorgegeven, dus wanneer OpenAI een tarief wijzigt, komt de wijziging op je factuur op dezelfde dag dat die op de tariefkaart verschijnt, in plaats van bij je volgende contractverlenging. Dezelfde sleutel en hetzelfde endpoint ondersteunen meer dan 200 modellen, dus een GPT-6.1 Sol-aanroep en een Claude- of Qwen-aanroep zitten achter één integratie met automatische failover en zonder tweede contract, en de routing-DSL voegt modellen samen tot één aanroep wanneer een taak meer dan één mening nodig heeft.
Ultrafast is niet een van die modellen, en het zou misleidend zijn om anders te suggereren. Het is een service-tier-flag op een OpenAI-account — je stuurt service_tier: "ultrafast" naar gpt-6.1-sol en OpenAI factureert je eigen account tegen de bovenstaande tarieven — dus het leeft binnen je directe OpenAI-integratie. Als je het aanzet, houd dan het getrapte verkeer op je leverancierssleutel en routeer het standaardvolume via ons. Dat is de eerlijke splitsing, en het is ook de goedkopere voor alles wat niet op een mens wacht.

Wat kun je er vandaag mee doen
Als je een Codex- of ChatGPT Work-seat op Pro $500 hebt, staat de schakelaar er al en kost de proef je niets behalve de verbruiksmultiplier — voer dezelfde taak op beide manieren uit en kijk of de lus die je daadwerkelijk draait genoeg beurten heeft om het achtvoudige zichtbaar te maken. Als je op de API zit, is het experiment dat de moeite waard is om uit te voeren smaller dan de aankondiging suggereert: breng in kaart hoeveel van je latentie tokengeneratie is en hoeveel het nadenken van het model, en richt Ultrafast vervolgens op het deel dat het daadwerkelijk kan comprimeren.
En als je voor hetzelfde verzoek kunt kiezen tussen Fast met 2x en Ultrafast met 6x, dan is Fast het niveau dat hier het eerst was en het niveau waarvan je het gedrag kunt afleiden uit alleen een tariefkaart. Ultrafast is nieuw voor dit model, door geen enkele onafhankelijke meting geprijsd, en precies zoveel waard als je eigen stopwatch zegt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
