Een gegenereerde hero-kaart met als kop 'Nu op het snelste niveau', met als ondertitel 'GPT-6.1 Sol Ultrafast wordt uitgerold naar de API, Codex en ChatGPT Work' en vier chips met de tekst '$12,00 / $60,00 per 1 mln. tokens', '6x Standaard', 'tot 8x sneller (Astra-meting)' en 'API, Codex en ChatGPT Work', met daaronder een voettekst met de tekst 'Beschikbaarheid en prijzen volgens OpenAI-documentatie, 8 oktober 2026'.
Guides & Insights

GPT-6.1 Sol Ultrafast rolt uit naar de API, Codex en ChatGPT Work

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

OpenAI rolt Ultrafast-modus uit voor GPT-6.1 Sol — de snelste servicelaag die het verkoopt, en de eerste keer dat de bijna-Astra Sol-tier er een heeft. De zet plaatst GPT-6.1 Sol in dezelfde categorie als GPT-6 Astra Ultrafast in de API, in Codex en in ChatGPT Work, en het komt met een gepubliceerde tariefkaart in plaats van een wachtlijst: $12,00 per miljoen invoertokens en $60,00 per miljoen uitvoertokens, precies zes keer wat standaard GPT-6.1 Sol kost. De snelheidsclaim op de verpakking is "tot 8x". Het interessante deel is wat die frase meet, en het antwoord is niet het model waarvoor je op het punt staat te betalen.

De changelog voor ontwikkelaars bevat de vermelding van 8 oktober: "Ultrafast-modus toegevoegd voor GPT-6.1 Sol in de Responses API. Gebruik gpt-6.1-sol met service_tier: "ultrafast" om de tijd tussen gegenereerde outputtokens te verkorten. Het is beschikbaar voor alle API-gebruikers, onder voorbehoud van ratelimieten, met wereldwijde verwerking en dataresidentie in de VS en de EU." De documentatiepagina van Ultrafast vermeldt nu "breed beschikbaar voor GPT-6 Astra en GPT-6.1 Sol, met preview-toegang voor GPT-5.6 Sol", en de snelheidspagina aan de ChatGPT-kant bevestigt het abonnementsdeel: Ultrafast is beschikbaar in Codex en ChatGPT Work op Pro $500 en op in aanmerking komende Enterprise- en Edu-abonnementen.

Ultrafast is een serviceniveau, geen tweede model

Er verandert niets aan de gewichten. Hetzelfde checkpoint, hetzelfde contextvenster van 1.050.000 tokens, dezelfde maximale invoer van 922.000 tokens, hetzelfde uitvoerplafond van 128.000 tokens, dezelfde kennisafsluitdatum van 30 april 2026, dezelfde antwoorden. Wat je koopt is een planningsprioriteit: het model genereert tokens sneller, en OpenAI's eigen framing is bewust nauw — de tier "verkort de tijd tussen gegenereerde uitvoertokens". Het maakt het model niet slimmer, en het maakt de denkfase niet korter.

Dat onderscheid is de hele beslissing. Voor een agentlus die veertig tool-aanroepen achter elkaar doet, wordt de winst steeds groter omdat de uitvoer van elke beurt eerder aankomt. Voor één enkele moeilijke redeneeropdracht die het grootste deel van zijn kloktijd aan nadenken besteedt, kun je zes keer zoveel betalen en naar dezelfde spinner kijken.

De niveauladder, in één keer, in gewone taal:

• Batch and Flex — de helft van Standard, het goedkope spoor voor werk waar niemand op wacht

• Standaard — $2,00 invoer / $0,10 in cache / $2,50 cache schrijven / $10,00 uitvoer per miljoen tokens

• Fast — tweemaal Standard, of $4,00 / $0,20 / $5,00 / $20,00; OpenAI heeft Priority processing op 30 juli 2026 omgedoopt tot Fast mode

• Ultrasnel — zes keer Standard, of $12.00 / $0.60 / $15.00 / $60.00

• Boven 272K invoertokens — het hele verzoek wordt opnieuw geprijsd tegen 2x de invoer- en cachetarieven en 1,5x de uitvoer; Ultrafast long-context kost $24.00 / $1.20 / $30.00 / $90.00

De rekensom die niemand op de marketingpagina zet

Zes keer de prijs voor acht keer de snelheid is geen verliesgevende transactie, en het is ook geen gratis lunch. Ultrafast wordt per token gefactureerd, dus een taak die $1,00 kost bij Standard kost $6,00 bij Ultrafast — en is in ongeveer een achtste van de tijd klaar. De besparing zit niet in de factuur, maar in de kloktijd. Je betaalt vijf dollar extra om zeven achtste van de wachtrijtijd voor die taak weg te nemen, en of dat goedkoop of absurd is, hangt volledig af van wat de persoon of de pijplijn die aan de andere kant wacht, per minuut waard is.

Hieruit volgen twee implicaties, en dat zijn nu juist degene die over het hoofd worden gezien:

• Interactief werk is het makkelijke ja. Een ontwikkelaar die een diff ziet landen, een agent die niet verder kan voordat hij het resultaat heeft gelezen — dat zijn de gevallen waarin de latentie het product is. Acht keer snellere output in een lus van veertig beurten is geen marginale verbetering voor de menselijke waarneming; het is het verschil tussen een tool die je gebruikt en een tool die je op de achtergrond laat draaien.

• Gepland en batchwerk is de makkelijke nee. Als een job toch tot de ochtend de tijd heeft, is Ultrafast een 6x-rekening voor niets, en de Batch-lane tegen halve prijs ligt daar gewoon.

Gecachte invoer verdient een tweede blik, want die beweegt ook: $0,60 per miljoen op Ultrafast tegenover $0,10 op Standard, nog steeds 5% van het tarief voor niet-gecachte invoer. Agents met prompt-caching die elke beurt een grote systeemprompt opnieuw versturen, zullen merken dat de cachekorting meeschaalt met de tier in plaats van hen ertegen te beschermen.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, alongside the page's notes that regional processing endpoints carry a 10% uplift, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Waar het getal "tot 8x" vandaan komt

Dit is het deel om te delen, omdat het de kop en de documentatie van de uitrol zijn die stilletjes verschillende dingen beschrijven.

De enige modelspecifieke snelheidsmeting die O​penAI publiceert, is deze zin: "GPT-6 Astra Ultrafast genereert tokens tot 8x sneller dan GPT-6 Astra in Standard-modus in Codex." Dat is een Astra-cijfer, gemeten in Codex. Er is geen equivalent gepubliceerd veelvoud voor GPT-6.1 Sol. Het document dat Ultrafast voor dit model behandelt, zegt dat het de tijd tussen gegenereerde uitvoertokens verkort en verwijst naar een prijstabel; er wordt geen getal aan gegeven. De snelheidspagina aan de ChatGPT-kant herhaalt de Astra-zin en stopt daar.

Dus de eerlijke lezing van "tot 8x sneller" is: het is de headline van de tier, afkomstig van het zustermodel dat sinds 29 september op Ultrafast draait, en het is een leveranciersclaim die geen enkele onafhankelijke partij voor een van beide modellen heeft gereproduceerd. Het kan best kloppen voor GPT-6.1 Sol — de twee draaien op dezelfde servingstack en het mechanisme van de tier is hetzelfde — maar niemand buiten OpenAI heeft een tokens-per-seconde-meting voor de Sol-variant gepubliceerd, en het "tot" is in die zin van wezenlijk belang.

Het is ook de moeite waard om de tiers per model gescheiden te houden, omdat de oudere nog altijd niet af is. Ultrafast werd op 13 augustus 2026 aangekondigd voor GPT-5.6 Sol met "tot 14x sneller dan Standard processing", in beperkte preview voor geselecteerde klanten. Drie maanden later zegt de documentatie nog steeds dat GPT-5.6 Sol "preview access" heeft en de Ultrafast-prijstabel bevat precies twee rijen — GPT-6 Astra en GPT-6.1 Sol. Een 14x-getal dat nooit algemene beschikbaarheid heeft bereikt en geen gepubliceerd tarief heeft, is een claim, niet een product.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Ultrafast mode is the fastest service tier in the OpenAI API', the availability sentence naming broad availability for GPT-6 Astra and GPT-6.1 Sol with preview access for GPT-5.6 Sol, the statement that Ultrafast mode for GPT-6 Astra and GPT-6.1 Sol is available to all API users, the recommendation to use WebSockets because network overhead without a persistent connection can reduce the latency gains, the note that Ultrafast has separate rate limits from Standard and Fast modes, the GPT-6.1 Sol rate-limit row reading 1,000,000 / 4,000,000 / 40,000,000 tokens per minute and 5,000 / 20,000 / 200,000 requests per minute, the line that GPT-6.1 Sol supports US and EU data residency and global processing, and a code sample setting service_tier to 'ultrafast' with model 'gpt-6.1-sol'.

Wie kan het daadwerkelijk aanzetten?

De API-kant is breed, de abonnementskant is smal, en dat verschil overrompelt mensen.

• API — beschikbaar voor alle API-gebruikers op gpt-6.1-sol — met afzonderlijke snelheidslimieten ten opzichte van Standard en Fast. Dat betekent een tweede budget om in de gaten te houden, niet alleen een tweede prijs.

• Ultrasnelle rate limits voor GPT-6.1 Sol — 1.000.000 tokens per minuut op Build, 4.000.000 op Launch, 40.000.000 op Grow. OpenAI heeft zijn gebruiksniveaus op 6 oktober teruggebracht van vijf naar drie, dus die drie namen vormen de huidige ladder, niet een verouderde.

• Dataresidentie — GPT-6.1 Sol ondersteunt dataresidentie in de VS en de EU en wereldwijde verwerking, ook onder Fast en Ultrafast. Astra's Ultrafast krijgt geen EU-residentie, dus als je workload aan de EU gebonden is, is dit de eerste Ultrafast-configuratie die je überhaupt kunt kopen.

• Codex en ChatGPT Work — Ultrafast is beschikbaar op het Pro $500-abonnement en op in aanmerking komende Enterprise- en Edu-abonnementen. Enterprise-beheerders krijgen het standaard uitgeschakeld en moeten het per gebruiker of per werkruimte inschakelen.

• Chat — niet inbegrepen. GPT-6.1 Sol zelf bevindt zich in Work en Codex; het consumentgerichte Chat-oppervlak maakt hier geen deel van uit.

• Hoe het wordt gefactureerd bij een abonnement — inbegrepen verbruik wordt verbruikt tegen 8x het Standaardtarief, en gekochte credits of Enterprise pay-as-you-go worden gefactureerd tegen 6x het Standaardtarief. Beide cijfers zijn het weten waard voordat je het ingeschakeld laat.

Eén implementatiedetail bepaalt of je überhaupt iets van de snelheid merkt. OpenAI's advies is onomwonden: gebruik WebSockets, "vooral voor agentische applicaties die veel toolaanroepen snel achter elkaar doen", want "zonder een persistente verbinding kan netwerkoverhead de latentiewinsten verminderen". Als je client voor elke aanroep een nieuwe HTTP-verbinding opent, kan overhead per verzoek het volledige voordeel van de tier waarvoor je net 6x zoveel hebt betaald, opeten. HTTP werkt nog steeds. Het is alleen misschien de tier niet waard.

Wat we routeren, en wat niet

GPT-6.1 Sol uit de standaardcategorie staat op OrcaRouter als openai/gpt-6.1-sol tegen het eigen tarief van de aanbieder van $2,00 voor input en $10,00 voor output per miljoen tokens, geleverd met 0% opslag — de lijstprijs van de leverancier wordt doorgegeven, dus wanneer OpenAI een tarief wijzigt, komt de wijziging op je factuur op dezelfde dag dat die op de tariefkaart verschijnt, in plaats van bij je volgende contractverlenging. Dezelfde sleutel en hetzelfde endpoint ondersteunen meer dan 200 modellen, dus een GPT-6.1 Sol-aanroep en een Claude- of Qwen-aanroep zitten achter één integratie met automatische failover en zonder tweede contract, en de routing-DSL voegt modellen samen tot één aanroep wanneer een taak meer dan één mening nodig heeft.

Ultrafast is niet een van die modellen, en het zou misleidend zijn om anders te suggereren. Het is een service-tier-flag op een O​penAI-account — je stuurt service_tier: "ultrafast" naar gpt-6.1-sol en O​penAI factureert je eigen account tegen de bovenstaande tarieven — dus het leeft binnen je directe O​penAI-integratie. Als je het aanzet, houd dan het getrapte verkeer op je leverancierssleutel en routeer het standaardvolume via ons. Dat is de eerlijke splitsing, en het is ook de goedkopere voor alles wat niet op een mens wacht.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s, a 10.00 s figure, and 313.9M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Wat kun je er vandaag mee doen

Als je een Codex- of ChatGPT Work-seat op Pro $500 hebt, staat de schakelaar er al en kost de proef je niets behalve de verbruiksmultiplier — voer dezelfde taak op beide manieren uit en kijk of de lus die je daadwerkelijk draait genoeg beurten heeft om het achtvoudige zichtbaar te maken. Als je op de API zit, is het experiment dat de moeite waard is om uit te voeren smaller dan de aankondiging suggereert: breng in kaart hoeveel van je latentie tokengeneratie is en hoeveel het nadenken van het model, en richt Ultrafast vervolgens op het deel dat het daadwerkelijk kan comprimeren.

En als je voor hetzelfde verzoek kunt kiezen tussen Fast met 2x en Ultrafast met 6x, dan is Fast het niveau dat hier het eerst was en het niveau waarvan je het gedrag kunt afleiden uit alleen een tariefkaart. Ultrafast is nieuw voor dit model, door geen enkele onafhankelijke meting geprijsd, en precies zoveel waard als je eigen stopwatch zegt.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt