Redaktionell flat vektorillustration för en techbloggs hero om ultrasnabb AI-inferens: ett stort rundat modellchip i mörkblått med en mjuk cyan-glöd mot en ljus bakgrund, en stiliserad blixt och en hastighetsmätare med nålen på max bredvid, snabba token-strömmar som rusar längs en horisontell hastighetslinje med rörelselinjer, och ett litet stoppur. Vit bakgrund med mjuka blå-och-cyan gradientaccenter och en subtil varm högdager; minimala flat line-ikoner; ren modern geometrisk sans-serif-typografi; ingen läsbar text, inga bokstäver, inga ord, ingen vattenstämpel, inga tredjepartslogotyper, 16:9-komposition.
Guides & Insights

GPT-5.6 Sol Ultrafast: Ultrafast släpps till 6× standardpris, men modellen är fortfarande endast en förhandsversion

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Väntan är över för nivån, men inte för den här modellen. På DevDay den 29 september 2026 gjorde leverantören Ultrafast till något du kan köpa: den nya planen ChatGPT Pro 500 för 500 dollar i månaden inkluderar det, API:et publicerar nu ett Ultrafast-prisblad på sex gånger standardpriset – 60,00 USD för indata / 300,00 USD för utdata per miljon tokens på GPT-6 Astra – och leverantörens Codex-dokumentation bekräftar att Pro-nivåerna inte har någon fem timmars användningsgräns alls, ett tidsfönster som gäller för Plus. Allt detta är uppgifter från leverantören, publicerade i leverantörens egen DevDay-sammanfattning, på hjälpsidor och i utvecklardokumentation. Det som inte har rört sig är modellen som den här sidan handlar om. GPT-5.6 Sol Ultrafast, som tillkännagavs den 13 augusti 2026 som den Cerebras-accelererade serveringsnivån för GPT-5.6 Sol med upp till 14× standardgenomströmning och 750 utdatatokens per sekund, är fortfarande endast förhandsvisningsåtkomst – arrangerad genom leverantörens kontoteam – och har fortfarande inget eget publicerat pris. Nivån har lanserats. Sol-varianten väntar fortfarande.

Två prisrörelser har inträffat sedan vi först skrev om detta, och de pekar i motsatta riktningar. Modellen under blev billigare: standard-GPT-5.6 Sol debiteras nu $4.00 per miljon indatatoken och $20.00 per miljon utdatatoken — OpenAI:s kampanjpris, som leverantören säger är tillgängligt åtminstone till och med den 21 november 2026 — inte $5.00 / $30.00 som gällde i augusti. Hastighetsnivån ovanpå den fick ett pris för första gången, och det är inte billigt: Ultrafast på GPT-6 Astra debiteras $60.00 / $300.00 per miljon. Varje siffra i den här artikeln kontrollerades igen mot OpenAI:s publicerade prislista, dess API-referens och dess Codex-prisdokumentation den 2026-09-30.

Vad Ultrafast mode faktiskt är

Ultrafast är en servicenivå, inte en ny modell. OpenAI tillkännagav den 13 augusti 2026 som den första produkten av sitt beräkningspartnerskap från januari 2026 med chiptillverkaren Cerebras – en affär som rapporteras vara värd omkring 10 miljarder dollar över tre år. Där standardinferens med GPT-5.6 Solkörs på GPU-kluster och tillbringar en stor del av sin tid med att flytta vikter mellan minne och beräkning, laddar Ultrafast modellens vikter i 44 GB SRAM på chipet på Cerebras kiselplattor i waferskala; en modell av Sols storlek sträcker sig över flera wafers i lager, så vikterna ligger där beräkningen sker. Resultatet är ett tak för genomströmningen som bestäms av kislet snarare än av minnesbandbredden.

Hårdvaruhistorien gick vidare 2026-08-18. Vid sitt Supernova-evenemang presenterade Cerebras CS-4, nästa generations rack-skala system byggt på sin Nexus-plattform — tre Wafer-Scale Engine-chips per rack, upp till 2× token-genereringshastigheten hos den tidigare CS-3, och, enligt Cerebras, mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar. Det är Cerebras påståenden för ett system i tidig åtkomst, ännu inte allmänt tillgängligt. Sedan avtäckningen hävdar ett enda inlägg på X att CS-4 redan betjänar GPT-5.6 Sol med ungefär 1 300 tokens per sekund — i linje med Cerebras egna siffror, men ännu inte bekräftat av någon. Betrakta den som en tidig signal: trovärdig, overifierad och värd att dubbelkolla innan du planerar kapacitet utifrån den.

Det som spelar roll för din kod: modell-id:t, vikterna, resonemangsbeteendet och utdata är identiska med standard-GPT-5.6 Sol. OpenAI beskriver Ultrafast som "mer nyttigt arbete per sekund" snarare än en kvalitetsnivå, och förhandsversionen kör hela flaggskeppsmodellen — hastigheten kommer inte från att man byter till en billigare modell. Det som ändras är hur snabbt tokens genereras.

Blanda inte ihop Ultrafast med snabbläget. Snabbläget är en separat, köpbar nivå på standardhårdvara: upp till ungefär 2,5× utdatahastighet mot ett pristillägg på 2× per token, utan att kvaliteten förändras – det bytte namn från Priority Processing den 30 juli 2026, och på GPT-5.6 Sol kostar det 8,00 $ input / 40,00 $ output per 1M. Ultrafast är något annat – Cerebras-hårdvara, upp till 14× på GPT-5.6 Sol och upp till 8× på GPT-6 Astra, som kostar 6× standardpriset på Astra och fortfarande inte har något pris på Sol. De två namnen ligger nu bredvid varandra i samma modellväljare, vilket fortfarande är det enskilt mest förvirrande med den här lanseringen.

Hur snabbt — siffrorna som räknas

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Siffran i rubriken är 14×, och den behöver en definition. OpenAI säger att Ultrafast genererar upp till 750 output-tokens per sekund jämfört med standardbearbetning av GPT-5.6 Sol. Det är en genomströmningssiffra för output-tokens, inte ett rakt påstående om att ”allt går 14× snabbare” — end-to-end-begärandetiden inkluderar även inmatningsbearbetning och modellens eget resonerande, vilket är anledningen till att 14× är märkt som ett maximum.

• Maximal utdatagenomströmning — upp till 750 utdatatokens per sekund, enligt OpenAIs tillkännagivande (2026-08-13).

• Jämfört med standardbearbetning – upp till 14× snabbare, enligt samma tillkännagivande; de faktiska vinsterna varierar med indatalängd och uppgiftstyp.

• Humanity's Last Exam, 2 500 frågor — OpenAI/Cerebras rapporterar att GPT-5.6 Sol Ultrafast blir klar på 11 timmar 11 minuter jämfört med 78 timmar 27 minuter för Claude Fable 5, med jämförbar noggrannhet. Leverantörsrapporterat, och jämförelsen spänner över två leverantörers hårdvarustackar – läs det som riktningsgivande, inte som en dom.

• GDP-Val, end-to-end — Cerebras rapporterar 5,6× snabbare totalt utan mätbar kvalitetsförlust. Även leverantörsrapporterat.

• Fast mode jämfört med Ultrafast – Fast mode når som mest cirka 2,5× utdatahastighet mot ett prispåslag på 2×, med samma tak på cirka 272K tokens som standardprissättningen. Ultrafast är det större hoppet: 14× på GPT-5.6 Sol enligt augustiutannonseringen, och upp till 8× på GPT-6 Astra i Codex enligt OpenAIs aktuella dokumentation, med lanseringsbevakning som anger att det motsvarar upp till 300 utdata-tokens per sekund.

• CS-4, nästa hårdvara — Cerebras hävdar att CS-4-racken levererar mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar, upp till 2× CS-3:s tokengenerering. En overifierad communityrapport placerar GPT-5.6 Sol på CS-4 vid ~1 300 tokens per sekund — samma riktning, ännu inte bekräftad av OpenAI eller Cerebras.

En varning innan du citerar 14×: det är ett tak för utdatagenomströmning på en leverantörs hårdvara, och oberoende jämförelser av augustilanseringen varierade från ungefär 7× till 11× beroende på vilken del av en arbetsbelastning som mättes. Samma disciplin gäller för hastighetssignalen för CS-4 – siffran på ~1 300 token/s för GPT-5.6 Sol på CS-4 började som ett enda X-inlägg, och varken OpenAI eller Cerebras har bekräftat den. Behandla alla dessa som leverantörs- och community-påståenden, inte som benchmark-utlåtanden.

Vad Ultrafast kostar nu – och varför det fortfarande inte prissätter Sol

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Här är läget för prisfrågan den 2026-09-30, sagt rakt ut. Ultrafast har en publicerad taxa — för GPT-6 Astra, och endast för GPT-6 Astra. OpenAIs prissida har nu en Ultrafast-kolumn vid sidan av Standard, Batch, Flex och Fast: $60.00 indata / $6.00 cachad indata / $75.00 cacheskrivningar / $300.00 utdata per miljon tokens i kort kontext, vilket fördubblas till $120.00 / $12.00 / $150.00 / $450.00 efter ungefär 272K tokens. Det är sex gånger standardtaxan för Astra, där Fast-läget är två gånger — och det är den första hårda siffran OpenAI har satt på nivån. Kortet ovan är vår egen ögonblicksbild från 2026-08-18, och dess dollarsiffror har ersatts två gånger om, av sänkningen av standardtaxan och nu av denna Ultrafast-rad. Det som fortfarande saknas i den tabellen är en Ultrafast-taxa för GPT-5.6 Sol: Ultrafast-kolumnen listar exakt en modell, gpt-6-astra. Nivån är prissatt; den här modellen är det inte.

Vad du kan prissätta idag, modell för modell:

• Standard GPT-5.6 Sol — $4.00 input / $20.00 output per 1M tokens för promptar upp till ungefär 272K tokens. OpenAI listar detta som kampanjpris som är tillgängligt åtminstone till och med den 21 november 2026. Detta är baslinjen du kan anropa just nu.

• Snabbläge — $8.00 / $40.00 för kort kontext på GPT-5.6 Sol, och fördubblas till $16.00 / $60.00 efter ungefär 272K tokens. Dubbelt så mycket som standardtaxan för upp till cirka 2.5× utdatahastighet, och på Sol är det fortfarande det snabbaste du faktiskt kan köpa.

• Prompt cache — cacheläsningar debiteras $0,40 per 1M (90 % rabatt på ny indata); cacheskrivningar debiteras $5,00 per 1M.

• Nivån för lång kontext — indata över ungefär 272K tokens debiteras med $8.00 / $30.00 vid standardbearbetning, inom modellens fönster på ~1.05M tokens och maximala utdata på 128K tokens.

• Batch API — $2.00 / $10.00 för kort kontext och $4.00 / $15.00 för lång kontext, en fast 50 % rabatt med en svarstid på ungefär 24 timmar.

För GPT-5.6 Sol är Astra-numret den bästa tillgängliga ledtråden och inget mer. OpenAI prissätter Ultrafast till 6× den underliggande modellens standardpris; tillämpa den multiplikatorn på Sols $4 / $20 och du hamnar på $24 / $120 per miljon. Det är aritmetik, inte ett publicerat pris – OpenAI har inte sagt något om ett pris för Sol Ultrafast, och förhandsvisningskohorterna i augusti fakturerades inte alls enligt någon nivåbaserad taxa. Planera utifrån standard-Sol till $4 / $20 eller snabbläge till $8 / $40 tills leverantören publicerar raden.

Så här använder du det – brett tillgängligt på Astra, fortfarande på begäran för Sol

Åtkomsten delades upp i två delar den 29 september, och uppdelningen går emot modellen som den här sidan handlar om. Ultrafast är nu brett tillgängligt på GPT-6 Astra: OpenAIs API-dokumentation säger att det är öppet för alla API-användare vid låga hastighetsgränser – 500 000 tokens per minut på användningsnivåerna 1–3, 1 miljon på nivå 4, 5 miljoner på nivå 5 – och det ingår i ChatGPT Work och Codex på den nya Pro 500-planen och på berättigade Enterprise- och Edu-planer, där en arbetsyteägare måste aktivera det, och där det inte stöds för arbetsytor som kräver inferens utanför USA. GPT-5.6 Sol Ultrafast följde inte med. Samma dokumentation beskriver fortfarande det som förhandsåtkomst via ett OpenAI-kontoteam, och parameterns egen beskrivning i API-schemat lyder fortfarande "currently available for gpt-5.6-sol" – en rad som nu släpar efter resten av dokumentationen i stället för att leda den. Om du vill ha nivån i dag, vill du ha den på Astra.

Gränssnittsfrågan är också avgjord. TestingCatalog rapporterade 2026-09-26 att en hastighetsväljare med Standard, Fast och Ultrafast låg opublicerad i Responses API Playground; tre dagar senare släppte OpenAI konsumentversionen av exakt detta, med Ultrafast nu som ett alternativ i modellväljaren i ChatGPT Work och Codex på Pro 500. Vi flaggade den iakttagelsen som en publikations tolkning av ett ej släppt gränssnitt och sade att OpenAI inte hade bekräftat något av det. Den pekade i rätt riktning, och utrullningen den syftade på kom på DevDay snarare än efter det.

De förhandsvisningskohorter som OpenAI namngav i augusti var kodning, handel, finansiell forskning, support och andra interaktiva arbetsbelastningar – team vars agenter gör många anrop per begäran och där svarstiden är flaskhalsen. Jane Street, Rogo och Podium var bland de namngivna tidiga testarna. Om din arbetsbelastning är en chatt med en enda tur spelar hastighetsnivån mycket mindre roll än för en agentloop med 40 anrop. Det praktiska svaret beror nu på vilken modell du frågar om: på GPT-6 Astra kan du ställa in service_tier: "ultrafast" i eftermiddag, och på GPT-5.6 Sol kan du fortfarande inte.

Vad du kan göra idag — det praktiska svaret

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Medan GPT-5.6 Sol Ultrafast stannar bakom förhandsvisningsdörren är båda flaggskeppsmodellerna live på OrcaRouter till leverantörens pris med 0 $ i påslag per token — modell-ID openai/gpt-5.6-sol via den OpenAI-kompatibla endpointen på api.orcarouter.ai/v1, och GPT-6 Astra bredvid den till standardpriset 10,00 $ / 50,00 $, vilket är modellen som OpenAI nu har lagt en Ultrafast-nivå ovanpå och som vi inte routar på den nivån. Skärmbilden nedan är från augusti 2026 och visar fortfarande den dåvarande raden 5,00 $ / 30,00 $; dagens Sol-pris är 4,00 $ / 20,00 $, vilket är det vi för vidare. Den vidarebefordran är anledningen till att leverantörens prisändringar når oss samma dag: 4,00 $ input / 20,00 $ output, samma siffror som OpenAI publicerar, utan något påslag per token ovanpå. Om du redan har en OpenAI-klient är migreringen en ändring av bas-URL och modell-ID; inget annat. Samma nyckel och endpoint ger tillgång till 200+ modeller, så Sol sitter bredvid sina egna syskon — GPT-5.6 Terra för 2,00 $ / 12,00 $ och GPT-5.6 Luna för 0,20 $ / 1,20 $ — och de modeller med öppna vikter som du skulle jämföra den med, och du kan routa efter svårighetsgrad i stället för att integrera om var och en.

Två OrcaRouter-specifika detaljer är värda att nämna på en hastighetssida. BYOK: ta med din egen OpenAI-nyckel och OpenAI fakturerar dig direkt enligt sina egna priser — OrcaRouter lägger till $0 per token och behåller dina anropsgränser och krediter hos leverantören intakta. Guardrails: PII Shield och innehållspolicyn körs före faktureringen, så en blockerad begäran returnerar ett rent 400-svar och debiteras aldrig, och Agent Firewall graderar verktygs- och MCP-anrop innan de körs. Ultrafast i sig är brett tillgängligt på GPT-6 Astra men inte på routningsbara villkor och inte för Sol — det är en åtkomststyrd nivå som faktureras till 6× standardtaxan, och vi erbjuder det inte. Om OpenAI någonsin erbjuder det på standardvillkor är att koppla in det till samma endpoint bara en ändring av modell-id; konfigurationen du bygger idag kan återanvändas.

Den ärliga gränsen — när Ultrafast inte är svaret

Fem ställen där berättelsen om hastighet fortfarande inte håller, nu när hälften av den har lagt sig:

Tillgänglig är inte samma sak som tillgänglig för dig. Ultrafast öppnades för alla API-användare på GPT-6 Astra, men det öppnades med låga hastighetsbegränsningar, det beskrivs fortfarande som åtkomstkontrollerat i OpenAI:s schema, det stöder inte EU eller annan regional bearbetning utanför USA, och i Enterprise-arbetsytor är det avstängt tills en ägare aktiverar det. På GPT-5.6 Sol öppnades ingenting alls. Kontrollera din egen åtkomst innan du arkitekterar utifrån någon av dem.

14× är ett maximum, inte en garanti. Det är ett tak för utdatagenomströmningen på Cerebras hårdvara; fördröjningen från ände till ände inkluderar fortfarande indatabearbetning, modellens resonemangstid och ditt eget nätverk. En resonemangstung prompt kan lägga större delen av sin väggklockstid på att tänka, där den framhävda snabbhetsvinsten krymper.

Det finns ett pris för den ena modellen och inget pris för den andra. Astra Ultrafast-taxan är publicerad — 6× standard — och det finns ingen Ultrafast-rad för GPT-5.6 Sol någonstans. Budgetera mot standard-Sol till $4 / $20 eller snabbläge till $8 / $40, och behandla alla "GPT-5.6 Sol Ultrafast-kostnad"-siffror du ser, inklusive $24 / $120-extrapoleringen ovan, som aritmetik snarare än en prislista.

Benchmarkresultaten är leverantörsrapporterade. HLE-körningen på 11 timmar och siffran 5,6× för GDP-Val är OpenAI/Cerebras-siffror från tillkännagivandet i augusti; oberoende uppskattningar av hastighetsökningen varierar från ungefär 7× till 11× beroende på vad som mäts. Lägg till CS-4-signalen i den listan: siffran på ~1 300 token/s för GPT-5.6 Sol på CS-4 kommer från ett enda X-inlägg och har ingen oberoende bekräftelse. De nya Astra Ultrafast-siffrorna – 8× i Codex, 6× priset – är också OpenAI:s egna.

Och den som kostar pengar snarare än tid: den åtgärdar inte en flaskhals du inte har. Om dina agenter är långsamma på grund av din egen orkestrering, verktygslatens eller indatatunga promptar, flyttar en snabbare utdataväg svansen bara marginellt. Beslutet om nivåmatchning — GPT-5.6 Sol för $4 / $20 mot GPT-5.6 Terra för $2 / $12 mot GPT-5.6 Luna för $0,20 / $1,20 — påverkar fortfarande din faktura mer än någon hastighetsnivå gör.

Summan av kardemumman. Ultrafast är inte längre en väntelistenivå som du bara kan läsa om. Från och med den 29 september 2026 säljer OpenAI den: ingår i $500-planen ChatGPT Pro 500 i Work och Codex, öppen för alla API-användare på GPT-6 Astra med låga hastighetsgränser, och prissatt till sex gånger standardtaxan — $60 / $300 per miljon kort kontext. GPT-5.6 Sol Ultrafast, augustiförhandsvisningen som den här sidan byggdes kring, har inte rört sig: fortfarande åtkomstkontrollerad, fortfarande begränsad till gpt-5.6-sol i API-schemat, fortfarande utan pris, och siffran på ~1 300 token/s som rapporterats för Sol på Cerebras CS-4 är fortfarande ett enda overifierat X-inlägg. Standard-GPT-5.6 Sol till $4 / $20 är vad du kan anropa i dag på OrcaRouter med $0 i påslag; GPT-6 Astra till $10 / $50 är vad du kan anropa om du vill ha modellen som fick Ultrafast-raden.

Ultrafast kostar nu riktiga pengar på GPT-6 Astra — 6× standard, eller ingår i Pro 500-planen för 500 $ — medan GPT-5.6 Sol Ultrafast fortfarande är en förhandsversion. Den fullständiga GPT-5.6 Sol är live på OrcaRouter för $4 / $20 per miljon tokens utan påslag, redo för din egen nyckel.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen