Redaktionell flat vektorillustration för en techbloggs hero om ultrasnabb AI-inferens: ett stort rundat modellchip i mörkblått med en mjuk cyan-glöd mot en ljus bakgrund, en stiliserad blixt och en hastighetsmätare med nålen på max bredvid, snabba token-strömmar som rusar längs en horisontell hastighetslinje med rörelselinjer, och ett litet stoppur. Vit bakgrund med mjuka blå-och-cyan gradientaccenter och en subtil varm högdager; minimala flat line-ikoner; ren modern geometrisk sans-serif-typografi; ingen läsbar text, inga bokstäver, inga ord, ingen vattenstämpel, inga tredjepartslogotyper, 16:9-komposition.
Guides & Insights

GPT-5.6 Sol Ultrafast: 14× hastighet, 750 Tok/s — CS-4 rapporteras ~1 300, inget pris ännu

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GPT-5.6 Sol Ultrafast mode är den hårdvaruaccelererade serveringsnivån för flaggskeppet — samma fullständiga GPT-5.6 Sol-modell som körs på Cerebras wafer-scale-chips istället för GPU-kluster, med upp till 14× hastigheten för standardbearbetning och upp till 750 output-tokens per sekund på den nivå som OpenAI tillkännagav i augusti. Den 2026-08-18 avtäckte Cerebras nästa generations CS-4-system som denna nivå växer till, och en tidig, overifierad rapport hävdar att GPT-5.6 Sol på CS-4 redan serverar ungefär 1 300 tokens per sekund. Det är inte en mindre modell och inte en destillering: endast hårdvaran och schemaläggningen har ändrats, och intelligensen bevaras. Vad den ännu inte har är ett pris — från och med 2026-08-19 är Ultrafast en begränsad API-förhandsvisning utan publicerad prislista, så den siffra du faktiskt kan budgetera mot idag är standardnivån på den live GPT-5.6 Sol-modellsidan: 5 dollar per miljon input-tokens och 30 dollar per miljon output-tokens, utan påslag. Den här artikeln tar upp vad läget är, hur snabba siffrorna verkligen är — inklusive den nya CS-4-hårdvaran och vad som fortfarande är overifierat — vad det kostar (inklusive det ärliga svaret ”inget pris ännu”) och vad du ska göra tills det når allmän tillgänglighet.

Vad Ultrafast mode faktiskt är

Ultrafast är en serveringsnivå, inte en ny modell. OpenAI tillkännagav den den 13 augusti 2026 som den första produkten från sitt beräkningspartnerskap från januari 2026 med chiptillverkaren Cerebras — en affär som rapporterats vara värd cirka 10 miljarder dollar över tre år. Medan standardinferens med GPT-5.6 Sol körs på GPU-kluster och spenderar mycket av sin tid på att flytta vikter mellan minne och beräkning, laddar Ultrafast modellens vikter i 44 GB inbyggd SRAM på Cerebras wafer-skala-chips; en modell av Sols storlek sträcker sig över flera wafers i lager, så vikterna ligger där beräkningen sker. Resultatet är ett genomströmningstak som sätts av kislet snarare än av minnesbandbredden.

Hårdvaruhistorien gick vidare 2026-08-18. Vid sitt Supernova-evenemang presenterade Cerebras CS-4, nästa generations rack-skala system byggt på sin Nexus-plattform — tre Wafer-Scale Engine-chips per rack, upp till 2× token-genereringshastigheten hos den tidigare CS-3, och, enligt Cerebras, mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar. Det är Cerebras påståenden för ett system i tidig åtkomst, ännu inte allmänt tillgängligt. Sedan avtäckningen hävdar ett enda inlägg på X att CS-4 redan betjänar GPT-5.6 Sol med ungefär 1 300 tokens per sekund — i linje med Cerebras egna siffror, men ännu inte bekräftat av någon. Betrakta den som en tidig signal: trovärdig, overifierad och värd att dubbelkolla innan du planerar kapacitet utifrån den.

Det som spelar roll för din kod: modell-id:t, vikterna, resonemangsbeteendet och utdata är identiska med standard-GPT-5.6 Sol. OpenAI beskriver Ultrafast som "mer nyttigt arbete per sekund" snarare än en kvalitetsnivå, och förhandsversionen kör hela flaggskeppsmodellen — hastigheten kommer inte från att man byter till en billigare modell. Det som ändras är hur snabbt tokens genereras.

Blanda inte ihop Ultrafast med det befintliga snabbläget. Snabbläget är en separat, köpbar nivå på standardhårdvara: upp till ungefär 2,5× utdatahastighet till en 2×-premie per token ($10 input / $60 output per 1M), utan kvalitetsförändring. Ultrafast är något annat — Cerebras-hårdvara, upp till 14×, och för närvarande inget pris alls.

Hur snabbt — siffrorna som räknas

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Siffran i rubriken är 14×, och den behöver en definition. OpenAI säger att Ultrafast genererar upp till 750 output-tokens per sekund jämfört med standardbearbetning av GPT-5.6 Sol. Det är en genomströmningssiffra för output-tokens, inte ett rakt påstående om att ”allt går 14× snabbare” — end-to-end-begärandetiden inkluderar även inmatningsbearbetning och modellens eget resonerande, vilket är anledningen till att 14× är märkt som ett maximum.

Maximalt utflöde — upp till 750 utdata-tokens per sekund, enligt OpenAIs tillkännagivande (2026-08-13).

Jämfört med standardbearbetning — upp till 14× snabbare, enligt samma tillkännagivande; faktiska vinster varierar med indatalängd och uppgiftstyp.

Humanity's Last Exam, 2 500 frågor – OpenAI/Cerebras rapporterar att GPT-5.6 Sol Ultrafast slutförde testet på 11 timmar och 11 minuter jämfört med 78 timmar och 27 minuter för Claude Fable 5, med jämförbar noggrannhet. Uppgifterna är leverantörsrapporterade, och jämförelsen omfattar två leverantörers hårdvaruplattformar – se det som vägledande, inte som ett avgörande.

GDP-Val, end-to-end — Cerebras rapporterar 5,6× snabbare totalt utan mätbar kvalitetsförlust. Även leverantörsrapporterat.

Baslinje för snabbläge — den befintliga köpbara hastighetsnivån toppar på ungefär 2,5× utmatningshastighet för ett prispåslag på 2×.

• CS-4, nästa hårdvara — Cerebras hävdar att CS-4-racken levererar mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar, upp till 2× CS-3:s tokengenerering. En overifierad communityrapport placerar GPT-5.6 Sol på CS-4 vid ~1 300 tokens per sekund — samma riktning, ännu inte bekräftad av OpenAI eller Cerebras.

En varning innan du citerar 14×: oberoende bevakning av lanseringen anger en jämförelse på ~11× i genereringshastighet mot Claude Fable 5, medan Cerebras egna siffror antyder ~7× för total testtid på samma körning – skillnaden är vilken del av en arbetsbelastning du mäter. Samma disciplin gäller för CS-4-hastighetssignalen: siffran på ~1 300 token/s började som ett enda inlägg på X, och varken OpenAI eller Cerebras har bekräftat den. Allt detta är siffror från leverantörer eller communityn som tillkännagavs denna vecka, och inget är oberoende verifierat ännu. Behandla dem som påståenden, inte som benchmark-utslag.

Vad det kostar — och det ärliga gapet

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Här är läget i prisfrågan den 2026-08-19, klart och tydligt: Ultrafast har inget publicerat pris. OpenAI har inte tillkännagett ett, och förhandsversionen visas inte på något offentligt priskort. Rapporter om att tidiga åtkomstplatser ingår i paket eller är gratis är spekulation, inte policy – och tills OpenAI prissätter nivån är alla siffror för "GPT-5.6 Sol Ultrafast cost" som du hittar någon annanstans en gissning.

Det du kan prissätta idag är resten av GPT-5.6 Sol-serien, verifierad mot OpenAIs publicerade priser den 2026-08-18:

Standard GPT-5.6 Sol — $5.00 inmatning / $30.00 utmatning per 1M tokens. Baslinjen du kan anropa just nu.

Fast mode — $10,00 / $60,00, ett 2× påslag för upp till cirka 2,5× utmatningshastighet. Det närmaste en hastighetsnivå du faktiskt kan köpa.

Promptcache-läsning — $0,50 per 1M (90 % rabatt på ny input); cache-skrivningar debiteras med $6,25 per 1M.

Nivå för lång kontext — input över cirka 272K tokens faktureras till 10,00 $ / 45,00 $.

Batch API — $2.50 / $15.00, fast 50 % rabatt med cirka 24 timmars handläggningstid.

För kontext om vilken premie som kan förväntas: snabbläget satte prejudikatet med 2× standardpriset för 2,5× hastigheten. Om Ultrafast följer en liknande kurva hamnar det väl över standardpriset $5 / $30 — och kommentarer kring förhandsvisningen förväntar sig precis det, eftersom Cerebras waferskapacitet är knapp och dyr. Men en förväntad premie är inte ett pris. Planera utifrån standard Sol eller snabbläge tills en prislista finns.

Så här använder du det — förhandsgranskningens verklighet

Access är den andra ärliga luckan. Ultrafast finns tillgängligt via OpenAI:s API för en utvald grupp kunder på väntelista, tillkännagivet 2026-08-13, där OpenAI säger att åtkomsten kommer att utökas "i takt med att kapaciteten växer." Det finns inget datum för allmän tillgänglighet. De tillkännagivna förhandsgrupperna är kodning, handel, finansiell forskning, support och andra interaktiva arbetsbelastningar – team vars agenter gör många anrop per förfrågan och där svarstiden är flaskhalsen. Jane Street, Rogo och Podium är bland de namngivna tidiga testarna.

Användningsmönstret det är utformat för: incidenthantering (läsa loggar, spårningar och diffar medan ett avbrott pågår), finansiell forskning och bedrägeridetektering på data i rörelse, kundsupport och röst i realtid (där en halv sekunds tystnad upplevs som trasigt), e-handelsutcheckning och att komprimera övernattningsforskningsbatcher till interaktiva sessioner. Om din arbetsbelastning är en chatt med en enda tur, spelar 14× mycket mindre roll än för en agentloop med 40 anrop.

Vad du kan göra idag — det praktiska svaret

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Medan Ultrafast är i förhandsversion är hela GPT-5.6 Sol live just nu — och på OrcaRouter levereras standardnivån till leverantörens pris med $0 påslag per token, som modell-ID openai/gpt-5.6-sol genom den OpenAI-kompatibla slutpunkten på api.orcarouter.ai/v1. Om du redan har en OpenAI-klient handlar migreringen om en ändring av bas-URL och modell-ID; inget annat. Samma nyckel och slutpunkt hanterar 200+ modeller, så Sol finns sida vid sida med GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 och de open-weight-modeller du skulle jämföra den med — och du kan dirigera efter svårighetsgrad i stället för att integrera om varje modell.

Två OrcaRouter-detaljer är värda att nämna på en snabbhetssida. BYOK: använd din egen OpenAI-nyckel och OpenAI fakturerar dig direkt enligt sina egna priser — OrcaRouter lägger till $0 per token och behåller dina leverantörsgränser och krediter intakta. Guardrails: PII Shield och innehållspolicyn körs före fakturering, så en blockerad begäran returnerar en ren 400 och debiteras aldrig, och Agent Firewall bedömer verktygs- och MCP-anrop innan de körs. När — och om — Ultrafast når allmän tillgänglighet till ett dirigerbart pris, är det bara en model-id-ändring att ansluta den till samma endpoint; den konfiguration du bygger idag följer med.

Den ärliga gränsen — när Ultrafast inte är svaret

Fyra punkter där 14×-historien inte håller, så du inte designar eller budgeterar utifrån en siffra som inte är fastställd:

14× är ett maximum, inte en garanti. Det är ett tak för utdatagenomströmningen på Cerebras hårdvara; end-to-end-latensen inkluderar fortfarande inmatningsbearbetning, modellens resonemangstid och ditt eget nätverk. En resonemangstung prompt kan tillbringa större delen av sin väggklockstid med att tänka, där den omtalade snabbheten krymper.

Den har inget pris och inget GA-datum. Från och med 2026-08-19 kan du inte köpa Ultrafast — du kan bara begära förhandsåtkomst, och CS-4-hårdvaran bakom den är i early access snarare än allmänt tillgänglig. Budgetera utifrån standard Sol ($5 / $30) eller snabbläge ($10 / $60), och betrakta alla Ultrafast-priser du ser online som overifierade.

Riktmärkena är leverantörsrapporterade. 11-timmars HLE-körningen och siffran 5,6× GDP-Val är OpenAI/Cerebras-siffror från tillkännagivandet; oberoende uppskattningar varierar från ungefär 7× till 11× beroende på vad som mäts. Lägg till CS-4-hastighetssignalen i den listan: siffran på ~1 300 token/s för GPT-5.6 Sol på CS-4 kommer från ett enda inlägg på X och har ingen oberoende bekräftelse. Inget av detta är oberoende verifierat ännu.

Det löser inte en flaskhals du inte har.Om dina agenter är långsamma på grund av din egen orkestrering, verktygslatens eller inmatningstunga prompts, flyttar en snabbare utdataväg svansen endast marginellt. Beslutet om nivåmatchning — GPT-5.6 Sol för $5 / $30 jämfört med GPT-5.6 Terra för $2 / $12 jämfört med GPT-5.6 Luna för $0.20 / $1.20 — påverkar fortfarande din nota mer än någon hastighetsnivå gör.

Kort sagt. GPT-5.6 Sol Ultrafast är den snabbaste serveringsnivån OpenAI har lanserat för sin flaggskeppsmodell — samma vikter på Cerebras hårdvara, upp till 14× genomströmning och 750 utdatatokens per sekund på den annonserade nivån. Cerebras nya CS-4 (presenterad 2026-08-18) rapporteras pressa GPT-5.6 Sol mot ~1 300 tokens per sekund, men den siffran är ett enda overifierat X-inlägg. Från och med 2026-08-19 är Ultrafast en väntelisteförhandsversion utan offentligt pris. Om du letar efter en siffra att budgetera mot är det ärliga svaret att det inte finns någon ännu. Standard GPT-5.6 Sol för $5 / $30 är vad du kan anropa idag, snabbläget för $10 / $60 är den köpbara hastighetsnivån, och OrcaRouter skickar båda vidare utan påslag på din egen nyckel. Bygg routingen nu — och när Ultrafast får ett pris och ett datum är det bara en model-id-ändring bort.

Tills Ultrafast får ett pris, är hela GPT-5.6 Sol live på GPT-5.6 Sol på OrcaRouter till $5 / $30 per miljon tokens, utan påslag, redo för din egen nyckel.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube