
GPT-5.6 Sol Ultrafast: 14× hastighet, 750 Tok/s — CS-4 rapporteras ~1 300, inget pris ännu
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNYDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokNYSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
GPT-5.6 Sol Ultrafast mode är den hårdvaruaccelererade serveringsnivån för flaggskeppet — samma fullständiga GPT-5.6 Sol-modell som körs på Cerebras wafer-scale-chips istället för GPU-kluster, med upp till 14× hastigheten för standardbearbetning och upp till 750 output-tokens per sekund på den nivå som OpenAI tillkännagav i augusti. Den 2026-08-18 avtäckte Cerebras nästa generations CS-4-system som denna nivå växer till, och en tidig, overifierad rapport hävdar att GPT-5.6 Sol på CS-4 redan serverar ungefär 1 300 tokens per sekund. Det är inte en mindre modell och inte en destillering: endast hårdvaran och schemaläggningen har ändrats, och intelligensen bevaras. Vad den ännu inte har är ett pris — från och med 2026-08-19 är Ultrafast en begränsad API-förhandsvisning utan publicerad prislista, så den siffra du faktiskt kan budgetera mot idag är standardnivån på den live GPT-5.6 Sol-modellsidan: 5 dollar per miljon input-tokens och 30 dollar per miljon output-tokens, utan påslag. Den här artikeln tar upp vad läget är, hur snabba siffrorna verkligen är — inklusive den nya CS-4-hårdvaran och vad som fortfarande är overifierat — vad det kostar (inklusive det ärliga svaret ”inget pris ännu”) och vad du ska göra tills det når allmän tillgänglighet.
Vad Ultrafast mode faktiskt är
Ultrafast är en serveringsnivå, inte en ny modell. OpenAI tillkännagav den den 13 augusti 2026 som den första produkten från sitt beräkningspartnerskap från januari 2026 med chiptillverkaren Cerebras — en affär som rapporterats vara värd cirka 10 miljarder dollar över tre år. Medan standardinferens med GPT-5.6 Sol körs på GPU-kluster och spenderar mycket av sin tid på att flytta vikter mellan minne och beräkning, laddar Ultrafast modellens vikter i 44 GB inbyggd SRAM på Cerebras wafer-skala-chips; en modell av Sols storlek sträcker sig över flera wafers i lager, så vikterna ligger där beräkningen sker. Resultatet är ett genomströmningstak som sätts av kislet snarare än av minnesbandbredden.
Hårdvaruhistorien gick vidare 2026-08-18. Vid sitt Supernova-evenemang presenterade Cerebras CS-4, nästa generations rack-skala system byggt på sin Nexus-plattform — tre Wafer-Scale Engine-chips per rack, upp till 2× token-genereringshastigheten hos den tidigare CS-3, och, enligt Cerebras, mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar. Det är Cerebras påståenden för ett system i tidig åtkomst, ännu inte allmänt tillgängligt. Sedan avtäckningen hävdar ett enda inlägg på X att CS-4 redan betjänar GPT-5.6 Sol med ungefär 1 300 tokens per sekund — i linje med Cerebras egna siffror, men ännu inte bekräftat av någon. Betrakta den som en tidig signal: trovärdig, overifierad och värd att dubbelkolla innan du planerar kapacitet utifrån den.
Det som spelar roll för din kod: modell-id:t, vikterna, resonemangsbeteendet och utdata är identiska med standard-GPT-5.6 Sol. OpenAI beskriver Ultrafast som "mer nyttigt arbete per sekund" snarare än en kvalitetsnivå, och förhandsversionen kör hela flaggskeppsmodellen — hastigheten kommer inte från att man byter till en billigare modell. Det som ändras är hur snabbt tokens genereras.
Blanda inte ihop Ultrafast med det befintliga snabbläget. Snabbläget är en separat, köpbar nivå på standardhårdvara: upp till ungefär 2,5× utdatahastighet till en 2×-premie per token ($10 input / $60 output per 1M), utan kvalitetsförändring. Ultrafast är något annat — Cerebras-hårdvara, upp till 14×, och för närvarande inget pris alls.
Hur snabbt — siffrorna som räknas

Siffran i rubriken är 14×, och den behöver en definition. OpenAI säger att Ultrafast genererar upp till 750 output-tokens per sekund jämfört med standardbearbetning av GPT-5.6 Sol. Det är en genomströmningssiffra för output-tokens, inte ett rakt påstående om att ”allt går 14× snabbare” — end-to-end-begärandetiden inkluderar även inmatningsbearbetning och modellens eget resonerande, vilket är anledningen till att 14× är märkt som ett maximum.
• Maximalt utflöde — upp till 750 utdata-tokens per sekund, enligt OpenAIs tillkännagivande (2026-08-13).
• Jämfört med standardbearbetning — upp till 14× snabbare, enligt samma tillkännagivande; faktiska vinster varierar med indatalängd och uppgiftstyp.
• Humanity's Last Exam, 2 500 frågor – OpenAI/Cerebras rapporterar att GPT-5.6 Sol Ultrafast slutförde testet på 11 timmar och 11 minuter jämfört med 78 timmar och 27 minuter för Claude Fable 5, med jämförbar noggrannhet. Uppgifterna är leverantörsrapporterade, och jämförelsen omfattar två leverantörers hårdvaruplattformar – se det som vägledande, inte som ett avgörande.
• GDP-Val, end-to-end — Cerebras rapporterar 5,6× snabbare totalt utan mätbar kvalitetsförlust. Även leverantörsrapporterat.
• Baslinje för snabbläge — den befintliga köpbara hastighetsnivån toppar på ungefär 2,5× utmatningshastighet för ett prispåslag på 2×.
• CS-4, nästa hårdvara — Cerebras hävdar att CS-4-racken levererar mer än 1 000 tokens per sekund på modeller över 10 biljoner parametrar, upp till 2× CS-3:s tokengenerering. En overifierad communityrapport placerar GPT-5.6 Sol på CS-4 vid ~1 300 tokens per sekund — samma riktning, ännu inte bekräftad av OpenAI eller Cerebras.
En varning innan du citerar 14×: oberoende bevakning av lanseringen anger en jämförelse på ~11× i genereringshastighet mot Claude Fable 5, medan Cerebras egna siffror antyder ~7× för total testtid på samma körning – skillnaden är vilken del av en arbetsbelastning du mäter. Samma disciplin gäller för CS-4-hastighetssignalen: siffran på ~1 300 token/s började som ett enda inlägg på X, och varken OpenAI eller Cerebras har bekräftat den. Allt detta är siffror från leverantörer eller communityn som tillkännagavs denna vecka, och inget är oberoende verifierat ännu. Behandla dem som påståenden, inte som benchmark-utslag.
Vad det kostar — och det ärliga gapet

Här är läget i prisfrågan den 2026-08-19, klart och tydligt: Ultrafast har inget publicerat pris. OpenAI har inte tillkännagett ett, och förhandsversionen visas inte på något offentligt priskort. Rapporter om att tidiga åtkomstplatser ingår i paket eller är gratis är spekulation, inte policy – och tills OpenAI prissätter nivån är alla siffror för "GPT-5.6 Sol Ultrafast cost" som du hittar någon annanstans en gissning.
Det du kan prissätta idag är resten av GPT-5.6 Sol-serien, verifierad mot OpenAIs publicerade priser den 2026-08-18:
• Standard GPT-5.6 Sol — $5.00 inmatning / $30.00 utmatning per 1M tokens. Baslinjen du kan anropa just nu.
• Fast mode — $10,00 / $60,00, ett 2× påslag för upp till cirka 2,5× utmatningshastighet. Det närmaste en hastighetsnivå du faktiskt kan köpa.
• Promptcache-läsning — $0,50 per 1M (90 % rabatt på ny input); cache-skrivningar debiteras med $6,25 per 1M.
• Nivå för lång kontext — input över cirka 272K tokens faktureras till 10,00 $ / 45,00 $.
• Batch API — $2.50 / $15.00, fast 50 % rabatt med cirka 24 timmars handläggningstid.
För kontext om vilken premie som kan förväntas: snabbläget satte prejudikatet med 2× standardpriset för 2,5× hastigheten. Om Ultrafast följer en liknande kurva hamnar det väl över standardpriset $5 / $30 — och kommentarer kring förhandsvisningen förväntar sig precis det, eftersom Cerebras waferskapacitet är knapp och dyr. Men en förväntad premie är inte ett pris. Planera utifrån standard Sol eller snabbläge tills en prislista finns.
Så här använder du det — förhandsgranskningens verklighet
Access är den andra ärliga luckan. Ultrafast finns tillgängligt via OpenAI:s API för en utvald grupp kunder på väntelista, tillkännagivet 2026-08-13, där OpenAI säger att åtkomsten kommer att utökas "i takt med att kapaciteten växer." Det finns inget datum för allmän tillgänglighet. De tillkännagivna förhandsgrupperna är kodning, handel, finansiell forskning, support och andra interaktiva arbetsbelastningar – team vars agenter gör många anrop per förfrågan och där svarstiden är flaskhalsen. Jane Street, Rogo och Podium är bland de namngivna tidiga testarna.
Användningsmönstret det är utformat för: incidenthantering (läsa loggar, spårningar och diffar medan ett avbrott pågår), finansiell forskning och bedrägeridetektering på data i rörelse, kundsupport och röst i realtid (där en halv sekunds tystnad upplevs som trasigt), e-handelsutcheckning och att komprimera övernattningsforskningsbatcher till interaktiva sessioner. Om din arbetsbelastning är en chatt med en enda tur, spelar 14× mycket mindre roll än för en agentloop med 40 anrop.
Vad du kan göra idag — det praktiska svaret

Medan Ultrafast är i förhandsversion är hela GPT-5.6 Sol live just nu — och på OrcaRouter levereras standardnivån till leverantörens pris med $0 påslag per token, som modell-ID openai/gpt-5.6-sol genom den OpenAI-kompatibla slutpunkten på api.orcarouter.ai/v1. Om du redan har en OpenAI-klient handlar migreringen om en ändring av bas-URL och modell-ID; inget annat. Samma nyckel och slutpunkt hanterar 200+ modeller, så Sol finns sida vid sida med GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 och de open-weight-modeller du skulle jämföra den med — och du kan dirigera efter svårighetsgrad i stället för att integrera om varje modell.
Två OrcaRouter-detaljer är värda att nämna på en snabbhetssida. BYOK: använd din egen OpenAI-nyckel och OpenAI fakturerar dig direkt enligt sina egna priser — OrcaRouter lägger till $0 per token och behåller dina leverantörsgränser och krediter intakta. Guardrails: PII Shield och innehållspolicyn körs före fakturering, så en blockerad begäran returnerar en ren 400 och debiteras aldrig, och Agent Firewall bedömer verktygs- och MCP-anrop innan de körs. När — och om — Ultrafast når allmän tillgänglighet till ett dirigerbart pris, är det bara en model-id-ändring att ansluta den till samma endpoint; den konfiguration du bygger idag följer med.
Den ärliga gränsen — när Ultrafast inte är svaret
Fyra punkter där 14×-historien inte håller, så du inte designar eller budgeterar utifrån en siffra som inte är fastställd:
14× är ett maximum, inte en garanti. Det är ett tak för utdatagenomströmningen på Cerebras hårdvara; end-to-end-latensen inkluderar fortfarande inmatningsbearbetning, modellens resonemangstid och ditt eget nätverk. En resonemangstung prompt kan tillbringa större delen av sin väggklockstid med att tänka, där den omtalade snabbheten krymper.
Den har inget pris och inget GA-datum. Från och med 2026-08-19 kan du inte köpa Ultrafast — du kan bara begära förhandsåtkomst, och CS-4-hårdvaran bakom den är i early access snarare än allmänt tillgänglig. Budgetera utifrån standard Sol ($5 / $30) eller snabbläge ($10 / $60), och betrakta alla Ultrafast-priser du ser online som overifierade.
Riktmärkena är leverantörsrapporterade. 11-timmars HLE-körningen och siffran 5,6× GDP-Val är OpenAI/Cerebras-siffror från tillkännagivandet; oberoende uppskattningar varierar från ungefär 7× till 11× beroende på vad som mäts. Lägg till CS-4-hastighetssignalen i den listan: siffran på ~1 300 token/s för GPT-5.6 Sol på CS-4 kommer från ett enda inlägg på X och har ingen oberoende bekräftelse. Inget av detta är oberoende verifierat ännu.
Det löser inte en flaskhals du inte har.Om dina agenter är långsamma på grund av din egen orkestrering, verktygslatens eller inmatningstunga prompts, flyttar en snabbare utdataväg svansen endast marginellt. Beslutet om nivåmatchning — GPT-5.6 Sol för $5 / $30 jämfört med GPT-5.6 Terra för $2 / $12 jämfört med GPT-5.6 Luna för $0.20 / $1.20 — påverkar fortfarande din nota mer än någon hastighetsnivå gör.
Kort sagt. GPT-5.6 Sol Ultrafast är den snabbaste serveringsnivån OpenAI har lanserat för sin flaggskeppsmodell — samma vikter på Cerebras hårdvara, upp till 14× genomströmning och 750 utdatatokens per sekund på den annonserade nivån. Cerebras nya CS-4 (presenterad 2026-08-18) rapporteras pressa GPT-5.6 Sol mot ~1 300 tokens per sekund, men den siffran är ett enda overifierat X-inlägg. Från och med 2026-08-19 är Ultrafast en väntelisteförhandsversion utan offentligt pris. Om du letar efter en siffra att budgetera mot är det ärliga svaret att det inte finns någon ännu. Standard GPT-5.6 Sol för $5 / $30 är vad du kan anropa idag, snabbläget för $10 / $60 är den köpbara hastighetsnivån, och OrcaRouter skickar båda vidare utan påslag på din egen nyckel. Bygg routingen nu — och när Ultrafast får ett pris och ett datum är det bara en model-id-ändring bort.
Tills Ultrafast får ett pris, är hela GPT-5.6 Sol live på GPT-5.6 Sol på OrcaRouter till $5 / $30 per miljon tokens, utan påslag, redo för din egen nyckel.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
