
GPT-6 Astra Ultrafast i 6x: Vad den publicerade prislistan faktiskt kostar dig
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 349 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 210 tok/s
- OrcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- xAISpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
GPT-6 Astra Ultrafast slutade vara en väntelista den 29 september 2026. Den är nu en köpbar tjänstenivå med ett offentliggjort pris, och priset är exakt sex gånger standardpriset på varje enskild rad. Den underliggande modellen – GPT-6 Astra, företagets flaggskepp, som lanserades den 3 september 2026 – är oförändrad; det som förändrades på DevDay är att snabbspåret ovanpå den blev allmänt tillgängligt, och i företagets API-dokumentation står det nu klart och tydligt att Ultrafast ”är brett tillgängligt för GPT-6 Astra, med förhandsåtkomst för GPT-5.6 Sol”. För första gången kan du sätta den här nivån på en budgetpost, och siffran som ska stå där är 60,00 USD per miljon indatatoken och 300,00 USD per miljon utdatatoken, avläst från företagets egen prissida den 30 september 2026.
Det gör detta till en annan fråga än den som lanseringsbevakningen besvarade. Det intressanta den här veckan är inte att nivån finns – förhandsversionen tillkännagavs den 13 augusti 2026 och bevakades till döds. Det intressanta är att en nivå utan pris nu har ett, och aritmetiken som följer av det är inte smickrande på ett specifikt, kvantifierbart sätt. Sex gånger är inte en premie man absorberar med en axelryckning; det är en premie man måste tjäna tillbaka på färre turer, och huruvida man kan det är en egenskap hos ens arbetsbelastning snarare än hos modellen.
De många greppen på varje linje, och det är det första att förstå
När man läser OpenAIs prissida den 30 september 2026 är Ultrafast-kolumnen för GPT-6 Astra en platt 6x av Standard-kolumnen snarare än ett påslag på vissa rader och inte på andra. Det spelar roll, för det innebär att du inte kan optimera dig ur det genom att ändra formen på dina förfrågningar.
• GPT-6 Astra, standardtjänst, förfrågningar på upp till 272 000 indatatoken — 10,00 USD indata, 1,00 USD cachad indata, 12,50 USD cacheskrivningar, 50,00 USD utdata, per 1 miljon token.
• GPT-6 Astra Ultrafast, samma tröskel — $60.00 inmatning, $6.00 cachad inmatning, $75.00 cache-skrivningar, $300.00 utmatning, per 1 miljon tokens. Exakt 6x på alla fyra raderna.
• Vid över 272 000 indatatoken prissätts hela begäran om — Standard går till $20.00 / $2.00 / $25.00 / $75.00, Ultrafast till $120.00 / $12.00 / $150.00 / $450.00. Fortfarande 6x. Regeln för lång kontext som OpenAI dokumenterar för GPT-6 Astra är 2x indata- och cachepriser med 1,5x utdata på hela begäran när du passerar tröskeln, och den gäller på samma sätt för båda nivåerna.
• De andra nivåerna på samma kort – Batch och Flex är 50 % av Standard, och Fast-läget är 2x Standard. Så multiplikatorstrappan för just den här modellen går 0,5x, 1x, 2x, 6x, utan något steg mellan de två sista.
Det finns ingen Ultrafast-motsvarighet till Batch. Batch och Flex är rabatter du köper med lösare schemaläggning på standardbanan; det finns ingen långsam-billig version av snabbanan. Om du vill ha hastigheten betalar du 6x för varje token du skickar och varje token du får tillbaka, och det finns ingen blandning av cachad och färsk indata som förbättrar förhållandet.

Vad ett samtal faktiskt kostar
Abstraktionen blir lättare att resonera kring med två konkreta förfrågningar. Båda använder OpenAI:s publicerade priser per miljon; aritmetiken är vår.
Ett enstaka anrop med 20 000 indatatokens och ett svar på 2 000 tokens debiteras 0,30 $ på Standard — 20 000 tokens à 10 $ per miljon är 0,20 $, plus 2 000 à 50 $ per miljon är 0,10 $. Samma anrop på Ultrafast debiteras 1,80 $. Exakt sex gånger, precis som utlovat.
Nu till det fall som faktiskt beskriver en agentloop: en konversation på 200 000 tokens där 190 000 tokens är ett cachat prefix och endast 10 000 är färska, vilket ger ett steg på 1 000 tokens. Standard debiterar 0,19 $ för den cachade läsningen, 0,10 $ för den färska indatan och 0,05 $ för utdata — 0,34 $ per steg. Ultrafast debiterar 1,14 $, 0,60 $ och 0,30 $ — 2,04 $ per steg. Återigen 6x, men titta på vad mixen gjorde: cachning är den enskilt mest effektiva kostnadshävstången på den här modellen och den är fortfarande exakt 6x billigare på standardbanan, så en kraftigt cachad agent vinner inget proportionellt på den snabba nivån och det mildrar inte heller premien.
Konsekvensen är den del som är värd att internalisera. Eftersom multipeln är konstant handlar break-even inte alls om din tokenmix. Det handlar helt och hållet om antalet turer. Ultrafast betalar sig i en arbetsbelastning bara när körningen minskar antalet fakturerade turer med ungefär en faktor sex – antingen genom att kollapsa en återförsöksloop till ett enda pass, eller genom att ersätta en sekvens av korta förtydligande anrop med en snabbare interaktiv session. Om din arbetsbelastning genererar samma antal turer som tidigare, bara snabbare, köper du latens till exakt 6x och inget annat.
Hastighetsbegränsningar och geografi är de oannonserade taken
Två begränsningar ligger utanför priset och är lätta att missa när du läser en prislista.
Den första är genomströmning. Ultrafast för GPT-6 Astra är tillgängligt för alla API-användare, men inledningsvis med låga hastighetsgränser: OpenAI dokumenterar 500 000 token per minut för nivåerna 1 till 3, 1 000 000 för nivå 4 och 5 000 000 för nivå 5. För en nivå som säljs på snabbhet är det ett verkligt tak – en agentkontext på 200 000 token vid en halv miljon token per minut innebär två och en halv förfrågan per minut på en låg nivå. OpenAIs egen vägledning pekar på samma problem från andra hållet och rekommenderar starkt WebSockets just för att nätverksoverhead per förfrågan kan äta upp den latens som nivån betalar för.
Det andra är dataresidens. Ultrafast stöder endast dataresidens i USA och global bearbetning. Det stöder inte EU eller andra regionala bearbetningsslutpunkter utanför USA. Om din distribution är beroende av en EU-residensslutpunkt för GPT-6 Astra är den här nivån inte tillgänglig för dig till något pris, och det är en hård gräns snarare än ett konfigurationsval. Observera också att residensslutpunkter har ett prispåslag på 10 % för modeller som släpps den 5 mars 2026 eller senare, vilket GPT-6 Astra är.
Hastighetsrubriken sänktes från 14x till 8x
Det här är värt att formulera noggrant, eftersom siffran som cirkulerar i de flesta rapporteringar är inaktuell. OpenAI:s Ultrafast-dokumentationssida, i den version som publiceras i dag, innehåller raden ”vår snabbaste API-tjänstenivå, med upp till 8x snabbare hastigheter än standardläget.” Förhandsmeddelandet den 13 augusti 2026 för GPT-5.6 Sol lovade ”upp till 14x snabbare än standardbearbetning” och upp till 750 utdatatoken per sekund på Cerebras hårdvara.
Det är inte samma påstående, och skillnaden är inte så mycket ett återtagande som ett ämnesbyte. Siffran 14x mättes på GPT-5.6 Sol i en begränsad förhandsvisning; siffran 8x är vad OpenAI publicerar för nivån som den ser ut nu, med GPT-6 Astra som sin allmänt tillgängliga modell. Den som budgeterar efter 14x på Astra budgeterar efter en siffra som OpenAI inte har publicerat för Astra. Den ärliga tolkningen är att båda siffrorna är leverantörsrapporterade tak för utdatagenomströmning, att ingen av dem är en latensgaranti för din arbetsbelastning, och att tiden från början till slut fortfarande inkluderar indatabearbetning, verktygsanrop och din egen orkestrering. Betrakta 8x som planeringssiffran och betrakta allt bättre som en bonus du verifierar på din egen trafik i stället för att anta.
Vad ska man göra med detta på måndag?
Beslutsregeln som följer av aritmetiken är snävare än marknadsföringen antyder, och den är värd att skriva ned innan någon föreslår att aktivera Ultrafast i ett bostadsområde.
Slå på det där arbetsbelastningen är latensbunden och interaktiv, och där en människa väntar. Incidenttriagering, en eskalering i live-support, en forskningsloop där en analytiker itererar under en och samma sittning – det är dessa fall där värdet av att svaret kommer nu i stället för om fyra minuter inte står i proportion till tokenpriset, och där en 6x-räkning för ett litet antal turer är trivialt mindre än kostnaden för personen som väntar. OpenAIs egna exempel i förhandsmeddelandet hade exakt denna form: att läsa loggar medan ett avbrott utvecklas, att korta ned en forskningsloop över natten till ett arbetspass.
Låt den vara avstängd när arbetsbelastningen är genomströmningsbunden eller batchformad. En nattlig återindexering, en massklassificeringskörning, en schemalagd rapport, en återfyllning – ingen av dem bryr sig om wall-clock-latens, alla domineras av antalet tokens, och alla har ett 0,5x-alternativ som finns precis där på samma prislista i Batch och Flex. Att betala 12x batchpriset för att bli klar snabbare är det tydligaste sättet att slösa pengar i den här tabellen.
Det besvärliga mellanläget är den agentiska kodningsloopen, och det är där aritmetiken över antal turer avgör saken. Om hastigheten verkligen tar bort omförsök – om modellens första försök på en ändring som omfattar flera filer lyckas oftare eftersom den inte kämpar mot en timeout – då kan Ultrafast bli billigare per slutförd uppgift trots att den är 6x per token. Det är ett mätbart påstående om dina egna spårningar, inte ett generellt, och mätningen är billig: räkna fakturerade turer per slutförd uppgift på båda nivåerna och multiplicera med taxan. Om förhållandet inte ligger nära sex är den snabba nivån ett latensköp och bör motiveras som ett sådant.
Nivån är prissatt; vägarna runt den är inte samma fråga
En praktisk not om hur du hanterar detta. GPT-6 Astra i standardtjänsten finns live på OrcaRouter som openai/gpt-6-astra till leverantörens eget pris – 10,00 USD in och 50,00 USD ut per miljon tokens, med steget för lång kontext på 272K till 20,00 / 75,00 USD – till 0 % påslag, vilket innebär att leverantörens listpris förs vidare och att varje leverantörsändring hamnar på din faktura samma dag som den hamnar på OpenAIs prislista i stället för vid din nästa avtalsförnyelse. Samma nyckel når fler än 200 modeller, så standardnivån kan ligga bakom samma klient som den billiga nivån eller en konkurrents modell utan en andra integration.
Det vi inte gör är att erbjuda Ultrafast-nivån. Det är en flagga för servicenivå på ett OpenAI-konto snarare än en separat routbar modell – du ställer in service_tier: "ultrafast" i en begäran till gpt-6-astra – och det faktureras av OpenAI på ditt eget konto enligt priserna ovan. Om du aktiverar det ligger det i din direkta OpenAI-integration, och OrcaRouter är rätt plats för den standardnivåtrafik du routar vid sidan av det. Att säga det rakt ut är mer användbart än att antyda en förmåga vi inte har.

Beslutsregeln, i ett stycke
Sex gånger är priset för en nivå, inte priset för en modell: vikterna, kontextfönstret på 1 050 000 token, utdatataket på 128 000 token och svaren är alla identiska med standardversionen av GPT-6 Astra. Det du köper är upp till 8x snabbare utdataflöde, på en prislista som är 6x på varje rad, med låga initiala hastighetsbegränsningar och en USA-residensrestriktion som helt utesluter EU. Den avvägningen är uppenbart rätt för en människa som väntar på ett svar, uppenbart fel för ett schemalagt batchjobb som har en halvprisbana tillgänglig, och genuint oavgjord för agentiska loopar där svaret beror på om hastigheten tar bort turer. Mät antalet turer i dina egna spår innan du binder upp dig, och routa resten till listpris.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
