Ett genererat titelkort med rubriken "GPT-6 Astra Ultrafast körs på Blackwell", underrubriken "NVIDIA namnger hårdvaran bakom 8x", och tre kort med texten "Hårdvara: Blackwell-GPU:er", "Prisfaktor: 6,00x standardpris" och "Hävdad hastighet: upp till 8x", med en sidfot som lyder "NVIDIA-inlägg, 1 oktober 2026 – leverantörsrapporterade siffror".
Guides & Insights

GPT-6 Astra Ultrafast körs på Blackwell: NVIDIA namnger hårdvaran bakom 8

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 1 oktober 2026 publicerade NVIDIA ett inlägg av Dion Harris med titeln "Hur NVIDIA GPU:er hjälper till att accelerera Open​AI:s GPT-6 Astra Ultrafast", och meningen i centrum av inlägget är första gången något av företagen har sagt vad nivån körs på: "GPT-6 Astra Ultrafast, som körs på NVIDIA Blackwell GPU:er, är nu tillgänglig i Open​AI API och för kvalificerade användare av ChatGPT Work och Codex." Det är nyheten, och den är snävare än rubriken antyder. GPT-6 Astra, modellen, släpptes den 3 september 2026. Tjänstenivån Ultrafast ovanpå den blev allmänt tillgänglig den 29 september 2026. Hastighetspåståendet – upp till 8x snabbare tokengenerering än Astras standardläge – var redan två dagar gammalt när NVIDIA upprepade det.

Vilket väcker frågan som inlägget egentligen besvarar: inte ”hur snabb är den” utan ”vems kisel är det”.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the note that Ultrafast for GPT-6 Astra is currently available to all API users at low rate limits with higher limits or Sol preview access requestable through an OpenAI account team, the recommendation to use WebSockets because without a persistent connection network overhead can reduce the latency gains, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Tre saker som inlägget faktiskt tillförde

Om man rensar bort upprepningen bidrar inlägget den 1 oktober med tre fakta.

• Hårdvaran – Blackwell. OpenAIs egen dokumentation för Ultrafast, publicerad den 30 september, beskriver nivåns hastighet, dess konfiguration och dess hastighetsbegränsningar, och nämner inte en enda GPU. Uppgiften om kretsen har alltså en enda källa: hårdvaruleverantören. Det gör den inte falsk; det gör den till en leverantörs påstående om sin egen utrustning, och värd att märkas som ett sådant.

• Två namngivna ingenjörer — Philippe Tillet, OpenAI:s inferenschef, och Uday Ruddarraju, OpenAI:s teknikchef för compute, båda citerade öppet om varifrån accelerationen kom.

• Målgruppen — "behöriga ChatGPT Work- och Codex-användare", vilket är bredare än den API-only-ram som nivån lanserades med. OpenAIs egen dokumentation säger fortfarande att Ultrafast för GPT-6 Astra är "tillgängligt för alla API-användare med låga rate limits", och det förbehållet om låga gränser har inte officiellt tagits bort.

De två citaten, och varför de är det intressanta

Tillets bidrag är en loop snarare än ett benchmark. NVIDIAs satsning på verktyg och dokumentation, säger han, ”har gjort det möjligt för oss att göra våra modeller exceptionellt bra på programmering”, och Astra kan sedan ”omvandla den kunskapen till högpresterande kärnor som gör NVIDIAs hårdvara attraktiv”. Ruddarraju är mer rakt på sak om arbetets inriktning: ”Vi använde våra interna modeller för att optimera inferens på NVIDIA-GPU:er.”

Läst tillsammans är detta ett påstående om driftsättning snarare än förmåga: OpenAIs frontlinjemodeller är nu tillräckligt bra på att skriva GPU-kärnor för att OpenAI använder dem för att optimera sin egen serveringsstack. Det stämmer också överens med det enda avsnittet i NVIDIAs inlägg som inte alls handlar om lanseringsveckan – en rubrik som lyder "Continually Improving Performance", som argumenterar för att driftsatt inferens blir snabbare med tiden eftersom OpenAI fortsätter att rikta sina egna modeller mot den NVIDIA-programvara som den körs på.

Inget av detta är en mätning. Det är två ingenjörer som beskriver en process, publicerad av företaget som sålde GPU:erna. Den ärliga läsningen är att processen är rimlig, billig att tro på och omöjlig att falsifiera utifrån – vilket också gäller varje hastighetssiffra i den här historien.

Blackwell här, Cerebras där

Det mest användbara som det här inlägget gör är att blottlägga en splittring som ingen har förklarat. Den 13 augusti 2026 förhandsvisade OpenAI en snabb nivå ovanpå en annan modell – GPT-5.6 Sol som är ”upp till 14×” snabbare – och utsåg Cerebras till partnern bakom den, och beskrev wafer-scale-hårdvara som genererar upp till 750 utdatatokens per sekund. Sju veckor senare körs den snabba nivån ovanpå Astra på Blackwell, och siffran är 8x.

Två snabba nivåer, två hårdvarusvar, det ena en specialiserad partner och det andra företagets egen största leverantör. Ingen av leverantörerna har publicerat en jämförelse mellan de två serveringsvägarna, och ingen oberoende utvärderare har mätt någon av dem. Notera också vad NVIDIAs inlägg gör med det andra namnet: "Rubin" förekommer en gång, inne i Tillets citat om modeller som skriver kärnor för "Blackwell- och Rubin-GPU:er". Det är ett påstående om vad OpenAIs modeller kan programmera, inte ett påstående om att något serveras på Rubin i dag.

Numret som NVIDIA inte skrev ut

Det finns en siffra i den här berättelsen som inget av företagen har satt bredvid 8x, och det är den som avgör om ett team slår på nivån. OpenAI:s publicerade Ultrafast-prislista listar gpt-6-astra till $60.00 per miljon indatatoken, $6.00 för cachad indata, $75.00 för cacheskrivning och $300.00 för utdata. Samma modell på standardnivån kostar $10.00 och $50.00, med cachad indata på $1.00 och cacheskrivning på $12.50. Varje kolumn är exakt sex gånger standardpriset.

• Multipeln — 6,00x för inmatning, utmatning, cachad inmatning och cacheskrivning. Inte "upp till". Sex.

• Taket — 8x, siffran som båda leverantörerna anger med "upp till" kopplat och inga angivna villkor.

• Vad det betyder — prismultipeln ligger under nivåns eget påstådda bästa fall. I taket är affären fördelaktig; vid allt under 6x på din trafik betalar du mer per sparad tidsenhet än marknadsföringen antyder. Vilket är anledningen till att det enda meningsfulla testet av den här nivån är en mätning på dina egna förfrågningar.

• Långkontextsteget – över 272 000 indatatoken blir Ultrafast-priserna $120.00 för indata och $450.00 för utdata, sex gånger standardnivåns egna stegvisa priser.

• Det operativa finstilta — OpenAI dokumenterar en Ultrafast-trappa för tokens per minut på 500 000 för användningsnivåerna 1 till 3, 1 000 000 för nivå 4 och 5 000 000 för nivå 5; Ultrafast stöder endast dataresidens i USA och global bearbetning, utan någon regional bearbetningsslutpunkt i EU eller i någon annan icke-amerikansk region; och dokumentationen rekommenderar WebSockets för Ultrafast "särskilt för agentiska applikationer som gör många verktygsanrop i snabb följd" och varnar för att "utan en beständig anslutning kan nätverksoverhead minska latensvinsterna."

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing the gpt-6-astra row at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that regional processing endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Den sista punkten är den man bör agera på. Ett team som aktiverar nivån och låter HTTP per begäran ligga kvar under den har betalat sex gånger taxan för att lämna tillbaka en del av snabbhetsvinsten till anslutningsetableringen – ett dokumenterat, undvikbart sätt att slösa bort pengarna.

Hur det här ser ut från en enda slutpunkt

GPT-6 Astra finns på OrcaRouter som openai/gpt-6-astra: ett kontextfönster på 1 050 000 tokens, upp till 128 000 utdatatokens, text-, bild- och filindata, och OpenAIs listpris som förs vidare direkt till $10,00 för indata och $50,00 för utdata per miljon tokens, som stiger till $20,00 och $75,00 över 272 000 indatatokens. Dess främsta riktmärke i katalogen är 96,1 på GPQA Diamond.

Ultrafast-nivån finns inte på OrcaRouter, och det kan den inte göra: det är ett åtkomstkontrollerat attribut för ett OpenAI-konto snarare än ett modell-id, vilket är anledningen till att openai/gpt-6-astra-ultrafast returnerar model-not-found. Om du aktiverar nivån finns den i din direkta OpenAI-integration. Vad en endpoint med över 200 modeller med 0 % påslag ger dig i den här situationen är inte den snabba vägen — det är kontrollen. Eftersom leverantörens listpris förs vidare snarare än att läggas på, landar en OpenAI-prisändring på vår sida samma dag som den landar på deras, och eftersom standard Astra-kanalen redan finns där, är experimentet som avgör detta beslut en rad konfiguration: samma prompt, standardnivå, och en billigare modell bredvid den, på samma nyckel. Det är det närmaste ett latensbenchmark de flesta team någonsin kommer att köra, och det kostar ingenting att sätta upp.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1,050,000-token context window, 128k maximum output, text, image and file input, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure and 155.1M tokens of traffic, with an OpenAI-compatible Python code sample and the EN language toggle in the header.

Vad har fortfarande inte mätts?

Tre saker går att kontrollera i dag. Nivån finns, den står på prislistan till exakt sex gånger standardpriset, och sedan den 1 oktober tillskrivs den offentligt NVIDIA Blackwell GPU:er.

En sak är inte: multiplikatorn för din trafik. Ingen leverantör har publicerat en latensfördelning för nivån vid en angiven samtidighetsnivå, och ingen tredje part har återskapat 8x. Det finns inte heller något benchmark som jämför Astra på Ultrafast med Astra på standard, och det bör inte finnas något smickrande sådant — det är samma checkpoint på en snabbare väg, så identiska inställningar bör ge identiska svar vid olika hastigheter. Om dina två spår divergerar vid samma prompter har du en buggrapport, inte en funktion.

Så den användbara sammanfattningen av den 1 oktober är mindre än vad tillkännagivandet ger sken av. Det är samma nivå till samma pris med samma overifierade hastighetstak, men bär nu en hårdvaruetikett. Den etiketten spelar roll – den berättar vilken acceleratorserie OpenAI skalar detta på, och den berättar att fast-tier-berättelsen har flyttat från en specialistpartner till branschens största GPU-leverantör på mindre än två månader. Det säger bara ingenting om din egen latensbudget, och inget inlägg kommer att göra det.