
GPT-6 Astra Ultrafast körs på Blackwell: NVIDIA namnger hårdvaran bakom 8
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Den 1 oktober 2026 publicerade NVIDIA ett inlägg av Dion Harris med titeln "Hur NVIDIA GPU:er hjälper till att accelerera OpenAI:s GPT-6 Astra Ultrafast", och meningen i centrum av inlägget är första gången något av företagen har sagt vad nivån körs på: "GPT-6 Astra Ultrafast, som körs på NVIDIA Blackwell GPU:er, är nu tillgänglig i OpenAI API och för kvalificerade användare av ChatGPT Work och Codex." Det är nyheten, och den är snävare än rubriken antyder. GPT-6 Astra, modellen, släpptes den 3 september 2026. Tjänstenivån Ultrafast ovanpå den blev allmänt tillgänglig den 29 september 2026. Hastighetspåståendet – upp till 8x snabbare tokengenerering än Astras standardläge – var redan två dagar gammalt när NVIDIA upprepade det.
Vilket väcker frågan som inlägget egentligen besvarar: inte ”hur snabb är den” utan ”vems kisel är det”.

Tre saker som inlägget faktiskt tillförde
Om man rensar bort upprepningen bidrar inlägget den 1 oktober med tre fakta.
• Hårdvaran – Blackwell. OpenAIs egen dokumentation för Ultrafast, publicerad den 30 september, beskriver nivåns hastighet, dess konfiguration och dess hastighetsbegränsningar, och nämner inte en enda GPU. Uppgiften om kretsen har alltså en enda källa: hårdvaruleverantören. Det gör den inte falsk; det gör den till en leverantörs påstående om sin egen utrustning, och värd att märkas som ett sådant.
• Två namngivna ingenjörer — Philippe Tillet, OpenAI:s inferenschef, och Uday Ruddarraju, OpenAI:s teknikchef för compute, båda citerade öppet om varifrån accelerationen kom.
• Målgruppen — "behöriga ChatGPT Work- och Codex-användare", vilket är bredare än den API-only-ram som nivån lanserades med. OpenAIs egen dokumentation säger fortfarande att Ultrafast för GPT-6 Astra är "tillgängligt för alla API-användare med låga rate limits", och det förbehållet om låga gränser har inte officiellt tagits bort.
De två citaten, och varför de är det intressanta
Tillets bidrag är en loop snarare än ett benchmark. NVIDIAs satsning på verktyg och dokumentation, säger han, ”har gjort det möjligt för oss att göra våra modeller exceptionellt bra på programmering”, och Astra kan sedan ”omvandla den kunskapen till högpresterande kärnor som gör NVIDIAs hårdvara attraktiv”. Ruddarraju är mer rakt på sak om arbetets inriktning: ”Vi använde våra interna modeller för att optimera inferens på NVIDIA-GPU:er.”
Läst tillsammans är detta ett påstående om driftsättning snarare än förmåga: OpenAIs frontlinjemodeller är nu tillräckligt bra på att skriva GPU-kärnor för att OpenAI använder dem för att optimera sin egen serveringsstack. Det stämmer också överens med det enda avsnittet i NVIDIAs inlägg som inte alls handlar om lanseringsveckan – en rubrik som lyder "Continually Improving Performance", som argumenterar för att driftsatt inferens blir snabbare med tiden eftersom OpenAI fortsätter att rikta sina egna modeller mot den NVIDIA-programvara som den körs på.
Inget av detta är en mätning. Det är två ingenjörer som beskriver en process, publicerad av företaget som sålde GPU:erna. Den ärliga läsningen är att processen är rimlig, billig att tro på och omöjlig att falsifiera utifrån – vilket också gäller varje hastighetssiffra i den här historien.
Blackwell här, Cerebras där
Det mest användbara som det här inlägget gör är att blottlägga en splittring som ingen har förklarat. Den 13 augusti 2026 förhandsvisade OpenAI en snabb nivå ovanpå en annan modell – GPT-5.6 Sol som är ”upp till 14×” snabbare – och utsåg Cerebras till partnern bakom den, och beskrev wafer-scale-hårdvara som genererar upp till 750 utdatatokens per sekund. Sju veckor senare körs den snabba nivån ovanpå Astra på Blackwell, och siffran är 8x.
Två snabba nivåer, två hårdvarusvar, det ena en specialiserad partner och det andra företagets egen största leverantör. Ingen av leverantörerna har publicerat en jämförelse mellan de två serveringsvägarna, och ingen oberoende utvärderare har mätt någon av dem. Notera också vad NVIDIAs inlägg gör med det andra namnet: "Rubin" förekommer en gång, inne i Tillets citat om modeller som skriver kärnor för "Blackwell- och Rubin-GPU:er". Det är ett påstående om vad OpenAIs modeller kan programmera, inte ett påstående om att något serveras på Rubin i dag.
Numret som NVIDIA inte skrev ut
Det finns en siffra i den här berättelsen som inget av företagen har satt bredvid 8x, och det är den som avgör om ett team slår på nivån. OpenAI:s publicerade Ultrafast-prislista listar gpt-6-astra till $60.00 per miljon indatatoken, $6.00 för cachad indata, $75.00 för cacheskrivning och $300.00 för utdata. Samma modell på standardnivån kostar $10.00 och $50.00, med cachad indata på $1.00 och cacheskrivning på $12.50. Varje kolumn är exakt sex gånger standardpriset.
• Multipeln — 6,00x för inmatning, utmatning, cachad inmatning och cacheskrivning. Inte "upp till". Sex.
• Taket — 8x, siffran som båda leverantörerna anger med "upp till" kopplat och inga angivna villkor.
• Vad det betyder — prismultipeln ligger under nivåns eget påstådda bästa fall. I taket är affären fördelaktig; vid allt under 6x på din trafik betalar du mer per sparad tidsenhet än marknadsföringen antyder. Vilket är anledningen till att det enda meningsfulla testet av den här nivån är en mätning på dina egna förfrågningar.
• Långkontextsteget – över 272 000 indatatoken blir Ultrafast-priserna $120.00 för indata och $450.00 för utdata, sex gånger standardnivåns egna stegvisa priser.
• Det operativa finstilta — OpenAI dokumenterar en Ultrafast-trappa för tokens per minut på 500 000 för användningsnivåerna 1 till 3, 1 000 000 för nivå 4 och 5 000 000 för nivå 5; Ultrafast stöder endast dataresidens i USA och global bearbetning, utan någon regional bearbetningsslutpunkt i EU eller i någon annan icke-amerikansk region; och dokumentationen rekommenderar WebSockets för Ultrafast "särskilt för agentiska applikationer som gör många verktygsanrop i snabb följd" och varnar för att "utan en beständig anslutning kan nätverksoverhead minska latensvinsterna."

Den sista punkten är den man bör agera på. Ett team som aktiverar nivån och låter HTTP per begäran ligga kvar under den har betalat sex gånger taxan för att lämna tillbaka en del av snabbhetsvinsten till anslutningsetableringen – ett dokumenterat, undvikbart sätt att slösa bort pengarna.
Hur det här ser ut från en enda slutpunkt
GPT-6 Astra finns på OrcaRouter som openai/gpt-6-astra: ett kontextfönster på 1 050 000 tokens, upp till 128 000 utdatatokens, text-, bild- och filindata, och OpenAIs listpris som förs vidare direkt till $10,00 för indata och $50,00 för utdata per miljon tokens, som stiger till $20,00 och $75,00 över 272 000 indatatokens. Dess främsta riktmärke i katalogen är 96,1 på GPQA Diamond.
Ultrafast-nivån finns inte på OrcaRouter, och det kan den inte göra: det är ett åtkomstkontrollerat attribut för ett OpenAI-konto snarare än ett modell-id, vilket är anledningen till att openai/gpt-6-astra-ultrafast returnerar model-not-found. Om du aktiverar nivån finns den i din direkta OpenAI-integration. Vad en endpoint med över 200 modeller med 0 % påslag ger dig i den här situationen är inte den snabba vägen — det är kontrollen. Eftersom leverantörens listpris förs vidare snarare än att läggas på, landar en OpenAI-prisändring på vår sida samma dag som den landar på deras, och eftersom standard Astra-kanalen redan finns där, är experimentet som avgör detta beslut en rad konfiguration: samma prompt, standardnivå, och en billigare modell bredvid den, på samma nyckel. Det är det närmaste ett latensbenchmark de flesta team någonsin kommer att köra, och det kostar ingenting att sätta upp.

Vad har fortfarande inte mätts?
Tre saker går att kontrollera i dag. Nivån finns, den står på prislistan till exakt sex gånger standardpriset, och sedan den 1 oktober tillskrivs den offentligt NVIDIA Blackwell GPU:er.
En sak är inte: multiplikatorn för din trafik. Ingen leverantör har publicerat en latensfördelning för nivån vid en angiven samtidighetsnivå, och ingen tredje part har återskapat 8x. Det finns inte heller något benchmark som jämför Astra på Ultrafast med Astra på standard, och det bör inte finnas något smickrande sådant — det är samma checkpoint på en snabbare väg, så identiska inställningar bör ge identiska svar vid olika hastigheter. Om dina två spår divergerar vid samma prompter har du en buggrapport, inte en funktion.
Så den användbara sammanfattningen av den 1 oktober är mindre än vad tillkännagivandet ger sken av. Det är samma nivå till samma pris med samma overifierade hastighetstak, men bär nu en hårdvaruetikett. Den etiketten spelar roll – den berättar vilken acceleratorserie OpenAI skalar detta på, och den berättar att fast-tier-berättelsen har flyttat från en specialistpartner till branschens största GPU-leverantör på mindre än två månader. Det säger bara ingenting om din egen latensbudget, och inget inlägg kommer att göra det.
