
GPT-6 Astra Ultrafast läuft auf Blackwell: NVIDIA nennt die Hardware hinter dem 8-fachen
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 223 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Am 1. Oktober 2026 veröffentlichte NVIDIA einen Beitrag von Dion Harris mit dem Titel „Wie NVIDIA-GPUs helfen, OpenAIs GPT-6 Astra Ultrafast zu beschleunigen“, und der zentrale Satz darin ist das erste Mal, dass eines der beiden Unternehmen gesagt hat, worauf die Stufe läuft: „GPT-6 Astra Ultrafast, ausgeführt auf NVIDIA Blackwell GPUs, ist ab sofort in der OpenAI-API und für berechtigte ChatGPT Work- und Codex-Nutzer verfügbar.“ Das ist die Nachricht, und sie ist enger gefasst, als die Schlagzeile nahelegt. GPT-6 Astra, das Modell, wurde am 3. September 2026 veröffentlicht. Die Ultrafast-Service-Stufe dafür wurde am 29. September 2026 allgemein verfügbar. Die Geschwindigkeitsbehauptung – bis zu 8-mal schnellere Token-Generierung als im Astra-Standardmodus – war bereits zwei Tage alt, als NVIDIA sie wiederholte.
Das wirft die Frage auf, die der Beitrag wirklich beantwortet: nicht „wie schnell ist es“, sondern „wessen Silizium ist es“.

Drei Dinge, die der Beitrag tatsächlich hinzugefügt hat
Ohne die Wiederholung trägt der Beitrag vom 1. Oktober drei Fakten bei.
• Die Hardware — Blackwell. OpenAIs eigene Ultrafast-Dokumentation, veröffentlicht am 30. September, beschreibt die Geschwindigkeit der Stufe, ihre Konfiguration und ihre Rate Limits und nennt überhaupt keine GPU. Die Silizium-Zuschreibung stützt sich also auf eine einzige Quelle: den Hardwarehersteller. Das macht sie nicht falsch; es macht sie zu einer Herstelleraussage über die eigene Ausrüstung, und es lohnt sich, sie als solche zu kennzeichnen.
• Zwei namentlich genannte Ingenieure — Philippe Tillet, OpenAIs Leiter des Bereichs Inferenz, und Uday Ruddarraju, OpenAIs Chief Technology Officer für Compute, beide mit namentlicher Zitierung dazu, woher die Beschleunigung kam.
• Das Publikum — „berechtigte ChatGPT Work- und Codex-Nutzer“, was weiter gefasst ist als die reine API-Ausrichtung, mit der die Stufe an den Start ging. OpenAIs eigene Dokumentation besagt weiterhin, dass Ultrafast für GPT-6 Astra „allen API-Nutzern mit niedrigen Ratenlimits zur Verfügung steht“, und dieser Vorbehalt der niedrigen Limits wurde nicht offiziell zurückgenommen.
Die beiden Zitate und warum sie der interessante Teil sind
Tillets Beitrag ist eine Schleife und kein Benchmark. NVIDIAs Investitionen in Tooling und Dokumentation, sagt er, „haben es uns ermöglicht, unsere Modelle außergewöhnlich gut im Programmieren zu machen“, und Astra kann dann „dieses Wissen in Hochleistungs-Kernels umwandeln, die NVIDIA-Hardware überzeugend machen“. Ruddarraju äußert sich unverblümter über die Richtung der Arbeit: „Wir haben unsere internen Modelle genutzt, um die Inferenz auf NVIDIA-GPUs zu optimieren.“
Zusammengenommen ist das eine Aussage über Deployment statt über Fähigkeit: OpenAIs Frontier-Modelle sind inzwischen gut genug im Schreiben von GPU-Kernels, dass OpenAI sie verwendet, um seinen eigenen Serving-Stack zu optimieren. Es steht auch im Einklang mit dem einen Abschnitt in NVIDIAs Beitrag, der überhaupt nicht von der Launch-Woche handelt – eine Überschrift mit dem Wortlaut „Continually Improving Performance“, die argumentiert, dass eingesetzte Inferenz mit der Zeit schneller wird, weil OpenAI immer wieder seine eigenen Modelle auf die NVIDIA-Software richtet, auf der sie läuft.
Nichts davon ist eine Messung. Es sind zwei Ingenieure, die einen Prozess beschreiben – veröffentlicht von dem Unternehmen, das die GPUs verkauft hat. Die ehrliche Lesart ist, dass der Prozess plausibel, leicht zu glauben und von außen nicht falsifizierbar ist – was auch für jede Geschwindigkeitsangabe in dieser Geschichte gilt.
Blackwell hier, Cerebras dort
Das Nützlichste, was dieser Beitrag leistet, ist, eine Kluft offenzulegen, die niemand erklärt hat. Am 13. August 2026 stellte OpenAI eine schnelle Stufe über einem anderen Modell vor – GPT-5.6 Sol, das „bis zu 14ד schneller läuft – und nannte Cerebras als den Partner dahinter und beschrieb Wafer-Scale-Hardware, die bis zu 750 Ausgabe-Tokens pro Sekunde generiert. Sieben Wochen später läuft die schnelle Stufe über Astra auf Blackwell, und die Zahl ist 8x.
Zwei schnelle Stufen, zwei Hardware-Antworten, eine davon ist ein spezialisierter Partner und die andere der größte Lieferant des Unternehmens selbst. Keiner der beiden Anbieter hat einen Vergleich zwischen den beiden Serving-Pfaden veröffentlicht, und kein unabhängiger Evaluator hat einen der beiden gemessen. Beachten Sie außerdem, was NVIDIAs Beitrag mit dem zweiten Namen macht: „Rubin“ erscheint einmal, in Tillets Zitat über Modelle, die Kernel für „Blackwell- und Rubin-GPUs“ schreiben. Es ist eine Aussage darüber, was die Modelle von OpenAI programmieren können, keine Aussage darüber, dass heute irgendetwas auf Rubin bereitgestellt wird.
Die Zahl, die NVIDIA nicht veröffentlicht hat
Es gibt in dieser Geschichte eine Zahl, die keines der beiden Unternehmen neben die 8x gesetzt hat, und sie ist diejenige, die darüber entscheidet, ob ein Team die Stufe einschaltet. Die von OpenAI veröffentlichte Ultrafast-Preisliste führt gpt-6-astra zu 60,00 $ pro Million Eingabe-Token, 6,00 $ für gecachte Eingabe, 75,00 $ für Cache-Schreiben und 300,00 $ für Ausgabe auf. Dasselbe Modell kostet in der Standardstufe 10,00 $ und 50,00 $, mit 1,00 $ für gecachte Eingabe und 12,50 $ für Cache-Schreiben. Jede Spalte ist genau das Sechsfache des Standardtarifs.
• Der Multiplikator — 6,00x bei Eingabe, Ausgabe, zwischengespeicherter Eingabe und Cache-Schreibvorgang. Nicht „bis zu“. Sechs.
• Die Obergrenze — 8x, der Wert, den beide Anbieter mit angehängtem „bis zu“ und ohne genannte Bedingungen nennen.
• Was das bedeutet — das Preisvielfache liegt unter dem vom Tarif selbst behaupteten Bestfall. Am oberen Ende ist der Tausch günstig; bei allem unter 6x auf Ihrem Traffic zahlen Sie mehr pro eingesparter Zeiteinheit, als das Marketing suggeriert. Deshalb ist der einzige aussagekräftige Test für diesen Tarif eine Messung an Ihren eigenen Anfragen.
• Die Langkontext-Stufe — oberhalb von 272.000 Eingabe-Tokens liegen die Ultrafast-Tarife bei 120,00 $ für die Eingabe und 450,00 $ für die Ausgabe, das Sechsfache der eigenen gestaffelten Tarife der Standardstufe.
• Das operative Kleingedruckte — OpenAI dokumentiert eine Ultrafast-Tokens-pro-Minute-Staffel von 500.000 für Nutzungsstufen 1 bis 3, 1.000.000 für Stufe 4 und 5.000.000 für Stufe 5; Ultrafast unterstützt nur US-Datenresidenz und globale Verarbeitung, ohne EU- oder anderen regionalen Verarbeitungsendpunkt außerhalb der USA; und die Dokumentation empfiehlt WebSockets für Ultrafast „insbesondere für agentische Anwendungen, die viele Tool-Aufrufe in schneller Folge ausführen“, mit der Warnung, dass „ohne eine persistente Verbindung Netzwerk-Overhead die Latenzgewinne verringern kann“.

Der letzte Punkt ist der, bei dem gehandelt werden muss. Ein Team, das die Tarifstufe aktiviert und darunter HTTP pro Anfrage belässt, hat das Sechsfache des Tarifs gezahlt, um einen Teil des Geschwindigkeitsgewinns wieder an den Verbindungsaufbau zurückzugeben – eine dokumentierte, vermeidbare Art, das Geld zu verschwenden.
Wie das aus Sicht eines einzelnen Endpunkts aussieht
GPT-6 Astra ist auf OrcaRouter als openai/gpt-6-astra: ein Kontextfenster von 1.050.000 Tokens, bis zu 128.000 Ausgabe-Tokens, Text-, Bild- und Dateieingaben, und OpenAIs Listenpreis wird direkt durchgereicht bei 10,00 $ Eingabe und 50,00 $ Ausgabe pro Million Tokens, steigend auf 20,00 $ und 75,00 $ oberhalb von 272.000 Eingabe-Tokens. Der hervorgehobene Benchmark-Wert im Katalog liegt bei 96,1 auf GPQA Diamond.
Die Ultrafast-Stufe ist nicht auf OrcaRouter verfügbar, und das kann sie auch nicht sein: Sie ist ein zugriffskontrolliertes Attribut eines OpenAI-Kontos und keine Modell-ID, weshalb openai/gpt-6-astra-ultrafast model-not-found zurückgibt. Wenn Sie die Stufe aktivieren, befindet sie sich in Ihrer direkten OpenAI-Integration. Was ein Endpunkt für über 200 Modelle mit 0 % Aufschlag Ihnen in dieser Situation bietet, ist nicht die Überholspur – es ist die Kontrolle. Da der Listenpreis des Anbieters durchgereicht und nicht mit einem Aufschlag versehen wird, kommt eine OpenAI-Preisänderung am selben Tag bei uns an, an dem sie bei ihnen ankommt, und weil die Standard-Astra-Lane bereits vorhanden ist, ist das Experiment, das diese Entscheidung klärt, eine Zeile Konfiguration: derselbe Prompt, die Standard-Stufe und daneben ein günstigeres Modell, auf demselben Schlüssel. Das ist das, was einem Latenz-Benchmark am nächsten kommt, den die meisten Teams jemals durchführen werden, und die Einrichtung kostet nichts.

Was wurde noch nicht gemessen?
Drei Dinge lassen sich heute überprüfen. Die Tarifstufe existiert, sie steht auf der Preisliste zu genau dem Sechsfachen des Standardtarifs, und seit dem 1. Oktober wird sie öffentlich NVIDIA Blackwell GPUs zugeschrieben.
Eines ist es nicht: der Multiplikator auf Ihren Traffic. Kein Anbieter hat eine Latenzverteilung für die Stufe bei einem angegebenen Nebenläufigkeitsgrad veröffentlicht, und kein Dritter hat die 8x reproduziert. Es gibt auch keinen Benchmark, der Astra auf Ultrafast mit Astra im Standard vergleicht, und es sollte keinen schmeichelhaften geben – es ist derselbe Checkpoint auf einem schnelleren Pfad, also sollten identische Einstellungen bei unterschiedlichen Geschwindigkeiten identische Antworten liefern. Wenn Ihre beiden Spuren bei denselben Prompts divergieren, haben Sie einen Bugreport, kein Feature.
Die brauchbare Zusammenfassung des 1. Oktober ist also kleiner, als die Ankündigung sich liest. Es ist dieselbe Stufe zum selben Preis mit derselben unbestätigten Geschwindigkeitsobergrenze, trägt jetzt aber ein Hardware-Label. Dieses Label ist wichtig – es verrät dir, auf welcher Beschleunigerlinie OpenAI das hier skaliert, und es verrät dir, dass die Story zur schnellen Stufe in weniger als zwei Monaten von einem spezialisierten Partner zum größten GPU-Anbieter der Branche gewandert ist. Es verrät dir nur nichts über dein eigenes Latenzbudget, und kein Beitrag wird das tun.
