Eine generierte Titelkarte für die Ultrafast-Stufe mit der Überschrift 'GPT-6 Astra Ultrafast', dem Untertitel 'Sechsmal die Rate, in jeder Zeile' und zwei Badges mit der Aufschrift 'kostenpflichtig und allgemein verfügbar' und 'Die Überholspur ist kein zweites Modell'.
Guides & Insights

GPT-6 Astra Ultrafast mit 6x: Was Sie die veröffentlichte Preisliste wirklich kostet

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

GPT-6 Astra Ultrafast ist seit dem 29. September 2026 keine Warteliste mehr. Es ist jetzt eine käufliche Service-Stufe mit einem veröffentlichten Preis, und dieser Preis beträgt genau das Sechsfache des Standardpreises in jeder einzelnen Zeile. Das darunterliegende Modell – GPT-6 Astra, das Flaggschiff des Unternehmens, veröffentlicht am 3. September 2026 – ist unverändert; was sich beim DevDay geändert hat, ist, dass die Schnellspur darüber allgemein verfügbar wurde, und die API-Dokumentation des Unternehmens besagt nun klar, dass Ultrafast „breit verfügbar für GPT-6 Astra ist, mit Vorschauzugang für GPT-5.6 Sol.“ Zum ersten Mal können Sie diese Stufe in eine Budgetzeile aufnehmen, und die Zahl, die dort einzutragen ist, lautet 60,00 $ pro Million Eingabe-Tokens und 300,00 $ pro Million Ausgabe-Tokens, abgelesen von der eigenen Preisseite des Unternehmens am 30. September 2026.

Das macht dies zu einer anderen Frage als derjenigen, die die Launch-Berichterstattung beantwortet hat. Die interessante Tatsache diese Woche ist nicht, dass die Stufe existiert — die Preview wurde am 13. August 2026 angekündigt und totdiskutiert. Die interessante Tatsache ist, dass eine Stufe ohne Preis jetzt einen hat, und die Arithmetik, die daraus folgt, ist auf eine spezifische, quantifizierbare Weise unvorteilhaft. Sechsmal ist kein Aufpreis, den man mit einem Schulterzucken hinnimmt; es ist ein Aufpreis, den man in weniger Zügen zurückverdienen muss, und ob man das kann, ist eine Eigenschaft der eigenen Arbeitslast und nicht des Modells.

Die mehrfachen Halte auf jeder Linie, und das ist das Erste, was man verstehen muss.

Wenn du am 30. September 2026 OpenAIs Preisseite liest, ist die Ultrafast-Spalte für GPT-6 Astra pauschal das 6-Fache der Standard-Spalte – statt eines Aufschlags bei manchen Zeilen und bei anderen nicht. Das ist wichtig, denn es bedeutet, dass du dich nicht durch eine Änderung der Form deiner Anfragen herausoptimieren kannst.

• GPT-6 Astra, Standard-Service, Anfragen mit bis zu 272.000 Eingabe-Tokens — 10,00 $ Eingabe, 1,00 $ zwischengespeicherte Eingabe, 12,50 $ Cache-Schreibvorgänge, 50,00 $ Ausgabe, pro 1 Mio. Tokens.

• GPT-6 Astra Ultrafast, gleiche Schwelle — 60,00 $ Eingabe, 6,00 $ zwischengespeicherte Eingabe, 75,00 $ Cache-Schreibvorgänge, 300,00 $ Ausgabe, pro 1 Mio. Token. Genau 6x bei allen vier Zeilen.

• Oberhalb von 272.000 Input-Tokens wird die gesamte Anfrage neu bepreist — Standard wechselt zu $20.00 / $2.00 / $25.00 / $75.00, Ultrafast zu $120.00 / $12.00 / $150.00 / $450.00. Weiterhin 6x. Die Long-Context-Regel, die OpenAI für GPT-6 Astra dokumentiert, sieht 2x Input- und Cache-Raten bei 1,5x Output auf die gesamte Anfrage vor, sobald man die Schwelle überschreitet, und sie gilt identisch für beide Tarife.

• Die anderen Stufen auf derselben Karte — Batch und Flex liegen bei 50 % von Standard, und der Fast-Modus ist 2x Standard. Die Multiplikator-Leiter für dieses eine Modell verläuft also 0,5x, 1x, 2x, 6x, ohne eine Sprosse zwischen den letzten beiden.

Es gibt kein Ultrafast-Äquivalent zu Batch. Batch und Flex sind Rabatte, die man mit lockererer Zeitplanung auf der Standard-Spur erkauft; es gibt keine langsam-günstige Version der schnellen Spur. Wenn man die Geschwindigkeit will, zahlt man das 6-Fache für jedes Token, das man sendet, und jedes Token, das man zurückbekommt, und es gibt keine Mischung aus gecachtem und frischem Input, die das Verhältnis verbessert.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Was ein Anruf tatsächlich kostet

Die Abstraktion lässt sich mit zwei konkreten Anfragen leichter nachvollziehen. Beide nutzen OpenAIs veröffentlichte Preise pro Million; die Rechnung stammt von uns.

Ein Single-Shot-Aufruf mit 20.000 Eingabe-Tokens und einer 2.000-Token-Antwort wird im Standard-Tarif mit 0,30 $ abgerechnet – 20.000 Tokens zu 10 $ pro Million sind 0,20 $, plus 2.000 zu 50 $ pro Million sind 0,10 $. Derselbe Aufruf wird mit Ultrafast mit 1,80 $ abgerechnet. Genau sechsmal so viel, wie beworben.

Nun der Fall, der tatsächlich eine Agent-Schleife beschreibt: eine Konversation mit 200.000 Tokens, bei der 190.000 Tokens ein gecachtes Präfix sind und nur 10.000 frisch sind, was einen Schritt mit 1.000 Tokens erzeugt. Standard berechnet $0,19 für den Cache-Lesevorgang, $0,10 für die frischen Eingaben und $0,05 für die Ausgabe — $0,34 pro Schritt. Ultrafast berechnet $1,14, $0,60 und $0,30 — $2,04 pro Schritt. Wieder 6x, aber schauen Sie, was die Mischung bewirkt hat: Caching ist der mit Abstand wirksamste Kostenhebel bei diesem Modell, und es ist auf der Standard-Lane immer noch genau 6x günstiger, sodass ein stark cachender Agent proportional nichts von der schnellen Stufe profitiert und auch der Aufpreis nicht gemildert wird.

Die Konsequenz ist der Teil, den es sich zu verinnerlichen lohnt. Weil der Multiplikator konstant ist, geht es beim Break-even überhaupt nicht um deinen Token-Mix. Es geht ausschließlich um die Anzahl der Turns. Ultrafast amortisiert sich in einer Workload nur dann, wenn die Ausführung die Anzahl der abgerechneten Turns um etwa den Faktor sechs senkt – entweder indem eine Retry-Schleife zu einem einzigen Durchlauf zusammengefasst wird oder indem eine Abfolge kurzer Klärungsaufrufe durch eine einzige schnellere interaktive Sitzung ersetzt wird. Wenn deine Workload dieselbe Anzahl an Turns auslöst wie zuvor, nur eben früher, kaufst du Latenz für genau das 6-Fache und sonst nichts.

Rate Limits und Geografie sind die unausgesprochenen Obergrenzen

Zwei Einschränkungen stehen außerhalb des Preises und werden leicht übersehen, wenn man eine Preisliste liest.

Das Erste ist der Durchsatz. Ultrafast für GPT-6 Astra ist für alle API-Nutzer verfügbar, zunächst jedoch mit niedrigen Ratenlimits: OpenAI dokumentiert 500.000 Token pro Minute für die Stufen 1 bis 3, 1.000.000 für Stufe 4 und 5.000.000 für Stufe 5. Für eine Stufe, die mit Geschwindigkeit verkauft wird, ist das eine echte Obergrenze – ein Agentenkontext von 200.000 Token bei einer halben Million Token pro Minute bedeutet auf einer niedrigen Stufe zweieinhalb Anfragen pro Minute. OpenAIs eigene Empfehlung weist von der anderen Seite auf dasselbe Problem hin und empfiehlt nachdrücklich WebSockets, gerade weil der Netzwerk-Overhead pro Anfrage die Latenz auffressen kann, für die die Stufe bezahlt.

Der zweite Punkt ist die Datenresidenz. Ultrafast unterstützt nur US-Datenresidenz und globale Verarbeitung. Es unterstützt keine EU- oder anderen regionalen Verarbeitungs-Endpunkte außerhalb der USA. Wenn Ihr Deployment für GPT-6 Astra auf einen EU-Residenz-Endpunkt angewiesen ist, steht Ihnen diese Stufe zu keinem Preis zur Verfügung, und das ist eine harte Grenze und keine Konfigurationsentscheidung. Beachten Sie außerdem, dass Residenz-Endpunkte einen Aufschlag von 10 % für Modelle mit sich bringen, die am oder nach dem 5. März 2026 veröffentlicht wurden, was auf GPT-6 Astra zutrifft.

Die Geschwindigkeits-Schlagzeile ging von 14x auf 8x zurück.

Das sollte sorgfältig festgehalten werden, denn die Zahl, die in den meisten kursiert, ist veraltet. Die heute veröffentlichte Ultracode-Dokumentationsseite von OpenAI enthält die Zeile „unser schnellster API-Dienst, mit bis zu 8-mal schnelleren Geschwindigkeiten als der Standardmodus.“ Die Vorschau-Ankündigung zu GPT-5.6 Sol vom 13. August 2026 versprach „bis zu 14-mal schneller als die Standardverarbeitung“ und bis zu 750 Ausgabe-Tokens pro Sekunde auf Cerebras-Hardware.

Das sind nicht dieselben Aussagen, und der Unterschied ist weniger ein Widerruf als vielmehr ein Themenwechsel. Die 14x-Zahl wurde auf GPT-5.6 Sol in einer begrenzten Vorschau gemessen; die 8x-Zahl ist das, was OpenAI für die Stufe in ihrem derzeitigen Zustand veröffentlicht, mit GPT-6 Astra als ihrem breit verfügbaren Modell. Wer mit 14x auf Astra kalkuliert, kalkuliert mit einer Zahl, die OpenAI für Astra nicht veröffentlicht hat. Die ehrliche Lesart ist, dass beide Zahlen vom Anbieter gemeldete Obergrenzen für den Ausgabedurchsatz sind, dass keine von beiden eine Latenzgarantie für Ihre Workload darstellt und dass die End-to-End-Zeit weiterhin die Eingabeverarbeitung, Tool-Aufrufe und Ihre eigene Orchestrierung umfasst. Betrachten Sie 8x als die Zahl für Ihre Planung, und betrachten Sie alles Bessere als einen Bonus, den Sie an Ihrem eigenen Traffic überprüfen, statt ihn anzunehmen.

Was ist am Montag damit zu tun?

Die Entscheidungsregel, die sich aus der Berechnung ergibt, ist enger gefasst, als das Marketing suggeriert, und es lohnt sich, sie schriftlich festzuhalten, bevor jemand vorschlägt, Ultrafast über einen gesamten Bestand hinweg zu aktivieren.

Aktiviere es dort, wo die Arbeitslast latenzgebunden und interaktiv ist und wo ein Mensch wartet. Incident-Triage, eine Live-Support-Eskalation, eine Rechercheschleife, in der ein Analyst in einer einzigen Sitzung iteriert – das sind die Fälle, in denen der Wert der Antwort, die jetzt statt in vier Minuten eintrifft, nicht proportional zum Tokenpreis ist, und in denen eine sechsfache Rechnung bei einer kleinen Anzahl von Turns vernachlässigbar kleiner ist als die Kosten der wartenden Person. OpenAIs eigene Beispiele in der Preview-Ankündigung hatten genau diese Form: das Lesen von Logs, während sich ein Ausfall entwickelt, und das Verdichten einer über Nacht laufenden Rechercheschleife zu einer Arbeitssitzung.

Lass es aus, wenn die Workload durchsatzgebunden oder batchförmig ist. Ein nächtlicher Re-Index, ein Bulk-Klassifizierungslauf, ein geplanter Report, ein Backfill – keiner davon kümmert sich um Wall-Clock-Latenz, alle werden von der Token-Anzahl dominiert, und alle haben eine 0,5x-Option direkt dort auf derselben Preisliste in Batch und Flex. Das 12-fache des Batch-Tarifs zu zahlen, um früher fertig zu sein, ist der klarste Weg, in dieser Tabelle Geld zu verschwenden.

Der unangenehme Mittelweg ist die agentische Coding-Schleife, und genau dort entscheidet die Arithmetik der Turn-Anzahl darüber. Wenn die Geschwindigkeit tatsächlich Wiederholungsversuche eliminiert – wenn der erste Durchlauf des Modells bei einer Multi-File-Änderung häufiger erfolgreich ist, weil es nicht gegen ein Timeout ankämpft –, dann kann Ultrafast pro abgeschlossener Aufgabe günstiger sein, obwohl es pro Token 6x kostet. Das ist eine messbare Aussage über Ihre eigenen Traces, keine allgemeine, und die Messung ist günstig: Zählen Sie die abgerechneten Turns pro abgeschlossener Aufgabe auf beiden Stufen und multiplizieren Sie mit dem Satz. Wenn das Verhältnis nicht nahe bei sechs liegt, ist die schnelle Stufe ein Latenzkauf und sollte als solcher gerechtfertigt werden.

Die Stufe ist bepreist; die Wege drumherum sind eine andere Frage

Eine praktische Anmerkung zur Handhabung. GPT-6 Astra im Standard-Service ist live auf OrcaRouter als openai/gpt-6-astrazum Tarif des Anbieters selbst — 10,00 $ Eingabe und 50,00 $ Ausgabe pro Million Token, wobei die 272K-Langkontext-Stufe auf 20,00 $ / 75,00 $ steigt — mit 0 % Aufschlag angeboten, was bedeutet, dass der Listenpreis des Anbieters durchgereicht wird und jede Preisänderung des Anbieters am selben Tag auf Ihrer Rechnung landet, an dem sie auf der Preisliste von OpenAI erscheint, statt erst bei Ihrer nächsten Vertragsverlängerung.Derselbe Schlüssel erreicht mehr als 200 Modelle, sodass der Standard-Tarif hinter demselben Client wie der günstige Tarif oder das Modell eines Wettbewerbers liegen kann, ohne eine zweite Integration.

Was wir nicht tun, ist, die Ultrafast-Stufe anzubieten. Es ist ein Service-Tier-Flag in einem OpenAI-Konto statt eines separat routbaren Modells — Sie setzen service_tier: "ultrafast" bei einer Anfrage an gpt-6-astra — und es wird von OpenAI zu den oben genannten Preisen Ihrem eigenen Konto in Rechnung gestellt. Wenn Sie es aktivieren, befindet es sich in Ihrer direkten OpenAI-Integration, und OrcaRouter ist der richtige Ort für den Datenverkehr der Standard-Stufe, den Sie daneben routen. Das klar zu sagen ist nützlicher, als eine Fähigkeit anzudeuten, die wir nicht haben.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Die Entscheidungsregel, in einem Absatz

Sechsmal ist der Preis einer Stufe, nicht der Preis eines Modells: Die Gewichte, das Kontextfenster von 1.050.000 Token, die Ausgabegrenze von 128.000 Token und die Antworten sind alle identisch mit dem Standard-GPT-6 Astra. Was Sie kaufen, ist ein bis zu 8-fach schnellerer Ausgabedurchsatz, zu einer Preisliste, die in jeder Zeile das 6-Fache beträgt, vorbehaltlich niedriger anfänglicher Ratenbegrenzungen und einer US-Residenz-Beschränkung, die die EU vollständig ausschließt. Dieser Tausch ist offensichtlich richtig für einen Menschen, der auf eine Antwort wartet, offensichtlich falsch für einen geplanten Batch-Job, für den eine Spur zum halben Preis verfügbar ist, und wirklich unentschieden für agentische Schleifen, bei denen die Antwort davon abhängt, ob die Geschwindigkeit Runden einspart. Messen Sie die Rundenanzahl in Ihren eigenen Traces, bevor Sie sich festlegen, und routen Sie den Rest zum Listenpreis.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert