
GPT-6.1 Sol Ultrafast rollt auf die API aus, Codex und ChatGPT funktionieren
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
OpenAI führt den Ultrafast-Modus ein für GPT-6.1 Sol — die schnellste Servicestufe, die es verkauft, und das erste Mal, dass die knapp unter Astra angesiedelte Sol-Stufe eine solche erhält. Der Schritt stellt GPT-6.1 Sol auf dieselbe Stufe wie GPT-6 Astra Ultrafast in der API, in Codex und in ChatGPT Work, und er kommt mit einer veröffentlichten Preisliste statt einer Warteliste: 12,00 $ pro Million Input-Tokens und 60,00 $ pro Million Output-Tokens, genau sechsmal so viel, wie das Standard-GPT-6.1 Sol kostet. Das Geschwindigkeitsversprechen auf dem Etikett lautet „bis zu 8x“. Der interessante Teil ist, was dieser Ausdruck misst, und die Antwort ist nicht das Modell, für das Sie gleich bezahlen.
Im Entwickler-Changelog steht der Eintrag vom 8. Oktober: „Ultrafast-Modus für GPT-6.1 Sol in der Responses API hinzugefügt. Verwenden Sie gpt-6.1-sol mit service_tier: "ultrafast", um die Zeit zwischen generierten Ausgabe-Tokens zu verkürzen. Er ist für alle API-Nutzer verfügbar, vorbehaltlich Rate Limits, mit globaler Verarbeitung und Datenresidenz in den USA und der EU." Auf der Ultrafast-Dokumentationsseite heißt es nun „breit verfügbar für GPT-6 Astra und GPT-6.1 Sol, mit Vorschauzugang für GPT-5.6 Sol“, und die Speed-Seite von ChatGPT bestätigt die Abo-Hälfte: Ultrafast ist in Codex und ChatGPT Work bei Pro für 500 $ sowie bei berechtigten Enterprise- und Edu-Tarifen verfügbar.
Ultrafast ist eine Service-Stufe, kein zweites Modell
An den Gewichten ändert sich nichts. Derselbe Checkpoint, dasselbe Kontextfenster von 1.050.000 Token, dieselbe maximale Eingabe von 922.000 Token, dieselbe Obergrenze von 128.000 Token für die Ausgabe, derselbe Wissensstand vom 30. April 2026, dieselben Antworten. Was Sie kaufen, ist eine Priorität bei der Zeitplanung: Das Modell generiert Token schneller, und OpenAIs eigene Formulierung ist bewusst eng gefasst – die Stufe „verkürzt die Zeit zwischen den generierten Ausgabe-Tokens". Sie macht das Modell nicht klüger und verkürzt auch nicht die Denkphase.
Diese Unterscheidung ist die ganze Entscheidung. Bei einer Agentenschleife, die vierzig Tool-Aufrufe hintereinander ausführt, summiert sich der Gewinn, weil die Ausgabe jedes Durchlaufs früher eintrifft. Bei einer einzelnen schwierigen Denkaufgabe, die den größten Teil ihrer Wanduhrzeit mit Überlegen verbringt, kannst du sechsmal so viel bezahlen und denselben Spinner beobachten.
Die Stufenleiter, einmal, in einfachen Worten:
• Batch and Flex — die Hälfte von Standard, der günstige Weg für Arbeit, auf die niemand wartet
• Standard — $2.00 Eingabe / $0.10 zwischengespeichert / $2.50 Cache-Schreiben / $10.00 Ausgabe pro Million Token
• Fast — doppelt so viel wie Standard, oder $4.00 / $0.20 / $5.00 / $20.00; OpenAI hat Priority processing am 30. Juli 2026 in Fast mode umbenannt
• Ultraschnell — sechsmal Standard oder 12,00 $ / 0,60 $ / 15,00 $ / 60,00 $
• Über 272K Eingabe-Tokens — die gesamte Anfrage wird mit 2x Eingabe- und Cache-Raten sowie 1,5x Ausgabe neu berechnet; Ultrafast Long-Context kostet $24.00 / $1.20 / $30.00 / $90.00
Die Rechnung, die niemand auf die Marketingseite schreibt
Der sechsfache Preis für die achtfache Geschwindigkeit ist kein Verlustgeschäft, und es ist auch kein Gratisangebot. Ultrafast wird pro Token abgerechnet, also kostet ein Job, der bei Standard 1,00 $ kostet, bei Ultrafast 6,00 $ — und ist in ungefähr einem Achtel der Zeit fertig. Die Ersparnis steckt nicht in der Rechnung, sondern in der Wall-Clock-Zeit. Sie zahlen fünf Dollar extra, um sieben Achtel der Warteschlangenzeit für diesen Job zu eliminieren, und ob das günstig oder absurd ist, hängt ganz und gar davon ab, was die Person oder die Pipeline, die am anderen Ende wartet, pro Minute wert ist.
Daraus folgen zwei Implikationen, und genau diese werden übersehen:
• Interaktive Arbeit ist das einfache Ja. Ein Entwickler, der zusieht, wie ein Diff landet, ein Agent, der nicht weitermachen kann, bis er das Ergebnis gelesen hat – das sind die Fälle, in denen die Latenz das Produkt ist. Eine achtmal schnellere Ausgabe in einer Schleife mit vierzig Runden ist keine geringfügige Verbesserung der menschlichen Wahrnehmung; es ist der Unterschied zwischen einem Werkzeug, das man benutzt, und einem Werkzeug, das man im Hintergrund laufen lässt.
• Geplante und Batch-Arbeit ist ein leichtes Nein. Wenn ein Job ohnehin bis zum Morgen Zeit hat, ist Ultrafast eine 6-fache Rechnung für nichts, und die Batch-Lane zum halben Preis liegt direkt daneben.
Zwischengespeicherte Eingaben sind einen zweiten Blick wert, denn sie bewegen sich ebenfalls: 0,60 $ pro Million bei Ultrafast gegenüber 0,10 $ bei Standard, weiterhin 5 % des Tarifs für nicht zwischengespeicherte Eingaben. Agenten mit Prompt-Cache, die in jeder Runde einen großen System-Prompt erneut senden, werden feststellen, dass der Cache-Rabatt mit der Tarifstufe skaliert, statt sie davor zu schützen.

Woher die Zahl „bis zu 8x“ kommt
Dies ist der Teil, der sorgfältig gelesen werden sollte, denn hier beschreiben die Schlagzeile des Rollouts und die Dokumentation des Rollouts unauffällig unterschiedliche Dinge.
Die einzige modellspezifische Geschwindigkeitsmessung, die OpenAI veröffentlicht, ist dieser Satz: „GPT-6 Astra Ultrafast generiert Token bis zu 8-mal schneller als GPT-6 Astra im Standardmodus in Codex.“ Das ist ein Astra-Wert, gemessen in Codex. Für GPT-6.1 Sol gibt es keinen entsprechenden veröffentlichten Multiplikator. Das Dokument, das Ultrafast für dieses Modell behandelt, besagt, dass es die Zeit zwischen generierten Ausgabe-Tokens verringert, und verweist auf eine Preistabelle; es nennt dafür keine Zahl. Die Geschwindigkeitsseite auf der ChatGPT-Seite wiederholt den Astra-Satz und endet dort.
Die ehrliche Lesart von „bis zu 8x schneller“ ist also: Es ist das Aushängeschild der Stufe, das von dem Schwestermodell stammt, das seit dem 29. September auf Ultrafast läuft, und es ist eine Anbieterbehauptung, die von keiner unabhängigen Instanz für eines der beiden Modelle reproduziert wurde. Sie mag für GPT-6.1 Sol durchaus zutreffen – die beiden laufen auf demselben Serving-Stack, und der Mechanismus der Stufe ist derselbe –, aber niemand außerhalb von OpenAI hat eine Token-pro-Sekunde-Messung für die Sol-Variante veröffentlicht, und das „bis zu“ leistet in diesem Satz echte Arbeit.
Es ist auch ratsam, die Stufen nach Modell getrennt zu halten, denn die ältere ist noch unerledigte Arbeit. Ultrafast wurde am 13. August 2026 für GPT-5.6 Sol mit „bis zu 14x schneller als Standard processing“ angekündigt, in einer begrenzten Vorschau für ausgewählte Kunden. Drei Monate später sagen die Dokumente immer noch, dass GPT-5.6 Sol „Vorschauzugriff“ hat, und die Ultrafast-Preistabelle enthält genau zwei Zeilen — GPT-6 Astra und GPT-6.1 Sol. Eine 14x-Zahl, die nie die allgemeine Verfügbarkeit erreicht hat und keinen veröffentlichten Preis hat, ist eine Behauptung, kein Produkt.

Wer kann es tatsächlich einschalten?
Die API-Seite ist weit gefasst; die Abonnement-Seite ist eng gefasst, und genau dieser Unterschied überrascht viele.
• API — verfügbar für alle API-Nutzer bei gpt-6.1-sol, mit separaten Rate-Limits gegenüber Standard und Fast. Das bedeutet ein zweites Budget, das man im Auge behalten muss, nicht nur ein zweiter Preis.
• Ultraschnelle Ratenlimits für GPT-6.1 Sol — 1.000.000 Token pro Minute bei Build, 4.000.000 bei Launch, 40.000.000 bei Grow. OpenAI hat seine Nutzungsstufen am 6. Oktober von fünf auf drei reduziert, diese drei Namen sind also die aktuellen Stufen, keine veralteten.
• Datenresidenz — GPT-6.1 Sol unterstützt US- und EU-Datenresidenz sowie globale Verarbeitung, auch unter Fast und Ultrafast. Astras Ultrafast bietet keine EU-Residenz, wenn Ihr Workload also auf die EU festgelegt ist, ist dies die erste Ultrafast-Konfiguration, die Sie überhaupt kaufen können.
• Codex and ChatGPT Work — Ultrafast ist im Pro-Plan für 500 $ sowie in berechtigten Enterprise- und Edu-Plänen verfügbar. Enterprise-Administratoren finden es standardmäßig deaktiviert vor und müssen es pro Nutzer oder pro Workspace aktivieren.
• Chat — nicht enthalten. GPT-6.1 Sol selbst lebt in Work und Codex; die Consumer-Chat-Oberfläche gehört nicht dazu.
• Wie es bei einem Abonnement abgerechnet wird — enthaltenes Nutzungsvolumen wird zum 8-fachen des Standard-Tarifs verbraucht, und gekaufte Credits oder Enterprise Pay-as-you-go werden zum 6-fachen des Standard-Tarifs abgerechnet. Beide Zahlen sollten Sie kennen, bevor Sie es eingeschaltet lassen.
Ein Implementierungsdetail entscheidet darüber, ob Sie überhaupt etwas von der Geschwindigkeit sehen. Die Empfehlung von OpenAI ist diesbezüglich unmissverständlich: Verwenden Sie WebSockets, „insbesondere für agentische Anwendungen, die viele Tool-Aufrufe in schneller Folge ausführen“, denn „ohne eine persistente Verbindung kann der Netzwerk-Overhead die Latenzgewinne verringern“. Wenn Ihr Client für jeden Aufruf eine neue HTTP-Verbindung öffnet, kann der Overhead pro Anfrage den gesamten Vorteil der Stufe auffressen, für die Sie gerade das Sechsfache bezahlt haben. HTTP funktioniert weiterhin. Es ist dann möglicherweise einfach nicht die Stufe wert.
Was wir routen, und was wir nicht
Das GPT-6.1 Sol der Standardstufe ist auf OrcaRouter als openai/gpt-6.1-sol zu den eigenen $2,00 für Input und $10,00 für Output pro Million Tokens des Anbieters verfügbar, bereitgestellt mit 0 % Aufschlag — der Listenpreis des Herstellers wird durchgereicht, sodass eine Preisänderung von OpenAI am selben Tag in Ihrer Rechnung landet, an dem sie auf der Preisliste erscheint, und nicht erst bei Ihrer nächsten Vertragsverlängerung. Derselbe Schlüssel und Endpunkt bedienen mehr als 200 Modelle, sodass ein GPT-6.1-Sol-Aufruf und ein Claude- oder Qwen-Aufruf hinter einer einzigen Integration mit automatischem Failover und ohne zweiten Vertrag stehen, und die Routing-DSL Modelle zu einem einzigen Aufruf zusammenführt, wenn eine Aufgabe mehr als eine Meinung benötigt.
Ultrafast ist keines dieser Modelle, und es wäre irreführend, etwas anderes anzudeuten. Es ist ein Service-Tier-Flag auf einem OpenAI-Konto – Sie senden service_tier: "ultrafast" an gpt-6.1-sol und OpenAI stellt Ihrem eigenen Konto die oben genannten Sätze in Rechnung – es lebt also innerhalb Ihrer direkten OpenAI-Integration. Wenn Sie es aktivieren, halten Sie den tier-basierten Traffic auf Ihrem Anbieter-Schlüssel und leiten den Traffic mit Standardvolumen über uns. Das ist die ehrliche Aufteilung, und sie ist zugleich die günstigere für alles, was nicht auf einen Menschen wartet.

Was heute damit machen
Wenn Sie einen Codex- oder ChatGPT Work-Seat auf Pro $500 haben, ist der Umschalter bereits vorhanden, und der Test kostet Sie nichts außer dem Nutzungsmultiplikator – führen Sie dieselbe Aufgabe auf beide Arten aus und sehen Sie, ob die Schleife, die Sie tatsächlich ausführen, genug Runden hat, damit das Achtfache sichtbar wird. Wenn Sie die API nutzen, ist das Experiment, das sich lohnt, enger gefasst, als die Ankündigung nahelegt: Erfassen Sie, wie viel Ihrer Latenz auf die Token-Generierung und wie viel auf das Denken des Modells entfällt, und richten Sie dann Ultrafast auf den Teil, den es tatsächlich komprimieren kann.
Und wenn du bei derselben Anfrage die Wahl zwischen Fast mit 2x und Ultrafast mit 6x hast, ist Fast die Stufe, die zuerst hier war, und diejenige, deren Verhalten sich allein anhand einer Preisliste nachvollziehen lässt. Ultrafast ist neu für dieses Modell, von keiner unabhängigen Messung bepreist und genau so viel wert, wie deine eigene Stoppuhr sagt.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
