
GPT-6.1 Ultrafast vs GPT-6.1 Sol: Drei Aufgaben, je ein Urteil
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Fragen Sie, ob GPT-6.1 Ultrafast sechsmal den Preis von GPT-6.1 Sol wert ist, und die ehrliche Antwort lautet, dass zwei Ihrer drei Workloads genau dort bleiben sollten, wo sie sind. Der interaktive Coding-Agent sollte wechseln. Der über Nacht laufende Evaluierungsdurchlauf nicht, und der Batch-Zusammenfasser ebenso wenig, und der Grund ist nicht, dass die Stufe überteuert wäre – sondern dass sie nie das gekauft haben, was sie verkauft. GPT-6.1 Sol erschien am 29. September 2026, und Ultrafast kam am 8. Oktober 2026 als Modus darüber hinzu: derselbe Checkpoint, dasselbe Kontextfenster von 1.050.000 Tokens, dieselbe Ausgabegrenze von 128.000 Tokens, derselbe Knowledge Cutoff vom 30. April 2026, dieselben Antworten, zu $12.00 pro Million Eingabe-Tokens und $60.00 pro Million Ausgabe-Tokens gegenüber $2.00 und $10.00. Eine Geschwindigkeitsstufe ist der Kauf von Wanduhrzeit, und Wanduhrzeit ist nur für eine Aufgabe Geld wert, auf die jemand wartet.
Diese Umdeutung ist der ganze Artikel. Der Rest ist die Arithmetik, die dir sagt, welcher deiner Jobs zur wartenden Sorte gehört, und die zwei Kosten, die zusammen mit dem Vielfachen auftreten, ob du sie eingeplant hast oder nicht.
Was sich tatsächlich unterscheidet: ein Anfragefeld und eine Rechnung
Es gibt keinen Ultrafast-Checkpoint, kein separates Kontextlimit, keinen alternativen Knowledge-Cutoff und nichts zum Pinnen. Sie senden denselben Modellbezeichner mit gesetztem Service-Tier-Feld, und OpenAI plant die Anfrage anders ein; senden Sie ihn ohne das Feld, sind Sie auf Standard. Alles, wogegen ein Entwickler programmiert, ist identisch, und es lohnt sich, bei der Liste mechanisch vorzugehen, denn die Länge der Liste ist das Argument.
• Modell-ID — dieselbe Kennung auf beiden, ein Standard-Snapshot, nichts Datumbehaftetes zum Pinnen.
• Kontext — ein 1.050.000-Token-Fenster, maximal 922.000 Token Eingabe und maximal 128.000 Token Ausgabe bei beiden.
• Reasoning-Stufenleiter — niedrig, mittel (Standard), hoch, xhigh und max bei beiden, wobei none und minimal bei beiden nicht unterstützt werden.
• Tool-Oberfläche — Websuche, Dateisuche, Bildgenerierung, Code-Interpreter, gehostete Shell, Apply Patch, Skills, Computer Use, MCP- und Toolsuche, über die Responses API, auf beiden.
• Preis — 2,00 $ Eingabe / 0,10 $ gecacht / 2,50 $ Cache-Schreibvorgang / 10,00 $ Ausgabe pro Million Tokens bei Standard, gegenüber 12,00 $ / 0,60 $ / 15,00 $ / 60,00 $ bei Ultrafast.
Über 272.000 Eingabe-Tokens — die gesamte Anfrage wird mit 2x Eingabe- und Cache-Tarifen und 1,5x Ausgabe bei beiden neu bepreist, was Ultrafast long-context auf 24,00 $ / 1,20 $ / 30,00 $ / 90,00 $ bringt.
• Geschwindigkeit — Standard ist per Definition die Basislinie; Ultrafast ist die oberste Stufe, und das einzige modellspezifische Vielfache, das OpenAI veröffentlicht, gehört zu GPT-6 Astra, nicht zu diesem Modell.
Diese letzte Zeile ist der Vorbehalt, der allem anderen zugrunde liegt, und sie bekommt weiter unten einen eigenen Abschnitt. Zuerst die Jobs.
Job eins: der interaktive Agent. Das ist der, der sich bewegt.
Ein Agenten-Loop, der vierzig Tool-Aufrufe hintereinander ausführt, ist der Käufer, für den diese Stufe gebaut wurde, denn die Generierungszeit jedes Turns bestimmt den nächsten Turn, und der Nutzer sieht zu. Nehmen wir eine Sitzung, die pro Turn 30.000 Input-Tokens sendet und 1.500 Output-Tokens empfängt, über 40 Turns hinweg – insgesamt 1.200.000 Input-Tokens und 60.000 Output-Tokens, wobei jede Anfrage deutlich unter der 272.000-Token-Schwelle für die Neubepreisung liegt.
• Standard — 1,2 Millionen Eingabe-Tokens zu 2,00 $ sind 2,40 $; 60.000 Ausgabe-Tokens zu 10,00 $ sind 0,60 $. Drei Dollar für den Durchlauf.
• Ultrafast — 1,2 Millionen Input-Tokens bei 12,00 $ ergeben 14,40 $; 60.000 Output-Tokens bei 60,00 $ ergeben 3,60 $. Achtzehn Dollar für den Durchlauf.
• Das Delta — $15.00, um den Großteil der Generierungslatenz aus einem Job zu entfernen, dessen Ausgabe ansonsten identisch ist.
Ob 15,00 $ günstig ist, ist eine Frage der Minuten, nicht der Tokens. Wenn die Sitzung mit Standard zwanzig Minuten und mit Ultrafast vier Minuten dauert, haben Sie sechzehn Minuten für fünfzehn Dollar gekauft – etwa 0,94 $ pro Minute –, und der Vergleich, der zählt, gilt dem, was diese sechzehn Minuten Sie kosten. Ein Entwickler zu Vollkosten ist mehr als einen Dollar pro Minute wert, im Human-in-the-Loop-Fall ist die Antwort daher eindeutig. Ein Agent, der in einer Warteschlange für menschliche Prüfung wartet, ist pro Minute nichts wert, und in diesem Fall sind dieselben sechzehn Minuten kostenlose sechzehn Minuten, und die Stufe ist Verschwendung.
Das ist der Test, den man anwenden muss, und er hat nichts mit dem Modell zu tun. Auf wessen Uhr liegt die Generierungszeit, und was ist diese Uhr wert? Wenn die Antwort „auf der einer Person, und jede Menge wert“ lautet, ist Ultrafast das Billigste auf Ihrer Rechnung. Wenn die Antwort „auf der eines Schedulers, und nichts wert“ lautet, ist es das Teuerste.

Job zwei: der nächtliche Bewertungsdurchlauf. Das ist ein Nein.
Ein Eval-Sweep schickt ein paar tausend Prompts durch das Modell, schreibt die Ergebnisse in den Objektspeicher, und am Morgen liest ein Mensch die Tabelle. Sein Latenzbudget bemisst sich nicht in Minuten, sondern in einer Nacht. In der Pipeline wartet nichts auf das Modell außer der nächsten Anfrage in der Warteschlange.
Ultrafast beseitigt nicht die Wall-Clock-Kosten des Sweeps, denn die Wall-Clock-Kosten des Sweeps sind eine Scheduling-Entscheidung, die du getroffen hast, nicht ein Latenzproblem, das du hast. Was es bewirkt, ist, die Rechnung zu versechsfachen und den Job auf ein Budget zu verschieben, das eigene Rate-Limits pro Organisation mitbringt — was bei einem unbeaufsichtigten Batch ein echtes Risiko ist, denn eine Rate-Limit-Obergrenze ist genau der Fehlermodus, den ein großer Sweep trifft, und die Tier-Seite veröffentlicht die Zahl nicht.
Und auf derselben Preiskarte gibt es einen Tarif, der für diese Aufgabe bepreist ist und in die entgegengesetzte Richtung bepreist wird. Batch und Flex kosten halb so viel wie Standard, und die Batch-Verarbeitung der API ist genau für diese Form ausgelegt: große Volumina, keine interaktive Deadline, asynchron zurückgegebene Ergebnisse. Nach den obigen Zahlen kostet dieselbe Token-Gesamtmenge über 40 Runden bei Batch 1,50 $ gegenüber 18,00 $ bei Ultrafast. Das ist eine 12-fache Spanne für eine Aufgabe, die den Unterschied nicht erkennen kann.
Der Fehler, den es zu vermeiden gilt, ist, Ultrafast als das allgemeine Upgrade zu behandeln. Es ist die oberste Sprosse einer Leiter – Batch und Flex bei der Hälfte, Standard bei eins, Fast bei zwei, Ultrafast bei sechs – und eine Leiter ist kein Menü besserer Versionen. Die falsche Sprosse zu wählen, kostet mehr Geld als das falsche Modell zu wählen.
Job drei: der Batch-Zusammenfasser. Auch ein Nein, aus einem anderen Grund.
Angenommen, die Workload ist ein nächtlicher Durchlauf über einen Dokumentenspeicher: lange Eingaben, kurze Ausgaben, kein Mensch im Prozess und eine SLA, die in Stunden gemessen wird. Hier wirkt sich der Token-Mix gegen Ultrafast aus statt für Ultrafast.
Die Schwelle von 272.000 Token ist der Grund dafür. In beiden Tarifstufen wird bei einer einzelnen Anfrage, die sie überschreitet, die gesamte Anfrage neu bepreist – jedes Eingabe-Token, jeder Cache-Lesevorgang, jedes Ausgabe-Token – mit dem Doppelten der Eingabe- und Cache-Sätze und dem 1,5-Fachen der Ausgabe. Long-context Ultrafast kostet daher 24,00 $ pro Million Eingabe-Token und 90,00 $ pro Million Ausgabe-Token, und die Neubepreisung wird durch die Anfrage ausgelöst, nicht durch den Anteil, der die Grenze überschreitet. Ein Dokumenten-Zusammenfasser, der gelegentlich eine Anfrage mit 300.000 Eingabe-Token abschickt, zahlt den Long-Context-Satz für alle 300.000 davon.
Das Cache-Verhalten verstärkt das. Gecachte Lesevorgänge sind die günstigsten Tokens in diesem Modell und der wirksamste Kostenhebel, und sie skalieren mit der Stufe, statt den Kostenmultiplikator abzufedern – 0,10 US-Dollar pro Million gecachter Eingabe bei Standard, 0,60 US-Dollar bei Ultrafast, beide bei 5 % des Tarifs für ungecachte Eingabe. Es gibt keine Mischung aus gecachten und frischen Tokens, die den Multiplikator abmildert, sodass eine stark optimierte gecachte Pipeline keinen Rabatt aus der Schnellspur erhält. Sie zahlt einfach das Sechsfache einer kleineren Zahl.
Betrachtet man beides zusammen, ist der Summarizer der Fall, in dem der Aufpreis von Ultrafast in absoluten Zahlen am größten und sein Nutzen am geringsten ist. Wenn die Dokumente wirklich lang und die Deadline wirklich in Stunden gemessen wird, ist die richtige Konfiguration Batch oder der normale Standard, und der richtige Einsatz von Ultrafast ist die Schleife mitten in der Entwicklung, in der man den Prompt iterativ anpasst und eine Person auf jede Revision wartet.
Die beiden Kosten, die mit dem Multiple einhergehen
Der sechsfache Satz ist der sichtbare Teil des Preises. Zwei unsichtbare Teile sind in der Produktion wichtiger.
Das erste ist das Rate-Limit-Budget. Ultrafast läuft mit eigenen Limits, getrennt von den Standard- und Fast-Budgets, und OpenAI legt sie pro Organisation fest, statt sie auf der Tier-Seite zu veröffentlichen; die Empfehlung lautet, die Limits Ihrer Organisation zu prüfen, bevor Sie den Traffic erhöhen, und sich an ein Account-Team zu wenden, wenn sie angehoben werden müssen. Eine Workload auf Ultrafast umzustellen, bewirkt also zweierlei zugleich: Es vervielfacht die Rechnung und verschiebt die Workload auf eine Obergrenze, die Sie möglicherweise nicht einsehen können. Bei einem unbeaufsichtigten Agenten greift die Obergrenze zuerst.
Das zweite ist die Form der Einsparungen. Ultrafast reduziert die Zwischen-Token-Zeit, nicht die Zeit bis zum ersten Token und nicht die Denkphase. Eine Anfrage, die den größten Teil ihrer Wanduhrzeit mit Nachdenken verbringt, bevor sie überhaupt etwas ausgibt, kann auf Ultrafast umgestellt werden und wirkt trotzdem langsam, weil die Stufe den Teil der Anfrage beschleunigt, der nie der Engpass war. Das ist der Fehlermodus, der Berichte wie „wir haben das Sechsfache bezahlt und es ist genauso schnell“ erzeugt: Es wird eine Anwendung gemessen, deren Latenz irgendwo liegt, wo die Stufe nicht hinreicht. Bevor Sie sich festlegen, messen Sie, wohin die Sekunden tatsächlich gehen — Zeit bis zum ersten Token gegenüber Zwischen-Token-Zeit —, denn die Stufe besitzt nur eine davon.
Warum „schneller“ noch keine Zahl ist, auf die man OpenAI festnageln kann
Ultrafast wird mit „bis zu 8x“ beworben, und die Messung hinter dieser Formulierung gehört zu einem anderen Modell. Der veröffentlichte Satz bezieht sich darauf, dass GPT-6 Astra Ultrafast Token bis zu 8x schneller generiert als GPT-6 Astra im Standardmodus in Codex. Für GPT-6.1 Sol gibt es keinen entsprechenden veröffentlichten Multiplikator, und auch keine unabhängige Stelle hat eine Tokens-pro-Sekunde-Zahl für die Sol-Variante veröffentlicht. Die Dokumentation für diese Stufe beschreibt sie als Verringerung der Zeit zwischen generierten Ausgabe-Tokens und verweist auf eine Preistabelle.
Es ist eine plausible Ausgangsannahme, dass das Vielfache trägt – beide Modelle laufen auf demselben Serving-Stack und der Mechanismus der Stufe ist derselbe –, doch „bis zu“ leistet in diesem Satz echte Arbeit, und eine auf einem Schwestermodell in einem anderen Client gemessene Anbieter-Obergrenze ist nicht die Zahl, die Ihre Workload sehen wird. Dasselbe gilt für die ältere Stufe: Ultrafast gegenüber GPT-5.6 Sol wurde im August 2026 mit „bis zu 14-mal schneller als Standard-Verarbeitung“ in begrenzter Vorschau angekündigt, und die Dokumentation nennt weiterhin Vorschauzugriff, wobei die Ultrafast-Rate-Tabelle genau zwei Zeilen enthält.
Worauf Sie OpenAI festnageln können, ist der Preis, denn der Preis wird veröffentlicht und gilt für jedes Token. Das heißt, die Entscheidung, um die es auf dieser Seite geht, ist eine Entscheidung über Ihr eigenes Latenzbudget, nicht über die Geschwindigkeitsbehauptung des Anbieters.

Testen, ohne zu committen, und zurückwechseln
Der Tarif ist für alle API-Nutzer verfügbar, daher ist der kostengünstigste Weg, die Wall-Clock-Frage zu beantworten, dasselbe Prompt-Set zweimal auszuführen – einmal mit aktiviertem und einmal mit deaktiviertem Feld – und die Token-Anzahlen sowie die Zeitmessungen zu vergleichen. Zwei Dinge sollten Sie in diesem Test beachten: ob Ihre Anfragen die 272.000-Token-Grenze überschreiten und ob die Zeit bis zum ersten Token die Zeit zwischen den Token dominiert. Eines von beiden kann dazu führen, dass der Versuch wie ein Nullergebnis aussieht, obwohl der Tarif genau wie angekündigt funktioniert.
Das Zurückschalten ist ein Request-Feld, keine Migration, und die Standard-Lane wird zum eigenen Listenpreis des Anbieters über OrcaRouter als openai/gpt-6.1-sol bereitgestellt — 2,00 $ pro Million Input-Tokens und 10,00 $ pro Million Output-Tokens, 0 % Aufschlag, wobei der Preis des Anbieters direkt durchgereicht wird, sodass eine Preisänderung eines Anbieters am selben Tag bei uns live ist. Ultrafast selbst ist nichts, was wir verkaufen; es ist ein Service-Tier-Flag, das über Ihr eigenes OpenAI-Konto abgerechnet wird, und das zu sagen ist nützlicher, als etwas anderes anzudeuten. Was ein einzelner Key tatsächlich bietet, ist die Standard-Lane plus der Rest des Katalogs hinter einem einzigen OpenAI-kompatiblen Endpoint, und automatisches Failover über Anbieter hinweg, was es wert ist, wenn Sie kurz davor stehen, einem Produktions-Agenten ein teures Tier voranzustellen und die Standard-Lane eher als Routing-Entscheidung denn als Code-Änderung haben möchten.

Ein praktischer Hinweis zur Schnellspur, der nicht für die günstige gilt: WebSockets. OpenAI empfiehlt für Ultrafast eine persistente WebSocket-Verbindung, die für einen Agenten, der viele sequenzielle Aufrufe durchführt, die richtige Form ist und für ein Batch-Skript mit einer Anfrage pro Prozess die falsche. Wenn es sich bei Ihrem Client um die zweite Art handelt, ist der vom Tarif selbst empfohlene Transportweg ein weiterer Grund dafür, dass der Nachtjob woanders hingehört.
Wenn sich das Urteil ändert
Drei Entwicklungen würden Jobs von der „Bleiben“-Liste streichen. Ein veröffentlichtes Ultrafast-Ratenlimit für GPT-6.1 Sol würde das Obergrenzenrisiko aus dem Batch-Fall entfernen. Eine veröffentlichte oder unabhängig reproduzierte Geschwindigkeitsmessung für die Sol-Stufe würde es Ihnen ermöglichen, die Wall-Clock-Ersparnis einzuplanen, statt sie anzunehmen. Und eine Rabattstufe auf der Überholspur — ein Ultrafast-Äquivalent zu Batch, bei dem die Stufe weiterhin schnell, aber nicht sechsmal so teuer ist — würde die Wirtschaftlichkeit jedes Jobs in der Mitte der Leiter verändern.
Nichts davon existiert heute. Was existiert, ist eine Stufe, die genau das ist, was sie zu sein vorgibt: derselbe GPT-6.1 Sol, anders getaktet, zum sechsfachen Preis in jeder Zeile. Verschiebe den interaktiven Agenten, lass die anderen beiden in Ruhe und miss, wo deine Sekunden tatsächlich hingehen, bevor du entscheidest, welche die deine ist.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
