Eine generierte Titelkarte mit der Überschrift 'Ultrafast vs Sol' und dem Untertitel 'Gleicher Checkpoint, zwei Tarifkarten, drei Workloads' sowie drei Chips mit der Aufschrift 'Interaktiver Agent: wechseln', 'Übernacht-Durchlauf: bleiben' und 'Batch-Zusammenfasser: bleiben', über einer Fußzeile mit dem Text 'Die Preise sind OpenAI-Listenpreise pro 1 Mio. Token, kurzer Kontext, Oktober 2026'.
Engineering & Research

GPT-6.1 Ultrafast vs GPT-6.1 Sol: Drei Aufgaben, je ein Urteil

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Fragen Sie, ob GPT-6.1 Ultrafast sechsmal den Preis von GPT-6.1 Sol wert ist, und die ehrliche Antwort lautet, dass zwei Ihrer drei Workloads genau dort bleiben sollten, wo sie sind. Der interaktive Coding-Agent sollte wechseln. Der über Nacht laufende Evaluierungsdurchlauf nicht, und der Batch-Zusammenfasser ebenso wenig, und der Grund ist nicht, dass die Stufe überteuert wäre – sondern dass sie nie das gekauft haben, was sie verkauft. GPT-6.1 Sol erschien am 29. September 2026, und Ultrafast kam am 8. Oktober 2026 als Modus darüber hinzu: derselbe Checkpoint, dasselbe Kontextfenster von 1.050.000 Tokens, dieselbe Ausgabegrenze von 128.000 Tokens, derselbe Knowledge Cutoff vom 30. April 2026, dieselben Antworten, zu $12.00 pro Million Eingabe-Tokens und $60.00 pro Million Ausgabe-Tokens gegenüber $2.00 und $10.00. Eine Geschwindigkeitsstufe ist der Kauf von Wanduhrzeit, und Wanduhrzeit ist nur für eine Aufgabe Geld wert, auf die jemand wartet.

Diese Umdeutung ist der ganze Artikel. Der Rest ist die Arithmetik, die dir sagt, welcher deiner Jobs zur wartenden Sorte gehört, und die zwei Kosten, die zusammen mit dem Vielfachen auftreten, ob du sie eingeplant hast oder nicht.

Was sich tatsächlich unterscheidet: ein Anfragefeld und eine Rechnung

Es gibt keinen Ultrafast-Checkpoint, kein separates Kontextlimit, keinen alternativen Knowledge-Cutoff und nichts zum Pinnen. Sie senden denselben Modellbezeichner mit gesetztem Service-Tier-Feld, und O​penAI plant die Anfrage anders ein; senden Sie ihn ohne das Feld, sind Sie auf Standard. Alles, wogegen ein Entwickler programmiert, ist identisch, und es lohnt sich, bei der Liste mechanisch vorzugehen, denn die Länge der Liste ist das Argument.

• Modell-ID — dieselbe Kennung auf beiden, ein Standard-Snapshot, nichts Datumbehaftetes zum Pinnen.

• Kontext — ein 1.050.000-Token-Fenster, maximal 922.000 Token Eingabe und maximal 128.000 Token Ausgabe bei beiden.

• Reasoning-Stufenleiter — niedrig, mittel (Standard), hoch, xhigh und max bei beiden, wobei none und minimal bei beiden nicht unterstützt werden.

• Tool-Oberfläche — Websuche, Dateisuche, Bildgenerierung, Code-Interpreter, gehostete Shell, Apply Patch, Skills, Computer Use, MCP- und Toolsuche, über die Responses API, auf beiden.

• Preis — 2,00 $ Eingabe / 0,10 $ gecacht / 2,50 $ Cache-Schreibvorgang / 10,00 $ Ausgabe pro Million Tokens bei Standard, gegenüber 12,00 $ / 0,60 $ / 15,00 $ / 60,00 $ bei Ultrafast.

Über 272.000 Eingabe-Tokens — die gesamte Anfrage wird mit 2x Eingabe- und Cache-Tarifen und 1,5x Ausgabe bei beiden neu bepreist, was Ultrafast long-context auf 24,00 $ / 1,20 $ / 30,00 $ / 90,00 $ bringt.

• Geschwindigkeit — Standard ist per Definition die Basislinie; Ultrafast ist die oberste Stufe, und das einzige modellspezifische Vielfache, das O​penAI veröffentlicht, gehört zu G​PT-6 Astra, nicht zu diesem Modell.

Diese letzte Zeile ist der Vorbehalt, der allem anderen zugrunde liegt, und sie bekommt weiter unten einen eigenen Abschnitt. Zuerst die Jobs.

Job eins: der interaktive Agent. Das ist der, der sich bewegt.

Ein Agenten-Loop, der vierzig Tool-Aufrufe hintereinander ausführt, ist der Käufer, für den diese Stufe gebaut wurde, denn die Generierungszeit jedes Turns bestimmt den nächsten Turn, und der Nutzer sieht zu. Nehmen wir eine Sitzung, die pro Turn 30.000 Input-Tokens sendet und 1.500 Output-Tokens empfängt, über 40 Turns hinweg – insgesamt 1.200.000 Input-Tokens und 60.000 Output-Tokens, wobei jede Anfrage deutlich unter der 272.000-Token-Schwelle für die Neubepreisung liegt.

• Standard — 1,2 Millionen Eingabe-Tokens zu 2,00 $ sind 2,40 $; 60.000 Ausgabe-Tokens zu 10,00 $ sind 0,60 $. Drei Dollar für den Durchlauf.

• Ultrafast — 1,2 Millionen Input-Tokens bei 12,00 $ ergeben 14,40 $; 60.000 Output-Tokens bei 60,00 $ ergeben 3,60 $. Achtzehn Dollar für den Durchlauf.

• Das Delta — $15.00, um den Großteil der Generierungslatenz aus einem Job zu entfernen, dessen Ausgabe ansonsten identisch ist.

Ob 15,00 $ günstig ist, ist eine Frage der Minuten, nicht der Tokens. Wenn die Sitzung mit Standard zwanzig Minuten und mit Ultrafast vier Minuten dauert, haben Sie sechzehn Minuten für fünfzehn Dollar gekauft – etwa 0,94 $ pro Minute –, und der Vergleich, der zählt, gilt dem, was diese sechzehn Minuten Sie kosten. Ein Entwickler zu Vollkosten ist mehr als einen Dollar pro Minute wert, im Human-in-the-Loop-Fall ist die Antwort daher eindeutig. Ein Agent, der in einer Warteschlange für menschliche Prüfung wartet, ist pro Minute nichts wert, und in diesem Fall sind dieselben sechzehn Minuten kostenlose sechzehn Minuten, und die Stufe ist Verschwendung.

Das ist der Test, den man anwenden muss, und er hat nichts mit dem Modell zu tun. Auf wessen Uhr liegt die Generierungszeit, und was ist diese Uhr wert? Wenn die Antwort „auf der einer Person, und jede Menge wert“ lautet, ist Ultrafast das Billigste auf Ihrer Rechnung. Wenn die Antwort „auf der eines Schedulers, und nichts wert“ lautet, ist es das Teuerste.

A generated cost card headed 'One run, four configurations', listing Batch at half of Standard for $1.50, standard GPT-6.1 Sol at $3.00, GPT-6.1 Ultrafast at $18.00 and Ultrafast above 272,000 input tokens at $24.00 input and $90.00 output per 1M, with a note that all four describe the same 40-turn agent of 1,200,000 input and 60,000 output tokens and a footer reading that prices are OpenAI list rates and the arithmetic is ours.

Job zwei: der nächtliche Bewertungsdurchlauf. Das ist ein Nein.

Ein Eval-Sweep schickt ein paar tausend Prompts durch das Modell, schreibt die Ergebnisse in den Objektspeicher, und am Morgen liest ein Mensch die Tabelle. Sein Latenzbudget bemisst sich nicht in Minuten, sondern in einer Nacht. In der Pipeline wartet nichts auf das Modell außer der nächsten Anfrage in der Warteschlange.

Ultrafast beseitigt nicht die Wall-Clock-Kosten des Sweeps, denn die Wall-Clock-Kosten des Sweeps sind eine Scheduling-Entscheidung, die du getroffen hast, nicht ein Latenzproblem, das du hast. Was es bewirkt, ist, die Rechnung zu versechsfachen und den Job auf ein Budget zu verschieben, das eigene Rate-Limits pro Organisation mitbringt — was bei einem unbeaufsichtigten Batch ein echtes Risiko ist, denn eine Rate-Limit-Obergrenze ist genau der Fehlermodus, den ein großer Sweep trifft, und die Tier-Seite veröffentlicht die Zahl nicht.

Und auf derselben Preiskarte gibt es einen Tarif, der für diese Aufgabe bepreist ist und in die entgegengesetzte Richtung bepreist wird. Batch und Flex kosten halb so viel wie Standard, und die Batch-Verarbeitung der API ist genau für diese Form ausgelegt: große Volumina, keine interaktive Deadline, asynchron zurückgegebene Ergebnisse. Nach den obigen Zahlen kostet dieselbe Token-Gesamtmenge über 40 Runden bei Batch 1,50 $ gegenüber 18,00 $ bei Ultrafast. Das ist eine 12-fache Spanne für eine Aufgabe, die den Unterschied nicht erkennen kann.

Der Fehler, den es zu vermeiden gilt, ist, Ultrafast als das allgemeine Upgrade zu behandeln. Es ist die oberste Sprosse einer Leiter – Batch und Flex bei der Hälfte, Standard bei eins, Fast bei zwei, Ultrafast bei sechs – und eine Leiter ist kein Menü besserer Versionen. Die falsche Sprosse zu wählen, kostet mehr Geld als das falsche Modell zu wählen.

Job drei: der Batch-Zusammenfasser. Auch ein Nein, aus einem anderen Grund.

Angenommen, die Workload ist ein nächtlicher Durchlauf über einen Dokumentenspeicher: lange Eingaben, kurze Ausgaben, kein Mensch im Prozess und eine SLA, die in Stunden gemessen wird. Hier wirkt sich der Token-Mix gegen Ultrafast aus statt für Ultrafast.

Die Schwelle von 272.000 Token ist der Grund dafür. In beiden Tarifstufen wird bei einer einzelnen Anfrage, die sie überschreitet, die gesamte Anfrage neu bepreist – jedes Eingabe-Token, jeder Cache-Lesevorgang, jedes Ausgabe-Token – mit dem Doppelten der Eingabe- und Cache-Sätze und dem 1,5-Fachen der Ausgabe. Long-context Ultrafast kostet daher 24,00 $ pro Million Eingabe-Token und 90,00 $ pro Million Ausgabe-Token, und die Neubepreisung wird durch die Anfrage ausgelöst, nicht durch den Anteil, der die Grenze überschreitet. Ein Dokumenten-Zusammenfasser, der gelegentlich eine Anfrage mit 300.000 Eingabe-Token abschickt, zahlt den Long-Context-Satz für alle 300.000 davon.

Das Cache-Verhalten verstärkt das. Gecachte Lesevorgänge sind die günstigsten Tokens in diesem Modell und der wirksamste Kostenhebel, und sie skalieren mit der Stufe, statt den Kostenmultiplikator abzufedern – 0,10 US-Dollar pro Million gecachter Eingabe bei Standard, 0,60 US-Dollar bei Ultrafast, beide bei 5 % des Tarifs für ungecachte Eingabe. Es gibt keine Mischung aus gecachten und frischen Tokens, die den Multiplikator abmildert, sodass eine stark optimierte gecachte Pipeline keinen Rabatt aus der Schnellspur erhält. Sie zahlt einfach das Sechsfache einer kleineren Zahl.

Betrachtet man beides zusammen, ist der Summarizer der Fall, in dem der Aufpreis von Ultrafast in absoluten Zahlen am größten und sein Nutzen am geringsten ist. Wenn die Dokumente wirklich lang und die Deadline wirklich in Stunden gemessen wird, ist die richtige Konfiguration Batch oder der normale Standard, und der richtige Einsatz von Ultrafast ist die Schleife mitten in der Entwicklung, in der man den Prompt iterativ anpasst und eine Person auf jede Revision wartet.

Die beiden Kosten, die mit dem Multiple einhergehen

Der sechsfache Satz ist der sichtbare Teil des Preises. Zwei unsichtbare Teile sind in der Produktion wichtiger.

Das erste ist das Rate-Limit-Budget. Ultrafast läuft mit eigenen Limits, getrennt von den Standard- und Fast-Budgets, und OpenAI legt sie pro Organisation fest, statt sie auf der Tier-Seite zu veröffentlichen; die Empfehlung lautet, die Limits Ihrer Organisation zu prüfen, bevor Sie den Traffic erhöhen, und sich an ein Account-Team zu wenden, wenn sie angehoben werden müssen. Eine Workload auf Ultrafast umzustellen, bewirkt also zweierlei zugleich: Es vervielfacht die Rechnung und verschiebt die Workload auf eine Obergrenze, die Sie möglicherweise nicht einsehen können. Bei einem unbeaufsichtigten Agenten greift die Obergrenze zuerst.

Das zweite ist die Form der Einsparungen. Ultrafast reduziert die Zwischen-Token-Zeit, nicht die Zeit bis zum ersten Token und nicht die Denkphase. Eine Anfrage, die den größten Teil ihrer Wanduhrzeit mit Nachdenken verbringt, bevor sie überhaupt etwas ausgibt, kann auf Ultrafast umgestellt werden und wirkt trotzdem langsam, weil die Stufe den Teil der Anfrage beschleunigt, der nie der Engpass war. Das ist der Fehlermodus, der Berichte wie „wir haben das Sechsfache bezahlt und es ist genauso schnell“ erzeugt: Es wird eine Anwendung gemessen, deren Latenz irgendwo liegt, wo die Stufe nicht hinreicht. Bevor Sie sich festlegen, messen Sie, wohin die Sekunden tatsächlich gehen — Zeit bis zum ersten Token gegenüber Zwischen-Token-Zeit —, denn die Stufe besitzt nur eine davon.

Warum „schneller“ noch keine Zahl ist, auf die man OpenAI festnageln kann

Ultrafast wird mit „bis zu 8x“ beworben, und die Messung hinter dieser Formulierung gehört zu einem anderen Modell. Der veröffentlichte Satz bezieht sich darauf, dass GPT-6 Astra Ultrafast Token bis zu 8x schneller generiert als GPT-6 Astra im Standardmodus in Codex. Für GPT-6.1 Sol gibt es keinen entsprechenden veröffentlichten Multiplikator, und auch keine unabhängige Stelle hat eine Tokens-pro-Sekunde-Zahl für die Sol-Variante veröffentlicht. Die Dokumentation für diese Stufe beschreibt sie als Verringerung der Zeit zwischen generierten Ausgabe-Tokens und verweist auf eine Preistabelle.

Es ist eine plausible Ausgangsannahme, dass das Vielfache trägt – beide Modelle laufen auf demselben Serving-Stack und der Mechanismus der Stufe ist derselbe –, doch „bis zu“ leistet in diesem Satz echte Arbeit, und eine auf einem Schwestermodell in einem anderen Client gemessene Anbieter-Obergrenze ist nicht die Zahl, die Ihre Workload sehen wird. Dasselbe gilt für die ältere Stufe: Ultrafast gegenüber GPT-5.6 Sol wurde im August 2026 mit „bis zu 14-mal schneller als Standard-Verarbeitung“ in begrenzter Vorschau angekündigt, und die Dokumentation nennt weiterhin Vorschauzugriff, wobei die Ultrafast-Rate-Tabelle genau zwei Zeilen enthält.

Worauf Sie OpenAI festnageln können, ist der Preis, denn der Preis wird veröffentlicht und gilt für jedes Token. Das heißt, die Entscheidung, um die es auf dieser Seite geht, ist eine Entscheidung über Ihr eigenes Latenzbudget, nicht über die Geschwindigkeitsbehauptung des Anbieters.

A generated decision card headed 'Which lane for which job' with three columns: 'Interactive agent' carrying the rows 'A person is waiting' and 'Ultrafast: yes', 'Overnight eval sweep' carrying 'Nobody is waiting' and 'Batch: half of Standard', and 'Long-document batch pass' carrying '272,000-token repricing line' and 'Standard: yes', footnoted to OpenAI's published per-million rates and tier documentation, October 2026.

Testen, ohne zu committen, und zurückwechseln

Der Tarif ist für alle API-Nutzer verfügbar, daher ist der kostengünstigste Weg, die Wall-Clock-Frage zu beantworten, dasselbe Prompt-Set zweimal auszuführen – einmal mit aktiviertem und einmal mit deaktiviertem Feld – und die Token-Anzahlen sowie die Zeitmessungen zu vergleichen. Zwei Dinge sollten Sie in diesem Test beachten: ob Ihre Anfragen die 272.000-Token-Grenze überschreiten und ob die Zeit bis zum ersten Token die Zeit zwischen den Token dominiert. Eines von beiden kann dazu führen, dass der Versuch wie ein Nullergebnis aussieht, obwohl der Tarif genau wie angekündigt funktioniert.

Das Zurückschalten ist ein Request-Feld, keine Migration, und die Standard-Lane wird zum eigenen Listenpreis des Anbieters über OrcaRouter als openai/gpt-6.1-sol bereitgestellt — 2,00 $ pro Million Input-Tokens und 10,00 $ pro Million Output-Tokens, 0 % Aufschlag, wobei der Preis des Anbieters direkt durchgereicht wird, sodass eine Preisänderung eines Anbieters am selben Tag bei uns live ist. Ultrafast selbst ist nichts, was wir verkaufen; es ist ein Service-Tier-Flag, das über Ihr eigenes O​penAI-Konto abgerechnet wird, und das zu sagen ist nützlicher, als etwas anderes anzudeuten. Was ein einzelner Key tatsächlich bietet, ist die Standard-Lane plus der Rest des Katalogs hinter einem einzigen O​penAI-kompatiblen Endpoint, und automatisches Failover über Anbieter hinweg, was es wert ist, wenn Sie kurz davor stehen, einem Produktions-Agenten ein teures Tier voranzustellen und die Standard-Lane eher als Routing-Entscheidung denn als Code-Änderung haben möchten.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128,000 maximum output tokens, text and image input with text output, input price $2.00 and output price $10.00 per 1M tokens, with the page's code sample and EN language toggle visible in the header.

Ein praktischer Hinweis zur Schnellspur, der nicht für die günstige gilt: WebSockets. O​penAI empfiehlt für Ultrafast eine persistente WebSocket-Verbindung, die für einen Agenten, der viele sequenzielle Aufrufe durchführt, die richtige Form ist und für ein Batch-Skript mit einer Anfrage pro Prozess die falsche. Wenn es sich bei Ihrem Client um die zweite Art handelt, ist der vom Tarif selbst empfohlene Transportweg ein weiterer Grund dafür, dass der Nachtjob woanders hingehört.

Wenn sich das Urteil ändert

Drei Entwicklungen würden Jobs von der „Bleiben“-Liste streichen. Ein veröffentlichtes Ultrafast-Ratenlimit für GPT-6.1 Sol würde das Obergrenzenrisiko aus dem Batch-Fall entfernen. Eine veröffentlichte oder unabhängig reproduzierte Geschwindigkeitsmessung für die Sol-Stufe würde es Ihnen ermöglichen, die Wall-Clock-Ersparnis einzuplanen, statt sie anzunehmen. Und eine Rabattstufe auf der Überholspur — ein Ultrafast-Äquivalent zu Batch, bei dem die Stufe weiterhin schnell, aber nicht sechsmal so teuer ist — würde die Wirtschaftlichkeit jedes Jobs in der Mitte der Leiter verändern.

Nichts davon existiert heute. Was existiert, ist eine Stufe, die genau das ist, was sie zu sein vorgibt: derselbe GPT-6.1 Sol, anders getaktet, zum sechsfachen Preis in jeder Zeile. Verschiebe den interaktiven Agenten, lass die anderen beiden in Ruhe und miss, wo deine Sekunden tatsächlich hingehen, bevor du entscheidest, welche die deine ist.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert