Eine generierte Titelkarte mit der Schlagzeile 'Ultrafast vs. Standard' und dem Untertitel 'Ein GPT-6.1 Sol-Checkpoint, zwei Tarifkarten', mit Chips mit der Aufschrift '$2.00 / $10.00 Standard' und '$12.00 / $60.00 Ultrafast', einem '6x'-Badge und der Zeile 'dieselben Token, sechsmal die Rechnung', über einer Fußzeile, die darauf hinweist, dass die Preise OpenAIs eigene Listenpreise für Kurzkontext-Anfragen sind.
Engineering & Research

GPT-6.1 Sol Ultrafast vs. GPT-6.1 Sol: Die Überholspur kostet mehr als das Frontier-Modell

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Aktivieren von GPT-6.1 Sol Ultrafast macht GPT-6.1 Sol den teuersten Weg in der G​PT-6-Familie, ein Token zu generieren, das nicht von G​PT-6 Astra erzeugt wird. Das ist der ganze Vergleich in einem Satz, und es ist das Gegenteil von dem, was „schnelle Option auf dem günstigeren Modell“ zu bedeuten scheint. Ultrafast kostet das Sechsfache von Standard — $12,00 pro Million Input-Tokens und $60,00 pro Million Output-Tokens, gegenüber $2,00 und $10,00 — was einen schnellen GPT-6.1 Sol-Aufruf über G​PT-6 Astra bei normaler Geschwindigkeit setzt, über GPT-5.6 Sol bei normaler Geschwindigkeit, und innerhalb eines Rundungsfehlers von nichts anderem auf der Preisliste.

Nichts davon macht die Stufe zu einem Fehler. Es macht sie zu einem Latenz-Kauf, und die Frage, die diese Seite beantwortet, ist, wann die Latenz diesen Preis wert ist und wann nicht. Die beiden verglichenen Produkte sind derselbe Checkpoint und dieselben Antworten; der gesamte Unterschied besteht in einem Service-Tier-Flag und einer Rechnung.

Dasselbe Modell, und es lohnt sich, genau zu sagen, wie gleich.

There is no Ultrafast checkpoint to download, no separate context limit, no different knowledge cutoff. You send model: "gpt-6.1-sol" with service_tier: "ultrafast" and O​penAI schedules the request differently; send it without the flag and you get Standard. Everything a developer actually codes against is identical:

• Modell-ID — gpt-6.1-sol für beide, ein Standard-Snapshot, nichts Datumsgebundenes zum Anpinnen

• Kontext — 1.050.000-Token-Fenster, maximale Eingabe 922.000 Token, maximale Ausgabe 128.000 Token, für beide

• Wissensstichtag — 30. April 2026, für beide

• Reasoning-Leiter — niedrig, mittel (Standard), hoch, xhigh, max für beide; keine und minimal werden auf beiden nicht unterstützt

• Modalitäten — Text und Bild als Eingabe, Text als Ausgabe, für beide

• Tool-Oberfläche — dieselbe Websuche, Dateisuche, Bilderzeugung, Code-Interpreter, gehostete Shell, Patch-Anwendung, Skills, Computer-Nutzung, MCP und Toolsuche, über die Responses API, für beide

• Preis — 2,00 $ / 0,10 $ zwischengespeichert / 2,50 $ Cache-Schreibvorgang / 10,00 $ Ausgabe pro Million Token vs. 12,00 $ / 0,60 $ / 15,00 $ / 60,00 $

• Lange Prompts über 272K Eingabe-Tokens — die gesamte Anfrage wird mit 2x-Eingabe- und Cache-Raten sowie 1,5x-Ausgabe bei beiden neu berechnet, sodass Ultrafast Long-Context bei 24,00 $ / 1,20 $ / 30,00 $ / 90,00 $ landet

• Speed — Standard is Standard; Ultrafast is the top of the tier ladder, and the only published model-specific multiple in O​penAI's documentation belongs to G​PT-6 Astra, not this model

That last line is the honest caveat on the whole article. O​penAI's docs say G​PT-6 Astra Ultrafast "generates tokens up to 8x faster than G​PT-6 Astra in Standard mode in Codex". GPT-6.1 Sol's documentation describes the tier, lists its rate limits, and says it supports US and EU data residency — it does not publish a multiple. If you are buying this because you expect eight times the speed, you are extrapolating from a sibling model, and no independent measurement exists for either.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context stepping to $120.00 / $12.00 / $150.00 / $450.00 in long context, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, with the page's note that short context means up to 272K input tokens.

Das durchgerechnete Beispiel: Was ein Agenten-Turn auf jeder Spur kostet

Nimm einen Coding-Agenten mit auf eine echte, wenig glamouröse Schleife: Jede Runde liest er erneut 40.000 Tokens Repository-Kontext und gibt 6.000 Tokens Reasoning und Patch aus, und die Aufgabe dauert zwölf Runden. Gehe davon aus, dass nichts zwischengespeichert ist – das ist der pessimistische Fall und derjenige, der die Stufe bei der Eingabe am schlechtesten aussehen lässt; dann mach es erneut mit zwischengespeichertem Kontext, denn genau das tut ein Agent mit Prompt-Caching tatsächlich.

• Standard, ohne Cache — 40.000 Input-Tokens kosten 0,08 $ und 6.000 Output-Tokens kosten 0,06 $, also 0,14 $ pro Durchgang und 1,68 $ für die Aufgabe

• Ultraschnell, ungecacht — 0,48 $ Eingabe und 0,36 $ Ausgabe pro Turn, 0,84 $ pro Turn, 10,08 $ für die Aufgabe

• Standard, gecachter Kontext — die 40.000 Tokens sinken auf $0.10 pro Million, sodass der Turn $0.064 kostet und die Aufgabe kostet $0.77

• Ultraschneller, gecachter Kontext — gecachte Eingabe kostet in dieser Stufe 0,60 $ pro Million, der Turn kostet also 0,384 $ und die Aufgabe 4,61 $

Der Multiplikator beträgt in jeder Zeile sechs, und genau das ist der Punkt: Caching schützt dich nicht vor der Stufe, sondern skaliert mit ihr. Was die Zahlen erkaufen, ist eine Aufgabe, die in ungefähr einem Achtel der tatsächlich verstrichenen Zeit abgeschlossen ist, und die gesamte Beurteilung läuft darauf hinaus, ob es 2,40 $ bis 8,40 $ pro Aufgabe wert ist, diese Wartezeit zu beseitigen.

Hier ist jedoch der Vergleich, der für die meisten Teams den Ausschlag geben dürfte. Rechnet man dieselben Token-Mengen auf GPT-6 mit Standard durch — 0,40 $ Input und 0,30 $ Output pro Turn, 8,40 $ für die Aufgabe. Ultrafast auf GPT-6.1 Sol ist pro Token teurer als das Frontier-Modell bei normaler Geschwindigkeit. Das ist kein Argument gegen die Stufe; es ist ein Argument darüber, auf welche Dimension man optimiert. Wenn das Problem die Antwortqualität ist, sind Sie mit Astra im Standard besser dran. Wenn das Problem ist, dass ein Mensch auf einen Spinner starrt, helfen weder Astra noch Sol — aber die Stufe wird es.

Eine Einschränkung, bevor jemand auf Grundlage dieser Zahlen ein Budget erstellt: Die Token-Anzahlen sind bei derselben Aufgabe nicht über alle Modelle hinweg konstant. Dies sind Vergleiche pro Token bei identischen angenommenen Token-Anzahlen, und das ist der einzige Vergleich, den die Preisliste unterstützt. Messen Sie Ihre eigenen Traces.

A generated cost card headed 'One agent turn, four ways', comparing GPT-6.1 Sol Standard at $0.14 per turn and $1.68 over twelve turns uncached and $0.064 and $0.77 with prompt caching, GPT-6.1 Sol Ultrafast at $0.84 and $10.08 uncached and $0.384 and $4.61 cached, and GPT-6 Astra Standard at $0.70 and $8.40 on the same token counts, over a footer reading that these are OpenAI list rates per 1M tokens for short-context requests and that the per-turn and per-task figures are the article's arithmetic on those rates rather than vendor benchmarks.

Der Tarif, den Sie wahrscheinlich eigentlich wollen, ist Fast

Between Standard and Ultrafast there is a middle lane, and on GPT-6.1 Sol it is the one most teams should be pricing first. Fast mode runs at twice Standard — $4.00 input and $20.00 output per million tokens — for the same checkpoint, and O​penAI renamed Priority processing to Fast mode on July 30, 2026, so it has been stable for months. It is one third of Ultrafast's rate for a speed-up that the tier documentation treats as the ordinary supported case.

Ultrafast ist die richtige Antwort, wenn die Latenz das Produkt ist und das Token-Volumen klein ist: ein interaktiver Agent, der seinen nächsten Schritt nicht gehen kann, bevor die vorherige Ausgabe eintrifft, eine Entwickler-Schleife, in der sich vierzig kurze Turns summieren, eine Demo, in der die Pause der Fehlermodus ist. Fast ist die richtige Antwort, wenn du ein allgemein schnelleres Modell möchtest und nicht bereit bist, das Dreifache für den letzten Zuwachs zu zahlen. Batch und Flex bleiben die richtige Antwort für alles mit einer in Stunden gemessenen Deadline — sie sind die Hälfte von Standard, nicht das Doppelte.

Speed is also not the only lever. If the latency you are trying to remove is the model thinking rather than the model typing, the tier does nothing for you: Ultrafast compresses token generation, and O​penAI's own description is that it "reduces the time between generated output tokens". A request that spends most of its wall-clock in reasoning will arrive sooner by a fraction of what the price suggests. Move the reasoning effort down a notch and see what that does to the bill before you move the tier up six.

Wo die Standard-Lane zu Hause ist

Standard GPT-6.1 Sol is on OrcaRouter as openai/gpt-6.1-sol at the provider's own $2.00 input and $10.00 output per million tokens, served at 0% markup — the vendor's list price passed through, so a rate change from O​penAI shows up in your usage the same day rather than at the next renewal. The same key reaches more than 200 models, so the standard-lane traffic you keep after the Ultrafast experiment can sit behind one integration next to whatever else the task needs, with automatic failover if a provider degrades and a routing DSL for composing models into a single call.

Ultrafast itself is not something we can sell you, and it would be dishonest to phrase it any other way. It is a service-tier flag billed by O​penAI against your own account, not a separately routable model — we host the checkpoint, not the tier. Run the tiered traffic on your vendor key; route the volume through us.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s and 313.9M tokens of traffic, with the page's code snippet and EN language toggle visible in the header.

Wer sollte es umschalten?

Lass es eingeschaltet, wenn eine Person oder ein automatisierter Konsument bei jeder Antwort blockiert wird und das Token-Volumen pro Aufgabe klein genug ist, dass die absolute Rechnung im niedrigen Dollarbereich bleibt – die obige Rechnung veranschlagt eine Agentenaufgabe mit zwölf Runden auf etwa 10 US-Dollar, was eine günstige Lösung ist, wenn dadurch zwei Minuten menschlichen Wartens ersetzt werden, und eine teure, wenn dadurch überhaupt nichts ersetzt wird.

Lass es aus, wenn deine Workload geplant, gebatcht, in großen Mengen ausgewertet oder nachts erneut ausgeführt wird. Aus ist ebenfalls richtig, wenn du auf Qualität aus bist: Das Sechsfache an Ausgaben bringt bei diesem Modell keinerlei zusätzliche Fähigkeiten, und dasselbe Geld auf GPT-6 Astra im Standard-Tarif gerichtet ist ein echtes Upgrade statt eines schnelleren Spinners. Ultrafast verkauft Zeit, und Zeit ist nur 60 $ pro Million Token wert – für die Workflows, die tatsächlich darauf warten.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert