Redaktionelle Flachvektor-Illustration für einen Hero-Bereich eines Technologie-Blogs über ultraschnelle KI-Inferenz: ein großer abgerundeter Modell-Chip in Tiefblau mit weichem Cyan-Schein auf hellem Hintergrund, daneben ein stilisierter Blitz und ein Geschwindigkeitsmessgerät, dessen Nadel auf Maximum steht, schnelle Token-Ströme, die entlang einer horizontalen Geschwindigkeitslinie mit Bewegungslinien rasen, sowie eine kleine Stoppuhr. Weißer Hintergrund mit weichen Blau-Cyan-Verlaufselementen und einem dezenten warmen Glanzlicht; minimale flache Linien-Symbole; saubere, moderne, geometrische serifenlose Typografie; kein lesbarer Text, keine Buchstaben, keine Wörter, kein Wasserzeichen, keine Logos Dritter, 16:9-Komposition.
Guides & Insights

GPT-5.6 Sol Ultrafast: 14-fache Geschwindigkeit, 750 Tok/s — CS-4 Berichten zufolge ~1.300, noch kein Preis

Autor

Gideon Frost

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

GPT-5.6 Sol Ultrafast mode ist die hardwarebeschleunigte Serving-Stufe für das Flaggschiff – dasselbe vollständige GPT-5.6-Sol-Modell läuft auf Cerebras-Wafer-Scale-Chips statt auf GPU-Clustern und liefert bis zu 14× die Geschwindigkeit der Standardverarbeitung sowie bis zu 750 Ausgabe-Tokens pro Sekunde auf der Stufe, die OpenAI im August angekündigt hat. Am 18. August 2026 enthüllte Cerebras das System der nächsten Generation, CS-4, auf das diese Stufe aufbaut, und ein früher, unbestätigter Bericht behauptet, dass GPT-5.6 Sol auf CS-4 bereits etwa 1.300 Tokens pro Sekunde serviert. Es ist kein kleineres Modell und keine Destillation: Nur die Hardware und das Scheduling haben sich geändert, die Intelligenz bleibt erhalten. Was es noch nicht hat, ist ein Preis – Stand 19. August 2026 ist Ultrafast eine begrenzte API-Vorschau ohne veröffentlichte Preisliste, sodass die Zahl, mit der Sie heute tatsächlich kalkulieren können, die Standard-Stufe auf der Live-Seite des GPT-5.6-Sol-Modells ist: $5 pro Million Eingabe-Tokens und $30 pro Million Ausgabe-Tokens, ohne Aufschlag durchgereicht. Dieser Artikel behandelt, was der Modus ist, wie schnell die Zahlen wirklich sind – einschließlich der neuen CS-4-Hardware und was noch unbestätigt ist –, was er kostet (einschließlich der ehrlichen Antwort „noch kein Preis“) und was zu tun ist, bis er allgemein verfügbar ist.

Was der Ultrafast-Modus tatsächlich ist

Ultrafast ist eine Serving-Stufe, kein neues Modell. OpenAI kündigte es am 13. August 2026 als erstes Produkt seiner Compute-Partnerschaft mit dem Chip-Hersteller Cerebras aus dem Januar 2026 an – ein Deal, der auf rund 10 Milliarden US-Dollar über drei Jahre beziffert wird. Während die Standard-Inferenz von GPT-5.6 Sol auf GPU-Clustern läuft und viel Zeit damit verbringt, Gewichte zwischen Speicher und Recheneinheiten zu verschieben, lädt Ultrafast die Gewichte des Modells in 44 GB On-Chip-SRAM auf Cerebras' Wafer-Scale-Chips; ein Modell in der Größe von Sol erstreckt sich über mehrere Wafer in Schichten, sodass die Gewichte dort liegen, wo die Rechenleistung ist. Das Ergebnis ist eine Durchsatzobergrenze, die vom Silizium bestimmt wird und nicht von der Speicherbandbreite.

Die Hardware-Geschichte hat sich am 2026-08-18 weiterentwickelt. Bei seiner Supernova-Veranstaltung enthüllte Cerebras den CS-4, das System der nächsten Generation auf Rack-Ebene, das auf der Nexus-Plattform basiert – drei Wafer-Scale-Engine-Chips pro Rack, bis zu 2× der Token-Erzeugungsgeschwindigkeit des bisherigen CS-3 und laut Cerebras mehr als 1.000 Token pro Sekunde bei Modellen mit über 10 Billionen Parametern. Das sind Cerebras' Angaben für ein System im Early Access, das noch nicht allgemein verfügbar ist. Seit der Enthüllung behauptet ein einzelner Beitrag auf X, dass der CS-4 GPT-5.6 Sol bereits mit etwa 1.300 Token pro Sekunde bedient – das entspricht in der Richtung Cerebras' eigenen Zahlen, wurde aber bisher von niemandem bestätigt. Behandeln Sie es als ein frühes Signal: plausibel, unverifiziert und einen erneuten Check wert, bevor Sie die Kapazität darauf planen.

Der Teil, der für deinen Code zählt: die Modell-ID, die Gewichte, das Reasoning-Verhalten und die Ausgabe sind identisch mit dem Standard-GPT-5.6 Sol. OpenAI bezeichnet Ultrafast als „mehr nützliche Arbeit pro Sekunde“ und nicht als Qualitätsstufe, und die Vorschau läuft mit dem vollwertigen Flaggschiff – die Geschwindigkeit entsteht nicht durch den Austausch gegen ein günstigeres Modell. Was sich ändert, ist, wie schnell Tokens erzeugt werden.

Verwechseln Sie Ultrafast nicht mit dem vorhandenen fast mode. Fast mode ist eine separate, kostenpflichtige Stufe auf Standard-Hardware: bis zu etwa 2,5× Ausgabegeschwindigkeit bei einem 2× Aufpreis pro Token ($10 Eingabe / $60 Ausgabe pro 1M), ohne Qualitätsänderung. Ultrafast ist etwas anderes — Cerebras-Hardware, bis zu 14×, und vorerst ohne jeden Preis.

Wie schnell — die Zahlen, die zählen.

Speed card titled 'GPT-5.6 Sol Ultrafast — how fast', sourced to the OpenAI announcement of 2026-08-13 with all speed figures vendor-reported. Three highlight cells read Up to 14x max speedup vs standard, 750 output tokens per second max, and 11h 11m for 2,500 HLE questions. Rows list standard GPT-5.6 Sol as the 1x baseline, fast mode up to ~2.5x at 2x price, Claude Fable 5 on the same HLE set at 78h 27m, GDP-Val end-to-end at 5.6x faster, and 'same model, same quality — hardware only'. Footer: 14x is a maximum, not a guarantee, and none of the speed figures are independently verified yet.

Die in der Schlagzeile genannte Zahl ist 14×, und sie bedarf einer Definition. OpenAI zufolge erzeugt Ultrafast bis zu 750 Ausgabe-Token pro Sekunde, verglichen mit der standardmäßigen GPT-5.6-Sol-Verarbeitung. Das ist eine Durchsatzangabe für Ausgabe-Token, keine pauschale Aussage, dass „alles 14× schneller läuft“ — die End-to-End-Anfragezeit umfasst auch die Eingabeverarbeitung und das eigene Denken des Modells, weshalb 14× als Maximum ausgewiesen ist.

Maximaler Ausgabedurchsatz — bis zu 750 Ausgabe-Token pro Sekunde, laut OpenAIs Ankündigung (2026-08-13).

Im Vergleich zur Standardverarbeitung — bis zu 14× schneller, laut derselben Ankündigung; die tatsächliche Beschleunigung variiert je nach Eingabelänge und Aufgabentyp.

Humanity's Last Exam, 2.500 Fragen — OpenAI/Cerebras berichten, dass GPT-5.6 Sol Ultrafast in 11 Stunden und 11 Minuten fertig war, gegenüber 78 Stunden und 27 Minuten für Claude Fable 5, bei vergleichbarer Genauigkeit. Es handelt sich um Herstellerangaben, und der Vergleich erstreckt sich über die Hardware-Stacks zweier Anbieter — als Richtwert zu verstehen, nicht als Urteil.

GDP-Val, End-to-End — Cerebras berichtet von insgesamt 5,6× höherer Leistung ohne messbaren Qualitätsverlust. Ebenfalls vom Anbieter gemeldet.

Schnellmodus-Basislinie — die bestehende käufliche Geschwindigkeitsstufe erreicht maximal etwa die 2,5-fache Ausgabegeschwindigkeit für einen doppelten Preisaufschlag.

• CS-4, die nächste Hardware — Cerebras behauptet, dass das CS-4-Rack bei Modellen mit über 10 Billionen Parametern mehr als 1.000 Token pro Sekunde liefert, bis zu 2× der Token-Erzeugung des CS-3. Ein unbestätigter Community-Bericht beziffert GPT-5.6 Sol auf CS-4 mit etwa 1.300 Token pro Sekunde — gleiche Richtung, aber noch nicht von OpenAI oder Cerebras bestätigt.

Ein Wort der Vorsicht, bevor Sie die 14× zitieren: Unabhängige Berichterstattung über den Launch führt einen ~11×-Vergleich der Generierungsgeschwindigkeit gegenüber Claude Fable 5 an, während Cerebras' eigene Zahlen auf ~7× für die gesamte Testzeit bei demselben Lauf schließen lassen – der Unterschied liegt darin, welchen Teil einer Workload man misst. Dieselbe Sorgfalt gilt für das CS-4-Geschwindigkeitssignal: Die Angabe von ~1,300 token/s stammt von einem einzelnen X-Post, und weder OpenAI noch Cerebras haben sie bestätigt. All das sind Hersteller- oder Community-Zahlen, die diese Woche verkündet wurden, und keine davon ist bisher unabhängig verifiziert. Behandeln Sie sie als Behauptungen, nicht als Benchmark-Urteile.

Was es kostet — und die ehrliche Lücke

Price card titled 'What GPT-5.6 Sol costs today — 2026-08-18', listing published input/output rates per 1M tokens. Three highlight cells read Standard $5.00 / $30.00, Fast mode $10.00 / $60.00, and Ultrafast price TBD in preview. Rows list prompt cache read $0.50, cache write $6.25, long-context over ~272K $10.00 / $45.00, batch API $2.50 / $15.00, and context window ~1.05M with 128K max output. Footer: Ultrafast has no published price as of 2026-08-18 — standard and fast mode are what you can buy today.

Hier ist der Stand der Preisfrage am 19.08.2026, klar ausgedrückt: Ultrafast hat keinen veröffentlichten Preis. OpenAI hat keinen angekündigt, und die Vorschau erscheint auf keiner öffentlichen Preistabelle. Berichte, dass Early-Access-Plätze gebündelt oder kostenlos seien, sind Spekulation, keine Politik – und bis OpenAI die Preisstufe festlegt, ist jede Zahl zu „GPT-5.6 Sol Ultrafast Kosten“, die Sie anderswo finden, eine Vermutung.

Was Sie heute bepreisen können, ist der Rest der GPT-5.6 Sol-Linie, verifiziert anhand der veröffentlichten Preise von OpenAI, Stand 2026-08-18:

Standard GPT-5.6 Sol — 5,00 $ Eingabe / 30,00 $ Ausgabe pro 1 Mio. Tokens. Die Basisversion, die Sie jetzt sofort aufrufen können.

Schnellmodus — $10.00 / $60.00, ein 2-facher Aufpreis für bis zu etwa 2,5-fache Ausgabegeschwindigkeit. Das kommt einer Geschwindigkeitsstufe, die man tatsächlich kaufen kann, am nächsten.

Prompt-Cache lesen — $0.50 pro 1M (90 % günstiger als neuer Input); Cache-Schreibvorgänge kosten $6.25 pro 1M.

Langkontext-Stufe — Eingaben über etwa 272.000 Token kosten 10,00 $ / 45,00 $.

Batch API — 2,50 $ / 15,00 $, pauschal 50 % Rabatt bei einer Bearbeitungszeit von etwa 24 Stunden.

Zur Einordnung des zu erwartenden Aufpreises: Der schnelle Modus hat den Präzedenzfall gesetzt – 2× der Standardsatz für 2,5× die Geschwindigkeit. Wenn Ultrafast einer ähnlichen Kurve folgt, wird es deutlich über den Standardpreisen von 5 $ / 30 $ liegen – und die Kommentare zur Vorschau erwarten genau das, weil die Cerebras-Waferkapazität knapp und teuer ist. Aber ein erwarteter Aufpreis ist kein Preis. Plane auf Basis von Standard-Sol oder dem schnellen Modus, bis eine Preisliste vorliegt.

Wie man es verwendet — die Vorschau-Realität

Access ist die zweite ehrliche Lücke. Ultrafast ist über die OpenAI-API für eine ausgewählte Kundengruppe auf Wartelistenbasis verfügbar, angekündigt am 13.08.2026, wobei OpenAI erklärte, dass der Zugang „mit wachsender Kapazität“ erweitert werde. Es gibt kein Datum für die allgemeine Verfügbarkeit. Die angekündigten Preview-Kohorten sind Programmierung, Handel, Finanzforschung, Support und andere interaktive Workloads – Teams, deren Agenten viele Aufrufe pro Anfrage tätigen und bei denen die Antwortlatenz der Engpass ist. Jane Street, Rogo und Podium gehören zu den namentlich genannten frühen Testern.

Das Nutzungsmuster, für das es entwickelt wurde: Incident Response (Lesen von Logs, Traces und Diffs, während eine Störung live ist), Finanzrecherche und Betrugserkennung bei Streaming-Daten, Echtzeit-Kundensupport und Sprache (wo eine halbe Sekunde Stille als Störung wahrgenommen wird), E-Commerce-Checkout und die Komprimierung nächtlicher Recherche-Batches in interaktive Sitzungen. Wenn Ihre Workload ein einzelnes Chat-Gespräch ist, spielt der 14×-Faktor eine weitaus geringere Rolle als bei einer 40-Aufruf-Agentenschleife.

Was Sie heute tun können — die praktische Antwort

The OrcaRouter model page for openai/gpt-5.6-sol, showing the $5.00 per million input and $30.00 per million output pricing, the ~1.05M-token context window, 128K max output, and the vision, tools and JSON badges.

Während Ultrafast in der Vorschau ist, ist das volle GPT-5.6 Sol bereits live — und bei OrcaRouter wird der Standard-Tier zum Provider-Preis mit $0-Aufschlag pro Token angeboten, als Modell-ID openai/gpt-5.6-sol über den OpenAI-kompatiblen Endpoint unter api.orcarouter.ai/v1. Wenn Sie bereits einen OpenAI-Client haben, ist die Migration eine Änderung von Base-URL und Modell-ID; sonst nichts. Derselbe Schlüssel und derselbe Endpoint tragen 200+ Modelle, sodass Sol neben GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 und den Open-Weight-Modellen steht, mit denen Sie es vergleichen würden — und Sie können nach Schwierigkeitsgrad routen, statt jedes einzelne neu zu integrieren.

Zwei Besonderheiten von OrcaRouter sind auf einer Geschwindigkeitsseite erwähnenswert. BYOK: Bringen Sie Ihren eigenen OpenAI-Schlüssel mit, und OpenAI stellt Ihnen direkt zu seinen eigenen Tarifen in Rechnung — OrcaRouter addiert $0 pro Token und hält Ihre Anbieter-Ratenlimits und Guthaben intakt. Guardrails: Der PII Shield und die Inhaltsrichtlinie werden vor der Abrechnung ausgeführt, sodass eine blockierte Anfrage einen sauberen 400-Status zurückgibt und nie berechnet wird. Die Agent Firewall bewertet Tool- und MCP-Aufrufe, bevor sie ausgeführt werden. Wenn — und falls — Ultrafast zu einem routbaren Preis die allgemeine Verfügbarkeit erreicht, ist das Einbinden in denselben Endpoint nur eine Änderung der Modell-ID; das Setup, das Sie heute aufbauen, bleibt erhalten.

Die ehrliche Grenze — wenn Ultrafast nicht die Antwort ist

Vier Stellen, an denen die 14×-Geschichte nicht stichhaltig ist – planen oder budgetieren Sie daher nicht anhand einer Zahl, die nicht gesichert ist:

14× ist ein Maximum, keine Garantie. Es ist eine Obergrenze für den Ausgabedurchsatz auf Cerebras-Hardware; die Ende-zu-Ende-Latenz umfasst weiterhin die Eingabeverarbeitung, die Denkzeit des Modells und dein eigenes Netzwerk. Ein Prompt mit hohem Denkaufwand kann den Großteil seiner tatsächlichen Laufzeit mit Denken verbringen, wobei die beworbene Beschleunigung schrumpft.

Es hat keinen Preis und kein GA-Datum. Stand 19.08.2026 kann man Ultrafast nicht kaufen – man kann nur Vorabzugriff anfragen, und die dahinterstehende CS-4-Hardware befindet sich im Early Access und ist nicht allgemein verfügbar. Kalkulieren Sie mit dem Standard-Sol (5 $ / 30 $) oder dem schnellen Modus (10 $ / 60 $), und behandeln Sie jeden Ultrafast-Preis, den Sie online sehen, als unbestätigt.

Die Benchmarks werden von den Anbietern gemeldet. Die 11-stündige HLE-Ausführung und der 5,6-fache GDP-Val-Wert sind OpenAI/Cerebras-Angaben aus der Ankündigung; unabhängige Schätzungen reichen von etwa 7× bis 11×, je nachdem, was gemessen wird. Hinzu kommt das CS-4-Geschwindigkeitssignal: Die Angabe von ~1.300 Token/s für GPT-5.6 Sol auf CS-4 stammt von einem einzelnen X-Beitrag und hat keine unabhängige Bestätigung. Keiner dieser Werte wurde bisher unabhängig verifiziert.

Es wird keinen Engpass beheben, den Sie nicht haben.Wenn Ihre Agenten wegen Ihrer eigenen Orchestrierung, Tool-Latenz oder eingabeintensiver Prompts langsam sind, verschiebt ein schnellerer Ausgabepfad das Tail nur geringfügig. Die Tarifwahl — GPT-5.6 Sol bei $5 / $30 gegenüber GPT-5.6 Terra bei $2 / $12 gegenüber GPT-5.6 Luna bei $0.20 / $1.20 — wirkt sich immer noch stärker auf Ihre Rechnung aus als jede Geschwindigkeitsstufe.

Unterm Strich. GPT-5.6 Sol Ultrafast ist die schnellste Serving-Stufe, die OpenAI für sein Flaggschiff herausgebracht hat — die gleichen Gewichte auf Cerebras-Hardware, bis zu 14× Durchsatz und 750 Ausgabe-Token pro Sekunde auf der angekündigten Stufe. Cerebras' neuer CS-4 (vorgestellt am 2026-08-18) treibt GPT-5.6 Sol Berichten zufolge auf ~1.300 Token pro Sekunde, aber diese Zahl ist ein einzelner unbestätigter X-Post. Stand 2026-08-19 ist Ultrafast eine Wartelisten-Vorschau ohne öffentlichen Preis. Wenn du nach einer Zahl für deine Budgetplanung suchst, ist die ehrliche Antwort, dass es noch keine gibt. Standard GPT-5.6 Sol für $5 / $30 ist das, was du heute abrufen kannst, der Schnellmodus für $10 / $60 ist die käufliche Geschwindigkeitsstufe, und OrcaRouter leitet beide ohne Aufschlag über deinen eigenen Schlüssel weiter. Bau das Routing jetzt auf — und wenn Ultrafast einen Preis und ein Datum bekommt, ist es nur eine Modell-ID-Änderung entfernt.

Bis Ultrafast einen Preis bekommt, ist das volle GPT-5.6 Sol live auf GPT-5.6 Sol on OrcaRouter zu $5 / $30 pro Million Tokens, ohne Aufschlag, bereit für Ihren eigenen Schlüssel.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert

© 2026 OrcaRouter

Für Anbieter

Du betreibst eine Inferenz-Plattform? Bring deine Modelle auf OrcaRouter.

providers@orcarouter.ai

Community beitreten

Discordsupport@orcarouter.aiXGitHubYouTube