
GPT-5.6 Sol Ultrafast: 14-fache Geschwindigkeit, 750 Tok/s — CS-4 Berichten zufolge ~1.300, noch kein Preis
- z-aiNEUZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianNEUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Intelligenz68Coding
- qwenNEUQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNEUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokNEUSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaNEUMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenz77Coding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenz77Coding
- grokxAI: Grok 4.52026-07-0856Intelligenz72Coding
GPT-5.6 Sol Ultrafast mode ist die hardwarebeschleunigte Serving-Stufe für das Flaggschiff – dasselbe vollständige GPT-5.6-Sol-Modell läuft auf Cerebras-Wafer-Scale-Chips statt auf GPU-Clustern und liefert bis zu 14× die Geschwindigkeit der Standardverarbeitung sowie bis zu 750 Ausgabe-Tokens pro Sekunde auf der Stufe, die OpenAI im August angekündigt hat. Am 18. August 2026 enthüllte Cerebras das System der nächsten Generation, CS-4, auf das diese Stufe aufbaut, und ein früher, unbestätigter Bericht behauptet, dass GPT-5.6 Sol auf CS-4 bereits etwa 1.300 Tokens pro Sekunde serviert. Es ist kein kleineres Modell und keine Destillation: Nur die Hardware und das Scheduling haben sich geändert, die Intelligenz bleibt erhalten. Was es noch nicht hat, ist ein Preis – Stand 19. August 2026 ist Ultrafast eine begrenzte API-Vorschau ohne veröffentlichte Preisliste, sodass die Zahl, mit der Sie heute tatsächlich kalkulieren können, die Standard-Stufe auf der Live-Seite des GPT-5.6-Sol-Modells ist: $5 pro Million Eingabe-Tokens und $30 pro Million Ausgabe-Tokens, ohne Aufschlag durchgereicht. Dieser Artikel behandelt, was der Modus ist, wie schnell die Zahlen wirklich sind – einschließlich der neuen CS-4-Hardware und was noch unbestätigt ist –, was er kostet (einschließlich der ehrlichen Antwort „noch kein Preis“) und was zu tun ist, bis er allgemein verfügbar ist.
Was der Ultrafast-Modus tatsächlich ist
Ultrafast ist eine Serving-Stufe, kein neues Modell. OpenAI kündigte es am 13. August 2026 als erstes Produkt seiner Compute-Partnerschaft mit dem Chip-Hersteller Cerebras aus dem Januar 2026 an – ein Deal, der auf rund 10 Milliarden US-Dollar über drei Jahre beziffert wird. Während die Standard-Inferenz von GPT-5.6 Sol auf GPU-Clustern läuft und viel Zeit damit verbringt, Gewichte zwischen Speicher und Recheneinheiten zu verschieben, lädt Ultrafast die Gewichte des Modells in 44 GB On-Chip-SRAM auf Cerebras' Wafer-Scale-Chips; ein Modell in der Größe von Sol erstreckt sich über mehrere Wafer in Schichten, sodass die Gewichte dort liegen, wo die Rechenleistung ist. Das Ergebnis ist eine Durchsatzobergrenze, die vom Silizium bestimmt wird und nicht von der Speicherbandbreite.
Die Hardware-Geschichte hat sich am 2026-08-18 weiterentwickelt. Bei seiner Supernova-Veranstaltung enthüllte Cerebras den CS-4, das System der nächsten Generation auf Rack-Ebene, das auf der Nexus-Plattform basiert – drei Wafer-Scale-Engine-Chips pro Rack, bis zu 2× der Token-Erzeugungsgeschwindigkeit des bisherigen CS-3 und laut Cerebras mehr als 1.000 Token pro Sekunde bei Modellen mit über 10 Billionen Parametern. Das sind Cerebras' Angaben für ein System im Early Access, das noch nicht allgemein verfügbar ist. Seit der Enthüllung behauptet ein einzelner Beitrag auf X, dass der CS-4 GPT-5.6 Sol bereits mit etwa 1.300 Token pro Sekunde bedient – das entspricht in der Richtung Cerebras' eigenen Zahlen, wurde aber bisher von niemandem bestätigt. Behandeln Sie es als ein frühes Signal: plausibel, unverifiziert und einen erneuten Check wert, bevor Sie die Kapazität darauf planen.
Der Teil, der für deinen Code zählt: die Modell-ID, die Gewichte, das Reasoning-Verhalten und die Ausgabe sind identisch mit dem Standard-GPT-5.6 Sol. OpenAI bezeichnet Ultrafast als „mehr nützliche Arbeit pro Sekunde“ und nicht als Qualitätsstufe, und die Vorschau läuft mit dem vollwertigen Flaggschiff – die Geschwindigkeit entsteht nicht durch den Austausch gegen ein günstigeres Modell. Was sich ändert, ist, wie schnell Tokens erzeugt werden.
Verwechseln Sie Ultrafast nicht mit dem vorhandenen fast mode. Fast mode ist eine separate, kostenpflichtige Stufe auf Standard-Hardware: bis zu etwa 2,5× Ausgabegeschwindigkeit bei einem 2× Aufpreis pro Token ($10 Eingabe / $60 Ausgabe pro 1M), ohne Qualitätsänderung. Ultrafast ist etwas anderes — Cerebras-Hardware, bis zu 14×, und vorerst ohne jeden Preis.
Wie schnell — die Zahlen, die zählen.

Die in der Schlagzeile genannte Zahl ist 14×, und sie bedarf einer Definition. OpenAI zufolge erzeugt Ultrafast bis zu 750 Ausgabe-Token pro Sekunde, verglichen mit der standardmäßigen GPT-5.6-Sol-Verarbeitung. Das ist eine Durchsatzangabe für Ausgabe-Token, keine pauschale Aussage, dass „alles 14× schneller läuft“ — die End-to-End-Anfragezeit umfasst auch die Eingabeverarbeitung und das eigene Denken des Modells, weshalb 14× als Maximum ausgewiesen ist.
• Maximaler Ausgabedurchsatz — bis zu 750 Ausgabe-Token pro Sekunde, laut OpenAIs Ankündigung (2026-08-13).
• Im Vergleich zur Standardverarbeitung — bis zu 14× schneller, laut derselben Ankündigung; die tatsächliche Beschleunigung variiert je nach Eingabelänge und Aufgabentyp.
• Humanity's Last Exam, 2.500 Fragen — OpenAI/Cerebras berichten, dass GPT-5.6 Sol Ultrafast in 11 Stunden und 11 Minuten fertig war, gegenüber 78 Stunden und 27 Minuten für Claude Fable 5, bei vergleichbarer Genauigkeit. Es handelt sich um Herstellerangaben, und der Vergleich erstreckt sich über die Hardware-Stacks zweier Anbieter — als Richtwert zu verstehen, nicht als Urteil.
• GDP-Val, End-to-End — Cerebras berichtet von insgesamt 5,6× höherer Leistung ohne messbaren Qualitätsverlust. Ebenfalls vom Anbieter gemeldet.
• Schnellmodus-Basislinie — die bestehende käufliche Geschwindigkeitsstufe erreicht maximal etwa die 2,5-fache Ausgabegeschwindigkeit für einen doppelten Preisaufschlag.
• CS-4, die nächste Hardware — Cerebras behauptet, dass das CS-4-Rack bei Modellen mit über 10 Billionen Parametern mehr als 1.000 Token pro Sekunde liefert, bis zu 2× der Token-Erzeugung des CS-3. Ein unbestätigter Community-Bericht beziffert GPT-5.6 Sol auf CS-4 mit etwa 1.300 Token pro Sekunde — gleiche Richtung, aber noch nicht von OpenAI oder Cerebras bestätigt.
Ein Wort der Vorsicht, bevor Sie die 14× zitieren: Unabhängige Berichterstattung über den Launch führt einen ~11×-Vergleich der Generierungsgeschwindigkeit gegenüber Claude Fable 5 an, während Cerebras' eigene Zahlen auf ~7× für die gesamte Testzeit bei demselben Lauf schließen lassen – der Unterschied liegt darin, welchen Teil einer Workload man misst. Dieselbe Sorgfalt gilt für das CS-4-Geschwindigkeitssignal: Die Angabe von ~1,300 token/s stammt von einem einzelnen X-Post, und weder OpenAI noch Cerebras haben sie bestätigt. All das sind Hersteller- oder Community-Zahlen, die diese Woche verkündet wurden, und keine davon ist bisher unabhängig verifiziert. Behandeln Sie sie als Behauptungen, nicht als Benchmark-Urteile.
Was es kostet — und die ehrliche Lücke

Hier ist der Stand der Preisfrage am 19.08.2026, klar ausgedrückt: Ultrafast hat keinen veröffentlichten Preis. OpenAI hat keinen angekündigt, und die Vorschau erscheint auf keiner öffentlichen Preistabelle. Berichte, dass Early-Access-Plätze gebündelt oder kostenlos seien, sind Spekulation, keine Politik – und bis OpenAI die Preisstufe festlegt, ist jede Zahl zu „GPT-5.6 Sol Ultrafast Kosten“, die Sie anderswo finden, eine Vermutung.
Was Sie heute bepreisen können, ist der Rest der GPT-5.6 Sol-Linie, verifiziert anhand der veröffentlichten Preise von OpenAI, Stand 2026-08-18:
• Standard GPT-5.6 Sol — 5,00 $ Eingabe / 30,00 $ Ausgabe pro 1 Mio. Tokens. Die Basisversion, die Sie jetzt sofort aufrufen können.
• Schnellmodus — $10.00 / $60.00, ein 2-facher Aufpreis für bis zu etwa 2,5-fache Ausgabegeschwindigkeit. Das kommt einer Geschwindigkeitsstufe, die man tatsächlich kaufen kann, am nächsten.
• Prompt-Cache lesen — $0.50 pro 1M (90 % günstiger als neuer Input); Cache-Schreibvorgänge kosten $6.25 pro 1M.
• Langkontext-Stufe — Eingaben über etwa 272.000 Token kosten 10,00 $ / 45,00 $.
• Batch API — 2,50 $ / 15,00 $, pauschal 50 % Rabatt bei einer Bearbeitungszeit von etwa 24 Stunden.
Zur Einordnung des zu erwartenden Aufpreises: Der schnelle Modus hat den Präzedenzfall gesetzt – 2× der Standardsatz für 2,5× die Geschwindigkeit. Wenn Ultrafast einer ähnlichen Kurve folgt, wird es deutlich über den Standardpreisen von 5 $ / 30 $ liegen – und die Kommentare zur Vorschau erwarten genau das, weil die Cerebras-Waferkapazität knapp und teuer ist. Aber ein erwarteter Aufpreis ist kein Preis. Plane auf Basis von Standard-Sol oder dem schnellen Modus, bis eine Preisliste vorliegt.
Wie man es verwendet — die Vorschau-Realität
Access ist die zweite ehrliche Lücke. Ultrafast ist über die OpenAI-API für eine ausgewählte Kundengruppe auf Wartelistenbasis verfügbar, angekündigt am 13.08.2026, wobei OpenAI erklärte, dass der Zugang „mit wachsender Kapazität“ erweitert werde. Es gibt kein Datum für die allgemeine Verfügbarkeit. Die angekündigten Preview-Kohorten sind Programmierung, Handel, Finanzforschung, Support und andere interaktive Workloads – Teams, deren Agenten viele Aufrufe pro Anfrage tätigen und bei denen die Antwortlatenz der Engpass ist. Jane Street, Rogo und Podium gehören zu den namentlich genannten frühen Testern.
Das Nutzungsmuster, für das es entwickelt wurde: Incident Response (Lesen von Logs, Traces und Diffs, während eine Störung live ist), Finanzrecherche und Betrugserkennung bei Streaming-Daten, Echtzeit-Kundensupport und Sprache (wo eine halbe Sekunde Stille als Störung wahrgenommen wird), E-Commerce-Checkout und die Komprimierung nächtlicher Recherche-Batches in interaktive Sitzungen. Wenn Ihre Workload ein einzelnes Chat-Gespräch ist, spielt der 14×-Faktor eine weitaus geringere Rolle als bei einer 40-Aufruf-Agentenschleife.
Was Sie heute tun können — die praktische Antwort

Während Ultrafast in der Vorschau ist, ist das volle GPT-5.6 Sol bereits live — und bei OrcaRouter wird der Standard-Tier zum Provider-Preis mit $0-Aufschlag pro Token angeboten, als Modell-ID openai/gpt-5.6-sol über den OpenAI-kompatiblen Endpoint unter api.orcarouter.ai/v1. Wenn Sie bereits einen OpenAI-Client haben, ist die Migration eine Änderung von Base-URL und Modell-ID; sonst nichts. Derselbe Schlüssel und derselbe Endpoint tragen 200+ Modelle, sodass Sol neben GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 und den Open-Weight-Modellen steht, mit denen Sie es vergleichen würden — und Sie können nach Schwierigkeitsgrad routen, statt jedes einzelne neu zu integrieren.
Zwei Besonderheiten von OrcaRouter sind auf einer Geschwindigkeitsseite erwähnenswert. BYOK: Bringen Sie Ihren eigenen OpenAI-Schlüssel mit, und OpenAI stellt Ihnen direkt zu seinen eigenen Tarifen in Rechnung — OrcaRouter addiert $0 pro Token und hält Ihre Anbieter-Ratenlimits und Guthaben intakt. Guardrails: Der PII Shield und die Inhaltsrichtlinie werden vor der Abrechnung ausgeführt, sodass eine blockierte Anfrage einen sauberen 400-Status zurückgibt und nie berechnet wird. Die Agent Firewall bewertet Tool- und MCP-Aufrufe, bevor sie ausgeführt werden. Wenn — und falls — Ultrafast zu einem routbaren Preis die allgemeine Verfügbarkeit erreicht, ist das Einbinden in denselben Endpoint nur eine Änderung der Modell-ID; das Setup, das Sie heute aufbauen, bleibt erhalten.
Die ehrliche Grenze — wenn Ultrafast nicht die Antwort ist
Vier Stellen, an denen die 14×-Geschichte nicht stichhaltig ist – planen oder budgetieren Sie daher nicht anhand einer Zahl, die nicht gesichert ist:
14× ist ein Maximum, keine Garantie. Es ist eine Obergrenze für den Ausgabedurchsatz auf Cerebras-Hardware; die Ende-zu-Ende-Latenz umfasst weiterhin die Eingabeverarbeitung, die Denkzeit des Modells und dein eigenes Netzwerk. Ein Prompt mit hohem Denkaufwand kann den Großteil seiner tatsächlichen Laufzeit mit Denken verbringen, wobei die beworbene Beschleunigung schrumpft.
Es hat keinen Preis und kein GA-Datum. Stand 19.08.2026 kann man Ultrafast nicht kaufen – man kann nur Vorabzugriff anfragen, und die dahinterstehende CS-4-Hardware befindet sich im Early Access und ist nicht allgemein verfügbar. Kalkulieren Sie mit dem Standard-Sol (5 $ / 30 $) oder dem schnellen Modus (10 $ / 60 $), und behandeln Sie jeden Ultrafast-Preis, den Sie online sehen, als unbestätigt.
Die Benchmarks werden von den Anbietern gemeldet. Die 11-stündige HLE-Ausführung und der 5,6-fache GDP-Val-Wert sind OpenAI/Cerebras-Angaben aus der Ankündigung; unabhängige Schätzungen reichen von etwa 7× bis 11×, je nachdem, was gemessen wird. Hinzu kommt das CS-4-Geschwindigkeitssignal: Die Angabe von ~1.300 Token/s für GPT-5.6 Sol auf CS-4 stammt von einem einzelnen X-Beitrag und hat keine unabhängige Bestätigung. Keiner dieser Werte wurde bisher unabhängig verifiziert.
Es wird keinen Engpass beheben, den Sie nicht haben.Wenn Ihre Agenten wegen Ihrer eigenen Orchestrierung, Tool-Latenz oder eingabeintensiver Prompts langsam sind, verschiebt ein schnellerer Ausgabepfad das Tail nur geringfügig. Die Tarifwahl — GPT-5.6 Sol bei $5 / $30 gegenüber GPT-5.6 Terra bei $2 / $12 gegenüber GPT-5.6 Luna bei $0.20 / $1.20 — wirkt sich immer noch stärker auf Ihre Rechnung aus als jede Geschwindigkeitsstufe.
Unterm Strich. GPT-5.6 Sol Ultrafast ist die schnellste Serving-Stufe, die OpenAI für sein Flaggschiff herausgebracht hat — die gleichen Gewichte auf Cerebras-Hardware, bis zu 14× Durchsatz und 750 Ausgabe-Token pro Sekunde auf der angekündigten Stufe. Cerebras' neuer CS-4 (vorgestellt am 2026-08-18) treibt GPT-5.6 Sol Berichten zufolge auf ~1.300 Token pro Sekunde, aber diese Zahl ist ein einzelner unbestätigter X-Post. Stand 2026-08-19 ist Ultrafast eine Wartelisten-Vorschau ohne öffentlichen Preis. Wenn du nach einer Zahl für deine Budgetplanung suchst, ist die ehrliche Antwort, dass es noch keine gibt. Standard GPT-5.6 Sol für $5 / $30 ist das, was du heute abrufen kannst, der Schnellmodus für $10 / $60 ist die käufliche Geschwindigkeitsstufe, und OrcaRouter leitet beide ohne Aufschlag über deinen eigenen Schlüssel weiter. Bau das Routing jetzt auf — und wenn Ultrafast einen Preis und ein Datum bekommt, ist es nur eine Modell-ID-Änderung entfernt.
Bis Ultrafast einen Preis bekommt, ist das volle GPT-5.6 Sol live auf GPT-5.6 Sol on OrcaRouter zu $5 / $30 pro Million Tokens, ohne Aufschlag, bereit für Ihren eigenen Schlüssel.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
