
GPT-5.6 Sol Ultrafast: 14× szybciej, 750 Tok/s — CS-4 podobno ~1,300, ceny jeszcze nie ma
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B Uncensored (Aggressive)2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
GPT-5.6 Sol Ultrafast mode is the hardware-accelerated serving tier for the flagship — the same full GPT-5.6 Sol model run on Cerebras wafer-scale chips instead of GPU clusters, delivering up to 14× the speed of standard processing and up to 750 output tokens per second on the tier OpenAI announced in August. On 2026-08-18, Cerebras unveiled the next-generation CS-4 system that this tier grows onto, and an early, unverified report claims GPT-5.6 Sol on CS-4 already serves roughly 1,300 tokens per second. It is not a smaller model and not a distillation: only the hardware and scheduling changed, and the intelligence is preserved. What it does not yet have is a price — as of 2026-08-19, Ultrafast is a limited API preview with no published rate card, so the number you can actually budget against today is the standard tier on the live GPT-5.6 Sol model page: $5 per million input tokens and $30 per million output, passed through at zero markup. This article covers what the mode is, how fast the numbers really are — including the new CS-4 hardware and what is still unverified — what it costs (including the honest "no price yet" answer), and what to do until it reaches general availability.
Czym tak naprawdę jest tryb Ultrafast
Ultrafast to warstwa serwowania, a nie nowy model. OpenAI ogłosiło go 13 sierpnia 2026 roku jako pierwszy produkt swojego styczniowego (2026) partnerstwa obliczeniowego z producentem chipów Cerebras — umowy wycenianej na około 10 miliardów dolarów na trzy lata. Podczas gdy standardowa inferencja GPT-5.6 Sol działa na klastrach GPU i spędza dużo czasu na przenoszeniu wag między pamięcią a jednostkami obliczeniowymi, Ultrafast ładuje wagi modelu do 44 GB wbudowanego SRAM na układach waflowych Cerebrasa; model wielkości Sol rozciąga się na kilku waflach warstwami, więc wagi znajdują się tam, gdzie odbywają się obliczenia. Efektem jest sufit przepustowości wyznaczony przez krzem, a nie przez przepustowość pamięci.
The hardware story moved on 2026-08-18. At its Supernova event, Cerebras unveiled the CS-4, the next-generation rack-scale system built on its Nexus platform — three Wafer-Scale Engine chips per rack, up to 2× the token-generation speed of the prior CS-3, and, per Cerebras, more than 1,000 tokens per second on models above 10 trillion parameters. Those are Cerebras's claims for a system in early access, not yet generally available. Since the unveiling, a single post on X claims CS-4 already serves GPT-5.6 Sol at roughly 1,300 tokens per second — consistent in direction with Cerebras's own numbers, but confirmed by nobody so far. Treat it as an early signal: plausible, unverified, and worth re-checking before you plan capacity around it.
Część, która ma znaczenie dla twojego kodu: identyfikator modelu, wagi, zachowanie rozumowania i wynik są identyczne jak w standardowym GPT-5.6 Sol. OpenAI przedstawia Ultrafast jako „więcej użytecznej pracy na sekundę”, a nie jako poziom jakości, a wersja zapoznawcza uruchamia pełny flagowy model — prędkość nie wynika z podmiany na tańszy model. Zmienia się tylko szybkość generowania tokenów.
Nie myl Ultrafast z istniejącym szybkim trybem. Tryb szybki jest osobnym, płatnym poziomem na standardowym sprzęcie: do około 2,5× szybkości wyjściowej przy 2× premii za token ($10 za wejście / $60 za wyjście na 1M), bez zmiany jakości. Ultrafast to co innego — sprzęt Cerebras, do 14×, a na razie w ogóle bez ceny.
Jak szybko — liczby, które mają znaczenie

Główna liczba to 14× i wymaga ona wyjaśnienia. OpenAI twierdzi, że Ultrafast generuje do 750 tokenów wyjściowych na sekundę, w porównaniu ze standardowym przetwarzaniem GPT-5.6 Sol. To wskaźnik przepustowości dla tokenów wyjściowych, a nie proste twierdzenie, że „wszystko działa 14× szybciej" — całkowity czas przetwarzania żądania obejmuje również przetwarzanie wejściowe oraz własne rozumowanie modelu, dlatego 14× jest oznaczone jako maksimum.
• Maksymalna przepustowość wyjściowa — do 750 tokenów wyjściowych na sekundę, zgodnie z ogłoszeniem OpenAI (2026-08-13).
• W porównaniu ze standardowym przetwarzaniem — do 14× szybciej, według tego samego ogłoszenia; rzeczywiste przyspieszenie zależy od długości danych wejściowych i typu zadania.
• Humanity's Last Exam, 2,500 pytań — OpenAI/Cerebras podają, że GPT-5.6 Sol Ultrafast ukończył test w 11 godzin i 11 minut, podczas gdy Claude Fable 5 potrzebował 78 godzin i 27 minut, przy porównywalnej dokładności. Dane pochodzą od producentów, a porównanie obejmuje stosy sprzętowe dwóch różnych dostawców — należy to traktować jako orientacyjne, a nie jako werdykt.
• GDP-Val, end-to-end — Cerebras raportuje 5,6× większą ogólną wydajność bez mierzalnej utraty jakości. Również raportowane przez dostawcę.
• Linia bazowa trybu szybkiego — istniejący płatny poziom szybkości osiąga maksymalnie około 2,5× prędkości generowania przy dwukrotnie wyższej cenie.
• CS-4, the next hardware — Cerebras claims the CS-4 rack delivers more than 1,000 tokens per second on models above 10 trillion parameters, up to 2× CS-3's token generation. An unverified community report puts GPT-5.6 Sol on CS-4 at ~1,300 tokens per second — same direction, not yet confirmed by OpenAI or Cerebras.
One caution before you quote the 14×: independent coverage of the launch cites an ~11× generation-speed comparison against Claude Fable 5, while Cerebras's own figures imply ~7× for total test time on the same run — the difference is which portion of a workload you measure. The same discipline applies to the CS-4 speed signal: the ~1,300-token/s figure started as a single X post, and neither OpenAI nor Cerebras has confirmed it. All of these are vendor or community numbers announced this week, and none are independently verified yet. Treat them as claims, not benchmark verdicts.
Ile to kosztuje — i uczciwa luka

Here is the state of the price question on 2026-08-19, stated plainly: Ultrafast has no published price. OpenAI has not announced one, and the preview does not appear on any public rate card. Reports that early-access slots are bundled or free are speculation, not policy — and until OpenAI prices the tier, any "GPT-5.6 Sol Ultrafast cost" number you find elsewhere is a guess.
To, co możesz dziś wycenić, to reszta linii GPT-5.6 Sol, zweryfikowana względem opublikowanych stawek OpenAI z dnia 2026-08-18:
• Standard GPT-5.6 Sol — $5.00 wejście / $30.00 wyjście za 1M tokenów. To linia bazowa, którą możesz wywołać już teraz.
• Tryb szybki — 10,00 $ / 60,00 $, premia 2× za prędkość wyjściową do około 2,5×. To coś najbardziej zbliżonego do poziomu prędkości, który faktycznie można kupić.
• Odczyt z pamięci podręcznej promptu — $0.50 za 1M (90% taniej niż nowe wejście); zapisy do pamięci podręcznej są rozliczane po $6.25 za 1M.
• Poziom długiego kontekstu — wejścia powyżej mniej więcej 272K tokenów są rozliczane w cenie $10.00 / $45.00.
• Batch API — $2.50 / $15.00, płaska zniżka 50% z czasem realizacji około 24 godzin.
Dla kontekstu co do oczekiwanej dopłaty: tryb szybki ustanowił precedens w postaci 2× standardowej stawki za 2,5× prędkości. Jeśli Ultrafast pójdzie podobną krzywą, będzie to znacznie powyżej standardowych $5 / $30 — a komentarze wokół zapowiedzi właśnie tego oczekują, ponieważ wydajność płytek Cerebras jest ograniczona i kosztowna. Ale oczekiwana premia to nie cena. Planuj z założeniem standardowego Sol lub trybu szybkiego, dopóki nie powstanie cennik.
Jak tego używać — rzeczywistość podglądu
Dostęp to druga uczciwa luka. Ultrafast jest dostępny przez API OpenAI dla wybranej grupy klientów na zasadzie listy oczekujących, co ogłoszono 2026-08-13, a OpenAI twierdzi, że dostęp zostanie rozszerzony «w miarę wzrostu wydajności». Nie ma daty ogólnej dostępności. Ogłoszone grupy podglądowe to: kodowanie, handel, badania finansowe, wsparcie i inne obciążenia interaktywne — zespoły, których agenci wykonują wiele wywołań na żądanie i dla których opóźnienie odpowiedzi jest wąskim gardłem. Jane Street, Rogo i Podium znajdują się wśród wymienionych wczesnych testerów.
Wzorzec użycia, dla którego został zaprojektowany: reagowanie na incydenty (przeglądanie logów, śladów i diffów podczas trwającej awarii), badania finansowe i wykrywanie oszustw na danych w ruchu, obsługa klienta w czasie rzeczywistym i wsparcie głosowe (gdzie półsekundowa cisza odbierana jest jako usterka), proces płatności w e-commerce oraz kompresowanie nocnych partii badawczych w sesje interaktywne. Jeśli Twoje obciążenie to czat jednorazowy, mnożnik 14× ma znacznie mniejsze znaczenie niż w przypadku pętli agenta z 40 wywołaniami.
Co możesz zrobić dzisiaj — praktyczna odpowiedź

Podczas gdy Ultrafast jest w fazie preview, pełny GPT-5.6 Sol jest już dostępny — a na OrcaRouter standardowa warstwa jest oferowana po stawce dostawcy z zerową marżą za token, pod identyfikatorem modelu openai/gpt-5.6-sol przez kompatybilny z OpenAI endpoint pod adresem api.orcarouter.ai/v1. Jeśli masz już klienta OpenAI, migracja to zmiana adresu bazowego i identyfikatora modelu; nic więcej. Ten sam klucz i endpoint dają dostęp do 200+ modeli, więc Sol znajduje się obok GPT-5.6 Terra, GPT-5.6 Luna, Claude Opus 5 oraz modeli o otwartych wagach, z którymi można go porównać — i możesz sterować routingiem według trudności, zamiast ponownie integrować każdy z nich.
Na stronie poświęconej szybkości warto wymienić dwie specyficzne cechy OrcaRoutera.BYOK: użyj własnego klucza OpenAI, a OpenAI rozliczy Cię bezpośrednio według własnych stawek — OrcaRouter dolicza $0 za token i pozostawia limity szybkości i środki dostawcy bez zmian.Guardrails: PII Shield i polityka treści działają przed rozliczeniem, więc zablokowane żądanie zwraca czysty błąd 400 i nigdy nie jest obciążane, a Agent Firewall ocenia wywołania narzędzi i MCP przed ich wykonaniem. Gdy — i jeśli — Ultrafast osiągnie ogólną dostępność w cenie umożliwiającej routing, podłączenie go do tego samego endpointu to zmiana identyfikatora modelu; konfiguracja, którą zbudujesz dziś, przenosi się.
Uczciwa granica — kiedy Ultrafast nie jest odpowiedzią
Cztery miejsca, w których historia 14× się nie sprawdza, więc nie opierasz architektury ani budżetu na liczbie, która nie jest przesądzona:
14× to maksimum, a nie gwarancja. To górna granica przepustowości wyjściowej na sprzęcie Cerebras; całkowite opóźnienie nadal obejmuje przetwarzanie wejściowe, czas rozumowania modelu oraz twoją własną sieć. Prompt wymagający intensywnego rozumowania może spędzić większość rzeczywistego czasu na myśleniu, gdzie deklarowane przyspieszenie maleje.
It has no price and no GA date. As of 2026-08-19 you cannot buy Ultrafast — only request preview access, and the CS-4 hardware behind it is in early access rather than generally available. Budget against standard Sol ($5 / $30) or fast mode ($10 / $60), and treat any Ultrafast price you see online as unverified.
The benchmarks are vendor-reported. The 11-hour HLE run and the 5.6× GDP-Val figure are OpenAI/Cerebras numbers from the announcement; independent estimates range from roughly 7× to 11× depending on what's measured. Add the CS-4 speed signal to that list: the ~1,300-token/s figure for GPT-5.6 Sol on CS-4 comes from a single X post and has no independent confirmation. None of these are independently verified yet.
Nie naprawi to wąskiego gardła, którego nie masz. Jeśli Twoi agenci działają wolno z powodu własnej orkiestracji, opóźnień narzędzi lub promptów wymagających dużego wkładu, szybsza ścieżka wyjścia tylko nieznacznie przesuwa ogon. Decyzja o dopasowaniu poziomu — GPT-5.6 Sol za 5 $ / 30 $ versus GPT-5.6 Terra za 2 $ / 12 $ versus GPT-5.6 Luna za 0,20 $ / 1,20 $ — wciąż bardziej wpływa na Twój rachunek niż jakikolwiek poziom szybkości.
Bottom line. GPT-5.6 Sol Ultrafast is the fastest serving tier OpenAI has shipped for its flagship — the same weights on Cerebras hardware, up to 14× throughput and 750 output tokens per second on the announced tier. Cerebras's new CS-4 (unveiled 2026-08-18) reportedly pushes GPT-5.6 Sol toward ~1,300 tokens per second, but that figure is a single unverified X post. As of 2026-08-19, Ultrafast is a waitlist preview with no public price. If you are searching for a number to budget against, the honest answer is that there isn't one yet. Standard GPT-5.6 Sol at $5 / $30 is what you can call today, fast mode at $10 / $60 is the purchasable speed tier, and OrcaRouter passes both through at $0 markup on your own key. Build the routing now — and when Ultrafast gets a price and a date, it is one model-id change away.
Dopóki Ultrafast nie ma ceny, pełny GPT-5.6 Sol jest dostępny na GPT-5.6 Sol on OrcaRouter w cenie 5 / 30 dolarów za milion tokenów, zero marży, gotowy na Twój własny klucz.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
