
GPT-5.6 Sol Ultrafast vs GPT-5.6 Sol: te same wagi, inny poziom usług
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 610 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 189 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
GPT-5.6 Sol Ultrafast nie jest nowym modelem, a to nie jest materiał o premierze. Dostawca ogłosił ten tryb 13 sierpnia 2026 r., a tego samego dnia wartość ultrafast pojawiła się w publicznym schemacie OpenAPI firmy, wewnątrz opisu ServiceTierResponses w specyfikacji — który, zgodnie z własnym brzmieniem, ogranicza ten poziom do endpointu gpt-5.6-sol i oznacza go jako objęty kontrolą dostępu. To, co sprawiło, że ta strona wróciła do naszej kolejki, jest mniejsze i bardziej konkretne: 25 września 2026 r. commit fe4f7a1 rozszerzył tę wartość na dwie kolejne enumeracje — parametr service-tier na poziomie żądania oraz pole polityki service-tier agenta. Sześć tygodni po ogłoszeniu ten poziom nadal znajduje się na liście oczekujących, nadal nie ma opublikowanej ceny, a teraz jest podłączony do większej części powierzchni API, niż jest w stanie faktycznie obsłużyć. GPT-5.6 Sol Ultrafast i GPT-5.6 Sol to ten sam model; jedyne, co może rozstrzygnąć to porównanie, to kto kontroluje wskaźnik i kto podał ci koszt.
Zestawienie w nagłówku jest nietypowe. GPT-5.6 Sol Ultrafast i GPT-5.6 Sol to ten sam model. Te same wagi, ten sam checkpoint, takie samo zachowanie przy rozumowaniu, to samo okno kontekstu wynoszące 1,05 miliona tokenów, ta sama maksymalna długość wyjścia 128K, te same odpowiedzi. Sposób, w jaki OpenAI to ujmuje, to „więcej użytecznej pracy na sekundę”, a nie mądrzejszy model. Jedyna rzecz, która różni się między dwiema kolumnami tego porównania, to sposób wytwarzania tokenów i nazwa poziomu w treści żądania — co czyni je najczystszym eksperymentem kontrolnym w obecnej ofercie, a także najtrudniejszym do wyboru przy zakupie, ponieważ jeden z dwóch poziomów nie ma w ogóle opublikowanej ceny.
Co tak naprawdę zmieniło się w tym tygodniu?
Dowodem na wrześniową zmianę jest commit, a nie wpis na blogu. OpenAI utrzymuje openai-openapi, repozytorium publikujące czytelny dla maszyn schemat jego API, a commit fe4f7a1 — datowany na 2026-09-25 — dodaje ultrafast do dwóch wyliczeń: polityki warstwy usług przypisanej do agentów oraz pola na poziomie żądania, które specyfikacja opisuje jako „warstwę usług używaną dla żądań modelu”. To rozszerzenie, a nie debiut: przed tym commitem te dwie listy zawierały auto, default, flex, priority, fast, a ta warstwa była już w schemacie od 13 sierpnia. Commit warto odnotować ze względu na to, do którego pola dotarł — pola polityki, którym konfiguruje się agenta, a to inna płaszczyzna niż nadpisanie na poziomie pojedynczego żądania.
Opis, który ma znaczenie, pochodzi z commita z 13 sierpnia, a nie z tego, i jest najbardziej szczegółowym stwierdzeniem, jakie OpenAI opublikowało gdziekolwiek na temat tego poziomu. Obok nowej wartości w specyfikacji czytamy: „Jeśli ustawiono wartość 'ultrafast', żądanie zostanie przetworzone przy użyciu objętego kontrolą dostępu poziomu usługi Ultrafast Processing. Ten poziom jest obecnie dostępny dla gpt-5.6-sol; odpowiedź obsłużona przez niego będzie wskazywać service_tier=ultrafast.”
Przeczytaj to zdanie dwa razy, bo rozstrzyga ono dwie kwestie, co do których ta strona porównawcza musiałaby w przeciwnym razie zachować ostrożność. Ten poziom jest ograniczony do jednego modelu — flagowego GPT-5.6 Sol i niczego innego w ofercie — i podlega kontroli dostępu, a nie jest otwarty, co odpowiada sposobowi, w jaki OpenAI opisuje podgląd z listą oczekujących. Mówi też, po czym poznasz, że go otrzymałeś: odpowiedź zwrotnie informuje, który poziom faktycznie obsłużył żądanie, więc przejście awaryjne do standardowego przetwarzania jest widoczne w treści odpowiedzi, a nie czymś, co trzeba wywnioskować na podstawie opóźnienia. Ten sam opis pojawia się zarówno w schemacie standardowym, jak i w schemacie Beta Responses, i widnieje tam od 13 sierpnia.
![A screenshot of the GitHub commit page for openai/openai-openapi commit fe4f7a1 by openai-openapi-publisher[bot], titled "Add 'ultrafast' service tier option to improve request speed", showing the diff adding "ultrafast" to the enum lists after "fast" and a new x-enumDescription reading "Uses the ultrafast service tier."](https://cms.orcarouter.ai/api/media/file/2-1341.png)
Drugi, słabszy sygnał nadszedł następnego dnia. Raport z 26 września opisuje nowy selektor Speed — Fast, Standard i Ultrafast — który trafi do Responses API Playground, przy czym szersza dostępność Ultrafast jest spodziewana po konferencji deweloperskiej OpenAI DevDay. Nie widzieliśmy tego selektora sami i OpenAI nie opublikowało noty o wdrożeniu, więc traktuj to jako raport z jednego źródła, a nie jako wdrożoną funkcję. Elementy, które można dziś sprawdzić, to dwa miejsca w publicznym schemacie oraz fakt, że dla tego poziomu nie pojawił się żaden cennik.
To, co się nie zmieniło, jest równie ważne. Nadal nie ma ceny Ultrafast. Strona z cennikiem OpenAI, odczytana 27 września, zawiera cztery zakładki, które miała wcześniej — Standard, Batch, Flex i Fast — a ciąg „ultrafast” nie pojawia się na niej nigdzie. Dostęp nadal jest opisywany jako ograniczona wersja zapoznawcza dla wybranych klientów, rozszerzana w miarę wzrostu przepustowości. Ten poziom jest jednocześnie w umowie i poza cennikiem, i taki jest jego uczciwy stan.
Te dwa poziomy, obok siebie
Ponieważ żadna funkcja nie odróżnia tych dwóch, porównanie sprowadza się niemal wyłącznie do obsługi i rozliczeń. Każda poniższa linia zawiera obie strony w jednym wierszu.
• Model — GPT-5.6 Sol Ultrafast działa na identycznym checkpointcie GPT-5.6 Sol co standardowe przetwarzanie GPT-5.6 Sol, ten sam checkpoint, bez destylacji, bez zmniejszania rozmiaru.
• Przepustowość wyjściowa — do 750 tokenów wyjściowych na sekundę, do 14× standardu, zgodnie z ogłoszeniem OpenAI z 13 sierpnia, w porównaniu ze standardowym przetwarzaniem GPT-5.6 Sol na klastrach GPU, względem którego mierzone jest 14×.
• Sprzęt — układy Cerebras w skali wafla, wagi rezydujące w SRAM na chipie, pierwszy produkt styczniowego partnerstwa obliczeniowego OpenAI z Cerebras z 2026 r., wartego według doniesień około 10 miliardów dolarów w ciągu trzech lat, w porównaniu z konwencjonalnym wnioskowaniem na GPU, w którym większość czasu zajmuje przenoszenie wag między pamięcią a jednostkami obliczeniowymi.
• Cena — niepublikowana na dzień 27 września 2026 r. w porównaniu z obecną stawką promocyjną OpenAI wynoszącą 4,00 USD za milion tokenów wejściowych / 20,00 USD za milion tokenów wyjściowych, plus 0,40 USD za milion za buforowane dane wejściowe.
• Dostępność — ograniczony podgląd z listą oczekujących dla wybranych klientów kontra domyślna ścieżka, wywoływalna przez każdego posiadacza klucza API.
• Odpowiedzi, które otrzymujesz — identyczne co do zasady vs identyczne co do zasady; jeśli różnią się przy tym samym poleceniu, to jest to ustalenie, a nie funkcja.

Twierdzenie o prędkości i jego górna granica
Nagłówkowa liczba to 14× i zasługuje na taką samą staranność, jaką otrzymuje reszta tej strony. OpenAI podaje do 750 tokenów wyjściowych na sekundę w porównaniu ze standardowym przetwarzaniem — to liczba przepustowości dla wyjściowych tokenów, a nie twierdzenie, że każde żądanie kończy się 14 razy szybciej. Na czas end-to-end składa się także przetwarzanie danych wejściowych i własne rozumowanie modelu, a żadnego z nich sprzęt w skali waferowej nie kompresuje w tym samym stosunku. Dlatego firma określa 14× jako maksimum, a nie jako wynik pomiaru.
Opublikowane porównania opierają się na danych raportowanych przez dostawców po obu stronach zestawienia, a jedno z nich obejmuje stosy technologiczne dwóch dostawców. Przebieg Humanity's Last Exam obejmujący 2 500 pytań podano jako kończący się w 11 godzin 11 minut na Ultrafast w porównaniu z 78 godzinami 27 minutami dla Claude Fable 5, przy porównywalnej dokładności — to OpenAI i Cerebras mówią nam o benchmarku, który obejmuje model konkurenta, a niezależne relacje z premiery przytoczyły węższe, około 11× porównanie szybkości generowania w tym samym przebiegu, podczas gdy własne dane Cerebras sugerują około 7× w przypadku całkowitego czasu testu. Rozbieżność między 14×, 11× i 7× nie jest sprzecznością; to, co się dzieje, gdy trzy strony mierzą różne części jednego obciążenia. Cerebras osobno podaje 5,6× end-to-end na GDP-Val bez mierzalnej utraty jakości. Nic z tego nie zostało odtworzone przez stronę trzecią.
Cennik ma lukę.
Tu właśnie dwa poziomy przestają być symetryczne. GPT-5.6 Sol ma cztery opublikowane cenniki, a Ultrafast nie jest jednym z nich.
• Standardowy GPT-5.6 Sol — 4,00 USD / 20,00 USD za milion tokenów, z wejściem z pamięci podręcznej po 0,40 USD oraz stawką za długi kontekst wynoszącą 8,00 USD / 30,00 USD, gdy dane wejściowe przekroczą około 272 tys. tokenów.
• Tryb szybki — $8.00 / $40.00, dokładnie dwukrotność stawki standardowej. To poziom, którego nazwę zmieniono z Priority processing 30 lipca 2026 r., a API akceptuje zarówno service_tier: "priority", jak i service_tier: "fast". Zapewnia do około 2,5× szybkości generowania wyników.
• {{1}}Batch{{/1}} i {{2}}Flex{{/2}} — 2,00 / 10,00 USD, stałe 50% zniżki od standardu w zamian za luźniejsze planowanie.
• Ultrafast — brak cennika. To nie puste pole, które wypełniliśmy domysłem; to puste pole pozostawione przez OpenAI.
Ten wiersz Fast-mode to jedyny realny punkt odniesienia, względem którego można wyceniać Ultrafast, i jest to trzeźwiący punkt odniesienia dla każdego, kto planuje budżet: jedyny poziom szybkości, dla którego OpenAI faktycznie podało liczbę, kosztuje dokładnie dwa razy więcej niż standardowa stawka, oferując dwuipółkrotnie większą szybkość. Ultrafast to większa obietnica szybkości oparta na trudniej dostępnym sprzęcie — moce produkcyjne Cerebras w zakresie waferów nie są towarem — więc kierunek ewentualnej dopłaty nie budzi wątpliwości. Jej wysokość — już tak. Dopóki nie istnieje cennik, każda liczba określana jako „cena GPT-5.6 Sol Ultrafast”, którą zobaczysz gdziekolwiek w cytatach, jest czyimś domysłem, w tym również naszym.
Jak byś to właściwie nazwał?
Zmiana schematu mówi ci, jaki kształt będzie miało docelowe wywołanie. Jeśli poziom obsługi działa według wzorca pozostałych, pojawia się jako dodatkowe pole w żądaniu, które już wysyłasz: zachowujesz model gpt-5.6-sol, zachowujesz swój prompt i dodajesz selektor poziomu — dokładnie tak, jak dziś wybiera się Fast mode, zamieniając priority na fast. W parsowaniu odpowiedzi nic się nie zmienia, bo w modelu nic się nie zmienia. Na tym polega cały urok poziomu obsługi w porównaniu z wymianą modelu i dlatego strona porównawcza taka jak ta ma tak niewiele do porównania.
To, czego nie możesz dziś zrobić, to tego wywołać. Wartość wyliczeniowa istnieje; zasoby, które za nią stoją — w przypadku większości kont — już nie. Zatem praktyczne pytanie na najbliższe kilka tygodni nie brzmi, który z dwóch poziomów wybrać — lecz co uruchomić, dopóki ten wybór jest niedostępny.
Na to pytanie brama odpowiada lepiej niż lista oczekujących. Standardowy poziom modelu jest już dostępny na OrcaRouter jako openai/gpt-5.6-sol, obsługiwany w stawce samego dostawcy z zerową marżą na tokenach, przez endpoint zgodny z OpenAI pod adresem api.orcarouter.ai/v1 — więc promocyjne stawki OpenAI 4 / 20 USD oraz jego stawka 8 / 30 USD za długi kontekst są przekazywane bezpośrednio, a nie wyceniane przez nas od nowa, a ich zmiana trafia po naszej stronie tego samego dnia, w którym trafia do OpenAI. Ten sam klucz obsługuje ponad 200 modeli, co ma tu większe znaczenie niż zwykle: ponieważ nie można ustawić service_tier: "ultrafast" i otrzymać odpowiedzi, sposobem na kupienie sobie dziś niskich opóźnień jest inne rozdzielenie pracy — wywołania interaktywne kieruj do tego modelu z katalogu, który najszybciej spełnia twoje wymagania jakościowe, a nocne partie zostawiaj na najtańszej przepustowości, która przechodzi. Gdy ten poziom wreszcie się otworzy, router jest miejscem, w którym przełączyłbyś przełącznik, a do tego czasu to różnica między listą oczekujących a planem.

Który z nich powinien znaleźć się na produkcji?
Pomińmy na chwilę słowo „versus”, bo nie ma tu żadnej decyzji jakościowej do podjęcia. Jeśli optymalizujesz pod kątem kosztu na token, odpowiedzią jest standardowy GPT-5.6 Sol, a odpowiedzią na wszystko, co może poczekać, jest ścieżka Batch z 50% zniżką. Jeśli optymalizujesz pod kątem tego, jak długo człowiek siedzi przed spinnerem, odpowiedzią jest Ultrafast w momencie, gdy możesz go dostać — a obciążenia, które OpenAI wskazuje dla wersji preview, dokładnie pokazują dlaczego: reagowanie na incydenty z otwartymi logami i diffami podczas trwającej awarii, kontrole oszustw na zmieniających się danych, rozmowy z obsługą klienta, w których pół sekundy ciszy czyta się jak zepsuty produkt, oraz pętle badawcze, które kiedyś działały przez całą noc, a teraz są kompresowane do jednej sesji roboczej.
Znakiem rozpoznawczym jest kształt twojego grafu żądań, a nie rozmiar twojego promptu. Pojedyncza długa generacja zyskuje 14× na papierze, a w praktyce znacznie mniej, ponieważ przetwarzanie wejścia i rozumowanie nie kompresują się w tym stosunku. Czterdzieści kolejnych wywołań narzędzi za jedną akcją widoczną dla użytkownika daje coś znacznie bliższego pełnemu mnożnikowi, ponieważ każde z tych przejść w obie strony to opóźnienie, które użytkownik musi przeczekać. Jeśli twoje obciążenie wygląda jak to drugie, ten poziom jest skierowany do ciebie; jeśli wygląda jak to pierwsze, standardowa ścieżka i tak zawsze była w porządku.
Dwie rzeczy, na które warto uważać, i żadna z nich nie jest plotką, którą możemy rozstrzygnąć stąd. Po pierwsze, cennik: warstwa premium bez ceny nie może zostać ujęta w budżecie, a precedens trybu Fast sugeruje, że nie będzie ona mała. Po drugie, czy lista oczekujących faktycznie zostanie zniesiona w okolicach DevDay, jak donoszono — ponieważ wartość service_tier, z której większość kont nie może skorzystać, to dokumentacja, a nie dostępność, a różnica między tymi dwoma to różnica między planem a obietnicą.
