Wygenerowana karta hero z nagłówkiem „Teraz na najszybszym poziomie” i podtytułem „GPT-6.1 Sol Ultrafast trafia do API, Codex i ChatGPT Work” oraz czterema chipami o treści „$12.00 / $60.00 za 1 mln tokenów”, „6x Standard”, „do 8x szybciej (pomiar Astra)” i „API, Codex i ChatGPT Work”, nad stopką o treści „Dostępność i ceny zgodnie z dokumentacją OpenAI, 8 października 2026”.
Guides & Insights

GPT-6.1 Sol Ultrafast trafia do API, Codex i ChatGPT Work

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

O​penAI wprowadza tryb Ultrafast dla GPT-6.1 Sol — najszybszy poziom usług, jaki oferuje, i pierwszy taki przypadek dla poziomu niemal-Astra Sol. Ten ruch stawia GPT-6.1 Sol w tej samej kategorii co GPT-6 Astra Ultrafast w API, w Codex i w ChatGPT Work, a pojawia się on z opublikowanym cennikiem, a nie listą oczekujących: 12,00 USD za milion tokenów wejściowych i 60,00 USD za milion tokenów wyjściowych, dokładnie sześć razy więcej niż kosztuje standardowy GPT-6.1 Sol. Obietnica prędkości na opakowaniu to „do 8x”. Najciekawsze jest to, co właściwie mierzy to sformułowanie — a odpowiedzią nie jest model, za który za chwilę zapłacisz.

Dziennik zmian dla deweloperów zawiera wpis z 8 października: „Dodano tryb Ultrafast dla GPT-6.1 Sol w Responses API. Użyj gpt-6.1-sol z service_tier: "ultrafast", aby skrócić czas między generowanymi tokenami wyjściowymi. Jest dostępny dla wszystkich użytkowników API, z zastrzeżeniem limitów szybkości, z przetwarzaniem globalnym oraz rezydencją danych w USA i UE”. Strona dokumentacji Ultrafast zawiera teraz zapis „powszechnie dostępny dla GPT-6 Astra i GPT-6.1 Sol, z dostępem w wersji zapoznawczej dla GPT-5.6 Sol”, a strona poświęcona szybkości po stronie ChatGPT potwierdza część subskrypcyjną: Ultrafast jest dostępny w Codex i ChatGPT Work w planie Pro za 500 USD oraz w kwalifikujących się planach Enterprise i Edu.

Ultrafast to warstwa usługi, a nie drugi model.

Nic się nie zmienia w wagach. Ten sam checkpoint, to samo okno kontekstowe o rozmiarze 1 050 000 tokenów, ten sam maksymalny rozmiar danych wejściowych wynoszący 922 000 tokenów, ten sam górny limit danych wyjściowych wynoszący 128 000 tokenów, ta sama data odcięcia wiedzy — 30 kwietnia 2026 — te same odpowiedzi. To, co kupujesz, to priorytet szeregowania: model generuje tokeny szybciej, a samo ujęcie OpenAI jest celowo wąskie — ten poziom „skraca czas między generowanymi tokenami wyjściowymi”. Nie czyni modelu mądrzejszym i nie skraca fazy myślenia.

Ta różnica przesądza o całej decyzji. W przypadku pętli agenta, która wykonuje czterdzieści wywołań narzędzi z rzędu, korzyść się kumuluje, ponieważ wynik każdej tury pojawia się szybciej. W przypadku pojedynczego trudnego żądania rozumowania, które większość swojego czasu zegarowego spędza na deliberacji, możesz zapłacić sześciokrotnie więcej i wciąż patrzeć na ten sam wskaźnik ładowania.

Drabina poziomów, raz, prostymi słowami:

• Batch and Flex — połowa ceny Standard, tania ścieżka dla pracy, na którą nikt nie czeka

• Standard — 2,00 USD za wejście / 0,10 USD z pamięci podręcznej / 2,50 USD za zapis do pamięci podręcznej / 10,00 USD za wyjście za milion tokenów

• Fast — dwukrotnie więcej niż Standard, czyli $4.00 / $0.20 / $5.00 / $20.00; OpenAI zmieniło nazwę przetwarzania Priority na tryb Fast 30 lipca 2026 r.

• Ultrabłyskawicznysześciokrotnie Standard, czyli $12.00 / $0.60 / $15.00 / $60.00

• Powyżej 272 tys. tokenów wejściowych — całe żądanie jest ponownie wyceniane według 2x stawek za dane wejściowe i pamięć podręczną oraz 1,5x za dane wyjściowe; Ultrafast long-context to 24,00 USD / 1,20 USD / 30,00 USD / 90,00 USD

Arytmetyka, której nikt nie umieszcza na stronie marketingowej

Sześciokrotna cena za ośmiokrotną szybkość to nie interes przynoszący straty, ale też nie darmowy lunch. Ultrafast jest rozliczany za token, więc zadanie, które w Standard kosztuje 1,00 USD, w Ultrafast kosztuje 6,00 USD — i kończy się w mniej więcej jednej ósmej tego czasu. Oszczędność nie tkwi w rachunku, tylko w czasie rzeczywistym. Płacisz pięć dodatkowych dolarów, aby usunąć siedem ósmych czasu oczekiwania w kolejce dla tego zadania, a to, czy to jest tanie, czy absurdalne, zależy wyłącznie od tego, ile warta jest za minutę osoba albo potok czekający na drugim końcu.

Nasuwają się dwie implikacje, i to właśnie one są pomijane:

• Praca interaktywna to łatwe „tak”. Deweloper obserwujący, jak ląduje diff, agent, który nie może kontynuować, dopóki nie odczyta wyniku — to właśnie przypadki, w których opóźnienie jest produktem. Osiem razy szybsze wyjście w pętli czterdziestu tur to nie marginalna poprawa w ludzkiej percepcji; to różnica między narzędziem, którego używasz, a narzędziem, które zostawiasz w tle.

• Zadania zaplanowane i wsadowe to łatwe „nie”. Jeśli zadanie i tak ma czas do rana, Ultrafast to 6x wyższy rachunek za nic, a o połowę tańszy tryb Batch czeka tuż obok.

Wejście z pamięci podręcznej jest warte drugiego spojrzenia, ponieważ również się zmienia: $0.60 za milion w Ultrafast wobec $0.10 w Standard, wciąż 5% stawki za wejście bez pamięci podręcznej. Agenci korzystający z pamięci podręcznej promptów, którzy przy każdej turze ponownie wysyłają duży prompt systemowy, przekonają się, że rabat za pamięć podręczną skaluje się wraz z poziomem, a nie chroni ich przed nim.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing two rows: gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens short-context, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, and gpt-6.1-sol at $12.00 / $0.60 / $15.00 / $60.00 short-context stepping to $24.00 / $1.20 / $30.00 / $90.00, alongside the page's notes that regional processing endpoints carry a 10% uplift, that FedRAMP endpoints carry a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Skąd pochodzi liczba „do 8x”

To jest część, którą trzeba przeczytać uważnie, ponieważ właśnie tutaj nagłówek wdrożenia i dokumentacja wdrożenia po cichu opisują co innego.

Jedyny pomiar prędkości dotyczący konkretnego modelu, jaki O{{1}}penAI publikuje, to zdanie: "{{2}}GPT-6 Astra Ultrafast generuje tokeny do 8x szybciej niż GPT-6 Astra w trybie Standard w Codex.{{/2}}"{{/1}}. To jest wartość dla Astry, zmierzona w Codex. Nie opublikowano równoważnej wielokrotności dla GPT-6.1 Sol. Dokument dotyczący Ultrafast dla tego modelu mówi, że skraca czas między generowanymi tokenami wyjściowymi, i wskazuje tabelę cen; nie podaje przy tym żadnej liczby. Po stronie ChatGPT prędkość powtarza {{3}}zdanie o Astrze i na tym się kończy.{{/3}}

Uczciwa interpretacja sformułowania „do 8 razy szybciej” jest więc taka: to nagłówek tego poziomu, zaczerpnięty z bliźniaczego modelu, który jest w Ultrafast od 29 września, i zarazem twierdzenie dostawcy, którego nie potwierdził niezależnie żaden podmiot w przypadku żadnego z tych modeli. Może ono jak najbardziej być prawdziwe w przypadku GPT-6.1 Sol — oba działają na tym samym stosie obsługi, a mechanizm tego poziomu jest taki sam — ale nikt poza OpenAI nie opublikował pomiaru liczby tokenów na sekundę dla wariantu Sol, a słowo „do” ma w tym niemałe znaczenie.

Warto również rozdzielać poziomy według modelu, ponieważ starszy wciąż jest niedokończoną sprawą. Ultrafast został ogłoszony 13 sierpnia 2026 r. dla GPT-5.6 Sol jako „do 14 razy szybszy niż przetwarzanie Standard”, w ograniczonym podglądzie dla wybranych klientów. Trzy miesiące później dokumentacja wciąż podaje, że GPT-5.6 Sol ma „dostęp w wersji zapoznawczej”, a tabela cen Ultrafast zawiera dokładnie dwa wiersze — GPT-6 Astra i GPT-6.1 Sol. Liczba 14x, która nigdy nie osiągnęła ogólnej dostępności i nie ma opublikowanej stawki, jest twierdzeniem, a nie produktem.

A screenshot of OpenAI's Ultrafast mode documentation page, showing the sentence 'Ultrafast mode is the fastest service tier in the OpenAI API', the availability sentence naming broad availability for GPT-6 Astra and GPT-6.1 Sol with preview access for GPT-5.6 Sol, the statement that Ultrafast mode for GPT-6 Astra and GPT-6.1 Sol is available to all API users, the recommendation to use WebSockets because network overhead without a persistent connection can reduce the latency gains, the note that Ultrafast has separate rate limits from Standard and Fast modes, the GPT-6.1 Sol rate-limit row reading 1,000,000 / 4,000,000 / 40,000,000 tokens per minute and 5,000 / 20,000 / 200,000 requests per minute, the line that GPT-6.1 Sol supports US and EU data residency and global processing, and a code sample setting service_tier to 'ultrafast' with model 'gpt-6.1-sol'.

Kto tak naprawdę może to włączyć

Strona API jest szeroka, strona subskrypcji — wąska, a ta różnica potrafi zaskoczyć ludzi.

• API — dostępny dla wszystkich użytkowników API w modelu gpt-6.1-sol, z zastrzeżeniem odrębnych limitów szybkości względem Standard i Fast. Oznacza to drugi budżet do pilnowania, nie tylko drugą cenę.

• Błyskawiczne limity szybkości dla GPT-6.1 Sol — 1 000 000 tokenów na minutę w Build, 4 000 000 w Launch, 40 000 000 w Grow. O​penAI uprościł swoje poziomy użytkowania z pięciu do trzech 6 października, więc te trzy nazwy to aktualna drabina, a nie ta z przeszłości.

• Rezydencja danych — GPT-6.1 Sol obsługuje rezydencję danych w USA i UE oraz przetwarzanie globalne, w tym w trybach Fast i Ultrafast. Ultrafast firmy Astra nie zapewnia rezydencji w UE, więc jeśli Twoje obciążenie jest przypisane do UE, to pierwsza konfiguracja Ultrafast, jaką w ogóle możesz kupić.

• Codex i ChatGPT Work — Ultrafast jest dostępny w planie Pro za 500 USD oraz w kwalifikujących się planach Enterprise i Edu. Administratorzy Enterprise mają go domyślnie wyłączonego i muszą go włączyć dla poszczególnych użytkowników lub obszarów roboczych.

• Chat — nie jest uwzględniony. GPT-6.1 Sol znajduje się w Work i Codex; konsumencki interfejs Chat nie wchodzi w jego skład.

• Jak jest rozliczane w ramach subskrypcji — wykorzystanie wliczone w limit jest zużywane według stawki 8x wyższej niż Standard, a zakupione kredyty lub rozliczenie Enterprise za rzeczywiste użycie są rozliczane według stawki 6x wyższej niż Standard. Warto znać obie te liczby, zanim pozostawisz tę opcję włączoną.

Jeden szczegół implementacyjny decyduje o tym, czy w ogóle odczujesz jakiekolwiek przyspieszenie. Wskazówki OpenAI są w tej kwestii bez ogródek: używaj WebSockets, „zwłaszcza w aplikacjach agentowych, które wykonują wiele wywołań narzędzi szybko jedno po drugim”, ponieważ „bez trwałego połączenia narzut sieciowy może zmniejszyć korzyści w zakresie opóźnień”. Jeśli Twój klient otwiera nowe połączenie HTTP przy każdym wywołaniu, narzut przypadający na żądanie może pochłonąć całą przewagę poziomu, za który właśnie zapłaciłeś 6x. HTTP nadal działa. Po prostu może nie być wart tego poziomu.

Co routujemy, a czego nie

Standardowy GPT-6.1 Sol jest dostępny w OrcaRouter jako openai/gpt-6.1-solw cenie samego dostawcy: 2,00 USD za wejście i 10,00 USD za wyjście za milion tokenów, z marżą 0% — cena katalogowa dostawcy przekazywana 1:1, więc gdy O​penAI zmienia stawkę, zmiana trafia na Twoje rozliczenie tego samego dnia, w którym pojawia się w cenniku, a nie dopiero przy odnowieniu umowy. Ten sam klucz i endpoint obsługują ponad 200 modeli, więc wywołanie GPT-6.1 Sol oraz wywołanie Claude'a czy Q​wena stoją za jedną integracją z automatycznym przełączaniem awaryjnym i bez drugiej umowy, a język DSL routingu potrafi złożyć modele w jedno wywołanie, gdy zadanie wymaga więcej niż jednej opinii.

Ultrafast nie należy do tych modeli i sugerowanie czegokolwiek innego byłoby mylące. To flaga poziomu usługi na koncie O​penAI — wysyłasz service_tier: "ultrafast"do gpt-6.1-sol, a O​penAI rozlicza twoje własne konto według powyższych stawek — więc funkcjonuje ona w ramach twojej bezpośredniej integracji z O​penAI. Jeśli ją włączysz, pozostaw ruch objęty tym poziomem na swoim kluczu dostawcy, a ruch o standardowym wolumenie kieruj przez nas. To uczciwy podział, a przy tym tańszy dla wszystkiego, co nie czeka na człowieka.

A screenshot of the OrcaRouter model page for GPT-6.1 Sol, model id openai/gpt-6.1-sol, showing a 1M-token context window, 128K maximum output, text, image and file input with text output, vision, tools, JSON and reasoning capabilities, public benchmarks attributed to OpenAI dated 2026-09-29, input price $2.00 and output price $10.00 per 1M tokens, p50 time to first token 6.14 s, a 10.00 s figure, and 313.9M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Co z tym dzisiaj zrobić

Jeśli masz stanowisko Codex lub ChatGPT Work w planie Pro $500, przełącznik już tam jest, a próba nie kosztuje cię nic poza mnożnikiem użycia — uruchom to samo zadanie na oba sposoby i sprawdź, czy pętla, którą faktycznie wykonujesz, ma wystarczająco dużo tur, aby ośmiokrotne przyspieszenie się uwidoczniło. Jeśli korzystasz z API, eksperyment, który warto przeprowadzić, jest węższy, niż sugeruje ogłoszenie: zmierz, jaka część twojego opóźnienia przypada na generowanie tokenów, a jaka na myślenie modelu, a następnie skieruj Ultrafast na część, którą faktycznie może skompresować.

A jeśli masz wybór między Fast przy 2x a Ultrafast przy 6x dla tego samego żądania, Fast to poziom, który pojawił się pierwszy i którego zachowanie możesz wywnioskować z samego cennika. Ultrafast jest nowy dla tego modelu, nie został wyceniony przez żadne niezależne pomiary i jest wart dokładnie tyle, ile mówi twój własny stoper.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie