
GPT-6.1 Sol Ultrafast trafia do API, Codex i ChatGPT Work
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 111 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 55 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 377 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
OpenAI wprowadza tryb Ultrafast dla GPT-6.1 Sol — najszybszy poziom usług, jaki oferuje, i pierwszy taki przypadek dla poziomu niemal-Astra Sol. Ten ruch stawia GPT-6.1 Sol w tej samej kategorii co GPT-6 Astra Ultrafast w API, w Codex i w ChatGPT Work, a pojawia się on z opublikowanym cennikiem, a nie listą oczekujących: 12,00 USD za milion tokenów wejściowych i 60,00 USD za milion tokenów wyjściowych, dokładnie sześć razy więcej niż kosztuje standardowy GPT-6.1 Sol. Obietnica prędkości na opakowaniu to „do 8x”. Najciekawsze jest to, co właściwie mierzy to sformułowanie — a odpowiedzią nie jest model, za który za chwilę zapłacisz.
Dziennik zmian dla deweloperów zawiera wpis z 8 października: „Dodano tryb Ultrafast dla GPT-6.1 Sol w Responses API. Użyj gpt-6.1-sol z service_tier: "ultrafast", aby skrócić czas między generowanymi tokenami wyjściowymi. Jest dostępny dla wszystkich użytkowników API, z zastrzeżeniem limitów szybkości, z przetwarzaniem globalnym oraz rezydencją danych w USA i UE”. Strona dokumentacji Ultrafast zawiera teraz zapis „powszechnie dostępny dla GPT-6 Astra i GPT-6.1 Sol, z dostępem w wersji zapoznawczej dla GPT-5.6 Sol”, a strona poświęcona szybkości po stronie ChatGPT potwierdza część subskrypcyjną: Ultrafast jest dostępny w Codex i ChatGPT Work w planie Pro za 500 USD oraz w kwalifikujących się planach Enterprise i Edu.
Ultrafast to warstwa usługi, a nie drugi model.
Nic się nie zmienia w wagach. Ten sam checkpoint, to samo okno kontekstowe o rozmiarze 1 050 000 tokenów, ten sam maksymalny rozmiar danych wejściowych wynoszący 922 000 tokenów, ten sam górny limit danych wyjściowych wynoszący 128 000 tokenów, ta sama data odcięcia wiedzy — 30 kwietnia 2026 — te same odpowiedzi. To, co kupujesz, to priorytet szeregowania: model generuje tokeny szybciej, a samo ujęcie OpenAI jest celowo wąskie — ten poziom „skraca czas między generowanymi tokenami wyjściowymi”. Nie czyni modelu mądrzejszym i nie skraca fazy myślenia.
Ta różnica przesądza o całej decyzji. W przypadku pętli agenta, która wykonuje czterdzieści wywołań narzędzi z rzędu, korzyść się kumuluje, ponieważ wynik każdej tury pojawia się szybciej. W przypadku pojedynczego trudnego żądania rozumowania, które większość swojego czasu zegarowego spędza na deliberacji, możesz zapłacić sześciokrotnie więcej i wciąż patrzeć na ten sam wskaźnik ładowania.
Drabina poziomów, raz, prostymi słowami:
• Batch and Flex — połowa ceny Standard, tania ścieżka dla pracy, na którą nikt nie czeka
• Standard — 2,00 USD za wejście / 0,10 USD z pamięci podręcznej / 2,50 USD za zapis do pamięci podręcznej / 10,00 USD za wyjście za milion tokenów
• Fast — dwukrotnie więcej niż Standard, czyli $4.00 / $0.20 / $5.00 / $20.00; OpenAI zmieniło nazwę przetwarzania Priority na tryb Fast 30 lipca 2026 r.
• Ultrabłyskawicznysześciokrotnie Standard, czyli $12.00 / $0.60 / $15.00 / $60.00
• Powyżej 272 tys. tokenów wejściowych — całe żądanie jest ponownie wyceniane według 2x stawek za dane wejściowe i pamięć podręczną oraz 1,5x za dane wyjściowe; Ultrafast long-context to 24,00 USD / 1,20 USD / 30,00 USD / 90,00 USD
Arytmetyka, której nikt nie umieszcza na stronie marketingowej
Sześciokrotna cena za ośmiokrotną szybkość to nie interes przynoszący straty, ale też nie darmowy lunch. Ultrafast jest rozliczany za token, więc zadanie, które w Standard kosztuje 1,00 USD, w Ultrafast kosztuje 6,00 USD — i kończy się w mniej więcej jednej ósmej tego czasu. Oszczędność nie tkwi w rachunku, tylko w czasie rzeczywistym. Płacisz pięć dodatkowych dolarów, aby usunąć siedem ósmych czasu oczekiwania w kolejce dla tego zadania, a to, czy to jest tanie, czy absurdalne, zależy wyłącznie od tego, ile warta jest za minutę osoba albo potok czekający na drugim końcu.
Nasuwają się dwie implikacje, i to właśnie one są pomijane:
• Praca interaktywna to łatwe „tak”. Deweloper obserwujący, jak ląduje diff, agent, który nie może kontynuować, dopóki nie odczyta wyniku — to właśnie przypadki, w których opóźnienie jest produktem. Osiem razy szybsze wyjście w pętli czterdziestu tur to nie marginalna poprawa w ludzkiej percepcji; to różnica między narzędziem, którego używasz, a narzędziem, które zostawiasz w tle.
• Zadania zaplanowane i wsadowe to łatwe „nie”. Jeśli zadanie i tak ma czas do rana, Ultrafast to 6x wyższy rachunek za nic, a o połowę tańszy tryb Batch czeka tuż obok.
Wejście z pamięci podręcznej jest warte drugiego spojrzenia, ponieważ również się zmienia: $0.60 za milion w Ultrafast wobec $0.10 w Standard, wciąż 5% stawki za wejście bez pamięci podręcznej. Agenci korzystający z pamięci podręcznej promptów, którzy przy każdej turze ponownie wysyłają duży prompt systemowy, przekonają się, że rabat za pamięć podręczną skaluje się wraz z poziomem, a nie chroni ich przed nim.

Skąd pochodzi liczba „do 8x”
To jest część, którą trzeba przeczytać uważnie, ponieważ właśnie tutaj nagłówek wdrożenia i dokumentacja wdrożenia po cichu opisują co innego.
Jedyny pomiar prędkości dotyczący konkretnego modelu, jaki O{{1}}penAI publikuje, to zdanie: "{{2}}GPT-6 Astra Ultrafast generuje tokeny do 8x szybciej niż GPT-6 Astra w trybie Standard w Codex.{{/2}}"{{/1}}. To jest wartość dla Astry, zmierzona w Codex. Nie opublikowano równoważnej wielokrotności dla GPT-6.1 Sol. Dokument dotyczący Ultrafast dla tego modelu mówi, że skraca czas między generowanymi tokenami wyjściowymi, i wskazuje tabelę cen; nie podaje przy tym żadnej liczby. Po stronie ChatGPT prędkość powtarza {{3}}zdanie o Astrze i na tym się kończy.{{/3}}
Uczciwa interpretacja sformułowania „do 8 razy szybciej” jest więc taka: to nagłówek tego poziomu, zaczerpnięty z bliźniaczego modelu, który jest w Ultrafast od 29 września, i zarazem twierdzenie dostawcy, którego nie potwierdził niezależnie żaden podmiot w przypadku żadnego z tych modeli. Może ono jak najbardziej być prawdziwe w przypadku GPT-6.1 Sol — oba działają na tym samym stosie obsługi, a mechanizm tego poziomu jest taki sam — ale nikt poza OpenAI nie opublikował pomiaru liczby tokenów na sekundę dla wariantu Sol, a słowo „do” ma w tym niemałe znaczenie.
Warto również rozdzielać poziomy według modelu, ponieważ starszy wciąż jest niedokończoną sprawą. Ultrafast został ogłoszony 13 sierpnia 2026 r. dla GPT-5.6 Sol jako „do 14 razy szybszy niż przetwarzanie Standard”, w ograniczonym podglądzie dla wybranych klientów. Trzy miesiące później dokumentacja wciąż podaje, że GPT-5.6 Sol ma „dostęp w wersji zapoznawczej”, a tabela cen Ultrafast zawiera dokładnie dwa wiersze — GPT-6 Astra i GPT-6.1 Sol. Liczba 14x, która nigdy nie osiągnęła ogólnej dostępności i nie ma opublikowanej stawki, jest twierdzeniem, a nie produktem.

Kto tak naprawdę może to włączyć
Strona API jest szeroka, strona subskrypcji — wąska, a ta różnica potrafi zaskoczyć ludzi.
• API — dostępny dla wszystkich użytkowników API w modelu gpt-6.1-sol, z zastrzeżeniem odrębnych limitów szybkości względem Standard i Fast. Oznacza to drugi budżet do pilnowania, nie tylko drugą cenę.
• Błyskawiczne limity szybkości dla GPT-6.1 Sol — 1 000 000 tokenów na minutę w Build, 4 000 000 w Launch, 40 000 000 w Grow. OpenAI uprościł swoje poziomy użytkowania z pięciu do trzech 6 października, więc te trzy nazwy to aktualna drabina, a nie ta z przeszłości.
• Rezydencja danych — GPT-6.1 Sol obsługuje rezydencję danych w USA i UE oraz przetwarzanie globalne, w tym w trybach Fast i Ultrafast. Ultrafast firmy Astra nie zapewnia rezydencji w UE, więc jeśli Twoje obciążenie jest przypisane do UE, to pierwsza konfiguracja Ultrafast, jaką w ogóle możesz kupić.
• Codex i ChatGPT Work — Ultrafast jest dostępny w planie Pro za 500 USD oraz w kwalifikujących się planach Enterprise i Edu. Administratorzy Enterprise mają go domyślnie wyłączonego i muszą go włączyć dla poszczególnych użytkowników lub obszarów roboczych.
• Chat — nie jest uwzględniony. GPT-6.1 Sol znajduje się w Work i Codex; konsumencki interfejs Chat nie wchodzi w jego skład.
• Jak jest rozliczane w ramach subskrypcji — wykorzystanie wliczone w limit jest zużywane według stawki 8x wyższej niż Standard, a zakupione kredyty lub rozliczenie Enterprise za rzeczywiste użycie są rozliczane według stawki 6x wyższej niż Standard. Warto znać obie te liczby, zanim pozostawisz tę opcję włączoną.
Jeden szczegół implementacyjny decyduje o tym, czy w ogóle odczujesz jakiekolwiek przyspieszenie. Wskazówki OpenAI są w tej kwestii bez ogródek: używaj WebSockets, „zwłaszcza w aplikacjach agentowych, które wykonują wiele wywołań narzędzi szybko jedno po drugim”, ponieważ „bez trwałego połączenia narzut sieciowy może zmniejszyć korzyści w zakresie opóźnień”. Jeśli Twój klient otwiera nowe połączenie HTTP przy każdym wywołaniu, narzut przypadający na żądanie może pochłonąć całą przewagę poziomu, za który właśnie zapłaciłeś 6x. HTTP nadal działa. Po prostu może nie być wart tego poziomu.
Co routujemy, a czego nie
Standardowy GPT-6.1 Sol jest dostępny w OrcaRouter jako openai/gpt-6.1-solw cenie samego dostawcy: 2,00 USD za wejście i 10,00 USD za wyjście za milion tokenów, z marżą 0% — cena katalogowa dostawcy przekazywana 1:1, więc gdy OpenAI zmienia stawkę, zmiana trafia na Twoje rozliczenie tego samego dnia, w którym pojawia się w cenniku, a nie dopiero przy odnowieniu umowy. Ten sam klucz i endpoint obsługują ponad 200 modeli, więc wywołanie GPT-6.1 Sol oraz wywołanie Claude'a czy Qwena stoją za jedną integracją z automatycznym przełączaniem awaryjnym i bez drugiej umowy, a język DSL routingu potrafi złożyć modele w jedno wywołanie, gdy zadanie wymaga więcej niż jednej opinii.
Ultrafast nie należy do tych modeli i sugerowanie czegokolwiek innego byłoby mylące. To flaga poziomu usługi na koncie OpenAI — wysyłasz service_tier: "ultrafast"do gpt-6.1-sol, a OpenAI rozlicza twoje własne konto według powyższych stawek — więc funkcjonuje ona w ramach twojej bezpośredniej integracji z OpenAI. Jeśli ją włączysz, pozostaw ruch objęty tym poziomem na swoim kluczu dostawcy, a ruch o standardowym wolumenie kieruj przez nas. To uczciwy podział, a przy tym tańszy dla wszystkiego, co nie czeka na człowieka.

Co z tym dzisiaj zrobić
Jeśli masz stanowisko Codex lub ChatGPT Work w planie Pro $500, przełącznik już tam jest, a próba nie kosztuje cię nic poza mnożnikiem użycia — uruchom to samo zadanie na oba sposoby i sprawdź, czy pętla, którą faktycznie wykonujesz, ma wystarczająco dużo tur, aby ośmiokrotne przyspieszenie się uwidoczniło. Jeśli korzystasz z API, eksperyment, który warto przeprowadzić, jest węższy, niż sugeruje ogłoszenie: zmierz, jaka część twojego opóźnienia przypada na generowanie tokenów, a jaka na myślenie modelu, a następnie skieruj Ultrafast na część, którą faktycznie może skompresować.
A jeśli masz wybór między Fast przy 2x a Ultrafast przy 6x dla tego samego żądania, Fast to poziom, który pojawił się pierwszy i którego zachowanie możesz wywnioskować z samego cennika. Ultrafast jest nowy dla tego modelu, nie został wyceniony przez żadne niezależne pomiary i jest wart dokładnie tyle, ile mówi twój własny stoper.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
