Wygenerowana karta tytułowa dla poziomu Ultrafast z nagłówkiem „GPT-6 Astra Ultrafast”, podtytułem „Sześć razy większa szybkość, w każdej linii” i dwiema plakietkami o treści „w cenie i ogólnie dostępne” oraz „szybka ścieżka to nie drugi model”.
Guides & Insights

GPT-6 Astra Ultrafast przy 6x: Ile faktycznie kosztuje Cię opublikowany cennik stawek

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

GPT-6 Astra Ultrafast przestał być dostępny wyłącznie przez listę oczekujących 29 września 2026 r. Jest teraz poziomem usługi dostępnym w sprzedaży, z opublikowaną ceną, a cena ta jest dokładnie sześciokrotnie wyższa od standardowej w każdej pojedynczej pozycji. Model bazowy — GPT-6 Astra, flagowy produkt firmy, wydany 3 września 2026 r. — pozostaje bez zmian; to, co zmieniło się na DevDay, to fakt, że szybka ścieżka oparta na tym modelu stała się ogólnie dostępna, a dokumentacja API firmy mówi teraz wprost, że Ultrafast „jest szeroko dostępny dla GPT-6 Astra, z dostępem w wersji zapoznawczej dla GPT-5.6 Sol”. Po raz pierwszy możesz umieścić ten poziom w pozycji budżetowej, a liczba, którą należy tam wpisać, to 60,00 USD za milion tokenów wejściowych i 300,00 USD za milion tokenów wyjściowych, odczytana z firmowej strony z cennikiem 30 września 2026 r.

To czyni z tego inne pytanie niż to, na które odpowiedziała relacja z premiery. Ciekawym faktem w tym tygodniu nie jest to, że ten poziom istnieje — preview został ogłoszony 13 sierpnia 2026 r. i omówiony na śmierć. Ciekawy jest natomiast fakt, że poziom, który nie miał ceny, teraz ją ma, a arytmetyka, która z tego wynika, jest niepochlebna w konkretny, wymierny sposób. Sześciokrotność to nie premia, którą przyjmuje się ze wzruszeniem ramion; to premia, którą trzeba odzyskać w mniejszej liczbie tur, a to, czy jest to możliwe, jest właściwością twojego obciążenia pracą, a nie samego modelu.

Wielokrotne blokady na każdej linii — i to jest pierwsza rzecz, którą trzeba zrozumieć.

Czytając stronę cennika OpenAI 30 września 2026 r., zobaczysz, że kolumna Ultrafast dla GPT-6 Astra to płaski mnożnik 6x względem kolumny Standard, a nie narzut stosowany do niektórych pozycji, a do innych nie. Ma to znaczenie, ponieważ oznacza, że nie można tego obejść optymalizacją polegającą na zmianie kształtu swoich żądań.

• GPT-6 Astra, usługa Standard, żądania do 272 000 tokenów wejściowych — 10,00 USD za tokeny wejściowe, 1,00 USD za buforowane tokeny wejściowe, 12,50 USD za zapis w pamięci podręcznej, 50,00 USD za tokeny wyjściowe, za 1 mln tokenów.

• GPT-6 Astra Ultrafast, ten sam próg — 60,00 USD za wejście, 6,00 USD za wejście z pamięci podręcznej, 75,00 USD za zapis do pamięci podręcznej, 300,00 USD za wyjście, za 1 mln tokenów. Dokładnie 6x na wszystkich czterech pozycjach.

• Powyżej 272 000 tokenów wejściowych całe żądanie podlega ponownej wycenie — Standard przechodzi na 20,00 USD / 2,00 USD / 25,00 USD / 75,00 USD, a Ultrafast na 120,00 USD / 12,00 USD / 150,00 USD / 450,00 USD. Nadal 6x. Zasada długiego kontekstu, którą OpenAI dokumentuje dla GPT-6 Astra, to 2x stawki za wejście i pamięć podręczną oraz 1,5x stawka za wyjście dla całego żądania po przekroczeniu progu, i obowiązuje identycznie dla obu poziomów.

• Pozostałe poziomy na tej samej karcie — Batch i Flex to 50% Standard, a tryb Fast to 2x Standard. Zatem drabina mnożników dla tego jednego modelu wynosi 0,5x, 1x, 2x, 6x, bez szczebla pomiędzy dwoma ostatnimi.

Nie istnieje odpowiednik Batch w Ultrafast. Batch i Flex to zniżki, które kupujesz, godząc się na luźniejsze planowanie na standardowej ścieżce; nie ma wolnej i taniej wersji szybkiej ścieżki. Jeśli chcesz szybkości, płacisz 6x za każdy token, który wysyłasz, i każdy token, który otrzymujesz z powrotem, a żadna mieszanka wejścia z pamięci podręcznej i świeżego wejścia nie poprawia tego stosunku.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Ile naprawdę kosztuje jedna rozmowa

Abstrakcję łatwiej zrozumieć na dwóch konkretnych żądaniach. Oba korzystają z publikowanych przez OpenAI stawek za milion; arytmetyka jest nasza.

Pojedyncze wywołanie z 20 000 tokenów wejściowych i odpowiedzią o długości 2000 tokenów kosztuje 0,30 USD w Standard — 20 000 tokenów po 10 USD za milion to 0,20 USD, plus 2000 po 50 USD za milion to 0,10 USD. To samo wywołanie w Ultrafast kosztuje 1,80 USD. Dokładnie sześć razy więcej, zgodnie z reklamą.

A teraz przypadek, który faktycznie opisuje pętlę agenta: rozmowa o 200 000 tokenów, w której 190 000 tokenów to zbuforowany prefiks, a tylko 10 000 to świeże dane, generująca krok o 1000 tokenów. Standard nalicza 0,19 USD za odczyt z pamięci podręcznej, 0,10 USD za świeże wejście i 0,05 USD za wyjście — 0,34 USD na krok. Ultrafast nalicza 1,14 USD, 0,60 USD i 0,30 USD — 2,04 USD na krok. Znowu 6x, ale spójrz, co zrobiła ta mieszanka: buforowanie to pojedyncza najskuteczniejsza dźwignia kosztowa w tym modelu, a mimo to na standardowej ścieżce jest wciąż dokładnie 6 razy taniej, więc silnie zbuforowany agent nie zyskuje proporcjonalnie nic z szybkiej warstwy i nie łagodzi to też narzutu.

Konsekwencja jest tym, co warto przyswoić. Ponieważ mnożnik jest stały, próg opłacalności wcale nie zależy od mieszanki tokenów. Zależy wyłącznie od liczby tur. Ultrafast zwraca się w danym obciążeniu tylko wtedy, gdy jego uruchomienie zmniejsza liczbę rozliczanych tur mniej więcej sześciokrotnie — czy to przez zwinięcie pętli ponownych prób do pojedynczego przebiegu, czy przez zastąpienie sekwencji krótkich wywołań doprecyzowujących jedną szybszą sesją interaktywną. Jeśli Twoje obciążenie generuje taką samą liczbę tur jak wcześniej, tylko szybciej, kupujesz skrócenie opóźnienia za dokładnie 6x i nic więcej.

Limity szybkości i geografia to nieogłaszane pułapy.

Dwa ograniczenia stoją poza ceną i łatwo je przeoczyć, gdy czytasz cennik.

Pierwszą kwestią jest przepustowość. Ultrafast dla GPT-6 Astra jest dostępny dla wszystkich użytkowników API, ale początkowo przy niskich limitach szybkości: OpenAI dokumentuje 500 000 tokenów na minutę dla poziomów od 1 do 3, 1 000 000 dla poziomu 4 i 5 000 000 dla poziomu 5. Jak na poziom sprzedawany za szybkość to realny sufit — kontekst agenta o rozmiarze 200 000 tokenów przy pół miliona tokenów na minutę oznacza dwa i pół żądania na minutę na niskim poziomie. Własne wytyczne OpenAI wskazują na ten sam problem z drugiej strony, zdecydowanie zalecając WebSockets właśnie dlatego, że narzut sieciowy na żądanie może pochłonąć opóźnienie, za które płaci dany poziom.

Drugą kwestią jest rezydencja danych. Ultrafast obsługuje wyłącznie rezydencję danych w USA i przetwarzanie globalne. Nie obsługuje punktów końcowych przetwarzania regionalnego w UE ani w innych regionach poza USA. Jeśli Twoje wdrożenie zależy od punktu końcowego rezydencji danych w UE dla GPT-6 Astra, ten poziom nie jest dla Ciebie dostępny za żadną cenę, a jest to twarda granica, a nie wybór konfiguracji. Należy również pamiętać, że punkty końcowe rezydencji danych wiążą się z 10% narzutem w przypadku modeli wydanych 5 marca 2026 r. lub później, a GPT-6 Astra jest takim modelem.

Nagłówek o szybkości spadł z 14x do 8x

Warto to starannie zaznaczyć, ponieważ liczba krążąca w większości relacji jest nieaktualna. Strona dokumentacji OpenAI Ultrafast, w wersji opublikowanej dzisiaj, zawiera zdanie: „nasza najszybsza warstwa usług API, do 8 razy szybsza niż tryb Standard”. Zapowiedź wersji podglądowej GPT-5.6 Sol z 13 sierpnia 2026 r. obiecywała „do 14 razy szybsze przetwarzanie niż w trybie Standard” oraz do 750 tokenów wyjściowych na sekundę na sprzęcie Cerebras.

To nie są te same twierdzenia, a różnica to nie tyle wycofanie się, ile zmiana tematu. Wartość 14x zmierzono na GPT-5.6 Sol w ograniczonym podglądzie; wartość 8x to to, co OpenAI publikuje dla tego poziomu w obecnym kształcie, z GPT-6 Astra jako szeroko dostępnym modelem. Kto planuje budżet na podstawie 14x dla Astry, planuje go na podstawie liczby, której OpenAI nie opublikowało dla Astry. Uczciwa interpretacja jest taka, że obie liczby to raportowane przez dostawcę pułapy przepustowości wyjściowej, że żadna z nich nie jest gwarancją opóźnienia dla twojego obciążenia, a czas end-to-end nadal obejmuje przetwarzanie danych wejściowych, wywołania narzędzi i twoją własną orkiestrację. Traktuj 8x jako wartość do planowania, a wszystko, co lepsze, traktuj jako bonus, który zweryfikujesz na własnym ruchu, zamiast zakładać go z góry.

Co zrobić z tym w poniedziałek

Reguła decyzyjna wynikająca z arytmetyki jest węższa, niż sugeruje marketing, i warto ją zapisać, zanim ktoś zaproponuje włączenie Ultrafast w całym środowisku.

Włącz to tam, gdzie obciążenie jest wrażliwe na opóźnienia i interaktywne, oraz tam, gdzie człowiek czeka. Triage incydentów, eskalacja wsparcia na żywo, pętla badawcza, w której analityk iteruje w trakcie jednego posiedzenia — to są przypadki, w których wartość odpowiedzi docierającej teraz, a nie za cztery minuty, nie jest proporcjonalna do ceny tokena, i w których sześciokrotny rachunek za niewielką liczbę tur jest trywialnie mniejszy niż koszt osoby czekającej. Przykłady samego OpenAI w ogłoszeniu o wersji zapoznawczej miały dokładnie taki kształt: czytanie logów, gdy rozwija się awaria, sprowadzenie całonocnej pętli badawczej do sesji roboczej.

Wyłącz to tam, gdzie obciążenie jest ograniczone przepustowością lub ma charakter wsadowy. Nocna reindeksacja, masowy przebieg klasyfikacji, zaplanowany raport, uzupełnianie danych — żadne z nich nie przejmuje się opóźnieniem rzeczywistym, wszystkie są zdominowane przez liczbę tokenów, a każde z nich ma opcję 0,5x dostępną tuż obok, w tym samym cenniku w Batch i Flex. Płacenie 12x stawki wsadowej, żeby skończyć szybciej, to najbardziej oczywisty sposób marnowania pieniędzy w tej tabeli.

Niezręczny środek to pętla kodowania agentowego i to tam arytmetyka liczby tur rozstrzyga sprawę. Jeśli szybkość naprawdę eliminuje ponowienia — jeśli pierwsze podejście modelu do zmiany wieloplikowej częściej się udaje, bo nie walczy z limitem czasu — to Ultrafast może być tańszy na ukończone zadanie, mimo że jest 6 razy droższy za token. To jest mierzalne twierdzenie o twoich własnych śladach, a nie ogólne, a pomiar jest tani: policz rozliczane tury na ukończone zadanie na obu poziomach i pomnóż przez stawkę. Jeśli stosunek nie jest bliski sześciu, szybki poziom to zakup niskiego opóźnienia i jako taki powinien być uzasadniony.

Poziom jest wyceniony; trasy wokół niego nie są tym samym pytaniem.

Jedna praktyczna uwaga o tym, jak do tego podejść. GPT-6 Astra w usłudze standardowej jest już dostępny w OrcaRouter jako openai/gpt-6-astra według własnej stawki dostawcy — 10,00 USD za wejście i 50,00 USD za wyjście za milion tokenów, z progiem długiego kontekstu 272K do 20,00 / 75,00 USD — udostępniany z 0% marży, co oznacza, że cena katalogowa dostawcy jest przekazywana dalej, a każda zmiana u dostawcy trafia na Twoje rozliczenie tego samego dnia, w którym pojawia się w cenniku OpenAI, a nie dopiero przy kolejnym odnowieniu umowy. Ten sam klucz daje dostęp do ponad 200 modeli, więc poziom standardowy może działać za tym samym klientem co tańszy poziom lub model konkurenta, bez drugiej integracji.

Nie obsługujemy poziomu Ultrafast. To flaga poziomu usługi na koncie OpenAI, a nie osobno trasowalny model — ustawiasz service_tier: "ultrafast"w żądaniu kierowanym do gpt-6-astra — a OpenAI rozlicza go na Twoim własnym koncie według powyższych stawek. Jeśli go włączysz, będzie funkcjonować w ramach Twojej bezpośredniej integracji z OpenAI, a OrcaRouter to właściwe miejsce dla ruchu w standardowym poziomie, który trasujesz obok niego. Powiedzenie tego wprost jest bardziej przydatne niż sugerowanie możliwości, których nie mamy.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Reguła decyzyjna w jednym akapicie

Sześciokrotność to cena poziomu, a nie cena modelu: wagi, okno kontekstu o rozmiarze 1 050 000 tokenów, limit wyjściowy 128 000 tokenów i odpowiedzi są identyczne jak w standardowym GPT-6 Astra. Kupujesz do 8x szybszą przepustowość wyjściową, według cennika, który jest 6x wyższy w każdej pozycji, z zastrzeżeniem niskich początkowych limitów szybkości i ograniczenia rezydencji w USA, które całkowicie wyklucza UE. Ten wybór jest oczywiście słuszny dla człowieka czekającego na odpowiedź, oczywiście błędny w przypadku zaplanowanego zadania wsadowego, które ma dostępną ścieżkę za połowę ceny, i naprawdę nierozstrzygnięty w przypadku pętli agentowych, w których odpowiedź zależy od tego, czy szybkość eliminuje tury. Zmierz liczbę tur na własnych śladach, zanim się zobowiążesz, a resztę kieruj po cenie katalogowej.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie