Wygenerowana karta tytułowa z nagłówkiem „Ultrafast vs Standard”, podtytułem „Jeden checkpoint, dwa poziomy usług” i dwiema plakietkami o treści „te same wagi, te same odpowiedzi” oraz „zmienia się tylko ścieżka serwowania”.
Guides & Insights

GPT-6 Astra Ultrafast vs GPT-6 Astra: ten sam checkpoint, sześciokrotnie większa szybkość

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

To rzadkie porównanie, w którym obie strony są tym samym. GPT-6 Astra Ultrafast nie jest modelem; to poziom usługi zastosowany do GPT-6 Astra, flagowego modelu firmy wydanego 3 września 2026 r., a dokumentacja firmy wprost podaje ten mechanizm: ustawiasz model na gpt-6-astra i dodajesz service_tier: "ultrafast". Nie ma osobnego identyfikatora modelu, osobnego checkpointu ani osobnego okna kontekstowego. Zatem strona zatytułowana „GPT-6 Astra Ultrafast vs GPT-6 Astra” nie może być argumentem opartym na benchmarku, ponieważ nie istnieje drugi zestaw wag do poddania benchmarkowi — a udawanie, że jest inaczej, byłoby najłatwiejszym sposobem na napisanie wprowadzającego w błąd artykułu w tym tygodniu.

To, co można porównać, jest węższe i bardziej użyteczne niż tabela specyfikacji: jeden cennik przeciw drugiemu, jedno stanowisko w kwestii dostępności przeciw innemu oraz różnica czasu rzeczywistego, której wielkość OpenAI określa jako „do 8x”. Odkąd Ultrafast dla GPT-6 Astra stał się ogólnie dostępny 29 września 2026 r., obie strony tego porównania wreszcie mają przypisane ceny, co nie było prawdą w sierpniu, gdy ten poziom był dostępny tylko w wersji zapoznawczej. To oznacza, że pytanie zmieniło kształt. Nie brzmi już ono: „czy ten poziom jest prawdziwy”, lecz: „przy sześciokrotnie wyższej stawce, co musi być prawdą o moim obciążeniu, aby szybka ścieżka była właściwym zakupem”.

Kolumny, które się różnią, i ta, która nie.

Ustawiając oba pasma obok siebie, niemal każdy wiersz jest identyczny z założenia. Wiersze, które nie są identyczne, to jedyna treść, jaką ma ten artykuł.

• Punkt kontrolny — identyczny. GPT-6 Astra Ultrafast działa na wagach standardowego GPT-6 Astra. Takie samo zachowanie podczas próbkowania, takie samo zachowanie podczas rozumowania, ta sama odpowiedź na ten sam prompt przy tym samym ustawieniu wysiłku.

• Kontekst, dane wyjściowe i dane wejściowe — identyczne. Okno wejściowe o rozmiarze 1 050 000 tokenów i limit danych wyjściowych wynoszący 128 000 tokenów po obu stronach, wejście tekstowe, obrazowe i plikowe, wyjście tekstowe oraz data odcięcia wiedzy 30 kwietnia 2026 r. niezależnie od poziomu.

• Kontrola rozumowania — identyczna. Poziom wysiłku przyjmuje wartości low, medium, high, xhigh i max po obu stronach. Wariant zmienia szybkość napływania tokenów, a nie to, jak intensywnie model myśli, więc żądanie Ultrafast z wysiłkiem xhigh nadal jest żądaniem z wysiłkiem xhigh.

• Cennik — różni się, i to jest cała decyzja. Standard nalicza 10,00 USD za wejście, 1,00 USD za wejście z pamięci podręcznej, 12,50 USD za zapisy do pamięci podręcznej i 50,00 USD za wyjście za 1 mln tokenów do 272 000 tokenów wejściowych; Ultrafast nalicza 60,00 / 6,00 / 75,00 / 300,00 USD. Powyżej 272 tys. całe żądanie jest przeliczane na 20,00 / 2,00 / 25,00 / 75,00 USD w standardzie i 120,00 / 12,00 / 150,00 / 450,00 USD w Ultrafast. Sześciokrotnie, na wszystkich czterech liniach, w obu przedziałach kontekstu.

• Dostęp — inny. Standard to domyślna ścieżka, możliwa do wywołania przez każdego z kluczem API. Ultrafast działał na zasadzie listy oczekujących i jest teraz dostępny dla wszystkich użytkowników API, ale początkowo z niskimi limitami szybkości: OpenAI dokumentuje 500 000 tokenów na minutę na poziomach API od 1 do 3, 1 000 000 na poziomie 4 i 5 000 000 na poziomie 5.

• Geografia — różnica tylko w jednym kierunku, ponieważ ograniczenie dotyczy poziomu. Ultrafast obsługuje wyłącznie rezydencję danych w USA i przetwarzanie globalne, a nie obsługuje punktów końcowych przetwarzania w UE ani w innych regionach poza USA; standardowa ścieżka nie ma równoważnego ograniczenia.

• Przepustowość — inna i określona jako górna granica, a nie obietnica. Dokumentacja OpenAI dotycząca Ultrafast opisuje ten poziom jako zapewniający „nawet 8 razy szybsze prędkości niż tryb Standard”.

• Benchmarki — to nie wiersz. Nie ma nic, co można by w nim umieścić. Tam, gdzie strona porównująca dwa modele zawierałaby tabelę indeksową, ta ma po obu stronach te same liczby — i to jest sedno sprawy, a nie luka w danych.

A screenshot of OpenAI's Ultrafast documentation page, showing the sentence 'Our fastest API service tier, with up to 8x faster speeds than Standard mode.', the sentence 'It is broadly available for GPT-6 Astra, with preview access for GPT-5.6 Sol.', the recommendation to use WebSockets because per-request network overhead can reduce the latency gains, the note that Ultrafast for GPT-6 Astra is available to all API users at low rate limits with higher limits or Sol preview access available through an OpenAI account team, and a Python code sample setting service_tier to 'ultrafast' with model 'gpt-6-astra'.

Crossover, zadziałał poprawnie

Ponieważ mnożnik wynosi stałe 6x, decyzja sprowadza się do jednej nierówności i warto ją rozpisać, a nie tylko do niej nawiązywać. Ultrafast to właściwy zakup, gdy wartość szybszego ukończenia przewyższa sześciokrotność rachunku za tokeny. Wszystko inne to komentarz.

Rozważmy konkretny przypadek: przebieg agentowy, który przyswaja kontekst repozytorium o rozmiarze 100 000 tokenów i tworzy patch o rozmiarze 5 000 tokenów, przy czym zawartość repozytorium jest buforowana między próbami. W standardowej usłudze odczyt z pamięci podręcznej kosztuje 0,10 USD, świeże dane wejściowe 0,10 USD, a dane wyjściowe 0,25 USD — 0,45 USD na próbę. W Ultrafast ta sama próba kosztuje 0,60 USD, 0,60 USD i 1,50 USD — 2,70 USD. Różnica wynosi 2,25 USD na próbę. Jeśli szybkość nie robi niczego poza tym, że każda próba kończy się szybciej, a liczba prób się nie zmienia, zapłacono 2,25 USD na próbę za opóźnienie, a jedynym uzasadnieniem jest wartość czasu oczekiwania.

Teraz niech szybkość wykona robotę. Jeśli szybsza ścieżka oznacza, że pierwsze podejście modelu częściej się udaje, bo nie walczy z wolną rundą w obie strony, a liczba podejść spada z trzech do jednego, standard kosztuje 1,35 dolara za zadanie, podczas gdy Ultrafast — 2,70 dolara. Nadal drożej — ale tylko 2x, nie 6x, a teraz pytanie brzmi, czy dwa dolary są warte różnicy między jednym cyklem interaktywnym a sekwencją takich cykli.

To jest arytmetyka, którą zespoły pomijają, a pokusa, by ją pominąć, działa w obu kierunkach. Płaski 6x na każdej linii sprawia, że poziom wygląda jednolicie drogo, co jest błędne, gdy usuwa tury. A nagłówek „do 8x” sprawia, że wygląda jednolicie tanio, co jest błędne, gdy tego nie robi. Liczbą, która to rozstrzyga, są rozliczane tury na ukończone zadanie, mierzone na własnych śladach, pomnożone przez stawkę. Jeśli ten stosunek nie zbliża się do sześciu, Ultrafast jest zakupem niskiego opóźnienia i powinien zostać zatwierdzony jako taki, z nazwanym człowiekiem po drugiej stronie oczekiwania.

Co obejmuje, a czego nie obejmuje „do 8x”

Publikowana deklaracja prędkości to górny limit przepustowości wyjściowej, a utożsamianie przepustowości z opóźnieniem to najczęstszy błąd popełniany w odniesieniu do tego poziomu.

Przepustowość to liczba tokenów na sekundę, gdy generowanie już trwa. Opóźnienie to czas między wysłaniem żądania a otrzymaniem odpowiedzi. Ultrafast poprawia to pierwsze. Dokumentacja samego OpenAI wskazuje to drugie jako odrębny problem, zdecydowanie zalecając WebSockets dla Ultrafast właśnie dlatego, że narzut sieciowy na żądanie może niwelować zyski opóźnieniowe — zalecenie, które byłoby zbędne, gdyby ten poziom czynił rundy sieciowe darmowymi. Dwa kolejne elementy czasu zegarowego leżą całkowicie poza tym poziomem: czas, jaki twoja własna orkiestracja spędza między wywołaniami, oraz czas, jaki wywołanie narzędzia zajmuje na serwerach kogoś innego. W przypadku pojedynczego długiego generowania przepustowość to większość historii. W przypadku dwudziestoetapowej pętli agenta to tylko jej ułamek, i ten ułamek jest dokładnie powodem, dla którego arytmetyka liczby tur powyżej ma większe znaczenie niż nagłówek 8x.

A screenshot of the OrcaRouter model page for GPT-6 Astra, model id openai/gpt-6-astra, showing a 1M-token context window, 128K maximum output, text, image and file input, text output, public benchmarks attributed to OpenAI dated 2026-09-04, input price $10.00 and output price $50.00 per 1M tokens, p50 time to first token 4.69 s, a 10.00 s figure, and 155.1M tokens of traffic, with the page's code sample and EN language toggle visible in the header.

Dla kalibracji spójrz na niższy poziom. Tryb Fast, przemianowany z Priority processing 30 lipca 2026 r., kosztuje 2x standardowo i zgodnie z dokumentacją jest do 2,5x szybszy. Ultrafast kosztuje 6x standardowo i zgodnie z dokumentacją jest do 8x szybszy. Zatem przejście z Fast na Ultrafast to 3x większy koszt za około 3,2x większą szybkość — niemal liniowa wymiana. Premia względem standardu nie jest superliniowa; jest po prostu duża i jest dostępna tylko w tej jednej rodzinie modeli. Tabela cen Ultrafast OpenAI ma tylko jeden wiersz, a jest nim gpt-6-astra, co oznacza, że ten poziom jest możliwością obecnego flagowca, a nie ogólnym wyborem poziomu usługi w całej linii.

Dwa obciążenia, jeden model

Najczystszym sposobem prowadzenia tego porównania jest przestać pytać, czy Ultrafast jest lepszy, i zacząć pytać, którym z dwóch kształtów jest twoje żądanie.

Pierwszy wzorzec to osoba, która czeka. Triage incydentów, gdy trwa awaria, eskalacja wsparcia, w której klient jest na linii, analityk iterujący w ramach jednej sesji — to obciążenia, w których odpowiedź przychodząca w dwadzieścia sekund, a nie w dwie minuty, zmienia to, co dana osoba może zrobić dalej, i w których całkowity rachunek za tokeny jest niewielki, ponieważ liczba tur jest mała. Sześciokrotna stawka przy garstce tur to błąd zaokrąglenia wobec kosztu osoby, która tam siedzi. To tutaj poziom jest oczywiście właściwy i to jest wzorzec, który opisały własne materiały przedpremierowe OpenAI.

Drugi kształt to maszyna działająca według harmonogramu. Nocna reindeksacja, masowy przebieg klasyfikacji, raport, który musi być gotowy na rano, uzupełnienie danych historycznych. Żadna z tych rzeczy nie potrafi odczuwać opóźnień. Wszystkie są zdominowane przez liczbę tokenów. A wszystkie mają lepszą opcję w tym samym cenniku: Batch i Flex, w cenie 50% standardowej, czyli 5,00 USD za dane wejściowe i 25,00 USD za dane wyjściowe za milion dla GPT-6 Astra do 272K. Płacenie 6x więcej, by zadanie, którego nikt nie obserwuje, zakończyło się szybciej, skoro istnieje ścieżka za połowę ceny, to najdroższy możliwy błąd w tej tabeli.

Trzeci kształt jest tym niejednoznacznym i to ten, który faktycznie ma większość zespołów inżynierskich: pętla agentowa. To tam rozstrzyga arytmetyka punktu przecięcia, a nie reguła kciuka, i tam pomiar jest tak tani, że nie ma wymówki dla zgadywania — opomiaruj liczbę tur na ukończone zadanie na obu torach, pomnóż przez stawkę i porównaj sumy. Odpowiedzi GPT-6 Astra są takie same po obu stronach, więc każda różnica w liczbie tur to różnica w tym, ile czasu zajął model, a nie w tym, co wytworzył, co czyni to czystym eksperymentem, a nie eksperymentem obciążonym czynnikami zakłócającymi.

Kupowanie standardowej opcji

Warto rozdzielić dwie rzeczy, które określenie „Ultrafast pricing” zwykle zaciera: cenę poziomu i cenę modelu. Standard GPT-6 Astra jest modelem routowalnym, a w OrcaRouter jest dostępny jako openai/gpt-6-astra po stawce samego dostawcy — 10,00 USD za wejście, 1,00 USD za wejście z pamięci podręcznej i 50,00 USD za wyjście za milion tokenów, z udokumentowanym progiem długiego kontekstu do 20,00 USD / 2,00 USD / 75,00 USD powyżej 272 000 tokenów wejściowych. Jest serwowany z 0% narzutu, co oznacza, że cena katalogowa dostawcy jest przekazywana bez zmian, a zmiana stawki dostawcy trafia na Twój rachunek tego samego dnia, a nie dopiero przy kolejnym odnowieniu umowy, a ten sam klucz daje dostęp do ponad 200 innych modeli, więc ewaluacja rozpoczęta od Astry może zostać rozszerzona na konkurenta bez drugiej integracji.

Sam poziom Ultrafast nie podlega naszemu routingowi — a powód jest strukturalny, nie komercyjny: to nie jest model. To flagą poziomu usługi z kontrolą dostępu, którą OpenAI stosuje do własnego identyfikatora modelu i rozlicza na Twoim koncie, włączaną dla każdego żądania przez wywołującego. Podział jest więc czysty — jeśli włączysz Ultrafast, będzie on działać w Twojej bezpośredniej integracji z OpenAI, a ruch w warstwie standardowej, który prowadzisz obok niego, to dokładnie to, do czego służy brama przepuszczająca. Precyzyjne określenie tej granicy jest bardziej użyteczne niż akapit sugerujący, że szybka ścieżka jest dostępna przez nas.

A screenshot of OpenAI's API pricing page with the Ultrafast tab selected, showing gpt-6-astra at $60.00 input, $6.00 cached input, $75.00 cache writes and $300.00 output per 1M tokens for short-context requests, stepping to $120.00 / $12.00 / $150.00 / $450.00 above 272,000 input tokens, alongside gpt-5.6-sol at $4.00 / $0.40 / $5.00 / $20.00 short-context and $8.00 / $0.80 / $10.00 long-context, with the page's notes that data-residency endpoints carry a 10% uplift for models released on or after March 5, 2026, that FedRAMP carries a further 10%, that Priority processing was renamed Fast mode on July 30, 2026, and that GPT-5.6 Sol's promotional pricing is available at least through November 21, 2026.

Dolna linia, która jest krótsza niż strona

GPT-6 Astra Ultrafast i GPT-6 Astra to jeden model z dwoma cennikami. Poziom zmienia się, gdy otrzymujesz odpowiedź, a nie to, czym ona jest — te same wagi, to samo okno 1 050 000 tokenów, ten sam limit wyjściowy 128 000 tokenów, te same opcje kontroli wysiłku i ten sam punkt odcięcia wiedzy, przy nawet 8x większej przepustowości wyjściowej za dokładnie 6x wyższą cenę w każdej pozycji, z zastrzeżeniem niskich początkowych limitów szybkości i ograniczenia rezydencji wyłącznie do USA, którego standardowa ścieżka nie ma. Kupuj go tam, gdzie ktoś czeka, albo tam, gdzie szybkość w sposób udowodniony eliminuje rozliczane tury, pomiń go tam, gdzie zadanie działa według harmonogramu, a Batch lub Flex jest dostępny za połowę standardowej stawki, i mierz liczbę tur, zamiast zakładać ją. Jedyną rzeczą, której to porównanie nie może ci powiedzieć, jest to, który model jest lepszy, ponieważ zawsze był w nim tylko jeden model.