Główna karta tytułowa dla GPT-6 Astra z napisem „Jak wywołać GPT-6 Astra”, z podtytułem „Identyfikator modelu, endpoint i ile kosztuje uruchomienie o długim horyzoncie”, z wierszem daty „Model wydany 3 września 2026 — szczegóły API zweryfikowane 16 września 2026” oraz trzema kartami poniżej: „Identyfikator modelu: gpt-6-astra”, „Kontekst: 1 050 000 tokenów” i „Standard: 10,00 USD za wejście / 50,00 USD za wyjście”, z logo OrcaRouter nałożonym w prawym dolnym rogu.
Guides & Insights

GPT-6 Astra API: identyfikator modelu, punkt końcowy i ile tak naprawdę kosztuje zadanie o długim horyzoncie

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

The short version: GPT-6 Astra is callable today at https://api.openai.com/v1 under a single model id, gpt-6-astra, at $10.00 per million input tokens, $1.00 cached input and $50.00 output — the figures Ope​nAI's own pricing page carried on September 16, 2026. The model itself is from September 3, 2026, thirteen days before this page was written, so nothing here is launch coverage and nothing here is framed as an announcement. This is the reference page for the developer question that comes after availability: what string to pass, which endpoint takes it, what the 1,050,000-token window really buys, what the account has to look like first, and what one genuine long-horizon agent run costs on a rate card that quietly reprices itself above 272,000 input tokens. GPT-5.6 Sol appears throughout only as the price baseline it is sold above, never as the subject.

Powód, dla którego trzynastodniowy model zasługuje w tym tygodniu na własną stronę, jest taki, że ścieżki dostępu do niego zmieniły się po tym, jak zmieniła się premiera, a ścieżka API jest teraz tą zwyczajną. Kiedy Ope​nAI wypuściło Astrę 3 września, opisało to jako stopniowe wdrażanie, a nie dostępność; do 8 września mówiło już, że model został w pełni udostępniony użytkownikom Plus, Pro, Business i Enterprise w Co​dex i ChatGPT Work, a w tygodniu 14 września AWS umieszczał go w Bedrock, a Microsoft Foundry oferowało go jako ogólnie dostępny. Dla wywołującego API ta kolejność ma mniejsze znaczenie, niż to brzmi — endpoint przez cały czas działał i był udokumentowany — ale oznacza to, że pytania zakupowe wokół niego mają teraz odpowiedzi, których nie miały w dniu premiery. Wszystko poniżej odczytano z własnej dokumentacji modeli, strony z cennikiem i strony kontroli danych Ope​nAI w dniu 16 września 2026 r., a wszystko, co pochodzi skądinąd, mówi o tym w zdaniu, które to zawiera.

Identyfikator modelu oraz szczerze udzielona odpowiedź na pytanie o snapshot

Ciąg do przekazania to gpt-6-astra — małymi literami, z łącznikami, bez prefiksu dostawcy. To jedyny identyfikator, jaki Ope​nAI dokumentuje dla tego modelu.

Jeśli szukasz datowanego snapshotu do przypięcia, nie ma takiego, którego można by znaleźć, i nie zamierzamy wymyślać wiarygodnie wyglądającego sufiksu. Strona modelu Ope​nAI dla GPT-6 Astra wymienia dokładnie jeden wpis w sekcji Snapshots i jest to samo gpt-6-astra. Nie ma -2026-09-03 w formacie datowanym ani -latest aliasu po stronie dostawcy. Podczas badania zobaczyliśmy zmieniający się alias w postaci ~openai/gpt-astra-latest na liście routera; to konstrukcja bramy zbudowana na identyfikatorze dostawcy, a nie coś, co publikuje Ope​nAI, i nie powinna trafiać do twojej konfiguracji tak, jakby była.

Praktyczna konsekwencja jest niewielka, ale warto ją wspomnieć. Możesz pobrać obiekt modelu, aby potwierdzić, z czym rozmawiasz:

curl https://api.openai.com/v1/models/gpt-6-astra -H "Authorization: Bearer $OPENAI_API_KEY"

Przypnij samo id w wartości konfiguracji, zamiast wpisywać je w tuzinie miejsc wywołań. Jeśli OpenAI później doda snapshoty z datą, samo id stanie się ruchomym celem, a twoja przypięta wartość zacznie zmieniać się pod twoimi stopami — jedno miejsce do edycji to różnica między dwuminutową zmianą a popołudniem spędzonym na grepowaniu.

Punkt końcowy: bazowy adres URL, kompatybilność i żądanie, które działa

The base URL is https://api.openai.com/v1. Per Ope​nAI's model documentation, GPT-6 Astra is supported on Responses (/v1/responses), Chat Completions (/v1/chat/completions) and Batch (/v1/batch). It is explicitly not supported on Realtime, Assistants, Fine-tuning, Embeddings, image generation and editing, video, audio, moderation, or the legacy Completions endpoint — and those absences matter as much as the presence list, because a team that planned around the Assistants API or a fine-tuned variant has to replan rather than rewrite.

Co do kompatybilności: to własne API OpenAI, czyli format transmisji, pod który napisano każdy zgodny z OpenAI SDK i klienta. Wszystko, co mówi tym formatem, będzie rozmawiać z gpt-6-astra bez warstwy pośredniej — zmieniasz ciąg modelu, a jeśli migrujesz ze starszego modelu OpenAI, również nazwy parametrów poniżej. Nowe projekty powinny używać Responses API: to interfejs, na którym OpenAI dokumentuje kontrolę rozumowania tego modelu, to tam znajdują się wbudowane narzędzia, a obsługa Chat Completions w przypadku najnowszych modeli historycznie była płytsza z tych dwóch.

Minimalne wywołanie strumieniowe z ustawionym poziomem wysiłku rozumowania:

curl https://api.openai.com/v1/responses \

-H "Authorization: Bearer $OPENAI_API_KEY" \

-H "Content-Type: application/json" \

-d '{"model": "gpt-6-astra", "input": "Wymień pliki, które zmieniłbyś, aby przenieść tę usługę z przestarzałego interfejsu API uwierzytelniania.", "reasoning": {"effort": "high"}, "max_output_tokens": 16000, "stream": true}'

A to samo w Pythonie, w którym większość czytelników faktycznie żyje:

from openai import OpenAI

client = OpenAI()

stream = client.responses.create(model="gpt-6-astra", input="Wymień pliki, które należałoby zmienić, aby przenieść tę usługę z przestarzałego API uwierzytelniania.", reasoning={"effort": "high"}, max_output_tokens=16000, stream=True)

for event in stream:

if event.type == "response.output_text.delta": print(event.delta, end="")

Trzy rzeczy w tym żądaniu są charakterystyczne dla tego modelu, a nie skopiowane z ogólnego przewodnika szybkiego startu.

Poziom wysiłku rozumowania to pokrętło kosztów, a nie tylko pokrętło jakości. Strona modelu Ope​nAI wymienia obsługiwane wartości jako low, medium, high, xhigh i max. Zwróć uwagę, gdzie zaczyna się ta lista: dla GPT-6 Astra nie ma wartości none ani minimal, więc dolna granica przesunęła się w górę. Tokeny rozumowania są rozliczane jak tokeny wyjściowe po 50,00 USD za milion, co oznacza, że zmiana wysiłku z high na max to decyzja z przypisaną ceną, a nie darmowe ulepszenie jakości.

Streaming jest obsługiwany, a to uczciwy sposób na prowadzenie długich tur. Pojedyncze żądanie do tego modelu może wygenerować do 128 000 tokenów wyjściowych. Czekanie, aż to trafi do jednego ciała odpowiedzi, bez wglądu w to, czy postępuje, to przepis na zgadywanie limitów czasu.

Buforowanie promptów jest tutaj jawne. Interfejs Responses API dokumentuje prompt_cache_breakpoint dla treści tekstowej, obrazowej i plikowej, z trybem explicit, oznaczającym „dokładny koniec nadającego się do ponownego użycia prefiksu promptu” i dziedziczącym swój TTL z prompt_cache_options.ttl żądania. W modelu, w którym stawka za wejście z pamięci podręcznej wynosi jedną dziesiątą stawki za wejście bez pamięci podręcznej, to, gdzie umieścisz tę granicę, jest linią o największym wpływie w Twoim żądaniu.

Screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured 16 September 2026, showing the model id gpt-6-astra described as the company's most capable model, a 1,050,000-token context window, 128,000 maximum output tokens, an Apr 30, 2026 knowledge cutoff, reasoning token support with reasoning.effort values of low, medium, high, xhigh and max, input modalities of text and image with text output and audio and video marked not supported, Standard pricing of $10.00 input, $1.00 cached input, $12.50 cache writes and $50.00 output per million tokens, the note that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, and supported endpoints of Responses, Chat Completions and Batch with Fine-tuning, Assistants, Embeddings and Images marked unsupported.

Co tak naprawdę oznacza okno o rozmiarze 1 050 000 tokenów

Udokumentowane liczby to okno kontekstu o rozmiarze 1 050 000 tokenów, maksymalne wejście 922 000 tokenów, maksymalne wyjście 128 000 tokenów oraz data odcięcia wiedzy 30 kwietnia 2026 r.

Zacznij od arytmetyki, którą ludzie przeoczają: 922 000 plus 128 000 równa się 1 050 000. Okno jest współdzielone między tym, co wysyłasz, a tym, co model może zwrócić, a limit wyjściowy jest z niego rezerwowany. Nie możesz wysłać 1 050 000 tokenów wejściowych; praktyczny limit dla pojedynczego żądania to 922 000, a jeszcze mniej, jeśli chcesz mieć miejsce na prawdziwą odpowiedź.

Co daje milion tokenów w jednostkach, w których faktycznie pracujesz? Konwersje tokenów na tekst są przybliżone i pochodzą od nas, a nie od OpenAI, ale są właściwego rzędu: przy około czterech znakach na token 1 050 000 tokenów to rząd 750 000 słów, czyli mniej więcej sto tysięcy linii kodu. To średniej wielkości repozytorium w całości, z zapasem miejsca na dane wyjściowe narzędzi, które agent generuje podczas pracy. Przypadek długiego horyzontu, dla którego sprzedaje się ten model, wygląda dokładnie tak: agent, który godzinę temu przeczytał plik i nadal widzi, co w nim było, zamiast takiego, który skompaktował poranek do akapitu streszczenia.

A teraz część, która należy na stronę z kosztami, a nie na stronę ze specyfikacją. Dokumentacja modeli Ope​nAI podaje, że prompty zawierające więcej niż 272 000 tokenów wejściowychsą rozliczane według2-krotności stawek za wejście i za cache oraz 1,5-krotności stawki za wyjście dla całego żądania. Strona z cennikiem ujmuje to jako drugi wiersz: długi kontekst w GPT-6 Astra to 20,00 USD za wejście, 2,00 USD za wejście z cache i 75,00 USD za wyjście. Zatem górne trzy czwarte tego okna to przedział cenowy, a nie tylko zapas. Przebieg, którego transkrypt przekracza 272 000 tokenów, płaci podwójnie za każdy token wejściowy — w tym za te z cache — za całe żądanie, i to jest największe wahnięcie w ekonomii tego modelu. Poniżej przedstawiono to w całości.

Jeszcze jeden mechanizm wart poznania, ponieważ to własne przyznanie dostawcy, że jedno okno to nie cała odpowiedź. W przypadku Co​dex Ope​nAI opisuje eksperymentalne podejście do kontekstu dostarczane wraz z Astra, w którym notatki utrzymują się między oknami kontekstu zamiast wielokrotnego kompaktowania do jednego podsumowania, a wcześniejsze okna pozostają przeszukiwalne, dzięki czemu wymagania i wyniki testów z wcześniejszych wiadomości oraz dane wyjściowe narzędzi można nadal znaleźć. Ope​nAI nazywa je eksperymentalnym, mówi, że jest włączone w Co​dex config.toml, i twierdzi, że stanie się domyślne dla Astra. Jeśli samodzielnie budujesz odpowiednik na API, to właśnie ten kształt warto skopiować: trwałe notatki plus historię, którą można przywołać, a nie jeden bohaterski prompt.

A ograniczenie samej liczby: duże okno to pojemność, a nie gwarancja uwagi w jego obrębie. Podawane przez dostawcę dane dotyczące długiego horyzontu są lepszym wskaźnikiem zachowania niż liczba tokenów — OpenAI raportuje OSWorld 2.0 na poziomie 72,6% przy około 40 minutach na zadanie, a Terminal-Bench 4.0 na poziomie 57,9% w porównaniu z 37,3% dla GPT-5.6 Sol. To są własne liczby OpenAI, których nie odtworzyliśmy, a niezależny obraz jest bliski, ale nie identyczny: Artificial Analysis zmierzyło Astrę na poziomie 59,1% w Terminal-Bench v4.0 w porównaniu z 52,0% dla Claude Fable 5.1 i 39,9% dla GPT-5.6 Sol. Oba źródła zgadzają się, że luka na długim horyzoncie względem poprzedniej generacji jest realna; żadne z nich nie zastępuje uruchomienia własnego zadania.

Modalności wejściowe oraz kwestia pliku pozostawiona uczciwie otwarta

Strona modelu OpenAI wymienia modalności wejściowe: tekst i obraz, z wyjściem tekstowym. Brak audio, brak wideo, brak generowania obrazów w tym modelu.

Dane wejściowe obrazu trafiają jako część zawartości wewnątrz wiadomości użytkownika. Typ części to input_image, a obraz jest dostarczany albo jako w pełni kwalifikowany URL, albo jako URL danych base64 w polu image_url, albo jako file_id z Files API. Dostępny jest opcjonalny parametr detail o wartościach auto, low, high lub original, domyślnie ustawiony na auto. Struktura jest następująca:

{"model": "gpt-6-astra", "input": [{"role": "user", "content": [{"type": "input_text", "text": "co się zmieniło na tym zrzucie ekranu?"}, {"type": "input_image", "image_url": "data:image/png;base64,...", "detail": "high"}]}]}

Dokumentacja OpenAI dotycząca przetwarzania obrazów wymienia PNG, JPEG, WEBP i nieanimowane GIF-y jako akceptowane formaty, do 512 MB całkowitego ładunku na żądanie i do 1500 obrazów na żądanie, a obrazy przekraczające 30 000 patchy są odrzucane, a nie zmniejszane. To ogólne limity przetwarzania obrazów na platformie, a nie limity specyficzne dla Astra, a obrazy są rozliczane jako tokeny tak jak każde inne dane wejściowe.

Teraz pytanie, z którym czytelnicy faktycznie przychodzą, i szczera odpowiedź. Czy można przesyłać pliki lub dokumenty PDF? Nie mogliśmy potwierdzić obsługi dokumentów dla tego modelu w dokumentacji Ope​nAI i nie zamierzamy sugerować, że to działa. Responses API rzeczywiście definiuje część zawartości input_file, więc infrastruktura istnieje w API ogólnie; ale strona Ope​nAI dla GPT-6 Astra wymienia tekst i obraz jako modalności wejściowe i nie wymienia pliku, i nie znaleźliśmy żadnego oświadczenia Ope​nAI dokumentującego obsługę plików PDF dla tego punktu końcowego. Wpis routera dla tego samego modelu rzeczywiście pokazuje plik obok tekstu i obrazu — traktuj to jako zgłoszone przez router, co jest tym, co router rejestruje o trasie, a nie tym, co gwarantuje dostawca. Jeśli wczytywanie dokumentów ma kluczowe znaczenie dla Twojego obciążenia, przetestuj to na prawdziwym punkcie końcowym, zanim na tym zbudujesz, i miej przygotowany fallback OCR do tekstu. To różnica między popołudniem testów a przepisaniem od zera.

Pełna linia cenowa i jeden długoterminowy przebieg z wyceną.

Każda liczba w tej sekcji została odczytana ze strony cennika Ope​nAI z dnia 16 września 2026 r., a wszystkie dotyczą miliona tokenów w wariancie Standard, chyba że w wierszu zaznaczono inaczej.

Krótki kontekst, do 272K danych wejściowych — 10,00 USD za wejście, 1,00 USD za wejście z pamięci podręcznej, 12,50 USD za zapis do pamięci podręcznej, 50,00 USD za wyjście.

Długi kontekst, powyżej 272K danych wejściowych — 20,00 USD za dane wejściowe, 2,00 USD za dane wejściowe z pamięci podręcznej, 25,00 USD za zapis do pamięci podręcznej, 75,00 USD za dane wyjściowe, stosowane do całego żądania.

Batch i Flex — połowa ceny Standard: $5.00 / $0.50 / $6.25 / $25.00 krótki kontekst, $10.00 / $1.00 / $12.50 / $37.50 długi kontekst.

Tryb szybki — podwójny Standard: 20,00 / 2,00 / 25,00 / 100,00 USD przy krótkim kontekście, 40,00 / 4,00 / 50,00 / 150,00 USD przy długim kontekście. Ope​nAI zauważa, że tryb szybki jest niedostępny dla GPT-6 Astra z rezydencją danych w UE.

Rezydencja danych — punkty końcowe, które z niej korzystają, mają 10% dopłaty w przypadku modeli udostępnionych 5 marca 2026 r. lub później. GPT-6 Astra się kwalifikuje, więc wdrożenie z rezydencją danych jest o 10% droższe od każdej z podanych powyżej wartości.

Kluczowa kwestia do przyswojenia to stawka za dane wejściowe z pamięci podręcznej. 1,00 USD wobec 10,00 USD to 90% zniżki na tę część promptu, którą wysyłasz ponownie — a w przypadku obciążenia agenta to niemal cały prompt. Zapisy do pamięci podręcznej są rozliczane po 12,50 USD, czyli 1,25x stawki za dane wejściowe bez pamięci podręcznej, więc próg opłacalności jest prosty: 100 000 tokenów wysłanych dwukrotnie bez pamięci podręcznej kosztuje 2,00 USD, natomiast jednokrotny zapis tego prefiksu i jednokrotne odczytanie go kosztuje 1,35 USD. Pamięć podręczna opłaca się od drugiego ponownego użycia wzwyż, a agent pracujący na tym samym transkrypcie przez sto tur używa go ponownie sto razy.

Co prowadzi nas do arytmetyki, która faktycznie rozstrzyga, czy ten model jest przystępny cenowo, ponieważ stawka nagłówkowa to nie liczba, która trafia na fakturę. Oto modelowy przebieg — nasz, oparty na publikowanych stawkach OpenAI, a nie na zmierzonym rachunku — dla rodzaju zadania, do którego ten model jest sprzedawany: autonomiczny agent kodujący wykonujący migrację w skali repozytorium w ciągu kilku godzin, 120 wywołań modelu, transkrypt roboczy, który w miarę narastania średnio obejmuje około 500 000 tokenów wejściowych na wywołanie, 80% tego wejścia obsługiwane z pamięci podręcznej oraz 400 000 tokenów wyjściowych w całym przebiegu, łącznie z rozumowaniem.

Przy standardowych stawkach dla krótkiego kontekstu:

• Dane wejściowe bez pamięci podręcznej — 12 mln tokenów × 10,00 USD = 120,00 USD

• Buforowane dane wejściowe — 48 mln tokenów × 1,00 USD = 48,00 USD

• Wyjście — 0,4 mln tokenów × 50,00 USD = 20,00 USD

Razem ≈ 188,00 USD za uruchomienie

Ten sam przebieg w zakresie długiego kontekstu, czyli to, co faktycznie otrzymuje transkrypcja znajdująca się powyżej 272 000 tokenów na wywołanie:

• Wejście niebuforowane — 12 mln tokenów × 20,00 USD = 240,00 USD

• Buforowane dane wejściowe — 48 mln tokenów × $2.00 = $96.00

• Wyjście — 0.4M tokenów × $75.00 = $30.00

Razem ≈ 366,00 USD za przebieg

Wynikają z tego dwa wnioski i żaden nie jest widoczny na podstawie stawki nagłówkowej. Po pierwsze, to, gdzie znajduje się Twój transkrypt, ma takie samo znaczenie jak to, który model wybierzesz — identyczne zadanie kosztuje około dwa razy więcej w zależności od tego, czy przekracza próg 272K, co sprawia, że dyscyplina kontekstu (pobieranie właściwych 100K zamiast utrzymywania 600K) jest na tym modelu techniką kontroli kosztów, a nie tylko techniką wydajności. Po drugie, buforowanie jest warte więcej, niż sugeruje rabat: bez żadnych trafień cache pierwszy scenariusz obejmuje dane wejściowe o wartości $600.00 zamiast $168.00, a uruchomienie kosztuje około $620 zamiast $188. Włącz buforowanie, zanim zwiększysz wysiłek rozumowania.

Dla punktu odniesienia ta sama mieszanka tokenów w GPT-5.6 Sol przy stawkach pokazanych na stronie cennika OpenAI 16 września — 4,00 USD za wejście, 0,40 USD za wejście z pamięci podręcznej, 20,00 USD za wyjście przy krótkim kontekście — daje około 75,20 USD, a w wierszu dla długiego kontekstu Sol (8,00 USD / 0,80 USD / 30,00 USD) około 146,40 USD. To sprawia, że ten przebieg jest około 2,5x w obu przedziałach. Dwie uwagi do tego mnożnika, bo już wywołał zamieszanie gdzie indziej: stawka Sol jest promocyjna — OpenAI mówi, że promocja jest dostępna co najmniej do 21 listopada 2026 r. — natomiast stawka Astry jest cennikowa, więc mnożnik mierzy dzisiejsze dwie karty stawek, a nie trwały fakt dotyczący modeli, i maleje, jeśli promocja wygaśnie. A starsze „2,5x”, które krąży w odniesieniu do Astry, jest czasami obliczane względem przedpromocyjnego cennika Sol wynoszącego 5,00 USD/30,00 USD, co daje 2x na wejściu i około 1,67x na wyjściu. Wskaż, którą stawkę Sol masz na myśli, bo inaczej liczba jest bezwartościowa.

Jeszcze jedna linijka: poziom Batch zmniejsza to wszystko o połowę, sprowadzając pierwsze uruchomienie do około 94 dolarów. To, czy możesz z niego skorzystać, zależy od następnej sekcji.

Single-column scoreboard titled 'GPT-6 Astra API — the scoreboard' with six rows reading 'Model id: gpt-6-astra', 'Context window: 1,050,000 tokens', 'Max output: 128,000 tokens', 'Price (Standard): $10.00 in / $50.00 out', 'Cached input: $1.00, a 90% discount' and 'Above 272K input: 2x input, 1.5x output', above a footer reading 'All figures per OpenAI's model and pricing pages, read September 16, 2026.', with the OrcaRouter logo composited in the bottom-right corner.

Zero Data Retention i zniżka, która sama się dyskwalifikuje

Ope​nAI podaje, że Zero Data Retention jest dostępne dla kwalifikujących się klientów API w obsługiwanych punktach końcowych, z zastrzeżeniem zatwierdzenia — i obie części tego zdania mają realne znaczenie. Nie jest to przełącznik samoobsługowy: kwalifikowalność wymaga uprzedniego zatwierdzenia przez Ope​nAI i zaakceptowania dodatkowych wymagań, a uruchamia się ją, rozmawiając z działem sprzedaży. Po zatwierdzeniu konfiguruje się je na poziomie organizacji lub projektu w Ustawienia → Organizacja → Kontrola danych, na zakładce Retencja danych, gdzie projekt może dziedziczyć ustawienie domyślne organizacji, jawnie ustawić ZDR, wybrać Zmodyfikowany monitoring nadużyć albo wyłączyć oba.

Co to zmienia w praktyce: ZDR wyklucza treści klienta z dzienników monitorowania nadużyć, zastępując domyślne przechowywanie do 30 dni, a parametr store w /v1/responses i /v1/chat/completions jest traktowany jako false, nawet jeśli żądanie próbuje ustawić go na true.

Najważniejszy szczegół na stronie o kosztach: /v1/batches nie znajduje się na liście punktów końcowych kwalifikujących się do ZDR. Strona OpenAI poświęcona kontroli danych wymienia go jako niekwalifikujący się, a stan aplikacji jest przechowywany aż do momentu usunięcia. Zatem w GPT-6 Astra 50-procentowa zniżka w warstwie Batch i Zero Data Retention wykluczają się wzajemnie — obciążenie pracą podlegające wymogom zgodności, które potrzebuje ZDR, powinno uwzględniać w budżecie stawkę Standard, a nie stawkę batch, a podana powyżej kwota 94 USD nie jest dla niego dostępna.

Jeszcze trzy zastrzeżenia, powiedziane wprost, bo strona, która przecenia ZDR, jest gorsza niż taka, która go pomija. ZDR nie jest absolutne: w ramach „Eyes Off” OpenAI zastrzega sobie prawo do uznania modeli za niekwalifikujące się do ZDR dla konkretnych klientów, z uprzednim pisemnym powiadomieniem, a w ramach „Safety Retention” treści mogą być przechowywane i weryfikowane przez człowieka, gdy klasyfikatory oznaczą poważne ryzyko. Dane wejściowe w postaci obrazów i plików oznaczone jako potencjalny CSAM są przechowywane do ręcznej weryfikacji nawet w ramach ZDR. A ZDR kończy się na granicy OpenAI — jeśli Twój agent wywołuje zdalny serwer MCP lub API innego dostawcy, ten ruch podlega polityce przechowywania tej strony, a nie tej opisanej tutaj. Osobno: rezydencja danych to inna kontrola niż ZDR, wymaga własnej zgody i aneksu Modified Retention poza Stanami Zjednoczonymi oraz wiąże się ze wspomnianą powyżej podwyżką o 10%. Jeśli polegasz na buforowaniu w ramach ZDR, przeczytaj stronę OpenAI dotyczącą kontroli danych, aby dowiedzieć się, co przechowuje buforowanie; nie zamierzamy podawać dla niego wskaźnika retencji, którego sami nie moglibyśmy tam odczytać.

Limity szybkości zgodnie z dokumentacją i ten, który pierwszy daje się we znaki

Strona modelu OpenAI publikuje następujące limity dla poszczególnych poziomów dla GPT-6 Astra — żądania i tokeny na minutę, a następnie limit kolejki wsadowej:

Poziom 1 — 500 RPM, 500 000 TPM, kolejka wsadowa 1 500 000

Poziom 2 — 5 000 RPM, 1 000 000 TPM, kolejka wsadowa 3 000 000

Poziom 3 — 5 000 RPM, 2 000 000 TPM, kolejka wsadowa 100 000 000

Poziom 4 — 10 000 RPM, 4 000 000 TPM, kolejka wsadowa 200 000 000

Poziom 5 — 15 000 RPM, 40 000 000 TPM, kolejka wsadowa 15 000 000 000

Dwa limity nazwiemy nieudokumentowanymi, zamiast je uzupełniać: nie ma opublikowanego limitu dla darmowego planu, ponieważ GPT-6 Astra w ogóle nie jest dostępny w darmowym planie; nie znaleźliśmy też żadnego opublikowanego pułapu powyżej Poziomu 5 ani odrębnej tabeli limitów dla trybu Fast. Jeśli dostawca nie opublikował limitu, brak ten należy uznać za nierozstrzygnięty — nie zakładaj, że jest nielimitowany.

Liczba, która najpierw daje się we znaki w obciążeniu agenta, to 500 000 TPM w warstwie Tier 1. Pojedyncze wywołanie tego modelu może przenieść transkrypt o 500 000 tokenów, co oznaczapojedyncze żądanie może zużyć całą minutę budżetu tokenów w warstwie podstawowej. Okno kontekstu o rozmiarze miliona tokenów na niewiele zda się agentowi, który przez 120 tur okupuje ten sam transkrypt, jeśli warstwa nie jest w stanie przepchnąć tokenów. Dobierz rozmiar warstwy do wolumenu tokenów z powyższego przykładu, a nie do liczby żądań — i pamiętaj, że awans na wyższą warstwę zależy od wydatków i historii konta, więc warto go ustalić przed terminem, a nie w jego trakcie.

Azure i AWS Bedrock, po jednej linii każdy

Microsoft Azure — GPT-6 Astra można wdrożyć w Microsoft Foundry pod tym samym identyfikatorem gpt-6-astra; materiały Foundry wskazują, że ogólna dostępność przypada na początek września 2026 r., oraz podają wdrożenia Global Standard i US Data Zone, bez EU Data Zone na start, a stawki są równe lub zbliżone do cennika OpenAI, z pozycją dla długiego kontekstu. Przeczytaliśmy to w materiałach Foundry, a nie na własnej stronie katalogowej Microsoftu, do której nie mogliśmy dziś dotrzeć — zanim zaplanujesz na niej wdrożenie, zweryfikuj aktualną listę wdrożeń, zestaw regionów i stawkę we własnej dokumentacji Microsoftu.

AWS Bedrock — wymieniony jako openai.gpt-6-astra, dostępny przez obsługiwane interfejsy API Bedrock i potwierdzony w cotygodniowym podsumowaniu AWS z 15 września 2026 r., z własnym obwodem zarządzania Bedrock (izolacja punktów końcowych VPC, szyfrowanie KMS, Guardrails) oraz oświadczeniem AWS, że dane wnioskowania nie są wykorzystywane do uczenia modeli. Wnioskowanie w regionie i geograficzne wnioskowanie międzyregionalne na Bedrock jest rozliczane o 10% powyżej stawek podstawowych; ta liczba jest w naszym odczytaniu daną z drugiej ręki, więc sprawdź własną stronę z cennikiem AWS.

Żadna z tych ścieżek nie zmienia modelu. Obie zmieniają sposób zakupu, co dla czytelnika z przedsiębiorstwa jest sednem sprawy: wdrożenie w Foundry lub Bedrock może mieścić się w ramach istniejącego zobowiązania chmurowego, odziedziczyć jego IAM, mechanizmy rejestrowania i granicę sieciową oraz trafić na fakturę, którą dział finansowy już zatwierdził — często to różnica między pilotażem a czymś, co faktycznie zostaje wdrożone. Kompromis polega na tym, że przyjmujesz na siebie cykl życia modelu w chmurze i stawkę chmury, a obie chmury są raportowane na poziomie cennika OpenAI lub powyżej niego, a nie poniżej.

Gdzie router się wpisuje, w tym części, które przemawiają przeciwko niemu

GPT-6 Astra znajduje się w katalogu OrcaRouter jako openai/gpt-6-astra, a OrcaRouter przekazuje cenę katalogową dostawcy przy 0% marży — cena dostawcy to nasza cena, a zmiana ceny przez dostawcę trafia na Twój rachunek tego samego dnia, a nie dopiero przy odnowieniu. W przypadku modelu w tej cenie nie jest to twierdzenie o błędzie zaokrąglenia: arytmetyka powyżej to ta sama arytmetyka, którą zapłaciłbyś bezpośrednio.

Screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured 16 September 2026, showing the listing openai/gpt-6-astra from provider OpenAI, a 1M-token context, 128K maximum output, input of text, image and file with text output, a p50 time to first token of 6.70 s and p95 of 10.00 s, $10.00 input and $50.00 output per million tokens, 181.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

Uczciwym argumentem za routingiem w tym przypadku nie jest cena, lecz możliwość wycofania się. Astra jest około 2,5 razy droższa od modelu o poziom niżej, a jej koszt waha się wokół progu, który kontroluje twoja architektura — dlatego większość zespołów chce najpierw wypróbować ją na fragmencie rzeczywistego ruchu, zanim zdecyduje się na ścieżkę produkcyjną. Za pomocą jednego klucza możesz umieścić ją za tym samym endpointem co modele, których już używasz, kierować do niej część ruchu i automatycznie przełączać się na coś tańszego, gdy nie zwraca różnicy w koszcie — to zmiana konfiguracji, a nie migracja, z jednym API obejmującym ponad 200 modeli, DSL-em routingu, który łączy kilka modeli w jedno wywołanie, oraz fuzją modeli, gdy chcesz, aby odpowiadał cały panel.

Argumenty przeciw, wyłożone wprost. Router to jeszcze jeden przeskok na ścieżce żądania i jeszcze jedna strona w przepływie danych — a w tym modelu nie jest to hipotetyczne, ponieważ ZDR jest zatwierdzany w OpenAI dla każdej organizacji osobno, a żądanie kierowane przez router nie jest automatycznie objęte twoim zatwierdzeniem ZDR. Jeśli wysyłasz dane objęte regulacjami, potwierdź warunki danych dla danej trasy, zanim je wyślesz, i bądź gotów skontaktować się bezpośrednio z dostawcą w sprawie tego obciążenia. Routing dodaje też komponent, który może zawieść albo zwiększyć opóźnienie, i sprawia, że podmiana modeli jest tak łatwa, że można zmienić to, co odpowiada twoim użytkownikom, bez przeprowadzenia przeglądu. Nic z tego nie przeważa nad argumentem za próbą i odwracalnością dla większości zespołów; warto o tym wszystkim wiedzieć, zanim uznasz, że router jest darmowy. Zestawiliśmy platformy routingowe ze sobą w osobnym tekście, zamiast powtarzać to porównanie tutaj.

Trzy pytania, na które nie ma jednozdaniowych odpowiedzi

Czy mogę dostroić GPT-6 Astra albo używać go z Assistants API? Nie, w obu przypadkach — i jest to granica projektowa, a nie ustawienie, które przeoczyłeś. Strona modelu Ope​nAI wymienia Chat Completions, Responses i Batch jako obsługiwane endpointy, a jawnie podaje Fine-tuning i Assistants jako nieobsługiwane, i nie ma wiersza GPT-6 Astra w tabeli cen dostrajania Ope​nAI. Jeśli twoja architektura opiera się na dostrojonym modelu flagowym, Astrę trzeba obsłużyć przez prompty, co przenosi koszt z treningu na tokeny wejściowe — a przy 10,00 USD za milion przy dużym prompcie systemowym to realna pozycja w budżecie, a nie przypis.

Czy model odmówi wykonania prac związanych z bezpieczeństwem, do których mam uprawnienia? Czasami tak, i warto wiedzieć o tym, zanim zaczniesz budować. GPT-6 Astra to pierwszy model OpenAI, który osiągnął próg zdolności w zakresie cyberbezpieczeństwa na poziomie Critical w ramach firmowego Preparedness Framework, a w wersji udostępnionej odmawia zaawansowanych zadań cybernetycznych, takich jak pisanie exploitów typu proof-of-concept. OpenAI twierdzi, że planuje poszerzyć dostęp dzięki mniej restrykcyjnym zabezpieczeniom w ramach programu Daybreak. Dla obrońcy przejawia się to jako odmowa, która nie jest ograniczeniem liczby żądań ani błędem — przewidź ją w obsłudze błędów, zamiast reagować na nią ponawianiem.

Czy potrzebuję specjalnej zgody, aby wywołać ten model? Nie w przypadku standardowego punktu końcowego — nie ma listy oczekujących ani etapu zatwierdzania, aby wywołać gpt-6-astra, wystarczy konto z rozliczeniami. Zgoda może być natomiast potrzebna na wszystko wokół tego: Zero Data Retention, które jest udostępniane na wniosek; lokalizacja danych poza Stanami Zjednoczonymi, która wymaga osobnego aneksu; oraz podniesienie poziomu, jeśli zamierzasz przetwarzać wolumeny tokenów w skali agentowej przez konto Tier 1. Model to najłatwiejsza część procesu zakupowego.

Na co uważać i kto powinien teraz działać

Jeśli budujesz na tym modelu, cztery rzeczy warte monitorowania są wszystkie po stronie dostawcy i wszystkie opatrzone datą. Czy Ope​nAI opublikuje datowany snapshot dla gpt-6-astra — co zamieniłoby goły identyfikator w ruchomy cel i nadało sens przypinaniu. Czy próg 272 000 tokenów się zmieni, ponieważ ta jedna linia jest warta więcej dla Twojego rachunku niż jakikolwiek benchmark na stronie. Czy stawki Bedrock i Foundry zbiegną się z cennikiem Ope​nAI, czy pozostaną powyżej niego, ponieważ decyduje to o ścieżce zakupowej w takim samym stopniu jak model. I czy program Daybreak zmieni to, co endpoint będzie odrzucać, co dla zespołów bezpieczeństwa jest różnicą między użytecznym narzędziem a demem.

Co do tego, kto powinien działać, podział jest wyraźny. Jeśli już płacisz za GPT-5.6 Sol według stawek promocyjnych za pracę agentową o długim horyzoncie, mnożnik 2,5x jest realny, a pytanie jest wąskie: czy wskaźnik ukończenia zadań w Twoim własnym obciążeniu przebija różnicę w cenie? Uruchom to na wycinku rzeczywistego ruchu i się przekonaj — powyższy przykład obliczeniowy mówi, ile kosztuje ten wycinek, zanim zaczniesz. Jeśli Twoja praca to czat z krótkim kontekstem lub klasyfikacja o dużym wolumenie, to nie jest Twój model; nowa wycena dla długiego kontekstu i stawka wyjściowa $50.00 czynią z niego drogi sposób na zrobienie czegoś, co GPT-5.6 Luna robi za ułamek ceny. A jeśli jesteś przedsiębiorstwem z wymogiem zgodności, najpierw rozpocznij rozmowę o ZDR, ponieważ warunkuje ona zniżkę Batch, podwyżkę za rezydencję i wybór ścieżki — a żadnej z tych rzeczy nie podejmiesz w dniu, w którym jej potrzebujesz.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie