
GPT-6 Astra Ultrafast działa na Blackwell: NVIDIA ujawnia sprzęt stojący za 8x
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
1 października 2026 r. NVIDIA opublikowała wpis Diona Harrisa zatytułowany „Jak GPU NVIDIA pomagają przyspieszyć GPT-6 Astra Ultrafast OpenAI”, a zdanie w jego centrum jest pierwszym razem, kiedy którakolwiek z firm powiedziała, na czym działa ten poziom: „GPT-6 Astra Ultrafast, działający na GPU NVIDIA Blackwell, jest już dostępny w API OpenAI oraz dla uprawnionych użytkowników ChatGPT Work i Codex”. To jest ta wiadomość, a jest ona węższa, niż sugeruje nagłówek. GPT-6 Astra, czyli model, został wydany 3 września 2026 r. Warstwa usług Ultrafast nad nim stała się powszechnie dostępna 29 września 2026 r. Twierdzenie o szybkości — do 8 razy szybsze generowanie tokenów niż w standardowym trybie Astra — miało już dwa dni, gdy NVIDIA je powtórzyła.
Co rodzi pytanie, na które ten wpis tak naprawdę odpowiada: nie „jak szybki jest”, lecz „czyj to krzem”.

Trzy rzeczy, które ten post faktycznie dodał
Odrzuć powtórzenie, a wpis z 1 października wnosi trzy fakty.
• Sprzęt — Blackwell. Własna dokumentacja OpenAI dotycząca Ultrafast, opublikowana 30 września, opisuje szybkość tego poziomu, jego konfigurację i limity szybkości, i nie wymienia żadnego GPU. Zatem przypisanie tego krzemu ma tylko jedno źródło — producenta sprzętu. To nie czyni go fałszywym; czyni go twierdzeniem dostawcy o jego własnym sprzęcie, które warto jako takie oznaczyć.
• Dwóch nazwanych inżynierów — Philippe Tillet, szef ds. wnioskowania w OpenAI, oraz Uday Ruddarraju, dyrektor ds. technologii obliczeniowych w OpenAI, obaj oficjalnie wypowiedzieli się o tym, skąd wzięło się przyspieszenie.
• Odbiorcy — „uprawnieni użytkownicy ChatGPT Work i Codex”, co jest szersze niż wyłącznie API-owe ujęcie, z którym kojarzono tę warstwę. Dokumentacja samego OpenAI wciąż podaje, że Ultrafast dla GPT-6 Astra jest „dostępny dla wszystkich użytkowników API przy niskich limitach”, a tego zastrzeżenia o niskich limitach nie wycofano oficjalnie.
Te dwa cytaty i dlaczego to one są najciekawsze
Wkład Tilleta to pętla, a nie benchmark. Inwestycja NVIDII w narzędzia i dokumentację, jak mówi, „pozwoliła nam sprawić, że nasze modele są wyjątkowo dobre w programowaniu”, a Astra może następnie „przekształcić tę wiedzę w wysokowydajne kernele, które czynią sprzęt NVIDIA atrakcyjnym”. Ruddarraju mówi bardziej bez ogródek o kierunku tych prac: „Użyliśmy naszych wewnętrznych modeli do optymalizacji wnioskowania na GPU NVIDIA”.
Czytane razem, to twierdzenie o wdrożeniu, a nie o możliwościach: modele frontier OpenAI są obecnie tak dobre w pisaniu jąder GPU, że OpenAI używa ich do optymalizacji własnego stosu serwującego. Jest to również spójne z jedyną sekcją wpisu NVIDIA, która wcale nie dotyczy tygodnia premiery — nagłówkiem o treści „Nieustanne poprawianie wydajności”, w której argumentuje się, że wdrożone wnioskowanie z czasem staje się szybsze, ponieważ OpenAI nieustannie kieruje własne modele na oprogramowanie NVIDIA, na którym działa.
Nic z tego nie jest pomiarem. To opis procesu autorstwa dwóch inżynierów, opublikowany przez firmę, która sprzedała GPU. Uczciwa interpretacja jest taka, że proces jest wiarygodny, łatwo w niego uwierzyć i jest niefalsyfikowalny z zewnątrz — co dotyczy również każdej liczby dotyczącej szybkości w tej historii.
Tu Blackwell, tam Cerebras.
Najbardziej użyteczną rzeczą, jaką robi ten post, jest ujawnienie podziału, którego nikt nie wyjaśnił. 13 sierpnia 2026 r. OpenAI zaprezentowało szybką warstwę dla innego modelu — GPT-5.6 Sol działającego „do 14×” szybciej — i wskazało Cerebras jako partnera stojącego za tym rozwiązaniem, opisując sprzęt w skali wafla generujący do 750 tokenów wyjściowych na sekundę. Siedem tygodni później szybka warstwa dla Astra działa na Blackwell, a liczba to 8x.
Dwa szybkie poziomy, dwie odpowiedzi sprzętowe: jeden z nich to wyspecjalizowany partner, a drugi – największy dostawca samej firmy. Żaden z dostawców nie opublikował porównania między obiema ścieżkami serwowania, a żaden niezależny ewaluator nie zmierzył żadnej z nich. Zwróć też uwagę, co post NVIDII robi z drugą nazwą: „Rubin” pojawia się raz, w cytacie Tilleta o modelach piszących jądra dla „GPU Blackwell i Rubin”. To stwierdzenie o tym, co modele OpenAI mogą programować, a nie stwierdzenie, że cokolwiek jest dziś serwowane na Rubinie.
Liczba, której NVIDIA nie wydrukowała
W tej historii jest jedna liczba, której żadna z firm nie umieściła obok 8x, i to ona decyduje o tym, czy zespół włącza ten poziom. Opublikowany przez OpenAI cennik Ultrafast wymienia gpt-6-astra po 60,00 USD za milion tokenów wejściowych, 6,00 USD za tokeny wejściowe z pamięci podręcznej, 75,00 USD za zapis do pamięci podręcznej i 300,00 USD za tokeny wyjściowe. Ten sam model w warstwie standardowej kosztuje 10,00 USD i 50,00 USD, przy czym tokeny wejściowe z pamięci podręcznej kosztują 1,00 USD, a zapis do pamięci podręcznej 12,50 USD. Każda kolumna jest dokładnie sześciokrotnością stawki standardowej.
• Mnożnik — 6,00x dla danych wejściowych, wyjściowych, wejściowych z pamięci podręcznej i zapisu do pamięci podręcznej. Nie „do”. Sześć.
• Sufit — 8x, wartość, którą obaj dostawcy podają z dołączonym „do”, bez określonych warunków.
• Co to oznacza — mnożnik ceny plasuje się poniżej własnego, deklarowanego najlepszego przypadku danego poziomu. Przy górnej granicy transakcja jest korzystna; przy czymkolwiek poniżej 6x w Twoim ruchu płacisz więcej za jednostkę zaoszczędzonego czasu, niż sugeruje marketing. Dlatego jedynym sensownym testem tego poziomu jest pomiar na własnych żądaniach.
• Próg długiego kontekstu — powyżej 272 000 tokenów wejściowych stawki Ultrafast wynoszą 120,00 USD za wejście i 450,00 USD za wyjście, czyli sześciokrotnie więcej niż własne stawki stopniowane poziomu standardowego.
• Operacyjne szczegóły drobnym drukiem — OpenAI dokumentuje drabinkę limitów Ultrafast w tokenach na minutę: 500 000 dla poziomów użycia od 1 do 3, 1 000 000 dla poziomu 4 i 5 000 000 dla poziomu 5; Ultrafast obsługuje wyłącznie rezydencję danych w USA i przetwarzanie globalne, bez punktu końcowego przetwarzania regionalnego w UE ani w innym regionie poza USA; a dokumentacja zaleca WebSockets dla Ultrafast „zwłaszcza w przypadku aplikacji agentowych, które wykonują wiele wywołań narzędzi szybko po sobie”, ostrzegając, że „bez trwałego połączenia narzut sieciowy może ograniczyć korzyści w zakresie opóźnień”.

Ostatni punkt to ten, na którym trzeba zadziałać. Zespół, który włącza tę warstwę, a pozostawia pod nią HTTP dla poszczególnych żądań, zapłacił sześciokrotność stawki, aby część przyspieszenia oddać z powrotem nawiązywaniu połączeń — udokumentowany, możliwy do uniknięcia sposób marnowania pieniędzy.
Jak to wygląda z jednego punktu końcowego
GPT-6 Astra jest dostępny w OrcaRouter jako openai/gpt-6-astra: okno kontekstu 1 050 000 tokenów, do 128 000 tokenów wyjściowych, dane wejściowe tekstowe, obrazowe i plikowe, a cena katalogowa OpenAI przekazywana bezpośrednio po 10,00 USD za milion tokenów wejściowych i 50,00 USD za milion tokenów wyjściowych, przechodząca na 20,00 USD i 75,00 USD powyżej 272 000 tokenów wejściowych. Główny benchmark katalogowy to 96,1 w GPQA Diamond.
Poziom Ultrafast nie występuje w OrcaRouter i nie może być: jest atrybutem konta OpenAI objętym kontrolą dostępu, a nie identyfikatorem modelu, dlatego openai/gpt-6-astra-ultrafast zwraca model-not-found. Jeśli włączysz ten poziom, znajdzie się on w Twojej bezpośredniej integracji z OpenAI. To, co punkt końcowy z ponad 200 modelami z marżą 0% daje Ci w tej sytuacji, to nie szybka ścieżka — to kontrola. Ponieważ cena katalogowa dostawcy jest przekazywana bez narzutu, zmiana stawek OpenAI trafia na naszą stronę tego samego dnia, co na ich stronę, a ponieważ standardowa ścieżka Astra już istnieje, eksperyment, który rozstrzyga tę decyzję, to jedna linia konfiguracji: ten sam prompt, standardowy poziom i tańszy model obok, na tym samym kluczu. To najbliższa rzecz do benchmarku opóźnień, jaki większość zespołów kiedykolwiek przeprowadzi, a skonfigurowanie tego nic nie kosztuje.

Co jeszcze nie zostało zmierzone
Trzy rzeczy można dziś zweryfikować. Ten poziom istnieje, widnieje w cenniku dokładnie jako sześciokrotność stawki standardowej, a od 1 października jest publicznie przypisywany do GPU NVIDIA Blackwell.
Jednej rzeczy nie ma: mnożnika dla twojego ruchu. Żaden dostawca nie opublikował rozkładu opóźnień dla tego poziomu przy podanym poziomie współbieżności, a żadna strona trzecia nie odtworzyła 8x. Nie ma też benchmarku porównującego Astrę w trybie Ultrafast z Astrą w trybie standardowym, a pochlebnego nie powinno być — to ten sam checkpoint na szybszej ścieżce, więc identyczne ustawienia powinny dawać identyczne odpowiedzi przy różnych prędkościach. Jeśli twoje dwie ścieżki rozchodzą się przy tych samych promptach, masz zgłoszenie błędu, a nie funkcję.
Tak więc przydatne podsumowanie 1 października jest skromniejsze, niż wynika z ogłoszenia. To ten sam poziom w tej samej cenie z tym samym niezweryfikowanym pułapem prędkości, tyle że teraz nosi etykietę sprzętową. Ta etykieta ma znaczenie — mówi ci, na jakiej linii akceleratorów OpenAI to skaluje, i mówi ci, że opowieść o szybkiej warstwie przeniosła się od wyspecjalizowanego partnera do największego dostawcy GPU w branży w mniej niż dwa miesiące. Po prostu nie mówi ci nic o twoim własnym budżecie opóźnień, i żaden wpis tego nie zrobi.
