
Step 5 Preview vs GPT-6 Astra: dziesięć razy wyższa cena wejściowa za dziewięć punktów indeksu
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Te dwa modele ogłoszono w odstępie siedemnastu dni i wyceniono z myślą o różnych planetach. Step 5 Preview, ogłoszony 20 września 2026 r. model rzadkiej mieszaniny ekspertów (sparse mixture-of-experts) firmy StepFun o 600 mld parametrów, kosztuje 1,00 USD za milion tokenów wejściowych i 2,70 USD za milion tokenów wyjściowych. GPT-6 Astra, flagowy model tego dostawcy wydany 3 września 2026 r., kosztuje 10,00 USD i 50,00 USD za te same jednostki poniżej progu 272 tys. tokenów wejściowych — oraz 20,00 USD i 75,00 USD powyżej niego. To dziesięciokrotność ceny wejścia i około osiemnastokrotność ceny wyjścia za model, który uzyskuje o dziewięć punktów więcej w niezależnym Intelligence Index: 53 wobec 44. To, czy Astra jest lepsza, nie podlega dyskusji. Kwestią otwartą pozostaje, czy ta różnica jest warta dodatkowych trzydziestu dolarów za milion tokenów wyjściowych w twoim obciążeniu — a odpowiedź zmienia się dwukrotnie w trakcie lektury tego tekstu.
Do czego służy każdy model
Step 5 Preview powstał i jest sprzedawany z myślą o pracy agentowej: kodowaniu z AI, inżynierii oprogramowania, profesjonalnej pracy z wiedzą, finansach. Architektura jest pod to dostrojona — 600 mld parametrów łącznie, z około 27 mld aktywnych na token, kontekst 1 mln tokenów, wejście tekstowe i obrazowe oraz rozumowanie z rozszerzonym myśleniem. StepFun pominął całą linię Step 4.x, aby tu dotrzeć, przechodząc bezpośrednio z Step-3.7-Flash do Step 5.
GPT-6 Astra to flagowy model ogólnego przeznaczenia OpenAI: kontekst 1 mln tokenów, do 128 tys. tokenów wyjściowych, wejście w postaci tekstu, obrazów i plików, wyjście w postaci tekstu, data odcięcia wiedzy 30 kwietnia 2026 r. oraz obsługa rozumowania, kodowania i przepływów pracy z agentami. To model, po który sięga przedsiębiorstwo, gdy odpowiedź musi być poprawna, a rachunek za tokeny nie jest wiążącym ograniczeniem.
• Indeks Inteligencji — Step 5 Preview 44 vs GPT-6 Astra 53
• Parametry — Step 5 Preview: 600 mld łącznie / 27 mld aktywnych vs GPT-6 Astra – nieujawnione
• Kontekst i limit wyjściowy — oba z kontekstem 1 mln tokenów; Astra podaje okno 1 050 000 tokenów i limit wyjściowy 128 tys., StepFun nie opublikował limitu wyjściowego
• Modalność wejściowa — tekst i obrazy vs tekst, obrazy i pliki
• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs GPT-6 Astra 59,3 tokenów/s
• Cena za 1 mln tokenów — 1,00 USD na wejściu / 2,70 USD na wyjściu w porównaniu z 10,00 USD na wejściu / 50,00 USD na wyjściu poniżej 272 tys. tokenów wejściowych, rosnąca do 20,00 USD / 75,00 USD powyżej tego progu
• Pamięć podręczna — Step 5 Preview: 95% zniżki w porównaniu z GPT-6 Astra, który oferuje 90% zniżki na odczyt i stawkę zapisu do pamięci podręcznej w wysokości 12,50 USD za milion
• Koszt na zadanie Intelligence Index — Step 5 Preview 0,71 USD vs GPT-6 Astra 3,26 USD

Faktura, linia po linii
Cennik Step 5 Preview jest jednolity i tani: 1,00 USD za wejście, 2,70 USD za wyjście, z 95% zniżką za trafienia w cache, która sprawia, że wejście z cache kosztuje blisko 0,05 USD za milion tokenów. Przy mieszance trafień w cache, wejścia i wyjścia wynoszącej 7:2:1 — konwencji stosowanej w tym blogu dla ruchu agentów — stawka mieszana wynosi blisko 0,51 USD za milion tokenów, a koszt na zadanie Intelligence Index to 0,71 USD, co daje 27. miejsce na 200. Zastrzeżenie dotyczy rozwlekłości: model wygenerował 160 mln tokenów wyjściowych w tym Indeksie wobec mediany 92 mln, więc surowe liczby tokenów są wyższe, niż sugerowałaby cena katalogowa.
Cennik GPT-6 Astra jest progowy, a to właśnie na progu warto skupić uwagę. Poniżej 272 tys. tokenów wejściowych na żądanie stawki wynoszą 10,00 USD i 50,00 USD; powyżej — 20,00 USD i 75,00 USD. Próg wybiera się na podstawie liczby tokenów wejściowych danego żądania, co ma większe znaczenie, niż mogłoby się wydawać w przypadku modelu sprzedawanego z kontekstem 1 mln tokenów — pojedyncze wywołanie z dużym kontekstem przekracza granicę i podwaja stawkę dla całego żądania. Odczyty z pamięci podręcznej kosztują 1,00 USD za milion, co daje 90% zniżki, a zapisy do pamięci podręcznej — 12,50 USD za milion. Przy tej samej proporcji 7:2:1 stawka mieszana wynosi blisko 7,70 USD za milion tokenów, a koszt na zadanie Index to 3,26 USD, 71. miejsce na 200.
Astra działa odwrotnie pod względem rozwlekłości i jest tu zwięzłym modelem: 60 mln tokenów wyjściowych w Index w porównaniu ze 160 mln w Step 5 Preview, 27. miejsce na 200 w tym pomiarze. Mniejsza liczba tokenów przy wyższej stawce zawęża lukę, którą surowy mnożnik wyolbrzymia. Nie zamyka jej jednak — wskaźnik kosztu na zadanie już łącznie bilansuje rozwlekłość, zachowanie pamięci podręcznej i ceny, a 3,26 USD wobec 0,71 USD to wciąż 4,6-krotna różnica.
Co daje dziewięć punktów indeksu
Najważniejsze liczby Astry pochodzą od samego OpenAI i nie zostały odtworzone: 96,1 w GPQA Diamond, 72,6% w OSWorld 2.0, 97,6% w FrontierMath Tier 4, 57,2% w Humanity's Last Exam z użyciem narzędzi i około 57,9% w Terminal-Bench 4.0. Wynik ARC-AGI-3 to ten, który trzeba traktować ostrożnie — OpenAI podaje 99,9% w ramach własnego harnessu adaptera dostawcy i 62,7% na standardowym harnessie, a różnica 37 punktów między harnessami mówi co najmniej tyle samo o harnessie, co o modelu.
Opublikowane wyniki Step 5 Preview plasują się w tym samym przedziale w zadaniach agentowych, do których został stworzony, i niosą ze sobą to samo zastrzeżenie: 33,3% na Terminal-Bench 4.0, 80,5 na ProgramBench, 67,7 na DeepSWE v1.1 i 49,0 na StepCodeBench — wszystkie od StepFun i żadnego nie odtworzono niezależnie. Różni dostawcy, różne środowiska testowe, brak wspólnego przebiegu — co jest dokładnie powodem, dla którego niezależnie zmierzona dziewięciopunktowa różnica jest bardziej użyteczną liczbą niż którakolwiek z tych.
Ta różnica jest realna i nie jest mała. W zestawieniu 200 modeli 53 i 44 zajmują trzecie i dwudzieste czwarte miejsce, a różnica ujawnia się jako inna klasa zadań, a nie inny wynik w tym samym zadaniu: opublikowane zwycięstwa Astry skupiają się na rozumowaniu długoterminowym i korzystaniu z komputera, i to tam czołówka zestawienia odrywa się od reszty. Jeśli Twoje obciążenie pracą mieści się w tym obszarze, te dziewięć punktów jest warte więcej niż faktura.
Jedno zastrzeżenie do wyniku Astry. Artificial Analysis koryguje Intelligence Index, a wartości dla tego samego modelu wahają się między migawkami wykonanymi w odstępie kilku tygodni — 52,8, 53 i 54,7 pojawiają się w materiałach opublikowanych na temat tego modelu w ciągu tego samego miesiąca. Liczbą, której należy użyć, jest 53 z bieżącej strony modelu, a każde porównanie zestawiające starszą migawkę Astry z bieżącą wartością Step 5 Preview mierzy dwiema różnymi linijkami.

Szybkość i opóźnienie to dwie różne kwestie
Pod względem szybkości generowania niezależny ranking jest jednoznaczny: 99,8 tokena wyjściowego na sekundę dla Step 5 Preview wobec 59,3 dla GPT-6 Astra, który jest również wolniejszy niż średnia 70 tokenów na sekundę wśród mierzonych modeli. W interaktywnej pętli kodowania to różnica między sugestią a pauzą, która kumuluje się w trakcie sesji tak, jak zniżka za trafienia w pamięć podręczną.
Opóźnienie to bardziej złożona historia, a pojedyncza liczba może na jego temat wprowadzać w błąd. Astra prowadzi rozumowanie, zanim zacznie generować tokeny, więc czas do pierwszego tokenu i czas do użytecznej odpowiedzi to nie ten sam pomiar, a publikowane wartości dla niego są bardzo rozbieżne w zależności od tego, czy uwzględnia się rozumowanie. W naszym własnym ruchu z ostatnich siedmiu dni mediana czasu do pierwszego tokenu GPT-6 Astra wynosi 6,72 sekundy, a 95. percentyl to 10,00 sekundy — liczba, której wywołujący faktycznie doświadcza przez nasz endpoint. Artificial Analysis podaje czas do pierwszego tokenu Step 5 Preview na poziomie 2,96 sekundy w swoim własnym środowisku testowym, a tych dwóch liczb nie mierzy się w ten sam sposób, więc nie należy ich od siebie odejmować.
Gdzie tak naprawdę trafia asymetria pamięci podręcznej
Oba modele mocno dyskontują powtarzające się prefiksy i oba pobierają opłatę za ich zapis, a różnica między nimi w przypadku odczytu wynosi 20-krotność. 95-procentowy rabat na pamięć podręczną w Step 5 Preview sprawia, że buforowane dane wejściowe kosztują blisko 0,05 USD za milion tokenów. GPT-6 Astra odczytuje pamięć podręczną po 1,00 USD za milion — co stanowi 90-procentowy rabat od dziesięciokrotnie wyższej stawki podstawowej — a zapisuje ją po 12,50 USD za milion.
Dla pętli agenta ponownie wysyłającej ten sam prompt systemowy i kontekst repozytorium w każdej turze to stawka za odczyt jest tym, co się kumuluje, a większy rabat na tańszym modelu jest wart więcej niż mniejszy rabat na drogim. Mieszanka Astry nadal oscyluje w okolicach 7,70 USD za milion tokenów w porównaniu z 0,51 USD dla Step 5 Preview przy tej samej proporcji 7:2:1 — piętnastokrotna różnica, której długa sesja nie niweluje, lecz powiększa.
Uruchamianie obu z jednego klucza.
GPT-6 Astra jest już dostępny na OrcaRouter pod openai/gpt-6-astra według stawek cennikowych OpenAI — 10,00 USD i 50,00 USD za milion poniżej progu 272K, 20,00 USD i 75,00 USD powyżej niego — przekazywanych bez marży, dzięki czemu zmiana ceny dostawcy obowiązuje u nas tego samego dnia, a nie dopiero w kolejnym cyklu rozliczeniowym. Nasza własna siedmiodniowa telemetria tego punktu końcowego pokazuje podaną powyżej medianę 6,72 s oraz 10,00 s jako 95. percentyl czasu do pierwszego tokenu, a także 277,9 mln tokenów ruchu przepuszczonego przez niego w ostatnim tygodniu.
Step 5 Preview nie znajduje się w naszym katalogu i nie kierujemy do niego ruchu. Działa na własnym API i w Studio StepFun i to jest jedyne miejsce, w którym działa, dopóki nie pojawi się checkpoint z 15 października. Ta asymetria nie jest wadą porównania; ona jest tym porównaniem. Tania połowa tego starcia to ta, po którą trzeba udać się gdzie indziej, a połowa, którą można dziś wdrożyć produkcyjnie, znajduje się za jednym API dla ponad 200 modeli: GPT-6 Astra po powyższych stawkach, GLM-5.3 po $1.26 i $3.96, DeepSeek V4 Pro, Claude Opus 5 i reszta, z automatycznym przełączaniem awaryjnym między dostawcami utrzymującym stabilną ścieżkę, gdy zmienia się przepustowość dostawcy, a DSL routingu pozwalającym zadaniu zacząć tanio i eskalować tylko wtedy, gdy musi. Ta zasada eskalacji to prawdziwa odpowiedź na dziesięciokrotną różnicę cen: większość obciążenia nie potrzebuje szczytu tabeli, a warstwa routingu to sposób, by przestać płacić za tę część, która go nie potrzebuje.

Kto powinien wybrać, które
Jeśli Twoje obciążenie to agent działający w długim horyzoncie, który musi poprawnie wykonać trudne zadanie — korzystanie z komputera, wieloetapowe badania, praca, w której błędna odpowiedź kosztuje więcej niż tokeny — dziewięciopunktowa przewaga GPT-6 Astra jest najtańszą częścią decyzji, a faktura pokazuje, ile kosztuje ta możliwość. Uruchamiaj go jako cel eskalacji, a nie domyślny wybór, i uważaj na próg 272K: pojedyncze zbyt duże żądanie podwaja stawkę za wszystko w nim zawarte.
Jeśli Twoje obciążenie to tekst agentowy o dużej objętości — generowanie kodu, refaktoryzacje, ekstrakcja strukturalna, wewnętrzna pętla asystenta kodowania — Step 5 Preview ma przewagę we wszystkim, na czym zależy fakturze i zegarowi, a dziewięć punktów indeksu raczej nie przetrwa kontaktu z rozkładem zadań, który nie plasuje się na szczycie tabeli. Haczyk nie polega na wydajności: model jest własnościowy, bez opublikowanej licencji, bez zgody na użycie komercyjne i bez checkpointu do 15 października. Możesz go wywoływać; nie możesz go posiadać, dostrajać ani wypuszczać jego pochodnej.
Jeśli odpowiedź nie jest oczywista, wzorcem jest podział na poziomy, a nie wybór. Kieruj ogólny ruch do modelu średniego poziomu, a Astra rezerwuj dla żądań, które wymagają szczytu zestawienia — oba końce tej reguły znajdują się za jednym kluczem po naszej stronie, więc podział kosztuje jedną regułę routingu, a nie drugą umowę. Płacenie stawek za model flagowy za pracę, którą model średniego poziomu wykonuje poprawnie, to błąd, którego tak naprawdę dotyczy to porównanie.
