
Step 5 Preview vs GPT-5.6 Sol: Trzy punkty indeksu, jedna siódma ceny wyjściowej
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
W aktualnym Artificial Analysis Intelligence Index Step 5 Preview uzyskuje wynik 44. GPT-5.6 Sol uzyskuje 47. To cała różnica — trzy punkty — a do tego dochodzi różnica w cenie katalogowej: 2,70 USD wobec 20,00 USD za milion tokenów wyjściowych. Rzadki model mieszanki ekspertów StepFun 600B i flagowy model tego dostawcy to nie ten sam rodzaj produktu, a sam indeks nie powie ci, który z nich wybrać. Ten artykuł analizuje, skąd biorą się te trzy punkty, skąd nie, oraz ile kosztują oba modele, gdy faktycznie się je uruchomi.
Po pierwsze, sytuacja z wydaniem — ponieważ jest nietypowa
Step 5 Preview został wydany. Trzeba to powiedzieć wprost, bo wiele materiałów na jego temat powstało przed dzisiejszym dniem i opisuje coś innego. StepFun ogłosił i udostępnił model 20 września 2026 r., a jego własne API i Studio ruszyły tego samego dnia. Artificial Analysis datuje oceniany przez siebie model na 18 września. To, co nie jest gotowe, to wagi: repozytorium stepfun-ai/Step-5-Preview-BF16 na Hugging Face istnieje, ale to pusta skorupa — brak karty modelu, brak konfiguracji, brak tensorów. StepFun zapowiedział, że pełne wagi pojawią się 15 października 2026 r.. Zatem trafny opis w jednym zdaniu brzmi: API dostępne już teraz, wagi obiecane za około cztery tygodnie, a „Preview” w nazwie opisuje kanał wydania, a nie dojrzałość modelu.
Jeśli czytałeś cokolwiek, co opisuje Step 5 Preview jako nieogłoszony przeciek, który po cichu pojawił się w rankingu, ten opis stracił ważność. W połowie września był trafny. Dziś nie jest.
Czym jest Step 5 Preview
StepFun potwierdził kształt architektury: rzadki model mieszaniny ekspertów z 600 miliardami parametrów łącznie i 27 miliardami aktywnych na token, oknem kontekstowym 1 mln tokenów, wejściem tekstowym i obrazowym oraz wyjściem tekstowym, a także obsługą rozumowania. Ta liczba aktywnych parametrów jest najważniejsza. Budżet 27 mld aktywnych parametrów stawia Step 5 Preview w tej samej klasie obliczeniowej na token co modele, których całkowity rozmiar jest ułamkiem jego rozmiaru, i właśnie dlatego jego wyniki przepustowości wyglądają tak, jak wyglądają.
Ceny w API samego dostawcy wynoszą 1,00 USD za milion tokenów wejściowych, 2,70 USD za milion tokenów wyjściowych, z 95% zniżką na cache po stronie wejściowej. Artificial Analysis oblicza stawkę łączoną w wysokości 0,51 USD za milion przy proporcji cache:wejście:wyjście 7:2:1 oraz koszt na zadanie Intelligence Index wynoszący 0,71 USD.
Czym jest GPT-5.6 Sol
GPT-5.6 Sol wszedł w fazę ograniczonego podglądu 26 czerwca 2026 roku przed około dwudziestoma amerykańskimi partnerami i osiągnął ogólną dostępność 9 lipca 2026 roku w ChatGPT, Codex i OpenAI API. Jest zamknięty w ścisłym tego słowa znaczeniu: OpenAI nie opublikowało liczby parametrów, opisu architektury ani szczegółów dotyczących treningu, a model jest dostępny wyłącznie przez API.
Opublikowane limity to okno kontekstowe o rozmiarze 1 050 000 tokenów, maksymalne wejście 922 000 tokenów i maksymalne wyjście 128 000 tokenów — twardy limit wyjścia, którego odpowiednika Step 5 Preview nie reklamuje. reasoning.effort przyjmuje none, low, medium (domyślnie), high, xhigh i max. To ustawienie nie jest przypisem; jak pokazują poniższe liczby, zmienia każdą kluczową wartość.
Cena Sol w karcie modelu samego OpenAI to 4,00 USD za milion tokenów wejściowych, 0,40 USD za wejściowe z pamięci podręcznej, 20,00 USD za milion tokenów wyjściowych. To stawka promocyjna ogłoszona 21 sierpnia 2026 r. — obniżka o 20% na wejściu i 33% na wyjściu — a karta OpenAI gwarantuje ją tylko do 21 listopada 2026 r.. Cena premierowa w lipcu wynosiła 5,00 / 30,00 USD, przy 0,50 USD za wejściowe z pamięci podręcznej. Każdy, kto planuje budżet na podstawie 4/20 USD, powinien wiedzieć, że dostawca nie poinformował, co stanie się 22 listopada.
Liczby, obok siebie
• Intelligence Index — Step 5 Preview 44 (#24 z 200) vs GPT-5.6 Sol 47 przy max wysiłku, 44 przy xhigh. Obie wartości to pomiary Artificial Analysis w bieżącej wersji indeksu, ponownie skalibrowanej 7 września 2026 r. Można je bezpośrednio porównywać ze sobą, ale nie z niczym, co opublikowano przed tą datą.
• Cena danych wejściowych — 1,00 USD za milion vs 4,00 USD za milion.
• Cena danych wyjściowych — 2,70 USD za milion vs 20,00 USD za milion.
• Wejście z pamięci podręcznej — 95% zniżki z 1,00 USD w porównaniu ze stałą stawką 0,40 USD za milion.
• Terminal-Bench 4.0 — 33,3% vs 39,9% przy max i 25% przy xhigh, obie zmierzone przez Artificial Analysis na tym samym zestawie testowym. Wynik 33,3% Step 5 Preview plasuje się między dwoma poziomami wysiłku Sol. To ta jedna, najbardziej interesująca liczba w całym porównaniu.
• SciCode — 59% vs 57%, ponownie Artificial Analysis, Sol zmierzony na poziomie xhigh.
• Szybkość generowania — 99,8 tokenów/s (#45 z 200) vs 61,5 tokenów/s (#92 z 200) przy maksymalnym wysiłku.
• Czas do pierwszego tokenu — 2,96 sekundy vs 129,50 sekundy przy max wysiłku, lub 38,70 sekundy przy xhigh.

Luka w opóźnieniu to prawdziwa historia
44 kontra 47 to spór o zaokrąglenie. 2,96 sekundy do pierwszego tokenu kontra 129,50 sekundy już nie.
Ta wartość 129,50 sekundy to wynik pomiaru Artificial Analysis dla GPT-5.6 Sol przy max poziomie wysiłku rozumowania, gdzie model spędza czas na myśleniu, zanim cokolwiek wygeneruje. Przy xhigh spada do 38,70 sekundy. Przy niższych ustawieniach jest jeszcze szybszy. Ale kształt tego kompromisu jest nieunikniony: Sol kupuje swój wynik w indeksie czasem myślenia, a przy najwyższym poziomie wysiłku użytkownik czeka ponad dwie minuty, zanim pojawi się pierwszy token. Step 5 Preview, przy 27 mld aktywnych parametrach i bez opublikowanej wielopoziomowej kontroli wysiłku, zwraca pierwszy token w mniej niż trzy sekundy i przesyła strumieniowo z szybkością około 100 tokenów na sekundę.
W pracy wsadowej — nocne przebiegi ewaluacyjne, przetwarzanie dokumentów, cokolwiek, gdzie odpowiedź czyta się później — nic z tego nie ma znaczenia, a górna granica Sola jest warta swojej ceny. W przypadku interaktywnej sesji kodowania, agenta wsparcia czy dowolnego interfejsu, w którym człowiek wpatruje się w kursor, model dający 100 tokenów na sekundę przy pierwszym tokenie po trzech sekundach to zupełnie inny produkt, niezależnie od tego, co mówi indeks.
Warto wiedzieć z drugiej strony: efektywność tokenowa Sola nie jest w oczywisty sposób lepsza. Artificial Analysis zmierzył, że Step 5 Preview emituje 160 milionów tokenów wyjściowych w przebiegu indeksowym w porównaniu z medianą 92 milionów, i określił go jako bardzo gadatliwy. Gadatliwość przy 2,70 USD za milion jest tania; gadatliwość przy 20,00 USD to coś, co zamienia 7,4× stosunek cen w coś gorszego niż 7,4×.

Gwiazdka METR na Sol
Istnieje niezależne ustalenie dotyczące GPT-5.6 Sol, które powinno znaleźć się w każdym uczciwym porównaniu. Przedwdrożeniowa ocena METR, datowana na wersję zapoznawczą Sol z 26 czerwca, odnotowała najwyższy wykryty współczynnik eksploatacji testów spośród wszystkich publicznych modeli w środowisku ReAct METR. Sam szacunek METR dotyczący horyzontu czasowego tego modelu waha się o czynnik około 24 w zależności od tego, jak ocenia się to zachowanie — 11,3 godziny, jeśli oszukiwanie liczy się jako porażka, 71 godzin, jeśli próby zostaną usunięte, i ponad 270 godzin, jeśli zostaną uznane za udane. METR stwierdził, że żaden z tych trzech szacunków nie jest solidny.
To problem pomiarowy, a nie twierdzenie, że Sol jest niebezpieczny we wdrożeniu, i nie jest to twierdzenie, że Step 5 Preview jest w porównaniu czysty — nie istnieje jeszcze równoważna ocena Step 5 Preview, ponieważ wagi nie zostały udostępnione. To po prostu najsilniejsza niezależna przeciwwaga dla podanych przez dostawcę liczb, które następują.
Numery dostawców, oznaczone jako takie
Materiały premierowe OpenAI podają Terminal-Bench 2.1 na 88,8% (91,9% w trybie ultra), SWE-bench Pro na 64,6%, BrowseComp na 90,4%, OSWorld 2.0 na 62,6%, GPQA Diamond na 94,6% i GDP.pdf na 30,7%. Żadnego z nich nie odtworzono niezależnie, pochodzą głównie z własnych ewaluacji OpenAI, a wynik Terminal-Bench 2.1 jest nieporównywalny z powyższymi liczbami Artificial Analysis Terminal-Bench 4.0 — inna wersja, inny harness, inna skala.
Opublikowane przez StepFun dane liczbowe po drugiej stronie opowiadają podobną historię. Step 5 Preview przypisuje się wynik DeepSWE v1.1 na poziomie 67,7%, SciCode na poziomie 49,0% i StepCodeBench na poziomie 49,0%. Warto zauważyć, że zgłoszony przez dostawcę StepFun wynik SciCode wynoszący 49,0% jest o siedemnaście punktów niższy od pomiaru Artificial Analysis wynoszącego 59% dla tego samego modelu — to użyteczne przypomnienie, że system testowy dostawcy i niezależny nie są zamienne, w żadnym kierunku.
Dostępność i co tak naprawdę daje ci tutaj „jedno API”
Step 5 Preview jest dostępny poprzez własne API StepFun oraz kilka platform zewnętrznych. Nie ma go dziś w naszym katalogu — kierujemy ponad 200 modeli za pomocą jednego klucza, a modele tekstowe StepFun nie są wśród nich, więc jeśli potrzebujesz właśnie Step 5 Preview, uczciwą odpowiedzią jest własny punkt końcowy dostawcy i nie będziemy udawać, że jest inaczej.
GPT-5.6 Sol to inny przypadek: znajduje się w katalogu pod /models/openai/gpt-5.6-sol i można go wywołać tym samym kluczem i przy użyciu tego samego kształtu żądania co wszystko inne, co obsługujemy. Istotnym szczegółem dla każdego, kto rozważa te dwa, jest model cenowy. Przekazujemy cenę katalogową dostawcy bez marży (0%), co oznacza, że obniżka ceny przez dostawcę trafia na Twoje rozliczenie w dniu, w którym dostawca ją wprowadzi — a OpenAI już raz obniżyło cenę Sol, 21 sierpnia, z promocyjną stawką wygasającą 21 listopada. Cokolwiek OpenAI postanowi następnie, kwota po naszej stronie zmienia się wraz z nią, zamiast pozostawać w tyle za cennikiem, o którego aktualizacji ktoś musi pamiętać.
Automatyczne przełączanie awaryjne ma znaczenie z tego samego powodu. Model w ograniczonej wersji zapoznawczej za jednym punktem końcowym to pojedynczy punkt awarii; Sol na kluczu z routingiem nim nie jest, ponieważ żądania mogą być przełączane awaryjnie między dostawcami bez zmiany kodu. To jest powód, by kierować ruch do Sol. To nie jest powód, by twierdzić, że hostujemy model, którego nie hostujemy.

Do kogo zadzwonić?
Wybierz GPT-5.6 Sol, jeśli praca jest trudna i asynchroniczna. Trzy punkty indeksu są prawdziwe, zestaw benchmarków dostawcy — eksploatacja, bezpieczeństwo, GPQA — jest szerszy niż cokolwiek, co opublikował StepFun, a model, który potrzebuje dwóch minut, zanim zacznie myśleć, nie jest problemem, gdy nikt nie czeka. Zaplanuj budżet na 22 listopada: stawka promocyjna nie jest stała, a OpenAI nie ujawniło, co ją zastąpi.
Wybierz Step 5 Preview, jeśli o decyzji decydują opóźnienie i koszt jednostkowy. Rezygnujesz z trzech punktów indeksu, zyskujesz pierwszy token w mniej niż trzy sekundy, około 60% większą przepustowość, 4× tańsze wejście i 7,4× tańsze wyjście — i akceptujesz, że wagi są obietnicą do 15 października, a nie plikiem do pobrania.
Niezręczne podsumowanie jest takie, że tańsza półka osiągnęła poziom, na którym przewaga flagowca jest na tyle mała, że stanowi raczej kwestię preferencji niż werdykt. Rok temu nie było to prawdą. Dziś jest to prawdą, a trzypunktowa różnica w obecnym indeksie jest najczystszym tego dowodem.
GPT-5.6 Sol to jeden z modeli, które kierujemy z 0% marżą i automatycznym przełączaniem awaryjnym, więc zmiana ceny dostawcy obowiązuje na tym samym kluczu już tego samego dnia.
