
Step 5 Preview kontra Claude Opus 5: Siedem punktów indeksu za siedmiokrotnie wyższy rachunek
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Materiały premierowe StepFun dotyczące Step 5 Preview otwierają się pojedynczym twierdzeniem porównawczym: jedno zadanie na nim kosztuje jedną ósmą tego samego zadania na Claude Opus 5. Oba modele znajdują się teraz w tym samym niezależnym rankingu, więc to twierdzenie można sprawdzić, zamiast się o nie spierać. Artificial Analysis przepuściło każdy z nich przez Intelligence Index v4.3.2 — dziesięć ewaluacji — i opublikowało koszt każdego przebiegu, przy czym Claude Opus 5 oceniano przy jego własnym maksymalnym ustawieniu wysiłku rozumowania. Step 5 Preview: 44 w indeksie, 922,84 USD za ukończenie przebiegu. Claude Opus 5: 51 w indeksie, 7274,74 USD. To 7,9 razy więcej pieniędzy za 7 punktów wyniku, a podany przez StepFun stosunek okazuje się tym trafnym. To, co ten stosunek ukrywa, jest najciekawsze, bo różnica nie jest głównie różnicą ceny. To różnica gadatliwości ubrana w szaty różnicy ceny, a rozdzielenie tych dwóch rzeczy zmienia to, który model powinieneś postawić przed jakim obciążeniem.
Dwa koszty eksploatacji, jedna tablica i co tak naprawdę się w nich znajduje
Całkowity koszt przebiegu to najczystsze pojedyncze porównanie dostępne w tym przypadku, ponieważ oba modele odpowiedziały na te same pytania w ramach tego samego środowiska testowego, a żaden z dostawców nie podał tej liczby. Jest to również liczba najbardziej narażona na błędny odczyt, więc warto ją bliżej przeanalizować.
• Wynik indeksu — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 oceniono przy maksymalnym ustawieniu wysiłku rozumowania
• Całkowity koszt ukończenia indeksu — Step 5 Preview $922.84 vs Claude Opus 5 $7,274.74
• Cena mieszana przy proporcji trafień w pamięć podręczną / wejścia / wyjścia 7:2:1 — Step 5 Preview 0,51 USD za 1 mln tokenów vs Claude Opus 5 3,85 USD
• Tokeny wyjściowe wygenerowane podczas przebiegu indeksowania — Step 5 Preview 160M vs Claude Opus 5 140M
• Cena katalogowa — Step 5 Preview: 1,00 USD za wejście / 2,70 USD za wyjście vs Claude Opus 5: 5,00 USD za wejście / 25,00 USD za wyjście
Spójrz razem na wiersze trzeci i piąty, a arytmetyka przestaje być prostym porównaniem cen. Stawka mieszana Step 5 Preview jest 7,5 razy tańsza, a stawka cennikowa jest 5 razy tańsza na wejściu i 9,3 razy tańsza na wyjściu — więc mieszanka robi coś, czego cena wejścia nie robi. Dzieje się tak, ponieważ mieszanka ma większą wagę po stronie wyjścia, a to na wyjściu oba modele różnią się najbardziej. Claude Opus 5 nalicza 9,3 razy stawkę wyjściową Step 5 Preview, a oba modele generują bardzo dużo: 140 mln tokenów wyjściowych w przypadku Claude Opus 5 wobec mediany 92 mln wśród modeli ocenianych przez indeks oraz 160 mln w przypadku Step 5 Preview wobec tej samej mediany 92 mln.
Uczciwa interpretacja jest więc węższa niż „tani model to okazja”. Step 5 Preview jest tańszy pod każdym względem i nie jest oszczędnym modelem — generuje o 74% więcej danych wyjściowych niż model medianowy, z którym jest porównywany, a to dokładnie takie zachowanie, które cena ma karać. Claude Opus 5 generuje o 52% więcej niż mediana i pobiera 9,3 razy wyższą opłatę za każdy z tych tokenów. Wywołujący, który ogranicza długość danych wyjściowych, otrzymuje inny stosunek niż ten, który tego nie robi.
Nie chodzi o to, które jest lepsze. Chodzi o to, gdzie leży punkt przecięcia.
Załóżmy, że indeks jest rozsądnym przybliżeniem pracy, którą faktycznie zlecasz — zadania agentowe o długim horyzoncie, kod, wieloetapowe korzystanie z narzędzi. Wtedy punkt przejścia można ująć prosto: Claude Opus 5 musi być co najmniej 7,9 razy bardziej użyteczny na zadanie, zanim będzie wart swojej ceny, a w indeksie jest o 7 punktów lepszy w skali 100 punktów. Te dwa fakty nie muszą wskazywać tego samego kierunku, ponieważ 7-punktowa luka w indeksie nie oznacza bycia o 16% lepszym we wszystkim. To suma dziesięciu ewaluacji, a skład ma większe znaczenie niż suma.
To jest argument za tym, żeby przejmować się kształtem obu wyników, a nie nagłówkiem. Wynik Step 5 Preview w Terminal-Bench 4.0 to 33,3% — prawdziwy wynik agentowy, wyprzedzający DeepSeek V4.1 Flash z 26,8% — ale nic w opublikowanym zapisie nie pokazuje jeszcze, by dorównywał Claude Opus 5 w ewaluacjach długiego horyzontu, w których model Anthropic jest najmocniejszy. Materiały samego StepFun przyznają to w sformułowaniu: w ALE-CLI, FrontierFinance i DRACO firma umieszcza Step 5 Preview na drugim miejscu, za GPT-6 Astra albo Claude Opus 5, a przed pozostałymi otwartymi modelami w porównaniu. Drugie miejsce przy jednej piątej ceny to naprawdę dobry wynik. To także nie jest pierwsze miejsce, a zadania, w których model kończy drugi, to zwykle zadania, które wymagały pierwszego.
Inna asymetria dotyczy tego, co się dzieje przy błędnym wywołaniu. Błędna odpowiedź taniego modelu, która zajęła cztery sekundy i 2 000 tokenów, kosztuje cię ponowną próbę; ta sama błędna odpowiedź od Claude Opus 5 przy 25 dolarach za milion tokenów wyjściowych kosztuje cię ponowną próbę plus namysł. Jeśli twój pipeline ponawia próbę po awarii — większość pętli agentowych tak robi — efektywny koszt przypadający na udane zadanie jest liczbą, która się liczy, i nie jest to ten sam stosunek co cena katalogowa, ponieważ oba modele nie będą zawodziły z taką samą częstotliwością. Nikt jeszcze nie opublikował tej liczby dla Step 5 Preview.

Kontrast specyfikacji, wymiar po wymiarze
• Wynik indeksu — Step 5 Preview 44 vs Claude Opus 5 51, oba w Intelligence Index v4.3.2, Claude Opus 5 przy maksymalnym ustawieniu wysiłku rozumowania
• Cena za 1 mln tokenów — Step 5 Preview 1,00 USD za wejście / 2,70 USD za wyjście vs Claude Opus 5 5,00 USD za wejście / 25,00 USD za wyjście
• Zniżka za cache — Step 5 Preview 95% vs Claude Opus 5 90%
• Kontekst — oba po 1 mln tokenów; StepFun nie opublikował limitu wyjściowego, a Anthropic ma 128 tys.
• Wejście — oba przyjmują tekst i obrazy; oba zwracają tylko tekst
• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs Claude Opus 5 55,3 tokenów/s
• Panel sterowania — Step 5 Preview udostępnia rozszerzone myślenie; Claude Opus 5 zastępuje temperaturę i top_p adaptacyjnym pokrętłem wysiłku rozumowania
• Wagi — Step 5 Preview zamknięto dziś, punkt kontrolny BF16 zaplanowano na 15 października; Claude Opus 5 w całości zastrzeżony
• Niezależne dowody — oba ocenione przez Artificial Analysis; wiersze agentowego benchmarku StepFun są uruchamiane przez dostawcę i niezreplikowane
Dwa wiersze zasługują na uwagę. Różnica prędkości jest realna i w praktyce większa, niż sugeruje tabela: 99,8 tokena na sekundę w porównaniu z 55,3 to model, który kończy pracę około dwa razy szybciej przy tym samym wyniku, a czas do pierwszego tokena w Step 5 Preview wynoszący 2,96 sekundy w porównaniu z 56,84 sekundy w Claude Opus 5 na tej samej tablicy to zupełnie inny rząd wielkości — choć ta druga liczba dotyczy konfiguracji rozumowania o maksymalnym wysiłku, w której model deliberuje, zanim cokolwiek wyemituje. To nie jest opóźnienie, jakie widzi wywołanie produkcyjne. W przypadku standardowego punktu końcowego nasz własny katalog podaje p50 czasu do pierwszego tokena wynoszące 6,73 sekundy dla Claude Opus 5, i to jest liczba, na której należy się opierać, jeśli nie prosisz celowo o maksymalne deliberowanie.
Wiersz rabatu za pamięć podręczną to ten, który po cichu decyduje o powtarzalnych obciążeniach, i sprzyja Step 5 Preview — 95% w porównaniu z 90%. Pętla agenta, która przy każdym wywołaniu ponownie wysyła ten sam prompt systemowy i kontekst repozytorium, opiera się niemal w całości na tym rabacie, więc pięciopunktowa różnica kumuluje się przez długą sesję.

Gdzie Claude Opus 5 wciąż jest jedyną odpowiedzią
Nic z powyższego nie przemawia przeciwko modelowi Anthropic. Kosztuje tyle, ile kosztuje, ponieważ robi to, co indeks próbuje mierzyć, i robi to niemal na szczycie tabeli — 51 w Intelligence Index v4.3.2, o siedem punktów przed Step 5 Preview i w zasięgu liderów obecnej generacji. Obciążenia, w których 7-punktowa różnica w wyniku zagregowanym nie oddaje rzeczywistej różnicy, to te, które nie tolerują odpowiedzi z drugiego miejsca: wielogodzinny refaktoring, w którym trybem awarii jest subtelna zmiana zachowania, model finansowy, w którym łańcuch rozumowania musi być audytowalny, migracja, w której błędna decyzja zostaje wykryta tydzień później. W takich przypadkach ponowna próba nie jest tania, a namysł jest produktem.
Zadania, w których ta różnica nie ma znaczenia, to te zbudowane z wielu drobnych decyzji: kroków klasyfikacji i routingu, ekstrakcji, podsumowywania, szkieletów testów, tysiąca wywołań, które agent wykonuje między dwoma wywołaniami, które naprawdę się liczą. W ich przypadku model na poziomie 44, który odpowiada w połowie czasu przy jednej piątej ceny danych wejściowych, nie jest kompromisem. To właściwy domyślny wybór, a drogi model zostaje zarezerwowany dla kroku, który musi być poprawny.
Przeprowadzanie podziału bez uruchamiania dwóch integracji
Praktyczna wersja tego porównania to wielopoziomowy potok, a powodem, dla którego zespoły go nie budują, jest proces zakupowy, a nie inżynieria — dwóch dostawców, dwie umowy, dwa SDK, dwa klucze do rotacji. Claude Opus 5 jest w naszym katalogu w cenie 5,00 USD i 25,00 USD, a tańsze modele tekstowe, które ustawiłbyś przed nim, są w tym samym katalogu, wszystkie za jednym kluczem dla ponad 200 modeli, z ceną katalogową dostawcy przekazywaną przy 0% marży. Step 5 Preview nie znajduje się na tej liście — działa na własnym API StepFun i dopóki wagi nie zostaną udostępnione, to jedyne miejsce, w którym działa. Złożenie wielopoziomowości z modeli, które obsługujemy, to wyrażenie DSL routingu, a nie zmiana w kodzie — kieruj rutynowe wywołania do małego modelu, eskaluj do drogiego na podstawie warunku pewności lub złożoności i utrzymuj obie odnogi za tym samym punktem końcowym.
Automatyczne przełączanie awaryjne ma tutaj znaczenie z konkretnego powodu, a nie jako ogólna funkcja. Step 5 Preview udostępniło swoje API w dniu ogłoszenia, bez opublikowanych wag i bez ujawnionej floty obsługującej; to endpoint podglądowy mający zaledwie kilka dni, a endpointy podglądowe mają ograniczenia przepustowości w sposób, w jaki dojrzałe endpointy ich nie mają. Claude Opus 5 jest obsługiwany przez wielu niezależnych dostawców, co daje redundancję, której podgląd nie może zaoferować. Utrzymywanie sprawdzonego modelu jako ścieżki zapasowej — po naszej stronie oznacza to model produkcyjny z katalogu, a nie podgląd — pozwala uzyskać prawdziwy sygnał jakości na własnym obciążeniu bez uzależniania ścieżki produkcyjnej od floty, której rozmiar wciąż jest ustalany.

Reguła decyzyjna
Jeśli Twoje obciążenie pracą to niewielka liczba bardzo trudnych zadań, Claude Opus 5 nie jest drogą opcją — to ta tania, ponieważ druga najlepsza odpowiedź kosztuje więcej niż różnica. Jeśli Twoje obciążenie pracą to duża liczba zwykłych zadań z niewielką liczbą trudnych wśród nich, Step 5 Preview w cenie $1.00 i $2.70 z 95% zniżką na pamięć podręczną jest lepszym domyślnym wyborem, a 7-punktowa różnica to w większości błąd zaokrąglenia w pracy, która go nie potrzebowała.
To, co zmieniłoby tę kalkulację, to niezależne dowody na wskaźniki awaryjności i na wiersze agentowe o długim horyzoncie. Podane przez samą StepFun liczby stawiają ten model na drugim miejscu w ewaluacjach, na których oparto premierę, a żadna strona trzecia ich nie odtworzyła. Śledź punkt kontrolny z 15 października pod kątem dwóch rzeczy: czy licencja pozwala na dostrajanie, które pozwoliłoby ci zamknąć 7-punktową lukę na własnych danych, oraz czy rozwlekłość się utrzyma, gdy zniknie sufiks preview. To pierwsze zmieniłoby ten stosunek; to drugie już raz go zmieniło.
