Wygenerowana karta tytułowa zatytułowana „Step 5 Preview vs Claude Opus 5 — różnica w cenie” z dwiema kolumnami: Step 5 Preview przy AA Index 44, cena $1,00 za wejście / $2,70 za wyjście, koszt przebiegu indeksu $922,84 i prędkość generowania 99,8 tokenów/s; Claude Opus 5 przy AA Index 51, cena $5,00 za wejście / $25,00 za wyjście, koszt przebiegu indeksu $7 274,74 i prędkość generowania 55,3 tokenów/s. Stopka głosi: „7,9x kosztu za 7 punktów indeksu. Oba według Artificial Analysis Intelligence Index v4.3.2 przy maksymalnym wysiłku rozumowania.”
Guides & Insights

Step 5 Preview kontra Claude Opus 5: Siedem punktów indeksu za siedmiokrotnie wyższy rachunek

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Materiały premierowe StepFun dotyczące Step 5 Preview otwierają się pojedynczym twierdzeniem porównawczym: jedno zadanie na nim kosztuje jedną ósmą tego samego zadania na Claude Opus 5. Oba modele znajdują się teraz w tym samym niezależnym rankingu, więc to twierdzenie można sprawdzić, zamiast się o nie spierać. Artificial Analysis przepuściło każdy z nich przez Intelligence Index v4.3.2 — dziesięć ewaluacji — i opublikowało koszt każdego przebiegu, przy czym Claude Opus 5 oceniano przy jego własnym maksymalnym ustawieniu wysiłku rozumowania. Step 5 Preview: 44 w indeksie, 922,84 USD za ukończenie przebiegu. Claude Opus 5: 51 w indeksie, 7274,74 USD. To 7,9 razy więcej pieniędzy za 7 punktów wyniku, a podany przez StepFun stosunek okazuje się tym trafnym. To, co ten stosunek ukrywa, jest najciekawsze, bo różnica nie jest głównie różnicą ceny. To różnica gadatliwości ubrana w szaty różnicy ceny, a rozdzielenie tych dwóch rzeczy zmienia to, który model powinieneś postawić przed jakim obciążeniem.

Dwa koszty eksploatacji, jedna tablica i co tak naprawdę się w nich znajduje

Całkowity koszt przebiegu to najczystsze pojedyncze porównanie dostępne w tym przypadku, ponieważ oba modele odpowiedziały na te same pytania w ramach tego samego środowiska testowego, a żaden z dostawców nie podał tej liczby. Jest to również liczba najbardziej narażona na błędny odczyt, więc warto ją bliżej przeanalizować.

• Wynik indeksu — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5 oceniono przy maksymalnym ustawieniu wysiłku rozumowania

• Całkowity koszt ukończenia indeksu — Step 5 Preview $922.84 vs Claude Opus 5 $7,274.74

• Cena mieszana przy proporcji trafień w pamięć podręczną / wejścia / wyjścia 7:2:1 — Step 5 Preview 0,51 USD za 1 mln tokenów vs Claude Opus 5 3,85 USD

• Tokeny wyjściowe wygenerowane podczas przebiegu indeksowania — Step 5 Preview 160M vs Claude Opus 5 140M

• Cena katalogowa — Step 5 Preview: 1,00 USD za wejście / 2,70 USD za wyjście vs Claude Opus 5: 5,00 USD za wejście / 25,00 USD za wyjście

Spójrz razem na wiersze trzeci i piąty, a arytmetyka przestaje być prostym porównaniem cen. Stawka mieszana Step 5 Preview jest 7,5 razy tańsza, a stawka cennikowa jest 5 razy tańsza na wejściu i 9,3 razy tańsza na wyjściu — więc mieszanka robi coś, czego cena wejścia nie robi. Dzieje się tak, ponieważ mieszanka ma większą wagę po stronie wyjścia, a to na wyjściu oba modele różnią się najbardziej. Claude Opus 5 nalicza 9,3 razy stawkę wyjściową Step 5 Preview, a oba modele generują bardzo dużo: 140 mln tokenów wyjściowych w przypadku Claude Opus 5 wobec mediany 92 mln wśród modeli ocenianych przez indeks oraz 160 mln w przypadku Step 5 Preview wobec tej samej mediany 92 mln.

Uczciwa interpretacja jest więc węższa niż „tani model to okazja”. Step 5 Preview jest tańszy pod każdym względem i nie jest oszczędnym modelem — generuje o 74% więcej danych wyjściowych niż model medianowy, z którym jest porównywany, a to dokładnie takie zachowanie, które cena ma karać. Claude Opus 5 generuje o 52% więcej niż mediana i pobiera 9,3 razy wyższą opłatę za każdy z tych tokenów. Wywołujący, który ogranicza długość danych wyjściowych, otrzymuje inny stosunek niż ten, który tego nie robi.

Nie chodzi o to, które jest lepsze. Chodzi o to, gdzie leży punkt przecięcia.

Załóżmy, że indeks jest rozsądnym przybliżeniem pracy, którą faktycznie zlecasz — zadania agentowe o długim horyzoncie, kod, wieloetapowe korzystanie z narzędzi. Wtedy punkt przejścia można ująć prosto: Claude Opus 5 musi być co najmniej 7,9 razy bardziej użyteczny na zadanie, zanim będzie wart swojej ceny, a w indeksie jest o 7 punktów lepszy w skali 100 punktów. Te dwa fakty nie muszą wskazywać tego samego kierunku, ponieważ 7-punktowa luka w indeksie nie oznacza bycia o 16% lepszym we wszystkim. To suma dziesięciu ewaluacji, a skład ma większe znaczenie niż suma.

To jest argument za tym, żeby przejmować się kształtem obu wyników, a nie nagłówkiem. Wynik Step 5 Preview w Terminal-Bench 4.0 to 33,3% — prawdziwy wynik agentowy, wyprzedzający DeepSeek V4.1 Flash z 26,8% — ale nic w opublikowanym zapisie nie pokazuje jeszcze, by dorównywał Claude Opus 5 w ewaluacjach długiego horyzontu, w których model Anthropic jest najmocniejszy. Materiały samego StepFun przyznają to w sformułowaniu: w ALE-CLI, FrontierFinance i DRACO firma umieszcza Step 5 Preview na drugim miejscu, za GPT-6 Astra albo Claude Opus 5, a przed pozostałymi otwartymi modelami w porównaniu. Drugie miejsce przy jednej piątej ceny to naprawdę dobry wynik. To także nie jest pierwsze miejsce, a zadania, w których model kończy drugi, to zwykle zadania, które wymagały pierwszego.

Inna asymetria dotyczy tego, co się dzieje przy błędnym wywołaniu. Błędna odpowiedź taniego modelu, która zajęła cztery sekundy i 2 000 tokenów, kosztuje cię ponowną próbę; ta sama błędna odpowiedź od Claude Opus 5 przy 25 dolarach za milion tokenów wyjściowych kosztuje cię ponowną próbę plus namysł. Jeśli twój pipeline ponawia próbę po awarii — większość pętli agentowych tak robi — efektywny koszt przypadający na udane zadanie jest liczbą, która się liczy, i nie jest to ten sam stosunek co cena katalogowa, ponieważ oba modele nie będą zawodziły z taką samą częstotliwością. Nikt jeszcze nie opublikował tej liczby dla Step 5 Preview.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Kontrast specyfikacji, wymiar po wymiarze

• Wynik indeksu — Step 5 Preview 44 vs Claude Opus 5 51, oba w Intelligence Index v4.3.2, Claude Opus 5 przy maksymalnym ustawieniu wysiłku rozumowania

• Cena za 1 mln tokenów — Step 5 Preview 1,00 USD za wejście / 2,70 USD za wyjście vs Claude Opus 5 5,00 USD za wejście / 25,00 USD za wyjście

• Zniżka za cache — Step 5 Preview 95% vs Claude Opus 5 90%

• Kontekst — oba po 1 mln tokenów; StepFun nie opublikował limitu wyjściowego, a Anthropic ma 128 tys.

• Wejście — oba przyjmują tekst i obrazy; oba zwracają tylko tekst

• Szybkość generowania — Step 5 Preview 99,8 tokenów/s vs Claude Opus 5 55,3 tokenów/s

• Panel sterowania — Step 5 Preview udostępnia rozszerzone myślenie; Claude Opus 5 zastępuje temperaturę i top_p adaptacyjnym pokrętłem wysiłku rozumowania

• Wagi — Step 5 Preview zamknięto dziś, punkt kontrolny BF16 zaplanowano na 15 października; Claude Opus 5 w całości zastrzeżony

• Niezależne dowody — oba ocenione przez Artificial Analysis; wiersze agentowego benchmarku StepFun są uruchamiane przez dostawcę i niezreplikowane

Dwa wiersze zasługują na uwagę. Różnica prędkości jest realna i w praktyce większa, niż sugeruje tabela: 99,8 tokena na sekundę w porównaniu z 55,3 to model, który kończy pracę około dwa razy szybciej przy tym samym wyniku, a czas do pierwszego tokena w Step 5 Preview wynoszący 2,96 sekundy w porównaniu z 56,84 sekundy w Claude Opus 5 na tej samej tablicy to zupełnie inny rząd wielkości — choć ta druga liczba dotyczy konfiguracji rozumowania o maksymalnym wysiłku, w której model deliberuje, zanim cokolwiek wyemituje. To nie jest opóźnienie, jakie widzi wywołanie produkcyjne. W przypadku standardowego punktu końcowego nasz własny katalog podaje p50 czasu do pierwszego tokena wynoszące 6,73 sekundy dla Claude Opus 5, i to jest liczba, na której należy się opierać, jeśli nie prosisz celowo o maksymalne deliberowanie.

Wiersz rabatu za pamięć podręczną to ten, który po cichu decyduje o powtarzalnych obciążeniach, i sprzyja Step 5 Preview — 95% w porównaniu z 90%. Pętla agenta, która przy każdym wywołaniu ponownie wysyła ten sam prompt systemowy i kontekst repozytorium, opiera się niemal w całości na tym rabacie, więc pięciopunktowa różnica kumuluje się przez długą sesję.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Gdzie Claude Opus 5 wciąż jest jedyną odpowiedzią

Nic z powyższego nie przemawia przeciwko modelowi Anthropic. Kosztuje tyle, ile kosztuje, ponieważ robi to, co indeks próbuje mierzyć, i robi to niemal na szczycie tabeli — 51 w Intelligence Index v4.3.2, o siedem punktów przed Step 5 Preview i w zasięgu liderów obecnej generacji. Obciążenia, w których 7-punktowa różnica w wyniku zagregowanym nie oddaje rzeczywistej różnicy, to te, które nie tolerują odpowiedzi z drugiego miejsca: wielogodzinny refaktoring, w którym trybem awarii jest subtelna zmiana zachowania, model finansowy, w którym łańcuch rozumowania musi być audytowalny, migracja, w której błędna decyzja zostaje wykryta tydzień później. W takich przypadkach ponowna próba nie jest tania, a namysł jest produktem.

Zadania, w których ta różnica nie ma znaczenia, to te zbudowane z wielu drobnych decyzji: kroków klasyfikacji i routingu, ekstrakcji, podsumowywania, szkieletów testów, tysiąca wywołań, które agent wykonuje między dwoma wywołaniami, które naprawdę się liczą. W ich przypadku model na poziomie 44, który odpowiada w połowie czasu przy jednej piątej ceny danych wejściowych, nie jest kompromisem. To właściwy domyślny wybór, a drogi model zostaje zarezerwowany dla kroku, który musi być poprawny.

Przeprowadzanie podziału bez uruchamiania dwóch integracji

Praktyczna wersja tego porównania to wielopoziomowy potok, a powodem, dla którego zespoły go nie budują, jest proces zakupowy, a nie inżynieria — dwóch dostawców, dwie umowy, dwa SDK, dwa klucze do rotacji. Claude Opus 5 jest w naszym katalogu w cenie 5,00 USD i 25,00 USD, a tańsze modele tekstowe, które ustawiłbyś przed nim, są w tym samym katalogu, wszystkie za jednym kluczem dla ponad 200 modeli, z ceną katalogową dostawcy przekazywaną przy 0% marży. Step 5 Preview nie znajduje się na tej liście — działa na własnym API StepFun i dopóki wagi nie zostaną udostępnione, to jedyne miejsce, w którym działa. Złożenie wielopoziomowości z modeli, które obsługujemy, to wyrażenie DSL routingu, a nie zmiana w kodzie — kieruj rutynowe wywołania do małego modelu, eskaluj do drogiego na podstawie warunku pewności lub złożoności i utrzymuj obie odnogi za tym samym punktem końcowym.

Automatyczne przełączanie awaryjne ma tutaj znaczenie z konkretnego powodu, a nie jako ogólna funkcja. Step 5 Preview udostępniło swoje API w dniu ogłoszenia, bez opublikowanych wag i bez ujawnionej floty obsługującej; to endpoint podglądowy mający zaledwie kilka dni, a endpointy podglądowe mają ograniczenia przepustowości w sposób, w jaki dojrzałe endpointy ich nie mają. Claude Opus 5 jest obsługiwany przez wielu niezależnych dostawców, co daje redundancję, której podgląd nie może zaoferować. Utrzymywanie sprawdzonego modelu jako ścieżki zapasowej — po naszej stronie oznacza to model produkcyjny z katalogu, a nie podgląd — pozwala uzyskać prawdziwy sygnał jakości na własnym obciążeniu bez uzależniania ścieżki produkcyjnej od floty, której rozmiar wciąż jest ustalany.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Reguła decyzyjna

Jeśli Twoje obciążenie pracą to niewielka liczba bardzo trudnych zadań, Claude Opus 5 nie jest drogą opcją — to ta tania, ponieważ druga najlepsza odpowiedź kosztuje więcej niż różnica. Jeśli Twoje obciążenie pracą to duża liczba zwykłych zadań z niewielką liczbą trudnych wśród nich, Step 5 Preview w cenie $1.00 i $2.70 z 95% zniżką na pamięć podręczną jest lepszym domyślnym wyborem, a 7-punktowa różnica to w większości błąd zaokrąglenia w pracy, która go nie potrzebowała.

To, co zmieniłoby tę kalkulację, to niezależne dowody na wskaźniki awaryjności i na wiersze agentowe o długim horyzoncie. Podane przez samą StepFun liczby stawiają ten model na drugim miejscu w ewaluacjach, na których oparto premierę, a żadna strona trzecia ich nie odtworzyła. Śledź punkt kontrolny z 15 października pod kątem dwóch rzeczy: czy licencja pozwala na dostrajanie, które pozwoliłoby ci zamknąć 7-punktową lukę na własnych danych, oraz czy rozwlekłość się utrzyma, gdy zniknie sufiks preview. To pierwsze zmieniłoby ten stosunek; to drugie już raz go zmieniło.