생성된 타이틀 카드 제목: 'Step 5 Preview vs Claude Opus 5 — 가격 격차', 두 개의 열: Step 5 Preview는 AA Index 44, 가격 입력 $1.00 / 출력 $2.70, 지수 실행 비용 $922.84, 출력 속도 99.8토큰/초; Claude Opus 5는 AA Index 51, 가격 입력 $5.00 / 출력 $25.00, 지수 실행 비용 $7,274.74, 출력 속도 55.3토큰/초. 바닥글: '7개 지수 포인트에 7.9배 비용. 둘 다 최대 추론 노력에서 Artificial Analysis Intelligence Index v4.3.2 기준.'
Guides & Insights

Step 5 Preview 대 Claude Opus 5: 7배 청구서 대비 7개 지수 포인트

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

StepFun의 출시 자료에 따르면 Step 5 Preview는 단일 비교 주장을 앞세운다: 이 모델에서 한 작업을 수행하는 비용은 Claude Opus 5 대비 같은 작업을 수행하는 비용의 8분의 1이다. 이제 두 모델은 같은 독립 리더보드에 올라 있으므로, 그 주장은 논쟁이 아니라 검증이 가능하다. Artificial Analysis는 각 모델을 Intelligence Index v4.3.2 — 10개 평가 — 로 실행했고, 각 실행에 든 비용을 공개했으며, Claude Opus 5는 자체 최대 추론 노력 설정에서 점수를 매겼다. Step 5 Preview: 지수 44, 실행 완료 비용 $922.84. Claude Opus 5: 지수 51, $7,274.74. 이는 7점의 점수를 위해 7.9배의 비용을 지불한 것이며, StepFun이 제시한 비율이 정확한 것으로 드러난다. 그 비율이 감추는 것이 흥미로운 부분인데, 격차는 주로 가격 격차가 아니기 때문이다. 그것은 가격 격차의 옷을 입은 장황함 격차이며, 둘을 분리하면 어떤 모델을 어떤 워크로드 앞에 두어야 하는지가 달라진다.

두 가지 실행 비용, 하나의 보드, 그리고 그 안에 실제로 들어 있는 것

총 실행 비용은 여기서 가능한 가장 명쾌한 단일 비교 지표입니다. 두 모델 모두 동일한 하네스에서 동일한 질문에 답했고, 어느 공급업체도 이 수치를 산출하지 않았기 때문입니다. 또한 이 수치는 오독될 가능성이 가장 큰 수치이므로, 자세히 살펴볼 가치가 있습니다.

• 인덱스 점수 — Step 5 Preview 44 vs Claude Opus 5 51, Claude Opus 5는 최대 추론 노력(reasoning-effort) 설정에서 측정되었습니다

• 인덱스를 완성하는 데 드는 총비용 — Step 5 Preview $922.84 vs Claude Opus 5 $7,274.74

• 7:2:1 캐시 적중 / 입력 / 출력 조합 기준 혼합 가격 — Step 5 Preview 100만 토큰당 $0.51, Claude Opus 5는 $3.85

• 인덱스 실행 중 생성된 출력 토큰 — Step 5 Preview 160M vs Claude Opus 5 140M

• 정가 — Step 5 Preview 입력 $1.00 / 출력 $2.70 vs Claude Opus 5 입력 $5.00 / 출력 $25.00

3행과 5행을 함께 보면, 산술은 더 이상 단순한 가격 비교가 아니게 된다. Step 5 Preview의 블렌드 요율은 7.5배 더 저렴하고, 리스트 요율은 입력에서 5배, 출력에서 9.3배 더 저렴하다 — 즉 블렌드는 입력 가격이 하지 못하는 역할을 하고 있다. 이는 블렌드가 출력 쪽에 가중치를 두기 때문이며, 출력은 두 모델이 가장 크게 갈리는 부분이다. Claude Opus 5는 Step 5 Preview의 출력 요율의 9.3배를 청구하며, 두 모델 모두 상당한 양을 생성한다. Claude Opus 5의 출력 토큰은 140M으로, 이 인덱스가 점수를 매기는 모델들의 중앙값 92M과 대조되고, Step 5 Preview는 같은 92M 중앙값에 대해 160M이다.

그래서 정직하게 읽으면 "저렴한 모델이 이득이다"라는 말보다 범위가 좁다. Step 5 Preview는 모든 축에서 더 저렴하지만 검소한 모델은 아니다 — 비교 대상인 중앙값 모델보다 출력을 74% 더 생성하는데, 이는 가격이 마땅히 벌해야 할 바로 그 행동이다. Claude Opus 5는 중앙값보다 52% 더 생성하고 그 토큰 각각에 9.3배를 청구한다. 출력 길이를 제한하는 호출자는 그렇지 않은 호출자와 다른 비율을 얻는다.

그 질문은 어느 쪽이 더 나은가가 아니다. 그것은 교차점이 어디에 있는가이다

지수가 실제로 보내는 작업—장기 지평의 에이전트 작업, 코드, 다단계 도구 사용—을 합리적으로 대리한다고 가정해 보자. 그러면 교차점은 간단히 말할 수 있다: Claude Opus 5가 그 청구 비용을 지불할 가치가 있으려면 작업당 최소 7.9배 더 유용해야 하는데, 지수에서는 100점 척도에서 7점 더 낫다. 그 두 사실이 같은 방향을 가리킬 필요는 없다. 7점의 지수 격차가 모든 면에서 16% 더 나은 것은 아니기 때문이다. 그것은 열 가지 평가의 집계이며, 총점보다 구성이 더 중요하다.

그것이 헤드라인 수치보다 두 점수의 형태를 중시해야 하는 이유다. Step 5 Preview의 Terminal-Bench 4.0 수치는 33.3%다 — 이는 실제 에이전트 성능 결과로, 26.8%의 DeepSeek V4.1 Flash를 앞서지만, 공개된 기록 중 아직 Anthropic 모델이 가장 강한 장기 지평 평가에서 Claude Opus 5에 필적한다는 것을 보여주는 것은 없다. StepFun 자체 자료도 표현상 이를 인정한다: ALE-CLI, FrontierFinance, DRACO에서 회사는 Step 5 Preview를 GPT-6 Astra나 Claude Opus 5 중 하나에 뒤지고, 비교 대상 다른 오픈 모델들보다는 앞선 2위로 둔다. 5분의 1 가격으로 2위를 하는 것은 진정으로 좋은 결과다. 그러나 그것은 1위가 아니며, 모델이 2위를 차지하는 과제는 보통 1위가 필요했던 과제다.

또 다른 비대칭성은 잘못된 호출에서 벌어지는 일에 있다. 4초와 2,000 토큰이 걸린 저렴한 모델의 잘못된 답변은 재시도 비용만 물리지만, 출력 토큰 백만 개당 25달러인 Claude Opus 5의 똑같은 잘못된 답변은 재시도에 더해 숙고 비용까지 물린다. 파이프라인이 실패 시 재시도한다면 — 대부분의 에이전트 루프가 그렇듯이 — 실질 비용, 즉 성공한 작업당 비용이 중요한 숫자이며, 그것은 정가와 같은 비율이 아니다. 두 모델이 같은 비율로 실패하지는 않을 것이기 때문이다. 아직 아무도 Step 5 Preview에 대해 그 숫자를 공개하지 않았다.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

스펙 대비, 차원별로

• 지수 점수 — Step 5 Preview 44 대 Claude Opus 5 51, 둘 다 Intelligence Index v4.3.2 기준이며, Claude Opus 5는 최대 추론 노력 설정에서

• 1M 토큰당 가격 — Step 5 Preview 입력 $1.00 / 출력 $2.70 vs Claude Opus 5 입력 $5.00 / 출력 $25.00

• 캐시 할인 — Step 5 Preview 95% vs Claude Opus 5 90%

• 컨텍스트 — 둘 다 1M 토큰; StepFun은 출력 상한을 공개하지 않았고 Anthropic의 것은 128K입니다

• 입력 — 둘 다 텍스트와 이미지를 입력받고, 둘 다 텍스트만 출력합니다

• 출력 속도 — Step 5 Preview 초당 99.8 토큰 vs Claude Opus 5 초당 55.3 토큰

• 제어 표면 — Step 5 Preview는 확장 사고를 노출하며, Claude Opus 5는 temperature와 top_p를 적응형 추론 노력 다이얼로 대체합니다

• 가중치 — Step 5 Preview는 오늘 마감되었고, BF16 체크포인트는 10월 15일로 예정됨; Claude Opus 5는 전반에 걸쳐 독점

• 독립적 근거 — 둘 다 Artificial Analysis가 채점; StepFun의 에이전트 벤치마크 행은 벤더가 실행한 것으로 재현되지 않음

두 행은 따로 짚고 넘어갈 만합니다. 속도 차이는 실제로 존재하며, 실전에서는 표가 시사하는 것보다 더 큽니다: 초당 99.8토큰 대 55.3토큰은 동일한 출력을 약 두 배 더 빠르게 완료하는 모델이라는 뜻이고, Step 5 Preview의 첫 토큰까지 걸리는 시간 2.96초와 같은 보드에서의 Claude Opus 5의 56.84초는 차원이 다른 이야기입니다 — 다만 그 두 번째 수치는 모델이 아무것도 출력하기 전에 숙고하는 최대 추론 강도 구성을 측정한 것입니다. 프로덕션 호출에서 겪는 지연 시간은 아닙니다. 표준 엔드포인트 기준으로, 자체 카탈로그에는 Claude Opus 5의 첫 토큰까지 걸리는 p50 시간이 6.73초로 보고되는데, 이는 최대한의 숙고를 의도적으로 요청하지 않는 경우 계획의 기준으로 삼아야 할 수치입니다.

캐시 할인 행은 반복되는 워크로드를 조용히 좌우하는 항목이며, Step 5 Preview에 95% 대 90%로 유리하게 작용합니다. 호출할 때마다 동일한 시스템 프롬프트와 저장소 컨텍스트를 다시 보내는 에이전트 루프는 거의 전적으로 그 할인에 기대어 살아가므로, 5포인트 차이는 긴 세션에 걸쳐 누적됩니다.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs Claude Opus 5 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, price $1.00 / $2.70, cache discount 95%, output speed 99.8 tokens/sec, context 1M tokens, and weights due October 15. The right column gives Claude Opus 5 the rows AA Index 51, price $5.00 / $25.00, cache discount 90%, output speed 55.3 tokens/sec, context 1M tokens, and weights proprietary. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort. StepFun agentic rows are vendor-run.'

Claude Opus 5가 여전히 유일한 해답인 곳

위의 어떤 내용도 Anthropic의 모델을 반박하지 않는다. 비용이 드는 만큼의 비용이 드는 것은 이 모델이 그 지수가 측정하려는 일을 해내고, 그것도 거의 최상위권에서 해내기 때문이다 — Intelligence Index v4.3.2에서 51점, Step 5 Preview보다 7점 앞서며 현세대 선두권에 근접한 수치다. 7점의 총합 격차가 실제 차이를 과소평가하는 워크로드는 2등 답변을 용납할 수 없는 것들이다: 실패 방식이 미묘한 동작 변화인 여러 시간짜리 리팩터링, 추론 체인이 감사 가능해야 하는 금융 모델, 잘못된 결정이 일주일 뒤에야 발견되는 마이그레이션. 그런 경우 재시도는 저렴하지 않고, 숙고 자체가 결과물이다.

격차가 무의미한 워크로드는 수많은 작은 결정으로 구성된 것들입니다. 분류 및 라우팅 단계, 추출, 요약, 테스트 스캐폴딩, 그리고 실제로 중요한 두 번의 호출 사이에 에이전트가 수행하는 수천 번의 호출 같은 것들이죠. 그런 작업에서는 입력 가격의 5분의 1로 절반의 시간에 응답하는 44점 모델은 타협이 아닙니다. 그것이 올바른 기본값이며, 반드시 정확해야 하는 단계를 위해 비싼 모델을 남겨 두는 것입니다.

두 개의 통합을 실행하지 않고 스플릿 실행하기

이 비교의 실용적인 형태는 계층형 파이프라인인데, 팀들이 이를 구축하지 않는 이유는 엔지니어링이 아니라 조달입니다 — 두 개의 벤더, 두 개의 계약, 두 개의 SDK, 교체해야 할 두 개의 키. Claude Opus 5는 $5.00 및 $25.00에 저희 카탈로그에 있으며, 그 앞에 배치할 더 저렴한 텍스트 모델들도 같은 카탈로그에 있습니다. 200개 이상의 모델을 하나의 키 뒤에 두고 제공업체 정가를 0% 마크업으로 그대로 전달합니다. Step 5 Preview는 그 목록에 없습니다 — StepFun 자체 API에서 실행되며, 가중치가 공개되기 전까지는 그곳이 유일하게 실행되는 곳입니다. 저희가 실제로 라우팅하는 모델들 전반에 걸쳐 계층화를 구성하는 것은 코드 변경이 아니라 라우팅 DSL 표현식입니다 — 일상적인 호출은 소형 모델로 보내고, 신뢰도나 복잡도 조건에 따라 비싼 모델로 에스컬레이션하며, 두 경로 모두 동일한 엔드포인트 뒤에 유지하세요.

자동 장애 조치(failover)는 여기서 일반적인 기능이라기보다 특정한 이유 때문에 중요합니다. Step 5 Preview는 발표 당일 API를 공개했지만 가중치를 공개하지 않았고 서빙 인프라도 밝히지 않았습니다. 불과 며칠 된 프리뷰 엔드포인트이며, 프리뷰 엔드포인트는 성숙한 엔드포인트와 달리 용량 제약이 있습니다. Claude Opus 5는 여러 독립 제공업체가 서빙하며, 이는 프리뷰가 제공할 수 없는 이중화입니다. 검증된 모델을 폴백 구간으로 유지하는 것 — 우리 쪽에서는 프리뷰가 아니라 카탈로그에 있는 프로덕션 모델을 의미합니다 — 이 바로 자체 워크로드에서 실제 품질 신호를 얻으면서도 프로덕션 경로가 아직 규모를 산정 중인 인프라에 의존하지 않게 하는 방법입니다.

Screenshot of the OrcaRouter model page for Claude Opus 5 at www.orcarouter.ai/models/anthropic/claude-opus-5, showing the model id anthropic/claude-opus-5, the max output and context figures of 128K and 1M tokens, input pricing of $5.00 and output pricing of $25.00 per million tokens, a p50 time to first token of 6.73 seconds, 59.7M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

의사결정 규칙

작업량이 아주 어려운 소수의 작업이라면, Claude Opus 5는 비싼 선택이 아니라 오히려 저렴한 선택입니다. 두 번째로 좋은 답이 그 차액보다 더 큰 비용을 치르게 하기 때문입니다. 작업량이 대다수가 평범한 작업이고 그 안에 어려운 작업이 소수 섞여 있는 경우라면, $1.00와 $2.70에 95% 캐시 할인이 적용되는 Step 5 Preview가 더 나은 기본값이며, 7포인트 격차는 그것이 필요하지 않았던 작업에서는 대부분 반올림 오차에 불과합니다.

그 계산을 바꿀 것은 실패율과 장기적 에이전트 작업 항목들에 관한 독립적인 증거다. StepFun 자체 수치는 자사가 출시를 설계하며 중심에 둔 평가들에서 이 모델을 2위에 올려놓았고, 이를 재현한 제3자는 아직 없다. 10월 15일 체크포인트에서 두 가지를 지켜보라: 라이선스가 자체 데이터로 7점 격차를 좁힐 수 있게 해주는 파인튜닝을 허용하는지, 그리고 미리보기 접미사가 떨어져 나간 뒤에도 장황함이 유지되는지. 첫 번째는 그 비율을 바꿀 것이고, 두 번째는 이미 한 번 바꿨다.