Step 5 Preview용으로 생성된 타이틀 카드는 'Step 5 Preview — 지금까지의 유출'이라는 문구를 표시하며, 여섯 가지 사양을 레이블-값 행으로 나열합니다: 총 파라미터 약 600B, 추론당 활성화 약 27B, 입력 텍스트 및 이미지, 컨텍스트 창 1M 토큰, AA Intelligence Index 44, 그리고 1M 토큰당 입력 $1.00, 출력 $2.70의 가격. 하단에는 '모든 수치는 제3자 제공이며 미검증 - StepFun은 이 모델을 발표하지 않았습니다.'라고 적혀 있습니다. OrcaRouter 로고는 오른쪽 아래 모서리에 있습니다.
Guides & Insights

Step 5 미리보기: StepFun의 미공개 600B 플래그십이 이미 리더보드에 올라 있다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Step 5 Preview는 리더보드 순위, 공개된 가격, 측정된 출력 속도, 그리고 Intelligence Index 점수 44를 갖고 있습니다 — Kimi K3와 같은 점수입니다. 크기가 대략 다섯 배에 달하는 모델이죠. 이것이 갖지 못한 것은 출시입니다. StepFun은 이를 발표하지 않았고, StepFun 자체 플랫폼 문서에도 등재되어 있지 않으며, 다운로드할 가중치도 없습니다. 아래의 모든 수치는 공급업체가 공개적으로 아무것도 말하기 전에 접근 권한을 얻은 제3자로부터 나온 것이므로, 이 글은 리뷰가 아니라 지금까지 알려진 내용을 정리한 글입니다. 수치들은 사양표가 아니라 앞으로 다가올 것에 대한 증거로 읽으십시오.

유출이 곧 이야기다

Step 5 Preview의 첫 공개 흔적은 평가 실행입니다. Artificial Analysis에는 이에 대한 라이브 모델 페이지가 있으며, 점수는 StepFun 자체 API를 통해 테스트 태그 step-5-preview-b 아래에서 산출되었습니다. 플랫폼은 이 모델을 2026년 9월 18일자로 기록하고 있습니다. 이 글에 나오는 44, 가격, 속도 측정치, 벤치마크 행은 바로 그 페이지에서 나온 것입니다.

그에 반해, 벤더 측은 비어 있다. StepFun의 개발자 문서에는 Step 3.7 Flash와 Step 3.5 Flash까지의 모델이 나열되어 있고 거기서 끝난다 — step-5는 없고, 프리뷰 항목도 없다. stepfun-ai Hugging Face 조직에는 Step 5 저장소가 없으며, 이는 실수가 아니라 폐쇄형 가중치 플래그십이라는 점과 일치한다. 중국 개발자 포럼의 커뮤니티 보고서들은 9월 19일 상하이에서 열리는 AGI Frontier 행사에서 공개될 가능성을 시사하는데, 이는 평가 결과가 나온 지 대략 하루 뒤가 된다. 이 글을 쓰는 시점에서 StepFun 외부에는 출시 버전에 대한 공식 사양, 공식 가격, 공식 명칭을 가진 사람이 없다.

이름 자체가 이것이 출시가 아니라 프리뷰라는 첫 번째 단서다. StepFun은 Step 4.x 라인을 완전히 건너뛰고 Step 5로 넘어갔다. Preview 접미사로 공개되고, 제품 페이지도 나오기 전에 벤치마크된 모델은 벤더가 아직 조정 중인 모델이다 — 가격, 라우팅, 한도는 모두 정식 출시 전에 바뀔 수 있다.

누구든 알 수 있는 한, 명세가 어떤 모습인지

이것이 회자되는 수치들이며, 이는 유출의 가장 많이 반복된 주장들입니다 — 가장 많이 확인된 주장과는 다릅니다:

• 총 파라미터 — 약 600B, Kimi K3의 약 2.8T와 대비

• 추론당 활성화 — 약 27B, 전체의 약 4.5%, 이례적으로 희소한 전문가 혼합(mixture-of-experts) 비율

• 입력 방식 — 텍스트 및 이미지, 출력은 텍스트만

• 추론 — 예, 확장 사고를 사용합니다

• 컨텍스트 윈도 — Artificial Analysis 기준 1M 토큰; 개발자 도구에서 유통되는 별도의 서드파티 구성에는 최대 출력 64,000과 함께 350,000이 기재되어 있습니다

• 가중치 가용성 — 닫힘, 저장소 없음

그 컨텍스트 윈도우 모순은 분명히 짚고 넘어갈 가치가 있습니다. 아직 누구도 이를 해소하지 못했기 때문입니다. 1M 토큰 윈도우와 350k 토큰 윈도우는 메모리 비용이 다른 서로 다른 제품이며, 두 번째 수치는 첫 번째가 전혀 언급하지 않는 64k 출력 상한을 동반합니다. 1M이라는 숫자를 믿고 장문 문서 파이프라인을 계획하고 있다면, 350k 구성은 벤더 페이지를 기다려야 하는 이유입니다. 파라미터 수치도 비슷한 불확실성을 지닙니다. DataLearner의 트래커는 여전히 Step 5 Preview의 MoE 아키텍처와 파라미터 수치를 확인 불가로 기록하고 있으며, 이는 이 모델에 관해 가장 많이 인용되는 단일 사실인 600B/27B 조합이 공식적으로 가장 덜 확인된 항목 중 하나라는 뜻입니다.

흥미로운 숫자는 600B가 아니라 27B입니다.

희소 전문가 혼합(MoE) 모델은 토큰이 실제로 라우팅되는 전문가에만 연산을 사용하므로, 프로덕션에서 모델이 어떻게 동작하는지를 좌우하는 것은 활성화된 수치입니다. 약 27B 활성 기준에서 Step 5 Preview는 토큰당 연산량이 자신보다 훨씬 작은 모델들과 같은 범위에 있으며, 600B 전체는 대체로 메모리 풋프린트의 문제입니다.

두 가지 결과가 따르며, 둘 다 제3자 측정에서 드러난다. 서빙 비용은 활성화된 파라미터 수를 따라가는데, 이는 가격이 현재 수준에 형성된 이유 중 하나다. 그리고 토큰당 속도에서도 이점이 있다: Artificial Analysis는 초당 출력 토큰 99.8개를 측정했으며, 200개 모델 중 42위로 중앙값 64.6과 대비된다. 첫 토큰까지 걸리는 시간은 2.96초로, 중앙값 약 3.57초와 대비된다. 600B/27B 분할이 정확하다면, 이는 호스팅이 아니라 서빙이 저렴하도록 설계된 모델이다 — 토큰이 아니라 GPU 비용을 지불하는 사람이라면 중요한 구분이다.

인텔리전스 인덱스에서 어디에 위치하는지

Artificial Analysis는 Intelligence Index v4.3에서 Step 5 Preview에 44점을 부여했습니다. 이 지수는 10가지 평가를 포함합니다. 이는 리더보드에서 200개 모델 중 25위이며, 지수가 점수를 매기는 중앙값 모델(25점)을 크게 웃돕니다.

• Intelligence Index — Step 5 Preview 44 vs Kimi K3 44

• 바로 위 — GLM-5.3Claude Opus 5, 둘 다 45

• 바로 아래 — DeepSeek V4.1 Flash 40, DeepSeek V4 Pro 36

• Terminal-Bench 4.0 — Step 5 Preview 33.3% (Kimi K3 약 12.6% 대비, DeepSeek V4.1 Flash 26.8% 대비)

• SciCode — Step 5 Preview의 59%, Kimi K3와 동일한 수준

• 출력 속도 — 초당 99.8토큰, 경쟁 제품 중앙값 64.6 대비

헤드라인은 Kimi K3와의 동률이며, 솔직히 읽자면 헤드라인이 시사하는 것보다 더 좁다. 총 600B로 2.8T 매개변수 모델을 종합 지수에서 맞먹는 것은 실질적인 효율성 성과지만, 그 종합 지수는 그 내용의 형태를 가린다. Step 5 Preview에 유리한 Terminal-Bench 4.0 격차는 극적이지만, SciCode 결과는 막상막하이다. 지수에서의 종합적 동등성은 모든 곳에서의 동등성이 아니며, 프리뷰 빌드는 격차가 유지될 것이라고 가정하기에 가장 신뢰할 수 없는 시점이다.

언급할 만한 불일치가 하나 더 있습니다: Artificial Analysis는 44를 보고하지만, DataLearner의 독립 추적기는 같은 실행을 43.6으로 기록합니다. 이는 역량에 대한 이견이라기보다는 반올림 차이입니다. 하지만 이는 일반적으로 이 모델의 수치에 관한 요점을 잘 보여주는 종류의 일입니다 — 그것들은 아직 발표되지 않은 모델에 대한 제3자 측정값이며, 조금씩 다른 시점에 측정되었고, 그중 어느 것도 StepFun에 의해 확인되지 않았습니다. 이 벤치마크 중 어느 것도 벤더가 보고한 것이 아니며, 이는 양면성이 있습니다: StepFun의 누구도 여기서 어떤 수치를 주장하지 않았고, StepFun의 누구도 어떤 수치를 뒷받침하지도 않았습니다.

Screenshot of the Artificial Analysis model page for Step 5 Preview, headed 'Step 5 Preview Intelligence, Performance & Price Analysis', showing StepFun as the creator, a release date of September 2026, an Intelligence Index of 44 at rank 25 of 200, an output speed of 99.8 tokens per second at rank 42 of 200, input pricing of $1.00 and output pricing of $2.70 per million tokens with a 95% cache discount, $0.71 per Intelligence Index task, verbosity of 160M output tokens, and technical specifications listing reasoning as supported, input modality as text plus image, and a 1M token context window.

가격, 그리고 그 가격을 갉아먹는 장황함

가격 책정은 이 유출 사안 중 예산에 가장 먼저 영향을 미칠 부분입니다. StepFun의 API를 통해 Artificial Analysis는 다음을 기록합니다:

• 입력 — 백만 토큰당 $1.00, 유사 모델 중간값 $1.88 대비

• 출력 — 백만 토큰당 $2.70, 중앙값 $10.00 대비

• 캐시 — 95% 캐시 할인으로, 캐시 적중 시 백만 토큰당 약 $0.05 수준입니다

• 혼합 — 캐시 적중:입력:출력이 7:2:1 비율일 때 백만 토큰당 약 $0.51

• Intelligence Index 작업당 비용 — $0.71

• 전체 인덱스 실행 비용 — 총 $918.34

$2.70의 출력은 가장 중요한 항목입니다. 왜냐하면 같은 100만 토큰에 Kimi K3가 $15.00을 청구하는 금액의 5분의 1에도 못 미치기 때문입니다. 하지만 토큰당 비교가 숨기는 함정이 하나 있는데, Artificial Analysis는 그것을 직접 측정합니다: 바로 장황함입니다. Step 5 Preview는 Intelligence Index를 완료하는 데 160M 출력 토큰을 생성했는데, 이는 해당 분야의 중앙값 90M과 대비되며, 그 측정 기준에서 200개 중 65위입니다.

직접 계산해 보자. 백만 토큰당 $2.70이라면 160M 출력 토큰은 약 $432로, 전체 인덱스 실행의 총비용 $918.34의 절반 정도다. 이는 작업이 아니라 모델 자체의 장황함에 쓰인 돈이다. 같은 160M 토큰을 Kimi K3의 $15.00 출력 요율로 돌려 보면 $2,400이 되는데, 여기서 가격 우위가 나온다. 하지만 다른 모델에서 토큰 수를 가져와 비용을 추산하는 사람에게는 실용적인 경고가 있다: Step 5 Preview는 중앙값의 약 1.8배를 출력하므로, 출력이 많은 워크로드는 더 저렴한 요율과 더 많은 토큰을 동시에 얻게 된다. 할인은 살아남지만, $1.00/$2.70 대 $3.00/$15.00이 보여 주는 것보다는 작으며, 그 크기는 프롬프트가 모델을 얼마나 수다스럽게 만드는지에 전적으로 달려 있다.

95% 캐시 할인은 또 다른 지렛대이며, 이는 이례적으로 공격적입니다. 프롬프트 재사용이 많은 워크로드 — 긴 시스템 프롬프트, 고정 문서, 공유 코드베이스 — 는 $1.00 입력 요율보다 혼합 $0.51에 훨씬 더 가깝게 안착합니다. 그 혼합 수치는 7:2:1 비율을 가정하는데, 이는 보장이 아니라 모델링 가정이지만, 여러분의 자체 트래픽에 대입해 볼 올바른 형태의 산술입니다.

A generated two-column comparison scoreboard titled 'Step 5 Preview vs Kimi K3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, total params about 600B, active params about 27B, Terminal-Bench 4.0 33.3%, SciCode 59%, and price $1.00 / $2.70. The right column gives Kimi K3 the rows AA Index 44, total params about 2.8T, active params not disclosed, Terminal-Bench 4.0 about 12.6%, SciCode 59%, and price $3.00 / $15.00. A footer reads 'Step 5 Preview figures third-party via Artificial Analysis and unaudited; Kimi K3 figures per Artificial Analysis. Prices per 1M tokens.' The OrcaRouter logo sits in the bottom-right corner.

얼리 테스터들이 겪고 있는 것

이것들은 유출 전후 며칠간 개발자 포럼과 소셜 게시물에서 나온 개별 보고이며, 측정값이 아니므로 그에 맞게 가중치를 부여해야 합니다:

• 도구 호출이 가장 흔한 불만 사항입니다 — 잘못된 도구 이름이 선택되고, 대상 파일을 먼저 읽지 않은 채 편집이 시도됩니다

• 약 340,000 토큰의 컨텍스트를 넘어서면 오류가 보고되며, 이는 1M 윈도우가 실제 수치로 판명될 경우 주시해야 할 실패 모드입니다

• 일부 프롬프트에서 출력을 잘라내는 콘텐츠 필터링

• 성능에 대한 인상은 엇갈렸다: 일부 테스터는 GLM-5.3 Flash보다 위에 놓았고, 다른 테스터는 DeepSeek V4.1 Flash보다 아래에 놓았다

공개되지 않은 미리보기 빌드가 도구 사용에서 실패하는 것은 스캔들이 아니다 — 그것은 미리보기 라벨이 존재하는 이유다. 하지만 그것은 44를 에이전틱 신뢰성에 대한 약속으로 읽어서는 안 된다는 뜻이다, 왜냐하면 Intelligence Index는 초기 테스터들이 가장 많이 불평하는 바로 그 부분을 테스트하지 않기 때문이다.

실제로는 뭐라고 불러야 할지 — 그리고 그동안 무엇을 써야 할지

OrcaRouter는 Step 5 Preview를 라우팅하지 않습니다. 공개 엔드포인트도 없고 가중치도 없으므로 라우팅할 대상이 없으며, 어떤 제3자 플랫폼도 아직 그렇다고 솔직히 주장할 수 없습니다. 오늘 그것을 어디에서 호출할 수 있는지 알려주는 사람은 제품이 아니라 평가용 엔드포인트를 설명하고 있는 것입니다.

비교 대상이 되는 모델들은 별개의 문제다. Kimi K3, GLM-5.3, DeepSeek V4.1 Flash는 모두 OrcaRouter를 통해 이용할 수 있으며, 15개 제공업체의 199개 모델과 함께 단일 API 키와 단일 청구서로 사용할 수 있다. 가격은 제공업체의 정가에 0% 마크업으로 그대로 전달되는데, 이는 이런 모델에서는 평소보다 더 중요하다: Step 5 Preview의 $1.00/$2.70이 출시 시 유지되었다가 이후 바뀌면, 패스스루 경로는 다른 누군가의 재가격 일정에 따라 움직이는 것이 아니라 같은 날 바로 움직인다.

그것이 실제로 호출 가능해지면, 아직 출시되지 않은 모델에 준하는 모델을 실행하는 현명한 방법은 아직 신뢰하지 않는 모든 모델을 실행할 때와 같습니다 — 자동 페일오버가 있는 라우트 뒤에 두는 것입니다. 그래야 툴 호출 실패나 롱 컨텍스트 오류가 발생했을 때 애플리케이션까지 함께 중단되는 대신, 정상 동작하는 모델로 폴백됩니다. 초기 보고서들이 여기서 특히 주장하는 패턴이 바로 이것입니다: 툴 호출 문제와 롱 컨텍스트 오류가 보고된 프리뷰 빌드는 바로 뒤에 폴백을 두고 싶은 모델이지, 그 자체로 프로덕션 경로에 올리고 싶은 모델이 아닙니다.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models showing 199 models from 15 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a 'How to call any model' card showing a POST request to the OrcaRouter chat completions endpoint.

이것을 유출에서 릴리스로 바꾸려면 무엇이 필요할까?

주목할 세 가지를, 그것이 얼마나 많은 것을 확정해 줄 수 있는지 순서대로 살펴보겠습니다. 첫째, StepFun 자체 개발자 플랫폼의 모델 페이지와 가격 책정입니다 — 그 순간 step-5가 모델 목록에 나타나면, 벤더 사양서가 이 글의 모든 서드파티 해석을 대체하게 됩니다. 600B/27B 조합과 1M 컨텍스트 주장까지 포함해서요. 둘째, 1M 대 350k 컨텍스트 모순의 해결입니다. 1M 창 아래의 64k 출력 상한은 장문 문서나 에이전트 파이프라인을 구축하는 사람이라면 누구에게나 의미 있는 차이이며, 현재 이는 미해결 상태입니다. 셋째, 이 가격이 출시 초기 전략인지 영구적인 라인인지 여부입니다. 중국 플래그십 모델의 프리뷰 가격은 용량이 빠듯해지면 변동해 온 이력이 있고, 백만 출력 토큰당 $2.70는 그러한 의문을 불러일으킬 만큼 공격적입니다.

최소한 그중 첫 번째가 실현되기 전까지는, 솔직한 요약은 이렇다. Step 5 Preview는 정말로 효율적인 모델처럼 보인다 — 총 600B가 2.8T급 총합 작업을 수행하고, 가격은 업계를 몇 배나 밑돈다 — 다만 검증되지 않은 사양, 실질적인 장황함 비용, 그리고 아직 입증되지 않은 툴 호출 평판을 안고 있다. 계획에 넣어 둘 가치는 있다. 프로덕션 경로에 걸 만한 가치는 아직 없다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트