
Step 5 Preview 발표: StepFun의 600B 플래그십이 실제로 제공하는 것, 그리고 아직 빠진 것
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
StepFun은 Step 5 Preview를 2026년 9월 20일에 발표했습니다 — 토큰당 27B 파라미터가 활성화되는 6,000억 파라미터 규모의 희소 전문가 혼합(MoE) 플래그십으로, 1M 토큰 컨텍스트 창, 네이티브 이미지 입력, Artificial Analysis Intelligence Index 점수 44를 갖췄습니다. API는 같은 날 열렸습니다. 열리지 않은 것은 모델 자체입니다: Hugging Face 저장소 stepfun-ai/Step-5-Preview-BF16는 발표 당일 오후에 이미 존재했으며 정확히 파일 하나, .gitattributes만 들어 있었고, 가중치도, 라이선스도, 모델 카드도, 구성도 없었습니다. StepFun 자체 자료에서는 오픈 웨이트 공개 시점을 2026년 10월 15일로 제시합니다. 그래서 이번 출시를 정직하게 한 줄로 요약하자면, 이 모델은 오늘 호출할 수 있고 약 3주 반 뒤에 다운로드할 수 있으며, 이 둘은 서로 다른 일이라는 것입니다. 이 모델은 또한 이 블로그가 오늘 앞서 미발표 유출로 다룬 바로 그 모델로, StepFun이 제품 페이지를 공개하기 전에 테스트 태그로 벤치마크되었습니다 — 이는 프리뷰가 숫자 하나 바뀌지 않고도 유출에서 출시로 이동할 수 있다는 유용한 알림입니다.
이 저장소는 자리 표시자이며, 그게 전부입니다.
벤더가 가중치를 공개할 때, 그 저장소가 곧 증거다. 저장소에는 라이선스 파일이 있고, 파라미터 수가 적힌 설정 파일이 있고, 용도와 평가 표가 담긴 README가 있으며, safetensors 샤드들의 총 크기를 보면 파라미터 주장이 사실인지 알 수 있다. stepfun-ai/Step-5-Preview-BF16에는 그런 것이 하나도 없다. 이 모델의 Hugging Face API 레코드를 보면 생성 시각은 2026-09-20T03:52Z, 다운로드 0회, 좋아요 2개, 빈 config 객체, pipeline_tag 없음, 라이선스 없음, 형제 파일 하나뿐이다. StepFun 조직 페이지에는 이 저장소가 등록되어 있지만, 다른 Step 5 저장소는 하나도 없다 — FP8 빌드도, NVFP4 빌드도, GGUF도, 6월에 Step-3.7-Flash와 함께 제공되었던 양자화 변형도 없다.
그것을 수수께끼가 아니라 일정으로 읽어라. repo 이름의 BF16 접미사가 결정적 단서다: bfloat16 체크포인트를 먼저 공개하려는 연구소는 — FP8 및 NVFP4 서빙 빌드가 도착하기 전에 여러분이 미세 조정하고 양자화하는 출발점이 되는 형식인데 — 저장소를 만들 때 그렇게 이름 붙이고 나중에 채운다. StepFun은 자체 발표 자료에서 10월 15일이라고 밝혔다. 그때까지 그 저장소는 의도에 관한 주장일 뿐이며, 그것이 증명하는 유일한 사실은 StepFun이 네임스페이스를 예약했다는 것뿐이다.
이것은 실용적인 이유에서 중요합니다. Preview 접미사와 누락된 가중치는 같은 방향을 가리키는 동일한 신호입니다: 모델은 호출 가능하고, 가격은 책정되어 있으며, 자체 하드웨어에서 실행할 아티팩트는 아직 존재하지 않습니다. 10월 중순 이전에 자체 호스팅 Step 5 Preview를 전제로 하는 모든 계획은 그 뒤를 받쳐줄 아티팩트가 없는 계획입니다.
실제로 발표된 내용은 무엇인가요?
StepFun의 프레이밍은 좁고 구체적이다: Step 5 Preview는 실제 환경의 에이전트 작업—AI 코딩, 소프트웨어 엔지니어링, 전문 지식 업무, 금융—을 위한 베이스 모델이며, 챗 품질보다는 긴 컨텍스트, 멀티턴 도구 호출, 지속적 실행에 중점을 둔다. 이 회사는 Step 4.x 라인을 완전히 건너뛰고 Step-3.7-Flash에서 곧바로 Step 5로 갔는데, 이는 이 단계를 얼마나 큰 도약으로 보는지에 대한 진술이기도 하다.
날짜와 관련해 짚고 넘어갈 만한 세부 사항이 하나 있는데, 이는 조달 일정을 발목 잡는 종류의 일이기 때문이다. Artificial Analysis는 이 모델의 날짜를 2026년 9월 18일로 잡고 있으며, 이는 StepFun 자체 발표보다 이틀 앞선다. 보드는 모델에 접근할 수 있게 되면 점수를 매기며, 그 이틀의 차이는 모델이 호출 가능해진 시점과 벤더가 그에 대해 글을 쓰는 시점 사이의 통상적인 지연이다. 인용해야 할 날짜는 StepFun의 발표 — 9월 20일, 같은 날 API와 Studio 공개 — 이며, 10월 15일 가중치 날짜도 같은 자료에서 나온다.
게시된 사양:
• 총 파라미터 — 600B, 희소 전문가 혼합
• 토큰당 활성 — 27B, 전체의 약 4.5%, 이례적으로 희소한 비율
• 컨텍스트 윈도우 — 1M 토큰
• 입력 — 텍스트와 이미지를 기본적으로 지원하며, 출력은 텍스트만 가능
• 추론 — 예, 확장 사고를 사용합니다
• 가격 — 백만 입력 토큰당 $1.00, 백만 출력 토큰당 $2.70, 95% 캐시 할인 적용
• 제공 일정 — API와 Studio는 9월 20일부터 오픈되며, 가중치는 10월 15일로 예정되어 있습니다
StepFun이 내세우는 효율성 주장은 600B/27B 분할이 이 모델을 파레토 최전선, 즉 연산 단위당 역량에 올려놓는다는 것이며, 회사는 이를 Step-3.5-Flash에서 Step-3.7-Flash를 거쳐 이번 모델에 이르기까지 동일한 추구의 세 세대라고 설명한다. 일관성 있는 이야기이며, 그 메커니즘은 희소 비율이다. 27B가 활성화된 상태에서는 토큰당 서빙 비용이 훨씬 더 작은 모델의 범위에 머무는 반면, 총 600B는 대부분 메모리 사용량 문제다.
공급업체의 주장, 그리고 그 옆에 있는 제3자 수치
출시 자료에는 두 부류의 숫자가 등장하며, 이 둘은 같은 방식으로 읽어서는 안 된다. StepFun 자체 평가가 첫 번째 부류다: 단일 작업 비용이 Claude Opus 5의 8분의 1이라는 주장; ALE-CLI, FrontierFinance, DRACO에서 GPT-6 Astra 또는 Claude Opus 5에 이어 2위; MLA 커널 최고 성능을 Claude Opus 5의 493에 맞서 508 TFLOPS로 끌어올린 24시간 GPU 커널 최적화 실행; Qwen3-30B-A3B를 AIME24에서 53.3%에서 60%로 끌어올린 자동화된 사후 학습 실험; DeepSWE v1.1은 67.7%, 자체 StepCodeBench는 49.0%. StepFun은 StepCodeBench를 직접 구축했다 — 553개 코드 저장소, 아홉 가지 작업 유형, 33개 프로그래밍 언어 — 이는 자사 모델을 측정하기에는 합리적인 도구이지만 독립적인 도구는 아니다.
두 번째 부류는 다른 누군가가 측정하며, 이는 대비해 계획해야 하는 부분이다. Artificial Analysis는 Step 5 Preview에 Intelligence Index v4.3.2에서 44점을 부여하며, 200개 모델 중 24위 — Kimi K3와 동률이고, GLM-5.3보다 1점 뒤지며, Claude Opus 5의 medium reasoning-effort 설정과 동률이다. Terminal-Bench 4.0에서는 같은 보드가 33.3%를 기록해, 26.8%의 DeepSeek V4.1 Flash보다 앞서고 약 12.6%의 Kimi K3보다 훨씬 앞선다. 출력 속도는 초당 99.8토큰, 첫 토큰까지 걸리는 시간은 2.96초로 측정된다 — 둘 다 동일한 독립 실행에서 나온 수치이며, 둘 다 에이전트 루프가 대화형처럼 느껴지는지를 결정하는 종류의 수치다.
제3자 수치 하나는 정반대 방향으로 작용하며 가격 옆에 나란히 놓일 만하다. 같은 index 실행에서 Step 5 Preview는 160M 출력 토큰을 사용했는데, 점수화된 모델들의 중앙값은 92M이었다. 이 모델은 장황하다. 백만 출력 토큰당 $2.70라면 그 장황함은 공짜가 아니다. 160M 출력 토큰은 실행 총비용 $922.84 중 대략 $432에 해당하며, 세 배를 청구하는 모델에서는 청구서에서 가장 큰 항목이 될 것이다. 낮은 대표 가격과 작업당 높은 토큰 수는 하나의 숫자를 이루는 양면이며, index 작업당 비용인 $0.71이 바로 그 둘을 이미 담고 있는 숫자다.

그 유출이 제대로 짚은 것, 그리고 그것이 풀지 못한 단 한 가지
이 블로그의 이전 보도는 어떤 발표보다도 앞서 드러난 평가 실행을 바탕으로 작성되었으며, 확인할 수 없었던 주장들을 표시해 두었습니다. 그 발표는 그중 대부분을 해소했습니다. 600B/27B 조합은 이제 추론된 것이 아니라 벤더가 밝힌 것입니다. 1M 토큰 컨텍스트 윈도우는 이제 제3자 게시판에만 있는 것이 아니라 StepFun 자체 사양에 들어 있습니다. 1.00달러와 2.70달러의 가격이 바로 그 가격입니다. 이름은 소문으로 돌던 다른 이름이 아니라 Step 5 Preview입니다.
발표가 하지 않은 일은 유출 보도가 제기한 컨텍스트 윈도우 모순을 해결하는 것이었다. 개발자 도구 환경에서 유통된 별도의 서드파티 구성은 이 모델을 컨텍스트 350,000토큰, 최대 출력 64,000토큰으로 기재했다. 1M 윈도우와 350k 윈도우는 메모리 비용이 다른 서로 다른 제품이며, 64k 출력 상한은 바로 이 모델이 판매 대상으로 삼는 장기적 에이전트 작업에 대한 엄격한 제약이다. StepFun의 발표는 1M이라고 말하며 출력 상한은 언급하지 않는다. 그 답에 의존하는 파이프라인을 구축하기 전에 여러분의 라우팅이 어느 쪽으로 귀결되는지 아는 것이 좋으며, 그것은 리더보드보다는 벤더의 문서에 물어볼 질문이다.
이번 출시가 바꾸지 않은 또 다른 점은 독립적 재현입니다. 위의 모든 벤치마크 행 중 Artificial Analysis에서 나온 것이 아닌 것은 모두 StepFun 자체의 것으로, StepFun의 하네스에서 실행된 것이며, 어떤 제3자도 에이전틱 결과를 재현하지 못했습니다. 올해 중국 연구소들의 플래그십에서 나타난 패턴은 종합 지수는 유지되는 반면 벤더의 헤드라인 행은 흔들린다는 것입니다. 종합 지수를 계획 수치로 삼으세요.
오늘 호출할 수 있는 것과 그동안 라우팅할 것
Step 5 Preview는 저희 카탈로그에 없으며, OrcaRouter도 이를 라우팅하지 않습니다 — StepFun 쪽에 공개 API와 Studio가 있고, 바로 그곳에서 실행됩니다. 저희가 가진 것은 이 모델이 비교 측정되는 대상 모델 세트이며, 하나의 키로 접근할 수 있습니다: DeepSeek V4.1 Flash는 백만 토큰당 입력 $0.15, 출력 $0.60, GLM-5.3은 Z.ai가 제시한 $1.40와 $4.40에 맞선 $1.26와 $3.96, Claude Opus 5는 $5.00와 $25.00, 그리고 Kimi K3가 그 옆에 있습니다. 이것이 앞으로 3주간의 실질적인 형태입니다: 벤치마크할 수 있는 프리뷰와, 실제로 의존할 수 있는 프로덕션 모델 세트, 제공사 정가를 0% 마크업으로 그대로 전달하면서 하나의 API로 200개 이상의 모델에 접근 — 따라서 StepFun의 가격이 10월 이전에 움직이면, 지불하게 될 금액도 갱신 시점이 아니라 같은 날 함께 움직입니다.
이 기간에는 자동 페일오버가 평소보다 더 가치가 있습니다. 프리뷰의 실패 양상은 성능이 나쁘다는 것이 아니라 용량이 제한된다는 것이기 때문입니다. 발표 당일 API를 열었지만 아직 가중치가 없는 모델은 서빙 플릿을 아직 구축 중인 모델이며, 새벽 2시에 성능이 저하되는 프리뷰 엔드포인트는 여러분의 에이전트 루프까지 함께 망가뜨립니다. 프리뷰를 검증된 모델을 폴백으로 둔 라우터 뒤에 배치하면, 검증되지 않은 플릿에 프로덕션 경로를 걸지 않고도 자체 워크로드에 대한 품질 신호를 얻을 수 있습니다.

중요한 날짜는 10월 15일입니다
위의 모든 내용은 한 가지 특정한 점에서 잠정적입니다: 가중치야말로 모델을 영구적으로 만드는 요소입니다. $1.00 및 $2.70의 비공개 프리뷰는 단일 벤더가 제공하는 가격으로서는 좋은 가격이고, 공개된 라이선스 아래의 BF16 체크포인트는 더 이상 어떤 단일 벤더도 통제할 수 없는 가격입니다. StepFun은 10월 15일에 두 번째 방안을 실행하겠다고 약속했으며, 이미 예약해 둔 저장소 이름은 bfloat16 first를 먼저 내세우고 있습니다.
지금부터 그때까지 지켜볼 것은 범위가 좁고 확인 가능하다. 저장소는 채워지는가 — 그리고 어떤 라이선스로? 설정 파일이 총 600B, 활성 27B를 확인해 주는가? StepFun이 컨텍스트 윈도우와 함께 출력 상한을 공개해 350k/64k 문제를 해결하는가? 프리뷰가 접미사를 떼어낸 뒤에도 가격이 유지되는가? 이 네 가지 답이 Step 5 Preview가 직접 호스팅할 모델이 될지, 빌려 쓸 모델이 될지, 아니면 한 번 벤치마크하고 지나칠 모델이 될지를 결정한다. 저장소에 .gitattributes 외에 더 많은 것이 담기기 전까지는, 이 발표는 이야기의 끝이 아니라 시작이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
