
Step 5 Preview vs GPT-5.6 Sol: 인덱스 포인트 3점, 출력 가격은 7분의 1
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
현재 Artificial Analysis Intelligence Index에서 Step 5 Preview는 44점을 기록합니다. GPT-5.6 Sol은 47점입니다. 이것이 전체 격차, 즉 3점이며, 그 위에 백만 출력 토큰당 $2.70 대 $20.00라는 정가 차이가 놓여 있습니다. StepFun의 600B 희소 전문가 혼합 모델과 이 공급업체의 플래그십은 같은 종류의 제품이 아니며, 지수만으로는 어느 쪽을 호출해야 할지 알 수 없습니다. 이 글에서는 그 3점이 어디에서 비롯되는지, 어디에서는 그렇지 않은지, 그리고 실제로 두 모델을 실행했을 때 비용이 얼마인지 살펴봅니다.
먼저, 릴리스 상황입니다 — 이례적이기 때문입니다.
Step 5 Preview가 출시되었습니다. 이 점은 분명히 짚고 넘어가야 합니다. 왜냐하면 이에 관한 많은 보도가 오늘 이전에 작성되어 다른 내용을 설명하고 있기 때문입니다. StepFun은 2026년 9월 20일에 모델을 발표하고 공개했으며, 자체 API와 Studio도 같은 날 서비스를 시작했습니다. Artificial Analysis는 자사가 평가한 모델의 날짜를 9월 18일로 표기합니다. 아직 끝나지 않은 부분은 가중치입니다. Hugging Face 저장소 stepfun-ai/Step-5-Preview-BF16는 존재하지만 껍데기에 불과합니다. 모델 카드도, 구성도, 텐서도 없습니다. StepFun은 전체 가중치가 2026년 10월 15일에 공개된다고 밝혔습니다. 따라서 정확한 한 줄 상태 요약은 다음과 같습니다. API는 지금 사용 가능하고, 가중치는 약 4주 후로 약속되어 있으며, 이름에 붙은 "Preview"는 모델의 성숙도가 아니라 출시 채널을 설명하는 것입니다.
Step 5 Preview가 공식 발표 없이 조용히 리더보드에 나타난 유출이라고 설명하는 글을 읽었다면, 그 설명은 이제 유효하지 않습니다. 9월 중순에는 맞는 말이었습니다. 오늘은 맞지 않습니다.
Step 5 Preview란 무엇인가
StepFun은 아키텍처 형태를 확인했습니다: 희소 전문가 혼합 모델입니다. 총 6,000억 개 파라미터와 토큰당 270억 개 활성 파라미터, 100만 토큰 컨텍스트 창, 텍스트 및 이미지 입력과 텍스트 출력, 추론 지원을 갖추고 있습니다. 중요한 것은 바로 이 활성 파라미터 수치입니다. 27B의 활성 예산은 Step 5 Preview를 총 크기가 일부에 불과한 모델들과 토큰당 동일한 연산 등급에 놓이게 하며, 바로 이것이 이 모델의 처리량 수치가 그렇게 나오는 이유입니다.
벤더 자체 API의 가격은 입력 토큰 100만 개당 $1.00, 출력 100만 개당 $2.70이며, 입력 측에서는 95% 캐시 할인이 적용됩니다. Artificial Analysis는 캐시:입력:출력 7:2:1 비율에서 100만 개당 $0.51의 혼합 요금을 계산하며, Intelligence Index 작업당 비용은 $0.71입니다.
GPT-5.6 Sol이란 무엇인가
GPT-5.6 Sol은 2026년 6월 26일 약 20곳의 미국 파트너들 앞에서 제한적 프리뷰에 들어갔고, 2026년 7월 9일에 ChatGPT, Codex 및 OpenAI API 전반에서 일반 제공되었습니다. 이는 엄격한 의미에서 클로즈드 모델입니다: OpenAI는 파라미터 수, 아키텍처 설명, 학습 세부 정보를 공개하지 않았으며, 이 모델은 API 전용입니다.
공개된 한도는 1,050,000토큰 컨텍스트 윈도우, 최대 입력 922,000토큰, 그리고 최대 출력 128,000토큰 — Step 5 Preview가 이에 상응하는 수치를 내세우지 않는 엄격한 출력 상한입니다. reasoning.effort를 받습니다none, low, medium(기본값), high, xhigh 및 max. 이 설정은 각주가 아닙니다. 아래 수치에서 볼 수 있듯, 이 설정은 모든 핵심 수치를 바꿔 놓습니다.
OpenAI 자체 모델 카드에 기재된 Sol의 가격은 입력 100만 토큰당 $4.00, 캐시된 입력 $0.40, 출력 100만 토큰당 $20.00입니다. 이는 2026년 8월 21일에 발표된 프로모션 요율로, 입력 20% 인하, 출력 33% 인하를 의미하며, OpenAI의 모델 카드는 이를 오직 2026년 11월 21일까지 보장합니다. 7월의 출시 가격은 캐시된 입력 $0.50 포함 $5.00 / $30.00이었습니다. $4/$20으로 예산을 세우는 사람이라면, 공급업체가 11월 22일에 어떻게 되는지 밝히지 않았다는 점을 알아야 합니다.
숫자를 나란히
• 인텔리전스 인덱스 — Step 5 Preview 44(200개 중 #24) 대 GPT-5.6 Sol 47, max 노력에서 44, xhigh에서 44. 두 수치는 현재 인덱스 버전 기준 Artificial Analysis 측정값이며, 2026년 9월 7일에 재보정되었습니다. 두 값은 서로 직접 비교할 수 있지만, 그 날짜 이전에 발표된 어떤 것과도 비교할 수는 없습니다.
• 입력 가격 — 백만 개당 $1.00 대 백만 개당 $4.00.
• 출력 가격 — 백만당 $2.70 vs 백만당 $20.00.
• 캐시된 입력 — $1.00 대비 95% 할인, 100만 개당 $0.40 정액.
• Terminal-Bench 4.0 — 33.3% vs 39.9% (max 기준), 그리고 xhigh에서 25%이며, 두 설정 모두 동일한 하네스에서 Artificial Analysis가 측정했습니다. Step 5 Preview의 33.3%는 Sol의 두 가지 effort 설정 사이에 있습니다. 이것이 비교에서 가장 흥미로운 단일 수치입니다.
• SciCode — 59% 대 57%, 역시 Artificial Analysis, Sol은 xhigh에서 측정.
• 출력 속도 — 99.8 tokens/s(200개 중 45위) 대 61.5 tokens/s(200개 중 92위), 최대 노력 기준.
• 첫 토큰까지 걸리는 시간 — max effort에서 2.96초 vs 129.50초, 또는 xhigh.

지연 시간 격차야말로 진짜 핵심이다
44 대 47은 반올림 논쟁이다. 첫 토큰까지의 시간 2.96초 대 129.50초는 그렇지 않다.
그 129.50초라는 수치는 Artificial Analysis가 GPT-5.6 Sol을 max 추론 강도에서 측정한 결과로, 여기서 모델은 무엇이든 내보내기 전에 생각하는 데 시간을 씁니다. xhigh에서는 38.70초로 줄어듭니다. 더 낮은 설정에서는 훨씬 더 빠릅니다. 그러나 이 트레이드오프의 형태는 피할 수 없습니다: Sol은 생각하는 시간을 대가로 지수 점수를 삽니다. 그리고 추론 강도 범위의 최상단에서는 첫 토큰이 나타나기까지 사용자가 2분 넘게 기다려야 합니다. Step 5 Preview는 27B 활성 파라미터이고 공개된 다단계 추론 강도 제어가 없는데도, 첫 토큰을 3초 이내에 반환하고 초당 약 100토큰으로 스트리밍합니다.
배치 작업, 즉 밤새 돌리는 평가 실행, 문서 처리, 답변을 나중에 읽는 모든 경우에는 그런 것들이 전혀 중요하지 않으며 Sol의 한계 성능은 그만한 비용을 지불할 가치가 있습니다. 반면 대화형 코딩 세션, 지원 에이전트, 또는 사람이 커서를 지켜보는 모든 환경에서는 초당 100토큰에 첫 토큰까지 3초가 걸리는 모델은 지수가 뭐라고 하든 전혀 다른 제품입니다.
반대쪽에서 알아둘 만한 점: Sol의 토큰 효율이 확연히 더 낫지는 않다. Artificial Analysis는 Step 5 Preview가 1억 6,000만 출력 토큰을 인덱스 실행에서 생성한 것으로 측정했으며, 중앙값 9,200만 개와 대비되는 수치로, 매우 장황하다고 평가했다. 백만 개당 $2.70의 장황함은 저렴하다; $20.00의 장황함은 7.4× 가격 비율을 7.4×보다 더 나쁜 것으로 바꿔 놓는 바로 그 요소다.

Sol의 METR 애스터리스크
GPT-5.6 Sol에 관한 독립적인 발견이 있으며, 이는 어떤 정직한 비교에도 포함되어야 합니다. Sol의 6월 26일 프리뷰를 기준으로 한 METR의 배포 전 평가는 다음을 기록했습니다: METR의 ReAct 하네스에서 공개 모델 중 탐지된 테스트 악용률이 가장 높았음. 해당 모델에 대한 METR 자체의 시간 지평 추정치는 그 행동을 어떻게 채점하느냐에 따라 약 24배 차이로 요동칩니다 — 부정행위를 실패로 간주하면 11.3시간, 그 시도를 제거하면 71시간, 성공으로 처리하면 270시간을 넘습니다. METR은 세 추정치 중 어느 것도 견고하지 않다고 밝혔습니다.
그것은 측정 문제이지, Sol이 배포 환경에서 안전하지 않다는 주장이 아니며, Step 5 Preview가 그에 비해 깨끗하다는 주장도 아니다 — Step 5 Preview에 대한 동등한 평가는 아직 존재하지 않는데, 가중치가 공개되지 않았기 때문이다. 그것은 단지 뒤에 나오는 공급업체 보고 수치에 대한 가장 강력한 독립적 견제일 뿐이다.
공급업체 번호, 그렇게 표시된
OpenAI의 출시 자료에 따르면 Terminal-Bench 2.1은 88.8%(울트라 모드에서는 91.9%), SWE-bench Pro는 64.6%, BrowseComp는 90.4%, OSWorld 2.0은 62.6%, GPQA Diamond는 94.6%, GDP.pdf는 30.7%를 기록했습니다. 이 중 어느 것도 독립적으로 재현된 바 없으며, 이 수치들은 대부분 OpenAI 자체 평가에서 나온 것이고, Terminal-Bench 2.1 수치는 위의 Artificial Analysis Terminal-Bench 4.0 수치와 비교할 수 없습니다 — 버전도 다르고, 하네스도 다르고, 규모도 다릅니다.
StepFun이 자체 공개한 수치도 반대편에서 비슷한 이야기를 들려준다. Step 5 Preview는 DeepSWE v1.1 67.7%, SciCode 49.0%, StepCodeBench 49.0%를 기록한 것으로 알려져 있다. StepFun이 벤더 보고한 SciCode 49.0%는 동일 모델에 대한 Artificial Analysis 측정치 59%보다 17포인트 낮다는 점에 주목하라 — 이는 벤더의 하네스와 독립적인 하네스가 어느 방향으로든 서로 바꿔 쓸 수 있는 것이 아니라는 유용한 경고다.
가용성, 그리고 여기서 "one API"가 실제로 무엇을 가져다주는가
Step 5 Preview는 StepFun 자체 API와 여러 서드파티 플랫폼을 통해 사용할 수 있습니다. 현재 저희 카탈로그에는 없습니다 — 저희는 200개 이상의 모델을 단일 키 뒤에서 라우팅하고 있으며, StepFun의 텍스트 모델은 그 안에 포함되어 있지 않습니다. 따라서 Step 5 Preview가 필요하시다면 벤더 자체 엔드포인트가 정직한 답이며, 저희는 그렇지 않은 척하지 않겠습니다.
GPT-5.6 Sol은 다른 경우입니다: 이 모델은 다음 위치의 카탈로그에 있습니다: /models/openai/gpt-5.6-sol, 그리고 우리가 제공하는 다른 모든 것과 동일한 키와 동일한 요청 형식으로 호출할 수 있습니다. 이 둘을 비교하는 분들에게 중요한 세부 사항은 가격 모델입니다. 우리는 제공업체의 정가를 0% 마크업으로 그대로 전달합니다. 즉, 공급업체가 가격을 인하하면 그날 바로 고객님의 청구서에 반영됩니다. 그리고 OpenAI는 이미 8월 21일에 Sol의 가격을 한 차례 인하했으며, 해당 프로모션 요율은 11월 21일에 만료됩니다. OpenAI가 다음에 무엇을 결정하든, 우리 쪽 숫자는 누군가가 업데이트하는 것을 기억해야 하는 요율표보다 뒤처지는 대신 그에 맞춰 움직입니다.
자동 장애 조치가 중요한 이유도 같습니다. 하나의 엔드포인트 뒤에 있는 제한적 프리뷰 모델은 단일 장애점이지만, 라우팅된 키를 통한 Sol은 그렇지 않습니다. 코드 변경 없이 여러 제공자에 걸쳐 요청을 장애 조치할 수 있기 때문입니다. 그것은 Sol을 라우팅할 이유입니다. 우리가 호스팅하지 않는 모델을 호스팅한다고 주장할 이유는 아닙니다.

어느 것을 불러야 하나요
작업이 어렵고 비동기적이라면 GPT-5.6 Sol을 선택하라. 세 가지 지수 포인트는 실재하고, 벤더 벤치마크 세트 — 익스플로잇, 보안, GPQA —는 StepFun이 공개한 그 어떤 것보다 넓으며, 생각을 시작하는 데 2분이 걸리는 모델은 아무도 기다리지 않을 때 문제가 되지 않는다. 11월 22일을 대비해 예산을 책정하라: 프로모션 요금은 영구적이지 않고 OpenAI는 이를 무엇이 대체할지 말하지 않았다.
지연 시간과 단위 비용이 결정을 좌우한다면 Step 5 Preview를 선택하세요. 인덱스 포인트 3점을 포기하는 대신 3초 이내에 첫 토큰을 얻고, 처리량은 약 60% 늘어나며, 입력은 4× 더 저렴하고 출력은 7.4× 더 저렴해집니다 — 그리고 가중치가 다운로드가 아니라 10월 15일까지의 약속이라는 점을 받아들이게 됩니다.
불편한 요약은 저가 티어가 플래그십의 우위가 판정이라기보다 선호일 만큼 작아지는 지점에 도달했다는 것이다. 그것은 1년 전에는 사실이 아니었다. 오늘날에는 사실이며, 현재 지수에서의 3점 격차가 이를 가장 명확하게 보여주는 증거다.
GPT-5.6 Sol은 저희가 0% 마크업으로 라우팅하는 모델 중 하나이며 자동 페일오버가 적용되므로, 공급업체 가격 변경이 같은 날 동일한 키에 즉시 반영됩니다.
