
Step 5 Preview vs GPT-6 Astra: 9 인덱스 포인트 차이에 10배의 입력 가격
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
이 두 모델은 17일 간격으로 발표되었고, 가격은 서로 다른 행성을 겨냥하고 있었다. Step 5 Preview는 2026년 9월 20일 발표된 StepFun의 600B 파라미터 희소 전문가 혼합(mixture-of-experts) 모델로, 입력 토큰 100만 개당 $1.00, 출력 토큰 100만 개당 $2.70를 청구한다. GPT-6 Astra는 2026년 9월 3일 출시된 해당 업체의 플래그십으로, 272K 토큰 입력 임계값 미만에서는 같은 단위당 $10.00와 $50.00를, 임계값을 넘으면 $20.00와 $75.00를 청구한다. 이는 독립 Intelligence Index에서 53 대 44로 9점 더 높은 점수를 받은 모델에 대해 입력 가격은 10배, 출력 가격은 약 18배라는 뜻이다. Astra가 더 나은지 자체는 문제가 아니다. 문제는 그 격차가 당신의 워크로드에서 출력 토큰 100만 개당 30달러를 더 지불할 가치가 있느냐이며, 이 글을 읽어 내려가는 동안 그 답은 두 번 바뀐다.
각 모델의 용도
Step 5 Preview는 에이전트 작업, 즉 AI 코딩, 소프트웨어 엔지니어링, 전문 지식 업무, 금융을 위해 구축되고 판매됩니다. 아키텍처는 이를 위해 조정되었습니다 — 총 600B 파라미터에 토큰당 약 27B 활성, 1M 토큰 컨텍스트, 텍스트 및 이미지 입력, 그리고 확장 사고를 통한 추론. StepFun은 여기에 도달하기 위해 Step 4.x 라인 전체를 건너뛰었고, Step-3.7-Flash에서 곧바로 Step 5로 이동했습니다.
GPT-6 Astra는 OpenAI의 범용 플래그십 모델입니다: 100만 토큰 컨텍스트, 최대 128K 출력 토큰, 텍스트·이미지·파일 입력, 텍스트 출력, 2026년 4월 30일 지식 컷오프, 그리고 추론, 코딩 및 에이전트형 워크플로 지원을 갖췄습니다. 정답이어야 하고 토큰 비용이 결정적 제약이 아닐 때 기업이 선택하는 모델입니다.
• 인텔리전스 지수 — Step 5 Preview 44 vs GPT-6 Astra 53
• 파라미터 — Step 5 Preview 총 600B / 활성 27B vs GPT-6 Astra 미공개
• 컨텍스트와 출력 상한 — 둘 다 1M 토큰 컨텍스트, Astra는 1,050,000토큰 창과 128K 출력 상한을 명시하며, StepFun은 출력 상한을 공개하지 않았다
• 입력 방식 — 텍스트 및 이미지 대 텍스트, 이미지 및 파일
• 출력 속도 — Step 5 Preview 99.8 tokens/sec vs GPT-6 Astra 59.3 tokens/sec
• 1M 토큰당 가격 — 입력 $1.00 / 출력 $2.70 vs 272K 입력 미만에서 입력 $10.00 / 출력 $50.00, 272K 입력 초과 시 $20.00 / $75.00로 상승
• 캐시 — Step 5 Preview 95% 할인 vs GPT-6 Astra 백만 개당 $12.50 캐시 쓰기 요율로 90% 읽기 할인
• 인텔리전스 지수 작업당 비용 — Step 5 Preview $0.71 vs GPT-6 Astra $3.26

인보이스, 한 줄씩
Step 5 Preview의 가격은 균일하고 저렴합니다: 입력 $1.00, 출력 $2.70이며, 95% 캐시 할인으로 캐시된 입력은 백만 토큰당 약 $0.05에 가까워집니다. 7:2:1 캐시 적중·입력·출력 혼합 — 이 블로그가 에이전트 트래픽에 사용하는 관례 — 에서 혼합 요율은 백만 토큰당 약 $0.51에 이르고, Intelligence Index 작업당 비용은 $0.71로 200개 중 27위입니다. 주의할 점은 장황함입니다: 이 모델은 해당 Index에서 1억 6천만 개의 출력 토큰을 생성했는데, 중앙값은 9,200만 개였으므로 원시 토큰 수는 티켓 가격이 시사하는 것보다 높습니다.
GPT-6 Astra의 가격은 계층제로 책정되어 있으며, 그 계층이 바로 자세히 읽을 가치가 있는 부분이다. 요청당 입력 토큰 272K 미만에서는 $10.00과 $50.00이고, 그 이상에서는 $20.00과 $75.00이다. 계층은 각 요청 자체의 입력 토큰 수로 선택되는데, 이는 1M 토큰 컨텍스트를 내세운 모델에서는 들리는 것보다 더 중요하다 — 단 한 번의 대규모 컨텍스트 호출이 경계를 넘으면 전체 요청의 요율이 두 배가 된다. 캐시 읽기는 백만당 $1.00로 90% 할인이며, 캐시 쓰기는 백만당 $12.50이다. 동일한 7:2:1 구성에서 혼합 요율은 백만 토큰당 약 $7.70에 이르고, Index 작업당 비용은 $3.26으로 200개 중 71위이다.
Astra는 장황함에서는 반대로 작용하며, 여기서는 간결한 모델이다: Index에서 출력 토큰 60M으로 Step 5 Preview의 160M과 대비되며, 그 지표에서 200개 중 27위다. 더 높은 단가로 더 적은 토큰을 쓰면 격차가 좁아지는데, 원시 배수는 이 격차를 과장한다. 격차를 없애지는 못한다 — 작업당 비용 수치는 이미 장황함, 캐시 동작, 가격을 함께 상쇄해 계산한 값이며, $3.26 대 $0.71은 여전히 4.6배 차이다.
9개의 지수 포인트로 무엇을 살 수 있는가
Astra의 대표 수치는 OpenAI 자체 수치이며 재현되지 않았다: GPQA Diamond에서 96.1, OSWorld 2.0에서 72.6%, FrontierMath Tier 4에서 97.6%, 도구 사용 시 Humanity's Last Exam에서 57.2%, Terminal-Bench 4.0에서 약 57.9%다. ARC-AGI-3 수치는 조심스럽게 다뤄야 할 항목이다. OpenAI는 자사 provider-adapter 하네스에서 99.9%, 표준 하네스에서 62.7%를 보고하며, 하네스 간 37포인트 차이는 적어도 모델만큼이나 하네스 자체에 관한 진술이다.
Step 5 Preview의 공개 수치는 그것이 만들어진 에이전트 작업에서 같은 영역에 속하며, 동일한 단서를 달고 있다: Terminal-Bench 4.0에서 33.3%, ProgramBench에서 80.5, DeepSWE v1.1에서 67.7, StepCodeBench에서 49.0이며, 모두 StepFun에서 나온 것이고 독립적으로 재현된 것은 하나도 없다. 벤더도 다르고 하네스도 다르며 공유된 실행도 없다 — 바로 그렇기 때문에 독립적으로 측정된 9포인트 격차가 이들 중 어느 수치보다 더 유용한 숫자다.
그 격차는 실재하며 결코 작지 않습니다. 200개 모델을 아우르는 리더보드에서 53점과 44점은 각각 3위와 24위에 위치하며, 그 차이는 같은 과제에서의 점수 차이가 아니라 서로 다른 종류의 과제로 나타납니다. Astra가 공개적으로 우위를 점한 분야는 장기적 추론과 컴퓨터 사용에 집중되어 있는데, 바로 이 지점에서 리더보드 최상위권이 격차를 벌립니다. 여러분의 워크로드가 그 영역에 속한다면, 그 9점은 청구서보다 더 큰 가치를 지닙니다.
Astra의 점수에 관한 한 가지 주의점이 있습니다. Artificial Analysis는 Intelligence Index를 개정하며, 같은 모델의 수치도 몇 주 간격으로 수집된 스냅샷에 따라 달라집니다 — 52.8, 53, 54.7이 모두 같은 달 안에 이 모델에 관해 발표된 자료에 등장합니다. 현재 모델 페이지의 53이 사용해야 할 숫자이며, 더 오래된 Astra 스냅샷을 현재 Step 5 Preview 수치와 나란히 놓는 비교는 서로 다른 두 개의 자로 측정하는 셈입니다.

속도와 지연 시간은 서로 다른 두 가지 문제입니다
생성 속도에 관한 한 독립적인 평가 결과는 명확하다: Step 5 Preview는 초당 출력 토큰 99.8개로 GPT-6 Astra의 59.3개를 앞선다. GPT-6 Astra는 측정된 모델들의 평균인 초당 70토큰보다도 느리다. 대화형 코딩 루프에서 이는 제안과 멈춤 사이의 차이이며, 캐시 할인이 그렇듯 세션 전반에 걸쳐 누적된다.
지연 시간은 더 복잡한 이야기이며, 단일 숫자만으로는 이를 잘못 이끌 수 있습니다. Astra는 추론을 내보내기 전에 라우팅하므로, 첫 토큰까지의 시간과 사용 가능한 답변까지의 시간은 같은 측정이 아니며, 추론이 포함되는지 여부에 따라 공개된 수치가 크게 달라집니다. 지난 7일간 우리 자체 트래픽에서 GPT-6 Astra의 첫 토큰까지의 중앙값 시간은 6.72초이고 95번째 백분위수는 10.00초입니다. 이는 호출자가 우리 엔드포인트를 통해 실제로 경험하는 숫자입니다. Artificial Analysis는 자체 하네스에서 Step 5 Preview의 첫 토큰까지의 시간을 2.96초로 제시하는데, 이 두 수치는 같은 방식으로 측정된 것이 아니므로 서로 빼서 비교해서는 안 됩니다.
캐시 비대칭이 실제로 귀결되는 지점
두 모델 모두 반복되는 프리픽스에 큰 할인을 적용하며, 둘 다 이를 기록하는 데에도 비용을 부과합니다. 그리고 읽기 측면에서 두 모델 간 차이는 20배입니다. Step 5 Preview의 95% 캐시 할인으로 캐시된 입력은 백만 토큰당 약 $0.05에 가까워집니다. GPT-6 Astra는 캐시를 백만 토큰당 $1.00에 읽으며 — 10배 더 높은 기본 요율에서 90% 할인 — 백만 토큰당 $12.50에 기록합니다.
매 턴마다 동일한 시스템 프롬프트와 저장소 컨텍스트를 다시 보내는 에이전트 루프에서는 읽기 요금이 누적되는 부분이며, 더 저렴한 모델에 적용되는 더 큰 폭의 할인이 더 비싼 모델에 적용되는 더 작은 폭의 할인보다 더 가치가 있다. Astra의 블렌드는 동일한 7:2:1 조합에서 Step 5 Preview의 $0.51과 대비해 여전히 백만 토큰당 $7.70 근처에 머문다 — 긴 세션이 좁히지 못하고 오히려 벌리는 15배 차이다.
하나의 키로 둘 다 실행
GPT-6 Astra가 OrcaRouter에서 라이브로 제공됩니다 아래에서openai/gpt-6-astra OpenAI의 정가 기준으로 — 272K 임계값 이하에서는 백만 토큰당 $10.00 및 $50.00, 이를 초과하면 $20.00 및 $75.00 — 마크업 없이 그대로 전달되므로, 벤더의 가격 변경이 다음 청구 주기가 아니라 같은 날 우리 쪽에도 반영됩니다. 해당 엔드포인트에 대한 자체 7일 텔레메트리에 따르면, 위에 제시된 첫 토큰 도달 시간 중앙값 6.72초와 95백분위수 10.00초가 나타났으며, 지난 한 주 동안 이 엔드포인트를 통과한 트래픽은 277.9M 토큰입니다.
Step 5 Preview는 우리 카탈로그에 없고, 우리가 라우팅하지도 않습니다. 이 모델은 StepFun 자체 API와 Studio에서 실행되며, 10월 15일 체크포인트가 도착하기 전까지는 그곳이 유일한 실행 환경입니다. 이런 비대칭은 이 비교의 결함이 아니라, 바로 그 비교 자체입니다. 이 맞대결에서 저렴한 쪽은 호출하려면 다른 곳으로 가야 하는 쪽이고, 오늘 바로 프로덕션에 투입할 수 있는 쪽은 200개가 넘는 모델을 하나의 API로 제공합니다. 위 요금의 GPT-6 Astra, $1.26와 $3.96의 GLM-5.3, DeepSeek V4 Pro, Claude Opus 5 등이 모두 포함되며, 제공업체 전반에 걸친 자동 장애 조치가 특정 제공업체의 용량이 변동할 때도 경로를 안정적으로 유지하고, 라우팅 DSL을 통해 작업을 저렴하게 시작해 필요할 때만 확장할 수 있습니다. 그 확장 규칙이 10배 가격 차이에 대한 진짜 해답입니다. 대부분의 워크로드는 최상위 모델이 필요하지 않으며, 라우팅 계층은 필요하지 않은 부분에 비용을 지불하지 않게 해주는 방법입니다.

누가 어떤 것을 골라야 하나요
워크로드가 어려운 작업을 정확히 해내야 하는 장기 실행 에이전트라면 — 컴퓨터 사용, 다단계 리서치, 잘못된 답변이 토큰보다 더 많은 비용을 초래하는 작업 — GPT-6 Astra의 9포인트 우위는 결정에서 가장 저렴한 부분이고, 청구서는 그 역량에 드는 비용입니다. 기본값이 아니라 에스컬레이션 대상으로 실행하고, 272K 임계값을 조심하세요: 초과 크기의 요청 하나가 그 안의 모든 항목 요율을 두 배로 만듭니다.
워크로드가 대용량 에이전트형 텍스트 — 코드 생성, 리팩터링, 구조화 추출, 코딩 어시스턴트의 내부 루프 — 라면, Step 5 Preview는 청구서와 시계가 신경 쓰는 모든 면에서 앞서 있으며, 리더보드 최상단에 있지 않은 작업 분포와 맞닥뜨리면 지수상 9포인트 우위는 유지되기 어렵습니다. 문제는 성능이 아닙니다. 이 모델은 독점 모델로, 공개된 라이선스도, 상업적 사용 허가도, 10월 15일까지 체크포인트도 없습니다. 호출할 수는 있지만, 소유하거나 파인튜닝하거나 그 파생물을 배포할 수는 없습니다.
답이 명확하지 않다면, 패턴은 선택이 아니라 티어 분할입니다. 일반 트래픽은 미드티어 모델로 보내고, 보드 최상단이 필요한 요청에는 Astra를 남겨 두세요 — 그 규칙의 양쪽 끝은 우리 쪽의 하나의 키 뒤에 있으므로, 이 분할에는 두 번째 계약이 아니라 라우팅 규칙 하나만 추가하면 됩니다. 미드티어 모델이 제대로 완수할 수 있는 작업에 플래그십 요금을 지불하는 것이 바로 이 비교가 실제로 말하는 실수입니다.
