
Step 5 Preview vs GLM-5.3: 단 한 점 차이, 그리고 둘 중 하나만 라이선스 파일을 보유
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
독립 평가 보드에서 Step 5 Preview와 GLM-5.3은 단 1점 차이다. Artificial Analysis Intelligence Index v4.3.2에서 44 대 45로, GLM-5.3은 GLM-5.3 (max)로 채점되고 Step 5 Preview에는 effort 라벨이 전혀 붙지 않는다. 이는 이 시리즈에서 가장 근소한 차이이며, 동시에 이 비교에서 가장 쓸모없는 숫자이기도 하다. 결정적인 숫자는 GLM-5.3에는 오늘 바로 내려받을 수 있는 가중치가 있다는 점이다. MIT가 아닌 커스텀 라이선스로 Z.ai가 공개했으며, 반면 StepFun이 2026년 9월 20일에 발표한 Step 5 Preview의 Hugging Face 저장소에는 단 하나의 .gitattributes 파일만 들어 있고, BF16 체크포인트의 공개 예정일은 10월 15일이라고 명시되어 있다. StepFun의 출시 자료는 이 모델을 오픈소스 결과 톱3라고 설명한다. 아직 오픈소스가 아니다. GLM-5.3은 오픈소스이며, 이 모델을 염두에 두고 계획을 세우기 전에 읽어봐야 할 것은 바로 그 라이선스다.
지수 1포인트가 실제로 사는 것
두 모델 모두 같은 연구소에서 동일한 열 가지 평가를 거쳤는데, 이는 비교를 유난히 깔끔하게 만드는 동시에 유난히 도움이 되지 않게 만든다.
• 지능 지수 — Step 5 Preview 44 vs GLM-5.3 45
• 그게 어디에 위치하느냐 — GLM-5.3은 Step 5 Preview보다 1점 위이고, Step 5 Preview는 Kimi K3와 동률이다
• 파라미터 — Step 5 Preview 총 600B / 활성 27B vs GLM-5.3 총 753B / 활성 40B
• 출력 속도 — Step 5 Preview 99.8 토큰/초 vs GLM-5.3 72.1 토큰/초
• 첫 토큰까지의 시간 — Step 5 Preview 2.96s vs GLM-5.3 2.99s
• 100만 토큰당 가격 — Step 5 Preview 입력 $1.00 / 출력 $2.70 vs GLM-5.3 입력 $1.40 / 출력 $4.40
• 캐시 할인 — Step 5 Preview 95% vs GLM-5.3 81%
• Intelligence Index 작업당 비용 — Step 5 Preview $0.71 vs GLM-5.3 $2.01
• 컨텍스트 — 둘 다 1M 토큰; 우리 카탈로그에는 GLM-5.3이 131.1K 출력 상한으로 기재되어 있으며, StepFun은 아직 출력 상한을 공개하지 않았습니다
• 가중치 — Step 5 Preview 종료, BF16 체크포인트는 10월 15일 예정; GLM-5.3은 커스텀 Z.ai 라이선스로 공개
그 행들을 함께 읽으면 1점 차이는 더 이상 헤드라인이 아니다. Step 5 Preview는 입력 비용이 29% 저렴하고, 출력 비용이 39% 저렴하며, 토큰을 38% 더 빠르게 생성하고, 캐시 할인은 14포인트 더 깊게 적용한다 — 그리고 장황함과 캐시 동작을 하나의 숫자로 합친 인덱스 작업당 비용 수치는 2.8배 더 낮다. 이는 총 600B로 GLM-5.3의 753B에 맞서며, 활성 27B 대 40B로 이를 해낸다. 효율성 축에서는 가까운 대결이 아니다; 능력 면에서는 이 순위표가 보여주는 한 가장 근소한 차이다.
Step 5 Preview가 이기지 못하는 유일한 행은 고치기가 가장 어려운 행입니다: GLM-5.3에는 라이선스 파일이 있고 Step 5 Preview에는 없습니다.
라이선스가 모든 차이를 만들어내며, 그것은 MIT가 아닙니다.
중국 연구소의 오픈 플래그십이 MIT로 배포된다고 가정하기는 쉽다. 실제로 여러 곳이 그렇게 하고 있기 때문이다. Z.ai 자체의 GLM-5.2와 GLM-5.3-Flash도 둘 다 MIT를 채택하고 있다. GLM-5.3 플래그십은 다르다. 일련의 제한 조건을 전제로 상업적 사용을 허용하는 맞춤형 "glm-5.3" 라이선스로 배포된다. 이는 더 작은 형제 모델이 채택한 MIT 조건과는 실질적으로 다른 문서이며, README보다 라이선스를 먼저 읽는 법무팀을 둔 회사에게 이는 형식적인 절차가 아니라 논의가 필요한 사안이다.
Step 5 Preview에는 아직 라이선스가 전혀 없는데, 이는 별개의 문제이며 명백히 더 작은 문제도 아닙니다. 제한적 라이선스는 무엇을 할 수 있는지 알려주고, 그 조건이 수용 가능한지 스스로 판단하게 해 줍니다. 라이선스가 없다는 것은 아무것도 알려주지 않습니다. 상업적 사용 허가도, 재배포 권리도, 파인튜닝 허가도 없고, 10월 15일 체크포인트가 여러분의 제품에 사용 가능한지 평가할 방법도 그것이 나타나기 전까지는 없습니다. StepFun이 확보해 둔 저장소 이름인 stepfun-ai/Step-5-Preview-BF16은 bfloat16 형식을 가리키는데, 이는 서빙하는 아티팩트가 아니라 파인튜닝하고 양자화하는 원본 아티팩트입니다. 이는 릴리스의 형태를 알려줄 뿐, 그 조건을 알려주지는 않습니다.
그러니까 정직한 비교는 읽고 동의하지 않을 수 있는 라이선스와 존재하지 않는 라이선스 사이의 비교입니다. 통제된 환경에서 미세 조정하거나 자체 호스팅하거나 파생 제품을 출시해야 하는 팀에게 이 둘 중 답을 가진 것은 GLM-5.3뿐이며, 그 답은 청신호가 아니라 법률 검토입니다.
효율성 격차는 여전히 유효하게 버티는 부분이다.
효율성 주장은 벤치마크 주장보다 더 회의적으로 볼 필요가 있습니다. 내놓기는 더 쉽고 확인하기는 더 어렵기 때문입니다. 이 두 가지는 대부분보다 더 잘 견디며, 그 메커니즘은 아키텍처에서 드러납니다.
Sparse mixture-of-experts 모델은 토큰이 라우팅되는 전문가에만 연산을 사용하므로, 활성화된 수치가 프로덕션 동작을 좌우하는 반면 총계는 대부분 메모리 문제입니다. GLM-5.3의 40B와 비교해 27B가 활성화된 상황에서 Step 5 Preview는 토큰당 약 3분의 1 적은 작업을 수행하며, 측정치도 이를 따릅니다: 초당 출력 토큰 99.8 대 72.1, 인덱스 작업당 비용 $0.71 대 $2.01. 이는 같은 이야기를 세 가지 방식으로 전한 것이며, 바로 그 점이 단 하나의 듣기 좋은 숫자가 아니라 이것을 신뢰할 수 있게 만듭니다.
캐시 할인은 두 모델이 판매되는 워크로드에서 가장 중요한 행입니다. 에이전트 루프가 매 턴마다 동일한 시스템 프롬프트와 저장소 컨텍스트를 다시 보내는 것은 거의 전적으로 그 할인 안에서 이루어지므로, 95% 대 81%는 긴 세션에 걸쳐 정가에서는 나타나지 않는 방식으로 누적됩니다. 7:2:1 캐시 적중 / 입력 / 출력 비율에서 Step 5 Preview의 혼합 요율은 백만 토큰당 약 $0.51에 이르는 반면, GLM-5.3의 혼합 요율은 상당히 더 높으며 — 루프가 오래 실행될수록 격차는 더 벌어집니다.
아직 검증할 수 없는 것은 그 효율성이 규모가 커져도 유지되는지 여부다. Step 5 Preview의 API는 출시 당일 단일 엔드포인트로 공개되었다. GLM-5.3은 8월 중순부터 여러 독립적인 호출자에 걸쳐 프로덕션 트래픽을 처리해 왔으며, 다섯 주간의 실제 부하를 쌓은 모델은 충분히 많은 사용자 집단에 알려져 공개적으로 드러나는 실패 모드를 갖고 있다. 며칠 된 엔드포인트에는 그런 것이 전혀 없다. 효율성 수치는 더 호의적인 해석이고, 운영 실적 기록은 더 유용한 해석이다.

오늘 각 측에 무엇을 요청할 수 있는지
비교에서 두 대상이 대칭을 이루지 않는 유일한 부분이 바로 여기이며, 이를 "둘 다 사용 가능하다"라고 얼버무리기보다 정확히 짚고 넘어갈 만한 점이다.
GLM-5.3이 OrcaRouter에서 z-ai/glm-5.3 모델 페이지를 통해 공개되었습니다. 입력 $1.26, 출력 $3.96이며, 모델 페이지 자체에 표시된 Z.ai의 $1.40 및 $4.40 요금과 대비됩니다 — 마크업 없이 그대로 전달되므로, 보시는 숫자는 저희가 정한 요금이 아니라 제공업체의 현재 요금입니다. 오픈 가중치는 Hugging Face에 있으므로 동일한 모델에 세 가지 방식으로 접근할 수 있습니다: 저희 엔드포인트, Z.ai 자체 API, 또는 직접 보유한 하드웨어.
Step 5 Preview는 우리 카탈로그에 없으며, 우리가 라우팅하지도 않습니다. 이 모델은 StepFun 자체 API와 Studio에서 실행되며, 가중치가 공개될 때까지는 그곳이 유일한 실행 환경입니다. 우리 쪽에서 그 옆에 놓여 있는 것은 이 모델이 비교 측정되는 대상 모델 세트입니다, 하나의 키로 200개 이상의 모델을: 위 할인 요율이 적용된 GLM-5.3, $0.66와 $1.98의 DeepSeek V4 Pro, 그리고 $5.00와 $25.00의 Claude Opus 5입니다. 바로 이것이 앞으로 4주를 막힘 없이 실행 가능하게 만듭니다 — 같은 키로 프로덕션 모델과 프리뷰를 벤치마킹할 수 있고, 프리뷰의 용량 곡선이 아직 알려지지 않은 동안 프로바이더 전반의 자동 페일오버가 프로덕션 경로를 지켜 주며, 라우팅 DSL이 프로덕션 레그를 두 번째 통합이 아니라 단일 호출로 구성합니다.

리드와 실적 중에서 선택하기
파인튜닝, 자체 호스팅 또는 파생 제품 제작을 하고 있다면, GLM-5.3이 답이며 이건 근소한 차이가 아니다. 한 점 더 높은 점수 때문이 아니라, 둘 중 유일하게 읽어볼 수 있는 라이선스와 다운로드할 수 있는 체크포인트를 갖고 있기 때문이다. 법무 검토 예산을 잡아라. 맞춤형 조건은 MIT가 아니며, 그 차이는 벤치마크가 아니라 조달 감사에서 드러나는 종류의 차이다.
API로 모델을 호출하고 있고 워크로드가 대량의 에이전트형 텍스트라면, Step 5 Preview는 청구서와 시계가 신경 쓰는 모든 면에서 앞서 있습니다: 토큰당 더 저렴하고, 작업당 더 저렴하며, 생성 속도가 더 빠르고, 에이전트 루프를 채우는 반복 접두사 패턴에 대한 캐시 할인이 더 깊습니다. 공개된 출력 상한도 없고 라이선스도 없는 며칠 된 단일 소스 엔드포인트와 비교하면, 이를 기본값으로 삼는 근거는 계약이 아니라 벤치마크에 관한 것입니다.
답을 바꿀 것은 10월 15일 체크포인트다. 허용적 라이선스라면 효율성 우위는 빌리는 것이 아니라 소유할 수 있는 것이 되고, 그 시점에는 1점 부족이 중요하지 않게 된다 — 인덱스 작업당 2.8배 더 저렴하고 생성 속도가 38% 더 빠른 모델은 종합 점수에서 이길 필요가 없다. 제한적 라이선스라면 GLM-5.3만이 그 둘 중 제품을 구축할 수 있는 유일한 모델로 남고, 1점 격차는 어차피 서로 다르게 사용하게 될 두 모델에 관한 사소한 이야기가 된다.
주목할 만한 사양은 하나, 바로 출력 상한이다. 두 벤더 모두 100만 토큰 컨텍스트를 광고한다. 우리 카탈로그에는 GLM-5.3이 최대 출력 131.1K로 등재되어 있고, StepFun의 발표문에는 100만 컨텍스트가 명시되어 있을 뿐 출력 상한은 없으며, 유출 당시 떠돌던 별도의 서드파티 구성에는 컨텍스트 350,000에 최대 출력 64,000이 적혀 있었다. 장기 지평의 에이전트 작업을 위해 판매되는 두 모델에게 그 숫자는 실제로 무엇을 만들 수 있는지를 결정하는데, 지금은 한쪽만 답을 내놓은 상태다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
