생성된 타이틀 카드의 제목은 'Step 5 Preview vs GLM-5.3 — 1점 차이'이며, 두 개의 열과 그 사이에 '1점' 배지가 있습니다: Step 5 Preview는 AA Index 44, 총 600B / 활성 27B, 가격 $1.00 / $2.70, 출력 속도 초당 99.8토큰이고 가중치는 10월 15일 공개 예정; GLM-5.3은 AA Index 45, 총 753B / 활성 40B, 가격 $1.40 / $4.40, 출력 속도 초당 72.1토큰이며 가중치는 사용자 지정 라이선스로 공개되었습니다. 바닥글에는 '둘 모두 Artificial Analysis Intelligence Index v4.3.2 기준이며, GLM-5.3은 GLM-5.3 (max)으로 채점됩니다.'라고 적혀 있습니다.
Guides & Insights

Step 5 Preview vs GLM-5.3: 단 한 점 차이, 그리고 둘 중 하나만 라이선스 파일을 보유

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

독립 평가 보드에서 Step 5 PreviewGLM-5.3은 단 1점 차이다. Artificial Analysis Intelligence Index v4.3.2에서 44 대 45로, GLM-5.3은 GLM-5.3 (max)로 채점되고 Step 5 Preview에는 effort 라벨이 전혀 붙지 않는다. 이는 이 시리즈에서 가장 근소한 차이이며, 동시에 이 비교에서 가장 쓸모없는 숫자이기도 하다. 결정적인 숫자는 GLM-5.3에는 오늘 바로 내려받을 수 있는 가중치가 있다는 점이다. MIT가 아닌 커스텀 라이선스로 Z.ai가 공개했으며, 반면 StepFun이 2026년 9월 20일에 발표한 Step 5 Preview의 Hugging Face 저장소에는 단 하나의 .gitattributes 파일만 들어 있고, BF16 체크포인트의 공개 예정일은 10월 15일이라고 명시되어 있다. StepFun의 출시 자료는 이 모델을 오픈소스 결과 톱3라고 설명한다. 아직 오픈소스가 아니다. GLM-5.3은 오픈소스이며, 이 모델을 염두에 두고 계획을 세우기 전에 읽어봐야 할 것은 바로 그 라이선스다.

지수 1포인트가 실제로 사는 것

두 모델 모두 같은 연구소에서 동일한 열 가지 평가를 거쳤는데, 이는 비교를 유난히 깔끔하게 만드는 동시에 유난히 도움이 되지 않게 만든다.

• 지능 지수 — Step 5 Preview 44 vs GLM-5.3 45

• 그게 어디에 위치하느냐 — GLM-5.3은 Step 5 Preview보다 1점 위이고, Step 5 Preview는 Kimi K3와 동률이다

• 파라미터 — Step 5 Preview 총 600B / 활성 27B vs GLM-5.3 총 753B / 활성 40B

• 출력 속도 — Step 5 Preview 99.8 토큰/초 vs GLM-5.3 72.1 토큰/초

• 첫 토큰까지의 시간 — Step 5 Preview 2.96s vs GLM-5.3 2.99s

• 100만 토큰당 가격 — Step 5 Preview 입력 $1.00 / 출력 $2.70 vs GLM-5.3 입력 $1.40 / 출력 $4.40

• 캐시 할인 — Step 5 Preview 95% vs GLM-5.3 81%

• Intelligence Index 작업당 비용 — Step 5 Preview $0.71 vs GLM-5.3 $2.01

• 컨텍스트 — 둘 다 1M 토큰; 우리 카탈로그에는 GLM-5.3이 131.1K 출력 상한으로 기재되어 있으며, StepFun은 아직 출력 상한을 공개하지 않았습니다

• 가중치 — Step 5 Preview 종료, BF16 체크포인트는 10월 15일 예정; GLM-5.3은 커스텀 Z.ai 라이선스로 공개

그 행들을 함께 읽으면 1점 차이는 더 이상 헤드라인이 아니다. Step 5 Preview는 입력 비용이 29% 저렴하고, 출력 비용이 39% 저렴하며, 토큰을 38% 더 빠르게 생성하고, 캐시 할인은 14포인트 더 깊게 적용한다 — 그리고 장황함과 캐시 동작을 하나의 숫자로 합친 인덱스 작업당 비용 수치는 2.8배 더 낮다. 이는 총 600B로 GLM-5.3의 753B에 맞서며, 활성 27B 대 40B로 이를 해낸다. 효율성 축에서는 가까운 대결이 아니다; 능력 면에서는 이 순위표가 보여주는 한 가장 근소한 차이다.

Step 5 Preview가 이기지 못하는 유일한 행은 고치기가 가장 어려운 행입니다: GLM-5.3에는 라이선스 파일이 있고 Step 5 Preview에는 없습니다.

라이선스가 모든 차이를 만들어내며, 그것은 MIT가 아닙니다.

중국 연구소의 오픈 플래그십이 MIT로 배포된다고 가정하기는 쉽다. 실제로 여러 곳이 그렇게 하고 있기 때문이다. Z.ai 자체의 GLM-5.2GLM-5.3-Flash도 둘 다 MIT를 채택하고 있다. GLM-5.3 플래그십은 다르다. 일련의 제한 조건을 전제로 상업적 사용을 허용하는 맞춤형 "glm-5.3" 라이선스로 배포된다. 이는 더 작은 형제 모델이 채택한 MIT 조건과는 실질적으로 다른 문서이며, README보다 라이선스를 먼저 읽는 법무팀을 둔 회사에게 이는 형식적인 절차가 아니라 논의가 필요한 사안이다.

Step 5 Preview에는 아직 라이선스가 전혀 없는데, 이는 별개의 문제이며 명백히 더 작은 문제도 아닙니다. 제한적 라이선스는 무엇을 할 수 있는지 알려주고, 그 조건이 수용 가능한지 스스로 판단하게 해 줍니다. 라이선스가 없다는 것은 아무것도 알려주지 않습니다. 상업적 사용 허가도, 재배포 권리도, 파인튜닝 허가도 없고, 10월 15일 체크포인트가 여러분의 제품에 사용 가능한지 평가할 방법도 그것이 나타나기 전까지는 없습니다. StepFun이 확보해 둔 저장소 이름인 stepfun-ai/Step-5-Preview-BF16은 bfloat16 형식을 가리키는데, 이는 서빙하는 아티팩트가 아니라 파인튜닝하고 양자화하는 원본 아티팩트입니다. 이는 릴리스의 형태를 알려줄 뿐, 그 조건을 알려주지는 않습니다.

그러니까 정직한 비교는 읽고 동의하지 않을 수 있는 라이선스와 존재하지 않는 라이선스 사이의 비교입니다. 통제된 환경에서 미세 조정하거나 자체 호스팅하거나 파생 제품을 출시해야 하는 팀에게 이 둘 중 답을 가진 것은 GLM-5.3뿐이며, 그 답은 청신호가 아니라 법률 검토입니다.

효율성 격차는 여전히 유효하게 버티는 부분이다.

효율성 주장은 벤치마크 주장보다 더 회의적으로 볼 필요가 있습니다. 내놓기는 더 쉽고 확인하기는 더 어렵기 때문입니다. 이 두 가지는 대부분보다 더 잘 견디며, 그 메커니즘은 아키텍처에서 드러납니다.

Sparse mixture-of-experts 모델은 토큰이 라우팅되는 전문가에만 연산을 사용하므로, 활성화된 수치가 프로덕션 동작을 좌우하는 반면 총계는 대부분 메모리 문제입니다. GLM-5.3의 40B와 비교해 27B가 활성화된 상황에서 Step 5 Preview는 토큰당 약 3분의 1 적은 작업을 수행하며, 측정치도 이를 따릅니다: 초당 출력 토큰 99.8 대 72.1, 인덱스 작업당 비용 $0.71 대 $2.01. 이는 같은 이야기를 세 가지 방식으로 전한 것이며, 바로 그 점이 단 하나의 듣기 좋은 숫자가 아니라 이것을 신뢰할 수 있게 만듭니다.

캐시 할인은 두 모델이 판매되는 워크로드에서 가장 중요한 행입니다. 에이전트 루프가 매 턴마다 동일한 시스템 프롬프트와 저장소 컨텍스트를 다시 보내는 것은 거의 전적으로 그 할인 안에서 이루어지므로, 95% 대 81%는 긴 세션에 걸쳐 정가에서는 나타나지 않는 방식으로 누적됩니다. 7:2:1 캐시 적중 / 입력 / 출력 비율에서 Step 5 Preview의 혼합 요율은 백만 토큰당 약 $0.51에 이르는 반면, GLM-5.3의 혼합 요율은 상당히 더 높으며 — 루프가 오래 실행될수록 격차는 더 벌어집니다.

아직 검증할 수 없는 것은 그 효율성이 규모가 커져도 유지되는지 여부다. Step 5 Preview의 API는 출시 당일 단일 엔드포인트로 공개되었다. GLM-5.3은 8월 중순부터 여러 독립적인 호출자에 걸쳐 프로덕션 트래픽을 처리해 왔으며, 다섯 주간의 실제 부하를 쌓은 모델은 충분히 많은 사용자 집단에 알려져 공개적으로 드러나는 실패 모드를 갖고 있다. 며칠 된 엔드포인트에는 그런 것이 전혀 없다. 효율성 수치는 더 호의적인 해석이고, 운영 실적 기록은 더 유용한 해석이다.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

오늘 각 측에 무엇을 요청할 수 있는지

비교에서 두 대상이 대칭을 이루지 않는 유일한 부분이 바로 여기이며, 이를 "둘 다 사용 가능하다"라고 얼버무리기보다 정확히 짚고 넘어갈 만한 점이다.

GLM-5.3이 OrcaRouter에서 z-ai/glm-5.3 모델 페이지를 통해 공개되었습니다. 입력 $1.26, 출력 $3.96이며, 모델 페이지 자체에 표시된 Z.ai의 $1.40 및 $4.40 요금과 대비됩니다 — 마크업 없이 그대로 전달되므로, 보시는 숫자는 저희가 정한 요금이 아니라 제공업체의 현재 요금입니다. 오픈 가중치는 Hugging Face에 있으므로 동일한 모델에 세 가지 방식으로 접근할 수 있습니다: 저희 엔드포인트, Z.ai 자체 API, 또는 직접 보유한 하드웨어.

Step 5 Preview는 우리 카탈로그에 없으며, 우리가 라우팅하지도 않습니다. 이 모델은 StepFun 자체 API와 Studio에서 실행되며, 가중치가 공개될 때까지는 그곳이 유일한 실행 환경입니다. 우리 쪽에서 그 옆에 놓여 있는 것은 이 모델이 비교 측정되는 대상 모델 세트입니다, 하나의 키로 200개 이상의 모델을: 위 할인 요율이 적용된 GLM-5.3, $0.66와 $1.98의 DeepSeek V4 Pro, 그리고 $5.00와 $25.00의 Claude Opus 5입니다. 바로 이것이 앞으로 4주를 막힘 없이 실행 가능하게 만듭니다 — 같은 키로 프로덕션 모델과 프리뷰를 벤치마킹할 수 있고, 프리뷰의 용량 곡선이 아직 알려지지 않은 동안 프로바이더 전반의 자동 페일오버가 프로덕션 경로를 지켜 주며, 라우팅 DSL이 프로덕션 레그를 두 번째 통합이 아니라 단일 호출로 구성합니다.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs GLM-5.3 — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, cost per index task $0.71, and weights due October 15. The right column gives GLM-5.3 the rows AA Index 45, parameters 753B total / 40B active, price $1.40 / $4.40 list, $1.26 / $3.96 on OrcaRouter, cache discount 81%, cost per index task $2.01, and weights published under a custom licence. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2; GLM-5.3 is scored as GLM-5.3 (max).'

리드와 실적 중에서 선택하기

파인튜닝, 자체 호스팅 또는 파생 제품 제작을 하고 있다면, GLM-5.3이 답이며 이건 근소한 차이가 아니다. 한 점 더 높은 점수 때문이 아니라, 둘 중 유일하게 읽어볼 수 있는 라이선스와 다운로드할 수 있는 체크포인트를 갖고 있기 때문이다. 법무 검토 예산을 잡아라. 맞춤형 조건은 MIT가 아니며, 그 차이는 벤치마크가 아니라 조달 감사에서 드러나는 종류의 차이다.

API로 모델을 호출하고 있고 워크로드가 대량의 에이전트형 텍스트라면, Step 5 Preview는 청구서와 시계가 신경 쓰는 모든 면에서 앞서 있습니다: 토큰당 더 저렴하고, 작업당 더 저렴하며, 생성 속도가 더 빠르고, 에이전트 루프를 채우는 반복 접두사 패턴에 대한 캐시 할인이 더 깊습니다. 공개된 출력 상한도 없고 라이선스도 없는 며칠 된 단일 소스 엔드포인트와 비교하면, 이를 기본값으로 삼는 근거는 계약이 아니라 벤치마크에 관한 것입니다.

답을 바꿀 것은 10월 15일 체크포인트다. 허용적 라이선스라면 효율성 우위는 빌리는 것이 아니라 소유할 수 있는 것이 되고, 그 시점에는 1점 부족이 중요하지 않게 된다 — 인덱스 작업당 2.8배 더 저렴하고 생성 속도가 38% 더 빠른 모델은 종합 점수에서 이길 필요가 없다. 제한적 라이선스라면 GLM-5.3만이 그 둘 중 제품을 구축할 수 있는 유일한 모델로 남고, 1점 격차는 어차피 서로 다르게 사용하게 될 두 모델에 관한 사소한 이야기가 된다.

주목할 만한 사양은 하나, 바로 출력 상한이다. 두 벤더 모두 100만 토큰 컨텍스트를 광고한다. 우리 카탈로그에는 GLM-5.3이 최대 출력 131.1K로 등재되어 있고, StepFun의 발표문에는 100만 컨텍스트가 명시되어 있을 뿐 출력 상한은 없으며, 유출 당시 떠돌던 별도의 서드파티 구성에는 컨텍스트 350,000에 최대 출력 64,000이 적혀 있었다. 장기 지평의 에이전트 작업을 위해 판매되는 두 모델에게 그 숫자는 실제로 무엇을 만들 수 있는지를 결정하는데, 지금은 한쪽만 답을 내놓은 상태다.

Screenshot of the OrcaRouter model page for GLM-5.3 at www.orcarouter.ai/models/z-ai/glm-5.3, showing the model id z-ai/glm-5.3, a 1M-token context and 131.1K max output, input pricing of $1.26 and output pricing of $3.96 per million tokens against the crossed-out list rates of $1.40 and $4.40, a cache read rate of $0.25 per million tokens, and the endpoints and SDK snippets behind the OrcaRouter API.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트