
GLM-5.3-FlashX, 기반 모델의 2.5배 가격에 출시
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
주목해야 할 숫자는 200이 아니다. 2.5다. 2026년 9월 18일, Z.ai는 GLM-5.3-FlashX를 초당 최대 200개의 출력 토큰 속도로 자사 API에 올렸다 — 그리고 그 가격을 GLM-5.3-Flash, 이 모델의 기반이 된 오픈 웨이트 모델에 부과하는 요금의 2.5배로 책정했다. 모델 자체에서 바뀐 것은 아무것도 없다. 동일한 가중치, 동일한 320B-A18B 전문가 혼합(mixture-of-experts) 백본, 동일한 100만 토큰 컨텍스트, 텍스트와 이미지, 비디오, 파일에 대한 동일한 네이티브 처리. 바뀐 것은 그 아래의 서빙 스택이며, 대기열 앞쪽에 더 가까이 자리하는 특권에 대해 Z.ai가 이제 부과하는 요금이다.
그 점에서 FlashX는 모델 시장에서 드문 사례다. 벤치마크가 전혀 붙지 않은 출시인 것이다. Z.ai는 FlashX 전용 평가를 공개하지 않았는데, 평가할 새 모델이 없기 때문이다. GLM-5.3-Flash에 적용되는 모든 성능 수치는 여기에도 그대로 적용된다. 출시 보도가 시사한 것보다 덜 호의적인 수치들까지 포함해서.
전체 델타를 한 번에
• 속도 — GLM-5.3-FlashX 최대 200 tok/s(벤더 보고 최고치) vs GLM-5.3-Flash 98 tok/s, Artificial Analysis가 Z.ai 자체 API에서 측정한 기준br> • 가격 — 100만 입력 토큰당 $0.37 / 100만 출력 토큰당 $1.25 vs 정가 $0.15 / $0.50br> • 캐시 입력 — 100만 토큰당 $0.075 vs 100만 토큰당 $0.03br> • 지능 — 동일하며, FlashX는 기본 모델의 점수를 그대로 물려받음br> • 컨텍스트 — 둘 다 100만 토큰br> • 가중치 — GLM-5.3-Flash는 MIT 라이선스 오픈 가중치이고, FlashX는 호스팅 티어로서 자체 가중치가 없음
200과 98은 같은 종류의 숫자가 아니며, 이 점은 솔직히 말할 가치가 있습니다. 하나는 공급업체가 서비스가 도달할 수 있다고 말하는 상한선입니다. 다른 하나는 독립 연구소가 실제 요청 전반에 걸쳐 측정한 값입니다. 2.5×를 지불할지 결정하는 사용자라면 200을 광고로 취급하고 자신의 워크로드를 직접 측정해야 합니다.

Z.ai가 말하는 것이 일을 하고 있다
속도 향상은 수학이 아니라 인프라에서 비롯된 것이다. Z.ai는 FlashX가 약 10만 개의 중국산 자국 가속기 클러스터에서 전용으로 구축된 서빙 스택 위에서 실행된다고 설명한다. 여기에는 SGLang 기반 추론 엔진, W8A8 양자화, INT8/FP8/BF16 혼합 캐시 양자화, 그리고 멀티모달 인코딩 단계를 토큰 생성 단계와 분리해 서로가 서로를 막지 않도록 하는 인코드–프리필–디코드 분리형 아키텍처가 포함된다. 이 회사는 동일한 하드웨어에서 초기 기준선 대비 엔드투엔드 서비스 처리량이 약 3배라고 보고하며, GLM-5.3으로 구동되는 인프라 에이전트가 이 스택 튜닝을 도왔다고 밝혔다.
그 모든 것은 공급업체가 보고한 내용이며, 지금까지 Z.ai 외부의 누구에 의해서도 재현되지 않았다. 그것은 또한 이 이야기에서 가장 그럴듯한 부분이기도 하다. 이번과 같은 서빙 계층 출시는 대개 엔지니어링 성과이며, 설명된 아키텍처 선택은 바로 이런 종류의 이득을 위한 표준 도구 모음이다. 그것들이 보장은 아니다. 200 tok/s라는 수치는 피크이고, 피크는 짧은 출력, 웜 캐시, 혼잡하지 않은 클러스터에서 도달된다. 장문 컨텍스트 멀티모달 요청 — FlashX가 명시적으로 겨냥하는 워크로드 — 은 그것을 달성할 가능성이 가장 낮은 요청들이다.
가격이 곧 실제 제품 결정이다
정가 기준으로, GLM-5.3-FlashX는 100만 입력 토큰당 $0.37, 100만 출력 토큰당 $1.25이며, 캐시된 입력은 $0.075, 캐시 저장은 한시적으로 무료입니다. Z.ai의 국내 가격으로는 입력 ¥2, 출력 ¥7로, 기본 Flash의 ¥0.8, ¥2.8과 대비됩니다 — Z.ai가 자국에서 판매하는 통화로 표시된 동일한 2.5배 비율입니다.

사람들이 좀처럼 확인하지 않는 방향에서 계산은 금방 불편해진다. 출력 토큰은 배수가 가장 세게 물어뜯는 지점인데, 이 제품군의 모든 모델에서 출력이 비싼 쪽이기 때문이다: FlashX 출력은 Flash 출력의 2.5배이고, 두 모델 모두에서 출력은 이미 입력 가격의 약 3.4배다. 하루에 백만 개의 출력 토큰을 생성하는 배치 작업은 $0.50에서 $1.25로 바뀐다 — 정의상 아무도 기다리지 않는 워크로드에 대해 연간 $274 차이다.
이득이 되는 지점은 상각할 수 있는 지연 시간이다. 순차적으로 열 번 호출하는 에이전트 루프는 호출당 차이를 열 번 절약하며, 그 차이가 2~3초라면 작업당 실제 경과 시간 30초를 되찾은 셈이다. 대화형 코드 완성, 실시간 대화, 또는 사람이나 업스트림 서비스가 다음 토큰을 기다리며 막혀 있는 모든 파이프라인에서는 그런 맞바꿈이 대개 옳다. Z.ai는 또한 이 모델이 현재 자사의 GLM Coding Plan에 포함되지 않는다고 명확히 밝히고 있어, 구독 사용자는 FlashX를 번들로 받지 못하고 토큰당 비용을 지불한다.
여러분의 스택이 이미 둘 이상의 공급자와 통신하고 있다면, 전환은 모델 문자열을 바꾸는 것 외에는 아무것도 아닙니다. 라우팅이 하나의 계층으로 존재하는 실질적인 이유가 바로 여기에 있습니다. OrcaRouter에서는 공급업체의 정가가 0% 마크업으로 그대로 전달되므로, Z.ai의 가격 변경이나 프로모션 인하가 업스트림에서 일어난 바로 그날에 반영되며, 200개 이상의 모델 앞에 단일 엔드포인트가 있다는 것은 FlashX를 Flash와 비교 평가하는 일이 통합 프로젝트가 아니라 설정 편집 한 번이라는 뜻입니다. 장애 조치도 여기서 중요합니다. 완전히 새로운 클러스터 위의 완전히 새로운 서빙 티어는 바로 폴백을 뒤에 두어야 할 만한 의존성입니다.
변하지 않은 것, 그리고 그것이 더 중요한 이유
FlashX는 GLM-5.3-Flash의 역량 프로필을 그대로 물려받았으며, 그 프로필은 출시 당시의 보도가 시사한 것보다 좁다. Z.ai의 자료는 기본 모델을 Artificial Analysis Intelligence Index에서 Claude Opus 4.8과 동급으로 놓는다. Artificial Analysis 자체는 현재 해당 지수에서 GLM-5.3-Flash를 42로 표기하는데, 이는 Z.ai 자체 API에서 측정된 것으로, 탄탄한 점수이며 동급 오픈 웨이트 모델의 중간값을 훨씬 웃돌지만, 벤더 비교가 시사하는 최전선 등급과는 거리가 멀다. 두 진술 모두 사실이다. 다만 서로 같은 진술이 아니며, 그 간극이 바로 이 블로그가 벤더 수치를 벤더 수치라고 부르는 이유다.
베이스 모델은 진정으로 유능하고 진정으로 개방적이다. GLM-5.3-Flash는 2026년 8월 26일 MIT 라이선스로 Hugging Face에 가중치를 공개하며 출시되었고, 하이브리드 선형+희소 어텐션 설계(IndexPool 압축, 매니폴드 제약 하이퍼커넥션)는 GLM-5.3 대비 어텐션 연산량을 약 3분의 1로, KV 캐시를 약 4.4분의 1로 줄여 주는데, 바로 이것이 18B 활성 파라미터를 가진 320B 모델을 아예 서빙할 수 있을 만큼 저렴하게 만든다. 출력은 131,072 토큰으로 제한된다. 가격 대비로는 빠르지만 동급 모델 중에서는 빠르지 않다: Artificial Analysis가 측정한 값은 초당 98토큰으로, 동종 중앙값은 70을 넘지만 보드에서 가장 빠른 모델들보다는 낮다.
FlashX는 그중 어느 것도 바꾸지 않습니다. 바뀌는 것은 당신이 그것을 기다리는 시간뿐입니다.
솔직한 해석
워크로드가 지연 시간에 병목을 겪고 있고, GLM-5.3-Flash가 올바른 모델이라고 이미 결정했다면 FlashX를 구매하세요 — 호출을 연쇄하는 에이전트, 인라인으로 완성해 주는 편집기, 멈춤 자체가 제품인 음성 또는 채팅 인터페이스에 적합합니다. 작업이 배치 처리되거나 오프라인 작업이거나 지연 시간보다 처리량에 병목을 겪는다면 GLM-5.3-Flash에 남거나, 직접 호스팅할 수 있는 오픈 웨이트에 남으세요. 2.5배를 지불하고 얻는 지능은 이미 갖고 있던 지능입니다.
남아 있는 의문은 200에 대해 독립적인 측정이 무엇을 말해 주는가이다. 아직 Z.ai 외부에서는 누구도 FlashX 처리량 수치를 공개하지 않았고, 누군가 그렇게 하기 전까지 정직한 입장은 FlashX가 피크 수치를 내세워 판매되는 유망한 서빙 티어라는 것이다. 특히 이것은 상업적 시험이기도 하다. 거의 최전선급 모델을 자사 플래그십 가격의 10분의 1로 1년 동안 제공해 온 연구소가 이제 개발자들이 속도 자체에 돈을 지불할 의향이 있는지 묻고 있다. 그 답은 다음 티어의 가격이 어떻게 책정될지를 좌우할 것이다.

이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
