
GLM-5.3-FlashX vs GLM-5.3-Flash: 동일한 가중치, 2.5배 가격, 단 하나 다른 숫자
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GLM-5.3-FlashX를 산다고 해서 더 나은 모델을 얻을 수 있는 것은 아니다. 그것은 비판이 아니라 — 전체 전제다. GLM-5.3-FlashX는 2026년 9월 18일 Z.ai의 API에 출시되었으며, GLM-5.3-Flash와 동일한 가중치를 실행한다: 동일한 총 320B, 활성 18B의 전문가 혼합(mixture-of-experts) 백본, 동일한 1M 토큰 컨텍스트, 동일한 네이티브 텍스트, 이미지, 비디오 및 파일 입력, 동일한 131,072 토큰 출력 상한. Z.ai는 FlashX 벤치마크를 공개하지 않았는데, 새로 벤치마크할 것이 없기 때문이다. 차이는 토큰이 얼마나 빨리 나오는지와 비용이 얼마인지이며, 그 두 숫자가 구매자가 따져야 할 유일한 것이다.
그것은 대부분의 모델 비교보다 더 깔끔한 결정이고, 더 어려운 결정이다. 뒤에 숨을 수 있는 성능 이야기가 없기 때문이다. 지연 시간이 당신에게 2.5배의 가치가 있든, 없든 그뿐이다.
하나의 모델, 두 개의 가격표
• FlashX란 — 모델 릴리스가 아니라 서빙 티어이며, 동일한 가중치, 동일한 점수, 동일한 한도br> • 입력 가격 — FlashX는 100만 토큰당 $0.37, Flash는 정가 기준 100만 토큰당 $0.15br> • 출력 가격 — 100만 토큰당 $1.25 vs $0.50, 청구서를 실제로 좌우하는 배수br> • 캐시된 입력 — 100만 토큰당 $0.075 vs $0.03br> • 속도 — 최대 초당 출력 토큰 200개(공급업체 보고 최대치) vs Artificial Analysis가 독립적으로 측정한 98 tok/sbr> • 구독 액세스 — GLM-5.3-Flash는 Z.ai의 GLM Coding Plan에 3배 할당량으로 포함됩니다; FlashX는 포함되지 않습니다br> • 자체 호스팅 — GLM-5.3-Flash는 Hugging Face에서 MIT 라이선스 오픈 가중치입니다; FlashX는 다운로드할 가중치가 없습니다

Z.ai의 본거지 시장에서는 같은 비율이 명확히 제시된다: FlashX는 입력 ¥2, 출력 ¥7이고, Flash는 ¥0.8, ¥2.8이다. 여러 중국 매체도 이번 출시를 같은 방식으로 설명한다 — 2.5배 가격에 5배 속도 — 그리고 그들 모두 지능은 변하지 않았다고 지적한다.
지연 시간은 별도의 항목이며, 토큰당 가격이 매겨지는 것은 아닙니다.
2.5×가 자동으로 나쁜 거래가 되는 것은 아닙니다. 그 이유는 토큰 가격과 작업 비용이 서로 다른 양이기 때문입니다. 밤새 100만 개의 출력 토큰을 생성하는 배치 작업은 출력만 기준으로 Flash에서는 $0.50, FlashX에서는 $1.25를 지불하며, 아무도 기다리고 있지 않기 때문에 추가 $0.75에 대해 돌려받는 것이 없습니다. 열 번의 순차 호출을 수행하는 에이전트 루프는 토큰당 동일한 프리미엄을 지불하지만, 각 호출이 더 빨리 반환되고, 절감분은 청구서가 아니라 실제 경과 시간(wall-clock)에서 발생합니다. FlashX가 정말로 훨씬 짧은 시간에 반환된다면, 열 번의 턴은 작업당 수십 초의 지연 시간을 되돌려줄 수 있습니다. 그리고 그 작업이 사람이나 업스트림 서비스를 막고 있다면, 그 초는 토큰보다 더 가치가 있습니다.
Z.ai의 자체 포지셔닝은 이 노선을 정확히 따릅니다. FlashX는 고동시성 코딩, 다단계 에이전트 호출, 실시간 대화, 코드 완성, 긴 컨텍스트 멀티모달 작업에 겨냥하고, 가격에 민감하고 지연에 둔감한 워크로드 — 오프라인 배치, 대량 생성, 스케줄된 모든 것 — 는 기본 Flash로 다시 돌립니다. 이는 올바른 분할이며, 이 구분을 긋는 쪽이 바로 벤더라는 점은 주목할 만합니다.
추론이 무너지는 지점은 처리량 쪽이다. FlashX의 초당 200토큰은 벤더가 보고한 최고치이고, 기본 모델의 98은 독립 연구소가 측정한 중앙값이다. 최고치는 짧은 출력과 예열된 캐시, 유휴 클러스터에서 달성된다. 긴 컨텍스트 멀티모달 요청, 즉 FlashX가 정확히 겨냥하는 워크로드는 그 수치에 가장 가까이 가기 어렵고, Z.ai 외부에서는 이 문제를 결판낼 수치를 공개한 곳이 없다. 워크로드가 지연 시간에 묶여 있기보다 처리량에 묶여 있다면, 최고 수치는 실제로 얻게 될 성능에 대해 거의 알려주지 않는다.
FlashX에 없는 탈출구
이 비교에는 세 번째 선택지가 있으며, 이는 기본 모델이 오픈되어 있기 때문에만 존재합니다. GLM-5.3-Flash는 2026년 8월 26일 MIT 라이선스로 출시되었고, 가중치는 Hugging Face와 ModelScope에 공개되어 있으며, 오늘날 SGLang, vLLM, TokenSpeed, KTransformers를 포함한 추론 스택에서 서빙됩니다. 여러분의 사용량이 하드웨어 투자를 정당화할 만큼 충분히 높다면, 정직한 비교는 Flash 대 FlashX가 아니라 FlashX의 백만 출력 토큰당 $1.25와 여러분의 자체 가속기에서의 토큰당 자체 상각 비용입니다.

그 옵션에는 실제 진입 비용이 있다. FP8 릴리스는 서빙에 약 328GB의 GPU 메모리가 필요하며, 이는 대부분 팀에게 멀티노드 배포를 뜻하고 나머지 팀에게는 애초에 불가능한 선택이다. 하지만 이 점은 짚고 넘어갈 가치가 있다. FlashX의 가격 책정을 불가피한 결과가 아니라 의도된 테스트로 만드는 것이 바로 이 비대칭성이기 때문이다. Z.ai는 기본 모델의 경우 고객이 원칙적으로 직접 구축할 수 있는 서빙 구성에 프리미엄을 부과하고 있다. 그 프리미엄은 역량이 아니라 편의성에 대한 것이며, 편의성에는 시간이 지나면서 내려가는 시장 가격이 있다.
가격 변경의 진짜 의미
런칭을 뒷받침하는 경제성은 이례적으로 명확하다. GLM-5.3-Flash는 GLM-5.3 가격의 10분의 1로 출시되었고 — 출시 프로모션 기간에는 그 절반이었으며 — 널리 사용되었다. Z.ai가 이후 확인한 익명의 사전 출시 테스트 기간을 포함해서다. FlashX는 이 제품군이 처음으로 반대 방향으로 움직인 사례다: 동일한 모델을 더 높은 가격에 내놓은 것이다. 중국 금융 언론에 인용된 분석가들은 이를, 근접 프런티어급 성능을 상품 가격에 제공하며 1년 동안 시장 점유율을 사들인 후, 개발자들이 속도 자체에 돈을 지불할 의향이 있는지에 대한 의도적인 상업적 테스트로 해석했다.
두 가지 세부 사항이 그런 해석을 뒷받침한다. FlashX는 GLM Coding Plan에서 제외된 반면, 기본 Flash는 3배 할당량으로 포함되므로, 구독 사용자는 새 등급을 기존 약정에 흡수할 수 없다 — 토큰당 비용을 지불한다. 그리고 가격은 일률적이며, 일부 경쟁사가 유휴 용량을 채우기 위해 사용하는 시간대별 구조와 달리 비혼잡 시간대 할인이 없다. 속도 등급에 일률적으로 적용된 2.5배 가격은 기다릴 수 없는 사람들을 위한 가격이며, Z.ai는 그런 사람이 얼마나 많은지 파악하고 있다.
그것들 중에서 선택하기
다음 토큰에서 사람이나 서비스가 차단되고 모델 자체가 이미 올바른 선택이라면 FlashX를 선택하세요. 인라인 완성, 대화형 에이전트, 실시간 채팅처럼 지연 자체가 제품인 모든 경우가 여기에 해당합니다. 배치, 오프라인 및 대량 작업에는 GLM-5.3-Flash를 선택하고, 일정을 잡을 수 있는 모든 작업과 출력 지연이 아니라 출력 볼륨에 비용을 지불하는 모든 워크로드에 사용하세요. 볼륨이 크고 팀이 가속기를 운영할 수 있다면 FlashX 가격을 책정하기 전에 자체 호스팅 기본 가중치의 가격을 책정하세요. 비교 결과는 토큰 요율이 시사하는 것보다 더 유리합니다.
어느 쪽을 택하든, 호출 지점에서는 두 모델을 서로 교체 가능한 것으로 취급하세요. 동일한 프롬프트를 받고, 동일한 형식을 반환하며, 동일한 품질을 냅니다. 달라지는 것은 모델 문자열 하나뿐이고, 이는 실행할 수 있는 가장 저렴한 형태의 A/B 테스트입니다. OrcaRouter에서는 벤더의 정가가 0% 마크업으로 그대로 전달되므로, Z.ai의 가격 변경이나 프로모션이 업스트림에 적용되는 당일 그대로 반영되며, 두 티어 모두 200개 이상의 모델을 앞에 둔 하나의 엔드포인트 뒤에 있습니다. 측정된 지연 시간에 전적으로 좌우되는 결정이라면, 통합을 건드리지 않고 실험 도중에 두 모델 사이를 전환할 수 있다는 것만으로도 작업의 대부분이 해결됩니다.
이번 평결은 일반적인 모델 비교보다 범위가 좁다. 바로 그게 핵심이다. FlashX는 더 나은 모델이 아니며, 그런 척도 하지 않는다. 그것은 대기열이 더 짧은 동일한 모델이고, 대기열이 당신의 문제였을 때에만 말이 되는 가격에 팔린다. 도입하기 전에 두 모델 모두에서 자신의 첫 토큰까지 걸리는 시간(time to first token)을 측정하라 — 벤더가 내세운 200은 상한선일 뿐이고, 당신의 워크로드만이 중요한 유일한 벤치마크이며, 두 티어의 차이는 설정 변경 하나면 된다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
