GLM-5.3-FlashX vs DeepSeek V4.1 Flash를 위한 히어로 타이틀 카드로, 부제는 '저렴한 모델보다 느린 속도 티어'이며, 칩에는 '200 vs 214.7 tok/s', '$0.37 / $1.25 vs $0.15 / $0.60', 'AA 42 vs 40'이 적혀 있고, 하단 문구는 'GLM-5.3-FlashX, 2026년 9월 18일 출시'입니다.
Guides & Insights

GLM-5.3-FlashX vs DeepSeek V4.1 Flash: 저렴한 모델보다 느린 속도 등급

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Z.ai의 프리미엄 속도 등급에는 문제가 있는데, 그 이름은 바로 DeepSeek V4.1 Flash입니다. Z.ai가 GLM-5.3-FlashX를 2026년 9월 18일에 출시했을 때, 이 새 등급을 한 가지 숫자로 팔았습니다: 최대 초당 200 출력 토큰, 즉 기반이 된 GLM-5.3-Flash의 처리량 약 5배를 2.5배 가격에 제공한다는 것이었습니다. 독립 측정은 이미 DeepSeek의 저가형 모델을 초당 214.7 토큰, 첫 토큰 도달 시간 1.15초로 기록했는데, 이는 Z.ai가 광고하는 상한보다 두 항목 모두 빠르고, FlashX가 근처에도 못 미치는 가격입니다. 속도를 사려는 거라면, 시장은 FlashX가 도착하기 전에 이미 움직였습니다.

그러한 프레이밍은 한 가지 특정한 면에서 FlashX에게 불공평하고, 다른 모든 면에서는 공평하다. 두 모델 모두 비용을 위해 설계된 1M-context 오픈 웨이트 파생 모델이며, 둘 다 자신이 만들어진 목적에는 정말로 뛰어나다. 하지만 둘은 같은 문제의 서로 다른 절반을 위해 만들어졌고, 이제 두 모델 사이의 가격 차이는 대부분의 워크로드에서 "어느 쪽이 더 나은가"에 한 줄로 답할 수 있을 만큼 커졌다.

각각이 실제로 앞서 있는 부분

• 가격표 — GLM-5.3-FlashX는 100만 입력/출력 토큰당 $0.37 / $1.25, DeepSeek V4.1 Flash는 비피크 시간대 $0.15 / $0.60, 피크 시간대 $0.30 / $1.20br> • 캐시된 입력 — FlashX는 100만 토큰당 $0.075 vs DeepSeek는 비피크 시간대 $0.003, 에이전트 루프에서 크게 누적되는 25× 격차br> • 측정 처리량 — FlashX 최대 200 tok/s(공급업체 피크, 독립 수치 미공개) vs DeepSeek 214.7 tok/s(Artificial Analysis, DeepSeek의 API 기준)br> • 첫 토큰까지의 시간 — FlashX는 미공개 vs DeepSeek V4.1 Flash는 측정값 1.15초br> • 독립적 지능 — FlashX는 Artificial Analysis Intelligence Index에서 GLM-5.3-Flash의 42를 이어받음 vs DeepSeek V4.1 Flash는 40br> • 아키텍처 — 총 320B / 활성 18B MoE vs 총 552B, 프리필에서 약 8B 활성 및 디코드에서 16B 활성br> • 입력 모달리티 — 텍스트, 이미지, 비디오 및 파일 vs 텍스트 및 이미지br> • 출력 상한 — 131,072 토큰 vs 약 384,000br> • 오픈 가중치 — GLM-5.3-Flash는 MIT 라이선스이며, FlashX는 자체 가중치가 없는 호스팅 티어이고, DeepSeek V4.1 Flash는 MIT 라이선스임

A two-column scoreboard titled 'GLM-5.3-FlashX vs DeepSeek V4.1 Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'AA Index: 42', 'Context: 1M tokens', 'Output cap: 131,072'; the DeepSeek V4.1 Flash column reads 'Price: $0.15 / $0.60 off-peak', 'Cached input: $0.003 per 1M', 'Speed: 214.7 tok/s (measured)', 'AA Index: 40', 'Context: 1M tokens', 'Output cap: 384,000'; the footer reads 'FlashX speed is vendor-reported; DeepSeek figures per Artificial Analysis.'

그 목록을 두 번 읽어 보세요. 목록의 모양새 자체가 이야기의 핵심이니까요. FlashX는 정확히 두 행에서만 이기는데, 둘 다 근소합니다: 독립 지능 지수에서 2점 우위, 그리고 비디오 입력입니다. DeepSeek는 가격, 캐시된 가격, 측정된 속도, 출력 길이, 그리고 중요한 의미에서의 모달리티 폭에서 이깁니다 — 이미지를 받아들이고 긴 답변을 생성합니다. 2점의 지수 차이는 단일 벤치마크 실행의 노이즈 범위 안에 있으며, 여러분의 아키텍처를 결정하는 요소가 되어서는 안 됩니다.

저렴한 모델보다 느린 속도 등급

여기서 곱씹어볼 만한 부분이 있다. Z.ai는 실제 문제, 즉 GLM-5.3-Flash가 느리다는 문제를 해결하기 위해 FlashX를 구축했다. Artificial Analysis는 이를 초당 98개 출력 토큰으로 측정했는데, 이는 같은 크기의 오픈웨이트 모델 중간값보다는 높지만 인터랙티브 수준에는 한참 못 미친다. 회사의 해결책은 서빙 스택 재구축이었다. 약 10만 대의 자국산 가속기, SGLang 기반 엔진, W8A8 양자화, 혼합 정밀도 KV 캐시, 인코드–프리필–디코드 분리형 아키텍처가 그것이며, 회사는 동일 하드웨어에서 자사 베이스라인 대비 엔드투엔드 처리량이 약 3배라고 보고한다.

DeepSeek는 동일한 문제를 아키텍처 계층에서 해결했고, 가장 먼저 그 지점에 도달했습니다. V4.1 Flash의 Causal Encoder–Decoder 분할은 획일적인 수치가 아니라 프리필에서 약 8B 파라미터를, 디코드에서 16B를 활성화하며, FP4 KV 캐싱을 사용하는 Compressed Sparse Attention 2는 글로벌 캐시를 토큰당 890바이트로 줄입니다 — 이는 전작에 필요했던 HBM의 약 4분의 1, SSD 저장공간의 8분의 1에 해당합니다. 그 결과는 중립적인 연구소에서 측정한 기준으로 동일한 자사 API에서 초당 214.7토큰으로 실행되는 모델이며, 프리미엄 등급이 필요하지 않습니다.

Z.ai의 200은 벤더 피크이고 DeepSeek의 214.7은 독립적인 중앙값이며, 이는 Z.ai에 가능한 가장 불리한 비교이자 이를 유보적으로 받아들여야 하는 이유다. FlashX가 웜 상태의, 짧은 출력의, 혼잡하지 않은 요청에서 DeepSeek를 앞지를 가능성은 충분히 있다. 하지만 알 수는 없다. Z.ai 외부의 누구도 FlashX 처리량 수치를 공개하지 않았기 때문이다. 오늘날 알 수 있는 것은 두 모델이 같은 속도 대역에 있다는 것과, 그중 하나의 비용이 3분의 1에 불과하다는 것이다.

A screenshot of the Artificial Analysis model page for DeepSeek V4.1 Flash at max effort (captured September 19, 2026), showing an Intelligence Index score of 40, a measured 215 output tokens per second, $0.30 per 1M input and $1.20 per 1M output tokens, a 1M-token context window, 552B total parameters with 16B active, an MIT licence and weights on Hugging Face.

DeepSeek의 가격 우위가 구조화되는 지점

DeepSeek V4.1 Flash는 비수기 시간대에 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.60을 부과하며, 평일 두 시간대(01:00–04:00 및 06:00–10:00 UTC)에는 $0.30과 $1.20으로 두 배가 됩니다. FlashX는 $0.37과 $1.25의 고정 요금입니다. 이 둘을 나란히 놓고 보면, 기능처럼 보이는 고정 요금제가 사실은 작업을 일정에 맞춰 돌릴 수 있는 사람에게는 더 비싼 구조입니다.

캐시된 입력 항목이 에이전트 워크로드를 결정하는 요소입니다. DeepSeek는 오프피크 시간에 캐시된 입력 토큰 100만 개당 $0.003를 청구합니다; FlashX는 25배 더 많은 $0.075를 청구합니다. 매 단계마다 긴 시스템 프롬프트와 도구 스키마를 다시 보내는 에이전트는 매 단계마다 그 차액을 지불하며, 이는 실제 청구서를 지배할 가능성이 가장 높은 단일 항목입니다. Z.ai는 제한된 기간 동안 캐시 저장소를 무료로 제공한다고 명시하는데, 이는 실제로 누적되는 읽기보다는 저장소에 대한 할인입니다.

여기에는 상쇄 요소가 있는데, 그것은 DeepSeek 자체 수치가 치르는 대가에 대한 정직함이다. V4.1 Flash의 헤드라인 점수를 뒷받침하는 공급업체 수행 평가는 최대 추론 노력으로 산출되었으며, DeepSeek은 effort 25에서 effort 100으로 이동하면 출력 토큰을 약 2.5배 소비하면서 DeepSWE v1.1을 66.0에서 74.2로 끌어올린다고 문서로 밝힌다. 토큰이 2.5배일 때, 높은 추론 노력 구성의 실질 비용은 가격표가 시사하는 것보다 FlashX에 훨씬 더 가깝다 — 그리고 그 모델은 Intelligence Index에서 중앙값 130M에 비해 250M 출력 토큰을 생성할 만큼 매우 장황한 것으로 문서화되어 있다. 말이 많은 모델에서의 저렴한 토큰당 요금은 저렴한 작업과 같지 않다. 이 둘을 가격으로 비교하려는 사람은 백만 토큰당 비용이 아니라 완료된 작업당 비용을 비교해야 하며, 추정하기보다 측정해야 한다는 점을 예상해야 한다.

구체적으로 어떻게 결정할까

워크로드가 안정적인 접두사를 가진 장시간 실행 에이전트라면 DeepSeek V4.1 Flash가 선택지이며, 캐시된 입력 비율만으로 결정됩니다. 동일한 호출에서 비디오 이해나 파일 입력이 필요하다면, FlashX가 둘 중 이를 지원하는 유일한 모델입니다 — 이는 사양표상의 차이가 아니라 실제 역량 차이입니다. 긴 생성 출력이 필요하다면, FlashX의 131,072에 대비되는 DeepSeek의 약 384K 출력 한도가 보고서 생성, 긴 코드 파일, 답변보다는 합성하는 모든 작업에 중요합니다. 단일 벤치마크 지수에서 가장 강력한 독립 점수가 필요하다면, FlashX의 42 대 40은 실재하지만 그것에 기반을 두기에는 너무 작습니다.

스택이 이미 라우팅되어 있다면 두 모델 모두 하나의 엔드포인트에서 접근할 수 있으며, 이것이 이 문제를 판가름하는 가장 저렴한 방법입니다. OrcaRouter에서는 공급업체 정가가 0% 마크업으로 그대로 전달되므로, DeepSeek의 오프피크 할인과 향후 Z.ai의 가격 변동이 발생하는 당일에 그대로 반영되며, 둘 사이를 전환하는 일은 통합 작업이 아니라 모델 문자열 하나를 바꾸는 것에 불과합니다. 특히 FlashX에는 자동 페일오버를 갖춰 둘 가치가 있습니다. 이는 새 클러스터에서 서비스를 시작한 지 3주 된 서빙 티어이며, 여러분이 대비하려는 장애 유형은 모델이 작동을 멈추는 것이 아니라 용량 한계이기 때문입니다.

간단명료한 요약: DeepSeek V4.1 Flash는 대부분의 프로덕션 작업에서 더 나은 기본 선택이다. 토큰당 더 저렴하고, 캐시된 토큰당 더 저렴하며, 측정상 더 빠르고, 더 긴 출력을 지원한다. GLM-5.3-FlashX는 비디오나 파일 입력이 필요하고 그 뒤에 약간 더 높은 독립 지수를 원하는 좁은 영역에서는 올바른 선택이다. Z.ai는 속도 등급을 프리미엄 가격에 책정해, 빠르고 저렴한 모델이 이미 존재하던 시장에 내놓았다. 그게 이 비교의 전부다.

A screenshot of the OrcaRouter model page for DeepSeek V4.1 Flash (deepseek/deepseek-v4.1-flash, captured September 19, 2026) showing the model header, a 384K max output, text and image input, an MIT licence by DeepSeek with a 2026-09-10 release date, and the billing row reading $0.15 per 1M input and $0.60 per 1M output tokens with a 1.33-second p50 time to first token.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트