
GLM 5.3 Prime: 동일한 GLM-5.3 가중치, 정확히 두 배의 요금표로
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
GLM 5.3 Prime의 비용은 입력 토큰 100만 개당 2.80달러, 출력 토큰 100만 개당 8.80달러입니다. 이것이 실행되는 모델인 GLM-5.3은 1.40달러와 4.40달러입니다. 이는 반올림 차이나 프로모션 격차가 아니라 두 항목 모두 정확히 2.0배이며, 두 제품이 서로 어긋나는 유일한 부분입니다. GLM 5.3 Prime은 새 모델이 아닙니다. 이는 Z.ai가 2026년 8월 25일에 공개한 GLM-5.3 자체의 가중치를 더 빠른 서빙 스택 뒤에 탑재한 것입니다. GLM-5.3 자체는 2026년 8월 14일에 발표되어 8월 18일에 API에 도달했습니다. 9월 말에 Prime ID가 등장했을 때 기반 모델에는 아무 변화도 없었습니다. 바뀐 것은 누군가 여기에 두 번째 가격표를 붙였다는 것뿐입니다.
모델 목록에서 익숙한 이름 옆에 낯선 이름이 보여서 이 글을 읽고 있다면, 짧은 답은 이렇습니다. 당신이 보고 있는 것은 릴리스가 아니라 서빙 티어입니다. 더 긴 답은 2분을 들을 가치가 있습니다. 왜냐하면 그 계산은 유난히 깔끔하고, 출처는 유난히 불분명하기 때문입니다.
"Prime" 등급이 무엇인지, 한 단락으로.
서빙 티어는 동일한 가중치를 가리키는 두 번째 제품 ID로, 비용이 아니라 처리량에 맞춰 조정된 것입니다. 더 큰 모델, 더 긴 컨텍스트, 더 나은 추론 모드, 더 넓은 도구 표면을 얻는 것은 아닙니다. 토큰을 더 빨리 내보내게 되고, 그 특권의 대가를 절약한 벽시계 시간이 아니라 모든 토큰에 대해 지불합니다. 그 트레이드오프는 실재하며 때로는 옳습니다 — 열 번의 순차 호출을 수행하는 다단계 에이전트 루프는 각 호출이 더 빨리 반환되는 것에서 진정한 이점을 얻습니다 — 하지만 그것은 지연 시간 구매이지 역량 구매가 아니며, 그렇게 가격이 책정되어야 합니다.
GLM 5.3 Prime에 대한 공급업체 설명은 굳이 말하지 않아도 될 부분을 곧바로 말한다. 즉, "Z.ai의 GLM-5.3 중 고속 변형으로, 추론 가속을 통해 1.5~2배의 출력 처리량을 제공하면서 모든 기능을 그대로 계승한다"는 것이다. 모든 기능. 1,000,000 토큰의 동일한 컨텍스트 윈도. 동일한 131,072 토큰 출력 상한. 텍스트 입력, 텍스트 출력. 추론은 필수이며, 낮음, 높음 및 최대 노력 수준을 지원하고 기본값은 최대 — 기본 모델과 동일하다.
요금표, 나란히
• 입력 — GLM 5.3 Prime 1M당 $2.80 vs GLM-5.3 1M당 $1.40
• 출력 — GLM 5.3 Prime 1M당 $8.80 vs GLM-5.3 1M당 $4.40
• 캐시된 입력 — GLM 5.3 Prime 1M당 $0.56 vs GLM-5.3 1M당 $0.26
• 배수 — 세 항목 모두에 2.0×, 양방향 모두에서
• 컨텍스트 — 둘 다 1,000,000 토큰
• 최대 출력 — 둘 다 131,072 토큰
• 추론 — 둘 다 필수, 동일한 세 가지 노력 수준, 동일한 기본값
캐시 항목은 사람들이 놓치는 부분입니다. 캐시 읽기는 프런티어 모델에서 구매할 수 있는 가장 저렴한 토큰이며, 에이전트 워크로드가 실제로 예산을 쓰는 곳이기도 합니다 — 시스템 프롬프트, 도구 정의, 그리고 계속 늘어나는 대화 기록이 매 턴마다 다시 읽힙니다. 캐시 단가가 두 배가 되면 긴 에이전트 세션에서 가장 큰 비용 항목이 두 배가 됩니다. 즉, 실제 워크로드에 적용되는 실효 할증은 새 입력 토큰에 대한 대표 가격 차이가 시사하는 것보다 2배에 더 가깝습니다. 캐시를 적극적으로 활용하니 실제로는 fast lane이 더 저렴하기를 기대했다면, 그렇지 않습니다.
실제로 누가 그걸 팔고 있나요?
여기서부터 리스팅이 흥미로워지며, 신중한 독자라면 속도를 늦춰야 하는 지점입니다. Z.ai 자체 문서와 모델 개요, 그리고 공개된 가격 페이지 어디에도 Prime SKU는 나열되어 있지 않습니다. 공급업체의 모델 ID에서 glm-5.3-prime을 검색해도 아무것도 나오지 않습니다. Z.ai의 자체 속도 등급은 완전히 다른 라인의 다른 제품입니다 — 더 저렴한 Flash 제품군에 속하는 GLM-5.3-FlashX로, 2026년 9월 18일에 출시되었으며 백만 토큰당 $0.37 및 $1.25로 책정되어 있습니다.
따라서 Prime은 Z.ai의 가중치를 기반으로 구축된 플랫폼 측 제품입니다. 두 가지 세부 사항이 누구의 플랫폼인지를 가리킵니다. 첫 번째는 "1.5–2× 출력 처리량"이라는 표현으로, 이는 주요 클라우드 제공업체가 자체 가속 서빙 모드에 사용하는 것과 동일한 문구입니다. 이 모드는 모델 ID를 전환하여 활성화하며, 기능과 사용 한도는 명시적으로 변경되지 않습니다. 두 번째는 해당 리스팅이 엔드포인트 뒤의 업스트림 제공업체를 정확히 하나만 명시한다는 점입니다. 고속 등급 SKU 뒤에 단일 제공업체가 있다는 것은 오픈 가중치 모델이 서빙되는 방식이 아닙니다. 그것은 플랫폼 자체의 가속 배포가 외부에서 보이는 모습입니다.
그렇다고 해서 GLM 5.3 Prime이 나쁜 제품이 되는 것은 아니다. 그것은 공급자가 하나뿐인 제품이라는 뜻이며, 이는 프로덕션 트래픽을 해당 제품으로 라우팅하기 전에 물어봐야 할 복원력 문제다.
속도 주장의 가치

1.5~2×라는 수치는 벤더 자체 조건에서 측정된 처리량 주장이며, 처리량은 그러한 조건에 가장 민감한 지표다. 짧은 프롬프트와 유휴 클러스터, 워밍된 캐시에서의 초당 출력 토큰 수는 장문 컨텍스트 에이전트가 보는 숫자가 아니다. 기본 모델에 대한 독립적 측정에 따르면 GLM-5.3은 초당 약 61 출력 토큰, GLM-5.3-Flash는 약 46인데, 이 세트에서 동급 평균은 67이다 — 즉 더 저렴한 라인이 더 느린 라인이기도 하며, 이는 이름이 시사하는 바와 정반대다. 이는 최고치가 아니라 표준화된 평가 세트 전반의 중앙값이다.
더 미묘한 비용도 있습니다. 두 ID 모두에서 reasoning effort 기본값은 max이며, 이는 가장 긴 사고 연쇄를 생성하는 설정입니다. 여기서 속도와 장황함은 서로 반대 방향으로 작용합니다. 최대 길이로 추론하는 빠른 티어라도 어려운 문제에서는 종단 간 느릴 수 있는데, 병목은 모델이 생성하기로 결정한 토큰 수이지 토큰을 생성하는 속도가 아니기 때문입니다. 워크로드가 추론 중심이라면 가속을 위해 2배를 지불하기 전에 high 또는 low로 낮추세요. effort 수준이 서빙 티어보다 지연 시간에 더 큰 영향을 미칩니다.
같은 모델을 구매하는 세 가지 방법

GLM-5.3은 이제 구매 가능한 세 가지 형태로 존재하며, 그것들은 세 가지 모델이 아닙니다:
• GLM-5.3, $1.40 / $4.40 — 기본 요금표, 전체 기능, 직접 호스팅할 수 있는 공개 가중치가 공개된 버전
• GLM 5.3 Prime, $2.80 / $8.80 — 가속화된 스택을 통해 제공되는 동일한 가중치, 단일 업스트림 공급업체, 가중치는 포함되지 않음
• GLM-5.3-FlashX, $0.37 / $1.25 — GLM-5.3이 전혀 아니라 더 저렴한 Flash 패밀리의 속도 등급이며, 지연 시간을 구매하는 가장 저렴한 방법
그 세 번째 줄이야말로 눈여겨볼 가치가 있습니다. 당신이 실제로 원하는 것이 더 빠른 토큰이고, 어떤 GLM에서 토큰을 얻든 상관없다면, FlashX는 이미 플래그십 비용의 약 10분의 1에 불과한 모델에서 가속을 제공하며, 그 비용은 플래그십이 가속 없이 들이는 비용의 절반 이하입니다. Prime은 당신이 GLM-5.3의 추론 품질을 특별히 필요로 하고 그것을 특별히 더 빨리 필요로 하는 경우에만 의미가 있습니다.
우리 측에서 이것이 어디에 위치하는지

한 가지는 분명히 말씀드려야 합니다. OrcaRouter는 GLM 5.3 Prime을 호스팅하지 않으며, GLM-5.3-FlashX도 호스팅하지 않습니다. 두 모델 페이지 모두 저희 사이트에서 404를 반환합니다. 가속 티어를 원하신다면 그것을 판매하는 플랫폼에서 구매하거나, 기본 모델의 경우 공급업체 자체 API에서 구매해야 합니다.
우리가 호스팅하는 것은 GLM-5.3과 GLM-5.3-Flash이며, 공급자의 정가에 우리 측 마크업 없이 제공합니다 — Z.ai 자체 요율표에서 보시는 것과 동일한 $1.40과 $4.40을, 재책정하지 않고 그대로 전달합니다. 이는 6주 만에 가격이 두 번 바뀐 모델에서는 들리는 것보다 더 중요합니다. 우리는 스프레드를 붙이지 않기 때문에, 공급업체의 가격 변경은 마이그레이션이나 지원 티켓 없이 그쪽에 적용되는 같은 날 우리 쪽에도 바로 적용됩니다. 두 ID 모두 200개 이상의 다른 모델과 함께 하나의 API 키 뒤에 있습니다, 따라서 GLM-5.3과 GLM-5.3-Flash 사이의 A/B는 두 번째 계약이 아니라 한 줄의 모델 이름 변경이며, 단일 업스트림 공급자가 성능 저하될 경우 자동 페일오버가 여러분을 보호합니다 — 이는 단일 공급업체 패스트 티어가 지니는 특정 위험입니다.
2배를 지불해야 할까요?
사람이나 업스트림 서비스가 응답 때문에 막혀 있고, 워크로드가 처리량이 아니라 지연 시간에 병목이 있으며, 지연 시간의 진짜 원인이 추론 노력(reasoning effort)이라는 것을 이미 확인했다면, 그 비용을 지불하세요. 밤새 배치 생성을 돌리는 경우, 볼륨이 충분히 커서 2배 토큰 프리미엄이 절약되는 실제 시간을 앞질러 버리는 경우, 또는 이 티어가 조용히 더 나은 모델이기를 바랐던 경우에는 지불하지 마세요. 그렇지 않습니다. 이것은 초시계를 켜둔 GLM-5.3이며, 그 초시계는 토큰 단위로 요금을 청구합니다.
지금 GLM-5.3 패밀리 전체에 대한 정직한 설명은 이렇습니다. Z.ai는 8월에 모델 하나를 출시했고, 시장은 9월 내내 그것을 네 가지 다른 가격으로 재포장하는 데 썼습니다. GLM 5.3 Prime은 그 패키지 중 가장 비쌉니다. 또한 가장 문서 기록이 희박한 제품이기도 한데, 가중치에 이름을 올린 회사가 이 제품을 목록에 올리지 않기 때문입니다. 그렇다고 피해야 할 이유는 아닙니다. 프로덕션 경로에 투입하기 전에 자신이 정확히 무엇을 사는지 알아야 하는 이유입니다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
