생성된 타이틀 카드에는 'GLM-5.3-Flash 공개'라는 제목과 함께 'Zhipu의 오픈 멀티모달 프론티어 모델은 익명의 Ox Alpha였으며, 이제 GLM-5.3 가격의 10분의 1입니다'라는 부제가 있고, 번개 칩, MIT 배지, 이미지-비디오 아이콘을 나타내는 플랫 라인 아이콘이 있습니다.
Guides & Insights

GLM-5.3-Flash 공개: 익명의 'Ox Alpha'는 줄곧 Zhipu의 오픈 멀티모달 프론티어 모델이었다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

타사 코딩 플랫폼 사용량 차트에서 일주일 동안 1위를 지킨 모델이 마침내 이름과 가격을 공개했다. 2026년 8월 26일, Zhipu AI는 개발자들이 8월 20일부터 사용해 온 무료 모델 'Ox Alpha'가 GLM-5.3-Flash임을 확인했다. 이 모델은 총 3,200억 개, 활성 180억 개(320B-A18B) 매개변수를 갖춘 혼합 전문가(MoE) 모델로, GLM-5 시리즈 최초의 네이티브 멀티모달 출시작이며, 출시 당시 어떤 요금표에서도 가장 저렴한 최첨단(frontier-grade) 모델 중 하나다. Zhipu는 GLM-5.3-Flash의 가격을 플래그십 GLM-5.3 API 요금의 10분의 1로 책정했으며, 한정 기간 할인 중에는 20분의 1이다. 또한 MIT 라이선스로 공개된 오픈 가중치는 같은 날 Hugging Face에 게시됐다. 가중치가 아직 이번 달 말로 예정된 GLM-5.3과 달리, 이 모델은 다음 주가 아니라 이번 주에 직접 호스팅(self-host)할 수 있다.

간단히 요약하면, Zhipu가 지금까지 가장 저렴한 대형 모델을 오픈소스로 공개했습니다. 이 모델은 활성 파라미터의 극히 일부만 사용하면서도 벤치마크에서 자사의 GLM-5.2를 능가합니다. Zhipu의 출시 자료에 따르면, 공급업체는 이 모델의 Artificial Analysis Intelligence Index 점수를 57로 평가했으며, 이는 Claude Opus 4.8과 동률입니다. 이번 출시에 포함된 모든 벤치마크 수치는 공급업체가 보고한 것으로, 작성 시점 기준으로 아직 재현되지 않았습니다. 가격과 파라미터 수는 현재 확인된 사실입니다.

실제로 출시된 것

GLM-5.3-Flash는 총 320B, 활성 18B 규모의 45레이어 MoE로, 활성 풋프린트는 GLM-5.2의 약 32B 활성 파라미터의 절반을 약간 넘습니다. 가장 주목할 만한 기능은 모달리티입니다. 즉, 텍스트, 이미지, 비디오 입력을 기본적으로 처리하는데, 이는 GLM-5 모델 중 최초이며, 비전을 별도의 어댑터로 라우팅하지 않습니다. 컨텍스트는 100만 토큰까지 지원하며, Zhipu는 장문 컨텍스트 제공 비용이 GLM-5.3의 약 1/3 수준이라고 주장합니다.

아키텍처 측면에서 Zhipu에 따르면, 이 모델은 {{1}}스파스 어텐션과 선형 어텐션을 결합한 하이브리드 설계를 사용한 최초의 오픈소스 프론티어 모델{{/1}}이다. 확장을 위해 {{2}}Manifold-Constrained Hyper-Connections (mHC){{/2}}를 도입했고, 장기 컨텍스트 지연 시간을 줄이기 위해 네 개의 인덱서 키 벡터를 하나의 가중치 풀로 압축하는 {{3}}IndexPool{{/3}} 메커니즘도 사용했다. 사전 학습은 {{4}}30조 토큰 규모의 멀티모달 말뭉치{{/4}}로 수행됐다. 이 중 어느 것도 아직 독립적으로 검증되지 않았으며, 이는 Zhipu가 자체 모델에 대해 설명한 내용이다. 다만 서빙 효율성에 대한 주장은 가중치가 오픈소스 추론 스택에 공개되면 테스트할 수 있을 만큼 구체적이다.

출시일 사양표, 한눈에 보기:

• 파라미터 — 총 320B / 활성 18B, 45개 레이어, MoE.

• 모달리티 — 기본 텍스트, 이미지, 비디오 입력; 텍스트 출력.

• 컨텍스트 창 — 최대 1,000,000개의 토큰.

• 라이선스 — MIT, 출시 시점에 Hugging Face에서 오픈 가중치 공개.

• 가격 — 토큰 100만 개당 $0.15 / $0.50 (입력 / 출력), 캐시된 입력 100만 개당 $0.03; 2026년 9월 9일까지 50% 할인 프로모션을 적용하면 $0.075 / $0.25 / $0.015로 낮아집니다. 정가 기준으로 이는 GLM-5.3의 $1.40 / $4.40의 약 10분의 1 수준입니다.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

옥스 알파 주간

이번 공개는 일주일간의 추측을 마무리한다. 8월 20일, 익명의 모델이 제3자 AI API 플랫폼에 등장했는데, 100만 토큰 컨텍스트 창, 텍스트/이미지/비디오 입력, 가격 0을 갖추고 있었으며, 빠르게 해당 플랫폼의 주간 차트에서 가장 많이 호출된 모델이 되었다. 커뮤니티는 48시간 이내에 그 모델을 Zhipu의 GLM 제품군으로 지문 분석해냈다 — 이는 이전에 다른 중국 연구소의 모델을 식별했던 것과 같은 '익명 후 공개' 패턴이었다 — 그리고 분석가들은 대체로 Flash 변형 GLM-5.3일 것이라고 추측했다. 8월 26일 발표는 그 추측을 확인했고, 무료 주간은 의도적인 테스트였다는 세부 사항을 덧붙였다. Zhipu에 따르면 익명 실행은 제공된 코딩 플랫폼에서 호출량 기록을 세웠으며, 모든 트래픽은 중국 국산 칩에서 처리되었다.

{{1}}그 무료 주간 맥락은 가격 기대에 중요하다. 일주일 동안 0달러로 제공된 후, 플래그십 요금의 10분의 1 가격에 한시적으로 20분의 1 가격 할인으로 출시된 모델은 보급형 티어에서 의도적인 시장 형성 움직임이다{{/1}} — 그리고 '한시적'이라는 수식어가 주목할 부분이다. {{2}}할인은 철회할 수 있는 가격 결정이지만, MIT 오픈 가중치는 그럴 수 없다.{{/2}}

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

실제 달러 기준으로 드는 비용

Zhipu의 요금표가 실제 달러 기준으로 공개됐다. 단순한 비율이 아니라, 입력 토큰 100만 개당 $0.15, 출력 토큰 100만 개당 $0.50, 캐시된 입력 토큰 100만 개당 $0.03이다. GLM-5.3이 공개한 $1.40 / $4.40과 비교하면 정가 기준 대략 10분의 1 수준이며, 2026년 9월 9일까지 진행되는 50% 출시 할인 프로모션을 적용하면 $0.075 / $0.25 / $0.015로 약 20분의 1 수준으로 낮아진다. Zhipu는 또한 이 모델의 AA Intelligence Index 태스크당 비용을 약 $0.045로 추산했는데, 이는 벤더가 보고한 수치로 "Opus 4.8의 1/40"이라는 표현의 근거가 된 숫자다. 10~40배 더 높은 가격의 모델들과 같은 성능대에서 점수를 받는 모델이라는 점을 감안하면, 헤드라인의 경제성은 실재한다. 다만 세부적으로는 출시 할인이 일시적이며, 태스크당 비용은 프로덕션에서 모델이 얼마나 장황한 출력을 내는지에 따라 달라진다.

{{1}}효율성 이야기가 바로 Zhipu가 비용 우위를 주장하는 근거입니다.{{/1}} {{2}}GLM-5.3 대비, 공급업체는 어텐션 컴퓨트가 3.0배, KV 캐시가 4.4배 감소했다고 보고하며,{{/2}} {{3}}비교 대상 보급형 모델들 — GLM-5.3, DeepSeek V4 Flash, Kimi K3 — 중 가장 낮은 어텐션 컴퓨트를 주장하면서도{{/3}} {{4}}KV 캐시는 여전히 DeepSeek V4 Flash와 Kimi K3보다 약간 크다는 점은 인정합니다.{{/4}} {{5}}서빙 측면에서 Zhipu는 국산 중국 칩에서 기준 대비 엔드투엔드 서빙 성능이 3배 개선되었다고 보고하며,{{/6}}주류 NVIDIA GPU와 비슷하다고 부르는 토큰당 비용에 도달했다고 말합니다.{{/5}} {{7}}이 모든 수치는 공급업체가 보고한 것이며 아직 독립적으로 재현된 바 없습니다.{{/8}} 이는 오픈 가중치와 대조해 볼 수 있는 적절한 수치들입니다.{{/7}}

그 공개가 중요한 이유

벤치마크를 빼고 보면, 이번 출시는 여전히 두 가지 방식으로 오픈 모델 지형을 바꾼다. 첫째, 프런티어급 오픈 가중치 멀티모달 모델을 저렴한 가격에 제공한다는 점이다. MIT 라이선스, 1M 컨텍스트, 기본 이미지/비디오 입력, 작업당 한 자릿수 센트의 비용이라는 조합은 미국 프런티어 연구소 어디에도 직접적인 대응물이 없다. 그들의 동급 멀티모달 모델은 열 배는 더 비싸고 폐쇄형으로 출시되기 때문이다. 둘째, Zhipu 자체 플래그십을 견제한다. GLM-5.3은 이번 달 AA Intelligence Index에서 독립적으로 측정된 60점을 받은 743B 모델이며, GLM-5.3-Flash는 같은 제품군을 겨냥해 "프런티어 지능, 플래시 비용"으로 포지셔닝되었다. Zhipu의 서사는 더 작고 저렴한 모델이 플래그십의 성능 대부분을 담아낼 수 있다는 것이다. 그리고 이는 벤더의 코딩 및 에이전트 관련 주장이 유효하다면, 업계가 올해 내내 맴돌던 포스트트레이닝 경제 논리와 동일한 논증이다.

한 가지 유의점이 이를 올바른 관점에서 바라보게 한다. {{1}}GLM-5.3-Flash의 AA Index 점수 57은 Zhipu 자체 출시 자료에서 나온 것이며, 아직 Artificial Analysis 리더보드에서 나온 결과가 아니다. Claude Opus 4.8과의 코딩 비교 역시 Zhipu 내부 Z.ai Code Bench 평가다.{{/1}} {{2}}독립적인 측정 결과가 나올 때까지 57점과 코딩 동등성은 주장으로 간주해야 한다. 이 모델은 익명으로 폭넓게 테스트되었으므로, 제3자 수치가 곧 나올 것이다.{{/2}}

시도해 보세요. 그리고 라우팅 레이어가 어떻게 맞는지.

출시 당일 액세스는 지푸(Zhipu) 자체 API, Hugging Face의 오픈 가중치(zai-org/GLM-5.3-Flash, MIT), 그리고 지푸의 코딩 제품인 ZCode와 GLM Coding Plan(일일 체험 카드 배치 포함)을 통해 가능합니다. 자체 호스팅의 경우, MIT 라이선스와 vLLM 및 SGLang 지원 덕분에 위의 서빙 효율성 주장을 직접 확인할 수 있습니다.

라우팅 측면에서, 이번 업데이트 기준으로 GLM-5.3-Flash는 아직 OrcaRouter의 로스터에 포함되어 있지 않습니다. 나머지 GLM 제품군은 포함되어 있습니다: GLM-5.3은 Zhipu의 API가 오픈된 같은 날 우리 측에서도 라이브로 전환되었으며, Zhipu의 공식 가격에 0% 마크업을 적용한 통과(pass-through) 방식으로 제공됩니다. 이러한 통과 방식이 이번과 같은 출시에서 핵심적인 메커니즘입니다 — 공급업체의 가격 변동, 즉 할인이 유지되든 이후 요금표가 변경되든, 재협상 없이 당일 우리 측에 반영됩니다. Flash가 출시된 후 하나의 키로 GLM 라인의 나머지 모델들과 함께 실행하려면, 그 설정이 바로 답입니다. 그 전까지는 Hugging Face의 가중치가 직접 테스트해볼 수 있는 가장 빠른 방법입니다.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

다음에 볼 콘텐츠

앞으로 몇 주 안에 실체를 가를 세 가지가 있습니다. 첫째, 57에 대한 독립적인 Artificial Analysis 측정입니다. 이 모델은 이미 Ox Alpha라는 이름으로 공개 운영 중이었기 때문에 리더보드도 빠르게 따라잡을 것입니다. 둘째, 현재 2026년 9월 9일에 종료 예정인 50% 할인 프로모션이 그 이후로 연장되는지 여부입니다. 이에 따라 Flash의 상시 비용이 결정되기 때문입니다. 셋째, 여전히 8월 28일경 공개가 약속된 GLM-5.3 가중치입니다. 이는 Flash의 MIT 가중치가 공개된 바로 그 주로, 오픈 가중치 커뮤니티가 같은 계열의 두 등급을 동시에 비교할 수 있게 해줍니다.

이 글에서 비교한 모델3

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

providers@orcarouter.ai

커뮤니티에 참여하세요

Discordsupport@orcarouter.aiXGitHubYouTube