GLM-5.3-Flash는 Z.ai의 네이티브 멀티모달 모델입니다. 효율적인 코딩과 장기 지평 에이전트 작업에 적합합니다. 하이브리드 희소 및 선형 어텐션 아키텍처는 긴 컨텍스트 동작을 정확하게 유지하면서 서빙 비용을 크게 절감합니다. 총 320B / 활성 18B 파라미터, 1M 토큰 컨텍스트, 텍스트 + 이미지 + 비디오 입력, 텍스트 출력.
OpenAI 호환 — 쓰던 SDK 그대로
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| 입력 / 1M tokens | $0.075 |
| 출력 / 1M tokens | $0.250 |
| 캐시 읽기 / 1M | $0.017 |
| 통화 | USD |
정가 기준 추정치
추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.
이번 주 개발자들의 이야기
@misc{orcarouter_glm_5_3_flash,
title = {GLM 5.3 Flash API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3-flash}
}Z.ai. (2026). GLM 5.3 Flash API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3-flash