GLM 5.3 Flash

z-ai/glm-5.3-flash
신규
비전도구JSON추론
제공 Z.ai · 2026-08-26

GLM-5.3-Flash는 Z.ai의 네이티브 멀티모달 모델입니다. 효율적인 코딩과 장기 지평 에이전트 작업에 적합합니다. 하이브리드 희소 및 선형 어텐션 아키텍처는 긴 컨텍스트 동작을 정확하게 유지하면서 서빙 비용을 크게 절감합니다. 총 320B / 활성 18B 파라미터, 1M 토큰 컨텍스트, 텍스트 + 이미지 + 비디오 입력, 텍스트 출력.

엔드포인트:/v1/chat/completions
컨텍스트1M 토큰
최대 출력128K
입력text + image + video
출력text
p50 TTFT7.78 s
입력$0.07/ 100만 토큰
출력$0.25/ 100만 토큰
p50 TTFT7.78 s7일
p95 TTFT10.00 s7일
트래픽797.5M토큰 / 7일

코드 샘플

어떤 SDK에서도 호출

OpenAI 호환 — 쓰던 SDK 그대로

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

지원되는 매개변수

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • temperature
  • tool_choice
  • tools
  • top_p

가격

입력 / 1M tokens$0.075
출력 / 1M tokens$0.250
캐시 읽기 / 1M$0.017
통화USD

비용 계산기

월 토큰 수10MM
입력 비율70%%
월 예상 $1.28 · 프롬프트 캐싱 사용 시 $1.07

정가 기준 추정치

토큰 및 비용 추정기

입력 토큰: 9요청당 비용: $0.000126

추정치일 뿐입니다 — 실제 토큰 수는 제공자의 토크나이저에 따라 달라집니다.

성능

p50 TTFT
7.78 s
출력 속도
113 tok/s
p95 TTFT
10.00 s
오류율
7.4%

공개 벤치마크

71.5
AA Coding
비교된 모델 중 88%보다 우수
134개 중 15위
57.5
AA Intelligence
비교된 모델 중 92%보다 우수
136개 중 11위
Agents' Last Exam
26.3
AutomationBench v1.0.6
48.8
BabyVision
53.4
Chartography (with tools)
78.0
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
63.4
GPQA Diamond
91.2
HLE (with tools)
55.3
Humanity's Last Exam
39.9
Long-Context Recall
78.0
MMVU
80.5
MVBench
77.8
NL2Repo
56.3
OfficeQA Pro
62.4
SciCode
46.1
tau_banking
47.2
Terminal-Bench 2.1
84.3
terminalbench_v2_1
84.3
Toolathlon Verified
78.4
소스: artificialanalysis.ai, z.ai

커뮤니티 화제

이번 주 개발자들의 이야기

Hacker News10 회 언급 · 7일지난주 대비 8 증가

비교

GLM 5.3 FlashGLM 5.1GLM 5.2GLM 5.3
입력 $/100만$0.07$1.40$1.40$1.26
출력 $/100만$0.25$4.40$4.40$3.96
컨텍스트1.0M200K1.0M1.0M
품질8/109/109/109/10
나란히 비교나란히 비교나란히 비교나란히 비교

FAQ

OrcaRouter에서 Z.ai: GLM 5.3 Flash 비용은 얼마인가요?
Z.ai: GLM 5.3 Flash는 OrcaRouter를 통해 1M 입력 토큰당 $0.07, 1M 출력 토큰당 $0.25에 가격이 책정되어 있습니다. 가격은 라우팅 레이어에서 실시간으로 가져옵니다.
Z.ai: GLM 5.3 Flash의 컨텍스트 윈도우는 얼마인가요?
Z.ai: GLM 5.3 Flash는 1M 토큰의 컨텍스트 윈도우를 지원합니다. 해당 제한까지 롱 컨텍스트 기능(RAG, 요약)을 사용하세요.
OpenAI SDK를 통해 Z.ai: GLM 5.3 Flash를 호출하려면 어떻게 하나요?
OpenAI base_url을 https://api.orcarouter.ai/v1로 설정하고, OrcaRouter API 키를 제공한 후, chat.completions.create 호출에서 model="z-ai/glm-5.3-flash"를 전달하세요.
OrcaRouter가 Z.ai: GLM 5.3 Flash를 속도 제한합니까?
모델별 속도 제한은 OrcaRouter 플랜을 따릅니다. 무료 티어는 보수적인 한도로 제공되며, 유료 티어는 한도를 높입니다. 현재 할당량은 /pricing에서 확인하세요.

이 배지 임베드

Z.ai: GLM 5.3 Flash$0.07/M in7777ms p50OrcaRouter를 통해
HTML <a href="https://www.orcarouter.ai/models/z-ai/glm-5.3-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg" alt="OrcaRouter 의 Z.ai: GLM 5.3 Flash" /> </a>
Markdown [![Z.ai: GLM 5.3 Flash](https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg)](https://www.orcarouter.ai/models/z-ai/glm-5.3-flash)

모델 카드를 데이터로

GET /api/public/models/z-ai/glm-5.3-flash열기
기계 판독 가능:/llms.txt/llms-full.txt