GLM 5.3 Flash

z-ai/glm-5.3-flash
Ny
VisionVerktygJSONResonemang
av Z.ai · 2026-08-26

GLM-5.3-Flash är en nativ multimodal modell från Z.ai. Den är lämplig för effektiv kodning och långsiktiga agentuppgifter. Dess hybridarkitektur med gles och linjär attention bibehåller korrekt långkontextbeteende samtidigt som den kraftigt minskar servingkostnaden. 320B totalt / 18B aktiva parametrar, 1M-token-kontext, text + bild + video in, text ut.

ctx1M tokens
Max output128K
Inmatningtext + image + video
Utdatatext
p50 TTFT7.78 s
INMATNING$0.07/ 1M token
UTDATA$0.25/ 1M token
p50 TTFT7.78 s7d
p95 TTFT10.00 s7d
TRAFIK799.8Mtokens/7d

Kodexempel

Anropa från valfritt SDK

OpenAI-kompatibel — behåll det SDK du redan använder

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametrar som stöds

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • temperature
  • tool_choice
  • tools
  • top_p

Priser

Inmatning / 1M token$0.075
Utdata / 1M tokens$0.250
Cacheläsning / 1M$0.017
ValutaUSD

Kostnadskalkylator

Token/månad10MM
Andel input70%%
Uppskattat/månad $1.28 · Med promptcachning $1.07

Uppskattning baserad på listpris

Token- och kostnadsberäknare

Input-token: 18Kostnad per förfrågan: $0.000126

Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.

Prestanda

p50 TTFT
7.78 s
Utdatahastighet
113 tok/s
p95 TTFT
10.00 s
Felfrekvens
7.5%

Offentliga benchmarks

71.5
AA Coding
Bättre än 88% av jämförda modeller
#15 av 134
57.5
AA Intelligence
Bättre än 92% av jämförda modeller
#11 av 136
Agents' Last Exam
26.3
AutomationBench v1.0.6
48.8
BabyVision
53.4
Chartography (with tools)
78.0
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
63.4
GPQA Diamond
91.2
HLE (with tools)
55.3
Humanity's Last Exam
39.9
Long-Context Recall
78.0
MMVU
80.5
MVBench
77.8
NL2Repo
56.3
OfficeQA Pro
62.4
SciCode
46.1
tau_banking
47.2
Terminal-Bench 2.1
84.3
terminalbench_v2_1
84.3
Toolathlon Verified
78.4
Källa: artificialanalysis.ai, z.ai

Community-buzz

Vad utvecklare säger den här veckan

Hacker News10 omnämnanden · 7dupp 8 jämfört med föregående vecka

Så jämför den sig

GLM 5.3 FlashGLM 5.1GLM 5.2GLM 5.3
Input $/M$0.07$1.40$1.40$1.26
Output $/M$0.25$4.40$4.40$3.96
Kontext1.0M200K1.0M1.0M
Kvalitet8/109/109/109/10
Jämför sida vid sidaJämför sida vid sidaJämför sida vid sidaJämför sida vid sida

Vanliga frågor

Hur mycket kostar Z.ai: GLM 5.3 Flash på OrcaRouter?
Z.ai: GLM 5.3 Flash prissätts till $0.07 per 1M inmatningstokens och $0.25 per 1M utmatningstokens via OrcaRouter. Prissättningen hämtas live från routningslagret.
Vad är Z.ai: GLM 5.3 Flash:s kontextfönster?
Z.ai: GLM 5.3 Flash stöder ett kontextfönster på 1M tokens. Använd långkontext-funktioner (RAG, sammanfattning) upp till den gränsen.
Hur anropar jag Z.ai: GLM 5.3 Flash via OpenAI SDK?
Ställ in OpenAI base_url till https://api.orcarouter.ai/v1, ange din OrcaRouter API-nyckel, och skicka model="z-ai/glm-5.3-flash" i anropet till chat.completions.create.
Begränsar OrcaRouter hastigheten för Z.ai: GLM 5.3 Flash?
Per-modell hastighetsbegränsningar följer din OrcaRouter-plan. Gratisnivåer levereras med konservativa gränser; betalnivåer lyfter dem. Kolla /pricing för aktuella kvoter.

Bädda in denna badge

Z.ai: GLM 5.3 Flash$0.07/M in7777ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/z-ai/glm-5.3-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg" alt="Z.ai: GLM 5.3 Flash på OrcaRouter" /> </a>
Markdown [![Z.ai: GLM 5.3 Flash](https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg)](https://www.orcarouter.ai/models/z-ai/glm-5.3-flash)

Modellkort som data

GET /api/public/models/z-ai/glm-5.3-flashÖppna