GLM-5.3-Flash ist ein natives multimodales Modell von Z.ai. Es eignet sich für effizientes Codieren und Agentenaufgaben mit langem Zeithorizont. Seine hybride Sparse- und Linear-Attention-Architektur gewährleistet präzises Verhalten bei langen Kontexten und senkt gleichzeitig die Bereitstellungskosten erheblich. 320B Gesamtparameter / 18B aktive Parameter, 1M-Token-Kontext, Text + Bild + Video als Eingabe, Text als Ausgabe.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| Eingabe / 1M Tokens | $0.075 |
| Ausgabe / 1M Tokens | $0.250 |
| Cache-Lesen / 1M | $0.017 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/z-ai/glm-5.3-flashÖffnen @misc{orcarouter_glm_5_3_flash,
title = {GLM 5.3 Flash API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3-flash}
}Z.ai. (2026). GLM 5.3 Flash API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3-flash