GLM 5.3 Flash

z-ai/glm-5.3-flash
Nowy
WizjaNarzędziaJSONRozumowanie
przez Z.ai · 2026-08-26

GLM-5.3-Flash to natywny model multimodalny od Z.ai. Jest przeznaczony do wydajnego kodowania i długoterminowych zadań agentowych. Jego hybrydowa architektura uwagi rzadkiej i liniowej utrzymuje dokładność w przypadku długich kontekstów, jednocześnie znacznie obniżając koszty serwowania. 320B parametrów łącznie / 18B aktywnych, kontekst 1M tokenów, tekst + obraz + wideo na wejściu, tekst na wyjściu.

Punkty końcowe:/v1/chat/completions
kont.1M tokenów
Maks. wyjście128K
Wejścietext + image + video
Wyjścietext
p50 TTFT7.78 s
WEJŚCIE$0.07/ 1M tokenów
WYJŚCIE$0.25/ 1M tokenów
p50 TTFT7.78 s7 d
p95 TTFT10.00 s7 d
RUCH797.5Mtokenów / 7 d

Przykłady kodu

Wywołuj z dowolnego SDK

Zgodne z OpenAI — zostań przy swoim SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="z-ai/glm-5.3-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Obsługiwane parametry

  • include_reasoning
  • max_tokens
  • reasoning
  • reasoning_effort
  • response_format
  • stop
  • stream
  • temperature
  • tool_choice
  • tools
  • top_p

Cennik

Wejście / 1M tokenów$0.075
Wyjście / 1M tokenów$0.250
Odczyt cache / 1M$0.017
WalutaUSD

Kalkulator kosztów

Tokeny / miesiąc10MM
Udział wejścia70%%
Szacunkowo / miesiąc $1.28 · Z cache promptów $1.07

Szacunek na podstawie cennika

Kalkulator tokenów i kosztów

Tokeny wejściowe: 19Koszt na żądanie: $0.000126

Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.

Wydajność

p50 TTFT
7.78 s
Prędkość wyjścia
113 tok/s
p95 TTFT
10.00 s
Wskaźnik błędów
7.4%

Publiczne benchmarki

71.5
AA Coding
Lepszy niż 88% porównywanych modeli
15 z 134
57.5
AA Intelligence
Lepszy niż 92% porównywanych modeli
11 z 136
Agents' Last Exam
26.3
AutomationBench v1.0.6
48.8
BabyVision
53.4
Chartography (with tools)
78.0
CharXiv Reasoning (with tools)
89.4
DeepSWE v1.1
63.4
GPQA Diamond
91.2
HLE (with tools)
55.3
Humanity's Last Exam
39.9
Long-Context Recall
78.0
MMVU
80.5
MVBench
77.8
NL2Repo
56.3
OfficeQA Pro
62.4
SciCode
46.1
tau_banking
47.2
Terminal-Bench 2.1
84.3
terminalbench_v2_1
84.3
Toolathlon Verified
78.4
Źródło: artificialanalysis.ai, z.ai

Aktywność społeczności

O czym mówią programiści w tym tygodniu

Hacker News10 wzmianek · 7 dniwzrost o 8 wobec poprzedniego tygodnia

Porównanie

GLM 5.3 FlashGLM 5.1GLM 5.2GLM 5.3
Wejście $/M$0.07$1.40$1.40$1.26
Wyjście $/M$0.25$4.40$4.40$3.96
Kontekst1.0M200K1.0M1.0M
Jakość8/109/109/109/10
Porównaj obok siebiePorównaj obok siebiePorównaj obok siebiePorównaj obok siebie

FAQ

Ile kosztuje Z.ai: GLM 5.3 Flash na OrcaRouter?
Z.ai: GLM 5.3 Flash jest wyceniany na $0.07 za 1M tokenów wejściowych i $0.25 za 1M tokenów wyjściowych za pośrednictwem OrcaRouter. Ceny są pobierane na żywo z warstwy routingu.
Jakie jest okno kontekstowe Z.ai: GLM 5.3 Flash?
Z.ai: GLM 5.3 Flash obsługuje okno kontekstu o wielkości 1M tokenów. Używaj funkcji długiego kontekstu (RAG, streszczanie) do tego limitu.
Jak wywołać Z.ai: GLM 5.3 Flash za pomocą OpenAI SDK?
Ustaw base_url OpenAI na https://api.orcarouter.ai/v1, podaj swój klucz API OrcaRouter i przekaż model="z-ai/glm-5.3-flash" w wywołaniu chat.completions.create.
Czy OrcaRouter ogranicza przepustowość Z.ai: GLM 5.3 Flash?
Limity szybkości na model są zgodne z Twoim planem OrcaRouter. Darmowe plany mają niskie limity; płatne plany je podnoszą. Sprawdź /pricing, aby zobaczyć aktualne limity.

Osadź tę odznakę

Z.ai: GLM 5.3 Flash$0.07/M in7777ms p50przez OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/z-ai/glm-5.3-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg" alt="Z.ai: GLM 5.3 Flash w OrcaRouter" /> </a>
Markdown [![Z.ai: GLM 5.3 Flash](https://www.orcarouter.ai/embed/z-ai/glm-5.3-flash.svg)](https://www.orcarouter.ai/models/z-ai/glm-5.3-flash)

Karta modelu jako dane

GET /api/public/models/z-ai/glm-5.3-flashOtwórz
Odczyt maszynowy:/llms.txt/llms-full.txt