Nästa generations flaggskepp från Zhipu med flera tankelägen och starka verktygsanrop. 200K kontext / 128K max utdata.
GLM 5 är en textmodell utvecklad av Z.ai, tillgänglig via OrcaRouters OpenAI-kompatibla API. Den accepterar textinmatning och erbjuder ett kontextfönster på 200 000 tokens med en maximal utmatning på…
GLM 5 stöder endast textinmatning. Enligt de angivna specifikationerna accepterar den inte bilder, ljud eller video. Detta gör den till en ren språkmodell optimerad för att bearbeta skrivet innehåll. All kommunikation med modellen sker via texttoken, och utdata är också text. Om din applikation kräver multimodal inmatning måste du använda en annan modell som hanterar bilder eller andra modaliteter. För uppgifter som att sammanfatta transkriberat ljud eller extrahera text från bilder måste du konvertera dessa indata till text innan du skickar dem till GLM 5.
GLM 5 utmärker sig i uppgifter som drar nytta av dess stora kontextfönster och höga utmatningsgräns. Vanliga användningsområden inkluderar: ingående analysera långa juridiska avtal eller regulatoriska dokument; generera detaljerade sammanfattningar av hela forskningsartiklar eller böcker; upprätthålla sammanhängande konversationshistorik i kundsupportchattbotar som sträcker sig över dussintals turer; och utföra komplexa resonemang där modellen behöver referera till flera avsnitt av en lång prompt. τ²-Bench-poängen på 98.2 antyder att den är särskilt stark på att utföra flerstegsuppgifter i simulerade miljöer, såsom att navigera på webbplatser eller utföra datainmatning.
Om din uppgift inte kräver hela 200K-kontexten eller 128K-utmatningen, kan en mindre eller billigare modell vara mer kostnadseffektiv. Till exempel kan enkla frågor och svar, kort textklassificering eller generering av enstaka stycken hanteras av modeller som kostar mindre per token. GLM 5:s prissättning är $1.00 per miljon inmatningstokens och $3.20 per miljon utmatningstokens, vilket är högre än många kompakta modeller. Dessutom, om ditt arbetsflöde innefattar mycket korta prompter och svar, kanske latensen och kostnaden för att ställa in en stor kontextmodell inte är motiverad. Utvärdera din typiska tokenanvändning: om du konsekvent använder mindre än 32K tokens, räcker troligen en mindre modell.
GLM 5 nås via OrcaRouters OpenAI-kompatibla API, som stöder strömmande svar och funktionsanrop. När du använder API:t kan du sätta stream-parametern till true för att ta emot tokens inkrementellt, vilket minskar upplevd latens för långa utdata. Funktionsanrop gör att modellen kan begära verktygsanrop eller strukturerade datautdata. Dessa funktioner är standard för API:t men beror på den specifika modellens stöd. Baserat på den tillhandahållna informationen kan GLM 5 användas med dessa funktioner. För implementeringsdetaljer, se OrcaRouters API-dokumentation.
τ²-Bench är ett riktmärke som utvärderar en AI-agents förmåga att slutföra flerstegsuppgifter i en simulerad miljö. Poängen representerar framgångsgraden över en mångfald av uppgifter, såsom webbnavigering, formulärifyllning och informationsinhämtning. En poäng på 98,2 betyder att GLM 5 slutförde 98,2% av riktmärkesuppgifterna framgångsrikt. Detta är en mycket hög prestanda, vilket indikerar att modellen kan följa komplexa instruktioner och utföra sekvenser av handlingar på ett tillförlitligt sätt. Det garanterar inte perfekt verklig prestanda, men det tyder på starka agentiska förmågor för liknande typer av strukturerade uppgifter.
Latens för GLM 5 beror på in- och utdatalängd samt den underliggande infrastrukturen som tillhandahålls av Z.ai. OrcaRouter dirigerar till leverantörens backend och tillför ingen extra latens utöver nätverksomkostnader. För korta indata och utdata (t.ex. 1 000 tokens in, 500 tokens ut) kan svarstiderna ligga på några sekunder. För långa genereringar nära maxgränsen 128K kan latensen vara betydligt högre – ofta tiotals sekunder eller mer – eftersom modellen måste bearbeta och generera många tokens. Strömning kan minska upplevd väntetid. Inga specifika latenssiffror anges, så verklig prestanda bör testas med representativa arbetsbelastningar.
Den primära styrkan som lyfts fram av rubrikens riktmärke är GLM 5:s höga framgångsfrekvens vid agentiska uppgifter. τ²-Bench-poängen på 98,2 indikerar att den effektivt kan hantera flerstegsresonemang och verktygsanvändning. Dessutom innebär dess stora kontextfönster (200K tokens) och maximala utdata (128K tokens) att den kan bibehålla koherens över mycket långa texter, vilket är en betydande förbättring jämfört med modeller med mindre fönster. Inga andra riktmärkespoäng anges, så direkta jämförelser på uppgifter som språkförståelse eller matematik är inte tillgängliga från dessa data. Modellen drar sannolikt nytta av Z.ais träningsmetodik och ökade skala.
GLM 5 är en textbaserad modell, så den kan inte bearbeta bilder eller andra modaliteter. Dess prestanda på uppgifter som kräver multimodal förståelse är noll. τ²-Bench-poängen, även om den är hög, mäts i en simulerad miljö; verklig agentprestanda kan variera. Modellens kostnad per token är relativt hög ($1.00 input / $3.20 output per miljon tokens), så för långa kontexter kan den totala kostnaden ackumuleras snabbt. Ingen information ges om latens under belastning, så du bör benchmarka med ditt specifika användningsfall. Liksom alla språkmodeller kan GLM 5 också producera felaktigt eller hallucinerat innehåll, särskilt i komplexa resonemangsscenarier bortom dess träningsdistribution.
GLM 5 är prissatt till $1.00 per 1 miljon inmatningstokens och $3.20 per 1 miljon utmatningstokens. Detta är leverantörspriserna som fastställts av Z.ai. OrcaRouter vidarebefordrar dessa priser utan extra påslag, så du betalar exakt leverantörens pris. Tokens räknas med standardtokeniseringsmetoden (ungefär 0,75 ord per token för engelska). Inmatningstokens inkluderar prompten och alla systemmeddelanden; utmatningstokens är modellens genererade svar. Det finns inga separata avgifter för API-anrop eller specialfunktioner om inte leverantören anger det. Prissättningen är per token, så kostnaden skalar linjärt med användningen.
Eftersom GLM 5 tar betalt per token, beror den totala kostnaden på både promptlängd och genereringslängd. För en typisk interaktion med 10 000 indatatokens och 5 000 utdatatokens skulle kostnaden vara (10 000/1 000 000)*$1,00 + (5 000/1 000 000)*$3,20 = $0,01 + $0,016 = $0,026 per anrop. För uppgifter som använder hela kontexten, som 200 000 indatatokens och 128 000 utdatatokens, skulle kostnaden bli $0,20 + $0,4096 = $0,6096 per anrop. Om ditt användningsfall inte kräver sådana extremfall, kan en billigare modell med mindre kontext vara mer ekonomisk. OrcaRouter låter dig jämföra kostnader mellan modeller innan driftsättning.
Den angivna informationen nämner inte cachning eller volymrabatter för GLM 5 via OrcaRouter. Prissättning sker per token till standardpris från leverantören. Om du behöver kostnadsbesparingar för högvolymsanvändning, överväg om en annan modell eller en dedikerad distribution kan vara fördelaktig. OrcaRouters noll-påslags-policy innebär att du betalar samma pris som om du anropade Z.ai direkt, utan någon plattformsavgift. För specifika rabattarrangemang måste du förhandla med Z.ai eller kolla efter eventuella kampanjer. Som standard beskrivs cachning inte, så antag att varje inferens debiteras individuellt.
För att använda GLM 5, skicka förfrågningar till OrcaRouters OpenAI-kompatibla API-slutpunkt. Ställ in bas-URLen till https://api.orcarouter.ai/v1. I din begärandekropp, ange modell-ID som "z-ai/glm-5". Du kan använda vilket OpenAI SDK som helst eller någon HTTP-klient som stöder slutpunkten för chat completions. Exempel med Python: import openai; client = openai.OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="your_key"); client.chat.completions.create(model="z-ai/glm-5", messages=[{"role":"user","content":"Hello"}]). Stöd för streaming, funktionsanrop och andra parametrar speglar OpenAI-schemat.
GLM 5 stöder alla standardparametrar för OpenAI chat completions-formatet. Du kan ställa in temperature (0–2), top_p, max_tokens (upp till 128 000), stop sequences, frequency_penalty, presence_penalty, stream (boolesk) och tools/functions för funktionsanrop. Gränsen för kontextfönstret är totalt 200 000 token, vilket inkluderar både meddelanden och eventuell systemprompt. Om indatan överskrider detta måste du trunkera eller dela upp kontexten. OrcaRouter trunkerar inte automatiskt; förfrågan kommer att misslyckas om tokenantalet överskrider gränsen. Använd tokenizerns räkning för att säkerställa efterlevnad.
Att migrera till OrcaRouter innebär att ändra bas-URL och modell-ID. Om du tidigare använde en OpenAI-slutpunkt med modellen "gpt-4o", skulle du ersätta bas-URL:en med https://api.orcarouter.ai/v1 och ställa in modellen till "z-ai/glm-5". Inga andra kodändringar behövs om du redan använder OpenAI chat completions-formatet. Se till att din API-nyckel är giltig för OrcaRouter. Testa med en liten begäran för att verifiera anslutningen och att modellen svarar som förväntat. Observera att tokenräkning kan skilja sig något på grund av modelspecifika tokenizer, men API:et hanterar det transparent.
Om den kombinerade token-räkningen för din inmatning (systemmeddelanden, konversationshistorik, användarprompt) överstiger 200 000 tokens, kommer API:et att returnera ett fel som indikerar att kontextlängden har överskridits. Du måste minska inmatningsstorleken. På samma sätt, om du ställer in max_tokens över 128 000, kommer begäran att begränsas till modellens maximala utdata; API:et kommer antingen att avvisa parametern eller begränsa den till gränsvärdet. Det är bäst att kontrollera token-räkningar programmatiskt innan du skickar stora nyttolaster. OrcaRouter trunkerar inte automatiskt prompts, så du måste hantera kontextlängden själv.
GLM 5:s kontextfönster på 200 000 tokens och maximal utdata på 128 000 tokens är bland de största som finns tillgängliga. Detta jämför sig fördelaktigt med många slutna modeller som erbjuder 128K eller 32K kontexter. Dess τ²-Bench-poäng på 98,2 är hög, vilket tyder på stark agentprestanda. Priserna är dock högre än hos vissa alternativa leverantörer; till exempel kan en modell med liknande tokenkapacitet men lägre kostnad per token vara mer ekonomisk vid tung användning. GLM 5 är endast text, medan vissa konkurrenter stöder multimodala indata. Utan andra benchmarkdata från de angivna fakta är direkta kvalitetsjämförelser på NLP-uppgifter inte möjliga.
Du kanske väljer GLM 5 om du behöver ett större kontextfönster än OpenAIs standardmodeller (som vanligtvis är 128K tokens). GLM 5 erbjuder 200K kontext och 128K utdata, vilket kan hantera längre indata utan trunkering. Dessutom kan τ²-Bench-poängen på 98.2 vara högre än vissa OpenAI-modeller på agentiska benchmarks, även om exakta jämförelser beror på utvärderingsförhållanden. Om kostnad är en primär faktor, jämför priser per token; GLM 5 på $1.00/$3.20 per miljon tokens kan vara konkurrenskraftigt beroende på alternativet. Om du också föredrar att använda en Z.ai-modell för specifika prestandaegenskaper är GLM 5 ett val.
Jämfört med tidigare GLM-modeller (som GLM 4) ökar GLM 5 kontextfönstret från 128K till 200K tokens och maxutdata från 64K till 128K tokens. τ²-Bench-poängen 98.2 är sannolikt en förbättring, även om äldre modells poäng inte anges. Priset kan ha ändrats; äldre modeller kan vara billigare per token. Om dina uppgifter passar inom det mindre kontextfönstret hos en äldre modell, kan det vara mer ekonomiskt att använda en billigare modell. Men för uppgifter som kräver det fulla 200K-kontexten eller högre utdata, är GLM 5 det enda alternativet i serien. Uppgradering kan också medföra kvalitetsförbättringar i resonemang och instruktionsföljning.
Baserat på den tillhandahållna informationen uppnår GLM 5 ett τ²-Bench-poäng på 98,2, vilket är nära perfekt på det riktmärket. Detta indikerar att den är mycket stark för agentiska uppgifter som liknar dem i riktmärket. Dock garanterar inte riktmärkespoäng verklig prestanda, och andra modeller kan prestera annorlunda i din specifika miljö. Om dina agentiska uppgifter nära matchar τ²-Bench-scenariot är GLM 5 en utmärkt kandidat. Men om dina uppgifter involverar andra verktyg, språk eller begränsningar bör du testa flera modeller. OrcaRouter gör det möjligt för dig att enkelt växla mellan modeller för att jämföra resultat.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)do_sampleinclude_reasoningmax_tokensreasoningrequest_idresponse_formatstopstreamtemperaturethinkingtool_choicetool_streamtoolstop_puser_id| Inmatning / 1M token | $1.00 |
| Utdata / 1M tokens | $3.20 |
| Cacheläsning / 1M | $0.260 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
@misc{orcarouter_glm_5,
title = {GLM 5 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5}
}Z.ai. (2026). GLM 5 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5