Kompakt MoE-syskon till GLM-4.5: 106B totalt / 12B aktiv. Samma hybrid-resonemangs- och verktygsanropsstack anpassad för hög genomströmning, låg kostnad inferens. 128K kontext.
GLM 4.5 Air är en textgenererande språkmodell utvecklad av Z.ai. Den erbjuder ett kontextfönster på 128 000 tokens och kan generera upp till 96 000 tokens i ett enda svar. Modellen är optimerad för…
GLM 4.5 Air specialiserar sig på textgenerering med stark betoning på resonemang, särskilt matematisk problemlösning, vilket framgår av dess 96,5 poäng på MATH-500. Den kan hantera komplexa flerstegsinstruktioner, generera sammanhängande långformad text upp till 96 000 tokens och bibehålla sammanhang över 128 000 tokens. Förmågor inkluderar att svara på faktabaserade frågor, sammanfatta långa dokument, översätta text mellan språk, utföra logiska slutledningar och skriva kod. Modellen är utformad för att följa detaljerade uppmaningar och producera strukturerade utdata. Dess stora kontextfönster gör att den kan arbeta med hela böcker, utökade rapporter eller långa konversationsloggar. Det är dock en textbaserad modell och kan inte bearbeta bilder eller annan media. För uppgifter som inte kräver resonemang eller långa utdata kan en mindre eller billigare modell vara tillräcklig.
De bästa användningsområdena för GLM 4.5 Air omfattar uppgifter som drar nytta av dess stora kontextfönster och höga utdatagräns. Exempel inkluderar: att analysera och sammanfatta långa akademiska artiklar, generera detaljerad teknisk dokumentation, lösa komplexa matematiska problem steg för steg, skapa omfattande studieg wider, och bearbeta omfattande användarloggar eller chathistorik. Modellen presterar även bra på kodningsuppgifter som kräver förståelse för långa kodfiler eller generering av stora kodbaser. På grund av dess prismodell – $0,20 för inmatning och $1,10 för utmatning per miljon tokens – är den kostnadseffektiv för scenarier där inmatning är billigare än utmatning. Applikationer som behöver generera många tokens, som att skriva långa texter eller flera resonemangssteg, kan vara ekonomiska jämfört med modeller med högre kostnad per utmatningstoken.
Medan GLM 4.5 Air erbjuder starkt resonemang och en stor kontext, kan den vara överflödig för enklare uppgifter. Överväg att använda en billigare, mindre modell när uppgiften inte kräver dess fulla kontextfönster eller utdatalimit. Om du till exempel behöver snabb klassificering, enkel översättning eller generering av korta svar, skulle en modell med lägre tokenkostnader vara mer ekonomisk. Om din applikation inte involverar matematiskt resonemang eller långformig generering, kanske premien för GLM 4.5 Airs funktioner inte är motiverad. Modellens utdatakostnad ($1.10 per 1M tokens) är högre än dess indatakostnad, så uppgifter som genererar mycket utdata (t.ex. långa sammanfattningar från korta indata) kan bli dyrare än alternativa modeller med lägre utdatakostnader. Utvärdera alltid avvägningen mellan kapacitet och kostnad för ditt specifika användningsfall.
MATH-500-riktmärket utvärderar en modells förmåga att lösa matematiska problem över olika svårighetsgrader, inklusive algebra, geometri, talteori och mer. En poäng på 96,5 indikerar att GLM 4.5 Air korrekt svarade på 96,5% av problemen i testuppsättningen. Detta tyder på stark matematisk resonemangsförmåga, jämförbar med eller bättre än andra modeller i sin klass. Det garanterar inte perfekt prestanda på alla matematikproblem, särskilt de som ligger utanför riktmärkets fördelning. Användare bör tolka denna poäng som en indikator på modellens skicklighet i symbolisk resonemang och steg-för-steg-problemlösning. Riktmärket mäter inte andra viktiga färdigheter som kreativitet, sunt förnuft eller faktualitet. För icke-matematiska uppgifter skulle andra riktmärken ge en mer relevant jämförelse.
Specifik latensdata för GLM 4.5 Air på OrcaRouter tillhandahålls inte. Generellt beror svarstiden på faktorer som längden på in- och utdatatokens, serverbelastning och nätverksförhållanden. Modeller med större kontextfönster och utdatabegränsningar kan uppvisa längre bearbetningstider när mycket långa svar genereras. Eftersom GLM 4.5 Air kan generera upp till 96 000 tokens, kommer generering av maximalt utdata ta avsevärt längre tid än korta svar. OrcaRouters API-infrastruktur är utformad för att minimera överhead, men den faktiska hastigheten varierar. För applikationer där låg latens är avgörande, överväg att använda mindre modeller eller kortare utdatalängder. Modellens prestanda på MATH-500 tyder på effektiv resonemangsförmåga, men realtidsapplikationer bör testas under förväntad belastning.
Styrkor: Hög matematisk resonemangsförmåga (MATH-500-poäng 96.5). Stor 128K kontextfönster möjliggör bearbetning av omfattande texter. Maxutdata på 96 000 tokens möjliggör generering av fullängdsdokument. Nollprissättning på OrcaRouter gör kostnaderna transparenta. Begränsningar: Endast textmodalitet; kan inte bearbeta bilder, ljud eller video. Den höga utdatakostnaden ($1,10 per 1M tokens) kan vara avskräckande för applikationer som genererar mycket långa svar ofta. Referensvärden för andra områden (t.ex. allmän kunskap, kodgenerering) anges inte, så dess övergripande mångsidighet är okänd. Liksom alla språkmodeller kan den producera felaktiga eller partiska utdata. Den har inte internetåtkomst eller realtidskunskap som standard. Användare bör validera utdata för kritiska applikationer.
Prissättning för GLM 4.5 Air debiteras enligt leverantörens taxa utan påslag på OrcaRouter. Kostnaden är $0.20 per 1 miljon inmatningstokens och $1.10 per 1 miljon utmatningstokens. Inmatningstokens inkluderar all text i prompten (system-, användar- och assistentmeddelanden fram till det sista svaret). Utmatningstokens är den genererade texten. Det finns inga extra avgifter eller plattformstillägg. Du betalar exakt leverantörens taxa. Denna transparenta prismodell gör att du kan förutsäga kostnader baserat på tokenanvändning. Debitering sker vanligtvis baserat på antalet tokens som förbrukas i varje API-anrop. Cachningspolicyer kan gälla på OrcaRouter; kontrollera plattformens dokumentation för detaljer om upprepade anrop med identisk indata är rabatterade.
Den primära avvägningen är mellan kapacitet och kostnad. GLM 4.5 Air erbjuder höga utdatagränser och stark resonemangsförmåga, men dess kostnad per utdatatok ($1.10 per 1M) är relativt hög. För uppgifter som genererar många utdatatoknar från korta indata kan kostnaden ackumuleras snabbt. Omvänt gynnas uppgifter med stora indata men korta utdata av den lägre kostnaden per indatatoken ($0.20 per 1M). Nollprispåslaget hos OrcaRouter innebär att du inte betalar extra utöver leverantörens taxa, men du måste fortfarande hantera tokenanvändningen. Om din applikation främst kräver kompakta svar kan en modell med lägre utdatakostnad vara mer ekonomisk. För applikationer som kräver långa utdata eller tungt resonemang kan GLM 4.5 Air vara kostnadseffektiv trots den högre utdatakostnaden på grund av dess prestanda.
OrcaRouter kan implementera cachningspolicyer som minskar kostnaden för upprepade identiska indatatokens. Specifika rabattdetaljer för GLM 4.5 Air anges inte. Vanligtvis tillämpas cachningsrabatter på prompt-tokens som har bearbetats tidigare, vilket sänker den effektiva indatakostnaden. Användare bör hänvisa till OrcaRouters dokumentation eller support för att bekräfta aktuella cachningsrutiner. Eftersom baskostnaden för indata redan är låg på 0,20 USD per 1 miljon tokens, kan cachning ytterligare minska kostnaderna för applikationer med repetitiva uppmaningar. Utdata-tokens cachas i allmänhet inte eftersom de varierar per anrop. Verifiera alltid de senaste faktureringsvillkoren direkt med OrcaRouter för att förstå eventuella tillgängliga rabatter eller kampanjer.
För att använda GLM 4.5 Air, skicka HTTP-förfrågningar till OrcaRouters OpenAI-kompatibla API-slutpunkt: https://api.orcarouter.ai/v1. Inkludera en giltig API-nyckel i Authorization-headern. Ange modellen som "z-ai/glm-4.5-air" i förfrågan. API:et stöder standard OpenAI chat completion-parametrar: messages (array av objekt med role och content), temperature, max_tokens, top_p, stop, frequency_penalty, presence_penalty och andra. Till exempel, ställ in "max_tokens" till upp till 96000 för att använda full utgångskapacitet. API:et returnerar ett JSON-svar med den genererade completionen. Streaming stöds genom att ställa in "stream": true. Se till att ditt klientbibliotek använder rätt bas-URL och modellnamn. OrcaRouters API är kompatibelt med OpenAIs klient-SDK:er, så migreringen är enkel.
GLM 4.5 Air stöder ett antal parametrar via OrcaRouters OpenAI-kompatibla API. Obligatorisk: model ("z-ai/glm-4.5-air") och messages. Valfria parametrar inkluderar: temperature (0.0 till 2.0, standard 1.0) för att styra slumpmässighet; top_p (0.0 till 1.0) för nucleus-sampling; max_tokens (upp till 96000) för att begränsa utdatalängd; stop (lista med sekvenser för att stoppa generering); frequency_penalty och presence_penalty (båda -2.0 till 2.0) för att straffa token-upprepning; och stream (boolean) för realtidsleverans av tokens. Kontextfönstret är 128000 tokens, så se till att totala tokens i meddelanden plus genererad utdata inte överskrider den gränsen; annars kommer begäran att trunkeras eller avvisas. OrcaRouter kan också stödja ytterligare parametrar som logit_bias eller user; kontrollera dokumentationen. Hänvisa alltid till den senaste API-referensen för exakta detaljer.
Migrering till GLM 4.5 Air på OrcaRouter är enkelt om du redan använder ett OpenAI-kompatibelt API. Ändra bas-URL till https://api.orcarouter.ai/v1, ersätt modellnamnet med "z-ai/glm-4.5-air" och använd din OrcaRouter API-nyckel. Inga andra ändringar av förfrågningsstrukturen krävs om du använder standardparametrar. Svarsformatet är identiskt med OpenAIs chattkompletteringar. Om du migrerar från en icke-OpenAI-plattform måste du anpassa din kod för att använda chattkompletteringsformatet. OrcaRouter stöder också funktionsanrop och verktygsanvändning, även om inte alla modeller gör det; kontrollera om GLM 4.5 Air stöder dessa. Testa med små förfrågningar först för att validera beteende och kostnader. OrcaRouter tillhandahåller kreditbaserad fakturering, så se till att du har tillräckligt saldo innan migrering.
Inom OrcaRouters katalog utmärker sig GLM 4.5 Air för sin kombination av ett stort kontextfönster (128K), hög utdatagräns (96K) och stark matematisk resonemangsförmåga (MATH-500 96,5). Jämfört med mindre modeller erbjuder den djupare resonemang men till en högre kostnad per utdatatoken. Jämfört med större eller frontier-modeller kan den sakna bredd i allmän kunskap eller multimodal kapacitet, men den är mer kostnadseffektiv för textbaserade, resonemangstunga uppgifter. Den nollpåslagsprissättningen gör den konkurrenskraftig mot modeller med liknande kapacitet som kan inkludera plattformsavgifter. För applikationer som inte kräver matematik eller långa utdata finns billigare alternativ. För uppgifter som kräver multimodal inmatning skulle andra modeller med bildbehandling vara bättre. Sammantaget upptar den en nisch som en dedikerad resonemangsmotor med generösa tokengränser.
GLM 4.5 Air är en variant av Z.ais GLM-4-familj. Även om specifika jämförelser inte tillhandahålls, indikerar benämningen "Air" vanligtvis en lättare eller kostnadsoptimerad version jämfört med grundmodellen GLM-4. Den offrar troligen viss prestanda för lägre latens eller kostnad, även om MATH-500-poängen på 96,5 visar att den behåller starka resonemangsförmågor. Kontextfönstret (128K) och utdatagränsen (96K) är generösa, möjligen större än tidigare GLM-4-iterationer. Priset (0,20/1,10 USD per 1M tokens) är konkurrenskraftigt. Utan direkta benchmarkjämförelser bör användare testa båda modellerna på sina specifika uppgifter. De huvudsakliga skillnaderna kan vara i hastighet, effektivitet eller något annorlunda träningsdata. OrcaRouter kan erbjuda andra GLM-4-modeller med olika prissättning; jämför tokenkostnader och prestanda för att välja den bästa passformen.
GLM 4.5 Air är en proprietär modell från Z.ai, inte öppen vikt. Jämfört med modeller med öppna vikter som de från Llama- eller Mistral-familjerna, erbjuder den fördelen att den är värd och hanteras av OrcaRouter utan egen värdinfrastruktur. Dess prissättning är per token, medan öppna modeller kräver kostnader för datorkraft. MATH-500-poängen är hög, men öppna modeller kan ha olika styrkor (t.ex. bredare kunskap). Kontextfönstret (128K) är stort men vissa öppna modeller erbjuder liknande eller större kontexter. Utmatningsgränsen på 96K tokens är ovanligt hög jämfört med de flesta öppna modeller, som vanligtvis har en maxgräns på 4K-32K. För användare som behöver mycket långa genereringar utan att hantera infrastruktur är GLM 4.5 Air bekvämt. För dem som kräver anpassningsbarhet eller datasuveränitet kan modeller med öppna vikter vara att föredra.
GLM 4.5 Air är endast textbaserad, så den kan inte bearbeta bilder, ljud eller video. Om din applikation kräver förståelse av visuellt innehåll (t.ex. analys av diagram, läsning av handskrift, tolkning av foton), skulle du behöva en multimodellmodell som GPT-4V eller Claude 3. På samma sätt kan den inte generera bilder eller tal. För uppgifter som kombinerar text- och bildresonemang skulle en multimodellmodell vara nödvändig. GLM 4.5 Airs styrka ligger rent i textuell resonemang och generering. Användare bör överväga om deras användningsfall verkligen kräver multimodalt inflöde eller om endast text räcker. Om enbart text är tillräckligt kan GLM 4.5 Air vara mer kostnadseffektiv för resonemangstunga uppgifter jämfört med multimodellmodeller, som ofta tar ut högre tokenavgifter och kan innehålla bildkapacitet som inte används.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-4.5-air",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)do_sampleinclude_reasoningmax_tokensreasoningrequest_idresponse_formatstopstreamtemperaturethinkingtool_choicetool_streamtoolstop_puser_id| Inmatning / 1M token | $0.200 |
| Utdata / 1M tokens | $1.10 |
| Cacheläsning / 1M | $0.030 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/z-ai/glm-4.5-airÖppna @misc{orcarouter_glm_4_5_air,
title = {GLM 4.5 Air API},
author = {Z.ai},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-4.5-air}
}Z.ai. (2025). GLM 4.5 Air API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-4.5-air