
GLM 5.3 Prime: Samma GLM-5.3-vikter, till exakt dubbla priset enligt prislistan
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 177 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1323 tok/s
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
GLM 5.3 Prime kostar 2,80 dollar per miljon indatatokens och 8,80 dollar per miljon utdatatokens. GLM-5.3, modellen den körs på, kostar 1,40 och 4,40 dollar. Det är inte en avrundningsskillnad eller en kampanjbetingad prisskillnad – det är exakt 2,0× på båda raderna, och det är det enda som de två produkterna är oense om. GLM 5.3 Prime är inte en ny modell. Den använder GLM-5.3:s egna vikter, samma vikter som Z.ai öppnade den 25 augusti 2026, bakom en snabbare serveringsstack. GLM-5.3 tillkännagavs den 14 augusti 2026 och nådde API:et den 18 augusti. Ingenting hos den underliggande modellen förändrades när Prime-ID:t dök upp i slutet av september. Det som förändrades var att någon satte en andra prislapp på den.
Om du läser detta därför att en modellista visade dig ett obekant namn bredvid ett bekant, är det korta svaret: du tittar på en serveringstier, inte en release. Det längre svaret är värt två minuter, eftersom aritmetiken är ovanligt ren och härkomsten är ovanligt dunkel.
Vad en "Prime"-nivå är, i ett stycke
En serving-nivå är ett andra produkt-ID som pekar på samma vikter, optimerad för genomströmning snarare än för kostnad. Du får inte en större modell, en längre kontext, ett bättre resonemangsläge eller en bredare verktygsyta. Du får ut tokens snabbare, och du betalar för privilegiet per token i stället för på den väggklockstid du sparade. Den avvägningen är verklig och ibland korrekt — en flerstegets agentloop som gör tio sekventiella anrop drar verkligen nytta av att varje anrop återkommer snabbare — men det är ett latensinköp, inte ett köp av förmåga, och det bör prissättas som ett sådant.
Leverantörens beskrivning av GLM 5.3 Prime säger det outtalade rakt ut: den är "höghastighetsvarianten av Z.ai:s GLM-5.3, som ärver dess fulla kapacitet samtidigt som den levererar 1,5–2× utdatagenomströmning genom inferensaccelerering." Full kapacitet. Samma kontextfönster på 1 000 000 token. Samma utdatatak på 131 072 token. Text in, text ut. Resonemang obligatoriskt, med låg, hög och max ansträngningsnivåer och max som standard — identisk med basmodellen.
Prislistan, sida vid sida
• Indata — GLM 5.3 Prime $2,80 per 1 miljon mot GLM-5.3 $1,40 per 1 miljon
• Utdata — GLM 5.3 Prime $8,80 per 1 miljon mot GLM-5.3 $4,40 per 1 miljon
• Cachad indata — GLM 5.3 Prime $0,56 per 1 miljon mot GLM-5.3 $0,26 per 1 miljon
• Multiplikator — 2,0× på alla tre rader, i båda riktningarna
• Kontext — 1 000 000 tokens för båda
• Maxutdata — 131 072 tokens för båda
• Resonemang — obligatoriskt för båda, samma tre ansträngningsnivåer, samma standard
Cache-posten är den folk missar. En cacheläsning är den billigaste token du någonsin kommer att köpa från en frontiermodell, och det är där agentarbetsbelastningar faktiskt spenderar sin budget — systemprompten, verktygsdefinitionerna och det växande transkriptet läses om vid varje tur. En fördubbling av cachepriset fördubblar den största utgiftsposten i en lång agentsession, vilket innebär att den effektiva merkostnaden för en verklig arbetsbelastning ligger närmare 2× än vad den rubriknoterade skillnaden för färska indatatoken antyder. Om du hoppades att snabbspåret skulle vara billigare i praktiken eftersom du cachar aggressivt, så är det inte.
Vem säljer det egentligen?
Det är här listningen blir intressant, och där en noggrann läsare bör sakta ner. Z.ai:s egen dokumentation, dess modellöversikt och dess publicerade prissida listar ingen Prime-SKU. Sök i leverantörens modell-ID:n efter glm-5.3-prime och du får ingenting. Z.ai:s egen hastighetsnivå är en helt annan produkt på en helt annan linje — GLM-5.3-FlashX, som tillhör den billigare Flash-familjen, lanserades den 18 september 2026 och är prissatt till $0.37 och $1.25 per miljon tokens.
Så Prime är en plattformssidig produkt byggd på Z.ai:s vikter. Två detaljer pekar på vems plattform. Den första är formuleringen "1,5–2× utdatagenomströmning", som är samma ordalydelse som en stor molnleverantör använder för sitt eget accelererade serveringsläge – ett läge man aktiverar genom att byta modell-ID, med funktioner och användningsgränser uttryckligen oförändrade. Den andra är att listningen namnger exakt en uppströmsleverantör bakom slutpunkten. En enda leverantör bakom en SKU i snabbklassen är inte hur en modell med öppna vikter serveras; det är hur en plattforms egen accelererade driftsättning ser ut utifrån.
Inget av det gör GLM 5.3 Prime till en dålig produkt. Det gör det till en produkt med en enda leverantör, vilket är en fråga om resiliens som du bör ställa innan du dirigerar produktionstrafik genom den.
Vad hastighetspåståendet är värt

1,5–2×-siffran är ett genomflödespåstående uppmätt under leverantörens egna förhållanden, och genomflöde är det mått som är mest känsligt för dessa förhållanden. Utdata-tokens per sekund med varm cache, kort prompt och ett inaktivt kluster är inte den siffra en långkontextagent ser. Oberoende mätning av basmodellen placerar GLM-5.3 på ungefär 61 utdata-tokens per sekund och GLM-5.3-Flash på omkring 46, i ett urval där klassgenomsnittet är 67 – så den billigare banan är också den långsammare, vilket är motsatsen till vad namnen antyder. Dessa är medianer över en standardiserad utvärderingsuppsättning, inte toppar.
Det finns också en subtilare kostnad. Standardinställningen för resonemangsinsats på båda ID:na är max, vilket är inställningen som producerar de längsta tankekedjorna. Hastighet och utförlighet drar här i olika riktningar: en snabb nivå som dessutom resonerar med maximal längd kan fortfarande vara långsam från början till slut på ett svårt problem, eftersom flaskhalsen är antalet tokens som modellen väljer att generera, inte hastigheten med vilken den genererar dem. Om din arbetsbelastning är resonemangstung, gå ner till high eller low innan du betalar 2× för acceleration — insatsnivån kommer att påverka din latens mer än serveringsnivån gör.
Tre sätt att köpa samma modell

GLM-5.3 finns nu i tre köpbara former, och de är inte tre modeller:
• GLM-5.3 för $1,40 / $4,40 — basprislistan, full kapacitet, versionen med publicerade öppna vikter som du kan hosta själv
• GLM 5.3 Prime för $2,80 / $8,80 — samma vikter via en accelererad stack, en enda uppströmsleverantör, inga vikter inblandade
• GLM-5.3-FlashX för $0,37 / $1,25 — inte GLM-5.3 alls, utan snabbnivån i den billigare Flash-familjen, och det i särklass billigaste sättet att köpa latens
Den tredje raden är den som är värd att stirra på. Om det du egentligen vill ha är snabbare tokens och du är flexibel med vilken GLM du får dem från, ger FlashX acceleration på en modell som redan kostar ungefär en tiondel av flaggskeppet, för mindre än hälften av vad flaggskeppet kostar utan acceleration. Prime är bara vettigt om du specifikt behöver GLM-5.3:s resonemangskvalitet och specifikt behöver den snabbare.
Var detta ligger hos oss

Vi bör vara tydliga med en sak: OrcaRouter hostar inte GLM 5.3 Prime, och vi hostar inte heller GLM-5.3-FlashX. Båda modellsidorna returnerar 404 på vår webbplats. Om du vill ha den accelererade nivån måste du köpa den från plattformen som säljer den, eller från leverantörens eget API för basmodellen.
Det vi gör är att hosta GLM-5.3 och GLM-5.3-Flash, till leverantörens listpris med noll påslag från oss — samma $1.40 och $4.40 som du ser på Z.ai:s egen prislista, vidarebefordrade i stället för omprissatta. Det spelar större roll än det låter för en modell vars prissättning har ändrats två gånger på sex veckor. Eftersom vi inte lägger på någon marginal är en leverantörsprisändring live hos oss samma dag som den är live hos dem, utan migrering eller supportärende. Båda ID:na ligger bakom en och samma API-nyckel tillsammans med över 200 andra modeller, så en A/B mellan GLM-5.3 och GLM-5.3-Flash är ett enradigt byte av modellnamn snarare än ett andra avtal, och automatisk failover täcker dig om en enskild uppströmsleverantör försämras — vilket är den specifika risk som en snabb nivå hos en enda leverantör medför.
Bör du betala 2×?
Betala för det om en människa eller en uppströmstjänst är blockerad i väntan på svaret, om arbetsbelastningen begränsas av latens snarare än av genomströmning, och om du redan har bekräftat att resonemangsinsatsen är den verkliga drivkraften bakom din latens. Betala inte för det om du kör batchgenerering över natten, om din volym är så hög att en 2× tokenpremie springer om den väggklockstid du sparar, eller om du hoppades att nivån i tysthet skulle vara en bättre modell. Det är den inte. Det är GLM-5.3 med ett stoppur igång, och stoppuret debiterar per token.
Den ärliga beskrivningen av hela GLM-5.3-familjen just nu är att Z.ai släppte en modell i augusti och att marknaden har ägnat september åt att paketera om den till fyra olika priser. GLM 5.3 Prime är det dyraste av dessa paket. Det är också det med den tunnaste dokumentationen, eftersom företaget vars namn står på vikterna inte listar det. Det är inte ett skäl att undvika det. Det är ett skäl att veta exakt vad du köper innan du sätter det i produktion.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
