Ett hero-titelkort för GLM 5.3 Prime med texten ”GLM 5.3 Prime: dubbelt pris, samma vikter”, med underrubriken ”GLM-5.3, augusti 2026, återsäljs som en snabbare serveringskanal i september”, med tre chips som lyder ”Indata / 1M: $2,80 vs $1,40”, ”Utdata / 1M: $8,80 vs $4,40” och ”Multiplikator: exakt 2,0x”, samt en sidfotsrad: ”Samma vikter, samma kontext, samma benchmarks – priset är den enda skillnaden.”
Guides & Insights

GLM 5.3 Prime: Samma GLM-5.3-vikter, till exakt dubbla priset enligt prislistan

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GLM 5.3 Prime kostar 2,80 dollar per miljon indatatokens och 8,80 dollar per miljon utdatatokens. GLM-5.3, modellen den körs på, kostar 1,40 och 4,40 dollar. Det är inte en avrundningsskillnad eller en kampanjbetingad prisskillnad – det är exakt 2,0× på båda raderna, och det är det enda som de två produkterna är oense om. GLM 5.3 Prime är inte en ny modell. Den använder GLM-5.3:s egna vikter, samma vikter som Z.ai öppnade den 25 augusti 2026, bakom en snabbare serveringsstack. GLM-5.3 tillkännagavs den 14 augusti 2026 och nådde API:et den 18 augusti. Ingenting hos den underliggande modellen förändrades när Prime-ID:t dök upp i slutet av september. Det som förändrades var att någon satte en andra prislapp på den.

Om du läser detta därför att en modellista visade dig ett obekant namn bredvid ett bekant, är det korta svaret: du tittar på en serveringstier, inte en release. Det längre svaret är värt två minuter, eftersom aritmetiken är ovanligt ren och härkomsten är ovanligt dunkel.

Vad en "Prime"-nivå är, i ett stycke

En serving-nivå är ett andra produkt-ID som pekar på samma vikter, optimerad för genomströmning snarare än för kostnad. Du får inte en större modell, en längre kontext, ett bättre resonemangsläge eller en bredare verktygsyta. Du får ut tokens snabbare, och du betalar för privilegiet per token i stället för på den väggklockstid du sparade. Den avvägningen är verklig och ibland korrekt — en flerstegets agentloop som gör tio sekventiella anrop drar verkligen nytta av att varje anrop återkommer snabbare — men det är ett latensinköp, inte ett köp av förmåga, och det bör prissättas som ett sådant.

Leverantörens beskrivning av GLM 5.3 Prime säger det outtalade rakt ut: den är "höghastighetsvarianten av Z.ai:s GLM-5.3, som ärver dess fulla kapacitet samtidigt som den levererar 1,5–2× utdatagenomströmning genom inferensaccelerering." Full kapacitet. Samma kontextfönster på 1 000 000 token. Samma utdatatak på 131 072 token. Text in, text ut. Resonemang obligatoriskt, med låg, hög och max ansträngningsnivåer och max som standard — identisk med basmodellen.

Prislistan, sida vid sida

• Indata — GLM 5.3 Prime $2,80 per 1 miljon mot GLM-5.3 $1,40 per 1 miljon
• Utdata — GLM 5.3 Prime $8,80 per 1 miljon mot GLM-5.3 $4,40 per 1 miljon
• Cachad indata — GLM 5.3 Prime $0,56 per 1 miljon mot GLM-5.3 $0,26 per 1 miljon
• Multiplikator — 2,0× på alla tre rader, i båda riktningarna
• Kontext — 1 000 000 tokens för båda
• Maxutdata — 131 072 tokens för båda
• Resonemang — obligatoriskt för båda, samma tre ansträngningsnivåer, samma standard

Cache-posten är den folk missar. En cacheläsning är den billigaste token du någonsin kommer att köpa från en frontiermodell, och det är där agentarbetsbelastningar faktiskt spenderar sin budget — systemprompten, verktygsdefinitionerna och det växande transkriptet läses om vid varje tur. En fördubbling av cachepriset fördubblar den största utgiftsposten i en lång agentsession, vilket innebär att den effektiva merkostnaden för en verklig arbetsbelastning ligger närmare 2× än vad den rubriknoterade skillnaden för färska indatatoken antyder. Om du hoppades att snabbspåret skulle vara billigare i praktiken eftersom du cachar aggressivt, så är det inte.

Vem säljer det egentligen?

Det är här listningen blir intressant, och där en noggrann läsare bör sakta ner. Z.ai:s egen dokumentation, dess modellöversikt och dess publicerade prissida listar ingen Prime-SKU. Sök i leverantörens modell-ID:n efter glm-5.3-prime och du får ingenting. Z.ai:s egen hastighetsnivå är en helt annan produkt på en helt annan linje — GLM-5.3-FlashX, som tillhör den billigare Flash-familjen, lanserades den 18 september 2026 och är prissatt till $0.37 och $1.25 per miljon tokens.

Så Prime är en plattformssidig produkt byggd på Z.ai:s vikter. Två detaljer pekar på vems plattform. Den första är formuleringen "1,5–2× utdatagenomströmning", som är samma ordalydelse som en stor molnleverantör använder för sitt eget accelererade serveringsläge – ett läge man aktiverar genom att byta modell-ID, med funktioner och användningsgränser uttryckligen oförändrade. Den andra är att listningen namnger exakt en uppströmsleverantör bakom slutpunkten. En enda leverantör bakom en SKU i snabbklassen är inte hur en modell med öppna vikter serveras; det är hur en plattforms egen accelererade driftsättning ser ut utifrån.

Inget av det gör GLM 5.3 Prime till en dålig produkt. Det gör det till en produkt med en enda leverantör, vilket är en fråga om resiliens som du bör ställa innan du dirigerar produktionstrafik genom den.

Vad hastighetspåståendet är värt

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-FlashX - the two speed tiers'. The GLM 5.3 Prime column reads 'Input / 1M: $2.80', 'Output / 1M: $8.80', 'Cached input: $0.56', 'Runs on: GLM-5.3 weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: 2.0x'; the GLM-5.3-FlashX column reads 'Input / 1M: $0.37', 'Output / 1M: $1.25', 'Cached input: not listed', 'Runs on: Flash family weights', 'Weights: none, hosted lane', 'Price vs GLM-5.3: under 0.3x'; the footer reads 'Both are serving tiers, not models. Prime per its tier listing; FlashX per the vendor rate card.'

1,5–2×-siffran är ett genomflödespåstående uppmätt under leverantörens egna förhållanden, och genomflöde är det mått som är mest känsligt för dessa förhållanden. Utdata-tokens per sekund med varm cache, kort prompt och ett inaktivt kluster är inte den siffra en långkontextagent ser. Oberoende mätning av basmodellen placerar GLM-5.3 på ungefär 61 utdata-tokens per sekund och GLM-5.3-Flash på omkring 46, i ett urval där klassgenomsnittet är 67 – så den billigare banan är också den långsammare, vilket är motsatsen till vad namnen antyder. Dessa är medianer över en standardiserad utvärderingsuppsättning, inte toppar.

Det finns också en subtilare kostnad. Standardinställningen för resonemangsinsats på båda ID:na är max, vilket är inställningen som producerar de längsta tankekedjorna. Hastighet och utförlighet drar här i olika riktningar: en snabb nivå som dessutom resonerar med maximal längd kan fortfarande vara långsam från början till slut på ett svårt problem, eftersom flaskhalsen är antalet tokens som modellen väljer att generera, inte hastigheten med vilken den genererar dem. Om din arbetsbelastning är resonemangstung, gå ner till high eller low innan du betalar 2× för acceleration — insatsnivån kommer att påverka din latens mer än serveringsnivån gör.

Tre sätt att köpa samma modell

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text input and text output with tools, JSON and reasoning, a 2026-08-18 date beside 'Public benchmarks by Z.ai', a p50 time to first token of 3.91 seconds, and a stat strip reading $1.26 input, $3.96 output, 3.91 s p50 TTFT, 10.00 s p95 TTFT and 1,733.9M tokens.

GLM-5.3 finns nu i tre köpbara former, och de är inte tre modeller:

• GLM-5.3 för $1,40 / $4,40 — basprislistan, full kapacitet, versionen med publicerade öppna vikter som du kan hosta själv
• GLM 5.3 Prime för $2,80 / $8,80 — samma vikter via en accelererad stack, en enda uppströmsleverantör, inga vikter inblandade
• GLM-5.3-FlashX för $0,37 / $1,25 — inte GLM-5.3 alls, utan snabbnivån i den billigare Flash-familjen, och det i särklass billigaste sättet att köpa latens

Den tredje raden är den som är värd att stirra på. Om det du egentligen vill ha är snabbare tokens och du är flexibel med vilken GLM du får dem från, ger FlashX acceleration på en modell som redan kostar ungefär en tiondel av flaggskeppet, för mindre än hälften av vad flaggskeppet kostar utan acceleration. Prime är bara vettigt om du specifikt behöver GLM-5.3:s resonemangskvalitet och specifikt behöver den snabbare.

Var detta ligger hos oss

A tall screenshot of the same OrcaRouter model page for GLM 5.3 (captured September 24, 2026) showing the PRICING block reading $1.26 per 1M input tokens, $3.96 per 1M output tokens and $0.234 per 1M cache read in USD, a token and cost estimator, and a PERFORMANCE panel for the last 7 days reading p50 TTFT 3.91 s, output speed 73.6 tokens per second, p95 TTFT 10.00 s and an error rate of 0.14%.

Vi bör vara tydliga med en sak: OrcaRouter hostar inte GLM 5.3 Prime, och vi hostar inte heller GLM-5.3-FlashX. Båda modellsidorna returnerar 404 på vår webbplats. Om du vill ha den accelererade nivån måste du köpa den från plattformen som säljer den, eller från leverantörens eget API för basmodellen.

Det vi gör är att hosta GLM-5.3 och GLM-5.3-Flash, till leverantörens listpris med noll påslag från oss — samma $1.40 och $4.40 som du ser på Z.ai:s egen prislista, vidarebefordrade i stället för omprissatta. Det spelar större roll än det låter för en modell vars prissättning har ändrats två gånger på sex veckor. Eftersom vi inte lägger på någon marginal är en leverantörsprisändring live hos oss samma dag som den är live hos dem, utan migrering eller supportärende. Båda ID:na ligger bakom en och samma API-nyckel tillsammans med över 200 andra modeller, så en A/B mellan GLM-5.3 och GLM-5.3-Flash är ett enradigt byte av modellnamn snarare än ett andra avtal, och automatisk failover täcker dig om en enskild uppströmsleverantör försämras — vilket är den specifika risk som en snabb nivå hos en enda leverantör medför.

Bör du betala 2×?

Betala för det om en människa eller en uppströmstjänst är blockerad i väntan på svaret, om arbetsbelastningen begränsas av latens snarare än av genomströmning, och om du redan har bekräftat att resonemangsinsatsen är den verkliga drivkraften bakom din latens. Betala inte för det om du kör batchgenerering över natten, om din volym är så hög att en 2× tokenpremie springer om den väggklockstid du sparar, eller om du hoppades att nivån i tysthet skulle vara en bättre modell. Det är den inte. Det är GLM-5.3 med ett stoppur igång, och stoppuret debiterar per token.

Den ärliga beskrivningen av hela GLM-5.3-familjen just nu är att Z.ai släppte en modell i augusti och att marknaden har ägnat september åt att paketera om den till fyra olika priser. GLM 5.3 Prime är det dyraste av dessa paket. Det är också det med den tunnaste dokumentationen, eftersom företaget vars namn står på vikterna inte listar det. Det är inte ett skäl att undvika det. Det är ett skäl att veta exakt vad du köper innan du sätter det i produktion.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen