
GPT-6.1 Sol vs GLM-5.3: Vikterna skeppades, och notan rörde sig inte
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
OpenAI släppte GPT-6.1 Sol den 29 september 2026 på sin DevDay-keynote, och Z.ai släppte GLM-5.3 sex veckor tidigare, den 18 augusti 2026, och höll sedan tillbaka checkpointen i en vecka. Den fördröjningen är över: zai-org/GLM-5.3 har funnits på Hugging Face sedan den 25 augusti, en BF16/FP8-checkpoint på ungefär 753 miljarder parametrar varav omkring 40 miljarder är aktiva per token, och den har sedan dess passerat 1,4 miljoner nedladdningar. Så frågan som de flesta jämförelser har ställt sedan augusti – är detta en öppen modell eller en hyrmodell? – har ett svar, och svaret förändrade inte kalkylen. På den oberoende resultattavlan får GPT-6.1 Sol 51,8 poäng och kostar 0,72 dollar per slutförd indexuppgift; GLM-5.3 får 44,8 poäng och kostar 2,01 dollar. Du kan nu äga modellen som är billigare per token och ändå betala nästan tre gånger mer per slutfört jobb.
Vad varje modell faktiskt är
GPT-6.1 Sol är OpenAI:s GPT-6-modell i mellanskiktet, ett steg under flaggskeppet GPT-6 Astra och över budgetmodellen GPT-6 Luna. Den har ett kontextfönster på 1 050 000 tokens med ett utdatatak på 128 000 tokens och en kunskapsgräns den 30 april 2026, och den tar emot text, bilder och filer som indata. Resonemanget sträcker sig från low till max med standardvärdet medium; värdena none och minimal som GPT-6 Sol accepterade returnerar nu ett fel, vilket OpenAI:s egen migreringsvägledning hanterar genom att uppmana utvecklare att ersätta med low. Det kostar $2.00 per miljon indatatokens och $10.00 per miljon utdatatokens, med cachad indata för $0.10.
GLM-5.3 är Z.ai:s nuvarande flaggskepp för mjukvaruutveckling och långsiktigt agentiskt arbete, byggt på samma mixture-of-experts-bas som GLM-5.2, där vinsterna kommer från efterträning snarare än från en större modell. Det är text in, text ut – ingen vision, oavsett pris – med ett fönster på 1 miljon token, ett tak för utdata på 128 000 token och tänkandet permanent påslaget. Det finns inget icke-resonerande läge, vilket är en hård begränsning för ett latenskänsligt anrop. Z.ai listar det till 1,40 USD in och 4,40 USD ut per miljon token med cachad indata till 0,26 USD; vår egen katalog har det till 1,26 USD och 3,96 USD med en cacheread på 0,234 USD, så leverantörens kort är den mer konservativa siffran och den man bör argumentera utifrån.
Prislistan, och raden som inverterar den
En rad per dimension, båda sidorna på varje:
• Indata — GPT-6.1 Sol $2,00 per 1M vs GLM-5.3 $1,40 per 1M; GLM är 30 % billigare
• Utdata — GPT-6.1 Sol $10,00 per 1M vs GLM-5.3 $4,40 per 1M; GLM är 56 % billigare
• Cachad indata — GPT-6.1 Sol $0,10 per 1M vs GLM-5.3 $0,26 per 1M; ordningen vänds, Sol är 2,6× billigare
• Klausul för lång kontext — GPT-6.1 Sol omprissätter hela begäran över 272 000 indatatoken till 2× indata och cache och 1,5× utdata, medan GLM-5.3 inte har någon motsvarande klausul på det publicerade kortet
• Kontext och utdata — 1 050 000 in / 128 000 ut vs 1M in / 128 000 ut; en skillnad på 5 %, oväsentlig
• Modalitet — text, bild och fil in, text ut vs endast text
• Resoneringsgolv — GPT-6.1 Sol låg, medel (standard), hög, xhigh, max vs GLM-5.3 alltid på, inget golv att sänka till
• Vikter — slutna, endast API vs öppna, nedladdningsbara, FP8
• Oberoende poäng, Artificial Analysis v4.3.2 vid maximal ansträngning — 51,8 vs 44,8
• Oberoende kostnad per indexuppgift — $0,72 vs $2,01
• Utdatatoken för indexkörningen — 67 miljoner vs 210 miljoner
img src="2.png" alt="En genererad tvåkolumns-jämförelsetavla med rubriken 'GPT-6.1 Sol vs GLM-5.3 – resultattavlan'. Vänster kolumn 'GPT-6.1 Sol': rader som lyder 'Intelligence Index: 51.8', 'Kostnad per indexuppgift: $0.72', 'Inpris: $2.00 per 1M', 'Utpris: $10.00 per 1M', 'Uttoken vid indexkörning: 67M', 'Vikter: stängda'. Höger kolumn 'GLM-5.3': rader som lyder 'Intelligence Index: 44.8', 'Kostnad per indexuppgift: $2.01', 'Inpris: $1.40 per 1M', 'Utpris: $4.40 per 1M', 'Uttoken vid indexkörning: 210M', 'Vikter: öppna på Hugging Face'. En sidfot lyder 'Oberoende siffror enligt Artificial Analysis v4.3.2 vid maximal ansträngning; leverantörernas listpriser.' OrcaRouter-logotypen sitter i nedre högra hörnet." /> Det sista paret är där den här matchen avgörs, och det är ingen subtil effekt.

210-miljoner-token-problemet
Artificial Analysis kör samma svit med tio utvärderingar mot varje modell på resultattavlan och publicerar tokenantalen bakom varje poäng. GLM-5.3 genererade ungefär 210 miljoner utdatatoken när den slutförde körningen. GPT-6.1 Sol genererade 67 miljoner. Jämfört med varje modells egen jämförelseklass på resultattavlan ligger GLM-5.3:s 210 miljoner över en klassmedian på omkring 140 miljoner, medan Sols 67 miljoner ligger klart under medianen på ungefär 81 miljoner för den flaggskeppsklass som den poängsätts i. Eftersom utdata är den dyra sidan av varje prislista överlever GLM-5.3:s framhävda 56 % rabatt på utdataraden inte mötet med mätningen: den avger 3,1× antalet token till 0,44× priset, och 3,1 × 0,44 är 1,37 — GLM-5.3 är den dyrare modellen för denna arbetsbelastning trots en avsevärt billigare prislista.
Styrelsens egen siffra för kostnad per uppgift bekräftar riktningen och den ungefärliga storleken. 2,01 $ mot 0,72 $ är 2,8×, större än vad enbart tokenkvoten antyder, eftersom GLM-5.3 också betalar mer för input- och cacheraderna per uppgift. Det är värt att vara noggrann med vad detta bevisar och inte bevisar: indexkörningen är tio fasta utvärderingar, och ordrikedomen i dem är inte densamma som ordrikedomen i din trafik. Men för en köpare är det tokens som faktureras, och skillnadens form är densamma för alla uppgiftsset där modellen måste producera ett långt svar.
Den partiella kompensationen utgörs av raden för cachad indata. GLM-5.3:s cache-läsning är $0,26 mot en bas på $1,40, och GPT-6.1 Sol:s är $0,10 mot en bas på $2,00 — Sol vinner med en faktor 2,6 på en taxa som dominerar varje arbetsbelastning med ett stabilt prefix. Om din trafik är en stor fast korpus med ett svar på ett stycke är GLM-5.3 utan vidare det billigare alternativet, och du bör välja det. Om din trafik liknar den trafik som båda dessa modeller byggdes för – agentloopar, redigeringar i reposkala, långa genererade utdata – krymper fördelen med cachad indata till brus bredvid en tokenkvot på 3×.
Var leverantörsnumren hamnar
Z.ai:s lanseringstal är starka och, som alltid, oreproducerade. Terminal-Bench 2.1 på 88,2, DeepSWE v1.1 på 66,9, CyberGym på 84,5, ExploitBench på 54,4, AutomationBench på 48,2, GDPval-AA v2 på 1769 Elo. Den enda siffra som är värd att läsa två gånger är Terminal-Bench 3.0 på 28,3 – uppföljarbenchmarken, och korrigeringen av 88,2 på den äldre. En modell kan vara utmärkt på det benchmark som dess efterträning riktade in sig på och ordinär på nästa generation av samma benchmark.
OpenAI:s lanseringssiffror för GPT-6.1 Sol är helt uppbyggda kring kostnad per slutförd uppgift snarare än råpoäng: DeepSWE v1.1 slår GPT-6 Sols bästa med 6,4 procentenheter vid lägre resonemangsansträngning, AutomationBench 1.0.6 ligger 2,2 punkter över Claude Opus 5.5 vid medelhög ansträngning, OSWorld 2.0 ligger sju punkter över GPT-6 Sol vid maximal ansträngning, Terminal-Bench Science 0.1 är mer än dubbelt så högt som GPT-6 Sol till mindre än halva kostnaden per uppgift. Observera att dessa är OpenAI:s testramverk med OpenAI:s inställningar på OpenAI:s valda benchmarkuppsättning, och att ingen av dem har reproducerats oberoende.
Överlappningen mellan de två leverantörernas publicerade uppsättningar är liten, och den enda direkta jämförelse som finns är på samma benchmark: Z.ai rapporterar 66,9 på DeepSWE v1.1, OpenAI rapporterar 68,8 för GPT-6 Sol – modellen som 6.1 ersätter – och en förbättring på 6,4 punkter för 6.1 Sol jämfört med sin egen föregångare. Två punkter skiljer dem åt i den leverantörsrapporterade jämförelsen, och ungefär sex punkter i OpenAI:s egen differens. Det är nära en kontrollerad jämförelse, och det säger samma sak som den oberoende nämnden säger: nästan paritet i förmåga, ett stort gap i vad det kostar att slutföra jobbet.
Ett API, eller två kontrakt
Båda modellerna finns på OrcaRouter, vilket är det ovanliga med den här kombinationen. GPT-6.1 Sol landade i katalogen till OpenAI:s eget listpris på releasedagen — $2.00 och $10.00 per miljon tokens, cachad indata $0.10, med steget på 272 000 tokens till $4.00 och $15.00 vidarebefordrat exakt som leverantören listar det — och GLM-5.3 finns bredvid den till $1.26 och $3.96 med en cacheläsning på $0.234. Inget läggs på någon av dem: plattformen för vidare leverantörens listpris oförändrat, vilket är anledningen till att en leverantörs prissänkning dyker upp hos oss samma dag i stället för efter att en återförsäljare har omförhandlat.

Det spelar större roll för just det här paret än för de flesta. Valet mellan dem är inte ”vilket som är bättre” – det är en tröskel för din egen utdatalängd, och den kommer att förskjutas första gången Z.ai skärper sin prislista eller OpenAI ändrar gränsen för 6.1-nivån. Att hålla båda bakom en och samma nyckel, med automatisk redundansväxling mellan dem och en routningsregel som du ändrar i konfigurationen i stället för i en driftsättning, är det som låter dig testa den tröskeln på verklig trafik i stället för att argumentera om den. Om Sols cachelinje vinner för din arbetsbelastning, routa på den; om dina svarslängder håller sig korta och GLM-5.3:s platta prislista utan kontextstup vinner segmentet, routa på det i stället – samma nyckel, inget andra kontrakt, ingen andra faktura.

Vilken av dem, om du måste välja idag
• Långa genererade utdata, agentiska loopar, utdatatungt arbete — GPT-6.1 Sol, och marginalen är nära trefaldig när tokenantalet tillämpas. Det är här prislistan ljuger och mätningen inte gör det.
• Stabilt prefix, kort svar — GLM-5.3. Dess priser för cachad indata och indata är genuint bättre och mångordigheten får aldrig en chans att bita.
• Alla förfrågningar över 272 000 indata-tokens — GLM-5.3, eftersom GPT-6.1 Sol prissätter om hela begäran vid den gränsen och GLM-5.3:s prislista inte har något motsvarande steg.
• Allt med en bild eller ett dokument som visuellt indata — GPT-6.1 Sol. GLM-5.3 är endast text och det är inte ens nära.
• Inferens inom din egen gräns, eller en säkring mot att en leverantörs villkor ändras — GLM-5.3, och nu finns nedladdningen i stället för att bara vara utlovad. Budgetera för hårdvaran: checkpointen är en stor FP8-artefakt och egen hosting är ett kapitalbeslut, inte ett API-beslut.
• Latenskänsliga anrop — ingendera utan försiktighet. GLM-5.3 har inget sätt att stänga av resonemang; GPT-6.1 Sol har en nedre gräns vid inställningen låg, och dess egen tid-till-första-token på den oberoende tavlan uppmättes till 332 sekunder mot tavlans median på 3,7.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
