GLM-5.3-Flash avslöjad — den anonyma "Ox Alpha" var Zhiou:s öppna multimodala gränsmodell hela tiden. Regenererad illustration.
Guides & Insights

GLM-5.3-Flash, fem veckor senare: en oberoende 42, en exploitkörning på Mythos-nivå och GLM-agenten som byggde om sin egen serving-stack

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

GLM-5.3-Flash har hanterat produktionstrafik i fem veckor, och den 17 september 2026 sade Zhipu AI något om var: företaget avslöjade att varje produktionsförfrågan för GLM-5.3-Flash nu körs på en flotta med fler än 100 000 inhemskt tillverkade kinesiska AI-acceleratorer, att den gick från första uppstart på den hårdvaran till att bära hela sin live-arbetsbelastning på under två veckor, och att genomströmningen från ände till ände ökade 3,2x under samma period. Det som har nått längst är vem som utförde arbetet. Mycket av det gjordes inte av inferensteamet utan av en agent som drevs av GLM-5.3 själv, vilken läste flaskhalsar, föreslog åtgärder och skrev kod för inferenssystem, medan ingenjörer satte upp mål, byggde återkopplingsmiljön och granskade allt som rörde numerisk semantik, samtidighet eller produktionsrisk. GLM-5.3-Flash är den multimodala modellen med 320 miljarder totalt och 18 miljarder aktiva (320B-A18B) som Zhipu lanserade och släppte som öppen källkod den 26 augusti 2026 – den anonyma "Ox Alpha" som företaget avslöjade den dagen – och dess större syskon GLM-5.3 är 743B-flaggskeppet som den prissattes i förhållande till. Inget av de tre siffrorna i dagens avslöjande kom från oss eller från någon annan: de är Zhipus egna. Flaggskeppet är inte heller längre den enda jämförelsen som spelar roll: på ExploitBench, en oberoende utvärdering av hur långt en modell klättrar på en verklig Chrome-exploitstege, har GLM-5.3-Flash nu uppmätts i nivå med Claude Mythos Preview, den slutna frontlinjemodellen som dess utvecklare endast släppte till granskade försvarare, till en bråkdel av kostnaden per försök.

Det är de goda nyheterna, och de är verkliga men leverantörsangivna. Tre andra saker har förändrats sedan det här inlägget först publicerades på lanseringsdagen, och två av dem drar i motsatt riktning. Artificial Analysis har nu publicerat sin egen mätning av modellen, och deras siffra är inte Zhipus. Lanseringsrabatten som gjorde detta till marknadens billigaste kapabla modell löpte ut enligt plan den 9 september och förlängdes inte. Och en tredjepartsutvärderare, Generality Labs, har publicerat sin egen ExploitBench-körning där GLM-5.3-Flash fick högre resultat än Claude Mythos Previews genomsnitt över tre körningar i samma stege – för ungefär sex cent per dollar. För alla som bokmärkte den här modellen i slutet av augusti som ”den billiga”, ser kalkylen annorlunda ut i dag än den gjorde då, och den ärliga rubriken är blandad: serveringsekonomin förbättrades verkligen, priset gick upp eftersom en kampanj tog slut, den flitigt citerade intelligenssiffran överlevde inte första kontakten med en oberoende testrigg, och den förmågejämförelse som faktiskt gick modellens väg är en enda icke referentgranskad körning vars egna författare säger att man inte bör övertolka den.

Zhipu är den enda källan för klusterstorleken, tvåveckorstidslinjen och 3,2x — det finns ingen oberoende granskning av någon av dem, och företaget självt säger att det inte har uppnått rekursiv självförbättring, och beskriver resultatet som en loop i minsta skala snarare än den riktiga saken. Det som kan kontrolleras, kontrollerade vi: den enda konkreta artefakten i redogörelsen som finns utanför Zhipus väggar — en precisionsfix i en Flash Linear Attention-kernel — är genuint mergad uppströms, och vi bekräftade det. När en siffra nedan kommer från Zhipu, anger den det. När den kommer från Artificial Analysis, anger den det i stället. När den kommer från Generality Labs — säkerhetsutvärderingsorganisationen bakom exploit-siffrorna i det här inlägget — anger den det, tillsammans med de förbehåll som dess författare själva bifogade: en körning, 41 buggar, en självpublicerad metod, ingen tredjepartsreproduktion och en kontaminationsfråga som de tar upp på eget initiativ. När en siffra är Anthropics — de enda siffrorna här som kommer från ett labb med ett konkurrerande intresse i svaret — säger brödtexten vilken modell den faktiskt mätte, eftersom inte alla av dem är den här.

Vad som faktiskt levererades

GLM-5.3-Flash är en mixture-of-experts-modell med 320B totalt / 18B aktiva och 45 lager, vilket gör att dess aktiva avtryck är lite drygt hälften av GLM-5.2:s cirka 32B. Den främsta förmågan är modalitet: den tar emot text-, bild- och videoindata inbyggt – den första GLM-5-modellen som gör det – i stället för att dirigera visionen genom en separat adapter. Kontexten sträcker sig upp till 1 miljon tokens, och Zhipu hävdar att kostnaden för långkontextbetjäning landar på ungefär en tredjedel av GLM-5.3:s.

Vad gäller arkitekturen beskriver Zhipu den som den första frontiermodellen med öppen källkod som kombinerar hybrid sparse-plus-linear-uppmärksamhet med Manifold-Constrained Hyper-Connections (mHC) för skalning och en IndexPool-mekanism som komprimerar fyra nyckel-vektorer från indexerarna till en viktad pool för att minska latensen vid lång kontext. Förträningen kördes på en multimodalkorpus med 30 biljoner token. Inget av detta är oberoende granskat – det är Zhipu som beskriver sin egen modell – men påståendena om serveringseffektivitet är tillräckligt specifika för att kunna testas nu när vikterna ligger framför den öppna inferensstacken, och redogörelsen från den 17 september tillför den första detaljerade bilden av hur serveringssidan faktiskt byggdes.

Lanseringsdagens specifikationsblad, i korthet:

Parametrar — 320B totalt / 18B aktiva, 45 lager, MoE.

• Modalitet – inbyggd text-, bild- och videoinmatning; textutmatning.

• Kontextfönster — upp till 1 000 000 tokens.

• Licens — MIT, öppna vikter på Hugging Face sedan lanseringsdagen.

• Pris — 0,15 $ / 0,50 $ per miljon tokens (indata / utdata), 0,03 $ per miljon cachad indata.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

Det där kortet är en ögonblicksbild från lanseringsdagen, och två av dess rader har ändrats sedan den 26 augusti. Siffran för AA Index är fortfarande Zhipus egen uppgift och motsägs nu av oberoende mätning – mer om det nedan. Det rabatterade pris som visas finns inte längre; kampanjen avslutades den 9 september. Parameterantal, kontextfönster, licens och modalitet är oförändrade aktuella fakta, och det är vad bilden främst är till för.

Ox Alpha-veckan, och vad den gratis giveawayen egentligen testade

Avslöjandet avslutade en vecka av spekulation. Den 20 augusti dök en anonym modell upp på en tredjeparts AI-API-plattform med ett kontextfönster på 1 miljon token, text-/bild-/videoinmatning och ett pris på noll, och den blev snabbt den mest anropade modellen på plattformens veckolistor. Communityn spårade den tillbaka till Zhipus GLM-familj inom 48 timmar – samma mönster där modellen först är anonym och sedan tas i anspråk, vilket tidigare hade identifierat modeller från andra kinesiska labb – och analytiker gissade i bred enighet på en Flash-variant av GLM-5.3. Tillkännagivandet den 26 augusti bekräftade gissningen: den kostnadsfria veckan var ett avsiktligt test, och företaget säger att den anonyma körningen processade över 62 biljoner token på sex dagar över de kodningsplattformar där den erbjöds, allt levererat från inhemska kinesiska chip.

Den där sista klausulen såg ut som en fotnot då. Det visade sig vara själva poängen. Gratisveckan var inte i första hand ett marknadsföringstrick eller ens ett belastningstest av modellen; det var ett belastningstest av acceleratorflottan under den, kört i en skala där ett misslyckande skulle ha varit offentligt och gratis. Tre veckor senare beskriver Zhipu samma flotta som att den hanterar 100 % av modellens produktionstrafik.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

Prissättningslogiken den veckan står sig fortfarande, med en korrigering. En modell som gavs bort för 0 dollar i en vecka och sedan lanserades till en tiondel av flaggskeppets pris med ytterligare 50 % rabatt var ett avsiktligt marknadsskapande drag i budgetsegmentet, och bestämningen "begränsad tid" var alltid den del man skulle hålla ögonen på. Vi flaggade det som något som kunde dras tillbaka. Det drogs tillbaka enligt plan – vilket är värt att säga rakt ut, eftersom rabattens utgång är den enda förändringen i den här historien som syns på en räkning.

Serveringsstacken som en agent återuppbyggde

Zhipus tekniska redogörelse den 17 september är den första detaljerade beskrivningen av hur GLM-5.3-Flash betjänas på kinesiskt kisel, och dess centrala påstående är att en modell hjälpte till att optimera systemet som kör den. Företaget kallar mekanismen dense feedback: korrekthetstester, exekveringsloggar, spårningar, mikrobenchmarks och end-to-end-mätvärden kopplades samman så att en agent kunde validera en hypotes lokalt i stället för att vänta på en fullständig driftsättning och belastningstest efter varje ändring. För att det skulle fungera säger Zhipu att återkopplingen måste vara lokal, billig och objektivt kontrollerbar — bunden till en specifik kärna eller kodväg, tillräckligt snabb att iterera på, och sann eller falsk utan en människa i loopen.

Med den loopen på plats hittade och åtgärdade agenten tre saker som företaget har beskrivit i detalj:

• En kontextparallell väg i KDA-kärnan tappade precision när sekvenserna växte, eftersom tl.dot använde TF32 som standard trots FP32-indata, vilket förvärrade avrundningsfelet i takt med kontextlängden. Åtgärden låser indataprecisionen till tf32x3, med en fallback till ieee på plattformar utan TF32-stöd. Den här är den mest intressanta av de tre, eftersom det är det enda påståendet i redogörelsen som lämnar Zhipus egen infrastruktur: ändringen är mergad uppströms i Flash Linear Attention som PR #1180, vilken vi kontrollerade och bekräftade vara mergad den 27 augusti 2026.

• KV-överföringen överlappade inte med DeepEP:s schemaläggning. Varken intranod-dispatch eller intranod-combine släppte Python GIL i den DeepEP-version som användes, vilket gjorde att överföringstråden fastnade bakom dem; engelskspråkiga och kinesiskspråkiga återgivningar av samma text angav den resulterande overheaden till över 20 % respektive över 30 %. Efter korrigeringen säger Zhipu att gapet mot dess prefill-only-baslinje sjönk till under 1 %.

• En avkodningskernel räknade om samma FP32-normalisering och gating fyra gånger, en gång per V-dimensionstile. Att dela upp divisionsarbetet minskade kerneltiden med 9,6 %, och att slå samman tilearna till ett enda trådblock – så att normaliseringen körs en gång – gav en hastighetsökning på 1,71x.

Runt dessa korrigeringar ligger de strukturella förändringarna: ReplaySSM, som byter beräkningskraft mot on-chip-minne eftersom acceleratorerna har mindre av det senare än de GPU:er som stacken ursprungligen skrevs för; tensorparallellism inom noden för att lätta på samma tryck; blandad INT8-, FP8- och BF16-cachning för att sträcka ut kapaciteten; och en Encode-Prefill-Decode-disaggregerad arkitektur som schemalägger de tre inferensstegen separat i stället för som en enda pipeline. Zhipu nämner också begränsningarna ärligt – begränsat on-chip-minne och interconnect-bandbredd, omogen programvara, ofullständig kärntäckning och tunn dokumentation – och säger att man inte har uppnått rekursiv självförbättring, och beskriver resultatet som en loop i minsta skala.

Läs redogörelsen med skepsis, eftersom incitamenten är uppenbara. Zhipu kommer inte att säga hur stor del av arbetet som agenten gjorde jämfört med hur stor del ingenjörerna gjorde, och det finns ingen extern granskning av genomströmningssiffran, tvåveckorstidslinjen eller klusterstorleken. Inramningen av tät återkoppling är också självservande på ett specifikt sätt: den gör att det mest imponerande påståendet (”vår modell förbättrade sig själv”) vilar på den minst kontrollerbara bevisningen (en intern loop som ingen kan granska). Det som hindrar berättelsen från att vara ren marknadsföring är att dess mest konkreta påstående är falsifierbart och visar sig vara sant – fixen för tf32x3-kärnan finns verkligen i upstream-repositoriet, daterad den 27 augusti, tre veckor före presscykeln kring den.

Vad det kostar, i faktiska dollar

Prislistan är Zhipus, och den är enkel: $0.15 per miljon indatatoken, $0.50 per miljon utdatatoken och $0.03 per miljon cachade indatatoken. Det är listpriset i dag. Lanseringskampanjen med 50 % rabatt pågick till och med den 9 september 2026 och förlängdes inte, så siffrorna $0.075 / $0.25 / $0.015 som cirkulerade flitigt i slutet av augusti finns inte längre tillgängliga i leverantörens eget API. Jämfört med GLM-5.3:s publicerade $1.40 / $4.40 hamnar Flash fortfarande på ungefär en tiondel enligt listpris — rabatten var en bonus ovanpå ett pris som redan var själva poängen, inte priset i sig. Artificial Analysis beräknar en blandad taxa på cirka $0.10 per miljon token vid en mix på 7:2:1 av cacheträffar/input/output, och anger utdatahastigheten till ungefär 117 token per sekund, vilket de beskriver som anmärkningsvärt snabbt, även om AA påpekar att hastighetssiffrorna avser modellens förstaparts-API snarare än ett test som AA har kört.

Zhipus bredare kostnadsberättelse är anledningen till att priset kan ligga där. I sina halvårsresultat, publicerade den 31 augusti, uppgav företaget att inferenskostnaden per unit-token i dess inhemska flotta med 100 000 acceleratorer hade sjunkit 80 % sedan början av 2026, och att API-bruttomarginalen gick från -0,4 % till 24,6 % till följd av skalfördelar, prissättning och billigare servering. Det är företagssiffror från ett företag som rapporterar till aktieägare, och de är inte granskade av oss; behandla dem som riktningsvisande snarare än exakta. Redogörelsen för servering ovan är mekanismen bakom påståendet – färre redundanta kernel-genomkörningar, mindre minnestryck, bättre överlappning – vilket är en mer trovärdig berättelse än enbart en procentsats, även om det är procentsatsen som kommer att citeras.

Effektivitetsanspråken mot flaggskeppet är oförändrade: attention-beräkning ned 3,0x och KV-cache ned 4,4x jämfört med GLM-5.3, enligt leverantörens uppgifter, och Zhipu medger att deras KV-cache fortfarande är något större än DeepSeek V4 Flash och Kimi K3. Lanseringstidens anspråk på en 3x end-to-end-förbättring av serving på inhemska chip anges nu som 3,2x, mätt från första uppstart till full produktionstrafik. Båda siffrorna är Zhipus, och de två redogörelser som bär dem ligger tre veckor isär — inget av detta har reproducerats utanför företaget.

Varför avslöjandet är viktigt – och vart rubriksiffran tog vägen

Här är den rättelse som betyder mest för alla som läste lanseringsbevakningen och höll fast vid siffran. Zhipus material angav GLM-5.3-Flash till 57 på Artificial Analysis Intelligence Index, i linje med Claude Opus 4.8. Artificial Analysis har sedan dess publicerat sin egen mätning av modellen på Intelligence Index v4.3, och den visar 42 – mot 47 för GPT-5.6 Sol (max) i samma version. 57 var aldrig en oberoende siffra; den var Zhipus, och oberoende mätning placerar modellen ungefär fem punkter under det frontier-nära bandet och klart under leverantörens rubriksiffra. På samma aktuella index mäter GLM-5.3 själv 45, så siffran 60 för flaggskeppet som förekom i vår lanseringsbevakning motsvarar inte längre vad Artificial Analysis publicerar i dag. Gapet på 15 punkter mellan påstående och mätning är inte en avrundningsskillnad, och det är det enskilt mest användbara en läsare kan ta med sig från den här uppdateringen – med ett förbehåll som avsnittet nedan tillägger, eftersom den andra oberoende mätningen i den här artikeln pekar i motsatt riktning.

Det som kvarstår efter den korrigeringen är snävare men fortfarande verkligt. GLM-5.3-Flash är en multimodal modell med öppna vikter, 1M kontext och inbyggd bild- och videoinmatning till ungefär en tiondel av listpriset för sitt flaggskeppssyskon — en kombination utan direkt motsvarighet från de amerikanska frontier-labben, vars jämförbara multimodala modeller kostar betydligt mer och släpps som stängda. Zhipus egen formulering, ”frontier intelligence, flash cost”, är den del som fick ta smällen: vid ett uppmätt värde på 42 är det en stark budgetmodell, inte en frontier-modell till rabattpris. Oberoende mätningar visar också att den ligger med god marginal över medianen för modeller med öppna vikter i liknande storlek, vilket är en verklig bedrift för en modell med 18B aktiva parametrar och en tiondel av inferenskostnaden — det är bara en annan bedrift än vad lanseringsbevakningen antydde.

Det andra oberoende numret – och det gick i modellens favör

Om resultatet från Artificial Analysis sänkte GLM-5.3-Flash ett snäpp, går den här åt andra hållet, och det är det märkligaste faktumet i historien. ExploitBench, byggt vid Carnegie Mellon, frågar inte om en modell kan krascha ett mål. Det poängsätter klättringen: att nå den sårbara koden, utlösa buggen, bygga återanvändbara primitiver och slutligen fullständig kontrollflödeskapning med godtycklig kodkörning, betygsatt mekaniskt mot produktions-V8 med säkerhetssandlådan påslagen. Generality Labs körde GLM-5.3-Flash över 41 buggar med en budget på 1 miljard tokens per bugg snarare än benchmarkens vanliga gräns på 300 turer, med argumentet att turer är en dålig proxy för vad en köpare faktiskt spenderar och att dollar är den ärliga begränsningen. GLM-5.3-Flash nådde full godtycklig kodkörning på 13 av de 41, och en genomsnittlig kapacitetspoäng på 64,8 % av stegens maximum. Claude Mythos Previews tre publicerade körningar fick 9, 10 och 11 på samma stege — ett medelvärde på 10, eller 62,2 %. Generalitys egen formulering, tryckt under diagrammet, är att GLM-5.3-Flash ”kan vara på Mythos-nivå inom cyber” vid denna mätning. Anthropics egen ExploitBench-körning, publicerad 29 september, rapporterar samma ordning vid mycket lägre absoluta frekvenser — dock på flaggskeppet GLM-5.3, inte på Flash: den räknar end-to-end-exploater per försök snarare än framsteg i stegen, och placerar GLM-5.3 på 50 av 410 mot Mythos Previews 56 av 410. Olika räkneregler, liknande ordning — vilket är precis varför en ExploitBench-siffra aldrig bör citeras utan att regeln bifogas.

Anledningen som spelar roll är nämnaren under den. Körningen prissatte GLM-5.3-Flashs uttoken till $0.25 per miljon — dess lanseringspris med 50 % rabatt, som sedan dess har löpt ut — mot Claude Mythos Previews historiska $125 per miljon, en 500-faldig skillnad. Vid kostnadsparitet spenderade körningen $16.81 per sårbarhet mot Mythos $297.17, vilket är där siffran på ungefär 6 % kommer ifrån. Läs påståendet noggrant, för den version som cirkulerar är fel. Det är inte att GLM-5.3-Flash är en bättre exploitutvecklare än Claude Mythos Preview. Det är att en dollar GLM-5.3-Flash-tokens köper ungefär vad en dollar Mythos-tokens köper för den här specifika uppgiften, och att du har råd med många fler dollar av den förra.

Generalitys egna förbehåll är värda mer än rubriken. De säger klart och tydligt att en enstaka körning inte fastställer paritet inom cyber som helhet, att kontaminering är en öppen fråga – ExploitBench kan ha tränats mot på något sätt – och att fyra av de 41 exemplen innehöll fel och poängsattes genom att föra det senast observerade resultatet framåt, vilket om något underskattar modellen. De publicerade också en uppföljning den 28 september som komplicerar hela jämförelsen. Genom att köra GLM-5.3-Flash genom sju olika agentramverk med en budget på 250 miljoner tokens, på tio urval valda för att spänna över svårighetsintervallet, fick samma vikter 10.6 under Codex-ramverket – över Claude Mythos Previews referens på 10.02 – och 6.2 under Claude Code-ramverket, till och med under benchmarkens ursprungliga tur-begränsade konfiguration på 6.4. Ramverket flyttade poängen mer än vad modelljämförelsen gjorde, och författarna säger att delmängden med tio urval förmodligen inte är representativ. Att diagrammet spreds brett den 2 oktober med argumentet att test-time compute-skalning suddar ut klyftorna mellan modellnivåer är ett påstående om branschen, inte ett resultat av utvärderingen: vad utvärderingen fann är att en billig öppen modell, given budget istället för en tur-begränsning, kan nå en frontlinjelabbs exploit-specialist på en stege.

Det är inte längre ett enda labbs historia. Anthropics egen bedömning från Frontier Red Team, publicerad den 29 september, körde GLM-5.3-Flash — den mindre syskonmodellen — i en session med människa i loopen: fick offentliga detaljer om en patchad Chrome-sårbarhet plus en annan, utan någon betydande vägledning, kedjade modellen ihop dem till en tillförlitlig ARM64-exploit som kringgick härdning av pekarautentisering, på 20 minuters mänsklig uppmärksamhet och åtta timmars modellarbete — 20,40 dollar enligt Zhipus API-priser. Samma bedömning är källan till siffran 50 av 410 i ExploitBench ovan, och den delen av den mätte GLM-5.3, flaggskeppet på 743B, inte Flash — en distinktion som bevakningen av rapporten till stor del har plattat ut. Två oberoende parter, olika testramverk, olika budgetar, samma inriktning. Båda är också enskilda labbkörningar och ingen av dem är ett reproducerat resultat, och endast Generality-körningen rapporterar en dollarsiffra för Flash snarare än för flaggskeppet. Den praktiska tolkningen är den som Anthropic säger rent ut: vikterna är nedladdningsbara, att ablittera GLM-5.3-Flash tog ungefär 600 GPU-timmar, och en modell som kostar under en dollar i timmen att köra är ett annat slags tillgänglighetsproblem än en som ligger bakom ett granskningsprogram.

Prova det, och hur routinglagret passar in

Åtkomst är enkel. Zhipus eget API tillhandahåller den till listpriset ovan, de MIT-licensierade vikterna finns på Hugging Face på zai-org/GLM-5.3-Flash i FP8 och BF16, och Zhipus kodningsprodukter – ZCode och GLM Coding Plan – inkluderar den. För egen hosting stöder både vLLM och SGLang den. Två praktiska anmärkningar om du väljer den vägen: SGLangs kokbok innehåller en varning om en öppen ändring: att bildindata kan tappas tyst i transformers-byggen före 5.13, vilket inte ger något fel och helt enkelt ger dig en textbaserad tolkning av en bildbegäran; och AMD-vägen är fortfarande inte ett recept. Den ursprungliga gfx950-aktiverings-PR:en från lanseringsdagen (sgl-project/sglang #37653) stängdes omergead den 6 september och ersattes av en bredare uppsättning gfx950 day-zero-pull requests – mHC via AITER, k-pool DSA-indexerare, FP8- och MXFP4-serving – varav flera fortfarande var öppna den 17 september. Aktivering på hårdvara i MI350X-klass pågår, är inte levererad, och det finns fortfarande ingen oberoende AMD-genomströmningssiffra.

På routing-sidan har läget förändrats sedan lanseringen: GLM-5.3-Flash finns nu i OrcaRouters utbud, tillsammans med resten av GLM-serien. Vi för vidare leverantörens listpris med 0 % påslag och ingen routeravgift, vilket är precis den mekanism som spelar roll för en modell vars pris just har ändrats — rabatten som löper ut på Zhipus sida är priset du betalar här, samma dag, utan ett andra kontrakt att omförhandla och utan kodändring. Denna vidarebefordran skär åt båda hållen, och det är värt att vara tydlig med det: en utgången kampanj är en verklig prishöjning på din räkning, och den sker här i samma stund som den sker uppströms. Om du väger Flash mot GLM-5.3 eller en annan budgetmodell ligger båda bakom en och samma nyckel med automatisk failover mellan leverantörer, vilket är det billiga sättet att prova en modell vars oberoende poäng fortfarande sätter sig, utan att satsa en produktionsväg på den. Det är också rätt form för resultatet ovan, och av en mer rakt på sak-anledning än bekvämlighet: samma vikter fick 10,6 eller 6,2 på samma benchmark beroende på vilken agent-harness som drev dem, så vad en köpare faktiskt testar är en kombination av scaffold och modell, och att byta ut modellen bakom en fast scaffold under en nyckel är billigare än att binda sig till någon av dem.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

Vad du ska titta på härnäst

Fyra saker avgör resten av den här historien. För det första, huruvida 42:an rör sig: modellen har varit i bred offentlig användning sedan augusti, så om Zhipus interna utvärdering och AA:s testramverk inte stämmer överens av en strukturell anledning – redovisning av resonemangstoken, mångordighet, en utvärdering som leverantören viktade tungt – bör det visa sig när den revideras snarare än som en engångsavvikelse. För det andra, huruvida exploiten reproduceras. Generality Labs körde 41 gånger, på egen hand, och säger det; testramverket här ovan visar att samma modell rör sig fyra punkter enbart genom val av testramverk, så det tal som skulle avgöra saken är en andra omkörning av de 41 med budgeten fastställd i dollar och testramverket hållet oförändrat. För det tredje, huruvida redogörelsen om inhemskt silicon får en andra källa. Zhipu är den enda parten som kan ange klusterstorleken, tidslinjen på två veckor och 3,2x, och det enda oberoende verifierbara påståendet i den – den sammanslagna kernelfixen – är ett litet sådant. För det fjärde, priset: rabatten är borta, och den intressanta frågan är om den återkommer som en kampanj när Zhipu behöver volym, eller om listpriset nu är golvet.

Den röda tråden är att GLM-5.3-Flash ombeds att bevisa två olika saker samtidigt – att en billig modell kan vara tillräckligt bra, och att kinesiska acceleratorer kan betjäna den i stor skala – och avslöjandet den 17 september är Zhipus svar på den andra frågan, levererat av en modell som hjälpte till att skriva det. Den första frågan har nu två oberoende siffror knutna till sig, och de pekar i motsatta riktningar: en 42:a på intelligensindexet, klart under leverantörens rubriksiffra, och en exploit-körning som hamnar i nivå med en specialist från ett frontlinjelabb, till en tjugondel av kostnaden. Båda kan vara sanna samtidigt, och gapet mellan dem – inte någon av siffrorna – är där besluten faktiskt fattas.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen