
Ox Alpha: Det kompletta specifikationsbladet för stealthmodellen som nu levereras som GLM-5.3-Flash
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 316 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 196 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
Ox Alpha är det anonyma namn som GLM-5.3-Flash förhandsvisades under; den avslöjades den 26 augusti 2026, och det är inte en modell du kan anropa idag. Förhandsvisningsposten som bar namnet Ox Alpha tillhandahåller den inte längre; modellen bakom har en leverantörssida, MIT-licensierade vikter, en publicerad prislista och en dokumenterad API-yta, som alla är Z.ai:s. Den här sidan är referensen för den modellen — omfånget, modaliteterna, prislistan, ändpunktsytan, varje publicerad benchmarksiffra med den revision eller det testramverk som hör till, och, eftersom aliaset fortfarande ger ett magert och förvirrande sökresultat, ett tydligt konstaterande av vad som inte dokumenteras någonstans. Allt nedan lästes den 28 september 2026 från Z.ai:s egen modelldokumentation och prissida, från Z.ai-modellkortet på Hugging Face, från Artificial Analysis och från vår egen katalog; siffror som leverantören publicerar och siffror som en oberoende part mäter är märkta separat, och inget här har härletts från en likhet.
Vad namnet Ox Alpha syftar på i dag
Aliaset är avvecklat, och det är leverantören som har avvecklat det. Z.ai:s egen dokumentation för GLM-5.3-Flash säger att modellen testades anonymt under namnet ox-alpha före lanseringen, i syfte att samla in användarfeedback, och att den anonyma körningen blev veckans mest populära modell. De daterbara hållpunkterna är korta och specifika: smyglistningen visade att Ox Alpha hade släppts den 20 augusti 2026, och avslöjandet kom den 26 augusti – samma datum som Z.ai:s dokumentationssida anger och samma releasedatum som vår egen katalog registrerar för z-ai/glm-5.3-flash.
Två saker följer av det, och båda har betydelse för en läsare som sökte på namnet.
• Aliaset är inte en rutt. Vår katalog returnerar "modell hittades inte" för ett uppslag på stealth/ox-alpha, läst 2026-09-28. Det finns inget att anropa under det namnet, eftersom leverantörens produkt bär leverantörens namn.
• Det finns inte heller något leverantörsägt viktrepositorium under aliaset. En sökning på Hugging Face efter ox-alpha returnerar communityuppladdningar som skapades under stealth-fönstret i slutet av augusti 2026, plus ett repositorium med enbart ett modellkort från den 27 september 2026 som inte innehåller några vikter och pekar på Z.ai:s officiella släpp. Ett repositorienamn är en etikett som dess uppladdare har valt; det är inte dokumentation om någonting. Z.ai:s egen organisation publicerar modellen som zai-org/GLM-5.3-Flash, med repositoriet skapat den 2026-08-25 i UTC.
Leverantörsfrågan som dominerade den anonyma veckan är stängd, och den stängdes på vanligt sätt: ett labb trädde fram och satte sitt namn på modellen. Det som återstår är en specifikation, vilket är vad den här sidan handlar om. Historien om upptäckten – fingeravtryckningen som föregick avslöjandet, den anonyma modellinjen som den tillhör, och avslöjandet av serving-hårdvaran som kom med den – finns i vår tidigare artikel om Ox Alpha-utredningen, och den här sidan tar inte upp något av det igen.
Kuvertet, såsom leverantören dokumenterar det

Detta är siffror som Z.ai har rapporterat, lästa från leverantörens egen dokumentationssida den 28 september 2026, och tre av de fyra övergripande dimensionerna är oberoende bekräftade – modellposten för Artificial Analysis har samma 320B totalt, 18B aktiva, 1 000 000-tokenkontext och MIT-licens, och vårt eget katalogkort innehåller kontext- och utdatagränserna.
• Kontextfönster — 1 000 000 tokens (Z.ai-dokumentation; Artificial Analysis; vårt eget katalogkort, som listar 1 000 000)
• Maximal utdata — 128K tokens (Z.ai-dokumentation); vårt kort anger 128 000
• Indata — text, bild, video och fil (Z.ai-dokumentation, läst 2026-09-28); vårt kort listar text, bild och video och gör inte anspråk på filinmatning
• Utdata – endast text, för varje källa
• Parametrar — 320B totalt med 18B aktiverade per token (Z.ai-dokumentation och modellkort; Artificial Analysis registrerar oberoende 320B och 18B)
• Licens — MIT, med vikter publicerade på Hugging Face (leverantörens modellkort; Artificial Analysis klassificerar modellen som öppna vikter under en tillåtande licens)
• Arkitektur — en hybrid av sparse och linjär attention, som Z.ai beskriver som den första frontiermodellen med öppen källkod som kombinerar de två, vilket minskar attention-beräkningen med 3,01× och KV-cachen med 4,44× jämfört med GLM-5.3, plus ett IndexPool-steg som komprimerar fyra indexer-nyckel vektorer till en vid lång kontext, och Manifold-Constrained Hyper-Connections för skalningseffektivitet. Allt enligt leverantören; det finns ingen oberoende arkitekturgranskning att hänvisa till.
• Förträning – en multimodal korpus på 30 biljoner tokens (enligt Z.ai). Leverantören publicerar ingen siffra för den totala träningsberäkningen och ingen uppdelning av parametrar per lager utöver rubriksiffrorna 320B/18B.
Ett övergripande påstående har krympt sedan lanseringen, och den aktuella dokumentationen är den man ska citera. Uppgiften om serveringshårdvara som cirkulerade i augusti angav den anonyma veckans kapacitet till ungefär 100 000 inhemska kinesiska chip. Z.ai:s dokumentation i dess nuvarande lydelse säger att modellen betjänades "över tiotusentals inhemskt utvecklade acceleratorer", med en 3× förbättring av end-to-end-servering jämfört med leverantörens egen baslinje på samma hårdvara och en kostnad per token som leverantören beskriver som jämförbar med vanliga NVIDIA-GPU:er. Tiotusentals är vad sidan säger nu; den större siffran är den från lanseringstiden. Båda är företagets påståenden, ingen av dem har granskats oberoende, och riktningen för revideringen är nedåt.
Prislistan, och varför det serverade antalet är det som spelar roll
Z.ai:s prissida listar GLM-5.3-Flash till $0.15 per miljon indatatokens, $0.03 per miljon cachade indatatokens och $0.50 per miljon utdatatokens, samt syskonnivån FlashX till $0.37 / $0.075 / $1.25. Det är leverantörens listpris, läst från leverantörens egen sida den 2026-09-28.
Den taxa som faktiskt tillämpades på vår rutt i dag är lägre, och detta är den praktiska poängen med avsnittet. Läst den 2026-09-28: OrcaRouter-kortet för z-ai/glm-5.3-flash prissätter indata till $0.075 per miljon tokens, utdata till $0.25 per miljon och cacheläsningar till $0.0173 per miljon. Det är hälften av leverantörens listpris, för samma modell, samma dag – den rabatterade siffran snarare än rubrikpriset, utan någon kampanjmärkning på kortet. Vår tidigare bevakning av denna modell noterade samma skillnad efter att det angivna kampanjfönstret stängdes; iakttagelsen gäller fortfarande i dag, och vi kan fortfarande inte ange någon källa till orsaken, så vi rapporterar den faktiska siffran och lämnar orsaken öppen.
Cachad indata är där de tre källorna uppenbart går isär, vilket är en användbar påminnelse om att ett "$0.03" i en tabell inte nödvändigtvis är ett pris som någon faktiskt betalar. Leverantörens sida anger $0.03 per miljon cachade indatatoken; Artificial Analysis modellpost har ett pris för cacheträff på $0.026; vår route levererar cacheläsningar till $0.0173. Alla tre lästes den eller strax före 2026-09-28, alla tre rapporterade av leverantör eller plattform. Vi anger leverantörens listpris som listpris och det serverade priset som vad en anropare faktiskt faktureras.
Räkna på ett representativt agentjobb – 100 000 indatatoken och 10 000 utdatatoken, inga cacheträffar:
• Till leverantörens listpris – 100 000 tokens × 0,15 $/1M = 0,015 $, plus 10 000 × 0,50 $/1M = 0,005 $, så 0,020 $ per anrop
• Till den taxa vår rutt erbjuder idag – 0,0075 $ plus 0,0025 $, alltså 0,010 $ per samtal, exakt hälften
Det är hela anledningen till att kontrollera det serverade priset i stället för listpriset innan du dimensionerar en arbetsbelastning: för en agent med lång tidshorisont som gör tusentals anrop om dagen är skillnaden mellan de två siffrorna skillnaden mellan två budgetar. OrcaRouter för vidare leverantörens listpris med 0 % påslag, vilket är anledningen till att rabatten som leverantören kör syns på vårt kort i stället för att absorberas någonstans i mellanledet.
Modaliteter och endpoint-yta
Leverantören dokumenterar en gränssnittsform och två modellkoder: glm-5.3-flash och glm-5.3-flashx, båda tillgängliga via Chat Completion-API:et. Bilder skickas in som ett innehållsblock med typen image_url i meddelandets innehållsmatris, och tar antingen en URL — vilket leverantören rekommenderar — eller en base64-datakodad URL, och flera bildblock kan skickas i ett och samma meddelande. Strömning stöds, och Z.ai rekommenderar att aktivera stream och tool_stream tillsammans för strömningsbegäranden. Verktygsanrop, kontextcachning och strukturerad JSON-utdata är alla dokumenterade funktioner; tänkande stöds men är, vilket nästa avsnitt förklarar, inte valfritt.
FlashX är en separat serveringsnivå av samma modell snarare än en separat förmåga: Z.ai dokumenterar den vid 200 tokens per sekund och anger att den ännu inte är tillgänglig i GLM Coding Plan. Det är inte den nivå som vår katalog omfattar, och det är inte vad siffrorna på den här sidan beskriver.
På vår route är endpoint-ytan snävare och värd att ange exakt. Kortet för z-ai/glm-5.3-flash exponerar POST /v1/chat/completions – endast chat completions, utan en andra protokoll-endpoint – och accepterar reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens och stop. Kapacitetschipsen på kortet är vision, tools, JSON och reasoning. Kontexten är 1 000 000 tokens och maximalt utdata 128 000, vilket matchar leverantörens dokumentation.
Ansträngning och tänkande: inställningarna som låser fast varje benchmark-siffra
Det här är den del av specifikationen som mest förändrar hur du läser poängen, och leverantören dokumenterar det exakt. GLM-5.3-Flash tar en reasoning_effort parameter med tre nivåer – low, high och max – och den har max som standard om du inte skickar något, eller om du skickar något som inte är low eller high. Tänkande kan inte stängas av: leverantören anger att thinking.type endast stöder enabled. Chattmallens clear_thinking-flagga har false som standard, och Z.ai rekommenderar att uttryckligen skicka den som true för chattscenarier. Leverantörens rekommenderade samplingsinställningar är temperature 1 och top_p 0.95, och den säger rent ut att reproduktion av benchmark och leaderboard bör behålla standardinställningen max effort.
Läs de två fakta tillsammans, och konsekvensen för den som jämför siffror är oundviklig: en poäng som anges utan en ansträngningsnivå är inte en fullständig mätning, eftersom inställningarna low, high och max är olika driftpunkter för samma modell, och standardinställningen är den dyraste av de tre. Vårt kort exponerar reasoning och reasoning_effort bland sina stödda parametrar, så inställningen är nåbar via rutten, inte bara via leverantören.
Benchmark-arket, med revideringen bifogad
Z.ai publicerar en benchmarktabell för GLM-5.3-Flash, och den är helt och hållet rapporterad av leverantören – den oberoende redovisningen från Artificial Analysis återger inte dessa rader. Leverantörens främsta kodnings- och agentiska resultat är DeepSWE v1.1 på 63,4 mot GLM-5.2:s 46,2, och AutomationBench v1.0.6 på 48,8 mot GLM-5.2:s 26,2. Resten av tabellen, så som vår egen katalog redovisar den med Z.ai som angiven källa: Humanity's Last Exam med verktyg 55,3, Agents' Last Exam 26,3, NL2Repo 56,3, Chartography med verktyg 78, CharXiv-resonemang med verktyg 89,4, och på visionsidan MMVU 80,5, MVBench 77,8 och BabyVision 53,4.
Två leverantörsrader förtjänar att deras fotnoter följer med in i meningen, eftersom de är de som en läsare med störst sannolikhet citerar utan dem. Z.ai:s interna kodningsutvärdering, Z.ai Code Bench v1.0, placerar GLM-5.3-Flash på 29,0 vid maximal ansträngning mot Claude Opus 4.8 på 29,5 – ett nästan oavgjort resultat i leverantörens egen testmiljö, utfört på Claude Code 2.1.207 och rapporterat av leverantören. Det är inte en oberoende jämförelse och det är inte en jämförelse med matchad ansträngning utförd av en tredje part; det är Z.ai som benchmarkar sin modell mot en konkurrent i sin egen utvärdering. Och leverantören anger ett Artificial Analysis Intelligence Index på 57 vid 0,045 dollar per uppgift, och namnger revisionen som v4.1.1.
Den sista siffran behöver hållas åtskild från det som Artificial Analysis publicerar i dag, eftersom de två inte kan ställas sida vid sida som en förändring. Artificial Analysys egen sida för GLM-5.3-Flash, läst 2026-09-28, rapporterar ett Intelligence Index på 41.8 på Index v4.3.2, uppmätt vid max effort. v4.3.2 omfattar tio utvärderingar — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience och AA-LCR v1.1 — vilket v4.1.1 inte gjorde. Två indexrevideringar, två uppsättningar uppgifter, två siffror. Ingen av dem är fel; de är inte samma mätning, och att citera 57:an bredvid 41.8 som om modellen hade rört sig vore ett misstag åt endera hållet.
Det som den oberoende redogörelsen faktiskt bekräftar är ramen snarare än poängen: Artificial Analysis registrerar oberoende 320B totala parametrar, 18B aktiverade, ett kontextfönster på 1 000 000 tokens, MIT-licens, öppna vikter och ett releasedatum den 2026-08-26, samt listar leverantörens prissättning på 0,15 USD för input och 0,50 USD för output per miljon tokens med ett pris vid cacheträff på 0,026 USD. Där leverantören publicerar en poäng och den oberoende parten inte gör det, säger vi det; där den oberoende parten bekräftar en specifikation är det den starkaste klassen av fakta på den här sidan.
Här finns ingen matchad direkt jämförelse, och att säga det är mer användbart än att producera en. Ingen har publicerat en körning av GLM-5.3-Flash mot Claude Opus 4.8, GPT-6 Sol eller Grok 4.7 vid en angiven ansträngningsnivå i en gemensam testrigg – Z.ai:s egen jämförelse är på deras egen testbänk, vid maximal ansträngning, mot en konkurrents standardläge. Tills det ändras är den ärliga jämförelsen mellan den här modellen och allt annat på pris, omfång och endpoint-yta, vilket är de tre saker på den här sidan som alla kan läsa av ur samma siffror.
Det som inte är dokumenterat, sagt rakt ut
En referenssida för en modell med ett tunt informationsunderlag är bara användbar om den är ärlig om luckorna, och den här har flera.
• Ingen kunskapsavgränsning från leverantören. Z.ai:s dokumentation och Hugging Face-modellkortet anger ingen sådan, och uppgiften från Artificial Analysis lämnar fältet tomt. Uppskattningar från stealth-fönstret är community-arbete, inte en siffra från leverantören, och den här sidan upprepar inte en sådan som om den vore det.
Inga fotnoter om testramverk för större delen av benchmark-arket. Modellkortet har dock fotnoter för HLE-körningen med verktyg – temperatur 1,0, top_p 0,95, en maximal genereringslängd på 163 840 token, utvärdering vid upp till en kontext på 300 000 token med en strategi för kontexthantering, och GPT-5.6 Luna med medium effort som domarmodell – samt för NL2Repo och DeepSWE, som leverantören uppger kördes med mini-swe-agent-testramverket. De återstående raderna är bara procentsatser utan testramverk eller effort angivet.
• Ingen förklaring av prisspridningen för cachad indata. Tre siffror för samma kvantitet på samma modell, och ingen källa anger varför de skiljer sig.
• Ingen oberoende benchmark av den anonyma serveringsperioden. Stealth-listningen är borta; vad den än mätte kan inte mätas igen, och ingen tredje part publicerade en körning mot aliaset medan det var live.
• Ingen tredjepartsjämförelse med motsvarande insats, av skälet som anges ovan.
• Ingen leverantörsbekräftelse av chipantalet vid lanseringen. Dokumentationen anger tiotusentals inhemska acceleratorer; siffran 100 000 finns inte på sidan.
Vi slår fast: vad vår katalog erbjuder, verifierat idag

Modellen bakom Ox Alpha finns live i vår katalog under sitt eget namn, kontrollerad idag i stället för antagen. En läsning av OrcaRouter-modell-API:et för z-ai/glm-5.3-flash den 2026-09-28 returnerade kortet i sin helhet: kontext på 1 000 000 tokens, maximal utdata på 128 000, text-, bild- och videoindata med textutdata, kapacitetschipsen vision, tools, JSON och reasoning, ett utgivningsdatum 2026-08-26, inte utfasad och inte avlistad, prissatt till 0,075 USD per miljon indatatokens, 0,25 USD per miljon utdatatokens och 0,0173 USD per miljon cachade indatatokens, via den enda slutpunkten POST /v1/chat/completions.
Vår egen sjudagarsmätning i playground på det kortet, för samma period, visar 61,8 utdatatokens per sekund, en p50-tid till första token på 7,39 sekunder och en felfrekvens på 1,47 %. Det är förstapartssiffror om vår serving, inte leverantörssiffror och inte oberoende benchmarkar, och de är av den anledningen de enda hastighetssiffrorna på den här sidan.
Själva aliaset finns inte på rutten. Om du har hamnat här efter att ha sökt på Ox Alpha är modellen du ska anropa z-ai/glm-5.3-flash, och förfrågan har den form som beskrivs ovan. Den ligger på samma nyckel som allt annat i katalogen – ett API för 200+ modeller, leverantörens pris förs vidare utan påslag, och automatisk failover om en leverantör slutar svara, så en modell du provkör behöver inte vara en modell som din produktionsväg är beroende av.

Ett förtydligande om vad den här sidan är, eftersom en läsare som kommer hit via modellens eget namn förtjänar det. Detta är en referenssida för en modell som redan finns i katalogen, inte en lanseringsrapport: GLM-5.3-Flash är från den 26 augusti 2026, och dess plats här vilar på att namnet Ox Alpha fortsätter att sökas utan att det finns någon dedikerad sida att landa på, inte på hur färsk lanseringen är. Datumet ovan används för att datera modellen, inte som nyhet. Det som skulle ändra den här sidan är en av fyra saker – en oberoende benchmarkkörning vid en angiven effort-nivå, en av leverantören angiven kunskapsgräns, en ändring av den taxan som tillämpas, eller ett beslut av Z.ai att uppge vad chiptalet vid lanseringen faktiskt var. Fram till dess att något av detta inträffar är specifikationen ovan allt som leverantören dokumenterar, och luckorna som listas i föregående avsnitt är en lika stor del av svaret som siffrorna är.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
