Ett hero-titelkort för Ox Alpha, den anonyma frontmodellen, som visar ett modellchip format som ett frågetecken med text-, bild- och videoinmatningar som flödar in och tokenblock som flödar ut, med tre piller som läser '1M tokenkontext', 'Gratis i en vecka' och 'Tillverkare okänd', samt OrcaRouter-logotypen kompositerad i nedre högra hörnet.
Guides & Insights

Ox Alpha avslöjad: Z.AI släpper den med öppna vikter som GLM-5.3-Flash

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

På kvällen onsdagen den 26 augusti slutade mysteriet precis som forensiken hade förutspått. Z.AI – laboratoriet i Beijing bakom GLM-serien – släppte den modell som man hade testat under en mask som en produkt med öppna vikter, under namnet GLM-5.3-Flash, exakt det undernamn som tokenizer-forensiken och förutsägelsemarknaderna hade enats om. Ox Alpha, den anonyma modell som har toppat användningslistorna sedan den dök upp den 20 augusti, är nu en publicerad, självhostbar modell: MIT-licens, totalt 320B parametrar med 18B aktiva per token, kontextfönstret på 1 048 576 tokens och text-/bild-/videoinmatning som den annonserade i listningen, samt vikter på Hugging Face. Avslöjandet besvarade också den anonyma veckans största gåta – hur en modell som ingen ägde kunde flytta 100 biljoner tokens om dagen: Z.AI säger att serveringen helt och hållet kördes på ungefär 100 000 inhemska kinesiska AI-chips, första gången som kinesisk kisel har burit global trafik i frontklass. Kapaciteten hade också gett upphov till veckans mest populära felgissning – i den skalan hävdade många observatörer, uppmuntrade av kryptiska inlägg från Google DeepMind-forskare, att Ox Alpha måste vara Gemini som kördes på NVIDIA-maskinvara; avslöjandet korrigerade även det. Samma kväll släppte Alibaba Qwen3.8-Flash-Next, en förhandsvisning med öppna vikter av dess Qwen4-arkitektur – en kväll, två släpp i frontklass med öppna vikter från kinesiska labb. Alla de fyra anonyma släppen före Ox Alpha tillskrevs så småningom kinesiska labb: Zhipu AI:s GLM-5, Xiaomis MiMo-V2-Pro, Ant Groups Lingxi Ling-2.6-flash, och Meituans LongCat-2.0. Ox Alpha är inte längre ett plattformsexklusivt experiment; det är en modell som utvecklare kan självhosta.

Varje siffra i den här texten är operatörens eget påstående, data från plattformens egen listning, ett offentligt tillkännagivande eller community-fingeravtryck. DeepSWE-siffrorna är community-mätningar av den oberoende forskaren Ben Davis — en fullständig körning med 113 uppgifter, inte en officiell leaderboard-post, även om siffran på ~63 % nu ligger nära Z.AI:s eget leverantörsrapporterade DeepSWE v1.1-resultat på 63,4. Identitetsfrågan är avgjord: den 26 augusti släppte Z.AI Ox Alpha som en modell med öppna vikter under namnet GLM-5.3-Flash — MIT-licens, 320B totala parametrar med 18B aktiva — vilket bekräftar det undernamn som den forensiska analysen av tokenizern och videoencodern hade konvergerat mot. Arkitektur, parameterantal och prissättning är nu publicerade av företaget; det som förblir leverantörsuppgivet snarare än oberoende verifierat är benchmarksviten och Z.AI:s påstående att serveringen under den anonyma veckan kördes på ungefär 100 000 inhemska kinesiska AI-chips till en kostnad per token som är jämförbar med vanlig NVIDIA-maskinvara — ett företagspåstående som flera medier nu har upprepat, inte en granskad siffra. Den tidiga Gemini-hypotesen — som kapaciteten på 100T tokens per dag hade gett upphov till och som kryptiska inlägg från Google DeepMind-forskare uppmuntrade — var fel, och släppet avgjorde saken. Kvalitetsbetyget som tillskrivs analytikern teortaxesTex — och hans förslag att en vidaretränad Ox Alpha skulle kunna vara arbetshästen för en starkare GLM 5.5 — är analytikerns egen bedömning från ett socialt inlägg, inte en oberoende mätning eller ett uttalande från Zhipu. Loop-animationsdemon som beskrivs nedan är också en community-rapport — en utvecklares inlägg på X, som upprepats på kinesiska utvecklarforum — inte ett leverantörspåstående om funktionalitet, och operatören har inte annonserat någon sådan funktion.

Vad vi vet — och vad vi inte vet

Den snabba versionen:

• Operatören beskriver Ox Alpha som "en gränsmodell byggd för effektiv kodning, uthålligt agentiskt arbete och verklig produktionsanvändning" — en resonemangsmodell som är inriktad på långsiktig mjukvaruutveckling och arbetsflöden som blandar text med visuell kontext.

Den har ett kontextfönster på 1 048 576 token (1M), en utdatagräns på 131 072 token och tar emot text-, bild- och videoinmatning — den första av de anonyma releaserna som annonserar videoinmatning, en funktion som GLM-5.3-Flash-releasen bekräftar som inbyggd snarare än påklistrad.

• Det var gratis i en vecka: $0 per miljon tokens in och ut, med operatören som hävdade "generösa hastighetsbegränsningar, nästan obegränsad användning" och 100 biljoner tokens per dag i serveringskapacitet — kapacitet som avslöjandet senare skulle säga var tillhandahållen på ungefär 100 000 inhemska kinesiska chips.

• Bekräftat: den 26 augusti släppte Z.AI Ox Alpha som en öppen-viktmodell under namnet GLM-5.3-Flash — MIT-licens, 320B totala parametrar med 18B aktiva — exakt det som sub-name-tokenizern, video-encodern, felkodsforensiken och förutsägelsemarknaderna hade konvergerat mot. Oberoende analytikern teortaxesTex bedömer den vara ungefär på GLM-5.3:s nivå, bortsett från vision, och föreslår att en vidaretränad Ox Alpha skulle kunna vara arbetshästen bakom en mycket starkare GLM 5.5.

• Den flash-multimodala avläsningen har nu en demo bakom sig: ombedd att generera en loopande animation av en pelikan som cyklar och öppnar en telefon som spelar samma animation, svarade Ox Alpha med en självständig loopande animation som en enda HTML/SVG-fil — en communitydemo, inte ett leverantörspåstående.

Tidiga aktivitetsdata på plattformen visar redan verklig produktionstrafik, inklusive en kodningsagent från Nous Research och Zed-redigeraren.

• Företaget har nu släppt det – den 26 augusti lanserade Z.AI Ox Alpha som öppenviktsmodellen GLM-5.3-Flash under MIT-licensen, vilket på en gång gjorde slut på frågorna om identitet, specifikation och pris: 320B totala parametrar med 18B aktiva, med inbyggd multimodalitet, ett Z.AI-listpris på 0,15 USD in / 0,50 USD ut per miljon tokens och en lanseringskampanj på 50 % som uppgavs gälla endast till och med den 9 september – ett datum som nu ligger åtta dagar bakåt, medan den rabatterade taxan fortfarande är den som tillämpas. Z.AI avslöjade också att den anonyma veckans serving på 100T tokens/dag kördes på ungefär 100 000 inhemska kinesiska chip, en första i den skalan. Det som avslöjandet inte innehöll är ett oberoende benchmark – modellens resultatkort är leverantörsrapporterat – så den mest representativa oberoende siffran är fortfarande Ben Davis fullständiga DeepSWE-körning med 113 uppgifter på ungefär 63 %, i nivå med GPT-5.6 Sol mid.

Vad Ox Alpha är

Plattformens listning beskriver Ox Alpha som "en resonemangsmodell designad för kodning, uthålligt agentarbete och produktionsarbetsbelastningar — långsiktig mjukvaruutveckling, komplext resonerande och arbetsflöden som kombinerar text med visuell kontext." Det är en specifik positionering: den är byggd för långvariga agentloopar och för kod, inte för allmän chatt. 1M-kontexten är den avslöjande detaljen — det är tillräckligt utrymme för en flertimmars agentsession eller ett stort repository — och 131K-utdatataket tillåter långa enstaka generationer. Den stöder verktygs- och funktionsanrop samt strukturerad JSON-utdata, vilket är resten av agentchecklistan.

A single-column scoreboard for Ox Alpha listing: context window 1M (1,048,576) tokens, max output 131,072 tokens, input text/image/video, independent benchmarks none yet, price free for one week, throughput 56 tokens/s (P50, platform-measured), with a footer reading 'Operator + platform-reported; no independent scores yet', and the OrcaRouter logo in the bottom-right corner.

Videoinmatningen är det mest utmärkande inslaget på specifikationsbladet. Ingen av de tidigare anonyma modellerna marknadsförde den, och en modell som kan ta emot videobilder såväl som text och bilder riktar sig mot en annan typ av arbetsbelastning än de chattfinjusterade utgåvor som föregick den. Det är också, som forensiken senare skulle visa, en av de starkaste identitetsmarkörer en modell kan bära. Allt detta – beskrivningen, specifikationerna, hastighetssiffrorna – kom från operatören och plattformens listning. GLM-5.3-Flash-utgåvan bekräftade rubrikspecifikationerna (320B-A18B, nativ multimodal); hastighets- och kapacitetssiffrorna förblir leverantörens påståenden.

Den multimodala historien fick en konkret demo den här veckan. Utvecklaren Chetaslua — vars server-sidessonder ingår i fingeravtrycksspåret — lade upp ett test där han bad Ox Alpha att skapa en loop av en pelikan som cyklar och öppnar en telefon som spelar upp samma animation: en självrefererande loop inuti loopen. Hans rapport visar att modellen levererar en enskild HTML/SVG-animation — en pelikan med tvåsegmentiga ben som verkligen trampar, hjulhastighet synkad med markhastigheten, en parallaxbakgrund och telefonen-i-loopen som slutpoäng. Kinesiska utvecklarforum körde separat sina egna pelikan-cykel-promptar och diskuterade resultatet, så demon är inte ett enskilt overifierbart påstående. Eftersom utdata är kod är det förenligt med plattformens text-output-only-specifikation: multimodal förståelse och kreativ kodgenerering som samverkar, inte nativ videosyntes. Chetasluas slutsats — att detta är utdelningen av multimodalitet, och att en kapabel open source-modell kommer med det — är hans egen prognos, inte ett leverantörsuttalande; operatören har inte annonserat något.

Erbjudandet om en gratis vecka.

Kampanjen var aggressiv. Gratis den vecka den pågick, "generösa rate limits, nästan obegränsad användning," och en påstådd kapacitet på 100 biljoner tokens per dag, med operatörens notering som uppmanade användare att "se vad du kan göra." Bokstavligen taget skulle 100T tokens per dag placera denna operatör bland de största inferensleverantörerna någonstans — påståendet läser mindre som en specifikation och mer som en stresstestutmaning, vilket passar mönstret: anonyma releaser är hur ett labb får frontier-skalig verklig trafik utan att sätta sitt namn på dörren. Den bekräftade uppgiften gjorde skalpåståendet konkret snarare än bara lättare att få att gå ihop: Z.AI avslöjade att 100T-tokens-per-dag-tjänsten kördes på ungefär 100 000 inhemska kinesiska AI-chips — första gången en frontier-klass-release har levererats i den skalan utan NVIDIA-hårdvara. Det avslöjandet är fortfarande ett företagspåstående, nu upprepat av flera medier men inte oberoende granskat, och det innehåller ett andra, mjukare leverantörspåstående: Z.AI säger att kostnaden per token på det inhemska klustret är jämförbar med vanliga NVIDIA-GPU:er.

Baksidan av "gratis i en vecka" var att priset som följde på det var okänt — avslöjandet besvarade det. Z.AI:s publicerade listpris för GLM-5.3-Flash är 0,15 USD per miljon indatatoken, 0,50 USD per miljon utdatatoken och 0,03 USD per miljon cachade indata. En lanseringskampanj med 50 % rabatt uppgavs pågå till och med den 9 september 2026, vilket sänkte det till 0,075 / 0,25 USD. Åtta dagar efter det datumet är den rabatterade taxan fortfarande den taxa som tillämpas: vid omläsning den 17 september 2026 prissätter modellsidan z-ai/glm-5.3-flash indata till 0,075 USD, utdata till 0,25 USD och cacheläsningar till 0,0173 USD per miljon token, utan någon kampanjmärkning. Jämfört med GLM-5.3:s listpris på 1,40 / 4,40 USD är det ungefär en tjugondel. Den praktiska konsekvensen är att slutdatumet den 9 september är inaktuellt snarare än bindande — en utvecklare som budgeterar efter 0,15 / 0,50 USD budgeterar efter en siffra som ingen för närvarande debiteras. Vad prissidorna inte avgör är varför. Z.AI:s egen modellista anger fortfarande 0,15 / 0,50 USD för GLM-5.3-Flash, så huruvida kampanjen förlängdes, gjordes permanent eller helt enkelt lämnades igång är inte något vi kan belägga; den rabatterade taxan är det observerade faktumet vid detta datum, och orsaken förblir öppen.

Det första fullständiga benchmarktestet — och det landar i nivå med GPT-5.6 Sol mid

Ox Alpha saknar fortfarande en notering på oberoende trackers som Artificial Analysis eller LMArena — ordet "frontier" är operatörens eget, och benchmarksiffrorna som Z.AI publicerade i samband med släppet av GLM-5.3-Flash (DeepSWE v1.1 63,4, AutomationBench 48,8, ett Artificial Analysis Intelligence Index på 57) är leverantörsrapporterade, inte oberoende resultat. Vad som har förändrats sedan lanseringen är att community-mätta siffror börjar cirkulera — och bilden har smalnat av. På Kingbench hamnade tidiga körningar av Ox Alpha på 87,5, strax under GLM-5.3:s 91,25. På DeepSWE körde den oberoende forskaren Ben Davis först ett delset med 10 uppgifter och rapporterade 80 % Pass@1, före Claude Fable 5 (65 %), GLM-5.3 och Grok 4.6 (62 %) samt GPT-5.6 Sol (52 %). Han har sedan genomfört en fullständig körning mot hela DeepSWE-uppsättningen med 113 uppgifter, och det korrigerade resultatet är ungefär 63 % — mer eller mindre i paritet med GPT-5.6 Sol mid. 80-procentssiffran var iögonfallande, men tio uppgifter är under 9 % av benchmarken; Davis själv pekade ut helhetsiffran som den som "är mycket mer vettig". Dessa är community-mätta siffror, inte en leverantörsbenchmark och inte en officiell leaderboard-poäng — men hela körningen är den mest representativa siffran någon har fått fram ur modellen, och den ligger nu nära Z.AI:s egen leverantörsrapporterade DeepSWE v1.1-poäng på 63,4 — en användbar korskontroll, även om företagets siffra är ett påstående snarare än en mätning.

En jämförelse betyder mer nu än vid lanseringen. DeepSeek V4 Pro 0813 — GA-versionen av DeepSeeks flaggskepp som släpptes den 13 augusti — rapporterar ett DeepSWE på 62,7 på DeepSeeks eget benchmarkkort, mot 12,8 för den tidigare DeepSeek V4 Pro Preview. Båda siffrorna är leverantörsrapporterade och har, i skrivande stund, inte reproducerats av något oberoende labb. Ser man 62,7 tillsammans med GLM-5.3-Flashs ~63-procentiga community full-set-körning och Z.AI:s eget DeepSWE v1.1 på 63,4, hamnar de två mest kända kinesiska kodningsagenternas anspråk i samma låga 60-spann. Det tiopoängsgap som såg ut att vara Ox Alphas signum mättes mot DeepSeek V4 Flash 0731, den billigare lilla modellen; mot DeepSeeks flaggskepp landar GLM-5.3-Flash på samma nivå, inte tio poäng före.

Den andra lärdomen handlar om själva siffran. Analytikern teortaxesTex — som har följt dessa uppskattningar sedan den anonyma veckan — konstaterar att den första rapporten om Ox Alpha också gav 80 % på DeepSWE: det var Davis iögonfallande delmängd på 10 uppgifter, och slutresultatet för hela uppsättningen på 113 uppgifter var 63 %. Med DeepSeek V4 Pro 0813:s officiella 62,7 inom samma intervall är hans observation att ingenting ännu har kommit i närheten av att legitimt reproducera 80 % — 80-procentsiffran fortsätter att dyka upp tidigt i en modells offentliga liv och hamnar sedan i det låga 60-talet när hela uppsättningen väl har körts. Det är hans analytiska läsning, inte en mätning, men det är rätt sorts glasögon för nästa DeepSWE-rubrik, inklusive eventuella sådana om själva GLM-5.3-Flash.

A screenshot of the Artificial Analysis models leaderboard as of August 21, 2026, showing the Intelligence section led by Claude Opus 5 and Claude Fable 5, the largest context-window highlights, and the output-speed rankings — a frontier leaderboard Ox Alpha has no independent score on yet.

Det som också finns är användning. Plattformens aktivitetsdata visar verklig produktionstrafik inom de första timmarna — inklusive Hermes Agent, det agentiska kodningsprojektet från Nous Research, och Zed-redigeraren. Båda är exakt de användningsfall med "långvarigt agentiskt arbete och kodning" som modellen är positionerad för. Det är inte ett resultat, men det är en signal: utvecklare med verkliga arbetsbelastningar beslutade att ett gratis, frontklassigt, anonymt spel var värt att koppla upp. Innan hela DeepSWE-körningen landade var den tidiga användningen det enda bevis som fanns; siffran på ~63% för hela uppsättningen ger nu modellen ett riktmärke att väga mot den.

Det finstilta om datalagring

Annonseringen om gratisveckan skryter med "noll datalagring." Modellens presentation på plattformen berättar en mer nyanserad historia: prompter och kompletteringar lagras av leverantören men används inte för träning, enligt plattformens stealth-model-villkor. Skillnaden spelar roll om du är på väg att klistra in proprietär kod i ett 1M-tokenfönster som ägs av en leverantör som var anonym tills Z.AI trädde fram den 26 augusti. Behandla "noll datalagring" som marknadsföring tills Z.AI publicerar villkor som uttryckligen säger det — och dirigera allt du inte vill ska loggas genom en separat, identifierbar modell.

Spelboken för anonyma modeller

Ox Alpha är den femte anonyma releasen på sex månader, och de tidigare fyra slutade på samma sätt — en anonym debut, en ström av gratis trafik, och sedan kliver ett företag fram:

• Pony Alpha (februari 2026) — bekräftad av Zhipu AI cirka fem dagar efter lanseringen som GLM-5, dess flaggskepp med 744B-parameter MoE-arkitektur.

• Hunter Alpha (11 mars) — en gratis modell med biljonparametrar och 1M-kontext som blev vårens spekulationshistoria, allmänt antagen vara Deep​Seek V4; avslöjades som Xiaomis MiMo-V2-Pro, med följeslagaren Healer Alpha identifierad som MiMo-V2-Omni.

Elephant Alpha (April) — en gratis, effektivitetsfokuserad textmodell som Ant Group hävdade var Lingxi Ling-2.6-flash ungefär två veckor efter att den dök upp.

• Owl Alpha (slutet av april) — en agentfokuserad modell med inbyggt verktygskanrop och en kontext på cirka 1M, som Meituan bekräftade som LongCat-2.0 den 30 juni, den första modellen med biljonparametrar som tränats och drivits helt på inhemska kinesiska chips.

• Ox Alpha (20 augusti) — avslöjades den 26 augusti som GLM-5.3-Flash, en modell med öppna vikter, MIT-licensierad 320B-A18B; identiteten, licensen och specifikationerna var alla officiella samma dag som masken togs av.

A two-column scorecard titled 'The anonymous models — and their reveals', listing Pony Alpha revealed as GLM-5 by Zhipu AI, Hunter Alpha as MiMo-V2-Pro by Xiaomi, Elephant Alpha as Lingxi Ling-2.6-flash by Ant Group, Owl Alpha as LongCat-2.0 by Meituan, and Ox Alpha marked '??? — unclaimed', with a footer noting reveals per each lab's public announcement and Ox Alpha unclaimed as of August 21, 2026, and the OrcaRouter logo in the bottom-right corner.

Varför lansera en bra modell bakom en mask? Den vanliga tolkningen, som Hunter Alpha-cykeln konkretiserade, är att anonymitet tar bort varumärkesbias från utvärderingar, och den fria användningen crowdsourcar verklig utvärderingsdata i frontlinjeskala medan alla argumenterar om ägaren. Som en analys av mönstret uttryckte det: "avsaknaden av ett varumärke är marknadsföringen." Extra vinsten är hastighet: en anonym modell kan nå en global utvecklarpublik på timmar utan ett lanseringsevent, och mysteriet i sig blir distributionen.

Vem är Ox Alpha?

Fram till releasen den 26 augusti hade inget företag gjort anspråk på den och Zhipu AI hade inte sagt något – men det hårda bevisläget förändrades inom 48 timmar efter modellens debut, och forensiken nedan är anledningen till att avslöjandet – som GLM-5.3-Flash – togs emot med så liten överraskning. Kapacitetssiffran talade inledningsvis emot forensiken: 100 biljoner tokens om dagen såg ut som signaturen för ett topplaboratorium på NVIDIA-hårdvara, och teorin att Ox Alpha var en ny Gemini – uppmuntrad av kryptiska inlägg från Google DeepMind-forskare – hade verklig fart tills tokenizerbevisen, och sedan Z.AI:s egen release, satte stopp för den. Den starkaste signalen är tokenizern. Ett communitybyggt fingeravtrycksverktyg, modelprint, körde nio infrastrukturprober mot Ox Alpha och fann att den matchade Z.ai:s GLM-5.3 i sex av dem, där alla fyra normaliserade tokenizerantal matchade GLM-familjen, medan den bästa icke-GLM-kandidaten klarade två av fyra. Den oberoende forskaren Ben Davis rapporterade att Ox Alphas tokenantal matchade GLM-5.3 exakt över 25 testprompter, med endast en konstant skillnad på +75 tokens, som han tillskrev en dold wrapper. Att matcha tokenizern är den svåraste identitetssignalen att förfalska – en modell kan inte ändra hur den segmenterar text utan att tränas om.

Videoflödet är den andra signaturen. Ox Alphas videotokenförbrukning matchade GLM-5V-Turbo exakt över fyra kontrollerade prov — samma bildruteurval, varaktighetsskalning och upplösningsmekanik — medan MiMo v2.5, Qwen 3.8 Max och GLM-4.6V alla avvek. Det är ett starkt tecken: videohantering sitter djupt i modellen, inte som ett tillägg. Resten av fingeravtrycksstacken pekar åt samma håll: Ox Alpha avvisar ljudinmatning på samma sätt som GLM-5V, delar GLM:s karakteristiska felkod "1301", uppvisar en liknande utmatningsstil (ungefär 1,3 emojis per 1 000 tecken), bär samma begränsade parameter- och API-konfiguration som fanns på plattformens GLM-5.3-uppställning två dagar före Ox Alphas lansering, och har en kunskapsgräns nära november 2025.

Identifieringen har ett prejudikat i Zhipus egen spelbok: Pony Alpha, det anonyma februarisläppet, visade sig vara GLM-5, en uppgift som lades fram ungefär fem dagar efter lanseringen. Den analystolkning som cirkulerat den här veckan – att Ox Alpha är GLM-5.3, förmodligen Flash-modellen – upprepades av Pliny the Liberator, som sade att hans agent hade bekräftat att ”Ox-alpha är från Zai, GLM-5.X-familjen”. Den oberoende analytikern teortaxesTex gör samma bedömning när det gäller kvalitet och lägger till ett påstående om tajmingen: han värderar Ox Alpha till ungefär GLM-5.3:s nivå, bortsett från bildigenkänningen, och anser att det mest slående är hur snabbt det gick – att komprimera det textbaserade GLM-5.3 och leverera det med fungerande bildigenkänning inom dagar efter lanseringen den 14 augusti. Det är en analytikers bedömning, inte ett oberoende testresultat, och han menar att den borde få en att tveka inför narrativet om att ”Kina släpper modeller direkt från pressen”. Hans senaste inlägg lägger en gissning om färdplanen ovanpå den tolkningen: GLM-5:s uppdateringscykel kan vara kort; Ox Alpha ligger så nära GLM-5.3 att det knappt är meningsfullt att använda den som subagent – ”kör bara ox @4 i stället” är hans sätt att säga att köra modellen direkt; och en vidaretränad Ox Alpha skulle vara mycket vettig som arbetshäst – med hans ord ett ”lastdjur” – för en betydligt starkare GLM 5.5. Det är en analytikers spekulation om en färdplan, inte ett uttalande från Zhipu. Frågan om undernamnet är däremot avgjord: den 26 augusti släppte Z.AI Ox Alpha som GLM-5.3-Flash. Den hake som tidigare höll Flash-etiketten på den ”förmodade” sidan – GLM-5.3 lanserades den 14 augusti som en textbaserad modell, medan Ox Alpha skyltar med videoinmatning – är precis vad släppet klargjorde: GLM-5.3-Flash är en distinkt, i grunden multimodal modell snarare än samma textbaserade modell. Alternativa teorier – Xiaomis MiMo-team, DeepSeek – har förts fram och i stort avfärdats på grund av tokeniserar- och videobevisen, och släppet avgör familjefrågan definitivt.Davis argument för att bry sig om Flash-etiketten visade sig vara det praktiska: eftersom Ox Alpha verkligen är GLM-5.3-Flash och presterar på GPT-5.6 Sol mid-nivå, kan den nu köras lokalt – vikterna finns på Hugging Face; SGLang, vLLM och TokenSpeed serverar den – vilket förvandlar en medelklassmodell bland frontlinjens kodningsmodeller till en engångskostnad för hårdvara i stället för en löpande kostnad per token för den som är villig att drifta den.

Den geopolitiska inramningen är analytikernas, inte bevisens: ”Detta sätter ännu större press på USA:s Frontier Labs, och gapet mot Kina krymper.” Det är en tolkning av vad en fri Zhipu-klassmodell som körs i frontier-skala innebär för konkurrensordningen – och hårdvaruavslöjandet ger den en fördel som analytikerna inte hade. Att servera 100 biljoner tokens om dagen på ungefär 100 000 inhemska chips är den första storskaliga demonstrationen av att en kinesisk stack utan NVIDIA-kisel kan bära frontier-inferenstrafik – det scenario som NVIDIAs vd Jensen Huang varnade för i Dwarkesh Podcast i våras, när han argumenterade för att exportkontroller skulle påskynda Kinas NVIDIA-oberoende stack och att en frontier-modell som fungerar bäst på inhemsk kinesisk hårdvara skulle vara ett ”fruktansvärt utfall” för USA. Z.AI:s siffra om kostnadsparitet är fortfarande ett leverantörspåstående, men själva händelsen är verklig. Samma kväll blev poängen konkret även på modellsidan: när Z.AI släppte GLM-5.3-Flash, lanserade Alibaba Qwen3.8-Flash-Next, sin open-weight-förhandsvisning av Qwen4-arkitekturen. Två kinesiska open-weight-släpp i frontier-klass under en enda kväll är den konkreta formen av vad observatörer kallade ”en stor dag för kinesisk open source”.

Borde du bygga vidare på det den här veckan?

Den kostnadsfria veckan är över, men testet är fortfarande billigt: den taxa som faktiskt gällde den 17 september är 0,075 USD in / 0,25 USD ut per miljon tokens, inte listpriset 0,15 / 0,50 USD — lanseringskampanjen med 50 % rabatt som uppgavs sluta den 9 september gäller fortfarande åtta dagar senare. Om du gör långsiktigt agentiskt arbete, kodar i långa kontexter eller kör videotunga pipelines, är det precis den skärningspunkten där Ox Alpha är positionerad — och med öppna vikter kan du köra testet på din egen hårdvara i stället för på en anonym plattforms nåder. Två varningar. För det första är etiketten "frontier" fortfarande ett påstående: GLM-5.3-Flashs resultatkort är leverantörsrapporterat, och den enda solida oberoende siffran — Davis ~63 % på DeepSWE — är stark men en bra bit från de virala 80 % från den tidiga delmängden med tio uppgifter. För det andra var priset på 0 USD tidsbegränsat, och avslöjandet prissatte det som kommer efter — billigt för kapaciteten, men inte längre gratis. Det som släppet med öppna vikter tar bort är beroendet: filerna är ute, så modellen kan driftas själv i stället för att hyras. Det är formen av ett test, inte ett beroende.

Det produktionssäkra sättet att köra ett sådant test är en reservkedja: den experimentella modellen svarar när den är frisk, och begäran rullas över till en beprövad modell i samma ögonblick som den stannar, får fel eller försvinner. Det är vad ett routningslager är till för. Avslöjandet gör valet av reservmodell trivialt: Ox Alpha är GLM-5.3-Flash, och modellen själv är live på OrcaRouter under sitt riktiga namn till $0.075 in / $0.25 out per miljon tokens, med cacheläsningar till $0.0173 — lanseringspriset med 50 % rabatt som uppgavs sluta den 9 september och som per den 17 september fortfarande är priset på sidan i stället för listpriset $0.15 / $0.50. Den förmedlas vidare med 0 % påslag, ett och samma API för 200+ modeller, med automatisk failover så att en trafiktopp under lanseringsveckan inte blir ditt avbrott. Provkör den nya modellen längst fram med en beprövad reservmodell bakom den i kedjan; när ett pris ändras är siffran du ser på OrcaRouter siffran du betalar, samma dag. Eller hoppa över API:et helt — vikterna är öppna, så att hosta GLM-5.3-Flash själv bakom samma kedja är också ett alternativ.

Vad du ska titta på

Sex saker kommer att berätta resten av historien. Den oberoende benchmarken: GLM-5.3-Flashs resultatkort är leverantörsrapporterat, Davis ~63% DeepSWE-körning är det enda solida oberoende siffran hittills, DeepSeek V4 Pro 0813:s officiella 62,7 ligger nu i samma band, och en Artificial Analysis- eller LMArena-post — eller en oberoende head-to-head — skulle vara den slutliga kontrollen av om "frontier" är ett faktum eller en slogan. Prisutvecklingen: frågan om steady-state har ett svar utifrån bevisningen hittills — 50%-kampanjen uppgavs sluta den 9 september, men den 17 september är den rabatterade kursen $0,075 / $0,25 fortfarande den som erbjuds, så kampanjpriset snarare än listpriset $0,15 / $0,50 är siffran att budgetera efter; vad som förblir oklart är orsaken, eftersom Z.AI:s eget listpris inte har rört sig. Maskinvarupåståendet: Z.AI säger att den anonyma veckan kördes på ungefär 100 000 inhemska chips till kostnadsparitet med NVIDIA — det första offentliga testet av detta i stor skala är om påståendet överlever oberoende granskning, och om den inhemska stacken blir standard för GLM-linjen. Adoptionsmatematiken: huruvida den plattformstoppande trafiken Ox Alpha drog till sig under masken omvandlas till självhostade och API-distributioner nu när den har ett namn, en licens och ett pris. Uppföljaren: huruvida GLM-5.3-Flash framställer Ox Alpha som en språngbräda — teortaxesTex antydan är att en vidareutbildad version blir arbetshästen för en mycket starkare GLM 5.5, vilket skulle göra denna release till grunden för nästa GLM. Och reaktionen: när Qwen3.8-Flash-Next landar samma natt och en avslöjning om inhemska chips bakom den, är pressen på amerikanska frontier-labb — och på exportkontrollsdebatten — att svara; håll utkik efter om en snabb uppföljning, en prisändring eller en politisk respons landar på andra sidan gapet.

Den ärliga domen: Ox Alpha var ett ovanligt billigt experiment i båda riktningarna. Plattformen testade om en anonym modell av frontier-klass för $0 kunde vinna verklig produktionstrafik inom en vecka – det gjorde den, tillräckligt övertygande för att Z.AI inte bara trädde fram på den sjätte dagen utan också släppte vikterna som en öppen modell samma natt. Du får testa om modellen förtjänar en plats i din stack, nu utan anonymitetsrisken: GLM-5.3-Flash är en namngiven, MIT-licensierad, självhostbar modell till ett publicerat pris, och hårdvarufrågan fick också ett svar – Z.AI säger att serveringen på 100T tokens/dag kördes på ungefär 100 000 inhemska kinesiska chip, enligt företaget men nu allmänt rapporterat. Det som återstår att ta reda på är om "frontier" överlever oberoende mätning, om Z.AI:s anspråk på kostnadsparitet för inhemska chip håller i stor skala, varför 50 %-lanseringskampanjen fortfarande är priset som erbjuds åtta dagar efter dess angivna slutdatum den 9 september, och om avslöjandet framställer GLM-5.3-Flash som arbetshästen för en starkare GLM 5.5, som teortaxesTex antyder. Kör experimentet, men kör det med en fallback under.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen