
GLM-5.3-Flash avslöjat: Den anonyma "Ox Alpha" var hela tiden Zhipus öppna multimodala gränsmodell
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiNYZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianNYQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenNYQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
Modellen som tillbringade en vecka högst upp på tredjepartslistor över användning av kodningsplattformar har äntligen ett namn och ett pris. Den 26 augusti 2026 bekräftade Zhipu AI att den kostnadsfria modellen "Ox Alpha" som utvecklare hade använt intensivt sedan den 20 augusti är GLM-5.3-Flash – en mixture-of-experts-modell med totalt 320 miljarder parametrar och 18 miljarder aktiva (320B-A18B), den första nativt multimodala utgåvan i GLM-5-serien och en av de billigaste frontier-modellerna på någon prislista vid lanseringen. Zhipu prissätter GLM-5.3-Flash till en tiondel av API-priset för flaggskeppsmodellen GLM-5.3, eller en tjugondel under en tidsbegränsad rabatt, och de öppna vikterna – med MIT-licens – laddades upp till Hugging Face samma dag. Till skillnad från GLM-5.3, vars vikter fortfarande väntas i slutet av månaden, är den här modellen något du kan self-hosta den här veckan, inte nästa.
Här är den korta versionen: Zhipu har publicerat sin hittills billigaste stora modell som öppen källkod, den slår deras egen GLM-5.2 i benchmarks trots att den bara kör en bråkdel av de aktiva parametrarna, och leverantören sätter dess Artificial Analysis Intelligence Index-poäng till 57 – vilket matchar Claude Opus 4.8, enligt Zhipus lanseringsmaterial. Alla benchmarksiffror som är knutna till denna lansering är leverantörsrapporterade och ej oberoende verifierade i skrivande stund; priserna och parameterantalet är aktuella fakta.
Vad som faktiskt levererades
GLM-5.3-Flash är en MoE med totalt 320B parametrar och 18B aktiva, med 45 lager, vilket gör att dess aktiva fotavtryck är lite över hälften av GLM-5.2:s ~32B aktiva parametrar. Den främsta förmågan är modalitet: den tar nativt emot text-, bild- och videoinmatning — den första GLM-5-modellen att göra detta — snarare än att dirigera vision genom en separat adapter. Kontexten når 1 miljon tokens, och Zhipu hävdar att kostnaden för långkontext-servering landar på ungefär en tredjedel av GLM-5.3:s.
På arkitektursidan beskriver Zhipu det som den första frontmodellen med öppen källkod som använder en hybriddesign med sparse attention och linjär attention, tillsammans med Manifold-Constrained Hyper-Connections (mHC) för skalning och en IndexPool-mekanism som komprimerar fyra indexeringsnyckelvektorer till en viktad pool för att minska latensen för långa kontexter. Förträningen kördes på en multimodal korpus med 30 biljoner tokens. Inget av detta är ännu oberoende granskat — det är Zhipus beskrivning av sin egen modell — men påståendena om serveringseffektivitet är tillräckligt specifika för att testas när vikterna väl ligger framför inferensstacken med öppen källkod.
Lanseringsdagens specifikationsblad, i korthet:
Parametrar — 320B totalt / 18B aktiva, 45 lager, MoE.
• Modalitet — nativ text-, bild- och videoinmatning; textutdata.
• Kontextfönster — upp till 1 000 000 tokens.
• Licens — MIT, öppna vikter finns tillgängliga på Hugging Face vid lansering.
• Pris — 0,15 $ / 0,50 $ per miljon tokens (inmatning / utmatning), 0,03 $ per miljon cachad inmatning; en kampanj med 50 % rabatt till och med 9 september 2026 sänker det till 0,075 $ / 0,25 $ / 0,015 $. Vid listpris är det ungefär en tiondel av GLM-5.3:s 1,40 $ / 4,40 $.

Ox-Alpha-veckan
Avslöjandet avslutar en vecka av spekulationer. Den 20 augusti dök en anonym modell upp på en tredjepartsplattform för AI API:er med ett kontextfönster på 1 miljon token, inmatning av text/bild/video och priset noll, och den blev snabbt den mest anropade modellen på plattformens veckolistor. Communityn spårade den tillbaka till Zhipus GLM-familj inom 48 timmar – samma mönster med anonymitet följt av anspråk som tidigare identifierat modeller från andra kinesiska labb – och analytiker gissade brett på en Flash-variant av GLM-5.3. Tillkännagivandet den 26 augusti bekräftade gissningen och lade till detaljen att den fria veckan var ett avsiktligt test: Zhipu säger att den anonyma körningen satte rekord i anropsvolymer på kodningsplattformarna där den erbjöds, med all trafik betjänad från inhemska kinesiska chip.
Sammanhanget med gratisveckan spelar roll för prisförväntningarna. En modell som ges bort gratis ($0) i en vecka, för att sedan lanseras till en tiondel av flaggskeppspriset med en tidsbegränsad rabatt ner till en tjugondel, är ett medvetet marknadsskapande drag i budgetsegmentet — och det är just "tidsbegränsad"-delen man ska hålla koll på. Rabatten är ett prissättningsbeslut som kan tas tillbaka; MIT:s öppna vikter kan inte det.

Vad det kostar, i faktiska dollar
Zhipus prislista är ute i faktiska dollar, inte bara kvoter: $0.15 per miljon inmatningstokens, $0.50 per miljon utmatningstokens och $0.03 per miljon cachade inmatningstokens. Mot GLM-5.3:s publicerade $1.40 / $4.40 landar det på ungefär en tiondel till listpris, och en lanseringskampanj med 50 % rabatt som pågår till och med den 9 september 2026 sänker det till $0.075 / $0.25 / $0.015 — ungefär en tjugondel. Zhipu anger också modellens kostnad per uppgift i AA Intelligence Index till cirka $0.045, enligt leverantören, vilket är siffran bakom formuleringen "1/40 av Opus 4.8". För en modell som presterar i samma nivå som modeller prissatta 10–40 gånger högre är de övergripande siffrorna verkliga; det finstilta är att lanseringsrabatten är tillfällig och att kostnaden per uppgift beror på hur mångordig modellen visar sig vara i produktion.
Det är i effektivitetshistorien som Zhipu hävdar att kostnadsfördelen finns. Jämfört med GLM-5.3 rapporterar leverantören en 3,0x minskning av attention-beräkningen och en 4,4x minskning av KV-cachen, och hävdar lägst attention-beräkning bland de jämförda budgetmodellerna — GLM-5.3, DeepSeek V4 Flash och Kimi K3 — samtidigt som man medger att KV-cachen fortfarande är något större än hos DeepSeek V4 Flash och Kimi K3. På serveringssidan rapporterar Zhipu en 3x förbättring av end-to-end-serveringsprestandan jämfört med baslinjen på inhemska kinesiska kretsar, och når en kostnad per token som man uppger vara jämförbar med vanliga NVIDIA-GPU:er. Allt detta är leverantörsrapporterat och inget har ännu oberoende reproducerats; det är rätt siffror att stämma av mot de öppna vikterna.
Varför avslöjandet spelar roll
Bortser man från benchmarkresultaten förändrar lanseringen ändå landskapet för öppna modeller på två sätt. För det första är det en multimodal modell med öppna vikter i frontklassen till ett budgetpris – kombinationen av MIT-licens, 1M-kontext, inbyggd bild-/videoinmatning och en kostnad på ensiffriga cent per uppgift saknar direkt motsvarighet hos de amerikanska frontlinjelabben, vars motsvarande multimodala modeller kostar en storleksordning mer och släpps stängda. För det andra undergräver den Zhipus eget flaggskepp: GLM-5.3 är 743B-modellen som enligt oberoende mätningar fick 60 på AA Intelligence Index den här månaden, och GLM-5.3-Flash positioneras som "frontier intelligence, flash cost" mot samma modellfamilj. Zhipus berättelse är att en mindre, billigare modell kan fånga in det mesta av flaggskeppets kapacitet – vilket, om leverantörens påståenden om kodning och agentiska förmågor håller streck, är samma argument om post-training-ekonomin som branschen har kretsat kring hela året.
En brasklapp håller detta i perspektiv. GLM-5.3-Flash:s AA Index-poäng på 57 kommer från Zhipus egna lanseringsmaterial, ännu inte från Artificial Analysis-topplistan, och kodjämförelsen med Claude Opus 4.8 är Zhipus interna Z.ai Code Bench-utvärdering. Betrakta 57:an och kodpariteten som påståenden tills oberoende mätning landar — modellen testades brett anonymt, så tredjepartssiffror borde komma snabbt.
Prova det, och hur routinglagret passar in
Tillgång från dag ett sker via Zhipus eget API, de öppna vikterna på Hugging Face (zai-org/GLM-5.3-Flash, MIT) och Zhipus kodningsprodukter – ZCode och GLM Coding Plan, som inkluderar en uppsättning dagliga erfarenhetskort. För egen drift innebär MIT-licensen tillsammans med stöd för vLLM och SGLang att påståendena ovan om serveringseffektivitet går att verifiera direkt.
På routingsidan är GLM-5.3-Flash ännu inte med på OrcaRouters lista i och med den här uppdateringen. Resten av GLM-familjen är dock: GLM-5.3 gick live hos oss samma dag som Zhipus API öppnade, till Zhipus listpris med 0 % påslag som förs vidare. Just det vidareförandet är exakt den mekanism som spelar roll för en lansering som den här — en prisändring från leverantören, oavsett om rabatten håller i sig eller prislistan ändras senare, syns hos oss samma dag, utan omförhandling. Om du vill köra Flash mot resten av GLM-serien med en enda nyckel när den väl finns tillgänglig, så är det det upplägget som gäller; tills dess är vikterna på Hugging Face det snabbaste sättet att testa den själv.

Vad du ska titta på härnäst
Tre saker avgör den verkliga historien under de närmaste veckorna. För det första, en oberoende Artificial Analysis-mätning av 57:an — modellen kördes redan ute i det vilda som Ox Alpha, så ledartavlan borde komma ikapp snabbt. För det andra, huruvida 50%-rabatterbjudandet — som för närvarande är satt att löpa ut den 9 september 2026 — förlängs efter det datumet, eftersom det avgör Flashs löpande kostnad. För det tredje, GLM-5.3-vikterna, fortfarande utlovade till ungefär den 28 augusti — samma vecka som Flashs MIT-vikter släpptes, vilket skulle ge communityt för öppna vikter två nivåer av samma familj att jämföra på en gång.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
