
ข้อกำหนด VRAM สำหรับ GLM-5.3-Flash: หน่วยความจำเท่าใดที่คุณต้องใช้ในการรัน MoE ขนาด 320B
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
GLM-5.3-Flash ไม่สามารถรันบน GPU สำหรับผู้บริโภคทั่วไปได้ รุ่นที่เล็กที่สุดที่ใช้งานได้คือ 2bit-lite ต้องใช้ weights ประมาณ 102 GB และ RAM 112 GB Mac ขนาด 128 GB เป็นจุดเริ่มต้น; H200 ตัวเดียวใส่ 2bit-lite ได้โดยเหลือพื้นที่ว่างประมาณ 39 GB; คนอื่น ๆ ควรใช้ hosted API: z-ai/glm-5.3-flash
นั่นคือคำตอบทั้งหมดในหนึ่งลมหายใจ และควรพูดให้ชัดเจนตรงนี้เลยว่า ไม่มีการกำหนดค่าฮาร์ดแวร์ระดับผู้บริโภคใดที่สามารถรันโมเดลนี้ได้ โมเดล vision-language mixture-of-experts ขนาด 320B พารามิเตอร์ของ Z.ai ซึ่งเปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ต้องใช้หน่วยความจำระดับเซิร์ฟเวอร์ในทุกรูปแบบ quantization ตัวเลข '18B active' อธิบายถึงการคำนวณต่อโทเคน ไม่ใช่หน่วยความจำที่พักอยู่ในแรม — เวตทั้งหมด 320B ยังคงถูกโหลดไว้ เป้าหมายการรันในเครื่องที่ทำได้จริงคือ Mac แบบหน่วยความจำรวมขนาดใหญ่ เซิร์ฟเวอร์หลาย GPU และ H200 ตัวเดียวที่ 141 GB หากคุณไม่ได้เป็นเจ้าของหนึ่งในนั้น ตัวเลขด้านล่างไม่ใช่รายการช้อปปิ้ง แต่เป็นเหตุผลที่ควรเรียกใช้โมเดลผ่าน API แทน
ก่อนถึงตัวเลข ขอวางกรอบความเข้าใจไว้หนึ่งข้อ: {{1}}ตัวเลขหน่วยความจำในบทความนี้เป็นข้อค้นพบจากชุมชน ไม่ใช่คำแนะนำจากผู้จำหน่าย{{/1}} {{2}}Z.ai เผยแพร่ค่าน้ำหนัก (weights) และข้อมูลจำเพาะของ API แต่ไม่ได้เผยแพร่ข้อกำหนดด้านหน่วยความจำสำหรับการอนุมานในเครื่อง (local inference){{/2}} {{3}}ตารางแยกตามระดับการควอนไทซ์มาจากโมเดลการ์ด orcarouter/GLM-5.3-Flash-MLX บน Hugging Face{{/3}} {{4}}ซึ่งเป็นการควอนไทซ์แบบ MLX ของค่าน้ำหนักแบบเปิด (open weights) ที่กลุ่มชุมชนเป็นผู้ดูแล{{/4}} และ{{5}}ตัวเลขการปรับใช้จริงมาจากผู้ปฏิบัติที่ได้โหลดโมเดลมาใช้งานจริง{{/5}} {{6}}เมื่อใดที่ตัวเลขมาจากการรายงานของผู้จำหน่าย—ได้แก่ ราคา และข้อกล่าวอ้างด้านประสิทธิภาพของ KV-cache ของสถาปัตยกรรม—เราจะระบุกำกับไว้เช่นนั้น{{/6}}
คำตอบสั้นๆ: อะไรใช้ได้กับของที่คุณมีอยู่
เริ่มจากสิ่งที่คุณมีอยู่จริง เพราะว่าบันไดควอนไทเซชันจะมีความหมายก็ต่อเมื่อเทียบกับเครื่องเป้าหมาย:
• GPU ระดับผู้บริโภค (RTX 4090, RTX 5090 และทุกรุ่นที่ต่ำกว่า) — ไม่ ไม่มีการ์ดระดับผู้บริโภคแม้แต่ใบเดียวที่มี VRAM เพียงพอ: บิลด์ที่เล็กที่สุดต้องใช้น้ำหนักเพียงอย่างเดียวประมาณ ~102 GB คิดเป็นประมาณห้าเท่าของ RTX 5090 แรมระบบไม่ได้เปลี่ยนแปลงสิ่งนี้ เพราะน้ำหนักต้องอยู่ในอุปกรณ์
• 128 GB Mac (M4 หรือ M5 Max) — บิลด์แบบ 2bit-lite (น้ำหนัก ~102 GB / แรมขั้นต่ำ 112 GB) และจะใช้ได้ก็ต่อเมื่อเพิ่มขีดจำกัด wired-memory แล้วเท่านั้น รายละเอียดเพิ่มเติมด้านล่าง นี่คือเครื่องระดับคอนซูเมอร์เพียงเครื่องเดียวที่โมเดลนี้พอจะลงได้
• Mac Studio 192 GB และ 256 GB — ใช้งานแบบ 3-bit (~184 / 200 GB) และ 2-bit (~145 / 160 GB) ได้; 4-bit ต้องใช้ ~224 GB ซึ่งมีเพียงรุ่น 256 GB เท่านั้นที่เข้าใกล้
• H200 ตัวเดียว (VRAM 141 GB) — 2bit-lite พอดี โดยเหลืออีกประมาณ 39 GB สำหรับ KV cache ซึ่งหมายความว่าใช้ได้เฉพาะบริบทสั้นเท่านั้น
• เซิร์ฟเวอร์หลาย GPU — ทุกอย่าง รวมถึง 4-bit, 6-bit และบิลด์อ้างอิง FP8 ขนาด ~328 GB
• สำหรับคนอื่นๆ — โฮสต์ API, z-ai/glm-5.3-flash นั่นไม่ใช่รางวัลปลอบใจ; มันคือจุดที่โมเดลนี้ใช้งานได้จริงๆ ทั้งเร็วและประหยัด และมีอธิบายไว้ที่ด้านล่างของหน้านี้
ตัวเลขสองตัว ไม่ใช่หนึ่ง: น้ำหนักเทียบกับหน่วยความจำรวม
การควอนไทซ์ทุกรายการบนโมเดลการ์ดมีสองคอลัมน์ — ขนาดน้ำหนักและ RAM ขั้นต่ำ — และช่องว่างระหว่างสองคอลัมน์นี้คือส่วนที่บทความส่วนใหญ่มักข้ามไป คอลัมน์น้ำหนักคือไฟล์โมเดล: พารามิเตอร์ทุกตัว ในความแม่นยำนั้น ๆ ที่ต้องอยู่ในหน่วยความจำ คอลัมน์ RAM ขั้นต่ำคือสิ่งที่เครื่องต้องเก็บไว้ในระหว่างรันไทม์: น้ำหนักบวกกับ KV cache, activations และบัฟเฟอร์ที่เพิ่มขึ้นตามความยาวของ context
ตัวเลข 18B-active คือจุดที่ผู้คนเข้าใจผิด GLM-5.3-Flash เป็น MoE แบบ 320B-total / 18B-active: ในแต่ละ token มีพารามิเตอร์เพียงประมาณ 18B ที่ถูกคำนวณ นั่นคือการประหยัดด้านการคำนวณ ไม่ใช่การประหยัดหน่วยความจำ น้ำหนักทั้งหมด 320B อยู่ในหน่วยความจำไม่ว่า expert ตัวใดจะถูกเรียกใช้ เพราะ router ไม่รู้ว่าต้องใช้ expert ตัวใดจนกว่าจะเห็น token MoE ให้ความเร็ว ไม่ใช่พื้นที่จัดเก็บ — ซึ่งเป็นประเด็นที่การ์ดข้อมูลของโมเดลเองชี้ให้เห็นเป็นตัวอย่าง โดยแสดงค่า total 320B ไว้คู่กับค่า active 18B
ดังนั้น เมื่อ build ระบุว่า "~204 GB weights / 224 GB min RAM" ส่วนเกิน ~20 GB คือ runtime overhead — KV cache, activations, context buffers ยิ่งเพิ่ม context length ขึ้น เดลต้านั้นก็ยิ่งโตขึ้น คอลัมน์ min-RAM ไม่ใช่คอลัมน์ weights คือตัวที่ใช้กำหนดขนาดเครื่อง

ตัวโมเดลเอง — สถาปัตยกรรม สัญญาอนุญาต และกรอบการนำเสนอของ Z.ai เอง — ได้รับการบันทึกไว้ในการ์ดอย่างเป็นทางการของผู้จำหน่าย ซึ่งแสดงไว้ด้านบน หน่วยความจำภายในไม่ได้ถูกกล่าวถึงในนั้น นั่นคือเหตุผลที่หน้านี้มีอยู่ ตัวเลขด้านล่างมาจากพอร์ต MLX ของชุมชนจาก open weights
บันไดการควอนไทซ์
ตารางบนการ์ด orcarouter/GLM-5.3-Flash-MLX คือตารางที่ผู้ปฏิบัติงานใช้โหลดจากจริงในปัจจุบัน โดยระบุบิลด์แบบ quantized ห้าตัวพร้อมกับการอ้างอิง FP8 โดยแต่ละรายการระบุขนาดน้ำหนักและแรมขั้นต่ำ:
• FP8 reference — น้ำหนัก ~328 GB จุดอ้างอิงที่ไม่ผ่านการ quantization ซึ่งเป็นรูปแบบที่ open weights ถูกเผยแพร่ออกมา
• 6 บิต — น้ำหนัก ~296 GB / RAM ขั้นต่ำ 320 GB. แทบไม่สูญเสีย; บิลด์คุณภาพดีที่สุด
• 4-bit — ~204 GB / 224 GB. ค่าเริ่มต้นที่แนะนำสำหรับการใช้งานทั่วไป
• 3 บิต — ประมาณ 184 GB / 200 GB. เข้มข้นแต่ใช้งานได้.
• 2 บิต — ประมาณ 145 GB / 160 GB. แบบสุดความสามารถ
• 2bit-lite — ~102 GB / 112 GB. บิลด์ที่เล็กที่สุด; เป็นเพียงบิลด์เดียวที่พอดีกับ Mac 128 GB หรือ H200 หนึ่งตัว
คุณภาพจะลดลงเมื่อจำนวนบิตลดลง และการ์ดก็ระบุค่าความเสื่อมนี้ไว้ เมื่อเทียบกับค่าอ้างอิง FP8 ค่า perplexity เพิ่มขึ้น +0.24% ที่ 6-bit, +2.96% ที่ 4-bit, +9.96% ที่ 3-bit, +56.9% ที่ 2-bit และ +141% ที่ 2bit-lite (ตัวเลข perplexity จาก model card ตัวเดียวกัน) คำแนะนำในส่วนของการ์ดคือ: 6-bit สำหรับแบบใกล้ไม่สูญเสีย (near-lossless), 4-bit เป็นค่าเริ่มต้นสำหรับใช้งานประจำวัน, 3-bit และ 2-bit สำหรับเมื่อหน่วยความจำจำกัด, 2bit-lite ใช้เฉพาะเมื่อไม่มีทางเลือกอื่นที่พอดี และการสร้างโค้ดแบบยาวไม่น่าเชื่อถือที่ 2bit-lite คำเตือนข้อสุดท้ายนี้สำคัญสำหรับโมเดล reasoning ขนาด 320B: 2bit-lite คือสิ่งที่ทำให้คุณได้ Mac 128 GB และภาษีด้านคุณภาพก็ตกอยู่ตรงที่งานเขียนโค้ดเจ็บปวดที่สุด

ตัวเลขสองตัวในบันไดนั้นสมควรได้รับการพิจารณาอย่างใกล้ชิด เพราะมันเป็นตัวตัดสินคำถามเรื่องฮาร์ดแวร์ทั้งหมด
ทำไม 2bit-lite จึงมีอยู่
2bit-lite ไม่ได้เป็นระดับคุณภาพที่เพิ่มขึ้น — มันเป็นระดับขนาดที่สร้างขึ้นเพื่อเหตุผลเดียว: 2-bit ปกติไม่พอดี ด้วยน้ำหนัก ~102 GB มันเป็นบิลด์เดียวที่พอดีภายใต้หน่วยความจำที่ใช้งานได้ ~112 GB บน Mac ขนาด 128 GB และเป็นเพียงหนึ่งเดียวที่พอดีกับ 141 GB ของ H200 ตัวเดียว โดยมีพื้นที่เหลือสำหรับ KV cache การ์ดโมเดลกล่าวไว้เช่นนั้น: 2-bit ปกติไม่พอดีกับ Mac ขนาด 128 GB; 2bit-lite พอดี โดยมีการเพิ่มขีดจำกัดหน่วยความจำแบบมีสาย บน H200 มันพอดี "โดยเหลือ ~39 GB สำหรับ KV cache" (ตามคำกล่าวของการ์ด) พื้นที่ 39 GB นั้นเป็นงบประมาณการทำงานทั้งหมดสำหรับทุกสิ่งที่โมเดลทำหลังจากการโหลด — ซึ่งนำเราไปสู่บริบท
ต้นทุนของ KV cache เมื่อบริบทยาว
GLM-5.3-Flash มีหน้าต่างบริบทขนาด 1M โทเค็น และบริบทที่ยาวคือจุดที่แผนการใช้หน่วยความจำเฉพาะที่ต้องล้มเหลว โมเดลใช้แอตเทนชันแบบไฮบริด sparse-plus-linear — NoPE-MLA ที่มีกลไก index-pool — ซึ่งมีประสิทธิภาพอย่างแท้จริง: Z.ai รายงานว่าสามารถลดการคำนวณแอตเทนชันลง 3.01× และขนาด KV cache ลง 4.44× เมื่อเทียบกับ GLM-5.3 ของตัวเอง (ตัวเลขที่รายงานโดยผู้ผลิต) แต่การที่ "เล็กกว่า GLM-5.3 ถึง 4.44×" ก็ยังคงเหลือ cache ที่มีขนาดเป็นสิบๆ GiB เมื่อคุณดันไปจนถึงบริบทเต็ม 1M
ตัวเลขสาธารณะที่ดีที่สุดที่เรามีคือจากการติดตั้งในชุมชนที่รันโมเดลบนโหนด DGX Spark สี่โหนด: แคช KV 16 GiB ต่อ rank — รวมประมาณ 64 GiB ทั่วทั้งสี่โหนด — เพื่อเก็บคอนเท็กซ์เต็ม 1M-token ซึ่งมีขนาดรองรับคำขอแบบเต็มคอนเท็กซ์พร้อมกันได้ไม่กี่รายการ นั่นมากกว่างบประมาณหน่วยความจำทั้งหมดของเครื่องเดี่ยวส่วนใหญ่ ก่อนที่จะนับน้ำหนักแม้แต่ตัวเดียว บน H200 ตัวเดียว การคำนวณคือประเด็นของหน้านี้: 2bit-lite เหลือพื้นที่ ~39 GB สำหรับทุกอย่างหลังการโหลดน้ำหนัก — สบายๆ สำหรับแชทสั้นๆ แต่หมดไปในไม่กี่นาทีเมื่อคอนเท็กซ์เพิ่มขึ้นไปถึง 100K tokens
กฎเชิงปฏิบัติ: คอลัมน์ min-RAM สมมติบริบทที่สมเหตุสมผล หากเวิร์กโหลดของคุณประมวลผลเอกสารยาวๆ ลูปเอเจนต์ หรือโค้ดระดับรีโพซิทอรี ให้กันหน่วยความจำ KV-cache เพิ่มเติม — และสำหรับอะไรก็ตามที่ใกล้ 1M โทเค็น ให้หยุดคำนวณแล้วใช้ API ข้อสังเกตเรื่องการกำหนดขนาดเหล่านี้เป็นความรู้จากชุมชน ไม่มีคำแนะนำจากผู้จำหน่ายสำหรับการจัดสรรงบประมาณ KV
ขีดจำกัดหน่วยความจำ wired ของ macOS: ทำไม Mac ขนาด 128 GB ถึงยังโหลดไม่ขึ้น
ความล้มเหลวที่พบบ่อยที่สุดที่รายงานโดยผู้ปฏิบัติงานไม่ใช่ "แรมไม่พอ" แต่เป็น Mac ขนาด 128 GB ที่มีโมเดลประมาณ 102 GB ซึ่งไม่ยอมโหลด สาเหตุคือขีดจำกัดของ wired memory ใน macOS บน Apple Silicon นั้น GPU ไม่สามารถเข้าถึงหน่วยความจำรวมได้ทั้งหมด: Metal เผย "ชุดทำงานสูงสุดที่แนะนำ" ประมาณสองในสามของ RAM จริง และการจัดสรรที่เกินกว่านั้นจะล้มเหลวแม้เครื่องจะยังมีหน่วยความจำว่าง
ดังนั้นค่า Metal budget เริ่มต้นของ Mac 128 GB จะอยู่ในช่วงประมาณ 80–90 GB ซึ่งต่ำกว่าที่บิลด์ 2bit-lite ต้องการ (RAM ขั้นต่ำ ~112 GB โดยมีโมเดล resident ~102 GB) การโหลดจึงล้มเหลวที่ Metal budget ไม่ใช่ที่ความจุ RAM วิธีแก้ในรายงานจากผู้ปฏิบัติทุกฉบับที่เราพบคือเหมือนกัน: เพิ่มขีดจำกัด wired ด้วย sudo sysctl iogpu.wired_limit_mb=… โดยตั้งค่าให้สูงกว่าขนาดรวมของโมเดลในหน่วย MB และคาดว่าจะรีเซ็ตเมื่อรีบูต ไกด์บางส่วนในชุมชนก็ตั้งค่า wired limit จาก Python ผ่าน mlx.metal.set_wired_limit() เพื่อให้ค่าน้ำหนักของโมเดลถูกพินไว้ และ macOS หยุดบีบอัดเพจ Metal ที่ไม่ใช้งาน
อีกหนึ่งจุดที่ซับซ้อน: รันไทม์มีพฤติกรรมแตกต่างกัน MLX บังคับใช้ขีดจำกัด Metal และล้มเหลวอย่างหนักเมื่อเกินขีดจำกัด ในขณะที่รันไทม์ที่ใช้ llama.cpp (เส้นทาง GGUF) โดยทั่วไปจะไม่บังคับใช้และปล่อยให้ macOS สลับไปใช้หน่วยความจำสำรองแทน นั่นคือเหตุผลที่โมเดลเดียวกันสามารถปฏิเสธการโหลดในรันไทม์หนึ่ง แต่ "โหลดได้" ในอีกรันไทม์หนึ่ง — และเหตุผลที่โมเดลที่ถูกสลับไปใช้หน่วยความจำสำรองอาจช้าจนใช้งานไม่ได้ นี่คือข้อค้นพบจากชุมชนเกี่ยวกับพฤติกรรมของ macOS ไม่ใช่คำแนะนำจาก Apple
ทางเลือกแบบโฮสต์: z-ai/glm-5.3-flash
สำหรับทุกคนที่ตัวเลขข้างต้นตัดออกไป — ซึ่งก็คือคนส่วนใหญ่ — Z.ai ให้บริการตัวโมเดลเองในชื่อ z-ai/glm-5.3-flash และนี่คือจุดที่คำว่า "Flash" ในชื่อแสดงตัวจริงๆ ราคาป้ายของ Z.ai คือ $0.15 ต่อล้านโทเคนอินพุต, $0.03 ต่อล้านโทเคนอินพุตแบบแคช และ $0.50 ต่อล้านโทเคนเอาต์พุต; โปรโมชันเปิดตัวมีถึงวันที่ 9 กันยายน 2026 ที่ $0.075 / $0.015 / $0.25 (ราคาที่ผู้ให้บริการรายงาน ณ เวลาที่เขียน) อินพุตแบบแคชที่ราคาหนึ่งในห้าของอินพุตใหม่คือคันโยกต้นทุนที่ใหญ่ที่สุดเพียงหนึ่งเดียว: เวิร์กโหลดใดๆ ที่มีคำนำหน้าที่ใช้ซ้ำได้ — พรอมต์ระบบ นิยามเครื่องมือ เอกสารร่วมยาวๆ — ควรจะได้ราคาอ่านแคช
การคำนวณหน่วยความจำเป็นส่วนหนึ่งของการตัดสินใจ การเสิร์ฟโมเดล 320B ด้วยตัวเองหมายถึงการจัดสรรหน่วยความจำ 112–320 GB ให้กับมันไม่ว่าจะว่างหรือเต็มกำลัง เอนด์พอยน์แบบโฮสต์ย้ายภาระทั้งหมดนั้นออกจากเครื่องของคุณ และในราคาโปรโมชันเปิดตัว โมเดลนี้มีต้นทุนต่อโทเคนต่ำกว่าโมเดลหลายตัวที่มีขนาดเพียงหนึ่งในสิบของมัน — ซึ่งคือประเด็นทั้งหมดของ MoE แบบ 18B แอกทีฟ
นี่คือจุดที่เหมาะสมตามธรรมชาติสำหรับจุดเส้นทาง (routing point) ด้วย OrcaRouter ทำให้ z-ai/glm-5.3-flash เป็นหนึ่งในโมเดลกว่า 200 รายการที่อยู่เบื้องหลัง API เดียว โดยคิดราคาตามรายการราคาของผู้ให้บริการ โดยไม่มีมาร์กอัป 0% — ดังนั้นโปรโมชันเปิดตัว และการลดราคาในอนาคตใด ๆ จะมีผลทันทีในวันที่ประกาศ การเฟลโอเวอร์อัตโนมัติหมายความว่าโมเดลอายุสามวันที่มีเส้นทางให้บริการไม่เสถียรจะไม่เป็นการเดิมพันกับระบบ production ของคุณ: หากผู้ให้บริการเกิดข้อผิดพลาดหรืออิ่มตัว คำขอจะเปลี่ยนไปยังผู้ให้บริการที่ทำงานปกติแทนที่จะล้มเหลว การลองโมเดลที่ยังไม่ผ่านการพิสูจน์อย่างปลอดภัยคือสิ่งที่เราเตอร์มีไว้เพื่อสิ่งนี้โดยเฉพาะ

คำถามที่พบบ่อย
ฉันสามารถรัน GLM-5.3-Flash บน RTX 5090 ได้ไหม?
ไม่. โมเดลที่เล็กที่สุดมีน้ำหนักเพียงประมาณ ~102 GB และ RTX 5090 มี VRAM 32 GB ไม่มี GPU สำหรับผู้บริโภครุ่นใดใกล้เคียงเลย โมเดลนี้ต้องใช้ Mac แบบ unified memory, H200 ตัวเดียว หรือเซิร์ฟเวอร์แบบหลาย GPU
18B แอคทีฟหมายความว่า GLM-5.3-Flash ทำงานบนฮาร์ดแวร์สำหรับผู้บริโภคหรือไม่
ไม่ใช่ ตัวเลข 18B ที่ active คิดเป็น compute ต่อ token พารามิเตอร์ทั้งหมด 320B ยังคงอยู่ในหน่วยความจำ เพราะ router ไม่สามารถรู้ได้ว่า token ต้องใช้ expert ตัวไหนจนกว่าจะเห็น token นั้น MoE ประหยัด compute ไม่ใช่หน่วยความจำ
วิธีที่ถูกที่สุดในการลองใช้ GLM-5.3-Flash คืออะไร?
โฮสต์ API ชื่อ z-ai/glm-5.3-flash ในราคาโปรโมชันเปิดตัว คิดค่าใช้จ่าย $0.075 ต่อล้าน input tokens และ cached-input tokens ราคา $0.015 การโฮสต์ด้วยตัวเองในรูปแบบที่เล็กที่สุดหมายถึงการจัดสรร RAM ประมาณ 112 GB ให้กับมัน ซึ่งจะสมเหตุสมผลก็ต่อเมื่อคุณมีฮาร์ดแวร์อยู่แล้วเท่านั้น
สรุปอย่างตรงไปตรงมา: GLM-5.3-Flash เป็นโมเดลระดับเซิร์ฟเวอร์ในทุกบิลด์ Mac ขนาด 128 GB จะได้บิลด์เดียวที่พอดี นั่นคือ 2bit-lite พร้อมการเพิ่มขีดจำกัดหน่วยความจำแบบฮาร์ดไวร์ คอนเทกซ์สั้น และการลดคุณภาพที่ระบุไว้ชัดเจนสำหรับโค้ดยาว H200 หนึ่งตัวได้บิลด์เดียวกันกับพื้นที่ว่าง KV ~39 GB ฮาร์ดแวร์ระดับเซิร์ฟเวอร์ได้บันไดที่แท้จริง ตั้งแต่ 4-bit เป็นค่าเริ่มต้นขึ้นไปจนถึง 6-bit ที่ใกล้ไม่สูญเสีย และสำหรับคนอื่นๆ — ผู้อ่านส่วนใหญ่ — เอนด์พอยต์โฮสต์ z-ai/glm-5.3-flash คือคำตอบที่ถูกต้อง และตัวเลขด้านบนคือเหตุผล ไม่ใช่รายการช้อปปิ้ง สำหรับการติดตั้งทีละขั้นตอนบน MacBook Pro บทความแนะนำการติดตั้ง MacBook ของเราครอบคลุมขั้นตอนทั้งหมดตั้งแต่ต้นจนจบ สำหรับการเปรียบเทียบคุณภาพของบิลด์ควอนไทเซชันและเลือกใช้เมื่อใด คู่มือ MLX build มีรายละเอียด และข่าวสารการเปิดตัวมีบริบทและคำกล่าวอ้างเรื่องเบนช์มาร์ก
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
