
วิธีรัน GLM-5.3-Flash บน MacBook Pro: คู่มือ MLX 2bit-Lite
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
การรัน GLM-5.3-Flash บน MacBook Pro หมายถึงเครื่องเดียวเท่านั้น: MacBook Pro M4/M5 Max 128 GB ที่รัน 2bit-lite บิลด์ของ การแปลง MLX ของเรา, โดยเพิ่มขีดจำกัดหน่วยความจำ wired ของ macOS แล้ว หาก MacBook Pro ของคุณมีหน่วยความจำน้อยกว่า 128 GB — M4 Pro 36 GB, M4 Max 48 GB — คู่มือนี้ไม่เหมาะสำหรับคุณ; ข้ามไปยังส่วนสุดท้ายและใช้ API ที่โฮสต์ไว้ z-ai/glm-5.3-flash แทน. GLM-5.3-Flash (weights at zai-org/GLM-5.3-Flash) เป็นโมเดล Mixture-of-Experts ของ Z.ai ที่มีพารามิเตอร์ 320 พันล้าน โดยมีพารามิเตอร์ที่ใช้งานจริง 18B ต่อโทเคน — เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 ซึ่งเป็น GLM-5 รุ่นแรกที่เป็น multimodal โดยกำเนิด — และแม้แต่บิลด์ที่เล็กที่สุดของพอร์ต MLX ของเรายังต้องใช้ weights ~102 GB และหน่วยความจำ ~112 GB นั่นคือตลาดทั้งหมด และเราจะไม่ทำให้มันดูเบาลง.
นี่คือเอกสารจากผู้พัฒนาโดยตรง ไม่ใช่บทความเปิดตัว: น้ำหนักโมเดลด้านล่างเป็นบิลด์ของ OrcaRouter เอง (orcarouter/GLM-5.3-Flash-MLX, ภายใต้สัญญา MIT) ซึ่งสร้างด้วยวิธีควอนไทเซชัน OrcaSAQ ที่ไม่ต้องปรับเทียบของเรา เราเผยแพร่เมื่อวันที่ 26 สิงหาคม และแก้ไขแนวทางอย่างเปิดเผยในวันถัดมา เนื่องจากช่วงควอนไทซ์ดั้งเดิมทำให้การใช้งานบน MacBook Pro ไม่เหมาะสำหรับคนส่วนใหญ่ — บิลด์ 2-bit ปกติยังต้องใช้หน่วยความจำประมาณ 160 GB ซึ่งแล็ปท็อปเครื่องไหนก็ไม่มี เมื่อวันที่ 27 สิงหาคม เราจึงสร้างเวอร์ชันที่เล็กที่สุดใหม่เป็น 2bit-lite เพื่อให้พอดีกับ MacBook Pro 128 GB โดยเฉพาะ และบทความนี้คือการเล่าอย่างตรงไปตรงมาว่าคุณได้อะไรจากสิ่งนั้นและต้องแลกด้วยอะไร ตัวเลขทุกตัวที่ระบุว่า บันทึกภาคสนาม ด้านล่างวัดผลจากการรันเพื่อตรวจสอบบน H200 เครื่องเดียวของเรา ไม่มีอะไรในนี้เป็น benchmark จากผู้จำหน่าย ในจุดที่เราทำตามแนวปฏิบัติของชุมชน เช่น คำสั่ง wired-memory หรือการระบุเวอร์ชันของ mlx-vlm เราจะติดป้ายกำกับไว้เช่นนั้น
รุ่น build ใดเหมาะกับ Mac รุ่นใด (อ่านข้อนี้ก่อนดาวน์โหลดอะไรก็ตาม)
บิลด์ทั้งห้าใน repo ต่างแมปกับค่า RAM ขั้นต่ำ บน MacBook Pro 'which build' มีคำตอบเดียวเท่านั้น — ทุกอย่างที่สูงกว่า 2bit-lite คือหัวข้อที่เกี่ยวกับ Mac Studio:
• 6-bit — น้ำหนัก ~296 GB / แรม ~320 GB / แทบไม่สูญเสีย เฉพาะ Mac Studio ที่มีแรม 512 GB เท่านั้น
• 4-bit — ~204 GB / ~224 GB / ค่าเริ่มต้นที่เราแนะนำ Mac Studio 256 GB นี่คือสิ่งที่ repo root มิเรอร์
• 3 บิต — ~184 GB / ~200 GB. Mac Studio 256 GB.
• 2 บิต — ~145 GB / ~160 GB. Mac Studio 192 GB. นี่คือบิลด์ที่เล็กที่สุดที่เราส่งมอบในวันแรก และมันคือความพลาด
• 2bit-lite — ~102 GB / ~112 GB. บิลด์เดียวที่พอดีกับเครื่อง 128 GB — MacBook Pro M4/M5 Max ขนาด 128 GB หรือ Mac Studio หรือ Mac mini ขนาด 128 GB แล็ปท็อป Apple Silicon ขนาด 128 GB (M3 Max หรือใหม่กว่า) ก็เหมือนกัน เพียงแต่ช้ากว่า
กับดักที่ซ่อนอยู่ในบันไดนั้น: คำสั่งดาวน์โหลดเริ่มต้นใน README จะดึงบิลด์ 4-bit (ประมาณ 204 GB) ซึ่งเป็นค่าเริ่มต้นที่เหมาะสำหรับเครื่อง 256 GB แต่ไร้ประโยชน์บนแล็ปท็อป ถ้าคุณทำตามคำสั่งเริ่มต้นบน MacBook Pro คุณจะได้โมเดลที่ไม่สามารถจัดสรรหน่วยความจำได้ เส้นทาง 2bit-lite จำเป็นต้องระบุอย่างชัดเจน--include ซึ่งจะกล่าวถึงด้านล่าง.
นอกจากนี้ยังมีเพดานแข็งที่คุณจะชนก่อนที่คณิตศาสตร์ข้างต้นจะใช้ได้ด้วยซ้ำ macOS ไม่อนุญาตให้กระบวนการหนึ่งเข้าควบคุมหน่วยความจำรวมทั้งหมด 128 GB ของ Mac โดยเพดานที่ GPU ใช้ได้โดยค่าเริ่มต้นอยู่ที่ประมาณ 91–96 GB (ซึ่งถูก reverse-engineer โดยชุมชนและได้รับการยืนยันในบทความหลายชิ้นเกี่ยวกับการตั้งค่า MLX สำหรับโมเดลขนาดใหญ่) ซึ่งต่ำกว่าน้ำหนักโมเดลเพียงอย่างเดียวที่ ~102 GB ดังนั้น แม้แต่ 2bit-lite ก็จะโหลดไม่ได้จนกว่าคุณจะเพิ่มขีดจำกัด wired-memory. ขั้นตอนนั้นจำเป็น และอยู่ใน Section 4.
ติดตั้ง mlx-vlm — และเฉพาะ mlx-vlm เท่านั้น
GLM-5.3-Flashเป็นโมเดลวิทัศน์-ภาษา (vision-language model) ดังนั้นจึงทำงานภายใต้ mlx-vlm ไม่ใช่ mlx-lm. นี่เป็นสาเหตุที่ทำให้ผู้คนติดปัญหามากที่สุด ดังนั้นควรพูดให้ชัดเจนตั้งแต่แรก: mlx-lm ใช้สำหรับโมเดลข้อความเท่านั้น การรันโมเดล multimodal ผ่านมันจะทำให้เกิดข้อผิดพลาดการโหลดที่ทำให้สับสน ติดตั้งแพ็กเกจ VLM เวอร์ชัน 0.6.17 ขึ้นไป:
pip install -U "mlx-vlm>=0.6.17"
การตรึงเวอร์ชันไม่ใช่ของตกแต่งglm5_next — สถาปัตยกรรมไฮบริดแบบ sparse-plus-linear-attention ที่อยู่เบื้องหลังGLM-5.3-Flash — เพิ่งถูกเพิ่มเข้าไปใน mlx-vlm ในวันเดียวกับที่โมเดลเปิดตัว (26 สิงหาคม 2026) และเวอร์ชันที่เก่ากว่าจะไม่รู้จักคอนฟิกนี้ สถาปัตยกรรมนี้สำคัญด้วยเหตุผลอีกประการหนึ่ง: มันคือโทโพโลยีแบบใหม่เอี่ยม และพอร์ตในระลอกแรกมีบั๊กด้านความถูกต้องจริงๆ ซึ่งผลลัพธ์ที่อ่านแล้วลื่นไหลจะไม่เผยให้เห็น การตรวจสอบรันไทม์โดยชุมชนบนเส้นทาง MLX ของ glm5_next ในระยะแรกพบและแก้ไขบั๊กสี่ตัว — การที่ไม่ได้ใช้ SwiGLU clamp ในทุกบล็อก FFN, เทนเซอร์ hyper-connection ที่ถูกจำกัดด้วย manifold ถูกแปลงเป็น dtype ที่ผิด (ซึ่งทำให้เมทริกซ์ผสม attention เสียหายอย่างเงียบๆ), ความไม่ตรงกันของ epsilon สองจุดใน attention norms, และ router logits แบบ bf16 ในขณะที่ reference ใช้ float32 หลังจากการแก้ไข ค่าตัวเลขตรงกับ reference ถึงประมาณ 1e-7 ข้อสรุปสำหรับคุณ: อัปเดต mlx-vlm ให้ทันสมัยอยู่เสมอ และปฏิบัติต่อรุ่นแรกสุดของพอร์ตสถาปัตยกรรมใหม่ด้วยความระแวง
ดาวน์โหลดน้ำหนัก: แฟลกสำหรับไม่รวม และแฟลกสำหรับรวมที่คุณต้องการจริงๆ
รากของรีโพเทียบเท่ากับบิลด์แบบ 4-bit และทั้งห้าเวอร์ชันมาในรูปแบบโฟลเดอร์ย่อย คำสั่งเริ่มต้นจะดาวน์โหลดรากและใช้--excludeเพื่อไม่ให้โฟลเดอร์ของทั้งห้าเวอร์ชัน (ซึ่งรวมกันมีขนาดประมาณ 800 GB) ถูกดาวน์โหลดมาด้วย:
hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"
บน MacBook Pro คำสั่งนั้นไม่ถูกต้องสำหรับคุณ — มันให้ root แบบ 4-bit แก่คุณ สำหรับแล็ปท็อป 128 GB ให้ดึงเฉพาะ 2bit-lite ซึ่งเป็นโฟลเดอร์ย่อย:
hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX
นั่นคือไฟล์ดาวน์โหลดขนาด ~102 GB ซึ่งครบถ้วนในตัวเอง — 2bit-lite/ โฟลเดอร์นี้มี config.json ของตัวเอง ดังนั้นคุณจึงชี้ตัวสร้างไปที่มันได้โดยตรง ถ้า hf ไม่อยู่ใน PATH ของคุณ ให้ติดตั้งมัน: pip install -U huggingface_hub ก่อนเริ่ม ให้ตรวจสอบว่าคุณมีพื้นที่ว่างบนดิสก์ ~110 GB และพื้นที่เก็บข้อมูลบน Mac ของคุณไม่ได้เหลือแค่ 100 GB สุดท้าย — MLX memory-map น้ำหนัก และ SSD ที่เกือบเต็มคือสาเหตุที่การตั้งค่าเหล่านี้พังกลางการดาวน์โหลด

เพิ่มขีดจำกัดของ wired memory — ขั้นตอนที่ทุกคนมักลืม
นี่คือขั้นตอนชี้เป็นชี้ตายบน MacBook Pro 128 GB และการ์ด README กลับถือว่าคุณรู้อยู่แล้วแทนที่จะเขียนคำสั่งให้ชัดเจน ค่าเพดาน working set ของ Metal เริ่มต้นบน Mac 128 GB อยู่ที่ประมาณ 91–96 GB ซึ่งต่ำกว่าน้ำหนัก 2bit-lite ที่ ~102 GB — ดังนั้นหากไม่ทำขั้นตอนนี้ โมเดลจะจัดสรรหน่วยความจำไม่สำเร็จและโหลดตาย วิธีแก้ที่ชุมชนใช้กันคือการตั้งค่า sysctl ที่เพิ่มเพดานหน่วยความจำแบบ wired ของ GPU เป็นหน่วยเมกะไบต์:
sudo sysctl iogpu.wired_limit_mb=114688
นั่นกำหนดเพดานไว้ที่ประมาณ 112 GB เหลือประมาณ 14 GB เป็นพื้นที่สำรองของระบบปฏิบัติการ บนเครื่องที่แรม 128 GB ค่าที่ชุมชนใช้งานจริงมักอยู่ระหว่าง ~114688 (112 GB) ถึง ~122880 (120 GB) อย่าตั้งค่าสูงสุด — macOS ต้องการพื้นที่ว่างไว้ใช้งาน มิฉะนั้นจะเกิดอาการหน้าจอกระตุกจาก window-server และระบบดีเลย์เมื่อหน่วยความจำเต็ม หลังจากตั้งค่าแล้ว ให้โหลดโมเดลและดู Activity Monitor: หากความดันหน่วยความจำเปลี่ยนเป็นสีเหลือง ให้ลดตัวเลขลง
หมายเหตุเชิงปฏิบัติสองข้อ ซึ่งทั้งคู่มาจากแนวทางปฏิบัติของชุมชน ไม่ใช่จากบันทึกภาคสนามของเรา ประการแรก sysctl จะถูกรีเซ็ตเมื่อรีบูตและใช้กับเซสชันเทอร์มินัลที่คุณตั้งค่าไว้ ดังนั้นควรวางแผนรันมันใหม่ (หรือเขียนสคริปต์ผ่าน LaunchAgent) — การลืมมันหลังรีบูตคือความล้มเหลวแบบคลาสสิก "เมื่อวานยังใช้ได้" ประการที่สอง MLX ยังเปิดเผยตัวปรับแต่งระดับโพรเซส mlx.core.metal.set_wired_limit(bytes) บน macOS 15.0 ขึ้นไป โดยค่านี้ต้องไม่เกินเพดานของ sysctl และเป็นตัวเลือกที่พกพาได้มากกว่าหากคุณเขียนสคริปต์ในโน้ตบุ๊ก ไม่ว่าคุณจะใช้แบบไหน ผลลัพธ์ก็เหมือนกัน: หากไม่มีมัน ไม่มีอะไรที่นี่ทำงาน
รันมัน: ข้อความ รูปภาพ และ Python API
เมื่อวางน้ำหนักเข้าที่และเพิ่มขีดจำกัดแล้ว การสร้างเป็นคำสั่งเดียว ข้อความ:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "อธิบายการพัวพันเชิงควอนตัมในหนึ่งประโยค." --max-tokens 256
การป้อนรูปภาพทำงานในลักษณะเดียวกันกับ --image ซึ่งเป็นแฟล็ก — นี่คือจุดที่โมเดลมัลติโมดัลพิสูจน์คุณค่าบนแล็ปท็อป เนื่องจากทาวเวอร์วิทัศน์ยังคงใช้ความแม่นยำสูงในเลย์เอาต์ OrcaSAQ:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "อธิบายภาพนี้" --max-tokens 256
สำหรับสคริปต์ Python API มีรูปแบบเดียวกันกับที่ผู้ใช้ mlx-vlm คุ้นเคย:
from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "อธิบายภาพนี้.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))
กำหนด --max-tokens ให้พอประมาณ ในการรัน field-note บน H200 ของเรา 2bit-lite รักษาความเร็วไว้ที่ประมาณ 10 tok/s ดังนั้น คำตอบขนาด 1,024 โทเคนก็ต้องรอนานถึง 2 นาที — และเอาต์พุตที่ยาวคือจุดที่ KV budget และการถดถอยของคุณภาพเล่นงาน (ดูด้านล่าง) บนโน้ตบุ๊ก คุณควรคาดหวังว่ามันจะรู้สึกช้ากว่า ไม่ใช่เร็วกว่า จนกว่าจะมีตัวเลขจากการวัดจริง
คุณภาพที่คุณได้รับจริง (บันไดที่วัดได้)
นี่คือส่วนที่จริงใจของคู่มือ และเราจะไม่ปิดบังมัน OrcaSAQ เสื่อมคุณภาพลงอย่างค่อยเป็นค่อยไปจนถึง 3 บิต จากนั้นต้นทุนก็เพิ่มขึ้นอย่างรวดเร็ว เทียบกับค่าอ้างอิง FP8 (perplexity 2.7797):
• 6-bit — perplexity 2.7864 (+0.24%), ความตรงกันของโทเคน top-1 97.76% แทบไม่มีการสูญเสีย ตามที่โฆษณาไว้
• 4-bit — perplexity 2.8620 (+2.96%), top-1 96.13% ซึ่งเป็นค่าเริ่มต้นที่แนะนำ.
• 3-bit — เพอร์เพล็กซิตี้ 3.0566 (+9.96%), top-1 92.06% ก้าวร้าวแต่ใช้งานได้
• 2-bit — perplexity 4.3622 (+56.9%), top-1 86.56% เป็นต้นทุนที่แท้จริง
• 2bit-lite — perplexity 6.7018 (+141%), top-1 77.19% เป็นบิลด์ที่เล็กที่สุด และเป็นเพียงบิลด์เดียวที่ MacBook Pro รองรับได้
พวกนั้นคือตัวเลขที่วัดได้จากไปป์ไลน์การแปลงของเราเอง 2bit-lite มีการถดถอยของเพอร์เพล็กซิตี้ 141% และความสอดคล้องของโทเคนอันดับแรกต่ำกว่า 78% — คุณกำลังรันโมเดลที่ด้อยลงอย่างเห็นได้ชัด และโหมดความล้มเหลวด้านล่างคือสิ่งที่ความด้อยลงนั้นแสดงออกมาในทางปฏิบัติ มันเป็นเดโมที่ยอดเยี่ยมและผู้ช่วยรูปแบบสั้นที่สมเหตุสมผล แต่มันไม่ใช่สิ่งทดแทนโมเดลแบบเต็มความแม่นยำ
{{1}}ในเรื่องความเร็ว เราต้องพูดตรงๆ กับคุณเช่นเดียวกัน{{/1}} {{2}}บันทึกภาคสนามที่เผยแพร่คือ H200: ~10 tok/s, การสนทนาหลายรอบที่เสถียร, เหมาะกับคำถาม-ตอบในชีวิตประจำวันและข้อความสั้นๆ{{/2}} {{3}}เรายังไม่มีตัวเลขที่วัดได้สำหรับ MacBook Pro สำหรับ 2bit-lite และเราจะไม่กุตัวเลขขึ้นมา{{/3}} {{4}}ปริมาณงานของ Apple Silicon ในที่นี้ขึ้นอยู่กับแบนด์วิธหน่วยความจำ การระบายความร้อน และความครอบคลุมของเคอร์เนล MLX สำหรับ attention แบบไฮบริด ซึ่งเราไม่ได้วัดสิ่งเหล่านี้เลยสำหรับบิลด์นี้บนแล็ปท็อปเครื่องนี้{{/4}} {{5}}จุดข้อมูล Apple Silicon ที่ใกล้เคียงที่สุดเท่าที่เราจะอ้างอิงให้คุณได้คือตัวเลขจากแหล่งอิสระที่ ~450 tok/s สำหรับบิลด์ GLM-5.3-Flash แบบ 4-bit บน Mac 512 GB ภายใต้รันไทม์ MLX ที่ต่างกัน{{/5}} {{6}}ซึ่งเป็นบิลด์ที่ต่างกัน ความแม่นยำที่ต่างกัน และเป็นเครื่องเดสก์ท็อป ดังนั้นอย่านำค่านั้นไปใช้เป็นตัวเลขของคุณเช่นกัน{{/6}} {{7}}วางแผนไว้ก่อนว่าเครื่องจะช้า และถ้าไม่ช้าก็ถือว่าเป็นเซอร์ไพรส์ที่น่ายินดี{{/7}}
แคช KV และบริบทยาว: อย่าลืมเผื่อพื้นที่
GLM-5.3-Flashโฆษณาหน้าต่างบริบทขนาด 1M โทเคน ตัวเลขนั้นไม่เกี่ยวข้องกับฮาร์ดแวร์นี้ และคำแนะนำวิธีใช้ที่แสร้งว่ามันสำคัญก็จะทำให้คุณเข้าใจผิด หมายเหตุภาคสนามมีเพียงหนึ่งบรรทัด: ให้รันไทม์มีงบประมาณ KV เพียงพอสำหรับความยาวเป้าหมายของคุณ บน H200 ตัวเดียว โหมด 2bit-lite เหลือพื้นที่ว่างประมาณ 39 GB สำหรับ KV cache หลังจากโหลดน้ำหนักโมเดลแล้ว บน MacBook Pro 128 GB ตัวเลขยิ่งบีบหนักกว่า: น้ำหนักโมเดลประมาณ 102 GB เทียบกับเพดานประมาณ 112 GB เหลือราว ๆ 26 GB ก่อนที่จะหัก working set ของ macOS เอง — และเลเยอร์ไฮบริดที่ใช้ linear-attention ทำให้พื้นที่ KV ของโมเดลนี้เล็กเมื่อเทียบกับ dense model ที่ขนาดเท่ากัน แต่มันก็ยังเพิ่มขึ้นเป็นเส้นตรงตามความยาวบริบท
คำแนะนำจากฝั่งเซิร์ฟเวอร์ของชุมชนในวงกว้างสนับสนุนประเด็นนี้: การกำหนดค่าที่โหลดได้อย่างราบรื่นที่บริบท 8K อาจทำให้หน่วยความจำเต็มที่ 128K บนแล็ปท็อป ให้ใช้บริบทสั้น ๆ — ข้อความถาม-ตอบไม่กี่พันโทเค็นหรือรูปภาพหนึ่งภาพ — และอย่าพยายามป้อนหนังสือทั้งเล่มให้มัน เมื่อใดก็ตามที่งานต้องการบริบทที่ยาวจริง ๆ คุณจะอยู่ในส่วนสุดท้ายของบทความนี้
การสร้างโค้ดที่ยาวไม่น่าเชื่อถือที่ 2bit-lite (อ่านข้อความนี้สองครั้ง)
นี่คือส่วนที่คู่มือวิธีทำจะไร้ค่าหากซ่อนโหมดความล้มเหลวของมันไว้ ดังนั้นส่วนนี้จึงควรมีหัวข้อของตัวเอง บันทึกภาคสนามของ H200 ชัดเจนไม่กำกวม: คำถาม-คำตอบทั่วไปและข้อความสั้นๆ ออกมาดี แต่การสร้างโค้ดยาวๆ ไม่น่าเชื่อถือที่ความแม่นยำระดับนี้ เราสามารถจำลองโหมดความล้มเหลวสามโหมดในการทดสอบตรวจสอบของเรา:
• การวนซ้ำ — โมเดลเริ่มพูดซ้ำบรรทัดเดิมหรือบล็อกเดิมแทนที่จะดำเนินเนื้อหาต่อไป โดยทั่วไปจะเริ่มเกิดขึ้นหลังจากสร้างไปได้สองสามร้อยโทเคน
• โค้ดเชื่อมต่อที่ขาดหายไป — การนำเข้า การเชื่อมต่อ และการจัดการข้อผิดพลาดถูกละทิ้งไปอย่างเงียบ ๆ ฟังก์ชันที่สร้างขึ้นนั้นดูถูกต้องเมื่อมองแยกเดี่ยว แต่ไม่สามารถทำงานได้ เพราะโครงสร้างรองรับโดยรอบนั้นไม่มีอยู่จริง
• การเขียนซ้ำซ้อน — แทนที่จะแก้ไขเพียงเล็กน้อย โมเดลกลับเขียนทับเนื้อหาส่วนใหญ่ของไฟล์ใหม่ และผลลัพธ์ในแต่ละรอบที่ต่อเนื่องกันไม่สอดคล้องกับของกันและกัน
สิ่งเหล่านี้ทำซ้ำได้ที่ 2bit-lite และมันคือสิ่งที่ข้อตกลงระดับ top-1 77% ทำนายไว้อย่างชัดเจน สิ่งที่ผู้ปฏิบัติที่ยังคงยึดแล็ปท็อปบิลด์เป็นหลักทำจริง ๆ คือ:
• ใช้สำหรับ การอธิบาย การสรุป คำถาม-คำตอบ และการทำความเข้าใจรูปภาพ — งานรูปแบบสั้นที่มันทำได้ดีจริงๆ
• หากจำเป็นต้องขอโค้ด ให้ขอ ทีละฟังก์ชันเล็กๆ พร้อมกับซิกเนเจอร์ที่ชัดเจน และตรวจสอบแต่ละฟังก์ชันก่อนดำเนินการต่อไป อย่าส่งไฟล์ทั้งหมดให้มันแล้วขอฟีเจอร์
• สำหรับสิ่งใดก็ตามที่ยาว — โมดูลเต็มรูปแบบ การรีแฟกเตอร์ หรือเซสชันเอเจนต์ที่ยาว — ให้ส่งไปยัง API แบบเต็มความแม่นยำ นั่นไม่ใช่วิธีแก้ปัญหาเฉพาะหน้า แต่เป็นสถาปัตยกรรมที่ถูกต้อง และเป็นส่วนสุดท้าย
เมื่อไม่ควรทำสิ่งนี้เลย: เรียก z-ai/glm-5.3-flash แทน

กฎการตัดสินใจอย่างตรงไปตรงมา: เรียกใช้ 2bit-lite บน MacBook Pro M4/M5 Max ขนาด 128 GB เฉพาะเมื่อคุณต้องการโมเดลมัลติโมดัล 320B อย่างแท้จริง บนแล็ปท็อปที่คุณพกพาได้ — ถาม-ตอบแบบออฟไลน์ เอกสารส่วนตัว การทำความเข้าใจรูปภาพ โดยไม่มีอะไรออกจากเครื่องเลย เลือกใช้ API สำหรับอย่างอื่นทั้งหมด:
• MacBook Pro ทุกรุ่นที่ต่ำกว่า 128 GB — ไม่มี build สำหรับคุณ อย่าพยายามโหลดมัน ใช้ API แทน
• การสร้างโค้ดแบบยาวหรือการให้เหตุผลด้วยบริบทยาว — 2bit-lite ล้มเหลวในเรื่องนี้อย่างแน่นอนและสม่ำเสมอ ใช้ API แทน
• งานที่คำนึงถึงคุณภาพ — ความสอดคล้อง top-1 77.19% และ perplexity +141% คือการลดลงจริง ไม่ใช่ข้อผิดพลาดจากการปัดเศษ ใช้ API.
• ปริมาณงานที่รับประกันหรือความหน่วงที่คาดเดาได้ — ยังไม่มีตัวเลขที่วัดจากแล็ปท็อป และบันทึกภาคสนามคือ 10 tok/s ใช้ API.

โมเดลที่โฮสต์คือ z-ai/glm-5.3-flashให้บริการแบบความแม่นยำเต็มรูปแบบบน OrcaRouter ในราคาปัจจุบันของ Z.ai — $0.07 ต่อล้านโทเคนอินพุต และ $0.25 ต่อล้านโทเคนเอาต์พุต ณ เวลาที่เขียนนี้ (ราคาช่วงเปิดตัว; ราคาที่ Z.ai ประกาศอย่างเป็นทางการคือ $0.15 / $0.50) นี่คือราคาที่ผู้ให้บริการรายงาน และเราส่งต่อโดยคิดมาร์กอัป 0% ดังนั้นการลดราคาของ Z.ai จะแสดงผลในฝั่งเราภายในวันเดียวกัน คุณจะได้รับ API key เดียวที่สามารถเข้าถึงโมเดลอื่นๆ อีก 200+ รายการที่เราให้บริการ และการ failover อัตโนมัติหมายความว่าการทดลองกับโมเดลใหม่นี้ไม่ได้ทำให้เส้นทางการผลิตของคุณต้องพึ่งพาผู้ให้บริการรายเดียว ในเวลาเดียวกันกับการดาวน์โหลด 102 GB และการรอคอยการสร้างผลลัพธ์ครั้งแรกที่เชื่องช้า API ก็ตอบคำถามได้มากเท่ากับหนึ่งสัปดาห์แล้ว — และตอบด้วยความแม่นยำเต็มรูปแบบ
การอนุมานในเครื่องจะคุ้มค่าเมื่อเหตุผลคือการทำงานในเครื่อง — ความเป็นส่วนตัว การทำงานแบบออฟไลน์ ไม่มีการจำกัดอัตราการใช้งาน เดโมที่ทำงานด้วยแบตเตอรี่ ไม่คุ้มค่าเมื่อคิดจากต้นทุนหรือคุณภาพสำหรับเหตุผลอื่นใด และไม่คุ้มค่าเลยบนเครื่องที่มีหน่วยความจำน้อยกว่า 128 GB
คำถามที่พบบ่อย
Mac ขนาด 64 GB หรือ 96 GB สามารถรัน GLM-5.3-Flash ในเครื่องได้ไหม? ไม่ได้ โมเดลขนาดเล็กที่สุดอย่าง 2bit-lite ต้องใช้พื้นที่ขั้นต่ำประมาณ 112 GB หลังจากหักค่าใช้จ่ายของ macOS แล้ว และแม้แต่เครื่อง 128 GB ก็ยังต้องเพิ่มขีดจำกัดหน่วยความจำแบบ wired เพื่อโหลดมัน หาก Mac ของคุณต่ำกว่า 128 GB ไม่มีเส้นทางสำหรับการรันในเครื่อง ให้เรียกใช้ z-ai/glm-5.3-flash ผ่าน API แทน
ฉันติดตั้ง mlx-vlm แล้วโมเดลโหลดไม่สำเร็จ — มีอะไรผิดปกติ? สาเหตุปกติสองประการ เรียงตามลำดับ: เวอร์ชันต่ำกว่า 0.6.17 ซึ่งมาก่อนการรองรับ glm5_next และจะไม่รู้จักสถาปัตยกรรมนั้น; และการไม่เพิ่มขีดจำกัด wired-memory เนื่องจากบิลด์ขนาด ~102 GB ไม่สามารถจัดสรรหน่วยความจำได้ภายใต้เพดาน Metal เริ่มต้นที่ ~91–96 GB บน Mac 128 GB แก้ทั้งสองอย่าง (อัปเกรดแพ็กเกจ รัน sysctl) แล้วมันจะโหลดได้
2bit-lite ที่ build ในเครื่องเป็นโมเดลเดียวกับ API ของ z-ai/glm-5.3-flash หรือไม่? มีน้ำหนักพื้นฐานเดียวกันกับ GLM-5.3-Flash แต่คุณภาพไม่เท่ากัน 2bit-lite เป็นการควอนไทซ์แบบ 2-bit ซึ่งมีความตรงกันของโทเคนแบบ top-1 อยู่ที่ 77.19% เมื่อเทียบกับ FP8 reference และการสร้างโค้ดยาวก็ไม่น่าเชื่อถือ API ให้ความแม่นยำเต็มรูปแบบ ทั้งสองใช้แทนกันได้เฉพาะงานแบบสั้นที่ยอมรับความคลาดเคลื่อนของคุณภาพได้เท่านั้น
เวอร์ชัน 30 วินาที
เครื่องเดียว บิลด์เดียว sysctl ที่จำเป็นหนึ่งตัว หากคุณมี MacBook Pro M4/M5 Max ความจุ 128 GB: ติดตั้ง mlx-vlm>=0.6.17, ดาวน์โหลดเฉพาะ 2bit-lite/ (~102 GB), เพิ่มขีดจำกัดหน่วยความจำแบบ wired ด้วย sudo sysctl iogpu.wired_limit_mb=114688, แล้วรัน mlx_vlm.generate — สำหรับ Q&A ข้อความสั้น และรูปภาพ ยอมรับว่าการสร้างโค้ดยาวๆ ไม่น่าเชื่อถือที่ความแม่นยำระดับนี้ ว่ายังไม่มีปริมาณงานบนแล็ปท็อปที่วัดได้ และว่า Mac 128 GB คือขั้นต่ำ ไม่ใช่มาตรฐาน หากข้อแม้ข้อใดข้อหนึ่งเป็นตัวเปลี่ยนใจ — หรือ Mac ของคุณต่ำกว่า 128 GB — โมเดลเดียวกันที่ความแม่นยำเต็มรูปแบบห่างแค่การเรียก API ครั้งเดียวบน z-ai/glm-5.3-flash.
ไม่ได้ใช้ Mac ความจุ 128 GB ใช่ไหม? z-ai/glm-5.3-flash ให้บริการโมเดลเดียวกันที่ความแม่นยำเต็มรูปแบบบน OrcaRouter — ใช้คีย์ API เดียว ราคาจากผู้ให้บริการส่งผ่านโดยคิดมาร์กอัป 0% และไม่ต้องดาวน์โหลด 102 GB
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
