
كيفية تشغيل GLM-5.3-Flash على MacBook Pro: دليل 2bit-Lite MLX
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
تشغيل GLM-5.3-Flash على MacBook Pro يعني جهازًا واحدًا بالضبط: 128 GB M4/M5 Max MacBook Pro يعمل بالنسخة 2bit-lite من تحويلنا إلى MLX، مع رفع حد الذاكرة المثبتة في macOS. إذا كان جهاز MacBook Pro لديك أقل من 128 GB — مثل M4 Pro بسعة 36 GB أو M4 Max بسعة 48 GB — فهذا الدليل ليس لك؛ انتقل إلى القسم الأخير واستخدم واجهة برمجة التطبيقات المستضافة z-ai/glm-5.3-flash بدلاً من ذلك. GLM-5.3-Flash (الأوزان في zai-org/GLM-5.3-Flash) هو نموذج Z.ai من فئة Mixture-of-Experts بمعاملات تبلغ 320 مليارًا و18B نشطًا لكل رمز — صدر في 26 أغسطس 2026، وهو أول GLM-5 متعدد الوسائط بشكل أصلي — وحتى أصغر بناء لمنفذ MLX لدينا يتطلب حوالي 102 GB من الأوزان وحوالي 112 GB من الذاكرة. هذا هو السوق بأكمله، ولن نلين في ذلك.
هذه وثائق من الطرف الأول، وليست مقالة إطلاق: الأوزان أدناه هي بناء OrcaRouter الخاص (orcarouter/GLM-5.3-Flash-MLX، MIT)، أُنتجت بطريقة التكميم OrcaSAQ الخالية من المعايرة الخاصة بنا. أصدرناه في 26 أغسطس وعدّلنا المسار علنًا في اليوم التالي، لأن نطاق التكميم الأصلي لم يجعل استخدام MacBook Pro عمليًا لمعظم الناس — إذ ما زال الإصدار العادي 2-بت يتطلب حوالي 160 جيجابايت، وهو ما لا يملكه أي حاسوب محمول. في 27 أغسطس أعدنا بناء أصغر نسخة باسم 2bit-lite خصيصًا لتناسب MacBook Pro بسعة 128 جيجابايت، وهذا المقال هو الحساب الصادق لما يمنحك إياه ذلك وما يكلفه. كل رقم مُعلَّم بـملاحظة ميدانية أدناه قِيس في تشغيل تحقق على H200 واحد لدينا؛ لا شيء هنا هو معيار من بائع. وعندما نكرر ممارسة المجتمع — أمر الذاكرة الموصولة، إصدارات mlx-vlm — نصنّفها على هذا النحو.
أي إصدار يناسب أي Mac (اقرأ هذا قبل تنزيل أي شيء)
كلٌّ من الـ builds الخمسة في المستودع يقابل حدًّا أدنى لذاكرة RAM. على MacBook Pro، سؤال "أي build" له إجابة واحدة فقط — كل ما هو فوق 2bit-lite هو حديث عن Mac Studio:
• 6-bit — أوزان ~296 جيجابايت / رام ~320 جيجابايت / بلا فقدان تقريبًا. Mac Studio بسعة 512 جيجابايت فقط.
• 4-bit — ~204 جيجابايت / ~224 جيجابايت / الإعداد الافتراضي الموصى به لدينا. Mac Studio 256 جيجابايت. هذا ما يعكسه جذر المستودع.
• 3-بت — ~184 جيجابايت / ~200 جيجابايت. Mac Studio 256 جيجابايت.
• 2-bit — حوالي 145 جيجابايت / حوالي 160 جيجابايت. Mac Studio بسعة 192 جيجابايت. كان هذا أصغر إصدار أصدرناه في اليوم الأول، وكان هو الإخفاق.
• 2bit-lite — ~102 GB / ~112 GB. البناء الوحيد الذي يناسب جهازًا بسعة 128 جيجابايت: MacBook Pro بمعالج M4/M5 Max بسعة 128 جيجابايت، أو Mac Studio أو Mac mini بسعة 128 جيجابايت. أي كمبيوتر محمول من Apple Silicon بسعة 128 جيجابايت (M3 Max أو أحدث) هو القصة نفسها، لكن أبطأ.
المصيدة المخبأة في ذلك السُّلَّم: أمر التنزيل الافتراضي في README يسحب نسخة 4-bit (~204 جيجابايت)، وهي الافتراضي المناسب لجهاز بسعة 256 جيجابايت وغير مجدية على حاسوب محمول. إذا اتبعت الأمر الافتراضي على MacBook Pro، فستحصل على نموذج لن يُخصص. مسار 2bit-lite يتطلب --include، وهو موضح أدناه.
هناك أيضًا سقف صارم ستصطدم به قبل أن تنطبق حتى الحسابات أعلاه. لا يسمح macOS لأي عملية بالاستيلاء على كامل الذاكرة الموحّدة لجهاز Mac سعة 128 جيجابايت؛ السقف الافتراضي القابل للاستخدام من جانب GPU يبلغ حوالي 91–96 جيجابايت (وهو رقم استُنتج عكسيًا من قبل المجتمع وأكّدته عدة مقالات حول إعدادات MLX للنماذج الكبيرة). وهذا أقل من ~102 جيجابايت للأوزان وحدها، لذاحتى 2bit-lite لن يُحمَّل حتى ترفع حد الذاكرة السلكية. هذه الخطوة إلزامية، وهي القسم 4.
ثبّت mlx-vlm — وفقط mlx-vlm
GLM-5.3-Flash هو نموذج لغة ورؤية، لذا فهو يعمل عبر mlx-vlm، وليس mlx-lm. هذه هي الطريقة الأكثر شيوعًا على الإطلاق التي يعلق بها الناس، لذا اذكرها مبكرًا: mlx-lm مخصص للنماذج النصية فقط؛ تشغيل نموذج متعدد الوسائط عبره ينتج خطأ تحميل مربكًا. ثبّت حزمة VLM بإصدار 0.6.17 أو أحدث:
pip install -U "mlx-vlm>=0.6.17"
تثبيت الإصدار ليس مجرد زخرفة.glm5_next — البنية الهجينة القائمة على الانتباه المتناثر والانتباه الخطي التي تقف خلف GLM-5.3-Flash — لم تصل إلى mlx-vlm إلّا في اليوم نفسه الذي صدر فيه النموذج (26 أغسطس 2026)، وأي إصدار أقدم لن يتعرّف على الإعدادات. وتكتسب البنية أهميةً لسببٍ ثانٍ: إنها طوبولوجيا جديدة كليًا، وقد احتوت الموجة الأولى من المنافذ على أخطاء صحة حقيقية لم يكشفها الإخراج السلس. كشف تدقيق تشغيلي مجتمعي لمسار MLX المبكر في glm5_next عن أربعة من هذه الأخطاء وأصلحها — مشبك SwiGLU غير مطبّق على كل كتلة FFN، وموترات الوصلات الفائقة المقيّدة بالمتشعب مُحوّلة إلى نوع بيانات خاطئ (ما أفسد مصفوفة خلط الانتباه بصمت)، وخطآن في إبسيلون داخل معايير الانتباه، وrouter logits بترميز bf16 بينما يستخدم المرجع float32. بعد الإصلاحات، طابقت النتائج الرقمية المرجع بدقة تبلغ نحو 1e-7. الخلاصة لك: حافظ على تحديث mlx-vlm، وتعامل مع أول إصدار على الإطلاق لأي منفذ ببنية جديدة بقدرٍ من الشك.
نزّل الأوزان: أعلام الاستبعاد، والإدراج الذي تحتاجه فعلًا
جذر المستودع يعكس البناء رباعي البتات، وجميع المتغيرات الخمسة تأتي كمجلدات فرعية. الأمر الافتراضي ينزّل الجذر ويستخدم --exclude بحيث لا يأتي أيٌّ من مجلدات المتغيرات الخمسة (التي يبلغ مجموعها حوالي 800 جيجابايت) معه:
نزّل النموذج orcarouter/GLM-5.3-Flash-MLX باستخدام hf إلى الدليل ./GLM-5.3-Flash-MLX مع استثناء "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"
على جهاز MacBook Pro، هذا الأمر غير صحيح بالنسبة لك — إنه يعطيك الجذر 4-bit. بالنسبة لحاسوب محمول بسعة 128 جيجابايت، قم بجلب فقط 2bit-lite، المجلد الفرعي:
hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX
هذا هو التنزيل بحجم ~102 جيجابايت، وهو مكتفٍ ذاتيًا — 2bit-lite/، المجلد، يحمل ما يخصه config.json، لذا وجّه المولّد إليه مباشرةً. إذا كان hf غير موجود في PATH، ثبّته: pip install -U huggingface_hub. قبل أن تبدأ، تأكد من توفر ~110 جيجابايت من المساحة الحرة وأن تخزين جهاز Mac لديك ليس آخر 100 جيجابايت حرة — يقوم MLX بتعيين الأوزان في الذاكرة، وقرص SSD شبه ممتلئ هو ما يتسبب في فشل هذه الإعدادات أثناء التنزيل.

ارفع حد الذاكرة الموصولة — الخطوة التي ينساها الجميع
هذه هي الخطوة الحاسمة على جهاز MacBook Pro بسعة 128 جيجابايت، وبطاقة README تفترض أنك تعرفها بدلاً من ذكر الأمر صراحةً. الحد الافتراضي لسقف مجموعة عمل Metal على جهاز Mac بسعة 128 جيجابايت يبلغ تقريبًا 91–96 جيجابايت، وهو أقل من وزن 2bit-lite البالغ ~102 جيجابايت — لذا بدون هذه الخطوة يفشل النموذج في تخصيص الذاكرة ويموت التحميل. الإصلاح القياسي المعتمد في المجتمع هو sysctl يرفع سقف الذاكرة المقيّدة لوحدة معالجة الرسومات بالميغابايت:
sudo sysctl iogpu.wired_limit_mb=114688
يحدد ذلك سقفًا يبلغ ~112 جيجابايت، مما يترك حوالي 14 جيجابايت كاحتياطي لنظام التشغيل. على أجهزة 128 جيجابايت، تتراوح القيم المتداولة في المجتمع من ~114688 (112 جيجابايت) إلى ~122880 (120 جيجابايت)؛ لا ترفعها إلى الحد الأقصى — يحتاج macOS إلى مساحة احتياطية أو ستعاني من تقطيع في خادم النوافذ وتباطؤ في النظام تحت ضغط الذاكرة. بعد ضبطه، قم بتحميل النموذج وراقب Activity Monitor: إذا تحول ضغط الذاكرة إلى اللون الأصفر، قلّل الرقم.
ملاحظتان عمليتان، كلتاهما من الممارسة المجتمعية وليس من ملاحظاتنا الميدانية. أولاً، يعود sysctl إلى قيمه الافتراضية عند إعادة التشغيل، ويَسري على جلسة الطرفية التي عيّنتَه فيها، لذا خطط لإعادة تنفيذه (أو أتمتِه عبر LaunchAgent) — فنسيانه بعد إعادة التشغيل هو الفشل الكلاسيكي المتمثل في "كان يعمل بالأمس". ثانيًا، تُتيح MLX أيضًا مقبضًا داخل العملية، mlx.core.metal.set_wired_limit(bytes)، على macOS 15.0 والإصدارات الأحدث؛ يجب أن يظل أقل من الحد الأقصى لـ sysctl، وهو الخيار الأكثر قابلية للنقل إذا كنت تكتب سكربتات في مفكرة. أيًا كان ما تستخدمه، فالتأثير هو نفسه: بدونه، لن يعمل أي شيء هنا.
شغّله: النص، الصورة، وPython API
بعد وضع الأوزان في مكانها ورفع الحد، يصبح التوليد أمرًا واحدًا. النص:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "اشرح التشابك الكمي في جملة واحدة." --max-tokens 256
يعمل إدخال الصور بالطريقة نفسها مع --image كخيار — وهنا يثبت النموذج متعدد الوسائط قيمته على الحاسوب المحمول، إذ يبقى برج الرؤية بدقة أعلى في تخطيط OrcaSAQ:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "صف هذه الصورة." --max-tokens 256
بالنسبة للنصوص البرمجية، تكون Python API بنفس الشكل الذي يعرفه مستخدمو mlx-vlm:
from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "صف هذه الصورة.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))
أبقِ --max-tokens متواضعًا. في تشغيلنا الميداني على H200، يحقق 2bit-lite حوالي 10 توكن/ثانية، لذا فإن إجابة من 1,024 توكنًا تعني انتظارًا لمدة دقيقتين بالفعل — والمخرجات الطويلة هي حيث تصبح ميزانية KV وانهيار الجودة مؤثرين (أدناه). على جهاز محمول، يجب أن تتوقع أن يكون أبطأ، وليس أسرع، حتى توجد قياسات فعلية.
ما الجودة التي تحصل عليها فعليًا (السلم المُقاس)
إليك الجزء الصادق من دليل اللعب، ولن نقوم بتجميله. يتدهور OrcaSAQ بأناقة حتى 3-بت، ثم ترتفع التكلفة بسرعة. مقارنةً بالمرجع FP8 (الحيرة 2.7797):
• 6-بت — الحيرة 2.7864 (+0.24%)، توافق الرمز الأعلى 97.76%. بلا فقدان تقريبًا، كما هو معلن.
• 4-bit — الحيرة 2.8620 (+2.96%)، top-1 96.13%. الخيار الافتراضي الموصى به.
• 3-bit — الارتباك 3.0566 (+9.96%)، top-1 92.06%. عدواني لكن قابل للاستخدام.
• 2-بت — الحيرة 4.3622 (+56.9%)، top-1 86.56%. تكلفة حقيقية.
• 2bit-lite — perplexity 6.7018 (+141%)، top-1 77.19%. أصغر إصدار، والوحيد الذي يمكن لجهاز MacBook Pro تشغيله.
تلك أرقام مُقاسة من خط التحويل الخاص بنا. 2bit-lite يُحدث تدهورًا في الحيرة بنسبة 141% وتوافقًا في التوكن الأول بأقل من 78% — أنت تشغّل نموذجًا متدهورًا بشكل ملحوظ، وأنماط الفشل أدناه هي ما يبدو عليه هذا التدهور عمليًا. إنه عرض رائع ومساعد معقول للردود القصيرة؛ لكنه ليس بديلًا عن النموذج كامل الدقة.
فيما يتعلق بالسرعة، ندين لك بنفس الصراحة. الملاحظة الميدانية المنشورة هي H200: حوالي 10 tok/s، مستقرة عبر جولات متعددة، مناسبة للأسئلة والأجوبة اليومية والنصوص القصيرة. لم نحصل بعد على رقم مُقاس لأجهزة MacBook Pro بالنسبة إلى 2bit-lite، ولن نختلق واحدًا — إنتاجية Apple Silicon هنا تعتمد على عرض النطاق الترددي للذاكرة، والحرارة، وتغطية نواة MLX للانتباه الهجين، ولا شيء من ذلك قمنا بقياسه لهذا البناء على هذا الكمبيوتر المحمول. أقرب نقطة بيانات منشورة لـ Apple Silicon يمكن أن نشير إليك هي ~450 tok/s مستقل لبناء GLM-5.3-Flash بدقة 4-bit على جهاز Mac بسعة 512 جيجابايت تحت بيئة تشغيل MLX مختلفة — بناء مختلف، ودقة مختلفة، وجهاز مكتبي، لذا لا تعتبرها رقمك أيضًا. خطط للبطء؛ وستكون مفاجأة سارة إذا لم تكن كذلك.
ذاكرة التخزين المؤقت KV والسياق الطويل: انتبه إلى مساحة الأمان
GLM-5.3-Flash يعلن عن نافذة سياق تبلغ 1M رمز. هذا الرقم غير ذي صلة على هذا الجهاز، ودليل إرشادي يدّعي عكس ذلك لن يقدم لك خدمة. الملاحظة الميدانية هي سطر واحد: امنح وقت التشغيل ميزانية KV كافية لطولك المستهدف. على H200 واحدة، يترك 2bit-lite نحو 39 جيجابايت من المساحة الحرة لذاكرة KV المؤقتة بعد تحميل الأوزان. على MacBook Pro بسعة 128 جيجابايت، الحساب أقسى: ~102 جيجابايت من الأوزان مقابل سقف يبلغ ~112 جيجابايت، مما يترك نحو 26 جيجابايت قبل مساحة عمل macOS ذاتها — وطبقات الانتباه الخطي الهجين تجعل بصمة KV لهذا النموذج صغيرة مقارنة بنموذج كثيف بهذا الحجم، لكنها لا تزال تنمو خطيًا مع السياق.
تؤكد إرشادات جانب التقديم من المجتمع الأوسع هذه النقطة: الإعداد الذي يعمل بشكل جيد بسياق 8K قد ينفد من الذاكرة عند 128K. على الكمبيوتر المحمول، أبقِ السياقات قصيرة — بضعة آلاف من التوكنات للأسئلة والأجوبة أو صورة واحدة — ولا تحاول إطعامه كتابًا. حالما تحتاج مهمة فعلًا إلى سياق طويل، فأنت في القسم الأخير من هذا المقال.
توليد الأكواد الطويلة ليس موثوقًا عند 2bit-lite (اقرأ هذا مرتين)
هذا هو القسم الذي يكون دليل الإرشاد الذي يخفي أنماط فشله بلا قيمة بدونه، لذلك يحصل على عنوان خاص به. ملاحظات الميدان لـ H200 لا لبس فيها: الأسئلة والأجوبة اليومية والنصوص القصيرة تخرج بشكل جيد، بينما توليد الأكواد الطويلة ليس موثوقًا به عند هذه الدقة. ثلاثة أنماط فشل تم إعادة إنتاجها في تشغيل التحقق الخاص بنا:
• حلقات التكرار — يبدأ النموذج بتكرار نفس الأسطر أو الكتل بدلاً من إحراز تقدم، عادةً بعد بضع مئات من الرموز.
• كود الربط المفقود — تُحذف عمليات الاستيراد والتوصيل ومعالجة الأخطاء بصمت. تبدو الدالة المُولّدة صحيحة عند عزلها، لكنها لا تعمل، لأن السقالات المحيطة بها غير موجودة ببساطة.
• تقلب إعادة الكتابة — بدلاً من التعديل الأدنى، يعيد النموذج كتابة أجزاء كبيرة من الملف، وتتعارض مخرجات الجولات المتتالية مع بعضها البعض.
هذه الأمور قابلة للتكرار في 2bit-lite، وهي بالتحديد ما يتنبأ به اتفاق بنسبة 77% على أفضل نتيجة. ما يفعله الممارسون الذين يستمرون في الاحتفاظ ببناء اللابتوب في الواقع:
• استخدمه من أجل التفسير والتلخيص والأسئلة والأجوبة وفهم الصور — عمل قصير الشكل حيث يكون جيدًا حقًا.
• إذا كان عليك أن تطلب كودًا، فاطلب دالة صغيرة واحدة في كل مرة بتوقيع واضح، وتحقق من كل واحدة قبل المتابعة. لا تعطه ملفًا كاملًا وتطلب ميزة.
• لأي شيء طويل — وحدة كاملة، أو إعادة هيكلة، أو جلسة وكيل طويلة — وجّه إلى واجهة برمجة التطبيقات كاملة الدقة. هذا ليس حلاً مؤقتًا؛ بل هو البنية الصحيحة، وهو القسم الأخير.
متى لا تفعل هذا إطلاقًا: استدعِ z-ai/glm-5.3-flash بدلاً من ذلك

قاعدة القرار الصادقة: شغّل 2bit-lite على MacBook Pro بسعة 128 جيجابايت M4/M5 Max فقط عندما تريد تحديدًا نموذجًا متعدد الوسائط بحجم 320B على حاسوب محمول يمكنك حمله — أسئلة وأجوبة دون اتصال، مستندات خاصة، فهم الصور دون خروج أي شيء من الجهاز. اختر واجهة API لكل شيء آخر:
• أي MacBook Pro بسعة أقل من 128 جيجابايت — لا يوجد إصدار مناسب لك. لا تحاول تحميله؛ استخدم واجهة برمجة التطبيقات (API).
• توليد أكواد طويلة أو الاستدلال طويل السياق — يفشل 2bit-lite في هذا تحديدًا، بشكل ثابت. استخدم API.
• العمل الحساس للجودة — توافق 77.19% على أعلى نتيجة وارتفاع التحير بنسبة 141% يمثلان انخفاضًا حقيقيًا، وليس خطأ تقريبًا. استخدم الـ API.
• إنتاجية مضمونة أو زمن استجابة يمكن التنبؤ به — لا يوجد رقم مُقاس لأجهزة الكمبيوتر المحمولة حتى الآن، والملاحظة الميدانية هي 10 tok/s. استخدم واجهة API.

النموذج المستضاف هو z-ai/glm-5.3-flash، ويُقدَّم بدقة كاملة على OrcaRouter بسعر Z.ai الحالي — 0.07 دولار لكل مليون رمز إدخال و0.25 دولار لكل مليون رمز إخراج وقت كتابة هذا المقال (سعر فترة الإطلاق؛ والقائمة المنشورة من Z.ai هي 0.15 / 0.50 دولار). هذا هو السعر المُبلَّغ من البائع، ويُمرَّر بهامش ربح 0%، لذا فإن أي خفض لسعر Z.ai يظهر لدينا في نفس اليوم. وتحصل على مفتاح API واحد يصل أيضًا إلى أكثر من 200 نموذج آخر نوفر التوجيه إليها، كما أن تجاوز الفشل التلقائي يعني أن تجربة هذا النموذج الجديد لا تراهن بمسار إنتاجك على مزود واحد. وفي الوقت نفسه الذي يستغرقه تنزيل 102 غيغابايت وانتظار أول توليد بارد، يكون API قد أجاب بالفعل عن أسئلة تكفي لأسبوع كامل — ويجيب عنها بدقة كاملة.
الاستدلال المحلي يستحق العناء عندما يكون السبب محليًا — الخصوصية، العمل دون اتصال، لا حدود للمعدل، عرض توضيحي يعمل على البطارية. لا يستحق العناء من حيث حسابات التكلفة أو الجودة لأي سبب آخر، ولا يستحق العناء إطلاقًا على جهاز بذاكرة أقل من 128 جيجابايت.
الأسئلة الشائعة
هل يمكن لجهاز Mac بسعة 64 جيجابايت أو 96 جيجابايت تشغيل GLM-5.3-Flash محليًا؟لا. أصغر إصدار، 2bit-lite، يتطلب حوالي 112 جيجابايت كحد أدنى بعد احتساب الحمل الإضافي لنظام macOS، وحتى جهاز بسعة 128 جيجابايت يجب رفع حد الذاكرة المثبتة (wired memory) لتحميله. إذا كان جهاز Mac لديك أقل من 128 جيجابايت، فلا يوجد مسار محلي؛ استخدم z-ai/glm-5.3-flash عبر API بدلاً من ذلك.
لقد قمت بتثبيت mlx-vlm وفشل تحميل النموذج — ما المشكلة؟ السببان المعتادان، بالترتيب: إصدار أقل من 0.6.17، وهو إصدار يسبق دعم glm5_next ولن يتعرف على البنية؛ وعدم رفع حد الذاكرة المقيّدة، لأن بناء ~102 غيغابايت لا يمكنه تخصيص ذاكرة ضمن الحد الافتراضي لـ Metal البالغ حوالي 91–96 غيغابايت على جهاز Mac بسعة 128 غيغابايت. أصلح كليهما (قم بترقية الحزمة، وشغّل sysctl) وسيتم التحميل.
هل الإصدار المحلي 2bit-lite هو نفس نموذج واجهة برمجة التطبيقات z-ai/glm-5.3-flash؟نفس أوزان GLM-5.3-Flash الأساسية، لكن ليس بنفس الجودة. 2bit-lite هو تكميم ثنائي البت بنسبة توافق 77.19% في الرموز الأولى (top-1) مع المرجع FP8، وتوليد الأكواد الطويلة غير موثوق. تقدم واجهة البرمجة دقة كاملة. إنهما قابلان للتبادل فقط في المهام القصيرة التي تتسامح مع الجودة.
نسخة الـ30 ثانية
جهاز واحد، إصدار واحد، أمر sysctl إلزامي واحد. إذا كان لديك MacBook Pro بسعة 128 جيجابايت من M4/M5 Max: ثبّت mlx-vlm>=0.6.17، ونزّل فقط 2bit-lite/ (~102 جيجابايت)، وارفع حد الذاكرة السلكية باستخدام sudo sysctl iogpu.wired_limit_mb=114688، وشغّل mlx_vlm.generate — للأسئلة والأجوبة والنصوص القصيرة والصور. تقبّل أن توليد الأكواد الطويلة ليس موثوقًا به عند هذه الدقة، وأنه لا يوجد قياس لإنتاجية الكمبيوتر المحمول بعد، وأن Mac بسعة 128 جيجابايت هو الحد الأدنى وليس المعيار. إذا كانت أي من هذه التحفظات عائقًا — أو كان جهاز Mac لديك أقل من 128 جيجابايت — فإن النموذج نفسه بدقة كاملة يبعد مكالمة API واحدة على z-ai/glm-5.3-flash.
لست على Mac بسعة 128 جيجابايت؟ z-ai/glm-5.3-flash يقدم نفس النموذج بدقة كاملة على OrcaRouter — مفتاح API واحد، تسعير المزود يمر دون أي هامش ربح، ودون تنزيل 102 جيجابايت.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
