بطاقة عنوان رئيسية للمقال المعنون 'GLM-5.3-Flash VRAM Requirements' مع عنوان فرعي 'كم الذاكرة التي تحتاجها لتشغيل 320B MoE'، وشارات '320B إجمالاً · 18B نشط'، و'سياق 1M-token'، و'إصدارات MLX المجتمعية'، وبطاقة ملخص نصها '2bit-lite: ~102 GB أوزان / 112 GB رام — الإصدار الذي يناسب Mac بسعة 128 GB'، مع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

متطلبات VRAM لنموذج GLM-5.3-Flash: مقدار الذاكرة التي تحتاجها لتشغيل نموذج MoE بحجم 320B

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

GLM-5.3-Flash لا يمكن تشغيله على أي وحدة معالجة رسومية استهلاكية. أصغر إصدار قابل للاستخدام، 2bit-lite، يتطلب حوالي 102 جيجابايت من الأوزان و112 جيجابايت من الذاكرة العشوائية. جهاز Mac بسعة 128 جيجابايت هو نقطة الدخول؛ ووحدة H200 واحدة تكفي لتشغيل 2bit-lite مع مساحة فارغة تبلغ حوالي 39 جيجابايت؛ ويجب على الجميع الآخرين استخدام واجهة برمجة التطبيقات المستضافة، z-ai/glm-5.3-flash.

هذه هي الإجابة كاملةً في نَفَس واحد، ويجدر قولها بوضوح هنا: لا يوجد أي تكوين أجهزة استهلاكي يشغّل هذا النموذج. نموذج Z.ai المختلط من الخبراء للرؤية واللغة بمعاملات 320B، الذي صدر في 26 أغسطس 2026، يتطلب ذاكرة من فئة الخوادم في كل تكميم. الرقم «18B نشط» يصف الحساب لكل توكن، وليس الذاكرة المقيمة — فجميع أوزان 320B تبقى محمّلة. الأهداف المحلية الواقعية هي أجهزة Mac كبيرة بذاكرة موحّدة، وخوادم متعددة وحدات معالجة الرسوميات، ووحدة H200 واحدة بسعة 141 جيجابايت. إذا كنت لا تملك واحدًا من تلك، فالأرقام أدناه ليست قائمة تسوّق؛ بل هي السبب في استدعاء النموذج عبر واجهة برمجة تطبيقات (API) بدلًا من ذلك.

ملاحظة تأطيرية قبل الأرقام: أرقام الذاكرة في هذا المقال هي نتائج مجتمعية، وليست إرشادات من البائع. تنشر Z.ai الأوزان ومواصفات API؛ لكنها لا تنشر متطلبات الذاكرة للاستدلال المحلي. يأتي جدول التكميم لكل مستوى من بطاقة نموذج orcarouter/GLM-5.3-Flash-MLX على Hugging Face، وهو تكميم MLX للأوزان المفتوحة الذي يحتفظ به مجموعة مجتمعية، وتأتي أرقام النشر من ممارسين قاموا فعليًا بتحميل النموذج. حيثما كان الرقم مُبلغًا من البائع — مثل التسعير، وادعاءات كفاءة ذاكرة التخزين المؤقت KV الخاصة بالبنية — فإننا نصنفه على هذا النحو.

الإجابة المختصرة: ما يناسب ما تملكه

ابدأ بما لديك فعليًا، لأن سلم التكميم لا يكون ذا معنى إلا بالنسبة إلى آلة مستهدفة:

• وحدات معالجة الرسوميات الاستهلاكية (RTX 4090, RTX 5090, وكل ما هو أقل) — لا. لا تملك أي بطاقة استهلاكية ذاكرة فيديو كافية: أصغر بناء يتطلب حوالي 102 جيجابايت من الأوزان وحدها، أي ما يعادل خمس بطاقات RTX 5090 تقريبًا. ذاكرة النظام لا تغيّر ذلك، لأن الأوزان يجب أن تكون مقيمة على الجهاز.

• ماك بسعة 128 جيجابايت (M4 أو M5 Max) — إصدار 2bit-lite (أوزان ~102 جيجابايت / 112 جيجابايت كحد أدنى للذاكرة العشوائية)، وفقط بعد رفع حد الذاكرة السلكية. المزيد عن ذلك أدناه. هذا هو الجهاز الاستهلاكي الوحيد الذي يتسع للنموذج.

• Mac Studio بسعة 192 جيجابايت و256 جيجابايت — تصبح 3-bit (~184 / 200 جيجابايت) و2-bit (~145 / 160 جيجابايت) قابلة للتحقيق؛ بينما يتطلب 4-bit حوالي 224 جيجابايت، وهو ما تقترب منه فئة 256 جيجابايت فقط.

• H200 واحدة (141 جيجابايت VRAM) — 2bit-lite يتسع مع بقاء حوالي 39 جيجابايت لذاكرة KV المؤقتة، مما يعني سياقات قصيرة فقط.

• خادم متعدد GPU — كل شيء، بما في ذلك 4-bit و6-bit وبناء المرجع FP8 (~328 جيجابايت).

أما الجميع الآخرون — واجهة برمجة التطبيقات المستضافة، z-ai/glm-5.3-flash. وهذا ليس جائزة ترضية؛ بل هو المكان الذي يكون فيه النموذج سريعًا وغير مكلف فعليًا للاستخدام، وهو مغطى في أسفل هذه الصفحة.

رقمان وليس رقمًا واحدًا: الأوزان مقابل الذاكرة الإجمالية

كل تكميم في بطاقة النموذج يحتوي عمودين — حجم الأوزان والحد الأدنى من الذاكرة — والفجوة بينهما هي الجزء الذي تتجاهله معظم الشروحات. عمود الأوزان هو ملفات النموذج: كل معامل، بذلك المستوى من الدقة، يبقى مقيمًا في الذاكرة. أما عمود الحد الأدنى من الذاكرة فهو ما يجب أن تحمله الآلة في وقت التشغيل: الأوزان بالإضافة إلى ذاكرة التخزين المؤقت KV، والتنشيطات، والمخازن المؤقتة التي تنمو مع طول السياق.

الرقم 18B النشط هو ما يضلّل الناس. GLM-5.3-Flash هو نموذج MoE بإجمالي 320B / 18B نشط: لكل توكن، لا تُحتسب سوى نحو 18B من المعاملات. هذا توفير في الحوسبة، وليس توفيرًا في الذاكرة. جميع أوزان الـ320B تبقى في الذاكرة بغض النظر عن أي الخبراء يعمل، لأن الموجّه لا يعرف الخبراء الذين يحتاجهم حتى يرى التوكن. MoE يشتري السرعة، لا البصمة — وهي نقطة توضّحها بطاقة النموذج نفسها بمثال، حيث يُعرض إجمالي الـ320B إلى جانب الـ18B النشط.

لذا عندما يقول إصدار ما "~204 جيجابايت أوزان / 224 جيجابايت حد أدنى للذاكرة"، فإن الـ ~20 جيجابايت الإضافية هي حمل زمن التشغيل — ذاكرة التخزين المؤقت KV، والمُفعّلات، ومخازن السياق. ارفع طول السياق وسينمو هذا الفارق. عمود الحد الأدنى للذاكرة، وليس عمود الأوزان، هو الذي يجب قياس حجم الجهاز بناءً عليه.

A screenshot of the official Hugging Face model card for zai-org/GLM-5.3-Flash (captured August 29, 2026), showing the MIT license, the image-text-to-text and glm5_next tags, and the card's introduction describing GLM-5.3-Flash as the first natively multimodal model in the GLM-5 series with 320B total parameters and 18B active, introducing a hybrid sparse-and-linear attention architecture.

النموذج نفسه — البنية، والترخيص، وصياغة Z.ai الخاصة — موثّق على البطاقة الرسمية للبائع، المعروضة أعلاه. الذاكرة المحلية غير مغطاة هناك؛ ولهذا السبب توجد هذه الصفحة. الأرقام أدناه مأخوذة من منفذ MLX المجتمعي للأوزان المفتوحة.

سُلّم التكميم

الجدول الموجود على بطاقة orcarouter/GLM-5.3-Flash-MLX هو الذي يعتمد عليه الممارسون فعليًا للتحميل اليوم. وهو يسرد خمسة إصدارات مكمّمة بالإضافة إلى مرجع FP8، كلٌّ منها بحجم الأوزان والحد الأدنى من الذاكرة العشوائية (RAM):

• مرجع FP8 — ~328 جيجابايت من الأوزان. هذه هي نقطة المرجع غير المكمّمة التي تُشحَن بها الأوزان المفتوحة.

• 6-بت — حوالي 296 جيجابايت من الأوزان / 320 جيجابايت حد أدنى للذاكرة. شبه خالٍ من الفقد؛ أفضل بناء من حيث الجودة.

• 4-بت — ~204 جيجابايت / 224 جيجابايت. الإعداد الافتراضي اليومي الموصى به.

• 3-bit — ~184 GB / 200 GB. عدواني لكن قابل للاستخدام.

• 2-بت — ~145 جيجابايت / 160 جيجابايت. أفضل جهد.

• 2bit-lite — ~102 جيجابايت / 112 جيجابايت. أصغر إصدار؛ الوحيد الذي يناسب جهاز Mac بسعة 128 جيجابايت أو H200 واحد.

الجودة تنخفض كلما انخفضت البتات، وبطاقة النموذج تحدد ذلك كميًا. بالنسبة إلى مرجع FP8، يتدهور مقياس الارتباك (perplexity) بنسبة +0.24% عند 6-bit، و+2.96% عند 4-bit، و+9.96% عند 3-bit، و+56.9% عند 2-bit، و+141% عند 2bit-lite (أرقام الارتباك مأخوذة من نفس بطاقة النموذج). إرشادات البطاقة نفسها: 6-bit لجودة شبه خالية من الخسائر، و4-bit كخيار افتراضي يومي، و3-bit و2-bit عند ضيق الذاكرة، و2bit-lite فقط عندما لا يتسع أي شيء آخر — ولا يُعتمد على توليد أكواد طويلة عند 2bit-lite. هذا التحذير الأخير مهم لنموذج استدلال بحجم 320B: فـ 2bit-lite هو ما يتيح لك الحصول على Mac بسعة 128 جيجابايت، وتكلفة الجودة تقع بالضبط حيث يكون العمل البرمجي أكثر إيلامًا.

A single-column scoreboard titled 'GLM-5.3-Flash — the memory ladder' listing six rows: 'FP8 reference: 328 GB weights', '6-bit: 296 GB / 320 GB RAM', '4-bit: 204 GB / 224 GB RAM', '3-bit: 184 GB / 200 GB RAM', '2-bit: 145 GB / 160 GB RAM', '2bit-lite: 102 GB / 112 GB RAM', with a footer reading 'Community MLX builds (orcarouter/GLM-5.3-Flash-MLX) — not vendor guidance.' and the OrcaRouter logo in the bottom-right corner.

هناك رقمان في ذلك السُلَّم يستحقان نظرةً أقرب، لأنهما يحسمان مسألة العتاد برمتها.

لماذا يوجد 2bit-lite

2bit-lite ليست طبقة إضافية من الجودة — بل هي طبقة حجم أُنشئت لسبب واحد: 2-bit العادية لا تتسع. مع ~102 جيجابايت من الأوزان، هي النسخة الوحيدة التي تتسع ضمن ~112 جيجابايت من الذاكرة القابلة للاستخدام على Mac بسعة 128 جيجابايت، والنسخة الوحيدة التي تتسع في 141 جيجابايت على H200 واحدة مع مساحة متبقية لذاكرة التخزين المؤقت KV. وبطاقة النموذج تقول ذلك: 2-bit العادية لا تتسع على Mac بسعة 128 جيجابايت؛ بينما 2bit-lite تتسع، مع رفع حد الذاكرة السلكية. وعلى H200، تتسع "مع بقاء ~39 جيجابايت لذاكرة التخزين المؤقت KV" (بكلمات البطاقة). تلك الـ39 جيجابايت هي الميزانية التشغيلية الكاملة لكل ما يفعله النموذج بعد التحميل — وهو ما يقودنا إلى السياق.

ما تكلفة ذاكرة التخزين المؤقت لـ KV في السياقات الطويلة

تمتلك GLM-5.3-Flash نافذة سياق {{1}}تتسع لمليون توكن{{/1}}، والسياق الطويل هو المكان الذي تموت فيه خطط الذاكرة المحلية. إن {{2}}انتباه النموذج الهجين المتناثر-الخطي{{/2}} — {{3}}NoPE-MLA مع آلية تجميع المؤشرات{{/3}} — فعّال حقًا: تشير Z.ai إلى أنه يقلص حساب الانتباه {{4}}3.01×{{/4}} وحجم مخبأ KV {{5}}4.44×{{/5}} مقارنةً بنموذجها {{6}}GLM-5.3 (أرقام معلنة من البائع){{/6}}. لكن كون الحجم {{7}}«أصغر بمقدار 4.44× من GLM-5.3»{{/7}} لا يزال يُبقي مخبأً يُقاس بـ{{8}}عشرات الـ GiB{{/8}} عند الاقتراب من {{9}}سياق 1M كامل{{/9}}.

أفضل رقم عام لدينا يأتي من نشر مجتمعي شغّل النموذج عبر أربع عقد {{1}}DGX Spark{{/1}}: 16 جيبي بايت من {{2}}KV cache{{/2}} لكل عقدة — حوالي 64 جيبي بايت إجمالاً عبر العقد الأربع — لاستيعاب سياق كامل بطول مليون رمز، بحجم مصمَّم لدعم بضعة طلبات متزامنة بسياق كامل. هذا أكثر من ميزانية الذاكرة الكاملة لمعظم الأجهزة الفردية، قبل احتساب وزن واحد. على {{3}}H200{{/3}} واحدة، الحساب هو جوهر هذه الصفحة: {{4}}2bit-lite{{/4}} يترك حوالي 39 جيجابايت لكل شيء بعد الأوزان — مريح لمحادثة قصيرة، لكنه يتبخر خلال دقائق مع ارتفاع السياق نحو {{5}}100 ألف رمز{{/5}}.

القاعدة العملية: يفترض عمود min-RAM سياقًا معقولًا. إذا كان عبء عملك يشتمل على مستندات طويلة، أو حلقات وكيل، أو تعليمات برمجية بحجم مستودع كامل، فاحسب ذاكرة إضافية لـ KV-cache فوق ذلك — وبالنسبة لأي شيء يقترب من مليون رمز، توقف عن الحسابات واستخدم API. هذه الملاحظات حول حجم الذاكرة هي استنتاجات مجتمعية؛ لا توجد إرشادات من البائعين بشأن ميزانية KV.

حد ذاكرة macOS السلكية: لماذا لا يزال جهاز Mac بسعة 128 جيجابايت يفشل في التحميل

أكثر حالات الفشل شيوعًا التي يبلغ عنها الممارسون ليست "ذاكرة غير كافية". بل هي جهاز Mac بسعة 128 جيجابايت مع نموذج بحوالي 102 جيجابايت يرفض التحميل. والسبب هو حد الذاكرة السلكية في macOS. على Apple Silicon، لا تستطيع وحدة معالجة الرسومات الوصول إلى كل الذاكرة الموحدة: تعرض Metal "الحد الأقصى الموصى به لمجموعة العمل" بحوالي ثلثي الذاكرة الفعلية، ويفشل التخصيص فوقه حتى عندما تتوفر ذاكرة حرة في الجهاز.

إذًا، الميزانية الافتراضية لـ Metal على جهاز Mac بسعة 128 جيجابايت تتراوح بين 80 و90 جيجابايت — وهي أقل من ما تحتاجه نسخة 2bit-lite (حوالي 112 جيجابايت كحد أدنى للذاكرة العشوائية مع نموذج مقيم بحوالي 102 جيجابايت). يفشل التحميل بسبب ميزانية Metal، وليس بسبب سعة الذاكرة العشوائية. الحل في كل تقارير الممارسين التي وجدناها هو نفسه: ارفع الحد المُقيَّد (wired limit) باستخدام الأمر sudo sysctl iogpu.wired_limit_mb=…، واضبط القيمة على ما يتجاوز إجمالي حجم النموذج بالميجابايت، وتوقع أن يعود إلى الوضع الافتراضي بعد إعادة التشغيل. تضع بعض الأدلة المجتمعية أيضًا الحد المُقيَّد من بايثون عبر mlx.metal.set_wired_limit() لتثبيت أوزان النموذج، بحيث يتوقف macOS عن ضغط صفحات Metal الخاملة.

إليك ترجمة النص إلى العربية مع الحفاظ على أي علامات إن وجدت (لا توجد علامات مرقمة هنا): أحد التعقيدات الإضافية: أن بيئات التشغيل تتصرف بشكل مختلف. بيئة MLX تفرض حد الذاكرة الخاص بـ Metal وتفشل بشكل قاطع عند تجاوزه، بينما بيئات التشغيل المبنية على llama.cpp (مسار GGUF) بشكل عام لا تفرضه وتترك نظام macOS يقوم بالتبديل (swap) بدلاً من ذلك. لهذا السبب يمكن لنفس النموذج أن يرفض التحميل في بيئة تشغيل بينما "يُحمَّل" في أخرى — ولماذا يمكن لنموذج تم تبديله أن يكون بطيئًا إلى حد عدم القدرة على استخدامه. هذه استنتاجات من المجتمع حول سلوك macOS، وليست إرشادات من Apple.

البديل المستضاف: z-ai/glm-5.3-flash

أما من تستبعدهم الأرقام أعلاه — وهم معظم الناس — فتقدّم لهم Z.ai النموذج نفسه باسم z-ai/glm-5.3-flash، وهنا يظهر مبرر كلمة "Flash" في الاسم فعلًا. السعر المعلن من Z.ai هو 0.15 دولار لكل مليون رمز إدخال، و0.03 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و0.50 دولار لكل مليون رمز إخراج؛ مع عرض ترويجي للإطلاق يمتد حتى 9 سبتمبر 2026 بأسعار 0.075 / 0.015 / 0.25 دولار (أسعار معلنة من المورّد، سارية وقت كتابة هذا النص). ويُعدّ الإدخال المخزّن مؤقتًا الذي تبلغ تكلفته خُمس تكلفة الإدخال الجديد أكبر عامل توفير في التكلفة: وأي عبء عمل يتضمن بادئة قابلة لإعادة الاستخدام — من مطالبات النظام وتعريفات الأدوات والمستندات المشتركة الطويلة — يجب أن يستفيد من تسعير القراءة من الذاكرة المؤقتة.

تقع حسابات الذاكرة في صلب القرار. تقديم نموذج 320B بنفسك يعني تخصيص 112–320 جيجابايت من الذاكرة له سواء كان خاملاً أو مُحمَّلاً بالكامل. أما نقطة الوصول المستضافة (endpoint) فتبعد كل ذلك عن أجهزتك، وبأسعار الإطلاق الترويجية، تكلّفك رموز هذا النموذج أقل من رموز نماذج كثيرة يبلغ حجمها عُشر حجمه — وهذا هو بيت القصيد في نموذج MoE النشط بحجم 18B.

هذا أيضًا هو المكان الطبيعي لنقطة التوجيه. عبر OrcaRouter، يعد z-ai/glm-5.3-flash واحدًا من أكثر من 200 نموذج خلف واجهة برمجة تطبيقات واحدة، بسعر القائمة لدى المزود مع هامش ربح 0٪ — لذا فإن العرض الترويجي للإطلاق، وأي تخفيض مستقبلي في الأسعار، يصبح ساريًا في نفس اليوم الذي يُعلن عنه. يعني التبديل التلقائي عند الفشل أن نموذجًا عمره ثلاثة أيام وله مسار خدمة غير مستقر ليس رهانًا على بنية الإنتاج لديك: إذا أخطأ المزود أو وصل إلى حد التشبع، ينتقل الطلب إلى مزود سليم بدلاً من أن يفشل. تجربة نموذج غير مُثبت بأمان هو بالضبط ما صُمم من أجله الموجّه.

A screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash (captured August 29, 2026), showing the model description 'native multimodal model... 320B total / 18B active parameters, 1M-token context, text + image + video in, text out', release date 2026-08-26, endpoint /v1/chat/completions, and prices of $0.07 per million input tokens and $0.25 per million output.

الأسئلة الشائعة

هل يمكنني تشغيل GLM-5.3-Flash على RTX 5090؟

لا. أصغر بناء يتطلب حوالي 102 غيغابايت من الأوزان وحدها، وبطاقة RTX 5090 تحتوي على 32 غيغابايت فقط من الذاكرة العشوائية للرسوميات. لا توجد أي بطاقة رسوميات استهلاكية تقترب من ذلك؛ النموذج يحتاج إلى أجهزة Mac ذات الذاكرة الموحّدة، أو بطاقة H200 واحدة، أو خادمًا متعدد البطاقات الرسومية.

هل يعني 18B النشط أن GLM-5.3-Flash يعمل على أجهزة المستهلك؟

لا. الرقم 18B النشط هو حساب لكل توكن. جميع معاملات 320B تبقى مقيمة في الذاكرة، لأن الموجّه لا يمكنه معرفة أي الخبراء يحتاجها التوكن حتى يرى التوكن. MoE يوفّر الحساب، لا الذاكرة.

ما هي أرخص طريقة لتجربة GLM-5.3-Flash؟

الواجهة المستضافة، z-ai/glm-5.3-flash. بسعر الإطلاق الترويجي، تبلغ التكلفة 0.075 دولارًا لكل مليون رمز إدخال، بينما تبلغ تكلفة الرموز المدخلة المخزنة مؤقتًا 0.015 دولارًا. الاستضافة الذاتية لأصغر نسخة تعني تخصيص حوالي 112 جيجابايت من الذاكرة لها، وهو أمر منطقي فقط إذا كنت تملك العتاد بالفعل.

الخلاصة الصادقة: GLM-5.3-Flash نموذج بفئة الخوادم في كل إصدار. يحصل Mac بسعة 128 جيجابايت على الإصدار الوحيد الذي يناسبه — 2bit-lite، مع رفع حد الذاكرة المثبتة، وسياقات قصيرة، وضريبة جودة موثقة على الأكواد الطويلة. بينما يحصل H200 واحد على نفس الإصدار مع مساحة خالية لذاكرة KV تبلغ حوالي 39 جيجابايت. أجهزة الخوادم تحصل على السلم الحقيقي، من 4-bit كافتراضي وصولًا إلى 6-bit شبه الخالي من الفقد. وبالنسبة للجميع الآخرين — معظم القراء — فإن نقطة نهاية z-ai/glm-5.3-flash المستضافة هي الجواب الصحيح، والأرقام أعلاه هي السبب، وليست قائمة تسوق. للتثبيت خطوة بخطوة على MacBook Pro، يغطي دليل تثبيت MacBook لدينا العملية كاملة من البداية إلى النهاية؛ ولمعرفة كيف تقارن إصدارات التكميم من حيث الجودة ومتى تختار كلًا منها، يقدّم دليل MLX التفاصيل؛ وتغطية الإصدار تحمل سياق الإطلاق وادعاءات الأداء.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا