
דרישות VRAM עבור GLM-5.3-Flash: כמה זיכרון דרוש להרצת MoE של 320B
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 103 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
GLM-5.3-Flash אינו מתאים לשום GPU צרכני. המבנה השמיש הקטן ביותר, 2bit-lite, דורש כ-102 GB של משקלים ו-112 GB של זיכרון RAM. Mac עם 128 GB הוא נקודת הכניסה; H200 יחיד מתאים ל-2bit-lite עם כ-39 GB פנויים; כל השאר צריכים להשתמש ב-API המאוחסן, z-ai/glm-5.3-flash.
זוהי כל התשובה בנשימה אחת, וכדאי לומר זאת בפשטות כאן: אין תצורת חומרה ביתית שיכולה להריץ את המודל הזה. מודל ה-320B-פרמטרים מסוג vision-language mixture-of-experts של Z.ai, ששוחרר ב-26 באוגוסט 2026, דורש זיכרון ברמת שרת בכל קוונטיזציה. הנתון "18B active" מתאר חישוב לכל טוקן, לא זיכרון תושב — כל 320B המשקולות נשארות טעונות בזיכרון. היעדים המקומיים הריאליים הם מחשבי Mac עם זיכרון מאוחד גדול, שרתים מרובי GPU, ו-H200 יחיד עם 141 GB. אם אין ברשותך אחד מאלה, המספרים שלהלן אינם רשימת קניות; הם הסיבה לקרוא למודל דרך API במקום.
הערת מסגרת אחת לפני המספרים: מספרי הזיכרון בכתבה זו הם ממצאים של הקהילה, לא הנחיית ספק. Z.ai מפרסמת משקלים ומפרטי API; היא אינה מפרסמת דרישות זיכרון להסקה מקומית. טבלת הקוונטיזציה מגיעה מכרטיס המודל orcarouter/GLM-5.3-Flash-MLX ב־Hugging Face, קוונטיזציית MLX של המשקלים הפתוחים שקבוצת קהילה מתחזקת, ומספרי הפריסה מגיעים מאנשי מקצוע שבאמת טענו את המודל. היכן שנתון מדווח על ידי הספק — תמחור וטענות יעילות מטמון ה־KV של הארכיטקטורה — אנו מתייגים אותו ככזה.
התשובה הקצרה: מה שמתאים למה שיש לך
התחל ממה שיש לך בפועל, כי סולם הקוונטיזציה הגיוני רק ביחס למכונת מטרה:
• GPU צרכני (RTX 4090, RTX 5090, וכל מה שמתחת) — לא. לאף כרטיס צרכני אחד אין מספיק זיכרון VRAM: הבנייה הקטנה ביותר היא ~102 GB של משקלים בלבד, בערך שווה ערך לחמישה כרטיסי RTX 5090. זיכרון RAM מערכתי לא משנה את זה, כי המשקלים חייבים להיות שוכנים על ההתקן.
• Mac עם 128 ג'יגה-בייט (M4 או M5 Max) — מבנה ה-2bit-lite (~102 ג'יגה-בייט משקלים / מינימום 112 ג'יגה-בייט RAM), ורק לאחר העלאת מגבלת ה-wired-memory. עוד על כך בהמשך. זוהי מכונת הצרכן היחידה שהמודל מתאים לה.
• 192 GB ו-256 GB Mac Studio — 3-bit (~184 / 200 GB) ו-2-bit (~145 / 160 GB) הופכים לנגישים; 4-bit דורש ~224 GB, שרק הדרגה של 256 GB מתקרבת אליו.
• H200 יחיד (141 GB VRAM) — 2bit-lite נכנס עם כ־39 GB פנויים ל־KV cache, מה שאומר רק קונטקסטים קצרים.
• שרת Multi-GPU — הכל, כולל 4-bit, 6-bit, ו-build הייחוס FP8 בגודל ~328 GB.
• כל השאר — ה-API המאוחסן, z-ai/glm-5.3-flash. זה לא פרס ניחומים; זה המקום שבו המודל הוא למעשה מהיר וזול לשימוש, וזה מכוסה בתחתית עמוד זה.
שני מספרים, לא אחד: משקלים מול זיכרון כולל
לכל קוונטיזציה בכרטיס המודל יש שתי עמודות — גודל המשקלים ו-RAM מינימלי — והפער ביניהן הוא החלק שרוב הכתבות מדלגות עליו. עמודת המשקלים היא קבצי המודל: כל פרמטר, ברמת דיוק זו, שוכן בזיכרון. עמודת ה-RAM המינימלי היא מה שהמכונה חייבת להחזיק בזמן ריצה: המשקלים בתוספת מטמון ה-KV, האקטיבציות והבאפרים שגדלים עם אורך ההקשר.
הנתון של 18B אקטיביים הוא המקום שבו אנשים מוטעים. GLM-5.3-Flash הוא MoE עם 320B בסך הכול / 18B אקטיביים: לכל טוקן, רק כ-18B פרמטרים מבצעים חישוב. זה חיסכון בחישוב, לא חיסכון בזיכרון. כל 320B המשקולות יושבות בזיכרון ללא קשר לאילו מומחים מופעלים, כי הנתב אינו יודע אילו מומחים הוא צריך עד שהוא רואה את הטוקן. MoE קונה מהירות, לא טביעת רגל — נקודה שכרטיס המודל עצמו מדגים בדוגמה, עם סך 320B המוצג לצד 18B האקטיביים.
אז כאשר build אומר "~204 GB משקלים / 224 GB RAM מינימלי," ה-~20 GB הנוספים הם תקורה בזמן ריצה — מטמון KV, אקטיבציות, באפרי הקשר. הגדל את אורך ההקשר והפער הזה גדל. העמודה של מינימום RAM, לא עמודת המשקלים, היא זו שעל פיה יש לתכנן את גודל המכונה.

המודל עצמו — הארכיטקטורה, הרישיון והמסגור של Z.ai עצמו — מתועד בכרטיס הרשמי של הספק, המופיע למעלה. זיכרון מקומי אינו מכוסה שם; זו הסיבה שהדף הזה קיים. המספרים שלהלן מגיעים מהפורט הקהילתי של המשקולות הפתוחות ל-MLX.
סולם הכימות
הטבלה בכרטיס orcarouter/GLM-5.3-Flash-MLX היא זו שמפתחים טוענים ממנה בפועל כיום. היא מפרטת חמישה בניינים מכוונטים (quantized) בתוספת ייחוס FP8, כל אחד עם גודל המשקלים ו-RAM מינימלי:
• ייחוס FP8 — משקלים של ~328 גיגה-בייט. נקודת הייחוס הלא-מכומתת שבה המשקלים הפתוחים מופצים.
• 6-bit — ~296 GB משקל / מינימום 320 GB RAM. כמעט ללא אובדן; הבנייה באיכות הגבוהה ביותר.
• 4-bit — ~204 GB / 224 GB. ברירת המחדל המומלצת לשימוש יומיומי.
• 3-bit — ~184 GB / 200 GB. אגרסיבי אבל שמיש.
• 2-bit — ~145 GB / 160 GB. מאמץ מיטבי.
• 2bit-lite — ~102 GB / 112 GB. הגרסה הקטנה ביותר; היחידה שמתאימה ל-Mac עם 128 GB או ל-H200 יחיד.
האיכות יורדת ככל שהסיביות נושרות, והכרטיס מכמת את זה. ביחס לייחוס FP8, הפלפלקסיטי מתדרדר ב־+0.24% ב־6 ביט, ב־+2.96% ב־4 ביט, ב־+9.96% ב־3 ביט, ב־+56.9% ב־2 ביט, וב־+141% ב־2bit-lite (נתוני הפלפלקסיטי מאותו כרטיס מודל). הנחיות השטח של הכרטיס עצמו: 6 ביט לאיכות כמעט ללא אובדן, 4 ביט כברירת המחדל לשימוש יומיומי, 3 ביט ו־2 ביט כשהזיכרון מוגבל, 2bit-lite רק כששום דבר אחר לא מתאים — ויצירת קוד ארוך אינה אמינה ב־2bit-lite. האזהרה האחרונה הזו חשובה למודל חשיבה עם 320B: 2bit-lite הוא מה שמשיג לך את המק עם 128GB, ומחיר האיכות נוחת בדיוק במקום שבו עבודת הקוד כואבת ביותר.

שני מספרים בסולם הזה ראויים למבט קרוב יותר, כי הם מכריעים את כל שאלת החומרה.
למה 2bit-lite קיים
2bit-lite אינו מדרגת איכות נוספת — הוא מדרגת גודל שנוצרה מסיבה אחת: 2-bit הרגיל לא נכנס. עם משקלים של כ-102 ג'יגה־בייט, זהו המבנה היחיד שנכנס מתחת לכ-112 ג'יגה־בייט של זיכרון שמיש ב-Mac עם 128 ג'יגה־בייט, והיחיד שמתאים ל-141 ג'יגה־בייט של H200 בודד עם מקום פנוי ל-KV cache. כרטיס המודל אומר את זה: 2-bit הרגיל לא נכנס ל-Mac עם 128 ג'יגה־בייט; 2bit-lite נכנס, עם מגבלת זיכרון חוטי מוגבהת. על H200 הוא נכנס "עם כ-39 ג'יגה־בייט פנויים ל-KV cache" (לשון הכרטיס). אותם 39 ג'יגה־בייט הם כל תקציב העבודה לכל מה שהמודל עושה לאחר הטעינה — וזה מביא אותנו להקשר.
מה עולה מטמון ה-KV בהקשר ארוך
ל-GLM-5.3-Flash יש חלון הקשר של 1M טוקנים, והקשר ארוך הוא המקום שבו תוכניות זיכרון מקומי מתות. תשומת הלב ההיברידית sparse-plus-linear של המודל — NoPE-MLA עם מנגנון index-pool — יעילה באמת: Z.ai מדווחת שהיא מקצצת את חישוב תשומת הלב פי 3.01 ואת גודל מטמון ה-KV פי 4.44 לעומת GLM-5.3 שלה (נתונים שדווחו על ידי הספק). אבל "פי 4.44 קטן יותר מ-GLM-5.3" עדיין משאיר מטמון שנמדד בעשרות GiB כשדוחפים לעבר הקשר מלא של 1M.
המספר הציבורי הטוב ביותר שיש לנו הוא מפריסה קהילתית שהריצה את המודל על ארבעה צמתי DGX Spark: 16 GiB של KV cache לכל rank — כ-64 GiB בסך הכול על פני הארבעה — כדי להחזיק הקשר מלא של 1M טוקנים, בגודל שמתאים לתמיכה בכמה בקשות במקביל עם הקשר מלא. זה יותר מתקציב הזיכרון הכולל של רוב המכונות הבודדות, וזאת לפני משקל בודד. על H200 בודד, החשבון הוא כל העניין בדף הזה: 2bit-lite משאיר כ-39 GB לכל מה שנותר אחרי המשקלים — נוח לשיחה קצרה, אבל נגמר תוך דקות כשההקשר מטפס לכיוון 100K טוקנים.
הכלל המעשי: עמודת ה-min-RAM מניחה הקשר סביר. אם עומס העבודה שלך מריץ מסמכים ארוכים, לולאות סוכן, או קוד בקנה מידה של מאגר קוד, הוסף תקציב זיכרון ל-KV-cache בנוסף — ובכל מה שקרוב ל-1M טוקנים, הפסק לעשות חשבון והשתמש ב-API. תצפיות התמחור הללו הן ממצאים של הקהילה; אין הנחיות ספקים לתקצוב KV.
מגבלת הזיכרון הנעול של macOS: למה מק עם 128 ג'יגה-בייט עדיין נכשל בטעינה
הכשל הנפוץ ביותר שמדווחים על ידי מתרגלים אינו "אין מספיק זיכרון RAM." זהו Mac עם 128 GB ומודל של כ-102 GB שמסרב להיטען. הסיבה היא מגבלת הזיכרון ה-wired של macOS. ב-Apple Silicon, ה-GPU אינו יכול לגשת לכל הזיכרון המאוחד: Metal חושף "גודל עבודה מרבי מומלץ" של כשני שלישים מה-RAM הפיזי, והקצאות מעליו נכשלות גם כשהמכונה כוללת זיכרון פנוי.
אז תקציב Metal ברירת המחדל של Mac עם 128 ג'יגה-בייט נע בטווח 80–90 ג'יגה-בייט — מתחת למה שגרסת 2bit-lite דורשת (כ-112 ג'יגה-בייט זיכרון מינימלי עם מודל שוכן של כ-102 ג'יגה-בייט). הטעינה נכשלת בגלל תקציב Metal, לא בגלל קיבולת הזיכרון. התיקון בכל דיווח של מתרגל שמצאנו הוא זהה: להעלות את מגבלת ה-wired עם sudo sysctl iogpu.wired_limit_mb=…, ולקבוע ערך גבוה מטביעת הרגל הכוללת של המודל ב-MB, ולצפות שזה יתאפס באתחול. מדריכים קהילתיים מסוימים גם קובעים את מגבלת ה-wired מ-Python באמצעות mlx.metal.set_wired_limit() כדי שמשקלי המודל יישארו נעולים ו-macOS יפסיק לדחוס דפי Metal שאינם פעילים.
עוד סיבוך: סביבות ריצה מתנהגות אחרת. MLX אוכף את תקציב Metal ונכשל בצורה חריפה כאשר חורגים ממנו, בעוד שסביבות ריצה המבוססות על llama.cpp (מסלול GGUF) בדרך כלל אינן אוכפות אותו ומאפשרות ל-macOS לבצע החלפה (swap) במקום. זו הסיבה שאותו מודל יכול לסרב להיטען בסביבת ריצה אחת ו"להיטען" באחרת — ולכן מודל שהוחלף יכול להיות איטי עד כדי חוסר שימושיות. אלו ממצאים קהילתיים על התנהגות macOS, לא הנחיות של Apple.
החלופה המתארחת: z-ai/glm-5.3-flash
עבור כל מי שהמספרים שלמעלה פוסלים — וזה רוב האנשים — Z.ai מגישה את המודל עצמו בתור z-ai/glm-5.3-flash, וזה המקום שבו ה"Flash" בשם באמת בא לידי ביטוי. מחיר המחירון של Z.ai הוא $0.15 למיליון טוקני קלט, $0.03 למיליון טוקני קלט במטמון, ו-$0.50 למיליון טוקני פלט; מבצע השקה נמשך עד 9 בספטמבר 2026, במחירים של $0.075 / $0.015 / $0.25 (מחירים שדווחו על ידי הספק, נכון למועד הכתיבה). קלט במטמון במחיר של חמישית מקלט טרי הוא מנוף העלויות הגדול ביותר: כל עומס עבודה עם קידומת ניתנת לשימוש חוזר — הנחיות מערכת, הגדרות כלים, מסמכים משותפים ארוכים — צריך לנצל את מחיר קריאת המטמון.
חישובי הזיכרון צריכים להיכלל בהחלטה. הגשת מודל 320B בעצמך משמעה להקדיש לו 112–320 ג'יגה-בייט של זיכרון, בין אם הוא במצב סרק ובין אם הוא עמוס. נקודת הקצה המרוחקת מעבירה את כל זה מהמכונות שלך, ובמחירי מבצע ההשקה המודל עולה פחות לכל טוקן ממודלים רבים שגודלם עשירית מגודלו — וזו בדיוק המטרה של MoE עם 18B פרמטרים פעילים.
זה גם המקום הטבעי לנקודת הניתוב. באמצעות OrcaRouter, z-ai/glm-5.3-flash הוא אחד מ-200+ הדגמים שמאחורי API יחיד, המתומחר במחיר המחירון של הספק עם 0% תוספת — כך שמבצע ההשקה, וכל הפחתת מחיר עתידית, פעילים באותו יום שבו הם מוכרזים. משמעות failover אוטומטי היא שדגם בן שלושה ימים עם נתיב שרת לא יציב אינו הימור על ערימת הייצור שלך: אם הספק מחזיר שגיאה או שהוא רווי, הבקשה עוברת לספק בריא במקום להיכשל. ניסיון בטוח של דגם לא מוכח הוא בדיוק מה שנתב נועד לעשות.

שאלות נפוצות
האם ניתן להריץ את GLM-5.3-Flash על RTX 5090?
לא. הגרסה הקטנה ביותר היא ~102 GB של משקלים בלבד, ול-RTX 5090 יש 32 GB של VRAM. שום GPU צרכני לא מתקרב; המודל דורש מחשבי מק עם זיכרון מאוחד, H200 בודד, או שרת עם מספר GPUs.
האם 18B פעיל אומר ש-GLM-5.3-Flash רץ על חומרה ביתית?
לא. הנתון של 18B פעיל הוא חישוב לכל טוקן. כל 320B הפרמטרים נשארים בזיכרון, כי הנתב לא יכול לדעת אילו מומחים טוקן צריך עד שהוא רואה את הטוקן. MoE חוסך חישוב, לא זיכרון.
מה הדרך הזולה ביותר לנסות את GLM-5.3-Flash?
ה-API המאונדס, z-ai/glm-5.3-flash. במחיר ההשקה-מבצע הוא עולה $0.075 למיליון טוקני קלט, וטוקני קלט שמורים במטמון עולים $0.015. אירוח עצמי של הבנייה הקטנה ביותר פירושו להקדיש כ-~112 GB של זיכרון RAM עבורו, מה שהגיוני רק אם כבר יש לך את החומרה.
התקציר הכנה: GLM-5.3-Flash הוא מודל ברמת שרת בכל build. ה-Mac בעל 128 GB מקבל את ה-build היחיד שמתאים — 2bit-lite, עם הרמת מגבלת הזיכרון ה-wired, הקשרים קצרים, ומס איכות מתועד על קוד ארוך. H200 בודד מקבל את אותו build עם כ-39 GB של מרווח KV. חומרת שרת מקבלת את הסולם האמיתי, מ-4-bit כברירת מחדל ועד 6-bit כמעט חסר אובדן. ולכל השאר — רוב הקוראים — נקודת הקצה המאוחסנת z-ai/glm-5.3-flash היא התשובה הנכונה, והמספרים לעיל הם הסיבה, לא רשימת קניות. להתקנה שלב-שלב על MacBook Pro, המדריך להתקנה על MacBook שלנו מכסה את כל התהליך מקצה לקצה; להשוואת builds של קוונטיזציה מבחינת איכות ומתי לבחור כל אחד, מדריך ה-MLX מכיל את הפרטים; וסיקור ההשקה נושא את הקשר ההשקה ואת טענות הביצועים.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
