
איך להריץ GLM-5.3-Flash על MacBook Pro: ספר המהלכים של 2bit-Lite MLX
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
הרצת GLM-5.3-Flash על MacBook Pro פירושה מכונה אחת בדיוק: 128 GB M4/M5 Max MacBook Pro המריץ את בניית ה-2bit-lite של ההמרה שלנו ל-MLX, עם הרמת מגבלת הזיכרון ה-wired של macOS. אם ה-MacBook Pro שלכם כולל פחות מ-128 GB — M4 Pro עם 36 GB, M4 Max עם 48 GB — המדריך הזה לא בשבילכם; דלגו לסעיף האחרון ונתבו ל-API המתארח של z-ai/glm-5.3-flash במקום זאת. GLM-5.3-Flash (המשקלים ב-zai-org/GLM-5.3-Flash) הוא מודל ה-Mixture-of-Experts של Z.ai בעל 320 מיליארד פרמטרים, עם 18B פעילים לכל טוקן — שוחרר ב-26 באוגוסט 2026, ה-GLM-5 המולטי-מודאלי הראשון מטבעו — ואפילו הגרסה הקטנה ביותר של הפורט שלנו ל-MLX דורשת ~102 GB של משקלים ו-~112 GB של זיכרון. זה כל השוק, ואנחנו לא מתכוונים לרכך את זה.
זהו תיעוד ישיר של היצרן, לא כתבת השקה: המשקלים שלהלן הם הבנייה של OrcaRouter עצמו (orcarouter/GLM-5.3-Flash-MLX, MIT), שנוצר בשיטת הכימות OrcaSAQ ללא כיול שלנו. שחררנו אותו ב-26 באוגוסט ולמחרת תיקנו את הכיוון בפומבי, כי טווח הכימות המקורי לא הפך את השימוש ב-MacBook Pro למעשי עבור רוב האנשים — בניית ה-2-bit הרגילה עדיין דרשה כ-160 ג'יגה-בייט, שאין לאף מחשב נייד. ב-27 באוגוסט בנינו מחדש את הגרסה הקטנה ביותר כ-2bit-lite במיוחד כדי להתאים ל-MacBook Pro בעל 128 ג'יגה-בייט, והמאמר הזה הוא החשבון הכנה של מה שזה נותן לך ומה זה עולה. כל מספר שמסומן הערת שדה להלן נמדד בריצת האימות שלנו על H200 יחיד; שום דבר כאן אינו מדד של ספק. במקומות שבהם אנו חוזרים על נוהג קהילתי — פקודת ה-wired-memory, ניהול הגרסאות של mlx-vlm — אנו מתייגים זאת ככזה.
איזו גרסה מתאימה לאיזה Mac (קראו את זה לפני שאתם מורידים משהו)
חמשת הגרסאות במאגר מתאימות כל אחת לכמות זיכרון מינימלית. ב-MacBook Pro, לשאלה "איזו גרסה" יש תשובה אחת בדיוק — כל מה שמעל 2bit-liteזה עניין של Mac Studio:
• 6-bit — ~296 GB משקלים / ~320 GB זיכרון RAM / כמעט ללא אובדן. Mac Studio עם 512 GB בלבד.
• 4-bit — ~204 GB / ~224 GB / ברירת המחדל המומלצת שלנו. Mac Studio 256 GB. זה מה ששורש הריפו משקף.
• 3-bit — ~184 GB / ~200 GB. Mac Studio 256 GB.
• 2-bit — ~145 GB / ~160 GB. Mac Studio 192 GB. זו הייתה הבילד הקטן ביותר שהשקנו ביום הראשון, וזו הייתה ההחמצה.
• 2bit-lite — ~102 GB / ~112 GB. הגרסה היחידה שמתאימה למחשב עם 128 GB — MacBook Pro עם M4/M5 Max ו-128 GB, או Mac Studio או Mac mini עם 128 GB. כל מחשב נייד של Apple Silicon עם 128 GB (M3 Max או חדש יותר) הוא אותו סיפור, רק איטי יותר.
המלכודת הטמונה בסולם הזה: פקודת ההורדה שמוגדרת כברירת מחדל ב-README מורידה את גרסת ה-4-bit (~204 GB), שהיא ברירת המחדל הנכונה עבור מכונה עם 256 GB וחסרת תועלת על מחשב נייד. אם תעקוב אחרי פקודת ברירת המחדל במחשב MacBook Pro, בסופו של דבר תקבל מודל שלא יקצה זיכרון. מסלול ה-2bit-lite דורש במפורש --include, שיפורט להלן.
יש גם תקרה קשיחה שתתקל בה לפני שהחשבון שלמעלה בכלל תקף. macOS לא מאפשר לתהליך לתפוס את כל הזיכרון המאוחד של מק עם 128 GB; תקרת ברירת המחדל לשימוש ב-GPU היא בערך 91–96 GB (תוצאה של הנדסה לאחור על ידי הקהילה, ואומתה בכמה כתבות על תצורות MLX למודלים גדולים). זה נמוך מכ-102 GB של המשקלים בלבד, לכן אפילו 2bit-lite לא ייטען עד שלא תעלה את מגבלת הזיכרון הקשיח. שלב זה הוא חובה, והוא מופיע בסעיף 4.
התקן את mlx-vlm — ורק את mlx-vlm
GLM-5.3-Flash הוא מודל שפה-ראייה, ולכן הוא רץ תחת mlx-vlm, לא mlx-lm. זו הדרך הנפוצה ביותר שבה אנשים נתקעים, אז נגיד זאת מוקדם: mlx-lm מיועד למודלים טקסטואליים בלבד; הפעלת מודל מולטי-מודאלי באמצעותו גורמת לשגיאת טעינה מבלבלת. התקן את חבילת ה-VLM בגרסה 0.6.17 ומעלה:
pip install -U "mlx-vlm>=0.6.17"
נעילת הגרסה אינה קישוט. glm5_next — הארכיטקטורה ההיברידית של קשב דליל-פלוס-לינארי שמאחורי GLM-5.3-Flash — הגיעה ל-mlx-vlm רק באותו היום שבו הושק הדגם (26 באוגוסט 2026), וכל גרסה ישנה יותר לא תזהה את התצורה. לארכיטקטורה יש חשיבות גם מסיבה שנייה: זוהי טופולוגיה חדשה לחלוטין, ובגל הראשון של הפורטים היו באגי נכונות אמיתיים שפלט שוטף לא היה חושף. ביקורת ריצה קהילתית של נתיב ה-MLX המוקדם של glm5_next מצאה ותיקנה ארבעה מהם: clamp של SwiGLU שלא הופעל על כל בלוק FFN, טנזורי היפר-חיבור מוגבלי-יריעה שהומרו ל-dtype שגוי (מה ששחת באופן שקט את מטריצת ערבוב הקשב), שני אי-התאמות אפסילון בנורמות הקשב, ולוגיטים של ראוטר ב-bf16 בעוד שהייחוס משתמש ב-float32. לאחר התיקונים, הנומריקה תאמה לייחוס בדיוק של בערך 1e-7. המסקנה עבורך: שמור על mlx-vlm מעודכן, והתייחס בחשדנות למהדורה הראשונה ממש של כל פורט של ארכיטקטורה חדשה.
הורד את המשקלים: דגלי ההחרגה, וההכללה שאתה באמת צריך
שורש ה-repo זהה ל-build של 4-bit, וכל חמשת הווריאנטים נכללים כתיקיות משנה. הפקודה ברירת המחדל מורידה את השורש ומשתמשת ב- --exclude כך שאף אחת מחמש תיקיות הווריאנטים (שביחד הן בסדר גודל של 800 גיגה-בייט) לא תורד יחד איתו:
hf download orcarouter/GLM-5.3-Flash-MLX --local-dir ./GLM-5.3-Flash-MLX --exclude "2bit-lite/*" "2-bit/*" "3-bit/*" "4-bit/*" "6-bit/*"
ב-MacBook Pro הפקודה הזו שגויה עבורך — היא נותנת לך את ה-root של 4 סיביות. עבור מחשב נייד בנפח 128 GB, הבא רק את תיקיית המשנה של 2bit-lite:
hf download orcarouter/GLM-5.3-Flash-MLX --include "2bit-lite/*" --local-dir ./GLM-5.3-Flash-MLX
זו הורדה של ~102 GB, והיא עצמאית לחלוטין — תיקיית 2bit-lite/ כוללת את ה-config.json שלה, כך שאתה מפנה את המחולל ישירות אליה. אם hf אינו ב-PATH שלך, התקן אותו: pip install -U huggingface_hub. לפני שתתחיל, ודא שיש לך ~110 GB של שטח פנוי, ושלא מדובר ב-100 ה-GB הפנויים האחרונים ב-Mac שלך — MLX ממפה את ה-weights לזיכרון, ו-SSD כמעט מלא הוא מה שהורג את ההתקנות האלה באמצע ההורדה.

הגדל את מגבלת הזיכרון הקשיח — השלב שכולם שוכחים
זהו השלב הקריטי שיכול להכריע את ההצלחה או הכישלון ב-MacBook Pro בעל 128 GB, וכרטיס ה-README מניח שאתם יודעים אותו במקום לכתוב במפורש את הפקודה. תקרת סביבת העבודה המוגדרת כברירת מחדל של Metal ב-Mac בעל 128 GB היא בערך 91–96 GB, וזה מתחת לכ-102 GB של משקלי 2bit-lite — לכן ללא שלב זה המודל לא מצליח להקצות זיכרון והטעינה קורסת. הפתרון הסטנדרטי בקהילה הוא sysctl שמעלה את תקרת הזיכרון הקשור ל-GPU במגה-בייט:
sudo sysctl iogpu.wired_limit_mb=114688
זה קובע תקרה של ~112 ג'יגה-בייט, ומשאיר כ-14 ג'יגה-בייט כשמורה למערכת ההפעלה. במכונות עם 128 ג'יגה-בייט, ערכי קהילה בשטח נעים בין ~114688 (112 ג'יגה-בייט) ועד ~122880 (120 ג'יגה-בייט); אל תמקסם את זה — macOS זקוקה למרווח ראש, או שתקבל גמגומים של שרת החלונות ותקיעות מערכת תחת לחץ זיכרון. לאחר ההגדרה, טען את המודל וצפה ב-Activity Monitor: אם לחץ הזיכרון הופך לצהוב, הנמך את המספר.
שתי הערות מעשיות, שתיהן מהפרקטיקה הקהילתית ולא מהערות השטח שלנו. ראשית, sysctl מתאפס באתחול ומוחל על סשן הטרמינל שבו הגדרת אותו, אז תכנן להריץ אותו שוב (או לתסרט אותו דרך LaunchAgent) — לשכוח אותו אחרי אתחול הוא הכישלון הקלאסי של "אתמול זה עבד". שנית, MLX חושף גם פרמטר פנימי בתהליך, mlx.core.metal.set_wired_limit(bytes), ב-macOS 15.0 ומעלה; הוא חייב להישאר מתחת לתקרת ה-sysctl, והוא האפשרות הניידת יותר אם אתה כותב סקריפטים במחברת. לא משנה באיזה מהם תשתמש, ההשפעה זהה: בלעדיו, שום דבר כאן לא רץ.
הרץ את זה: טקסט, תמונה, ו-API של Python
כשהמשקלים במקום והמגבלה הועלתה, היצירה היא פקודה אחת. טקסט:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --prompt "הסבר את השזירות הקוונטית במשפט אחד." --max-tokens 256
קלט תמונה עובד באותו אופן עם --image כדגל — כאן המודל המולטי-מודאלי מוכיח את עצמו במחשב נייד, מכיוון שמגדל הראייה נשאר בדיוק גבוה יותר בפריסת OrcaSAQ:
python -m mlx_vlm.generate --model ./GLM-5.3-Flash-MLX/2bit-lite --image photo.jpg --prompt "תאר את התמונה הזו." --max-tokens 256
עבור סקריפט, ה-API של Python הוא באותה צורה שמשתמשי mlx-vlm מכירים:
from mlx_vlm import load, generate from mlx_vlm.prompt_utils import apply_chat_template model, processor = load("./GLM-5.3-Flash-MLX/2bit-lite") prompt = apply_chat_template(processor, model.config, "תאר את התמונה הזו.", num_images=1) print(generate(model, processor, prompt, ["photo.jpg"], max_tokens=256, verbose=True))
שמור על --max-tokensצנוע. בריצת השטח שלנו על H200, 2bit-lite מחזיק בערך 10 tok/s, אז תשובה של 1,024 אסימונים היא כבר המתנה של שתי דקות — ויציאות ארוכות הן המקום שבו תקציב ה-KV וקריסת האיכות נושכים (להלן). במחשב נייד כדאי לצפות שזה ירגיש איטי יותר, לא מהיר יותר, עד שיהיה נתון מדוד.
איזו איכות אתה מקבל בפועל (הסולם הנמדד)
הנה החלק הכנה של ספר המשחקים, ואנחנו לא הולכים לייפות אותו. OrcaSAQ מתדרדר בחן עד ל-3-bit, ואז העלות מטפסת במהירות. לעומת ייחוס ה-FP8 (perplexity 2.7797):
• 6-bit — פרפלקסיות 2.7864 (+0.24%), התאמת הטוקן הראשון 97.76%. כמעט ללא אובדן, כפי שפורסם.
• 4-bit — perplexity 2.8620 (+2.96%), top-1 96.13%. ברירת המחדל המומלצת.
• 3-ביט — פרפלקסיטי 3.0566 (+9.96%), top-1 92.06%. אגרסיבי אך שמיש.
• 2-bit — perplexity 4.3622 (+56.9%), top-1 86.56%. עלות אמיתית.
• 2bit-lite — perplexity 6.7018 (+141%), top-1 77.19%. הבנייה הקטנה ביותר, והיחידה שמקבוק פרו יכול להחזיק.
אלה מספרים שנמדדו מצינור ההמרה שלנו. 2bit-lite הוא רגרסיה של 141% ב-perplexity והסכמה על הטוקן הראשון (top-1) מתחת ל-78% — אתה מריץ מודל שהידרדר באופן ניכר, ומצבי הכשל שלהלן הם מה שההידרדרות הזו נראית בפועל. זו הדגמה מבריקה ועוזר סביר לפניות קצרות; היא אינה תחליף למודל בדיוק מלא.
בעניין המהירות, אנחנו חייבים לך את אותה הכנות. הערת השטח שפורסמה היא H200: כ-10 tok/s, יציבה בריבוי-סבבים, ומתאימה לשאלות-תשובות יומיומיות ולטקסט קצר. עדיין אין לנו נתון מדוד ל-MacBook Pro עבור 2bit-lite, ואנחנו לא הולכים להמציא אחד — התפוקה של Apple Silicon כאן תלויה ברוחב פס הזיכרון, בתרמיקה, ובכיסוי קרנל ה-MLX עבור הקשב ההיברידי, ואף אחד מאלה לא נמדד על ידינו עבור build זה על המחשב הנייד הזה. נקודת הנתונים הקרובה ביותר שפורסמה עבור Apple Silicon שאנחנו יכולים להפנות אותך אליה היא מדידה עצמאית של ~450 tok/s עבור build של GLM-5.3-Flash ב-4-bit על Mac עם 512 GB תחת זמן ריצה שונה של MLX — build שונה, דיוק שונה, ומחשב שולחני, אז אל תתייחס גם אליו כמספר שלך. תכין את עצמך לקצב איטי; תהיה מופתע לטובה אם לא.
KV cache וקונטקסט ארוך: שימו לב למרווח
GLM-5.3-Flash מפרסם חלון הקשר של 1M טוקנים. המספר הזה אינו רלוונטי בחומרה זו, ומדריך שמתיימר אחרת היה עושה לך שירות רע. ההערה המעשית היא שורה אחת: תן לסביבת הריצה מספיק תקציב KV לאורך היעד שלך. ב-H200 בודד, 2bit-lite משאיר כ-39 GB של מרווח למטמון KV לאחר טעינת המשקלים. ב-MacBook Pro עם 128 GB, החשבון קשוח יותר: ~102 GB של משקלים מול תקרה של ~112 GB משאיר בסדר גודל של 26 GB לפני סט העבודה של macOS עצמו — ושכבות תשומת הלב הליניאריות ההיברידיות הופכות את טביעת הרגל של ה-KV של המודל הזה לקטנה יחסית למודל צפוף בגודל זה, אבל היא עדיין גדלה ליניארית עם ההקשר.
בצד השרת, ההנחיות מהקהילה הרחבה מאשרות את הנקודה: תצורה שנטענת היטב בהקשר של 8K יכולה לגמור את הזיכרון ב־128K. במחשב הנייד, שמרו על הקשרים קצרים — כמה אלפי טוקנים של שאלות ותשובות או תמונה אחת — ואל תנסו להאכיל אותו בספר. ברגע שעומס עבודה באמת דורש הקשר ארוך, אתם נמצאים בחלק האחרון של המאמר הזה.
יצירת קוד ארוך אינה אמינה ב-2bit-lite (קרא זאת פעמיים)
זהו הקטע שבלעדיו מדריך שמסתיר את מצבי הכשל שלו היה חסר ערך, ולכן הוא זוכה לכותרת משלו. הערות השטח של H200 חד-משמעיות: שאלות ותשובות יומיומיות וטקסט קצר יוצאים בסדר, ויצירת קוד ארוכה אינה אמינה ברמת דיוק זו. שלושה מצבי כשל שוחזרו בריצת האימות שלנו:
• לולאות חזרה — המודל מתחיל לחזור על אותן שורות או בלוקים במקום להתקדם, בדרך כלל לאחר כמה מאות טוקנים.
• קוד דבק חסר — ייבואים, חיבורים וטיפול בשגיאות מושמטים בשקט. הפונקציה שנוצרת נראית נכונה בבידוד ואינה רצה, משום שהשלד הסובב פשוט חסר.
• שכתוב יתר — במקום עריכה מינימלית, המודל משכתב חלקים גדולים של קובץ, וסיבובים עוקבים לא מסכימים עם הפלט של זה.
אלה ניתנים לשחזור ב-2bit-lite, והם בדיוק הדברים שחוזה הסכמה של 77% ב-top-1. מה אנשי מקצוע שמשמרים את ה-build הנייד בסביבה עושים בפועל:
• השתמשו בו עבור הסבר, סיכום, שאלות ותשובות, והבנת תמונות — משימות קצרות שבהן הוא באמת טוב.
• אם אתה חייב לבקש קוד, בקש פונקציה קטנה אחת בכל פעם עם חתימה מפורשת, וודא כל אחת לפני שממשיך הלאה. אל תיתן לו קובץ שלם ותבקש תכונה.
• עבור כל דבר ארוך — מודול מלא, רפקטורינג, או סשן סוכן ארוך — נתב ל-API בעל הדיוק המלא. זה לא עקיפה; זו הארכיטקטורה הנכונה, וזה החלק האחרון.
כאשר אין לבצע זאת כלל: קרא ל-z-ai/glm-5.3-flash במקום

כלל ההחלטה הכנה: הפעל את 2bit-lite על MacBook Pro M4/M5 Max עם 128 GB רק כשאתה רוצה ספציפית מודל מולטי-מודאלי של 320B על מחשב נייד שאתה יכול לשאת — שאלות ותשובות לא מקוונות, מסמכים פרטיים, הבנת תמונות בלי שכלום יוצא מהמכשיר. בחר ב-API לכל השאר:
• כל MacBook Pro מתחת ל-128 GB — אין build בשבילך. אל תנסה לטעון אותו; השתמש ב-API.
• יצירת קוד ארוכה או חשיבה בהקשר ארוך — 2bit-lite נכשל בדיוק בזה, באופן אמין. השתמשו ב-API.
• עבודה רגישה לאיכות — 77.19% הסכמת top-1 ופרפלקסיות של +141% הם ירידה אמיתית, לא שגיאת עיגול. השתמשו ב-API.
• תפוקה מובטחת או זמן השהיה צפוי — עדיין אין נתון מדוד למחשב נייד, והערת השטח היא 10 tok/s. השתמשו ב-API.

המודל המתארח הוא z-ai/glm-5.3-flash, מוגש בדיוק מלא על OrcaRouter במחיר הנוכחי של Z.ai — $0.07 למיליון אסימוני קלט ו-$0.25 למיליון אסימוני פלט נכון לכתיבת שורות אלה (מחיר תקופת השקה; המחירון שפורסם על ידי Z.ai הוא $0.15 / $0.50). זה המחיר שדווח על ידי הספק, והוא מועבר בלי שום תוספת, כך שהפחתת מחיר של Z.ai משתקפת אצלנו באותו היום. אתה מקבל מפתח API אחד שמגיע גם ל-200+ המודלים האחרים שאנחנו מנתבים, ו-failover אוטומטי פירושו שניסוי עם המודל החדש הזה לא הופך את נתיב הייצור שלך לתלוי בספק יחיד. באותו זמן שלוקח להוריד 102 GB ולהמתין להרצה הקרה הראשונה, ה-API כבר ענה על שאלות של שבוע שלם — והוא עונה עליהן בדיוק מלא.
הסקה מקומית שווה את זה כשהסיבה היא מקומית — פרטיות, עבודה לא מקוונת, ללא מגבלות קצב, הדגמה שרצה על סוללה. זה לא שווה את זה בחישוב של עלות או איכות מכל סיבה אחרת, וזה לא שווה את זה בכלל על מכונה עם פחות מ-128 GB.
שאלות נפוצות
האם Mac עם 64 GB או 96 GB יכול להריץ את GLM-5.3-Flash באופן מקומי?לא. המבנה הקטן ביותר, 2bit-lite, דורש לפחות כ-112 GB לאחר תקורות ה-macOS, ואפילו מכונה עם 128 GB חייבת להעלות את מגבלת הזיכרון הנעול כדי לטעון אותו. אם ה-Mac שלך הוא מתחת ל-128 GB, המסלול המקומי אינו קיים; נתב את z-ai/glm-5.3-flash דרך ה-API במקום זאת.
התקנתי את mlx-vlm והמודל לא נטען — מה לא בסדר? שתי הסיבות השכיחות, לפי הסדר: גרסה נמוכה מ-0.6.17, שקודמת לתמיכה ב-glm5_next ולא תזהה את הארכיטקטורה; ושגבול ה-wired memory לא הוגבה, מכיוון שה-build של ~102 GB אינו יכול להקצות זיכרון תחת תקרת Metal של ~91–96 GB המוגדרת כברירת מחדל ב-Mac עם 128 GB. תקן את שניהם (שדרג את החבילה, הרץ את sysctl) והמודל ייטען.
האם ה-build המקומי של 2bit-lite הוא אותו מודל כמו ה-API של z-ai/glm-5.3-flash? אותם משקלים בסיסיים של GLM-5.3-Flash, אבל לא אותה איכות. 2bit-lite הוא קוונטיזציה של 2-bit עם 77.19% הסכמה בטוקן המוביל לעומת ייחוס FP8, ויצירת קוד ארוך אינה אמינה. ה-API מספק דיוק מלא. הם ניתנים להחלפה רק לעבודה קצרה וסובלנית לפגמי איכות.
הגרסה בת 30 השניות
מכונה אחת, build אחד, sysctl חובה אחד. אם יש לך MacBook Pro M4/M5 Max עם 128 GB: התקן את mlx-vlm>=0.6.17, הורד רק 2bit-lite/ (כ-102 GB), העלה את מגבלת הזיכרון ה-wired עם sudo sysctl iogpu.wired_limit_mb=114688, והרץ mlx_vlm.generate — לשאלות ותשובות, טקסט קצר ותמונות. קבל שיצירת קוד ארוכה אינה אמינה בדיוק זה, שעדיין אין מדידת throughput למחשב נייד, ושמק עם 128 GB הוא הרף התחתון, לא הסטנדרט. אם כל אחת מההסתייגויות האלה היא מפריעת עסקה — או שהמק שלך מתחת ל-128 GB — אותו המודל בדיוק מלא נמצא במרחק קריאת API אחת ב-z-ai/glm-5.3-flash.
לא על Mac עם 128 GB? z-ai/glm-5.3-flash מציע את אותו מודל ברמת דיוק מלאה על OrcaRouter — מפתח API אחד, תמחור ספק שמועבר ב-0% רווח, וללא הורדה של 102 GB.
