
Qwen3.8-27B עם MLX על Apple Silicon: כן, זה רץ — הנה מה שבאמת צריך
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 לכל 1M טוקנים · 22 tok/s
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
Qwen3.8 27B פועל על Apple Silicon כיום דרך MLX. התג הוא qwen3.8:27b-mlx ב-Ollama, נוסף ב-Ollama v0.32.12, והגרסה עם דיוק 4-bit מורדת כ-18 GB וצריכה בערך 16–19 GB של זיכרון מאוחד — מה שהופך מק עם 24 GB+ לרף הריאלי ומק עם 16 GB לבלתי אפשרי. המשקלים הם ברישיון Apache 2.0, חינם לשימוש על חומרה שבבעלותך, וזו כל המהות של המודל. השחרור של Alibaba הוא בן יומיים (13–14 באוגוסט 2026), כך שכל מספר למטה מסומן: מה שמגיע מכרטיס המודל של Alibaba, מה שאימתנו בעמוד Ollama היום, ומה שמקורו בהערכה או מדידה של צד שלישי.
גיליון העובדות של 30 שניות
Qwen3.8 27B הוא המודל הצפוף של Alibaba עם 27 מיליארד פרמטרים, ששוחרר ב-13–14 באוגוסט 2026 תחת Apache 2.0 — המשקולות הגיעו ל-Hugging Face ול-ModelScope ב-13, וקובץ ה-LICENSE הופיע למחרת בבוקר. זהו האח הצפוף הניתן לפריסה של Qwen3.8-Max עם 2.4 טריליון פרמטרים. לפי כרטיס המודל, כל הדיווחים של Alibaba שטרם שוחזרו באופן עצמאי:
• גודל — 27B דחוס, 27.78B פרמטרים סה"כ כולל מקודד הראייה.
• ארכיטקטורה — 64 שכבות, גודל חבוי 5,120, אוצר מילים 248,320.
• תשומת לב היברידית — 16 שכבות תשומת לב מלאות ועוד 48 שכבות לינאריות של Gated DeltaNet, ביחס של 3:1.
• הקשר — 262,144 טוקנים במקור, ניתן להרחבה ל-1M באמצעות YaRN (Ollama מציין את התג ב-256K).
• קלט — הבנה מובנית של תמונות ווידאו על גבי טקסט, ממסמכים ועד וידאו באורך שעות.
• משקלים — 55.6 GB ב-BF16, כולל ראש פענוח ספקולטיבי MTP.

בצד ה-MLX, אומת היום: Ollama משחררת את qwen3.8:27b-mlx — build מקורי של MLX עבור Apple Silicon בהורדה של כ-18 GB ב-4-bit — והערות הגרסה v0.32.12 מציינות אופטימיזציה ל-Apple Silicon. mlx-lm, ערכת הכלים הפייתונית של אפל, תומכת בארכיטקטורה לייצור והמרה, והקוונטיזציות של MLX (3/5/6-bit, בנוסף ל-MXFP4 ול-NVFP4) הופיעו תוך שעות מהפרסום של המשקלים. שאר המאמר מניח Mac מסדרת M עם זיכרון מאוחד של 24 GB או יותר.
מה MLX משנה לגבי זיכרון
ב-Apple Silicon אין VRAM נפרד. MLX פועל על מאגר הזיכרון המאוחד של סדרת M, כך שהמספר שחשוב הוא סך ה-RAM ב-Mac שלך פחות מה ש-macOS וכל השאר תופסים. מודל ש"נכנס ב-17 GB" דורש מכונה עם יותר מזה בנוחות.
החדשות הטובות הן ש-Qwen3.8 27B זול יותר להחזקה ממה שמצביע ספירת הפרמטרים שלו. מכיוון שרק 16 שכבות הקשב המלאות שומרות מטמון KV — 48 השכבות הליניאריות לא — עלות המטמון היא כ-64 קילו-בייט לכל טוקן, בערך רבע ממה שמשלם מודל צפוף רגיל עם 64 שכבות. בקצה הרחוק, חלון 262K המלא דורש כ-16.4 ג'יגה-בייט של מטמון בנוסף למשקלים, וזה תקציב של שרת, לא תקציב של מחשב נייד.
{{1}}הסולם הריאלי ל-Mac, גודל קובץ פלוס מרווח מטמון:{{/1}}
• 4-ביט MLX — ~16–19 GB בסך הכול. מתאים ל-Mac עם 24 GB ועם חלון של בערך 64K–96K; ברירת המחדל הסבירה.
• 6-bit MLX — ~21–22 GB. למחשבים עם 32 GB; קפיצת האיכות לעומת 4-bit מתונה.
• 8-bit MLX — ~27–30 ג"ב. מחשבים עם 48 ג"ב ומעלה; כמעט ללא אובדן.
• BF16 — כ-55.6 GB. רק מכונות הסטודיו מהדרג הגבוה ביותר בסדרת M – Max ו-Ultra.

מקורות: נתון ה-4-bit עוקב אחרי ה-GGUF Q4_K_M הנמדד (17.1 GB, unsloth, 14 באוגוסט) ואחרי הורדת ה-Ollama בנפח 18 GB; נתוני ה-8-bit וה-BF16 עוקבים אחרי כרטיס ה-BF16 של Alibaba עצמו ואחרי שושלת Qwen3.6-27B. נתון המטמון של 64 KB לכל טוקן נגזר מהארכיטקטורה, אינו מודפס בגיליון מפרטים, ותקף רק עבור סביבות ריצה שמדלגות על מטמון ה-KV בשכבות הלינאריות כפי ש-MLX עושה.
שלוש דרכים להפעיל אותו, מהפשוטה ביותר ועד לשליטה המרבית
מסלול A — Ollama, הפשוט ביותר
שדרג ל-Ollama 0.32.12 או לגרסה חדשה יותר, ואז:
• ollama pull qwen3.8:27b-mlx — מוריד את גרסת ה-MLX בנפח ~18 ג"ב.
• ollama run qwen3.8:27b-mlx — צ'אט אינטראקטיבי עם תבנית החשיבה מחוברת.
• ollama serve — חושף את ה-API התואם ל-OpenAI ב-localhost:11434 עבור האפליקציות שלך.

בעיה ידועה אחת, מתוך issue פעיל ב-GitHub נכון לכתיבת שורות אלה: qwen3.8:27b-mlx דוחה את התפקיד "developer" ב-endpoint /v1/responses, מה ששובר את הפקודה ollama launch codex עבור המודל הזה — בעוד שהפקודה הישירה ollama run עובדת כראוי. אם אתה בונה לולאת סוכן בסגנון Codex על גרסת ה-MLX, בדוק את ה-endpoint המדויק שבו אתה מתכנן להשתמש לפני שאתה מסכן עליו את הלולאה.
מסלול B — mlx-lm, השליטה המרבית
ערכת הכלים של אפל. התקן אותה באמצעות pip install mlx-lm, ולאחר מכן או משוך checkpoint של MLX שעבר קוונטיזציה מראש, או המר את משקלי ה-BF16 הרשמיים בעצמך:
• mlx_lm.generate --model <checkpoint> — הפעל צ'קפוינט ישירות; קוונטים של 4-bit ו-8-bit של ה-27B מהקהילה עדיין נחתו ב-mlx-community תוך ימים מהשחרור.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — המר פעם אחת; עולה בערך כמו הורדה אחת.
• mlx_lm.server --model <checkpoint> — שרת תואם OpenAI שמחיל עבורך את תבנית הצ'אט של בלוק החשיבה.
אם ה-quant המדויק שאתה רוצה עוד לא עלה, ההמרה מה-weights הרשמיים היא עבודה קצרה על כל Mac מסדרת M ומסירה כל ספק לגבי מה שצד שלישי שלח.
נתיב C — LM Studio, הלחיצה האחת
LM Studio משתמש בקצה האחורי של MLX על Apple Silicon והוסיף את Qwen3.8 27B עם ההשקה: חפשו את המודל, בחרו quant שמתאים ל-RAM שלכם, והוא יוריד ויריץ. אם אתם מעדיפים ממשק גרפי (GUI), זה המסלול הידידותי ביותר, והמדריך המלווה שלנו מכסה אותו מההתחלה עד הסוף — ראו "How to Run Qwen3.8 27B Locally" במאמרים הנלווים למטה.
מלכודת התבנית
Qwen3.8 27B חושב כברירת מחדל, ובלוקי החשיבה מוצגים על ידי תבנית הצ'אט, לא על ידי ליבת המודל. בדיקות של צד שלישי ב-48 השעות הראשונות מציינות שהתבנית הרשמית עוטפת כל תגובה של עוזר בבלוק חשיבה — אפילו ריקה — ושבלולאות סוכן מרובות-סבבים הבלוקים מקוננים וההיסטוריה נחתכת, מה שנתפס כמו אמנזיה. לא מדובר בקוונטיזציה. אם סביבת ריצה כוללת תבנית מתוקנת, השתמש בה; כשאתה בונה לולאת סוכן ואין צורך בחשיבה, השבת את החשיבה לכל בקשה — תבנית הצ'אט חושפת דגל enable_thinking, והמודל מקבל reasoning_effort של xhigh, medium, או low.
איך זה באמת מרגיש
בדיקה עצמאית על Mac mini M4 עם 32 GB של זיכרון מאוחד, שהריצה את גרסת ה-MLX עם 4 סיביות, מדדה בערך 5–6 טוקנים/שנייה של יצירה. זה המספר שאמור להגדיר ציפיות: מצוין לכתיבת טיוטה אינטראקטיבית, חשיבה ארוכת טווח, וקריאות סוכן מזדמנות; כואב ללולאות סוכן ארוכות ולמשימות אצווה. האנקדוטה של אותו בודק — חשיבה של כמה דקות ואחריה יישום קטן שנראה נכון אבל לא באמת הסתדר — היא תזכורת טובה לכך ש-27B על מחשב נייד הוא עוזר מסוגל אך לא חסין מטעויות.
המהירות עולה בהתאם לדרגת השבב: M-series Max עם יותר רוחב פס זיכרון ויותר ליבות פועל מהר יותר באופן משמעותי מה-M4 הבסיסי ב-mini. אבל 5–6 tok/s בנקודת הכניסה הוא קו הבסיס הכנה, ולפיו עליך לשפוט כל כותרת "רץ על Apple Silicon".
ההקשר של 262K הוא תכונת שרת.
חלון ה-262K המקורי של Qwen3.8 27B הוא שימושי באמת — אבל ב-Mac הוא מוגבל על ידי הזיכרון, לא על ידי המודל. עם 64 KB של מטמון KV לכל טוקן, חלון של 8K עולה בערך 0.5 GB, 32K בערך 2 GB, 128K בערך 8 GB, ו-262K המלא בערך 16.4 GB בנוסף למשקלי המודל. במכונה עם 24 GB שרצה ב-4-bit, התקרה הריאלית היא בערך 64K–96K טוקנים; הגעה לכיוון 128K+ דורשת מכונה עם 32 GB+, והחלון המלא דורש מכונה שזיכרון מאוחד שלה הוא ברובו מטמון. תכנן את ההקשר שבאמת אתה צריך, וקבע מגבלה עליו בתצורת הריצה — המודל מרוצה, וקובץ ההחלפה שלך נשאר שקט.
כשאפל סיליקון היא התשובה הלא נכונה
קח נתיב אחר אם אחד מאלה הוא עומס העבודה שלך:
• יש לך Mac עם 8 GB או 16 GB. גרסת ה-4-bit כבר דורשת ~17 GB של זיכרון מאוחד; פחות מזה גורם להחלפה (swapping) והמודל הופך לבלתי שמיש. זו הטעות הנפוצה ביותר, ושום תחבולת קוונטיזציה לא פותרת אותה.
• אתה צריך את החלון המלא של 262K או את הרחבת YaRN של 1M. תקציב ה-KV הזה הוא תקציב של שרת, לא תקציב של מחשב נייד.
• אתה משרת אנשים אחרים. מחשב נייד הוא מושב אחד; תפוקה למשתמשים מרובים דורשת שרת GPU או API מתארח.
• צריך לנוע מהר בלולאות סוכן ארוכות. 5–6 tok/s מספיק לאדם שקורא תוך כדי, אבל איטי עבור תת-סוכן.
המסגור הכנה: ההצעה של Qwen3.8 27B היא שהוא חינמי בנקודת השימוש על חומרה שבבעלותך — ההפך ממודל API שגובה תשלום עבור כל טוקן. זו בדיוק הסיבה שהוא לא נמצא בקטלוג של OrcaRouter (הקטלוג מנתב את דור Qwen3.6/3.5-27B המוקדם יותר ואת קו ה-API המאוחסן של Qwen). אנחנו הכלי הלא נכון לסיפור של חינמי-מקומי, וזו בדיוק הנקודה: כשעומס עבודה חוצה את היכולות של מק, החלופות הן מארז GPU, GPU שכור, או API מאוחסן של Qwen — לא ראוטר שבמקרה נושא את ה-27B הספציפי הזה.
השורה התחתונה
Qwen3.8 27B על Apple Silicon הוא אמיתי, הוא טוב, וההיקף שלו מצומצם. גרסת ה-MLX ב-4-bit מתאימה ל-Mac עם 24 GB ומעלה, מורדת בשם qwen3.8:27b-mlx ב-Ollama, עולה אפס לכל טוקן, והיא מודל הקוד הפתוח הראשון ברמת סוכן שבאמת שמיש ויכול לרוץ על מחשב נייד. הפשרות הן מהירות (5–6 טוקנים לשנייה ב-M4 mini) וקונטקסט (תגבילו אותו הרבה מתחת ל-262K אלא אם יש לכם את הזיכרון). אם יש לכם Mac עם 24 GB ומעלה ועומס עבודה ש-27B יכול לסחוב, זה המודל המקומי החינמי הטוב ביותר הזמין השבוע. אם יש לכם Mac עם 16 GB או שאתם צריכים תפוקת ייצור, זה לא — והחלופה היא מסלול בתשלום, שהיא החלטה שונה לחלוטין.
