כרטיס כותרת עבור Qwen3.8-27B עם MLX על Apple Silicon, המציג אייקון מחשב נייד מינימליסטי עם תג מנוע MLX ותג מחיר שעליו כתוב 'חינם', על ה-Mac שלך.
Guides & Insights

Qwen3.8-27B עם MLX על Apple Silicon: כן, זה רץ — הנה מה שבאמת צריך

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Qwen3.8 27B פועל על Apple Silicon כיום דרך MLX. התג הוא qwen3.8:27b-mlx ב-Ollama, נוסף ב-Ollama v0.32.12, והגרסה עם דיוק 4-bit מורדת כ-18 GB וצריכה בערך 16–19 GB של זיכרון מאוחד — מה שהופך מק עם 24 GB+ לרף הריאלי ומק עם 16 GB לבלתי אפשרי. המשקלים הם ברישיון Apache 2.0, חינם לשימוש על חומרה שבבעלותך, וזו כל המהות של המודל. השחרור של Ali​baba הוא בן יומיים (13–14 באוגוסט 2026), כך שכל מספר למטה מסומן: מה שמגיע מכרטיס המודל של Ali​baba, מה שאימתנו בעמוד Ollama היום, ומה שמקורו בהערכה או מדידה של צד שלישי.

גיליון העובדות של 30 שניות

Qwen3.8 27B הוא המודל הצפוף של Ali​baba עם 27 מיליארד פרמטרים, ששוחרר ב-13–14 באוגוסט 2026 תחת Apache 2.0 — המשקולות הגיעו ל-Hugging Face ול-ModelScope ב-13, וקובץ ה-LICENSE הופיע למחרת בבוקר. זהו האח הצפוף הניתן לפריסה של Qwen3.8-Max עם 2.4 טריליון פרמטרים. לפי כרטיס המודל, כל הדיווחים של Ali​baba שטרם שוחזרו באופן עצמאי:

גודל — 27B דחוס, 27.78B פרמטרים סה"כ כולל מקודד הראייה.

ארכיטקטורה — 64 שכבות, גודל חבוי 5,120, אוצר מילים 248,320.

תשומת לב היברידית — 16 שכבות תשומת לב מלאות ועוד 48 שכבות לינאריות של Gated DeltaNet, ביחס של 3:1.

הקשר — 262,144 טוקנים במקור, ניתן להרחבה ל-1M באמצעות YaRN (Ollama מציין את התג ב-256K).

קלט — הבנה מובנית של תמונות ווידאו על גבי טקסט, ממסמכים ועד וידאו באורך שעות.

משקלים — 55.6 GB ב-BF16, כולל ראש פענוח ספקולטיבי MTP.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

בצד ה-MLX, אומת היום: Ollama משחררת את qwen3.8:27b-mlx — build מקורי של MLX עבור Apple Silicon בהורדה של כ-18 GB ב-4-bit — והערות הגרסה v0.32.12 מציינות אופטימיזציה ל-Apple Silicon. mlx-lm, ערכת הכלים הפייתונית של אפל, תומכת בארכיטקטורה לייצור והמרה, והקוונטיזציות של MLX (3/5/6-bit, בנוסף ל-MXFP4 ול-NVFP4) הופיעו תוך שעות מהפרסום של המשקלים. שאר המאמר מניח Mac מסדרת M עם זיכרון מאוחד של 24 GB או יותר.

מה MLX משנה לגבי זיכרון

ב-Apple Silicon אין VRAM נפרד. MLX פועל על מאגר הזיכרון המאוחד של סדרת M, כך שהמספר שחשוב הוא סך ה-RAM ב-Mac שלך פחות מה ש-macOS וכל השאר תופסים. מודל ש"נכנס ב-17 GB" דורש מכונה עם יותר מזה בנוחות.

החדשות הטובות הן ש-Qwen3.8 27B זול יותר להחזקה ממה שמצביע ספירת הפרמטרים שלו. מכיוון שרק 16 שכבות הקשב המלאות שומרות מטמון KV — 48 השכבות הליניאריות לא — עלות המטמון היא כ-64 קילו-בייט לכל טוקן, בערך רבע ממה שמשלם מודל צפוף רגיל עם 64 שכבות. בקצה הרחוק, חלון 262K המלא דורש כ-16.4 ג'יגה-בייט של מטמון בנוסף למשקלים, וזה תקציב של שרת, לא תקציב של מחשב נייד.

{{1}}הסולם הריאלי ל-Mac, גודל קובץ פלוס מרווח מטמון:{{/1}}

4-ביט MLX — ~16–19 GB בסך הכול. מתאים ל-Mac עם 24 GB ועם חלון של בערך 64K–96K; ברירת המחדל הסבירה.

6-bit MLX — ~21–22 GB. למחשבים עם 32 GB; קפיצת האיכות לעומת 4-bit מתונה.

8-bit MLX — ~27–30 ג"ב. מחשבים עם 48 ג"ב ומעלה; כמעט ללא אובדן.

BF16 — כ-55.6 GB. רק מכונות הסטודיו מהדרג הגבוה ביותר בסדרת M – Max ו-Ultra.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

מקורות: נתון ה-4-bit עוקב אחרי ה-GGUF Q4_K_M הנמדד (17.1 GB, unsloth, 14 באוגוסט) ואחרי הורדת ה-Ollama בנפח 18 GB; נתוני ה-8-bit וה-BF16 עוקבים אחרי כרטיס ה-BF16 של Ali​baba עצמו ואחרי שושלת Qwen3.6-27B. נתון המטמון של 64 KB לכל טוקן נגזר מהארכיטקטורה, אינו מודפס בגיליון מפרטים, ותקף רק עבור סביבות ריצה שמדלגות על מטמון ה-KV בשכבות הלינאריות כפי ש-MLX עושה.

שלוש דרכים להפעיל אותו, מהפשוטה ביותר ועד לשליטה המרבית

מסלול A — Ollama, הפשוט ביותר

שדרג ל-Ollama 0.32.12 או לגרסה חדשה יותר, ואז:

ollama pull qwen3.8:27b-mlx — מוריד את גרסת ה-MLX בנפח ~18 ג"ב.

ollama run qwen3.8:27b-mlx — צ'אט אינטראקטיבי עם תבנית החשיבה מחוברת.

ollama serve — חושף את ה-API התואם ל-OpenAI ב-localhost:11434 עבור האפליקציות שלך.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

בעיה ידועה אחת, מתוך issue פעיל ב-GitHub נכון לכתיבת שורות אלה: qwen3.8:27b-mlx דוחה את התפקיד "developer" ב-endpoint /v1/responses, מה ששובר את הפקודה ollama launch codex עבור המודל הזה — בעוד שהפקודה הישירה ollama run עובדת כראוי. אם אתה בונה לולאת סוכן בסגנון Codex על גרסת ה-MLX, בדוק את ה-endpoint המדויק שבו אתה מתכנן להשתמש לפני שאתה מסכן עליו את הלולאה.

מסלול B — mlx-lm, השליטה המרבית

ערכת הכלים של אפל. התקן אותה באמצעות pip install mlx-lm, ולאחר מכן או משוך checkpoint של MLX שעבר קוונטיזציה מראש, או המר את משקלי ה-BF16 הרשמיים בעצמך:

mlx_lm.generate --model <checkpoint> — הפעל צ'קפוינט ישירות; קוונטים של 4-bit ו-8-bit של ה-27B מהקהילה עדיין נחתו ב-mlx-community תוך ימים מהשחרור.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — המר פעם אחת; עולה בערך כמו הורדה אחת.

mlx_lm.server --model <checkpoint> — שרת תואם O​penAI שמחיל עבורך את תבנית הצ'אט של בלוק החשיבה.

אם ה-quant המדויק שאתה רוצה עוד לא עלה, ההמרה מה-weights הרשמיים היא עבודה קצרה על כל Mac מסדרת M ומסירה כל ספק לגבי מה שצד שלישי שלח.

נתיב C — LM Studio, הלחיצה האחת

LM Studio משתמש בקצה האחורי של MLX על Apple Silicon והוסיף את Qwen3.8 27B עם ההשקה: חפשו את המודל, בחרו quant שמתאים ל-RAM שלכם, והוא יוריד ויריץ. אם אתם מעדיפים ממשק גרפי (GUI), זה המסלול הידידותי ביותר, והמדריך המלווה שלנו מכסה אותו מההתחלה עד הסוף — ראו "How to Run Qwen3.8 27B Locally" במאמרים הנלווים למטה.

מלכודת התבנית

Qwen3.8 27B חושב כברירת מחדל, ובלוקי החשיבה מוצגים על ידי תבנית הצ'אט, לא על ידי ליבת המודל. בדיקות של צד שלישי ב-48 השעות הראשונות מציינות שהתבנית הרשמית עוטפת כל תגובה של עוזר בבלוק חשיבה — אפילו ריקה — ושבלולאות סוכן מרובות-סבבים הבלוקים מקוננים וההיסטוריה נחתכת, מה שנתפס כמו אמנזיה. לא מדובר בקוונטיזציה. אם סביבת ריצה כוללת תבנית מתוקנת, השתמש בה; כשאתה בונה לולאת סוכן ואין צורך בחשיבה, השבת את החשיבה לכל בקשה — תבנית הצ'אט חושפת דגל enable_thinking, והמודל מקבל reasoning_effort של xhigh, medium, או low.

איך זה באמת מרגיש

בדיקה עצמאית על Mac mini M4 עם 32 GB של זיכרון מאוחד, שהריצה את גרסת ה-MLX עם 4 סיביות, מדדה בערך 5–6 טוקנים/שנייה של יצירה. זה המספר שאמור להגדיר ציפיות: מצוין לכתיבת טיוטה אינטראקטיבית, חשיבה ארוכת טווח, וקריאות סוכן מזדמנות; כואב ללולאות סוכן ארוכות ולמשימות אצווה. האנקדוטה של אותו בודק — חשיבה של כמה דקות ואחריה יישום קטן שנראה נכון אבל לא באמת הסתדר — היא תזכורת טובה לכך ש-27B על מחשב נייד הוא עוזר מסוגל אך לא חסין מטעויות.

המהירות עולה בהתאם לדרגת השבב: M-series Max עם יותר רוחב פס זיכרון ויותר ליבות פועל מהר יותר באופן משמעותי מה-M4 הבסיסי ב-mini. אבל 5–6 tok/s בנקודת הכניסה הוא קו הבסיס הכנה, ולפיו עליך לשפוט כל כותרת "רץ על Apple Silicon".

ההקשר של 262K הוא תכונת שרת.

חלון ה-262K המקורי של Qwen3.8 27B הוא שימושי באמת — אבל ב-Mac הוא מוגבל על ידי הזיכרון, לא על ידי המודל. עם 64 KB של מטמון KV לכל טוקן, חלון של 8K עולה בערך 0.5 GB, 32K בערך 2 GB, 128K בערך 8 GB, ו-262K המלא בערך 16.4 GB בנוסף למשקלי המודל. במכונה עם 24 GB שרצה ב-4-bit, התקרה הריאלית היא בערך 64K–96K טוקנים; הגעה לכיוון 128K+ דורשת מכונה עם 32 GB+, והחלון המלא דורש מכונה שזיכרון מאוחד שלה הוא ברובו מטמון. תכנן את ההקשר שבאמת אתה צריך, וקבע מגבלה עליו בתצורת הריצה — המודל מרוצה, וקובץ ההחלפה שלך נשאר שקט.

כשאפל סיליקון היא התשובה הלא נכונה

קח נתיב אחר אם אחד מאלה הוא עומס העבודה שלך:

• יש לך Mac עם 8 GB או 16 GB. גרסת ה-4-bit כבר דורשת ~17 GB של זיכרון מאוחד; פחות מזה גורם להחלפה (swapping) והמודל הופך לבלתי שמיש. זו הטעות הנפוצה ביותר, ושום תחבולת קוונטיזציה לא פותרת אותה.

• אתה צריך את החלון המלא של 262K או את הרחבת YaRN של 1M. תקציב ה-KV הזה הוא תקציב של שרת, לא תקציב של מחשב נייד.

• אתה משרת אנשים אחרים. מחשב נייד הוא מושב אחד; תפוקה למשתמשים מרובים דורשת שרת GPU או API מתארח.

• צריך לנוע מהר בלולאות סוכן ארוכות. 5–6 tok/s מספיק לאדם שקורא תוך כדי, אבל איטי עבור תת-סוכן.

המסגור הכנה: ההצעה של Qwen3.8 27B היא שהוא חינמי בנקודת השימוש על חומרה שבבעלותך — ההפך ממודל API שגובה תשלום עבור כל טוקן. זו בדיוק הסיבה שהוא לא נמצא בקטלוג של OrcaRouter (הקטלוג מנתב את דור Qwen3.6/3.5-27B המוקדם יותר ואת קו ה-API המאוחסן של Qwe​n). אנחנו הכלי הלא נכון לסיפור של חינמי-מקומי, וזו בדיוק הנקודה: כשעומס עבודה חוצה את היכולות של מק, החלופות הן מארז GPU, GPU שכור, או API מאוחסן של Qwe​n — לא ראוטר שבמקרה נושא את ה-27B הספציפי הזה.

השורה התחתונה

Qwen3.8 27B על Apple Silicon הוא אמיתי, הוא טוב, וההיקף שלו מצומצם. גרסת ה-MLX ב-4-bit מתאימה ל-Mac עם 24 GB ומעלה, מורדת בשם qwen3.8:27b-mlx ב-Ollama, עולה אפס לכל טוקן, והיא מודל הקוד הפתוח הראשון ברמת סוכן שבאמת שמיש ויכול לרוץ על מחשב נייד. הפשרות הן מהירות (5–6 טוקנים לשנייה ב-M4 mini) וקונטקסט (תגבילו אותו הרבה מתחת ל-262K אלא אם יש לכם את הזיכרון). אם יש לכם Mac עם 24 GB ומעלה ועומס עבודה ש-27B יכול לסחוב, זה המודל המקומי החינמי הטוב ביותר הזמין השבוע. אם יש לכם Mac עם 16 GB או שאתם צריכים תפוקת ייצור, זה לא — והחלופה היא מסלול בתשלום, שהיא החלטה שונה לחלוטין.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube