
Qwen3.8-27B-Uncensored-MLX על Apple Silicon: איך לבחור את הגרסה שלך, לטעון אותה ב-LM Studio או ב-mlx-vlm, ולאלף את הקונטקסט של 262K
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2658אינטליגנציה72כתיבת קוד
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
הדבר השימושי ביותר לדעת על orcarouter/Qwen3.8-27B-Uncensored-MLXהוא שאינך צריך לבחור תיקיית משנה כדי להפעיל אותו. הגרסה ה-abliterated של OrcaRouter ל-Apple-Silicon של Qwen/Qwen3.8-27B – שפורסמה ב-Hugging Face ב-17 באוגוסט 2026, כך שהיא לא חדשה, רק מתועדת פחות – שומרת עותק של גרסת ה-4-bit בשורש המאגר, במפורש כדי שכלים המתייחסים למאגר אחד כמודל אחד, ובראשם LM Studio, יטענו אותו ללא כל הגדרה. ההחלטה האחת הזו היא הסיבה שכרטיס זה משך כ-83,000 הורדות בחודש האחרון, בעוד שהמרות MLX דומות זוכות לשבריר מזה. כל דבר אחר בו הוא בחירה אמיתית: איזה מארבעת הדיוקים מתאים לזיכרון המאוחד של ה-Mac שלך, באיזה runner אתה משתמש, האם ראייה וקריאה לכלים (tool calling) שורדות ברוחב הסיביות שלך, והאם חלון ההקשר של 262,144 טוקנים שווה את מחירו על החומרה שלך. מדריך זה עובר על ההחלטות האלה לפי הסדר. זהו תיעוד first-party – הגדלים, הדיוקים ונתוני הנאמנות להלן הם של OrcaRouter עצמו, נמדדים על גרסה מדויקת זו, וכל מספר קהילתי מסומן ככזה.

מה בדיוק יש בריפו הזה
זהו build מסוג abliterated של Qwen/Qwen3.8-27B — מודל צפוף בגודל 27B עם תשומת לב היברידית (Gated DeltaNet linear attention plus full attention), בעל יכולת ראייה-שפה מולדת, עם שליטה בחשיבה, קריאה לכלים, ראש חיזוי רב-טוקני (MTP), וחלון הקשר של 262,144 טוקנים. Abliteration מסירה את התנהגות הסירוב של המודל על ידי אורתוגונליזציה של כיוון הסירוב מתוך זרם השיירים; אם זה חדש לך, המדריך שלנו לטכניקה הוא המקום הטוב יותר להתחיל בו מאשר העמוד הזה, שעוסק בהרצת ה-build, לא במתודה. המשקלים הם תחת Apache-2.0, שעברו בירושה ממודל הבסיס.
אל תבלבלו את המאגר הזה עם qwen-3-8-27b-mlx, שהוא אותו דגם בסיס בפורמט MLX ללא ה-abliteration. קוראים תופסים לעיתים קרובות אחד כשהתכוונו לשני: זהו ה-build המחקרי ללא סירוב; ההוא הוא ה-Qwen/Qwen3.8-27B הרגיל על Apple Silicon. בדקו את שם המאגר לפני שתבזבזו את זמן ההורדה.
פרט מבני אחד חשוב יותר ממה שהוא נראה: מגדל הראייה, כל הנורמות, וה-conv1d של תשומת הלב הליניארית נשארים ב-BF16, ורק השכבות הליניאריות של מודל השפה — כולל embed_tokens ו lm_head — עוברות קוונטיזציה. זו הסיבה שהבנת התמונות שורדת את הקוונטיזציה, וזו גם הסיבה שהגדלים על הדיסק להלן מעט גדולים יותר מהערכה נאיבית של "27B ב-N ביטים": חלק מהמודל לעולם לא נדחס.
ההחלטה: איזו גרסה מתאימה לאיזה מק

ארבעה דיוקים מגיעים כתיקיות משנה — 8-bit/, 6-bit/, 4-bit/, 2-bit/ — כולם הם קוונטיזציה אפינית של MLX בגודל קבוצה 64. גרסת ה-4-bit משוכפלת בנוסף בשורש המאגר. בחר קודם לפי הזיכרון המאוחד של ה-Mac שלך, ורק אחר כך לפי איכות:
• 8-bit — ~27.5 GB על הדיסק, דורש מק עם 64 GB (מכונה עם 32 GB יכולה לטעון אותו אבל משאירה מעט מקום לכל דבר אחר). נמדדה נאמנות קוסינוס מול מקור ה-BF16: 0.9997, למעשה כמעט ללא אובדן. בחרו בו כשהאיכות היא כל העניין והזיכרון בשפע.
• 6-bit — כ-22 ג"ב, מתאים למחשבי מק עם 24–32 ג"ב. נאמנות 0.9996, מצוינת. האיזון הטוב ביותר בין איכות לנפח עבור רוב בעלי מחשבי 48 ג"ב.
• 4-bit — ~15 GB, מתאים בנוחות ל-Mac של 24 GB. נאמנות 0.996, טובה מאוד. זוהי ברירת המחדל המומלצת שלנו, וזהו העותק בשורש המאגר מסיבה זו.
• 2-bit — כ-8.7 ג"ב, מתאים ל-Mac עם 16 ג"ב. נאמנות 0.92 וב-27B, מושפל מאוד: לולאות חזרה, טקסט מקושקש, קוד וסינית, ראייה חלקית. הכרטיס אומר זאת במפורש — לארכיון בלבד, לא לעבודה אמיתית. Mac עם 16 ג"ב יכול טכנית לטעון אותו; זה לא הופך אותו לשימושי.
גודל על הדיסק אינו מספר הזיכרון. המשקולות חייבות להיכנס לזיכרון מאוחד יחד עם macOS, מטמון ה-KV וזיכרונות החיץ של Metal, אז צריך להשאיר מרווח ראש. בדיקה קהילתית של גרסת ה-4-bit על Mac עם M1 Pro ו-32 GB מדדה כ-16 GB של משקולות על הדיסק, אבל שיא הסקה של 18.5–21.7 GB; בדיקות קהילתיות של גרסאות MLX ב-8-bit מדווחות על שיאים סביב 34–36 GB אפילו כשהמשקולות הן כ-29.5 GB. ההנחיה המעשית מאותה בדיקה קהילתית היא: 16 GB היא לא אופציה אמיתית עבור מודל 27B, 24 GB יכול לנסות 4-bit עם קונטקסט קצר, ו-32 GB היא נקודת הפתיחה הנוחה. המאמר שלנו על תכנון VRAM עובר על אותו חישוב עבור כל המשפחה.
מכיוון שהרישום ברמת המאגר מסתכם בכ-94 GB על פני כל רמות הדיוק, הורד רק את תיקיית המשנה שאתה צריך עם hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — תוך החלפה לדיוק שבחרת. עותק ה-4-bit הראשי הוא כפיל של תיקיית המשנה 4-bit, כך שלעולם אין צורך להוריד את שניהם.
נתיב ראשון — LM Studio, אפס תצורה
העותק הראשי של 4-bit קיים במפורש כדי ש-LM Studio יוכל להתייחס לכל המאגר כמודל אחד. חפשו את מזהה המודל, בחרו את רמת הדיוק הרצויה (העותק הראשי הוא 4-bit), והאפליקציה תטפל בשאר. שלוש נקודות תקיעה, כולן מהכרטיס שלנו, והן ההבדל כולו בין שזה עובד לבין שזה נכשל:

• המאגר מוגבל.הורדות אנונימיות מקבלות HTTP 401. קבל את התנאים בדף המודל, ולאחר מכן הדבק טוקן קריאה של Hugging Face לתוך Settings → Integrations → Hugging Face ב-LM Studio. דלג על כך והטעינה פשוט תיכשל.
• כבה קוונטיזציה של מטמון ה-KV. דגמי הראייה של MLX אינם תומכים בכך בארכיטקטורה זו, והטעינה נכשלת במהלך האתחול אם האפשרות מופעלת (מתועד כ-mlx-engine#286). זה ההיפך מההמלצה לגרסאות GGUF, שם קוונטיזציה של מטמון K/V מהווה חיסכון לגיטימי ב-VRAM — שני הפורמטים אינם ניתנים להחלפה כאן.
• עדכן את זמן הריצה. qwen3_5 תמיכת ארכיטקטורה הגיעה ל-mlx-vlm 0.6.x; זמן ריצה מיושן מצורף אינו יכול לטעון משקולות אלה כלל. התג 'Likely too large' של LM Studio, לעומת זאת, הוא רק אזהרת זיכרון RAM, לא שגיאה — התעלם ממנו אם הזיכרון המאוחד שלך עומד בהנחיות לעיל.
איזו רמת דיוק ב-LM Studio: 8-bit הוא כ-29.5 GB בדיסק ודורש Mac עם 64 GB; 6-bit הוא כ-22 GB ומתאים למחשב עם 48 GB; 4-bit בכ-16 GB הוא הבחירה הנכונה ב-Mac עם 32 GB. אם תרצו את המסלול של llama.cpp / Ollama על חומרה אחרת, המדריך שלנו להרצה מקומית של המודל הלא מצונזר מכסה את המסלול הזה בנפרד.
מסלול שני — mlx-vlm ו-mlx-lm מתוך תיקיית משנה
המסלול בשורת הפקודה נותן לך את הדיוק ישירות ושרת תואם OpenAI עבור כלי סוכנים. דרישות: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 ו-mlx ≥ 0.32; הקצה האחורי של Metal נבחר אוטומטית על Apple Silicon). לאחר הורדת תיקיית המשנה שלמעלה:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "הסבר הסתבכות קוונטית במשפט אחד." --max-tokens 256
הוסף --image path/to/image.png לצורך קלט חזותי, או הגש אותו:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
החזון שורד את הקוונטיזציה.
מכיוון שמגדל הראייה וה-conv1d נשארים ב-BF16, הבנת התמונה נשמרת ב-4/6/8-bit. בתמונת הבדיקה שלנו — צורות, צבעים, מיקום, רקע וטקסט בתוך התמונה — גרסאות ה-4/6/8-bit תיארו את הכול נכון; גרסת ה-2-bit הייתה חלקית בלבד. אם אתם בוחרים גרסה והראייה חשובה לכם, 4-bit הוא הנמוך ביותר שכדאי לרדת אליו. לא פרסמנו תפוקת ראייה ספציפית ל-Apple Silicon עבור הגרסה הזו, אז אל תסמכו על נתון tok/s עבורה אלא אם כן הוא מגיע מריצה מזוהה בשם על סוג השבבים שלכם.
מגדל הראייה השמור הוא גם חלק ממשטח הסיכון, וכדאי לומר זאת במפורש: מודל שעבר אבליטרציה שיכול גם לקרוא תמונות אינו בעיית בטיחות של טקסט בלבד.
קריאה לכלים ושימוש בסוכנים
קריאת כלים היא יכולת של מודל בסיס והיא שורדת את האבליטרציה, מה שהופך את הבנייה הזו לשימושית באמת עבור רד-טימינג של מערכות אייג'נטיות — ומסוכנת באמת אם מכוונים אותה לשירותים אמיתיים. ההתקנה הסטנדרטית היא mlx_lm.server נקודת הקצה שלמעלה, שכל סוכן תואם OpenAI יכול לגשת אליה. אם אתה בכל זאת מריץ אותה כסוכן, הבן מה הפעלת: מודל ללא סירוב, עם קריאת פונקציות והקשר של 262K, הוא פרופיל בטיחות שונה ממודל צ'אט, והמסגור של הכרטיס כ'מחקר בלבד' קיים בדיוק מהסיבה הזו.
ההקשר של 262K ומה הוא באמת עולה
הארכיטקטורה מעניקה למודל זה הקשר ארוך בעלות נמוכה במיוחד. קשב היברידי כאן פירושו 48 שכבות של קשב ליניארי (Gated DeltaNet) המשולבות עם 16 שכבות של קשב מלא, ורק 16 שכבות הקשב המלא נושאות מטמון KV קלאסי — שכבות הקשב הליניארי שומרות במקום זאת על מצב רקורסיבי קומפקטי. כך ש-262,144 אסימונים עולים פחות משמעותית ממה שהיו עולים על מודל 27B עם קשב מלא. זוהי עובדה מבנית לגבי המודל הבסיסי, לא הבטחה לגבי המק שלך.
בפועל, החלון הוא יכולת, לא דרגה חינמית. בדיקת קונטקסט ארוך קהילתית על M4 Max מדדה בערך 63 tok/s בקונטקסט קצר, שיורדת לכ-11 tok/s ב-31K אסימונים — הפענוח מתדרדר בחדות כשהמטמון מתמלא, והשהיית האסימון הראשון בהנחיות ארוכות מאוד היא בדרך כלל המחסום הגדול יותר מאשר תפוקה גולמית. מילוי מקדים ספקולטיבי ומבוסס-ANE משפר את ההזנה, לא את הפענוח. נתוני עלות ה-KV-cache שלנו עבור Apple-Silicon למבנה זה לא פורסמו; אם אתם צריכים מספרים קשיחים לחומרה שלכם, ההרצות הקהילתיות הן המקור המהימן, והקונצנזוס הקהילתי הוא להתייחס ל-262K המלא כאל דבר שפונים אליו במכוון, לא כברירת מחדל שמשאירים דולקת.
מהירות — מה בעצם נמדד
אנו מפרסמים נתון מהירות יחיד בדיוק עבור build זה, והוא אינו Apple Silicon: בערך 32–37 tok/s במצב יציב על H200 יחיד באמצעות ה-backend של MLX CUDA, מה שמאשר שהמשקולות רצות גם מחוץ ל-macOS. ב-Mac הכרטיס שלנו במתכוון לא מפרסם tok/s, כיוון שזה תלוי בשבב, בדיוק ובמריץ. מספרים שכדאי למתרגלים להכיר, כולם מסומנים ככאלה:
• בנייה מדויקת זו, 4-bit, M1 Pro 32 GB: ~8.7 tok/s יצירה ו-~41.7 tok/s prefill בריצה קצרה (בדיקת קהילה, אוגוסט 2026). שבב ישן יותר, אבל רף ריאלי.
• oMLX עם MTP מובנה על M4 Max, checkpoint רגיל שאינו abliterated: 53.3 tok/s לפרוזה ו-72.1 tok/s לקוד, עם כ-273.7 tok/s prefill ב-4K; decode גולמי ללא MTP ~24.6 tok/s. מדידה שנעשית בפועל על checkpoint וסביבת ריצה שונים, אז יש להתייחס אליה כאל חסם עליון שמשקולות abliterated עשויות להתקרב אליו, ולא כהבטחה.
• prefill עם dual-ANE של oMLX על M3 Ultra, עם גרסת abliterated של oQ4e-MTP: prefill מהיר יותר בכ-17.7% ב-16K ובכ-18.9% ב-32K, ו-decode דרך Lightning MTP עד לכ-75 tok/s ב-16K. האזהרות אמיתיות: זה משתמש בממשקי ריצה פרטיים של Apple ובמשקלי INT8 מקורבים, מוסיף בערך 4GB לזיכרון השיא, ומאריך את זמן טעינת המודל מכ-3.4 שניות לכ-28 שניות. זהו אופטימיזציה לקליטת פרומפט, לא מאיץ יצירה.
ראש MTP — האצה בחינם אם הראנר שלך תומך בכך
מבנה זה כולל את דראפטר חיזוי מרובה-הטוקנים של המודל הבסיסי בתיקיית המשנה mtp/ (ארכיטקטורת qwen3_5_mtp) וזה עובד עם כל דיוק ראשי. הקבלה היא ללא אובדן — עם פענוח חמדן (greedy decoding) הפלט זהה להרצה ללא הדראפטר — כך שזה האצה אמיתית ללא פגיעה באיכות כשהוא מופעל. שתי הערות הגדרה מהכרטיס שלנו: נדרש מבנה mlx-vlm הכולל את qwen3_5_mtp דראפטר (בענף main), ויש להעביר גם --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp וגם --draft-kind mtp. הגדרת mtp_enabled בלבד לא עושה כלום. אם הרץ שלך אינו תומך בדראפטר, הוא מתעלם ממנו והמודל רץ כרגיל — שום דבר לא נשבר.
בטיחות — קרא את זה לפני שאתה מריץ, לא אחרי.
כתב הוויתור של כרטיס המודל עצמו ישיר בצורה בלתי רגילה, והעמוד הזה לא מתכוון לרכך אותו. יישור הבטיחות של מבנה זה הוסר במידה ניכרת. הוא ייענה לבקשות מזיקות, לא אתיות, פוגעניות או בלתי חוקיות שהמודל הבסיסי Qwen/Qwen3.8-27B היה מסרב להן, ואין לו מנגנוני הגנה פנימיים משמעותיים. הוא משוחרר אך ורק למחקר לגיטימי — חקר פרשנות, בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג, הערכת חוסן וניסויים מבוקרים. אם זה לא מה שאתם עושים, זה המודל הלא נכון.
שתי אזהרות מהכרטיס ראויות להדגשה. ראשית, פריצות jailbreak ובדיקות בטיחות "מצליחות" בקלות על מודל abliterated, וזו איננה הערכת בטיחות שעברה — זוהי ההתנהגות הצפויה של מודל שכיוון הסירוב שלו הוסר. היעדר סירובים אינו ראיה לבטיחות. שנית, הראייה, קריאת הכלים וחלון ההקשר של 262K שנשמרו מרחיבים את משטח התקיפה להבנת תמונות ולשימוש סוכני: מודל לא-מצונזר שיכול לקרוא צילומי מסך ולהפעיל כלים מהווה סיכון רחב יותר מגרסה מוסרת-סירוב שמתפקדת כצ'אט בלבד. קוונטיזציה דלת-סיביות מוסיפה שכבה שלישית של חוסר יציבות — ברמת 2-bit, פלט מקושקש עלול אפילו להיחשב בטעות כסירוב, וזהו סוג מבלבל משלו של כשלון.
אתה נושא באחריות מלאה ובחבות מלאה לשימוש ולפלטים. רישיון Apache-2.0 עובר בירושה ממודל הבסיס ואינו משנה זאת: הוא מתיר שימוש; הוא אינו הופך את הפריסה שלך לבטוחה. כל מי שפורס זאת למשתמשי קצה, לקטינים או לכל סביבת ייצור חייב להוסיף תחילה שכבות מיתון, בטיחות ומניעת ניצול לרעה משלו, ולציית לחוק החל. עבור חוקרים שמפעילים זאת בפועל, מעקי הבטיחות המעשיים הם: סביבה מבודדת, רצוי לא מקוונת; כלי סוכן שאינם מכוונים לשירותים אמיתיים; ללא חשיפה למשתמשי קצה; ובדיקת הפלטים לפני שהם הולכים לכל מקום.
כשהמקומי אינו התשובה
{{1}}הלוקאליות היא עיקר העניין בבנייה הזו — המשקולות יושבות על הדיסק שלך, אין עלות פר-טוקן, ושום דבר לא יוצא מהמכונה.{{/1}} {{2}}אבל לוקאליות היא גם תקרה: זה עובד רק על Apple Silicon, אתה צריך לחיות עם איכות הקוונטיזציה, ואין יתירות אם המכונה עמוסה.{{/2}} {{3}}אם אתה צריך מודל מסוג 27B שאינו abliterated דרך API לעומס עבודה אמיתי, או שאתה רוצה לבצע A/B בין הבנייה הלוקאלית הזו לבין מודל מתארח עם אותן פרומפטים, זה הפער ששכבת ניתוב נועדה למלא.{{/3}} {{4}}OrcaRouter מאגדת 200+ מודלים תחת מפתח API אחד במחיר המחירון של הספק, עם failover אוטומטי ו-DSL לניתוב — הורדת מחיר של ספק נכנסת לתוקף אצלנו באותו היום שבו היא מתפרסמת, כי אנחנו מעבירים את מחיר המחירון כפי שהוא.{{/4}} {{5}}API אחד, אינטגרציה אחת, ואתה יכול להשוות מערך לוקאלי לא מוכח מול מודל מתארח בלי להקים חשבון שני.{{/5}} {{6}}אנחנו לא מארחים את בניית ה-MLX הזו — המשקולות הן לוקאליות בעיצובן — כך שה-API הוא המסלול המשלים, לא תחליף לו.{{/6}}
מדריך ההחלטות המהיר
• 16 GB Mac — בכנות, לא הדגם הזה. 2-bit מתאים ורק לארכיון; תילחם בזיכרון בכל מקרה. חפש מודל קטן יותר ללא צנזורה, או את ההמרה הקהילתית המעורבת של 3/6-bit שנבנתה למכונות עם 18–24 GB.
• 24 GB Mac — 4-bit, ושמור על הקשר קצר; אל תריץ ראייה והקשר ארוך בו-זמנית.
• מק עם 32 GB — 4-bit הוא הנקודה המתוקה; 6-bit אם שומרים על הקונטקסט מצומצם.
• 48 GB Mac — 6-bit עם מרווח ראש; 8-bit אם לא דוחקים את החלון.
• 64 GB ומעלה — 8-bit, כמעט ללא אובדן, והקשר של 262K בהישג יד, עם האזהרות הנ״ל.
זהו כל ה-runbook. המודל הוא מה-17 באוגוסט 2026, אלה לא חדשות השקה, וזה לא צריך להיות: 83,000 הורדות קרו כי אנשים רצו מדריך הדרכה, והעמוד הזה הוא אותו מדריך. התחילו בשורש ה-repo, טענו את ה-4-bit ב-LM Studio, ועזבו את ה-build הדיפולטיבי רק כשאתם יודעים במה אתם מוותרים תמורת האיכות. אם הגעתם מהצד של GGUF או FP8, המדריכים הקשורים מכסים את המסלולים האלה — מסגרת ההחלטה כאן זהה, מתמטיקת הקוונטיזציה לא.
לא עוד גרסה של המודל הזה — Qwen3.8-Flash-Next-Uncensored היא גרסה נפרדת: עברה אבליטרציה מ-Qwen3.8-Flash-Next, תצוגה מקדימה של תמהיל מומחים עם 176B מאוחסנים / 6B פעילים של ארכיטקטורת Qwen4. אותה טכניקת אבליטרציה, משקלים שונים, אוסף משלו.
כל שש גרסאות ה-27B — BF16, GGUF, MLX, FP8, INT8 ו-NVFP4 — נאספות באוסף Qwen3.8-27B-Uncensored ב-Hugging Face.
משקלים אלו נועדו להיות מקומיים בלבד. כדי שיהיה בסיס אירוח שניתן למדוד מולו את הגרסה ה-abliterated, Qwen3.8-27B מוגש ב-OrcaRouter במחיר המחירון של הספק ללא תוספת מחיר — הדגם המקורי, עם יישור הבטיחות על כנו.
