כרטיס גיבור למאמר 'Qwen3.8-Flash-Next-Uncensored: Run the Abliterated MoE on llama.cpp and Apple Silicon', המציג את הכותרת הראשית, את כותרת המשנה 'GGUF + MLX מקורי - עד 262K קונטקסט' ושלושה שבבי מפרט: 'מוגבל ב-Hugging Face', '13 כימות GGUF' ו'גרסת MLX של 6-bit'.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: הרצת ה-Abliterated MoE על llama.cpp ו-Apple Silicon

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

לפני שתורידו כל דבר: Qwen3.8-Flash-Next-Uncensored אינו Qwen3.8-27B-Uncensored. הם חולקים שם משפחה וטכניקת abliteration, אבל הם מודלים שונים ממהדורות משקל שונות, וכל פוסט קודם על "Qwen uncensored" בבלוג הזה עוסק ב-27B. הנושא כאן הוא הזוג שפרסם OrcaRouter ל-Hugging Face ב-26 באוגוסט 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF ו- orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — מבנים שעברו abliteration של Qwen3.8-Flash-Next, מודל mixture-of-experts מנותב של Alibaba עם 176B מאוחסנים / 6B פעילים, שמציג תצוגה מקדימה של ארכיטקטורת Qwen4. הכרזנו על השחרור כ-"GGUF + MLX מקורי, עד 262K קונטקסט," שמיועד לחוקרי אבטחה, לצוותי red team ו-blue team. המדריך הזה נכתב מתוך כרטיסי המודל שלנו: מה עושה הסרת הסירוב בתוך MoE מנותב, מה העלות בפועל של טענת ה-262K קונטקסט בזיכרון, כיצד לשרת את שני קווי הקבצים, ואיפה עומד קו המחקר. אם הגעתם לכאן כדי לקבל את המבוא ל-abliteration או את המתמטיקה של כימות 27B, הפוסטים הקודמים בסדרה הזו מכסים את אלה.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

ראשית, השער

שני המאגרים מוגבלים ב-Hugging Face (gated: auto). לא ניתן להוריד קבצים עד שתתחבר ותקבל את תנאי המאגר בכל ריפו — מאגרי ה-GGUF וה-MLX נושאים כל אחד שער משלו. זהו ההבדל המעשי ביותר מקו GGUF ללא גייט: שורת הפקודה הנאיבית 'just hf download' נכשלת עם שגיאת אימות לפני שהיא מורידה ולו בייט אחד. הזרימה היא:

• התחבר ל-Hugging Face (או הירשם) והתקן את huggingface_hub, ולאחר מכן הרץ את hf auth login פעם אחת כך שהטוקן שלך יישמר בדיסק.

פתח את orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF בדפדפן, קבל את התנאים, ואז חזור על כך עבור orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

מאותו רגע ואילך, hf download עם הטוקן המאומת שלך עובד כמו כל repo אחר. כל quant שמושך, ומשקלי ה-MLX, הם תוצר מחקר תחת Apache-2.0 — אותו רישיון כמו המודל הבסיסי — והשער הוא חלק מהעסקה: קריאת התנאים היא שלב ראשון בשימוש במודל.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

מה abliteration עושה ל-MoE מנותב

הטכניקה היא עריכת המשקלים בסגנון ארדיטי שכבר סיקרנו במקומות אחרים בבלוג הזה; החלק המעניין הוא מה היא עושה ספציפית לארכיטקטורה הזו. ב-27B הדחוס היו 131 מטריצות שיוריות. ב-Qwen3.8-Flash-Next-Uncensored כרטיס המודל של MLX מתעד שאבליטרציה הוחלה על 149 טנזורים כותבי-שיורי, והרכיבים שהופכים את המודל הזה למה שהוא — נתב ה-MoE, טבלת שיבוצי ה-n-gram בגודל 51B ומגדל הראייה — במפורש מעולם לא נגעו בהם.

ה"{{1}}מעולם לא נגעו{{/1}}" הזה הוא כל הסיפור עבור מודל מנותב. כל טוקן מפעיל 10 מתוך 512 מומחים; אין מומחה יחיד שאחראי על הסירוב. {{2}}התנהגות הסירוב שוכנת בזרם השארית (residual stream) שמרכיב את הפלט הסופי, וזה בדיוק הכיוון שהאורתוגונליזציה מסירה.{{/2}} אז הנתב (router) ממשיך לנתב את אותם מומחים, טבלת ה-n-gram ממשיכה לייצר את אותם embeddings, ומה שמשתנה הוא מה שהמודל אומר ברגע שהיטל הפלט (output projection) רץ. בדיקות כרטיס המודל GGUF שפורסמו מתארות את אופי השינוי כך: {{3}}ירידה בסירוב להנחיות מזיקות מ-64–100% במודל הבסיס לבערך 0–3.3% בגרסה זו, סירוב יתר של הנחיות תמימות קרוב ל-0%, וביצועים בטווח של ±2 נקודות מהבסיס בבדיקות בסגנון MMLU-Pro / GSM8K / CMMLU{{/3}}. {{4}}אלה המספרים של כרטיס המודל עצמו, מדווחים עצמית ולא שוכפלו באופן בלתי תלוי.{{/4}}

ראש MTP: קיים ב-MLX, הוסר ב-GGUF

Qwen3.8-Flash-Next כולל ראש ספקולטיבי של ניבוי רב-טוקני (multi-token-prediction) בגודל ~4B, ושתי הגרסאות חלוקות לגביו. מאגר ה-GGUF לא כולל אותו — הכרטיס מציין במפורש שהקבצים האלה אינם כוללים את ראש הטיוטה הספקולטיבית של MTP — מכיוון שתמיכת qwen4exp ב-llama.cpp עדיין לא מממשת MTP, ולכן הראש היה משקל מת בקובץ. גרסת ה-MLX משמרת אותו, כך שב-Apple Silicon עדיין מקבלים פענוח ספקולטיבי. התוצאה המעשית, שמאומתת על ידי מתרגלים שמפעילים את המודל הבסיסי: המסלול של llama.cpp בגרסת GGUF רץ כיום ללא פענוח ספקולטיבי, בעוד שהגדרה של SGLang עם MTP מכפילה יותר מפי שתיים את מהירות הפענוח על אותה מחלקת חומרה. אם llama.cpp אי פעם תוסיף תמיכה ב-MTP עבור qwen4exp, קו ה-GGUF יקבל האצה ללא עלות — אבל אל תקנו חומרה בציפייה שזה יקרה השבוע.

הטענה לגבי הקשר של 262K, וכמה עולה מטמון ה-KV

ההקשר המקורי הוא 262,144 טוקנים (ניתן להרחבה באמצעות YaRN לכיוון מיליון), והאילוץ שבאמת מכביד הוא הזיכרון. החדשות הטובות הן שהארכיטקטורה שומרת על מטמון KV קטן: מתוך 48 השכבות, 36 משתמשות בתשומת לב לינארית של Gated DeltaNet, אשר דוחסת את ההיסטוריה למצב רקורסיבי בגודל קבוע, ורק 12 השכבות עם תשומת לב מלאה נושאות מטמון KV קונבנציונלי שגדל עם אורך הרצף.

שתי נקודות נתונים שנמדדו על ידי הקהילה, שתיהן על המודל הבסיסי, מועברות ישירות. פריסת GGUF עם 4 כרטיסי RTX 3090 דיווחה על מעבר מ-65K ל-131K קונטקסט בתוספת של כ-0.78 GB לכרטיס של זיכרון KV בלבד, ודגם DGX Spark יחיד רץ עם קונטקסט מלא של 262K עם קובץ מסוג Q4, תוך שמירת המודל בזיכרון בכ-76.9 GB מתוך מאגר ה-128 GB שלו, על ידי הצמדת טבלת ה-n-gram ל-CPU ומיפוי הזיכרון (mmap) שלה מ-NVMe. שורת התקציב של כרטיס המודל GGUF עצמו היא: סך הכול = גודל הקובץ + מטמון KV + כ-0.9 GB של mmproj. המשמעות לבחירת הקוונטיזציה: ב-262K מטמון KV הוא סעיף משמעותי, אבל המשקולות (weights) הן הגורם הדומיננטי, ולכן אותו היגיון של VRAM תחילה ממדריך ה-27B GGUF תקף כאן — ההבדל הוא בגדלי הקבצים עצמם, שנעים בין IQ2_XXS בכ-52 GB לבין Q5_K_M בכ-125 GB.

קו ה-GGUF: 13 קוונטיזציות, קבצים מפוצלים, mmproj ו-build של llama.cpp

מאגר ה-GGUF מספק 13 רמות קוונטיזציה — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — כאשר קוונטי ה-IQ נבנים ממטריצת חשיבות על טקסט כיול באנגלית, סינית וקוד. כל קוונט הוא רב-חלקי, מפוצל באמצעות llama-gguf-split, לכן הורד את כל הסט של הקוונט וכיוון את הטוען לחלק ...-00001-of-000NN.gguf. אין רמת Q6_K, Q8_0 או F16, והסיבה היא מבנית ולא כלכלית: טבלת ההטמעות של n-gram (PLE) היא טנזור אחד גדול מכדי לעמוד במגבלת 50 GB לקובץ של Hugging Face ב-6-bit ומעלה, וטנזור GGUF יחיד אינו ניתן לחלוקה בין קבצים — לכן הקו מסתיים ב-Q5_K_M.

הקובץ האחר שאסור לדלג עליו הוא mmproj-...-F16.gguf, בגודל של כ־0.9 ג"ב: זהו מודל ראייה-שפה, ו-llama.cpp זקוק לפרויקטור עבור כל קלט תמונה. Qwen3.8-Flash-Next הוא רב-מודאלי, וכך גם ההידור הזה — ה-abliteration לא נוגע במגדל הראייה.

התמיכה ב-llama.cpp עדיין לא נמצאת ב-mainline. מזהה הארכיטקטורה הוא qwen4exp, ו-buildים סטנדרטיים נכשלים עם השגיאה "unknown architecture 'qwen4_exp'"; אתה צריך build מ-PR #27742 (הענף qwen4exp/qwen3.8-flash-next), מהודר עם היעדים llama-cli, llama-mtmd-cli, llama-server ו-llama-gguf-split. משם, אופן ההגשה הוא שרת llama.cpp הרגיל עם דגלים ספציפיים ל-Qwen, תוך שימוש בשם ה-quant מקובצי החלקים:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

הגדר את -c לכל אורך הקשר שתוכל; הדוגמה בכרטיס מתחילה ב-8192. חשיבה (Reasoning) מופעלת כברירת מחדל ומוחזרת ב-reasoning_content, וקריאה לכלים (tool calling) פועלת דרך נקודת הקצה התואמת ל-OpenAI. ערכי הדגימה שלמעלה הם ההמלצה של כרטיס המודל; משתמשים על המודל הבסיסי משתמשים ב-temp 0.7 / top-p 0.80 / top-k 20 עם קנס נוכחות של 1.5 במצב instruct שאינו חשיבה, ומכווננים את עומק החשיבה עם --chat-template-kwargs {"reasoning_effort":"medium"}.

ה-build של MLX על Apple Silicon

מאגר ה-MLX הוא הדרך הילידית ל-Apple Silicon: אותם משקלים, אותה הסרת סירובים, רץ בזמן ריצה של Metal. הוא כולל גרסת 4-bit כברירת מחדל (~163 GB), גרסת 6-bit שהוכרזה (~192 GB) ושכבת 8-bit (~221 GB), ומכיוון שמומחי ה-fused-3D וטבלת ה-n-gram נשמרים ברמת דיוק גבוהה יותר מהתווית הנומינלית, הדיוק האפקטיבי גבוה בהרבה מ-4-bit אחיד — הכרטיס מציין ~7.85 ביטים אפקטיביים למשקל עבור התווית "4-bit". זו הסיבה שגודל המאגר נראה גדול: טבלת ה-n-gram לא נדחסת כמו שקוואנטים קהילתיים דוחסים אותה.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

החומרה היא האילוץ המגביל. MLX רץ רק על Apple Silicon (Metal), וצריך זיכרון מאוחד עבור המשקלים — השורה בכרטיס המודל היא "Mac עם מספיק זיכרון מאוחד עבור המשקלים של 163 GB (לדוגמה M-series Ultra)". התייחס לדרגת ה-4-bit כמכונה ברמת 192 GB, ולגרסת ה-6-bit כרמת 256 GB. התגיות בכרטיס מתעדות את מכלול התכונות — qwen4_exp, MoE, MTP, function calling, vision-language — והוא מופעל דרך mlx-vlm עבור קלט תמונה. ראש הניבוי הספקולטיבי MTP כלול כאן, וזה היתרון השקט של גרסת ה-MLX על פני קו ה-GGUF.

נתיב הראייה, למי שמשתמשים בו

מכיוון שזה מודל שפה-ראייה, הנתיב הרב-מודלי הוא חלק מספר העבודה ולא תוספת.{{1}} ב-llama.cpp, קלט תמונה דורש גם את המקרן mmproj וגם build הכולל את llama-mtmd-cli / llama-server.{{2}} ב-MLX, מפעילים אותו עם mlx-vlm במקום מנהל ההתקן הטקסטואלי mlx-lm.{{3}} עבור צוותי red team, נתיב הראייה הוא המקום שבו נמצאת עבודת ההערכה המעניינת: מעקות בטיחות רב-מודליים, הזרקת prompt הנישאת בתוך תמונה, OCR נגד צילומי מסך של המערכות שלך, ותמונות אדוורסריות המכוונות לכל הצנרת.{{4}} מכיוון שה-abliteration מכסה את כל המודל ומשאיר את מגדל הראייה intact, תמונה שהייתה מעוררת סירוב בראש הטקסט פשוט נוחתת על מודל שאין בו התנהגות סירוב לפגוע בה.{{5}} כרטיס ה-GGUF אומר שראייה וקריאה לכלי בשיחות מרובות-שלבים אומתו על ה-build הזה;{{6}} אין ערכת הערכה נפרדת לראייה שפורסמה.{{7}}

לשם מה זה נועד, והיכן עובר הגבול

הגרסה הזו קיימת לסוג אחד של עבודה: הערכת מה שמודל ללא סירוב יכול לעשות, במטרה להבין ולהגן על מערכות. עבור צוות אדום, זה אומר לבדוק את מעקות הבטיחות שלך מול מודל שלא יסרב בנימוס — עמידות להזרקת הנחיות, תרחישי הוצאת מידע, ניצול לרעה של כלים, והפער בין "המודל הבסיסי מסרב" לבין "המודל למעשה אינו יכול לעשות זאת". הפער הזה הוא כל הערך המחקרי של גרסה שעברה אבליטרציה: הוא מגלה לך מה שכבת הסירוב הסתירה, וזה ההבדל בין אבטחה באמצעות מדיניות לאבטחה באמצעות יכולת. עבור צוות כחול, אותם משקלים הם קו הבסיס הסביר של היריב: אם גורם עוין יכול להוריד ולהריץ את זה, ההגנות שלך צריכות להחזיק מעמד מול מודל שעונה במקום מסרב. הערכות שנבנות עליה הן חסם תחתון למה שמודל מותאם אישית שמעולם לא עבר יישור יכול לעשות — התייחס אליהן ככאלה, לא כאל תקרה.

היו ברורים לגבי מה הסרת הסירובים משנה ומה אינה משנה. היא משנה את התנהגות הפלט — המודל כבר אינו מסרב — והיא אינה משנה את היכולת. אין ידע חדש, אין כישורים חדשים, אין כוח חישוב חדש; אותו אימון, אותן מגבלות על מה שהמודל יכול בפועל להפיק. מודל שעבר אבליטרציה אינו יכול להנדס תוכנות זדוניות שלא היה מסוגל להן קודם; הוא פשוט עונה במקום להתחמק, והפלטים שלו אינם אמיתיים יותר בשל היותם מתירים יותר. רצועת היכולת של ±2 נקודות בכרטיס וקריסת מספרי הסירובים הם אותה עובדה הנראית משני צדדים.

היכן שהקו עובר הוא הסכם המאגר הסגור, וזה לא נוסח תבניתי. שימוש לגיטימי: הערכת מערכות משלך, מחקר פגיעות ציבורי על מודלים, בניית הערכות זיהוי והגנה, חקר מנגנוני סירוב. לא לגיטימי: פריסה של זה כעוזר הפונה למשתמשים, יצירת תוכנות זדוניות או ניצול פרצות פעילים נגד מערכות שאינן בבעלותך או שאין לך הרשאה לבדוק, הונאה, חומרי נשק. רישיון Apache-2.0 והחוק החל הם הרצפה; השער הוא הסכם מטרת המחקר המפורש שמעליו. אם מקרה השימוש שלך הוא "לשחרר צ'אטבוט למשתמשים", זה לא המודל שלך — וזה בכוונה, לא בהשמטה.

כיצד להשיג את קו הבסיס המוגש

{{1}}המשקלים האלה הם מקומיים בלבד במכוון:{{/1}} {{2}}מטעני הבדיקה של צוות אדום לעולם לא אמורים לעבור דרך API של צד שלישי, ואירוח עצמי הוא כל העניין.{{/2}} {{3}}כשרוצים את קו הבסיס המצונזר והמסופק לשם השוואה{{/3}} — {{4}}ה-Qwen3.8-Flash של Alibaba ב-$0.16 למיליון אסימוני קלט ו-$0.47 למיליון אסימוני פלט{{/4}} — {{5}}OrcaRouter מנתב אותו במחיר המחירון של הספק עם 0% תוספת ו-failover אוטומטי, כך שכלי הערכה יכול לנוע בין הבסיס המסופק לבין הגרסה המקומית הלא-מצונזרת שלך עם מפתח אחד וללא חוזה שני.{{/5}} {{6}}המשקלים הפתוחים של Qwen3.8-Flash-Next עדיין לא בקטלוג שלנו;{{/6}} {{7}}כאשר סביבת ריצה שאנו מנתבים אליה תכיל אותם,{{/7}} {{8}}הם יגיעו לאותו מערך — מפתח אחד ומחיר מחירון.{{/8}}

התחל כאן

ב-{{1}}Mac עם זיכרון אחיד של 128 GB+{{/1}}, ה-{{2}}MLX build{{/2}} נותן לך MTP ו-vision במקום אחד — קבל את תנאי מאגר ה-MLX, משוך את המשקלים של 4-bit או 6-bit, והרץ אותם עם {{3}}mlx-vlm{{/3}}. על {{4}}NVIDIA, AMD או מכונת CPU{{/4}}, בנה {{5}}llama.cpp מ-PR #27742{{/5}}, קבל את {{6}}תנאי מאגר ה-GGUF{{/6}}, משוך קוונטיזציה שמתאימה, ואל תשכח את {{7}}קובץ ה-mmproj{{/7}}. בשני המקרים, מספרי הסירוב וטווח היכולות הם של המאגר עצמו, מפורסמים בכרטיס המאגר ולא אומתו באופן בלתי תלוי נכון למועד כתיבת שורות אלה — הדרך הכנה לקרוא אותם היא כמדידה של הספק את העריכה שלו עצמו, לא כביקורת עצמאית. השער, הרישיון וגבול הבטיחות שלמעלה הם אותו טקסט משלוש זוויות: זהו מכשיר מחקר, והוא משוחרר על תנאי זה.

כל חמשת מבני ה-Flash-Next — BF16, GGUF, MLX, FP8 ו-NVFP4 — מרוכזים בתוךאוסף Qwen3.8-Flash-Next-Uncensored ב-Hugging Face.

אין לבלבל עם משפחת ה-27B: Qwen3.8-27B-Uncensored הוא מודל שונה שעבר אבליטרציה מבסיס שונה, עם אוסף משלו ו-runbooks משלו. אותה טכניקה, משקלים שונים.

המשקלים הללו הם מקומיים בלבד בעיצובם. עבור קו בסיס מתארח כדי למדוד מולו את הגרסה שעברה abliteration, Qwen3.8-Flash מוגש ב-OrcaRouter במחיר המחירון של הספק עם 0% תוספת — המודל הרגיל, עם יישור הבטיחות על כנו.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube