
Qwen 3.8 27B Uncensored GGUF: הבנייה המקומית שעברה Abliteration, 12 רמות קוונטיזציה, והגבול למחקר בלבד
- obsidianחדשQwen3.8 27B Uncensored (Aggressive)2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-1358 tok/s
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
Qwen 3.8 27B לא מצונזר GGUF הוא הורדה אמיתית, והגרסה שכדאי להתחיל איתה היא Qwen3.8-27B-Uncensored-GGUF — פורסם ב-Hugging Face ב-16 באוגוסט 2026 כגרסת האחות הילידית ל-llama.cpp של מהדורת ה-FP8 המאובליטר שלנו. מדובר באותם משקלים של 27 מיליארד פרמטרים ללא סירוב כמו Qwen3.8-27B-Uncensored-FP8, שהומרו ל-GGUF להסקה מקומית: F16 ועוד 12 רמות קוונטיזציה מ-Q2_K ועד Q8_0 (כולל קוונטי ה-imatrix IQ3_M ו-IQ4_XS), חלון הקשר של 262K, מקרן ראייה נפרד, וראש ניבוי ספקולטיבי MTP שלם. "לא מצונזר" פירושו מאובליטר — כיוון הסירוב הוצא מהמשקלים בתהליך אורתוגונליזציה — ולכן הוא יענה במקום שבו הבסיס המיושר מסרב, וזו בדיוק הסיבה שהוא מיועד למחקר בלבד. הנה מה שהמאגר בפועל מכיל, איזה קוונט מתאים ל-GPU שלך, איך להריץ אותו ב-llama.cpp, ואת גבול הבטיחות שאתה מקבל על ידי הורדתו.
גרסת 30 השניות: F16 ועוד 12 quants, Q4_K_M ב-16.8 GB היא הבחירה המועדפת, אתה צריך build של llama.cpp ממאי 2026 או חדש יותר, וזה כלי מחקר ללא הגנות — לא משהו לפרוס למשתמשי קצה.
מה הפירוש האמיתי של "GGUF לא מצונזר" — וכיצד גרסה זו שונה מגרסת FP8
GGUF הוא פורמט המודל בקובץ יחיד ש-llama.cpp משתמש בו; FP8 היא סכמת קוונטיזציה שרצה על שרתי GPU של vLLM. שתי ההוצאות הלא-מצונזרות שלנו הן אותם משקלים שעברו אבליטרציה בשתי סביבות ריצה. Qwen3.8-27B-Uncensored-FP8 (15 באוגוסט 2026) מיועד ל-vLLM על שרת, עם קוונטיזציה מחדש לסכימה הרשמית של Qwen3.8-27B-FP8 כך שהוא רץ על אותו נתיב קרנל. Qwen3.8-27B-Uncensored-GGUF (16 באוגוסט 2026) מיועד ל-llama.cpp על מכונה מקומית — ה-GPU השולחני או תחנת העבודה שבשליטתך. אותם משקלים, מודל פריסה שונה: API בענן לעומת תהליך מקומי.
Abliteration היא התערבות ברמת המשקולות, לא כוונון עדין (fine-tune). כיוון הסירוב הוא וקטור בזרם השיירי (residual stream) של המודל, שכאשר הוא מופעל, מפיק "I can't help with that"; הבנייה מוצאת את הכיוון הזה ומבצעת אורתוגונליזציה שלו מתוך המשקולות, על פי הגישה של Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). לא מאומנות משקולות חדשות. הבסיס הוא Qwen/Qwen3.8-27B — מודל צפוף (dense) בגודל 27B עם ארכיטקטורה היברידית (48 שכבות Gated DeltaNet של קשב לינארי ו-16 שכבות קשב מלא), ראייה מובנית (native vision), והקשר (context) של 262,144 טוקנים. הרישיון הוא Apache 2.0, העובר בירושה מהבסיס. שימו לב שהמאגר הרשמי של Qwen מפיץ רק קבצי BF16 בפורמט safetensors — אין GGUF רשמי של Qwen — ולכן כל GGUF לא מצונזר של מודל זה, כולל זה, הוא המרה של המשקולות הפתוחות.
סולם הקוונט — F16 בתוספת 12 דרגות
המאגר כולל F16 (54.6 GB בשני קבצים) ו-12 דרגות קוונטיזציה. הגדלים שלהלן הם גדלי הקבצים של המאגר עצמו, שנקראו ב-16 באוגוסט 2026; גדלי קבצי GGUF משתנים מעט מגרסה לגרסה.

• F16 — 54.6 GB (2 קבצים) — דיוק ייחוס
• Q8_0 — 29.0 GB — כמעט ללא אובדן, לכרטיסי מסך מתקדמים
• Q6_K — 22.4 GB — הנקודה המתוקה של יחס איכות-לג'יגה
• Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — איכות גבוהה בכרטיסים גדולים יותר
• Q4_K_M — 16.8 GB — ברירת המחדל המומלצת
• Q4_K_S — 15.8 GB
• IQ4_XS — 15.3 GB — הבחירה הטובה ביותר לביט נמוך (מכויל עם imatrix)
• Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — לכרטיסי 16 GB
• IQ3_M — 12.8 GB — טביעת רגל קטנה (מכויל imatrix)
• Q3_K_S — 12.3 GB
• Q2_K — 10.9 GB — קוונט ה-K הקטן ביותר, פשרה ניכרת באיכות
הנחיות חומרה: {{1}}Q4_K_M על כרטיס של 24 GB{{/1}} (RTX 4090 או RTX 3090); {{2}}IQ4_XS או Q3_K_M אם יש לכם 16 GB{{/2}}; {{3}}Q2_K רק אם אתם דחוסים ל-12 GB{{/3}}. מכיוון שהבסיס משתמש ב-hybrid Gated DeltaNet attention, מטמון ה-KV קטן — בערך 0.5 GB בהקשר של 8K — כך שאפשר לדחוף את החלון גבוה בהרבה מאשר מודל dense רגיל של 27B. הראייה מוסיפה קובץ נפרד אחד: מקרן ה-F16 הוא {{4}}931 MB{{/4}}. קיימת גם סדרת abliterated קהילתית של {{5}}9-quant{{/5}} לאותו בסיס; שלנו היא ההמרה של ה-abliteration המתועד של FP8, כשקוונטי ה-imatrix ומספרי ה-refusal-delta מכרטיס המודל נשמרים. {{6}}כל זה נשמר{{/6}}.
איך להריץ את זה ב-llama.cpp
שלושה שלבים. דרישה אחת לא מובנת מאליה: במאי 2026 נוספו ל-llama.cpp ארכיטקטורת qwen35 ותמיכת MTP, אז עדכנו ל-build מ-2026-05 ומעלה — buildים ישנים יותר לא יטעינו את הקבצים האלה (לפי ה-README של ה-repo).
1. הורד את המודל המכומת שבחרת ואת מקרן הראייה.המאגר מוגבל, לכן עליך להתחבר ל-Hugging Face ולקבל את התנאים תחילה — קריאת ה-README היא חלק מקבלת מהות המודל הזה.
huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc
2. הפעל את llama-server. זה מספק נקודת קצה תואמת OpenAI; -ngl 99/ מעביר את כל השכבות ל-GPU.
llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080
3. (אופציונלי) הפעל את ראש הפענוח הספקולטיבי של MTP. הוסף --spec-type draft-mtp/ — ראש ה-nextn מובנה בכל quant, כך שלא נדרש מודל draft נפרד.

ריצות מחקר עם טקסט בלבד יכולות להשמיט את --mmproj/; קלט תמונות צריך אותו, כי זה מודל שפה-ראייה ילידי. ה-endpoint הוא http://localhost:8080/v1/chat/completions, כך שכל קוד OpenAI SDK קיים עובד עם החלפת base-URL.
אין GPU? אותו קו לא מצונזר מתארח
GGUF מקומי אינו עולה דבר לכל טוקן, אך דורש כ-17 GB של VRAM עבור דרגת Q4_K_M. אם אין ברשותך החומרה, הכרטיס המארח obsidian/Qwen3.8-27B על OrcaRouter משרת את אותה סדרת 27B הלא־מצונזרת — ראייה, חשיבה, הקשר של 262K — במחיר של 0.40$ למיליון טוקני קלט ו-4.21$ למיליון טוקני פלט, כשהגישה מוגבלת לחוקרי אבטחה, לצוותי רד טים ולחוקרי בטיחות בינה מלאכותית. אותה משפחת משקלים, שתי סביבות ריצה: GGUF מקומית, FP8 בענן. החלטת המידרציה נשארת בצד שלך בכל מקרה.
גבול הבטיחות — קרא זאת לפני ההורדה
במודל זה הוסרה במידה ניכרת התאמת הבטיחות (safety alignment). הוא ייענה לבקשות מזיקות, לא אתיות, פוגעניות או בלתי חוקיות שהמודל הבסיסי Qwen3.8-27B היה מסרב להן, ואין בו מנגנוני הגנה מובנים משמעותיים. הוא משוחרר אך ורק למחקר לגיטימי — חקר פרשנות, חקר מנגנוני סירוב, רד-טימינג (red-teaming), הערכת חוסן ובדיקת מעקות בטיחות. אתה נושא באחריות מלאה ובחבות מלאה לשימוש שלך בו ולכל מה שהוא מייצר, ואסור לך לפרוס אותו למשתמשי קצה או לסביבת ייצור בלי להוסיף שכבות בטיחות, ניטור ומניעת ניצול משלך. המחברים אינם נושאים באחריות כלשהי. הרישיון הוא Apache 2.0.

ההתנהגות הנמדדת אומרת לך מה {{1}}לא מצונזר{{/1}} עולה. מסוויטת הערכת הבטיחות של כרטיס המודל — שהורצה על בניית ה-FP8 ומתוארכת ל-15 באוגוסט 2026, שהם המשקלים שה-GGUF הזה ממיר: סירוב להנחיות מזיקות יורד מ-64–99% במודל הבסיס ל-0–6% במשקלים ה-abliterated, סירוב יתר לתכנים תמימים יורד מ-5.6% ל-0.4%, וציוני היכולות נשארים בטווח של ±1.3 נקודות מהבסיס. המספרים האלה הם הסיבה שסוג מודל זה הוא אובייקט מחקר לגיטימי — והם גם האזהרה.
מאמר זה אינו מכיל במכוון הנחיות מזיקות. אם אתם מעריכים את המודל, הריצו את מבחני הסירוב הסטנדרטיים — AdvBench, HarmBench, StrongREJECT, XSTest-safe — וקראו את המספרים בעצמכם. זוהי הדרך הרשמית לחקור מודל נטול סירוב.
כשהבנייה הזו היא התשובה השגויה
1. אתה רוצה עוזר רגיל. מודל שגוי. אין לו מחסומי בטיחות והוא ייענה לבקשות מזיקות. השתמש ב-Qwen3.8-27B המיושר במקום.
2. כל דבר שהיית מציב בפני משתמשי קצה. מודל שגוי ללא קשר לכוונה. Apache 2.0 אינו מעביר את האחריות שלך, ומשלוח מודל ללא מעקות בטיחות למשתמשים אינו אסטרטגיית פריסה.
3. אתה על Apple Silicon. ה-GGUF ירוץ, אבל ההמרה ל-MLX של מודל הבסיס היא ההתאמה הטבעית יותר — ראו את המדריך הנפרד שלנו ל-MLX.
4. אתה לא רוצה להריץ אותו בכלל. השתמש בכרטיס המתארח — אותן משקולות, בלי 17 GB של VRAM, ואותו שער גישה למחקר בלבד.
השורה התחתונה
ל-"Qwen 3.8 27B uncensored GGUF" יש תשובה, וזו הורדה קונקרטית: Qwen3.8-27B-Uncensored-GGUF — F16 ועוד 12 רמות קוונטיזציה עבור llama.cpp, המשקלים המנוטרלים מה-build שלנו ב-FP8, חלון הקשר של 262K, ראייה ו-MTP, תחת רישיון Apache 2.0 ולשימוש מחקרי בלבד. בחרו ב-Q4_K_M על כרטיס של 24 GB, עדכנו את llama.cpp לגרסה מאוחרת ממאי 2026, והריצו אותו כשרת מקומי תואם OpenAI. זהו כלי מחקר לבחינת סירובים ובדיקת מעקות בטיחות — לא צ'אטבוט, ולא מוצר שמריצים לייצור. המשקלים ניתנים בחינם; האחריות למה שתעשו איתם מוטלת כולה עליכם.
למחקר לגיטימי, ה-F16 וכל 12 רמות הקוונטיזציה זמינים ב-Hugging Face: הורד את ה-GGUF מ-Hugging Face
