
כיצד להריץ את Qwen3.8-27B-Uncensored מקומית: GGUF Quants, llama.cpp ו-Ollama
- DeepSeekחדשDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.32026-08-1860אינטליגנציה75כתיבת קוד
- obsidianחדשQwen3.8 27B2026-08-1552אינטליגנציה68כתיבת קוד
- qwenחדשQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekחדשDeepSeek: DeepSeek V4 Pro 08132026-08-1253אינטליגנציה69כתיבת קוד
- grokחדשSpaceXAI: Grok 4.62026-08-1261אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
כדי להריץ את Qwen3.8-27B-Uncensored מקומית, משוך את מאגר ה-GGUF המאובטח orcarouter/Qwen3.8-27B-Uncensored-GGUF מ-Hugging Face, בחר קוונטיזציה לפי ה-VRAM שלך — Q4_K_M (16.8 GB) לכרטיס GPU של 24 GB, IQ4_XS (15.3 GB) לכרטיס GPU של 16 GB, Q3_K_M (13.5 GB) כשאתה רוצה מרווח קונטקסט — והגש אותו עם build עדכני של llama.cpp באמצעות הדגל --jinja, והוסף --mmproj אם אתה צריך יכולות ראייה. אותו קובץ מיובא ל-Ollama בשלוש פקודות. זוהי גרסת ה-GGUF של build ה-abliterated של Qwen3.8 27B, ששוחרר ב-16 באוגוסט 2026, עם קונטקסט מקורי של 262K, מקרן הראייה וראש הניבוי הספקולטיבי MTP משומרים בכל קוונטיזציה. זהו כלי מחקר, לא עוזר: התנהגות הסירוב הוסרה ממנו, הוא אינו נושא מעקות בטיחות מובנים, והרישיון הוא Apache 2.0. קרא את גבול הבטיחות בתחתית עמוד זה לפני ההורדה — זו הנקודה של המאגר המאובטח.
איזה GGUF להוריד לפי VRAM
המאגר כולל זוג אחד בדיוק מלא ושנים-עשר קבצים מקוונטטים, כך שהחלטת ההורדה היא למעשה החלטת VRAM. המספרים שלהלן הם גדלי הקבצים שנקראו ממאגר Hugging Face ב-2026-08-16.

מה בעצם יש במאגר
orcarouter/Qwen3.8-27B-Uncensored-GGUF מכיל חמישה עשר קבצי מודל: משקלי F16 המפוצלים לשני חלקים, שנים-עשר קבצי GGUF מכומתים — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M ו-IQ4_XS — ומקרן הראייה mmproj. הוא יצוא GGUF של אותה גרסה מסורסת כמו Qwen3.8-27B-Uncensored-FP8, ארוז מחדש עבור סביבות ריצה מקומיות מסוג llama.cpp, והוא יורש את רישיון Apache 2.0 של המודל הבסיסי ואת חלון ההקשר המקורי של 262,144 אסימונים.
שלוש תכונות משותפות לכל קוונט. הארכיטקטורה היא qwen35 — תשומת לב היברידית עם 48 שכבות לינאריות מסוג Gated DeltaNet ו-16 שכבות תשומת לב מלאה — וזו הסיבה שהמאגר מסרב להיטען בגרסאות ישנות יותר של llama.cpp ומדוע מטמון ה-KV נשאר קטן. ראש ה-MTP (nextn) לפענוח ספקולטיבי נשמר בכל הקוונטים, K-quant ו-IQ כאחד. ותבנית הצ׳אט היא תבנית ה-Qwen Jinja, שעליך להפעיל במפורש (ראה להלן) או ששיחות מרובות-סבבים יישברו.
מדוע מטמון ה-KV נשאר קטן מספיק כדי להיות משמעותי
זהו הפרט שגורם לסיפור המקומי לעבוד. מתוך 64 השכבות, רק 16 משתמשות בתשומת לב מלאה; 48 האחרות משתמשות בתשומת לב לינארית מסוג Gated DeltaNet, שאינה שומרת מטמון KV קונבנציונלי. ההשפעה המעשית, שנמדדה ב-Runbook המקורי עבור ארכיטקטורה זו, היא מטמון KV של בערך 2 GB בהקשר של 32K — בערך רבע ממה שמודל 27B קונבנציונלי היה צריך. זו הסיבה שקובץ Q4_K_M בנפח 16.8 GB עדיין נכנס לכרטיס של 24 GB עם חלון הקשר ארוך, ומדוע סדרת ה-GGUF הלא מצונזרת ניתנת להפעלה על חומרה שלא הייתה יכולה להכיל כלל את ה-checkpoint של BF16 בנפח 55.6 GB.
הרץ את זה עם llama.cpp
llama.cpp הוא המסלול המיועד. אתה צריך build עדכני: ה‑trunk רושם את ארכיטקטורת qwen35, ו‑builds ישנים יותר דוחים את הקובץ לחלוטין. צורת הפקודה, לפי הערות השימוש בכרטיס המודל ומדריך ההפעלה של ארכיטקטורה זו, היא:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
זה נותן לך נקודת קצה תואמת OpenAI ב-localhost:8080. להוספת תמונות, הוסף --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. החלף את Q4_K_M בקוונטיזציה התואמת ל-VRAM שלך; הדגלים זהים.
הרץ את זה עם Ollama
אולמה מריץ את אותו קובץ על ידי ייבואו מ-Modelfile, שהיא הדרך הנתמכת להוספת GGUF שאינו בספרייה. בתיקייה המכילה את ה-quant שהורדת:
./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
שמור את השורה הזו כקובץ Modelfile, לאחר מכן ollama create qwen3.8-27b-uncensored -f Modelfile ו ollama run qwen3.8-27b-uncensored. עבור ראייה, הוסף את שורת mmproj לקובץ Modelfile (מ- FROM ... Q4_K_M.gguf בתוספת נתיב mmproj) ו-Ollama מחבר את המקרן. אותן אזהרות --ctx ו-template חלות: הגדר את גודל ההקשר שאתה יכול בפועל להכיל, וזכור שמודל שהוסרו ממנו סירובים עונה ללא גדר מגן בינך לבין הפלט.
מה שהסרת הסירוב שינתה בפועל
כרטיס המודל מפרסם ערכת הערכת בטיחות עבור build זה. כשהחשיבה כבויה, שיעור הסירוב במדדים הסטנדרטיים להנחיות מזיקות יורד מ-64–99% במודל הבסיס ל-0–6% במשקלים שעברו אבליטרציה; כשהחשיבה פועלת הוא כמעט אף פעם לא מסרב — 1.7% או פחות. מדדי היכולות נשארים בטווח של ±1.3 נקודות מהמודל הבסיסי. כך נראה כל שחרור שעבר אבליטרציה בקו הזה: סירובים הוסרו, יכולות נותרו על כנן, וההסתייגות שחלק נכבד מהתשובות עדיין מקדים הצהרה קצרה לפני המענה — תוצר לוואי של האימון, לא סירוב.
הצד השני הוא כל העניין בגבול הבטיחות שלהלן: מודל שמעולם לא מסרב אינו עוזר טוב יותר; הוא סוג אחר של עצם. הוא כלי בדיקה למדידת מנגנוני סירוב ולגילוי האם מעקה הבטיחות שלך עובד.
מה בעצם עושים עם זה במחקר
שלושה פרויקטים לגיטימיים שהם השימוש המורשה במודל נטול סירובים:
כשהבנייה הזו היא התשובה השגויה
אם אתה רוצה עוזר רגיל, או כל דבר שהיית מציב מול משתמשי קצה, זה הדגם הלא נכון — אין לו מעקות בטיחות מובנים משמעותיים, הוא ייענה לבקשות שהדגם הבסיסי מסרב להן, ו-Apache 2.0 אינו מעביר את האחריות ממך. השתמש ב-Qwen3.8-27B המקורי המכוונן למטרה זו. אם אתה רוצה להסיט סירובים בצ'אטבוט, חבילת system-prompt משיגה יותר עם פחות סיכון מעריכת משקלים. ואם אין לך GPU בכלל אבל עדיין רוצה לחקור את הדגם, הכרטיס המתארח obsidian/Qwen3.8-27B ב-OrcaRouter משרת את אותו קו לא מצונזר ב-$0.40 למיליון אסימוני קלט ו-$4.21 למיליון אסימוני פלט עם אותו חלון הקשר של 262K; הוא מוגבל לחוקרי אבטחה ובטיחות ב-AI באותה דרך שבה המאגר מוגבל, והחלטת המודרציה עדיין נשארת בצד שלך. כרטיס הדגם מכיל את פרטי התמחור והמדדים.
גבול הבטיחות — קרא זאת לפני ההורדה

יישור הבטיחות של המודל הזה {{1}}הוסר באופן מהותי{{/1}}. הוא ייענה לבקשות {{2}}מזיקות, לא אתיות, פוגעניות או בלתי חוקיות{{/2}} שהמודל Qwen3.8-27B המקורי היה מסרב להן, ואין לו {{3}}מעקות בטיחות מובנים משמעותיים{{/3}}. הוא משוחרר {{4}}בקפדנות למחקר לגיטימי בלבד{{/4}} — {{5}}חקר יכולת פרשנות, בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג, הערכת עמידות וניסויים מבוקרים{{/5}}. אתה נושא ב{{6}}אחריות מלאה וחבות מלאה{{/6}} לגבי אופן השימוש בו ולגבי כל מה שהוא מייצר, ואינך {{7}}רשאי לפרוס אותו למשתמשי קצה או לסביבת ייצור{{/7}} מבלי להוסיף {{8}}שכבות בטיחות, ניטור ומניעת ניצול לרעה משלך{{/8}}. המחברים אינם נושאים ב{{9}}אחריות כלשהי{{/9}} לשימוש לרעה. הורדת המאגר משמעותה שאתה מקבל {{10}}תנאים אלה{{/10}}; הרישיון הוא {{11}}Apache 2.0{{/11}}.
מאמר זה אינו מכיל במתכוון פרומפטים מזיקים. מספרי הסירוב שלמעלה מגיעים מחבילת הערכת הבטיחות של כרטיס המודל עצמו, שהיא הדרך הנכונה למדוד מודל מסוג זה: להריץ את מבחני הסירוב הסטנדרטיים, לקרוא את המספרים, ולעצב את המחקר שלך סביב מה שהם מראים.
מקורות ותאריך
כל העובדות לעיל אומתו ב-2026-08-16. רשימת הקבצים והגדלים נקראים ממאגר Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (נוצר ב-16 באוגוסט 2026; ארכיטקטורה qwen35; רישיון Apache 2.0; גישה מוגבלת). מספרי הסירוב והיכולות לקוחים מחבילת הערכת הבטיחות של כרטיס המודל. מדידת מטמון ה-KV (~2 GB בהקשר של 32K) לקוחה מספר הנהלים של OrcaRouter לארכיטקטורה זו, How to Run Qwen 3.8 27B Locally. התמחור והגבלת הגישה לקוחים מעמוד המודל obsidian/Qwen3.8-27B, שנבדק באותו יום. גדלי הקבצים המכומתים הם ב-GB עשרוניים כפי שהם מאוחסנים ב-Hugging Face.
למחקר לגיטימי, המשקלים נמצאים ב-Hugging Face: הורדה מ-Hugging Face — ללא כרטיס אשראי, פעיל תוך 60 שניות.
