
כיצד להריץ את Qwen3.8-27B-Uncensored מקומית: GGUF Quants, llama.cpp ו-Ollama
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
כדי להריץ את Qwen3.8-27B-Uncensored מקומית, משוך את מאגר ה-GGUF המאובטח orcarouter/Qwen3.8-27B-Uncensored-GGUF מ-Hugging Face, בחר קוונטיזציה לפי ה-VRAM שלך — Q4_K_M (16.8 GB) לכרטיס GPU של 24 GB, IQ4_XS (15.3 GB) לכרטיס GPU של 16 GB, Q3_K_M (13.5 GB) כשאתה רוצה מרווח קונטקסט — והגש אותו עם build עדכני של llama.cpp באמצעות הדגל --jinja, והוסף --mmproj אם אתה צריך יכולות ראייה. אותו קובץ מיובא ל-Ollama בשלוש פקודות. זוהי גרסת ה-GGUF של build ה-abliterated של Qwen3.8 27B, ששוחרר ב-16 באוגוסט 2026, עם קונטקסט מקורי של 262K, מקרן הראייה וראש הניבוי הספקולטיבי MTP משומרים בכל קוונטיזציה. זהו כלי מחקר, לא עוזר: התנהגות הסירוב הוסרה ממנו, הוא אינו נושא מעקות בטיחות מובנים, והרישיון הוא Apache 2.0. קרא את גבול הבטיחות בתחתית עמוד זה לפני ההורדה — זו הנקודה של המאגר המאובטח.
איזה GGUF להוריד לפי VRAM
המאגר כולל זוג אחד בדיוק מלא ושנים-עשר קבצים מקוונטטים, כך שהחלטת ההורדה היא למעשה החלטת VRAM. המספרים שלהלן הם גדלי הקבצים שנקראו ממאגר Hugging Face ב-2026-08-16.

מה בעצם יש במאגר
orcarouter/Qwen3.8-27B-Uncensored-GGUF מכיל חמישה עשר קבצי מודל: משקלי F16 המפוצלים לשני חלקים, שנים-עשר קבצי GGUF מכומתים — Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M, Q6_K, Q8_0, IQ3_M ו-IQ4_XS — ומקרן הראייה mmproj. הוא יצוא GGUF של אותה גרסה מסורסת כמו Qwen3.8-27B-Uncensored-FP8, ארוז מחדש עבור סביבות ריצה מקומיות מסוג llama.cpp, והוא יורש את רישיון Apache 2.0 של המודל הבסיסי ואת חלון ההקשר המקורי של 262,144 אסימונים.
שלוש תכונות משותפות לכל קוונט. הארכיטקטורה היא qwen35 — תשומת לב היברידית עם 48 שכבות לינאריות מסוג Gated DeltaNet ו-16 שכבות תשומת לב מלאה — וזו הסיבה שהמאגר מסרב להיטען בגרסאות ישנות יותר של llama.cpp ומדוע מטמון ה-KV נשאר קטן. ראש ה-MTP (nextn) לפענוח ספקולטיבי נשמר בכל הקוונטים, K-quant ו-IQ כאחד. ותבנית הצ׳אט היא תבנית ה-Qwen Jinja, שעליך להפעיל במפורש (ראה להלן) או ששיחות מרובות-סבבים יישברו.
מדוע מטמון ה-KV נשאר קטן מספיק כדי להיות משמעותי
זהו הפרט שגורם לסיפור המקומי לעבוד. מתוך 64 השכבות, רק 16 משתמשות בתשומת לב מלאה; 48 האחרות משתמשות בתשומת לב לינארית מסוג Gated DeltaNet, שאינה שומרת מטמון KV קונבנציונלי. ההשפעה המעשית, שנמדדה ב-Runbook המקורי עבור ארכיטקטורה זו, היא מטמון KV של בערך 2 GB בהקשר של 32K — בערך רבע ממה שמודל 27B קונבנציונלי היה צריך. זו הסיבה שקובץ Q4_K_M בנפח 16.8 GB עדיין נכנס לכרטיס של 24 GB עם חלון הקשר ארוך, ומדוע סדרת ה-GGUF הלא מצונזרת ניתנת להפעלה על חומרה שלא הייתה יכולה להכיל כלל את ה-checkpoint של BF16 בנפח 55.6 GB.
הרץ את זה עם llama.cpp
llama.cpp הוא המסלול המיועד. אתה צריך build עדכני: ה‑trunk רושם את ארכיטקטורת qwen35, ו‑builds ישנים יותר דוחים את הקובץ לחלוטין. צורת הפקודה, לפי הערות השימוש בכרטיס המודל ומדריך ההפעלה של ארכיטקטורה זו, היא:

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja
זה נותן לך נקודת קצה תואמת OpenAI ב-localhost:8080. להוספת תמונות, הוסף --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. החלף את Q4_K_M בקוונטיזציה התואמת ל-VRAM שלך; הדגלים זהים.
הרץ את זה עם Ollama
אולמה מריץ את אותו קובץ על ידי ייבואו מ-Modelfile, שהיא הדרך הנתמכת להוספת GGUF שאינו בספרייה. בתיקייה המכילה את ה-quant שהורדת:
./Qwen3.8-27B-Uncensored-Q4_K_M.gguf
שמור את השורה הזו כקובץ Modelfile, לאחר מכן ollama create qwen3.8-27b-uncensored -f Modelfile ו ollama run qwen3.8-27b-uncensored. עבור ראייה, הוסף את שורת mmproj לקובץ Modelfile (מ- FROM ... Q4_K_M.gguf בתוספת נתיב mmproj) ו-Ollama מחבר את המקרן. אותן אזהרות --ctx ו-template חלות: הגדר את גודל ההקשר שאתה יכול בפועל להכיל, וזכור שמודל שהוסרו ממנו סירובים עונה ללא גדר מגן בינך לבין הפלט.
מה שהסרת הסירוב שינתה בפועל
כרטיס המודל מפרסם ערכת הערכת בטיחות עבור build זה. כשהחשיבה כבויה, שיעור הסירוב במדדים הסטנדרטיים להנחיות מזיקות יורד מ-64–99% במודל הבסיס ל-0–6% במשקלים שעברו אבליטרציה; כשהחשיבה פועלת הוא כמעט אף פעם לא מסרב — 1.7% או פחות. מדדי היכולות נשארים בטווח של ±1.3 נקודות מהמודל הבסיסי. כך נראה כל שחרור שעבר אבליטרציה בקו הזה: סירובים הוסרו, יכולות נותרו על כנן, וההסתייגות שחלק נכבד מהתשובות עדיין מקדים הצהרה קצרה לפני המענה — תוצר לוואי של האימון, לא סירוב.
הצד השני הוא כל העניין בגבול הבטיחות שלהלן: מודל שמעולם לא מסרב אינו עוזר טוב יותר; הוא סוג אחר של עצם. הוא כלי בדיקה למדידת מנגנוני סירוב ולגילוי האם מעקה הבטיחות שלך עובד.
מה בעצם עושים עם זה במחקר
שלושה פרויקטים לגיטימיים שהם השימוש המורשה במודל נטול סירובים:
כשהבנייה הזו היא התשובה השגויה
אם אתה רוצה עוזר רגיל, או כל דבר שהיית מציב מול משתמשי קצה, זה הדגם הלא נכון — אין לו מעקות בטיחות מובנים משמעותיים, הוא ייענה לבקשות שהדגם הבסיסי מסרב להן, ו-Apache 2.0 אינו מעביר את האחריות ממך. השתמש ב-Qwen3.8-27B המקורי המכוונן למטרה זו. אם אתה רוצה להסיט סירובים בצ'אטבוט, חבילת system-prompt משיגה יותר עם פחות סיכון מעריכת משקלים. ואם אין לך GPU בכלל אבל עדיין רוצה לחקור את הדגם, הכרטיס המתארח obsidian/Qwen3.8-27B ב-OrcaRouter משרת את אותו קו לא מצונזר ב-$0.40 למיליון אסימוני קלט ו-$4.21 למיליון אסימוני פלט עם אותו חלון הקשר של 262K; הוא מוגבל לחוקרי אבטחה ובטיחות ב-AI באותה דרך שבה המאגר מוגבל, והחלטת המודרציה עדיין נשארת בצד שלך. כרטיס הדגם מכיל את פרטי התמחור והמדדים.
גבול הבטיחות — קרא זאת לפני ההורדה

יישור הבטיחות של המודל הזה {{1}}הוסר באופן מהותי{{/1}}. הוא ייענה לבקשות {{2}}מזיקות, לא אתיות, פוגעניות או בלתי חוקיות{{/2}} שהמודל Qwen3.8-27B המקורי היה מסרב להן, ואין לו {{3}}מעקות בטיחות מובנים משמעותיים{{/3}}. הוא משוחרר {{4}}בקפדנות למחקר לגיטימי בלבד{{/4}} — {{5}}חקר יכולת פרשנות, בטיחות בינה מלאכותית ומנגנוני סירוב, רד-טימינג, הערכת עמידות וניסויים מבוקרים{{/5}}. אתה נושא ב{{6}}אחריות מלאה וחבות מלאה{{/6}} לגבי אופן השימוש בו ולגבי כל מה שהוא מייצר, ואינך {{7}}רשאי לפרוס אותו למשתמשי קצה או לסביבת ייצור{{/7}} מבלי להוסיף {{8}}שכבות בטיחות, ניטור ומניעת ניצול לרעה משלך{{/8}}. המחברים אינם נושאים ב{{9}}אחריות כלשהי{{/9}} לשימוש לרעה. הורדת המאגר משמעותה שאתה מקבל {{10}}תנאים אלה{{/10}}; הרישיון הוא {{11}}Apache 2.0{{/11}}.
מאמר זה אינו מכיל במתכוון פרומפטים מזיקים. מספרי הסירוב שלמעלה מגיעים מחבילת הערכת הבטיחות של כרטיס המודל עצמו, שהיא הדרך הנכונה למדוד מודל מסוג זה: להריץ את מבחני הסירוב הסטנדרטיים, לקרוא את המספרים, ולעצב את המחקר שלך סביב מה שהם מראים.
מקורות ותאריך
כל העובדות לעיל אומתו ב-2026-08-16. רשימת הקבצים והגדלים נקראים ממאגר Hugging Face orcarouter/Qwen3.8-27B-Uncensored-GGUF (נוצר ב-16 באוגוסט 2026; ארכיטקטורה qwen35; רישיון Apache 2.0; גישה מוגבלת). מספרי הסירוב והיכולות לקוחים מחבילת הערכת הבטיחות של כרטיס המודל. מדידת מטמון ה-KV (~2 GB בהקשר של 32K) לקוחה מספר הנהלים של OrcaRouter לארכיטקטורה זו, How to Run Qwen 3.8 27B Locally. התמחור והגבלת הגישה לקוחים מעמוד המודל obsidian/Qwen3.8-27B, שנבדק באותו יום. גדלי הקבצים המכומתים הם ב-GB עשרוניים כפי שהם מאוחסנים ב-Hugging Face.
למחקר לגיטימי, המשקלים נמצאים ב-Hugging Face: הורדה מ-Hugging Face — ללא כרטיס אשראי, פעיל תוך 60 שניות.
