بطاقة العنوان الرئيسية للمقال 'Qwen 3.8 27B Uncensored GGUF': بطاقة بحثية بحواف دائرية تحمل العنوان 'Qwen3.8-27B Uncensored GGUF'، وعنوانًا فرعيًا 'بناء محلي منزوع الرقابة لـ llama.cpp'، وشارات تعرض '12 مستوى تكميم' و'262 ألف سياق' و'رؤية + MTP'، وأيقونة درع تحمل وسم 'للبحث فقط'. شعار OrcaRouter مركّب في أسفل اليمين.
Guides & Insights

Qwen 3.8 27B غير الخاضع للرقابة GGUF: البناء المحلي المجرّد من الرقابة، و12 تكميمًا، وحدود الاستخدام البحثي فقط

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إن Qwen 3.8 27B uncensored GGUF هو تنزيل حقيقي، والنسخة التي ينبغي البدء بها هي Qwen3.8-27B-Uncensored-GGUF — نُشر على Hugging Face في 16 أغسطس 2026 بصفته النسخة الشقيقة المخصصة لـ llama.cpp من إصدارنا FP8 المُزال منه الرفض (abliterated). إنها نفس الأوزان المكونة من 27 مليار معلمة مع إزالة الرفض الموجودة في Qwen3.8-27B-Uncensored-FP8، لكنها محوّلة إلى صيغة GGUF للاستدلال المحلي: F16 بالإضافة إلى 12 مستوى تكميم من Q2_K إلى Q8_0 (بما في ذلك تكميمات imatrix مثل IQ3_M وIQ4_XS)، ونافذة سياق بطول 262K، ومُسقِط رؤية منفصل، ورأس فك الترميز التخميني MTP سليمًا. وتعني كلمة "Uncensored" أنها abliterated — أي أن اتجاه الرفض تمت إزالته من الأوزان عبر التعامد — لذلك ستجيب حيث يرفض النموذج الأساسي المتوافق، وهذا هو بالضبط سبب كونها للبحث فقط. وإليك ما يحتويه المستودع فعليًا، وأي تكميم يناسب بطاقة الرسومات (GPU) الخاصة بك، وكيفية تشغيله في llama.cpp، وحدود الأمان التي تقبلها عند تنزيله.

نسخة الثلاثين ثانية: F16 بالإضافة إلى 12 كوانت، وQ4_K_M بحجم 16.8 غيغابايت هو الخيار الافتراضي، وتحتاج إلى إصدار llama.cpp من مايو 2026 أو أحدث، وهذه أداة بحثية بدون حواجز حماية — وليست شيئًا يُنشر للمستخدمين النهائيين.

ما الذي يعنيه "GGUF غير الخاضع للرقابة" فعلياً — وكيف يختلف هذا الإصدار عن نسخة FP8

GGUF هو تنسيق النموذج أحادي الملف الذي يستخدمه llama.cpp؛ FP8 هو مخطط تكميم يعمل على خوادم vLLM GPU. إصدارانا غير الخاضعين للرقابة يحتويان على نفس الأوزان بعد إزالة القيود، في بيئتي تشغيل. Qwen3.8-27B-Uncensored-FP8 (15 أغسطس 2026) يستهدف vLLM على الخادم، مع إعادة تكميمه إلى مخطط Qwen3.8-27B-FP8 الرسمي بحيث يعمل على نفس مسار النواة. Qwen3.8-27B-Uncensored-GGUF (16 أغسطس 2026) يستهدف llama.cpp على جهاز محلي—GPU المكتبي أو محطة العمل التي تتحكم فيها. نفس الأوزان، نموذج نشر مختلف: واجهة برمجة تطبيقات سحابية مقابل عملية محلية.

إن Abliteration هي تدخل على مستوى الأوزان، وليست ضبطًا دقيقًا. اتجاه الرفض هو متجه في التدفق المتبقي للنموذج؛ وعند تفعيله يُنتج "لا أستطيع المساعدة في ذلك". تحدد عملية البناء هذا الاتجاه وتُزيله من الأوزان عبر التعامد، وفقًا لمنهج Arditi et al. 2024 ("Refusal in Language Models Is Mediated by a Single Direction"). لا يتم تدريب أي أوزان جديدة. النموذج الأساسي هو Qwen/Qwen3.8-27B — نموذج كثيف بحجم 27 مليارًا ببنية هجينة (48 طبقة انتباه خطي من نوع Gated DeltaNet و16 طبقة انتباه كامل)، مع رؤية مدمجة وسياق يبلغ 262,144 رمزًا. الترخيص هو Apache 2.0، موروث من النموذج الأساسي. لاحظ أن المستودع الرسمي لـ Qwen يوفر ملفات BF16 safetensors فقط — لا يوجد GGUF رسمي من Qwen — لذا فإن أي نسخة GGUF غير خاضعة للرقابة من هذا النموذج، بما في ذلك هذه النسخة، هي تحويل للأوزان المفتوحة.

السُّلَّم الكمّي — F16 بالإضافة إلى 12 مستوى

يحتوي المستودع على F16 (54.6 جيجابايت موزعة على ملفّين) و12 مستوى تكميم. الأحجام أدناه هي أحجام الملفات الخاصة بالمستودع، تمت قراءتها في 16 أغسطس 2026؛ وتختلف أحجام ملفات GGUF قليلاً من إصدار إلى آخر.

Card titled 'Qwen3.8-27B Uncensored GGUF — the quant ladder' listing F16 54.6 GB and 12 quantization tiers with file sizes: Q8_0 29.0 GB near-lossless, Q6_K 22.4 GB, Q5_K_M 19.5 GB, Q5_K_S 19.0 GB, Q4_K_M 16.8 GB marked recommended default, Q4_K_S 15.8 GB, IQ4_XS 15.3 GB marked best low-bit pick, Q3_K_L 14.6 GB, Q3_K_M 13.5 GB, IQ3_M 12.8 GB, Q3_K_S 12.3 GB, Q2_K 10.9 GB, with a footer reading 'File sizes per the Hugging Face repo, read August 16 2026'.

F16 — 54.6 جيجابايت (2 ملفات) — دقة مرجعية

Q8_0 — 29.0 GB — شبه عديم الفقد، لوحدات معالجة الرسوميات المتطورة

Q6_K — 22.4 GB — النقطة المثالية من حيث الجودة لكل غيغابايت

Q5_K_M — 19.5 GB / Q5_K_S — 19.0 GB — جودة عالية على البطاقات الأكبر

Q4_K_M — 16.8 GB — الخيار الافتراضي الموصى به

Q4_K_S — 15.8 جيجابايت

IQ4_XS — 15.3 GB — أفضل خيار منخفض البت (مُعاير بـ imatrix)

Q3_K_L — 14.6 GB / Q3_K_M — 13.5 GB — لبطاقات 16 GB

IQ3_M — 12.8 جيجابايت — بصمة صغيرة (بمعايرة imatrix)

Q3_K_S — 12.3 GB

Q2_K — 10.9 GB — the smallest K-quant, a visible quality compromise

إرشادات الأجهزة: استخدم Q4_K_M على بطاقة بذاكرة 24 جيجابايت (RTX 4090 أو RTX 3090)؛ واستخدم IQ4_XS أو Q3_K_M إذا كانت ذاكرتك 16 جيجابايت؛ ولا تستخدم Q2_K إلا إذا كنت مضطرًا إلى 12 جيجابايت. نظرًا لأن القاعدة تستخدم انتباه Gated DeltaNet الهجين، فإن ذاكرة التخزين المؤقت KV صغيرة — حوالي 0.5 جيجابايت عند سياق 8K — لذا يمكنك دفع النافذة إلى أبعد بكثير من نموذج كثيف تقليدي بحجم 27B. الرؤية تضيف ملفًا منفصلًا واحدًا: مُسقِط F16 بحجم 931 ميجابايت. توجد أيضًا سلسلة مجتمعية من 9 نماذج abliterated مكمّاة لنفس القاعدة؛ نسختنا هي تحويل من abliteration FP8 الموثق، مع الاحتفاظ بمكمّات imatrix وأرقام رفض-دلتا من بطاقة النموذج.

كيفية تشغيله في llama.cpp

ثلاث خطوات. متطلب واحد غير بديهي: دعم بنية qwen35 وMTP وصل إلى llama.cpp في مايو 2026، لذا حدّث إلى إصدار من 2026-05 أو أحدث — الإصدارات الأقدم لن تحمّل هذه الملفات (وفقًا لملف README الخاص بالمستودع).

1. قم بتنزيل النموذج المكمم الذي اخترته بالإضافة إلى مسقط الرؤية. المستودع مقيّد، لذا عليك تسجيل الدخول إلى Hugging Face وقبول الشروط أولاً — قراءة ملف README هي جزء من قبول طبيعة هذا النموذج.

huggingface-cli download orcarouter/Qwen3.8-27B-Uncensored-GGUF --include "Qwen3.8-27B-Uncensored-Q4_K_M.gguf" "mmproj-Qwen3.8-27B-Uncensored-f16.gguf" --local-dir ./qwen-unc

2. ابدأ تشغيل llama-server. يوفر هذا نقطة نهاية متوافقة مع OpenAI؛ -ngl 99/ يفرّغ كل الطبقات إلى وحدة معالجة الرسومات.

llama-server -m ./qwen-unc/Qwen3.8-27B-Uncensored-Q4_K_M.gguf --mmproj ./qwen-unc/mmproj-Qwen3.8-27B-Uncensored-f16.gguf -ngl 99 -c 16384 --jinja --host 0.0.0.0 --port 8080

3. (اختياري) قم بتمكين رأس فك الترميز التخميني MTP.أضف--spec-type draft-mtp/ — رأس nextn مدمج في كل quant، لذا لا حاجة لنموذج مسودة منفصل.

Card titled 'Run it locally in llama.cpp' with steps: update to a llama.cpp build from May 2026 or newer for the qwen35 architecture and MTP; download via huggingface-cli including the Q4_K_M quant and mmproj-Qwen3.8-27B-Uncensored-f16.gguf; run llama-server with --mmproj, -ngl 99, -c 16384, --jinja; optional --spec-type draft-mtp for the embedded speculative-decoding head, with a footer reading 'OpenAI-compatible endpoint at http://localhost:8080/v1/chat/completions'.

يمكن للتشغيلات البحثية النصية فقط أن تستغني عن --mmproj؛ لكن إدخال الصور يتطلبه، لأن هذا نموذج لغوي بصري أصلي. نقطة النهاية هي http://localhost:8080/v1/chat/completions، لذا فإن كود OpenAI SDK الحالي يعمل مع تبديل عنوان الأساس.

لا توجد وحدة معالجة رسوميات؟ نفس الخط غير الخاضع للرقابة مستضاف

Local GGUF تكلفته صفر لكل رمز (token) لكنه يحتاج تقريبًا 17 جيجابايت من ذاكرة VRAM لمستوى Q4_K_M. إذا لم تكن تملك العتاد المطلوب، فالنسخة المستضافة obsidian/Qwen3.8-27B على OrcaRouter تقدم نفس سلسلة 27B غير الخاضعة للرقابة — رؤية، واستدلالًا، وسياقًا بحد أقصى 262K — بسعر 0.40 دولار لكل مليون رمز إدخال و4.21 دولار لكل مليون رمز إخراج، مع تقييد الوصول للباحثين في الأمن السيبراني وفرق الاختراق الأحمر والباحثين في سلامة الذكاء الاصطناعي. نفس عائلة الأوزان، وبيئتا تشغيل: GGUF محليًا وFP8 في السحابة. قرار الاعتدال (الرقابة) يبقى على جانبك في كلتا الحالتين.

حدود الأمان — اقرأ هذا قبل التنزيل

تمت إزالة مواءمة السلامة لهذا النموذج بشكل جوهري. سوف يمتثل للطلبات الضارة أو غير الأخلاقية أو المسيئة أو غير القانونية التي كان النموذج الأساسي Qwen3.8-27B سيرفضها، ولا توجد لديه حواجز حماية مدمجة تُذكر. تم إصداره بشكل صارم لأغراض البحث المشروع — قابلية التفسير، دراسة آلية الرفض، الاختبارات الهجومية (red-teaming)، تقييم المتانة، واختبار حواجز الحماية. أنت تتحمل المسؤولية الكاملة والتبعة القانونية عن طريقة استخدامك له وعن كل ما يولّده، ويجب ألا تنشره للمستخدمين النهائيين أو في بيئة الإنتاج دون إضافة طبقات السلامة والرقابة ومنع إساءة الاستخدام الخاصة بك. لا يتحمل المؤلفون أي مسؤولية. الترخيص هو Apache 2.0.

A safety-boundary card with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production apps and consumer services, with a warning strip reading 'No built-in guardrails — the model will comply with requests the base model refuses' and a footer reading 'Apache 2.0 · research-only · you assume full responsibility and liability'.

ما يُظهره القياس الفعلي هو ثمن "عدم الرقابة". من حزمة تقييم السلامة في بطاقة النموذج — التي أُجريت على بناء FP8 بتاريخ 15 أغسطس 2026، وهي الأوزان التي يحوّلها ملف GGUF هذا: انخفاض رفض المطالبات الضارة من 64–99٪ في النموذج الأساسي إلى 0–6٪ في الأوزان المجرّدة من الرقابة، وانخفاض الرفض الزائد غير الضار من 5.6٪ إلى 0.4٪، وتبقى نتائج القدرات ضمن ±1.3 نقطة من الأساس. هذه الأرقام هي السبب في أن هذا الصنف من النماذج موضوع بحثي مشروع — وهي أيضًا التحذير.

لا تحتوي هذه المقالة عمدًا على أي محفزات ضارة. إذا كنت تقيّم النموذج، فشغّل معايير الرفض القياسية — AdvBench وHarmBench وStrongREJECT وXSTest-safe — واقرأ الأرقام بنفسك. تلك هي الطريقة المعتمدة لدراسة نموذج مُزال الرفض منه.

عندما يكون هذا الإصدار هو الإجابة الخاطئة

1. أنت تريد مساعدًا عاديًا.نموذج خاطئ. ليس لديه حواجز حماية وسيلبي الطلبات الضارة. استخدم نموذج Qwen3.8-27B المُحاذى بدلاً من ذلك.

2. أي شيء ستضعه أمام المستخدمين النهائيين. نموذج خاطئ بغض النظر عن النية. Apache 2.0 لا ينقل مسؤوليتك، وتوفير نموذج بدون حواجز حماية للمستخدمين ليس استراتيجية نشر.

3. أنت تستخدم Apple Silicon. سيعمل GGUF بسلاسة، لكن تحويل MLX للنموذج الأساسي هو الأنسب — راجع دليل MLX المنفصل الخاص بنا.

4. لا تريد تشغيله على الإطلاق. استخدم البطاقة المستضافة — نفس الأوزان، بدون 17 غيغابايت من VRAM، وبنفس البوابة المخصصة للبحث فقط.

خلاصة القول

"Qwen 3.8 27B uncensored GGUF" لديه إجابة، وهي تنزيل ملموس: Qwen3.8-27B-Uncensored-GGUF — F16 بالإضافة إلى 12 مستوى تكميم لـ llama.cpp، الأوزان المُجرّدة من الرقابة من بنية FP8 الخاصة بنا، سياق 262K، رؤية، وMTP، بموجب Apache 2.0 وللبحث فقط. اختر Q4_K_M على بطاقة 24 جيجابايت، حدّث llama.cpp بعد مايو 2026، وقم بتشغيله كخادم محلي متوافق مع OpenAI. إنه أداة بحث لدراسة حالات الرفض واختبار الحواجز الواقية — وليس روبوت محادثة، وليس شيئًا يُطرح للاستخدام العام. الأوزان مجانية؛ والمسؤولية عن استخدامك لها تقع بالكامل على عاتقك.

لأغراض البحث المشروع، يتوفر F16 وجميع مستويات التكميم الاثني عشر على Hugging Face: نزّل ملف GGUF من Hugging Face

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube