رسم توضيحي مسطّح ومتجه لبطل مدونة تقنية حول تشغيل نموذج لغوي كبير غير مراقَب ومجرّد من الحواجز محليًا على أجهزتك الخاصة: شريحة نموذج كبيرة مستديرة بلون أزرق داكن مع توهج سماوي ناعم تطفو في منتصف اليسار، ودائرتها الداخلية تتحول من شكل قفل مغلق إلى شكل مفتوح. إلى يمينها، بطاقة GPU مدمجة على طاولة عمل ونافذة طرفية رفيعة مع أشرطة أوامر أفقية مجردة وصورة ظلية صغيرة لحيوان اللاما بجانبها. في الزاوية العلوية، أيقونة مجهر صغيرة ودرع مستدير بمثلث تحذير، مما يشير إلى استخدام بحثي وحدود أمان. خلفية زرقاء فاتحة وبيضاء ناعمة، ومساحة فارغة واسعة عبر الثلث السفلي. لا يوجد نص مقروء.
Guides & Insights

كيفية تشغيل Qwen3.8-27B-Uncensored محلياً: إصدارات GGUF المكممة وllama.cpp وOllama

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لتشغيل Qwen3.8-27B-Uncensored محليًا، اسحب مستودع GGUF المقيّد orcarouter/Qwen3.8-27B-Uncensored-GGUF من Hugging Face، واختر تكميمًا يناسب ذاكرة VRAM لديك — Q4_K_M (16.8 GB) لـ GPU بسعة 24 GB، وIQ4_XS (15.3 GB) لـ GPU بسعة 16 GB، وQ3_K_M (13.5 GB) عندما تريد مساحة سياق إضافية — وشغّله باستخدام إصدار حالي من llama.cpp مع علامة --jinja، مع إضافة --mmproj إذا احتجت إلى الرؤية. يمكن استيراد الملف نفسه إلى Ollama بثلاثة أوامر. هذه هي نسخة GGUF من إصدار Qwen3.8 27B المُجرَّد من سلوك الرفض، الذي صدر في 16 أغسطس 2026، مع الحفاظ على سياق 262K الأصلي، ومُسقِط الرؤية، ورأس فك الترميز التخميني MTP في كل تكميم. إنها أداة بحث، وليست مساعدًا: فقد أُزيل سلوك الرفض منها، ولا تتضمن أي ضوابط أمان مدمجة، وترخيصها هو Apache 2.0. اقرأ حدود الأمان في أسفل هذه الصفحة قبل التنزيل — فهذا هو الغرض من المستودع المقيّد.

أي GGUF يجب تنزيله حسب VRAM

يأتي المستودع بزوج واحد كامل الدقة واثني عشر ملفًا مكمّمًا، لذا فإن قرار التنزيل هو في الحقيقة قرار يتعلق بذاكرة VRAM. الأرقام أدناه هي أحجام الملفات المقروءة من مستودع Hugging Face بتاريخ 2026-08-16.

A quant-picker card titled 'Qwen3.8-27B-Uncensored GGUF — pick by VRAM', sourced to the Hugging Face repo orcarouter/Qwen3.8-27B-Uncensored-GGUF checked 2026-08-16. It lists: 24 GB GPU — Q4_K_M at 16.8 GB, the recommended default; 16 GB GPU — IQ4_XS at 15.3 GB (tight) or Q3_K_M at 13.5 GB (context headroom); 12 GB GPU — Q2_K at 10.9 GB only, quality drops; 48 GB+ — Q8_0 at 29.0 GB or F16 at 54.7 GB; plus a vision line reading add mmproj 0.9 GB for image input. Footer: only 16 of 64 layers use full attention, so the KV cache stays ~2 GB at 32K context and Q4_K_M fits a 24 GB card with long context.

ما الذي يوجد فعلياً في المستودع

orcarouter/Qwen3.8-27B-Uncensored-GGUF يحوي خمسة عشر ملفًا للنموذج: أوزان F16 مقسّمة إلى جزأين، واثني عشر ملف GGUF مكمّمًا — Q2_K، Q3_K_S، Q3_K_M، Q3_K_L، Q4_K_S، Q4_K_M، Q5_K_S، Q5_K_M، Q6_K، Q8_0، IQ3_M وIQ4_XS — بالإضافة إلى مُسقط الرؤية mmproj. وهو تصدير GGUF لنفس البناء المجرّد المستخدم في Qwen3.8-27B-Uncensored-FP8، معاد تعبئته لبيئات التشغيل المحلية من فئة llama.cpp، ويرث رخصة Apache 2.0 للنموذج الأساسي وسياقه الأصلي البالغ 262,144 رمزًا.

ثلاث خصائص تنطبق على كل كمية. البنية هي qwen35 — انتباه هجين مع 48 طبقة خطية من Gated DeltaNet و16 طبقة انتباه كامل — وهذا هو سبب رفض المستودع للتحميل في إصدارات llama.cpp الأقدم ولماذا تبقى ذاكرة التخزين المؤقت للـ KV صغيرة. أما رأس فك الترميز التخميني MTP (nextn) فهو محفوظ في جميع الكميات، سواء K-quant أو IQ. وقالب المحادثة هو قالب Qwen Jinja، الذي يجب عليك تفعيله صراحة (انظر أدناه) أو ستنكسر المحادثات متعددة الأدوار.

لماذا تبقى ذاكرة التخزين المؤقت KV صغيرة بما يكفي لتكون مؤثرة؟

هذا هو التفصيل الذي يجعل قصة التشغيل المحلي ناجحة. من بين 64 طبقة، تستخدم 16 طبقة فقط الانتباه الكامل؛ بينما تستخدم الـ48 الأخرى انتباهًا خطيًا من نوع Gated DeltaNet، الذي لا يحتفظ بأي ذاكرة تخزين مؤقت KV تقليدية. التأثير العملي، وفقًا لما قيس في دليل التشغيل الأصلي لهذه البنية، هو ذاكرة تخزين مؤقت KV تبلغ تقريبًا 2 جيجابايت عند سياق 32K — أي حوالي ربع ما قد يحتاجه نموذج تقليدي بحجم 27B. ولهذا السبب لا يزال ملف Q4_K_M بحجم 16.8 جيجابايت يلائم بطاقة 24 جيجابايت مع نافذة سياق طويلة، ولهذا السبب أيضًا فإن سلسلة GGUF غير الخاضعة للرقابة قابلة للتشغيل على أجهزة لا يمكنها استضافة نقطة التحقق BF16 بحجم 55.6 جيجابايت على الإطلاق.

شغّله باستخدام llama.cpp

llama.cpp هو المسار المقصود. تحتاج إلى إصدار حديث: النُسخة الرئيسية تُسجّل بنية qwen35، والإصدارات الأقدم ترفض الملف تمامًا. شكل الأمر، استنادًا إلى ملاحظات الاستخدام في بطاقة النموذج ودليل تشغيل هذه البنية، هو:

A command card titled 'llama.cpp — serve the uncensored GGUF' showing the run command llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja, an optional vision line adding --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf, and notes: a current build is required because the qwen35 architecture is refused by older llama.cpp versions; the MTP nextn head is preserved in every quant but needs a build with MTP support, stock builds ignore it. Footer: the Ollama path is a Modelfile with FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf, then ollama create qwen3.8-27b-uncensored -f Modelfile, then ollama run qwen3.8-27b-uncensored.

llama-server -m Qwen3.8-27B-Uncensored-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja

يمنحك ذلك نقطة نهاية متوافقة مع OpenAI على localhost:8080. لإدخال الصور، أضف --mmproj mmproj-Qwen3.8-27B-Uncensored-f16.gguf. استبدل Q4_K_M بمستوى التكميم الذي يناسب ذاكرة الفيديو (VRAM) لديك؛ الخيارات متطابقة.

شغّلها باستخدام Ollama

يقوم Ollama بتشغيل نفس الملف عن طريق استيراده من ملف Modelfile، وهي الطريقة المدعومة لإضافة ملف GGUF غير موجود في المكتبة. في المجلد الذي يحتوي على النسخة الكمية التي قمت بتنزيلها:

FROM ./Qwen3.8-27B-Uncensored-Q4_K_M.gguf

احفظ هذا السطر كـ Modelfile، ثم ollama create qwen3.8-27b-uncensored -f Modelfile وollama run qwen3.8-27b-uncensored. بالنسبة للرؤية، أضف سطر mmproj إلى Modelfile (FROM ... Q4_K_M.gguf بالإضافة إلى مسار mmproj) ويقوم Ollama بتوصيل المُسقط تلقائيًا. تنطبق نفس تحذيرات --ctx والقالب: عيّن حجم السياق الذي يمكنك استيعابه فعليًا، وتذكر أن النموذج المُجرّد من الرفض يردّ دون أي حاجز حماية بينك وبين المخرجات.

ما الذي غيّره إزالة الرفض فعليًا

تنشر بطاقة النموذج مجموعة تقييم سلامة لهذا الإصدار. عند إيقاف التفكير، تنخفض معدلات الرفض على معايير المطالبات الضارة القياسية من 64–99% على النموذج الأساسي إلى 0–6% على الأوزان المُجرَّدة من الرفض؛ وعند تشغيل التفكير، لا يرفض تقريبًا أبدًا — 1.7% أو أقل. تبقى معايير القدرات ضمن ±1.3 نقطة مقارنةً بالنموذج الأساسي. هذا هو نمط كل إصدار مُجرَّد من الرفض في هذه السلسلة: إزالة الرفض مع بقاء القدرات سليمة، مع التنبيه إلى أن نسبة ملموسة من الإجابات لا تزال تُقدِّم تنويهًا قصيرًا قبل الرد — أثر تدريبي، وليس رفضًا.

الجانب الآخر هو المغزى من حد الأمان الموضح أدناه: النموذج الذي لا يرفض أبدًا ليس مساعدًا أفضل، بل هو كائن من نوع مختلف. إنه أداة اختبار لقياس آليات الرفض ولمعرفة ما إذا كان حاجز الحماية الخاص بك يعمل.

ما الذي يجب فعله به فعليًا في البحث

ثلاثة مشاريع مشروعة تمثل الاستخدام المعتمد لنموذج مُزيل الرفض:

عندما يكون هذا الإصدار هو الإجابة الخاطئة

إذا كنت تريد مساعدًا عاديًا، أو أي شيء تريد وضعه أمام المستخدمين النهائيين، فهذا هو النموذج الخاطئ — إذ لا يحتوي على حواجز أمان مدمجة ذات معنى، وسيلبي طلبات يرفضها النموذج الأساسي، ورخصة Apache 2.0 لا تعفيك من المسؤولية. استخدم نموذج Qwen3.8-27B الأصلي المحاذى لهذا الغرض. وإذا كنت تريد صدّ الرفض في روبوت محادثة، فإن حزمة موجهات النظام تحقق أكثر بمخاطر أقل من تعديل الأوزان. وإذا لم يكن لديك GPU على الإطلاق ولكنك ما زلت ترغب في دراسة النموذج، فإن البطاقة المستضافة obsidian/Qwen3.8-27B على OrcaRouter تقدم نفس النسخة غير الخاضعة للرقابة بسعر 0.40 دولار لكل مليون رمز إدخال و4.21 دولار لكل مليون رمز إخراج، مع نفس سياق 262K؛ وهي مقتصرة على باحثي الأمن والسلامة في الذكاء الاصطناعي كما هو الحال مع المستودع، ويظل قرار الإشراف على عاتقك. بطاقة النموذج تتضمن تفاصيل الأسعار والمعايير.

حدود الأمان — اقرأ هذا قبل التنزيل

A safety-boundary card for Qwen3.8-27B-Uncensored with two columns: under Research use it lists refusal-mechanism study, interpretability, red-teaming, robustness evaluation and guardrail testing; under Never deploy it lists end-user chatbots, production applications and consumer services, with a warning that this model has had its safety alignment removed and will comply with harmful, unethical or illegal requests the base model refuses, and a footer reading Apache 2.0, research-only, you assume full responsibility.

خضع هذا النموذج لإزالة جوهرية لمواءمة السلامة. سيلبي الطلبات الضارة وغير الأخلاقية والمسيئة أو غير القانونية التي كان النموذج الأصلي Qwen3.8-27B يرفضها، ولا يحتوي على أي حواجز حماية مدمجة تُذكر. صدر حصريًا للأبحاث المشروعة — تفسير النماذج، ودراسة سلامة الذكاء الاصطناعي وآليات الرفض، واختبارات الفريق الأحمر، وتقييم المتانة، والتجارب المضبوطة. أنت تتحمل المسؤولية الكاملة والتبعة القانونية عن استخدامك له وعن كل ما يولّده، ويجب ألا تنشره للمستخدمين النهائيين أو في بيئة الإنتاج دون إضافة طبقات الحماية والاعتدال ومنع إساءة الاستخدام الخاصة بك. لا يتحمل المؤلفون أي مسؤولية عن إساءة الاستخدام. تنزيل المستودع يعني قبولك لهذه الشروط؛ والترخيص هو Apache 2.0.

لا تحتوي هذه المقالة عمدًا على أي مطالبات ضارة. أرقام الرفض أعلاه مأخوذة من مجموعة تقييم السلامة الخاصة ببطاقة النموذج، وهي الطريقة الصحيحة لقياس نموذج من هذه الفئة: شغّل معايير الرفض القياسية، واقرأ الأرقام، وصمّم بحثك بناءً على ما تظهره.

المصادر والتاريخ

جميع الحقائق المذكورة أعلاه تم التحقق منها في 2026-08-16. قائمة الملفات وأحجامها مأخوذة من مستودع Hugging Face: orcarouter/Qwen3.8-27B-Uncensored-GGUF (أُنشئ في 16 أغسطس 2026؛ البنية qwen35؛ ترخيص Apache 2.0؛ مقيد الوصول). أرقام الرفض والقدرات مأخوذة من حزمة تقييم السلامة في بطاقة النموذج. قياس ذاكرة التخزين المؤقت KV (حوالي 2 جيجابايت عند سياق 32K) مأخوذ من دليل التشغيل OrcaRouter لهذه البنية، "كيفية تشغيل Qwen 3.8 27B محليًا". تسعير النسخة المستضافة والتحكم في الوصول مأخوذان من صفحة نموذج obsidian/Qwen3.8-27B، التي تم فحصها في نفس اليوم. أحجام الملفات المكمَّمة بالجيجابايت العشري كما هي مخزنة على Hugging Face.

للأبحاث المشروعة، الأوزان متوفرة على Hugging Face: حمّل من Hugging Face — بدون بطاقة ائتمان، يعمل خلال 60 ثانية.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube