
شرح نموذج LLM غير الخاضع للرقابة: تقنية Abliteration، الاستخدام البحثي، والخط الذي لا تعبره
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1354 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 252 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
نموذج لغوي كبير غير خاضع للرقابة هو نموذج لغوي تمت إزالة سلوك الرفض فيه عمدًا — أي الجزء من النموذج الذي يرفض الطلب بدلاً من الإجابة عليه. ومعظم هذه النماذج تُبنى عبر عملية "الإزالة" (abliteration): حيث يجد الباحث الاتجاه الداخلي الوحيد الذي يتوسط سلوك الرفض ويمسحه من الأوزان، تاركًا بقية النموذج سليمًا إلى حد كبير. والنتيجة نموذج يجيب حيث يقول نموذج عادي "لا"، وهذا بالضبط سبب دراسته وسبب عدم صلاحيته للإنتاج. وقد أصدرنا أحد هذه النماذج، Qwen3.8-27B-Uncensored-FP8، وهو إصدار مقطّع (abliterated) ومكمّم FP8 من Qwen3.8 27B، إلى Hugging Face بموجب ترخيص Apache 2.0 كأثر بحثي فقط. هذه الصفحة هي شرح لهذه الفئة: ما هي هذه النماذج، وما البحث الذي يبررها، وكيفية التعامل معها بأمان، وأين يقع الحد الفاصل.
هناك تأطير واحد يُبقي الفئة بأكملها صادقة، لذا دعني أضعه في المقدمة: النموذج غير المُقيَّد ليس أذكى، ولا أكثر صدقًا، ولا أكثر قدرةً من النموذج الذي اشتُق منه. إنه نفس الأوزان مع سلوك واحد مطروح. كل ما ما زال يعرفه، كان يعرفه دائمًا — ما تغيّر هو أنه لم يعد يرفض. هذا يجعله أداة مفيدة حقًا لأبحاث السلامة، وشيئًا غير آمن حقًا لنشره. كلا نصفي هذه الجملة مهمان، وبقية هذه الصفحة تشرح كليهما.
ماذا يعني "غير الخاضع للرقابة" في الواقع
• أو يمكنك الوصول إليه من خلال بطاقة نموذجنا، والتي تتضمن تفاصيل الأسعار والمعايير.
التقنية مستمدة من اكتشاف في مجال قابلية التفسير يعود إلى عام 2024. في ورقة "Refusal in Language Models Is Mediated by a Single Direction" (Arditi et al., arXiv:2406.11717, NeurIPS 2024)، أظهر المؤلفون أنه عبر 13 نموذج محادثة مفتوح المصدر تتراوح أحجامها من 1.8 مليار إلى 72 مليار معامل، فإن الرفض يخضع لفضاء فرعي أحادي البعد تقريبًا من تيار البقايا — الحالة الداخلية التي تحمل المعلومات بين الطبقات. أزل هذا الاتجاه فيتوقف النموذج عن الرفض؛ وأعده فيرفض النموذج الطلبات غير الضارة أيضًا.
Abliteration يحوّل هذا الاستنتاج إلى إجراء عملي: تقدير الاتجاه، ثم إزالته بتعامد من مصفوفات الأوزان التي تكتب في التدفق المتبقي. في بنيتنا الخاصة، Qwen3.8-27B-Uncensored-FP8، تم تقدير اتجاه الرفض في طبقة واحدة وإزالته من 131 مصفوفة تكتب في التدفق المتبقي، مع ترك برج الرؤية دون مساس. ما يبقى هو نفس المعرفة، ونفس التفكير، ونفس سياق 262,144 رمزًا — مع إزالة الرفض. وللتدقيق في التسمية: "غير الخاضع للرقابة" لا يعني متوافقًا أو آمنًا. بل يعني أن الحارس معطّل. سنعود لاحقًا إلى ما يتطلبه ذلك منك.
البحث الذي أنشأها
نتيجة اتجاه الرفض حقّقت أمرين في آنٍ واحد. علميًا، قدّمت تفسيرًا آليًا لسلوكٍ أمني: فهناك دائرة حقيقية يمكن العثور عليها تجعل النموذج يقول «لا». عمليًا، أظهرت مدى هشاشة المواءمة — إذ يمكن لتعديلٍ واحد من الرتبة الأولى على الأوزان أن يعطّل السلوك دون الحاجة إلى ضبطٍ دقيق. هذا ليس عيبًا في نموذج مختبرٍ واحد؛ فقد أعاد المؤلفون إنتاج النتيجة عبر أكثر من اثني عشر نموذجًا للمحادثة.
بحلول عام 2026 أصبحت هذه التقنية خط أنابيب بأمر واحد، وهي حقيقة ذات حدين. Heretic، وهي مكتبة مفتوحة المصدر، تقدّر اتجاهات الرفض لكل طبقة وتُعامِدها وتستبعدها من إسقاطات الانتباه والشبكات المغذية بالكامل؛ أفاد تقرير صادر في مايو 2026 أن إزالة الحواجز الوقائية لنموذج Llama 3.3 من Meta استغرقت حوالي 10 دقائق، ولنموذج Gemma 4 من Google حوالي 90 دقيقة، مع أكثر من 3500 نموذج مشتق وأكثر من 13 مليون تنزيل تراكمي. يتّبع Abliterix (Wu Wangzhang) مسارًا أكثر حذرًا: فهو يستخرج اتجاه رفض من 800 طلب ضار و800 طلب غير ضار، ويطبّق إسقاطًا متعامدًا، ويقدّم التعديل كمهايئات LoRA من الرتبة 1 بحيث تبقى الأوزان الأساسية دون تغيير، ويعرض معدل الرفض وتباعد KL بحيث تبقى تكلفة القدرة مرئية. على نموذج Qwen3.5 بمعاملات 0.8B، أبلغ عن 0 حالة رفض من بين 200 طلب ضار.
اقرأ تلك الفقرة كما يقرأها باحث سلامة. الهدف من بناء هذه الأدوات ليس أن يُجرّد أي شخص نموذجًا من حواجز الأمان بهدف التسلية. بل الهدف هو أن الإزالة تافهة وعلنية — لذلك قياسها، ودراسة كيف تعمل، وبناء حواجز أمان تستطيع الصمود أمامها، هو بحد ذاته برنامج بحثي. هذا هو الاختبار العدائي بمعنى الصندوق الأبيض: لا يمكنك الدفاع عن نظام ما حتى تعرف مدى سهولة اختراقه.
لماذا أصبحت "uncensored models" رائجة في 2026
تلاقت ثلاث قوى. أولاً، موجة الأوزان المفتوحة: تُطرح Qwen3.8 27B ونظيراتها بموجب تراخيص متساهلة، وأسلوب الإزالة (abliteration) لا يتطلب تشغيل تدريب — فقط تعدّل الأوزان ثم تعيد التكميم. ثانيًا، نضجت الأدوات من كود بحثي إلى مكتبات بأمر واحد، بحيث يمكن لمهندس كفء إنتاج نسخة في ظهيرة. ثالثًا، أصبحت Hugging Face قناة التوزيع، مما يعني أن الانتشار قابل للقياس.
نقطة بياناتنا الخاصة: نموذج Qwen3.8-27B-Uncensored-FP8، الذي صدر في 15 أغسطس 2026، حصل على 257 إعجابًا و4,285 تنزيلًا خلال يوم تقريبًا (تم التحقق في 16 أغسطس). الأمر ليس أن عشرات الآلاف من الناس يريدون نشر نموذج غير مقيّد. بل إن الكثير من الباحثين والمهندسين يريدون دراسته — وأرقام التنزيلات هي منحنى الطلب على هذا الفضول.
الغرض منه: الاستخدامات البحثية المشروعة
إليك القائمة المُبرَّرة، وهي القائمة الكاملة. إذا لم يكن الاستخدام مدرجًا فيها، فاعتبره غير مشروع:
• قابلية التفسير — دراسة ما هي دائرة الرفض فعليًا، وأين تكمن، ولماذا يؤدي إزالة اتجاه واحد إلى تغيير السلوك.
اختبارات الفريق الأحمر وتقييم الحواجز الوقائية — بناء طبقة رقابة واختبار ما إذا كانت تكتشف ما ينتجه نموذج تمت إزالة الرفض منه.
• قياس الإفراط في الأمان — تحديد مدى تكرار رفض النماذج الأساسية للطلبات غير الضارة، وفصل ذلك عن الأمان الحقيقي.
• أبحاث المتانة — قياس مدى سهولة إزالة المواءمة، وهي معلومات أساسية لأي شخص يصمم الضبط الدقيق للسلامة.
• تجارب السلامة الخاضعة للرقابة — توجد مجموعات معايير مثل AdvBench وJailbreakBench تحديدًا لقياس سلوك الرفض بطريقة موحدة وقابلة للتكرار.

كل هذه تشترك في خاصية واحدة: النموذج هو موضوع الدراسة، وليس المُخرَج. ناتج هذا البحث هو ورقة بحثية، أو نتيجة قياس، أو حاجز أمان أفضل — وليس خدمة أبدًا.
كيفية تشغيل واحدة بمسؤولية (إذا كنت تقوم بالبحث فعليًا)
إذا كان لديك سبب مشروع للعمل مع نموذج abliterated، فإن قواعد التشغيل واضحة ومباشرة:
• قم بتشغيله محليًا في بيئة معزولة، ومن الأفضل أن يكون معزولًا تمامًا عن الشبكة. لا نقطة وصول عامة، ولا خدمة دردشة، ولا خادم مشترك.
• قدّمه باستخدام الأدوات القياسية — vLLM أو llama.cpp — بنفس الطريقة التي تتعامل بها مع أي نموذج مفتوح الأوزان. إصدارنا هو تكميم block-FP8 يعمل على مسار نواة FP8 القياسي في vLLM مع سياق 262K ومفتاح التفكير واستدعاء الأدوات سليمة.
• قِس، لا تكتفِ بالحديث. حدد كمياً معدل الرفض على مجموعة اختبارات معيارية للطلبات الضارة وقارنه بالنموذج الأساسي؛ وحدد كمياً معدل الرفض المفرط على الطلبات غير الضارة؛ واعرض تباعد كي إل (KL) بحيث يصبح انحراف القدرات واضحاً. هذا هو الفرق بين التجربة والحكاية.

• احتفظ بالمخرجات في بيئة خاضعة للرقابة. سجّل، وراجع، وتخلّص منها بدلاً من نشرها.
• إذا كنت تقيّم حواجز الحماية الخاصة بك، ضع طبقة الإشراف أمام النموذج واختبرها — فهذا هو الهدف الأساسي من التمرين.
• للاطلاع على ورقة المواصفات الكاملة وجدول المعايير وتفاصيل الاستضافة، افتح بطاقة النموذج الخاصة بنا — فهي المرجع الرسمي لهذا الإصدار.
حدود الأمان: ما معنى "للأبحاث فقط"؟
هذا الجزء لا يمكن التأكيد عليه بما فيه الكفاية. النموذج المُجرَّد من الحماية لا يملك حواجز حماية مدمجة ذات معنى. سيلبي طلبات يرفضها النموذج العادي. هذه هي الميزة، وهي أيضًا الخطر — ولهذا يحمل كل إصدار جاد منه، بما في ذلك إصدارنا، نفس التحذيرات.
• لا حواجز حماية مدمجة. سلوك الرفض لم يعد موجودًا؛ لا تتصرف وكأنه ما زال موجودًا.
• ليس للمستخدمين النهائيين، وليس للإنتاج. المنتج، أو روبوت المحادثة، أو واجهة برمجة التطبيقات التي تخدم الجمهور، أو الأداة الداخلية التي يعتمد عليها زملاؤك — لا شيء من هذه يعد المكان المناسب لنموذج غير خاضع للرقابة.
• المسؤولية تقع على عاتقك. نُصدر Qwen3.8-27B-Uncensored-FP8 بموجب ترخيص Apache 2.0، وهو ترخيص متساهل فيما يخص إعادة التوزيع. الترخيص ليس شهادة أمان: الكود المتساهل لا يغيّر سلوك النموذج، ولا ينقل واجب الرعاية.
إذا استخدمته، فأنت تملك المخرجات. البيئة الخاضعة للرقابة هي مسؤوليتك؛ وكذلك تحديد ما ستمنحه إياه وما لن تمنحه، وما تفعله بما ينتج عنه.

عندما يكون النموذج غير المقيّد هو الإجابة الخاطئة
أوضح طريقة لقول ذلك: إذا كان هناك شخص على الطرف الآخر من النموذج، فإن النموذج غير الخاضع للرقابة هو الإجابة الخاطئة. أي منتج يحتاج إلى أن يكون جديرًا بالثقة، أي مساعد تكون أحكامه ذات أهمية، أي شيء يكون فيه الرفض هو السلوك الصحيح — استخدم النموذج الأساسي بدلاً منه. السبب في وجود Qwen3.8 27B بشكله الطبيعي هو تحديدًا أن الرفض ميزة وليس خللًا، وذلك في كل استخدام حقيقي تقريبًا. أما البناء المجرّد من الرفض فموجود للحالات البحثية الضيقة المذكورة أعلاه فقط ولا شيء غير ذلك.
خلاصة القول. إن نموذج اللغة الكبير غير الخاضع للرقابة ليس فئة منتجات، وليس اختراقًا. إنه نتاج بحثي ذو نسب علمي حقيقي — من اكتشاف اتجاه الرفض إلى الأدوات الآلية لعام 2026 — وحدود نشر صارمة. النماذج حقيقية، والطلب قابل للقياس، والاستخدامات المشروعة حقيقية أيضًا: قابلية التفسير، والاختبار الأحمر (red-teaming)، وتقييم الحواجز الواقية، والتجارب الخاضعة للسلامة. الخط الفاصل بين دراسة الحاجز وإيقاف تشغيله لشخص آخر هو جوهر هذه الصفحة، ولا يتحرك.
هذا الإصدار المحدد متاح للعموم بموجب ترخيص Apache 2.0 — لأغراض البحث فقط. يمكنك تنزيل الأوزان من Hugging Face
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
