
Abliteration، شرح: كيف تعمل إزالة الرفض دون أي تدريب
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 1009 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 195 tok/s
- OrcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- xAISpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
Abliterationتزيل سلوك الرفض في نموذج اللغة الكبير (LLM) — منعكس "لا يمكنني المساعدة في ذلك" — عبر تعديل الأوزان دون أي تشغيل تدريبي. يعمل ذلك لأن الرفض يتم عبر اتجاه واحد في التدفق المتبقي للنموذج: ابحث عن هذا الاتجاه، واطرحه من المصفوفات التي تكتب في التدفق، فيتوقف النموذج عن الرفض مع الحفاظ على قدراته. أوضح مثال متاح للعامة هو Qwen3.8 27B Uncensored (Aggressive)، والذي تظهر بطاقة بياناته انهيار معدل رفض المطالبات الضارة من 99.0% إلى 0.0% على AdvBench بينما ترتفع MMLU فعليًا بمقدار عُشر نقطة. هكذا تعمل الآلية، وماذا تقول الأرقام المقيسة، وأين يقع الخط الفاصل.
هذا ليس ضبطًا دقيقًا، ولا تعلمًا بالتعزيز من التغذية الراجعة البشرية، وليس موجه اختراق. "الإزالة المطلقة" هي نتيجة تفسيرية تحولت إلى جبر خطي: ورقة بحثية عام 2024 أظهرت أن اتجاهًا واحدًا في التمثيل الداخلي يتحكم في سلوكٍ كلف التدريب على السلامة جهدًا هائلًا لتثبيته، وأنه يمكنك إيقاف تشغيله عبر تعديل الأوزان مباشرةً. ولأن التعديل عبارة عن إسقاط، فهو رخيص التكلفة، وقابل للتكرار على بطاقة رسوميات واحدة، ويُبقي ملف أوزان عاديًا قابلًا للمشاركة — ولهذا أصبحت الإصدارات المُزالة من النماذج مفتوحة المصدر، بما في ذلك عائلة Qwen3.8-27B، الطريقة المعيارية لإنتاج ملفات أوزان بحثية "غير مقيّدة".
اتجاه الرفض: متجه واحد في تيار متعدد آلاف الأبعاد
داخل محوّل، يمر كل رمز عبر تدفق متبقٍّ — وهو التمثيل الجاري الذي تقرأ منه الطبقات وتكتب فيه. كتل الانتباه وMLP في كل طبقة تأخذ التدفق كمدخل لها وتضيف مخرجاتها إليه. هذا التدفق هو في الأساس ذاكرة العمل للنموذج: متجه واحد لكل موضع رمز، ببعد يساوي عرض النموذج.
الورقة البحثية لعام 2024 التي بدأ بها كل هذا — آندي أرديتي وزملاؤه،"الرفض في نماذج اللغة يتوسطه اتجاه واحد" (arXiv:2406.11717, NeurIPS 2024) — قاس ما تبدو عليه متجهات التدفق تلك عندما يكون نموذج المحادثة على وشك الرفض مقابل عندما يمتثل. عبر 13 نموذج محادثة مفتوح الأوزان من 1.8B إلى 72B معلمة، كانت الإجابة متسقة بشكل لافت: الفرق هو في الأساس اتجاه واحد. عند الرمز النهائي، يحتوي التدفق المتبقي على مكوّن كبير على طول اتجاه رفض واحد عندما يرفض النموذج، ولا يكاد يوجد أي مكوّن عندما يمتثل. تتوافق الهندسة عبر فئات الضرر، ولهذا السبب يتركز الإسقاط على أول متجه مفرد بدلاً من التوزع عبر فضاء فرعي كامل.
للعثور على هذا الاتجاه، تقوم بجمع التنشيطات على مجموعتين من المطالبات — الضارة وغير الضارة — وتأخذ متوسط بقايا الرمز الأخير لكل مجموعة. يكون اتجاه الرفض تقريبًا متوسط(الضارة) − متوسط(غير الضارة)، مع تطبيعه إلى طول الوحدة. أطرت الورقة الأصلية هذا المفهوم باستخدام التنقيب الخطي؛ بينما تقدّر الإصدارات الإنتاجية مثل Qwen3.8-27B-Uncensored-FP8 اتجاهًا واحدًا (k=1) كمتوسط فرق مُقنّع بالتنشيط الضخم لبقايا الرمز الأخير للضارة وغير الضارة. لا توجد تسميات تتجاوز تقسيم الضارة/غير الضارة، ولا تدرّج، ولا تدريب.
التعديل: اطرح الاتجاه من كل مصفوفة تكتب إلى الدفق
بمجرد حصولك على اتجاه الرفض r — وهو متجه وحدة في التيار المتبقي — يكون التدخل إسقاطًا من الرتبة 1. يمكن "تنظيف" كل مصفوفة أوزان يُضاف ناتجها إلى التيار المتبقي من r:
W' = W − r(rᵀW)
بعبارة أخرى: احسب مركبة مخرجات كل مصفوفة التي تتجه على طول r، ثم أزلها. المصفوفات التي تكتب إلى التيار هي إسقاطات المخرجات — إسقاط مخرجات الانتباه (o_proj)، والإسقاط السفلي لشبكة MLP (down_proj)، وفضاء صفوف تضمين الرموز. يتم التعديل بدقة float32، ويستغرق دقائق على GPU واحدة، ولا يحتاج إلى مُحسِّن ولا إلى بيانات تدريب تتجاوز أزواج التنشيط التي جمعتها بالفعل.
هناك طريقتان لإزالة اتجاه، ومن الجدير إبقاؤهما منفصلتين:
• استئصال التنشيط — ربط التمرير الأمامي وطرح المُكوّن r من التنشيطات الحيّة. قابل للعكس، لا تُمس الأوزان؛ مثالي للتجارب التي تقارن الرفض والامتثال على نفس نقطة التفتيش.
• تعامد الأوزان — تطبيق الإسقاط على الأوزان نفسها، مما ينتج نقطة تفتيش دائمة قابلة للمشاركة. وهذا ما يشير إليه مصطلح "abliteration"، وهو ما يُضمَّن في مستودعات النماذج غير الخاضعة للرقابة.

التعامدُ خشنٌ عن قصد. إنه يزيل مكوّن الرفض من الأوزان ولا شيء غير ذلك. لا يمكنه إضافة المعرفة، أو تحسين الاستدلال، أو جعل النموذج أكثر صدقًا — ولهذا فإن النموذج المُبطَل يتصرف مثل نموذجه الأساسي، لكن بدون منعكس الرفض.
كيف تبدو 131 مصفوفة على بناءٍ حقيقي: Qwen3.8-27B-Uncensored-FP8
لتوضيح ذلك: Qwen3.8-27B-Uncensored-FP8 (Hugging Face، نُشر في 2026-08-15، Apache 2.0) هو بناء مُجرَّد من Qwen3.8-27B. Qwen3.8-27B هو نموذج انتباه هجين — 16 طبقة انتباه كامل بالإضافة إلى 48 طبقة خطية من Gated DeltaNet، بإجمالي 64 طبقة، بالإضافة إلى رأس توقع متعدد الرموز (MTP). قام هذا البناء بإزالة اتجاه الرفض من 131 مصفوفة لكتابة البقايا:
self_attn.o_proj — 17 مصفوفات (16 طبقة انتباه كامل + MTP)
• linear_attn.out_proj — 48 مصفوفة (طبقات Gated DeltaNet)
• mlp.down_proj — 65 مصفوفة (64 طبقة + MTP)
• embed_tokens (فضاء الصفوف) — مصفوفة واحدة
تم تقدير اتجاه الرفض عند الطبقة 38 — round(0.6 × 64)، الطبقة التي يكون فيها الاتجاه أكثر تركيزًا — وكان الحد الأقصى للتسرب المتبقي بعد التعديل 1.8e-2. تُرك برج الرؤية دون تغيير، وجُرّد رأس MTP بشكل متسق مع بقية النموذج بحيث لا يعيد فك الترميز التخميني إدخال حالات الرفض في المراحل اللاحقة. تم حساب التعديل بصيغة float32، ثم أُعيد تكميمه إلى block-FP8 باستخدام نفس المخطط المستخدم في نقطة التحقق الرسمية Qwen3.8-27B-FP8؛ ويُظهر البناء تطابقًا بنسبة 99.9% في أكواد FP8 مقارنةً بنقطة التحقق الرسمية، وهكذا تعرف أن إعادة التكميم لم تشوّه التعديل.
القياس: الرفض ينهار، والقدرات تصمد.
جميع الأرقام أدناه مأخوذة من بطاقة النموذج الخاصة بـ Qwen3.8-27B-Uncensored-FP8، المنشورة في 2026-08-15 والتي تم تقييمها باستخدام vLLM. وهي مُعلَن عنها من قِبل المورّد — وليست مُعاد إنتاجها بشكل مستقل — وهي السجل العام الأكثر اكتمالًا المتاح للمقارنة قبل/بعد لتعديل الـ abliteration.
معدل الرفض على معايير المطالبات الضارة، مع إيقاف التفكير (معدل الرفض؛ الأقل يعني أقل رقابة):
• AdvBench (n=100): 99.0% → 0.0%
• StrongREJECT (n=150): 97.3% → 2.0%
• HarmBench المعياري (n=150): 98.7% → 2.7%
• MaliciousInstruct (n=100): 99.0% → 0.0%
• JailbreakBench الضار (ن=100): 94.0% → 0.0%
• SimpleSafetyTests (n=50): 64.0% → 6.0%
عبر مجموعة الاختبارات، ينخفض معدل الرفض للاستجابات الضارة من 64–99% في النسخة الأساسية إلى 0–6% بعد التعديل. مع تفعيل التفكير (enable_thinking=true)، يكون الرفض المتبقي أقل حتى — ≤1.7% في كل مكان، مع معظم المعايير عند 0% تمامًا. عدم التناظر مفيد: اتجاه الرفض يقع أساسًا في المسار السريع غير التفكيري، لذا بمجرد إزالته من رأس الإخراج، يتبقى القليل ليتعثر به أثر الاستدلال.
الإفراط في الرفض — الطلبات غير الضارة التي يرفضها النموذج الأساسي بشكل خاطئ — ينخفض أيضًا: XSTest-safe (n=250) ينتقل من 5.6% إلى 0.4%. إزالة الاتجاه لا توقف الرفض الضار فحسب؛ بل تمنع النموذج من رفض الطلبات الحميدة التي بدت خطيرة فقط. هذا الرقم حجة هادئة على أن جزءًا من «سلامة» النموذج الأساسي هو ضريبة إنذار كاذب.
القدرات، جميعها ضمن ±1.3 نقطة من الأساس:
• MMLU (0-shot بحرف): 84.3% → 84.7% (+0.4)
• GSM8K (CoT): 90.0% → 88.7% (−1.3)
• MMLU-Pro (CoT): 77.6% → 76.8% (−0.8)
• CMMLU (0-مثال): 81.4% → 80.8% (−0.6)
مؤشر perplexity لنص WikiText-2 هو 6.96. بعبارة أخرى، التعديل موجّه بدقة جراحية: فهو يزيل سلوكًا تم تركيبه فوق المعرفة ويترك المعرفة — كما تُقاس، على الأقل، في هذه التقييمات — سليمة في جوهرها.

التحفظات الصادقة
ثلاثة أمور لا تخبرك بها الأرقام الرئيسية. أولاً، الإزالة الكاملة ليست مفتاح تشغيل/إيقاف نظيفًا. حوالي 30–50% من الاستجابات للمطالبات الضارة لا تزال تسبقها عبارة إخلاء مسؤولية قصيرة — النموذج يمتثل، لكن جملة تحذيرية تبقى كأثر تدريبي. التعديل أحادي الاتجاه لا يزيل كل أثر لسلوك وقت التدريب.
ثانيًا، الرفض مشفَّر بشكل زائد عن الحاجة. اتجاه واحد يزيل معظمه، لكن بعض الفئات أعمق رسوخًا من غيرها، والاستئصال العدواني المفرط يمكن أن يوقع النموذج في الهراء — الإفراط في الاستئصال نمط فشل حقيقي، لا نظري. أنت تدير قرصًا، وهذا القرص له حد أدنى.
ثالثًا، تكلفة القدرة تعتمد على الاتجاه والطبقة. حقق هذا البناء نتيجة ضمن ±1.3 نقطة لأن الاتجاه قُدِّر في الطبقة الصحيحة وطُبِّق الإسقاط باستمرارية. انقل التقدير إلى الطبقة الخاطئة، أو ادفع الإسقاط بقوة أكبر، ويمكن لنفس الطريقة أن تُضعِف الاستدلال بشكل ملموس. النتيجة ليست مضمونة بالطريقة — بل تتحقق بالبناء.
عندما يكون الإبليترايشن هو الأداة الخاطئة
إذا كنت تريد مساعدًا متوافقًا، فلا تقم بإزالة الرفض (abliteration) — أنت تريد نقطة التحقق الأساسية المتوافقة، وليس إصدارًا مُزالًا منه الرفض. إذا كنت تريد تقييم نموذج Qwen3.8-27B المُزال منه الرفض دون تنزيل 30 جيجابايت من الأوزان، فإن العائلة متاحة على OrcaRouter (obsidian/Qwen3.8-27B، 0.40$ للإدخال / 4.21$ للإخراج لكل مليون رمز، سياق 262K، مدرج بتاريخ 2026-08-15)، مع النسخة الموسّعة بالكامل والمقيّدة الوصول للباحثين الأمنيين وفرق الاختبار الأمني.
إذا كنت ترغب في الرفض الانتقائي — رفض الأسلحة والإجابة عن كل ما عدا ذلك — فإن الضبط الدقيق عبر LoRA أو DPO، أو حاجزًا في موجه النظام، يمنحك سطح تحكم. أما Abliteration فهي تعديل حاد وشامل؛ لا يمكنها استئصال فئة واحدة بعينها.
إذا أردت إجراء تجارب قابلة للعكس، فابدأ بإزالة التنشيط في وقت الاستدلال بدلاً من تعديل الأوزان. يمكنك مقارنة الرفض والامتثال على نفس نقطة التحقق، ثم الالتزام بتعديل الأوزان فقط إذا كان السلوك هو ما تريده.
حد الأمان — اقرأ هذا قبل استخدامه
لا يمتلك النموذج المُبطَل حواجز حماية مدمجة. بالنسبة لنموذج متوافق، آلية الرفض هي حاجز الحماية؛ إزالتها تجعل الأوزان الخام تُجيب عن كل شيء يعرف النموذج الأساسي كيف يُجيب عنه. لا شيء في الإسقاط يضيف أمانًا، ولا شيء في المراحل اللاحقة يلتقط المخرجات.
الاستخدامات المشروعة هي الاستخدامات البحثية: قابلية التفسير (دراسة أين يقع الرفض في الأوزان وما الذي يتحكم فيه هذا الاتجاه أيضًا)، الاختبار الهجومي وتقييم الحواجز الأمنية (اختبار طبقات الأمان الخاصة بك ضد نموذج لا يخضع للرقابة الذاتية)، وقياس الإفراط في الأمان (حيث يحدد انخفاض نتيجة XSTest من 5.6% إلى 0.4% عدد المرات التي ترفض فيها النماذج المتوافقة المدخلات الحميدة). في كل حالة، يكون النموذج هو موضوع الدراسة، وليس الناتج.
الحدود ليست زخرفية:
• لأغراض البحث فقط — وليس للإنتاج أو منتجات المستخدم النهائي أو الأدوات الداخلية.
• لا توجد حواجز حماية — المخرجات غير مُصفّاة؛ أنت مسؤول عنها وعن عواقبها.
• الترخيص ليس شهادة أمان — Apache 2.0 يسمح بالاستخدام؛ لكنه لا يباركه.
كلا مستودعي Hugging Face — Qwen3.8-27B-Uncensored-FP8 والنسخة المعاد تعبئتها GGUF باسم Qwen3.8-27B-Uncensored-GGUF (نُشرت في 2026-08-16) — مقيدان: تقرّ بحدود الاستخدام البحثي فقط قبل بدء التحميل.

الخلاصة
{{1}}تُعد Abliteration من أنظف النتائج في قابلية تفسير نماذج اللغات الكبيرة (LLM){{/1}}: اتجاه خطي واحد في التدفق المتبقي يتوسط سلوكًا أنفقت تدريبات السلامة حوسبة هائلة على تثبيته، ويمكن لإسقاط وزن من الرتبة 1 إزالته دون تشغيل تدريبي. الحالة المُقاسَة — {{KEEP}}{{2}}Qwen3.8-27B-Uncensored-FP8{{/2}}{{/KEEP}} — تُظهر أن التعديل جراحي دقيق: {{3}}ينهار الرفض من 64–99% إلى 0–6%{{/3}}، {{4}}وينخفض الرفض المفرط إلى جزء يسير من قيمته (5.6% → 0.4%){{/4}}، {{5}}وتبقى القدرات ضمن ±1.3 نقطة{{/5}}. كما تُظهر بالضبط لماذا تُعد أداة بحثية لا منتجًا: لا حواجز حماية، وإخلاءات مسؤولية متبقية، وحدود تضع المسؤولية على عاتقك. {{6}}استخدمها لفهم الرفض، واختبار حواجز الحماية لديك، وقياس السلامة المفرطة — لا لوضعها أمام المستخدمين.{{/6}}
Qwen3.8-27B-Uncensored-FP8 هو نتاج بحثي بموجب ترخيص Apache 2.0 — مقيد الوصول، وليس خدمة مستضافة هنا. حمّل الأوزان على Hugging Face
