
معايير Qwen3.8-27B-Uncensored: انهيار الرفض، واستمرار القدرة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
قصة المعايير لـQwen3.8 27B Uncensored (Aggressive) — البناء المُجرَّد (abliterated) لـQwen3.8 27B الذي صدر كنقطة تفتيش FP8 في 15 أغسطس 2026 وبناء GGUF في 16 أغسطس — لا تكمن في أنه أصبح أقوى، بل في أنه توقف عن الرفض. ويذكر تقرير بطاقة النموذج أن رفض المطالبات الضارة انهار من 64–99% في النموذج الأساسي إلى 0–6% في البناء المُجرَّد مع إيقاف التفكير، وإلى 1.7% أو أقل مع تشغيل التفكير، بينما تقع جميع معايير القدرات ضمن ±1.3 نقطة من الأساس، وتبلغ perplexity على WikiText-2 6.96. إذا كنت هنا من أجل معايير qwen غير الخاضعة للرقابة، فهذه هي الأرقام البارزة: إنه ليس نموذجًا أذكى، بل نموذجًا غير رافض.
هذا التمييز مهم، لأن معظم ما يُصنَّف ضمن "المعايير غير المقيّدة" هو إما قائمة رقيقة من درجات القدرات أو منشور مبالغ فيه يدّعي أن النموذج "أفضل". وليس أيٌّ منهما ما يفعله abliteration. تستعرض هذه المقالة البيانات المُقاسة الفعلية — انهيار الرفض، والإفراط في الرفض، والاحتفاظ بالقدرات، ومقياس الارتباك — والطريقة التي أنتجتها، وحدود الأمان التي ينبغي أن تقرأها قبل أن تلمس الأوزان.
ما الذي يقيسه ملخص المعايير غير الخاضع للرقابة فعليًا
المراجعة العادية للنماذج تتناول محورًا واحدًا: القدرة — MMLU وGSM8K والبرمجة والاستدلال. أما النموذج المُجرَّد من الرفض (abliterated) فهو مثير للاهتمام على محور مختلف، وجوهر وسم «غير المُرقَّب» هو أن محور السلامة تحرّك. لذا فإن السؤال المفيد لـQwen3.8-27B-Uncensored-FP8 ليس «هل هو أذكى؟» بل «ما تكلفة إزالة آلية الرفض، وما مدى شمولية إزالتها؟»
ثلاث مجموعات من الأرقام يجب قراءتها معًا. معدل الرفض في معايير المطالبات الضارة — كم مرة يرفض النموذج؛ كلما كان الأساس أعلى، كانت الإزالة أكثر وضوحًا. الرفض المفرط للمطالبات غير الضارة — كم مرة يرفض طلبًا بريئًا بشكل خاطئ؛ الانخفاض أفضل للجميع. والاحتفاظ بالقدرة — ما إذا كان التعديل قد أضعف النموذج. ملخص معايير يطبع درجات القدرة فقط يجيب على السؤال الخطأ.
الطريقة: abliteration هي تعديل للأوزان، وليست ضبطًا دقيقًا
ما الذي يميّز الأبليتيريشن عن حزم "الجيلبريك" المجتمعية هو مكان التغيير. فالجيلبريك على مستوى البرومبت يغلّف المدخلات؛ بينما الأبليتيريشن يعدّل الأوزان. الطريقة هنا هي طريقة Arditi et al. (2024) بعنوان "Refusal in Language Models Is Mediated by a Single Direction". النتيجة الأساسية هي أن سلوك الرفض في نماذج عديدة يتحكم فيه اتجاه واحد في التدفق المتبقي — قدّر هذا الاتجاه وأزله، وسيتوقف النموذج عن الرفض دون الحاجة إلى إعادة تدريبه.
بشكل ملموس، تصف البطاقة تقدير اتجاه رفض واحد من متوسط الفرق المُقنّع بالتنشيط الهائل للبواقي في الطبقة الأخيرة، حيث يُطرح الباقي الضار من الباقي غير الضار عند الطبقة 38 (التقريب 0.6 × 64)، باستخدام AdvBench كمجموعة ضارة وAlpaca كمجموعة غير ضارة. التعديل هو تعامد، W′ = W − r(rᵀW)، محسوب بدقة float32 ويُطبَّق على 131 مصفوفة لكتابة البواقي — إسقاطات مخرجات الانتباه، وإسقاطات مخرجات الانتباه الخطي، وإسقاطات MLP النازلة، وفضاء صف واحد للتضمين. لا تُنفَّذ أي خطوة تدريب؛ ويُترك برج الرؤية دون مساس؛ ويتم إبطال رأس التنبؤ التخميني MTP بشكل متسق. لهذا السبب تبقى القدرة سليمة: إزالة اتجاه هي تدخل ألطف بكثير من ضبط النموذج بدقة ليطيع.
الرفض ينهار: الأرقام
تم قياسه على الإصدار FP8 الذي يقدّمه vLLM ونُشر على بطاقة نموذج Hugging Face (2026-08-15)، إذ ينخفض معدل الرفض في معايير التلقينات الضارة من 64–99% في الإصدار الأساسي إلى 0–6% في الإصدار غير الخاضع للرقابة مع إيقاف التفكير:
• AdvBench — 99.0% ← 0.0%
• JailbreakBench (ضار) — من 94.0% إلى 0.0%
• StrongREJECT — 97.3% → 2.0%
• HarmBench (المعياري) — 98.7% ← 2.7%
• MaliciousInstruct — 99.0% → 0.0%
• SimpleSafetyTests — 64.0% → 6.0%
• ForbiddenQuestions — 73.3% → 4.7%
مع تفعيل التفكير، يكون الرفض شبه معدوم — {{1}}1.7% على AdvBench و0.0% في معظم الاختبارات الأخرى{{/1}}. تُضيف البطاقة تحفظًا صادقًا واحدًا: {{2}}30–50% من الإجابات لا تزال تبدأ بعبارة تنويه قصيرة{{/2}}. هذا أثر تدريبي، وليس رفضًا — {{3}}يجيب النموذج لكنه يتحوط في مقدمته{{/3}}. يُقرأ هذا على أنه احتكاك لا أمان.

الإفراط في الرفض يُعد فشلًا أيضًا.
الرقم الأقل شهرة يقع على الجانب الآخر من محور الأمان. في اختبار XSTest-safe — 250 طلبًا حميدًا ترفضها النماذج المتوافقة أحيانًا عن طريق الخطأ — يفرط النموذج الأساسي في الرفض بنسبة 5.6% من الوقت. النسخة غير الخاضعة للرقابة تفرط في الرفض بنسبة 0.4%. إزالة اتجاه الرفض لا تمنع النموذج من رفض الطلبات الضارة فحسب؛ بل تمنعه أيضًا من رفض الطلبات غير الضارة التي كان يرفضها سابقًا بسبب الإفراط في التعميم. بالنسبة لأي شخص يبني أدوات تقييم أو أدوات فريق أحمر (red-team) حيث يكون خط الأساس الخالي من الرفض هو الغاية، فهذا تحسين حقيقي في الأداة، وليس تأثيرًا جانبيًا يستحق الاعتذار.
القدرة تُحفظ ولا تُحسَّن
هنا يموت التصور القائل إن "غير الخاضع للرقابة = الأقوى". تعرض بطاقة النموذج إصدار FP8 المُجرَّد (abliterated) مقارنةً بالإصدار الأساسي الرسمي FP8 باستخدام النصوص البرمجية والإعدادات نفسها:
• MMLU (0-shot) — 84.3% → 84.7%
• GSM8K (CoT) — 90.0% → 88.7%
• MMLU-Pro (CoT) — 77.6% → 76.8%
• CMMLU (0-shot، الصينية) — 81.4% → 80.8%
كل درجة تقع ضمن نطاق ±1.3 نقطة من القيمة الأساسية، وتأتي درجة الالتباس الخام لمجموعة WikiText-2 عند 6.96 — وهذا دليل البطاقة على أن نمذجة اللغة نفسها لم تتدهور. القراءة الصادقة: الإبليتراشن شبه محايد فيما يتعلق بالقدرات على هذه البنية. أنت لا تحصل على نموذج أفضل؛ بل تحصل على النموذج نفسه دون سلوك الرفض.

ينطبق نفس التحذير على النظام البيئي الأوسع: ادعاءات «غير خاضع للرقابة دون فقدان» على الإصدارات المجتمعية تستحق قراءة متشككة. وجدت مقارنة ثلاثية على إصدار مفتوح الأوزان بحجم 4B على Hugging Face أن التقنية التي ادعت أنها بدون فقدان خفضت في الواقع TruthfulQA بحوالي 7 نقاط وLambada بحوالي 4، بينما وصل معدل نجاح هجوم HarmBench إلى 100%؛ في حين استقرت الطريقتان الأخريان عند 99.2% و95.5%. وتجربة عدوانية على إصدار مختلف حققت صفر رفض ولكنها أنتجت كلامًا غير مترابط، لذا تراجع الإصدار المنشور إلى معايير أكثر لطفًا لكل طبقة. نتائج Abliteration خاصة بالطريقة — هذه الأرقام تحديدًا من بيانات بطاقة إصدار FP8.
ما لا تدّعيه البطاقة
اقرأ المنهجية قبل الاستشهاد بالأرقام. تشير بطاقة المعلومات إلى قياس الرفض باعتباره "مؤشرًا فقط، وليس رقمًا بتقييم LLM-judge / بدرجة نشر": تم الحكم على الرفض من خلال مصنف قائم على القواعد لعبارات الافتتاح، مع فئة "تحفظ" منفصلة للإجابات التي امتثلت لكنها أضافت إخلاء مسؤولية في المقدمة. المعايير تقتصر على النصوص فقط، وتعمل على إصدار FP8 المخدوم عبر vLLM مع نموذج اللغة فقط، واستخدمت مجموعة القدرات نصوص تقييم قياسية. الإطار الصحيح: هذه بيانات مقيسة من البائع نفسه، قابلة للتكرار من البطاقة المنشورة - وليست تشغيلًا من طرف ثالث مستقل، وليست ادعاءً حول إصدار GGUF، الذي يُشحن بمقدار كمي (quantized) لـ llama.cpp ويجب تقييمه بشكل منفصل.
حد الأمان
هذا هو الجزء الذي لا يمكن التحايل عليه. لقد تمت إزالة آلية الرفض بشكل كبير من النموذج المجرّد من الحماية (abliterated). عمليًا: سوف يستجيب لطلبات ضارة أو غير أخلاقية أو غير قانونية التي النموذج الأساسي Qwen3.8 27B يرفضها، وليس لديه أي حواجز حماية مدمجة ذات معنى. الاستخدامات المشروعة هي البحث — قابلية التفسير (دراسة كيفية ترميز اتجاهات الرفض)، وسلامة الذكاء الاصطناعي ودراسة آلية الرفض، والاختبار الأحمر (اختبار النماذج بمدخلات تحاول تجاوز حواجز الحماية)، وتقييم المتانة. تم إصداره بموجب رخصة Apache 2.0، الموروثة من النموذج الأساسي، بشكل صارم كأداة بحثية. أنت تتحمل المسؤولية والتبعة القانونية كاملة عن طريقة استخدامك له وعن كل ما ينتجه. لا تنشره للمستخدمين النهائيين أو في بيئة الإنتاج دون طبقات الأمان والمراقبة ومنع إساءة الاستخدام الخاصة بك — ولأي استخدام إنتاجي أو موجه للمستهلك، فإن نموذج Qwen3.8 27B القياسي هو النموذج الذي تريده فعليًا.
عندما يكون معيار غير خاضع للرقابة هو الشيء الخطأ الذي تبحث عنه
إذا كان سؤالك هو: «أي نموذج هو الأقوى في الرياضيات أو البرمجة؟» فأنت تقرأ الأرقام الخاطئة — فالإصدار غير الخاضع للرقابة ليس ترقية في القدرات. إذا كان تطبيقك بحاجة إلى رفض الطلبات الضارة، فهذا النموذج هو عكس ما تريده تمامًا. إذا كنت تُطلق منتجًا، فلا تبنِ على نقطة تفتيش مجرّدة من الرفض (abliterated). وإذا كان ما تبتغيه فعلًا هو كسر القيود (jailbreak)، فهذا شيء مختلف تمامًا — فحزم مستوى المطالبات (prompt-level) تقع خارج نطاق التدخل على مستوى الأوزان الذي نناقشه هنا، وليست موضوع هذه المقالة. إن بيانات المعايير في هذا المقال موجودة لسؤال واحد ضيّق ومشروع: ماذا يحدث لنموذج Qwen3.8 27B عند إزالة الرفض، بشكل مُقاس.
كيفية الوصول إليها
كلا الإصدارين متاحان على Hugging Face بموجب Apache 2.0: orcarouter/Qwen3.8-27B-Uncensored-FP8 (block-FP8 E4M3، حوالي 30.9 جيجابايت من الأوزان، يعمل على مسار نواة vLLM FP8 القياسي مع بقاء سياق 262K والأدوات والتفكير وMTP كما هي) و orcarouter/Qwen3.8-27B-Uncensored-GGUF (F16 إلى جانب 12 مستوى تكميم لـ llama.cpp، حيث يُعد Q4_K_M بحجم 16.8 جيجابايت الخيار الافتراضي الموصى به لوحدة معالجة رسومات بسعة 24 جيجابايت). إن بطاقة الطراز على OrcaRouter تتضمن الأسعار وتفاصيل المعايير — الإصدار غير الخاضع للرقابة مُدرج هناك باسم obsidian/Qwen3.8-27B بسعر 0.40 دولار لكل مليون رمز إدخال و4.21 دولار لكل مليون رمز إخراج، مع سياق 262K، والوصول مقصور على باحثي الأمن، وفرق الاختراق، وباحثي سلامة الذكاء الاصطناعي.

الخلاصة
معايير qwen غير الخاضعة للرقابة تجيب على سؤال ضيق، والإجابة واضحة: إزالة الرفض من Qwen3.8 27B عبر الـ abliteration تُبقي القدرة ضمن ±1.3 نقطة، بينما ينهار الرفض على الاستفسارات الضارة من 64–99% إلى 0–6%، وينخفض الرفض المفرط من 5.6% إلى 0.4%، ويبقى مؤشر الحيرة عند 6.96. اقرأ هذه الأرقام على أنها «لا يرفض»، وليس أبدًا على أنها «أقوى». بالنسبة لأبحاث قابلية التفسير والسلامة والفريق الأحمر، فهذه هي الأداة التي تصفها بطاقة النموذج بالضبط. أما بالنسبة لأي شيء يواجه المستخدم، فهو النموذج الخاطئ بحكم بنيته.
للاستخدام البحثي المشروع، الأوزان متاحة على Hugging Face بموجب رخصة Apache 2.0 — orcarouter/Qwen3.8-27B-Uncensored-FP8 (نسخة GGUF الخاصة بـ llama.cpp متوفرة على orcarouter/Qwen3.8-27B-Uncensored-GGUF).
