
Ternary Bonsai 2 27B Uncensored مقابل Qwen3.8-27B-Uncensored-MLX: طريقتان لإزالة اتجاه الرفض
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
OrcaRouter Ternary Bonsai 2 27B Uncensored و Qwen3.8-27B-Uncensored-MLX يجيبان عن السؤال نفسه — كيف تستخرج اتجاه الرفض من نموذج لغوي — لكنهما يجيبان عنه في مكانين مختلفين. سلالة Qwen3.8-27B-Uncensored-MLX هي أبليتيريشن تقليدي: تُجعل مصفوفات الأوزان متعامدة مقابل اتجاه رفض مُتعلَّم، وتُحفظ الأوزان المُعدَّلة كنقطة تحقق جديدة. في المقابل، يقوم OrcaRouter Ternary Bonsai 2 27B Uncensored بالإسقاط المكافئ وقت الاستدلال، بطرح المكوّن الذي يقع على امتداد اتجاه الرفض من كل كتابة متبقية، لذا لا تُعدَّل حزمة Bonsai الأساسية أبدًا وتبقى متطابقة على مستوى البتات. كلاهما من إصداراتنا الخاصة، والانقسام بينهما ليس تفضيلًا يتعلق ببيئات التشغيل. إنه ناتج عن حساب خاص بالأوزان الثلاثية.
عمر موضوع هذه المقارنة يوم واحد. أعلنت Prism ML عن Bonsai 2 27B في 2026-09-17؛ أُنشئت مستودعات Hugging Face في مساء اليوم السابق، عند 23:40–23:41 UTC في 2026-09-16، تحت Apache-2.0. أما نسخة MLX المُزالة منها آلية الرفض التي تُقارَن بها، فهي متاحة منذ منتصف أغسطس. لا شيء مما يلي يُعد سجل أداء للأحدث بين الاثنين — وحيثما لم يُقَس شيء، تذكر هذه المقالة ذلك.
الحيلة نفسها، مُطبَّقة في مكانين مختلفين
الاجتثاث العادي هو تعديل للأوزان. تُقدِّر اتجاه الرفض، ثم تُسقطه من المصفوفات التي تكتب في المجرى المتبقي: W ← W - r(rᵀW). بضع عمليات ضرب مصفوفات، بلا مُحسِّن، بلا دالة خسارة. هكذا صُنع Qwen3.8-27B-Uncensored-MLX — تصفه بطاقة النموذج بأنه "اجتثاث (إزالة اتجاه الرفض)، ثم تكميم MLX الأفيني"، مع تعامد الاتجاه واستبعاده من المجرى المتبقي وحفظ النتيجة كمجموعة جديدة من الأوزان. ما يُشحن هو نقطة تحقق أُزيل منها الاتجاه بالفعل.
OrcaRouter Ternary Bonsai 2 27B Uncensored يترك الأوزان كما هي ويتدخل حيث تُنتَج كل مساهمة متبقية، بدقة float32، مع اتجاه الرفض المخزَّن r:
• y ← y - alpha · dot(y, r) · r
عند ألفا 1 — القيمة الافتراضية — المكوّن الموازي لـr يُزال من عملية الكتابة تلك. عند ألفا 0 يكون الإسقاط معطّلًا ويتصرف النموذج كما تفعل الحزمة المنشورة. القيم الواقعة بينهما تمنح قوة جزئية، والقيم الأعلى من 1 تفرط في الإسقاط، وهو ما يقول المشروع إنه قد يُضعف الجودة. اختيار الطبقات متاح أيضًا، بحيث يمكنك استئصال مجموعة فرعية بدلًا من المكدس بأكمله. الاتجاه نفسه متجه عادي بأبعاد 5120 — حوالي 20 كيلوبايت بصيغة float32 — دون تطبيق أي دوران هادامار إضافي، لأن الإسقاط يعمل على مخرجات الإسقاط، وهي بالفعل في الأساس المخفي العادي.
تفصيل التغطية هو الجزء الذي يخطئ فيه الناس عندما يحاولون فعل هذا بأنفسهم. تغليف self_attn.o_proj وحده يلتقط 16 موقعًا. هذا التنفيذ يغلّف 129 كاتبًا للقيم المتبقية: 64 mlp.down_proj، 48 linear_attn.out_proj، 16 self_attn.o_proj، وmodel.embed_tokens. أداة مرفقة selfcheck.py تتحقق من أن الإسقاط يخفض المكوّن المتبقي إلى نحو 1e-6 من معيار المتبقي، وتحذر إذا لم يتم اكتشاف 129 موقعًا.

لماذا تجعل الأوزان الثلاثية هذا خيارًا إجباريًا بدلًا من تفضيل؟
هذا هو الجزء الخاص بهذا النموذج تحديدًا، وهو السبب في أن المقاربتين غير قابلتين للتبادل هنا رغم أنهما تحسبان الشيء نفسه تقريبًا.
تحزّن حزمة ثلاثية القيم في {-1, 0, +1} مضروبةً في مقياس FP16 لكل مجموعة، عند حجم مجموعة 128، في أساس مُدوَّر. عَمِّد مصفوفة ثلاثية مقابل اتجاه رفض فتحصل على مصفوفة كثيفة كاملة الدقة. لا توجد مصفوفة ثلاثية تساوي W - r(rᵀW) عمومًا. لذا فإن حفظ الأوزان المعدَّلة مرة أخرى يعني إعادة تكميمها — وإعادة تكميم الأوزان المعدَّلة لا تعيد إنتاج التدريب المدرك للتكميم الذي أنتج الحزمة الأصلية. سلوك التقريب الذي دربت Prism ML النموذج على تحمّله هو خاصية لإجراء التدريب، لا للمكمِّم، ولا يمكنك إعادة تشغيله بعد وقوع الأمر.
في نقطة تفتيش BF16 كثيفة، لا تنشأ هذه المشكلة.قرّب الأوزان المعدّلة إلى 4 بتات فتحصل على نموذج 4 بتات أسوأ قليلاً، وهو المقايضة العادية التي يقبلها الجميع بالفعل. أما في حزمة ثلاثية القيم، فستكون قد أهدرت الخاصية الوحيدة التي وُجدت الحزمة لأجلها.
إذاً، الصياغة الصادقة ليست "زمن التشغيل أفضل". بل إن إسقاط زمن التشغيل هو الوحيد من بين الاثنين الذي يحافظ على ما يجعل هذا النموذج بعينه مميزاً. اتجاه الرفض هو 20 KB. الحزمة هي 8.005 GiB.
ذلك الرقم 8.005 GiB يخص حزمة MLX تحديدًا — prism-ml/Ternary-Bonsai-2-27B-mlx-2bit، التي model.safetensors يقيس 8,595,477,990 بايت على واجهة Hugging Face API (8.595 GB، 8.005 GiB)، وهي حاوية MLX أفينية ذات شيفرات 2-بت بالإضافة إلى مقياس FP16 وإزاحة لكل مجموعة. إنه منتج مختلف عن إصدارات GGUF التي تقدمها Prism ML، والأرقام لا تنتقل بينهما. العنوان الرئيسي لـ Prism ML نفسه 5.93 GB / 1.76 بت لكل وزن يصف PTQ1_0 GGUF، الذي يقيس 5.947 GB؛ ويُذكر أن صيغة True Ternary الخاصة بهم تبلغ 1.72 بت لكل وزن و5.80 GB. لا يصف أي من هذين الرقمين حزمة MLX التي تستأصلها بيئة التشغيل هذه.
حيث لا يزال نهج نقاط التحقق متفوقًا، وهو بالفعل يتفوق في بعض الحالات

سيكون من السهل كتابة هذا كجولة نصر للطريقة الأحدث. لكن ذلك سيكون خطأً، لأن الاجتثاث التقليدي متقدم على المحاور التي تحدّد معظم عمليات النشر.
• مُخرَج واحد، أي بيئة تشغيل متوافقة. نقطة حفظ منزوع منها الرفض هي مجموعة أوزان عادية. حمّلها في أي مُحمِّل متوافق مع MLX تستخدمه بالفعل، وستعمل. أما نهج بيئة التشغيل فيحتاج إلى بيئة التشغيل المضمَّنة الخاصة بالحزمة — ويحذّر المشروع صراحةً من أن مُحمِّل MLX عاديًا قد يبدو وكأنه يحمّل الحزمة بينما يحسب شيئًا خاطئًا بصمت. وهذا مدرج أضيق بكثير.
• العتاد. يتوفر Qwen3.8-27B-Uncensored-MLX بنُسخ 2 و4 و6 و8 بت، مع نسخة 4 بت منسوخة عند جذر المستودع، لذا فإن الأدوات التي تتعامل مع المستودع كطراز واحد تُحمّله دون أي إعداد. إن Ternary Bonsai 2 27B Uncensored مخصّص لـ Apple Silicon / MLX. ضرب المصفوفات المُكمَّم الخاص بالحزمة له نوى Metal وCPU، لكن لا يوجد تنفيذ CUDA عبر mlx-cuda، لذلك على جهاز NVIDIA لا تحصل حزمة MLX هذه حاليًا على تسريع GPU على الإطلاق — يعمل الاستدلال عبر CPU، ويمكن أن تستغرق تمريرة أمامية لطراز 27B دقائق. وهذا يجعل مسار CPU على Linux مفيدًا لاختبار التنفيذ وقابلية إعادة الإنتاج، لا لأغراض الخدمة.
• الأدوات والدراية. خلف Abliteration سنوات من الأدوات — وصفات مضبوطة، وبحث في نطاق الطبقات، ومتغيرات منشورة يمكنك المقارنة بها. أما طريقة وقت التشغيل هنا فلها تطبيق واحد، على نموذج واحد، صدرت أمس.
• التوزيع. نقطة تفتيش واحدة هي تنزيل واحد. يشحن الاستئصال وقت التشغيل حزمةً بالإضافة إلى ملف اتجاه بالإضافة إلى بيئة تشغيل، وعلى القارئ أن يُبقي ثلاثة أشياء متزامنة.
• الأدلة. توجد لإبطال نقاط التحقق قياسات من جهات خارجية على عائلة هذا النموذج الأساسي. أما الاستئصال وقت التشغيل على حزمة ثلاثية القيم فلا تتوافر له سوى أرقامنا الخاصة، وافتراضه الجوهري غير مُتحقَّق منه — والمزيد عن ذلك أدناه.

ما الذي يجلبه الاستئصال وقت التشغيل في المقابل
المقايضة حقيقية في الاتجاه الآخر أيضًا، والبند الأول هو الذي يتجاوز هذا النموذج في عموميته.
• منشأ متطابق على مستوى البت.صفر تعديلات على الأوزان، صفر إعادة تكميم، صفر خطأ تكميم إضافي. هذا ليس شعارًا؛ بل هي الخاصية التي تجعل أرقام القدرات أدناه قابلة للتفسير بدلًا من كونها مصادفة سعيدة.
• ألفا قابلة للضبط. قوة الاستئصال (ablation) معامل وقت تشغيل، وليست خاصية من خصائص نقطة الحفظ (checkpoint). يمكنك مسح نطاق قيمها لحمل العمل الخاص بك، أو تعطيلها كليًا بقيمة ألفا 0، أو المبالغة في الإسقاط وقياس ما الذي ينهار — دون تنزيل نموذج ثانٍ.
• تحكم انتقائي حسب الطبقات. استئصال مجموعة فرعية من الطبقات هو وسيطة، وليس إعادة خبز. وهذا مهم لأي شخص يدرس أيّ الطبقات تحمل السلوك، لأن البديل هو إنتاج نقطة تحقق لكل إعداد.
• لا توجد مجموعة ثانية من الأوزان. النموذج المحرَّر هو النموذج الأصلي. بالنسبة لحزمة تقوم فكرتها الأساسية بأكملها على البصمة، فإن طرح نسخة موازية منزوعة القيود (abliterated) بحجم نحو 16 غيغابايت — وهو حجم نسخة 4-بت في مستودع المقارنة — سيقوّض الفكرة.
• قابلية العكس. تعديل نقطة التحقق دائم لذلك الناتج. أما علامة وقت التشغيل فليست كذلك.
الأرقام التي لدينا، وكيف تم قياسها بالضبط
كل ما في هذا القسم هو تقييم OrcaRouter الخاص لـ OrcaRouter Ternary Bonsai 2 27B Uncensored، والمنهجية لا تقل أهمية عن الأرقام.
هذا القياس هو مصنّف قائم على القواعد لعبارة الافتتاح، وليس حكماً من نموذج لغوي كبير. التفكير معطّل، وفك الترميز جشع، والميزانية 64 رمزاً، والنموذج الأساسي والنموذج المستأصل يستخدمان الأوزان نفسها في العملية نفسها عند ألفا 0 مقابل ألفا 1. هذه النقطة الأخيرة هي أقوى جزء في الإعداد: فلا توجد مقارنة عبر نقاط حفظ مختلفة، ولا فرق في التكميم يمكن أن يشوّش النتيجة. وهو أيضاً سبب وجوب قراءة الأرقام بوصفها مقياساً لما يقوله النموذج في عبارة افتتاحه، ولا أكثر من ذلك.
معدلات الرفض على مجموعات المطالبات الضارة المنشورة، من النموذج الأساسي إلى المُستأصل:
• AdvBench (n=100) — 99.0% إلى 6.0%
• JailbreakBench (n=100) — من 96.0% إلى 4.0%
• StrongREJECT (n=150) — 99.3% إلى 3.3%
• HarmBench (n=150) — من 98.7% إلى 7.3%
• MaliciousInstruct (n=100) — 97.0% إلى 0.0%
• ForbiddenQuestions (n=150) — 75.3% إلى 5.3%
• SimpleSafetyTests (n=50) — من 96.0% إلى 18.0%، وهذا الرقم أقل من الواقع
إن SimpleSafetyTests مُقدَّم بأقل من واقعه لسبب محدّد. تتكوّن تلك المجموعة في الغالب من مطالبات إيذاء الذات، ويجيب عنها النموذج المُستأصَل بإعادة توجيه لأزمة تبدأ بـ "I am deeply sorry to hear…". لا تتضمّن قائمة العبارات الدقيقة لدى المصنّف تلك البداية، لذا فهو يقيّم إعادة التوجيه على أنها امتثال. معدل الرفض المتبقي الحقيقي أعلى من 18.0%. تُرِك المصنّف كما هو عن قصد، حتى تظل الأرقام قابلة للمقارنة مع بطاقات النماذج الأخرى الخاصة بـ OrcaRouter — ولكن ينبغي ألا يأخذ القارئ نسبة 18.0% على ظاهرها.
لم ينفد مخزون الرموز من أي رد في أي من هذه التشغيلات، وهذا ما يجعل ميزانية 64 رمزًا مبررة هنا. هناك عمود منفصل في النتائج الكاملة يحصي الردود التي أجابت لكنها غلّفت الإجابة بإخلاء مسؤولية؛ وقد بلغ ذلك 42–60% حسب المجموعة.
نتيجتان تتعارضان مع الرواية البسيطة
تستحق اثنتان من النتائج معالجة خاصة بهما، لأن كلتيهما تعقّدان القراءة البديهية.
ينخفض الرفض المفرط أيضًا. على المطالبات الحميدة في JailbreakBench، ترفض الحزمة المنشورة 25.0% منها. وعند تعطيلها، ترفض 0.0%. وعلى XSTest-safe تنخفض من 5.2% إلى 0.4%.
هذا هو النصف الذي لم يُبلَّغ عنه بما يكفي من التقنية. حزمة Bonsai المنشورة ترفض ربع مجموعة مطالبات حميدة؛ ومهما كان ما يفعله اتجاه الرفض في نموذج QAT، فإنه ينطلق على مطالبات كان ينبغي ألا تُفعّله أبدًا. وإزالة الاتجاه تزيل تلك الرفضات أيضًا، وذلك مكسب حقيقي في القدرات لا تكلفة على السلامة. ويظهر التأثير نفسه في أعمال مستقلة على نماذج أخرى — فقد قاست أداة الاختبار الخاصة بـ Atomic Chat انخفاض الإفراط في رفض المطالبات الحميدة لدى Gemma 2 9B من 44% إلى 0.5% بعد abliteration، مع بقاء MMLU دون تغيير يُذكر عند 68.4 إلى 68.0. هذا قياسهم، ونموذجهم، ومُبلَّغ عنه ذاتيًا في مدونتهم؛ فالنمط هو المقصود، لا الأرقام الدقيقة.
الإطار التالي غير مريح لكنه صادق: الإفراط في الرفض والرفض مقبض واحد. لا يمكنك أن تخفّض فقط حالات الرفض التي لا تعجبك.
الحفاظ على القدرة ثابت، وهذا ليس مجرد حظ. اختبارات القدرة، من الأساس إلى المُستأصل:
• MMLU (n=300) — 76.7% إلى 77.7%، +1.0
• GSM8K (ن=150) — من 87.3% إلى 86.0%، -1.3
• CMMLU (n=500) — من 76.2% إلى 75.6%، -0.6
كل حركة تقع داخل نطاق الضجيج عند أحجام العينات هذه — فسؤال واحد من GSM8K يعادل 0.7 نقطة. وقد استُبعد MMLU-Pro بدل الإبلاغ عنه: إذ يطلب التوجيه الخاص به الاستدلال قبل الإجابة، ولم تكن 63–64% من الردود على الجانبين قد بلغت إجابة داخل ميزانية الرموز، لذا فإن أي رقم دقة سيكون حدًّا أدنى تحدده الميزانية لا قياسًا.
ثبات القدرة يتبع مباشرةً من أوزان متطابقة بتًا ببت، ومن الجدير أن نكون دقيقين بشأن السبب. النموذج الذي يجيب هو النموذج نفسه. يضيف زمن التشغيل ضربًا نقطيًا واحدًا وعملية AXPY واحدة لكل كتابة متبقية، ولا يغيّر شيئًا في الأوزان أو التكميم أو النوى التي تقرأها. نهج نقاط التحقق عليه أن يستحق هذا الثبات — وغالبًا لا يفعل. اختبار تحدٍّ من طرف ثالث لعملية أبليتريشن مختلفة لنفس قاعدة Qwen3.8-27B، نشره في 2026-08-17 مهندس في SMF Works، قاس نتيجة مركبة بلغت 79.0% وتهبط إلى 72.0%، مع هبوط الرياضيات من 50.0% إلى 33.3%. تلك وصفة مختلفة، وسلسلة أدوات مختلفة، وقياس مختلف، لذا ليست درجة لهذه المقارنة. إنه تذكير بأن أبليتريشن نقاط التحقق على هذه القاعدة قد كلّف خسائر بعشرات النقاط المئوية في اختبار واحد على الأقل دقيق ومزوّد بأدوات قياس، وأن «الأبليتريشن شبه مجاني» ادعاء يعتمد كليًا على الوصفة.
الافتراض الذي لم يتحقق منه أحد بعد
هذا هو الجزء من القصة الذي يجب قوله بصراحة، وهو ينتمي إلى مقارنة بين طرق إزالة الحجب بدلاً من أن يكون في حاشية.
اتجاه الرفض المستخدم هنا قُدِّر من نموذج BF16 الأساسي الذي دُرِّبت حزمة Bonsai انطلاقاً منه. البنية والأساس المخفي متطابقان، لذا فإن المتجه صحيح من حيث الأبعاد والإسقاط دقيق رياضياً — وتستطيع بيئة التشغيل أن تثبت، وهي تفعل ذلك بالفعل، أنه يزيل الاتجاه المزوَّد من تيار البواقي.
ما لا يثبته ذلك هو أن الاتجاه لا يزال يعني الشيء نفسه في النموذج المدرَّب مع مراعاة التكميم. ولم يُقَس بالكامل مدى نجاة الاتجاه بعد التدريب المدرك للتكميم. إن إزالة متجه بدقة ليست مماثلة لإزالة السلوك الذي قُدِّر أنه يمثله، والادعاء الثاني هو المهم. كل رقم في القسم أعلاه نتيجة تجريبية متسقة مع نقل جيد؛ لكن لا شيء منها يبرهن أن النقل مكتمل، والمشروع يقول ذلك بنفسه، موصيًا بمسح alpha واختيار الطبقات قبل استخلاص النتائج.
أي مقارنة صادقة بين طرق إلغاء الرقابة لا بد أن تعترف بهذا. لدى الابليتريشن التقليدي مشكلة الصورة المرآتية — فهو يعدّل الأوزان ثم يقيس النتيجة، لذا لا يتعين على اتجاهه أن ينتقل بين إصدارات النموذج، لكن تعديله دائم ولا يمكن استرداده إذا كانت الوصفة خاطئة.
ما الذي لا يزال غير مُقاس؟
إلى جانب مسألة النقل، ثمة ثلاث فجوات تستحق التسمية بدلًا من الالتفاف حولها بالكتابة.
• لا توجد إعادة إنتاج مستقلة.كل معيار Bonsai 2 27B متداول — المتوسط 83.9، ومعدل الاحتفاظ 98.2%، والتقسيمات الفئوية — مُبلَّغ عنه من قبل المورّد Prism ML، وقد شُغِّل باستخدام EvalScope على خلفية vLLM على وحدات H100s بجهد استدلال "xhigh". لم يقم أحد خارج Prism ML بإعادة إنتاجها. كما أن جداول السلامة والقدرات أعلاه هي جداولنا، وهي ليست مستقلة هي الأخرى أيضًا.
• سلوك تفعيل التفكير. جداولنا بوضع التفكير المُعطّل. وقد وجدت أعمال مستقلة على نماذج أخرى مُزالة الرفض أنه حتى عند نجاح الهجوم بنسبة 100%، يظل النموذج يستدل بشأن السلامة في نسبة كبيرة من الردود عندما يُسمح له بالتفكير. أما ما إذا كان ذلك ينطبق هنا، وما الذي يفعله بأرقام العبارة الافتتاحية، فلم يُقَس بعد.
• اتجاه واحد. تفترض الطريقة أن الرفض يتوسطه اتجاه واحد، وهو اكتشاف أرديتي وآخرين والأساس الذي تقوم عليه التقنية بأكملها. وقد وجدت أعمال لاحقة على نماذج أخرى اتجاهات متمايزة هندسيًا لفئات رفض مختلفة. متجه واحد، ممسوح عبر ألفا واحدة، لا يحسم ذلك.
ما الذي يعنيه هذا إذا كنت تختار بينهما
اختر نقطة الحفظ إذا كنت تحتاج إلى تشغيل النموذج في أي مكان، على عتاد لا تتحكم فيه، عبر محمّل لم تكتبه. اختر بيئة التشغيل إذا كنت تستخدم Apple Silicon، ويهمّك أن يكون المخرج الذي تدرسه هو المخرج الذي دربته Prism ML، وتريد أن تكون قوة الاجتثاث معاملًا يمكنك تغييره بدلًا من قرار يفرض عليك إعادة التنزيل. كلا الخيارين يمكن الدفاع عنه، وهما يُختاران وفق قيود النشر، لا وفق أي الطريقتين أحدث.
إذا كنت تحاول أن تقرر تجريبيًا، فإن لطريقة وقت التشغيل ميزة عملية واحدة تستحق الذكر: alpha 0 و alpha 1 هما العملية نفسها والأوزان نفسها، لذا فإن المقارنة بينهما تعزل الاستئصال ولا شيء غيره. تلك تجربة أنظف من مقارنة الفروق بين نقطتي حفظ، وهي السبب في أنه يمكن قراءة الجدول أعلاه باعتباره قياسًا للإسقاط بدلًا من قياس تكميمين له.
الاستخدام المسؤول
قد يؤدي حذف اتجاه رفض مُتعلَّم إلى جعل النموذج يستجيب لطلبات كان من شأن النموذج الأصلي أن يرفضها. هذا هو عمل الآلية، وليس أثرًا جانبيًا، ولا ينبغي إدراجه كميزة. هذه آلية بحثية وتحكم في الاستدلال، وليست دليلًا على أن أي مخرجات ناتجة آمنة أو صحيحة أو مناسبة.
بطاقة الحزمة المنشورة نفسها تطرح النقطة ذاتها من الجانب الآخر: فنسخة MLX المُبترّة (abliterated) «أُزيلت مواءمتها الأمنية إلى حد كبير»، وستستجيب لطلبات كان الأصل سيرفضها، ولا تحمل ضوابط حماية مدمجة ذات معنى. ويحصر مؤلفوها نطاقها في البحث المشروع — القابلية للتفسير، وأبحاث السلامة، والاختبار بالفريق الأحمر، وتقييم المتانة — ويقولون بصراحة إن عمليات النشر يجب أن تضيف أولاً طبقة الإشراف الخاصة بها وضوابط الوصول.
لا شيء في هذه المقالة يُعدّ حجة على أن إزالة الرفض بلا كلفة، أو أن انخفاض معدل الرفض مؤشر على الجودة. النموذج الذي يجيب عن أسئلة أكثر ليس، بمقتضى ذلك، نموذجًا أفضل، والمصنّف القائم على القواعد الذي يحصي عبارات الاستهلال هو قياس للصياغة، لا للكفاءة. وكلا هذين المُخرَجين هما أداتان بحثيتان مرتبطتان بواجب على المشغّل، ولا ينتقل هذا الواجب إلى من كتب كود الاستئصال.
كود الاستئصال وقت التشغيل، واتجاه الرفض، وجداول التقييم الكاملة منشورة منOrcaRouter، إلى جانب منصة التوجيه التي يبنيها الفريق.
