بطاقة رئيسية لمقال 'Qwen3.8-Flash-Next-Uncensored: Run the Abliterated MoE on llama.cpp and Apple Silicon'، تُظهر العنوان الرئيسي، والعنوان الفرعي 'GGUF + native MLX - حتى سياق 262K'، وثلاث رقاقات مواصفات: 'مقيد على Hugging Face'، '13 نسخة GGUF مكمّمة'، و'إصدار MLX بست بتات'.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: تشغيل الـ MoE المُجرَّد على llama.cpp وأجهزة Apple Silicon

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

قبل أن تُحمّل أي شيء: Qwen3.8-Flash-Next-Uncensored ليس Qwen3.8-27B-Uncensored. إنهما يشتركان في اسم العائلة وفي تقنية إزالة الرفض (abliteration)، لكنهما نموذجان مختلفان من إصدارات أوزان مختلفة، وكل منشور سابق على هذه المدونة بعنوان "Qw​en uncensored" يتحدث عن الإصدار 27B. الموضوع هنا هو الزوج الذي نشرته OrcaRouter على Hugging Face في 26 أغسطس 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF وorcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — وهما نسختان معدّلتان بإزالة الرفض من Qwen3.8-Flash-Next، وهو نموذج موجه مختلط الخبراء (routed mixture-of-experts) من Alibaba بسعة 176B مخزّنة / 6B نشطة، ويستعرض بنية Qwen4. أعلنّا عن هذا الإصدار بوصفه "GGUF + MLX أصلي، مع سياق يصل إلى 262K"، موجهًا إلى باحثي الأمن، والفرق الحمراء والزرقاء. هذا الدليل كتبناه من بطاقات النماذج الخاصة بنا: ماذا تفعل إزالة الرفض داخل موجه MoE، وما التكلفة الفعلية لادعاء سياق 262K من حيث الذاكرة، وكيفية خدمة سطري الملفات معًا، وأين يقع الخط البحثي. إذا وصلت إلى هنا بحثًا عن مقدمة الأبليتريشن أو حسابات تكميم 27B، فإن المنشورات السابقة في هذه السلسلة تغطي هذين الموضوعين.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

أولاً، البوابة

كلا المستودعين مقيدان على Hugging Face (gated: auto). لا يتم تنزيل أي ملفات حتى تسجل الدخول وتقبل شروط المستودع في كل مستودع — مستودعا GGUF وMLX يحمل كل منهما بوابة خاصة به. هذا هو الفرق العملي الأكبر عن خط GGUF غير المقيد: الأمر البسيط «just hf download» يفشل بخطأ مصادقة قبل جلب أي بايت. التدفق هو:

• سجّل الدخول إلى Hugging Face (أو أنشئ حسابًا) وثبّت huggingface_hub، ثم شغّل hf auth login مرة واحدة حتى يكون رمزك على القرص.

• افتح {{1}}orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF{{/1}} في المتصفح، وافق على الشروط، ثم كرر الأمر نفسه مع {{2}}orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX{{/2}}.

• من ذلك الحين، يعمل تنزيل hf باستخدام رمز المصادقة الخاص بك مثل أي مستودع آخر. كل نموذج مكمّم تسحبه، وأوزان MLX، هي قطعة أثرية بحثية بموجب Apache-2.0 — نفس ترخيص النموذج الأساسي — والبوابة جزء من الصفقة: قراءة الشروط هي الخطوة الأولى لاستخدام النموذج.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

ما الذي يفعله abliteration بـ MoE الموجّه؟

التقنية هي تعديل الوزن بأسلوب أرديتي الذي غطيناه سابقًا في هذه المدونة؛ الجزء المثير للاهتمام هو ما تفعله بهذه البنية تحديدًا. في النموذج الكثيف 27B، كان عدد المصفوفات المتبقية 131. أما في Qwen3.8-Flash-Next-Uncensored، فسجل بطاقة طراز MLX تطبيق الإبطال على 149 موترًا لكتابة المتبقيات، والمكونات التي تجعل هذا النموذج ما هو عليه — موجه MoE، وجدول تضمين n-gram بحجم 51B، وبرج الرؤية — لم تُمس صراحةً أبدًا.

إن عبارة "لم يُلمَس" هي القصة كلها لنموذج موجَّه. كل توكن ينشّط 10 من أصل 512 خبيرًا؛ ولا يوجد خبير واحد يملك قرار الرفض. سلوك الرفض يسكن في التيار المتبقي الذي يؤلف المخرجات النهائية، وهو بالضبط الاتجاه الذي يزيله التعامد. لذا يظل الموجّه يرسل الخبراء أنفسهم، ويظل جدول n-gram ينتج التضمينات نفسها، وما يتغير هو ما يقوله النموذج بمجرد تشغيل إسقاط المخرجات. الفحوصات المنشورة في بطاقة نموذج GGUF تصف شكل هذا التغيّر بأنه: انخفاض رفض المطالبات الضارة من 64–100% في النموذج الأساسي إلى نحو 0–3.3% في هذا الإصدار، والرفض المفرط غير المؤذي قرب 0%، والقدرات ضمن ±2 نقطة من الأساس في فحوصات من نمط MMLU-Pro / GSM8K / CMMLU. هذه أرقام البطاقة نفسها، مُبلَغ عنها ذاتيًا لا مُعاد إنتاجها بشكل مستقل.

رأس MTP: موجود في MLX، محذوف في GGUF

تأتي Qwen3.8-Flash-Next مع رأس تخمين متعدد الرموز بحوالي 4B (multi-token-prediction speculative head)، والبناءان يختلفان عليه. مستودع GGUF يستبعده — والبطاقة توضح أن هذه الملفات لا تتضمن رأس المسودة التخمينية mtp — لأن دعم llama.cpp لـ qwen4exp لا ينفذ MTP بعد، لذا سيكون الرأس وزنًا زائدًا في الملف. بناء MLX يحتفظ به، لذا على Apple Silicon لا تزال تحصل على فك الترميز التخميني. النتيجة العملية، التي يؤكدها الممارسون الذين يشغلون النموذج الأساسي: مسار llama.cpp GGUF يعمل بدون فك ترميز تخميني اليوم، بينما إعداد SGLang المفعّل بـ MTP يضاعف فك الترميز بأكثر من الضعف على نفس فئة الأجهزة. إذا قام llama.cpp يومًا ما بتطبيق MTP لـ qwen4exp، فسيحصل خط GGUF على تسريع مجاني — لكن لا تشترِ أجهزة متوقعًا ذلك هذا الأسبوع.

ادعاء سياق 262K، وما هي تكلفة ذاكرة التخزين المؤقت KV

السياق الأصلي هو 262,144 رمزًا (قابل للتوسيع عبر YaRN نحو 1M)، والقيود التي تؤثر فعليًا هي الذاكرة. الخبر الجيد هو أن البنية تحافظ على صغر حجم ذاكرة التخزين المؤقت KV: من بين 48 طبقة، تستخدم 36 طبقة انتباهًا خطيًا Gated DeltaNet، الذي يضغط التاريخ في حالة متكررة ثابتة الحجم، وطبقات الانتباه الكامل الـ12 فقط تحمل ذاكرة تخزين مؤقت KV تقليدية تنمو مع طول التسلسل.

نقطتا بيانات مُقاسَتان من المجتمع، كلتاهما على النموذج الأساسي، تنطبقان مباشرةً. نشرٌ باستخدام 4 بطاقات RTX 3090 مع GGUF أفاد بالانتقال من سياق 65 ألفًا إلى 131 ألفًا مع إضافة ~0.78 جيجابايت فقط من KV لكل بطاقة، بينما شغّل نظام DGX Spark واحد سياقًا كاملًا بطول 262 ألفًا بملف من فئة Q4 مع إبقاء النموذج محمّلًا في ~76.9 جيجابايت من تجمّع 128 جيجابايت، عبر تثبيت جدول n-gram على وحدة المعالجة المركزية وربطه من NVMe باستخدام mmap. سطر الميزانية الخاص ببطاقة نموذج GGUF هو: الإجمالي = حجم الملف + ذاكرة التخزين المؤقت KV + mmproj البالغ ~0.9 جيجابايت. الخلاصة لاختيار التكميم: عند 262 ألفًا، تُعد ذاكرة التخزين المؤقت KV بندًا حقيقيًا، لكن الأوزان هي البند المهيمن، لذا ينطبق نفس منطق "ذاكرة الفيديو أولًا" من دليل 27B GGUF — والفرق هنا هو أحجام الملفات نفسها، التي تتراوح من IQ2_XXS بحوالي 52 جيجابايت إلى Q5_K_M بحوالي 125 جيجابايت.

خط GGUF: 13 مستوى تكميم، ملفات مقسمة، mmproj، وبناء llama.cpp

يوفّر مستودع GGUF 13 مستوى تكميم — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — حيث بُنيت تكميمات IQ من مصفوفة أهمية مستندة إلى نصوص معايرة بالإنجليزية والصينية والبرمجة. كل مستوى تكميم متعدد الأجزاء، ومقسّم باستخدام llama-gguf-split، لذا نزّل المجموعة الكاملة للمستوى المطلوب ووجّه المُحمّل إلى الجزء ...-00001-of-000NN.gguf. لا توجد درجات Q6_K أو Q8_0 أو F16، والسبب هيكلي وليس اقتصاديًا: جدول تضمين n-gram (PLE) هو موتر واحد أكبر من أن يلبي حد Hugging Face البالغ 50 جيجابايت لكل ملف عند 6 بت فأكثر، ولا يمكن تقسيم موتر GGUF واحد عبر ملفات — لذا تتوقف السلسلة عند Q5_K_M.

الملف الآخر الذي يجب ألّا تتخطاه هو mmproj-...-F16.gguf، بحجم يقارب 0.9 جيجابايت: هذا نموذج لغة ورؤية (vision-language)، وllama.cpp يحتاج إلى المُسقِط (projector) لأي إدخال صورة. Qwen3.8-Flash-Next متعدد الوسائط، وكذلك هذا الإصدار — عملية abliteration لا تمس برج الرؤية.

دعم llama.cpp ليس في الفرع الرئيسي بعد. معرف البنية هو qwen4exp، والبنيات القياسية تفشل مع رسالة "unknown architecture 'qwen4_exp'"؛ تحتاج إلى بناء من PR #27742 (الفرع qwen4exp/qwen3.8-flash-next)، مُجمَّع مع أهداف llama-cli وllama-mtmd-cli وllama-server وllama-gguf-split. من هناك، يكون شكل الخدمة هو خادم llama.cpp المعتاد مع علامات خاصة بـ Qwen، باستخدام اسم الكم من ملفات الأجزاء:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

اضبط -c على أي سياق يمكنك استيعابه؛ مثال البطاقة يبدأ من 8192. الاستدلال مفعّل افتراضيًا ويُعاد في reasoning_content، ويعمل استدعاء الأدوات عبر نقطة النهاية المتوافقة مع OpenAI. قيم أخذ العينات أعلاه هي توصية بطاقة النموذج؛ يستخدم الممارسون على النموذج الأساسي temp 0.7 / top-p 0.80 / top-k 20 مع عقوبة حضور 1.5 في وضع التعليمات غير التفكيري، ويضبطون عمق الاستدلال باستخدام --chat-template-kwargs {"reasoning_effort":"medium"}.

إصدار MLX على Apple Silicon

مستودع MLX هو المسار الأصلي لشرائح Apple Silicon: نفس الأوزان، نفس إزالة الرفض، وبيئة تشغيل أصلية مبنية على Metal. يأتي الإصدار الافتراضي بدقة 4-بت (حوالي 163 جيجابايت)، والإصدار المُعلن بدقة 6-بت (حوالي 192 جيجابايت)، وفئة بدقة 8-بت (حوالي 221 جيجابايت)، ولأن الخبراء ثلاثيي الأبعاد المندمجين وجدول n-gram يُحفظان بدقة أعلى من التصنيف الاسمي، فإن الدقة الفعلية تتجاوز بكثير مستوى 4-بت الموحّد — وتُدرج البطاقة حوالي 7.85 بتًا فعليًا لكل وزن بالنسبة لوسم "4-بت". لهذا تبدو أحجام المستودع كبيرة: جدول n-gram لا يُسحق بالطريقة التي تسحقه بها إصدارات التكميم المجتمعية.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

الأجهزة هي القيد الملزِم. يعمل MLX فقط على Apple Silicon (Metal)، وتحتاج إلى ذاكرة موحّدة للأوزان — سطر بطاقة النموذج هو "جهاز Mac بذاكرة موحّدة كافية للأوزان البالغة 163 جيجابايت (مثل M-series Ultra)". تعامل مع طبقة 4-bit كجهاز من فئة 192 جيجابايت، وبناء 6-bit كجهاز من فئة 256 جيجابايت. تسجّل بطاقة النموذج مجموعة الميزات الكاملة — qwen4_exp، MoE، MTP، استدعاء الدوال، الرؤية-اللغة — وتُدار عبر mlx-vlm لإدخال الصور. يتضمن هذا رأس MTP التخميني، وهو الميزة الخفية لبناء MLX مقارنةً بخط GGUF.

مسار الرؤية، لمن يستخدمونه

بما أن هذا نموذج رؤية-لغة، فإن المسار المتعدد الوسائط يُعد جزءًا من دليل الإجراءات وليس مجرد إضافة اختيارية. على منصة llama.cpp، يتطلب إدخال الصور كلاً من مُسقط mmproj وإصدارًا يتضمن llama-mtmd-cli / llama-server. أما على MLX، فتديره بواسطة mlx-vlm بدلاً من مشغّل mlx-lm النصي فقط. بالنسبة لفرق الاختبار الأمني، يقع العمل التقييمي المثير للاهتمام في مسار الرؤية: حواجز الحماية متعددة الوسائط، وحقن الأوامر عبر صورة، وOCR ضد لقطات شاشة أنظمتك الخاصة، والصور العدائية الموجهة إلى خط المعالجة بأكمله. وبما أن إزالة الرفض (abliteration) تشمل النموذج الكامل وتُبقي برج الرؤية سليمًا، فإن صورةً كانت ستؤدي إلى تحفيز الرفض في رأس النص تصل ببساطة إلى نموذجٍ لا يوجد فيه سلوك رفض ليعترضها. تذكر بطاقة GGUF أنه تم التحقق من الرؤية واستدعاء الأدوات متعدد الجولات في هذا الإصدار؛ ولم يتم نشر مجموعة تقييم رؤية منفصلة.

ما الغرض من هذا، وأين يقع الحد

هذا الإصدار موجود لفئة واحدة من العمل: تقييم ما يمكن لنموذج مجرَّد من الرفض أن يفعله، بهدف فهم الأنظمة والدفاع عنها. بالنسبة للفريق الأحمر، يعني ذلك اختبار حواجز الأمان الخاصة بك ضد نموذج لن يرفض بأدب — مقاومة حقن البرومبت، وسيناريوهات تسريب البيانات، وإساءة استخدام الأدوات، والفجوة بين «النموذج الأساسي يرفض» و«النموذج لا يستطيع فعل هذا فعلًا». تلك الفجوة هي جوهر القيمة البحثية للإصدار المُجرَّد من الرفض: فهي تخبرك بما كانت طبقة الرفض تُخفيه، وهو الفرق بين الأمن عبر السياسة والأمن عبر القدرة. بالنسبة للفريق الأزرق، فإن الأوزان نفسها هي خط الأساس المعقول للخصم: إذا استطاعت جهة معادية تنزيل هذا وتشغيله، فإن دفاعاتك تحتاج إلى الصمود أمام نموذج يجيب بدلًا من أن يمتنع. التقييمات المبنية عليه هي حد أدنى لما يمكن لنموذج مخصص لم يُخضع لمواءمة أبدًا أن يفعله — تعامل معها على هذا الأساس، لا كسقف.

كن واضحًا بشأن ما يغيّره إزالة الرفض وما لا يغيّره. فهو يغيّر سلوك المخرجات — إذ لم يعد النموذج يرفض — لكنه لا يغيّر القدرة. لا معرفة جديدة، ولا مهارات جديدة، ولا قدرة حاسوبية جديدة؛ بل نفس التدريب، ونفس القيود على ما يمكن للنموذج إنتاجه فعلًا. لا يمكن لنموذج مُجرَّد من الرفض (abliterated) أن يهندس برمجيات خبيثة لم يكن قادرًا عليها سابقًا؛ إنه ببساطة يجيب بدلًا من التحفّظ، ومخرجاته ليست أكثر صدقًا لمجرد أنها أكثر تساهلًا. نطاق القدرة البالغ ±2 نقطة في البطاقة وانهيار أرقام الرفض هما الحقيقة ذاتها من وجهين.

أين يقع الخط الفاصل هو اتفاقية المستودع المقيد، وهي ليست مجرد صياغة نمطية. الاستخدام المشروع: تقييم أنظمتك الخاصة، والبحث العلني عن الثغرات في النماذج، وبناء أدوات الكشف والتقييمات الدفاعية، ودراسة آليات الرفض. غير المشروع: نشر هذا النموذج كمساعد موجّه للمستخدمين، أو توليد برمجيات خبيثة أو استغلالات عملية ضد أنظمة لا تملكها أو لا تملك إذنًا لاختبارها، أو الاحتيال، أو مواد الأسلحة. ترخيص Apache-2.0 والقانون المعمول به هما الحد الأدنى؛ أما البوابة فهي اتفاقية الغرض البحثي الصريحة التي تأتي فوق ذلك. إذا كانت حالة استخدامك هي "إطلاق روبوت محادثة للمستخدمين"، فهذا النموذج ليس نموذجك — وهذا مقصود، وليس إغفالًا.

كيفية الحصول على خط الأساس المُقدَّم

هذه الأوزان محلية فقط عن قصد: حمولات استطلاع الفريق الأحمر يجب ألا تمر عبر واجهة برمجية لطرف ثالث، والنقطة الأساسية هي الاستضافة الذاتية. عندما تريد خط الأساس الخاضع للرقابة والمقدَّم عبر الخدمة للمقارنة — Qwen3.8-Flash من Alibaba بسعر 0.16 دولار لكل مليون إدخال و0.47 دولار لكل مليون إخراج — يقوم OrcaRouter بتوجيهه بسعر القائمة لدى المزود مع هامش ربح 0% وتبديل تلقائي عند الفشل، بحيث يمكن لمنصة التقييم التنقل بين القاعدة المستضافة وبنيتك المحلية غير الخاضعة للرقابة باستخدام مفتاح واحد وبدون عقد ثانٍ. أوزان Qwen3.8-Flash-Next المفتوحة ليست في كتالوجنا بعد؛ عندما يقوم وقت تشغيل نوجّهه بحملها، ستستقر في نفس الإعداد ذي المفتاح الواحد وسعر القائمة.

ابدأ من هنا

حدد الخط الذي يناسب أجهزتك، ثم اقرأ البوابة ذات الصلة. على جهاز Mac بذاكرة موحّدة سعتها 128 جيجابايت أو أكثر، يمنحك إصدار MLX دعم MTP والرؤية في مكان واحد — اقبل شروط مستودع MLX، واسحب الأوزان بدقة 4-بت أو 6-بت، وشغّلها عبر mlx-vlm. على أجهزة NVIDIA أو AMD أو جهاز بمعالج CPU، ابنِ llama.cpp من PR #27742، واقبل شروط مستودع GGUF، واسحب نموذج كمّي مناسب، ولا تنسَ ملف mmproj. في كلتا الحالتين، أرقام الرفض ونطاق القدرات هي من إنتاج المستودع نفسه، منشورة على بطاقة النموذج ولم تتم إعادة إنتاجها حتى كتابة هذه السطور — والطريقة الصادقة لقراءتها هي اعتبارها قياسًا من البائع لتعديله الخاص، لا تدقيقًا مستقلًا. البوابة، والترخيص، وحدود الأمان الواردة أعلاه هي النص نفسه من ثلاث زوايا: هذه أداة بحثية، وقد صدرت على هذا الشرط.

جميع إصدارات Flash-Next الخمسة — BF16 وGGUF وMLX وFP8 وNVFP4 — مجمعة في مجموعة Qwen3.8-Flash-Next-Uncensored على Hugging Face.

لا ينبغي الخلط بينه وبين عائلة 27B: Qwen3.8-27B-Uncensoredهو نموذج مختلف مُجرَّد من قاعدة مختلفة، وله مجموعته الخاصة ودفاتر تشغيله الخاصة. نفس التقنية، أوزان مختلفة.

هذه الأوزان محلية فقط بحكم التصميم. للحصول على خط أساس مستضاف لقياس البناء المُجرَّد من المحاذاة مقابلَه، Qwen3.8-Flash يُقدَّم على OrcaRouter بسعر قائمة المزود بدون أي هامش ربح — النموذج الأصلي مع محاذاة السلامة سليمة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube