
Qwen3.8-Flash-Next-Uncensored-NVFP4: دليل تشغيل الخادم على Blackwell
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Qwen3.8-Flash-Next-Uncensored-NVFP4 يعمل على عائلة واحدة فقط من وحدات معالجة الرسومات: Blackwell. تنفذ NVFP4 على أنوية التنسور FP4 العتادية، بينما Hopper (H100/H200) وأي شيء أقدم ببساطة لا يمتلكها. إذا كنت تستخدم Hopper، توقف هنا — الإصدار Qwen3.8-Flash-Next-Uncensored-FP8 هو الذي تريده. كل ما يلي يفترض استخدام Blackwell (B100، B200، GB200، أو بطاقة من سلسلة RTX 50)، وإصدار حديث من vLLM مع دعم qwen4_exp، و transformers ≥ 5.16.
هذا هو تكميم NVFP4 للنسخة المُجرّدة من الرفض (التي أُزيل منها الرفض) لـ Qwen/Qwen3.8-Flash-Next، المُقتطعة من 330 جيجابايت بصيغة BF16 إلى 178 جيجابايت على القرص. وقد نشرته OrcaRouter إلى Hugging Face في 27 أغسطس 2026 باسم orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. المستودع مقيد: يجب أن تكون قد سجّلت الدخول إلى Hugging Face وقبلت شروط المستودع، أو hf download و vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 كلاهما يفشلان مع خطأ مصادقة قبل نقل أي بايت. هذه الصفحة هي دليل تشغيل الخدمة، وليست تغطية إطلاق — عمر هذا البناء يومان، والأسئلة التي يواجهها الناس فعليًا هي العتاد، والأعلام، وأي بناء يختارون.

وقبل أن تبدأ الأرقام: Qwen3.8-Flash-Next-Uncensored ليس Qwen3.8-27B-Uncensored؛ إنهما نموذجان مختلفان يتشاركان اسم عائلة وتقنية إزالة الحجب (abliteration) — أوزان أساسية مختلفة، وبنيات مختلفة، ومجموعات Hugging Face مختلفة. تم اشتقاق Flash-Next بإزالة الحجب من Qwen/Qwen3.8-Flash-Next، وهو معاينة لبنية Qwen4 (qwen4_exp) تعتمد على خليط الخبراء الموجّه: 512 خبيرًا مع عشرة خبراء موجّهين بالإضافة إلى خبير مشترك نشط، وانتباه هجين (طبقات Gated DeltaNet الخطية إلى جانب طبقات الانتباه الكامل)، واتصالات فائقة (Hyper-Connections)، وتضمين PLE للـ n-gram، وبرج رؤية وفيديو أصلي، ورأس فك تشفير تخميني MTP. تم اشتقاق 27B بإزالة الحجب من Qwen/Qwen3.8-27B، وهي قاعدة كثيفة مختلفة تمامًا. لا يُنقل أي شيء من أرقام التشغيل في صفحة 27B إلى هذا النموذج؛ وحيثما تكون صفحة 27B مفيدة فعلًا — الدليل التمهيدي لإزالة الحجب، والحسابات العامة لاختيار التكميم — فهي مرتبطة أدناه مع ما يُنقل وما لا يُنقل.

ما هي هذه البنية، دقةً بدقة
Qwen3.8-Flash-Next هو نموذج خليط خبراء موجَّه (MoE): كل توكن ينشّط 10 من أصل 512 خبيرًا بالإضافة إلى خبير مشترك واحد، وبضعة مليارات فقط من المعاملات تكون نشطة لكل توكن رغم أن النموذج المخزَّن أكبر بكثير. إصدار NVFP4 هو تكميم موترات مضغوط بدقة مختلطة لتلك الحزمة، والتقسيم هو جوهر القصة:
• أوزان خبراء MoE — NVFP4 (4-بت، NVIDIA FP4 E2M1، تجميع 16 مع مقاييس كتلة FP8).
• الانتباه (self_attn.{q,k,v,o})، إسقاطات linear_attn، الخبير المشترك، وlm_head — FP8 (8 بت).
تضمين n-gram الخاص بـ PLE، وتضمينات التوكن والرؤية، وHyper-Connections، ومفهرس QSA، وGated-DeltaNet conv/dt، وجميع عمليات التطبيع، وبرج الرؤية بأكمله — BF16، محفوظ بدقة كاملة.
ثلاث خصائص للتحويل تهم أكثر من تقسيم الدقة نفسه. أولاً، إنه خاص بالأوزان فقط: إذ يتم تكميم التفعيلات ديناميكيًا في وقت التشغيل، ولا توجد معايرة ثابتة، والأوزان مشتقة مباشرةً من نقطة تفتيش BF16 (وتصف البطاقة هذا الاشتقاق بأنه بدون بيانات). ثانيًا، تعديل الإزالة (abliteration) مدمج في الأوزان، لذا فإن إزالة الرفض تصمد أمام التكميم — التحويل إلى 4 بت هو تغيير في الدقة، وليس تدخلًا في الأمان. ثالثًا، لا يتم تكميم ذاكرة التخزين المؤقت KV؛ إذ تبقى بصيغة BF16 أثناء التشغيل. من السهل تفويت هذه النقطة الأخيرة، وهي مهمة في سياق النموذج الأصلي البالغ 262,144 رمزًا، حيث تشكّل ذاكرة KV بندًا حقيقيًا في استخدام الذاكرة إلى جانب الأوزان.
الحجم على القرص يهيمن عليه موتر واحد. تصف البطاقة تضمين n-gram الخاص بـ PLE كموتر واحد يضم حوالي 66 مليار معامل، محفوظ بصيغة BF16 حسب التصميم؛ وهو أكبر جزء وهو السبب في أن حجم البناء يبلغ 178 جيجابايت بدلاً من رقم أصغر. هناك تباين يجب الإشارة إليه بدلاً من التغاضي عنه: بطاقة FP8 الشقيقة تسمي نفس الجدول باسم n-gram الخاص بـ PLE بـ 51 مليار معامل، وتشير ملاحظة W4A4 في هذه البطاقة إلى أنه يبلغ حوالي 100 جيجابايت. تذكر البطاقتان أرقامًا مختلفة لنفس الجدول، لذا تعامل مع كل رقم كرقم خاص ببطاقته — وعند تقدير حجم النشر، افترض أن الجدول كبير بصيغة BF16 وخطط حول ذلك.
الشرط المسبق للأجهزة، موضحًا بالتفصيل
هذا هو أقصر وأهم قسم في الصفحة. NVFP4 هو تنسيق من بلاكويل: المسار السريع هو عملية GEMM أصلية بدقة FP4 على أنوية الموتر من الجيل الخامس، وبدون هذا العتاد لا يملك التنسيق ما يعمل عليه. سطر متطلبات البطاقة صريح — وحدة معالجة رسومية من بلاكويل (B100 / B200 / GB200 / RTX 50-series)، لأن NVFP4 يستخدم أنوية الموتر FP4 المادية، ولن يعمل على Hopper (H100/H200) أو الأقدم، التي تفتقر إلى دعم حوسبة FP4.
عمليات إعادة التوجيه، في مكان واحد:
• على Hopper (H100/H200) — قم بتقديم Qwen3.8-Flash-Next-Uncensored-FP8 بدلاً من ذلك. إنها نفس الأوزان بدقة 8-بت، وتعمل على Hopper وBlackwell، وهي الإصدار الذي يغطيه دليل FP8 الخاص بهذه المدونة.
• على وحدة معالجة رسوميات NVIDIA الاستهلاكية أو على جهاز بوحدة معالجة مركزية — بناء GGUF بمستويات التكميم الثلاثة عشر من llama.cpp هو المسار المحلي.
• على Apple Silicon — إصدار MLX، بطبقات 4/6/8-بت، هو مسار Metal الأصلي.
إن متطلب وقت التشغيل مُلزم تمامًا مثل السيليكون. إن qwen4_exp هي بنية جديدة كليًا، لذا سترفض إصدارات vLLM الجاهزة التي سبقتها تحميل نقطة التحقق. تحتاج إلى إصدار حديث من vLLM يدعم qwen4_exp، بالإضافة إلى قارئ NVFP4 من compressed-tensors (يُكتشف التنسيق من config.json وليس اختيارًا يدويًا)، ونسخة transformers ≥ 5.16. ويتطلب الإدخال متعدد الوسائط أيضًا حزمة الرؤية الخاصة بـ Qwen في بيئة التشغيل؛ بينما يعمل تقديم النصوص فقط بدونها.
أمر خدمة البطاقة، علمًا علمًا
استدعاء بطاقة النموذج نفسه نقطة بداية جيدة، ومن المفيد فهم الغرض من كل علامة بدلاً من النسخ واللصق بشكل أعمى:
vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder
• --tensor-parallel-size 4 — تبلغ الأوزان ~178 جيجابايت على القرص، لذا توزّعها البطاقة على أربع وحدات GPU. هذا هو الشكل الذي صُمم البناء على أساسه؛ لا تعتبره اقتراحًا.
• --trust-remote-code — مطلوب لبنية مخصصة. كود النمذجة الخاص بـ qwen4_exp ليس في سجل transformers القياسي بعد، لذا يقوم vLLM بتحميل كود البنية من المستودع. أنت تثق بهذا الكود، وهو قرار طبيعي لكنه حقيقي لبنية جديدة كليًا.
• --enable-expert-parallel — يوزّع الخبراء عبر مراتب التوازي الموتر بدلًا من تكرارها، وهذا ما يجعل نموذج MoE ذا 512 خبيرًا ممكنًا عند TP4. البطاقة الشقيقة FP8 تذكر السبب الأوضح على هذا البناء: بدونه، لا يكون العرض الوسيط لـ MoE مقسومًا على TP قابلاً للقسمة على حجم كتلة FP8. تعامل معه كشرط مطلوب، وليس اختياريًا.
• --enable-auto-tool-choice and --tool-call-parser qwen3_coder — يعملان معًا على تفعيل استدعاء الدوال. يتيح خيار auto للنموذج تحديد ما إذا كان سيستدعي أداة أم لا، ويقوم محلل qwen3_coder بفك ترميز تنسيق استدعاء الأدوات، وهو نفس عائلة المحللات التي تستخدمها نماذج Qwen3.8-27B وQwen3.8-Flash-Next.
بمجرد تشغيله، تحمل نقطة النهاية المتوافقة مع OpenAI في /v1/chat/completions مجموعة الميزات الكاملة عبر حزمة Qwen4 في بيئة التشغيل: استدعاء الأدوات كما هو مذكور أعلاه، والاستدلال عبر chat_template_kwargs.enable_thinking، والرؤية عبر أجزاء محتوى image_url. لا تحتاج إلى خادم منفصل للوسائط المتعددة؛ فهي نفس نقطة النهاية.
ملاحظة هيكلية واحدة من البطاقة: لا يوجد متغير W4A4 ثابت تمامًا لهذا البناء، ولن يكون هناك واحد بتكلفة زهيدة. يتطلب التحويل الثابت W4A4 تمريرًا أماميًا لمعايرة التنشيط، ويجب أن يحمل هذا التمرير تضمين n-gram بحجم ~100 جيجابايت على GPU واحدة. هذا هو السبب نفسه الذي يجعل جدول PLE يهيمن على قائمة الملفات، وهو السبب وراء بقاء هذا البناء مقتصرًا على الأوزان فقط مع تنشيطات ديناميكية.
تقارير ميدانية من المجتمع — كيف يبدو هذا الأمر فعليًا في الواقع
لا توجد أرقام مُعلنة حول الإنتاجية أو زمن الاستجابة لهذا المستودع تحديداً، وهذه الصفحة لن تخترعها. ما هو موجود فعلاً هو مجموعة متنامية من التقارير الميدانية من ممارسين يخدمون إصدارات Qwen3.8-Flash-Next NVFP4 — نفس البنية، نفس تقسيم الدقة NVFP4/FP8/BF16، مع استبعاد تعديل "الإزالة" (abliteration) — وسلوك الخدمة ينتقل مباشرة. هذه نتائج مجتمعية، وليست توجيهات من البائع، والأشخاص الذين أبلغوا عنها كانوا يعملون على أجهزة Blackwell بنفس نظام التكميم.
• فك الترميز التخميني MTP هو أكبر رافعة أداء على الإطلاق. يأتي النموذج مع رأس مسودة متعدد التنبؤ بالرموز، وعلى أحد معالجات RTX PRO 6000 (96 جيجابايت، SM120) تُحمَّل وحدة MTP مكمَّمة إلى NVFP4 بحوالي 0.51 جيجابايت من ذاكرة الفيديو — وقد قاس التقرير طول قبول يتراوح بين 2.3 و3.9 من أصل 4 كحد أقصى، ومعدل قبول يتراوح بين 0.86 و0.96. كما قاس التقرير نفسه متوسط فك ترميز أحادي التدفق يتراوح بين 180 و226 رمزًا/الثانية (216.9 في البرمجة، و225.8 في حمل عمل استدعاء أدوات الوكيل، و136.6 في الاستدلال) مقابل خط أساس يبلغ نحو 105 رموز/الثانية، وأجاب على استعلام من 216,685 رمزًا في 8.4 ثانية. تعامل مع الأرقام باعتبارها من إعدادات جهاز شخص واحد، وليست مواصفة رسمية.
• قم بتفريغ تضمين n-gram الخاص بـ PLE إلى ذاكرة RAM المضيفة.نظرًا لأن الجدول ضخم ونادرًا ما يكون عنق الزجاجة في الإنتاجية، فإن الحلول المجتمعية على بطاقات Blackwell الفردية تثبّته على المضيف (حوالي 50 جيبي بايت من ذاكرة RAM الحرة للمضيف في تقرير RTX PRO 6000) وتقوم بتعيينه عبر mmap من NVMe، مما يقايض القليل من زمن الاستجابة مقابل إمكانية احتواء النموذج بالكامل. توقع القيام بشيء مماثل إلا إذا كانت ميزانية ذاكرة الفيديو (VRAM) كبيرة جدًا.
• ثبّت نافذة السياق بشكل صريح. مع تفعيل ذاكرة التخزين المؤقت KV بصيغة BF16 وMTP، تضخم تجمّع KV بحجم تلقائي ليجاوز ما يمكن للبطاقة استيعابه، مما أدى إلى نفاد الذاكرة (OOM) أثناء مرحلة التعبئة المسبقة الطويلة؛ أدى تثبيت max-model-len / max-total-tokens عند 262144 إلى استعادة مساحة التشغيل. عند سياق يبلغ 262 ألف، تُعد ذاكرة التخزين المؤقت KV بندًا في الميزانية تحتسب له، وليست خيارًا افتراضيًا.
• خطأ في الضبط التلقائي لـ FlashInfer يُفسد المخرجات بصمت. أهم نمط فشل في الميدان: الضبط التلقائي يختار تكتيكات نواة MoE المندمجة بناءً على زمن الاستجابة فقط ولا يفحص الدقة العددية أبدًا، لذا تحت بعض الأشكال ينهار فك التشفير إلى رمز متكرر. أعاد تقرير RTX PRO 6000 إنتاجها كـ 36 من أصل 36 حالة توليد تالفة عند تفعيل الضبط التلقائي، مقابل 0 من 36 عند تعطيله — والحل البديل هو تعطيل الضبط التلقائي لـ FlashInfer (في vLLM، استخدم --no-enable-flashinfer-autotune؛ وفي SGLang، استخدم --disable-flashinfer-autotune). إذا تدهورت مخرجاتك المُقدَّمة فجأة، فتحقق من هذا قبل أي شيء آخر.
• يتطلب DGX Spark (GB10, SM121) تصحيحات خاصة به. لا تتسع أوزان NVFP4 (نحو 126 GiB في البنية المجتمعية) في ذاكرة Spark واحدة بسعة 128 GB، لذلك تشغّل وصفات SGLang التوازي التوتري بعامل 2 عبر عقدتين باستخدام RoCE، ويشترط محلل فك التشفير المتناثر QSA مرور نواة FlashInfer السريعة عبر فحص is_sm100_supported() الذي يفشل على SM121، فيُستخدم مسار بديل ينهار أثناء الإحماء — والحل تصحيح صغير مع تفريغ PLE. توقّع معدل فك يبلغ ~47–50 tok/s، ويصل ذروته إلى نحو 70 مع MTP4 ورسوميات CUDA، وتحقق من أن نواتك تعمل فعليًا على SM121 قبل أن تعد بمعيار أداء.
الاستدلال، واستدعاء الأدوات، والرؤية عبر حزمة Qwen4
إجماع المجتمع على جيل Qwen3.8 ينتقل إلى هذا النموذج مع التحذير المعتاد بأنه ممارسة ميدانية، وليس توجيهًا من البائع.
• reasoning_effort هو المؤشر الأكثر أهمية.قالب المحادثة يضبط افتراضيًا على xhigh، مما يجعل النموذج يفكر مطولًا في كل طلب. مشغلو حلقة الوكلاء يضبطون medium افتراضيًا وينخفضون إلى low للمكالمات الحساسة لزمن الاستجابة؛ وenable_thinking false يعطل التفكير تمامًا عندما لا تحتاجه. على بطاقة Blackwell واحدة، ترك xhigh مفعلًا للمكالمات الروتينية هو الطريقة التي ينتج بها النموذج السريع إجابات بطيئة.
• اقرن أدوات أخذ العينات بوضع التفكير. يجمع الممارسون على استخدام درجة حرارة 1.0 / top-p 0.95 عند تفعيل التفكير، ودرجة حرارة 0.7 / top-p 0.80 مع عقوبة حضور تبلغ حوالي 1.5 عند إيقافه. يؤدي خلط المجموعتين إلى تدهور جودة المخرجات.
• يظل استدعاء الأدوات صامدًا بعد كلٍّ من abliteration والتحويل إلى 4 بت. مسار استدعاء الدوال سليم، وهذا هو ما يربطه محلل qwen3_coder وأعلام auto-tool-choice. وبالنسبة للفريق الأحمر، فهذه حقيقة ذات حدّين، إذ تعني أن إساءة الاستخدام الوكيلية تعمل بكامل طاقتها على نموذج غير موائم — كما هو موضح أدناه.
• الرؤية محفوظة، وهذا يوسّع سطح الهجوم. لم تمس عملية الاستئصال برج الرؤية، وبقي بصيغة BF16، لذلك يعمل إدخال الصور عبر أجزاء محتوى image_url. الممارسون الذين يقيّمون السلسلة غير الخاضعة للرقابة يتعاملون مع المسار متعدد الوسائط كهدف تقييم من الدرجة الأولى: حقن التعليمات المحمول في صورة يصل إلى نموذج لا يمتلك سلوك رفض ليستهدفه.
أي إصدار يجب أن تقدّمه؟
تتضمن مجموعة Flash-Next خمسة إصدارات — BF16 وGGUF وMLX وFP8 وهذا الإصدار NVFP4 — ومنطق الاختيار الصادق يعتمد على العتاد والمفاضلات، وليس على ترتيب.
• NVFP4 (هذا الإصدار، ~178 جيجابايت على القرص) — اختيار بلاكويل. أنوية الموتر FP4، خبراء 4-بت، أحدث إصدار في المجموعة والأصغر بين إصدارات خادم vLLM الخاصة بها، وهو الذي تتحدث عنه هذه الصفحة.
• FP8 (~186 GB على القرص) — الاختيار الأمثل لـ Hopper، ويعمل بشكل متساوٍ على Blackwell أيضًا. نفس الأوزان بدقة 8-بت، وهو المسار الأكثر توثيقًا واعتمادًا في vLLM، والأكثر وضوحًا من حيث متطلبات التوازي بين الخبراء.
• GGUF (13 نسخ تكميم، من IQ2_XXS ~52 GB إلى Q5_K_M ~125 GB) — اختيار llama.cpp لأجهزة NVIDIA أو AMD أو CPU الاستهلاكية. لا حاجة إلى Blackwell، ولا حاجة إلى vLLM.
• MLX (مستويات 4/6/8 بت، حوالي 163–221 جيجابايت) — الخيار الأمثل لشرائح Apple Silicon، مع Metal أصلي، ورأس MTP مشمول.
ملاحظتان صادقتان قبل أن تختار. أولاً، إصدارا NVFP4 وFP8 يفصل بينهما حوالي ثمانية غيغابايت فقط على القرص، لأن كليهما يُبقي جدول n-gram الكبير بصيغة BF16 — التوفير من 4 بت يتركّز في أوزان الخبراء، وليس في الحجم الكلي. الميزة الحقيقية لـNVFP4 على Blackwell هي سرعة نوى FP4 الموترة على أولئك الخبراء، وليس ملفًا أصغر بشكل كبير. ثانيًا، تصف البطاقة NVFP4 على أنه اشتقاق أوزان حتمي يرث تقييم "abliteration" مع مقايضة إضافية صغيرة في الجودة بسبب خبراء 4 بت، وهي لا تحدد مقدار تلك المقايضة. إنها غير مُحددة الكمية — تعامل معها كتكلفة حقيقية لكن غير محددة للخبراء الأصغر، وليس كأمر تافه.
التقييم، يُقرأ بشكل صحيح
تقرير البطاقة عن قياسات الإزالة (abliteration) على إصدار BF16 المُخدَّم عبر vLLM مقارنةً بالنموذج الرسمي Qwen/Qwen3.8-Flash-Next: انهيار رفض الاستجابات للطلبات الضارّة من 64–100% إلى ما يقارب 0–3.3%، وبقاء الرفض المفرط للطلبات غير الضارّة قرب الصفر، وبقاء القدرات ضمن ±2 نقطة من النموذج الأساسي. هناك ثلاث نقاط يجب فهمها بشكل صحيح حول هذه الأرقام. أولاً، هي قياسات على إصدار BF16، وقد ورِثها إصدار 4-bit هذا بالاستدلال لا بالقياس المباشر عليه. ثانياً، هي أرقام البائع نفسه، أُنتجت باستخدام مصنّف قائم على قواعد يقيس عبارات الافتتاح، وتصفه بطاقات المجموعة بأنه مؤشّر لا بمستوى النشر العلمي — أي أنها قياس داخلي لتعديله الخاص، لا تدقيق مستقل. ثالثاً، لا تخبرنا شيئًا عن مقايضة الجودة الخاصة بـNVFP4 المذكورة أعلاه، والتي لا تكممها البطاقة.
حدود الأمان — لأغراض البحث فقط
إخلاء المسؤولية في البطاقة صريح، وهو الجزء من هذه الصفحة الذي يجب ألا يبدو كنص قالب. لقد خضع هذا النموذج لإزالة جوهرية لمحاذاة السلامة: تم تعميد اتجاه الرفض خارج التيار المتبقي، وسيلبي النموذج الطلبات الضارة أو غير الأخلاقية أو غير القانونية التي كان Qwen3.8-Flash-Next الأصلي سيرفضها. يُصدر حصريًا للبحث المشروع — قابلية التفسير، ودراسة سلامة الذكاء الاصطناعي وآلية الرفض، والاختبار العدائي (red-teaming)، وتقييم المتانة — ولا يتحمل المؤلفون أي مسؤولية عن إساءة الاستخدام. أنت تتحمل المسؤولية الكاملة عن أي شيء يولده، وعليك إضافة طبقات السلامة والاعتدال الخاصة بك قبل أن يصل أي شيء إلى المستخدم. تعد رخصة Apache 2.0 هي الحد الأدنى؛ وبوابة الغرض البحثي تقع فوقها.
هناك أمران يخطئ فيهما الخطابُ الدائرُ حول النماذج غير الخاضعة للرقابة، وهذه البطاقة تجعل من المستحيل إغفالَهما. أولاً، محاولةُ كسرِ حمايةٍ تنجح ضد هذا النموذج ليست اجتيازَ تقييمِ سلامة — بل هي السلوكُ المُعلَن عنه. النموذجُ المُبتَتَر (abliterated) يُفشِل تلك المحاولات عمداً؛ وقياسُه باختبارٍ واحدٍ من قبيل «هل يمكنك كسر حمايته؟» إنما يَقيس أن التعديل نجح، لا أن الحاجزَ الواقي قوي. ثانياً، برجُ الرؤية المحفوظ ومسارُ استدعاء الأدوات السليم يوسّعان سطحَ الهجوم الفعلي إلى ما وراء النص: حقنُ التعليمات عبر مدخلات الصور وإساءةُ استخدام الأدوات الوكيلية كلاهما يعمل بكامل طاقته، وهذا هو بالضبط سببُ تأطيرِ الفريق الأحمر (red-team) لهذا الأمر بوصفه اختبارَ قدراتٍ لا مرشّحاً لروبوت محادثة. إذا كانت حالتُك الاستخدامية هي طرحُ مساعدٍ موجَّهٍ للمستخدم النهائي، فهذا ليس نموذجَك، وهذا مقصودٌ بحكم التصميم.
أين يتناسب OrcaRouter
إنّ بناءً مُقيَّدًا للاستضافة الذاتية فقط، عمره يومان، هو الحالة النموذجية لاعتماد التوجيه (routing) بدلًا من التوصيل الثابت (hardwiring). عندما تشغّل بناء NVFP4 هذا بنفسك، يمكنك إعداد مسار يشير إليه ويقوم بالتبديل التلقائي (failover) إلى نموذج مستضاف إذا أظهر البناء سلوكًا غير سليم تحت الضغط — واجهة واحدة، دون أي إعادة توصيل بين المزوّدين عند التبديل. وبالنسبة لأعمال التقييم (eval) تحديدًا، فإن خط الأساس المُقدَّم المُقيَّد هو المقارنة التي تريدها، وهو على بُعد ضغطة مفتاح واحدة: يتضمّن الكتالوج نموذج Qwen3.8-Flash من Alibaba بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مُمرَّرًا بسعر المزوّد المعلن بهامش ربح 0%، لذا يمكن لمنظومة اختبار الفريق الأحمر (red-team harness) التنقّل بين القاعدة المستضافة المقيَّدة وبناءك المحلي غير المقيَّد دون الحاجة إلى عقد ثانٍ، وأي تغيير في أسعار البائع ينعكس على نقطة النهاية (endpoint) الخاصة بك في اليوم نفسه.

من يجب عليه تنزيل هذا — ومن لا يجب؟
حمّل orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 إذا كنت على Blackwell، وتريد أصغر بصمة خادم في مجموعة Flash-Next مع سرعة نوى FP4 tensor-core، وتقوم بالعمل البحثي الذي وُجد هذا الخط لأجله. حمّل Qwen3.8-Flash-Next-Uncensored-FP8 إذا كنت على Hopper أو تريد المسار الأكثر تحققًا على نطاق واسع. حمّل إصدار GGUF إذا كنت على وحدة معالجة رسوميات استهلاكية أو جهاز بوحدة معالجة مركزية، وإصدار MLX إذا كنت على Apple Silicon، ولا شيء على الإطلاق إذا كان الهدف نشرًا موجهًا للمستخدمين. اقرأ البوابة وإخلاء المسؤولية قبل قبول أي منهما — فهما شروط النموذج، وليست مجرد إجراء شكلي.
جميع إصدارات Flash-Next الخمسة — BF16 وGGUF وMLX وFP8 وNVFP4 — مجمعة في مجموعة Qwen3.8-Flash-Next-Uncensored على Hugging Face.
نموذج مختلف، وليس نسخة أخرى من هذا النموذج: Qwen3.8-27B-Uncensored هو نموذج مجرّد من قاعدة مختلفة وله مجموعته الخاصة ودفاتر تشغيله الخاصة.
هذه الأوزان محلية فقط بحكم التصميم. للحصول على خط أساس مستضاف لقياس البناء المُجرَّد من المحاذاة مقابلَه، Qwen3.8-Flash يُقدَّم على OrcaRouter بسعر قائمة المزود بدون أي هامش ربح — النموذج الأصلي مع محاذاة السلامة سليمة.
