
Qwen3.8-27B-Uncensored-NVFP4: دليل تشغيل الخدمة لوحدات معالجة الرسوم Blackwell
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
Qwen3.8-27B-Uncensored-NVFP4 متاح على Hugging Face منذ 19 أغسطس 2026، وخلال الأيام العشرة الماضية تم سحبه نحو 32,700 مرة. هذا ليس تغطية إطلاق — الأوزان عمرها عشرة أيام، لا يوجد إعلان لتغطيته، والبنيات الشقيقة Qwen3.8-27B-Uncensored-FP8 وQwen3.8-27B-Uncensored-GGUF موثقة بالفعل في هذه المدونة. إنه دليل تشغيل لبناءٍ يقوم الناس بتحميله الآن بنشاط: ما هو NVFP4 فعليًا، ولماذا يمزج هذا البناء المحدد بينه وبين FP8، وأي وحدات معالجة رسومية تستفيد منه وأيها لا، وكيفية تقديمه، ومن يجب أن يختاره بدلًا من بنيتَي FP8 أو GGUF — ومن لا يجب.
أمرٌ نوضّحه من البداية، لأنه يعثِر كل من يحمّل لأول مرة: المستودع مقنّن. الأمر الساذج هو hf download orcarouter/Qwen3.8-27B-Uncensored-NVFP4؛ هذا السطر يفشل بخطأ مصادقة حتى تقوم بتسجيل الدخول إلى Hugging Face وقبول شروط الوصول للمستودع في صفحة النموذج. كل ما يلي يفترض أنك فعلت الاثنين.
وأيضًا من البداية: بطاقة نموذج هذا المستودع خلف نفس البوابة، لذا لا شيء هنا يعيد صياغتها. ما يلي يستند إلى قائمة الملفات العامة وبيانات تعريف المستودع، وإلى توثيق NVIDIA العام لـ NVFP4، وإلى تقارير ميدانية من أشخاص يشغّلون إصدارات Qwen3.8-27B NVFP4 على Blackwell. وحينما يكون الرقم صادرًا عن ممارس وليس عن بائع، يذكر النص ذلك.

ما هو هذا الإصدار
Qwen3.8-27B-Uncensored-NVFP4 هو تكميم NVFP4 لـ Qwen3.8-27B-Uncensored، النسخة المُعرَّاة من نموذج عليبابا Qwen/Qwen3.8-27Bالتي نشرتها منظمة orcarouter في 2026-08-18. تزيل تقنية Abliteration اتجاه رفض النموذج من التدفق المتبقي؛ وقد شرحنا هذه التقنية في دليلنا للنماذج غير الرقابية ولن نعيد شرحها هنا. الأساس هو النموذج 27B الكثيف بهندسة انتباه هجينة — 48 طبقة انتباه خطّي بالإضافة إلى 16 طبقة انتباه كامل — مع قدرة أصلية على فهم الصور والفيديو، وسياق يبلغ 262,144 رمزًا، ورأس MTP مدمج للفكّ التخميني. مرخّص بموجب Apache 2.0 بالكامل.
ما الذي يجعل هذا الإصدار مثيرًا للاهتمام ليس عملية الإزالة (abliteration) بل تخطيط التكميم، لأنه إصدار مكمَّم عمدًا — إذا كنت تبحث عن NVFP4، فالتنسيق هو النقطة. وفقًا للبيانات الوصفية العامة للمستودع وإعداد التكميم فيه، فهو بناء من الموترات المضغوطة مختلط الدقة: إسقاطات الانتباه بصيغة FP8 (E4M3)، وطبقات MLPs بصيغة NVFP4 (4-بت، معبأة)، بينما تُرك مُرمِّز الرؤية، ورأس MTP، وlm_head، ومعاملات التطبيع والتحيزات الخاصة بالانتباه الخطي بصيغة BF16. تتوافق بيانات safetensors في قائمة الملفات العامة مع ذلك المخطط: نحو 3.5 مليار معامل بصيغة BF16، و9.4 مليار بصيغة FP8-E4M3، و15 مليارًا في الموترات المعبأة ذات 4-بت، أي حوالي 24.7 جيجابايت على القرص موزعة على خمسة أجزاء (shards) بالإضافة إلى جزء إضافي منفصل للنموذج. لا شيء من ذلك يُعد ادعاءً حول كيفية تقديمه للخدمة — فذاكرة VRAM المطلوبة أثناء التشغيل والإنتاجية لهذا المستودع بالضبط غير منشورة في أي مكان يمكنني الاستشهاد به اليوم. الحجم على القرص مستمد من قائمة الملفات، والتنسيق مستمد من الإعداد، وسلوك التقديم أدناه مُتحقَّق منه مجتمعيًا على إصدارات NVFP4 وثيقة الصلة.
ما هو NVFP4، وكيف يختلف عن FP8 وعن INT8/AWQ
NVFP4 هو تنسيق الفاصلة العائمة رباعي البتات من NVIDIA، طُوِّر للجيل الخامس من أنوية الموتر في معمارية Blackwell، وتُعد مدونة NVIDIA التقنية الرسمية المصدر الأساسي الصحيح له. يخزّن الأوزان بصيغة E2M1 — بت واحد للإشارة، وبتان للأس، وبت واحد للجزء العشري — ويضبط مقياسها في كتل: كل 16 قيمة تتشارك مقياس FP8 بصيغة E4M3، أما الموتر بأكمله فيحصل على عدد قياسي FP32 لكل موتر. هذا المخطط ثنائي المستوى هو جوهر التنسيق: فهو يستعيد النطاق الديناميكي الذي قد يفقده رقم فاصلة عائمة رباعي البتات تقليدي، على حساب بضعة بتات من النفقات الإضافية لكل كتلة. الفروق العملية، في سطر واحد:
• NVFP4 مقابل FP8 — كلاهما من الفاصلة العائمة، لكن FP8 (E4M3، 8-بت) يعمل على Hopper وBlackwell، بينما NVFP4 هو 4-بت ويتم تسريعه محليًا على Blackwell فقط. تشير NVIDIA إلى أن الأوزان أصغر بنحو 3.5× من FP16 وحوالي 1.8× أصغر من FP8، وعلى Blackwell يتم تنفيذ ضرب المصفوفات مباشرة على أنوية التنسور FP4.
• NVFP4 مقابل INT8/AWQ — INT8 (W8A8) وAWQ (W4A16) تنسيقان صحيحان يعملان منذ Ampere فصاعدًا؛ AWQ هو 4-بت لكنه تنسيق صحيح، وفي معظم الأجهزة يتم إلغاء تكميم الأوزان إلى نوع أوسع لضرب المصفوفات. NVFP4 هو تنسيق عائم 4-بت مع تحجيم بالكتل، لذا يحافظ على دقة أكبر في البتات المنخفضة، وله مسار GEMM أصلي FP4 لا تمتلكه التنسيقات الصحيحة.
• NVFP4 مقابل MXFP4 — غالبًا ما يتم الخلط بين الاثنين. يستخدم MXFP4 كتلًا من 32 عنصرًا ومقاييس E8M0 (قوى العدد اثنين)، بينما يستخدم NVFP4 كتلًا من 16 عنصرًا ومقاييس E4M3. توفر الكتل الأدق عزلًا أفضل للقيم الشاذة في NVFP4، ولهذا السبب يُعد هذا التنسيق المعيار الفعلي للبتات الأربع في حزم خدمة Blackwell.

أي عتاد يستفيد — وأيها لا
أهم حقيقة حول هذا الإصدار: NVFP4 هو تنسيق من بلاكويل. إنه يُثبت جدارته فقط على وحدات معالجة الرسوميات (GPUs) التي تنفذ نوى الموتر فيها FP4 GEMM بشكل أصلي، وعلى أي شيء آخر، فهو الأداة الخاطئة مهما كانت سرعة الجهاز على الورق.
• Blackwell — RTX 50-series, B200/B300, RTX PRO 6000, DGX Spark (GB10) — هنا يكون NVFP4 هو الخيار الصحيح: أنوية FP4 tensor الأصلية، أصغر بصمة بمستوى الخوادم في الخط غير المقيّد، والتنسيق الذي صُمم هذا البناء من أجله.
• Hopper — H100/H200 — لا يدعم GEMM الأصلي FP4. يتحول NVFP4 إلى مسار إلغاء تكميم يعتمد على الوزن فقط (weight-only dequant)، وهو أبطأ ولا يقدّم أي فائدة. استخدم Qwen3.8-27B-Uncensored-FP8 هنا؛ هذا الإصدار مُتحقق منه على هذا العتاد بالضبط.
• Ampere/Ada — RTX 3090/4090 — لا يوفر NVFP4 تسريعًا على هذه البطاقات أيضًا. إصدار GGUF، بمستوى Q4_K_M بحجم 16.8 جيجابايت، هو الأداة المناسبة لبطاقة سعتها 24 جيجابايت.
• Apple Silicon — NVFP4 غير ذي صلة على أجهزة Mac. إصدار MLX (أو GGUF) هو الذي يعمل.
توضيح صادق: الفروع المجتمعية (Community Forks) تستطيع تشغيل NVFP4 بأوزان فقط (weight-only) على أجهزة ما قبل بلاكويل. إصدار NVFP4 المجتمعي من نفس النموذج المُجرَّد من الرفض (abliterated) مهيأ صراحةً لبطاقات فئة V100 عبر فرع vLLM معدَّل، وأما وصفات DGX Spark الأخيرة حول Qwen3.8-27B فلها شأن آخر. تلك مسارات متخصصة لها محاذيرها الخاصة، وليست ما يستهدفه هذا الإصدار. إذا كنت على بلاكويل، فلا شيء من ذلك يهم؛ وإذا لم تكن على بلاكويل، فإن إصدار FP8 أو GGUF هو الخيار الأفضل للتحميل.
كيفية تقديمه
المستودع مُعلَّم لإصدار vLLM، ويتم قراءة تنسيق compressed-tensors تلقائيًا من config.json — لا تقم باختيار مخطط التكميم يدويًا. المكدس الذي يجمع عليه الممارسون لبناء Qwen3.8-27B NVFP4 هو إصدار حديث من vLLM على بطاقة Blackwell، وذاكرة تخزين مؤقت لـ KV بنوع FP8، ورأس MTP الخاص بالنموذج المستخدم في فك الترميز التخميني. دليل Unsloth الخاص بـ NVFP4، وهو المرجع المجتمعي الأكثر استشهادًا، يوصي باستخدام vLLM 0.25.0 أو أحدث مع FlashInfer واعتماد نواة CUTLASS-DSL للمسار السريع FP4.
نقطة بداية صالحة، مُجمَّعة من الخيارات المُتحقَّق منها لبناء FP8 الخاص بنا ووصفات مجتمع NVFP4، كلها في سطر واحد:
vllm serve orcarouter/Qwen3.8-27B-Uncensored-NVFP4 --kv-cache-dtype fp8 --max-model-len 262144 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder --speculative-config '{"method": "mtp", "num_speculative_tokens": 3}'
• FP8 KV cache — الطريقة الأكثر توافقًا على نطاق واسع لخفض ذاكرة التخزين المؤقت إلى النصف؛ ويشير الممارسون إلى أنها تضاعف تقريبًا حجم السياق الذي يمكنك الاحتفاظ به. يوجد دعم لذاكرة التخزين المؤقت KV بصيغة NVFP4 لكنه يقتصر على بعض الواجهات الخلفية للانتباه، لذا فإن KV بصيغة FP8 هو الخيار الافتراضي الأكثر أمانًا.
• فك الترميز التخميني MTPيأتي النموذج مزودًا برأس مسودة MTP، ويحافظ التكميم عليه بصيغة BF16. أفاد الممارسون أن رمزي مسودة إلى ثلاثة رموز تعمل جيدًا مع أوزان NVFP4 على Blackwell، مع أكبر المكاسب في المخرجات المنظمة مثل JSON واستدعاءات الأدوات.
• الرؤية — وحدة تشفير الرؤية محفوظة بصيغة BF16 في هذا الإصدار. أضِف --language-model-only لتقديم خدمة النصوص فقط؛ احذفه إذا كنت بحاجة إلى إدخال الصور أو الفيديو.
• على DGX Spark — بعض المزالق التي أبلغ عنها المستخدمون: أبقِ --gpu-memory-utilization عند 0.90 أو أقل (القيم الأعلى قد تسبّب تجميد الجهاز أثناء تحميل الأوزان)، وأضف --safetensors-load-strategy lazy إذا كانت الذاكرة محدودة. كما ستحتاج إلى إصدار GB10 من vLLM لأنوية sm_121a.
أداء صادق: لا توجد أرقام إنتاجية منشورة ومستقلة لهذا المستودع المحدد. القياسات الموجودة مخصصة لإصدارات NVFP4 وثيقة الصلة. يبلغ Unsloth عن 1.41–1.49× من الرموز في الثانية مقارنة بـ BF16 على B200 لإصداره الخاص Qwen3.8-27B-NVFP4 (89.8 إلى 133.7 رمز/ثانية عند دفعة 1، و3,048 إلى 4,407 عند دفعة 64)، كما يبلغ أحد مستخدمي DGX Spark في منتديات NVIDIA عن حوالي 20–32 رمز/ثانية مع أوزان NVFP4، وذاكرة تخزين مؤقت KV بصيغة FP8 وعمق MTP 3. كلاهما يستحق الاستشهاد؛ ولا يُعتبر أي منهما معيارًا لهذا المستودع.
أنماط الاستخدام التي تعمل بالفعل
الممارسون الذين يشغّلون نماذج عائلة Qwen3.8-27B على Blackwell يتوافقون على مجموعة قليلة من الإعدادات. تعامل مع هذه كتقارير ميدانية، لا كإرشادات من البائع — فشركة Qwen لا توثّق معظم هذا، وبطاقة هذا المستودع نفسه مقيّدة.
• reasoning_effort هو الإعداد الأكثر أهمية.القيمة الافتراضية xhigh تجعل النموذج يفكر لفترة طويلة في كل طلب. الأشخاص الذين يشغّلون حلقات الوكيل يضبطون medium افتراضيًا وينزلون إلى low — أو يعطّلون التفكير تمامًا باستخدام enable_thinking: false — للمكالمات الفردية الحساسة لزمن الاستجابة. على معالج GPU واحد من نوع Blackwell، استخدام تفكير xhigh في مهمة روتينية هو ما يجعلك تحصل على نموذج سريع وإجابات بطيئة.
• معاملات أخذ العينات مقترنة بوضع التفكير، وليست مستقلة. إجماع المجتمع: عند تشغيل وضع التفكير تُستخدم درجة الحرارة 1.0 / top_p 0.95؛ وعند إيقافه تُستخدم درجة الحرارة 0.7 / top_p 0.80 مع presence_penalty 1.5. تبديل المجموعتين يقلّل من جودة المخرجات.
• استخدم قالب محادثة حديثًا.قالب qwen3_5 يغلّف كل دور من أدوار المساعد في كتلة تفكير، ويشير عدة ممارسين إلى تكرار أو اقتطاع في الإجابات مع القوالب غير المحدثة؛ البدائل المُصلَّحة من المجتمع Qwen-Fixed-Chat-Templates وQwen-Sharp تضبط preserve_thinking وتوقف التكرار. إذا استمر إخراجك المُقدَّم بعد رمز الإيقاف، فهذا أول شيء يجب التحقق منه.
• خصص ميزانية لمسارات التفكير الطويلة في عمل الوكلاء. يُفيد الممارسون أن نموذج الجيل 3.8 يُصدر تقريبًا ضعف عدد الرموز لكل مهمة مقارنة بسابقه 3.6 — وتأتي القفزة النوعية جزئيًا من التفكير الأطول. بالنسبة لإجابات xhigh الطويلة، قم ببث مخرجات التفكير وإلا ستواجه انتهاء مهلة البوابة.
• استدعاء الأدوات يظل سليماً عبر التكميم.مسار استدعاء الدوال يظل يعمل بعد كل من الإبليتيريشن والتحويل إلى 4-بت؛ قم بتفعيله باستخدام محلل استدعاء الأدوات qwen3_coder وسيختار النموذج الأدوات بنفس طريقة النموذج الأساسي.

من يجب أن يختار هذا البناء — ومن لا يجب عليه
القرار الأمين، دون تكرار رياضيات اختيار الكمّ التي تناولتها منشوراتنا حول FP8 وGGUF بالتفصيل بالفعل:
• اختر NVFP4 إذا كنت تُشغّل النماذج على Blackwell وتريد أصغر حجم تشغيلي بمستوى الخوادم في الخط غير الخاضع للرقابة بسرعة FP4-tensor-core — وتقوم بأعمال بحث أو فريق أحمر أو قابلية تفسير تتطلب بشكل مشروع نموذجًا مُجرّدًا من تدابير الأمان.
• اختر Qwen3.8-27B-Uncensored-FP8 إذا كنت تستخدم Hopper، أو تريد مسار vLLM الأكثر تحققًا على نطاق واسع — فهو نفس الأوزان بدقة 8-bit، تم التحقق منه على H200، مع حد أدنى لذاكرة VRAM يبلغ حوالي 40 جيجابايت.
• اختر Qwen3.8-27B-Uncensored-GGUF إذا كنت تستخدم GPU استهلاكية أو جهاز Mac، أو تريد llama.cpp بدلاً من vLLM — فإن مستوى Q4_K_M هو الخيار الأمثل محليًا.
• لا تختر أيًا منهما إذا كنت تريد أقصى درجات الدقة، أو كنت تبني أي شيء يواجه المستخدم (انظر حدود الأمان أدناه)، أو لا تريد الاستضافة الذاتية إطلاقًا — نفس الخط غير المقيّد يُقدَّم عبر OrcaRouter للباحثين فقط، لذا لا حاجة إلى GPU.
حدود الأمان — لأغراض البحث فقط
هذا نموذج مُجرّد من الحواجز (abliterated)، والنسخة المكمّمة لا تعيد وضع الحواجز الواقية. تمت إزالة اتجاه الرفض من التدفق المتبقي لنموذج Qwen/Qwen3.8-27B، وNVFP4 هو تغيير في الدقة وليس تدخلاً أمنيًا — سيلتزم النموذج بالطلبات التي يرفضها النموذج الأساسي، ولا يحتوي هذا الإصدار على أي رقابة مدمجة. تم إصداره لأغراض قابلية التفسير، وسلامة الذكاء الاصطناعي، وأبحاث الفريق الأحمر بموجب رخصة Apache 2.0، والمسؤولية تقع على عاتقك.
ملاحظتان للتقييم نادرًا ما تُطرحان في مجال النماذج غير الخاضعة للرقابة. أولًا، اختبار اختراق واحد ينجح بشكل تافه ليس تقييم سلامة ناجحًا — النماذج المجرّدة من قدرات الرفض (abliterated) تفشل في تلك الاختبارات عمدًا. قِس ما يهمك فعلًا باستخدام البطاريات المناسبة (AdvBench وHarmBench وStrongREJECT للضرر؛ XSTest-safe للرفض المفرط) وقارن معدلات الرفض قبل التدخل وبعده. ثانيًا، قيّم النسخة المكممة (quant)، وليس النموذج الأساسي فقط: فإصدار 4-bit يمكن أن يغيّر السلوك في الحالات الحدّية حتى عندما تبدو الدرجات الإجمالية سليمة. لا تنشر هذا للمستخدمين النهائيين دون طبقات الرقابة ومنع إساءة الاستخدام الخاصة بك.
أين يتناسب OrcaRouter
البناء المكمم الذي يبلغ عمره عشرة أيام هو الحالة النموذجية للتوجيه بدلاً من التوصيل الثابت. يمكنك إنشاء مسار يشير إلى بناء NVFP4 الذي تديره بنفسك، والتبديل تلقائيًا إلى نموذج مستضاف إذا أساء البناء التصرف تحت الحمل — واجهة واحدة، دون إعادة توصيل بين المزودين عند التبديل. يمرر OrcaRouter سعر القائمة من المزود بهامش ربح 0٪، لذا إذا تحرك سعر النموذج الأساسي، تعكسه نقطة الوصول الخاصة بك في نفس اليوم بدلاً من أن يظهر في دورة الفوترة الخاصة بك.
وإذا كان الهدف الأساسي هو تجنب تشغيل وحدة معالجة الرسومات (GPU) تمامًا: فإن نفس الخط غير المقيّد متاح عبر OrcaRouter، مقتصرًا على الباحثين الأمنيين والفرق الحمراء، مع تجاوز تلقائي للفشل عبر مزودي الخدمة. سواء قمت باستضافة هذا الإصدار NVFP4 ذاتيًا أو استدعيت الخط المُستضاف، فالأمر يتطلب مفتاح API واحدًا في كلتا الحالتين.
الخلاصة
{{1}}Qwen3.8-27B-Uncensored-NVFP4 هو التنزيل الصحيح إذا كنت تُشغّل النموذج المُزال التقييد (abliterated) على Blackwell وتريد أصغر مساحة تخزين مع سرعة أنوية FP4-التنسور.{{/1}} {{2}}وهو التنزيل الخاطئ على Hopper (استخدم نسخة FP8)، أو على وحدة معالجة رسومية استهلاكية أو Apple GPU (استخدم نسخة GGUF أو MLX)، أو إذا كنت بحاجة إلى أقصى دقة.{{/2}} {{3}}وهو ليس جديدًا — فهو متاح للتنزيل منذ 19 أغسطس 2026 — لكنه يُنزَّل بكميات كبيرة، والآن تعرف ما الذي ستواجهه قبل تجاوز البوابة.{{/3}}
ليس مجرد بناء آخر لهذا النموذج — Qwen3.8-Flash-Next-Uncensored هو إصدار منفصل: مُشتق من Qwen3.8-Flash-Next عبر تقنية الإزالة (abliteration)، وهو معاينة من نوع مزيج الخبراء (mixture-of-experts) لمعمارية Qwen4 بإجمالي 176B مخزّن / 6B نشط. نفس تقنية الإزالة، أوزان مختلفة، ومجموعة خاصة به.
جميع الإصدارات الستة بحجم 27B — BF16 وGGUF وMLX وFP8 وINT8 وNVFP4 — مجمعة فيمجموعة Qwen3.8-27B-Uncensoredعلى Hugging Face.
هذه الأوزان مخصصة للاستخدام المحلي فقط بحكم التصميم. ولإتاحة خط أساس مستضاف تُقارَن به النسخة المجرّدة من الحماية، Qwen3.8-27B يُقدَّم على OrcaRouter بسعر قائمة المزود دون أي زيادة — النموذج الأصلي مع محاذاة السلامة سليمة.
