بطاقة عنوان رئيسية لمقال "Qwen3.8-Flash-Next-Uncensored-NVFP4: A Blackwell Serving Runbook"، تعرض العنوان الرئيسي والعنوان الفرعي "A Blackwell Serving Runbook — خبراء NVFP4، انتباه FP8، وPLE بصيغة BF16"، وأربع شرائح مواصفات: "حصرية لـ Blackwell — أنوية FP4 الموترية" و"من 330 جيجابايت إلى 178 جيجابايت" و"مقيد الوصول على Hugging Face" و"سياق 262K"، مع شعار OrcaRouter متراكبًا في الزاوية السفلية اليمنى.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored-NVFP4: دليل تشغيل الخادم على Blackwell

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Qwen3.8-Flash-Next-Uncensored-NVFP4 يعمل على عائلة واحدة فقط من وحدات معالجة الرسومات: Blackwell. تنفذ NVFP4 على أنوية التنسور FP4 العتادية، بينما Hopper (H100/H200) وأي شيء أقدم ببساطة لا يمتلكها. إذا كنت تستخدم Hopper، توقف هنا — الإصدار Qwen3.8-Flash-Next-Uncensored-FP8 هو الذي تريده. كل ما يلي يفترض استخدام Blackwell (B100، B200، GB200، أو بطاقة من سلسلة RTX 50)، وإصدار حديث من vLLM مع دعم qwen4_exp، و transformers ≥ 5.16.

هذا هو تكميم NVFP4 للنسخة المُجرّدة من الرفض (التي أُزيل منها الرفض) لـ Qw​en/Qwen3.8-Flash-Next، المُقتطعة من 330 جيجابايت بصيغة BF16 إلى 178 جيجابايت على القرص. وقد نشرته OrcaRouter إلى Hugging Face في 27 أغسطس 2026 باسم orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4. المستودع مقيد: يجب أن تكون قد سجّلت الدخول إلى Hugging Face وقبلت شروط المستودع، أو hf download و vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 كلاهما يفشلان مع خطأ مصادقة قبل نقل أي بايت. هذه الصفحة هي دليل تشغيل الخدمة، وليست تغطية إطلاق — عمر هذا البناء يومان، والأسئلة التي يواجهها الناس فعليًا هي العتاد، والأعلام، وأي بناء يختارون.

A screenshot of the Hugging Face page for the gated orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 repo (captured August 29 2026), showing the gate banner 'You need to agree to share your contact information to access this model', 'Login or Sign Up to review the conditions', Model size 125B params, tensor types F8_E4M3 · BF16 · U8 · I64, the apache-2.0 licence, the base-model line Qwen/Qwen3.8-Flash-Next, and the abliterated, uncensored, nvfp4, fp4, fp8, vllm and vision-language tags.

وقبل أن تبدأ الأرقام: Qwen3.8-Flash-Next-Uncensored ليس Qwen3.8-27B-Uncensored؛ إنهما نموذجان مختلفان يتشاركان اسم عائلة وتقنية إزالة الحجب (abliteration) — أوزان أساسية مختلفة، وبنيات مختلفة، ومجموعات Hugging Face مختلفة. تم اشتقاق Flash-Next بإزالة الحجب من Qw​en/Qwen3.8-Flash-Next، وهو معاينة لبنية Qwen4 (qwen4_exp) تعتمد على خليط الخبراء الموجّه: 512 خبيرًا مع عشرة خبراء موجّهين بالإضافة إلى خبير مشترك نشط، وانتباه هجين (طبقات Gated DeltaNet الخطية إلى جانب طبقات الانتباه الكامل)، واتصالات فائقة (Hyper-Connections)، وتضمين PLE للـ n-gram، وبرج رؤية وفيديو أصلي، ورأس فك تشفير تخميني MTP. تم اشتقاق 27B بإزالة الحجب من Qw​en/Qwen3.8-27B، وهي قاعدة كثيفة مختلفة تمامًا. لا يُنقل أي شيء من أرقام التشغيل في صفحة 27B إلى هذا النموذج؛ وحيثما تكون صفحة 27B مفيدة فعلًا — الدليل التمهيدي لإزالة الحجب، والحسابات العامة لاختيار التكميم — فهي مرتبطة أدناه مع ما يُنقل وما لا يُنقل.

A scoreboard card for Qwen3.8-Flash-Next-Uncensored-NVFP4 with six rows: base model Qwen/Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + accepted terms), precision NVFP4 experts - FP8 attention - BF16 PLE, on-disk size 178 GB from 330 GB BF16, KV cache BF16 (not quantized), hardware Blackwell only (FP4 tensor cores); footer reads 'All figures from the orcarouter model card, August 29 2026 - self-reported, not independently audited.'

ما هي هذه البنية، دقةً بدقة

Qwen3.8-Flash-Next هو نموذج خليط خبراء موجَّه (MoE): كل توكن ينشّط 10 من أصل 512 خبيرًا بالإضافة إلى خبير مشترك واحد، وبضعة مليارات فقط من المعاملات تكون نشطة لكل توكن رغم أن النموذج المخزَّن أكبر بكثير. إصدار NVFP4 هو تكميم موترات مضغوط بدقة مختلطة لتلك الحزمة، والتقسيم هو جوهر القصة:

• أوزان خبراء MoE — NVFP4 (4-بت، NVIDIA FP4 E2M1، تجميع 16 مع مقاييس كتلة FP8).

• الانتباه (self_attn.{q,k,v,o})، إسقاطات linear_attn، الخبير المشترك، وlm_head — FP8 (8 بت).

تضمين n-gram الخاص بـ PLE، وتضمينات التوكن والرؤية، وHyper-Connections، ومفهرس QSA، وGated-DeltaNet conv/dt، وجميع عمليات التطبيع، وبرج الرؤية بأكمله — BF16، محفوظ بدقة كاملة.

ثلاث خصائص للتحويل تهم أكثر من تقسيم الدقة نفسه. أولاً، إنه خاص بالأوزان فقط: إذ يتم تكميم التفعيلات ديناميكيًا في وقت التشغيل، ولا توجد معايرة ثابتة، والأوزان مشتقة مباشرةً من نقطة تفتيش BF16 (وتصف البطاقة هذا الاشتقاق بأنه بدون بيانات). ثانيًا، تعديل الإزالة (abliteration) مدمج في الأوزان، لذا فإن إزالة الرفض تصمد أمام التكميم — التحويل إلى 4 بت هو تغيير في الدقة، وليس تدخلًا في الأمان. ثالثًا، لا يتم تكميم ذاكرة التخزين المؤقت KV؛ إذ تبقى بصيغة BF16 أثناء التشغيل. من السهل تفويت هذه النقطة الأخيرة، وهي مهمة في سياق النموذج الأصلي البالغ 262,144 رمزًا، حيث تشكّل ذاكرة KV بندًا حقيقيًا في استخدام الذاكرة إلى جانب الأوزان.

الحجم على القرص يهيمن عليه موتر واحد. تصف البطاقة تضمين n-gram الخاص بـ PLE كموتر واحد يضم حوالي 66 مليار معامل، محفوظ بصيغة BF16 حسب التصميم؛ وهو أكبر جزء وهو السبب في أن حجم البناء يبلغ 178 جيجابايت بدلاً من رقم أصغر. هناك تباين يجب الإشارة إليه بدلاً من التغاضي عنه: بطاقة FP8 الشقيقة تسمي نفس الجدول باسم n-gram الخاص بـ PLE بـ 51 مليار معامل، وتشير ملاحظة W4A4 في هذه البطاقة إلى أنه يبلغ حوالي 100 جيجابايت. تذكر البطاقتان أرقامًا مختلفة لنفس الجدول، لذا تعامل مع كل رقم كرقم خاص ببطاقته — وعند تقدير حجم النشر، افترض أن الجدول كبير بصيغة BF16 وخطط حول ذلك.

الشرط المسبق للأجهزة، موضحًا بالتفصيل

هذا هو أقصر وأهم قسم في الصفحة. NVFP4 هو تنسيق من بلاكويل: المسار السريع هو عملية GEMM أصلية بدقة FP4 على أنوية الموتر من الجيل الخامس، وبدون هذا العتاد لا يملك التنسيق ما يعمل عليه. سطر متطلبات البطاقة صريح — وحدة معالجة رسومية من بلاكويل (B100 / B200 / GB200 / RTX 50-series)، لأن NVFP4 يستخدم أنوية الموتر FP4 المادية، ولن يعمل على Hopper (H100/H200) أو الأقدم، التي تفتقر إلى دعم حوسبة FP4.

عمليات إعادة التوجيه، في مكان واحد:

• على Hopper (H100/H200) — قم بتقديم Qwen3.8-Flash-Next-Uncensored-FP8 بدلاً من ذلك. إنها نفس الأوزان بدقة 8-بت، وتعمل على Hopper وBlackwell، وهي الإصدار الذي يغطيه دليل FP8 الخاص بهذه المدونة.

• على وحدة معالجة رسوميات NVIDIA الاستهلاكية أو على جهاز بوحدة معالجة مركزية — بناء GGUF بمستويات التكميم الثلاثة عشر من llama.cpp هو المسار المحلي.

• على Apple Silicon — إصدار MLX، بطبقات 4/6/8-بت، هو مسار Metal الأصلي.

إن متطلب وقت التشغيل مُلزم تمامًا مثل السيليكون. إن qwen4_exp هي بنية جديدة كليًا، لذا سترفض إصدارات vLLM الجاهزة التي سبقتها تحميل نقطة التحقق. تحتاج إلى إصدار حديث من vLLM يدعم qwen4_exp، بالإضافة إلى قارئ NVFP4 من compressed-tensors (يُكتشف التنسيق من config.json وليس اختيارًا يدويًا)، ونسخة transformers ≥ 5.16. ويتطلب الإدخال متعدد الوسائط أيضًا حزمة الرؤية الخاصة بـ Qw​en في بيئة التشغيل؛ بينما يعمل تقديم النصوص فقط بدونها.

أمر خدمة البطاقة، علمًا علمًا

استدعاء بطاقة النموذج نفسه نقطة بداية جيدة، ومن المفيد فهم الغرض من كل علامة بدلاً من النسخ واللصق بشكل أعمى:

vllm serve orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 --tensor-parallel-size 4 --trust-remote-code --enable-expert-parallel --enable-auto-tool-choice --tool-call-parser qwen3_coder

--tensor-parallel-size 4 — تبلغ الأوزان ~178 جيجابايت على القرص، لذا توزّعها البطاقة على أربع وحدات GPU. هذا هو الشكل الذي صُمم البناء على أساسه؛ لا تعتبره اقتراحًا.

--trust-remote-code — مطلوب لبنية مخصصة. كود النمذجة الخاص بـ qwen4_exp ليس في سجل transformers القياسي بعد، لذا يقوم vLLM بتحميل كود البنية من المستودع. أنت تثق بهذا الكود، وهو قرار طبيعي لكنه حقيقي لبنية جديدة كليًا.

--enable-expert-parallel — يوزّع الخبراء عبر مراتب التوازي الموتر بدلًا من تكرارها، وهذا ما يجعل نموذج MoE ذا 512 خبيرًا ممكنًا عند TP4. البطاقة الشقيقة FP8 تذكر السبب الأوضح على هذا البناء: بدونه، لا يكون العرض الوسيط لـ MoE مقسومًا على TP قابلاً للقسمة على حجم كتلة FP8. تعامل معه كشرط مطلوب، وليس اختياريًا.

--enable-auto-tool-choice and --tool-call-parser qwen3_coder — يعملان معًا على تفعيل استدعاء الدوال. يتيح خيار auto للنموذج تحديد ما إذا كان سيستدعي أداة أم لا، ويقوم محلل qwen3_coder بفك ترميز تنسيق استدعاء الأدوات، وهو نفس عائلة المحللات التي تستخدمها نماذج Qwen3.8-27B وQwen3.8-Flash-Next.

بمجرد تشغيله، تحمل نقطة النهاية المتوافقة مع OpenAI في /v1/chat/completions مجموعة الميزات الكاملة عبر حزمة Qwen4 في بيئة التشغيل: استدعاء الأدوات كما هو مذكور أعلاه، والاستدلال عبر chat_template_kwargs.enable_thinking، والرؤية عبر أجزاء محتوى image_url. لا تحتاج إلى خادم منفصل للوسائط المتعددة؛ فهي نفس نقطة النهاية.

ملاحظة هيكلية واحدة من البطاقة: لا يوجد متغير W4A4 ثابت تمامًا لهذا البناء، ولن يكون هناك واحد بتكلفة زهيدة. يتطلب التحويل الثابت W4A4 تمريرًا أماميًا لمعايرة التنشيط، ويجب أن يحمل هذا التمرير تضمين n-gram بحجم ~100 جيجابايت على GPU واحدة. هذا هو السبب نفسه الذي يجعل جدول PLE يهيمن على قائمة الملفات، وهو السبب وراء بقاء هذا البناء مقتصرًا على الأوزان فقط مع تنشيطات ديناميكية.

تقارير ميدانية من المجتمع — كيف يبدو هذا الأمر فعليًا في الواقع

لا توجد أرقام مُعلنة حول الإنتاجية أو زمن الاستجابة لهذا المستودع تحديداً، وهذه الصفحة لن تخترعها. ما هو موجود فعلاً هو مجموعة متنامية من التقارير الميدانية من ممارسين يخدمون إصدارات Qwen3.8-Flash-Next NVFP4 — نفس البنية، نفس تقسيم الدقة NVFP4/FP8/BF16، مع استبعاد تعديل "الإزالة" (abliteration) — وسلوك الخدمة ينتقل مباشرة. هذه نتائج مجتمعية، وليست توجيهات من البائع، والأشخاص الذين أبلغوا عنها كانوا يعملون على أجهزة Blackwell بنفس نظام التكميم.

فك الترميز التخميني MTP هو أكبر رافعة أداء على الإطلاق. يأتي النموذج مع رأس مسودة متعدد التنبؤ بالرموز، وعلى أحد معالجات RTX PRO 6000 (96 جيجابايت، SM120) تُحمَّل وحدة MTP مكمَّمة إلى NVFP4 بحوالي 0.51 جيجابايت من ذاكرة الفيديو — وقد قاس التقرير طول قبول يتراوح بين 2.3 و3.9 من أصل 4 كحد أقصى، ومعدل قبول يتراوح بين 0.86 و0.96. كما قاس التقرير نفسه متوسط فك ترميز أحادي التدفق يتراوح بين 180 و226 رمزًا/الثانية (216.9 في البرمجة، و225.8 في حمل عمل استدعاء أدوات الوكيل، و136.6 في الاستدلال) مقابل خط أساس يبلغ نحو 105 رموز/الثانية، وأجاب على استعلام من 216,685 رمزًا في 8.4 ثانية. تعامل مع الأرقام باعتبارها من إعدادات جهاز شخص واحد، وليست مواصفة رسمية.

قم بتفريغ تضمين n-gram الخاص بـ PLE إلى ذاكرة RAM المضيفة.نظرًا لأن الجدول ضخم ونادرًا ما يكون عنق الزجاجة في الإنتاجية، فإن الحلول المجتمعية على بطاقات Blackwell الفردية تثبّته على المضيف (حوالي 50 جيبي بايت من ذاكرة RAM الحرة للمضيف في تقرير RTX PRO 6000) وتقوم بتعيينه عبر mmap من NVMe، مما يقايض القليل من زمن الاستجابة مقابل إمكانية احتواء النموذج بالكامل. توقع القيام بشيء مماثل إلا إذا كانت ميزانية ذاكرة الفيديو (VRAM) كبيرة جدًا.

ثبّت نافذة السياق بشكل صريح. مع تفعيل ذاكرة التخزين المؤقت KV بصيغة BF16 وMTP، تضخم تجمّع KV بحجم تلقائي ليجاوز ما يمكن للبطاقة استيعابه، مما أدى إلى نفاد الذاكرة (OOM) أثناء مرحلة التعبئة المسبقة الطويلة؛ أدى تثبيت max-model-len / max-total-tokens عند 262144 إلى استعادة مساحة التشغيل. عند سياق يبلغ 262 ألف، تُعد ذاكرة التخزين المؤقت KV بندًا في الميزانية تحتسب له، وليست خيارًا افتراضيًا.

خطأ في الضبط التلقائي لـ FlashInfer يُفسد المخرجات بصمت. أهم نمط فشل في الميدان: الضبط التلقائي يختار تكتيكات نواة MoE المندمجة بناءً على زمن الاستجابة فقط ولا يفحص الدقة العددية أبدًا، لذا تحت بعض الأشكال ينهار فك التشفير إلى رمز متكرر. أعاد تقرير RTX PRO 6000 إنتاجها كـ 36 من أصل 36 حالة توليد تالفة عند تفعيل الضبط التلقائي، مقابل 0 من 36 عند تعطيله — والحل البديل هو تعطيل الضبط التلقائي لـ FlashInfer (في vLLM، استخدم --no-enable-flashinfer-autotune؛ وفي SGLang، استخدم --disable-flashinfer-autotune). إذا تدهورت مخرجاتك المُقدَّمة فجأة، فتحقق من هذا قبل أي شيء آخر.

يتطلب DGX Spark (GB10, SM121) تصحيحات خاصة به. لا تتسع أوزان NVFP4 (نحو 126 GiB في البنية المجتمعية) في ذاكرة Spark واحدة بسعة 128 GB، لذلك تشغّل وصفات SGLang التوازي التوتري بعامل 2 عبر عقدتين باستخدام RoCE، ويشترط محلل فك التشفير المتناثر QSA مرور نواة FlashInfer السريعة عبر فحص is_sm100_supported() الذي يفشل على SM121، فيُستخدم مسار بديل ينهار أثناء الإحماء — والحل تصحيح صغير مع تفريغ PLE. توقّع معدل فك يبلغ ~47–50 tok/s، ويصل ذروته إلى نحو 70 مع MTP4 ورسوميات CUDA، وتحقق من أن نواتك تعمل فعليًا على SM121 قبل أن تعد بمعيار أداء.

الاستدلال، واستدعاء الأدوات، والرؤية عبر حزمة Qwen4

إجماع المجتمع على جيل Qwen3.8 ينتقل إلى هذا النموذج مع التحذير المعتاد بأنه ممارسة ميدانية، وليس توجيهًا من البائع.

reasoning_effort هو المؤشر الأكثر أهمية.قالب المحادثة يضبط افتراضيًا على xhigh، مما يجعل النموذج يفكر مطولًا في كل طلب. مشغلو حلقة الوكلاء يضبطون medium افتراضيًا وينخفضون إلى low للمكالمات الحساسة لزمن الاستجابة؛ وenable_thinking false يعطل التفكير تمامًا عندما لا تحتاجه. على بطاقة Blackwell واحدة، ترك xhigh مفعلًا للمكالمات الروتينية هو الطريقة التي ينتج بها النموذج السريع إجابات بطيئة.

اقرن أدوات أخذ العينات بوضع التفكير. يجمع الممارسون على استخدام درجة حرارة 1.0 / top-p 0.95 عند تفعيل التفكير، ودرجة حرارة 0.7 / top-p 0.80 مع عقوبة حضور تبلغ حوالي 1.5 عند إيقافه. يؤدي خلط المجموعتين إلى تدهور جودة المخرجات.

يظل استدعاء الأدوات صامدًا بعد كلٍّ من abliteration والتحويل إلى 4 بت. مسار استدعاء الدوال سليم، وهذا هو ما يربطه محلل qwen3_coder وأعلام auto-tool-choice. وبالنسبة للفريق الأحمر، فهذه حقيقة ذات حدّين، إذ تعني أن إساءة الاستخدام الوكيلية تعمل بكامل طاقتها على نموذج غير موائم — كما هو موضح أدناه.

الرؤية محفوظة، وهذا يوسّع سطح الهجوم. لم تمس عملية الاستئصال برج الرؤية، وبقي بصيغة BF16، لذلك يعمل إدخال الصور عبر أجزاء محتوى image_url. الممارسون الذين يقيّمون السلسلة غير الخاضعة للرقابة يتعاملون مع المسار متعدد الوسائط كهدف تقييم من الدرجة الأولى: حقن التعليمات المحمول في صورة يصل إلى نموذج لا يمتلك سلوك رفض ليستهدفه.

أي إصدار يجب أن تقدّمه؟

تتضمن مجموعة Flash-Next خمسة إصدارات — BF16 وGGUF وMLX وFP8 وهذا الإصدار NVFP4 — ومنطق الاختيار الصادق يعتمد على العتاد والمفاضلات، وليس على ترتيب.

NVFP4 (هذا الإصدار، ~178 جيجابايت على القرص) — اختيار بلاكويل. أنوية الموتر FP4، خبراء 4-بت، أحدث إصدار في المجموعة والأصغر بين إصدارات خادم vLLM الخاصة بها، وهو الذي تتحدث عنه هذه الصفحة.

FP8 (~186 GB على القرص) — الاختيار الأمثل لـ Hopper، ويعمل بشكل متساوٍ على Blackwell أيضًا. نفس الأوزان بدقة 8-بت، وهو المسار الأكثر توثيقًا واعتمادًا في vLLM، والأكثر وضوحًا من حيث متطلبات التوازي بين الخبراء.

GGUF (13 نسخ تكميم، من IQ2_XXS ~52 GB إلى Q5_K_M ~125 GB) — اختيار llama.cpp لأجهزة NVIDIA أو AMD أو CPU الاستهلاكية. لا حاجة إلى Blackwell، ولا حاجة إلى vLLM.

MLX (مستويات 4/6/8 بت، حوالي 163–221 جيجابايت) — الخيار الأمثل لشرائح Apple Silicon، مع Metal أصلي، ورأس MTP مشمول.

ملاحظتان صادقتان قبل أن تختار. أولاً، إصدارا NVFP4 وFP8 يفصل بينهما حوالي ثمانية غيغابايت فقط على القرص، لأن كليهما يُبقي جدول n-gram الكبير بصيغة BF16 — التوفير من 4 بت يتركّز في أوزان الخبراء، وليس في الحجم الكلي. الميزة الحقيقية لـNVFP4 على Blackwell هي سرعة نوى FP4 الموترة على أولئك الخبراء، وليس ملفًا أصغر بشكل كبير. ثانيًا، تصف البطاقة NVFP4 على أنه اشتقاق أوزان حتمي يرث تقييم "abliteration" مع مقايضة إضافية صغيرة في الجودة بسبب خبراء 4 بت، وهي لا تحدد مقدار تلك المقايضة. إنها غير مُحددة الكمية — تعامل معها كتكلفة حقيقية لكن غير محددة للخبراء الأصغر، وليس كأمر تافه.

التقييم، يُقرأ بشكل صحيح

تقرير البطاقة عن قياسات الإزالة (abliteration) على إصدار BF16 المُخدَّم عبر vLLM مقارنةً بالنموذج الرسمي Qw​en/Qwen3.8-Flash-Next: انهيار رفض الاستجابات للطلبات الضارّة من 64–100% إلى ما يقارب 0–3.3%، وبقاء الرفض المفرط للطلبات غير الضارّة قرب الصفر، وبقاء القدرات ضمن ±2 نقطة من النموذج الأساسي. هناك ثلاث نقاط يجب فهمها بشكل صحيح حول هذه الأرقام. أولاً، هي قياسات على إصدار BF16، وقد ورِثها إصدار 4-bit هذا بالاستدلال لا بالقياس المباشر عليه. ثانياً، هي أرقام البائع نفسه، أُنتجت باستخدام مصنّف قائم على قواعد يقيس عبارات الافتتاح، وتصفه بطاقات المجموعة بأنه مؤشّر لا بمستوى النشر العلمي — أي أنها قياس داخلي لتعديله الخاص، لا تدقيق مستقل. ثالثاً، لا تخبرنا شيئًا عن مقايضة الجودة الخاصة بـNVFP4 المذكورة أعلاه، والتي لا تكممها البطاقة.

حدود الأمان — لأغراض البحث فقط

إخلاء المسؤولية في البطاقة صريح، وهو الجزء من هذه الصفحة الذي يجب ألا يبدو كنص قالب. لقد خضع هذا النموذج لإزالة جوهرية لمحاذاة السلامة: تم تعميد اتجاه الرفض خارج التيار المتبقي، وسيلبي النموذج الطلبات الضارة أو غير الأخلاقية أو غير القانونية التي كان Qwen3.8-Flash-Next الأصلي سيرفضها. يُصدر حصريًا للبحث المشروع — قابلية التفسير، ودراسة سلامة الذكاء الاصطناعي وآلية الرفض، والاختبار العدائي (red-teaming)، وتقييم المتانة — ولا يتحمل المؤلفون أي مسؤولية عن إساءة الاستخدام. أنت تتحمل المسؤولية الكاملة عن أي شيء يولده، وعليك إضافة طبقات السلامة والاعتدال الخاصة بك قبل أن يصل أي شيء إلى المستخدم. تعد رخصة Apache 2.0 هي الحد الأدنى؛ وبوابة الغرض البحثي تقع فوقها.

هناك أمران يخطئ فيهما الخطابُ الدائرُ حول النماذج غير الخاضعة للرقابة، وهذه البطاقة تجعل من المستحيل إغفالَهما. أولاً، محاولةُ كسرِ حمايةٍ تنجح ضد هذا النموذج ليست اجتيازَ تقييمِ سلامة — بل هي السلوكُ المُعلَن عنه. النموذجُ المُبتَتَر (abliterated) يُفشِل تلك المحاولات عمداً؛ وقياسُه باختبارٍ واحدٍ من قبيل «هل يمكنك كسر حمايته؟» إنما يَقيس أن التعديل نجح، لا أن الحاجزَ الواقي قوي. ثانياً، برجُ الرؤية المحفوظ ومسارُ استدعاء الأدوات السليم يوسّعان سطحَ الهجوم الفعلي إلى ما وراء النص: حقنُ التعليمات عبر مدخلات الصور وإساءةُ استخدام الأدوات الوكيلية كلاهما يعمل بكامل طاقته، وهذا هو بالضبط سببُ تأطيرِ الفريق الأحمر (red-team) لهذا الأمر بوصفه اختبارَ قدراتٍ لا مرشّحاً لروبوت محادثة. إذا كانت حالتُك الاستخدامية هي طرحُ مساعدٍ موجَّهٍ للمستخدم النهائي، فهذا ليس نموذجَك، وهذا مقصودٌ بحكم التصميم.

أين يتناسب OrcaRouter

إنّ بناءً مُقيَّدًا للاستضافة الذاتية فقط، عمره يومان، هو الحالة النموذجية لاعتماد التوجيه (routing) بدلًا من التوصيل الثابت (hardwiring). عندما تشغّل بناء NVFP4 هذا بنفسك، يمكنك إعداد مسار يشير إليه ويقوم بالتبديل التلقائي (failover) إلى نموذج مستضاف إذا أظهر البناء سلوكًا غير سليم تحت الضغط — واجهة واحدة، دون أي إعادة توصيل بين المزوّدين عند التبديل. وبالنسبة لأعمال التقييم (eval) تحديدًا، فإن خط الأساس المُقدَّم المُقيَّد هو المقارنة التي تريدها، وهو على بُعد ضغطة مفتاح واحدة: يتضمّن الكتالوج نموذج Qwen3.8-Flash من Ali​baba بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مُمرَّرًا بسعر المزوّد المعلن بهامش ربح 0%، لذا يمكن لمنظومة اختبار الفريق الأحمر (red-team harness) التنقّل بين القاعدة المستضافة المقيَّدة وبناءك المحلي غير المقيَّد دون الحاجة إلى عقد ثانٍ، وأي تغيير في أسعار البائع ينعكس على نقطة النهاية (endpoint) الخاصة بك في اليوم نفسه.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash (captured August 29 2026), showing the tagline 'Qwen3.8 Flash is a multimodal reasoning model from Alibaba', the Vision / Tools / JSON / Reasoning feature tags, pricing of $0.15 per 1M input tokens and $0.47 per 1M output tokens, a 1M-token context window with 131K max output, and the API endpoint https://api.orcarouter.ai/v1.

من يجب عليه تنزيل هذا — ومن لا يجب؟

حمّل orcarouter/Qwen3.8-Flash-Next-Uncensored-NVFP4 إذا كنت على Blackwell، وتريد أصغر بصمة خادم في مجموعة Flash-Next مع سرعة نوى FP4 tensor-core، وتقوم بالعمل البحثي الذي وُجد هذا الخط لأجله. حمّل Qwen3.8-Flash-Next-Uncensored-FP8 إذا كنت على Hopper أو تريد المسار الأكثر تحققًا على نطاق واسع. حمّل إصدار GGUF إذا كنت على وحدة معالجة رسوميات استهلاكية أو جهاز بوحدة معالجة مركزية، وإصدار MLX إذا كنت على Apple Silicon، ولا شيء على الإطلاق إذا كان الهدف نشرًا موجهًا للمستخدمين. اقرأ البوابة وإخلاء المسؤولية قبل قبول أي منهما — فهما شروط النموذج، وليست مجرد إجراء شكلي.

جميع إصدارات Flash-Next الخمسة — BF16 وGGUF وMLX وFP8 وNVFP4 — مجمعة في مجموعة Qwen3.8-Flash-Next-Uncensored على Hugging Face.

نموذج مختلف، وليس نسخة أخرى من هذا النموذج: Qwen3.8-27B-Uncensored هو نموذج مجرّد من قاعدة مختلفة وله مجموعته الخاصة ودفاتر تشغيله الخاصة.

هذه الأوزان محلية فقط بحكم التصميم. للحصول على خط أساس مستضاف لقياس البناء المُجرَّد من المحاذاة مقابلَه، Qwen3.8-Flash يُقدَّم على OrcaRouter بسعر قائمة المزود بدون أي هامش ربح — النموذج الأصلي مع محاذاة السلامة سليمة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube