
Qwen3.8-27B-Uncensored-MLX على Apple Silicon: كيفية اختيار نسختك، تحميلها في LM Studio أو mlx-vlm، والتحكم في سياق 262K
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
أكثر ما يفيد معرفته عن orcarouter/Qwen3.8-27B-Uncensored-MLX هو أنك لست مضطرًا إلى اختيار مجلد فرعي لتشغيله. فنسخة OrcaRouter المُجرَّدة (abliterated) والمبنية لشرائح Apple Silicon من Qwen/Qwen3.8-27B — التي نُشرت على Hugging Face في 17 أغسطس 2026، فهي ليست جديدة، بل غير موثّقة بما يكفي — تحتفظ بنسخة من البناء رباعي البت (4-bit) في جذر المستودع، تحديدًا كي تستطيع الأدوات التي تتعامل مع المستودع الواحد بوصفه نموذجًا واحدًا، وأهمها LM Studio، تحميله دون أي إعداد على الإطلاق. وهذا القرار وحده هو السبب في أن هذه البطاقة بلغت نحو 83,000 تنزيل في الشهر الماضي، بينما لا تحصل تحويلات MLX المماثلة إلا على جزء صغير من ذلك. وكل ما سواه هو خيار حقيقي: أيُّ الدقّات الأربع يناسب الذاكرة الموحّدة في جهاز Mac لديك، وأيُّ مشغّل تستخدمه، وما إذا كانت الرؤية واستدعاء الأدوات تبقى صالحة عند عرض البت الذي اخترته، وما إذا كانت نافذة السياق البالغة 262,144 رمزًا تستحق ما تكلّفه على عتادك. وهذا الدليل يستعرض هذه القرارات بالترتيب. وهو توثيق من الطرف الأول — فالأحجام والدقّات وأرقام الدقة أدناه هي من OrcaRouter نفسها، مُقاسة على هذا البناء بعينه، وكل رقم منسوب إلى المجتمع مُعلَّم على هذا النحو.

ما الذي يوجد بالضبط في هذا المستودع؟
هذا بناء منزوع الرفض (abliterated) من Qwen/Qwen3.8-27B — نموذج كثيف بحجم 27B، هجين الانتباه (انتباه خطي Gated DeltaNet بالإضافة إلى انتباه كامل)، أصلاً للرؤية واللغة، مع تحكم في التفكير، واستدعاء الأدوات، ورأس تنبؤ متعدد الرموز (MTP)، ونافذة سياق بطول 262,144 رمزًا. يعمل الإزالة (Abliteration) على إزالة سلوك الرفض في النموذج عن طريق تعامد اتجاه الرفض مع تيار البقايا (residual stream)؛ إذا كان هذا جديدًا عليك، فمن الأفضل أن تبدأ بدليلنا التمهيدي حول هذه التقنية بدلًا من هذه الصفحة، التي تتعلق بتشغيل البناء وليس بالمنهجية. الأوزان مرخصة بموجب Apache-2.0، موروثة من النموذج الأساسي.
لا تخلط بين هذا المستودع و qwen-3-8-27b-mlx، وهو نفس النموذج الأساسي بصيغة MLX بدون الـ abliteration. عادةً ما يلتقط القراء أحدهما وهم يقصدون الآخر: هذا الإصدار هو البناء البحثي الذي أزيلت منه آليات الرفض؛ وذاك هو Qwen/Qwen3.8-27B العادي على Apple Silicon. تحقق من اسم المستودع قبل أن تقضي وقت التحميل.
هناك تفصيل بنيوي واحد أهم مما يبدو: برج الرؤية، وجميع طبقات التطبيع، وconv1d الخاص بالانتباه الخطي تبقى في BF16، والطبقات الخطية لنموذج اللغة فقط — بما في ذلك embed_tokens و lm_head — هي التي يتم تكميمها. ولهذا السبب ينجو فهم الصور من التكميم، وهو أيضًا ما يجعل الأحجام على القرص أدناه أكبر قليلًا من تقدير ساذج «27B عند N بِتّات»: جزء من النموذج لا يُضغط أبدًا.
القرار: أي إصدار يناسب أي جهاز Mac

أربعة مستويات دقة تأتي كمجلدات فرعية — 8-bit/، 6-bit/، 4-bit/، 2-bit/ — جميعها تكميم أفيني MLX بحجم مجموعة 64. نسخة 4-bit متاحة أيضًا في جذر المستودع. اختر أولاً على أساس الذاكرة الموحدة لجهاز Mac الخاص بك، ثم الجودة:
• 8-bit — يشغل حوالي 27.5 جيجابايت على القرص، ويتطلب جهاز ماك بسعة 64 جيجابايت (يمكن لجهاز بسعة 32 جيجابايت تحميله لكنه يترك مساحة صغيرة لأي شيء آخر). تم قياس دقة جيب التمام مقابل المصدر BF16: 0.9997، وهو قريب فعليًا من عدم الفقدان. اختره عندما تكون الجودة هي كل ما يهم وتكون الذاكرة وفيرة.
• 6-bit — ~22 غيغابايت، يناسب أجهزة Mac بسعة 24–32 غيغابايت. الدقة 0.9996، ممتاز. أفضل توازن بين الجودة والمساحة لمعظم مالكي أجهزة بسعة 48 غيغابايت.
• 4-bit — حوالي 15 جيجابايت، مريح على Mac بسعة 24 جيجابايت. الدقة 0.996، جيدة جدًا. هذا هو الإعداد الافتراضي الموصى به، وهو النسخة الموجودة في جذر المستودع لهذا السبب.
• 2-bit — ~8.7 جيجابايت، يناسب Mac بسعة 16 جيجابايت. الدقة 0.92 وعند 27B تتدهور بشدة: حلقات تكرار، نصوص مشوشة، كود ولغة صينية، ورؤية جزئية. البطاقة توضح ذلك بصراحة — للأرشفة فقط، وليس للعمل الفعلي. يمكن لجهاز Mac بسعة 16 جيجابايت تحميله تقنيًا؛ لكن ذلك لا يجعله قابلًا للاستخدام.
الحجم على القرص ليس رقم الذاكرة. يجب أن تتسع الأوزان في الذاكرة الموحّدة إلى جانب macOS وذاكرة التخزين المؤقت KV والمخازن المؤقتة الخاصة بـ Metal، لذا اترك مساحة احتياطية. قياس تشغيل مجتمعي لنسخة 4-bit على Mac من طراز M1 Pro بسعة 32 جيجابايت أظهر ~16 جيجابايت من الأوزان على القرص لكن ذروة استدلال بلغت 18.5–21.7 جيجابايت؛ كما تشير تشغيليات مجتمعية لنسخ MLX بدقة 8-bit إلى ذروات تبلغ حوالي 34–36 جيجابايت حتى عندما تكون الأوزان ~29.5 جيجابايت. الإرشاد العملي من نفس الاختبار المجتمعي هو: 16 جيجابايت ليست خيارًا حقيقيًا لنموذج 27B، و24 جيجابايت يمكنها تجربة دقة 4-bit مع سياق قصير، و32 جيجابايت هي نقطة البداية المريحة. مقالنا حول تخطيط ذاكرة VRAM يشرح نفس الحسابات لعائلة النماذج بأكملها.
نظرًا لأن القائمة على مستوى المستودع تبلغ حوالي 94 جيجابايت عبر كل دقة، قم بتنزيل المجلد الفرعي الذي تحتاجه فقط باستخدام hf download orcarouter/Qwen3.8-27B-Uncensored-MLX --include "4-bit/*" --local-dir ./Qwen3.8-27B-Uncensored-MLX — مع استبدال الدقة التي اخترتها. النسخة الجذرية 4-bit هي نسخة مكررة من المجلد الفرعي 4-bit، لذلك لا تحتاج أبدًا إلى تنزيل كليهما.
المسار الأول — LM Studio، بدون أي إعدادات
النسخة الجذرية بدقة 4-bit موجودة تحديدًا لكي يتمكن LM Studio من التعامل مع المستودع كله كنموذج واحد. ابحث عن معرّف النموذج، واختر الدقة التي تريدها (النسخة الجذرية هي 4-bit)، ويتكفل التطبيق بالباقي. ثلاث مشاكل، كلها من بطاقتنا، وهي الفرق الكامل بين نجاح هذا وفشله:

• المستودع مقيّد. التنزيلات المجهولة تحصل على HTTP 401. اقبل الشروط في صفحة النموذج، ثم الصق رمز قراءة Hugging Face في LM Studio: Settings ← Integrations ← Hugging Face. إذا تخطيت هذا، فسيفشل التحميل ببساطة.
• عطّل تكميم ذاكرة التخزين المؤقت KV.إن نماذج الرؤية MLX لا تدعم ذلك على هذه البنية، ويفشل التحميل أثناء التهيئة إذا كان مفعّلاً (مُتتبَع باسم mlx-engine#286). وهذا عكس النصيحة الخاصة بإصدارات GGUF، حيث يُعد تكميم ذاكرة التخزين المؤقت K/V توفيرًا مشروعًا لذاكرة VRAM — فالصيغتان غير قابلتين للتبادل هنا.
• حدّث وقت التشغيل. qwen3_5 تمت إضافة دعم هذه البنية في mlx-vlm 0.6.x؛ لا يمكن لوقت التشغيل المرفق القديم تحميل هذه الأوزان إطلاقًا. وعلى النقيض، فإن شارة "Likely too large" في LM Studio هي مجرد تحذير بشأن الذاكرة (RAM)، وليست خطأً — تجاهلها إذا كانت ذاكرتك الموحدة تستوفي الإرشادات أعلاه.
أي دقة في LM Studio؟ 8-بت تستهلك حوالي 29.5 جيجابايت على القرص وتتطلب جهاز Mac بسعة 64 جيجابايت؛ 6-بت حوالي 22 جيجابايت مناسبة لجهاز بسعة 48 جيجابايت؛ 4-بت بحوالي 16 جيجابايت هي الخيار الأمثل على جهاز Mac بسعة 32 جيجابايت. إذا كنت تريد استخدام مسار llama.cpp / Ollama على أجهزة أخرى، فإن دليل التشغيل المحلي لدينا للنموذج غير الخاضع للرقابة يغطي هذا المسار بشكل منفصل.
المسار الثاني — mlx-vlm وmlx-lm من مجلد فرعي
مسار سطر الأوامر يمنحك الدقة مباشرةً وخادمًا متوافقًا مع OpenAI لأدوات الوكلاء. المتطلبات: pip install -U mlx-vlm (mlx-vlm ≥ 0.6.13 وmlx ≥ 0.32؛ يتم تحديد الخلفية Metal تلقائيًا على Apple Silicon). بعد تنزيل المجلد الفرعي أعلاه:
python -m mlx_vlm generate --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --prompt "اشرح التشابك الكمي في جملة واحدة." --max-tokens 256
أضف --image path/to/image.png للإدخال البصري، أو قدّمها:
python -m mlx_vlm server --model ./Qwen3.8-27B-Uncensored-MLX/4-bit --port 8080
For agent frameworks that speak OpenAI-compatible APIs, mlx_lm.server is the lighter path — uv tool install mlx-lm then mlx_lm.server --model "orcarouter/Qwen3.8-27B-Uncensored-MLX", which serves at http://localhost:8080/v1 with api type openai-completions. Our card carries self-reported community configs pointing Pi, Hermes and OpenClaw at that endpoint. Those are user-supplied setups we have not reproduced, so treat them as starting points, not guarantees.
الرؤية تنجو من التكميم
نظرًا لأن برج الرؤية وconv1d يبقيان في BF16، فإن فهم الصورة يُحفظ عند 4/6/8-بت. على صورة الاختبار لدينا — الأشكال والألوان والموضع والخلفية والنص داخل الصورة — وصفت الإصدارات 4/6/8-بت كل شيء بشكل صحيح؛ بينما كان إصدار 2-بت جزئيًا فقط. إذا كنت تختار إصدارًا وكانت الرؤية مهمة، فإن 4-بت هو الحد الأدنى الذي يجب أن تختاره. لم ننشر إنتاجية رؤية خاصة بـ Apple Silicon لهذا الإصدار، لذا لا تثق في رقم tok/s له ما لم يأتِ من تشغيل مسمى على فئة رقائقك الخاصة.
برج الرؤية المحفوظ هو أيضًا جزء من سطح المخاطر، ومن الجدير قول هذا الأمر بوضوح: النموذج المُفرَّغ من الحماية الذي يمكنه قراءة الصور أيضًا ليس مشكلة أمان نصية فقط.
استدعاء الأدوات واستخدام الوكلاء
استدعاء الأدوات قدرة من قدرات النموذج الأساسي، وهو ينجو من عملية الإزالة (abliteration)، مما يجعل هذا الإصدار مفيدًا حقًا لاختبار الأنظمة الوَكيلية (red-teaming) — وخطيرًا حقًا إذا ما وُجّه نحو خدمات حقيقية. الإعداد القياسي هو mlx_lm.server نقطة النهاية المذكورة أعلاه، والتي يمكن لأي وكيل متوافق مع OpenAI الاتصال بها. إذا قمت بتشغيله كوكيل، فافهم ما فعّلته: نموذج خالٍ من الرفض مع إمكانية استدعاء الدوال وسياق 262K يمثل موقفًا أمنيًا مختلفًا عن نموذج المحادثة، وتأطير البطاقة على أنه للاستخدام البحثي فقط موجود لهذا السبب.
سياق 262K وما يكلفه حقًا
تمنح هذه البنية هذا النموذج سياقًا طويلًا بتكلفة منخفضة بشكل غير اعتيادي. الانتباه الهجين هنا يعني 48 طبقة انتباه خطي (Gated DeltaNet) متداخلة مع 16 طبقة انتباه كامل، وطبقات الانتباه الكامل الـ16 فقط هي التي تحمل ذاكرة تخزين مؤقت تقليدية من نوع KV — بينما تحتفظ الطبقات الخطية بحالة متكررة مدمجة بدلًا من ذلك. لذا فإن 262,144 رمزًا تكلف أقل بشكل ملموس مما كانت ستكلفه في نموذج 27B بانتباه كامل. هذه حقيقة بنيوية تتعلق بالنموذج الأساسي، وليست وعدًا بخصوص جهاز Mac الخاص بك.
في الممارسة العملية، النافذة إمكانية وليست طبقة مجانية. اختبار مجتمعي للسياق الطويل على شريحة M4 Max قاس نحو 63 رمزًا/ثانية في السياق القصير، ليهبط إلى حوالي 11 رمزًا/ثانية عند 31 ألف رمز — إذ يتدهور فك الترميز بشكل حاد مع امتلاء الكاش، وغالبًا ما يكون زمن وصول الرمز الأول في الاستعلامات الطويلة جدًا هو العائق الأكبر من الإنتاجية الخام. التعبئة المسبقة التخمينية والقائمة على ANE تحسّن الاستيعاب، لا فك الترميز. أرقام تكلفة كاش KV الخاصة بنا لهذا البناء على سيليكون Apple غير منشورة؛ إذا كنت بحاجة إلى أرقام دقيقة لعتادك، فإن تشغيلات المجتمع هي المصدر الصادق، والإجماع المجتمعي هو التعامل مع السقف الكامل البالغ 262 ألفًا كشيء تلجأ إليه عمدًا، لا كإعداد افتراضي تتركه مفعّلًا.
السرعة — ما الذي يتم قياسه فعليًا
ننشر رقم سرعة واحدًا فقط لهذا الإصدار، وهو ليس لشرائح Apple Silicon: حوالي 32–37 رمزًا/ثانية في الحالة المستقرة على وحدة H200 واحدة عبر خلفية MLX CUDA، وهو ما يؤكد أن الأوزان تعمل أيضًا خارج macOS. أما على أجهزة Mac، فإن بطاقتنا لا تنشر أي رقم رموز/ثانية عمدًا، لأنه يعتمد على الشريحة والدقة والمشغّل. أرقام تهم الممارسين، وجميعها مُصنَّفة على هذا النحو:
• هذا الإصدار بالضبط، 4-bit، M1 Pro 32 GB: ~8.7 tok/s للتوليد و~41.7 tok/s للملء المسبق في تشغيل قصير (اختبار المجتمع، أغسطس 2026). رقاقة أقدم، لكنها حد أدنى واقعي.
• oMLX مع MTP أصلي على M4 Max، نقطة تفتيش قياسية غير مجرّدة: 53.3 رمز/ثانية للنثر و72.1 رمز/ثانية للكود، مع ~273.7 رمز/ثانية تعبئة مسبقة عند 4K؛ فك التشفير الخام بدون MTP ~24.6 رمز/ثانية. قياسات مُمارِس على نقطة تفتيش وبيئة تشغيل مختلفة، لذا تعامل معها كحدٍّ أعلى قد تقترب منه الأوزان المُجرّدة وليس كوعد.
• oMLX prefill ثنائي ANE على M3 Ultra، نسخة abliterated من oQ4e-MTP: prefill أسرع بنسبة تصل إلى ~17.7% عند 16K و~18.9% عند 32K، وdecode عبر Lightning MTP يصل إلى ~75 tok/s عند 16K. المحاذير حقيقية: إنه يستخدم واجهات وقت تشغيل Apple الخاصة وأوزان INT8 تقريبية، ويضيف حوالي 4 جيجابايت من الذروة في الذاكرة، ويرفع زمن تحميل النموذج من ~3.4 ثانية إلى ~28 ثانية. هذا تحسين لابتلاع المطالبات (prompt-ingestion)، وليس مسرّعًا للتوليد.
رأس MTP — تسريع مجاني إذا كان Runner الخاص بك يدعمه
يوفّر هذا الإصدار مُقترح التنبؤ متعدد الرموز للنموذج الأساسي في المجلد الفرعي mtp/ (البنية qwen3_5_mtp)، وهو يعمل مع أي دقة رئيسية. القبول غير مُفقد — مع فك الترميز الجشع يكون الناتج مطابقًا للتشغيل بدون المُقترح — لذا فهو تسريع حقيقي دون أي خسارة في الجودة عند تفعيله. ملاحظتا إعداد من بطاقتنا: يتطلب إصدار mlx-vlm يتضمن مُقترح qwen3_5_mtp (فرع main)، ويجب تمرير كلًا من --draft-model ./Qwen3.8-27B-Uncensored-MLX/mtp و--draft-kind mtp. إن ضبط mtp_enabled وحده لا يفعّل شيئًا. إذا كان المشغّل لديك لا يدعم المُقترح، فسيتم تجاهله ويعمل النموذج بشكل طبيعي — لا شيء يتعطل.
السلامة — اقرأ هذا قبل تشغيله، لا بعده.
إن إخلاء المسؤولية الخاص ببطاقة النموذج مباشر بشكل غير معتاد، وهذه الصفحة لن تخفف من حدته. لقد تمت إزالة مواءمة السلامة لهذا الإصدار بشكل جوهري. سوف يمتثل هذا النموذج للطلبات الضارة أو غير الأخلاقية أو المسيئة أو غير القانونية التي كان النموذج الأساسي Qwen/Qwen3.8-27B سيرفضها، ولا يحتوي على أي حواجز حماية مدمجة ذات معنى. تم إصداره بشكل صارم لأغراض البحث المشروع — قابلية التفسير، ودراسة سلامة الذكاء الاصطناعي وآليات الرفض، والاختبارات العدائية، وتقييم المتانة، والتجارب المضبوطة. إذا لم يكن هذا هو ما تفعله، فهذا هو النموذج الخاطئ.
تستحق تحذيران من البطاقة التركيز. أولاً، إن عمليات "اختراق الحماية" (jailbreak) وفحوصات السلامة "تنجح" بشكل تافه على نموذج مُجرَّد من اتجاهات الرفض (abliterated)، وهذا ليس تقييم سلامة ناجحًا — بل هو السلوك المتوقع لنموذج أُزيل منه اتجاه الرفض. غياب الرفض ليس دليلاً على السلامة. ثانيًا، إن الرؤية المحفوظة، واستدعاء الأدوات، وسياق {{1}}262K{{/1}} يوسّعان سطح الهجوم ليشمل فهم الصور والاستخدام الوكيل (agentic): نموذج غير مُقيَّد يمكنه قراءة لقطات الشاشة واستدعاء الأدوات هو خطر أوسع من بناء مُجرَّد من الرفض ويقتصر على الدردشة فقط. تُضيف التكميم منخفض الدقة (low-bit quantization) طبقة ثالثة من عدم الاستقرار فوق ذلك — عند دقة {{2}}2-bit{{/2}}، يمكن الخلط بين المخرجات المشوَّشة والرفض نفسه، وهذا نوعٌ مستقل من الفشل المُربِك.
أنت تتحمل المسؤولية الكاملة والتبعة القانونية عن الاستخدام والمخرجات. رخصة Apache-2.0 موروثة من النموذج الأساسي ولا تغيّر ذلك: فهي تسمح بالاستخدام، لكنها لا تجعل نشرك آمنًا. على أي شخص ينشر هذا للمستخدمين النهائيين أو القُصَّر أو في أي بيئة إنتاجية أن يضيف أولًا طبقات الإشراف والسلامة ومنع إساءة الاستخدام الخاصة به، وأن يمتثل للقانون المعمول به. أما بالنسبة للباحثين الذين يشغّلونه فعليًا، فالضوابط العملية هي: بيئة معزولة ويفضل أن تكون غير متصلة بالإنترنت؛ أدوات وكيل غير موجهة إلى خدمات حقيقية؛ عدم تعريض المستخدمين النهائيين له؛ ومراجعة المخرجات قبل أن تذهب إلى أي مكان.
عندما لا يكون المحلي هو الحل
المحلية هي جوهر هذا الإصدار — الأوزان موجودة على قرصك، لا تكلفة لكل توكن، ولا يغادر أي شيء جهازك. لكن المحلية أيضًا سقف: فهي لا تعمل إلا على Apple Silicon، وعليك أن تتعايش مع جودة التكميم، ولا يوجد أي تكرار احتياطي إذا كان الجهاز مشغولًا. إذا كنت تحتاج عبر API إلى نموذج من فئة 27B غير مُخضَّع لإزالة أنماط الرفض (non-abliterated) لعبء عمل حقيقي، أو أردت إجراء اختبار A/B بين هذا الإصدار المحلي ونموذج مستضاف بنفس الاستدعاءات (prompts)، فهذه هي الفجوة التي وُجدت طبقة توجيه لسدّها. يتيح OrcaRouter الوصول إلى أكثر من 200 نموذج عبر مفتاح API واحد وبسعر القائمة لدى المزوّد، مع تحويل تلقائي عند الفشل ولغة توجيه خاصة بالمجال (DSL) — أي تخفيض في الأسعار من المزوّد يدخل حيز التنفيذ من جهتنا في اليوم نفسه الذي يُعلَن عنه، لأننا نمرّر سعر القائمة كما هو. API واحدة، وتكامل واحد، ويمكنك مقارنة إعداد محلي لم يُثبَت بعد بنموذج مستضاف دون إنشاء حساب ثانٍ. نحن لا نستضيف هذا الإصدار من MLX — فهو أوزان محلية بطبيعة تصميمه — لذا فإن API هي المسار المكمّل، وليست بديلًا عنه.
دليل القرار السريع
• ماك بسعة 16 جيجابايت — بصراحة، ليس هذا الطراز. نسخة 2-بت تناسب لكنها للأرشفة فقط؛ ستواجه معاناة مع الذاكرة بأي حال. ابحث عن نموذج أصغر غير مقيّد، أو التحويل المختلط 3/6-بت الذي صنعه المجتمع لأجهزة 18–24 جيجابايت.
• ماك 24 جيجابايت — 4-بت، وحافظ على السياق قصيرًا؛ لا تشغّل الرؤية والسياق الطويل في نفس الوقت.
• 32 GB Mac — 4-bit هو الأمثل؛ 6-bit إذا حافظت على سياق مضغوط.
• ماك بسعة 48 جيجابايت — 6-بت مع مساحة رأس؛ 8-بت إذا لم تدفع النافذة إلى أقصى حد.
• 64 جيجابايت وما فوق — 8-بت، وشبه خالٍ من الفقدان، وسياق 262K في المتناول مع التحفظات المذكورة أعلاه.
هذا هو دليل التشغيل الكامل. النموذج يعود إلى 17 أغسطس 2026، وليس خبر إطلاق، ولا يحتاج إلى ذلك: فقد حدثت 83,000 عملية تنزيل لأن الناس أرادوا دليلًا إرشاديًا، وهذه الصفحة هي ذلك الدليل. ابدأ من جذر المستودع، وحمّل نسخة 4-بت في LM Studio، ولا تترك البنية الافتراضية إلا عندما تعرف ما الذي تتنازل عنه مقابل الجودة. إذا أتيت من جهة GGUF أو FP8، فإن الأدلة ذات الصلة تغطي تلك المسارات — إطار القرار هنا هو نفسه، لكن حسابات التكميم ليست كذلك.
ليس مجرد بناء آخر لهذا النموذج — Qwen3.8-Flash-Next-Uncensored هو إصدار منفصل: مُشتق من Qwen3.8-Flash-Next عبر تقنية الإزالة (abliteration)، وهو معاينة من نوع مزيج الخبراء (mixture-of-experts) لمعمارية Qwen4 بإجمالي 176B مخزّن / 6B نشط. نفس تقنية الإزالة، أوزان مختلفة، ومجموعة خاصة به.
جميع الإصدارات الستة بحجم 27B — BF16 وGGUF وMLX وFP8 وINT8 وNVFP4 — مجمعة فيمجموعة Qwen3.8-27B-Uncensoredعلى Hugging Face.
هذه الأوزان مخصصة للاستخدام المحلي فقط بحكم التصميم. ولإتاحة خط أساس مستضاف تُقارَن به النسخة المجرّدة من الحماية، Qwen3.8-27B يُقدَّم على OrcaRouter بسعر قائمة المزود دون أي زيادة — النموذج الأصلي مع محاذاة السلامة سليمة.
