
Qwen3.8-27B مع MLX على Apple Silicon: نعم، إنه يعمل — إليك ما تحتاجه حقًا
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 لكل مليون رمز · 22 tok/s
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1343 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 273 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
يعمل Qwen3.8 27B اليوم على Apple Silicon عبر MLX. العلامة هي qwen3.8:27b-mlx في Ollama، تمت إضافته في Ollama v0.32.12، والإصدار 4-bit يُحمَّل بحوالي 18 جيجابايت ويحتاج تقريبًا إلى 16–19 جيجابايت من الذاكرة الموحدة — مما يجعل Mac بسعة 24 جيجابايت أو أكثر هو الحد الأدنى الواقعي، وMac بسعة 16 جيجابايت غير مناسب. الأوزان مرخصة بموجب Apache 2.0، ومجانية عند الاستخدام على الأجهزة التي تملكها، وهذا هو جوهر الهدف من النموذج. إصدار Alibaba عمره يومان (13–14 أغسطس 2026)، لذا كل رقم أدناه مُعلَّم: ما جاء من بطاقة نموذج Alibaba، وما تحققنا منه من صفحة Ollama اليوم، وما هو تقدير أو قياس من طرف ثالث.
صحيفة الوقائع في 30 ثانية
Qwen3.8 27B هو نموذج علي بابا الكثيف الذي يضم 27 مليار معامل، وتم إطلاقه في 13–14 أغسطس 2026 بترخيص Apache 2.0 — حيث نُشرت الأوزان على Hugging Face وModelScope في اليوم الثالث عشر، مع ظهور ملف LICENSE في صباح اليوم التالي. وهو النموذج الكثيف القابل للنشر الشقيق لنموذج Qwen3.8-Max الذي يضم 2.4 تريليون معامل. من بطاقة النموذج، جميع البيانات مذكورة بواسطة علي بابا ولم يتم التحقق منها بشكل مستقل بعد.
• الحجم — 27B كثيف، 27.78B إجمالي المعلمات بما في ذلك مشفر الرؤية.
• البنية — 64 طبقة، حجم مخفي 5,120، ومفردات 248,320.
• انتباه هجين — 16 طبقة انتباه كامل بالإضافة إلى 48 طبقة خطية من Gated DeltaNet، بنسبة 3:1.
• السياق — 262,144 رمزًا أصليًا، قابل للتوسيع إلى 1M عبر YaRN (يسرد Ollama العلامة عند 256K).
• الإدخال — فهم أصلي للصور والفيديو إلى جانب النص، من المستندات إلى فيديو يمتد لساعات.
• الأوزان — 55.6 جيجابايت بصيغة BF16، مع تضمين رأس فك الترميز التخميني MTP.

على جانب MLX، تم التحقق اليوم: توفر Ollama إصدار qwen3.8:27b-mlx — وهو إصدار أصلي لـ MLX لأجهزة Apple Silicon بحجم تنزيل 4-bit يبلغ حوالي 18 جيجابايت — وتذكر ملاحظات إصدار v0.32.12 تحسينًا خاصًا بأجهزة Apple Silicon. mlx-lm، وهي أدوات Python الخاصة بشركة Apple، تدعم البنية لأغراض التوليد والتحويل، كما ظهرت تكميمات MLX (بمعدلات 3/5/6-bit، بالإضافة إلى MXFP4 وNVFP4) خلال ساعات من إصدار الأوزان. تفترض بقية هذه المقالة استخدام جهاز Mac من فئة M-series بذاكرة موحّدة تبلغ 24 جيجابايت أو أكثر.
ما الذي يغيّره MLX في الذاكرة
على Apple Silicon لا توجد ذاكرة VRAM منفصلة. يعمل MLX على تجمّع الذاكرة الموحّدة من سلسلة M، لذا فإن الرقم المهم هو إجمالي ذاكرة RAM في جهاز Mac الخاص بك مطروحًا منه ما تستخدمه macOS وكل شيء آخر. النموذج الذي "يناسب 17 جيجابايت" يحتاج إلى جهاز بذاكرة أكبر من ذلك بشكل مريح.
الخبر السار هو أن Qwen3.8 27B أقل تكلفة في الاحتفاظ به مما يوحي به عدد معالمه. ولأن الطبقات الست عشرة ذات الانتباه الكامل فقط هي التي تحتفظ بذاكرة تخزين مؤقت من نوع KV — بينما الطبقات الخطية الـ 48 لا تفعل ذلك — فإن تكلفة الذاكرة المؤقتة تبلغ حوالي 64 كيلوبايت لكل رمز، أي ربع ما تدفعه النماذج الكثيفة التقليدية ذات الـ 64 طبقة. وفي الطرف الأقصى، تحتاج نافذة الـ 262 ألف كاملة إلى حوالي 16.4 جيجابايت من الذاكرة المؤقتة بالإضافة إلى الأوزان، وهو ميزانية خادم وليس ميزانية كمبيوتر محمول.
السلم الواقعي لماك، حجم الملف بالإضافة إلى مساحة ذاكرة التخزين المؤقت:
• MLX بدقة 4-بت — بإجمالي ~16–19 جيجابايت. يناسب Mac بسعة 24 جيجابايت مع نافذة تبلغ نحو 64K–96K؛ وهو الخيار الافتراضي المنطقي.
• MLX بدقة 6-بت — حوالي 21–22 جيجابايت. على أجهزة بسعة 32 جيجابايت؛ قفزة الجودة مقارنةً بـ 4-بت متواضعة.
• MLX بثمانية بتات — ~27–30 جيجابايت. أجهزة بسعة 48 جيجابايت أو أكثر؛ شبه بدون فقدان.
• BF16 — حوالي 55.6 جيجابايت. فقط أجهزة الاستوديو M-series Max وUltra من الفئة العليا.

المصادر: الرقم رباعي البتات يتتبع قياس GGUF Q4_K_M (17.1 جيجابايت، unsloth، 14 أغسطس) وتنزيل Ollama البالغ 18 جيجابايت؛ بينما يتتبع رقما 8-bit وBF16 بطاقة BF16 الخاصة بـ Alibaba وسلالة Qwen3.6-27B. رقم ذاكرة التخزين المؤقت البالغ 64 كيلوبايت لكل رمز مشتق من البنية المعمارية، وليس مطبوعًا على ورقة مواصفات، ولا ينطبق إلا على بيئات التشغيل التي تتخطى ذاكرة التخزين المؤقت KV في الطبقات الخطية بالطريقة التي تفعلها MLX.
ثلاث طرق لتشغيله، من الأبسط إلى الأكثر تحكمًا
المسار أ — Ollama، الأبسط
قم بالترقية إلى Ollama 0.32.12 أو أحدث، ثم:
• ollama pull qwen3.8:27b-mlx — يقوم بتنزيل إصدار MLX بحوالي 18 جيجابايت.
• ollama run qwen3.8:27b-mlx — interactive chat with the thinking template wired up.
• ollama serve — يوفّر واجهة برمجة تطبيقات متوافقة مع OpenAI على localhost:11434 لتطبيقاتك.

أحد العيوب المعروفة، من مشكلة نشطة على GitHub وقت كتابة هذا المقال: qwen3.8:27b-mlx يرفض دور "developer" على نقطة النهاية /v1/responses، مما يعطل ollama launch codex لهذا النموذج — بينما مباشرةً، ollama run يعمل بشكل جيد. إذا كنت تبني حلقة وكيل بأسلوب Codex على إصدار MLX، اختبر نقطة النهاية المحددة التي تخطط لاستخدامها قبل الاعتماد عليها في الحلقة.
المسار ب — mlx-lm، الأكثر تحكمًا
حزمة أدوات Apple الخاصة. ثبّتها باستخدام pip install mlx-lm، ثم إما سحب نقطة تفتيش MLX مكمّمة مسبقًا أو تحويل الأوزان الرسمية BF16 بنفسك:
• mlx_lm.generate --model <checkpoint> — قم بتشغيل نقطة تفتيش مباشرة؛ نسخ المجتمع المكمّمة بدقة 4-bit و8-bit من نموذج 27B كانت لا تزال تُنشر في mlx-community خلال أيام من الإصدار.
• mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — حوِّل مرة واحدة فقط؛ التكلفة تعادل تقريبًا تنزيلًا واحدًا.
• mlx_lm.server --model <checkpoint> — خادم متوافق مع OpenAI يطبّق قالب محادثة thinking-block من أجلك.
إذا لم يكن الإصدار المكمّم المحدد الذي تريده متاحًا بعد، فإن التحويل من الأوزان الرسمية مهمة قصيرة على أي جهاز Mac من سلسلة M، ويزيل أي شك حول ما شحنه طرف ثالث.
المسار C — LM Studio، الخيار بنقرة واحدة
يستخدم LM Studio الواجهة الخلفية MLX على Apple Silicon والتقط Qwen3.8 27B عند إصداره: ابحث عن النموذج، واختر كمية تكميم تناسب الرام لديك، وسيتم تنزيله وتشغيله. إذا كنت تفضل واجهة رسومية، فهذه هي الطريقة الأسهل، ويغطي دليلنا المصاحب ذلك من البداية إلى النهاية — انظر "كيفية تشغيل Qwen3.8 27B محليًا" في القراءات ذات الصلة أدناه.
فخ القوالب
يبدأ تشغيل Qwen3.8 27B بالتفكير افتراضيًا، ويتم عرض كتل التفكير بواسطة قالب الدردشة، وليس بواسطة نواة النموذج. تشير الاختبارات الخارجية التي أُجريت خلال أول 48 ساعة إلى أن القالب الرسمي يغلّف كل دورة من دورات المساعد في كتلة تفكير — حتى الفارغة منها — وأنه في حلقات الوكيل متعددة الأدوار تتداخل الكتل ويتم اقتطاع السجل، وهو ما يبدو وكأنه فقدان ذاكرة. المشكلة ليست في التكميم. إذا وفرت بيئة تشغيل قالبًا مصححًا، فاستخدمه؛ وعند بناء حلقة وكيل لا تحتاج فيها إلى الاستدلال، عطّل التفكير لكل طلب — إذ يكشف قالب الدردشة عن علامة enable_thinking، ويقبل النموذج reasoning_effort بقيمة xhigh أو medium أو low.
ما هو الشعور الفعلي
اختبار مستقل على Mac mini M4 بذاكرة موحّدة سعتها 32 جيجابايت، مع تشغيل إصدار MLX 4-bit، قاس سرعة توليد تبلغ نحو 5–6 توكن/ثانية. هذا هو الرقم الذي ينبغي أن يضبط التوقعات: جيّد للصياغة التفاعلية، والاستدلال طويل المدى، واستدعاءات الوكلاء العرضية؛ ومُرهق للحلقات الوكيلة الطويلة والمهام الدُفعية. حكاية المُختبِر نفسه — تفكير يستغرق عدة دقائق يتبعه تطبيق صغير يبدو سليمًا لكنه لا يصحّ حسابيًا — تذكير جيّد بأن نموذج 27B على حاسوب محمول مساعدٌ قادرٌ لكنه غير معصوم.
السرعة تتفاوت حسب شريحة المعالج: شريحة M-series Max المزوّدة بعرض نطاق ذاكرة ونوى أكثر تعمل بشكل أسرع بشكل ملحوظ من M4 الأساسية في جهاز mini. لكن سرعة 5–6 رمز/ثانية في الطراز الابتدائي هي الخط الأساسي الصادق، وعليك أن تحكم على أي عنوان رئيسي يدّعي "يعمل على Apple Silicon" في ضوء هذا الرقم.
سياق 262K هو ميزة من ميزات الخادم
نافذة Qwen3.8 27B الأصلية البالغة 262K مفيدة حقًا — لكنها على Mac مقيدة بالذاكرة، وليس بالنموذج نفسه. مع وجود ذاكرة تخزين مؤقت KV بحجم 64 كيلوبايت لكل رمز، تكلف نافذة 8K حوالي 0.5 جيجابايت، ونافذة 32K حوالي 2 جيجابايت، ونافذة 128K حوالي 8 جيجابايت، والنافذة الكاملة 262K حوالي 16.4 جيجابايت إضافةً إلى أوزان النموذج. على جهاز بسعة 24 جيجابايت يعمل بدقة 4-بت، يبلغ الحد الأقصى الواقعي حوالي 64K–96K رمزًا؛ والوصول إلى 128K+ يتطلب جهازًا بسعة 32 جيجابايت فأكثر، بينما تتطلب النافذة الكاملة جهازًا تكون ذاكرته الموحدة مخصصة في معظمها لذاكرة التخزين المؤقت. خطط للسياق الذي تحتاجه فعلًا وحدّد سقفه في إعدادات التشغيل — سيكون النموذج سعيدًا، وسيبقى ملف المبادلة هادئًا.
عندما تكون Apple Silicon هي الإجابة الخاطئة
اتخذ مسارًا مختلفًا إذا كان أي من هذه هو عبء عملك:
لديك جهاز Mac بسعة 8 أو 16 جيجابايت. يتطلب الإصدار رباعي البت (4-bit) بالفعل ما يقارب 17 جيجابايت من الذاكرة الموحدة؛ أي شيء أقل من ذلك يؤدي إلى مبادلة الذاكرة ويصبح النموذج غير قابل للاستخدام. هذا هو الخطأ الأكثر شيوعًا على الإطلاق، ولا يمكن لأي قدر من حيل التكميم إصلاحه.
• تحتاج إلى نافذة 262K الكاملة أو امتداد YaRN بسعة 1M. ميزانية KV هذه هي ميزانية خادم، وليست ميزانية كمبيوتر محمول.
• أنت تخدم أشخاصًا آخرين. اللابتوب مقعد واحد؛ إنتاجية المستخدمين المتعددين تحتاج إلى صندوق GPU أو واجهة برمجة تطبيقات مستضافة.
• تحتاج إلى التحرك بسرعة في الحلقات الوكيلة الطويلة. 5–6 tok/s مناسبة لإنسان يقرأ على طول، لكنها بطيئة بالنسبة لوكيل فرعي.
الإطار الصادق: عرض Qwen3.8 27B هو أنه مجاني عند نقطة الاستخدام على أجهزتك أنت — عكس نموذج API الذي يفرض رسومًا على كل رمز. لهذا السبب تحديدًا ليس في كتالوج OrcaRouter (الكتالوج يوجّه الجيل السابق Qwen3.6/3.5-27B وخط Qwen API المستضاف). نحن الأداة الخاطئة لقصة الاستخدام المحلي المجاني، وهذه هي النقطة: عندما يتجاوز عبء العمل قدرات جهاز Mac، تكون البدائل صندوق GPU أو GPU مستأجر أو Qwen API مستضاف — وليس موجّهًا يحدث أن يحمل هذا الإصدار 27B بالذات.
خلاصة القول
Qwen3.8 27B على Apple Silicon حقيقي، وهو جيد، ونطاقه محدود. إصدار MLX بدقة 4-بت يناسب أجهزة Mac بسعة 24+ جيجابايت، ويُحمَّل كـ qwen3.8:27b-mlx في Ollama، ولا يكلف شيئًا لكل توكين، وهو أول نموذج مفتوح فعليًا بمستوى وكلاء يناسب حاسوبًا محمولًا. المفاضلة هي السرعة (5–6 توكين/ثانية على M4 mini) والسياق (حدّه جيدًا تحت 262K إلا إذا كانت ذاكرتك كافية). إذا كان لديك Mac بسعة 24+ جيجابايت وعبء عمل يستطيع 27B حمله، فهذا أفضل نموذج محلي مجاني متاح هذا الأسبوع. أما إذا كان لديك Mac بسعة 16 جيجابايت أو تحتاج إنتاجية عالية، فهو ليس كذلك — والبديل هو مسار مدفوع، وهذا قرار مختلف تمامًا.
