بطاقة عنوان لـ Qwen3.8-27B مع MLX على Apple Silicon، تعرض أيقونة كمبيوتر محمول بسيطة مع شارة محرك MLX وبطاقة سعر مكتوب عليها مجاني، على جهاز Mac الخاص بك.
Guides & Insights

Qwen3.8-27B مع MLX على Apple Silicon: نعم، إنه يعمل — إليك ما تحتاجه حقًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يعمل Qwen3.8 27B اليوم على Apple Silicon عبر MLX. العلامة هي qwen3.8:27b-mlx في Ollama، تمت إضافته في Ollama v0.32.12، والإصدار 4-bit يُحمَّل بحوالي 18 جيجابايت ويحتاج تقريبًا إلى 16–19 جيجابايت من الذاكرة الموحدة — مما يجعل Mac بسعة 24 جيجابايت أو أكثر هو الحد الأدنى الواقعي، وMac بسعة 16 جيجابايت غير مناسب. الأوزان مرخصة بموجب Apache 2.0، ومجانية عند الاستخدام على الأجهزة التي تملكها، وهذا هو جوهر الهدف من النموذج. إصدار Ali​baba عمره يومان (13–14 أغسطس 2026)، لذا كل رقم أدناه مُعلَّم: ما جاء من بطاقة نموذج Ali​baba، وما تحققنا منه من صفحة Ollama اليوم، وما هو تقدير أو قياس من طرف ثالث.

صحيفة الوقائع في 30 ثانية

Qwen3.8 27B هو نموذج علي بابا الكثيف الذي يضم 27 مليار معامل، وتم إطلاقه في 13–14 أغسطس 2026 بترخيص Apache 2.0 — حيث نُشرت الأوزان على Hugging Face وModelScope في اليوم الثالث عشر، مع ظهور ملف LICENSE في صباح اليوم التالي. وهو النموذج الكثيف القابل للنشر الشقيق لنموذج Qwen3.8-Max الذي يضم 2.4 تريليون معامل. من بطاقة النموذج، جميع البيانات مذكورة بواسطة علي بابا ولم يتم التحقق منها بشكل مستقل بعد.

الحجم — 27B كثيف، 27.78B إجمالي المعلمات بما في ذلك مشفر الرؤية.

البنية — 64 طبقة، حجم مخفي 5,120، ومفردات 248,320.

انتباه هجين — 16 طبقة انتباه كامل بالإضافة إلى 48 طبقة خطية من Gated DeltaNet، بنسبة 3:1.

السياق — 262,144 رمزًا أصليًا، قابل للتوسيع إلى 1M عبر YaRN (يسرد Ollama العلامة عند 256K).

الإدخال — فهم أصلي للصور والفيديو إلى جانب النص، من المستندات إلى فيديو يمتد لساعات.

الأوزان — 55.6 جيجابايت بصيغة BF16، مع تضمين رأس فك الترميز التخميني MTP.

A single-column scoreboard for Qwen3.8-27B: 27B dense (27.78B with vision), 64 layers with 16 full plus 48 linear attention, 262K native context (1M via YaRN), text plus image plus video input, Apache 2.0 weights at 55.6 GB BF16, released August 13-14 2026.

على جانب MLX، تم التحقق اليوم: توفر Ollama إصدار qwen3.8:27b-mlx — وهو إصدار أصلي لـ MLX لأجهزة Apple Silicon بحجم تنزيل 4-bit يبلغ حوالي 18 جيجابايت — وتذكر ملاحظات إصدار v0.32.12 تحسينًا خاصًا بأجهزة Apple Silicon. mlx-lm، وهي أدوات Python الخاصة بشركة Apple، تدعم البنية لأغراض التوليد والتحويل، كما ظهرت تكميمات MLX (بمعدلات 3/5/6-bit، بالإضافة إلى MXFP4 وNVFP4) خلال ساعات من إصدار الأوزان. تفترض بقية هذه المقالة استخدام جهاز Mac من فئة M-series بذاكرة موحّدة تبلغ 24 جيجابايت أو أكثر.

ما الذي يغيّره MLX في الذاكرة

على Apple Silicon لا توجد ذاكرة VRAM منفصلة. يعمل MLX على تجمّع الذاكرة الموحّدة من سلسلة M، لذا فإن الرقم المهم هو إجمالي ذاكرة RAM في جهاز Mac الخاص بك مطروحًا منه ما تستخدمه macOS وكل شيء آخر. النموذج الذي "يناسب 17 جيجابايت" يحتاج إلى جهاز بذاكرة أكبر من ذلك بشكل مريح.

الخبر السار هو أن Qwen3.8 27B أقل تكلفة في الاحتفاظ به مما يوحي به عدد معالمه. ولأن الطبقات الست عشرة ذات الانتباه الكامل فقط هي التي تحتفظ بذاكرة تخزين مؤقت من نوع KV — بينما الطبقات الخطية الـ 48 لا تفعل ذلك — فإن تكلفة الذاكرة المؤقتة تبلغ حوالي 64 كيلوبايت لكل رمز، أي ربع ما تدفعه النماذج الكثيفة التقليدية ذات الـ 64 طبقة. وفي الطرف الأقصى، تحتاج نافذة الـ 262 ألف كاملة إلى حوالي 16.4 جيجابايت من الذاكرة المؤقتة بالإضافة إلى الأوزان، وهو ميزانية خادم وليس ميزانية كمبيوتر محمول.

السلم الواقعي لماك، حجم الملف بالإضافة إلى مساحة ذاكرة التخزين المؤقت:

MLX بدقة 4-بت — بإجمالي ~16–19 جيجابايت. يناسب Mac بسعة 24 جيجابايت مع نافذة تبلغ نحو 64K–96K؛ وهو الخيار الافتراضي المنطقي.

MLX بدقة 6-بت — حوالي 21–22 جيجابايت. على أجهزة بسعة 32 جيجابايت؛ قفزة الجودة مقارنةً بـ 4-بت متواضعة.

MLX بثمانية بتات — ~27–30 جيجابايت. أجهزة بسعة 48 جيجابايت أو أكثر؛ شبه بدون فقدان.

BF16 — حوالي 55.6 جيجابايت. فقط أجهزة الاستوديو M-series Max وUltra من الفئة العليا.

An Apple Silicon MLX memory ladder for Qwen3.8-27B: 4-bit at roughly 16-19 GB fits 24 GB and up Macs, 6-bit at roughly 21-22 GB fits 32 GB Macs, 8-bit at roughly 27-30 GB fits 48 GB and up Macs, and BF16 at 55.6 GB is for Max and Ultra studio machines only.

المصادر: الرقم رباعي البتات يتتبع قياس GGUF Q4_K_M (17.1 جيجابايت، unsloth، 14 أغسطس) وتنزيل Ollama البالغ 18 جيجابايت؛ بينما يتتبع رقما 8-bit وBF16 بطاقة BF16 الخاصة بـ Ali​baba وسلالة Qwen3.6-27B. رقم ذاكرة التخزين المؤقت البالغ 64 كيلوبايت لكل رمز مشتق من البنية المعمارية، وليس مطبوعًا على ورقة مواصفات، ولا ينطبق إلا على بيئات التشغيل التي تتخطى ذاكرة التخزين المؤقت KV في الطبقات الخطية بالطريقة التي تفعلها MLX.

ثلاث طرق لتشغيله، من الأبسط إلى الأكثر تحكمًا

المسار أ — Ollama، الأبسط

قم بالترقية إلى Ollama 0.32.12 أو أحدث، ثم:

ollama pull qwen3.8:27b-mlx — يقوم بتنزيل إصدار MLX بحوالي 18 جيجابايت.

ollama run qwen3.8:27b-mlx — interactive chat with the thinking template wired up.

ollama serve — يوفّر واجهة برمجة تطبيقات متوافقة مع OpenAI على localhost:11434 لتطبيقاتك.

The Ollama library page for qwen3.8, showing the qwen3.8:27b-mlx tag with an MLX badge, an 18 GB download size and a 256K context, alongside the qwen3.8:27b and qwen3.8:latest tags.

أحد العيوب المعروفة، من مشكلة نشطة على GitHub وقت كتابة هذا المقال: qwen3.8:27b-mlx يرفض دور "developer" على نقطة النهاية /v1/responses، مما يعطل ollama launch codex لهذا النموذج — بينما مباشرةً، ollama run يعمل بشكل جيد. إذا كنت تبني حلقة وكيل بأسلوب Codex على إصدار MLX، اختبر نقطة النهاية المحددة التي تخطط لاستخدامها قبل الاعتماد عليها في الحلقة.

المسار ب — mlx-lm، الأكثر تحكمًا

حزمة أدوات Apple الخاصة. ثبّتها باستخدام pip install mlx-lm، ثم إما سحب نقطة تفتيش MLX مكمّمة مسبقًا أو تحويل الأوزان الرسمية BF16 بنفسك:

mlx_lm.generate --model <checkpoint> — قم بتشغيل نقطة تفتيش مباشرة؛ نسخ المجتمع المكمّمة بدقة 4-bit و8-bit من نموذج 27B كانت لا تزال تُنشر في mlx-community خلال أيام من الإصدار.

mlx_lm.convert --hf-path Qwen/Qwen3.8-27B --q-bits 4 — حوِّل مرة واحدة فقط؛ التكلفة تعادل تقريبًا تنزيلًا واحدًا.

mlx_lm.server --model <checkpoint> — خادم متوافق مع O​penAI يطبّق قالب محادثة thinking-block من أجلك.

إذا لم يكن الإصدار المكمّم المحدد الذي تريده متاحًا بعد، فإن التحويل من الأوزان الرسمية مهمة قصيرة على أي جهاز Mac من سلسلة M، ويزيل أي شك حول ما شحنه طرف ثالث.

المسار C — LM Studio، الخيار بنقرة واحدة

يستخدم LM Studio الواجهة الخلفية MLX على Apple Silicon والتقط Qwen3.8 27B عند إصداره: ابحث عن النموذج، واختر كمية تكميم تناسب الرام لديك، وسيتم تنزيله وتشغيله. إذا كنت تفضل واجهة رسومية، فهذه هي الطريقة الأسهل، ويغطي دليلنا المصاحب ذلك من البداية إلى النهاية — انظر "كيفية تشغيل Qwen3.8 27B محليًا" في القراءات ذات الصلة أدناه.

فخ القوالب

يبدأ تشغيل Qwen3.8 27B بالتفكير افتراضيًا، ويتم عرض كتل التفكير بواسطة قالب الدردشة، وليس بواسطة نواة النموذج. تشير الاختبارات الخارجية التي أُجريت خلال أول 48 ساعة إلى أن القالب الرسمي يغلّف كل دورة من دورات المساعد في كتلة تفكير — حتى الفارغة منها — وأنه في حلقات الوكيل متعددة الأدوار تتداخل الكتل ويتم اقتطاع السجل، وهو ما يبدو وكأنه فقدان ذاكرة. المشكلة ليست في التكميم. إذا وفرت بيئة تشغيل قالبًا مصححًا، فاستخدمه؛ وعند بناء حلقة وكيل لا تحتاج فيها إلى الاستدلال، عطّل التفكير لكل طلب — إذ يكشف قالب الدردشة عن علامة enable_thinking، ويقبل النموذج reasoning_effort بقيمة xhigh أو medium أو low.

ما هو الشعور الفعلي

اختبار مستقل على Mac mini M4 بذاكرة موحّدة سعتها 32 جيجابايت، مع تشغيل إصدار MLX 4-bit، قاس سرعة توليد تبلغ نحو 5–6 توكن/ثانية. هذا هو الرقم الذي ينبغي أن يضبط التوقعات: جيّد للصياغة التفاعلية، والاستدلال طويل المدى، واستدعاءات الوكلاء العرضية؛ ومُرهق للحلقات الوكيلة الطويلة والمهام الدُفعية. حكاية المُختبِر نفسه — تفكير يستغرق عدة دقائق يتبعه تطبيق صغير يبدو سليمًا لكنه لا يصحّ حسابيًا — تذكير جيّد بأن نموذج 27B على حاسوب محمول مساعدٌ قادرٌ لكنه غير معصوم.

السرعة تتفاوت حسب شريحة المعالج: شريحة M-series Max المزوّدة بعرض نطاق ذاكرة ونوى أكثر تعمل بشكل أسرع بشكل ملحوظ من M4 الأساسية في جهاز mini. لكن سرعة 5–6 رمز/ثانية في الطراز الابتدائي هي الخط الأساسي الصادق، وعليك أن تحكم على أي عنوان رئيسي يدّعي "يعمل على Apple Silicon" في ضوء هذا الرقم.

سياق 262K هو ميزة من ميزات الخادم

نافذة Qwen3.8 27B الأصلية البالغة 262K مفيدة حقًا — لكنها على Mac مقيدة بالذاكرة، وليس بالنموذج نفسه. مع وجود ذاكرة تخزين مؤقت KV بحجم 64 كيلوبايت لكل رمز، تكلف نافذة 8K حوالي 0.5 جيجابايت، ونافذة 32K حوالي 2 جيجابايت، ونافذة 128K حوالي 8 جيجابايت، والنافذة الكاملة 262K حوالي 16.4 جيجابايت إضافةً إلى أوزان النموذج. على جهاز بسعة 24 جيجابايت يعمل بدقة 4-بت، يبلغ الحد الأقصى الواقعي حوالي 64K–96K رمزًا؛ والوصول إلى 128K+ يتطلب جهازًا بسعة 32 جيجابايت فأكثر، بينما تتطلب النافذة الكاملة جهازًا تكون ذاكرته الموحدة مخصصة في معظمها لذاكرة التخزين المؤقت. خطط للسياق الذي تحتاجه فعلًا وحدّد سقفه في إعدادات التشغيل — سيكون النموذج سعيدًا، وسيبقى ملف المبادلة هادئًا.

عندما تكون Apple Silicon هي الإجابة الخاطئة

اتخذ مسارًا مختلفًا إذا كان أي من هذه هو عبء عملك:

لديك جهاز Mac بسعة 8 أو 16 جيجابايت. يتطلب الإصدار رباعي البت (4-bit) بالفعل ما يقارب 17 جيجابايت من الذاكرة الموحدة؛ أي شيء أقل من ذلك يؤدي إلى مبادلة الذاكرة ويصبح النموذج غير قابل للاستخدام. هذا هو الخطأ الأكثر شيوعًا على الإطلاق، ولا يمكن لأي قدر من حيل التكميم إصلاحه.

• تحتاج إلى نافذة 262K الكاملة أو امتداد YaRN بسعة 1M. ميزانية KV هذه هي ميزانية خادم، وليست ميزانية كمبيوتر محمول.

• أنت تخدم أشخاصًا آخرين. اللابتوب مقعد واحد؛ إنتاجية المستخدمين المتعددين تحتاج إلى صندوق GPU أو واجهة برمجة تطبيقات مستضافة.

• تحتاج إلى التحرك بسرعة في الحلقات الوكيلة الطويلة. 5–6 tok/s مناسبة لإنسان يقرأ على طول، لكنها بطيئة بالنسبة لوكيل فرعي.

الإطار الصادق: عرض Qwen3.8 27B هو أنه مجاني عند نقطة الاستخدام على أجهزتك أنت — عكس نموذج API الذي يفرض رسومًا على كل رمز. لهذا السبب تحديدًا ليس في كتالوج OrcaRouter (الكتالوج يوجّه الجيل السابق Qwen3.6/3.5-27B وخط Qwe​n API المستضاف). نحن الأداة الخاطئة لقصة الاستخدام المحلي المجاني، وهذه هي النقطة: عندما يتجاوز عبء العمل قدرات جهاز Mac، تكون البدائل صندوق GPU أو GPU مستأجر أو Qwe​n API مستضاف — وليس موجّهًا يحدث أن يحمل هذا الإصدار 27B بالذات.

خلاصة القول

Qwen3.8 27B على Apple Silicon حقيقي، وهو جيد، ونطاقه محدود. إصدار MLX بدقة 4-بت يناسب أجهزة Mac بسعة 24+ جيجابايت، ويُحمَّل كـ qwen3.8:27b-mlx في Ollama، ولا يكلف شيئًا لكل توكين، وهو أول نموذج مفتوح فعليًا بمستوى وكلاء يناسب حاسوبًا محمولًا. المفاضلة هي السرعة (5–6 توكين/ثانية على M4 mini) والسياق (حدّه جيدًا تحت 262K إلا إذا كانت ذاكرتك كافية). إذا كان لديك Mac بسعة 24+ جيجابايت وعبء عمل يستطيع 27B حمله، فهذا أفضل نموذج محلي مجاني متاح هذا الأسبوع. أما إذا كان لديك Mac بسعة 16 جيجابايت أو تحتاج إنتاجية عالية، فهو ليس كذلك — والبديل هو مسار مدفوع، وهذا قرار مختلف تمامًا.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube