بطاقة عنوان لمقال Qwen3.8-27B على Ollama، تعرض نافذة طرفية بسيطة تحتوي الأمر 'ollama run qwen3.8:27b' ومؤشرًا وامضًا، وثلاث شارات مكتوب عليها 'تنزيل 18 جيجابايت' و'Q4_K_M الافتراضي' و'سياق 262K'، والتسمية التوضيحية 'مجاني للتشغيل، على أجهزتك'.
Guides & Insights

Qwen3.8-27B على Ollama: أمر واحد، وأربعة إصدارات مكممة، وما التكلفة الحقيقية لكلمة "مجاني"

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

شغّلها بأمر واحد: ollama run qwen3.8:27b. هذا هو الجواب الكامل عن السؤال الذي تدور حوله هذه الصفحة. Qwen3.8 27B — نموذج علي بابا الكثيف الذي يضم 27 مليار معامل، صدرت أوزانه في 14 أغسطس 2026 بموجب رخصة Apache 2.0 — أصبح متاحًا في مكتبة Ollama هذا الأسبوع، والبناء الافتراضي هو بالفعل تكميم Q4_K_M معقول بحجم 18 غيغابايت (17 غيغابايت من الأوزان بالإضافة إلى مشفّر رؤية بحجم 931 ميغابايت). يعمل بالكامل على GPU بسعة 24 غيغابايت عند أطوال السياق العادية، ويتحول إلى CPU إذا كانت بطاقتك أصغر، ولا يكلف شيئًا لكل توكن.

كل ما هنا بتاريخ 15 أغسطس 2026. المواصفات مأخوذة من بطاقة نموذج Qwen3.8 27B؛ أحجام التنزيل والوسوم وأعداد التنزيلات مأخوذة من صفحة مكتبة Ollama المباشرة؛ أرقام المعايير مُبلَغ عنها من علي بابا ولا يوجد لها تكرار مستقل بعد. النموذج صدر قبل أيام، فتعامل مع أي شيء قابل للتغيير على أنه مؤقت.

العبارة المختصرة التي تعمل فعلاً

إذا كنت قد قمت بتثبيت Ollama بالفعل، فأنت على بُعد كلمتين فقط:

ollama run qwen3.8:27b

دعم Ollama وصل في الإصدار v0.32.12 — تقرير الإصدار يقرأ ببساطة: "يضيف هذا الإصدار دعم Qwen 3.8 27B." التشغيل الأول يقوم بتنزيل البناء الافتراضي (حوالي 18 جيجابايت، Q4_K_M)، ثم يلقيك في واجهة محادثة REPL مع وضع التفكير مفعّلاً افتراضيًا. تعرض صفحة المكتبة البناء مع وسوم القدرة "vision tools thinking 27b"، وهكذا تعرف أن مسارات الرؤية واستدعاء الأدوات موصولة بنفس التنزيل. حتى وقت كتابة هذا النص، تعرض الصفحة أكثر من 40,000 تنزيل وقائمة وسوم تمتد بالفعل على أحد عشر متغيرًا.

Screenshot of the Ollama library page for qwen3.8:27b, showing the default Q4_K_M build at 18 GB total — 17 GB for the 27.3B weights plus 931 MB for the 461M-parameter vision projector — the model ID 'ollama run qwen3.8:27b' and capability tags vision, tools, thinking, 27b.

نسختان {{1}}ستلجأ إليهما فعلياً{{/1}}:

• ollama run qwen3.8:27b-mlx — إصدار Apple Silicon، بنفس حجم 18 جيجابايت لكنه مُجمَّع لـ Metal؛ وهو الإصدار الذي تُركّز ملاحظات إصدار Ollama على تحسينه تحديدًا «لتحقيق أقصى أداء وجودة مخرجات مناسبة للمهام المتكررة ووكلاء البرمجة».

• ollama run qwen3.8:27b-q8_0 — نسخة تكميم 8-بت بحجم 30 جيجابايت، لمن يملك ذاكرة فيديو كافية ويريد أوزانًا أقرب إلى الدقة الكاملة.

ما الذي تقوم بتنزيله فعليًا

الاسم يقول 27B، لكن العدد الكلي للمعلمات هو 28B: نموذج لغة كثيف بحجم 27.3B بالإضافة إلى مشفر رؤية بحجم 461M يمنحه إدخال صورة وفيديو أصليًا. باقي المواصفات الرئيسية، مباشرة من بطاقة النموذج:

• 64 طبقة، الحجم المخفي 5,120، المفردات 248,320.

• اهتمام هجين: 16 طبقة انتباه مُبوَّب كاملة و48 طبقة DeltaNet خطية مُبوَّبة — مزيج خطي رشيق بنسبة 3:1، وهو السبب في أن نموذج 27B يمكنه الحفاظ على سياق أصلي يبلغ 262,144 رمزًا (قابلًا للتوسيع إلى 1M) دون أن تلتهم ذاكرة التخزين المؤقت لـ KV مركز بيانات بأكمله.

• الفهم الأصلي للصور والفيديو — "من مخططات ووثائق STEM إلى فيديوهات تمتد لساعات" هو صياغة علي‌بابا.

• Apache 2.0. نزّله، عدّل عليه، بع منتجًا يعتمد عليه. هذا الترخيص هو الحقيقة القانونية التي يتوقف عليها الجانب الاقتصادي في بقية هذا المقال.

المرجع ذو الدقة الكاملة هو BF16، ولهذا السبب توجد علامات 56 جيجابايت؛ كل علامة أصغر تمثل مقايضة بين الدقة والبصمة، ومعايير بطاقة النموذج نفسها هي ما تجري المقايضة على أساسها.

اختر مقدار تكميم، ثم تحقق من ذاكرة الفيديو لديك، وليس العكس.

يمنحك Ollama أحد عشر وسمًا، لكن القرار يتلخص في ثلاثة أحجام.

18 GB — Q4_K_M (الافتراضي). يتسع بالكامل على بطاقة 24 GB (من فئة RTX 4090 / 5090) في السياق العادي، وعلى بطاقات 16 GB مع نقل جزء من الحِمل إلى CPU — أبطأ، لكنه يعمل. هذا هو الإصدار المخصص لـ«شغّله فقط».

30 GB — Q8_0. الأوزان قريبة من الدقة الكاملة، تحتاج تقريبًا 40 جيجابايت من VRAM لتبقى بالكامل على GPU. على نموذج 27B، يجب أن تعرف بالفعل لماذا تريد الدقة الإضافية قبل أن تدفع مقابلها.

56 GB — BF16.الإصدار المرجعي. يتطلب أجهزة من فئة H100 أو سعة 96 جيجابايت. لا أحد يشغّل هذا على GPU للمستهلك، وهذا أمر جيد.

A self-built card comparing the Qwen3.8-27B Ollama quantization tiers: Q4_K_M at 18 GB fitting a 24 GB card, Q8_0 at 30 GB needing roughly 40 GB of VRAM, BF16 at 56 GB requiring H100-class hardware, and the Apple Silicon MLX build at 18 GB of unified memory, with a footer noting the KV cache adds several GB at long context.

الرقم الذي يوقع الناس في الخطأ هو ذاكرة التخزين المؤقت KV. التنزيل بحجم 18 جيجابايت لا يعني أن 18 جيجابايت من ذاكرة الفيديو كافية لجلسة بسياق 262K — عند السياق الطويل، تضيف ذاكرة التخزين المؤقت عدة جيجابايتات فوق الأوزان، ولهذا تستطيع بطاقة بسعة 24 جيجابايت حمل هذا النموذج بسلاسة عند سياق 8K–32K، لكن ليس عند 262K. على بطاقة حدودية، اخفض السياق، لا تخفض التكميم.

يُعتبر Apple Silicon هدفًا من الدرجة الأولى هنا

تشير ملاحظات إصدار Ollama v0.32.12 إلى macOS على وجه التحديد. عمليًا، يحتاج تشغيل `ollama run qwen3.8:27b-mlx` إلى حوالي 18 جيجابايت من الذاكرة الموحدة، لذا فإن جهاز Mac بسعة 24 جيجابايت أو أكثر يشغّله بالكامل على وحدة معالجة الرسومات مع مساحة إضافية للسياق. هناك أيضًا إصدار mxfp8 MLX بسعة 32 جيجابايت وإصدار mlx-bf16 بسعة 56 جيجابايت للأجهزة ذات الذاكرة 64–128 جيجابايت. إذا كان جهاز Mac من سلسلة M يتابع أخبار الطرازات المكتبية، فهذا هو الإصدار الذي كنت تنتظره.

262K في ورقة المواصفات، وأقل في مقعدك

يذكر بطاقة النموذج 262,144 رمزًا أصليًا، قابلاً للتوسيع إلى 1M؛ وتعرض صفحة مكتبة Ollama نفس النافذة على أنها 256K. كلاهما صحيح — 262,144 هو 256K مضروبًا في 1024 — ولا يعني أي منهما أن تكتب هذا الرقم في --num-ctx على بطاقة بسعة 24 جيجابايت. ينمو مخزن KV المؤقت بشكل خطي تقريبًا مع طول السياق، لذا على الأجهزة الاستهلاكية ستعمل ضمن نطاق 16K–64K، وليس 262K. ابدأ بالإعداد الافتراضي في Ollama، وارفع --num-ctx فقط عندما تتطلب المهمة ذلك فعليًا، وتذكر أن رقم 1M يتطلب آلية التوسيع بالإضافة إلى ذاكرة VRAM الكافية لتغذيته.

ما الذي لا يزال هشًا — اقرأ هذا قبل أن تراهن عليه

لا توجد معايير مرجعية مستقلة بعد. كل رقم في بطاقة النموذج هو قول Ali​baba كما في 15 أغسطس. المكاسب المُدّعاة مقارنةً بـ Qwen3.6-27B كبيرة — SWE-bench Pro 61.7 مقابل 53.5، وTerminal Bench 2.1 73.0 مقابل 63.4، وLiveCodeBench v6 90.3 مقابل 83.9، وGPQA Diamond 89.2 مقابل 87.8 — وكلها تبدو معقولة، ولم تُكرَّر أيٌّ منها بواسطة منصّة اختبار خارجية. لا تبنِ قرارًا إنتاجيًا على هذه الأرقام وحدها.

مكدس الرؤية عمره أيام فقط. تقرير خطأ مبكر (مشكلة ollama رقم #17753) أظهر أن بناء Q4 يوجه إدخال الرؤية عبر محلل Qwen3.5 ويفشل في معالجة الصور؛ تم إصلاحه خلال أيام في طلب السحب #17755، لكن مسار الوسائط المتعددة على نموذج عمره أسبوع هو بالضبط المكان الذي يجب أن تختبر فيه قبل الاعتماد عليه.

يتضمّن البناء الافتراضي ميزة MTP.وسم q4_K_M هو أيضًا إصدار التنبؤ متعدد الرموز — فك تشفير أسرع، وهو السبب في أن "18 GB" و"27B" يمكن أن يتعايشا دون تناقض.

يمكن أن تكون تسميات التكميم مضللة على أبل. الوسمان "mlx" و"nvfp4" بسعة 18 جيجابايت يختلفان في التكميم — فـ NVFP4 هو تنسيق FP4 من NVIDIA — لذا على Mac يُفضَّل استخدام الإصدار العادي -mlx ما لم تكن بحاجة تحديدًا إلى متغير FP8/FP4 لـ Blackwell GPU.

"Free" تقوم بعمل كبير في هذا العنوان.

الاستضافة الذاتية لنموذج 27B مجانية لكل توكن، لكنها ليست مجانية. الصياغة الصادقة هي ثلاثة خيارات تُدفع بعملات مختلفة:

شغّلها بنفسك (Ollama). $0 لكل توكن، دون اتصال، غير محدود، خاص — والأجهزة ملكك. إن شراء GPU بسعة 24 جيجابايت أو Mac بسعة 18 جيجابايت أو أكثر هو شراء حقيقي، وكذلك الكهرباء ووقت الإعداد. هذا هو القرار الصحيح عندما يصبح Qwen3.8 27B أداةً للاستخدام اليومي.

استدعِ واجهة برمجة تطبيقات محدودة المعدل بتكلفة 0$. يشغّل OrcaRouter نموذج Qwen3.8 27B على بنيته التحتية الخاصة بتكلفة صفرية (معرّف الطراز: qwen/qwen3.8-27b-free، 0$ لكل طلب، معدل الطلبات محدود) — ولأن الأوزان مفتوحة، لا توجد تكلفة بائع لكل توكن يمكن تمريرها. هذا هو الخيار الصحيح عندما تريد تجربة الطراز دون شراء أجهزة لاختبار إصدار عمره أسبوع.

استدعِ واجهة برمجة تطبيقات غير محدودة.نفس النموذج بدون حد المعدل هو 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج على OrcaRouter (qwen/qwen3.8-27b، سياق 262K، إدخال نص وصورة وفيديو). هذا هو الخيار الصحيح عندما تحتاج إلى نطاق إنتاجي ولا تريد مراقبة وحدة معالجة رسومية.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-27b, showing the model ID, the 'by Qwen' vendor label, a 262K-token context window, text, image and video input, and a p50 first-token latency of 225 ms.

الرياضيات التي تحسم الاختيار بينها: الاستخدام المتقطع يكون مجديًا أكثر عند $0 أو عند $0.33/$2.40 مقارنةً بسعر GPU؛ الاستخدام التفاعلي اليومي أرخص محليًا؛ الإنتاجية المستمرة تكون الأرخص عبر واجهة برمجة تطبيقات (API) لا تحتاج إلى إبقائها قيد التشغيل. متطلبات الخصوصية والعمل دون اتصال تدفعك إلى العمود الأول مهما كانت الحسابات.

عندما تكون هذه التوصية خاطئة

أنت حقًا بحاجة إلى سياق يتجاوز 100K+.النموذج يستطيع ذلك؛ بطاقتك ذات الـ24 غيغابايت لا تستطيع. في السياق الطويل حقًا، فإن GPU بسعة 40 غيغابايت أو أكثر أو واجهة برمجة تطبيقات بسياق أطول ليس ترفًا.

تحتاج إلى فيديو في الإنتاج اليوم. لقد تم إصلاح خطأ المحلل في مسار الرؤية للتو؛ تشغيل الفيديو في الإنتاج على نموذج متعدد الوسائط عمره أسبوع واحد هو رهان لا يجب أن تضعه دون خطة احتياطية.

أنت تريد التزامن. بطاقة رسوميات استهلاكية واحدة تبث جيلًا أو جيلين في كل مرة. إن 27B ليس خادمًا للتقديم.

أنت على أجهزة تعمل بوحدة المعالجة المركزية فقط. نموذج 27B بدقة 4-bit على CPU هو عرض توضيحي بطيء، وليس أداة. استخدام API هو الخيار الأمثل حتى تحصل على GPU.

الخلاصة

Qwen3.8 27B على Ollama هي أسهل طريقة لتشغيل نموذج 27B من الجيل الحالي أطلقته أي جهة حتى الآن: أمر واحد، وإعداد افتراضي بحجم 18 جيجابايت يناسب بطاقة بسعة 24 جيجابايت، وإصدار من الدرجة الأولى لمعالجات Apple Silicon، وحرية ترخيص Apache 2.0. التكميم الذي ينبغي أن تختاره هو دائمًا تقريبًا الافتراضي Q4_K_M — ولا تنتقل إلى q8_0 إلا عندما يمكنك قياس الفرق. وأما "المجاني" فمشروط: إذا كنت ستستخدم النموذج من حين لآخر، فإن واجهة API المجانية المحدودة المعدل أكثر حرية من شراء عتاد؛ وإذا أصبح أداة استخدامك اليومي، فالنُسخة المحلية هي أرخص ما تملك. تحقق من الأرقام قبل أن تبني عليها — فكل ما ورد في هذا المقال كان صحيحًا في 15 أغسطس 2026، وهذا النموذج يتغير يومًا بعد يوم.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube