
Qwen3.8-27B على Ollama: أمر واحد، وأربعة إصدارات مكممة، وما التكلفة الحقيقية لكلمة "مجاني"
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 لكل مليون رمز · 18 tok/s
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
شغّلها بأمر واحد: ollama run qwen3.8:27b. هذا هو الجواب الكامل عن السؤال الذي تدور حوله هذه الصفحة. Qwen3.8 27B — نموذج علي بابا الكثيف الذي يضم 27 مليار معامل، صدرت أوزانه في 14 أغسطس 2026 بموجب رخصة Apache 2.0 — أصبح متاحًا في مكتبة Ollama هذا الأسبوع، والبناء الافتراضي هو بالفعل تكميم Q4_K_M معقول بحجم 18 غيغابايت (17 غيغابايت من الأوزان بالإضافة إلى مشفّر رؤية بحجم 931 ميغابايت). يعمل بالكامل على GPU بسعة 24 غيغابايت عند أطوال السياق العادية، ويتحول إلى CPU إذا كانت بطاقتك أصغر، ولا يكلف شيئًا لكل توكن.
كل ما هنا بتاريخ 15 أغسطس 2026. المواصفات مأخوذة من بطاقة نموذج Qwen3.8 27B؛ أحجام التنزيل والوسوم وأعداد التنزيلات مأخوذة من صفحة مكتبة Ollama المباشرة؛ أرقام المعايير مُبلَغ عنها من علي بابا ولا يوجد لها تكرار مستقل بعد. النموذج صدر قبل أيام، فتعامل مع أي شيء قابل للتغيير على أنه مؤقت.
العبارة المختصرة التي تعمل فعلاً
إذا كنت قد قمت بتثبيت Ollama بالفعل، فأنت على بُعد كلمتين فقط:
ollama run qwen3.8:27b
دعم Ollama وصل في الإصدار v0.32.12 — تقرير الإصدار يقرأ ببساطة: "يضيف هذا الإصدار دعم Qwen 3.8 27B." التشغيل الأول يقوم بتنزيل البناء الافتراضي (حوالي 18 جيجابايت، Q4_K_M)، ثم يلقيك في واجهة محادثة REPL مع وضع التفكير مفعّلاً افتراضيًا. تعرض صفحة المكتبة البناء مع وسوم القدرة "vision tools thinking 27b"، وهكذا تعرف أن مسارات الرؤية واستدعاء الأدوات موصولة بنفس التنزيل. حتى وقت كتابة هذا النص، تعرض الصفحة أكثر من 40,000 تنزيل وقائمة وسوم تمتد بالفعل على أحد عشر متغيرًا.

نسختان {{1}}ستلجأ إليهما فعلياً{{/1}}:
• ollama run qwen3.8:27b-mlx — إصدار Apple Silicon، بنفس حجم 18 جيجابايت لكنه مُجمَّع لـ Metal؛ وهو الإصدار الذي تُركّز ملاحظات إصدار Ollama على تحسينه تحديدًا «لتحقيق أقصى أداء وجودة مخرجات مناسبة للمهام المتكررة ووكلاء البرمجة».
• ollama run qwen3.8:27b-q8_0 — نسخة تكميم 8-بت بحجم 30 جيجابايت، لمن يملك ذاكرة فيديو كافية ويريد أوزانًا أقرب إلى الدقة الكاملة.
ما الذي تقوم بتنزيله فعليًا
الاسم يقول 27B، لكن العدد الكلي للمعلمات هو 28B: نموذج لغة كثيف بحجم 27.3B بالإضافة إلى مشفر رؤية بحجم 461M يمنحه إدخال صورة وفيديو أصليًا. باقي المواصفات الرئيسية، مباشرة من بطاقة النموذج:
• 64 طبقة، الحجم المخفي 5,120، المفردات 248,320.
• اهتمام هجين: 16 طبقة انتباه مُبوَّب كاملة و48 طبقة DeltaNet خطية مُبوَّبة — مزيج خطي رشيق بنسبة 3:1، وهو السبب في أن نموذج 27B يمكنه الحفاظ على سياق أصلي يبلغ 262,144 رمزًا (قابلًا للتوسيع إلى 1M) دون أن تلتهم ذاكرة التخزين المؤقت لـ KV مركز بيانات بأكمله.
• الفهم الأصلي للصور والفيديو — "من مخططات ووثائق STEM إلى فيديوهات تمتد لساعات" هو صياغة عليبابا.
• Apache 2.0. نزّله، عدّل عليه، بع منتجًا يعتمد عليه. هذا الترخيص هو الحقيقة القانونية التي يتوقف عليها الجانب الاقتصادي في بقية هذا المقال.
المرجع ذو الدقة الكاملة هو BF16، ولهذا السبب توجد علامات 56 جيجابايت؛ كل علامة أصغر تمثل مقايضة بين الدقة والبصمة، ومعايير بطاقة النموذج نفسها هي ما تجري المقايضة على أساسها.
اختر مقدار تكميم، ثم تحقق من ذاكرة الفيديو لديك، وليس العكس.
يمنحك Ollama أحد عشر وسمًا، لكن القرار يتلخص في ثلاثة أحجام.
• 18 GB — Q4_K_M (الافتراضي). يتسع بالكامل على بطاقة 24 GB (من فئة RTX 4090 / 5090) في السياق العادي، وعلى بطاقات 16 GB مع نقل جزء من الحِمل إلى CPU — أبطأ، لكنه يعمل. هذا هو الإصدار المخصص لـ«شغّله فقط».
• 30 GB — Q8_0. الأوزان قريبة من الدقة الكاملة، تحتاج تقريبًا 40 جيجابايت من VRAM لتبقى بالكامل على GPU. على نموذج 27B، يجب أن تعرف بالفعل لماذا تريد الدقة الإضافية قبل أن تدفع مقابلها.
• 56 GB — BF16.الإصدار المرجعي. يتطلب أجهزة من فئة H100 أو سعة 96 جيجابايت. لا أحد يشغّل هذا على GPU للمستهلك، وهذا أمر جيد.

الرقم الذي يوقع الناس في الخطأ هو ذاكرة التخزين المؤقت KV. التنزيل بحجم 18 جيجابايت لا يعني أن 18 جيجابايت من ذاكرة الفيديو كافية لجلسة بسياق 262K — عند السياق الطويل، تضيف ذاكرة التخزين المؤقت عدة جيجابايتات فوق الأوزان، ولهذا تستطيع بطاقة بسعة 24 جيجابايت حمل هذا النموذج بسلاسة عند سياق 8K–32K، لكن ليس عند 262K. على بطاقة حدودية، اخفض السياق، لا تخفض التكميم.
يُعتبر Apple Silicon هدفًا من الدرجة الأولى هنا
تشير ملاحظات إصدار Ollama v0.32.12 إلى macOS على وجه التحديد. عمليًا، يحتاج تشغيل `ollama run qwen3.8:27b-mlx` إلى حوالي 18 جيجابايت من الذاكرة الموحدة، لذا فإن جهاز Mac بسعة 24 جيجابايت أو أكثر يشغّله بالكامل على وحدة معالجة الرسومات مع مساحة إضافية للسياق. هناك أيضًا إصدار mxfp8 MLX بسعة 32 جيجابايت وإصدار mlx-bf16 بسعة 56 جيجابايت للأجهزة ذات الذاكرة 64–128 جيجابايت. إذا كان جهاز Mac من سلسلة M يتابع أخبار الطرازات المكتبية، فهذا هو الإصدار الذي كنت تنتظره.
262K في ورقة المواصفات، وأقل في مقعدك
يذكر بطاقة النموذج 262,144 رمزًا أصليًا، قابلاً للتوسيع إلى 1M؛ وتعرض صفحة مكتبة Ollama نفس النافذة على أنها 256K. كلاهما صحيح — 262,144 هو 256K مضروبًا في 1024 — ولا يعني أي منهما أن تكتب هذا الرقم في --num-ctx على بطاقة بسعة 24 جيجابايت. ينمو مخزن KV المؤقت بشكل خطي تقريبًا مع طول السياق، لذا على الأجهزة الاستهلاكية ستعمل ضمن نطاق 16K–64K، وليس 262K. ابدأ بالإعداد الافتراضي في Ollama، وارفع --num-ctx فقط عندما تتطلب المهمة ذلك فعليًا، وتذكر أن رقم 1M يتطلب آلية التوسيع بالإضافة إلى ذاكرة VRAM الكافية لتغذيته.
ما الذي لا يزال هشًا — اقرأ هذا قبل أن تراهن عليه
• لا توجد معايير مرجعية مستقلة بعد. كل رقم في بطاقة النموذج هو قول Alibaba كما في 15 أغسطس. المكاسب المُدّعاة مقارنةً بـ Qwen3.6-27B كبيرة — SWE-bench Pro 61.7 مقابل 53.5، وTerminal Bench 2.1 73.0 مقابل 63.4، وLiveCodeBench v6 90.3 مقابل 83.9، وGPQA Diamond 89.2 مقابل 87.8 — وكلها تبدو معقولة، ولم تُكرَّر أيٌّ منها بواسطة منصّة اختبار خارجية. لا تبنِ قرارًا إنتاجيًا على هذه الأرقام وحدها.
• مكدس الرؤية عمره أيام فقط. تقرير خطأ مبكر (مشكلة ollama رقم #17753) أظهر أن بناء Q4 يوجه إدخال الرؤية عبر محلل Qwen3.5 ويفشل في معالجة الصور؛ تم إصلاحه خلال أيام في طلب السحب #17755، لكن مسار الوسائط المتعددة على نموذج عمره أسبوع هو بالضبط المكان الذي يجب أن تختبر فيه قبل الاعتماد عليه.
• يتضمّن البناء الافتراضي ميزة MTP.وسم q4_K_M هو أيضًا إصدار التنبؤ متعدد الرموز — فك تشفير أسرع، وهو السبب في أن "18 GB" و"27B" يمكن أن يتعايشا دون تناقض.
• يمكن أن تكون تسميات التكميم مضللة على أبل. الوسمان "mlx" و"nvfp4" بسعة 18 جيجابايت يختلفان في التكميم — فـ NVFP4 هو تنسيق FP4 من NVIDIA — لذا على Mac يُفضَّل استخدام الإصدار العادي -mlx ما لم تكن بحاجة تحديدًا إلى متغير FP8/FP4 لـ Blackwell GPU.
"Free" تقوم بعمل كبير في هذا العنوان.
الاستضافة الذاتية لنموذج 27B مجانية لكل توكن، لكنها ليست مجانية. الصياغة الصادقة هي ثلاثة خيارات تُدفع بعملات مختلفة:
• شغّلها بنفسك (Ollama). $0 لكل توكن، دون اتصال، غير محدود، خاص — والأجهزة ملكك. إن شراء GPU بسعة 24 جيجابايت أو Mac بسعة 18 جيجابايت أو أكثر هو شراء حقيقي، وكذلك الكهرباء ووقت الإعداد. هذا هو القرار الصحيح عندما يصبح Qwen3.8 27B أداةً للاستخدام اليومي.
• استدعِ واجهة برمجة تطبيقات محدودة المعدل بتكلفة 0$. يشغّل OrcaRouter نموذج Qwen3.8 27B على بنيته التحتية الخاصة بتكلفة صفرية (معرّف الطراز: qwen/qwen3.8-27b-free، 0$ لكل طلب، معدل الطلبات محدود) — ولأن الأوزان مفتوحة، لا توجد تكلفة بائع لكل توكن يمكن تمريرها. هذا هو الخيار الصحيح عندما تريد تجربة الطراز دون شراء أجهزة لاختبار إصدار عمره أسبوع.
• استدعِ واجهة برمجة تطبيقات غير محدودة.نفس النموذج بدون حد المعدل هو 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج على OrcaRouter (qwen/qwen3.8-27b، سياق 262K، إدخال نص وصورة وفيديو). هذا هو الخيار الصحيح عندما تحتاج إلى نطاق إنتاجي ولا تريد مراقبة وحدة معالجة رسومية.

الرياضيات التي تحسم الاختيار بينها: الاستخدام المتقطع يكون مجديًا أكثر عند $0 أو عند $0.33/$2.40 مقارنةً بسعر GPU؛ الاستخدام التفاعلي اليومي أرخص محليًا؛ الإنتاجية المستمرة تكون الأرخص عبر واجهة برمجة تطبيقات (API) لا تحتاج إلى إبقائها قيد التشغيل. متطلبات الخصوصية والعمل دون اتصال تدفعك إلى العمود الأول مهما كانت الحسابات.
عندما تكون هذه التوصية خاطئة
• أنت حقًا بحاجة إلى سياق يتجاوز 100K+.النموذج يستطيع ذلك؛ بطاقتك ذات الـ24 غيغابايت لا تستطيع. في السياق الطويل حقًا، فإن GPU بسعة 40 غيغابايت أو أكثر أو واجهة برمجة تطبيقات بسياق أطول ليس ترفًا.
• تحتاج إلى فيديو في الإنتاج اليوم. لقد تم إصلاح خطأ المحلل في مسار الرؤية للتو؛ تشغيل الفيديو في الإنتاج على نموذج متعدد الوسائط عمره أسبوع واحد هو رهان لا يجب أن تضعه دون خطة احتياطية.
• أنت تريد التزامن. بطاقة رسوميات استهلاكية واحدة تبث جيلًا أو جيلين في كل مرة. إن 27B ليس خادمًا للتقديم.
• أنت على أجهزة تعمل بوحدة المعالجة المركزية فقط. نموذج 27B بدقة 4-bit على CPU هو عرض توضيحي بطيء، وليس أداة. استخدام API هو الخيار الأمثل حتى تحصل على GPU.
الخلاصة
Qwen3.8 27B على Ollama هي أسهل طريقة لتشغيل نموذج 27B من الجيل الحالي أطلقته أي جهة حتى الآن: أمر واحد، وإعداد افتراضي بحجم 18 جيجابايت يناسب بطاقة بسعة 24 جيجابايت، وإصدار من الدرجة الأولى لمعالجات Apple Silicon، وحرية ترخيص Apache 2.0. التكميم الذي ينبغي أن تختاره هو دائمًا تقريبًا الافتراضي Q4_K_M — ولا تنتقل إلى q8_0 إلا عندما يمكنك قياس الفرق. وأما "المجاني" فمشروط: إذا كنت ستستخدم النموذج من حين لآخر، فإن واجهة API المجانية المحدودة المعدل أكثر حرية من شراء عتاد؛ وإذا أصبح أداة استخدامك اليومي، فالنُسخة المحلية هي أرخص ما تملك. تحقق من الأرقام قبل أن تبني عليها — فكل ما ورد في هذا المقال كان صحيحًا في 15 أغسطس 2026، وهذا النموذج يتغير يومًا بعد يوم.
