بطاقة عنوان رئيسية تعرض Qwen3.8-27B GGUF مع العنوان الفرعي «التكميم المناسب لوحدة معالجة الرسومات لديك»، وأيقونة تنزيل، وشرائح ملفات لـ Q4_K_M 17.1GB وUD-IQ2 9.0GB.
Guides & Insights

Qwen3.8-27B GGUF: أي Quant يجب تنزيله لبطاقة الرسومات الخاصة بك

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

قم بتنزيل حزمة unsloth/Qwen3.8-27B-GGUF، وطابق الملف مع البطاقة التي تملكها بالفعل. هذا هو الجواب كله: بطاقة GPU بسعة 24 جيجابايت (RTX 4090 أو 3090) عليها سحب Q4_K_M بحجم 17.1 جيجابايت؛ بطاقة GPU بسعة 16 جيجابايت عليها سحب IQ4_XS بحجم 15.7 جيجابايت (أو Q3_K_M بحجم 13.8 جيجابايت إذا أردت مساحة إضافية للسياق)؛ بطاقة GPU بسعة 12 جيجابايت محدودة بملفات الـ2-بت، UD-IQ2_XXS بحجم 9.0 جيجابايت، وهذا حل وسط يجب أن تقبله عن علم. إن Qwen3.8 27B — نموذج Ali​baba الكثيف ذا المعاملات البالغة 27 مليارًا، وذو أوزان Apache 2.0 التي صدرت في 13–14 أغسطس 2026 — يعمل محليًا بتكلفة منخفضة بشكل غير عادي، لأن انتباهه الهجين يخزن مؤقتًا 16 من طبقاته الـ64 فقط، لذا فإن تكميم 4-بت على ذاكرة 24 جيجابايت يحمل بسهولة سياقًا من 32K–64K توكنًا. وGGUF هو المسار الوحيد الذي لا يتطلب أي تكلفة إضافية: لا مفتاح API، ولا فاتورة لكل توكن، ولا مغادرة أي بيانات من جهازك.

بخصوص المصادر: البنية، ونافذة السياق، والترخيص رسمية، من بطاقة نموذج Qwen3.8 27B على Hugging Face، تم التحقق منها في 15 أغسطس 2026. أحجام GGUF مأخوذة من مستودعات unsloth وggml-org الخاصة بـ GGUF، في اليوم نفسه. إرشادات ذاكرة VRAM لكل وحدة معالجة رسومية هي التوصية الرسمية من unsloth. تقديرات KV-cache بالبايت وأرقام الرموز في الثانية مقاسة من المجتمع في الأيام الأولى بعد الإصدار، وليست مواصفات البائع. كل معيار مذكور أدناه مُعلن من Alibaba ولم يتم إعادة إنتاجه.

محدد الملفات، سطر واحد لكل كمية.

UD-IQ2_XXS — 9.0GB — الخيار الوحيد المريح لبطاقة بسعة 12 جيجابايت؛ توقع فقدانًا ملحوظًا في الجودة.

UD-Q2_K_XL — 10.7GB — بطاقات 12GB، مع عدم بقاء أي مساحة سياق تقريبًا.

Q3_K_M — 13.8GB — بطاقات 16GB التي تريد مساحة إضافية للسياق.

IQ4_XS — 15.7GB — بطاقات 16GB: أكبر تكميم يتسع بالكامل.

Q4_K_M — 17.1GB — بطاقات 24GB: الخيار الأمثل، والملف الذي يرشدك إليه هذا المقال.

Q5_K_M — 19.8GB — 24GB، مقايضة مساحة السياق مقابل تحسن بسيط في الجودة.

Q6_K — 22.9GB — تناسب 24GB إذا ضغطت؛ شبه بدون فقدان.

Q8_0 — 29.0GB — 32GB، أو تقسيم على بطاقتين، أو تفريغ على المعالج المركزي.

BF16 — 54.7GB — بطاقات الخوادم وإعدادات وحدة المعالجة المركزية كثيفة الذاكرة؛ دقة مرجعية.

حزمتان، حجمان لـ Q4_K_M: حزمة unsloth حجمها 17.1 جيجابايت؛ وحزمة ggml-org حجمها 19.0 جيجابايت. تستخدم حزمة unsloth تكميم Dynamic V3.0 (إصدار تجريبي) لملفات UD-* الخاصة بها، وهي الحزمة التي تعتمد عليها معظم التطبيقات المحلية افتراضيًا؛ بينما توفر حزمة ggml-org تكميم K-quants القياسي بالإضافة إلى رأس التنبؤ متعدد الرموز المنفصل المستخدم في فك التشفير التخميني. كلا الحجمين Q4_K_M يعمل — الفرق بضع مئات من الميغابايت وملف MTP.

A file-picker card for the Qwen3.8-27B GGUF pack, listing quantizations with sizes and target GPUs: UD-IQ2_XXS 9.0GB for 12GB cards, Q3_K_M 13.8GB and IQ4_XS 15.7GB for 16GB cards, Q4_K_M 17.1GB highlighted for 24GB cards, Q5_K_M 19.8GB and Q6_K 22.9GB for 24GB, Q8_0 29GB for 32GB-plus, and BF16 54.7GB for servers.

لماذا يتناسب هذا 27B على بطاقات أصغر من معظم البطاقات

يحتوي Qwen3.8 27B على 64 طبقة، لكن 16 طبقة فقط تستخدم الانتباه الكامل. أما الـ 48 الأخرى فتستخدم انتباه Gated DeltaNet الخطي، الذي يحتفظ بحالة متكررة بحجم ثابت بدلاً من ذاكرة تخزين مؤقتة متنامية للمفاتيح والقيم (KV cache). تخطيط الكتل في بطاقة النموذج هو 3×(Gated DeltaNet → FFN) لكل 1×(Gated Attention → FFN) — أي نسبة هجينة 3:1. التأثير العملي: ذاكرة KV المؤقتة تبلغ نحو ربع ما يحتاجه نموذج 27B كثيف تقليدي لنفس طول السياق. قياسات المجتمع هذا الأسبوع تضع الذاكرة المؤقتة عند حوالي 0.5 جيجابايت لسياق 8K، و2.0 جيجابايت عند 32K، و16.4 جيجابايت عند النافذة الأصلية الكاملة 262K. هذا يعكس النصيحة المعتادة — معظم ميزانية VRAM تذهب إلى الأوزان وليس إلى السياق، وبطاقة 24 جيجابايت يمكنها تشغيل Q4_K_M مع سياق 64K–96K دون عناء. يمكنك تقليص الذاكرة المؤقتة أكثر باستخدام علامة --cache-type-k في llama.cpp، التي تكمّم الذاكرة المؤقتة نفسها.

A card titled 'Qwen3.8-27B — the KV cache is the cheap part', showing that only 16 of 64 layers keep a cache and listing community-estimated cache sizes of about 0.5GB at 8K context, 2.0GB at 32K, 4.0GB at 64K, 8.0GB at 128K, and 16.4GB at 262K, roughly four times less than a dense 27B.

ثلاثة مزالق ستوقعك في اليوم الأول

إصدارات llama.cpp القديمة ترفض الملف.يسجّل GGUF البنية الجديدة qwen35، لذا تحتاج إلى إصدار حالي — أي إصدار صدر قبل أسبوع الإصدار يرفض تحميله بخطأ في البنية. حدّث llama.cpp أولاً، قبل أن تقوم بالتنزيل.

فخ القالب.قالب الدردشة الرسمي في Jinja يغلّف كل دور للمساعد داخل كتلة تفكير حتى عندما يكون تتبع الاستدلال فارغًا، مما ينتج كتلًا متداخلة وسجلًا مقتطعًا في المحادثات متعددة الأدوار — يبدو وكأن النموذج نسي ما قلته. شغّل llama.cpp مع --jinja، وفضّل حزمة تشتمل على chat_template.jinja مصححًا.

الرؤية تحتاج إلى ملف منفصل. النصوص تعمل مباشرة دون إعدادات إضافية؛ بينما الصور والفيديو لا تفعل شيئًا بصمت ما لم تقم أيضًا بتحميل مُسقط mmproj، بحوالي 0.9GB. وهو غير مدرج في صفحة مستودع GGUF الخاص بـ unsloth — احصل عليه من المستودع الأساسي أو حزمة ggml-org. إذا كنت تخطط لإدخال مستندات أو لقطات شاشة، أضف --mmproj إلى أمر الخادم.

نفّذها: الأوامر

llama.cpp، بمجرد أن يكون لديك بناء حالي:

llama-server -m Qwen3.8-27B-Q4_K_M.gguf --ctx-size 32768 --n-gpu-layers 99 --jinja --cache-type-k q8_0

...وأضف {{1}}--mmproj Qwen3.8-27B-mmproj-bf16.gguf{{/1}} {{2}}إذا كنت تحتاج إلى الرؤية{{/2}}.

إذا كنت تريد إدخال المكتبة في Ollama: نفّذ الأمر `ollama pull qwen3.8:27b`، ثم نفّذ `ollama run qwen3.8:27b`. يلتقط LM Studio وUnsloth Desktop قالب الدردشة وتفريغ الذاكرة العشوائية (RAM) تلقائيًا — وهما المسار الأقل تعقيدًا للتشغيل الأول.

محلي مقابل API: الاقتصاديات الصادقة

GGUF هو المسار المجاني: تكلفة هامشية صفرية، ولا حدود للمعدل، ولا شيء يغادر جهازك. لكنه ليس المسار الرخيص بالمطلق — إذ توفر أنت وحدة معالجة رسومات بسعة 24 جيجابايت (مثل RTX 3090 مستعملة أو RTX 4090 جديدة، إضافة إلى الكهرباء)، وملف بترميز 2-بت على بطاقة سعة 12 جيجابايت يمنحك تجربة دون المستوى.

مسار API متاح لأن الأوزان مرخصة بموجب Apache 2.0، لذا فإن التكلفة الحدية للتقديم قريبة من الصفر ويمكن لأي شخص استضافتها. نموذج Qwen3.8 27B متاح اليوم على OrcaRouter بسعر 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج — وهو سعر المزود كما هو دون أي زيادة — ولأن الأوزان مفتوحة، توجد أيضًا طبقة مجانية محدودة المعدل تكلفتها 0 دولار لكل طلب وترجع HTTP 429 عند تجاوز الحد المسموح. شهر نموذجي يستهلك 10 ملايين رمز بنسبة 70% للإدخال يكلف حوالي 9.51 دولارًا على الطبقة المدفوعة. إذا كنت تملك وحدة معالجة رسومية GPU بالفعل، فالاستضافة المحلية أفضل من حيث التكلفة؛ وإذا لم تملكها، فإن استئجار الرموز أفضل من شراء بطاقة لمشروع جانبي.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, and text, image and video input.

عندما تكون هذه التوصية خاطئة

Q4_K_M على 24GB هو الافتراضي، وليس الإجابة الشاملة. اختر شيئًا آخر عندما:

تحتاج إلى أقصى جودة على خادم أو محطة عمل — Q8_0 بحجم 29GB أو BF16 بحجم 54.7GB مع تفريغ إلى CPU وRAM، وليس ملف 4-bit.

أنت على بطاقة من سلسلة Blackwell RTX 50 — النسخة NVFP4 أسرع بنحو 1.5× في نفس 24GB من ذاكرة الفيديو وتستخدم FP8 KV cache لسياق أطول. وعلى 5090، يتفوق NVFP4 على أي GGUF في هذا الطراز.

تحتاج إلى سياق كامل يبلغ 262K — خصص ميزانية لذاكرة تخزين مؤقت تبلغ حوالي 16GB إضافةً إلى الأوزان؛ مما يخفض بطاقة 24GB إلى Q3_K_M، أو يفرض تكميم KV.

تعتمد على فك الترميز التخميني — اختر حزمة ggml-org، التي تحتفظ برأس التنبؤ متعدد الرموز؛ بعض الإصدارات الكمية تجرده لتوفير حوالي 0.5 جيجابايت.

لديك 12 جيجابايت فقط — إجابة صادقة: نموذج 27B بدقة 2-بت أسوأ بشكل ملحوظ من النموذج نفسه عند تقديمه بشكل صحيح. جرّب الطبقة المجانية من واجهة API قبل أن تلتزم بإعداد محلي بدقة 2-بت؛ إذا كانت جيدة بما يكفي، يمكن لملف GGUF أن ينتظر حتى يلحق العتاد.

خلاصة القول

Qwen3.8 27B هو النموذج النادر من فئة 27B الذي يناسب بطاقة 24GB دون أي مساومة: تنزيل Q4_K_M بحجم 17.1GB، ونسخة حالية من llama.cpp، وذاكرة تخزين مؤقت KV رخيصة بما يكفي ليكون السياق الطويل بلا تكلفة تقريبًا. نزّل هذا الملف إذا كنت تملك العتاد، وتذكّر أن الرؤية تتطلب ملف mmproj منفصلًا، وتوقّع مصيدة القالب في أول مرة تبدو فيها محادثة متعددة الأدوار وكأنها تنسى. إذا كنت لا تملك العتاد، فالنموذج نفسه متاح عبر واجهة برمجية (API) بسعر $0.33/$2.40 مع طبقة مجانية محدودة المعدل، فلا يوجد سبب لتشغيل ملف 2-bit لست راضيًا عنه. GGUF هو المسار المجاني؛ لكنه لم يعد المسار الوحيد.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube