بطاقة عنوان رئيسية تعرض Qwen3.8-27B مع Unsloth، مع العنوان الفرعي 'شغّلها أو كمّمها أو اضبطها محليًا'، وأيقونة نافذة طرفية، ورقاقات تقرأ 'UD-Q4_K_XL 17.9GB' و'Studio no-config'.
Guides & Insights

Qwen3.8-27B مع Unsloth: تشغيله أو تكميمه أو ضبطه بدقة محليًا

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نعم — تشغّل Unsloth نموذج Qwen3.8 27B، وهذه أسرع طريقة للحصول على نموذج Ali​baba الجديد المرخّص بموجب Apache-2.0 على معالج الرسومات الخاص بك. الإجابة كاملة في سطر واحد: افتح Unsloth Studio، وابحث عن "Qwen3.8 27B"، ثم اختر UD-Q4_K_XL (17.9GB) على بطاقة 24GB، وابدأ الدردشة في أقل من دقيقة. خلف هذه النقرة، أصدرت Unsloth ثلاثة أشياء في نفس الأسبوع الذي نُشرت فيه الأوزان (13–14 أغسطس 2026): unsloth/Qwen3.8-27B-GGUF حزمة مبنية على تكميم Unsloth Dynamic V3.0 (preview)، ودعم كامل في Unsloth Studio وDesktop، والإصدار v0.1.800-beta المزوّد بتصدير GGUF، واكتشاف imatrix، وتحسينات ملاءمة VRAM. كما تتيح أيضًا ضبط النموذج — يدّعي Unsloth أن التدريب أسرع 2× مع تقليل استخدام VRAM بنسبة 70%. Qwen3.8 27B هو نموذج رؤية-لغة كثيف بمعاملات يبلغ عددها 27 مليارًا، إذ يحافظ انتباهه الهجين على 16 طبقة فقط من أصل 64 طبقة في الانتباه الكامل، ولهذا السبب يمكن لملف 4-bit أن يعمل على بطاقات لا تستطيع معظم نماذج 27B العمل عليها.

بخصوص المصادر: حقائق النموذج رسمية، من بطاقة نموذج Qwen3.8 27B على Hugging Face، تم التحقق منها في 15 أغسطس 2026. دعم Unsloth وأحجام التكميم ومتطلبات VRAM وأوامر التثبيت مأخوذة من ملاحظات الإصدار ووثائق Unsloth، في نفس اليوم. سعر API مأخوذ مباشرة من كتالوج OrcaRouter، في نفس اليوم. تصريحات Unsloth بأنه "أسرع بمرتين مع ذاكرة VRAM أقل بنسبة 70%" و"بفارق كبير أقوى نموذج لحجمه" هي ادعاءات من البائع، ولم يتم إعادة إنتاجها بشكل مستقل.

ما معنى "Qwen3.8 + Unsloth": أربعة أشياء مختلفة

Unsloth هو أربعة أشياء منفصلة، ونتائج البحث بالكلمات المفتاحية تخلط بينها. معرفة أي واحد تحتاجه هو نصف عملية الإعداد:

unsloth/Qwen3.8-27B-GGUF — ملفات الأوزان المكمّمة على Hugging Face، 21 كوانتًا بالإضافة إلى مُسقط الرؤية. مبني باستخدام Dynamic V3.0 (معاينة)، وليس Dynamic 2.0 الأقدم (الذي أُعلن عنه في 24 أبريل 2025 ويسبق هذا النموذج). هذا هو مسار "تنزيل ملف"، ويمكن استخدامه من أي إصدار llama.cpp.

Unsloth Studio — تطبيق المتصفح الذي يمكنك تثبيته أو تشغيله من Hugging Face Space. ابحث في مركز النماذج، وانقر على نموذج مكمّم، وتواصل مع الأدوات بالدردشة. لا حاجة لضبط القالب أو معاملات الاستدلال يدويًا.

Unsloth Desktop — تطبيق الواجهة الرسومية المحلي لأنظمة macOS وWindows وLinux، الذي يشتمل على Studio بالإضافة إلى التدريب. هنا يتم الضبط الدقيق «الأسرع مرتين مع استهلاك أقل لذاكرة VRAM بنسبة 70%».

مكتبة unsloth للبايثون — from unsloth import FastLanguageModel، وهي واجهة برمجة التطبيقات للضبط الدقيق باستخدام QLoRA المستخدمة في دفاتر الملاحظات والبرامج النصية.

ملاحظات إصدار Unsloth للإصدار v0.1.800-beta، بعنوان "Release Qwen3.8 27B"، تنص على أن Qwen3.8 27B ونموذج Qwen3.8-2.4T-A95B الذي يضم 2.4 تريليون معامل "يمكن الآن تشغيلهما محليًا في Unsloth"، وأن الإصدار 27B "يعمل على 17 جيجابايت من ذاكرة الوصول العشوائي عبر Unsloth Dynamic GGUFs"، وأنه "يمكنك أيضًا ضبط Qwen3.8 27B بدقة في Unsloth." ويضيف الإصدار نفسه دعم تكميم NVFP4، ويتحقق من مساحة القرص قبل تصدير ملفات GGUF، ويكتشف دعم imatrix الحقيقي في Studio، ويجعل الاستدلال أسرع بنسبة تصل إلى 10% على GGUF مع حد أقصى قابل للضبط لذاكرة VRAM.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

اختر مستوى التكميم (quant) حسب VRAM، وليس حسب الحدس

يعتمد جدول ذاكرة Unsloth على إجمالي الذاكرة RAM بالإضافة إلى VRAM (أو الذاكرة الموحّدة)، وهو التوجيه الرسمي. يحتاج نموذج Qwen3.8 27B بترميز 4-bit إلى 17–19 جيجابايت؛ أما الحد الأدنى الواقعي لإعداد مريح بترميز 4-bit فهو بطاقة RTX 4090 بسعة 24 جيجابايت، أو RTX 5080، أو Mac بذاكرة موحّدة بسعة 24 جيجابايت. الخيارات الثلاثة التي تغطي الجميع تقريبًا:

12GB → UD-IQ2_XXS بحجم 9.0GB — الملف الوحيد الذي يناسب بالكامل؛ توقع فقدانًا ملحوظًا في الجودة. اتخذ هذا القرار عن عِلم.

16GB → UD-Q3_K_XL بحجم 13.4GB — أفضل ملف 3-bit، وفقًا لاختيار Unsloth نفسه.

24GB → UD-Q4_K_XL بحجم 17.9GB — الملف الموصى به بدقة 4 بت والإجابة الافتراضية لهذا المقال.

48–64GB → UD-Q8_K_XL بحجم 31.5GB — شبه بدون فقدان على محطة عمل أو إعداد بوحدتي GPU.

السلم الكامل، من قائمة ملفات unsloth/Qwen3.8-27B-GGUF ووثائق Unsloth، وتم التحقق من كليهما في 15 أغسطس 2026: UD-Q8_K_XL 31.5GB، UD-Q6_K_XL 25.9GB، UD-Q5_K_XL 20.2GB، UD-Q4_K_XL 17.9GB، UD-Q3_K_XL 13.4GB، UD-Q2_K_XL 10.7GB، UD-IQ3_XXS 11.9GB، UD-IQ2_M 10.3GB، UD-IQ2_XXS 9.0GB. كما تتوفر أيضًا تكميمات K القياسية (Q4_K_M 17.1GB، Q8_0 29.0GB)، وتشتمل الحزمة على مُسقِط رؤية (mmproj-BF16، 931MB) بحيث تعمل الصور والفيديو إذا قمت بتحميله. يطلق Unsloth على السلم بأكمله اسم «Dynamic V3.0 (preview)» — وهو أحدث من Dynamic 2.0 الذي ستراه في المقالات الأقدم، والذي بُني لنماذج صدرت قبل أكثر من عام.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

شغّله باستخدام Unsloth في ثلاث دقائق.

الطريقة بأمر واحد: على macOS أو Linux، نفّذ curl -fsSL https://unsloth.ai/install.sh | sh، ثم unsloth studio -p 8888 وافتح http://127.0.0.1:8888. على Windows، نفّذ irm https://unsloth.ai/install.ps1 | iex. إن أردت صفر تثبيت إطلاقاً، فإن Studio من Unsloth منشور أيضاً كـ Hugging Face Space — افتحه في المتصفح، وابحث عن "Qwen3.8 27B"، واختر نسخة مكمّمة (quant) حسب الذاكرة المتوفرة لديك. يضبط Studio معاملات أخذ العينات وقالب المحادثة تلقائياً، ويفرّغ الحمل إلى RAM عند نفاد VRAM، ويكتشف إعدادات تعدد GPU — ميزة "بدون إعدادات" حقيقية، وهي أسرع طريقة لتشغيل نموذج هذا الأسبوع.

مسار الملفات أولاً، إذا كنت تستخدم llama.cpp بالفعل: حمّل نسخة مكمّمة واحدة وشغّلها مباشرةً. هذه هي أوامر Unsloth الخاصة، تم التحقق منها وفقًا لوثائقهم:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

قيم أخذ العينات هذه هي إعدادات وضع التفكير الموصى بها في بطاقة النموذج. استبدل glob الخاص بـ --include بـ *UD-Q3_K_XL* على بطاقة بسعة 16GB، وأضف --mmproj مشيرًا إلى mmproj-BF16.gguf الخاص بالحزمة إذا كنت بحاجة إلى الرؤية. تحذير واحد: يجب أن يكون llama.cpp إصدارًا حديثًا — فالملف يسجّل بنية qwen35 الجديدة، وأي إصدار أقدم من أسبوع الإصدار يرفض تحميله.

اضبطه بدقة باستخدام Unsloth

يكتسب Unsloth سمعته من ضبط الدقة: تدّعي المكتبة تدريبًا أسرع بمقدار 2× مع استهلاك VRAM أقل بنسبة 70% مقارنةً بالإصدار القياسي من Transformers + PEFT، وهو ما يجعل QLoRA على نموذج 27B ممكنًا على بطاقة رسوميات استهلاكية واحدة. نقطة الدخول لضبط الدقة هي مستودع unsloth/Qwen3.8-27B العادي (صفحة ملفات safetensors بحجم 28B) بدلاً من حزمة GGUF. النمط القياسي لـ QLoRA في Unsloth، المطبَّق على هذا النموذج:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

ثم حلقة trl.SFTTrainer القياسية على مجموعة البيانات الخاصة بك. هذا المقتطف هو نمط QLoRA المعتاد من وثائق Unsloth — ادعاءات معايير التدريب هي من Unsloth نفسها ولم أقم بإعادة إنتاجها — وهناك تحذيران: تقوم نوى Unsloth بتعديل طبقات المحول النصي، لذا خطط للتعامل مع مشفر الرؤية بشكل منفصل، وحافظ على حزمة unsloth في الإصدار الحالي لأن هذه البنية حديثة جدًا وعدم تطابق الإصدارات يفشل بشكل صاخب.

ما يتولاه Unsloth Studio عنك

تشغيل GGUF يدويًا يعني الموازنة بدقة بين حجم السياق، وتفريغ ذاكرة الوصول العشوائي، واستدعاء الأدوات. تختزل Studio ذلك في إعدادات افتراضية: فهي تحدد حجم السياق بناءً على الذاكرة المتاحة فعليًا، وتفرغ نماذج الرؤية الخاملة لتحرير ذاكرة VRAM للدردشة أو التدريب، وتكتشف تخطيطات متعددة لوحدات معالجة الرسومات، وتربط البحث على الويب وتنفيذ البرامج واتصالات الوكلاء (Claude Code وCodex وMCP) بشكل جاهز. كما أن إصدار v0.1.800-beta أحكم التحكم في الأجزاء التي تسبب مشاكل عمليًا: فتصديرات GGUF تتحقق الآن من مساحة القرص قبل بدء دمج طويل بدلًا من الفشل في منتصف الطريق، وتكتشف Studio ما إذا كان GGUF الذي تصدّره يدعم فعليًا imatrix (حتى لا تهدر تشغيلًا)، كما أن حراس الذاكرة لم يعودوا يحجزون ذاكرة GPU بشكل مفرط. بالنسبة لنموذج عمره ثلاثة أيام، فإن "عدم وجود إعدادات" يقوم بعمل حقيقي.

المحلي المجاني مقابل واجهة برمجة التطبيقات المدفوعة: الاقتصاد الحقيقي

الفرق الجوهري بين {{1}}Unsloth{{/1}} وواجهة برمجة التطبيقات ليس الجودة — بل من يملك العتاد. {{2}}Unsloth{{/2}} هو الطريق المجاني: تكلفة حدية صفرية لكل رمز، ولا شيء يغادر جهازك، ولا حدود لمعدل الطلبات، وتحكم كامل في الأوزان. وهو ليس مجانيًا بشكل مطلق: أنت توفر وحدة معالجة الرسومات والكهرباء، وملف {{3}}2-bit{{/3}} على بطاقة {{4}}12GB{{/4}} تجربة منقوصة. {{5}}Qwen3.8 27B{{/5}} كثيف وقادر على الرؤية، لذا فإن {{6}}4-bit{{/6}} هو {{7}}17.9GB{{/7}} من الأوزان قبل السياق؛ الجهاز هو ثمن الدخول.

مسار API موجود لأن الأوزان مرخّصة بموجب Apache-2.0، لذا يمكن لأي شخص استضافتها بتكلفة هامشية شبه صفرية. Qwen3.8 27B موجود في كتالوج OrcaRouter اليوم بسعر$0.33 لكل مليون رمز إدخال و$2.40 لكل مليون رمز إخراج، النموذج مستضاف ذاتيًا على بنيتنا التحتية — دون تمرير سعر المورّد — مع نافذة سياقية تبلغ 262 ألف رمز وإدخال نص وصورة وفيديو. ولأن الأوزان مفتوحة، تتوفر أيضًا طبقة مجانية محدودة المعدل تتقاضى $0 لكل طلب. شهر تمثيلي بقيمة 10 ملايين رمز بمشاركة 70% من المدخلات يكلف حوالي $9.51 على الطبقة المدفوعة. إذا كنت تمتلك بطاقة بسعة 24 جيجابايت، فإن الحل المحلي يفوق من حيث التكلفة؛ وإذا لم تكن تمتلكها، فإن استئجار الرموز بهذا المعدل أفضل من شراء بطاقة لمشروع جانبي، والطبقة المجانية هي الطريقة الصادقة لاختبار النموذج قبل الالتزام بأي عتاد.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

عندما يكون Unsloth هو الإجابة الخاطئة

Unsloth Studio وحزمة GGUF هما الخيار الصحيح لجهاز واحد. وهما الخيار الخاطئ عندما:

أنت تمتلك بطاقة Blackwell RTX من سلسلة 50. إن نسخ unsloth/Qwen3.8-27B-NVFP4 المكممة أسرع بنحو 1.5× من BF16 في نفس سعة VRAM وتستخدم مخبأ FP8 KV لسياق أطول. هذا المسار يعمل عبر vLLM أو SGLang، وليس عبر GGUF ولا عبر Studio.

تحتاج إلى النافذة الأصلية كاملةً بسعة 262K أو امتداد YaRN بسعة 1M في بيئة الإنتاج. نموذج الرؤية الكثيف عند السياق الطويل يكون ثقيلًا؛ فميزة ضبط حجم السياق في Unsloth ستُشغّله لك بسياق أقصر بكل سهولة، لكن حزمة تقديم مجهزة بإدارة KV سليمة تتفوق على تطبيق محلي.

أنت تخدم العديد من المستخدمين. Unsloth هو تطبيق محلي ومكتبة للضبط الدقيق، وليس خادمًا متعدد المستأجرين. للحصول على التزامن والتوسع التلقائي وضمانات وقت التشغيل، فأنت بحاجة إلى نقطة نهاية مستضافة.

ليس لديك GPU على الإطلاق. إجابة صادقة: نموذج 27B بدقة 2-bit على بطاقة 12GB أسوأ بشكل ملحوظ من نفس النموذج عند تقديمه بشكل سليم. استخدم الطبقة المجانية من API أولًا؛ إذا كانت جيدة بما يكفي، فاشترِ العتاد عندما يثبت نجاح حالة الاستخدام.

تريد ضبط الجانب البصري بدقة. تستهدف تسريعات Unsloth طبقات المحوّل النصي؛ أما الضبط الدقيق متعدد الوسائط الكامل فيتطلب حزمة تقنية مختلفة.

خلاصة القول

Qwen3.8 27B مع Unsloth أصبحت مشكلة محلولة اعتبارًا من هذا الأسبوع: ثبّت Studio، واختر UD-Q4_K_XL لبطاقة سعة 24GB (أو UD-Q3_K_XL لسعة 16GB، وUD-IQ2_XXS لسعة 12GB)، وسيعمل النموذج دون أي إعدادات ودون فوترة لكل توكن. مسار الضبط الدقيق حقيقي، وادعاءات Unsloth بشأن السرعة هي السبب في أن QLoRA بحجم 27B عملي على بطاقة واحدة. اعلم أن سلم التكميم هو Dynamic V3.0 (إصدار معاينة)، وليس Dynamic 2.0 الذي تصفه المقالات الأقدم؛ وأبقِ llama.cpp محدّثًا؛ وإذا كنت لا تملك العتاد، فإن الأوزان نفسها متاحة عبر واجهة برمجة تطبيقات (API) بسعر $0.33/$2.40 مع طبقة مجانية محدودة المعدل — لذا لا يوجد أي سبب لتشغيل ملف 2-bit لست راضيًا عنه. التشغيل المحلي هو الطريق المجاني، وللمرة الأولى في هذه الفئة الوزنية هو أيضًا الطريق السهل.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube