
Qwen3.8-27B على vLLM: تشغيلها في الإنتاج على وحدة معالجة رسومات واحدة أو اثنتين
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 لكل مليون رمز · 42 tok/s
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1326 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 3410 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
نعم — يخدم Qwen3.8 27B في الإنتاج على vLLM اليوم، وعلى وحدة معالجة رسومية واحدة في معظم الحالات. الإصدار المهم هو vLLM 0.17.0 أو أحدث: فهو يتضمن الوصفة الرسمية، ونواة الانتباه الهجين التي يحتاجها هذا النموذج، وواجهة /v1 متوافقة مع OpenAI. بالنسبة لوحدة معالجة رسومية واحدة من نوع Blackwell، شغّل NVFP4 quant — وفقًا لوصفة vLLM الخاصة، يستهلك 24.6 جيبي بايت من ذاكرة VRAM عند حجم التوازي الموتر 1. لبطاقة واحدة بسعة 48 جيجابايت، شغّل FP8. أما BF16 الكامل، وهو نقطة تفتيش بحجم 51.7 جيجابايت، فيتطلب وحدة معالجة رسومية واحدة بسعة 80 جيجابايت أو بطاقتين بسعة 48 جيجابايت في وضع التوازي الموتر. الأوامر الدقيقة مذكورة أدناه؛ الأول أمر في سطر واحد.
تم التحقق من كل ما هنا في 15 أغسطس 2026، وهو اليوم الثالث لتفعيل الأوزان. المعمارية والسياق والترخيص مأخوذة من بطاقة نموذج Qwen3.8 27B على Hugging Face؛ حجم نقطة التفتيش هو مجموع أجزاء safetensors الثمانية عشر في المستودع؛ أوامر vLLM ورقم 24.6 GiB مأخوذان من صفحة وصفة vLLM الخاصة لهذا النموذج. Qwen3.8 27B هو نموذج Alibaba الكثيف متعدد الوسائط ذو 27 مليار معامل — أوزان Apache 2.0، صدر في 13–14 أغسطس — ولأن الأوزان مفتوحة، يمكنك تقديمه بنفسك بدلاً من استئجار الرموز. هذا الفرع هو ما تدور حوله هذه المقالة فعليًا.
الحقائق المهمة، مع المصادر
• البنية — نموذج كثيف بـ27B (27.8B مع احتساب برج الرؤية والمفردات المحشوة)، 64 طبقة، حجم مخفي 5,120، مفردات 248,320. بطاقة النموذج الرسمية، تم التحقق منها اليوم.
• الانتباه — هجين: 16 طبقة انتباه كاملة و48 طبقة خطية من Gated DeltaNet بنمط كتل بنسبة 3:1. فقط 16 طبقة تحتفظ بمخزن مؤقت متزايد للمفاتيح والقيم؛ بينما تحتفظ الـ48 الأخرى بحالة متكررة ثابتة الحجم بدلاً من ذلك.
• السياق — 262,144 توكنًا بشكل أصلي، قابل للتوسيع إلى ما يقارب مليون عبر تحجيم YaRN RoPE. بطاقة النموذج، تم التحقق منها اليوم.
• الإدخال — نص وصورة وفيديو أصلي؛ مع إخراج نصي. تُتيح vLLM الأنواع الثلاثة جميعها عبر واجهة برمجة تطبيقات chat-completions القياسية، دون الحاجة إلى ملف إسقاط (projector) منفصل.
• الترخيص — Apache 2.0. هذه الحقيقة الواحدة هي السبب في وجود سؤال "اخدمها بنفسك مقابل استئجار التوكنات" أصلًا.
• الأوزان — يبلغ إجمالي نقطة تفتيش BF16 51.7 جيجابايت عبر 18 شريحة safetensors (Hugging Face، تم التحقق منها اليوم). كما تنشر Qwen نقاط تفتيش FP8 وNVFP4 مبنية لـ vLLM.
• متطلب vLLM — الإصدار 0.17.0 أو أحدث، مع transformers ≥ 5.8.0. صفحة وصفات vLLM، تم التحقق منها اليوم. «أي vLLM» ليس تعليمة آمنة؛ نوى الطبقة المتكررة هي ما يضيفه الإصدار الجديد.
• التنبؤ متعدد التوكنات — يأتي رأس مسودة لفك الترميز التخميني مضمّنًا في نقطة التحقق، لذا لا تحتاج إلى نموذج مسودة منفصل. توثّق vLLM هذا الخيار؛ لا توجد بعد أرقام مستقلة حول مقدار تسريع الأداء.
سُلَّم وحدات معالجة الرسوميات — أيّ تكميم على أيّ بطاقة
ثلاث صيغ تقديم تغطي النطاق العملي. اختر بناءً على الـ VRAM المتوفر لديك فعلياً، وليس بناءً على "أفضل كوانت".
• NVFP4 — بإجمالي 24.6 غيغابايت (الأوزان بالإضافة إلى ذاكرة تخزين مؤقت FP8 KV)، وفقًا لوصفة vLLM عند TP1. يتسع لشريحة واحدة من فئة Blackwell — عمليًا RTX 5090 بسعة 32 غيغابايت أو B200. هذا هو المسار الأقل زمن استجابة والأكثر احتفاظًا بالسياق لكل بطاقة: تشير وصفة vLLM إلى سعة 6.6 مليون رمز KV حتى مع تمديد سياق المليون.
• FP8 — حوالي 26 غيغابايت من الأوزان. بطاقة واحدة بسعة 48 غيغابايت (L40S، RTX A6000، RTX 6000 Ada) تكفي لها مع مساحة للسياق؛ بطاقتان بسعة 48 غيغابايت في التوازي الموتر تمنحانك مساحة أكبر لسياق أطول أو تزامن أعلى. وصفة vLLM الخاصة تشغّل FP8 على TP4 عبر صينية GB300 بأربع وحدات GPU عندما تريد أكبر ذاكرة تخزين مؤقت KV ممكنة.
• BF16 — 51.7 جيجابايت من الأوزان، لذا فإن وحدة معالجة رسومية واحدة بسعة 80 جيجابايت (H100، A100 80GB، B200، GB300) أو بطاقتان بسعة 48 جيجابايت عند TP2. هذا هو خيار الدقة المرجعية، وهو الخيار الذي يستخدمه أمر تمديد السياق 1M أدناه فعليًا.
• MXFP4 — لا تستخدمه على NVIDIA. مسار MXFP4 في vLLM يفتقر حاليًا إلى دعم الطريقة الخطية؛ يتم نشر نفس الأوزان بصيغة NVFP4، وهي الصيغة التي يستخدمها إعداد NVIDIA فعليًا.

نفّذها — أوامر vLLM
الإعداد الافتراضي منخفض زمن الاستجابة لوحدة معالجة رسومية واحدة (NVFP4، وحدة معالجة رسومية واحدة من Blackwell)، كما ورد حرفيًا من وصفة vLLM:
vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder
أمر FP8 من نفس الوصفة (TP4، صينية واحدة من GB300، أكبر ذاكرة تخزين مؤقت لـ KV):
vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3
بالنسبة لبطاقتين سعة 48 جيجابايت، احتفظ بأمر FP8 واضبط --tensor-parallel-size 2 بدلاً من 4.
ألحق هذا بأيٍّ من الأمرين لتفعيل فك الترميز التخميني MTP:
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
امتداد السياق 1M (أيضًا من وصفة vLLM):
vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

Point any OpenAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.
ما الذي تعد به صفحات vLLM الخاصة وما لا تعد به
• لا توجد أرقام إنتاجية لطراز 27B بعد.اعتبارًا من 15 أغسطس، لا تنشر صفحة الوصفات الخاصة بـvLLM أي معايير إنتاجية أو زمن استجابة لطراز Qwen3.8 27B. الرقم المتداول "أكثر من 4,000 رمز في الثانية لكل وحدة معالجة رسومية" يعود إلى طراز Qwen3.8 2.4T-A95B على حامل GB300 NVL72 المزوّد بـ72 وحدة معالجة رسومية، وهو رقم مُعلن من قِبل البائع، ولا يخص هذا الطراز. أما أرقام الرموز في الثانية المجتمعية التي ستشاهدها متداولةً لـGGUF عبر llama.cpp أو Ollama — فهي لبيئة تشغيل مختلفة وعبء عمل مختلف عن خدمة vLLM.
• الادعاء بأن ذاكرة التخزين المؤقت منخفضة التكلفة يعتمد على وقت التشغيل. تشير بطاقة النموذج إلى أن 16 طبقة فقط من أصل 64 تحتفظ بذاكرة تخزين مؤقت، لكن ذلك لا يساعد إلا إذا كان محرك الخدمة يطبق فعليًا طبقات Gated DeltaNet. إصدار vLLM 0.17+ هو الإصدار الذي يفعل ذلك؛ ولهذا السبب فإن تحديد الإصدار هو أول شيء في هذه المقالة بدلاً من حاشية سفلية.
• MTP مدمج لكنه غير مُقاس هنا. رأس المسودة موجود في نقطة التفتيش، ويوثّق vLLM العلامة، لكن لم ينشر أحد حتى الآن رقم تسريع مستقل لهذا النموذج 27B على vLLM. خطط لقياسه على حركة المرور الخاصة بك.
• NVIDIA هو الطريق المُجرَّب.وصفة vLLM مكتوبة لبطاقات رسوميات NVIDIA (NVFP4 وFP8). عمليات نشر نموذج الانتباه الهجين على AMD Instinct أو Intel Gaudi لا تزال في مراحلها التجريبية الأولى، وهذه المقالة لا تدّعي عكس ذلك.
قدّمها بنفسك، أو استأجر الرموز
هنا حيث يقوم Apache 2.0 بعمله. لا توجد رسوم ترخيص لكل توكن على Qwen3.8 27B، لذا فإن السؤال الحقيقي الوحيد هو ما إذا كنت تملك العتاد أم تستأجر التوكنات.
• الاستضافة الذاتية (هذه المقالة) — تدفع مقابل وحدة معالجة الرسوميات مرة واحدة، وكل توكن بعد ذلك مجاني. إن بطاقة RTX 5090 التي تمتلكها بالفعل تجعل أمر NVFP4 نقطة نهاية بتكلفة حدية صفرية مع عدم مغادرة أي بيانات للجهاز. إذا كان عليك استئجار وحدة معالجة الرسوميات، فإن 5090 سحابيًا أو زوجًا من A6000 هو البند، ولا تنجح الحجة بأكملها إلا إذا كنت تملك البطاقة بالفعل أو لديك حجم الاستخدام المستمر.
• استأجر التوكنات — لأن الأوزان مفتوحة، تستضيفها عدة جهات، والحد الأدنى للسعر هو تكلفة الأجهزة. نموذج Qwen3.8 27B متاح الآن على OrcaRouter بسعر 0.33 دولار لكل مليون توكن إدخال و2.40 دولار لكل مليون توكن إخراج — بدون أي هامش ربح إضافي من البائع، لأن OrcaRouter يشغّل الأوزان المفتوحة على بنيته التحتية الخاصة — ونفس الأوزان المفتوحة تدعم طبقة مجانية محدودة المعدل، حيث لا تكلف شيئًا لكل طلب وتُرجع خطأ HTTP 429 عندما تتجاوز الحد المسموح. شهر نموذجي بواقع 10 ملايين توكن مع 70% إدخال يكلف حوالي 9.51 دولار على الطبقة المدفوعة.
• قاعدة القرار — إذا كنت تملك وحدة معالجة الرسومات (GPU) بالفعل، فاستضفها بنفسك. أما إذا كنت ستضطر إلى شراء واحدة أو استئجارها، فإن واجهة برمجة التطبيقات (API) تبلغ نقطة التعادل بسرعة على نطاق المشاريع الجانبية، ويمكن لنفس العميل المتوافق مع OpenAI الاتصال بأيٍّ من الطرفين، لذا لا يتغير الكود عندما تنتقل.

عندما تكون vLLM هي الإجابة الخاطئة
• أنت مجرد شخص واحد على حاسوب محمول — vLLM هو محرك تقديم، وليس تطبيق سطح مكتب. وللتشغيل المحلي لمستخدمٍ واحد، فإن llama.cpp أو Ollama مع ملف Q4 GGUF أبسط ويتطلب بطاقة بسعة 24 جيجابايت، وليس GPU من فئة Blackwell؛ ودليلنا how-to-run-Qwen3.8-27B-locally يرشدك في هذا المسار من البداية إلى النهاية.
• تحتاج إلى إنتاجية مضمونة بدون عمليات تشغيل — الاستضافة الذاتية تعني أنك مسؤول عن التنبيهات والطوابير والتعافي من الأعطال. إذا كانت عبارة "الـ API معطّل" جملة لا تريد نطقها، فاستأجر التوكنات بدلاً من ذلك ودع شخصاً آخر يتولى تشغيل البنية التحتية.
• أنت حقًا بحاجة إلى السياق الكامل البالغ ~1M بجودة رائدة — هذه مهمة Qwen3.8 2.4T-A95B، التي تخدمها vLLM أو SGLang عبر رف GB300 NVL72 مزود بـ 72 وحدة معالجة رسومية. لن يتمكن Qwen3.8 27B على وحدة أو وحدتي معالجة رسومية من مجاراته؛ مقالنا حول خدمة 2.4T يشرح لماذا يعتبر هذا النموذج فئة مختلفة من المشاكل.
• أنت تستخدم بطاقة 24GB قديمة — NVFP4 هو تنسيق بلاكويل؛ على بطاقات Ampere (RTX 3090) أو Ada (RTX 4090) بسعة 24GB، يكون مسار FP8 هو خيار vLLM، وما بعد ذلك فإن تكميم GGUF ضمن llama.cpp هو الحل العملي. النموذج نفسه على بطاقة 24GB هو أمر مختلف.
• يجب أن تخدم أقصى تزامن على بطاقة واحدة — الإعدادات الافتراضية لبطاقة GPU واحدة أعلاه هي نقطة البداية، وليست الشكل الإنتاجي. اضبط --max-num-seqs وذاكرة التخزين المؤقت KV وإعداد MTP وفقًا لمزيج الطلبات الخاص بك قبل أن تعتبرها مكتملة.
خلاصة القول
Qwen3.8 27B هو النموذج الكثيف النادر بحجم 27B الذي يخدمه vLLM على GPU واحدة في بيئة الإنتاج. حدّث إلى vLLM 0.17.0+، واسحب نسخة التكميم NVFP4 لبطاقة Blackwell بسعة 32GB بحجم 24.6 GiB، ونسخة التكميم FP8 لبطاقة واحدة بسعة 48GB أو بطاقتين بتقنية Tensor-Parallel، واحتفظ بـ BF16 لوحدة معالجة رسومية بسعة 80GB. الأوامر عبارة عن أسطر برمجية واحدة، والـ Endpoint متوافق مع OpenAI، ولأن الأوزان مرخصة بموجب Apache 2.0، يمكنك تشغيله بنفسك أو استئجاره بسعر 0.33 دولار / 2.40 دولار لكل مليون توكن مع طبقة مجانية — نفس رمز العميل في الحالتين. الشيء الوحيد الذي لا يمتلكه أحد حتى الآن هو رقم إنتاجية مستقل لنموذج 27B على vLLM، لذا خصّص ساعة لقياس الأداء بعد تشغيله قبل أن تعد أي شخص برقم زمن الاستجابة.
