بطاقة عنوان رئيسية تعرض Qwen3.8-27B على vLLM مع العنوان الفرعي «شغّلها في الإنتاج على وحدة GPU واحدة أو اثنتين»، وأيقونة خادم، وشرائح تنسيق تحمل تسميات NVFP4 24.6 GiB وFP8 48GB وBF16 80GB.
Guides & Insights

Qwen3.8-27B على vLLM: تشغيلها في الإنتاج على وحدة معالجة رسومات واحدة أو اثنتين

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نعم — يخدم Qwen3.8 27B في الإنتاج على vLLM اليوم، وعلى وحدة معالجة رسومية واحدة في معظم الحالات. الإصدار المهم هو vLLM 0.17.0 أو أحدث: فهو يتضمن الوصفة الرسمية، ونواة الانتباه الهجين التي يحتاجها هذا النموذج، وواجهة /v1 متوافقة مع OpenAI. بالنسبة لوحدة معالجة رسومية واحدة من نوع Blackwell، شغّل NVFP4 quant — وفقًا لوصفة vLLM الخاصة، يستهلك 24.6 جيبي بايت من ذاكرة VRAM عند حجم التوازي الموتر 1. لبطاقة واحدة بسعة 48 جيجابايت، شغّل FP8. أما BF16 الكامل، وهو نقطة تفتيش بحجم 51.7 جيجابايت، فيتطلب وحدة معالجة رسومية واحدة بسعة 80 جيجابايت أو بطاقتين بسعة 48 جيجابايت في وضع التوازي الموتر. الأوامر الدقيقة مذكورة أدناه؛ الأول أمر في سطر واحد.

تم التحقق من كل ما هنا في 15 أغسطس 2026، وهو اليوم الثالث لتفعيل الأوزان. المعمارية والسياق والترخيص مأخوذة من بطاقة نموذج Qwen3.8 27B على Hugging Face؛ حجم نقطة التفتيش هو مجموع أجزاء safetensors الثمانية عشر في المستودع؛ أوامر vLLM ورقم 24.6 GiB مأخوذان من صفحة وصفة vLLM الخاصة لهذا النموذج. Qwen3.8 27B هو نموذج Ali​baba الكثيف متعدد الوسائط ذو 27 مليار معامل — أوزان Apache 2.0، صدر في 13–14 أغسطس — ولأن الأوزان مفتوحة، يمكنك تقديمه بنفسك بدلاً من استئجار الرموز. هذا الفرع هو ما تدور حوله هذه المقالة فعليًا.

الحقائق المهمة، مع المصادر

البنية — نموذج كثيف بـ27B (27.8B مع احتساب برج الرؤية والمفردات المحشوة)، 64 طبقة، حجم مخفي 5,120، مفردات 248,320. بطاقة النموذج الرسمية، تم التحقق منها اليوم.

الانتباه — هجين: 16 طبقة انتباه كاملة و48 طبقة خطية من Gated DeltaNet بنمط كتل بنسبة 3:1. فقط 16 طبقة تحتفظ بمخزن مؤقت متزايد للمفاتيح والقيم؛ بينما تحتفظ الـ48 الأخرى بحالة متكررة ثابتة الحجم بدلاً من ذلك.

السياق — 262,144 توكنًا بشكل أصلي، قابل للتوسيع إلى ما يقارب مليون عبر تحجيم YaRN RoPE. بطاقة النموذج، تم التحقق منها اليوم.

الإدخال — نص وصورة وفيديو أصلي؛ مع إخراج نصي. تُتيح vLLM الأنواع الثلاثة جميعها عبر واجهة برمجة تطبيقات chat-completions القياسية، دون الحاجة إلى ملف إسقاط (projector) منفصل.

الترخيص — Apache 2.0. هذه الحقيقة الواحدة هي السبب في وجود سؤال "اخدمها بنفسك مقابل استئجار التوكنات" أصلًا.

الأوزان — يبلغ إجمالي نقطة تفتيش BF16 51.7 جيجابايت عبر 18 شريحة safetensors (Hugging Face، تم التحقق منها اليوم). كما تنشر Qwe​n نقاط تفتيش FP8 وNVFP4 مبنية لـ vLLM.

متطلب vLLM — الإصدار 0.17.0 أو أحدث، مع transformers ≥ 5.8.0. صفحة وصفات vLLM، تم التحقق منها اليوم. «أي vLLM» ليس تعليمة آمنة؛ نوى الطبقة المتكررة هي ما يضيفه الإصدار الجديد.

التنبؤ متعدد التوكنات — يأتي رأس مسودة لفك الترميز التخميني مضمّنًا في نقطة التحقق، لذا لا تحتاج إلى نموذج مسودة منفصل. توثّق vLLM هذا الخيار؛ لا توجد بعد أرقام مستقلة حول مقدار تسريع الأداء.

سُلَّم وحدات معالجة الرسوميات — أيّ تكميم على أيّ بطاقة

ثلاث صيغ تقديم تغطي النطاق العملي. اختر بناءً على الـ VRAM المتوفر لديك فعلياً، وليس بناءً على "أفضل كوانت".

NVFP4 — بإجمالي 24.6 غيغابايت (الأوزان بالإضافة إلى ذاكرة تخزين مؤقت FP8 KV)، وفقًا لوصفة vLLM عند TP1. يتسع لشريحة واحدة من فئة Blackwell — عمليًا RTX 5090 بسعة 32 غيغابايت أو B200. هذا هو المسار الأقل زمن استجابة والأكثر احتفاظًا بالسياق لكل بطاقة: تشير وصفة vLLM إلى سعة 6.6 مليون رمز KV حتى مع تمديد سياق المليون.

FP8 — حوالي 26 غيغابايت من الأوزان. بطاقة واحدة بسعة 48 غيغابايت (L40S، RTX A6000، RTX 6000 Ada) تكفي لها مع مساحة للسياق؛ بطاقتان بسعة 48 غيغابايت في التوازي الموتر تمنحانك مساحة أكبر لسياق أطول أو تزامن أعلى. وصفة vLLM الخاصة تشغّل FP8 على TP4 عبر صينية GB300 بأربع وحدات GPU عندما تريد أكبر ذاكرة تخزين مؤقت KV ممكنة.

BF16 — 51.7 جيجابايت من الأوزان، لذا فإن وحدة معالجة رسومية واحدة بسعة 80 جيجابايت (H100، A100 80GB، B200، GB300) أو بطاقتان بسعة 48 جيجابايت عند TP2. هذا هو خيار الدقة المرجعية، وهو الخيار الذي يستخدمه أمر تمديد السياق 1M أدناه فعليًا.

MXFP4 — لا تستخدمه على NVIDIA. مسار MXFP4 في vLLM يفتقر حاليًا إلى دعم الطريقة الخطية؛ يتم نشر نفس الأوزان بصيغة NVFP4، وهي الصيغة التي يستخدمها إعداد NVIDIA فعليًا.

A GPU ladder card for Qwen3.8-27B on vLLM: NVFP4 at 24.6 GiB on one 32GB Blackwell card at TP1 highlighted as the single-GPU pick, FP8 at about 26GB on one 48GB card or two at TP2, BF16 at 51.7GB on one 80GB GPU or two 48GB at TP2, plus a warning that MXFP4 does not run on NVIDIA.

نفّذها — أوامر vLLM

الإعداد الافتراضي منخفض زمن الاستجابة لوحدة معالجة رسومية واحدة (NVFP4، وحدة معالجة رسومية واحدة من Blackwell)، كما ورد حرفيًا من وصفة vLLM:

vllm serve Inferact/Qwen3.8-27B-NVFP4 --tensor-parallel-size 1 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder

أمر FP8 من نفس الوصفة (TP4، صينية واحدة من GB300، أكبر ذاكرة تخزين مؤقت لـ KV):

vllm serve Qwen/Qwen3.8-27B-FP8 --tensor-parallel-size 4 --max-model-len 262144 --kv-cache-dtype fp8 --reasoning-parser qwen3

بالنسبة لبطاقتين سعة 48 جيجابايت، احتفظ بأمر FP8 واضبط --tensor-parallel-size 2 بدلاً من 4.

ألحق هذا بأيٍّ من الأمرين لتفعيل فك الترميز التخميني MTP:

--speculative-config '{"method":"mtp","num_speculative_tokens":3}'

امتداد السياق 1M (أيضًا من وصفة vLLM):

vllm serve Qwen/Qwen3.8-27B --max-model-len 1010000 --hf-overrides '{"text_config": {"max_position_embeddings": 1010000}}'

A terminal-style card showing the vLLM serve command for Qwen3.8-27B NVFP4 on one GPU with the flags tensor-parallel-size 1, max-model-len 262144, kv-cache-dtype fp8, reasoning-parser qwen3, and tool-call-parser qwen3_coder.

Point any O​penAI client at http://localhost:8000/v1 — the endpoint is a drop-in replacement. Two runtime details matter once it is up: thinking is on by default at reasoning_effort xhigh, so turn it off per request with chat_template_kwargs {"enable_thinking": false} or drop it to {"reasoning_effort": "low"} for faster answers. And the checkpoint ships temperature 1.0, top_p 0.95, top_k 20 in its generation config — pass those unless your app already overrides sampling.

ما الذي تعد به صفحات vLLM الخاصة وما لا تعد به

لا توجد أرقام إنتاجية لطراز 27B بعد.اعتبارًا من 15 أغسطس، لا تنشر صفحة الوصفات الخاصة بـvLLM أي معايير إنتاجية أو زمن استجابة لطراز Qwen3.8 27B. الرقم المتداول "أكثر من 4,000 رمز في الثانية لكل وحدة معالجة رسومية" يعود إلى طراز Qwen3.8 2.4T-A95B على حامل GB300 NVL72 المزوّد بـ72 وحدة معالجة رسومية، وهو رقم مُعلن من قِبل البائع، ولا يخص هذا الطراز. أما أرقام الرموز في الثانية المجتمعية التي ستشاهدها متداولةً لـGGUF عبر llama.cpp أو Ollama — فهي لبيئة تشغيل مختلفة وعبء عمل مختلف عن خدمة vLLM.

الادعاء بأن ذاكرة التخزين المؤقت منخفضة التكلفة يعتمد على وقت التشغيل. تشير بطاقة النموذج إلى أن 16 طبقة فقط من أصل 64 تحتفظ بذاكرة تخزين مؤقت، لكن ذلك لا يساعد إلا إذا كان محرك الخدمة يطبق فعليًا طبقات Gated DeltaNet. إصدار vLLM 0.17+ هو الإصدار الذي يفعل ذلك؛ ولهذا السبب فإن تحديد الإصدار هو أول شيء في هذه المقالة بدلاً من حاشية سفلية.

MTP مدمج لكنه غير مُقاس هنا. رأس المسودة موجود في نقطة التفتيش، ويوثّق vLLM العلامة، لكن لم ينشر أحد حتى الآن رقم تسريع مستقل لهذا النموذج 27B على vLLM. خطط لقياسه على حركة المرور الخاصة بك.

NVIDIA هو الطريق المُجرَّب.وصفة vLLM مكتوبة لبطاقات رسوميات NVIDIA (NVFP4 وFP8). عمليات نشر نموذج الانتباه الهجين على AMD Instinct أو Intel Gaudi لا تزال في مراحلها التجريبية الأولى، وهذه المقالة لا تدّعي عكس ذلك.

قدّمها بنفسك، أو استأجر الرموز

هنا حيث يقوم Apache 2.0 بعمله. لا توجد رسوم ترخيص لكل توكن على Qwen3.8 27B، لذا فإن السؤال الحقيقي الوحيد هو ما إذا كنت تملك العتاد أم تستأجر التوكنات.

الاستضافة الذاتية (هذه المقالة) — تدفع مقابل وحدة معالجة الرسوميات مرة واحدة، وكل توكن بعد ذلك مجاني. إن بطاقة RTX 5090 التي تمتلكها بالفعل تجعل أمر NVFP4 نقطة نهاية بتكلفة حدية صفرية مع عدم مغادرة أي بيانات للجهاز. إذا كان عليك استئجار وحدة معالجة الرسوميات، فإن 5090 سحابيًا أو زوجًا من A6000 هو البند، ولا تنجح الحجة بأكملها إلا إذا كنت تملك البطاقة بالفعل أو لديك حجم الاستخدام المستمر.

استأجر التوكنات — لأن الأوزان مفتوحة، تستضيفها عدة جهات، والحد الأدنى للسعر هو تكلفة الأجهزة. نموذج Qwen3.8 27B متاح الآن على OrcaRouter بسعر 0.33 دولار لكل مليون توكن إدخال و2.40 دولار لكل مليون توكن إخراج — بدون أي هامش ربح إضافي من البائع، لأن OrcaRouter يشغّل الأوزان المفتوحة على بنيته التحتية الخاصة — ونفس الأوزان المفتوحة تدعم طبقة مجانية محدودة المعدل، حيث لا تكلف شيئًا لكل طلب وتُرجع خطأ HTTP 429 عندما تتجاوز الحد المسموح. شهر نموذجي بواقع 10 ملايين توكن مع 70% إدخال يكلف حوالي 9.51 دولار على الطبقة المدفوعة.

قاعدة القرار — إذا كنت تملك وحدة معالجة الرسومات (GPU) بالفعل، فاستضفها بنفسك. أما إذا كنت ستضطر إلى شراء واحدة أو استئجارها، فإن واجهة برمجة التطبيقات (API) تبلغ نقطة التعادل بسرعة على نطاق المشاريع الجانبية، ويمكن لنفس العميل المتوافق مع O​penAI الاتصال بأيٍّ من الطرفين، لذا لا يتغير الكود عندما تنتقل.

The OrcaRouter model page for Qwen3.8 27B, showing the input price of 0.33 dollars per million tokens, output price of 2.40 dollars per million tokens, a 262K-token context window, text image and video input, and p50 time-to-first-token of 225 milliseconds.

عندما تكون vLLM هي الإجابة الخاطئة

أنت مجرد شخص واحد على حاسوب محمول — vLLM هو محرك تقديم، وليس تطبيق سطح مكتب. وللتشغيل المحلي لمستخدمٍ واحد، فإن llama.cpp أو Ollama مع ملف Q4 GGUF أبسط ويتطلب بطاقة بسعة 24 جيجابايت، وليس GPU من فئة Blackwell؛ ودليلنا how-to-run-Qwen3.8-27B-locally يرشدك في هذا المسار من البداية إلى النهاية.

تحتاج إلى إنتاجية مضمونة بدون عمليات تشغيل — الاستضافة الذاتية تعني أنك مسؤول عن التنبيهات والطوابير والتعافي من الأعطال. إذا كانت عبارة "الـ API معطّل" جملة لا تريد نطقها، فاستأجر التوكنات بدلاً من ذلك ودع شخصاً آخر يتولى تشغيل البنية التحتية.

أنت حقًا بحاجة إلى السياق الكامل البالغ ~1M بجودة رائدة — هذه مهمة Qwen3.8 2.4T-A95B، التي تخدمها vLLM أو SGLang عبر رف GB300 NVL72 مزود بـ 72 وحدة معالجة رسومية. لن يتمكن Qwen3.8 27B على وحدة أو وحدتي معالجة رسومية من مجاراته؛ مقالنا حول خدمة 2.4T يشرح لماذا يعتبر هذا النموذج فئة مختلفة من المشاكل.

أنت تستخدم بطاقة 24GB قديمة — NVFP4 هو تنسيق بلاكويل؛ على بطاقات Ampere (RTX 3090) أو Ada (RTX 4090) بسعة 24GB، يكون مسار FP8 هو خيار vLLM، وما بعد ذلك فإن تكميم GGUF ضمن llama.cpp هو الحل العملي. النموذج نفسه على بطاقة 24GB هو أمر مختلف.

يجب أن تخدم أقصى تزامن على بطاقة واحدة — الإعدادات الافتراضية لبطاقة GPU واحدة أعلاه هي نقطة البداية، وليست الشكل الإنتاجي. اضبط --max-num-seqs وذاكرة التخزين المؤقت KV وإعداد MTP وفقًا لمزيج الطلبات الخاص بك قبل أن تعتبرها مكتملة.

خلاصة القول

Qwen3.8 27B هو النموذج الكثيف النادر بحجم 27B الذي يخدمه vLLM على GPU واحدة في بيئة الإنتاج. حدّث إلى vLLM 0.17.0+، واسحب نسخة التكميم NVFP4 لبطاقة Blackwell بسعة 32GB بحجم 24.6 GiB، ونسخة التكميم FP8 لبطاقة واحدة بسعة 48GB أو بطاقتين بتقنية Tensor-Parallel، واحتفظ بـ BF16 لوحدة معالجة رسومية بسعة 80GB. الأوامر عبارة عن أسطر برمجية واحدة، والـ Endpoint متوافق مع OpenAI، ولأن الأوزان مرخصة بموجب Apache 2.0، يمكنك تشغيله بنفسك أو استئجاره بسعر 0.33 دولار / 2.40 دولار لكل مليون توكن مع طبقة مجانية — نفس رمز العميل في الحالتين. الشيء الوحيد الذي لا يمتلكه أحد حتى الآن هو رقم إنتاجية مستقل لنموذج 27B على vLLM، لذا خصّص ساعة لقياس الأداء بعد تشغيله قبل أن تعد أي شخص برقم زمن الاستجابة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube