بطاقة عنوان لتقرير معايير Qwen3.8-27B، تعرض بطاقة تقرير معايير مع ختم مكتوب عليه "أوزان مفتوحة" وأيقونات للبرمجة والإنتاجية والرؤية والسياق الطويل والأجهزة المحلية، مع شرائح مكتوب عليها 27B DENSE و262K CONTEXT وAPACHE 2.0.
Guides & Insights

معايير Qwen3.8-27B: الجدول الكامل، مع التحفظات المرفقة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Qwen3.8-27B يحقق درجة 73.0 في Terminal-Bench 2.1، و61.7 في SWE-bench Pro، و90.3 في LiveCodeBench v6، و84.3 في OSWorld-Verified — وكل واحدة من هذه الأرقام هي من اختبارات Alibaba ذاتها. النموذج مفتوح الأوزان الذي يضم 27 مليار معامل صدر على Hugging Face في 14 أغسطس 2026 بموجب ترخيص Apache 2.0، وحتى 15 أغسطس لم يقم أي جهة خارج Alibaba بتقييم جودته بشكل مستقل. تقدم هذه الصفحة الملخص الكامل الموثّق بالمصادر: جميع المعايير الرسمية البالغ عددها 25 من بطاقة النموذج، وما الذي تغيّر مقارنةً بسلفه Qwen3.6-27B، وما الذي قاسه اختبار إنتاجية مستقل من AMD، وأي الادعاءات يجب التعامل معها كأولية.

دليل قراءة قبل الأرقام: "الرسمي" هنا يعني تقييم Alibaba المطبوع على بطاقة النموذج في Qwen/Qwen3.8-27B. وهو مُبلَّغ من البائع ولم يُعاد إنتاجه. "المستقل" يعني أن شخصًا من خارج المختبر قام بقياسه — حتى الآن ينطبق ذلك على إنتاجية العتاد فقط، وليس على أي درجة جودة. المعايير التي يهم فيها إطار التشغيل مُشار إليها داخل النص.

النموذج، سطر واحد لكل مواصفة

• 27B معاملات كثيفة (28B عند احتساب مشفّر الرؤية)، 64 طبقة، حجم مخفي 5120.

هجين الانتباه — 48 طبقة انتباه خطي من نوع Gated DeltaNet بالإضافة إلى 16 طبقة انتباه كامل، بنسبة 3:1 — وهو ما يجعل تشغيل نافذة من 262 ألف رمز (token) ميسور التكلفة.

• سياق أصلي يبلغ 262,144 رمزًا، قابل للتوسيع إلى 1,000,000 مع تحجيم YaRN.

• إدخال الصور والفيديو الأصلي (إخراج نصي)، أوزان Apache 2.0، حوالي 55.6 جيجابايت بصيغة BF16.

النسخة المختصرة: هذا هو النموذج المصمَّم ليأخذ ما تعلّمته علي بابا من بناء نموذج Qwen3.8-Max ذي المعاملات البالغة 2.4 تريليون، ويضغطه في شيء يمكن لوحدة معالجة رسومية واحدة تشغيله.

بطاقة الأداء: كل معيار على بطاقة النموذج

جميع النتائج أدناه مأخوذة من بطاقة نموذج Alibaba الصادرة في 14 أغسطس، مع نتيجة Qwen3.6-27B التي يستبدلها النموذج بين قوسين.

البرمجة. Terminal-Bench 2.1 (برمجة الطرفية عبر الوكلاء) 73.0 (63.4)؛ SWE-bench Pro 61.7 (53.5)؛ QwenSWEBench 79.0 (49.3)؛ DeepSWE 1.1 42.2 (13.3)؛ NL2Repo-Bench 42.3 (36.2)؛ LiveCodeBench v6 90.3 (83.9). استخدمت عمليات تشغيل SWE-bench Pro وQwenSWEBench منصة Claude Code، وفقًا لحاشية بطاقة النموذج — يجدر أخذ ذلك في الاعتبار قبل مقارنتها بنموذج تم تقييمه على منصة مختلفة.

وكلاء طويلي الأفق والعمل المكتبي. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / النتيجة 42.9 (10.6 / 27.3).

الاستدلال والمعرفة. GPQA Diamond 89.2 (87.8)؛ Humanity's Last Exam 30.8 (24.0)؛ IFBench اتباع التعليمات 79.5 (69.1). يتم تقييم HLE بواسطة GPT-4o، وفقًا للبطاقة.

الرؤية واستخدام الكمبيوتر. OSWorld-Verified 84.3 (63.9)؛ WebArena-Verified 64.8 (48.8)؛ AndroidWorld 81.9 (70.3)؛ MathVision 94.6 مع CI / 90.0 بدون (85.1)؛ BabyVision 85.6 مع CI / 65.7 بدون (28.9)؛ OmniDocBench 1.5 91.1 (89.4)؛ RealWorldQA 85.9 (84.1). "CI" هو تحسين وقت الاستدلال من Alibaba؛ الفجوة بين حالتَي تشغيله وإيقافه هي الرقم الأكثر دلالة على البطاقة حول مقدار النقاط التي يمكنك شراؤها بقدرة استدلال إضافية.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

ما الذي تغيّر فعليًا مقارنةً بـ Qwen3.6-27B

كل معيار على البطاقة ارتفع، لكن الفروقات ليست موحّدة — وشكل التحسّن هو القصة. المكاسب تتركّز في البرمجة الوكيلة واستخدام الحاسوب، وليس في استرجاع المعرفة:

• DeepSWE 1.1 (البرمجة بالوكلاء) من 13.3 إلى 42.2، أي قفزة تقريبًا بمقدار 3 أضعاف

• QwenSWEBench 49.3 ← 79.0

• درجة Agents' Last Exam من 27.3 إلى 42.9

• OSWorld-Verified 63.9 ← 84.3 وAndroidWorld 70.3 ← 81.9

• BabyVision (مع CI) من 28.9 إلى 85.6 — أكبر مكسب نسبي على البطاقة

في هذه الأثناء، انتقل GPQA Diamond من 87.8 إلى 89.2 وRealWorldQA من 84.1 إلى 85.9: تحسّن حقيقي لكنه طفيف. هذا ليس إصدارًا "أكثر ذكاءً في كل شيء". إنه إصدار يستهدف بشكل مباشر الوكلاء الذين يقرؤون الشاشات، ويستخدمون الأدوات، ويكتبون التعليمات البرمجية عبر خطوات متعددة.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

الفجوات الصادقة: أين لا تزال تخسر، وتحفظات المنهجية

في مواجهة الحدود المتقدمة، الصورة مبهجة لكنها ليست منحازة. حيث يتداخل Qwen3.8-27B مع Claude Opus 4.6 Max، يفوز Qwen في الأغلبية — SWE-bench Pro، QwenSWEBench، CoWorkBench، LiveCodeBench v6، OSWorld-Verified، AndroidWorld، IFBench، وكتلة الرؤية بأكملها. وفي مواجهة Muse Glimmer-30B من Meta، المنافس الطبيعي في الفئة المحلية، يفوز في جميع المقاييس الثمانية المتداخلة بشكل قاطع. لكنه لا يزال يخسر Terminal-Bench 2.1 (73.0 مقابل 78.2)، وGPQA Diamond (89.2 مقابل 91.3)، وHumanity's Last Exam (30.8 مقابل 40.0)، وNL2Repo-Bench (42.3 مقابل 47.6) أمام Claude Opus 4.6 Max. إذا كان عبء عملك هو أصعب التفكير الحدودي — الرياضيات الحدودية، أسئلة متعددة التخصصات بشكل كبير — فإن 27B لم يصل إلى هناك بعد.

ثلاثة تحذيرات قبل أن تقتبس أيًا من هذا. أولًا، لا شيء منه تم التحقق منه بشكل مستقل؛ لا يوجد مؤشر Artificial Analysis ولا تشغيل LMArena للنسخة 27B حتى 15 أغسطس، وأدوات الاختبار الخاصة بشركة Alibaba ليست هي التي سيستخدمها أطراف ثالثة. ثانيًا، بطاقة النموذج تستخدم بيئة Claude Code لاختبار SWE-bench Pro وQwenSWEBench وحكم GPT-4o لامتحان Humanity's Last Exam — المقارنات مع نماذج تم تقييمها على إعدادات أخرى ستغيّر الأرقام. ثالثًا، تشغيل MathVision من Alibaba استخدم موجهًا ثابتًا بينما حصل المنافسون على أعلى نوعين مختلفين. لا يعني أي من هذا أن النتائج خاطئة؛ بل يعني أنها سقف وليس أرضية، حتى يقوم شخص آخر بتشغيل النموذج.

ما الذي يتطلبه تشغيله

Qwen3.8-27B هو نموذج محلي، وهو ما يغير معنى «الأداء»: الإنتاجية على عتادك الخاص بدلاً من بطاقة أسعار. تبلغ أوزان BF16 حوالي 55.6 جيجابايت؛ وعند تكميمها إلى 4 بت تناسب بطاقة بسعة 24 جيجابايت مثل RTX 3090 أو 4090. أصدرت AMD دعم Day-0 في يوم الإطلاق، وقد وضعت قياساتها الخاصة لـ llama.cpp/Vulkan — أغسطس 2026، بمتوسط ثلاث عمليات تشغيل أو أكثر — النموذج عند 24.5 رمزًا/ثانية على Ryzen AI Max+ 395 و51.8 رمزًا/ثانية على Radeon AI PRO R9700 بسعة 32 جيجابايت، على أنظمة تحتوي على أكثر من 24 جيجابايت تقريبًا من الذاكرة الرسومية المتغيرة أو VRAM. اختبارات المجتمع لبناء FP8 على NVIDIA GH200 استوعبت 10 طلبات متزامنة بسياق 262K مع زمن وصول للرمز الأول أقل من 10 مللي ثانية. أرقامك الخاصة ستختلف — فهذه بطاقات رسومية لشخص آخر — لكن الصورة حقيقية: هذا هو أول إصدار من Qwen في هذه الفئة يعمل، وليس فقط في مراجعة، على محطة عمل واحدة.

أوزان مجانية، أم واجهة برمجية مدفوعة؟

القرار الذي يفرضه هذا النموذج هو القرار الذي يفصل بين الاستضافة المحلية والاستضافة عبر السحابة: الأوزان لا تكلف شيئًا، لكن وحدات معالجة الرسومات لديك ليست مجانية. الاستضافة الذاتية تعني امتلاك السيليكون — بطاقة واحدة بسعة 24 جيجابايت إذا قبلت التكميم بـ 4 بت وتوليدًا أبطأ، وشيئًا أكبر إذا أردت سياق 262 ألفًا بجودة كاملة. البديل المستضاف على OrcaRouter هو 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج، مع نفس سياق 262 ألف ومدخلات الصور والفيديو، وزمن p50 حتى أول رمز يبلغ 225 مللي ثانية مقيسًا على مدى الأيام السبعة الماضية — لا حاجة لشراء وحدة معالجة رسومات، ولا لمراقبة ذاكرة الفيديو. الحساب هو الحساب الذي تجريه دائمًا مع الأوزان المفتوحة: معدل نقل الرموز الذي تحتاجه فعليًا مضروبًا في تكلفة الرمز الواحد، مقابل السعر الثابت للبطاقة. عند حجم مرتفع ومستمر، تتفوق الاستضافة الذاتية؛ وعند الحجم المتقطع أو المتواضع، يكون دفع 0.33/2.40 دولار أفضل من شراء سيليكون يظل خاملًا معظم الوقت.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

خلاصة القول

Qwen3.8-27B هو أقوى نموذج مفتوح الأوزان طرحته Alibaba في هذه الفئة الحجمية، وفقًا لأرقام Alibaba الخاصة: الأفضل في الجدول في البرمجة الوكيلة، واستخدام الحاسوب، والاستدلال البصري، مع نافذة سياق تبلغ 262K وأوزان مرخصة بموجب Apache 2.0. القراءة الصحيحة لبطاقة النتائج مشروطة — فكل رقم مذكور من قِبل البائع، ومحدد ببيئة الاختبار، ولم يُستنسخ بعد، ولا تزال النماذج الحدودية تتفوق في أصعب معايير الاستدلال. إذا كنت تزن خيارك بين استضافته ذاتيًا أو استدعائه كواجهة برمجية، فتعامل مع جدول المعايير على أنه الوعد، بينما أرقام إنتاجية AMD هي القياس المستقل الوحيد المتاح اليوم. سنحدّث هذه الصفحة في اليوم الذي ينشر فيه مختبر مستقل نتيجة.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube