بطاقة عنوان لتقرير معايير Qwen3.8-27B، تعرض بطاقة تقرير معايير مع ختم مكتوب عليه "أوزان مفتوحة" وأيقونات للبرمجة والإنتاجية والرؤية والسياق الطويل والأجهزة المحلية، مع شرائح مكتوب عليها 27B DENSE و262K CONTEXT وAPACHE 2.0.
Guides & Insights

معايير Qwen3.8-27B: الجدول الكامل، مع التحفظات المرفقة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يحرز نموذج Qwen/Qwen3.8-27B درجة 73.0 في معيار Terminal-Bench 2.1، و61.7 في SWE-bench Pro، و90.3 في LiveCodeBench v6، و84.3 في OSWorld-Verified — وكل هذه الأرقام مأخوذة من أرقام علي بابا نفسها. وقد وصل النموذج مفتوح الأوزان الذي يبلغ حجمه 27 مليار معامل إلى منصة Hugging Face في 14 أغسطس 2026 بموجب رخصة Apache 2.0، وخلال أسبوعيه الأولين حصل على ثلاث نتائج خارجية مستقلة: المركز الأول بين النماذج مفتوحة الأوزان على معيار Harvey لوكيل Legal Agent، في دراسة أجرتها شركة Harvey المتخصصة في الذكاء الاصطناعي القانوني وشركة Engram المتخصصة في الذاكرة؛ والمركز التاسع إجمالًا على لوحة متصدرات WebDev الخاصة بـ Code Arena، وهو النموذج الوحيد في فئة حجمه ضمن العشرة الأوائل، وفقًا لإعلان علي بابا في 25 أغسطس؛ وإعلان 26 أغسطس عن حصوله على المركز الأول بين النماذج مفتوحة الأوزان على لوحة متصدرات Image-to-WebDev الخاصة بـ Arena.ai، محتلًا المركز السابع إجمالًا بدرجة مذكورة بلغت 1,574. هذه الصفحة هي العرض الكامل الموثّق: جميع المعايير الرسمية البالغ عددها 25 من بطاقة النموذج، وما الذي تغيّر مقارنةً بسلفه Qwen3.6-27B، وما الذي قاسه اختبار إنتاجية مستقل من AMD، ونتائج وكيل المحاماة وWebDev-arena تلك، وأي ادعاءات ينبغي أن تتعامل معها على أنها أولية حتى الآن.

دليل قراءة قبل الأرقام: «رسمي» هنا يعني تقييم Alibaba المطبوع على بطاقة النموذج في Qwen/Qwen3.8-27B. وهو مُبلَّغ من البائع وغير مُعاد إنتاجه. «مستقل» يعني أن شخصًا خارج المختبر قام بقياسه — حتى الآن يغطي ذلك اختبار إنتاجية العتاد، ودراسة وكيل في المجال القانوني، ومواضع على لوحتي متصدرين من لوحات تطوير الويب في Arena.ai، وهما Code Arena's WebDev وImage-to-WebDev arena. المعايير التي يهم فيها إطار الاختبار مُعلَّمة داخل النص.

النموذج، سطر واحد لكل مواصفة

• 27B معاملات كثيفة (28B عند احتساب مشفّر الرؤية)، 64 طبقة، حجم مخفي 5120.

هجين الانتباه — 48 طبقة انتباه خطي من نوع Gated DeltaNet بالإضافة إلى 16 طبقة انتباه كامل، بنسبة 3:1 — وهو ما يجعل تشغيل نافذة من 262 ألف رمز (token) ميسور التكلفة.

• سياق أصلي يبلغ 262,144 رمزًا، قابل للتوسيع إلى 1,000,000 مع تحجيم YaRN.

• إدخال الصور والفيديو الأصلي (إخراج نصي)، أوزان Apache 2.0، حوالي 55.6 جيجابايت بصيغة BF16.

النسخة المختصرة: هذا هو النموذج المصمَّم ليأخذ ما تعلّمته علي بابا من بناء نموذج Qwen3.8-Max ذي المعاملات البالغة 2.4 تريليون، ويضغطه في شيء يمكن لوحدة معالجة رسومية واحدة تشغيله.

بطاقة الأداء: كل معيار على بطاقة النموذج

جميع النتائج أدناه مأخوذة من بطاقة نموذج Alibaba الصادرة في 14 أغسطس، مع نتيجة Qwen3.6-27B التي يستبدلها النموذج بين قوسين.

البرمجة. Terminal-Bench 2.1 (برمجة الطرفية عبر الوكلاء) 73.0 (63.4)؛ SWE-bench Pro 61.7 (53.5)؛ QwenSWEBench 79.0 (49.3)؛ DeepSWE 1.1 42.2 (13.3)؛ NL2Repo-Bench 42.3 (36.2)؛ LiveCodeBench v6 90.3 (83.9). استخدمت عمليات تشغيل SWE-bench Pro وQwenSWEBench منصة Claude Code، وفقًا لحاشية بطاقة النموذج — يجدر أخذ ذلك في الاعتبار قبل مقارنتها بنموذج تم تقييمه على منصة مختلفة.

وكلاء طويلي الأفق والعمل المكتبي. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / النتيجة 42.9 (10.6 / 27.3).

الاستدلال والمعرفة. GPQA Diamond 89.2 (87.8)؛ Humanity's Last Exam 30.8 (24.0)؛ IFBench اتباع التعليمات 79.5 (69.1). يتم تقييم HLE بواسطة GPT-4o، وفقًا للبطاقة.

الرؤية واستخدام الكمبيوتر. OSWorld-Verified 84.3 (63.9)؛ WebArena-Verified 64.8 (48.8)؛ AndroidWorld 81.9 (70.3)؛ MathVision 94.6 مع CI / 90.0 بدون (85.1)؛ BabyVision 85.6 مع CI / 65.7 بدون (28.9)؛ OmniDocBench 1.5 91.1 (89.4)؛ RealWorldQA 85.9 (84.1). "CI" هو تحسين وقت الاستدلال من Alibaba؛ الفجوة بين حالتَي تشغيله وإيقافه هي الرقم الأكثر دلالة على البطاقة حول مقدار النقاط التي يمكنك شراؤها بقدرة استدلال إضافية.

A scoreboard card for Qwen3.8-27B, listing Terminal-Bench 2.1 73.0 (was 63.4), SWE-bench Pro 61.7 (was 53.5), LiveCodeBench v6 90.3 (was 83.9), GPQA Diamond 89.2 (was 87.8), OSWorld-Verified 84.3 (was 63.9) and native context 262K (1M via YaRN), with a footer reading Alibaba-reported, Aug 14 2026 model card — no independent scores yet.

ما الذي تغيّر فعليًا مقارنةً بـ Qwen3.6-27B

كل معيار على البطاقة ارتفع، لكن الفروقات ليست موحّدة — وشكل التحسّن هو القصة. المكاسب تتركّز في البرمجة الوكيلة واستخدام الحاسوب، وليس في استرجاع المعرفة:

• DeepSWE 1.1 (البرمجة بالوكلاء) من 13.3 إلى 42.2، أي قفزة تقريبًا بمقدار 3 أضعاف

• QwenSWEBench 49.3 ← 79.0

• درجة Agents' Last Exam من 27.3 إلى 42.9

• OSWorld-Verified 63.9 ← 84.3 وAndroidWorld 70.3 ← 81.9

• BabyVision (مع CI) من 28.9 إلى 85.6 — أكبر مكسب نسبي على البطاقة

في هذه الأثناء، انتقل GPQA Diamond من 87.8 إلى 89.2 وRealWorldQA من 84.1 إلى 85.9: تحسّن حقيقي لكنه طفيف. هذا ليس إصدارًا "أكثر ذكاءً في كل شيء". إنه إصدار يستهدف بشكل مباشر الوكلاء الذين يقرؤون الشاشات، ويستخدمون الأدوات، ويكتبون التعليمات البرمجية عبر خطوات متعددة.

A card showing the biggest Qwen3.8-27B benchmark gains over Qwen3.6-27B: DeepSWE 1.1 13.3 to 42.2, QwenSWEBench 49.3 to 79.0, Agents' Last Exam score 27.3 to 42.9, OSWorld-Verified 63.9 to 84.3, BabyVision with CI 28.9 to 85.6, WebArena-Verified 48.8 to 64.8, with a footer reading Delta vs Qwen3.6-27B, Alibaba-reported.

منذ نشر هذه الصفحة، كان التطور الأهم قانونيًا لا تقنيًا. أعلنت Alibaba أن Qw​en3.8-27B هو النموذج مفتوح الوزن رقم 1 في معيار Harvey's Legal Agent benchmark — وهو ادعاء من حساب البائع نفسه، لذا تعامل معه باعتباره تصريحًا من Alibaba. النتيجة التي تقف خلفه هي دراسة ليست من Alibaba: شركة Harvey، المتخصصة في الذكاء الاصطناعي القانوني، وشركة Engram، وهي شركة ناشئة في مجال ذاكرة الذكاء الاصطناعي، بنتا شركة محاماة افتراضية تُدعى Calderwood & Harkness من أكثر من 100 مليون رمز عبر ما يقرب من 10,000 مستند و266 قضية، ثم كيّفتا Qw​en3.8-27B عليها باستخدام ذاكرة معلمية، وملاحظات مضغوطة، وأداة استرجاع.

على 250 مهمة قانونية، حقق النموذج المُكيَّف 27B متوسط 67%، متقدمًا على كل نموذج اختبرته الدراسة — بما في ذلك Claude Opus 4.8 — وفي معيار الصحة الصارم القائم على الكل-أو-لا شيء، تفوق على Opus 4.8 بنسبة 30% مقابل 25%، بتكلفة تقريبية تبلغ 0.13 دولار لكل استعلام مقابل 1.32 دولار لـ Opus 4.8. هذه الأرقام مذكورة في تقارير Harvey/Engram ولم يتم إعادة إنتاجها بشكل مستقل بعد. قبل التدريب على وثائق الشركة الخاصة، سجل النموذج نفسه 4.7% فقط في الأسئلة الخاصة بالشركة؛ وبعد دراستها، بلغ 72.6%.

اقرأ #1 مع تحفظ كبير: النموذج الذي تصدّر المعيار كان قد اطّلع على مجموعة الاختبار مسبقًا، إذ تم ضبطه على 100 مليون توكن من بيانات الشركة قبل تقييمه. هذا يجعله عرضًا لما يستطيع نموذج 27B استيعابه مع الضبط المتخصص بمجال معيّن، وليس نتيجةً لأوزان Apache-2.0 الأصلية على منصة تقييم محايدة — كما أنه يغطي مجالًا واحدًا، وهو القانون، وليس الجودة العامة. أما ما يدعمه فعلًا فهو الفكرة وراء التغريدة: نموذج 27B صغير بما يكفي ليعمل على جهاز محلي، لكنه قوي بما يكفي للعمل بمستوى احترافي بمجرد امتلاكه المعرفة الصحيحة.

النتيجة المستقلة الثانية: #9 في الترتيب العام في WebDev على Code Arena

النتيجة المستقلة الثانية هي نتيجة برمجية، وهي السبب في تغيير هذه الصفحة في 25 أغسطس. Code Arena هي لوحة متصدّري تطوير الويب من Arena.ai — المشروع الذي كان يُعرف سابقًا باسم WebDev Arena، على الموقع الذي كان يُعرف سابقًا باسم LMArena — حيث يبني المستخدمون تطبيقات حقيقية باستخدام أزواج مجهولة الهوية من النماذج ويصوّتون على الناتج الذي يفضلون إطلاقه. على تلك اللوحة العامة، يحتل Qw​en3.8-27B المرتبة التاسعة بشكل عام برصيد 1595، وهو النموذج الوحيد في فئة حجمه ضمن العشرة الأوائل.

الموضع هو الجزء المستقل — فهو موجود على لوحة صدارة تابعة لطرف ثالث يمكن لأي شخص فتحها. العنوان الرئيسي حوله منسوب إلى علي بابا: صياغة «النموذج الصغير الوحيد ضمن أفضل 10»، والمواضع المرافقة، جاءت من إعلان Qw​en في 25 أغسطس. وهي تستحق التكرار بهذا التصنيف. يحتل نموذج 27B المرتبة السادسة بعد نموذج Qwen3.8-Max الأكبر بكثير (الذي يضعه الإعلان في المرتبة الثالثة إجمالاً)، ويتقدم بفارق كبير على Gemma 4-31B المماثل في الحجم (الذي يضعه الإعلان نفسه في المرتبة 80). المغزى ليس أن نموذج 27B يتفوق على النماذج الحدودية في بناء تطبيقات الويب؛ بل أن نموذجًا صغيرًا بما يكفي ليعمل على وحدة معالجة رسومية واحدة ضمن أفضل عشرة في ساحة برمجة عمياء يضم باقي أعضائها نماذج أكبر بكثير.

النتيجة المستقلة الثالثة: النموذج المفتوح رقم 1 على Image-to-WebDev في Arena.ai

وصلت النتيجة المستقلة الثالثة في 26 أغسطس، وهي الأقوى حتى الآن لنموذج بهذا الحجم. Image-to-WebDev هي اللوحة الشقيقة لـ WebDev الخاصة بـ Code Arena على Arena.ai — الساحة حيث يُعطى النموذج لقطة شاشة أو مرجعًا بصريًا آخر ويتعين عليه تحويله إلى واجهة ويب عاملة، مع قيام مصوتين بشريين غير مدركين للهوية باختيار المخرجات التي يفضلون إطلاقها. على لوحة الصدارة العامة تلك، يحتل Qw​en3.8-27B المرتبة الأولى بين النماذج مفتوحة المصدر والمرتبة السابعة إجمالاً، مع نتيجة ساحة مُبلَّغ عنها تبلغ 1,574.

الترتيب هو الجزء المستقل — فهو على لوحة صدارة تابعة لجهة خارجية يمكن لأي شخص فتحها. أما العنوان الذي يُحيط بهذا الترتيب فمصدره Alibaba: فقد جاء في إعلان فريق Qwen الصادر في 26 أغسطس أن نموذج 27B «في مستوى نماذج أكبر منه مئة مرة» في هذا الاختبار، وهي مقارنة لا توثّقها لوحة الصدارة. وترتيب التفضيلات ليس حكمًا على جودة الكود — فأصوات Image-to-WebDev تقيس أيّ مخرجات يفضّل الإنسان إطلاقها، لا ما إذا كانت HTML آمنة أو ميسّرة للوصول أو قابلة للصيانة. وما تؤكده النتيجة فعلًا هو أن نموذج 27B مفتوح الأوزان يتصدّر الآن كامل الساحة المفتوحة في تحويل صورة إلى صفحة، وهي المهارة التي تُبنى عليها فئة المنتجات المتنامية «من لقطة الشاشة إلى موقع».

الفجوات الصادقة: أين لا تزال تخسر، وتحفظات المنهجية

مقابل الحدود المتقدمة، الصورة مغرية لكنها ليست من جانب واحد. حيث يتداخل Qwen3.8-27B وClaude Opus 4.6 Max، يفوز Qwen بالأغلبية — SWE-bench Pro وQwenSWEBench وCoWorkBench وLiveCodeBench v6 وOSWorld-Verified وAndroidWorld وIFBench والكتلة البصرية بأكملها. مقابل Muse Glimmer-30B من Meta، المنافس الطبيعي في فئة الحجم المحلي، يفوز في جميع المعايير الثمانية المتداخلة بشكل حاسم. لكنه لا يزال يخسر Terminal-Bench 2.1 (73.0 مقابل 78.2) وGPQA Diamond (89.2 مقابل 91.3) وHumanity's Last Exam (30.8 مقابل 40.0) وNL2Repo-Bench (42.3 مقابل 47.6) أمام Claude Opus 4.6 Max. إذا كانت أعباء العمل لديك هي أصعب استدلال أمامي — رياضيات الحدود، أسئلة متعددة التخصصات بشكل كبير — فإن 27B ليس في ذلك المستوى بعد.

ثلاثة تحفظات قبل أن تقتبس أيًا من هذا. أولًا، جدول بطاقة النموذج أعلاه لا يزال بالكامل كما أبلغت به Alibaba — لا يوجد مؤشر Artificial Analysis لإصدار 27B بعد. أصبحت هناك الآن ثلاث نتائج مستقلة من جهات خارجية، لكن كل واحدة ضيقة النطاق: تصنيف Code Arena يقيس بناء تطبيقات الويب من أوامر نصية، وتصنيف Image-to-WebDev يقيس تحويل لقطة شاشة إلى صفحة قابلة للعمل، وكلاهما يُحكَم بتصويتات عمياء على مخرجات مجهولة المصدر، ودراسة وكيل Harvey القانوني تغطي مجالًا واحدًا بنموذج مخصص للاختبار. لا شيء من هذه هو الأوزان الأصلية للنموذج مع تشغيلها عبر بيئة اختبار عامة. ثانيًا، تستخدم بطاقة النموذج بيئة اختبار Claude Code لكل من SWE-bench Pro وQwenSWEBench ومحكمًا هو GPT-4o لاختبار Humanity's Last Exam — والمقارنات مع نماذج خضعت لتقييمات بطرق أخرى ستغيّر الأرقام. ثالثًا، استخدمت Alibaba في تشغيل MathVision موجهًا ثابتًا بينما حصل المنافسون على أعلى المتغيرين. لا يعني أي من هذا أن النتائج خاطئة؛ بل يعني أنها سقف وليست أرضية، حتى تقوم مختبرات مستقلة بتشغيل النموذج على بيئات اختبار عامة محايدة.

ما الذي يتطلبه تشغيله

Qw​en3.8-27B هو نموذج محلي، وهو ما يغيّر معنى "الأداء": الإنتاجية على أجهزتك الخاصة بدلاً من بطاقة الأسعار. تبلغ أوزان BF16 حوالي 55.6 جيجابايت؛ وعند تكميمها إلى 4 بت تناسب بطاقة ذاكرة 24 جيجابايت مثل RTX 3090 أو 4090. أصدرت AMD دعمًا في اليوم الأول لإطلاق النموذج، وقياساتها الخاصة باستخدام llama.cpp/Vulkan — أغسطس 2026، بمتوسط ثلاث جولات أو أكثر — أظهرت 24.5 رمزًا/ثانية على معالج Ryzen AI Max+ 395 و51.8 رمزًا/ثانية على كرت Radeon AI PRO R9700 بذاكرة 32 جيجابايت، على أنظمة تحتوي على أكثر من 24 جيجابايت تقريبًا من الذاكرة الرسومية المتغيرة أو VRAM. الاختبارات المجتمعية لبناء FP8 على NVIDIA GH200 حافظت على 10 طلبات متزامنة بسياق 262K مع زمن أقل من 10 مللي ثانية حتى أول رمز. الأرقام التي ستحصل عليها ستختلف — فهذه بطاقات رسومية شخصٍ آخر — لكن النمط حقيقي: هذا هو أول إصدار من Qw​en في هذه الفئة يعمل، ليس فقط في مراجعة، على محطة عمل واحدة.

أوزان مجانية، أم واجهة برمجية مدفوعة؟

القرار الذي يفرضه هذا النموذج هو القرار الذي يفصل بين الاستضافة المحلية والاستضافة عبر السحابة: الأوزان لا تكلف شيئًا، لكن وحدات معالجة الرسومات لديك ليست مجانية. الاستضافة الذاتية تعني امتلاك السيليكون — بطاقة واحدة بسعة 24 جيجابايت إذا قبلت التكميم بـ 4 بت وتوليدًا أبطأ، وشيئًا أكبر إذا أردت سياق 262 ألفًا بجودة كاملة. البديل المستضاف على OrcaRouter هو 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج، مع نفس سياق 262 ألف ومدخلات الصور والفيديو، وزمن p50 حتى أول رمز يبلغ 225 مللي ثانية مقيسًا على مدى الأيام السبعة الماضية — لا حاجة لشراء وحدة معالجة رسومات، ولا لمراقبة ذاكرة الفيديو. الحساب هو الحساب الذي تجريه دائمًا مع الأوزان المفتوحة: معدل نقل الرموز الذي تحتاجه فعليًا مضروبًا في تكلفة الرمز الواحد، مقابل السعر الثابت للبطاقة. عند حجم مرتفع ومستمر، تتفوق الاستضافة الذاتية؛ وعند الحجم المتقطع أو المتواضع، يكون دفع 0.33/2.40 دولار أفضل من شراء سيليكون يظل خاملًا معظم الوقت.

A decision card titled Free weights, your own compute — or pay per token. The self-host side lists $0 per token, Apache 2.0 weights, roughly 55.6GB BF16 with 4-bit fitting a 24GB card, 24.5 tokens/s on Ryzen AI Max+ 395 and 51.8 tokens/s on Radeon AI PRO R9700. The hosted-API side lists $0.33 input and $2.40 output per 1M tokens, 262K context with image and video input, and a 225ms p50 first token. A footer reads API price per OrcaRouter Aug 15 2026; throughput per AMD llama.cpp/Vulkan tests.

الخلاصة

Qw​en3.8-27B هو أقوى نموذج مفتوح الأوزان طرحته Alibaba في هذه الفئة الحجمية، وفقًا لأرقام Alibaba الخاصة: الأفضل في جدول المقارنة في البرمجة الوكيلة، واستخدام الكمبيوتر، والاستدلال البصري، مع نافذة سياق تبلغ 262K وأوزان Apache 2.0. القراءة الصحيحة لبطاقة النتائج مشروطة — كل رقم في بطاقة النموذج هو من تقارير البائع، ومخصص لمنهجية اختبار محددة، ولم يتم إعادة إنتاجه بعد، ولا تزال النماذج الحدودية تتفوق في أصعب معايير الاستدلال. إذا كنت تقرر ما إذا كنت ستستضيفه بنفسك أو تستدعيه كواجهة برمجة تطبيقات، فتعامل مع جدول المعايير على أنه الوعد، وأرقام إنتاجية AMD باعتبارها أول قياس مستقل للعتاد، ونتيجة Harvey في المجال القانوني باعتبارها أول إشارة مستقلة على أن قدرات النموذج تصمد خارج منهجيات Alibaba الخاصة، وموضعي مطوري الويب — المركز التاسع إجمالًا في Code Arena's WebDev والمركز الأول بين النماذج المفتوحة في Arena.ai's Image-to-WebDev — باعتبارهما أول تأكيدات مستقلة من لوحات تصنيف البرمجة لتلك القدرة. سنحدّث هذه الصفحة مع نشر المزيد من المختبرات المستقلة نتائجها.