
معايير Qwen3.8-27B: الجدول الكامل، مع التحفظات المرفقة
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
Qwen3.8-27B يحقق درجة 73.0 في Terminal-Bench 2.1، و61.7 في SWE-bench Pro، و90.3 في LiveCodeBench v6، و84.3 في OSWorld-Verified — وكل واحدة من هذه الأرقام هي من اختبارات Alibaba ذاتها. النموذج مفتوح الأوزان الذي يضم 27 مليار معامل صدر على Hugging Face في 14 أغسطس 2026 بموجب ترخيص Apache 2.0، وحتى 15 أغسطس لم يقم أي جهة خارج Alibaba بتقييم جودته بشكل مستقل. تقدم هذه الصفحة الملخص الكامل الموثّق بالمصادر: جميع المعايير الرسمية البالغ عددها 25 من بطاقة النموذج، وما الذي تغيّر مقارنةً بسلفه Qwen3.6-27B، وما الذي قاسه اختبار إنتاجية مستقل من AMD، وأي الادعاءات يجب التعامل معها كأولية.
دليل قراءة قبل الأرقام: "الرسمي" هنا يعني تقييم Alibaba المطبوع على بطاقة النموذج في Qwen/Qwen3.8-27B. وهو مُبلَّغ من البائع ولم يُعاد إنتاجه. "المستقل" يعني أن شخصًا من خارج المختبر قام بقياسه — حتى الآن ينطبق ذلك على إنتاجية العتاد فقط، وليس على أي درجة جودة. المعايير التي يهم فيها إطار التشغيل مُشار إليها داخل النص.
النموذج، سطر واحد لكل مواصفة
• 27B معاملات كثيفة (28B عند احتساب مشفّر الرؤية)، 64 طبقة، حجم مخفي 5120.
هجين الانتباه — 48 طبقة انتباه خطي من نوع Gated DeltaNet بالإضافة إلى 16 طبقة انتباه كامل، بنسبة 3:1 — وهو ما يجعل تشغيل نافذة من 262 ألف رمز (token) ميسور التكلفة.
• سياق أصلي يبلغ 262,144 رمزًا، قابل للتوسيع إلى 1,000,000 مع تحجيم YaRN.
• إدخال الصور والفيديو الأصلي (إخراج نصي)، أوزان Apache 2.0، حوالي 55.6 جيجابايت بصيغة BF16.
النسخة المختصرة: هذا هو النموذج المصمَّم ليأخذ ما تعلّمته علي بابا من بناء نموذج Qwen3.8-Max ذي المعاملات البالغة 2.4 تريليون، ويضغطه في شيء يمكن لوحدة معالجة رسومية واحدة تشغيله.
بطاقة الأداء: كل معيار على بطاقة النموذج
جميع النتائج أدناه مأخوذة من بطاقة نموذج Alibaba الصادرة في 14 أغسطس، مع نتيجة Qwen3.6-27B التي يستبدلها النموذج بين قوسين.
البرمجة. Terminal-Bench 2.1 (برمجة الطرفية عبر الوكلاء) 73.0 (63.4)؛ SWE-bench Pro 61.7 (53.5)؛ QwenSWEBench 79.0 (49.3)؛ DeepSWE 1.1 42.2 (13.3)؛ NL2Repo-Bench 42.3 (36.2)؛ LiveCodeBench v6 90.3 (83.9). استخدمت عمليات تشغيل SWE-bench Pro وQwenSWEBench منصة Claude Code، وفقًا لحاشية بطاقة النموذج — يجدر أخذ ذلك في الاعتبار قبل مقارنتها بنموذج تم تقييمه على منصة مختلفة.
وكلاء طويلي الأفق والعمل المكتبي. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / النتيجة 42.9 (10.6 / 27.3).
الاستدلال والمعرفة. GPQA Diamond 89.2 (87.8)؛ Humanity's Last Exam 30.8 (24.0)؛ IFBench اتباع التعليمات 79.5 (69.1). يتم تقييم HLE بواسطة GPT-4o، وفقًا للبطاقة.
الرؤية واستخدام الكمبيوتر. OSWorld-Verified 84.3 (63.9)؛ WebArena-Verified 64.8 (48.8)؛ AndroidWorld 81.9 (70.3)؛ MathVision 94.6 مع CI / 90.0 بدون (85.1)؛ BabyVision 85.6 مع CI / 65.7 بدون (28.9)؛ OmniDocBench 1.5 91.1 (89.4)؛ RealWorldQA 85.9 (84.1). "CI" هو تحسين وقت الاستدلال من Alibaba؛ الفجوة بين حالتَي تشغيله وإيقافه هي الرقم الأكثر دلالة على البطاقة حول مقدار النقاط التي يمكنك شراؤها بقدرة استدلال إضافية.

ما الذي تغيّر فعليًا مقارنةً بـ Qwen3.6-27B
كل معيار على البطاقة ارتفع، لكن الفروقات ليست موحّدة — وشكل التحسّن هو القصة. المكاسب تتركّز في البرمجة الوكيلة واستخدام الحاسوب، وليس في استرجاع المعرفة:
• DeepSWE 1.1 (البرمجة بالوكلاء) من 13.3 إلى 42.2، أي قفزة تقريبًا بمقدار 3 أضعاف
• QwenSWEBench 49.3 ← 79.0
• درجة Agents' Last Exam من 27.3 إلى 42.9
• OSWorld-Verified 63.9 ← 84.3 وAndroidWorld 70.3 ← 81.9
• BabyVision (مع CI) من 28.9 إلى 85.6 — أكبر مكسب نسبي على البطاقة
في هذه الأثناء، انتقل GPQA Diamond من 87.8 إلى 89.2 وRealWorldQA من 84.1 إلى 85.9: تحسّن حقيقي لكنه طفيف. هذا ليس إصدارًا "أكثر ذكاءً في كل شيء". إنه إصدار يستهدف بشكل مباشر الوكلاء الذين يقرؤون الشاشات، ويستخدمون الأدوات، ويكتبون التعليمات البرمجية عبر خطوات متعددة.

الفجوات الصادقة: أين لا تزال تخسر، وتحفظات المنهجية
في مواجهة الحدود المتقدمة، الصورة مبهجة لكنها ليست منحازة. حيث يتداخل Qwen3.8-27B مع Claude Opus 4.6 Max، يفوز Qwen في الأغلبية — SWE-bench Pro، QwenSWEBench، CoWorkBench، LiveCodeBench v6، OSWorld-Verified، AndroidWorld، IFBench، وكتلة الرؤية بأكملها. وفي مواجهة Muse Glimmer-30B من Meta، المنافس الطبيعي في الفئة المحلية، يفوز في جميع المقاييس الثمانية المتداخلة بشكل قاطع. لكنه لا يزال يخسر Terminal-Bench 2.1 (73.0 مقابل 78.2)، وGPQA Diamond (89.2 مقابل 91.3)، وHumanity's Last Exam (30.8 مقابل 40.0)، وNL2Repo-Bench (42.3 مقابل 47.6) أمام Claude Opus 4.6 Max. إذا كان عبء عملك هو أصعب التفكير الحدودي — الرياضيات الحدودية، أسئلة متعددة التخصصات بشكل كبير — فإن 27B لم يصل إلى هناك بعد.
ثلاثة تحذيرات قبل أن تقتبس أيًا من هذا. أولًا، لا شيء منه تم التحقق منه بشكل مستقل؛ لا يوجد مؤشر Artificial Analysis ولا تشغيل LMArena للنسخة 27B حتى 15 أغسطس، وأدوات الاختبار الخاصة بشركة Alibaba ليست هي التي سيستخدمها أطراف ثالثة. ثانيًا، بطاقة النموذج تستخدم بيئة Claude Code لاختبار SWE-bench Pro وQwenSWEBench وحكم GPT-4o لامتحان Humanity's Last Exam — المقارنات مع نماذج تم تقييمها على إعدادات أخرى ستغيّر الأرقام. ثالثًا، تشغيل MathVision من Alibaba استخدم موجهًا ثابتًا بينما حصل المنافسون على أعلى نوعين مختلفين. لا يعني أي من هذا أن النتائج خاطئة؛ بل يعني أنها سقف وليس أرضية، حتى يقوم شخص آخر بتشغيل النموذج.
ما الذي يتطلبه تشغيله
Qwen3.8-27B هو نموذج محلي، وهو ما يغير معنى «الأداء»: الإنتاجية على عتادك الخاص بدلاً من بطاقة أسعار. تبلغ أوزان BF16 حوالي 55.6 جيجابايت؛ وعند تكميمها إلى 4 بت تناسب بطاقة بسعة 24 جيجابايت مثل RTX 3090 أو 4090. أصدرت AMD دعم Day-0 في يوم الإطلاق، وقد وضعت قياساتها الخاصة لـ llama.cpp/Vulkan — أغسطس 2026، بمتوسط ثلاث عمليات تشغيل أو أكثر — النموذج عند 24.5 رمزًا/ثانية على Ryzen AI Max+ 395 و51.8 رمزًا/ثانية على Radeon AI PRO R9700 بسعة 32 جيجابايت، على أنظمة تحتوي على أكثر من 24 جيجابايت تقريبًا من الذاكرة الرسومية المتغيرة أو VRAM. اختبارات المجتمع لبناء FP8 على NVIDIA GH200 استوعبت 10 طلبات متزامنة بسياق 262K مع زمن وصول للرمز الأول أقل من 10 مللي ثانية. أرقامك الخاصة ستختلف — فهذه بطاقات رسومية لشخص آخر — لكن الصورة حقيقية: هذا هو أول إصدار من Qwen في هذه الفئة يعمل، وليس فقط في مراجعة، على محطة عمل واحدة.
أوزان مجانية، أم واجهة برمجية مدفوعة؟
القرار الذي يفرضه هذا النموذج هو القرار الذي يفصل بين الاستضافة المحلية والاستضافة عبر السحابة: الأوزان لا تكلف شيئًا، لكن وحدات معالجة الرسومات لديك ليست مجانية. الاستضافة الذاتية تعني امتلاك السيليكون — بطاقة واحدة بسعة 24 جيجابايت إذا قبلت التكميم بـ 4 بت وتوليدًا أبطأ، وشيئًا أكبر إذا أردت سياق 262 ألفًا بجودة كاملة. البديل المستضاف على OrcaRouter هو 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج، مع نفس سياق 262 ألف ومدخلات الصور والفيديو، وزمن p50 حتى أول رمز يبلغ 225 مللي ثانية مقيسًا على مدى الأيام السبعة الماضية — لا حاجة لشراء وحدة معالجة رسومات، ولا لمراقبة ذاكرة الفيديو. الحساب هو الحساب الذي تجريه دائمًا مع الأوزان المفتوحة: معدل نقل الرموز الذي تحتاجه فعليًا مضروبًا في تكلفة الرمز الواحد، مقابل السعر الثابت للبطاقة. عند حجم مرتفع ومستمر، تتفوق الاستضافة الذاتية؛ وعند الحجم المتقطع أو المتواضع، يكون دفع 0.33/2.40 دولار أفضل من شراء سيليكون يظل خاملًا معظم الوقت.

خلاصة القول
Qwen3.8-27B هو أقوى نموذج مفتوح الأوزان طرحته Alibaba في هذه الفئة الحجمية، وفقًا لأرقام Alibaba الخاصة: الأفضل في الجدول في البرمجة الوكيلة، واستخدام الحاسوب، والاستدلال البصري، مع نافذة سياق تبلغ 262K وأوزان مرخصة بموجب Apache 2.0. القراءة الصحيحة لبطاقة النتائج مشروطة — فكل رقم مذكور من قِبل البائع، ومحدد ببيئة الاختبار، ولم يُستنسخ بعد، ولا تزال النماذج الحدودية تتفوق في أصعب معايير الاستدلال. إذا كنت تزن خيارك بين استضافته ذاتيًا أو استدعائه كواجهة برمجية، فتعامل مع جدول المعايير على أنه الوعد، بينما أرقام إنتاجية AMD هي القياس المستقل الوحيد المتاح اليوم. سنحدّث هذه الصفحة في اليوم الذي ينشر فيه مختبر مستقل نتيجة.
