Qwen 3.8 مقابل GLM-5.2: أول معيار قياس يتقاطعان فيه فعليًا
Guides & Insights

Qwen 3.8 مقابل GLM-5.2: أول معيار قياس يتقاطعان فيه فعليًا

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

هذان النموذجان هما أوضح تعبير عن رهانين متعاكسين في الذكاء الاصطناعي الصيني مفتوح الأوزان. نموذج Zhipu GLM-5.2 رشيق ومُثبت: إجمالي المعلمات 753B ولا يضم سوى 40B معلمة نشطة، وبلغ مؤشر Artificial Analysis Intelligence Index المُدقق 51، وأوزان قابلة للتنزيل منذ يونيو 2026، وسعر منشور يبلغ $0.95 / $3.00. أما نموذج Alibaba Qwen3.8-Max فهو الرهان الأقصى: ~2.4T من المعلمات، وعدد غير معلن للمعلمات النشطة، و— حتى وقت قريب — لا أرقام على الإطلاق.

أعطى التوفر العام في 3 أغسطس 2026 هذه المواجهة شيئًا لا تملكه أي مقالة أخرى في هذه السلسلة: معيارًا حصل كلا النموذجين فيه على نتيجة. تعلن Alibaba نتيجة Terminal-Bench 2.1 عند 86.6؛ لدى Artificial Analysis نتيجة مدققة لـ GLM-5.2 عند 82.7 في نفس الاختبار. وللمرة الأولى، يمكن وضع ادعاء Qwen بجانب رقم منافس مُقاس بشكل مستقل على أرضية متطابقة — مع ملاحظة مهمة وهي أن واحدًا فقط من الاثنين كان من إنتاج حَكَم.

ملاحظة للمطوّرين — أسرع طريقة لحسم هذا الأمر هي تشغيل كلاهما على استعلاماتك الخاصة. يتيح OrcaRouter الوصول إلى أكثر من 200 نموذج عبر نقطة نهاية واحدة متوافقة مع OpenAI، لذا يمكنك مقارنة Qwen 3.8 Max مع GLM-5.2 في المهمة نفسها دون الحاجة إلى ربط اثنين من حزم SDK.

الحكم باختصار. على المعيار المشترك الوحيد، تدّعي Qwen تقدّمًا بـ3.9 نقطة على Terminal-Bench 2.1 (86.6 مقابل 82.7) — نتيجة حقيقية إذا تكررت، رغم أن رقم Qwen مُعلن ذاتيًا ورقم GLM مُدقّق. في كل شيء آخر، تمتلك GLM-5.2 المزايا العملية: فهي أرخص بنحو مرتين تقريبًا بسعر $0.95 / $3.00 مقابل $2 / $6 لدى Qwen، وأوزانها متاحة للتنزيل اليوم، معاملاتها النشطة البالغة 40B تجعلها قابلة للنشر فعليًا، وتحمل درجة مؤشر مستقل تبلغ 51 بينما لا تمتلك Qwen أي درجة. ترد Qwen بسياق 1M-token بسعر ثابت، وتعدد وسائط أصلي تفتقر إليه GLM، وسقف إمكانات أعلى. لا يزال النموذج الرشيق المُثبت يتفوق على النموذج الضخم غير المُثبت في الإنتاج — لكن الفجوة ضاقت في 3 أغسطس.

النقاط الرئيسية

أول تداخل مباشر في المعايير ضمن السلسلة: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (بإعلان من Alibaba) مقابل GLM-5.2 82.7 (وفقًا لـ Artificial Analysis، مدقّق). يتقدم Qwen بنحو 3.9 نقاط، لكن الرقمين ليسا بنفس الدرجة من الموثوقية.

GLM-5.2 هو تقريبًا نصف السعر: $0.95 / $3.00 لكل 1M (متوسط AA ~$0.90) مقابل سعر Qwen3.8-Max $2 / $6.

المعاملات النشطة هي القصة المعمارية الحقيقية: تشغّل GLM-5.2 40B نشطة من أصل 753B إجمالاً. Alibaba ما زالت لم تكشف عن عدد المعاملات النشطة في Qwen، مما يجعل تكلفة تقديمها غير قابلة للنمذجة.

أوزان GLM قابلة للتنزيل اليوم؛ أما أوزان Qwen فموعودة خلال الأسبوع، دون ترخيص أو مستودع حتى الآن.

GLM-5.2 لديه مؤشر مُدقَّق يبلغ 51. Qwen3.8-Max لا يزال بدون تقييم — رغم أن نسخته السابقة Qwen3.7-Max سجلت 46، أقل من GLM.

عروض Qwen الفريدة: نافذة رموز بسعة 1M تُفوتر بسعر ثابت دون أي رسوم إضافية على الاستعلامات الطويلة، بالإضافة إلى دعم الإدخال الأصلي للنصوص والصور والفيديو، ونتيجة 92.1 على معيار OmniDocBench 1.5. أمّا GLM-5.2 فهو موجّه للنصوص.

ملاحظة بشأن الدقة: جميع أرقام جودة Qwen3.8-Max مُبلَّغ عنها من Alibaba وغير مُتحقَّق منها من قِبل أطراف ثالثة. أرقام GLM-5.2 مصدرها Artificial Analysis. مقارنة نتيجة مُبلَّغة ذاتيًا بنتيجة مُدقَّقة على نفس المعيار مفيدة معلوماتيًا لكنها غير حاسمة — فبيئات اختبار البائع تختلف عن بيئات اختبار المُقيِّم. تسعير Qwen يعتمد بطاقة الأسعار العامة (GA) ويحل محل خصم المعاينة الخاص بشهر يوليو.

المواصفات والسعر، جنبًا إلى جنب

هذه هي البيانات الدقيقة، كل رقم منسوب إلى مصدره.

• الشركة المصنعة / الحالة — Qwen3.8-Max: Alibaba; GA (٣ أغسطس ٢٠٢٦)؛ GLM-5.2: Zhipu؛ صدر في يونيو ٢٠٢٦

• البنية المعمارية — Qwen3.8-Max: إجمالي ~2.4 تريليون، MoE متفرق؛ GLM-5.2: إجمالي 753 مليار، MoE متفرق (Artificial Analysis)

• المعلمات النشطة — Qwen3.8-Max: لم تفصح عنها Alibaba بعد; GLM-5.2: 40B نشطة (Artificial Analysis)

• نافذة السياق — Qwen3.8-Max: 1 مليون رمز، بسعر ثابت (983,616 مع وضع التفكير؛ الحد الأقصى للإخراج 131,072)؛ GLM-5.2: 1 مليون رمز (Artificial Analysis)

Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (وفقًا لإعلان Alibaba)؛ GLM-5.2: 82.7 (وفقًا لتدقيق Artificial Analysis)

• AA Intelligence Index — Qwen3.8-Max: لم يُقيَّم بعد؛ GLM-5.2: 51 (Artificial Analysis)

• درجات أخرى أبلغ عنها البائع — Qwen3.8-Max: GPQA Diamond 92.6، OSWorld-Verified 86.1، FrontierSWE 73.5 (أبلغت عنها Alibaba)؛ GLM-5.2: نتيجتها مقيسة من طرف ثالث

• الأنماط — Qwen3.8-Max: إدخال نص وصورة وفيديو ← إخراج نص؛ GLM-5.2: مركّز على النص

• التسعير (داخل / خارج) — Qwen3.8-Max: $2.00 / $6.00 لكل مليون، سعر ثابت؛ الإدخال المخزن مؤقتًا $0.25؛ GLM-5.2: $0.95 / $3.00 لكل مليون (AA ممزوج ~$0.90)

• أوزان مفتوحة — Qwen3.8-Max: موعودة خلال الأسبوع (لا ترخيص بعد)؛ GLM-5.2: نعم — متاح للتحميل اليوم

شيئان يؤطران هذه المقارنة، وأولهما هو نقطة البيانات الأكثر فائدة في السلسلة بأكملها.

أولاً، إن تداخل Terminal-Bench مفيد حقًا. يقيس Terminal-Bench 2.1 ما إذا كان النموذج قادرًا على تشغيل صدفة حقيقية حتى الاكتمال — تشغيل الأوامر، وقراءة المخرجات، والتعافي من الأخطاء. وهو أقرب مؤشر متاح لـ"هل يمكن أن يعمل هذا كعامل برمجة بدلاً من مقدم اقتراحات برمجية"، وهو المعيار الذي اختار كلا البائعَين الإبلاغ عنه. نتيجة Qwen البالغة 86.6 مقابل 82.7 المُدقَّقة من GLM هي تقدم بـ3.9 نقاط لصالح Qwen.

التحفظ مهم لكن لا ينبغي المبالغة فيه. تختلف أدوات التقييم الخاصة بالموردين وأدوات التقييم الخاصة بالمقيّمين في الهيكلة وسياسة إعادة المحاولة وبناء المطالبات، ويمكن لهذه الخيارات أن تغيّر نتيجة Terminal-Bench بأكثر من أربع نقاط. لذا فإن هذا ليس دليلاً على أن Qwen هو النموذج الوكيل الأفضل. ما يثبته فعليًا هو أن ادعاء Qwen المعلن ذاتيًا يقع في نفس النطاق التنافسي لنموذج مفتوح الوزن من الطراز الأول خضع للتدقيق، بدلاً من أن يكون في منطقة غير معقولة. وهذا موقف أقوى بشكل ملموس من 'غير مُقيَّم'.

ثانيًا، مقارنة البنية المعمارية هي حيث يتفوق GLM بهدوء. يُفعّل GLM-5.2 40 مليار معلمة من أصل 753 مليار. هذا الرقم وحده يخبرك بتكلفة تشغيله، وملف زمن الاستجابة، وأن فريقًا مجهزًا جيدًا يمكنه بالفعل تشغيله. لم تنشر Alibaba بعد عدد المعلمات النشطة لـ Qwen — مما يعني أنه على الرغم من كل ما يلمح إليه الرقم الرئيسي 2.4T، لا يمكن لأي شخص خارج Alibaba تقدير تكلفة تشغيل Qwen3.8-Max أو كيف سيتصرف عند الاستضافة الذاتية. في مقارنة خليط الخبراء، ليس هذا مجرد حاشية؛ بل هو الرقم المفقود الأكثر أهمية.

رشيق ومُثبت مقابل ضخم وغير مُتحقق منه

حالة GLM-5.2 مبنية على موقف هندسي متماسك: افعل المزيد بموارد أقل، انشر الأرقام، ووفّر الأوزان. نموذج نشط بحجم 40B رخيص في التشغيل، سريع بطبيعته البنيوية، ويمكن نشره بواسطة فريق يملك ميزانية GPU جادة ولكنها ليست سخيفة. مؤشره المدقق البالغ 51 ونتيجته المدققة في Terminal-Bench البالغة 82.7 تعنيان أن المشتري لا يعتمد على الثقة العمياء. وبسعر 0.95$ / 3.00$، فهو تقريبًا نصف سعر Qwen.

حالة Qwen3.8-Max هي رهان معاكس: قم ببناء أكبر نموذج يمكنك ودع القدرة تبرر التكلفة. لقد جعلت GA هذه الحالة أقوى بكثير مما كانت عليه، لأن هناك أخيرًا أرقامًا مرفقة — GPQA Diamond 92.6 في العلوم العليا، OSWorld-Verified 86.1 في تشغيل الواجهة الرسومية، FrontierSWE 73.5 مقابل 40.7 لسابقتها، وTerminal-Bench 86.6 المذكورة أعلاه. هذه أرقام على مستوى الطليعة، والزيادة التي تقارب الضعف على FrontierSWE هي نوع من القفزة الجيلية التي يصعب تزييفها بالكامل.

لكن تبقى فجوتان، وهما نفس الفجوتين اللتين كانتا مهمتين في يوليو. هناك لا نتيجة تقييم مستقلة — فمنصتا Artificial Analysis وLMArena لا تزالان غير مُقيَّمتين على Qwen3.8-Max، لذا فإن كل ادعاء بالجودة هو ادعاء من علي بابا. وهناك لا ترخيص، لذا لا يمكن بعدُ تقييم وعد الأوزان المفتوحة تجاريًا.

المرجعية التاريخية تقف ضد Qwen هنا أكثر من معظم المواجهات: سابقه Qwen3.7-Max سجّل46 على مؤشر AA، أقل من درجة GLM-5.2 البالغة 51. إذن ادعاء Alibaba الضمني ليس فقط أن Qwen3.8-Max جيد، بل أنه قفز من أسفل GLM إلى أعلى منه بوضوح في جيل واحد. تحسن FrontierSWE يمنح ذلك بعض المصداقية. نتيجة مستقلة ستحسم الأمر.

التكلفة عمليًا: أين تستقر 2×

لنأخذ خط أنابيب برمجة وكيلية: 180,000 رمزًا من سياق المستودع، و10,000 رمزًا من المخرجات لكل تشغيل.

GLM-5.2: 0.18M × $0.95 = $0.171، زائد 0.01M × $3.00 = $0.03. ≈ $0.20 لكل تشغيل.

Qwen3.8-Max: 0.18M × $2 = $0.36، زائد 0.01M × $6 = $0.06. ≈ 0.42$ لكل تشغيلة.

• عند 3,000 عملية/يوم: GLM ≈ $603/يوم؛ Qwen ≈ $1,260/يوم — بفارق يقارب $20,000/شهريًا.

• مع إدخال Qwen المخزَّن مؤقتًا بسعر $0.25/1M على مستودع مستقر، ينخفض تشغيله إلى ≈ $0.11، وهو ما يقلّ فعليًا عن تكلفة GLM غير المخزَّنة مؤقتًا.

ذلك السطر الأخير هو أكثر ما يفيد عمليًا في هذه المقارنة. السعر المعلن لـ Qwen يبلغ ضعف سعر GLM، لكن معدل إصابة ذاكرة التخزين المؤقت لديه البالغ $0.25 لكل 1M تنافسي بما يكفي لقلب الترتيب في خط أنابيب مُخزَّن جيدًا. إذا كان وكيلك يعيد قراءة سياق شبه ثابت في كل دورة — وهو ما ينطبق على معظم وكلاء البرمجة — فقد يكون Qwen الخيار الأرخص عمليًا رغم بطاقة الأسعار الأقل جاذبية. أما الفرق التي لا تُهيئ التخزين المؤقت فستدفع الضعف دون أي فائدة.

كلا النموذجين يحسبان رموز التفكير كمخرجات، لذا فإن التكوينات الثقيلة في الاستدلال تكلف أكثر من هذه التقديرات على كلا الجانبين.

قابلية النشر: المحور الذي يمتلكه GLM

كلا النموذجين صينيان مفتوحا الأوزان من نوع MoE مع ادعاءات بسياق مليون توكن، مما يجعل قابلية النشر هي الفجوة العملية الأكثر حدة.

أوزان GLM-5.2 قابلة للتنزيل منذ يونيو، وبـ 40B نشطة فهي هدف واقعي للاستضافة الذاتية — قابلة للقياس الكمي، وقابلة للخدمة على عدد معقول من وحدات GPU، وتم اختبارها بالفعل من قبل المجتمع.

أوزان Qwen3.8-Max من المقرر توفيرها خلال هذا الأسبوع، لكن النموذج الرائد ليس هدفًا واقعيًا لأي شخص: تقريبًا 1.2 تيرابايت بدقة 4 بت مقابل حوالي 141 جيجابايت لكل H200 يعني ثمانية أو أكثر من المسرعات عالية الأداء، وعدد المعاملات النشطة غير المعلن يجعل الإنتاجية الناتجة مستحيلة التوقع. أضف إلى ذلك الترخيص المفقود، فاستضافة النموذج الرائد ذاتيًا ليست خطة في الوقت الحالي.

المُعلَن عنه في نفس الوقت Qwen3.8-27B هو الجواب الحقيقي من Alibaba على هذا المحور. كما أنه يُطرح بأوزان مفتوحة ويُقال إنه يعمل بحوالي 17 جيجابايت من ذاكرة الفيديو — وهي بطاقة واحدة من الفئة العليا، أقل بكثير من متطلبات GLM-5.2 — فهو ينافس مباشرة على قابلية النشر. إذا كان اهتمامك بأي من النموذجين هو تشغيله بنفسك، فإن المقارنة بين Qwen 27B وGLM-5.2 هي التي ستهم فعلاً، وهي معركة أقرب بكثير من 2.4T مقابل 753B.

الأسئلة الشائعة

هل Qwen 3.8 أفضل من GLM-5.2؟

في المعيار الوحيد الذي يتقاسمانه، تدّعي Qwen التفوق — Terminal-Bench 2.1 بنتيجة 86.6 مقابل 82.7 المُدقَّقة لدى GLM. لكن رقم Qwen مُعلن ذاتيًا بينما قياس GLM تم بواسطة Artificial Analysis، وقد تتجاوز فروق الأدوات فجوة الأربع نقاط. كما تحتفظ GLM-5.2 بمؤشر مُدقَّق يبلغ 51 في حين لا تملك Qwen أي نتيجة مستقلة على الإطلاق. GLM هي الخيار الأكثر أمانًا؛ أما Qwen فلديها السقف الأعلى غير المُتحقَّق منه.

كيف يمكن المقارنة بينها على Terminal-Bench 2.1؟

يُبلغ Qwen3.8-Max عن 86.6؛ وقاست Artificial Analysis نموذج GLM-5.2 عند 82.7. وهذا تقدّم اسمي بمقدار 3.9 نقطة لصالح Qwen، وأول تداخل بينهما على نفس المعيار. اعتبرها دليلاً على أن Qwen منافس في تلك الفئة وليس إثباتًا لتقدمه، لأن رقم GLM فقط هو من أُنتج بشكل مستقل.

أيهما أرخص؟

GLM-5.2 على بطاقة الأسعار — 0.95 دولار / 3.00 دولار لكل 1M (المزيج AA حوالي 0.90 دولار) مقابل 2 دولار / 6 دولار لدى Qwen، أي النصف تقريبًا. لكن سعر الإدخال المخزَّن لدى Qwen عند 0.25 دولار لكل 1M تنافسي بما يكفي لدرجة أن خط أنابيب يعتمد بكثافة على التخزين المؤقت قد ينتهي به الأمر أرخص على Qwen منه على GLM بدون تخزين مؤقت.

I'm sorry, but I don't have specific information about "Qwen 3.8 Max." The Qwen models I'm aware of include Qwen2.5, Qwen3, and Qwen3-Max, but I don't have reliable details on a "3.8 Max" variant. Official parameter counts (such as active parameters in MoE architectures) are typically disclosed by Alibaba in their technical reports or official announcements. I'd recommend checking Alibaba's official Qwen documentation or release notes for the most accurate and up-to-date information.

لم تنشر Alibaba هذا الرقم أبدًا، حتى عند الإتاحة العامة. هذا هو الرقم الذي يحدد تكلفة التقديم وزمن الاستجابة في نموذج Mixture-of-Experts، لذا فإن غيابه يمثل فجوة حقيقية. على النقيض من ذلك، فإن GLM-5.2 موثق بـ 40B نشط من أصل 753B إجمالي.

أي منها يمكنني استضافته ذاتيًا فعليًا؟

GLM-5.2 اليوم — الأوزان متاحة، و40B النشطة تجعلها قابلة للتشغيل. أوزان Qwen3.8-Max موعودة خلال الأسبوع، لكن النموذج الرئيسي يحتاج إلى ثمانية أو أكثر من وحدات معالجة الرسوميات من فئة H200-class بسعة ~1.2TB بدقة 4-bit، دون نشر ترخيص بعد. النموذج Qwen3.8-27B الذي أُعلن عنه بالتزامن، والذي يُقال إنه يستهلك ~17GB من VRAM، هو خيار Qwen القابل للنشر والأقرب إلى مجال GLM.

هل خرج Qwen 3.8 Max من مرحلة المعاينة؟

نعم، في 3 أغسطس 2026، مع بطاقة أسعار منشورة ونقطة نهاية متوافقة مع OpenAI وDashScope. حملة اعتمادات Qoder بخصم 90% لشهر يوليو لم تعد تصف كيفية بيعها.

ما الذي تقدمه Qwen ولا يقدمه GLM-5.2؟

تعدد الوسائط الأصلي — إدخال الصور والفيديو، مع نتيجة 92.1 في OmniDocBench مُعلن عنها ذاتيًا لتحليل المستندات — وسياق بسعة مليون رمز يُفوتر بمعدل ثابت دون رسوم إضافية للمطالبات الطويلة. GLM-5.2 مركّز على النصوص، لذا بالنسبة لخطوط معالجة المستندات أو لقطات الشاشة أو الفيديو، فإن Qwen لا تنافسه بقدر ما تقوم بأمر مختلف.

الخلاصة

Qwen 3.8 مقابل GLM-5.2 هي المواجهة التي قدّم الإتاحة العامة فيها أكثر المعلومات الجديدة أصالةً. لأول مرة، يحصل Qwen على نتيجة في معيار (benchmark) قام مُقيّم مستقل بتشغيله أيضًا، ويحتل مرتبة أعلى من GLM على Terminal-Bench 2.1 بنتيجة 86.6 مقابل 82.7. وهذا ينقل Qwen من "دون نتيجة" إلى "منافس بشكل معقول على أرضية مُقاسة"، وهو تقدّم حقيقي حتى مع مراعاة التحفّظ المتعلّق بالنتائج المُبلَّغة ذاتيًا.

لكن GLM-5.2 يحتفظ بالتاج العملي، ويفعل ذلك عبر نقاط قوة غير برّاقة: نصف السعر، ومؤشر مدقَّق يبلغ 51، و40 مليار معامل نشط تجعل اقتصادياته قابلة للتنبؤ ونشره قابلاً للتحقيق، وأوزان يمكنك تنزيلها الآن. إجابات Qwen — سياق مليون رمز بسعر ثابت، وتعدد الوسائط الأصلي، وسقف أعلى — ذات مغزى لكنها مشروطة، وثغرتا يوليو لديه لم تتغيرا: لا نتيجة مستقلة ولا ترخيص. راقب ثلاثة أمور: أول نتيجة مستقلة في Intelligence Index لـ Qwen3.8-Max، وما إذا كان أحد المقيّمين يعيد إنتاج رقم 86.6 في Terminal-Bench، وإصدار Qwen3.8-27B، حيث ستتصادم هاتان الفلسفتان حقًا. حتى ذلك الحين، GLM-5.2 هو ما تشحنه وQwen3.8-Max هو ما تقيّمه — مع تفعيل التخزين المؤقت.

مقارنات في هذه المقالة3

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا