بطاقة عنوان رئيسية لمقارنة GLM-5.3 وGLM-5.2، بعنوان فرعي «نفس العقل، مضاعفة المعايير»، مع بطاقتي نموذج تتشاركان كتلة أساس واحدة متصلة من نوع 743B MoE، وسهم ترقية منحنٍ مكتوب عليه «ما بعد التدريب فقط» يشير من GLM-5.2 إلى GLM-5.3.
Guides & Insights

GLM-5.3 مقابل GLM-5.2: نفس العقل، معايير مضاعفة

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

التأطير الذي تقدمه Zhipu AI لترقيتها من G​LM-5.2 إلى G​LM-5.3 هو التأطير الصادق: الكتاب المدرسي لم يتغير، بل تغيّر تدريب الطالب فقط. يستند G​LM-5.3، الذي صدر في 14 أغسطس 2026، إلى نفس قاعدة MoE ذات المعاملات البالغة 743 مليارًا التي استند إليها G​LM-5.2، الذي تربّع على صدارة مجال الأوزان المفتوحة في مؤشر Artificial Analysis Intelligence في يونيو. البنية لم تتغير، والبصمة لم تتغير، والتسعير البالغ 1.40 دولار / 4.40 دولار لكل مليون لم يتغير — ومع ذلك، تشير Z.ai إلى أن النموذج المُعاد تدريبه يضاعف أداء سابقه أو يتفوق عليه في العديد من معايير البرمجة والأمان التي ينشرها كلا الإصدارين. وسواء جعل ذلك G​LM-5.3 ترقية لا بدّ منها أم مسألة ترقّب، فالأمر يعتمد على مدى ثقتك في نموذج تحسّن بهذا القدر دون تغيير بنيته الخاصة، وما إذا كانت قدرته السيبرانية المستجدة ميزةً تريد أن تكون محجوبة خلف نافذة أمان مدتها أسبوعان.

نفس الدماغ، أُعيد تدريبه

كل ما جعل GLM-5.2 خادمًا عمليًا لا يزال قائمًا: نموذج MoE بحجم 743B مع ما يقارب 40B معاملًا نشطًا، واهتمام IndexShare المتناثر الذي قلل من FLOPs عند سياق 1M، ورخصة MIT، ونافذة سياق 1M، والإنتاجية الرمزية الخفيفة التي قيست بحوالي 145–168 رمزًا في الثانية في ملاحظات مستقلة. يختلف GLM-5.3 في بُعد واحد فقط — ما بعد التدريب. قامت Z.ai بتوسيع مرحلة التعلم بالتعزيز باستخدام أطر IndexShare وSAO وSlime، وأضافت عشرات المرات من بيئات المهام الطويلة الأفق، ووسّعتها من تصحيح الأخطاء البرمجية إلى اكتشاف الثغرات الأمنية وهندسة الأنظمة. والنتيجة نموذج يتصرف بشكل مختلف على نفس العتاد، وهذا هو بالضبط سبب أن سؤال الترقية ليس "هل أحتاج وحدات معالجة رسومية جديدة؟" بل "هل أحتاج سلوكًا جديدًا؟"

دلتا المعيار، في كلا الاتجاهين

إذا قُرئت الأرقام المنشورة من Z.ai كمقارنة قبل/بعد، فإن القفزة هي الأكبر في تاريخ الأوزان المفتوحة. يرتفع مؤشر Terminal-Bench 3.0 — النسخة الأصعب حيث تم تقييم كلاهما — من 4.6 إلى 28.3، أي قفزة ستة أضعاف. ويرتفع DeepSWE v1.1 من 46.2 إلى 66.9، وهو الفرق بين «نموذج مفتوح جيد» و«القدرة على منافسة النماذج المغلقة الرائدة». كما تنتقل مجموعة CLI الفرعية في اختبار Agents' Last Exam من 23.8 إلى 28.5. ويرتفع اكتشاف الثغرات في CyberGym من 77.2 إلى 84.5. ويقفز ExploitBench إلى أكثر من الضعف، من 24.4 إلى 54.4، وترتفع إنتاجية ExploitGym من 29 و39 مهمة مكتملة (ساعتان وست ساعات) إلى 105 و130. وتلخص Z.ai الأمر بأنه تحسن بنحو 50% في البرمجة، ويتوافق شكل هذه المكاسب — المركّز في البرمجة طويلة المدى، وأتمتة الطرفية، والأمن — مع نموذج خضع للتدريب اللاحق فقط: فالمعرفة الخام هي نفسها، ولكن القدرة على تنفيذ عمل متعدد الخطوات فعليًا هي ما تعززت.

Terminal-Bench 3.0 — GLM-5.2 4.6 مقابل GLM-5.3 28.3

• DeepSWE v1.1 — GLM-5.2 46.2 مقابل GLM-5.3 66.9

الامتحان الأخير للوكلاء (CLI) — GLM-5.2 23.8 مقابل G​LM-5.3 28.5

• اكتشاف ثغرات CyberGym — GLM-5.2 77.2 مقابل G​LM-5.3 84.5

• ExploitBench — GLM-5.2 24.4 مقابل G​LM-5.3 54.4

The OrcaRouter GLM-5.2 model page showing Z.ai's open-weights flagship with its per-million-token pricing, context window and model ID.Scoreboard contrasting GLM-5.2 (Terminal-Bench 3.0 4.6, DeepSWE v1.1 46.2, Agents' Last Exam CLI 23.8, CyberGym 77.2, ExploitBench 24.4, Price $1.40/$4.40 per M) with GLM-5.3 (Terminal-Bench 3.0 28.3, DeepSWE v1.1 66.9, Agents' Last Exam CLI 28.5, CyberGym 84.5, ExploitBench 54.4, Price $1.40/$4.40 per M).

القدرة التي لم يخطط لها أحد

تستحق المكاسب الأمنية فقرة خاصة بها، {{1}}لأن Z.ai تقول إنها لم تكن في الخطة{{/1}}. أضاف فريق ما بعد التدريب بيئات لاكتشاف الثغرات متوقعًا تحسنًا متواضعًا؛ {{2}}لكن النموذج بدأ بدلًا من ذلك في ربط استغلالات كاملة، وهو سلوك ناشئ أجبر Z.ai على حجب الأوزان لنحو أسبوعين لتقوية السلامة{{/2}}. في الاختبارات الواقعية مع فرق الأمن، ساهم {{3}}G​LM-5.3{{/3}} في العثور على 2,436 ثغرة عبر 269 مشروعًا، {{4}}1,097 منها متوسطة أو عالية الخطورة{{/4}}، بما في ذلك عيوب ظلت دون اكتشاف لعقود {{5}}في برمجيات منتشرة على نطاق واسع{{/5}}. {{6}}كانت قدرة GLM-5.2 الأمنية بالمعنى العادي{{/6}} — إذ كان يستطيع قراءة الكود بحثًا عن الأخطاء. أما {{7}}G​LM-5.3{{/7}} فيمتلكها بمعنى مختلف: {{8}}فهو الشيء الذي تدور حوله نافذة السلامة{{/8}}. وهذا تغيير في النوع، {{9}}لا في الدرجة{{/9}}، وهو أقوى سبب منفرد للتعامل مع {{10}}النموذجين كمنتجين مختلفين رغم القاعدة المشتركة{{/10}}.

Infographic titled 'The upgrade delta' showing a two-column before-and-after comparison of GLM-5.2 vs GLM-5.3 across five benchmarks with upward arrows: Terminal-Bench 3.0 4.6 to 28.3, DeepSWE v1.1 46.2 to 66.9, Agents' Last Exam CLI 23.8 to 28.5, CyberGym 77.2 to 84.5, ExploitBench 24.4 to 54.4.

تحذير الاتساق

الثقل الموازن لكل رقم من الأرقام المذكورة أعلاه هو أن الاختبارات المبكرة من جهات خارجية تصف G​LM-5.3 بأنه غير متسق على نحوٍ لم يكن عليه GLM-5.2. إذ يبلّغ المراجعون المستقلون أن النموذج نفسه يؤدّي في بعض المهام مثل مهندسٍ خارجي بالكاد يجتاز التقييم، بينما يقدّم في مهام أخرى نتائجَ بمستوى احترافي؛ ويعتمد هذا الفارق على مدى وضوح المتطلبات المحددة. وهذا هو بالضبط نمط الفشل الذي قد تتنبأ به لنموذج جاءت مكاسبه بالكامل من تدريب لاحق مكثّف على البيئات: فهو يعمّم انطلاقًا من أشكال المهام التي تدرّب عليها، والمطالبات غير المحددة بدقة تقع خارج نطاق تلك الأشكال. ليست أيٌّ من النتائج المستقلة بصفاء الجداول التي نشرتها Z.ai، ولم يُعَد إنتاج أيٍّ من أرقام Z.ai بشكل مستقل حتى الآن. وفي سياق الإنتاج، يدعو هذا إلى إجراء تقييم صريح على عبء العمل الخاص بك قبل الترحيل — وهو نفس التحذير الذي استوجبه GLM-5.2، لكن الآن مع فجوة أوسع بين أفضل الحالات وأسوأها.

السعر، والوصول، ومسألة الانتظار

الأسعار متطابقة، مما يزيل الاحتكاك المعتاد عند الترقية: كلا النموذجين بسعر 1.40 دولار / 4.40 دولار لكل مليون رمز، مع اشتراط تفعيل وضع التفكير في G​LM-5.3. الوصول هو الفرق الحقيقي. يمكن تنزيل G​LM-5.2 اليوم بموجب رخصة MIT، واستضافته ذاتيًا على مساحة أقل من تيرابايت بصيغة FP8، واستدعاؤه عبر OrcaRouter بالسعر المعلن دون أي رسوم إضافية — إنه النموذج الذي يمكنك توجيه الحركة إليه الآن، وهو مستقر ومُقيَّم بشكل مستقل. أما G​LM-5.3 فيمكن استخدامه الآن عبر ZCode / AutoClaw من Z.ai وخطة G​LM للبرمجة، لكن واجهة برمجة التطبيقات العامة والأوزان كلاهما محجوزان لفترة الأمان، وأرقام القياس الخاصة به كلها مقدمة من البائع بانتظار إعادة تشغيلها من جهات خارجية. لذا فإن الإجابة الصادقة على سؤال "هل أنتظر؟" تتكون من جزأين: بالنسبة لحركة الإنتاج التي يجب ألا تتراجع، يبقى G​LM-5.2 الرهان الآمن ذو الأوزان المفتوحة اليوم، وبمجرد فتح واجهة برمجة تطبيقات G​LM-5.3 ونجاح عمليات التحقق المستقلة، تصبح الخطوة مجرد تغيير مسار، لا إعادة كتابة — فأنت تحتفظ بنفس الإعداد بمفتاح واحد وتغيّر المسار فقط. أما بالنسبة للعمل الاستكشافي وتقييم الأمان، فإن G​LM-5.3 يستحق التجربة الآن عبر أدوات Z.ai، مع إدراك أن تقدمه المنشور غير موثق وأن سلوكه أكثر تقلبًا من النموذج الذي يحل محله.

الحكم الصادق

GLM-5.3 هو النموذج الأفضل وفق أرقام Z.ai الخاصة — أفضل بشكل كبير في البرمجة طويلة المدى ومختلف جذريًا في الأمان — وهو مجاني لسير عملك لأن القاعدة والبصمة والسعر لم تتغير. لكن "الأفضل في تقييمات البائع" و"الأفضل في خط أنابيبك" يفصل بينهما أمران يمتلكهما GLM-5.2 بالفعل ولا يمتلكهما GLM-5.3 بعد: إعادة الإنتاج المستقلة وأوزان الشحن. إذا كنت تدير بالفعل GLM-5.2، فإن مسار الترقية هو الأرخص في تاريخ الأوزان مفتوحة المصدر — نفس العتاد، نفس السعر، نفس سطح API، وانتظار أسبوعين للأوزان. القرار أقل ارتباطًا بما إذا كان GLM-5.3 أفضل من GLM-5.2 وأكثر ارتباطًا بما إذا كنت مستعدًا للمراهنة على الإنتاج بنموذج لم يتم تأكيد تحسيناته، وقدرته الأمنية الجديدة، بعد من قبل أي شخص خارج Z.ai.

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube