
GLM-5.3 مقابل GLM-5.2: نفس العقل، معايير مضاعفة
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1357 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 231 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
التأطير الذي تقدمه Zhipu AI لترقيتها من GLM-5.2 إلى GLM-5.3 هو التأطير الصادق: الكتاب المدرسي لم يتغير، بل تغيّر تدريب الطالب فقط. يستند GLM-5.3، الذي صدر في 14 أغسطس 2026، إلى نفس قاعدة MoE ذات المعاملات البالغة 743 مليارًا التي استند إليها GLM-5.2، الذي تربّع على صدارة مجال الأوزان المفتوحة في مؤشر Artificial Analysis Intelligence في يونيو. البنية لم تتغير، والبصمة لم تتغير، والتسعير البالغ 1.40 دولار / 4.40 دولار لكل مليون لم يتغير — ومع ذلك، تشير Z.ai إلى أن النموذج المُعاد تدريبه يضاعف أداء سابقه أو يتفوق عليه في العديد من معايير البرمجة والأمان التي ينشرها كلا الإصدارين. وسواء جعل ذلك GLM-5.3 ترقية لا بدّ منها أم مسألة ترقّب، فالأمر يعتمد على مدى ثقتك في نموذج تحسّن بهذا القدر دون تغيير بنيته الخاصة، وما إذا كانت قدرته السيبرانية المستجدة ميزةً تريد أن تكون محجوبة خلف نافذة أمان مدتها أسبوعان.
نفس الدماغ، أُعيد تدريبه
كل ما جعل GLM-5.2 خادمًا عمليًا لا يزال قائمًا: نموذج MoE بحجم 743B مع ما يقارب 40B معاملًا نشطًا، واهتمام IndexShare المتناثر الذي قلل من FLOPs عند سياق 1M، ورخصة MIT، ونافذة سياق 1M، والإنتاجية الرمزية الخفيفة التي قيست بحوالي 145–168 رمزًا في الثانية في ملاحظات مستقلة. يختلف GLM-5.3 في بُعد واحد فقط — ما بعد التدريب. قامت Z.ai بتوسيع مرحلة التعلم بالتعزيز باستخدام أطر IndexShare وSAO وSlime، وأضافت عشرات المرات من بيئات المهام الطويلة الأفق، ووسّعتها من تصحيح الأخطاء البرمجية إلى اكتشاف الثغرات الأمنية وهندسة الأنظمة. والنتيجة نموذج يتصرف بشكل مختلف على نفس العتاد، وهذا هو بالضبط سبب أن سؤال الترقية ليس "هل أحتاج وحدات معالجة رسومية جديدة؟" بل "هل أحتاج سلوكًا جديدًا؟"
دلتا المعيار، في كلا الاتجاهين
إذا قُرئت الأرقام المنشورة من Z.ai كمقارنة قبل/بعد، فإن القفزة هي الأكبر في تاريخ الأوزان المفتوحة. يرتفع مؤشر Terminal-Bench 3.0 — النسخة الأصعب حيث تم تقييم كلاهما — من 4.6 إلى 28.3، أي قفزة ستة أضعاف. ويرتفع DeepSWE v1.1 من 46.2 إلى 66.9، وهو الفرق بين «نموذج مفتوح جيد» و«القدرة على منافسة النماذج المغلقة الرائدة». كما تنتقل مجموعة CLI الفرعية في اختبار Agents' Last Exam من 23.8 إلى 28.5. ويرتفع اكتشاف الثغرات في CyberGym من 77.2 إلى 84.5. ويقفز ExploitBench إلى أكثر من الضعف، من 24.4 إلى 54.4، وترتفع إنتاجية ExploitGym من 29 و39 مهمة مكتملة (ساعتان وست ساعات) إلى 105 و130. وتلخص Z.ai الأمر بأنه تحسن بنحو 50% في البرمجة، ويتوافق شكل هذه المكاسب — المركّز في البرمجة طويلة المدى، وأتمتة الطرفية، والأمن — مع نموذج خضع للتدريب اللاحق فقط: فالمعرفة الخام هي نفسها، ولكن القدرة على تنفيذ عمل متعدد الخطوات فعليًا هي ما تعززت.
Terminal-Bench 3.0 — GLM-5.2 4.6 مقابل GLM-5.3 28.3
• DeepSWE v1.1 — GLM-5.2 46.2 مقابل GLM-5.3 66.9
الامتحان الأخير للوكلاء (CLI) — GLM-5.2 23.8 مقابل GLM-5.3 28.5
• اكتشاف ثغرات CyberGym — GLM-5.2 77.2 مقابل GLM-5.3 84.5
• ExploitBench — GLM-5.2 24.4 مقابل GLM-5.3 54.4


القدرة التي لم يخطط لها أحد
تستحق المكاسب الأمنية فقرة خاصة بها، {{1}}لأن Z.ai تقول إنها لم تكن في الخطة{{/1}}. أضاف فريق ما بعد التدريب بيئات لاكتشاف الثغرات متوقعًا تحسنًا متواضعًا؛ {{2}}لكن النموذج بدأ بدلًا من ذلك في ربط استغلالات كاملة، وهو سلوك ناشئ أجبر Z.ai على حجب الأوزان لنحو أسبوعين لتقوية السلامة{{/2}}. في الاختبارات الواقعية مع فرق الأمن، ساهم {{3}}GLM-5.3{{/3}} في العثور على 2,436 ثغرة عبر 269 مشروعًا، {{4}}1,097 منها متوسطة أو عالية الخطورة{{/4}}، بما في ذلك عيوب ظلت دون اكتشاف لعقود {{5}}في برمجيات منتشرة على نطاق واسع{{/5}}. {{6}}كانت قدرة GLM-5.2 الأمنية بالمعنى العادي{{/6}} — إذ كان يستطيع قراءة الكود بحثًا عن الأخطاء. أما {{7}}GLM-5.3{{/7}} فيمتلكها بمعنى مختلف: {{8}}فهو الشيء الذي تدور حوله نافذة السلامة{{/8}}. وهذا تغيير في النوع، {{9}}لا في الدرجة{{/9}}، وهو أقوى سبب منفرد للتعامل مع {{10}}النموذجين كمنتجين مختلفين رغم القاعدة المشتركة{{/10}}.

تحذير الاتساق
الثقل الموازن لكل رقم من الأرقام المذكورة أعلاه هو أن الاختبارات المبكرة من جهات خارجية تصف GLM-5.3 بأنه غير متسق على نحوٍ لم يكن عليه GLM-5.2. إذ يبلّغ المراجعون المستقلون أن النموذج نفسه يؤدّي في بعض المهام مثل مهندسٍ خارجي بالكاد يجتاز التقييم، بينما يقدّم في مهام أخرى نتائجَ بمستوى احترافي؛ ويعتمد هذا الفارق على مدى وضوح المتطلبات المحددة. وهذا هو بالضبط نمط الفشل الذي قد تتنبأ به لنموذج جاءت مكاسبه بالكامل من تدريب لاحق مكثّف على البيئات: فهو يعمّم انطلاقًا من أشكال المهام التي تدرّب عليها، والمطالبات غير المحددة بدقة تقع خارج نطاق تلك الأشكال. ليست أيٌّ من النتائج المستقلة بصفاء الجداول التي نشرتها Z.ai، ولم يُعَد إنتاج أيٍّ من أرقام Z.ai بشكل مستقل حتى الآن. وفي سياق الإنتاج، يدعو هذا إلى إجراء تقييم صريح على عبء العمل الخاص بك قبل الترحيل — وهو نفس التحذير الذي استوجبه GLM-5.2، لكن الآن مع فجوة أوسع بين أفضل الحالات وأسوأها.
السعر، والوصول، ومسألة الانتظار
الأسعار متطابقة، مما يزيل الاحتكاك المعتاد عند الترقية: كلا النموذجين بسعر 1.40 دولار / 4.40 دولار لكل مليون رمز، مع اشتراط تفعيل وضع التفكير في GLM-5.3. الوصول هو الفرق الحقيقي. يمكن تنزيل GLM-5.2 اليوم بموجب رخصة MIT، واستضافته ذاتيًا على مساحة أقل من تيرابايت بصيغة FP8، واستدعاؤه عبر OrcaRouter بالسعر المعلن دون أي رسوم إضافية — إنه النموذج الذي يمكنك توجيه الحركة إليه الآن، وهو مستقر ومُقيَّم بشكل مستقل. أما GLM-5.3 فيمكن استخدامه الآن عبر ZCode / AutoClaw من Z.ai وخطة GLM للبرمجة، لكن واجهة برمجة التطبيقات العامة والأوزان كلاهما محجوزان لفترة الأمان، وأرقام القياس الخاصة به كلها مقدمة من البائع بانتظار إعادة تشغيلها من جهات خارجية. لذا فإن الإجابة الصادقة على سؤال "هل أنتظر؟" تتكون من جزأين: بالنسبة لحركة الإنتاج التي يجب ألا تتراجع، يبقى GLM-5.2 الرهان الآمن ذو الأوزان المفتوحة اليوم، وبمجرد فتح واجهة برمجة تطبيقات GLM-5.3 ونجاح عمليات التحقق المستقلة، تصبح الخطوة مجرد تغيير مسار، لا إعادة كتابة — فأنت تحتفظ بنفس الإعداد بمفتاح واحد وتغيّر المسار فقط. أما بالنسبة للعمل الاستكشافي وتقييم الأمان، فإن GLM-5.3 يستحق التجربة الآن عبر أدوات Z.ai، مع إدراك أن تقدمه المنشور غير موثق وأن سلوكه أكثر تقلبًا من النموذج الذي يحل محله.
الحكم الصادق
GLM-5.3 هو النموذج الأفضل وفق أرقام Z.ai الخاصة — أفضل بشكل كبير في البرمجة طويلة المدى ومختلف جذريًا في الأمان — وهو مجاني لسير عملك لأن القاعدة والبصمة والسعر لم تتغير. لكن "الأفضل في تقييمات البائع" و"الأفضل في خط أنابيبك" يفصل بينهما أمران يمتلكهما GLM-5.2 بالفعل ولا يمتلكهما GLM-5.3 بعد: إعادة الإنتاج المستقلة وأوزان الشحن. إذا كنت تدير بالفعل GLM-5.2، فإن مسار الترقية هو الأرخص في تاريخ الأوزان مفتوحة المصدر — نفس العتاد، نفس السعر، نفس سطح API، وانتظار أسبوعين للأوزان. القرار أقل ارتباطًا بما إذا كان GLM-5.3 أفضل من GLM-5.2 وأكثر ارتباطًا بما إذا كنت مستعدًا للمراهنة على الإنتاج بنموذج لم يتم تأكيد تحسيناته، وقدرته الأمنية الجديدة، بعد من قبل أي شخص خارج Z.ai.
