بطاقة عنوان للمقارنة بين GLM-5.3 وKimi K3: مكعب أصغر على اليسار يحمل اسم GLM-5.3 مع تسمية «قاعدة 743B مُدرَّبة لاحقًا»، ومكعب أكبر على اليمين يحمل اسم Kimi K3 مع تسمية «قاعدة 2.8T مبنية من الصفر».
Guides & Insights

GLM-5.3 مقابل Kimi K3: استغلال نموذج أساسي بحجم 743B أم بناء نموذج بحجم 2.8T — أي رهان سيؤتي ثماره؟

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

السباق الصيني للأوزان المفتوحة انقسم لتوّه إلى إجابتين على السؤال نفسه. بنت Moonshot AIKimi K3من الصفر — قاعدة مزيج خبراء بمعاملات تبلغ 2.8 تريليون، وهي أكبر نموذج مفتوح الأوزان يُطرح على الإطلاق، أُعلن في 16 يوليو 2026 وتلاه نشر الأوزان في 27 يوليو.G​LM-5.3هو الرهان المعاكس: أبقى Z.ai على القاعدة نفسها البالغة 743 مليار معامل التي شغّلت GLM-5.2، وأنفق دورة الإصدار بأكملها على التدريب اللاحق، محتجًا بأن سقف ذكاء النموذج الأساسي لم يكن يومًا هو المشكلة. كلاهما نموذجان رائدان بسياق مليون رمز، ومركّزان على البرمجة والعوامل (agents)، وكلاهما يدّعي أنه أفضل نموذج برمجة مفتوح في السوق. لا يمكن أن يكون كلاهما الطريقة المثلى لإنفاق الميزانية نفسها، والمقاييس تنقسم فعلًا في المنتصف — ما يجعل هذه المسألة استفتاءً على كيفية بناء نموذج الحدود القادم أكثر منها مقارنةً مباشرة.

رهانان على كيفية بناء نموذج متطور

تطلق Z.ai على GLM-5.3 وصف «التنقيب العميق» وليس ترقية جيلية. الأساس هو نفسه بايتًا ببايت نموذج 743B الموجود في GLM-5.2؛ والفارق كليًا في مرحلة ما بعد التدريب، عبر إطار العمل مفتوح المصدر slime على مهام تمتد عبر جلسات هندسية كاملة — تشخيص وإصلاح وتحقق وإصدار عبر مجموعات خوادم حقيقية وأنظمة تخزين وقواعد أكواد، بعضها يستغرق عدة أيام من عمل مهندس أول. المكاسب التي أعلنتها الشركة كبيرة: قفزة بنسبة 50% في معيار Code Bench الخاص بها، وTerminal-Bench 3.0 من 4.6 إلى 28.3، وDeepSWE v1.1 من 46.2 إلى 66.9، وقدرة سيبرانية فرضت مراجعة أمنية قبل شحن الأوزان. أما Moonshot فسارت في الاتجاه المعاكس. Kimi K3 أساس جديد كليًا — 2.8T من المعلمات الإجمالية مع نحو 104B نشطة لكل رمز (16 من 896 خبيرًا)، ومعمارية Kimi Delta Attention، وإدخال أصلي للصور والفيديو، وتفكير دائم التشغيل لا يمكن إيقافه، ونافذة سياق تبلغ 1M للإدخال والإخراج معًا. فبينما تراهن Z.ai على أن المزيد من النموذج نفسه يكفي، تراهن Moonshot على أن الأساس نفسه كان هو السقف.

The Z.ai research blog post announcing GLM-5.3, dated August 14 2026, titled GLM-5.3: Frontier Coding with Emergent Cyber Capabilities, with a Coding Plan / Code with ZCode call to action and a HuggingFace (Coming Soon) button.

المواجهة المباشرة، مع إرفاق المصدر

المكان الوحيد الذي يظهر فيه كلا النموذجين في الصفحة نفسها هو جدول الإطلاق الخاص بـ Z.ai، لذا فمن هناك تأتي الأرقام جنبًا إلى جنب — مُصنَّفة على أنها مُبلَّغ عنها من البائع، وليست مدقَّقة بشكل مستقل. تتوافق أرقام Kimi K3 المستقلة مع ما نشرته Moonshot في يوليو وما تقيسه Artificial Analysis، لكن لا يوجد مختبر محايد اختبر كليهما بعد.

Terminal-Bench 3.0 — G​LM-5.3 عند 28.3 مقابل Kimi K3 عند 17.4 (جدول Z.ai). أكبر فجوة برمجية في المواجهة، في أحدث وأصعب إصدار.

Terminal-Bench 2.1 — G​LM-5.3 عند 88.2 مقابل Kimi K3 عند 88.3. تعادل.

DeepSWE v1.1 — G​LM-5.3 عند 66.9 مقابل Kimi K3 عند 67.5. Kimi بفارق ضئيل.

SWE-Marathon v1.1 — G​LM-5.3 بـ 42.5 مقابل Kimi K3 بـ 48.1. أفضل فوز برمجي لـ Kimi.

ExploitGym — G​LM-5.3 بنتيجة 105/130 مقابل Kimi K3 بنتيجة 36/70. اكتساح شبه كامل لـ G​LM.

GDPval-AA v2 (العمل المعرفي) — G​LM-5.3 بـ 1,769 مقابل Kimi K3 بـ 1,682.

الوصول — GLM-5.3: اشتراك خطة البرمجة، الأوزان مقيدة حتى حوالي 28 أغسطس. Kimi K3: واجهة برمجة التطبيقات (API) متاحة بسعر $3 / $15، الأوزان قابلة للتنزيل منذ 27 يوليو.

A comparison scoreboard for GLM-5.3 and Kimi K3: GLM-5.3 shows Terminal-Bench 3.0 of 28.3, Terminal-Bench 2.1 of 88.2, DeepSWE v1.1 of 66.9, ExploitGym of 105/130, GDPval-AA v2 of 1,769 and weights around August 28, versus Kimi K3s 17.4, 88.3, 67.5, 36/70, 1,682, weights live since July 27 and $3/$15 API pricing.

الخندق الأمني هو الفصل الحقيقي

عندما نُجرّد معايير البرمجة جانبًا، يكون الفارق الحاسم في الأمن السيبراني. يسجّل G​LM-5.3 84.5 على CyberGym مقابل 80.0 لـ Kimi K3، ونتيجة ExploitBench الخاصة به البالغة 54.4 تكاد تضاعف نتيجة Kimi K3 البالغة 32.2. على ExploitGym، الفجوة ليست مجرد اختلاف، بل هي فئة مختلفة تمامًا — 105 و130 مقابل 36 و70 عبر جولتي الساعتين والست ساعات. لهذا السبب يبدو الإطلاقان مختلفين جدًا في الممارسة العملية: أوزان Kimi K3 متاحة علنًا بموجب رخصة Modified MIT، بينما تُحتجز أوزان G​LM-5.3 من أجل تحصين السلامة، وتحديدًا لأن Z.ai تقول إن النموذج بارع بما يكفي في اكتشاف العيوب واستغلالها لدرجة أن إصدار الأوزان فورًا بدا غير مسؤول. إذا كان عملك يتضمن مراجعة كود شخص آخر، أو الدفاع عن كودك ضد البحث الآلي عن الثغرات، فهذا هو السطر الأكثر صلة على الإطلاق في المقارنة كلها — وهو أيضًا الأقل تحققًا بشكل مستقل.

حيث يرد كيمي K3

تتركز انتصارات Kimi K3 في المجال الذي يكون فيه G​LM-5.3 أضعف: العمل طويل الأمد على المستودعات البرمجية. تحتفظ بالأفضلية على DeepSWE وSWE-Marathon، وتتصدر في Toolathlon Verified، كما أن نافذة الإخراج التي تتسع لمليون توكن تتيح لها كتابة قاعدة برمجية كاملة أو تتبعًا طويلًا لوكيل في مسار واحد. كما أن تفكيرها الدائم يبث السجل الكامل إلى API، وهو ما اعتبره المطورون أكثر فائدة لتصحيح أخطاء الوكلاء بكثير من التفسيرات الموجزة غير الشفافة — مع القيد التشغيلي الذي يلزم بتمرير حقول التفكير كما هي حرفيًا عبر استدعاءات الأدوات، وعدم وجود تعبئة مسبقة للمساعد. على مؤشر الذكاء في Artificial Analysis، يحقق Kimi K3 نتيجة 57، محتلًا المركز الرابع إجمالًا، بتكلفة تبلغ نحو 0.94 دولار للمهمة الواحدة وفقًا لمجموعته القياسية. كما أنه أغلى نموذج أصدره مختبر صيني حتى الآن: 3 دولارات لكل مليون توكن إدخال، و15 دولارًا لكل مليون توكن إخراج، بتسعير من فئة Sonnet، بينما لا يمكن بعد تحديد سعر G​LM-5.3 لكل توكن لأنه متاح فقط ضمن خطة اشتراك.

واقع الوصول والتكلفة

كيمي كيه 3 متاح الآن على OrcaRouter بسعر قائمة Moonshot الخاص — 3 دولارات / 15 دولارًا لكل مليون توكن، و0.30 دولار للقراءات المخزنة مؤقتًا، وهامش ربح 0% — لذا فإن عمل الوكيل ذي السياق 1M قابل للاستدعاء على نفس المفتاح الذي تستخدمه باقي مجموعتك، والأوزان المفتوحة هي خيار الخروج إذا أردت الاستضافة الذاتية. GLM-5.3 هو الأصعب في الحصول عليه: اشتراك شهري من 18 إلى 168 دولارًا مع نظام نقاط يستهلك الرصيد بمعدل 6.9x على الإدخال و24x على الإخراج، وتسعير خارج أوقات الذروة يخفض الاستهلاك إلى النصف خارج الفترة 14:00–18:00 بتوقيت الصين، ولا توجد واجهة برمجة تطبيقات لكل توكن حتى اكتمال مراجعة السلامة. طبقة التوجيه في الواقع تسوّي هذا التباين لنافذة الأسبوعين: عندما تصل واجهة برمجة تطبيقات GLM-5.3 إلى نفس المفتاح، يمكن لاستدعاء لوحة تشغيل كلا النموذجين الرائدين مفتاحي الترميز مقابل مهامك الخاصة والسماح للحَكَم بالتوفيق بينهما — وإذا كنت لا تستطيع الانتظار، فإن أوزان Kimi K3 التي تم إصدارها بالفعل تجعله النموذج الوحيد من الاثنين الذي يمكنك تشغيله بالكامل محليًا اليوم.

The OrcaRouter model page for MoonshotAI Kimi K3, showing the New and Featured badges, the kimi/kimi-k3 slug, $3.00 per million input and $15.00 per million output pricing, and text plus image input.

أي رهان يدفع؟

الحكم الصادق بعد أسبوع واحد هو أن كلا الرهانين يؤتي ثماره، لكن على أعباء عمل مختلفة. إذا كان عملك يعتمد بشكل كبير على الطرفيات، وقريبًا من الأمن السيبراني، ويُدار عبر وكلاء، فإن G​LM-5.3 هو الاتجاه الأقوى استنادًا إلى الأدلة التي نشرتها Z.ai — وفجوة الأمن السيبراني كبيرة بما يكفي لتستحق الانتظار أسبوعين للحصول على الأوزان لتتحقق بنفسك. إذا كان عملك يتضمن جلسات مستودع طويلة، أو مدخلات متعددة الوسائط، أو أي شيء تحتاج فيه إلى الأوزان بين يديك اليوم، فإن Kimi K3 هو الوحيد بين الاثنين المتاح فعليًا — ومكاسب المستودع العميق هي ما يمكنك التحقق منه الآن مباشرة من واجهته البرمجية الحية. الشيء الوحيد الذي يجب أن تبقيه في ذهنك: كل رقم في المواجهة المباشرة لهذه المقارنة يأتي من جدول Z.ai الخاص، لذا تعامل مع فروقات البرمجة باعتبارها اتجاهية حتى يُشغّلها مختبر مستقل على كليهما. وهذا هو بالضبط نوع التحقق الذي سيجلبه الانتظار لمدة أسبوعين.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube