
GLM-5.3 مقابل Kimi K3: استغلال نموذج أساسي بحجم 743B أم بناء نموذج بحجم 2.8T — أي رهان سيؤتي ثماره؟
- openaiجديدOpenAI: GPT-6 Astra2026-09-0455الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0247الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0247الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0157الذكاء82البرمجة
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2646الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1849الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1541الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1251الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0547الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0347الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2140الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128الذكاء49البرمجة
السباق الصيني للأوزان المفتوحة انقسم لتوّه إلى إجابتين على السؤال نفسه. بنت Moonshot AIKimi K3من الصفر — قاعدة مزيج خبراء بمعاملات تبلغ 2.8 تريليون، وهي أكبر نموذج مفتوح الأوزان يُطرح على الإطلاق، أُعلن في 16 يوليو 2026 وتلاه نشر الأوزان في 27 يوليو.GLM-5.3هو الرهان المعاكس: أبقى Z.ai على القاعدة نفسها البالغة 743 مليار معامل التي شغّلت GLM-5.2، وأنفق دورة الإصدار بأكملها على التدريب اللاحق، محتجًا بأن سقف ذكاء النموذج الأساسي لم يكن يومًا هو المشكلة. كلاهما نموذجان رائدان بسياق مليون رمز، ومركّزان على البرمجة والعوامل (agents)، وكلاهما يدّعي أنه أفضل نموذج برمجة مفتوح في السوق. لا يمكن أن يكون كلاهما الطريقة المثلى لإنفاق الميزانية نفسها، والمقاييس تنقسم فعلًا في المنتصف — ما يجعل هذه المسألة استفتاءً على كيفية بناء نموذج الحدود القادم أكثر منها مقارنةً مباشرة.
رهانان على كيفية بناء نموذج متطور
تطلق Z.ai على GLM-5.3 وصف «التنقيب العميق» وليس ترقية جيلية. الأساس هو نفسه بايتًا ببايت نموذج 743B الموجود في GLM-5.2؛ والفارق كليًا في مرحلة ما بعد التدريب، عبر إطار العمل مفتوح المصدر slime على مهام تمتد عبر جلسات هندسية كاملة — تشخيص وإصلاح وتحقق وإصدار عبر مجموعات خوادم حقيقية وأنظمة تخزين وقواعد أكواد، بعضها يستغرق عدة أيام من عمل مهندس أول. المكاسب التي أعلنتها الشركة كبيرة: قفزة بنسبة 50% في معيار Code Bench الخاص بها، وTerminal-Bench 3.0 من 4.6 إلى 28.3، وDeepSWE v1.1 من 46.2 إلى 66.9، وقدرة سيبرانية فرضت مراجعة أمنية قبل شحن الأوزان. أما Moonshot فسارت في الاتجاه المعاكس. Kimi K3 أساس جديد كليًا — 2.8T من المعلمات الإجمالية مع نحو 104B نشطة لكل رمز (16 من 896 خبيرًا)، ومعمارية Kimi Delta Attention، وإدخال أصلي للصور والفيديو، وتفكير دائم التشغيل لا يمكن إيقافه، ونافذة سياق تبلغ 1M للإدخال والإخراج معًا. فبينما تراهن Z.ai على أن المزيد من النموذج نفسه يكفي، تراهن Moonshot على أن الأساس نفسه كان هو السقف.

المواجهة المباشرة، مع إرفاق المصدر
المكان الوحيد الذي يظهر فيه كلا النموذجين في الصفحة نفسها هو جدول الإطلاق الخاص بـ Z.ai، لذا فمن هناك تأتي الأرقام جنبًا إلى جنب — مُصنَّفة على أنها مُبلَّغ عنها من البائع، وليست مدقَّقة بشكل مستقل. تتوافق أرقام Kimi K3 المستقلة مع ما نشرته Moonshot في يوليو وما تقيسه Artificial Analysis، لكن لا يوجد مختبر محايد اختبر كليهما بعد.
• Terminal-Bench 3.0 — GLM-5.3 عند 28.3 مقابل Kimi K3 عند 17.4 (جدول Z.ai). أكبر فجوة برمجية في المواجهة، في أحدث وأصعب إصدار.
• Terminal-Bench 2.1 — GLM-5.3 عند 88.2 مقابل Kimi K3 عند 88.3. تعادل.
• DeepSWE v1.1 — GLM-5.3 عند 66.9 مقابل Kimi K3 عند 67.5. Kimi بفارق ضئيل.
• SWE-Marathon v1.1 — GLM-5.3 بـ 42.5 مقابل Kimi K3 بـ 48.1. أفضل فوز برمجي لـ Kimi.
• ExploitGym — GLM-5.3 بنتيجة 105/130 مقابل Kimi K3 بنتيجة 36/70. اكتساح شبه كامل لـ GLM.
• GDPval-AA v2 (العمل المعرفي) — GLM-5.3 بـ 1,769 مقابل Kimi K3 بـ 1,682.
• الوصول — GLM-5.3: اشتراك خطة البرمجة، الأوزان مقيدة حتى حوالي 28 أغسطس. Kimi K3: واجهة برمجة التطبيقات (API) متاحة بسعر $3 / $15، الأوزان قابلة للتنزيل منذ 27 يوليو.

الخندق الأمني هو الفصل الحقيقي
عندما نُجرّد معايير البرمجة جانبًا، يكون الفارق الحاسم في الأمن السيبراني. يسجّل GLM-5.3 84.5 على CyberGym مقابل 80.0 لـ Kimi K3، ونتيجة ExploitBench الخاصة به البالغة 54.4 تكاد تضاعف نتيجة Kimi K3 البالغة 32.2. على ExploitGym، الفجوة ليست مجرد اختلاف، بل هي فئة مختلفة تمامًا — 105 و130 مقابل 36 و70 عبر جولتي الساعتين والست ساعات. لهذا السبب يبدو الإطلاقان مختلفين جدًا في الممارسة العملية: أوزان Kimi K3 متاحة علنًا بموجب رخصة Modified MIT، بينما تُحتجز أوزان GLM-5.3 من أجل تحصين السلامة، وتحديدًا لأن Z.ai تقول إن النموذج بارع بما يكفي في اكتشاف العيوب واستغلالها لدرجة أن إصدار الأوزان فورًا بدا غير مسؤول. إذا كان عملك يتضمن مراجعة كود شخص آخر، أو الدفاع عن كودك ضد البحث الآلي عن الثغرات، فهذا هو السطر الأكثر صلة على الإطلاق في المقارنة كلها — وهو أيضًا الأقل تحققًا بشكل مستقل.
حيث يرد كيمي K3
تتركز انتصارات Kimi K3 في المجال الذي يكون فيه GLM-5.3 أضعف: العمل طويل الأمد على المستودعات البرمجية. تحتفظ بالأفضلية على DeepSWE وSWE-Marathon، وتتصدر في Toolathlon Verified، كما أن نافذة الإخراج التي تتسع لمليون توكن تتيح لها كتابة قاعدة برمجية كاملة أو تتبعًا طويلًا لوكيل في مسار واحد. كما أن تفكيرها الدائم يبث السجل الكامل إلى API، وهو ما اعتبره المطورون أكثر فائدة لتصحيح أخطاء الوكلاء بكثير من التفسيرات الموجزة غير الشفافة — مع القيد التشغيلي الذي يلزم بتمرير حقول التفكير كما هي حرفيًا عبر استدعاءات الأدوات، وعدم وجود تعبئة مسبقة للمساعد. على مؤشر الذكاء في Artificial Analysis، يحقق Kimi K3 نتيجة 57، محتلًا المركز الرابع إجمالًا، بتكلفة تبلغ نحو 0.94 دولار للمهمة الواحدة وفقًا لمجموعته القياسية. كما أنه أغلى نموذج أصدره مختبر صيني حتى الآن: 3 دولارات لكل مليون توكن إدخال، و15 دولارًا لكل مليون توكن إخراج، بتسعير من فئة Sonnet، بينما لا يمكن بعد تحديد سعر GLM-5.3 لكل توكن لأنه متاح فقط ضمن خطة اشتراك.
واقع الوصول والتكلفة
كيمي كيه 3 متاح الآن على OrcaRouter بسعر قائمة Moonshot الخاص — 3 دولارات / 15 دولارًا لكل مليون توكن، و0.30 دولار للقراءات المخزنة مؤقتًا، وهامش ربح 0% — لذا فإن عمل الوكيل ذي السياق 1M قابل للاستدعاء على نفس المفتاح الذي تستخدمه باقي مجموعتك، والأوزان المفتوحة هي خيار الخروج إذا أردت الاستضافة الذاتية. GLM-5.3 هو الأصعب في الحصول عليه: اشتراك شهري من 18 إلى 168 دولارًا مع نظام نقاط يستهلك الرصيد بمعدل 6.9x على الإدخال و24x على الإخراج، وتسعير خارج أوقات الذروة يخفض الاستهلاك إلى النصف خارج الفترة 14:00–18:00 بتوقيت الصين، ولا توجد واجهة برمجة تطبيقات لكل توكن حتى اكتمال مراجعة السلامة. طبقة التوجيه في الواقع تسوّي هذا التباين لنافذة الأسبوعين: عندما تصل واجهة برمجة تطبيقات GLM-5.3 إلى نفس المفتاح، يمكن لاستدعاء لوحة تشغيل كلا النموذجين الرائدين مفتاحي الترميز مقابل مهامك الخاصة والسماح للحَكَم بالتوفيق بينهما — وإذا كنت لا تستطيع الانتظار، فإن أوزان Kimi K3 التي تم إصدارها بالفعل تجعله النموذج الوحيد من الاثنين الذي يمكنك تشغيله بالكامل محليًا اليوم.

أي رهان يدفع؟
الحكم الصادق بعد أسبوع واحد هو أن كلا الرهانين يؤتي ثماره، لكن على أعباء عمل مختلفة. إذا كان عملك يعتمد بشكل كبير على الطرفيات، وقريبًا من الأمن السيبراني، ويُدار عبر وكلاء، فإن GLM-5.3 هو الاتجاه الأقوى استنادًا إلى الأدلة التي نشرتها Z.ai — وفجوة الأمن السيبراني كبيرة بما يكفي لتستحق الانتظار أسبوعين للحصول على الأوزان لتتحقق بنفسك. إذا كان عملك يتضمن جلسات مستودع طويلة، أو مدخلات متعددة الوسائط، أو أي شيء تحتاج فيه إلى الأوزان بين يديك اليوم، فإن Kimi K3 هو الوحيد بين الاثنين المتاح فعليًا — ومكاسب المستودع العميق هي ما يمكنك التحقق منه الآن مباشرة من واجهته البرمجية الحية. الشيء الوحيد الذي يجب أن تبقيه في ذهنك: كل رقم في المواجهة المباشرة لهذه المقارنة يأتي من جدول Z.ai الخاص، لذا تعامل مع فروقات البرمجة باعتبارها اتجاهية حتى يُشغّلها مختبر مستقل على كليهما. وهذا هو بالضبط نوع التحقق الذي سيجلبه الانتظار لمدة أسبوعين.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
