
GLM-5.2 مقابل Kimi K3: أرخص وأسرع، أم أكبر وأفضل
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
وصل GLM-5.2 وKimi K3 بفارق شهر واحد في منتصف عام 2026، وهما يعكسان بعضهما بعضًا بشكل شبه تام. Kimi K3، الذي صدر في 2026-07-16 مع أوزان مفتوحة تلته في 2026-07-27، هو الأكبر وعلى الورق الأفضل: 2.8 تريليون معلمة، منها 104 مليارات نشطة، ودرجة أعلى في كل اختبار أداء تقريبًا خضع له الاثنان. أما GLM-5.2 فقد صدر منذ 2026-06-16، وهو الأصغر بين الاثنين بـ753 مليار معلمة مع 40 مليارًا نشطة، ويكلف نحو الثلث لكل توكن ناتج، ويستجيب أسرع عند الوسيط، ويُطرح بموجب رخصة MIT بدلًا من رخصة مخصصة تتضمن محفزات مرتبطة بالإيرادات.
هذا هو القرار في فقرة واحدة. وما يلي هو الأدلة التي تقف خلفه — حسابات السعر في مهمة قد تُشغّلها فعلاً، والقياسات التي يكون فيها الاثنان متقاربين بما يكفي ليكون الفرق مجرد ضجيج، ورقم شائع واحد لا يقبل المقارنة بالرقم المطبوع إلى جانبه.
أين يقف الاثنان
كلاهما متاح عمومًا عبر واجهات API الخاصة بمورديه، وكلاهما قابل للتوجيه على OrcaRouter، وكلاهما لديه أوزان قابلة للتنزيل. الفروق التي تهم قبل أن تقترب حتى من أي اختبار معياري:
• تاريخ الإصدار — GLM-5.2 في 2026-06-16 مقابل Kimi K3 في 2026-07-16 (صفحات الطرازات على Artificial Analysis؛ صفحة OrcaRouter الخاصة بالطراز Kimi K3 تؤرّخه بيوم أبكر، 2026-07-15)
• الأوزان — GLM-5.2 مفتوحة بموجب رخصة MIT مقابل Kimi K3 مفتوحة بموجب رخصة Kimi K3، التي تشترط اتفاقًا منفصلًا عند تجاوز 20 مليون دولار من الإيرادات السنوية من تقديم النموذج كخدمة، وإسنادًا بارزًا عند تجاوز 100 مليون مستخدم شهريًا (البحث والتطوير الداخلي مستثنى)
• الحجم — GLM-5.2 إجمالي 753 مليار / 40 مليار نشط مقابل Kimi K3 إجمالي 2.8 تريليون / 104 مليار نشط
• السياق — GLM-5.2 1,000,000 رمز مقابل Kimi K3 1,048,576 رمز
• المدخل — GLM-5.2 نصّ كمدخل ونصّ كمخرج، مقابل Kimi K3 نصّ وصور كمدخل ونصّ كمخرج
• الحد الأقصى للمخرجات المنشور — GLM-5.2 128,000 توكن مقابل عدم نشره على صفحة OrcaRouter الخاصة بـ Kimi K3
على OrcaRouter، يقع كلاهما خلف مفتاح واحد على نقطة نهاية واحدة متوافقة مع OpenAI على https://api.orcarouter.ai/v1، ونمرّر سعر القائمة الخاص بالمزوّد مباشرةً دون إضافة أي هامش — لذا فإن كل رقم أدناه هو رقم المورّد، وليس رقمنا.
كم يكلّف مليون توكن، في مهمة تكلّف شيئًا
بطاقات أسعار المورّدين أولاً، مقروءة من صفحات التسعير الخاصة بالمورّدين أنفسهم في 2026-09-23. تُدرج Z.ai نموذج GLM-5.2 بسعر 1.40 دولار لكل مليون رمز إدخال، و0.26 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و4.40 دولار لكل مليون رمز إخراج. تُدرج Moonshot نموذج Kimi K3 بسعر 3.00 دولار للإدخال، و0.30 دولار لقراءة الذاكرة المؤقتة، و15.00 دولارًا للإخراج — بالإضافة إلى كتابة الذاكرة المؤقتة برسوم 3.00 دولارات لكل مليون لذاكرة مؤقتة مدتها خمس دقائق و6.00 دولارات لكل مليون لذاكرة مؤقتة مدتها ساعة واحدة. تلك أسعار منشورة، وليست أسعارًا مدققة بشكل مستقل، ويمكن لأي من المورّدين تغييرها.
ضعهم على مهمة معظمها قراءة: مراجعة قاعدة برمجية بحجم 600,000 توكن مع إجابة مكتوبة من 8,000 توكن. على GLM-5.2، يمثل ذلك 0.6 × 1.40 دولار = 0.84 دولار من الإدخال بالإضافة إلى 0.008 × 4.40 دولار = 0.035 دولار من الإخراج، أو نحو 0.88 دولار. وعلى Kimi K3، يمثل ذلك 0.6 × 3.00 دولار = 1.80 دولار بالإضافة إلى 0.008 × 15.00 دولار = 0.12 دولار، أو نحو 1.92 دولار. أي نحو 2.2 ضعف التكلفة للمهمة نفسها.
الآن شغّله مجددًا بينما قاعدة التعليمات البرمجية موجودة بالفعل في ذاكرة التخزين المؤقت لدى المزوّد. ينخفض بند الإدخال إلى سعر قراءة ذاكرة التخزين المؤقت، ويصبح السعران اللذان كانا متباعدين بمعامل 2.1x عند 0.26 دولار مقابل 0.30 دولار لكل مليون — أي فجوة 15%. هذا هو الرقم الأقل تداولًا في المقارنة، والأكثر أهمية بالنسبة لوكيل يعيد قراءة السياق نفسه في كل دور. ويحمل أيضًا علامة نجمة: تفرض Kimi K3 رسومًا منفصلة لكتابة ذاكرة التخزين المؤقت، ولا تعلن صفحة GLM-5.2 عن أي رسوم كتابة على الإطلاق، لذا يكلّف البدء البارد على Kimi K3 أكثر بشكل ملموس مما يوحي به السعر الرئيسي البالغ 3.00 دولارات.
• قراءة بـ600 ألف رمز مع إجابة بـ8 آلاف رمز — GLM-5.2 بحوالي 0.88 دولار مقابل Kimi K3 بحوالي 1.92 دولار
• نفس سطر الإدخال المُخزَّن مؤقتًا — GLM-5.2 بسعر $0.16 مقابل Kimi K3 بسعر $0.18 لكل 600 ألف رمز

يتفق النموذج المستقل على الاتجاه ولكن ليس على المقدار. تمزج Artificial Analysis بين رموز إصابة الذاكرة المؤقتة والإدخال والإخراج بنسبة 7:2:1 وتضيف رموز الاستدلال التي يستهلكها النموذج فعليًا، وتضع أرقامها لهذين الاثنين — مقروءة في 2026-09-23 تحت مؤشرها v4.3.2 — GLM-5.2 عند $0.902 لكل مليون رمز مدمج مقابل $2.31 لـ Kimi K3، وتكلفة إكمال إحدى مهام التقييم الخاصة بها عند $0.96 مقابل $2.00. يكلف تشغيل مؤشر الذكاء الكامل مرة واحدة $1,559 على GLM-5.2 و$3,658 على Kimi K3.
ثمة تفصيل مخالف للحدس مطمور في نموذج التكلفة ذاك. يستخدم Kimi K3 عددًا أقلمن رموز الإخراج لكل مهمة مقارنةً بـ GLM-5.2 — 48,000 مقابل 64,000 — ورموز استدلال أقل، 32,000 مقابل 51,000. وهو النموذج الأكثر اقتصادًا لكل وحدة عمل، ومع ذلك تبلغ تكلفته نحو ضعف تكلفة الآخر لكل مهمة، لأن سعر الرمز الواحد عنده يبلغ 2.1 ضعفًا في الإدخال و3.4 ضعفًا في الإخراج. فرخص التكلفة لكل مهمة ورخص السعر لكل رمز خاصيتان مختلفتان، وهذه حالة تتجهان فيها في اتجاهين متعاكسين.
نافذة السياق، وما يتّسع فيها فعليًا
الاثنان لا يختلفان إلا بنسبة 5% على الورق: 1,000,000 رمز مقابل 1,048,576. أن نُبلّغ عن ذلك باعتباره فوزًا لـ Kimi K3 سيكون أمرًا سخيفًا. كلاهما نموذجان بمليون رمز، والنافذة ليست عامل تمييز؛ والسؤال الصادق هو ما الذي ما زال بوسع كل منهما فعله بالنص المدفون في منتصفها.
هذا ما يقيسه تقييم الاستدلال طويل السياق الخاص بـ Artificial Analysis، وهو أحد الفجوات الأوسع في مجموعة البيانات: تسجل Kimi K3 نسبة 89% مقابل 78% لـ GLM-5.2. إذا كانت مهمتك تحميل مجموعة نصوص كبيرة وطرح أسئلة تتطلب الربط بين حقائق من طرفيها المتقابلين، فإن الـ48,576 توكنًا الإضافية ليست سبب اختيار Kimi K3 — بل فارق الأحد عشر نقطة في السياق الطويل هو السبب.
الحدّ الأدنى أسفل النافذة يختلف أيضًا. ينشر GLM-5.2 حدًا أقصى للمخرجات يبلغ 128,000 توكن؛ ولا تنشر صفحة Kimi K3 رقمًا مكافئًا، لذلك لن نقدّم واحدًا. إذا كنت تُنشئ مستندات طويلة بدلًا من قراءتها، فإن هذا التفاوت يستحق أن تتحقق منه مقابل عبء عملك قبل أن تشتري أيًّا منهما.
السرعة: المحور الوحيد الذي يتفوق فيه GLM-5.2 بشكل مطلق
هناك قياسان مستقلان يشيران في الاتجاه نفسه هنا، وهذا جدير بالذكر تحديدًا لأنهما لا يتفقان على كل شيء.
بيانات التوجيه الخاصة بنا، خلال الأيام السبعة حتى 2026-09-23، تُظهر أن GLM-5.2 يجيب عند وسيط 3.28 ثانية للرمز الأول مقابل 8.09 ثانية لـ Kimi K3، ويبث 68.1 رمزًا في الثانية مقابل 43.4. يقع زمن p95 للرمز الأول لكل من النموذجين عند 10.00 ثانية بالضبط. Artificial Analysis، عند القياس بشكل منفصل، لديها GLM-5.2 بمعدل 68.2 رمز إخراج في الثانية مقابل 36.7 لـ Kimi K3، وعند 41.29 ثانية من البداية إلى النهاية مقابل 72.13، وعند 33.95 ثانية للإجابة الأولى مقابل 58.52.

يتباين المصدران في نقطة واحدة، ويجدر الإشارة إليها بدل تجاوزها بسلاسة. تضع Artificial Analysis نموذج Kimi K3 متقدمًا قليلًا في الزمن الخام للوصول إلى أول توكن، 4.08 ثانية مقابل 4.62، بينما يُظهر التوجيه الخاص بنا أن GLM-5.2 أسرع بنحو مرتين ونصف عند p50. نقاط نهاية مختلفة، ومزوّدو خدمات المنبع مختلفون، ونوافذ زمنية مختلفة. اعتبر اتجاه الإنتاجية — GLM-5.2 أسرع بفارق مريح — راسخًا، واعتبر أي رقم منفرد لزمن الوصول إلى أول توكن، سواء كان لنا أو لهم، خاصيةً لأسبوع بعينه.
هناك أيضًا رقم في صفحة GLM-5.2 الخاصة بنا لن نتجاهله بصمت: خلال الأيام السبعة نفسها، يُظهر معدل خطأ قدره 9.2%، مقابل 0.26% لدى Kimi K3. فجوة بهذا الحجم يُرجَّح بالقدر نفسه تقريبًا أن تكون أسبوعًا سيئًا للمزوّدين upstream الذين يخدمون GLM-5.2 بقدر ما يُرجَّح أن تكون خاصية من خصائص النموذج، وسبعة أيام ليست فترة طويلة بما يكفي للتمييز بين الأمرين. إنها نوع المشكلة الذي وُجد التوجيه لحلّها — عندما يفشل مزوّد في طلب واحد من كل أحد عشر طلبًا، ينقل التحويل التلقائي عند الفشل حركة المرور دون أن يستدعي أي شخص المناوب.

المعايير المرجعية: اكتساح حقيقي، أضيق من العنوان الرئيسي
يفوز Kimi K3 في كل ما خضع له كلا النموذجين تقريبًا. هذه أرقام Artificial Analysis ضمن مراجعة المؤشر v4.3.2، وكلا النموذجين في إعداد الاستدلال الأقصى، وقُرِئت في 2026-09-23:
• مؤشر الذكاء — Kimi K3 44 مقابل GLM-5.2 34
• AA-Briefcase v1.1 — 1510 مقابل 1233
• GDPval-AA v2.1 — 1524 مقابل 1358
• AutomationBench-AA — 58% مقابل 28%
• Terminal-Bench 4.0 — 13% مقابل 1%
• SciCode — 59% مقابل 51%
• Humanity's Last Exam — 47% مقابل 41%
• GDP.pdf — 22% مقابل 10%
• AA-LCR v1.1 — 89% مقابل 78%
• CritPt — 23% مقابل 21%
تحذيران قبل أن يلتقط أي شخص لقطة شاشة لتلك القائمة.
أولًا، مراجعة المؤشر. ذكرت تغطية إطلاق Kimi K3 في يوليو أنه عند 57 على Intelligence Index مع GLM-5.2 عند 51. الصفحات المباشرة اليوم تقول 44 و34. هذه ليست القياس نفسه — فـ Artificial Analysis تراجع المؤشر وتعيد تقييم النماذج وفقًا له، ووضع رقم من يوليو بجانب رقم من سبتمبر هو أسهل خطأ يمكن ارتكابه في هذه المقارنة الثنائية. الاتجاه مستقر عبر كل لقطة؛ أما الأرقام المطلقة فليست قابلة للمقارنة بين المراجعات.
ثانيًا، المستويات. يُعدّ Terminal-Bench 4.0 عند 13% و1% تقييمًا قاسيًا، وعلى هذا الارتفاع تخبرك النسبة أكثر مما يخبرك أيٌّ من الرقمين. أما AA-Omniscience، الذي يختبر ما إذا كان النموذج يعرف حدود معرفته، فيضع GLM-5.2 عند 4 مقابل 20 لـ Kimi K3 — وهو حدّ أدنى يستحقّ معرفته إذا كنت تخطط لتشغيل أيٍّ منهما دون إشراف.
شيء آخر يسجّله Artificial Analysis عن إدراج GLM-5.2: أنه يشير إلى أن إعداد الاستدلال الأقصى أصبح مهمَلًا لصالح GLM-5.3 الأحدث. لا يغيّر ذلك أيًا من الأرقام الواردة أعلاه، التي تمثل لقطة لـ GLM-5.2 كما جرى قياسه، لكنه يعني أن خارطة طريق Z.ai قد تجاوزت هذا النموذج. على نقطة نهاية موجّهة، يكون الثمن مجرد سلسلة نصية للنموذج بدلًا من عملية ترحيل، وهو الحجة الرئيسية لعدم تضمين أي من هذين الاسمين مباشرةً في تطبيقك.
الوكلاء واستخدام الأدوات: حيث تكون الفجوة أوسع
إذا كان هناك بند واحد في هذا الجدول ينبغي أن يحسم قرار الشراء، فهو هذا البند. فالعمل الوكيلي طويل الأفق هو المجال الذي يكون فيه هامش Kimi K3 الأكبر والأكثر ثباتًا:
• AutomationBench-AA — 58% مقابل 28%، فارق 30 نقطة
• GDPval-AA v2.1 — 1524 مقابل 1358
• AA-Briefcase v1.1 — 1510 مقابل 1233
• Terminal-Bench 4.0 — 13% مقابل 1%
تعتمد مواد الإصدار الخاصة بـ Moonshot على القصة نفسها — فقد صدر إطلاق أوزان K3 مرفوقًا بتقرير فني يغطي حزمة التدريب المتوازي للخبراء الخاصة بالمورّد وأداة بيئة الوكلاء — لكن مواد المورّد تبقى مواد مورّد، والأرقام الواردة أعلاه هي الأرقام المستقلة.
مجمّع الطرف الثالث LLM Stats، الذي يشغّل مؤشره المركب الخاص على مجموعة معايير مشتركة، يصل إلى الاستنتاج نفسه من اتجاه مختلف: من بين أحد عشر معيارًا يقيّمها لكلا الطرازين، يفوز Kimi K3 بجميعها، ودرجاته الفئوية تضع Kimi K3 في المقدمة في استخدام الأدوات (30.8 مقابل 19.6)، والوكلاء (38.3 مقابل 29.6)، والبرمجة (42.3 مقابل 34.8). هذه مؤشرات LLM Stats المركبة الخاصة به وفق ترجيحه الخاص، على مجموعة مشتركة ليست كبيرة، لذا تعامل معها كتأكيد وليس كنتيجة مختبرية. أحد عشر من أصل أحد عشر لا يزال ليس نتيجة متقاربة.
البرمجة
الاتجاه نفسه، بهامش أصغر. في تقييمات البرمجة التي تسجلها Artificial Analysis لكليهما، يتقدم Kimi K3 في SciCode بنسبة 59% مقابل 51%؛ وفي المجموعة المشتركة لدى LLM Stats، يتصدر DeepSWE، وDeepSWE 1.1، وFrontierSWE، وSWE-Marathon، وProgram Bench، وTerminal-Bench 2.1. أما الأرقام المُطرية لـ GLM-5.2 — 99.2% في AIME 2026، و94.4% في HMMT 2025، و91.2% في GPQA كما تنقلها جهات التجميع الخارجية — فهي مُبلَّغ عنها من المورّد ولم يُعَد إنتاجها، ومعظمها يقيس رياضيات المسابقات لا هندسة البرمجيات.
الخلاصة العملية: بالنسبة إلى وكيل برمجي يعمل مدة طويلة، ويعدّل ملفات كثيرة، ويتعيّن عليه التعافي من أخطائه، فإن الفارق الوكيلي لدى Kimi K3 إشارة أكثر صلة من درجات الرياضيات لأيٍّ من النموذجين. أما بالنسبة إلى مساعد برمجي سريع ورخيص قائم في الغالب على محاولة واحدة، فإن ميزة الإنتاجية لدى GLM-5.2 تستحق أكثر من تكلفة فجوة المعايير المرجعية.
حيث تكون متقاربة بما يكفي بحيث لا يهم ذلك
• سعر الإدخال المخزَّن مؤقتًا — 0.26 دولار مقابل 0.30 دولار لكل مليون، فجوة بنسبة 15% مقابل فجوة بمقدار 3.4 أضعاف في الإخراج
• نافذة السياق — 1,000,000 مقابل 1,048,576 رمزًا
• زمن الوصول إلى أول رمز عند النسبة المئوية 95 (p95) — 10.00 ثانية مقابل 10.00 ثانية على التوجيه الخاص بنا
• CritPt — 23% مقابل 21%
• الرياضيات — يضع LLM Stats نموذج GLM-5.2 متقدمًا بشكل طفيف على مؤشره المركّب للرياضيات (41.4 مقابل 40.9)، بينما يتقدم Kimi K3 في الرياضيات مع الصور؛ وبناءً على الأدلة المتاحة، لا يسيطر أي من النموذجين على الحساب.
أي شخص يخبرك أن أحد هذه النماذج ضعف الآخر في كل المجالات إنما يقرأ صفًا واحدًا من الجدول.
اختر GLM-5.2 إذا…
أنت تدفع الفاتورة، والفاتورة هي القيد. سعر مخرجات GLM-5.2 نحو الثلث، وهو أرخص أيضًا على خط التخزين المؤقت، ومرخّص بموجب MIT دون عتبة إيرادات يجب التحقق منها، وأسرع عند الوسيط وأسرع بكثير عند البث، ونافذته البالغة مليون رمز قريبة بما يكفي من نافذة Kimi K3 بحيث لن يغيّر هذا الفرق أي شيء أبدًا. إذا كان عبء العمل لديك نصًا يدخل ونصًا يخرج، وهو في معظمه قراءة لا سلاسل طويلة من استدعاءات الأدوات، فإن نقاط المعايير الإضافية في Kimi K3 هي نقاط لن يجمعها تطبيقك أبدًا.
اختر Kimi K3 إذا…
العمل وكيلي وطويل. فجوة الـ30 نقطة في AutomationBench، والتفوق في GDPval وAA-Briefcase، وفارق الإحدى عشرة نقطة في الاستدلال طويل السياق، والاكتساح في المجموعة المشتركة لـ LLM Stats — كلها تشير في الاتجاه نفسه: Kimi K3 هو النموذج الأفضل لتسليم مهمة متعددة الخطوات ثم الانصراف. وهو أيضًا الوحيد بين النموذجين الذي يقبل الصور. ستدفع نحو ضعف المبلغ لكل مهمة مقابل ذلك، وإذا كانت مجموعة عملك مُخزَّنة مؤقتًا بكثافة فستدفع أقل من الضعف — لكن الحجة لصالحه ليست السعر، وليست السرعة.
يمكن توجيه كليهما على OrcaRouter من مفتاح واحد عبر نقطة نهاية واحدة متوافقة مع OpenAI، بأسعار القوائم الخاصة بالمزوّدين دون أي إضافة فوقها، وكلاهما يقع خلف التحويل التلقائي نفسه عند الفشل. تلك هي أرخص طريقة لمعرفة أيّهما يريده عبء عملك فعلاً، لأن التبديل بينهما هو مجرد سلسلة نصية للنموذج وليس عقدًا.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
