بطاقة عنوان لـ 'Muse Spark 1.2 ضد GLM-5.2 — المبرمج المغلق مقابل العمومي المفتوح'، حيث يظهر Muse Spark 1.2 تحت أيقونة قفل مغلق وGLM-5.2 تحت أيقونة صندوق مفتوح.
Guides & Insights

موز سبارك 1.2 ضد GLM 5.2: المبرمج المغلق مقابل العام المفتوح

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

نموذجان بسياق يبلغ 1,000,000 رمز، لا يتجاوز الفارق بين سعريهما خمسة عشر سنتًا لكل مليون رمز، وكلاهما موجّه لمهام الوكلاء المكثّفة بالبرمجة — ولا يشتركان في أي شيء آخر تقريبًا. Muse Spark 1.2، الذي طرحته Meta في 5 أغسطس 2026 إلى جانب وكيل طرفية مدرَّب بشكل مشترك باسم Muse Code، نموذج مغلق الوزن، وأرخص لكل رمز، ويحقق 57 على مؤشر Artificial Analysis Intelligence Index الحالي، ولا يمكنه الرد دون تفكير أولًا. GLM 5.2، النموذج الرائد مفتوح الوزن من Z.ai منذ منتصف يونيو، مرخّص بموجب MIT، ويمكن استضافته ذاتيًا، وأسرع بنحو خمس مرات إلى أول رمز، ولا يزال ينقل حركة فعلية تبلغ أربعة أضعاف ونصف عبر بوابتنا — 213 مليون رمز خلال الأيام السبعة الماضية مقابل 46 مليونًا لـ Muse Spark 1.2. النموذج الأعلى درجةً والأرخص لكل رمز هو الأقل حركة. أما المفتوح فهو الذي يوجّه الناس إليه حركة مرورهم فعليًا.

النسخة الصادقة من تلك الحقيقة هي موضوع هذه المقالة. لا يحدد التسجيل والتسعير القرار بقدر ما يحدده مدى توافق النموذج مع خط الأنابيب لديك، وهذان الاثنان يتخذان خيارات متعاكسة على كل محور يحدد هذا التوافق. حيثما توجد أرقام مستقلة، فإنها مصدرها Artificial Analysis؛ وحيثما يكون مصدرها Meta أو Z.ai، فإنها مُصنَّفة على أنها مبلَّغ عنها من قِبل البائع؛ أما أرقام زمن الاستجابة وحركة المرور فهي بيانات القياس عن بُعد الخاصة بالإنتاج لدى OrcaRouter على مدى سبعة أيام.

تباين المواصفات، بُعدًا واحدًا في كل مرة

السعر — Muse Spark 1.2 بسعر 1.25$ للإدخال / 4.25$ للإخراج لكل مليون توكن، و0.15$ عند إصابة الكاش؛ GLM 5.2 بسعر 1.40$ للإدخال / 4.40$ للإخراج، و0.26$ مع الكاش. Meta أرخص في كل صف.

السياق — كلاهما 1,048,576 رمزًا. الحد الأقصى للإخراج: توثّق Meta سقف 131,072 رمزًا لـ Muse Spark 1.2؛ بينما تعلن GLM 5.2 عن 128,000.

الاستدلال — الاستدلال إلزامي على Muse Spark 1.2 عبر خمسة مستويات للجهد (من الأدنى إلى الأعلى جدًا، الافتراضي متوسط)؛ يعمل GLM 5.2 باستدلال هجين يتحكم فيه reasoning_effort عند مستوى مرتفع أو أقصى، مع تفعيل الاستدلال العميق افتراضيًا.

المدخلات — تعلن Muse Spark 1.2 عن دعم إدخال النصوص والصور والفيديو والصوت وPDF؛ بينما GLM 5.2 يدعم الإدخال النصي والإخراج النصي.

الأوزان — Muse Spark 1.2 مغلق، بدون مستودع وبدون مسار استضافة ذاتية؛ GLM 5.2 يصدر أوزانًا مفتوحة بترخيص MIT، وهو نموذج خليط من الخبراء بـ753B معلمة مع حوالي 40B معلمة نشطة لكل رمز.

العمرعند كتابة هذه السطور، يبلغ عمر Muse Spark 1.2 ثلاثة أيام فقط؛ بينما يعمل GLM 5.2 في الإنتاج منذ 13 يونيو، مع ثمانية أسابيع من الخبرة الميدانية ونظام بيئي كامل من بيئات الاستضافة والأدوات المبنية حوله.

فجوة المؤشر هي أربع نقاط. فخ الإصدار حقيقي.

مؤشر الذكاء الحالي من Artificial Analysis (الإصدار 4.1.1) يمنح Muse Spark 1.2 درجة 57، محتلاً المرتبة 12 من 185، وGLM 5.2 درجة 53 — وهي أعلى نتيجة بين النماذج مفتوحة الأوزان في لوحة الصدارة، لكنها متأخرة بأربع نقاط. لا تزال معظم التغطيات تشير إلى 54 لـ Muse Spark 1.2 لأن هذا ما أبلغ عنه تقييم يوم الإطلاق؛ وأضافت إعادة التقييم في الإصدار 4.1.1 2.7 نقطة إليه، وهي أكبر زيادة لأي نموذج في هذا التحديث. إذا رأيت "54 مقابل 51" أو "54 مقابل 53" في أي مكان، تحقق من إصدار المؤشر الذي يتبع له كل رقم قبل التعامل مع الفارق على أنه حقيقي.

من الجدير ذكره ما يعنيه فارق الأربع نقاط وما لا يعنيه. إنه يعني أن نموذج Meta المغلق يتصدّر على نموذج Z.ai المفتوح في المؤشر المركّب المكوّن من تسعة معايير، عند تكافؤ الجهد. ولا يعني أن Muse Spark 1.2 يتفوّق على GLM 5.2 في كل شيء، إذ يصل النموذجان إلى نتائجهما بطرق مختلفة. GLM 5.2 نموذج استثنائي في الرياضيات والاستدلال — سجّل 99.2 على AIME 2026 — لكنه معروف بإسهابه، ونقطة ضعفه هي الأعمال العميقة على نطاق مستودعات الأكواد. أما Muse Spark 1.2 فالعكس تمامًا: قوي في البرمجة الطرفية والمهام متعددة الملفات، وأرخص بكثير في تقييم كل مهمة، لأنه يستهلك توكنات أقل بكثير أثناء التفكير.

A two-column scoreboard for Muse Spark 1.2 and GLM-5.2. AA Index (v4.1.1): 57 vs 53. Terminal-Bench 2.1: 80.1 vs 77.9. DeepSWE 1.1: 59.3 (Meta) vs 46.2. Weights: closed vs MIT open. Price in/out: $1.25/$4.25 vs $1.40/$4.40. p50 TTFT: 8.13 s vs 1.55 s.

حيث تتباعد المعايير فعليًا

في Terminal-Bench 2.1، الاثنان أقرب مما يوحي به الفارق في المؤشر، والمصدر يهم أكثر من المعتاد. على نفس منصة Artificial Analysis، سجل Muse Spark 1.2 درجة 80.1 بينما سجل GLM 5.2 درجة 77.9. تدّعي Meta أن Muse Spark 1.2 سجل 82.9 على منصتها الخاصة؛ أفضل رقم موثق من Z.ai لـ GLM 5.2 هو 82.7، مما جعله أول نموذج مفتوح الأوزان يتجاوز 80 على ذلك المعيار. نفس المعيار، أربعة أرقام مختلفة — اقتران المنصات يحرك هذه الدرجات بعدة نقاط في كلا الاتجاهين، لذا تعامل مع أي ادعاء يعتمد على نتيجة واحدة من Terminal-Bench على أنه نطاق.

التباين الذي يجب الانتباه إليه هو DeepSWE 1.1، المعيار الذي يركز على التفكير العميق عبر ملفات متعددة وعلى نطاق المستودع في حلقة وكيل طويلة. تُعلن Meta عن 59.3 لـ Muse Spark 1.2 — رقم من البائع، لم يتمكن أي طرف ثالث من إعادة إنتاجه بعد. نشرت GLM 5.2 نتيجة DeepSWE تبلغ 46.2، بينما كان إصدارها السابق GLM-5.1 عند 18.0، لذا فهذا هو البعد الذي حققت فيه Z.ai أكبر تحسن وما زالت متأخرة فيه. إذا كان عبء عملك هو "تغيير خمسين ملفًا بشكل متماسك"، فإن تلك الفجوة هي القصة كلها؛ أما إذا كان عبء عملك هو أوامر الطرفية والهياكل الأساسية، فبالكاد تكون ملحوظة.

اكتشاف آخر يقلب التصوّر المألوف. مجموعة Vals AI المستقلة، التي تشغّل مهام الوكلاء حسب المجال، تضع Muse Spark 1.2 في المركز الخامس إجمالاً بنسبة 71.88% — والأول في Finance Agent، والأول في TaxEval، والأول في معيار Harvey's Legal Agent، أمام 44 و136 و31 نموذجًا على التوالي — بينما يُعد Terminal-Bench 2.1 فقط المجال الرابع عشر الأفضل لها من بين خمسين مجالًا. روجت Meta لهذا النموذج كنموذج برمجة، لكن مُقيّمًا مستقلًا وجد أنه الأقوى في وكلاء المستندات المالية والضريبية والقانونية. إذا كان فريقك يكتب العقود أو يطابق الدفاتر، فهذا هو الرقم الأكثر فائدة على الإطلاق في هذا المقال.

مسألة الأوزان المفتوحة هي المفترق الحقيقي.

كل ما سبق يتعلق بالقدرة. أما القرار فيتعلق في معظمه بالملكية، وهنا لا يمكن أن يكون الاثنان أبعد من بعضهما.

GLM 5.2 هو نموذج بأوزان مفتوحة مرخّص بموجب MIT. هذا يغيّر المعادلة، وليس فقط الفاتورة: يمكنك استضافته ذاتيًا إذا كان عبء العمل حساسًا أو كان الحجم كبيرًا؛ ويمكنك نقله بين مقدمي الخدمة دون إعادة تكامل، لأن الأوزان ملكك؛ وأي مضيف يوجّهه عليه أن ينافس على السعر وزمن الاستجابة، وهذا هو السبب في أن خط الأوزان المفتوحة يصبح أرخص بمرور الوقت. نموذج MoE بحجم 753B ليس نموذجًا يعمل على الحاسوب المحمول — ستستأجره معظم الفرق بدلًا من تشغيله — لكن خيار المغادرة، أو تشغيل الأوزان نفسها داخليًا بتكلفة ثابتة، يضع حدًا أدنى لما يمكن لأي شخص أن يفرضه عليك.

يشتري Muse Spark 1.2 الحزمة المعاكسة. الأوزان مغلقة والطريق الوحيد من الطرف الأول هو Model API الخاص بـ Meta، والذي نوجّهه الآن أيضًا. في المقابل تحصل على منتج مُدرَّب بالتزامن: Muse Code، الوكيل الطرفي الذي صدر مع النموذج، تم ضبطه على مسارات تسخير منتقاة بالرفض، ويشغّل وكلاءً فرعيين دائمين وآمنين عند إعادة التشغيل على بيئة تشغيل سجل أحداث دقيقة الإعادة، مع /plan،/grill و /goal كمهارات مدمجة. هذا شيء مختلف حقًا عن "نموذج جيد توصّله بمنظومتك الخاصة" — إنه وكيل يصل جاهزًا للعمل. والمقابل أنه يعمل فقط بطريقة Meta، في أداة Meta، على macOS أو Linux، دون عميل Windows، ودون MCP أو إضافات IDE بعد.

Screenshot of the Meta AI Research announcement 'Introducing Muse Code and Muse Spark 1.2', dated August 5 2026.

السعر لكل توكن، السعر لكل مهمة

لكل رمز، فإن Muse Spark 1.2 أرخص في الإدخال والإخراج، ويظل أرخص لكل مهمة لأنه أيضًا النموذج الأقل إسهابًا. قاست Artificial Analysis أن GLM 5.2 أحرق 141 مليون رمز إخراج، 95% منها رموز استدلال، فقط لتشغيل مؤشر الذكاء عند الإطلاق — وهو النموذج الرائد الأكثر إسهابًا على الإطلاق. أحرق Muse Spark 1.2 95 مليون رمز في نفس التمرين بتكلفة 0.40 دولار لكل مهمة. المزيد من الرموز بمعدل أعلى يعني أن تكلفة GLM 5.2 لكل مهمة تتراكم بطريقة يخفيها سعره المعلن، وهذه هي الطريقة الصحيحة لمقارنة نماذج الاستدلال: حدد سعر المهمة المكتملة، وليس معدل المليون رمز.

هناك سعر ثالث لا يمتلكه سوى واحد من هذه النماذج. يأتي Muse Spark 1.2 مع طبقة مساهم بسعر 0.10 دولار للإدخال / 0.20 دولار للإخراج — أي أقل بمرتبة كاملة من الطبقة القياسية، وأقل من السعر المدرج لـ GLM 5.2 بهامش مشابه. ثمن الدخول هو منح الإذن لـ Meta لتدريب نماذج مستقبلية على حركة المرور الخاصة بك، بالإضافة إلى حد أقصى يبلغ 60 طلبًا في الدقيقة يستبعد التوزيع الإنتاجي. تعامل معه كمراجعة قانونية مع خصم مرفق، وليس كوحدة SKU أرخص؛ بالنسبة لفريق مؤهل ويعمل ضمن الحد الأقصى، فإن ذلك يجعل مقارنة الأسعار تتوقف عن أن تكون متقاربة.

زمن الاستجابة: النموذجان ينعكسان

إذا كان فارق المؤشر في صالح Meta، فإن ملف زمن الاستجابة هو حيث يتفوق GLM 5.2 بشكل حاسم على مستوى الإحساس. عبر الأيام السبعة الأخيرة من الحركة الحقيقية على OrcaRouter، يُظهر Muse Spark 1.2 زمنًا للوصول إلى أول توكن عند p50 يبلغ 8.13 ثانية وعند p95 يبلغ 10.00 ثانية، ثم ينطلق بمعدل 576 توكنًا في الثانية كمخرجات مع معدل خطأ صفري. بينما يُظهر GLM 5.2 زمن p50 يبلغ 1.55 ثانية — أي أسرع بأكثر من خمس مرات للوصول إلى أول توكن — لكنه يقطر بمعدل 78.5 توكنًا في الثانية كنواتج مع معدل خطأ يبلغ 0.16%. وفي المختبر عند أقصى جهد يتسع الفارق: قاسَت Artificial Analysis زمن الوصول إلى أول توكن لـ Muse Spark 1.2 عند 26 ثانية في إعداد xhigh، وهو إعداد التفكير الأكثر تكلفة.

إذن أحد النموذجين يجعلك تنتظر ثم ينجز بسرعة؛ بينما يبدأ الآخر فورًا ويأخذ وقته. بالنسبة لأي شيء يراقبه إنسان — دور محادثة أو جلسة طرفية تفاعلية — يبدو GLM 5.2 أفضل، ولهذا يهيمن على الحركة التفاعلية عبر بوابتنا. أما فيما يتعلق بالتوليد الطويل، أو التصحيح الكبير، أو مسودة المستند، فإن Muse Spark 1.2 سينتهي أولًا بمجرد أن يبدأ، لأن معدل إخراجه يبلغ سبعة أضعاف معدل GLM 5.2. قس الرقم الخطأ وستختار النموذج الخطأ للسبب الخطأ.

تجربة كلاهما دون عقد ثانٍ.

كلا النموذجين مُدرجان في كتالوج OrcaRouter بسعر القائمة المقدّم من المزوّد — Muse Spark 1.2 بسعر 1.25$ و4.25$، وGLM 5.2 بسعر 1.40$ و4.40$ — لأن OrcaRouter يمرّر أسعار المزوّدين بهامش ربح 0%. وهذا يجعل أقسام التسعير المذكورة أعلاه هي الفاتورة الفعلية، وليست السعر المعلن، كما يعني أن التبديل بين النموذجين هو تغيير سطر واحد في سلسلة النموذج مع الحفاظ على نفس المفتاح، وليس تكاملًا جديدًا. وإذا خفّض أحد المزوّدين سعره، فإن التخفيض يصل إلينا في اليوم نفسه.

طبقة التوجيه تستحق مكانها هنا تحديدًا لأن النموذجين متكاملان. ضعف Muse Spark 1.2 يتمثل في بطء أول رمز (token) وارتفاع التكلفة على نطاق واسع؛ بينما ضعف GLM 5.2 يتمثل في الإسهاب والاستدلال العميق في المستودعات. قاعدة توجيه ترسل مرحلة التخطيط إلى Muse Spark 1.2 وتوزيع العاملات المتوازية إلى GLM 5.2 — أو تتحول تلقائيًا إلى GLM 5.2 عندما تكون نقطة نهاية Muse Code بطيئة — لا تكلف شيئًا إضافيًا لبنائها، لأن كلاهما يعمل خلف نقطة نهاية واحدة. وبالنسبة لنموذج عمره ثلاثة أيام، فإن التبديل التلقائي هو طريقة تجربته دون المراهنة على مسار إنتاجي به.

Screenshot of the OrcaRouter model page for GLM-5.2 (z-ai/glm-5.2), showing $1.40 per million input tokens, a 1M-token context window, 128K max output and an OpenAI-compatible endpoint.

من الذي يجب أن يختار ماذا

اختر Muse Spark 1.2 عندما تكون وحدة العمل قطعة أثرية كبيرة ومتماسكة ويمكن لشخص ما الانتظار بضع ثوانٍ حتى تبدأ: إعادة هيكلة ملفات متعددة، وتوليد مستودع كامل، وحلقات وكيل طويلة، و— وفقًا لـ Vals AI — أعمال المستندات المالية والضريبية والقانونية. تتفق ريادة DeepSWE، ومعدل الإخراج المرتفع، ومستوى المساهم كلها في الاتجاه نفسه. أنت تقبل أوزانًا مغلقة، وأدوات Meta، ورمزًا أوليًا أبطأ، وعليك أن تقرأ 82.9 و59.3 من Meta كادعاءات وليست حقائق.

اختر GLM 5.2 عندما تكون الملكية والإحساس أكثر أهمية من الدرجة المركّبة: أوزان مفتوحة يمكنك استضافتها ذاتيًا أو نقلها، وأول توكن سريع للعمل التفاعلي، ونظام بيئي من الأدوات والأطر التي تعمل معه بالفعل، وأقوى قدرة عامة مفتوحة الأوزان متاحة. تقبّل الإسهاب، و46.2 DeepSWE، وسعرًا معلنًا أعلى لكل توكن حتى قبل احتساب الفرق في عدد التوكنات.

معظم الفرق ستجد أن الإجابة الصادقة هي لا أحد منهما وحده. النموذج المفتوح هو الحصان الذي توجّه عبره معظم حركة المرور؛ أما النموذج المغلق فهو المتخصص الذي توجّهه نحو المهام العميقة والوثائق الحساسة. أربع نقاط مؤشر تفصل بينهما على مؤشر مركب، وعالم كامل يفصل بين من يملك الأوزان — هذا هو الخيار، وهو أوضح بكثير من الدرجات.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

providers@orcarouter.ai

انضم إلى مجتمعنا

Discordsupport@orcarouter.aiXGitHubYouTube