Muse Spark 1.2 و Muse Code-1
Guides & Insights

Muse Spark 1.2 وMuse Code: نموذج Meta الثالث في أربعة أشهر يحقق التعادل مع Grok 4.5

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدرت Meta Muse Spark 1.2 في 5 أغسطس 2026، بعد أربعة أسابيع من إصدار Muse Spark 1.1 وبعد حوالي أربعة أشهر من أول إصدار من Muse Spark. جاء هذا الإصدار بشيء لم يكن لدى الإصدارين السابقين: وكيل برمجة خاص بشركة Meta، Muse Code, تم إطلاقه في نسخة بيتا وتم تدريبه بالتزامن مع النموذج الذي يعمل عليه. وعلى لوحة النتائج الوحيدة التي لا تتحكم فيها Meta ولا منافسوها، فإن هذا الإصدار يضع Meta في تعادل محكم مع SpaceXAI — حيث يسجل كل من Muse Spark 1.2 وGrok 4.5 الآن 54 نقطة على مؤشر Artificial Analysis Intelligence Index.

هناك أمران يستحقان الفصل بينهما قبل أن تعني الأرقام أدناه شيئًا. درجة مؤشر Intelligence Index، وأرقام زمن الاستجابة، وعدد التوكنات، مصدرها Artificial Analysis، التي تُجري تقييماتها الخاصة وتنشر التكاليف؛ فهذه الأرقام مستقلة. أما نتائج البرمجة التي استهلت بها Meta إعلانها — Terminal-Bench 2.1 وDeepSWE v1.1 ومعيار داخلي — فقد أُجريت بواسطة Meta، وعلى منصة الاختبار الخاصة بها، مع إقران كل نموذج منافس بمنتج وكيله الخاص. كلا النوعين من الأرقام مفيد؛ لكنهما ليسا النوع نفسه من الأدلة، وتحافظ هذه المقالة على الفصل بينهما.

ما الذي شحنته ميتا فعليًا

Muse Spark 1.2 and Muse Code-2

الإعلان، الذي نُشر على مدونة أبحاث الذكاء الاصطناعي التابعة لشركة ميتا ويحمل تاريخ 5 أغسطس، يغطي منتجين في وقت واحد.

Muse Spark 1.2 — تحديثٌ موجّهٌ نحو البرمجة لعائلة Muse Spark. تقول Meta إنها ضاعفت موارد الحوسبة المخصصة للتدريب على مهام البرمجة ووسّعت تنوّع بيئات التدريب، مع الحفاظ على قدرة الوكيل العام التي رُوّج بها في إصدار 1.1. أهداف التدريب المعلنة طويلة الأفق: توليد مستودعات برمجية كاملة، ومشاريع كبيرة من البداية إلى النهاية، وما تسميه Meta "البحث الآلي"، مع تخطيط لتسلسل العمل، وتهيئة الأهداف للحفاظ على الاتجاه عبر خطوات عديدة، وضغط السياق لإبقاء الحالة ذات الصلة نشطة مع طول الجلسة.

Muse Code — وكيل برمجة طرفي في مرحلة تجريبية، يُثبَّت عبر سكربت شل من سطر واحد من نطاق مطوّري Meta. يشغّل وكلاء خلفيين غير متزامنين ودائمين يستمرون عبر الجلسة، على بيئة تشغيل محلية لسجل الأحداث تصفها Meta بأنها دقيقة في إعادة العرض وآمنة في إعادة التشغيل، وينسّق عدة وكلاء فرعيين لكل مهمة في أشجار عمل معزولة. يأتي مع ثلاث مهارات مدمجة: /plan لتخطيط مقيد بالموافقة، /grill لاختبار ضغط العمل المنجز بالفعل، و /goal لدفع المهمة إلى الاكتمال.

الاقتران ليس عرضيًا. تقول ميتا إن الاثنين تم تدريبهما معًا — حيث تمت معايرة النموذج على مسارات مأخوذة عبر أخذ العينات بالرفض من السقالة، مع تحسينات في إعدادات التدريب خاصة بالأهداف والضغط والوكلاء الفرعيين. إنها نفس طريقة التدريب المشترك التي أنتجت Claude Code وCodex، ولها نتيجة لأي شخص يقرأ أرقام المعايير: تم إنتاج نتائج البرمجة الرئيسية للنموذج داخل السقالة التي تم تدريبه ضدها. هذا ليس غشًا، بل هو كيف يعمل التقييم الوكيلي الآن. ولكنه يعني أن درجة 1.2 التي تم الحصول عليها من خلال سقالة أخرى هي سؤال مفتوح وليس افتراضًا آمنًا.

بقية المواصفات لم تتغير عن الإصدار 1.1، وهو في حد ذاته إعلامي. يظل حجم السياق عند 1,048,576 توكنًا. يظل الاستدلال إلزاميًا عبر خمسة مستويات جهد — الحد الأدنى، المنخفض، المتوسط، المرتفع، المرتفع جدًا — مع كون المتوسط هو الافتراضي؛ لا يوجد أي إعداد تحصل فيه على الأوزان دون دفع ثمن بعض التفكير. الأوزان مغلقة، ولا يوجد مستودع على Hugging Face، وتبقى واجهة برمجة تطبيقات النموذج الخاصة بشركة Meta هي المكان الوحيد من الطرف الأول لاستدعائه.

43، ثم 51، ثم 54

Muse Spark 1.2 and Muse Code-3

تُقيّم Artificial Analysis نموذج Muse Spark 1.2 بدرجة 54 على مؤشر الذكاء الخاص بها عند إعداد الاستدلال المرتفع جدًا (xhigh)، محتلاً بذلك المرتبة 13 من بين 185 نموذجًا مقارنةً بوسيط فئة يبلغ 32. ويتكوّن المؤشر من مركّب موزون لتسعة تقييمات — GDPval-AA v2 وτ³-Banking وTerminal-Bench v2.1 وSciCode وHumanity's Last Exam وGPQA Diamond وCritPt وAA-Omniscience وAA-LCR — موزّعة بالتساوي عبر الوكلاء والبرمجة والقدرة العامة والاستدلال العلمي.

عند قراءتها كسلسلة وليس كلقطة منفردة، فإن مسار ميتا هو القصة الفعلية. حصلت Muse Spark الأصلية على 43 في أبريل. وبلغت Muse Spark 1.1 درجة 51 في 9 يوليو، أي بزيادة ثماني نقاط خلال ربع سنة. وأضافت Muse Spark 1.2 ثلاث نقاط أخرى في أقل من شهر. لقد تحركت ميتا 11 نقطة مؤشر في أربعة أشهر، وأصبحت الآن تُطلق الإصدارات بسرعة تفوق قدرة نظام التقييم على مواكبتها — فلا يزال لا يوجد تحليل منشور لكل معيار لإصدار 1.2، ولا سجل له في Design Arena على الإطلاق، بينما يمتلك إصدار 1.1 الاثنين معًا.

أربعة وخمسون نقطة لميتا، بمستوى نموذج Grok 4.5، الذي أصدرته SpaceXAI قبل يوم من إصدار Muse Spark 1.1، وخلف مجموعة رائدة متقاربة: Claude Opus 5 بـ61، وClaude Fable 5 بـ60، وGPT-5.6 Sol بـ59. الفجوة مع القمة ست أو سبع نقاط. والفجوة من حيث بدأت ميتا العام هي إحدى عشرة نقطة. وما إذا كانت ستُغلق يعتمد على ما إذا كان الإيقاع سيستمر، وميتا حاليًا على دورة إصدار كل أربعة أسابيع.

لكن التعادل في مؤشر مركب ليس تعادلًا في الوظيفة، ومن الجدير توضيح ما الذي يقرره الرقم 54 وما لا يقرره. إنه يقرر أن Muse Spark 1.2 يُصنَّف في نفس مستوى Grok 4.5 من حيث القدرة الكلية. لكنه لا يخبرك أيهما يكتب تصحيحات أفضل، لأن المؤشر الفرعي للبرمجة الذي كان سيجيب على هذا السؤال لم يُنشر بعد للإصدار 1.2.

أرقام ميتا البرمجية، اقرأ بعناية

تصدّر إعلان Meta على ثلاثة رسوم بيانية. في عمليات تشغيله الخاصة، أُبلغ عنه كـ pass@1 عبر خمس محاولات مع اقتران كل نموذج منافس بمنتج وكيل خاص به:

Terminal-Bench 2.1 — 82.9% لـ Muse Spark 1.2، مقارنةً بـ 76.2% للإصدار 1.1. ويأتي Claude Opus 5 في المقدمة بنسبة 86.7%.

DeepSWE v1.1 — 59.3%، بارتفاع من 53.0%.

معيار البرمجة الداخلي لـ Meta — 70.6%، ارتفاعًا من 68.3%.

{{1}}الفروقات هي الجزء الجدير بالثقة.{{/1}} زيادة قدرها 6.7 نقطة في Terminal-Bench و6.3 في DeepSWE، {{2}}قِيست بالطريقة نفسها وعلى المنصة نفسها من قبل الفريق نفسه وبفارق شهر،{{/2}} {{3}}هي قراءة معقولة لمقدار تحسّن الإصدار 1.2 على 1.1 في المجال الذي كانت ميتا تحسّنه.{{/3}} {{4}}أما الترتيب بين البائعين فهو الجزء الذي يجب التعامل معه بتحفّظ:{{/4}} {{5}}إذ إن إقران منصات الاختبار متغير حرّ كبير،{{/5}} {{6}}والمختبر الذي يضبط منصته الخاصة إلى جانب نموذجه الخاص ليس في موقع يسمح له بضبط منصات الآخرين بالجودة نفسها.{{/6}} {{7}}كانت ميتا في المركز الثاني على شريحتها الخاصة،{{/7}} {{8}}وهذا على الأقل ليس الشكل المألوف لمعايير البائعين،{{/8}} {{9}}لكن لا جهة خارجية أعادت إنتاج أيٍّ منها حتى وقت كتابة هذه السطور.{{/9}}

قائمة الأسعار الثانية

الشيء الأكثر تأثيرًا في هذا الإصدار ليس في مخططات القياس المعيارية. يأتي Muse Spark 1.2 بقائمتي أسعار.

المستوى القياسي — 1.25 دولار لكل مليون رمز إدخال، و0.15 دولار لكل مليون عند إصابة الكاش، و4.25 دولار لكل مليون رمز إخراج. دون تغيير عن الإصدار 1.1، حتى السنت. حد المعدل حوالي 3,000 طلب في الدقيقة. يُحتسب الاستناد إلى البحث على الويب بشكل منفصل بمبلغ 2.50 دولار لكل ألف استعلام.

فئة المساهم — 0.10$ للإدخال، و0.002$ للإدخال المخزّن مؤقتًا، و0.20$ للإخراج. أي أنها أرخص بمقدار 12.5× على الإدخال وأرخص بمقدار 21.25× على الإخراج. ثمن الدخول هو الإذن لـ Meta بتدريب نماذج مستقبلية على حركة المرور الخاصة بك، وسقف معدل يبلغ 60 طلبًا في الدقيقة — أي 2% من الميزانية القياسية.

عند 0.10 دولار و0.20 دولار، ستُقدّم Muse Spark 1.2 أسعارًا أقل من كل نموذج قريب من الطليعة في السوق تقريبًا، بما في ذلك الطبقة الاقتصادية مفتوحة الأوزان التي تخسر أمامها في السعر في الحالات الأخرى. هذا هو الرقم المثير للاهتمام في هذا الإطلاق، وهو ليس قرار تسعير حقًا. ستون طلبًا في الدقيقة يستبعد معظم أنماط التوزيع الإنتاجية من تلقاء نفسه، لذا تستهدف الطبقة التجريب والعمل في الفرق الصغيرة بدلًا من الخدمة الفعلية. وعبارة "قد ندرّب على حركة البيانات الخاصة بك" هي سؤال لمن يوقّع على حوكمة البيانات في مؤسستك، وليس لمن يختار النماذج. تعامل معها كمراجعة قانونية بخصم مرفق، وليس كوحدة تخزين أرخص (SKU).

ما تكلفة إنتاج الـ54

Muse Spark 1.2 and Muse Code-4

تنشر Artificial Analysis تكلفة عمليات التقييم الخاصة بها، وفي هذا العمود تظهر ملامح Muse Spark 1.2. بلغت تكلفة إكمال مجموعة المعايير التسعة 637.85 دولارًا واستهلكت 95 مليون رمز إخراج، مقابل 548.07 دولارًا و94 مليونًا لـ Muse Spark 1.1 — وبأسعار متطابقة لكل رمز. النسبة الإضافية البالغة 16% هي تفكير خالص.

أرقام زمن الاستجابة تتحرك بنفس الطريقة. عند القياس على xhigh، يكون الوقت حتى أول رمز 26.12 ثانية للإصدار 1.2 مقابل 2.90 ثانية للإصدار 1.1، وتنخفض سرعة الإخراج من 213.5 إلى 165.0 رمزًا في الثانية. اشترت Meta ثلاث نقاط مؤشر بوقت التفكير، وتصميم الاستدلال الإلزامي يعني أنك لا تستطيع رفض الشراء — بل فقط تختار مقدار ما تشتريه منه.

ذلك الرقم البالغ 26 ثانية سيُقتبس بشكل خاطئ، لذا إليك التصحيح مسبقًا: {{1}}إنه قياس عند أعلى مستوى جهد يوفره النموذج، وتعمل واجهة API افتراضيًا على المستوى المتوسط{{/1}}. وكمرجع من حركة المرور الفعلية وليس من بيئة اختبار معيارية، {{2}}يُظهر Muse Spark 1.1 المُقدَّم عبر OrcaRouter — مهما كان مستوى الجهد الذي يطلبه المستخدمون فعليًا — زمن p50 للوصول إلى أول رمز على مدى 7 أيام يبلغ 1.84 ثانية وp95 يبلغ 6.00 ثانية{{/2}}، بمعدل 519 رمزًا في الثانية ومعدل خطأ صفري. {{3}}زمن الاستجابة في الاختبارات المعيارية عند أقصى جهد وزمن الاستجابة في الإنتاج عند الجهد الافتراضي كميتان مختلفتان{{/3}}، وعادةً ما يختلفان بمرتبة من المراتب. {{4}}اقرأ 26.12 ثانية على أنها السقف الأعلى للتفكير العميق، وليس ما سيشعر به الطلب فعليًا{{/4}}.

أين {{1}}يمكنك الاتصال به{{/1}} {{2}}اليوم{{/2}}

يتم تقديم Muse Spark 1.2 عبر واجهة برمجة تطبيقات النماذج الخاصة بشركة Meta حصريًا، وحتى وقت كتابة هذا النص، لا تتوفر في أي مكان آخر — لم يتم توجيهها عبر OpenRouter عند الإطلاق، ولا يوجد مستودع لها على Hugging Face، وهي غير مدرجة في كتالوج OrcaRouter. أما Muse Spark 1.1 فيتوفر بسعر 1.25 دولار و4.25 دولار — وهي نفس الأسعار التي تفرضها Meta، لأن OrcaRouter لا يضيف أي هامش ربح ويمرر سعر القائمة من المزود مباشرة.

هذا الأمر أكثر أهمية للمقارنة منه للنموذج نفسه. إذا كنت تبني نموذج تكلفة لهذا الإصدار، فإن النماذج التي ستقارنها به — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — تقع خلف مفتاح واحد بسعر القائمة، لذا فإن الرقم في جدول البيانات هو الرقم في الفاتورة، وأي تخفيض في الأسعار من المزود يُطبَّق في نفس اليوم وليس بعد التجديد. أما بالنسبة لـ Muse Spark 1.2 تحديدًا، فالجواب اليوم هو نقطة نهاية Meta، وعقد ثانٍ، وفاتورة منفصلة.

ما الذي لم يجبه الإعلان

لا يوجد رقم مستقل للترميز.تنشر Artificial Analysis مؤشرًا مركبًا للإصدار 1.2، لكنها لم تنشر بعد المؤشرات الفرعية للترميز والعمل الوكيلي التي نشرتها للإصدار 1.1 (71.3 و37.5 على التوالي). وبما أن العمل الوكيلي كان أضعف جوانب الإصدار 1.1 بفارق كبير، والترميز الوكيلي هو بالضبط ما يدّعي الإصدار 1.2 أنه أصلحه، فإن هذا الرقم هو ما سيحسم أمر الإصدار.

لا يوجد تكرار لنتائج الاختبار. كل رقم في الإعلان هو من تشغيل Meta. لم ينشر أحد حتى الآن نتائج Muse Spark 1.2 من منصة محايدة.

لا يوجد تحقق متعدد الوسائط. تعلن قائمة Muse Spark عن دعم إدخال النصوص والصور والفيديو والصوت وPDF. يغطي التقييم المستقل النصوص والصور. انتقلت رسائل Meta 1.2 بشكل شبه كامل إلى العمل البرمجي، وحالة الاستخدام متعددة الوسائط 1.1 التي بيعت صراحةً ليس خلفها الآن أي تسويق أو قياس.

لا يوجد سجل للإنتاجية. لا يزال حجم البيانات على نقطة النهاية منخفضًا جدًا بحيث لا يمكن لإحصائيات زمن الاستجابة المتحركة المعتادة أن تظهر.

ما الذي يجب مشاهدته خلال الأسابيع الأربعة القادمة

ثلاثة أمور ستحدد ما إذا كان هذا الإصدار كما تصفه Meta. الأول هو درجة وكيلية مستقلة للإصدار 1.2 — إذا تحرك المؤشر الفرعي الذي كان 37.5 على 1.1 بشكل كبير، فإن طرح البرمجة يكون حقيقيًا. الثاني هو ما إذا كان أي شخص يعيد إنتاج نتيجة Terminal-Bench خارج Muse Code؛ النموذج الذي يؤدي فقط داخل بيئته الخاصة هو منتج، وليس قدرة. الثالث هو ما يحدث لمستوى المساهمين: إذا خُفف حد الـ60 طلبًا، فإن نموذجًا قريبًا من الحدود الأمامية بسعر 0.10$ للإدخال و0.20$ للإخراج يغير حسابات مستوى الميزانية بطريقة لن يحققها أبدًا تحسن بثلاث نقاط في المؤشر.

وإذا استمرت الوتيرة على هذا النحو، فإن إصدار Muse Spark 1.3 متوقع في أوائل سبتمبر. ووفقًا لهذا الدليل، فإن الرقم الذي يجب مراقبته عند صدوره ليس درجة المؤشر، بل هو ما إذا كانت Meta قادرة على إضافة إمكانيات دون إضافة عشرين ثانية أخرى من التفكير إلى مقدمة كل طلب.

مقارنات في هذه المقالة3

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube