Muse Spark 1.2 و Muse Code-1
Guides & Insights

Muse Spark 1.2 وMuse Code: نموذج Meta الثالث في أربعة أشهر يحقق التعادل مع Grok 4.5

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدرت Meta Muse Spark 1.2 في 5 أغسطس 2026، بعد أربعة أسابيع من إصدار Muse Spark 1.1 وبعد أربعة أشهر تقريبًا من أول إصدار من Muse Spark. وصل هذا الإصدار مع ما لم يتوفر في الإصدارين السابقين: وكيل برمجة من تطوير Meta، Muse Code، تم طرحه في نسخة تجريبية وتم تدريبه بشكل مشترك مع النموذج الذي يعمل عليه. وعلى لوحة النتائج الوحيدة التي لا تتحكم فيها Meta ولا منافسوها، يُدخل هذا الإصدار Meta في تعادل تام مع SpaceXAI — الآن يسجّل كل من Muse Spark 1.2 وGrok 4.5 54 نقطة في مؤشر Artificial Analysis Intelligence Index. بعد خمسة أيام، جاء التطوير الأكبر: في 10 أغسطس، قالت Meta إنها ستفتح أوزان Muse Spark 1.2 — وهو إعلان، إذا تحقق، سيجعل النموذج أقوى منافس أمريكي مفتوح الأوزان حالياً للنماذج الصينية.

هناك أمران يستحقان الفصل بينهما قبل أن تعني الأرقام أدناه شيئًا. درجة مؤشر Intelligence Index، وأرقام زمن الاستجابة، وعدد التوكنات، مصدرها Artificial Analysis، التي تُجري تقييماتها الخاصة وتنشر التكاليف؛ فهذه الأرقام مستقلة. أما نتائج البرمجة التي استهلت بها Meta إعلانها — Terminal-Bench 2.1 وDeepSWE v1.1 ومعيار داخلي — فقد أُجريت بواسطة Meta، وعلى منصة الاختبار الخاصة بها، مع إقران كل نموذج منافس بمنتج وكيله الخاص. كلا النوعين من الأرقام مفيد؛ لكنهما ليسا النوع نفسه من الأدلة، وتحافظ هذه المقالة على الفصل بينهما.

ما الذي شحنته ميتا فعليًا

Muse Spark 1.2 and Muse Code-2

الإعلان، الذي نُشر على مدونة أبحاث الذكاء الاصطناعي التابعة لشركة ميتا ويحمل تاريخ 5 أغسطس، يغطي منتجين في وقت واحد.

Muse Spark 1.2 — تحديثٌ موجّهٌ نحو البرمجة لعائلة Muse Spark. تقول Meta إنها ضاعفت موارد الحوسبة المخصصة للتدريب على مهام البرمجة ووسّعت تنوّع بيئات التدريب، مع الحفاظ على قدرة الوكيل العام التي رُوّج بها في إصدار 1.1. أهداف التدريب المعلنة طويلة الأفق: توليد مستودعات برمجية كاملة، ومشاريع كبيرة من البداية إلى النهاية، وما تسميه Meta "البحث الآلي"، مع تخطيط لتسلسل العمل، وتهيئة الأهداف للحفاظ على الاتجاه عبر خطوات عديدة، وضغط السياق لإبقاء الحالة ذات الصلة نشطة مع طول الجلسة.

Muse Code — وكيل برمجة طرفي في مرحلة تجريبية، يُثبَّت عبر سكربت شل من سطر واحد من نطاق مطوّري Meta. يشغّل وكلاء خلفيين غير متزامنين ودائمين يستمرون عبر الجلسة، على بيئة تشغيل محلية لسجل الأحداث تصفها Meta بأنها دقيقة في إعادة العرض وآمنة في إعادة التشغيل، وينسّق عدة وكلاء فرعيين لكل مهمة في أشجار عمل معزولة. يأتي مع ثلاث مهارات مدمجة: /plan لتخطيط مقيد بالموافقة، /grill لاختبار ضغط العمل المنجز بالفعل، و /goal لدفع المهمة إلى الاكتمال.

الاقتران ليس عرضيًا. تقول ميتا إن الاثنين تم تدريبهما معًا — حيث تمت معايرة النموذج على مسارات مأخوذة عبر أخذ العينات بالرفض من السقالة، مع تحسينات في إعدادات التدريب خاصة بالأهداف والضغط والوكلاء الفرعيين. إنها نفس طريقة التدريب المشترك التي أنتجت Claude Code وCodex، ولها نتيجة لأي شخص يقرأ أرقام المعايير: تم إنتاج نتائج البرمجة الرئيسية للنموذج داخل السقالة التي تم تدريبه ضدها. هذا ليس غشًا، بل هو كيف يعمل التقييم الوكيلي الآن. ولكنه يعني أن درجة 1.2 التي تم الحصول عليها من خلال سقالة أخرى هي سؤال مفتوح وليس افتراضًا آمنًا.

بقية المواصفات لم تتغير عن الإصدار 1.1، وهي في حد ذاتها إعلامية. يبقى السياق عند 1,048,576 رمزًا. ويظل الاستدلال إلزاميًا عبر خمسة مستويات للجهد — أدنى، منخفض، متوسط، مرتفع، مرتفع جدًا — مع كون المتوسط هو الافتراضي؛ لا يوجد أي إعداد تحصل فيه على الأوزان دون دفع ثمن بعض التفكير. عند الإطلاق كانت الأوزان مغلقة، دون وجود مستودع على Hugging Face وكانت Model API الخاصة بـ Meta هي المكان الرسمي الوحيد لاستدعائها. ومن المقرر الآن أن يتغير ذلك: في 10 أغسطس أعلنت Meta أنها ستفتح الأوزان، مما يعكس سياسة الأوزان المغلقة التي حكمت الإصدارات الثلاثة الأولى من Muse Spark.

43، ثم 51، ثم 54

Muse Spark 1.2 and Muse Code-3

تُقيّم Artificial Analysis نموذج Muse Spark 1.2 بدرجة 54 على مؤشر الذكاء الخاص بها عند إعداد الاستدلال المرتفع جدًا (xhigh)، محتلاً بذلك المرتبة 13 من بين 185 نموذجًا مقارنةً بوسيط فئة يبلغ 32. ويتكوّن المؤشر من مركّب موزون لتسعة تقييمات — GDPval-AA v2 وτ³-Banking وTerminal-Bench v2.1 وSciCode وHumanity's Last Exam وGPQA Diamond وCritPt وAA-Omniscience وAA-LCR — موزّعة بالتساوي عبر الوكلاء والبرمجة والقدرة العامة والاستدلال العلمي.

عند قراءتها كسلسلة وليس كلقطة منفردة، فإن مسار ميتا هو القصة الفعلية. حصلت Muse Spark الأصلية على 43 في أبريل. وبلغت Muse Spark 1.1 درجة 51 في 9 يوليو، أي بزيادة ثماني نقاط خلال ربع سنة. وأضافت Muse Spark 1.2 ثلاث نقاط أخرى في أقل من شهر. لقد تحركت ميتا 11 نقطة مؤشر في أربعة أشهر، وأصبحت الآن تُطلق الإصدارات بسرعة تفوق قدرة نظام التقييم على مواكبتها — فلا يزال لا يوجد تحليل منشور لكل معيار لإصدار 1.2، ولا سجل له في Design Arena على الإطلاق، بينما يمتلك إصدار 1.1 الاثنين معًا.

أربعة وخمسون نقطة لميتا، بمستوى نموذج Grok 4.5، الذي أصدرته SpaceXAI قبل يوم من إصدار Muse Spark 1.1، وخلف مجموعة رائدة متقاربة: Claude Opus 5 بـ61، وClaude Fable 5 بـ60، وGPT-5.6 Sol بـ59. الفجوة مع القمة ست أو سبع نقاط. والفجوة من حيث بدأت ميتا العام هي إحدى عشرة نقطة. وما إذا كانت ستُغلق يعتمد على ما إذا كان الإيقاع سيستمر، وميتا حاليًا على دورة إصدار كل أربعة أسابيع.

لكن التعادل في مؤشر مركب ليس تعادلًا في الوظيفة، ومن الجدير توضيح ما الذي يقرره الرقم 54 وما لا يقرره. إنه يقرر أن Muse Spark 1.2 يُصنَّف في نفس مستوى Grok 4.5 من حيث القدرة الكلية. لكنه لا يخبرك أيهما يكتب تصحيحات أفضل، لأن المؤشر الفرعي للبرمجة الذي كان سيجيب على هذا السؤال لم يُنشر بعد للإصدار 1.2.

أرقام ميتا البرمجية، اقرأ بعناية

تصدّر إعلان Meta على ثلاثة رسوم بيانية. في عمليات تشغيله الخاصة، أُبلغ عنه كـ pass@1 عبر خمس محاولات مع اقتران كل نموذج منافس بمنتج وكيل خاص به:

Terminal-Bench 2.1 — 82.9% لـ Muse Spark 1.2، مقارنةً بـ 76.2% للإصدار 1.1. ويأتي Claude Opus 5 في المقدمة بنسبة 86.7%.

DeepSWE v1.1 — 59.3%، بارتفاع من 53.0%.

معيار البرمجة الداخلي لـ Meta — 70.6%، ارتفاعًا من 68.3%.

{{1}}الفروقات هي الجزء الجدير بالثقة.{{/1}} زيادة قدرها 6.7 نقطة في Terminal-Bench و6.3 في DeepSWE، {{2}}قِيست بالطريقة نفسها وعلى المنصة نفسها من قبل الفريق نفسه وبفارق شهر،{{/2}} {{3}}هي قراءة معقولة لمقدار تحسّن الإصدار 1.2 على 1.1 في المجال الذي كانت ميتا تحسّنه.{{/3}} {{4}}أما الترتيب بين البائعين فهو الجزء الذي يجب التعامل معه بتحفّظ:{{/4}} {{5}}إذ إن إقران منصات الاختبار متغير حرّ كبير،{{/5}} {{6}}والمختبر الذي يضبط منصته الخاصة إلى جانب نموذجه الخاص ليس في موقع يسمح له بضبط منصات الآخرين بالجودة نفسها.{{/6}} {{7}}كانت ميتا في المركز الثاني على شريحتها الخاصة،{{/7}} {{8}}وهذا على الأقل ليس الشكل المألوف لمعايير البائعين،{{/8}} {{9}}لكن لا جهة خارجية أعادت إنتاج أيٍّ منها حتى وقت كتابة هذه السطور.{{/9}}

قائمة الأسعار الثانية

الشيء الأكثر تأثيرًا في هذا الإصدار ليس في مخططات القياس المعيارية. يأتي Muse Spark 1.2 بقائمتي أسعار.

المستوى القياسي — 1.25 دولار لكل مليون رمز إدخال، و0.15 دولار لكل مليون عند إصابة الكاش، و4.25 دولار لكل مليون رمز إخراج. دون تغيير عن الإصدار 1.1، حتى السنت. حد المعدل حوالي 3,000 طلب في الدقيقة. يُحتسب الاستناد إلى البحث على الويب بشكل منفصل بمبلغ 2.50 دولار لكل ألف استعلام.

فئة المساهم — 0.10$ للإدخال، و0.002$ للإدخال المخزّن مؤقتًا، و0.20$ للإخراج. أي أنها أرخص بمقدار 12.5× على الإدخال وأرخص بمقدار 21.25× على الإخراج. ثمن الدخول هو الإذن لـ Meta بتدريب نماذج مستقبلية على حركة المرور الخاصة بك، وسقف معدل يبلغ 60 طلبًا في الدقيقة — أي 2% من الميزانية القياسية.

عند 0.10 دولار و0.20 دولار، ستُقدّم Muse Spark 1.2 أسعارًا أقل من كل نموذج قريب من الطليعة في السوق تقريبًا، بما في ذلك الطبقة الاقتصادية مفتوحة الأوزان التي تخسر أمامها في السعر في الحالات الأخرى. هذا هو الرقم المثير للاهتمام في هذا الإطلاق، وهو ليس قرار تسعير حقًا. ستون طلبًا في الدقيقة يستبعد معظم أنماط التوزيع الإنتاجية من تلقاء نفسه، لذا تستهدف الطبقة التجريب والعمل في الفرق الصغيرة بدلًا من الخدمة الفعلية. وعبارة "قد ندرّب على حركة البيانات الخاصة بك" هي سؤال لمن يوقّع على حوكمة البيانات في مؤسستك، وليس لمن يختار النماذج. تعامل معها كمراجعة قانونية بخصم مرفق، وليس كوحدة تخزين أرخص (SKU).

ما تكلفة إنتاج الـ54

Muse Spark 1.2 and Muse Code-4

تنشر Artificial Analysis تكلفة عمليات التقييم الخاصة بها، وفي هذا العمود تظهر ملامح Muse Spark 1.2. بلغت تكلفة إكمال مجموعة المعايير التسعة 637.85 دولارًا واستهلكت 95 مليون رمز إخراج، مقابل 548.07 دولارًا و94 مليونًا لـ Muse Spark 1.1 — وبأسعار متطابقة لكل رمز. النسبة الإضافية البالغة 16% هي تفكير خالص.

أرقام زمن الاستجابة تتحرك بنفس الطريقة. عند القياس على xhigh، يكون الوقت حتى أول رمز 26.12 ثانية للإصدار 1.2 مقابل 2.90 ثانية للإصدار 1.1، وتنخفض سرعة الإخراج من 213.5 إلى 165.0 رمزًا في الثانية. اشترت Meta ثلاث نقاط مؤشر بوقت التفكير، وتصميم الاستدلال الإلزامي يعني أنك لا تستطيع رفض الشراء — بل فقط تختار مقدار ما تشتريه منه.

ذلك الرقم البالغ 26 ثانية سيُقتبس بشكل خاطئ، لذا إليك التصحيح مسبقًا: {{1}}إنه قياس عند أعلى مستوى جهد يوفره النموذج، وتعمل واجهة API افتراضيًا على المستوى المتوسط{{/1}}. وكمرجع من حركة المرور الفعلية وليس من بيئة اختبار معيارية، {{2}}يُظهر Muse Spark 1.1 المُقدَّم عبر OrcaRouter — مهما كان مستوى الجهد الذي يطلبه المستخدمون فعليًا — زمن p50 للوصول إلى أول رمز على مدى 7 أيام يبلغ 1.84 ثانية وp95 يبلغ 6.00 ثانية{{/2}}، بمعدل 519 رمزًا في الثانية ومعدل خطأ صفري. {{3}}زمن الاستجابة في الاختبارات المعيارية عند أقصى جهد وزمن الاستجابة في الإنتاج عند الجهد الافتراضي كميتان مختلفتان{{/3}}، وعادةً ما يختلفان بمرتبة من المراتب. {{4}}اقرأ 26.12 ثانية على أنها السقف الأعلى للتفكير العميق، وليس ما سيشعر به الطلب فعليًا{{/4}}.

أين {{1}}يمكنك الاتصال به{{/1}} {{2}}اليوم{{/2}}

يتم تقديم Muse Spark 1.2 عبر واجهة برمجة تطبيقات النماذج الخاصة بـ Meta، ولا مكان آخر حتى وقت كتابة هذه السطور — فلا يوجد مستودع له على Hugging Face وليس ضمن كتالوج OrcaRouter. وهذا ما سيعمل إعلان 10 أغسطس على تغييره: تقول Meta إن الأوزان ستُفتح "في الأسابيع المقبلة"، وبمجرد حدوث ذلك، ينتقل سؤال التوافر من "أين يُقدَّم؟" إلى "أي الأوزان، وتحت أي ترخيص، وفي أي بيئات تشغيل؟". أمّا Muse Spark 1.1 فيوجد في كتالوج OrcaRouter بسعر 1.25 دولار و4.25 دولار — وهما الرقمان اللذان تفرضهما Meta، لأن OrcaRouter لا يضيف أي هامش ربح ويمرر سعر القائمة من المزود مباشرة.

هذا الأمر أكثر أهمية للمقارنة منه للنموذج نفسه. إذا كنت تبني نموذج تكلفة لهذا الإصدار، فإن النماذج التي ستقارنها به — Claude Opus 5، وClaude Fable 5، وGPT-5.6 Sol، وGrok 4.5، وDeepSeek V4 Flash — تقع خلف مفتاح واحد بسعر القائمة، لذا فإن الرقم في جدول البيانات هو الرقم في الفاتورة، وأي تخفيض من مزوّد الخدمة يسري في اليوم نفسه وليس بعد التجديد. وبالنسبة إلى Muse Spark 1.2 تحديدًا، الإجابة اليوم هي نقطة نهاية Meta، وعقد ثانٍ، وفاتورة منفصلة — وبمجرد توفّر الأوزان، يصبح التثبيت الذاتي خيارًا ثالثًا.

ما الذي تغير في العاشر من أغسطس؟

بعد خمسة أيام من الإصدار، انقلب موقف Meta تجاه منتجها الرئيسي. في إعلان بتاريخ 10 أغسطس، قالت Meta إنها ستفتح أوزان Muse Spark 1.2 «في الأسابيع القادمة»، مما يجعله أول إصدار من Muse Spark يمكن لفريق تشغيله بنفسه. البيان مجرد تصريح من الإدارة التنفيذية، وليس إصدارًا فعليًا: لا يوجد مستودع على Hugging Face حتى الآن، والتاريخ الدقيق وعدد المعاملات والترخيص كلها غير مؤكدة.

الرهانات هي سباق أوزان النماذج الحدودية. يسجّل نموذج Muse Spark 1.2 درجة 54 على مؤشر Artificial Analysis Intelligence Index — وهو أعلى من كل نموذج أمريكي مفتوح الأوزان قابل للتنزيل حاليًا — لذا إذا جاءت الأوزان كما وُعد، فسيكون أقوى منافس أمريكي مفتوح الأوزان للمختبرات الصينية. وهذا هو الإطار الذي جادل فيه زوكربيرغ مطولًا في 10 أغسطس في مقال من 6500 كلمة اتهم فيه القيود الأمريكية على بيانات التدريب بتسليم زمام المبادرة في الأوزان المفتوحة إلى المختبرات الأجنبية. ولهذا التحول أول شحنة بالفعل: نموذج Muse Glimmer، وهو نموذج من 30 مليار معامل صدر في اليوم نفسه بموجب رخصة Apache 2.0، ومُقطَّر من Muse Spark ومُصمَّم لأعباء العمل الوكيلية المحلية. وتضعه معايير Meta الخاصة في مقدمة نماذج Google Gemma4-31B وQwen3.6-27B في مهام الوكلاء؛ وهذه الأرقام ناتجة عن تشغيل البائع ولم تُستنسخ حتى الآن.

ما الذي لم يجبه الإعلان

لا يوجد رقم مستقل للترميز.تنشر Artificial Analysis مؤشرًا مركبًا للإصدار 1.2، لكنها لم تنشر بعد المؤشرات الفرعية للترميز والعمل الوكيلي التي نشرتها للإصدار 1.1 (71.3 و37.5 على التوالي). وبما أن العمل الوكيلي كان أضعف جوانب الإصدار 1.1 بفارق كبير، والترميز الوكيلي هو بالضبط ما يدّعي الإصدار 1.2 أنه أصلحه، فإن هذا الرقم هو ما سيحسم أمر الإصدار.

لا يوجد تكرار لنتائج الاختبار. كل رقم في الإعلان هو من تشغيل Meta. لم ينشر أحد حتى الآن نتائج Muse Spark 1.2 من منصة محايدة.

لا يوجد تحقق متعدد الوسائط. تعلن قائمة Muse Spark عن دعم إدخال النصوص والصور والفيديو والصوت وPDF. يغطي التقييم المستقل النصوص والصور. انتقلت رسائل Meta 1.2 بشكل شبه كامل إلى العمل البرمجي، وحالة الاستخدام متعددة الوسائط 1.1 التي بيعت صراحةً ليس خلفها الآن أي تسويق أو قياس.

لا يوجد سجل للإنتاجية. لا يزال حجم البيانات على نقطة النهاية منخفضًا جدًا بحيث لا يمكن لإحصائيات زمن الاستجابة المتحركة المعتادة أن تظهر.

ما الذي يجب مشاهدته خلال الأسابيع الأربعة القادمة

أربعة أمور ستحدد ما إذا كان هذا الإصدار كما تصفه ميتا. الأول: مؤشر وكيلي مستقل للإصدار 1.2 — إذا كان المؤشر الفرعي الذي بلغ 37.5 في 1.1 قد تحرك بشكل جوهري، فإن الطرح البرمجي حقيقي. الثاني: هل يعيد أي شخص إنتاج نتيجة Terminal-Bench خارج Muse Code؟ النموذج الذي لا يتميّز إلا داخل إطار اختباره الخاص هو منتج، وليس قدرة. الثالث: ما الذي سيحدث لشريحة المساهمين: إذا خُفّف سقف الـ60 طلبًا، فإن نموذجًا قريبًا من النماذج الحدودية بسعر $0.10 للإدخال و$0.20 للإخراج يغيّر حسابات شريحة الميزانية بطريقة لن تحققها زيادة بمقدار ثلاث نقاط في المؤشر أبدًا. الرابع: وعد الأوزان: تقول ميتا إن أوزان Muse Spark 1.2 ستُفتح 'في الأسابيع المقبلة'، وما إذا كان المستودع سيُتاح ضمن هذا الإطار الزمني — تحت أي ترخيص، وبأي سرعة ستتبناه بيئات التشغيل المحلية — سيحدد ما إذا كان التحول إلى الأوزان المفتوحة حقيقيًا.

وإذا استمر الإيقاع، فإن Muse Spark 1.3 من المقرر إصداره في أوائل سبتمبر. بناءً على هذا الدليل، الرقم الذي يجب مراقبته عند صدوره ليس درجة المؤشر. بل ما إذا كانت Meta تستطيع إضافة قدرة دون إضافة عشرين ثانية أخرى من التفكير إلى مقدمة كل طلب. الثمرة الأولى لهذا التحول قد خرجت بالفعل: Muse Glimmer، نموذج مفتوح الأوزان بمعاملات 30 مليار، أصدرته Meta في 10 أغسطس بموجب رخصة Apache 2.0، مصمم لتشغيل الوكلاء محليًا — أقرب معاينة حتى الآن لما سيبدو عليه Muse Spark 1.2 المفتوح.

مقارنات في هذه المقالة3

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا