Muse Spark 1.2 مقابل Muse Spark 1.1-1
Guides & Insights

مقارنة بين Muse Spark 1.2 وMuse Spark 1.1: هل يجب عليك الترقية؟

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

استبدلت Meta Muse Spark 1.1 مع Muse Spark 1.2 في 5 أغسطس 2026 دون تغيير السعر، أو نافذة السياق، أو قائمة الوسائط، أو المعلمات المدعومة، أو قرص الاستدلال. وبالتالي يبدو الترحيل مجانيًا — نفس عائلة سلسلة النماذج، نفس الفوترة، لا شيء لإعادة التفاوض. لكنه ليس مجانيًا. القياس المستقل يضع زمن أول توكن للنسخة الجديدة عند 26.12 ثانية مقابل 2.90 للنسخة القديمة، ومعدل الإخراج المستمر عند 165 توكنًا في الثانية مقابل 213.5. أنت تشتري ثلاث نقاط من الذكاء المُقاس مع انتظار يبلغ نحو تسعة أضعاف قبل أن يعود أي شيء.

ما إذا كان ذلك يستحق القيام به يعتمد بشكل شبه كامل على المدة التي تستغرقها مهامك. إليك ما يختلف فعليًا، وما بقي متطابقًا، وما لا يمكن لأحد أن يخبرك به بعد.

القرار في أربعة أسطر

• مؤشر الذكاء: 51 → 54، تم قياسه بشكل مستقل بواسطة Artificial Analysis عند إعداد xhigh الخاص بكل إصدار.

• الوقت حتى أول توكن: 2.90s → 26.12s، نفس المصدر، نفس الظروف.

• تكلفة تشغيل نفس مجموعة الاختبارات المعيارية: $548.07 → $637.85، بنفس التسعير لكل رمز. الزيادة البالغة 16% هي مجرد حرق للرموز.

• كل ما يسأل عنه نموذج المشتريات: دون تغيير.

Muse Spark 1.2 vs Muse Spark 1.1-2

ما هو المطابق حقًا

يستحق هذا الأمر أن يُذكَر، لأنه السبب الذي يجعل الترحيل يبدو بسيطًا على الورق، ولأن الاختلاف الذي لا وجود له هو اختلاف لا تحتاج إلى اختباره.

السعر — $1.25 لكل مليون رمز إدخال، و$4.25 لكل مليون رمز إخراج، و$0.15 لكل مليون عند إصابة ذاكرة التخزين المؤقت، و$2.50 لكل ألف عملية بحث ويب مدمجة. كل هذه الأرقام متطابقة في كلا الإصدارين.

السياق — 1,048,576 توكنًا على كليهما، مع عدم وجود مستوى رسوم إضافية للسياق الطويل على أي منهما.

الأنماط — النصوص والصور والفيديو والصوت وPDF كمدخلات؛ والنصوص كمخرجات. تعرض كلتا القائمتين نفس أنواع الإدخال الخمسة.

مقياس التفكير — إلزامي في كلا الإصدارين، بخمسة مستويات (أدنى، منخفض، متوسط، مرتفع، مرتفع جدًا)، والإعداد الافتراضي هو المتوسط في كليهما. لا يوجد إعداد في أيٍّ من الإصدارين يعطّل التفكير.

المعلمات — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. قوائم متطابقة.

الخدمة — مزوّد واحد، هو Meta نفسه، على كلاهما. لا مضيفين من جهات خارجية، ولا متغيرات تكميم.

السعر المختلط — تقدّر Artificial Analysis كلاهما بمبلغ 0.78 دولار لكل مليون رمز على أساس ترجيحها المختلط، وهو ما تتوقعه من بطاقات أسعار متطابقة.

إذا كنت تأمل أن تأتي الترقية مع المزيد من السياق، أو ضمان لطول الإكمال، أو كاش أرخص، فلم يحدث ذلك. هذا إصدار أوزان وما بعد تدريب مع بطاقة أسعار منسوخة ولصقها من الإصدار السابق.

ما الذي تحرك فعليًا

تعد Artificial Analysis حاليًا الطرف المستقل الوحيد الذي قام بتقييم كلا الإصدارين، وقد قامت بتقييمهما بأعلى مستوى جهد استدلالي، لذا فإن المقارنة تتم على أساس متكافئ.

Intelligence Index — 51 لـ 1.1 (المرتبة #22 من أصل 185) إلى 54 لـ 1.2 (المرتبة #13). تسعة مراكز على لوحة الترتيب التي يبلغ وسيط الفئة فيها 32، لذا فإن التحسن يحقق مركزًا حقيقيًا، وليس مجرد رقم عشري.

الوقت حتى أول رمز — من 2.90 ثانية إلى 26.12 ثانية. هذا هو الانحدار الرئيسي وهو ليس هامشيًا.

سرعة الإخراج — من 213.5 إلى 165.0 توكنًا في الثانية. لا تزال تحتل المرتبة 16 من بين 185 نموذجًا، وما تزال Artificial Analysis تصفها بأنها "سريعة بشكل ملحوظ"، لكنها أبطأ بنسبة 23% من النموذج الذي تحل محله.

الإسهاب — 94 مليون رمز إخراج للوصول إلى الفهرس، مقابل 95 مليون. دون تغيير فعليًا، وكلاهما أعلى بنحو 45% من الوسيط البالغ 65 مليون.

إجمالي إنفاق التقييم — من 548.07$ إلى 637.85$. وبما أن الإسهاب بالكاد تغيّر ولم تتغير الأسعار إطلاقًا، فإن تلك الزيادة البالغة 16% مصدرها شيء آخر غير المخرجات المرئية: مسارات استدلال داخلي أطول، أو المزيد من إعادة المحاولات، أو المزيد من جولات الأدوات لكل مهمة.

النمط متماسك. لم تجعل Meta النموذج أرخص أو أسرع أو أكبر حجمًا. بل جعلته يتأنى لفترة أطول قبل الالتزام، ويظهر هذا التأني الإضافي ككمون في الاستجابة، وتدفق أبطأ قليلًا، وفاتورة أعلى بنسبة 16% مقابل نفس العمل. ثلاث نقاط مؤشر هو ثمن ذلك.

ما مدى سوء زمن الاستجابة حقًا

سيتم اقتباس الرقم 26.12 ثانية خارج السياق، لذا تعامل معه بشكل صحيح: يتم قياسه عند xhigh، وهو المستوى الأغلى من بين خمسة مستويات للجهد، على مجموعة اختبارات معيارية مصممة لتكون صعبة. تكون واجهة البرمجة افتراضيًا على medium.

لتكوين فكرة عما يعنيه الإعداد الافتراضي فعليًا، يُظهر Muse Spark 1.1 على OrcaRouter — الذي يخدم متصلين حقيقيين بأي مستوى جهد يطلبونه — زمن p50 حتى أول توكن هو 1.84 ثانية، وزمن p95 هو 6.00 ثوانٍعلى مدار أسبوع متجدد. هذه بيانات من الإنتاج الفعلي بمستويات جهد الإنتاج، وهي أقل من الرقم المرجعي بأكثر من مرتبة من حيث الحجم. لا تتوفر بعد أي بيانات تليمترية إنتاجية للإصدار 1.2.

Muse Spark 1.2 vs Muse Spark 1.1-3

إذن القراءة الصادقة ليست «يستغرق 1.2 26 ثانية للرد»، بل هي: في الإعداد الذي يكسب فيه 1.2 نقاطه الإضافية الثلاث، يكلفك التوكن الأول 26 ثانية، وفي الإعداد نفسه كان النموذج القديم يكلفك ثلاثًا. إذا كنت تعمل بالفعل على إعداد xhigh — وهو بالضبط التكوين الذي يوجد فيه مكسب الذكاء — فهذا هو الرقم الذي ترثه. إذا كنت تعمل على إعداد متوسط أو أقل، فسترى شيئًا أقصر بكثير، وسترى أيضًا تحسنًا أقل.

هذا الاقتران هو الفخ الحقيقي في هذه الترقية. لا يمكنك الحصول على الذكاء دون التأمل، لأن التأمل هو مصدر الذكاء.

إعادة التموضع وراء الأرقام

لم تنشر Meta أي منشور إطلاق للإصدار 1.2 — فصفحة الإعلان عن Muse Spark لا تزال تصف الإصدار 1.1 — لكنها أعادت كتابة وصف المنتج، وتوضح إعادة الكتابة هذه المقايضة.

تم بيع Muse Spark 1.1 كنموذج استدلال متعدد الوسائط يتميز بسطح إدخال واسع بشكل غير معتاد، ويستهدف "وكلاء متعددي الوسائط، والبحث العميق عبر الوسائط المختلطة، وتحليل السياقات الطويلة": تقارير طويلة، ومكتبات وسائط، وتسجيلات وفيديو إلى جانب النص.

وصف Muse Spark 1.2 يُسقط كل ذلك تقريبًا ويذكر هندسة البرمجيات بدلاً من ذلك — إعادة هيكلة متعددة الملفات، وجلسات تصحيح أخطاء مطولة، وتوليد كامل للمستودع — ثم يضيف ادعاءً صريحًا حول تعدد الوكلاء: يمكن للنموذج أن يعمل كالوكيل الأساسي الذي يجمع السياق ويخطط ويوزع المهام، أو كعامل فرعي ينفذ بالتوازي تحته. كما يدعي أن التخزين المؤقت للمطالبات يمكن أن يخفض التكلفة الفعلية بنسبة 60–80% اعتمادًا على مقدار تكرار السياق بين الاستدعاءات. هذا الرقم الأخير هو تقدير من Meta وليس نتيجة مقاسة، على الرغم من أن معدل التخزين المؤقت البالغ 0.15 دولار يجعله معقولًا من الناحية الحسابية.

انظر إلى تراجع زمن الاستجابة مقارنةً بإعادة التموضع تلك، وسيتوقف عن أن يبدو كخطأ. لا أحد يُعيد هيكلة اثني عشر ملفًا ليكترث بـ 26 ثانية من التخطيط. اختارت Meta عميلًا، وليس هو ذاك الذي بِيعت له نسخة 1.1.

ما الذي لا يزال موجودًا في 1.1 وغير موجود في 1.2؟

أربعة أسابيع من الوجود ليست كافية لتجميع سجل حافل، وفي ثلاث نواحٍ ملموسة يُعتبر النموذج الأقدم حالياً المنتج الأكثر توثيقاً.

سجل في الساحة.تمتلك Muse Spark 1.1 سجلاً كبيرًا في Design Arena: 1334 Elo في المرتبة 5 في تطوير الألعاب، و1334 في المرتبة 7 في مكونات واجهة المستخدم، و1320 في المرتبة 3 في فن ASCII، و1318 في تصوير البيانات، و1309 في فئات الكود العامة، بالإضافة إلى سلم agents-arena كامل يغطي تطبيقات الويب وشرائح HTML وتطوير ألعاب Godot. أما Muse Spark 1.2 فليس لديها أي إدخالات على الإطلاق. وعلى المحور الذي تسوق له Meta الآن بأقصى جهد، لا توجد أي بيانات مواجهة مباشرة للنموذج الجديد.

نتائج المؤشرات الفرعية. تنشر Artificial Analysis مؤشر برمجة قدره 71.3 ومؤشرًا وكيليًا قدره 37.5 للإصدار 1.1. ولا يوجد مقابل منشور للإصدار 1.2. وبما أن النتيجة الوكيلة كانت أضعف أبعاد الإصدار 1.1 بفارق كبير، والقدرة الوكيلة هي بالضبط ما يدّعي الإصدار 1.2 تحسينه، فإن هذا الرقم هو ما سيحسم مسألة الترقية — وهو غير موجود بعد.

القياس عن بُعد للإنتاج. الإصدار 1.1 خلفه أسبوع من بيانات زمن الاستجابة الفعلية p50 وp95 و4.4 مليون رمز من حركة المرور الحية على OrcaRouter. الإصدار 1.2 لا يملك أيًّا من ذلك؛ نقطة النهاية الخاصة به حاليًا لا تُبلغ عن أي إحصائيات لزمن الاستجابة أو الإنتاجية لأن حجم الحركة منخفض جدًا بحيث لا يمكن أخذ عينات منه.

مكان لاستئجاره بخلاف Meta. يتوفر Muse Spark 1.1 في كتالوج OrcaRouter بسعر 1.25 دولار و4.25 دولار — وهو سعر Meta الرسمي، يُمرَّر بهامش ربح 0%. أما Muse Spark 1.2 فغير متوفر هناك بعد، لذا فهو اليوم تكامل مباشر مع Meta عبر مزود واحد وبدون مسار احتياطي.

Muse Spark 1.2 vs Muse Spark 1.1-4

لا يعني أي من هذا أن 1.2 أسوأ. بل يعني أن الدليل على 1.2 يتكوّن من درجة مركّبة واحدة من مُقيِّم واحد، بينما الدليل على 1.1 هو شهر من الساحات والمؤشرات الفرعية وحركة المرور المباشرة. يجب أن يؤثر هذا التباين على كيفية تنظيم عملية الترحيل، وليس على ما إذا كنت تحاول القيام بها.

قائمة فحص للترحيل قصيرة فعلاً

نظرًا لأن بطاقة الأسعار وسطح المعلمات متطابقان، فإن التبديل هو تغيير في سلسلة النموذج. العمل يتمثل في التحقق من الأشياء الثلاثة التي تحركت بالفعل.

قم بقياس الوقت حتى أول توكن بنفسك عند إعداد الجهد الذي تستخدمه. لا تقبل أيًّا من الرقمين 2.90 ثانية أو 26.12 ثانية. شغّل استفساراتك الفعلية بأي reasoning_effort تمرره فعليًا وقارن مباشرةً. هذا هو الرقم الوحيد الذي يمكن أن يُفشل الترحيل تمامًا.

تحقق من إعدادات المهلة الزمنية والبث. ستؤدي الزيادة بمقدار 9x في زمن استجابة الرمز الأول عند الجهد العالي إلى تجاوز مهلات العميل التي تم ضبطها وفقًا للإصدار 1.1، وستجعل أي تكامل غير قائم على البث يبدو وكأنه توقف تام.

أعد حساب التكلفة من عدد الرموز المقاسة، وليس من بطاقة الأسعار.الأسعار متطابقة، لذا أي تغيير في التكلفة هو سلوكي. لاحظت Artificial Analysis زيادة في الإنفاق بنسبة 16% لنفس العمل؛ ما إذا كنت ترى ذلك يعتمد على مزيج مهامك.

تحقق من استقرار مفتاح التخزين المؤقت أولاً. مع بادئة مستقرة من 60,000 توكن، تنخفض خطوة الوكيل النموذجية من حوالي 8.8 سنتًا إلى حوالي 2.2 سنتًا في أي من النسختين. هذا التأرجح بنسبة 75% أكبر من أي تأثير يحدثه تغيير الإصدار، وهو بالكامل تحت سيطرتك.

أعد اختبار مسارات الصوت والفيديو بشكل صريح. تعلن كلتا القائمتين عن نفس وسائط الإدخال الخمس، لكن بطاقة مواصفات Artificial Analysis للإصدار 1.2 تسجّل النص والصورة فقط كما تم تقييمهما. أعادت Meta صياغة العرض بعيدًا عن العمل متعدد الوسائط. لم يتحقق أي طرف مستقل من استمرار هذه القدرة.

أبقِ الإصدار 1.1 متاحًا كخيار احتياطي. تشغيل كلاهما خلف مفتاح واحد يعني أن التراجع هو تغيير في الإعدادات وليس حادثًا، ويتيح لك إجراء اختبار A/B بينهما على حركة المرور الحية بدلًا من الجدال حول معيار الأداء.

من يتحرك الآن، من ينتظر

تحرّك الآن إذا كنت تشغّل وكلاء برمجة طويلة الأفق بجهد استدلال عالٍ. فالمهام تستغرق دقائق بالفعل، وتختفي كلفة زمن الاستجابة داخل ذلك، ويُقاس مكسب الذكاء من طرف ثالث بدلًا من أن تدّعيه ميتا، وثلاث نقاط مؤشر تمثل قفزة ملموسة في هذه الفئة — تسعة مراكز على لوحة تضم 185 نموذجًا.

انتظرإذا كان أي شيء تقدمه تفاعليًا. لا يوجد إعداد تكون فيه 1.2 أكثر استجابة من 1.1، والاستدلال الإجباري يعني أنك لا تستطيع استعادة الاستجابة بتعطيل التفكير. تظل النسخة 1.1 هي النموذج الأسرع عند كل مستوى جهد، وتكلفتها هي نفسها تمامًا.

انتظر إذا كان عبء عملك هو تحليل الوسائط المختلطة — حالة الاستخدام للتقارير الطويلة والفيديو والصوت التي صُمم من أجلها الإصدار 1.1 وسُوّق لها صراحةً. توقفت Meta عن الإعلان عنه، والتقييم المستقل الوحيد للإصدار 1.2 يغطي النصوص والصور فقط. قد تكون القدرة ما تزال سليمة؛ ببساطة لا يوجد دليل على أي من الاتجاهين، ولدى 1.1 شهر من ذلك.

انتظر إذا كنت بحاجة إلى بيانات الحلبة. إن النموذج الذي يُسوَّق على أنه يولّد مستودعات كاملة، دون أي إدخالات في Design Arena ودون مؤشر فرعي وكيلي منشور، يطلب منك أن تصدّق كلام Meta بشأن ما غيّرته. امنحه ثلاثة أو أربعة أسابيع ولن يعود ذلك صحيحًا — وعندها يصبح هذا القرار أسهل بكثير في اتخاذه بناءً على الأدلة بدلًا من رقم مركّب واحد.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube