
Muse Code مقابل Muse Spark 1.1: ما الذي يقيسه تحديث Meta البالغ 6.7 نقطة فعليًا
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 لكل مليون رمز · 28 tok/s
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1323 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 2770 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
قم بعملية الطرح أولاً. يسجّل العرض التقديمي لإطلاق Meta لنموذج Muse Code — وكيل البرمجة الطرفي الذي أصدرته في 5 أغسطس 2026 — نتيجة 82.9% على Terminal-Bench 2.1، ويعزو ذلك إلى مكسب بمقدار 6.7 نقاط مقارنة بـMuse Spark 1.1، النموذج الذي يدفع معظم قراء هذا المقال ثمنه بالفعل. اطرح 6.7 من 82.9 لتحصل على 76.2 — وهو رقم لم تنشره Meta، لكنه بالضبط الدرجة الموجودة على لوحة المتصدرين العامة لـ Terminal-Bench 2.1 لنموذج Muse Spark 1.1 بجهد xhigh، المُقدَّم في يوليو، والذي أُجري باستخدام منصة mini-SWE-agent من جامعة برينستون.
تلك المصادفة هي الحقيقة الأكثر فائدة في هذه المقارنة، لأن mini-SWE-agent عبارة عن هيكل بسيط عمدًا — بضعة مئات من الأسطر، لا وكلاء فرعيين دائمين، لا سجل أحداث، لا مهارات تخطيط. نتيجة Meta البالغة 82.9% هي Muse Spark 1.2الذي يعمل داخل وكيل مصمم خصيصًا قامت Meta بتدريب النموذج معه. إذا كان الفارق البالغ 6.7 نقطة يمتد بين هذين الصفين، فإن التحسن الجيلي الأبرز هو ترقية للنموذج وترقية للهيكل مجمّعة في رقم واحد، ولم تنشر Meta أي شيء يفصل بينهما.
لم تذكر Meta أي منصة اختبار استخدمتها لخط الأساس 1.1، لذا فإن التطابق يشير إلى ذلك دون أن يكون مثبتًا. لكنه يعيد صياغة القرار أمام أي شخص يستدعي حاليًا Muse Spark 1.1 عبر واجهة برمجة تطبيقات (API)، وهو الإصدار الصادق من هذه المواجهة: أنت لا تختار بين نموذجين. أنت تختار بين نموذج تقوده بنفسك وكيل يقود نموذجًا أحدث نيابةً عنك، وواحد فقط من هذين الأمرين تم قياسه بواسطة شخص آخر غير Meta.
هذه ليست من الفئة نفسها، وورقة المواصفات تُشير إلى ذلك.
نصف الالتباس حول هذا الاقتران ينبع من التعامل مع Muse Code كإصدار نموذج. ليس كذلك. إنها أداة CLI، وهذا ما يطلق عليه Muse Spark 1.2.
• ما هو — Muse Code هو وكيل طرفية يُثبَّت بسطر واحد (curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1 هو نقطة نهاية نموذج تستدعيها من كودك الخاص أو من إطار وكيلك الخاص أو من أي واجهة سطر أوامر تقبل عنوان URL أساسي مخصص.
• النموذج الأساسي — يشغّل Muse Code إصدار Muse Spark 1.2، وهو مدرَّب بالاشتراك مع الوكيل؛ أما Muse Spark 1.1 فهو إصدار يوليو، وما يزال مُقدَّمًا ومدرجًا.
• أين يعمل — Muse Code مخصص لنظامي macOS وLinux فقط، يعمل عبر الطرفية فقط، دون واجهة رسومية ودون إضافة لبيئة التطوير المتكاملة؛ أما Muse Spark 1.1 فيعمل في أي مكان يدعم HTTPS، بما في ذلك Windows.
• المدخلات — يستخدم Muse Code مستودعًا وموجهًا؛ ويقبل Muse Spark 1.1 النصوص والصور والفيديو والصوت ومستندات PDF في سياق واحد يتسع لـ1,048,576 رمزًا ويُرجع نصًا.
• الحالةMuse Code هي نسخة تجريبية عامة ومُعلّمة على هذا النحو؛ Muse Spark 1.1 متاحة للعامة منذ يوليو 2026 وتحمل حركة إنتاج فعلية.
• السعر الرسمي— كلاهما يُفوتر عبر Meta Model API بسعر $1.25 لكل مليون رمز إدخال، و$0.15 للإدخال المخزّن مؤقتًا، و$4.25 للإخراج على المستوى القياسي. بطاقة الأسعار هي نفس بطاقة الأسعار.
السطر الأخير هو ما يفاجئ الناس، وهو يدحض الافتراض البديهي. إن اعتماد Muse Code لا يكلفك أكثر لكل توكن مما تشغّله بالفعل. ما يكلفه يُقاس بعملات أخرى — دعم المنصات، وزمن الاستجابة، والأنماط، وفي الطبقة الرخيصة، شفرة مصدرك. تلك هي المحاور الأربعة التي تستحق النقاش.
المعيار الذي يتباعدان فيه، يُقرأ مع تثبيت الحزام.

نشرت Meta فارقين جيليين مقارنةً بـ Muse Spark 1.1: +6.7 نقاط على Terminal-Bench 2.1 و+6.3 على DeepSWE 1.1. كلا الفارقين مُبلَغ من المورّد، وكلاهما مستمد من رسوم بيانية نُشرت كصور دون وصف للمنهجية، ولم يقم طرف ثالث بإعادة إنتاج أيٍّ منهما. وباستبعادهما، فإن خطوط الأساس الضمنية لـ Meta للإصدار 1.1 تبلغ تقريبًا 76.2% و53.0%.
الآن ضع نسبة 82.9% التي حققتها Meta بجوار اللوحة التي لم تستشهد بها. لوحة المتصدرين العامة لـ Terminal-Bench 2.1، وقت كتابة هذا المقال، تُظهر Claude Code مقترنًا بـ Claude Fable 5 بنسبة 83.8% ± 1.2%، وCodex مع GPT-5.5 بنسبة 83.1% ± 1.1%، وTerminus 2 مع Claude Fable 5 بنسبة 80.4%، وCursor CLI مع Grok 4.5 بنسبة 79.3%، وmini-SWE-agent مع Muse Spark 1.1 بنسبة 76.2% في المركز الثامن. النسبة التي أعلنتها Muse Code ذاتيًا والبالغة 82.9% كانت ستحتل المركز الثالث — خلف زوجين من العامل والنموذج لا يظهران في أي مكان في عرض Meta، الذي يقارن بدلاً من ذلك مع Claude Opus 5 بنسبة 86.7%، GPT-5.6 Terra بنسبة 81.8% وGrok 4.5 بنسبة 81.6% في عمليات منفصلة بأقصى جهد.

لوحتا صدارة، معيارٌ واحد، أرقامٌ لا تتطابق — ومقياسٌ ثالث مختلفٌ كليًا إذا نظرت إلى Artificial Analysis، التي يبلغ تقييمُها المستقل لمعيار Terminal-Bench v2.1 ذروتَه عند نحو 89.5% لنموذج GPT-5.6 Sol مقابل سقفٍ يبلغ 83.8% على لوحة الصدارة العامة. لا تكذب أيٌّ من هذه الأطراف. كل صفٍّ في Terminal-Bench يمثّل درجةً لمنصةِ تقييم، إلى جانب نموذج، وإعدادِ جهدٍ، وحصةٍ حسابية؛ وتغييرُ أيٍّ من هذه العناصر يحرّك النتيجةَ بأكثر من الفارق الكامل الذي تزعم Meta أنه يمثّل جيلًا كاملًا.
ولهذا السبب، فإن الرقم المثير للاهتمام على اللوحة العامة ليس عمود الدقة، بل عمود التكلفة. أنهى Muse Spark 1.1 تشغيله بنسبة 76.2% مقابل $198.05. اشترى Claude Code مع Claude Fable 5 دقته البالغة 83.8% مقابل 552.67 دولارًا، ودفع Codex مع GPT-5.5 مبلغ 2,059.19 دولارًا مقابل 83.1%. وهذا يعني فرقًا قدره 7.6 نقاط في الدقة مقابل 2.8 ضعف التكلفة في الحالة الأولى، ونحو 10 أضعاف في الحالة الثانية — وذلك بقياس نفس المشغّل، على المهام نفسها، وتحت القواعد نفسها، وهو بالضبط المقارنة العادلة التي لا يوفّرها لك مخطط Meta. كما تخصم اللوحة نقاطًا للمهام التي حُلّت عبر استغلال البيئة؛ إذ لا يُظهر تقديم Muse Spark 1.1 أي خصم من هذا القبيل، بينما يحمل تشغيل Grok 4.5 في Cursor CLI خصمًا بمقدار 9 نقاط.
لم تنشر Meta أي رقم تكلفة لنسبتها 82.9%.
ما الذي يفعله Muse Spark 1.1 بالفعل ولا يستطيع Muse Code فعله
الطرح الخاص بـ Muse Code هو أن وكيلًا مدرَّبًا بشكل مشترك يتفوق على "غلاف عام حول نموذج خارجي" — صياغة Meta، وادعاء Meta، لم يختبره أي شخص آخر. إنه ادعاء معقول. كما أنه يستهدف فجوة صُمم Muse Spark 1.1 خصيصًا لسدها.
Muse Spark 1.1 يتواصل عبر بروتوكول Model Context Protocol بشكل أصلي، ويدير اتصالات MCP الخاصة به دون إطار خارجي، وينسّق أدوار الوكيل الأساسي والوكيل الفرعي داخليًا، ويعمّم بطريقة zero-shot على الأدوات الجديدة والمهارات المخصصة. أرقام الإطلاق التي أعلنتها Meta لهذا النموذج كانت أرقام استخدام الأدوات: 88.1 على MCP Atlas لاستخدام الأدوات على نطاق واسع — متقدمًا على 82.2 التي أبلغتها لـ Claude Opus 4.8 و 75.3 لـ GPT-5.5 — و 54.7 على JobBench. كلها أرقام مقدمة من المورّد، وكلها من يوليو، ولم تتم إعادة إنتاج أي منها بشكل مستقل. النقطة تظل قائمة على أي حال: 1.1 ليس نموذج محادثة أُلحق به وكيل. أدخله إلى OpenCode أو Cline أو أي CLI يقبل نقطة نهاية مخصصة، وستحصل على وكيل اليوم.
ثم هناك كل ما لا تستطيع بنية Muse Code لمسه من الناحية البنيوية. يستدل Muse Spark 1.1 على الصور والفيديو والصوت وملفات PDF في نافذة سياق واحدة. لا فائدة لوكيل برمجة طرفي من ذلك السطح ولا وسيلة لإظهاره. إذا كان عبء عملك نموذج تصميم يتحوّل إلى مكونات، أو مكالمة دعم تُنسخ وتُفرز، أو مواصفات من 400 صفحة تُراجَع بالتقاطع مع تنفيذ، فإن الأحدث هو الأقل قدرة — وقد انتقل تموضع Meta لجيل 1.2 من «البحث العميق متعدد الوسائط عبر الوسائط المختلطة» إلى إعادة هيكلة متعددة الملفات وتوليد مستودع كامل، دون أي نتيجة فيديو أو صوت منشورة لـ 1.2 من أي جهة.
عدم التماثل الحقيقي يسري في الاتجاه المعاكس، وهو خاصية وقت تشغيل لا خاصية قدرة. يُلحق Muse Code كل استدعاء نموذج وكل تشغيل أداة وكل موافقة وكل تعديل بسجل أحداث محلي، وهو ما تقول Meta إنه يجعل الجلسة مطابقة عند إعادة العرض وآمنة من إعادة التشغيل: اعطّلها فيستأنف الوكيل من حيث توقف بدلًا من إعادة اشتقاق سياقه. وكلاؤه الخلفيون يستمرون عبر الجلسة بدلًا من أن يُستحدثوا ويُهدموا مع كل مهمة فرعية. دليل Meta هو دراسة حالة واحدة — تشغيل استمر 24 ساعة وتضمّن أكثر من 1000 استدعاء أداة لتحسين نوى GPU على عتاد NVIDIA Hopper. لم يُنشر أي رقم تسريع، لذا فالمدة هي الادعاء. إذا سبق أن خسرت ترحيلًا استغرق تسع ساعات لأن الحاضنة نسيت ما كانت تفعله عند الخطوة 300، فهذا شيء تريده فعلًا، ولا قدر من دعم MCP في النموذج يمنحك إياه.
نفس سعر القائمة، حتى تقرأ الطبقة الثانية

نظرًا لأن الطبقة القياسية متطابقة على الجانبين، فإن الحجة المتعلقة بالتسعير في هذه المقارنة تنحصر بالكامل في الطبقة التي طرحتها Meta إلى جانب Muse Code. إن طبقة المساهمين تبلغ تكلفتها 0.10 دولار لكل مليون توكن إدخال، و0.002 دولار للإدخال المخزّن مؤقتًا، و0.20 دولار للإخراج — أي أرخص بـ12.5 مرة على الإدخال، و21 مرة على الإخراج، و75 مرة على الإدخال المخزّن مؤقتًا — مقابل إذن صريح لاستخدام مطالباتك ومخرجاتك لتدريب نماذج Meta المستقبلية. وتؤكد Meta أن حركة المرور عبر الطبقة القياسية لا تُستخدم بهذه الطريقة.
قم بتشغيل خطوة وكيل واقعية من خلال ذلك — 60,000 رمزًا من سياق المستودع داخلها، و3,000 رمزًا لخطة التصحيح خارجها —而那 خطوة ألف تكلف 87.75 دولارًا على الطبقة القياسية الباردة، و21.75 دولارًا عندما يضرب سياق المستودع ذاكرة التخزين المؤقت، و6.60 دولارًا على طبقة المساهم الباردة، و0.72 دولارًا على المساهم مع ذاكرة تخزين مؤقت دافئة. تشغيلة نواة ميتا الخاصة على مدار 24 ساعة تقارب تسعين دولارًا على الطبقة التي تحمي شفرتك، وأقل من دولار على الطبقة التي لا تحميها.
هذا ليس خيار فوترة. أوامر وكيل البرمجة هي قاعدة الأكواد البرمجية الخاصة بك — واجهات برمجة التطبيقات الداخلية، والتعليق الذي يشرح سبب وجود الحل المؤقت، وأيًا كان ما تحتويه بيانات الاختبار الخاصة بك. في مستودع مفتوح المصدر، تكون فئة المساهمين قريبة من المال المجاني. أما في المستودع الاحتكاري، فهو قرار ترخيص بيانات يرتدي ثياب الخصم، وينبغي أن يُعرض على مَن يوقّع على معالجة البيانات وليس على مَن يراقب فاتورة الخدمات السحابية. حددت Meta الخصم بمقدار 12x لأن قيمة البيانات لدى Meta لا تقل عن ذلك.
إن البقاء على Muse Spark 1.1 يتفادى السؤال برمته، ومن الجدير معرفة ما يكلفه ذلك بالضبط وأين. يتوفر Muse Spark 1.1 في كتالوج OrcaRouter بسعر 1.25 دولار و4.25 دولار — وهو سعر Meta الرسمي حتى آخر سنت، لأننا لا نضيف أي هامش ربح (0%) ونمرر تسعيرة المزود كما هي، وهذا أيضًا هو السبب في أن تغيير أسعار Meta يظهر لدينا في اليوم الذي تجريه Meta وليس بعد دورة تعاقد. وتُظهر بيانات القياس من بيئة الإنتاج على مدى سبعة أيام أن زمن أول رمز (time-to-first-token) عند النسبة p50 يبلغ 1.84 ثانية وعند p95 يبلغ 6.00 ثوانٍ، وهو توقع أكثر فائدة بكثير مما ستعطيك إياه أي أداة اختبار معيارية. Muse Spark 1.2 هو ليس في كتالوجنا؛ فهو يُقدَّم بواسطة Meta مباشرة وليس عبر أي جهة أخرى، لذا فإن النصف الأحدث من هذه المقارنة لديه حاليًا مزود واحد فقط ولا مسار لتجاوز الأعطال (failover) بحكم البنية. إذا كنت تقيّم هذا النموذج، فإن هذا التعرض لمورد واحد هو جزء مما تقوم بتقييمه.
مقايضة زمن الاستجابة التي لا يذكرها أحد في تغطية الإطلاق
قامت Artificial Analysis، التي تقيس بشكل مستقل عند أقصى جهد استدلال لكل نموذج، بقياس زمن أول رمز لنموذج Muse Spark 1.1 عند 2.90 ثانية ولنموذج Muse Spark 1.2 عند 26.12 ثانية. انخفضت سرعة الإخراج من 213.5 إلى 165 رمزًا في الثانية. وكان المكسب ثلاث نقاط في مؤشر Intelligence Index، من 51 إلى 54، وقفزة من #22 إلى #13 من بين 185 نموذجًا.
اقرأه كإصدار نموذج للأغراض العامة، فهو صفقة سيئة — تسعة أضعاف الانتظار مقابل ثلاث نقاط. اقرأه كمحرك وكيل برمجي، فمن الواضح أنه الخيار الصحيح، لأنه لا أحد ينتظر إعادة هيكلة اثني عشر ملفًا ليلاحظ ستًا وعشرين ثانية من التخطيط، بينما يلاحظ الجميع كل ذلك عند انتظار إكمال محادثة. هذا هو أوضح بيان لمن يستهدف كل جانب من هذه المقارنة، وقد قِيس بواسطة طرف ثالث بدلاً من أن تزعمه ميتا.
هذا يعني أيضًا أن التحول ليس مجانيًا حتى لو كنت تهتم بالكود فقط. أي شيء تفاعلي كنت قد وجّهته إلى Muse Spark 1.1 — الإكمال السطري، روبوت مراجعة، واجهة محادثة فوق مستنداتك — يصبح أسوأ بشكل ملموس إذا نقلته إلى جيل 1.2 بجهد عالٍ. الترقية مستهدفة، والاستهداف له اتجاه.
أي واحد يجب عليك تشغيله فعليًا
ابقَ على Muse Spark 1.1 إذا لم يكن عملك مستودعًا.خطوط أنابيب متعددة الوسائط، وتحليل السياق الطويل، وأبحاث الوسائط المختلطة، وأي شيء تفاعلي، وأي شيء على Windows، وأي شيء موصول بالفعل عبر MCP ويعمل. لا شيء في إطلاق Muse Code يحسّن هذه الأمور، وقياس زمن الاستجابة يجعل واحدًا منها على الأقل أسوأ.
جرّب Muse Code إذا كان نمط فشلك هو طول المدة.ترحيلات المستودعات الأحادية، ترقيات التبعيات، عمليات إعادة هيكلة تستغرق أسابيع — مهام تُشرف عليها بنفسك حاليًا لأن الوكيل يفقد الخيط. سجل الأحداث والوكلاء الخلفيون الدائمون يستهدفون ذلك تحديدًا، وعجز بضع نقاط في المعايير يكون أقل أهميةً عندما تكون المدة أطول. النسخة التجريبية: على نسخة مستنسخة مؤقتة، على مستودع لا تمانع في خسارته.
افعل التجربة الصادقة إذا كنت تحاول أن تقرر أي نموذج تختار. أبقِ منصة الاختبار الخاصة بك ثابتة واستبدل Muse Spark 1.1 بـ Muse Spark 1.2 تحتها. ذلك يعزل المتغير الوحيد الذي يدمجه مخطط Meta، وهو السبيل الوحيد لمعرفة ما إذا كانت علاوة التدريب المشترك حقيقية أم أن 1.2 مجرد نموذج برمجة كفء أينما وضعته. إن بوابة واحدة تجعل هذا تغيير نص بدلاً من عملية شراء — لأن Muse Spark 1.1 وClaude Opus 5 وGPT-5.6 Terra وGrok 4.5 وClaude Fable 5 جميعها تقف خلف مفتاح OrcaRouter واحد بسعر القائمة مع تجاوز تلقائي للفشل عبر المزودين، لذا فإن مجموعة المقارنة لا تكلفك شيئًا لإبقائها جاهزة. أما Muse Spark 1.2 فهو الاستثناء ويجب أن يأتي من Meta.
أسئلة تستحق طرحها قبل تثبيت أي شيء
هل يمكنني توجيه Muse Code إلى Muse Spark 1.1 بدلاً من 1.2؟
لا تذكر مواد إطلاق Meta ذلك، وقد شُحن النموذجان كزوج مدرَّبَين معًا، وهي حجة ضد كونه مدعومًا أو مفيدًا. ومع ذلك، فإن الاتجاه العكسي موثق جيدًا: يعمل Muse Spark 1.1 في أي وكيل يقبل نقطة نهاية مخصصة، وهي الطريقة التي يشغّله بها معظم الناس كوكيل اليوم. إذا كان هدفك هو إجراء مقارنة مضبوطة، فشغّل 1.1 و1.2 في ما لديك من منصة الاختبار بدلاً من محاولة تكييف منصة Meta.
هل ينطبق مستوى المساهم على Muse Spark 1.1 أيضًا؟
أطلقت Meta البنية ثنائية المستويات مع إطلاق Muse Code وMuse Spark 1.2، وتُرفق بطاقة الأسعار المنشورة تسعير المساهمين بذلك الإصدار. افترض أن خصم 12x هو عرض من جيل 1.2 حتى تقول Meta خلاف ذلك، وسعّر أي عبء عمل بنسخة 1.1 بمبلغ 1.25 دولار و4.25 دولار. إذا كنت على OrcaRouter فأنت على السعر المعلن بحكم التعريف، لذلك لا توجد طبقة مشاركة بيانات يمكن الاشتراك فيها أو إلغاء الاشتراك منها.
إذن، هل الادعاء بـ 6.7 نقطة خاطئ؟
لا — إنه غير مدقَّق وغير محدد الأوصاف، وهذا مختلف. قد تكون ميتا قد شغّلت خط الأساس 1.1 الخاص بها في بيئة اختبار مماثلة لبيئة Muse Code، وفي هذه الحالة تكون الزيادة نتيجة نظيفة لمقارنة نموذج بنموذج. لكن لم تُنشر أي منهجية، والخط الأساسي الضمني يقع بدقة على درجة سقالة خارجية بسيطة، ونفس المعيار ينتج ثلاثة مقاييس مختلفة اعتمادًا على من يشغّله. تعامل مع +6.7 كمؤشر اتجاهي واحصل على رقمك الخاص قبل أن تخطط بناءً عليه.
ما الذي سيحسم هذا؟
تقديم واحد. إذا وضعت Meta نموذج Muse Code على لوحة الصدارة العامة لـ Terminal-Bench 2.1 وفق نفس القواعد التي قدم بها الجميع — بدون مهلات أو موارد معدلة، مع ملء عمود التكلفة، وتطبيق استقطاعات الاختراق — تصبح نسبة 82.9% قابلة للمقارنة مع 76.2% بجانب اسم Muse Spark 1.1 ومع 83.8% في الأعلى، وتُحسم هذه الحجة بأكملها في ظهيرة واحدة. وإلى ذلك الحين، الرقم الوحيد المُتحقق منه بشكل مستقل في هذه المواجهة يعود إلى النموذج الأقدم، وهو يشير إلى أن Muse Spark 1.1 حلّ ثلاثة أرباع Terminal-Bench 2.1 داخل سقالة صغيرة بما يكفي لقراءتها في جلسة واحدة، بتكلفة تقل عن مئتي دولار.
الأمر الثاني الذي يستحق المتابعة هو أضيق نطاقًا ويحدث عاجلًا: ما إذا كانت Artificial Analysis ستنشر الدرجات الفرعية للبرمجة والأداء الوكالي لجيل 1.2 التي تنشرها بالفعل لجيل 1.1. كان الأداء الوكالي هو أضعف بُعد منشور في 1.1 بفارق كبير. وهو بالتحديد الرقم الذي تدّعي Meta أنها أصلحته، وبالتحديد الرقم الذي لم يقسه أحد خارج Meta بعد.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
