
Muse Spark 1.2 مقابل Claude Fable 5: ما هي التكلفة الفعلية لست نقاط مؤشر؟
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenجديدQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekجديدDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- qwenجديدQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 197 tok/s
- orcaجديدOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
- tencentTencent: Hy32026-07-0642الذكاء59البرمجة
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232الذكاء42البرمجة
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226الذكاء39البرمجة
- anthropicAnthropic: Claude Sonnet 52026-06-3055الذكاء72البرمجة
- klingKling: Kling 3.0 Turbo2026-06-1757الذكاء52البرمجة57الرياضيات
- z-aiZ.ai: GLM 5.22026-06-1653الذكاء69البرمجة60الرياضيات
تنشر Artificial Analysis شيئًا تتجاهله معظم جداول المقارنات المرجعية: ما أنفقته. بلغت تكلفة تشغيل مؤشر الذكاء الخاص بها المكوّن من تسعة تقييمات $637.85 على Muse Spark 1.2 و $5,630.52 على Claude Fable 5. نفس مجموعة الاختبارات المرجعية، نفس الأدوات، فاتورة واحدة أكبر بـ 8.8 مرات من الأخرى. سجل Fable 5 درجة 60 مقابل 54 لـ Muse Spark 1.2.
اقسم الفرق وستحصل على الرقم الذي تدور حوله هذه المقارنة فعلًا: على هذا الحمل، تكلف آخر ست نقاط من الذكاء حوالي 832 دولارًا لكل نقطة. وما إذا كان ينبغي عليك دفع هذا المبلغ ليس سؤالًا عن المعايير، بل سؤالًا عن مقدار حركة المرور التي تحتاج فعلًا إلى تلك النقاط، والإجابة لدى معظم الفرق هي جزء صغير يمكن تحديده.
نقطة المؤشر الحدّية لها سعر، وهو مرتفع.
كلا النتيجتين تأتيان من نفس المقيّم المستقل الذي شغّل نفس المجموعة — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience و AA-LCR. ولا يعد أيٌّ منهما ادعاءً من البائع. يحتل Fable 5 المرتبة #3 من بين 185 نموذجًا؛ بينما Muse Spark 1.2 في المرتبة #13، مقابل متوسط الفئة البالغ 32. كلاهما أعلى من المتوسط بوضوح؛ واحد فقط في الطليعة.

أسعار القائمة تفسّر معظم الفجوة وتقلّل من شأن الباقي:
• إدخال — Muse Spark 1.2 $1.25 لكل مليون، Claude Fable 5 $10.00. ثماني مرات.
• المخرجات — $4.25 مقابل $50.00. ما يقرب من اثني عشر ضعفًا.
• المدخلات المخزنة مؤقتًا — $0.15 مقابل $1.00. أي ما يقارب سبعة أضعاف، وتفرض Fable 5 أيضًا رسومًا قدرها $12.50 لكل مليون كتابة إلى ذاكرة التخزين المؤقت، أو $20.00 لفترة TTL مدتها ساعة واحدة، بينما لا تنشر Muse Spark 1.2 أي رسوم منفصلة لكتابة ذاكرة التخزين المؤقت على الإطلاق.
• السعر المخلوط — تُقدّر Artificial Analysis سعر Muse Spark 1.2 بـ 0.78 دولار لكل مليون توكن وFable 5 بـ 7.70 دولار. أي أقل بقليل من عشرة أضعاف.
كانت Fable 5 أغلى طراز قامت Artificial Analysis باختباره على الإطلاق عند إطلاقه، ولا تزال تحتفظ بهذا اللقب. ومن الجدير أن نكون دقيقين بشأن السبب: فقد أحرق النموذج أقلّ عددًا من رموز الإخراج مقارنةً بـ Muse Spark 1.2 عند عبور الفهرس — 87 مليون مقابل 95 مليون — لذا فإن الفارق في التكلفة يعود إلى التسعيرة، لا إلى الإسهاب. Fable 5 ليست مسرفة. إنها ببساطة مسعّرة كمنتج رائد.
تُرجم إلى خطوة وكيل تقرأ 60,000 توكنًا من سياق المستودع وتكتب 3,000 توكنًا من التصحيح: حوالي 8.8 سنتًا على Muse Spark 1.2، وحوالي 75 سنتًا على Claude Fable 5. ألف خطوة يوميًا تكلف 88 دولارًا مقابل 750 دولارًا. وعلى مدى عام، 32,000 دولارًا مقابل 274,000 دولارًا.
حيث لا يمكن استبدال Claude Fable 5
ستكون قضية التكلفة أحادية الجانب إذا كانت النقاط الست هي مجمل الفارق. لكنها ليست كذلك، والمكان الذي تتسع فيه الفجوة هو بالضبط المكان الذي أعادت فيه Meta تموضع Muse Spark 1.2 للمنافسة.
تحتل Fable 5 المركز الأول عبر شريحة واسعة من سلالم المواجهات المباشرة في Design Arena: 1399 Elo والمرتبة 1 في تطوير الألعاب، و1367 والمرتبة 1 في فن ASCII، و1353 والمرتبة 1 في توليد SVG، بالإضافة إلى المرتبة 1 في ساحة الوكلاء لتطوير ألعاب Godot (1344)، وAndroid الأصلي (1318)، وتطوير الألعاب بالوكلاء (1300) وشرائح HTML (1260)، مع احتلال المركز الثاني في تطبيقات الويب وأعمال التطوير المتكامل. أما Muse Spark 1.2 فليس لديه أي إدخالات في Design Arena على الإطلاق — سابقه حقق سجلاً محترماً في منتصف الجدول (1334 في تطوير الألعاب بالمرتبة 5، و1309 في فئات الأكواد العامة بالمرتبة 9)، لكن النسخة الجديدة لم تُقيَّم ولو مرة واحدة.
تشير المؤشرات الخاصة بكل بُعد إلى الاتجاه نفسه. تُقيّم Artificial Analysis نموذج Claude Fable 5 بمؤشر برمجة يبلغ 76.5 ومؤشر وكيل يبلغ 52.8. حصل Muse Spark 1.1 على 71.3 و37.5 — أي بفارق خمس نقاط في البرمجة وخمس عشرة نقطة في العمل الوكيل. لم تُنشر أي أرقام خاصة بالأبعاد للإصدار 1.2 حتى الآن، لذا فإن التصريح الصادق هو أننا نعرف أن المؤشر المركب أغلق بفارق ثلاث نقاط، ولا نعرف مقدار ذلك الذي تركز على محور الوكيل.

الموقع التسويقي الخاص بـ Fable 5 يدّعي أن التقدّم يزداد مع طول المهمة وتعقيدها. هذا ادعاء من البائع وغير مُتحقَّق منه كما هو مذكور، لكنه متّسق مع شكل البيانات المستقلة: أكبر هوامش Fable 5 تظهر في ساحة الوكلاء، حيث يتعيّن على النموذج أن يحافظ على خطة متماسكة عبر العديد من الجولات، بدلاً من التوليد لمرة واحدة.
حيثما كان Muse Spark 1.2 هو ببساطة الإجابة الصحيحة
ثلاثة أمور تجعله الخيار الصحيح بغض النظر عن النقاط الست.
• إدخال الصوت والفيديو. تعلن قائمة Meta عن دعم النصوص والصور والفيديو والصوت وإدخال PDF. يقبل Claude Fable 5 النصوص والصور والملفات — لا صوت، لا فيديو. بالنسبة لأي خط أنابيب يتعامل مع التسجيلات أو اللقطات، هذه ليست مقايضة بل فلتر صارم. تحفظ صادق واحد: بطاقة مواصفات Artificial Analysis لنموذج Muse Spark 1.2 تسجّل فقط النص والصورة كمدخلات مُقيَّمة، لذا فالسطح الأوسع مُعلَن عنه وليس مُتحققًا منه بشكل مستقل.
• السرعة. 165.0 توكنًا في الثانية مقابل 71.7. يُدفق Muse Spark 1.2 المخرجات أسرع بأكثر من الضعف، ويحتل المرتبة #16 من 185 في السرعة مقابل متوسط الفئة البالغ 71 — بينما يقع Fable 5 عند المتوسط.
• التكلفة عند الحجم. كل شيء في القسم السابق.
أضف خيارًا رابعًا لمن تكون طلباتهم ضخمة حقًا: كلا النموذجين يعلنان عن ما يقارب مليون رمز من السياق — 1,048,576 لـ Muse Spark 1.2، و1,000,000 لـ Fable 5 — لكن Muse Spark 1.2 يفرض سعرًا ثابتًا على كل ذلك، بينما تسعيرة كتابة ذاكرة التخزين المؤقت في Fable 5 تعني أن الاحتفاظ ببادئة كبيرة ثابتة يكلف مالًا حقيقيًا مقدمًا قبل أن يبدأ في توفير أي شيء.
لا شيء من هذه النماذج سريع
هذا هو القسم الذي تتجاهله معظم المقارنات المباشرة، وهو يغيّر البنية الأساسية بدلاً من الفاتورة.
عند أقصى جهد للاستدلال، تقيس Artificial Analysis الوقت حتى أول توكن عند 26.12 ثانية لـ Muse Spark 1.2 و141.26 ثانية لـ Claude Fable 5، مع زمن استجابة شامل لـ Fable 5 يبلغ 148.24 ثانية. لا ينبغي لأي منهما أن يكون أمام مستخدم في تلك الإعدادات.
أرقام الإنتاج أكثر لطفًا بكثير وتستحق المعرفة. على OrcaRouter، يُظهر Claude Fable 5زمن p50 للوصول إلى أول رمز هو 7.04 ثانية وزمن p95 هو 10.00 ثانية على مدار أسبوع متحرك — أي أن هذه حركة مرور حقيقية بأي مستوى جهد يطلبه المتصلون، وليست اختبارًا معياريًا عند أقصى جهد. Muse Spark 1.1، على سبيل المقارنة، يعمل بزمن p50 يبلغ 1.84 ثانية. أما Muse Spark 1.2 فلا تتوفر له بعد بيانات قياس من الإنتاج.

النقطة الهيكلية: كلا النموذجين يتضمن استدلالًا إلزاميًا. مؤشر الجهد في Fable 5 يتراوح من منخفض إلى أقصى، والافتراضي هو مرتفع؛ بينما في Muse Spark 1.2 يتراوح من أدنى إلى مرتفع جدًا، والافتراضي هو متوسط. لا يسمح أي منهما بإيقاف التفكير. إذا كنت بحاجة إلى استجابات في أقل من ثانية، فهذه المقارنة بأكملها ليست في المكان الصحيح — فهذا ما صُممت له نماذج من فئة Luna أو Flash-Lite.
مكدس النموذجين، بتكلفة محسوبة
إن تأطير هذا كخيارٍ يقصي كل ما عداه هو الخطأ، لأن الحركة ليست متجانسة. تقريبًا كل وكيل إنتاج لديه ذيل طويل من الخطوات الروتينية — قراءة ملف، تلخيص فرق، تنسيق رقعة، تحديد الأداة التي يجب استدعاؤها بعد ذلك — ورأس قصير من الخطوات الصعبة حقًا حيث الخطأ يكلف ساعة.
نفّذ نفس ألف خطوة وكيل يوميًا. كلها على Claude Fable 5: حوالي 750 دولارًا. كلها على Muse Spark 1.2: حوالي 88 دولارًا. قسّم 900 خطوة روتينية إلى النموذج الرخيص و100 خطوة صعبة إلى النموذج المكلف: حوالي 79 دولارًا زائد 75 دولارًا، أو 154 دولارًا في اليوم. وهذا يمثل خُمس فاتورة Fable الكاملة مع الحفاظ على القدرة المتطورة على عُشر المكالمات التي تحتاجها فعليًا — وهو فرق يبلغ حوالي 220,000 دولار سنويًا على حلقة وكيل واحدة.
السبب في أن التقسيم يستحق البناء بدلاً من مجرد الوصف هو أنه كان يتطلب سابقًا علاقتين مع بائعين، وحزمتي SDK، ومجموعتي بيانات اعتماد. لم يعد الأمر كذلك الآن. يوجد Claude Fable 5 في كتالوج OrcaRouter بسعر 10.00 دولار و50.00 دولار — سعر القائمة من البائع، يُمرَّر بهامش ربح 0% — وMuse Spark 1.1 موجود هناك بسعر 1.25 دولار و4.25 دولار على نفس الأساس، خلف نفس نقطة النهاية المتوافقة مع OpenAI. تتيح لك DSL الخاصة بالتوجيه التعبير عن "النموذج الرخيص أولاً، ثم التصعيد عند انخفاض الثقة أو عند فشل تشغيل الاختبار" كاستدعاء واحد بدلاً من كود تنسيق تقوم بصيانته، كما يتيح لك دمج النماذج إرسال الخطوات الغامضة حقًا إلى مجموعة من النماذج في وقت واحد ومقارنتها. Muse Spark 1.2 نفسه ليس في الكتالوج بعد — حيث تقدمه Meta مباشرة، بوصفها المزود الوحيد له — لذا فإن أقرب ما يمكنك بناؤه اليوم إلى هذه الحزمة يستخدم 1.1 على الذراع الرخيصة.
تستحق تفاصيل المزود الواحد سطرًا خاصًا بها في تقييم المخاطر. لدى Claude Fable 5 مسارات تقديم متعددة وتجاوزًا تلقائيًا للفشل فيما بينها. أما Muse Spark 1.2 فلديه نقطة نهاية واحدة فقط، تديرها Meta. إذا تعطلت، فلا يوجد بديل احتياطي بنفس الطراز.
نموذج تكلفة، وليس حكمًا
الناتج المفيد من هذه المقارنة ليس "أي نموذج يفوز". بل هو حدّ يمكنك حسابه لعبء العمل الخاص بك.
قدّر نسبة مكالماتك التي تفشل فيها إجابة من فئة Muse Spark 1.2 وتنجح فيها إجابة من فئة Fable 5. اضرب ذلك في تكلفة الفشل — دقائق المهندس، أو دمج سيئ، أو حلقة إعادة محاولة، أو عميل. قارن ذلك بـ 66 سنتًا لكل خطوة، وهي تكلفة ترقية استدعاء واحد من Muse Spark 1.2 إلى Claude Fable 5 في المثال أعلاه ذي 60K-in / 3K-out. إذا تجاوزت الخسارة المتوقعة من إجابة خاطئة 66 سنتًا، وجّه تلك الخطوة إلى Fable 5. وإذا لم تتجاوزها، فلا تفعل.
بالنسبة لمعظم الفرق، يضع هذا الحساب Fable 5 في مراجعة الكود، وتوليد التصحيح النهائي، والتخطيط المعماري، وأي شيء يمس بيانات الإنتاج، ويضع Muse Spark 1.2 في كل شيء آخر — قراءة الملفات، والتلخيص، وفرز الاختبارات، واختيار الأدوات، والجزء الأوسط عالي الحجم من حلقة الوكيل حيث تكون التكلفة حقيقية والمخاطر لكل استدعاء ليست كذلك.
شيء واحد يستحق المراقبة: سلالم Design Arena والمؤشرات حسب الأبعاد لـ Muse Spark 1.2، وكلاهما غير موجود بعد. أقوى دليل لدى Fable 5 يتمثل تحديدًا في الساحات المباشرة التي لا يملك نموذج Meta الجديد أي سجل فيها على الإطلاق. عندما يظهر هذا السجل، سيتحرك هذا الحد — ربما بشكل كبير.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
