Muse Spark 1.2 مقابل Claude Haiku 4.5: سعر مدمج متطابق، وأفكار متعارضة حول التفكير
Guides & Insights

Muse Spark 1.2 مقابل Claude Haiku 4.5: سعر مدمج متطابق، وأفكار متعارضة حول التفكير

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Artificial Analysis prices Muse Spark 1.2 at $0.78 per million tokens blended and Claude Haiku 4.5 at $0.77. One cent apart, from two labs that agreed on nothing else. Meta's model cannot stop reasoning; Claude Haiku 4.5 only reasons when you ask it to. Meta gives you 1,048,576 tokens of context; Claude Haiku 4.5 gives you 200,000. Meta shipped this one on August 5, 2026 as a coding model with a terminal agent attached; Claude Haiku 4.5 shipped in October 2025 as the fast, cheap worker a bigger model tells what to do. Same price per token, entirely different machines.

That coincidence is the useful place to start a comparison, because it removes the variable people usually decide on and forces the question to be about shape instead. What follows uses independent numbers where they exist — Artificial Analysis for index scores and lab latency, OrcaRouter's own seven-day production telemetry for real-traffic latency — and flags vendor-reported figures as such, including one benchmark headline of the vendor's that has no third-party counterpart.

تباين المواصفات، بُعدًا واحدًا في كل مرة

Price — Muse Spark 1.2 at $1.25 in / $4.25 out per million; Claude Haiku 4.5 at $1.00 in / $5.00 out. Meta is cheaper on input, Claude Haiku 4.5 on output.

كاش — 0.15 دولار لكل مليون عند إصابة كاش على Muse Spark 1.2، بخصم 88%؛ و0.10 دولار لكل مليون عند قراءة كاش على Claude Haiku 4.5، بخصم 90%، بينما تُحتسب كتابة الكاش بمبلغ 1.25 دولار.

السياق — 1,048,576 رمزًا مقابل 200,000. بفارق 5.2×، وهي أكبر فجوة منفردة بينهما.

أقصى إخراج — يعلن Claude Haiku 4.5 عن سقف يبلغ 64,000 توكن؛ بينما لا تُعلن نقطة نهاية Muse Spark 1.2 عن أي حد أقصى لطول الإكمال على الإطلاق، وهو أمر غير معتاد بما يكفي لاختباره بدلاً من افتراضه.

الاستدلال — إلزامي على Muse Spark 1.2، مع خمسة مستويات جهد من الأدنى إلى الأعلى جدًا، وافتراضي متوسط؛ اختياري على Claude Haiku 4.5، وهو نموذج غير استدلالي حتى تقوم بتشغيل التفكير الموسع وتمنحه ميزانية تفكير.

Inputs — Meta advertises text, images, video, audio and PDF; Claude Haiku 4.5 takes text and images. Both return text.

Weights and providers — both closed. Muse Spark 1.2 is served only by Meta's own Model API; Claude Haiku 4.5 is available from the vendor and through the usual cloud resellers and aggregators.

العمر — Muse Spark 1.2 عمره أيام فقط. Claude Haiku 4.5 قيد الإنتاج منذ 15 أكتوبر 2025، مع حد معرفة يوليو 2025 وتسعة أشهر من الخبرة الميدانية المتراكمة خلفه.

الفجوة في المؤشر حقيقية. لكن الرقم الذي سيقتبسه الجميع ليس كذلك.

تُقيّم Artificial Analysis أداة Muse Spark 1.2 بدرجة 54 على مؤشر Intelligence Index، لتحتل المرتبة 13 من أصل 185. أما إدخالها الحالي لنموذج Claude Haiku 4.5 فيبلغ 24. ضع هذين الرقمين جنبًا إلى جنب وستحصل على عنوان رئيسي؛ لكن انظر إلى ماهية الإدخالات فعلًا وسينهار العنوان.

الرقم 54 هو Muse Spark 1.2 مُقيَّم عند إعداد xhigh، وهو إعداد الاستدلال الأكثر تكلفةً له. الرقم 24 هو Claude Haiku 4.5 مُقيَّم كنموذج دون تفكير — مع إيقاف التفكير — وتصنّفه Artificial Analysis كتقدير وليس كتشغيل مكتمل. في نسخة سابقة من المؤشر نفسه، قبل إعادة الوزن في v4.1، وضعت Artificial Analysis نتيجة Claude Haiku 4.5 عند 55 مع تفعيل التفكير و42 بدونه. لا يمكن مقارنة تلك الأرقام القديمة بـ54 أيضاً، لأن إصدارات المؤشر تعيد القياس، ونتيجة من حقبة v3 ليست نتيجة v4.1.

إذن التصريح الصادق أضيق مما توحي به لوحة الصدارة: Muse Spark 1.2 بأقصى جهد يسجّل 54 على المؤشر الحالي؛ لا توجد نتيجة v4.1 منشورة لـ Claude Haiku 4.5 مع تشغيل التفكير الموسّع، لذا لا توجد مقارنة مماثلة بين الاثنين بأقصى جهد حتى الآن. من يريك 54 مقابل 24 يقارن نموذجًا بتأمّل كامل بنموذج طُلب منه ألّا يتأمّل.

Where the vendor has published a number, it is a specific one: Claude Haiku 4.5 scores 73.3% on SWE-bench Verified, averaged over 50 trials with a 128K thinking budget. That is a vendor figure, and the thinking budget in it is enormous for a model marketed on speed — but it is the same evaluation the industry quotes for frontier models, and it puts Haiku in a bracket its price does not suggest. Meta's counterpart claims for Muse Spark 1.2 are Terminal-Bench 2.1 at 82.9% and DeepSWE v1.1 at 59.3%, also vendor-run, on Meta's own harness with each competitor paired to its own agent product. Two vendors, two benchmarks, no overlap. There is currently no single evaluation on which both of these models have a published score from the same evaluator.

أربعة أرقام لزمن الاستجابة، قصتان مختلفتان

زمن الاستجابة هو النقطة التي يتحول فيها إطار "السعر نفسه" من مجرد فضول إلى قرار، وهو أيضًا المجال الذي يكون فيه مصدر القياس أكثر أهمية.

في بيئة قياس الأداء، تسجّل Artificial Analysis زمن الوصول إلى أول توكن عند 26.12 ثانية لـ Muse Spark 1.2 بدقة xhigh، و1.00 ثانية لـ Claude Haiku 4.5. فجوة مقدارها 26×، ولو كانت هذه هي الصورة كاملة لانتهت المقارنة.

في الإنتاج ينعكس الأمر. عبر سبعة أيام من حركة المرور الحقيقية على OrcaRouter — حيث يستخدم المتصلون أي جهد يريدونه فعليًا — يُظهر Claude Haiku 4.5 وقتًا حتى أول توكن عند p50 يبلغ 3.84 ثانية، وعند p95 يبلغ 10.00 ثانية، بمعدل 214 توكنًا في الثانية ومعدل خطأ 1.0%. أما Muse Spark 1.1، وهو إصدار نموذج Meta الموجود في الكتالوج، فيُظهر p50 يبلغ 1.84 ثانية وp95 يبلغ 6.00 ثانية، بمعدل 519 توكنًا في الثانية دون تسجيل أي أخطاء. على حركة المرور الحية، نموذج Meta هو الأسرع.

{{1}}كلتا مجموعتي الأرقام صحيحة، وهما تقيسان أشياء مختلفة.{{/1}} {{2}}الرقم المخبري يمثّل كل نموذج عند أقصى درجات التروّي مع كاش بارد، وهو اختبار عادل للسقف الأعلى واختبار ضعيف لصندوق الدردشة.{{/2}} {{3}}أما الرقم الإنتاجي فيشمل إصابات الكاش، والموجّهات القصيرة، ومستويات الجهد المنخفضة، وكل ما تفعله التطبيقات الواقعية، وهو اختبار عادل للوسيط وليس اختبارًا للحالة الأسوأ إطلاقًا.{{/3}} {{4}}الفخّ هو الاستشهاد بأحدهما والاستدلال على الآخر.{{/4}} {{5}}إذا كنت تضبط مهلة زمنية للمستخدم، فإن p95 هو الرقم الذي يجب أن تعتمده.{{/5}} {{6}}إذا كنت تسأل عن تكلفة خطوة وكيلية عميقة بالزمن الفعلي، فإن الرقم المعياري أقرب إلى الحقيقة — مع التنويه الصادق بأنه لا يوجد رقم إنتاجي مماثل لـ Muse Spark 1.2 نفسه حتى الآن، لأنه جديد جدًا ولم ينتشر استخدامه بعد.{{/6}}

لقد باعك كلا المختبرين وكيلًا فرعيًا. لكنهما كانا يقصدان شيئين مختلفين.

The vendor's pitch for Claude Haiku 4.5 was explicit about hierarchy: Sonnet-class models plan and orchestrate, Haiku instances execute in parallel underneath. Cheap, fast, disposable, many at once. The product design follows — a 200K window is plenty for a scoped subtask and deliberately not enough for a whole repository, thinking is off by default because a worker that deliberates is a worker that costs orchestrator money, and the vendor's own marketing names real-time chat, customer service and pair programming as the target.

يدّعي ترويجُ Meta لمنتج Muse Spark 1.2 أنه يجمع بين طرفَي التسلسل الهرمي نفسه. يقول النصُّ التسويقي لـ Meta إن النموذج يمكن أن يكون الوكيل الأساسي الذي يجمع السياق ويُخطِّط ويُفوِّض، أو وكيلًا فرعيًا ينفِّذ بالتوازي تحت أحدها. أما Muse Code، الوكيل الطرفي الذي صدر معه، فينسّق بين عدة وكلاء فرعيين دائمين لكل مهمة في أشجار عمل معزولة، على بيئة تشغيلٍ تُعيد سجلّ الأحداث بدقةٍ تامة. نافذة المليون توكن والاستدلال الدائم هما ما يحتاج إليه المخطِّط؛ وهما بالضبط ما لن تختاره لعامل توزيعٍ متفرّع، لأن كل مثيلٍ متوازٍ يدفع ثمن تفكيرٍ لم تطلبه.

Read as architecture rather than marketing, that is the real difference: the vendor built a worker and expects you to bring an orchestrator; Meta built an orchestrator and claims it can also work. If you already run a hierarchy, the interesting experiment is not choosing between them — it is Muse Spark 1.2 planning and Claude Haiku 4.5 executing, which is a shape neither vendor will sell you as a package.

كم تكلّف خطوة حقيقية واحدة على كلٍّ؟

معدلات كل مليون لا تحدد شيئًا في نماذج الاستدلال، لأن النموذج يختار عدد الرموز التي ينفقها. سعّر الخطوة بدلاً من ذلك.

خذ مهمة برمجية محددة النطاق: 60,000 توكن من سياق المستودع إدخالًا، و3,000 توكن من التصحيح إخراجًا. بارد، تكلّف Claude Haiku 4.5 مبلغ 0.060 دولارًا للإدخال و0.015 دولارًا للإخراج — 7.5 سنتات. تكلّف Muse Spark 1.2 مبلغ 0.075 دولارًا بالإضافة إلى 0.013 دولارًا — 8.8 سنتات. قريبة بما يكفي لاعتبارها ضجيجًا، تمامًا كما وعد السعر المختلط.

Now add the thing the blended rate hides. Muse Spark 1.2 cannot turn reasoning off, and at its default medium setting a step like this plausibly emits a few thousand reasoning tokens before the patch — they bill as output. Add 3,000 and the same step is $0.075 + $0.026 = 10.1 cents, about 35% above Haiku on identical inputs. Claude Haiku 4.5 with thinking off pays nothing for deliberation and stays at 7.5 cents; with a large thinking budget it will exceed Muse Spark 1.2, because Claude Haiku 4.5 charges $5.00 per million output against Meta's $4.25.

التخزين المؤقت يقلب التركيز مرة أخرى. أبقِ سياق المستودع ثابتًا بحيث يصيب ذاكرة التخزين المؤقت، فينخفض سعر إدخال Haiku إلى 0.006 دولار وMuse Spark 1.2 إلى 0.009 دولار — يتوقف جانب الإدخال عن التأثير تمامًا، وتتحول المقارنة بأكملها إلى معركة حول توكنات الإخراج، وهي معركة حول مقدار ما يفكر فيه كل نموذج. في عبء عمل يكرر السياق، يكون استقرار مفتاح ذاكرة التخزين المؤقت أكثر قيمة من اختيار النموذج، وهذا صحيح لكلا النموذجين.

The 1M window is the one place the arithmetic is not close. Anything that genuinely needs more than 200,000 tokens in a single call cannot be run on Claude Haiku 4.5 at any price. You either chunk and orchestrate — which is what the vendor intends — or you use a model with the room.

تجربة كلاهما دون عقد ثانٍ.

Claude Haiku 4.5 is in the OrcaRouter catalog at $1.00 and $5.00 — the vendor's list price, because OrcaRouter runs 0% markup and passes provider pricing through untouched, which also means a vendor price change is live on our side the same day rather than at the next contract cycle. The production latency figures above come from that same routing layer.

Muse Spark 1.2 ليس موجودًا في الكتالوج. حاليًا، تُعد Meta Model API هي المكان الوحيد لاستدعائه، لذا فإن المقارنة المباشرة الحقيقية اليوم تعني تكاملًا واحدًا عبرنا وتكاملًا مباشرًا مع Meta. Muse Spark 1.1 مستضاف، بنفس السعرين $1.25 و$4.25 اللذين تفرضهما Meta على 1.2، مما يجعله بديلًا معقولًا لشكل التكلفة وزمن الاستجابة للعائلة، لكن ليس لمكاسب البرمجة التي يُسوَّق بها 1.2. عندما يصبح 1.2 قابلاً للتوجيه، تصبح المقارنة تغييرًا في سطر واحد في سلسلة النموذج بنفس المفتاح — وبالنسبة لتجربة المنسّق-مع-العامل الموصوفة أعلاه، فإن DSL التوجيه هو كيفية ربط المخطط وعامل التوزيع في استدعاء واحد بدلاً من بناء التسليم يدويًا.

اختر وفقًا لشكل العمل، وليس وفقًا للنوتة.

اختر Claude Haiku 4.5 عندما يكون العمل محدودًا والمستخدم ينتظر. وكلاء الدعم، والتصنيف، والاستخراج، والدردشة، وإكمالات البرمجة الزوجية، وطبقة العمال المتوازيين في التسلسل الهرمي للوكلاء. إنه خيار معروف بسجل ميداني يمتد لتسعة أشهر، والتفكير اختياري، لذا تدفع فقط مقابل التأمل عندما تريده، و200K كافية لأي مهمة فرعية محددة النطاق تقريبًا. نتيجته المنشورة على SWE-bench Verified تشير إلى أنه أكثر قدرة بكثير مما يوحي به السعر، بشرط أن تكون مستعدًا لإنفاق ميزانية التفكير التي استلزمتها تلك النتيجة.

اختر Muse Spark 1.2عندما تكون وحدة العمل مستودعًا وليس طلبًا. إعادة هيكلة متعددة الملفات، وتصحيح أخطاء ممتد، وتوليد مشروع كامل، وحلقات وكيل طويلة المدى حيث لا يراقب أحد مؤشر التحميل. نافذة المليون رمز تلغي مشكلة التقسيم التي لا يمكن لـ Haiku حلها بأي ثمن، والاستدلال الإلزامي الذي يفسده للدردشة هو الخيار الافتراضي الصحيح عندما تكلف الخطة الخاطئة أكثر من الخطة البطيئة.

What should decide it is not the index number. Ask two questions instead: does a single call ever need to see more than 200,000 tokens, and is there a human waiting on the first token? Yes to the first points at Meta. Yes to the second points at the vendor. Yes to both means you want two models, which is the honest answer more often than either vendor's marketing admits.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube