Muse Spark 1.2 مقابل Gemini 3.5 Flash-Lite
Guides & Insights

Muse Spark 1.2 مقابل Gemini 3.5 Flash-Lite: مختبران، تعريفان مختلفان للوكيل الفرعي

الكاتب

Jim Song

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

خلال أسبوعين من بعضهما البعض، أطلق مختبران نموذجًا ووصفاه بالكلمة نفسها. وفقًا لبطاقة التعريف الخاصة به، Gemini 3.5 Flash-Lite هو «مناسب للوكلاء الفرعيين الذين ينفذون مهامًا مركّزة داخل سير عمل معقدة متعددة الوكلاء.» وتقول Meta إن Muse Spark 1.2 يمكن أن يعمل «إما كوكيل أساسي للتخطيط والتفويض أو كوكيل فرعي ينفذ بالتوازي.» نفس المفردات، واستغرق الأمر من Artificial Analysis تشغيل كليهما عبر Intelligence Index لإظهار مدى اختلاف المعنى: أنهى Flash-Lite المجموعة في 43 مليون رمز إخراج، بينما احتاج Muse Spark 1.2 إلى 95 مليونًا. أحد هذين النموذجين يفكر بإيجاز وبشكل متكرر؛ والآخر يفكر بعمق وطول. كلاهما يسمي النتيجة وكيلًا فرعيًا.

إن نسبة التوكنات هي الرقم الأكثر صلةً بالقرار في هذه المقارنة، لأن طبقة الوكلاء الفرعيين هي شيء تقوم ببثّه — عشرين في المرة، مئة في المرة — والبثّ يضاعف أي عادات لدى النموذج في كل استدعاء. وما يلي يستعرض ما بناه كل مختبر فعليًا، وكيف تبدو حسابات البثّ بالأسعار الحقيقية، وأين يتبيّن أن الخيار الرخيص هو الخيار المكلف.

ما الذي يعنيه كل مختبر بالكلمة

نسخة Flash-Lite هي تعريفٌ للدور حسب الحجم. Gemini 3.5 Flash-Lite هي الطبقة الأرخص في عائلتها، وهذا التموضع لافت لربط مستويات التفكير مباشرةً بأعباء عمل الوكلاء الفرعيين متعددة الخطوات — وهي المرة الأولى التي تُوصف فيها طبقةٌ في تلك العائلة بدور وكيل بدلاً من الحجم أو السرعة. الاستدلال إلزامي لكن الجهد الافتراضي هو الحد الأدنى، ويبلغ المؤشر أقصاه عند مستوى عالٍ، والنموذج مبني ليتم إطلاقه بكميات كبيرة والإجابة بسرعة. يذكر البائع 54.2% على SWE-Bench Pro مقابل 49.6% لـ Gemini 3 Flash، و74.0% على OSWorld-Verified مقابل 65.1% — وكلاهما أرقام مقدّمة من البائع لم يُعَد إنتاجها بشكل مستقل، وكلاهما مؤطَّران كمكاسب وكيلية بدلاً من مكاسب الذكاء الخام.

نسخة Meta هي تعريف دور وفقًا للطوبولوجيا. يصف النص التسويقي لمنتج Muse Spark 1.2 نموذجًا يمكنه جمع السياق، ووضع خطة، وتفويض التنفيذ عبر عوامل فرعية متوازية — أو أن يكون هو نفسه أحد تلك العوامل الفرعية. يتراوح مؤشر الاستدلال لديه من المستوى الأدنى حتى xhigh مع إعداد افتراضي متوسط، وتسمي Meta أعباء العمل المستهدفة بوضوح: إعادة هيكلة ملفات متعددة، وجلسات تصحيح أخطاء ممتدة، وتوليد مستودع كامل. هذا نموذج مصمم ليكون المنسق الذي يمكنه أيضًا القيام بالعمل، وهو منتج مختلف عن نموذج مصمم ليتم إنشاء عشرين نسخة منه في المرة الواحدة.

لم ينشر أي من المختبرين معيارًا للادعاء المحدد. أصدرت Meta الإصدار 1.2 في 5 أغسطس دون أي منشور إطلاق على الإطلاق — ولا تزال صفحة إعلان Muse Spark 1.1 تصف الإصدار السابق.

الفجوة التي يقيسها المؤشر فعليًا

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

درجات مستقلة، من Artificial Analysis عند تطبيق نفس المركب المكوّن من تسعة تقييمات على كلاهما:

مؤشر الذكاء — Muse Spark 1.2 (xhigh) 54، المرتبة #13 من 185. Gemini 3.5 Flash-Lite 36، المرتبة #20 من 163. ثمانية عشر نقطة، مقابل متوسط فئة يبلغ 32.

سرعة الإخراج — 165.0 رمزًا في الثانية مقابل 343.6. يتدفق Flash-Lite بسرعة تزيد عن الضعف.

الوقت حتى أول توكن — 26.12 ثانية مقابل 10.30، كلاهما بأقصى جهد. تشير Artificial Analysis إلى أن 10.30 ثانية من Flash-Lite هي نفسها في الطرف الأعلى لنماذج الاستدلال في فئته السعرية.

الإسهاب — 95 مليون توكن مخرَج مقابل 43 مليون لنفس مجموعة الاختبارات، بوسيط 65 مليون عبر جميع النماذج. Muse Spark 1.2 أعلى من الوسيط بنسبة 46%؛ بينما Flash-Lite أقل بنسبة 34%.

تكلفة تشغيل المؤشر — $637.85 مقابل $153.08.

لكل بُعد — تشير المؤشرات الفرعية لـ Artificial Analysis إلى أن Gemini 3.5 Flash-Lite سجّل 49.3 في البرمجة و26.8 في الوكلاء. لا يوجد حتى الآن تفصيل منشور لـ Muse Spark 1.2؛ سجّل سلفه 71.3 و37.5.

ثماني عشرة نقطة مؤشر ليست فرق تقريب. هذان ليسا مرشحين لنفس المكان.

حساب التفرع

سعر كل توكن هو المنظور الخاطئ لطبقة الوكيل الفرعي، لأن الهدف الأساسي من هذه الطبقة هو تشغيل العديد منها. لنأخذ مثالًا بأسعار القائمة — $0.30 للإدخال و$2.50 للإخراج لـ Gemini 3.5 Flash-Lite، و$1.25 للإدخال و$4.25 للإخراج لـ Muse Spark 1.2.

يُرسل المُنسِّق عشرين وكيلًا فرعيًا. يقرأ كلٌّ منهم 25,000 توكن من السياق المُحدَّد، ثم يكتب 1,500 توكن.

Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = حوالي 22.5 سنتًا لكل تفرع.

Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = حوالي 75 سنتًا لكل تفريع.

ثلاث مرات وثلث، وهو ما يبدو معقولًا. الآن طبّق فرق الإسهاب المُقاس. إذا كان Muse Spark 1.2 يكتب بشكل متناسب أكثر من Flash-Lite كما فعل على الفهرس — حوالي 2.2 ضعف عدد رموز الإخراج مقابل العمل نفسه — فإن تلك الردود التي تتكون من 1,500 رمز تصبح حوالي 3,300، ويرتفع التفرّع إلى حوالي 91 سنتًا. أربع مرات، وليس ثلاثًا. عند مئة تفرّع في الساعة في نظام وكيل نشط، يكون الفرق بين $22 و$91 في الساعة، أو ما يقارب $600,000 سنويًا من الفرق تحت الحمل المستمر.

تفصيلان في التسعير يجعلان الفجوة الحقيقية أوسع في اتجاه واحد وأضيق في الاتجاه الآخر:

Flash-Lite يحاسب على التفكير الداخلي بنفس معدل الإخراج. تسعّر رموز التفكير الداخلي بـ 2.50 دولار لكل مليون — نفس سعر الإخراج الظاهر. التفكير ليس مجانيًا، إنه غير مرئي فقط في الاستجابة. إذا استهلك وكيل فرعي 2000 رمز في التفكير قبل الإجابة، أضف نصف سنت لكل استدعاء، أو 10 سنتات عبر التفرع.

التخزين المؤقت يفضّل Muse Spark 1.2 من حيث النسب. قراءات الإدخال المخزنة مؤقتًا تكلف 0.15 دولار لكل مليون مقارنة بقائمة أسعار تبلغ 1.25 دولار — أي خصم 88%. تقرأ Flash-Lite الإدخال المخزّن مؤقتًا بسعر 0.03 دولار مقابل 0.30 دولار، أي خصم 90%، لكنها تفرض أيضًا حوالي 0.083 دولار لكل مليون لكتابة ذاكرة التخزين المؤقت، بينما لا تنشر Muse Spark 1.2 رسومًا منفصلة لكتابة ذاكرة التخزين المؤقت. بالنسبة للنشر التفرعي حيث يشارك كل وكيل فرعي نفس البادئة الكبيرة، تضيق الفجوة بشكل ملموس.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

زمن الاستجابة في الإنتاج هو المجال الذي يتقدم فيه Flash-Lite أكثر من غيره، وتُخفي أرقام المعايير ذلك. على OrcaRouter، وعلى مدى أسبوع متجدد من الحركة الفعلية، يُظهر Gemini 3.5 Flash-Lite زمن p50 حتى أول توكن يبلغ 816 مللي ثانية وp95 يبلغ 4.57 ثانية. يُظهر Muse Spark 1.1 — وهو أقرب بديل متاح، إذ لا تتوفر بيانات قياس عن الإصدار 1.2 بعد — متوسط p50 يبلغ 1.84 ثانية وp95 يبلغ 6.00 ثانية. عندما تعمل عشرون وكيلًا فرعيًا بالتوازي، فإن أبطأها يحدد الزمن الفعلي، لذا فإن p95 هو الرقم الذي يتحكم في زمن استجابة التفرع، وليس p50.

حيث أن الخيار الرخيص هو القرار الخاطئ

أربعة قيود على Gemini 3.5 Flash-Lite لا تظهر في مقارنة الأسعار وستظهر في مراجعة الحوادث.

سقف إخراج يبلغ 65,536 توكنًا. نصف ما تسمح به معظم النماذج في هذه الفئة، وجدار صلب لوكيل فرعي يُطلب منه توليد ملف كبير أو إرجاع مستند منظم طويل. لا تعلن نقطة نهاية Muse Spark 1.2 عن حد أقصى لطول الإكمال على الإطلاق — وهو أمر غير معتاد بما يكفي لاختباره بدلًا من الوثوق به، لكنه ليس حدًا موثقًا.

إنها نقطة نهاية غير خاضعة للإشراف. لا تحمل قائمة Flash-Lite أي علامة إشراف؛ بينما تحمل قائمة Meta الخاصة بـ Muse Spark 1.2 مثل هذه العلامة. وهذا يمثل ميزة حقيقية لبعض أعباء العمل ومشكلة امتثال لأخرى، ويجب أن يكون خيارًا متعمدًا وليس اكتشافًا.

بحث مدمج مكلف.أداة البحث على الويب في Flash-Lite تُسعَّر بحوالي 14 دولارًا لكل ألف استدعاء مقابل 2.50 دولار لـ Muse Spark 1.2. إذا كان وكلاؤك الفرعيون يبحثون بدلاً من مجرد القراءة، فإن النموذج الرخيص يصبح هو المكلف — بخمس مرات ونصف — كما أن حجم البحث في بنية التفرع (fan-out) يتزايد مع معامل التفرع.

ارتفع سعره، ولم ينخفض. يُدرج Gemini 3.5 Flash-Lite بسعر 0.30 دولار و2.50 دولار حيث كان Gemini 3.1 Flash-Lite السابق بسعر 0.25 دولار و1.50 دولار. الإخراج أغلى بنسبة 67% من الطبقة التي يحل محلها. إذا قمت بتحديد ميزانية وكيل فرعي بناءً على الطراز الأقدم، فأعد ضبطها.

Muse Spark 1.2 vs Gemini 3.5 Flash-Lite

عدم تماثل إضافي يستحق الذكر بوضوح: يتم تقديم Muse Spark 1.2 بواسطة مزوّد واحد فقط — Meta — دون مضيفين من جهات خارجية ودون أي خيار احتياطي. أما Gemini 3.5 Flash-Lite فلديها بصمة التشغيل الاعتيادية متعددة المناطق من الطرف الأول. بالنسبة للمنسّق، فهذه نقطة فشل واحدة لشجرة الوكلاء بأكملها؛ وبالنسبة لطبقة العمال، فهي نقطة فشل واحدة للتوزيع المتشعب.

الاقتران الذي ستستقر عليه معظم الفرق فعليًا

عند قراءتهما معًا، لا يعدّان هذان النموذجان منافسين بقدر ما هما نصفان لبنية واحدة، ويصف النص التسويقي لشركة Meta هذا الأمر بوضوح عندما يقدم دور الوكيل الأساسي بشكل منفصل عن دور الوكيل الفرعي.

الشكل الذي ينتج عن الأرقام: Muse Spark 1.2 بوصفه المنسق، وGemini 3.5 Flash-Lite بوصفها العمال. ثمّة استدعاء واحد مكلف ومتعمّد يقرأ المستودع، ويحمل الخطة، ويقرر ما يفوضه — حيث تمنحك 26 ثانية من التفكير وإسهاب على نطاق 95 مليون توكن خطة تستحق التنفيذ — تتبعه عشرون استدعاءً رخيصًا وسريعًا وضيقًا، يؤدي كلٌّ منها مهمة واحدة محدودة النطاق ويعود في أقل من ثانية عند المئين الخمسين. تدفع أسعارًا قريبة من أسعار الطليعة مرة واحدة لكل مهمة، وأسعارًا اقتصادية لكل وحدة عمل، وهذا هو بالضبط منحنى التكلفة الذي تريده بنية التفريع.

اقلب الأمر وسينهار الاقتصاد. عشرون وكيلًا فرعيًا من Muse Spark 1.2 بتكلفة 91 سنتًا لكل عملية توزيع تساوي أربعة أضعاف فاتورة عملٍ يُنجزه نموذج أضعف بـ18 نقطة في ثلث الوقت، ومنظّم Flash-Lite بمؤشر 36 سينتج خططًا لا يستطيع العمال إنقاذها.

كان بناء النظام منقسمًا بين موردين اثنين هو الجزء المزعج في السابق. Gemini 3.5 Flash-Lite موجود في كتالوج OrcaRouter بسعر 0.30 دولار و2.50 دولار — سعر قائمة المورد، يُمرَّر بدون أي هامش ربح، لذا فإن أي تغيير في السعر يصل إلينا في نفس اليوم بدلاً من بعد دورة عقدية — وMuse Spark 1.1 موجود هناك بسعر 1.25 دولار و4.25 دولار على نفس الأساس، وكلاهما خلف نقطة نهاية واحدة متوافقة مع OpenAI. هذا يعني أن نمط المنسّق-والعاملين عبارة عن سلسلتي نماذج في قاعدة شيفرة واحدة بدلاً من SDKs اثنين ومفتاحين وفاتورتين، كما أن تجاوز الفشل التلقائي يغطي حالة تعرض أحد الموردين لعطلٍ في منتصف توزيع المهام. على وجه الدقة بشأن ما هو متاح: Muse Spark 1.2 بحد ذاته ليس في الكتالوج بعد — تقدمه Meta مباشرة باعتبارها المزود الوحيد — لذا فإن أقرب نسخة من هذه الحزمة اليوم تعمل بإصدار 1.1 في خانة المنسّق.

اختر حسب الدور، وليس حسب النقاط

إذا كنت تختار طبقة عامل — تحليل المستندات، استخراج البيانات، تعديلات الملفات المحددة، التصنيف، الجزء المتكرر الضيق من شجرة الوكيل — فإن Gemini 3.5 Flash-Lite هو الأداة الأفضل، وعجز المؤشر البالغ 18 نقطة غير ذي صلة في الغالب لأنك لا تطلب منه التفكير. انتبه إلى سقف المخرجات وتسعير البحث.

إذا كنت تختار النموذج الذي يقرر ما يفعله العمال، فإن Muse Spark 1.2 هو المرشح الأقوى بين الاثنين، مع التحفظات التالية: ليس لديه درجة وكيلية مستقلة لكل بُعد، ولا سجل منافسة من أي نوع، ولا بيانات قياس عن بعد للإنتاج، ومزود واحد فقط. هذه هي الفجوات التي يجب سدها قبل أن يصبح قادرًا على حمل خطة إنتاجية.

وإذا كنت تأمل أن يقوم نموذج واحد بالمهمتين معًا، فإن الإجابة الصادقة من القياسات هي أن لا يفعل ذلك أيٌّ منهما. لا يمكن لـ Flash-Lite التخطيط عند المؤشر 36؛ ولا يمكن إنشاء عشرين نسخة من Muse Spark 1.2 في وقت واحد مقابل 91 سنتًا لكل عملية تفريع. إن ظهور كلمة "وكيل فرعي" في وصفَي المنتجين هو مجرد مصادفة تسويقية، وليس علامة على أنهما ينتميان إلى نفس الفئة.

مقارنات في هذه المقالة3

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا

© 2026 OrcaRouter

لمقدمي الخدمات

هل تدير منصة استدلال؟ اعرض نماذجك على OrcaRouter.

تواصل معنا

انضم إلى مجتمعنا

DiscordEmailXGitHubYouTube