
سولار ميني 4 مقابل ماث فورم 8B: أحد النموذجين يجيب عن السؤال، والآخر يجعله قابلاً للتحقق
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 لكل مليون رمز
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 لكل مليون رمز · 159 tok/s
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 220 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
ضع Solar Mini 4 إلى جانب MathForm 8B، وستكون تقارن بين نموذجين لا يتنافسان على الرمز نفسه. Solar Mini 4 هو نموذج خليط الخبراء المتناثر من Upstage، ذو 35 مليار معلمة، صدر في 22 سبتمبر 2026 مع نحو 3 مليارات معلمة نشطة لكل رمز، وهو يجيب عن الأسئلة: يقرأ مستندًا طويلًا، يستدل عليه، ثم يعيد نتيجة مكتوبة. MathForm 8B هو نموذج الصياغة الرسمية الآلية من OpenBMB، ذو 8 مليارات معلمة، نُشر في 14 أغسطس 2026 بموجب ترخيص Apache 2.0، وهو يفعل شيئًا لا يفعله أي نموذج استدلال على الإطلاق — فهو يأخذ عبارة رياضية باللغة الطبيعية ويعيد كتابتها كنظرية Lean 4 يستطيع مصرّف مساعد الإثبات التحقق من أنواعها. أحد النموذجين ينتج إجابات. والآخر ينتج أسئلة قابلة للتحقق آليًا، والثاني هو السلعة الأندر.
لا يزال من الجدير إجراء المقارنة على أي حال، لأن كليهما يصل في النهاية إلى النوع نفسه من خط المعالجة، ولأن كليهما يمتلك نقاط قوة متعاكسة على نحو يجعل الاختيار واضحًا بشكل غير معتاد. نموذج Upstage قوي في المستندات الطويلة، وضعيف في الاستدلال الصعب، ومكلف لكل مهمة مُنجزة. نموذج OpenBMB ضيق إلى حد أن يصبح عديم الفائدة خارج مجاله المتخصص، ولم يُقيَّم قط من مُقيِّم مستقل على الإطلاق، ولا يكلف شيئًا لتشغيله بمجرد أن تكون لديك GPU.
جنبًا إلى جنب، بشأن الأمور التي تختلف
• ما هو — Solar Mini 4 هو نموذج استدلال عام بسياق يبلغ 1M رمز (512K وفقًا لوثائق Upstage الخاصة) وقياس 24.1 على مؤشر Artificial Analysis Intelligence Index. MathForm 8B هو مُشكّل آلي أحادي المهمة، ليس له درجة مؤشر منشورة، ولا تقييم مستقل، ولا ادعاءات قدرات عامة.
• المعلمات — 35B إجمالًا / 3B نشطة، متفرقة، لـ Solar Mini 4؛ 8.19B كثيفة لـ MathForm 8B، مضبوطة ضبطًا دقيقًا انطلاقًا من Qwen3-8B على مجموعة FormalVerse الخاصة بـ OpenBMB التي تضم نحو 367,000 مثال Lean 4 تم التحقق منها.
• الترخيص والتسليم — Solar Mini 4 خاص، يتم الوصول إليه عبر واجهة برمجة تطبيقات Upstage ومنصات الطرف الثالث. MathForm 8B هو أوزان Apache-2.0 مع قالب محادثة، وأربع شظايا safetensors، ومسار نشر Transformers أو vLLM أو SGLang خلف نقطة نهاية متوافقة مع OpenAI.
• السعر — Solar Mini 4 بسعر 0.10 دولار / 0.01 دولار للمخزّن مؤقتًا / 0.40 دولار لكل مليون رمز، حاليًا بخصم 50% حتى 22 أكتوبر 2026. لا يوجد لـ MathForm 8B جدول تسعير؛ فتكلافته هي وحدة معالجة الرسومات التي تضعها تحته.
• سرعة — 204 رمز إخراج في الثانية لـ Solar Mini 4 على منصة اختبار Artificial Analysis، مع 88,300 رمز إخراج لكل مهمة فهرسة وحوالي 430 ثانية من العمل لكل مهمة. مخرجات MathForm 8B هي رأس مبرهنة Lean 4 واحد، بضع مئات من الرموز على الأكثر.
• استقلالية أرقامه — تم تشغيل Solar Mini 4 بواسطة طرف ثالث. أما MathForm 8B فلم يحدث ذلك: كل رقم في ورقته من إعداد المؤلفين أنفسهم، والنموذج أحدث وأكثر تخصصًا من أن يجذب تشغيلًا مستقلًا.
حيث يلتقي النموذجان، وحيث لا يلتقيان

أنماط الفشل هي ما يجعل هذا الاقتران مثيرًا للاهتمام، لأنها نقيضان تامان. أضعف نتيجة منشورة لـ Solar Mini 4 هي Terminal-Bench 4.0 عند 1%، مع AutomationBench-AA عند 22.3% — فهو سيئ في التحقق من عمله الخاص في بيئة تمنحه تغذية راجعة. الفرضية التصميمية بأكملها لـ MathForm 8B هي التحقق: تميّز OpenBMB بين Syntax Check، الذي يسأل عما إذا كانت عبارة Lean 4 تُترجم بنجاح، وConsistency Check، الذي يسأل عما إذا كانت العبارة التي تُرجمت تعني فعلاً الشيء نفسه الذي تعنيه المسألة غير الرسمية. الفشل الكلاسيكي الذي وُجد لمنعه هو عبارة تنجح في فحص الأنواع بينما تُضعف الادعاء بصمت.
هذا فرق حقيقي ويستحق أن نكون دقيقين بشأنه. نموذج استدلال ينتج برهانًا لديه مشكلة معروفة في التحقق الذاتي: لا شيء في عملية التوليد يخبرك ما إذا كانت الإجابة صحيحة. أما المُصرِّف فيفعل ذلك. إذا كانت سير عملك هي "تحويل بنك مسائل إلى شيء يمكن للآلة التحقق منه"، فإن MathForm 8B يقوم بالنصف من المهمة الذي لا يستطيع Solar Mini 4 القيام به على الإطلاق، وما يتبقى ليس مسألة درجة.
أرقام المورّد، الموسومة على هذا النحو: يذكر بحث OpenBMB متوسط Pass@8 بنسبة 88.06% وفق Syntax Check و72.37% وفق Consistency Check عبر ستة معايير تقييم، ويزعم أن هذه الأرقام تتفوق على عدة مُحوِّلات تلقائية إلى الصيغة الرسمية متخصصة بحجم 32B. لم يُعِد أي طرف ثالث إنتاج أي من ذلك. إن الانخفاض البالغ 16 نقطة بين الفحصين هو الرقم الأكثر إفادة — فهو يقيس عدد المرات التي لا تكون فيها العبارة المُصرَّفة تمامًا هي المسألة التي سألت عنها، وهو السبب في وجود Consistency Check كعمود منفصل.
لماذا قد يشغّل فريق كليهما
لأن خط الأنابيب الطبيعي يحتوي على مرحلة رخيصة وعالية الحجم ومرحلة مكلفة ومنخفضة الحجم. يعمل MathForm 8B على العتاد الخاص بك ويحوّل المسائل غير الرسمية إلى ترويسات Lean 4، مع وجود مترجم قادر على رفض المخرجات السيئة قبل أن يراها الإنسان. يتولى Solar Mini 4 ما يحدث حول ذلك: قراءة الورقة الداعمة، واستخراج الافتراضات، وتلخيص النتيجة بالكورية أو الإنجليزية، وتوجيه العمل. لا يتنافس الاثنان أبدًا على نفس الطلب، والنموذج الأصغر هو الذي يمتلك الجزء من المهمة الذي له إشارة نجاح/فشل موضوعية.
لا يمكننا توجيه أيٍّ من هذين النموذجين إليك — فنماذج Upstage ليست على OrcaRouter ولا نماذج OpenBMB كذلك — لذا إن أردت Solar Mini 4 فهو يأتي من واجهة Upstage API الخاصة بها، وإن أردت MathForm 8B فهو يأتي من Hugging Face ومن وحدة معالجتك الرسومية الخاصة بك. ما يمكننا فعله هو وضع بقية تلك المنظومة خلف مفتاح واحد: أكثر من 200 نموذج بهامش 0% فوق سعر القائمة لدى المزوّد، وتجاوز فشل تلقائي عبر المزوّدين، ولغة توجيه DSL تتيح لك ربط النماذج في استدعاء واحد. وفي سير عمل يقوم فيه متخصص صغير بخطوة الصياغة الشكلية ويتولى عمومي كبير كل ما حولها، فإن القدرة على تغيير النموذج العمومي الكبير بمجرد تعديل سلسلة نصية لنموذج — بدلًا من إصدار تكامل جديد — هي الفرق بين تغيير يستغرق أسبوعين وتغيير يستهلك ظهيرة واحدة.

ما الذي ينبغي استخلاصه
إذا كان سؤالك هو: «أي من هذه ينبغي أن أستخدم؟»، فالجواب الصادق أنه يعتمد على ما إذا كنت بحاجة إلى إجابة أم إلى صياغة صورية، ولن يحسم ذلك أي اختبار أداء. وإذا كان سؤالك هو: «هل يستحق MathForm 8B التنزيل؟»، فالجواب نعم لمهمة ضيقة واحدة، ولا لأي شيء آخر — فهو أداة صياغة صورية، لا أداة إثبات، ويبقى التزام الإثبات مفتوحًا في المخرجات التي ينتجها. وإذا كان سؤالك هو: «هل يستحق Solar Mini 4 مبلغ $0.36 للمهمة؟»، فالجواب نعم للمستندات الطويلة بكميات كبيرة، ولا لأي شيء يتطلب منه التحقق من عمله بنفسه.

المصادر، ختامًا. كل رقم من أرقام Solar Mini 4 أعلاه هو قياس مستقل من Artificial Analysis باستثناء نافذة السياق، فهي رقم Upstage الخاص ويخالف رقمهم. وكل رقم من أرقام MathForm 8B مُبلَّغ عنه من البائع من arXiv 2608.14221 وغير مُعاد إنتاجه، وكان إصداره غير معلن — فقد ظهرت الأوزان ومجموعة بيانات FormalVerse والورقة البحثية جميعها في 14 أغسطس 2026، دون أي منشور مدونة من البائع ودون أي تشغيل معياري مستقل حتى تاريخه.
