بطاقة عنوان رئيسية مُولّدة تحمل «Solar Mini 4 vs MathForm 8B» مع عنوان فرعي «أحدهما يجيب عن السؤال، والآخر يجعله قابلاً للتحقق» وشارتين مكتوب عليهما «نموذج عام في مواجهة مُصيِّغ تلقائي» و«تجميع Lean 4 في الحلقة».
Guides & Insights

سولار ميني 4 مقابل ماث فورم 8B: أحد النموذجين يجيب عن السؤال، والآخر يجعله قابلاً للتحقق

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Solar Mini 4 إلى جانب MathForm 8B، وستكون تقارن بين نموذجين لا يتنافسان على الرمز نفسه. Solar Mini 4 هو نموذج خليط الخبراء المتناثر من Upstage، ذو 35 مليار معلمة، صدر في 22 سبتمبر 2026 مع نحو 3 مليارات معلمة نشطة لكل رمز، وهو يجيب عن الأسئلة: يقرأ مستندًا طويلًا، يستدل عليه، ثم يعيد نتيجة مكتوبة. MathForm 8B هو نموذج الصياغة الرسمية الآلية من OpenBMB، ذو 8 مليارات معلمة، نُشر في 14 أغسطس 2026 بموجب ترخيص Apache 2.0، وهو يفعل شيئًا لا يفعله أي نموذج استدلال على الإطلاق — فهو يأخذ عبارة رياضية باللغة الطبيعية ويعيد كتابتها كنظرية Lean 4 يستطيع مصرّف مساعد الإثبات التحقق من أنواعها. أحد النموذجين ينتج إجابات. والآخر ينتج أسئلة قابلة للتحقق آليًا، والثاني هو السلعة الأندر.

لا يزال من الجدير إجراء المقارنة على أي حال، لأن كليهما يصل في النهاية إلى النوع نفسه من خط المعالجة، ولأن كليهما يمتلك نقاط قوة متعاكسة على نحو يجعل الاختيار واضحًا بشكل غير معتاد. نموذج Upstage قوي في المستندات الطويلة، وضعيف في الاستدلال الصعب، ومكلف لكل مهمة مُنجزة. نموذج OpenBMB ضيق إلى حد أن يصبح عديم الفائدة خارج مجاله المتخصص، ولم يُقيَّم قط من مُقيِّم مستقل على الإطلاق، ولا يكلف شيئًا لتشغيله بمجرد أن تكون لديك GPU.

جنبًا إلى جنب، بشأن الأمور التي تختلف

• ما هو — Solar Mini 4 هو نموذج استدلال عام بسياق يبلغ 1M رمز (512K وفقًا لوثائق Upstage الخاصة) وقياس 24.1 على مؤشر Artificial Analysis Intelligence Index. MathForm 8B هو مُشكّل آلي أحادي المهمة، ليس له درجة مؤشر منشورة، ولا تقييم مستقل، ولا ادعاءات قدرات عامة.

• المعلمات — 35B إجمالًا / 3B نشطة، متفرقة، لـ Solar Mini 4؛ 8.19B كثيفة لـ MathForm 8B، مضبوطة ضبطًا دقيقًا انطلاقًا من Qwen3-8B على مجموعة FormalVerse الخاصة بـ OpenBMB التي تضم نحو 367,000 مثال Lean 4 تم التحقق منها.

• الترخيص والتسليم — Solar Mini 4 خاص، يتم الوصول إليه عبر واجهة برمجة تطبيقات Upstage ومنصات الطرف الثالث. MathForm 8B هو أوزان Apache-2.0 مع قالب محادثة، وأربع شظايا safetensors، ومسار نشر Transformers أو vLLM أو SGLang خلف نقطة نهاية متوافقة مع OpenAI.

• السعر — Solar Mini 4 بسعر 0.10 دولار / 0.01 دولار للمخزّن مؤقتًا / 0.40 دولار لكل مليون رمز، حاليًا بخصم 50% حتى 22 أكتوبر 2026. لا يوجد لـ MathForm 8B جدول تسعير؛ فتكلافته هي وحدة معالجة الرسومات التي تضعها تحته.

• سرعة — 204 رمز إخراج في الثانية لـ Solar Mini 4 على منصة اختبار Artificial Analysis، مع 88,300 رمز إخراج لكل مهمة فهرسة وحوالي 430 ثانية من العمل لكل مهمة. مخرجات MathForm 8B هي رأس مبرهنة Lean 4 واحد، بضع مئات من الرموز على الأكثر.

• استقلالية أرقامه — تم تشغيل Solar Mini 4 بواسطة طرف ثالث. أما MathForm 8B فلم يحدث ذلك: كل رقم في ورقته من إعداد المؤلفين أنفسهم، والنموذج أحدث وأكثر تخصصًا من أن يجذب تشغيلًا مستقلًا.

حيث يلتقي النموذجان، وحيث لا يلتقيان

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

أنماط الفشل هي ما يجعل هذا الاقتران مثيرًا للاهتمام، لأنها نقيضان تامان. أضعف نتيجة منشورة لـ Solar Mini 4 هي Terminal-Bench 4.0 عند 1%، مع AutomationBench-AA عند 22.3% — فهو سيئ في التحقق من عمله الخاص في بيئة تمنحه تغذية راجعة. الفرضية التصميمية بأكملها لـ MathForm 8B هي التحقق: تميّز OpenBMB بين Syntax Check، الذي يسأل عما إذا كانت عبارة Lean 4 تُترجم بنجاح، وConsistency Check، الذي يسأل عما إذا كانت العبارة التي تُرجمت تعني فعلاً الشيء نفسه الذي تعنيه المسألة غير الرسمية. الفشل الكلاسيكي الذي وُجد لمنعه هو عبارة تنجح في فحص الأنواع بينما تُضعف الادعاء بصمت.

هذا فرق حقيقي ويستحق أن نكون دقيقين بشأنه. نموذج استدلال ينتج برهانًا لديه مشكلة معروفة في التحقق الذاتي: لا شيء في عملية التوليد يخبرك ما إذا كانت الإجابة صحيحة. أما المُصرِّف فيفعل ذلك. إذا كانت سير عملك هي "تحويل بنك مسائل إلى شيء يمكن للآلة التحقق منه"، فإن MathForm 8B يقوم بالنصف من المهمة الذي لا يستطيع Solar Mini 4 القيام به على الإطلاق، وما يتبقى ليس مسألة درجة.

أرقام المورّد، الموسومة على هذا النحو: يذكر بحث OpenBMB متوسط Pass@8 بنسبة 88.06% وفق Syntax Check و72.37% وفق Consistency Check عبر ستة معايير تقييم، ويزعم أن هذه الأرقام تتفوق على عدة مُحوِّلات تلقائية إلى الصيغة الرسمية متخصصة بحجم 32B. لم يُعِد أي طرف ثالث إنتاج أي من ذلك. إن الانخفاض البالغ 16 نقطة بين الفحصين هو الرقم الأكثر إفادة — فهو يقيس عدد المرات التي لا تكون فيها العبارة المُصرَّفة تمامًا هي المسألة التي سألت عنها، وهو السبب في وجود Consistency Check كعمود منفصل.

لماذا قد يشغّل فريق كليهما

لأن خط الأنابيب الطبيعي يحتوي على مرحلة رخيصة وعالية الحجم ومرحلة مكلفة ومنخفضة الحجم. يعمل MathForm 8B على العتاد الخاص بك ويحوّل المسائل غير الرسمية إلى ترويسات Lean 4، مع وجود مترجم قادر على رفض المخرجات السيئة قبل أن يراها الإنسان. يتولى Solar Mini 4 ما يحدث حول ذلك: قراءة الورقة الداعمة، واستخراج الافتراضات، وتلخيص النتيجة بالكورية أو الإنجليزية، وتوجيه العمل. لا يتنافس الاثنان أبدًا على نفس الطلب، والنموذج الأصغر هو الذي يمتلك الجزء من المهمة الذي له إشارة نجاح/فشل موضوعية.

لا يمكننا توجيه أيٍّ من هذين النموذجين إليك — فنماذج Upstage ليست على OrcaRouter ولا نماذج OpenBMB كذلك — لذا إن أردت Solar Mini 4 فهو يأتي من واجهة Upstage API الخاصة بها، وإن أردت MathForm 8B فهو يأتي من Hugging Face ومن وحدة معالجتك الرسومية الخاصة بك. ما يمكننا فعله هو وضع بقية تلك المنظومة خلف مفتاح واحد: أكثر من 200 نموذج بهامش 0% فوق سعر القائمة لدى المزوّد، وتجاوز فشل تلقائي عبر المزوّدين، ولغة توجيه DSL تتيح لك ربط النماذج في استدعاء واحد. وفي سير عمل يقوم فيه متخصص صغير بخطوة الصياغة الشكلية ويتولى عمومي كبير كل ما حولها، فإن القدرة على تغيير النموذج العمومي الكبير بمجرد تعديل سلسلة نصية لنموذج — بدلًا من إصدار تكامل جديد — هي الفرق بين تغيير يستغرق أسبوعين وتغيير يستهلك ظهيرة واحدة.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

ما الذي ينبغي استخلاصه

إذا كان سؤالك هو: «أي من هذه ينبغي أن أستخدم؟»، فالجواب الصادق أنه يعتمد على ما إذا كنت بحاجة إلى إجابة أم إلى صياغة صورية، ولن يحسم ذلك أي اختبار أداء. وإذا كان سؤالك هو: «هل يستحق MathForm 8B التنزيل؟»، فالجواب نعم لمهمة ضيقة واحدة، ولا لأي شيء آخر — فهو أداة صياغة صورية، لا أداة إثبات، ويبقى التزام الإثبات مفتوحًا في المخرجات التي ينتجها. وإذا كان سؤالك هو: «هل يستحق Solar Mini 4 مبلغ $0.36 للمهمة؟»، فالجواب نعم للمستندات الطويلة بكميات كبيرة، ولا لأي شيء يتطلب منه التحقق من عمله بنفسه.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

المصادر، ختامًا. كل رقم من أرقام Solar Mini 4 أعلاه هو قياس مستقل من Artificial Analysis باستثناء نافذة السياق، فهي رقم Upstage الخاص ويخالف رقمهم. وكل رقم من أرقام MathForm 8B مُبلَّغ عنه من البائع من arXiv 2608.14221 وغير مُعاد إنتاجه، وكان إصداره غير معلن — فقد ظهرت الأوزان ومجموعة بيانات FormalVerse والورقة البحثية جميعها في 14 أغسطس 2026، دون أي منشور مدونة من البائع ودون أي تشغيل معياري مستقل حتى تاريخه.