بطاقة عنوان مُولّدة تحمل النص 'Clef vs MathForm-8B'، وعنوانها الفرعي 'أحدهما يجيب على سؤالك، والآخر يكتب برهانًا'، مع شرائح تحمل النص 'Apache 2.0 كلاهما' و 'اثنان من ضبط Qwen الدقيق'. شعار OrcaRouter مُركّب في الزاوية السفلية اليمنى.
Engineering & Research

كليف مقابل MathForm-8B - أحدهما يجيب على سؤالك، والآخر يكتب النموذج.

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

سبب وضع Cloudflare/clef بجانب openbmb/MathForm-8B هو أنهما أكثر شيئين يسهل الخلط بينهما في الأوزان المفتوحة حاليًا، والخلط بينهما يكلّف جولة تدريب. كلاهما نموذجان مضبوطان تدريبًا دقيقًا مبنيان على نقطتي تفتيش Qwen3.8-27B وQwen3-8B على التوالي. كلاهما بترخيص Apache-2.0. نُشر كلاهما خلال الأسابيع العشرة الماضية. كلاهما ضيّقا النطاق، ومبنيان لغرض محدد، ويصفهما صانعوهما بأنهما متخصصان لا عامّان. ولا علاقة بينهما على الإطلاق، لأن أحدهما ينتج رقمًا مختارًا من قائمة قدّمتها، والآخر ينتج شيفرة مصدرية بلغة Lean 4، رمزًا تلو الآخر، ليتحقق منها مساعد إثبات.

Clef هو نموذج قرار متعدد الوسائط من Cloudflare بعدد معاملات يبلغ 27 مليارًا: تعطيه حالة ومخططًا لأسئلة محدّدة الأنواع، فيعيد احتمالًا معايرًا لكل إجابة مسموح بها في تمريرة واحدة غير انحدارية ذاتيًا، دون أي توليد نصي في أي مكان من المسار. MathForm-8B، من OpenBMB، هو نموذج أتمتة للصياغة — تدخله عبارة رياضية باللغة الطبيعية، فيخرج Lean 4، والخط الأنابيب الذي دربه موصوف في مطبوعة arXiv أولية نُشرت إلى جانب الأوزان في 14 أغسطس 2026. سقف أحد النموذجين هو حجم قائمة خياراتك. وسقف الآخر هو قوة نظرية الأنواع في Lean. السؤال عن أيهما أفضل هو خطأ فئوي، وكون كليهما ضبطًا دقيقًا مفتوح الأوزان بترخيص Apache-2.0 بعدد معاملات يتراوح بين ثمانية وسبعة وعشرين مليارًا هو بالضبط ما يجعل هذا الخطأ سهل الوقوع.

ما الذي تحظره واجهة كل نموذج ماديًا

أسرع طريقة لرؤية الانقسام هي أن تقرأ ما يمكن أن يعيده كل واحد.

• الإدخال — يستقبل Clef حالة (نصًا، أو JSON، أو صورًا، أو إطارات فيديو) بالإضافة إلى من 1 إلى 64 سؤالًا مُسمّى ومُحدّد النوع؛ ويستقبل MathForm-8B عبارة رياضية بلغة طبيعية.

• المخرجات — يعيد Clef احتمالًا واحدًا لكل خيار مسموح به، بعد تطبيق softmax لكل سؤال. يعيد MathForm-8B شفرة مصدرية بلغة Lean 4.

• أنواع الأسئلة — أنواع Clef هي noul (صواب/خطأ، مع احتمال أن تكون صوابًا)، اختيار (من 2 إلى 26 خيارًا مسمّى) ودرجة (من 2 إلى 26 مستوى مرتبًا)؛ لا يوجد لدى MathForm-8B أي مفهوم للأسئلة على الإطلاق.

• المعايرة — تنشر Clef حقل ثقة لكل إجابة؛ وتنشر MathForm-8B معدلات Pass@8 ضمن فحوصات الصياغة والاتساق.

• التقديم — يتم تقديم Clef عبر ما هو متوافق مع Jev/SystemOne، وهو POST /v1/systemone جسم، مستضاف أو ذاتي التشغيل؛ يأتي MathForm-8B مع تعليمات Transformers و vLLM و SGLang، وكلها توفر نقطة نهاية إكمال متوافقة مع OpenAI عند سياق 16,384 رمزًا مع max_new_tokens مضبوطًا على 16,384.

النتيجة العملية تظهر فورًا. إذا كنت بحاجة إلى حكم بنعم/لا حول قطعة من النص، فإن Clef هو الوحيد من بين الاثنين القادر على إنتاجه — فلا توجد طريقة لطرح سؤال على MathForm-8B لا يكون «اكتب كود Lean 4 لهذا». وإذا كنت بحاجة إلى Lean 4، فإن Clef هو الوحيد من بين الاثنين الذي لا يستطيع إنتاجه على الإطلاق، وليس ذلك عن ضعف: إن مطالبة مُقيِّم مقيَّد بمخطط بأن يصوغ مبرهنة صياغة صورية لا يتوافق مع عقده، لذا يُرفض الطلب بحكم التصميم بدلًا من أن يُجاب عنه بشكل سيئ.

A two-column comparison scoreboard titled 'Clef vs MathForm-8B — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; Trained from: Qwen3.8-27B; Output: probability per option, no text; Context: 65,536 tokens; Interface: /v1/systemone, 1 to 64 typed questions; Evidence: vendor run, unreproduced. The right column 'MathForm-8B' reads: Parameters: 8B text-only; Trained from: Qwen3-8B; Output: Lean 4 source code; Context: 16,384 tokens; Interface: OpenAI-compatible completion; Evidence: paper, Pass@8 88.06% SC, 72.37% CC. A footer reads 'Clef figures per Cloudflare; MathForm figures per OpenBMB's paper. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

خط الأنابيب الذي ينتمي إليه كلاهما

هناك بنية حقيقية يقع فيها هذان النموذجان جنبًا إلى جنب، ويستحق استعراضها لأنها تجعل الانقسام ملموسًا لا مجرّدًا. لنتأمل خدمة تُصوغ الرياضيات صياغة صورية للباحثين والطلاب.

تصل العبارات بلغة طبيعية، غير محدودة في نوعها. وقبل أن يمكن إضفاء أي صيغة رسمية على شيء ما، لا بد لشيء ما أن يقرر ما الذي وصل. هل هذه مبرهنة يجب إثباتها، أم تعريف يجب إضافته، أم طلب للتحقق من برهان موجود، أم سؤال يحتاج إلى توضيح قبل أن يمسّ أي أحد Lean؟ هل هي مكتفية بذاتها، أم تتوكأ على سياق لم يقدمه المستخدم؟ هل الرموز مألوفة، أم أن هذا الترميز لم يره النظام من قبل؟ كل واحد من هذه أسئلة محدودة النطاق بمجموعة خيارات صغيرة — الشكل الدقيق لـ Clef — والاحتمال المعاير المرفق بكل جواب هو ما يتيح للخدمة أن تفعل شيئًا معقولًا مع الأسئلة غير المؤكدة: توجيه أي شيء يقع تحت عتبة معينة إلى إنسان بدلًا من التخمين.

الخطوة الثانية تخص MathForm-8B. خُذ عبارة صُنّفت بالفعل كنظرية مكتفية بذاتها بترميز معروف، ثم أصدِر Lean 4. تلك مسألة توليد، ومسألة الجودة هي كم مرة يُصرَّف الناتج بنجاح وكم مرة يعني الشيء نفسه الذي تعنيه العبارة الأصلية — وهو بالضبط ما يقيسه محورا التقييم لدى المورّد. هذا هو النمط العام الجدير باستخلاصه من الاقتران: إن وجود مصنّف محدود رخيص أمام مولّد متخصص مكلف يكون عادةً أرخص وأكثر موثوقية من توجيه المولّد ليقرر ما إذا كان ينبغي أن يعمل أصلاً.

ما الذي تقيسه الأرقام على كل جانب فعليًا

يفيد ملخص arXiv الخاص بـ OpenBMB بأن MathForm-8B يبلغ متوسط معدلات Pass@8 قدره 88.06% تحت Syntax Check و72.37% تحت Consistency Check عبر ستة اختبارات مرجعية، وأنه على المجموعتين الفرعيتين FATE-H وFATE-X يحقق معدلي نجاح الاتساق 63% و37%، وكلاهما أعلى من أقوى خطوط الأساس المتخصصة التي تقارن بها الورقة. ويُعدّ مسار التدريب الجزء المثير للاهتمام في هذا الادعاء: حيث يستخرج مخطِّط استرجاع التعريفات ذات الصلة والصيغ الرسمية القائمة من Mathlib قبل التوليد، ثم تُراجَع العبارات المولّدة باستخدام تشخيصات المصرّف وتغذية راجعة للاتساق الدلالي، وهكذا بُنيت مجموعة بيانات FormalVerse المكوّنة من نحو 367,000 مثال Lean 4 تم التحقق منه قبل الضبط الدقيق الخاضع للإشراف والتعلّم المعزّز. هذه أرقام معلنة من الجهة المطوّرة ومستمدة من ورقة ومن بطاقة نموذج. ولم يُعِد تشغيلها أي طرف مستقل.

أرقام Clef تقيس شيئًا آخر تمامًا وليست قابلة للمقارنة. يسجّل تقرير تشغيل Decision Index من Cloudflare قيمة macro-F1 لتصنيف النوايا في BANKING77 تبلغ 94.2، وCLINC150 مع التعامل مع الحالات خارج النطاق عند 97.4، وGPQA Diamond عند 48.0 — حيث يسجّل Jev الأقدم 78.3 — ووسيط زمن استجابة الطلبات 209.3 مللي ثانية. إنه جدول عن التصنيف والتوجيه، أنتجته جهة المورّد على مجموعة الاختبارات الخاصة بالمورّد نفسه، واستُضيف إلى لوحة الصدارة الخاصة بالمورّد نفسه، ولم يُعَد إنتاجه.

الجملة الصادقة الوحيدة التي يمكن كتابتها عن هذين العمودين هي أنهما لا يشتركان في أي معيار مرجعي، ولا وحدة قياس، ولا فلسفة تقييم. إن نسبة 37% التي حققها MathForm-8B على مجموعة فرعية صعبة من الصياغة الرسمية، و97.4 التي حققها Clef في الكشف عن النوايا خارج النطاق، هما ادعاءان حقيقيان من صانعيهما حول مهمتين مختلفتين، والقارئ الذي يضعهما جنبًا إلى جنب لم يتعلم شيئًا سوى أن كلا الرقمين موجودان.

ما الذي ستشغّله، وما تكلفته

لا يوجد أي من النموذجين كمسار على OrcaRouter، ولا يقدم هذا المقال أي ادعاء بشأن التوفر — يُرجع الكتالوج خطأ 404 لـ cloudflare/clef و لـ MathForm-8B. يبلغ حجم مستودع MathForm حوالي 16.4 جيجابايت، وكلا النموذجين مرخصان بموجب Apache-2.0، لذا يمكن استضافتهما ذاتيًا غدًا من قبل أي شخص يمتلك العتاد.

• Clef على Cloudflare — $0.24 لكل مليون رمز إدخال على Workers AI، مع زمن الاستجابة المنشور المقاس على وحدة H200 واحدة.

• MathForm-8B مستضاف ذاتيًا — لا استضافة من مورّد، ولا سعر لكل رمز، وسياق موثّق بحجم 16,384 رمزًا، وهو قيد يستحق الملاحظة: لن يتّسع قسم طويل من ورقة بحثية في تمريرة واحدة.

• البديل الموجّه لنصف المصنِّف — Jev 1.13 من TypeSafe بسعر 0.042 دولار لكل مليون رمز إدخال ضمن سياق من 65,536 رمزًا، ويُقدَّم عبر نفس POST /v1/systemone جسم الطلب الذي يستخدمه Clef، مما يجعله بديلاً جاهزًا للخطوة الأولى في خط المعالجة أعلاه.

هنا تحديدًا تبرّر طبقة التوجيه وجودها في هذا الاقتران بعينه. النمط هو مُقرِّر ومولِّد، والنصف المُقرِّر هو الذي لديه بديل فعلي — نقطة نهاية واحدة أمام أكثر من 200 نموذج، سعر قائمة المزوّد يُمرَّر دون أي هامش مضاف لكل رمز، وتجاوز فشل تلقائي بحيث لا يؤدي تعثّر أحد المزوّدين إلى تعطيل البوابة الأمامية لخط أنابيبكأما نصف المولّد فهو ملف بحجم 16.4 غيغابايت تشغّله بنفسك، ولا تغيّر أي نقطة نهاية ذلك.

A headless capture of the openbmb/MathForm-8B model card on Hugging Face, showing the model title, the TextGeneration, Transformers and Safetensors tags, a link to the openbmb/FormalVerse dataset, the English language marker, and the qwen3, lean4, autoformalization, mathematics, formal-verification and reasoning subject tags.

شيء آخر تخفيه المقاسات

أعداد المعلمات تدعو إلى مقارنة لا تصح. فـ Clef يبلغ 27B وMathForm-8B يبلغ 8B، لذا من الطبيعي أن يُفترض أن النموذج الأكبر هو الأكثر قدرة وأن الأصغر هو المتخصص. لكن الأمر معكوس من حيث النوع. Clef كبير لأنه يحمل عمودًا فقريًا متعدد الوسائط مجمّدًا يحتاجه لقراءة لقطات الشاشة والفواتير؛ أما الجزء المدرَّب فوقه فهو رأس مخطط صغير مزوّد بمهايئات من الرتبة 256. MathForm-8B صغير لأن Lean 4 هدف ضيق وكانت قاعدة Qwen3-8B كافية لبلوغه، حيث تقع الهندسة الحقيقية في خط أنابيب الاسترجاع والتحقق الذي أنتج بيانات تدريبه لا في عدد معلماته.

الحجم، بعبارة أخرى، يخبرك بما كان على كل نموذج أن يحمله، لا بمدى صعوبة المشكلة التي يحلها. فنموذج 27B يقرأ إيصالًا ويعيد "billing, 0.98"، ونموذج 8B يُخرج كود Lean قابلًا للتصريف، وكلاهما يفعل بالضبط ما صُمّم من أجله، كما أن صياغة الأمر على أنه ثمانية مليارات مقابل سبعة وعشرين مليارًا ستقودك إلى النموذج الخاطئ في نحو نصف الحالات.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the Jev 1.13 title, text input and output modality labels, a p50 TTFT latency figure, the Performance and Public benchmarks tabs, and the code-sample panel.

القرار، والسؤال الذي لم يُجب عنه أيٌّ من المورّدَين

إذا كان لديك خط أنابيب يستوعب لغة طبيعية غير محدودة ويحتاج إلى توجيهها قبل إنفاق الحوسبة عليها، فإن الخطوة الأولى هي مصنّف محدود — Clef حيث تهمّ مدخلاته متعددة الوسائط وتبدو أرقامه جيدة على بياناتك، أو Jev 1.13 حيث تريد نفس شكل الطلب بسعر قائمة أقل ودون ربط معماريتك بمورّد لم يُعِد أحد إنتاج تقييمه. الخطوة الثانية هي مولّد متخصص، وإذا كان ذلك المولّد هو Lean 4، فإن MathForm-8B هو النموذج المفتوح المبني لهذا الغرض تحديدًا، مع خط أنابيب منشور ومدوّنة نصية خلفه.

ما يغيب على الجانبين هو النوع نفسه من الأدلة. تشغيل Decision Index الخاص بـ Clef هو خاص بـ Cloudflare ولم يُعَد تنفيذه بشكل مستقل قط؛ وأرقام Pass@8 الخاصة بـ MathForm-8B تأتي من ورقته البحثية الخاصة. كلاهما ادعاءان طموحان في مجال يكون فيه الاختبار الصادق رخيص الوصف ومكلف التنفيذ — خُذ بيانات لم يتدرّب عليها أي من المورّدين، وطبّق خط المعالجة نفسه، وانشر النتيجة. وإلى أن يفعل أحدهم ذلك لأي من النموذجين، فإن الشيء المفيد الذي يمكن أن تخبرك به هذه المقارنة هو شكل: أحد هذين ينتمي إلى مقدمة خط المعالجة لديك ليقرر ما يصل، والآخر ينتمي خلفه للقيام بالعمل الصعب الضيق، ولا يصلح أحدهما كبديل عن الآخر عند أي عدد من المعاملات.