بطاقة عنوان مُولَّدة يحمل رأسها «TwIL-LM3-Pro vs MathForm 8B»، وعنوانها الفرعي «Statement vs Entailment»، مع بطاقتين مستديرتي الحواف كُتب عليهما «MathForm 8B - يُصدر عبارة Lean 4» و«TwIL-LM3-Pro - يحكم على العبارة». وشعار OrcaRouter مُدمَج في الزاوية السفلية اليمنى.
Guides & Insights

TwIL-LM3-Pro مقابل MathForm 8B: القول والاستلزام نصفان مختلفان من الصياغة الصورية

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

TwIL-LM3-Pro و MathForm-8B يستهدفان نفس المشكلة الواسعة — جعل الآلة تنتج نصًا صوريًا قابلًا للتحقق بدلًا من نثر معقول — وهما يحلان نصفين مختلفين منها. MathForm-8B هو أداة التشكيل التلقائي من OpenBMB ذات 8 مليارات معامل، التي صدرت في أغسطس 2026: عند إعطائها مسألة رياضية بلغة عادية، فإنها تنتج عبارة Lean 4 لتلك المسألة، تاركةً واجب الإثبات مفتوحًا ليتحقق منه المترجم. TwIL-LM3-Pro هو نموذج المنطق الصوري من webAI بحجم 3.66 مليار معامل من سبتمبر 2026، ومخرجاتها المستهدفة هي تسميات الاستلزام، وترجمات منطق الرتبة الأولى، والتحليلات الدلالية، وانتقادات براهين Lean. أحدهما ينتج الشيء الذي يجب التحقق منه. والآخر يخبرك ما إذا كان ما لديك يستلزم ما تدّعيه.

لأن الاثنين يتداخلان في مسار واحد فقط — الصياغة الصورية باستخدام Lean — فإن صفحة مقارنة تُغري وتُضلّل. والسؤال الأكثر فائدة هو ما الذي دُرِّب كلٌّ منهما على أن يُكافأ عليه، لأن إشارة المكافأة هي حيث يتباعد التصميمان بأشدّ حدة، وحيث يكمن في الواقع الاختيار الأذكى.

القضية مقابل الاستلزام

تم تدريب MathForm-8B على FormalVerse، وهي مدونة Lean 4 يصفها بحث OpenBMB بأنها تضم نحو 367,000 مثال مُتحقَّق منه، عبر الضبط الدقيق الخاضع للإشراف يتلوه التعلم المعزز. ويسترجع خط الأنابيب المحيط به التعريفات ذات الصلة والصيغ الصورية الموجودة من Mathlib قبل التوليد، ثم يحسّن الناتج باستخدام تشخيصات المترجم وفحص للاتساق الدلالي. ومخرجه عبارة صورية — الاستيرادات، والأنواع، وترويسة المبرهنة — يقبلها مترجم خارجي أو يرفضها. وتوضح بطاقة النموذج صراحةً أنه لا يحل المسألة ولا يدّعي حلها؛ فالبرهان مهمة شخص آخر.

يأتي TwIL-LM3-Pro إلى المجال نفسه من الجانب المنطقي. استهدف مسار معالجته ستة أهداف: ترجمة منطق الرتبة الأولى، ووسم الاستلزام، والتحليل الدلالي، والصياغة الرسمية في Lean، ونقد البرهان في Lean، واستقراء القواعد. فبينما صُمّم MathForm لإصدار عبارة، صُمّم TwIL-LM3-Pro لإصدار أحكام حول العبارات — هل هذه مستلزمة، هل هذا التحليل صحيح، هل محاولة البرهان هذه سليمة. وهو أيضًا يصوغ صياغة رسمية، وذلك هو الموضع الوحيد الذي يكون فيه النموذجان قابلين للمقارنة حقًا لا مجرد متجاورين.

مكافأة من مُصرِّف مقابل مكافأة من مُقيِّم

هذا هو الفرق التصميمي المهم، ويوثّقه كلا المورّدين.

جاءت مكافأة تدريب MathForm من ترجمة Lean ومن تغذية راجعة للاتساق الدلالي. المترجم هو حَكَم: إما أن يقبل الصياغة الرسمية وإما ألا يقبلها، ولا توجد درجات جزئية ولا شيء للجدال معه. تلك هي أنظف إشارة مكافأة في هذا الجانب من تعلّم الآلة، ولهذا تُقدَّم معايير قياس الصياغة الرسمية الآلية على شكل معدلات نجاح — فالمقياس تابع لبرنامج لا يهمه ما يعتقده أي شخص.

كانت المرحلة النهائية لـ TwIL-LM3-Pro عبارة عن تشغيل GRPO موزون بالإنتروبيا مقابل مُدقّق برمجي، مع وصف بطاقة النموذج الخاصة به ائتماناً جزئياً للمطابقات الفضفاضة و token-F1 بحيث تظل مجموعات المطالبات التي فشل فيها كل شيء تنتج تدرجاً. بوابته الماكرو الرئيسية هي المتوسط متساوي الأوزان لأربعة مسارات تصنيف محدودة بالإضافة إلى استقراء القواعد، وفي تلك البوابة يُحتسب مساري الاختيار من متعدد والإجراءات كـ `max(exact_match, loose_match)` — وهي قاعدة تذكرها البطاقة بوضوح، لأن الإجابة الصحيحة المنسقة بشكل مختلف هي أثر تنسيقي وليس فشلاً في الاستدلال.

لا يُعدّ أيٌّ من التصميمين أسوأ. إنهما مضبوطان لنتائج مختلفة. فالمكافأة المُقيَّمة بواسطة مُصرِّف تُنتج نموذجًا يمكنك أن توجّهه إلى مسألة صياغة صورية صعبة وتثق بمخرجاته، لأن المخرجات قابلة للتحقق. أما المكافأة المُقيَّمة بواسطة مُقيِّم مع منح درجات جزئية، فتُنتج نموذجًا يمكن تدريبه على أحكام أكثر ضبابية — الاستلزام، والنقد، واستقراء القواعد — حيث لا يوجد مُصرِّف يفصل فيها، ويكون البديل هو عدم التدريب على هذه المسارات إطلاقًا. والثمن هو أن الأرقام الناتجة لا تكون أفضل من جودة منظومة التقييم، وwebAI تقول ذلك: فصف strict-7، الذي يزيل كل أثر لاحتساب المطابقة المتسامحة، موجود تحديدًا كي يرى القارئ الرقم الأقسى إلى جانب الرقم الرئيسي.

الدرجات ليست على المقياس نفسه

ينشر كلا النموذجين أرقامًا مرتبطة بـ Lean ولا يمكن طرح بعضها من بعض. تذكر ورقة MathForm متوسط Pass@8 بنسبة 88.06% تحت فحص الصياغة و72.37% تحت فحص الاتساق عبر ستة معايير Lean، مع معدلي نجاح في فحص الاتساق يبلغان 63% و37% على مجموعتي FATE-H وFATE-X الفرعيتين الأصعب، وتزعم أنها تتفوق على عدة مُصيغات تلقائية متخصصة بحجم 32B. تذكر بطاقة TwIL-LM3-Pro أن token-F1 الخاص بـ `lean_formalize` يبلغ 0.5092 ودقة `lean_critic` تبلغ 0.7950 على أداة Track A الخاصة به.

يقيس Pass@8 في ظل فحص المترجم وtoken-F1 مقابل سلسلة نصية مرجعية أمرين مختلفين. يمنح Pass@8 النموذج ثماني محاولات ويسأل إن كانت إحداها قد تُرجمت وظلت متسقة؛ أما token-F1 فيقيس مدى تطابق توليد واحد مع مرجع. يمكن لنموذج أن يحقق نتيجة جيدة في أحدهما وضعيفة في الآخر، ولا شيء في أي من الوثيقتين يجيز قراءتهما جنبًا إلى جنب.

الخلاصة الصادقة لسجل المعيار هي أن أدلة MathForm-8B تأتي من ورقة بحثية يوجد فيها مُصرِّف داخل الحلقة، وأن أدلة TwIL-LM3-Pro تأتي من منصة اختبار تابعة لمورّد يوجد فيها مُقيِّم داخل الحلقة، ولم يُشغِّل أي طرف ثالث كليهما عبر معيار تقييم واحد. تعامل مع أي صفحة تضع "88.06%" بجانب "0.5092" كما لو كانا خط نتيجة على أنها صفحة لم تقرأ التعريفات.

المواصفات، جنبًا إلى جنب

• المعاملات — TwIL-LM3-Pro 3.66B كثيف مقابل MathForm-8B 8B، أي ما يقرب من 2.2 ضعف الحجم.

• النموذج الأساسي — `ibm-granite/granite-4.2-3b` مقابل `Qwen/Qwen3-8B`.

• بيانات التدريب — مدونة اصطناعية للمنطق الصوري تغطي ستة أهداف مقابل FormalVerse، ونحو 367,000 مثال Lean 4 تم التحقق منها.

• المكافأة — مُدقِّق برمجي مع احتساب جزئي وتسامح مع المطابقة المرنة مقابل تجميع Lean وتغذية راجعة للاتساق الدلالي.

• المخرجات الأساسية — تسميات الاستلزام، وترجمات منطق الرتبة الأولى (FOL)، والتحليلات الدلالية، وعبارات Lean ونقد البراهين مقابل عبارة Lean 4 ليتحقق منها مُصرِّف.

• نافذة السياق — 131,072 توكنًا لـ TwIL-LM3-Pro، مقيسة ضمن 8,192 توكنًا؛ يُقدَّم MathForm-8B بميزانيات توليد تصل إلى 16,384 توكنًا في مثال الاستخدام الخاص به.

• الترخيص — ترخيص webAI للاستخدام غير التجاري الإصدار 1.0 مقابل Apache 2.0.

• بصمة مُكمَّمة — يوفّر TwIL-LM3-Pro ملف GGUF بحجم 2.09 GiB من نوع Q4_K_M للعمل على CPU أو على 4 GB من VRAM؛ أما MathForm-8B فلا ينشر أي ملف GGUF في مستودعه الخاص.

الترخيص يقرر مسألة الإنتاج مرة أخرى

MathForm-8B مرخّص بموجب Apache 2.0. يمكنك ضبطه الدقيق وإعادة توزيعه وتقديمه داخل منتج تجاري. TwIL-LM3-Pro غير تجاري: يُسمح بالاستخدام البحثي والشخصي، ويتطلب النشر المولّد للإيرادات اتفاقًا منفصلًا مع webAI، الذي يتمثل مساره التجاري في ترتيب مؤسسي بدلًا من قائمة أسعار منشورة.

بالنسبة لمجموعة بحثية أو لطالب، هذا الفرق غير ذي أهمية — فكلاهما تنزيلات غير مقيّدة على Hugging Face. أما بالنسبة لشركة، فهو حاسم، ويشير إلى MathForm-8B لأي عمل إنتاجي في الصياغة الصورية التلقائية، بغض النظر عن أي النموذجين يحقق نتيجة أفضل في مسار لم يقِسه أي من المورّدين بالطريقة نفسها.

أين يقع الموجّه في هذا المسار

لا يمثل TwIL-LM3-Pro ولا MathForm-8B مسارًا في كتالوج OrcaRouter، والأسباب مختلفة: أحدهما مرخّص بترخيص غير تجاري وليست له نقطة نهاية مستضافة، والآخر منشور كنسخة تحقق مفتوحة للاستضافة الذاتية. أما مسألة التوجيه في خط أنابيب الصياغة الرسمية فهي الطبقة المحيطة بهما. وبناء مدونة على نمط FormalVerse يعني توليد آلاف المسائل غير الرسمية، وتصفيتها من حيث سلامة الصياغة، وكتابة فحوص الاتساق الدلالي التي تُقيّم المخرجات — وكلها استدعاءات نصية، وكلها من نوع العمل الذي تريد فيه أن تبدّل النموذج الذي يولّد البيانات الضخمة بالنموذج الذي يحكم عليها دون عقد ثانٍ. على نقطة نهاية واحدة متوافقة مع OpenAI أمام أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش مضاف بنسبة 0%، يصبح هذا التبديل مجرد تغيير في الإعدادات، وأي تخفيض سعر من المورّد على نموذج التوليد يسري في اليوم نفسه. التجاوز التلقائي للفشل عنصر حامل للحمل في بناء المدونة تحديدًا لأن مهمة تتعطل في ثلثي الطريق خلال تمريرة توليد تكلّف التشغيل بأكمله.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

تقسيم العمل

إذا كانت المهمة هي تحويل رياضيات الكتب الدراسية إلى عبارات Lean قابلة للترجمة البرمجية على نطاق واسع، وكان لا بد من طرح النتيجة ضمن منتج تجاري، فإن MathForm-8B هو الأداة، ورخصة Apache 2.0 هي السبب. وإذا كانت المهمة هي تقرير ما إذا كان نص ما يستلزم ادعاءً، أو وسم الاستلزام، أو تحليل الدلالات، أو نقد محاولة برهان، فإن TwIL-LM3-Pro يغطي مجالًا لم يكن MathForm موجّهًا إليه قط — ورخصته غير التجارية حدٌّ لما يمكن أن تُستخدم فيه تلك القدرة، وليست نقطة ضد القدرة نفسها.

التركيبة المنطقية هي خط معالجة من مرحلتين وليس خيارًا: أحد النموذجين يُصدر العبارة الرسمية، والآخر يحكم عليها. وقد نشر كلا النموذجين خط المعالجة الذي أنتجهما، وهو أمر غير معتاد بهذا الحجم، وهو السبب في إمكان إجراء هذه المقارنة أصلًا.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.