بطاقة عنوان رئيسية تحمل النص «Intern-Decision-0.8B مقابل MathForm 8B» مع عنوان فرعي «أحدهما قادر على التحقق من عمله بنفسه»، وتحمل شهادتين «مخرجات Lean 4 متحقَّق منها عبر المُصرِّف» و«ثقة معلنة ذاتيًا فقط»، مع شعار OrcaRouter مُركَّب في الزاوية.
Guides & Insights

Intern-Decision-0.8B مقابل MathForm 8B: أحدهما يمكنه التحقق من عمله بنفسه

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أكثر سؤال مفيد يمكنك طرحه بشأن أي نموذج متخصص صغير هو: مَن يتحقق منه. إن Intern-Decision-0.8B وMathForm 8B كلاهما موجود لأن نموذجًا عامًا جرى ضبطه الدقيق ليصبح نموذجًا ضيقًا، وكلاهما مشتقان بموجب Apache-2.0 من أوزان Qwe​n، وكلاهما وُضعا على Hugging Face دون حملة تسويقية — لكنهما يقعان على جانبين متقابلين من خط يحدد كيف يمكنك نشرهما. MathForm 8B هو نموذج الأتمتة الصورية بحجم 8B التابع لـ OpenBMB، صدر في 14 أغسطس 2026، ويترجم الرياضيات المكتوبة باللغة الطبيعية إلى Lean 4 ويسلّم النتيجة إلى مُصرِّف، الذي إما يقبلها أو لا يقبلها. Intern-Decision-0.8B هو رأس قرار InternLM ذو 852,985,920 معاملًا، رُفع في 26 سبتمبر 2026، ويعيد توزيعًا احتماليًا مُعايَرًا على الخيارات التي قدّمتها مسبقًا — ولا شيء في العالم يتحقق بشكل مستقل مما إذا كانت التسمية التي يعيدها صحيحة. أحد هذين النموذجين ينتج مخرجات مصحوبة ببرهان. أما الآخر فينتج مخرجات مصحوبة بدرجة ثقة، والفرق في ما يمكنك فعله بهذين الأمرين هو المقال بأكمله.

يشرح هذا التأطير أيضًا لماذا تكون فجوة الحجم — 8B مقابل 0.8B، بمعامل عشرة — هي الرقم الأقل إثارة للاهتمام في المقارنة. لا يحاول أي من النموذجين أن يكون جيدًا فيما يفعله الآخر، ولا يخبرك تقييم أي منهما بأي شيء عن الآخر. ما يشتركان فيه هو نمط الإصدار وسلالة Qwen، وكلاهما يهم أقل من سؤال التحقق.

ما هو كل واحد منها في الحقيقة

‏MathForm 8B هو المنتج النهائي المطروح لوصفة من مرحلتين موصوفة في الورقة البحثية MathForm: توسيع نطاق الأتمتة الصورية الرياضية باستخدام استرجاع المعرفة والتحسين الموجّه بالتحقق (arXiv 2608.14221). يقوم مخطط استرجاع بسحب التعريفات ذات الصلة والصيغ الصورية القائمة من Mathlib قبل تشغيل المولِّد؛ ثم تُنقَّح العبارات المولَّدة باستخدام تشخيصات المصرّف وملاحظات الاتساق الدلالي؛ وتحتوي المدونة الناتجة، FormalVerse، على ما يقارب 367,000 مثال مُتحقَّق منه في Lean 4؛ ويُدرَّب MathForm 8B عليها عبر الضبط الدقيق الخاضع للإشراف يليه التعلّم المعزز باستخدام تصريف Lean وإشارات الاتساق الدلالي كمكافأة. وهو نموذج نصي فقط مبني على Qwen3-8B، ويُقدَّم عبر Transformers أو vLLM أو SGLang بواجهة برمجة تطبيقات متوافقة مع OpenAI، مع طول سياق موصى به قدره 16,384 رمزًا وحدّ أقصى لتوليد يبلغ 16,384 رمزًا. جميع خط أنابيب التقييم وملفات المعايير وسكربتات Pass@k موجودة في مستودع OpenBMB على GitHub، ومجموعة بيانات التدريب عامة.

‏Intern-Decision-0.8B هو الناتج المشحون لوصفة لم يصفها أحد. تقول بطاقة النموذج إنه «نموذج قرار منظم متعدد الوسائط مُضبوط بدقة انطلاقًا من Qwen3.5-0.8B» وتتوقف عند هذا الحد — لا وصف للبيانات، ولا إجراء تدريب، ولا ورقة بحثية، ولا مستودع. لكن ما توثّقه بدقة هو عقد الاستدلال. المحرك المرفق يحوّل خيارات كل سؤال إلى رموز أحادية الرمز، وينشئ هيكلًا يحتوي على عنصر نائب واحد <decision> لكل حقل، وينفّذ تمريرة أمامية سببية واحدة، ويقرأ اللوغيتات عند الموضع السابق لكل عنصر نائب، ويطبّق softmax على الرموز المسموح بها لذلك الحقل فقط، ويطبّق معايرة مُلاءَمة، ويعيد ربط الرموز بقيم خياراتك. لا يوجد generate() استدعاء ولا أخذ عينات في أي مكان من المسار. يقبل نصًا بالإضافة إلى ما يصل إلى ثماني صور، ويتعامل مع سؤال واحد إلى ستة عشر سؤالًا بما يصل إلى 62 خيارًا لكل منها، ويرفض المدخلات التي تتجاوز 8,192 رمزًا بدلًا من اقتطاعها. درجة حرارة المعايرة الافتراضية هي 2.747760550703، وتُضبط لكل نقطة تفتيش عبر تصغير NLL على 1,728 حالة.

اقرأ هاتين الفقرتين جنبًا إلى جنب، وسيبدو التفاوت صارخًا. تأتي MathForm 8B مع ورقة بحثية، ومجموعة بيانات، وخط لتقييم، ومستودع. أما Intern-Decision-0.8B فتأتي مع وصف لواجهة برمجة التطبيقات وجدول معايير.

عدم تماثل التحقق، وهو القصة الحقيقية

مخرجات MathForm 8B قابلة للتحقق بواسطة شيء غير الإنسان. إنها تُصدر Lean 4، وLean 4 إما أن يُصرَّف وإما ألا يُصرَّف. أرقام OpenBMB مُبلَّغ عنها ضمن نظامين لهذا السبب تحديدًا: Pass@8 بنسبة 88.06% تحت فحص الصياغة (Syntax Check)، وهو ما يعني أن المخرجات تُصرَّف، و72.37% تحت فحص الاتساق (Consistency Check)، وهو ما يعني أنها تُصرَّف ويوافق فحص الاتساق الدلالي على أن العبارة الصورية تعني ما قالته العبارة غير الصورية. كلا الرقمين متوسطان عبر ستة معايير، وتذكر الورقة أيضًا معدلات نجاح CC بنسبة 63% على FATE-H و37% على مجموعات FATE-X الفرعية الأصعب، مع الادعاء بأن هذا يتجاوز المُصيِّغات التلقائية المتخصصة بحجم 32B. هذه أرقام مُبلَّغ عنها من المورّد — فقد شغّلتها OpenBMB — لكن الخاصية المهمة بنيوية لا إحصائية: يمكن لنظام لاحق يستهلك مخرجات MathForm 8B أن يرفض صياغة صورية سيئة دون أن يطلب من نموذج أن يحكم عليها. المُصرِّف هو الحكم.

يتمتع Intern-Decision-0.8B بعَقد نوع ولا يوجد أوراكل. شكل المخرجات مضمون — حقلٌ معلن باسم choice يُعيد توزيعًا على قيم الخيارات التي أدرجتها، score يُعيد قيمة متوقعة مرجحة بالاحتمالات وفق معيارك، noul يُعيد احتمال نعم. لا شيء خارج النموذج يمكنه أن يخبرك ما إذا كانت نتيجة argmax صحيحة. قيمة الثقة هي تقدير النموذج نفسه لصحته، ويُعد عمل المعايرة الخاص بالبطاقة محاولة صادقة لجعل هذا التقدير ذا معنى — درجة حرارة مُلاءَمة تحافظ على argmax مع شحذ الاحتمالات أو تلطيفها، ويُتحقق منها على حالات محتجزة — لكن إجابة خاطئة مُعايرة جيدًا تظل إجابة خاطئة. إذا كانت خط أنابيبك بحاجة إلى معرفة ما إذا كانت التسمية صحيحة، فأنت بحاجة إلى بيانات مُوسومة، وتحتاج إلى قياسها بنفسك.

هذا ليس عيبًا فريدًا في Intern-Decision-0.8B. إنه حال كل مصنِّف، وهو المشكلة غير المحلولة في فئة نماذج القرار بأكملها التي تضم Jev من TypeSafe وLaya من Convai. يجدر قول ذلك بوضوح لأن جدول معايير أداء يحتوي على عمود لدرجة Brier قد يخلق انطباعًا بأن المعايرة هي التحقق. وهي ليست كذلك. تخبرك المعايرة بأنه عندما يقول هذا النموذج 80%، يكون محقًا نحو 80% من الوقت عبر التوزيع المُقيَّم — وهذا مفيد حقًا في ضبط العتبات وحساب القيمة المتوقعة، وليس ضمانًا لصحة كل عنصر على حدة.

لوحة النتائج، على الصفوف المشتركة بين كلا الطرازين

• المعاملات — Intern-Decision-0.8B: 852,985,920 عبر شريحة لغوية بحجم 1.50 GB، وشريحة رؤية بحجم 176 MB، ومُسقِط بحجم 25 MB. MathForm 8B: 8B كثيف، استنادًا إلى Qwen3-8B.

• النموذج الأساسي — Intern-Decision-0.8B: Qwen3.5-0.8B، صدر في فبراير 2026. MathForm 8B: Qwen3-8B.

• مهمة — Intern-Decision-0.8B: قرارات مُنمَّطة على مخطط تكتبه أنت — اختيار، تنقيط، ثنائي. MathForm 8B: رياضيات باللغة الطبيعية إلى صياغة صورية في Lean 4.

• المخرجات — Intern-Decision-0.8B: توزيع مُعايَر مع argmax لكل حقل، دون توليد نص. MathForm 8B: شيفرة مصدرية مولّدة بلغة Lean 4، وعادةً ما تكون طويلة.

• التحقق — Intern-Decision-0.8B: لا يوجد تحقق خارجي؛ الثقة مُبلَّغ عنها ذاتيًا. MathForm 8B: مُصرِّف Lean 4، بالإضافة إلى فحص الاتساق الدلالي.

• أدلة منشورة — Intern-Decision-0.8B: جدول معايير من البائع عبر سبعة معايير، غير مُعاد إنتاجه، لا توجد ورقة بحثية. MathForm 8B: ورقة بحثية، ومجموعة بيانات عامة من حوالي 367,000 مثال، وخط تقييم ومستودع، بتشغيل البائع.

• الترخيص — كلاهما Apache 2.0، ويحمل Intern-Decision-0.8B additionally ملف ترخيص Qwen المحفوظ لأوزانه الأصلية.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

التكلفة وزمن التأخير لا يمكن مقارنتهما، وهذا ليس تهرّبًا.

قياس InternLM لـ Intern-Decision-0.8B عند 33.98 مللي ثانية كمتوسط و37.50 مللي ثانية عند p95 لكل استعلام على بطاقة RTX 4090 واحدة عبر مسار Hugging Face المحلي، بينما سجل نظيرها بحجم 2B متوسط 33.28 مللي ثانية. توصي بطاقة النموذج الخاصة بـ MathForm 8B بما يصل إلى 16,384 رمزًا جديدًا لكل عملية تحويل إلى صيغة رسمية عند temperature 0.6 وtop_p 0.95. لا يقيس هذان القياسان المقدار نفسه. أحدهما تمريرة أمامية واحدة على مُوجّه؛ والآخر توليد انحداري ذاتي يمكن أن يمتد لآلاف الرموز. وضرب ميزانية التحويل إلى صيغة رسمية في قرار مدته 34 مللي ثانية لا يخبرك بشيء عن الكفاءة النسبية، لأن النموذجين لا يؤديان القدر نفسه من العمل — أحدهما يقرأ ويحسب الدرجات، والآخر يقرأ ويكتب نص برهان. إذا كانت الإنتاجية هي القيد لديك، فالحقائق ذات الصلة أبسط من نسبة. يحوّل MathForm 8B عبارة واحدة إلى صيغة رسمية في كل توليد، وعند 16 ألف رمز لكل خرج على نموذج كثيف بحجم 8B، فهذا عبء عمل يُشبع GPU ومرشح للمعالجة بالدفعات عبر vLLM أو SGLang، وكلاهما توثقه OpenBMB. يجيب Intern-Decision-0.8B عن ستة عشر سؤالًا تغطي سجلًا كاملًا في تمريرة واحدة، لذا فإن وحدة العمل سجل وليست حقلًا، وميزانية السجل هي سقف الإدخال البالغ 8,192 رمزًا — وهو يصل أسرع مما قد يتوقعه القارئ عندما تحزم حالة طويلة ومخططًا غنيًا وما يصل إلى ثماني صور.

حيث يكون كل واحد هو الأداة المناسبة

ينتمي MathForm 8B إلى مسار معالجة تكون عنق الزجاجة فيه هي المراجعة البشرية للرياضيات. توجد الأتمتة الصورية لأن كتابة Lean أبطأ من قراءته، ولأن العبارة القابلة للفحص آليًا هي عبارة يستطيع مساعد الإثبات بعدها مهاجمتها. والخاصية التي تجعله موثوقًا — مخرجات يتحقق منها المُصرِّف — هي أيضًا الخاصية التي تجعله محدودًا: فهو يصوغ صياغة صورية ولا يبرهن، وبطاقة النموذج صريحة في أن فحوصات التصريف تتطلب Kimina Lean Server قيد التشغيل، وأن التجارب استخدمت Lean 4.21.0. وكل من يتبناه يتبنى تلك المنظومة. وكما هي الحال مع أي نموذج مفتوح الأوزان عمره أيام أو أسابيع، فإن توجيه مسار اختباري إليه والرجوع إلى نموذج أثبت جدارته عند تعثره هو الطريقة الأقل مخاطرة لتقييمه، وهذا ما توجد من أجله بوابة ذات تجاوز تلقائي للفشل عبر سلسلة احتياطية — إعادات محاولة تصل قبل بدء الاستجابة، بحيث لا يصل تصوير صوري متعثر إلى المتصل بك أبدًا.

ينتمي Intern-Decision-0.8B إلى كل موضع توجد فيه بالفعل مجموعة إجابات مغلقة، وتكون فيه تكلفة توليد نصٍّ لاسترجاعها هدرًا محضًا. الفرز، والتوجيه، والتصحيح وفق معايير التقييم، والفصل في سجلٍ ما استنادًا إلى سياسة مكتوبة — أي الحالات التي يُستخدم فيها نموذج توليدي كوسيلة مكلفة للاختيار من قائمة. ومزاياه أنه حتمي، وأنه يعيد احتمالًا قابلًا للاستخدام بدلًا من سلسلة نصية عليك تحليلها، وأنه بمساحة 1.73 GB على القرص يعمل بارتياح ضمن ما تسمح به ذاكرة متصفح حاسوب محمول. وعيوبه أن التوثيق يتوقف عند واجهة API، وأنه لم ينشر أحد خارج InternLM نتيجة له، وأن العمود الوحيد في الاختبار المرجعي الذي يوحي بوجود مشكلة أمان — درجة 64.48 في WildJailBreak مقابل 96.29 لدى Jev — غير مفسَّر. لا تضعه في مواجهة مدخلات عدائية دون أن تُجري ذلك الاختبار بنفسك.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

يتشارك النموذجان نسبًا جديرًا بالملاحظة لأنه يغيّر ما يمنحك إياه مفهوم «مفتوح». كلٌّ منهما نسخة مضبوطة (fine-tune) من نقطة تحقق Qwen، وكلٌّ منهما يحافظ على ترخيص المنبع على نحو صحيح: MathForm 8B بموجب Apache 2.0 مع ذكر منشأ Qwen3-8B على البطاقة، وIntern-Decision-0.8B بموجب Apache 2.0 مع ملف LICENSE-QWEN منفصل في المستودع. لا يحمل أيٌّ منهما حدًّا للإيرادات أو قيدًا على مجال الاستخدام — على عكس ترخيص LFM Open License v1.0 التابع لـ Liquid AI، الذي يشترط أن يظل كيانك تحت عتبة إيرادات سنوية قدرها 10 ملايين دولار للحصول على الحقوق التجارية. إذا كنت تبني بغرض تجاري، فهذا فارق يفصل هذين الإصدارين عن أجزاء من منظومة النماذج الصغيرة، وينطبق عليهما كليهما بالتساوي.

إذا كنت تريد طبقة القرار دون نقطة التحقق غير الموثّقة

الفجوة بين "أن يكون رأس القرار هو الشكل الصحيح لهذه المشكلة" و"أن يكون رأس القرار هذا تحديدًا هو ما يمكنك الدفاع عنه أمام مراجع" هي ما يسدّه بديل مستضاف. Jev 1.13 من TypeSafe هو النموذج الذي اختبرت InternLM عائلتها مقابله على Jevbench، على Typed Decision وعلى ToolACE، وهو قابل للاستدعاء اليوم عبر نقطة نهاية واحدة متوافقة مع OpenAI بسعر 0.042 دولار لكل مليون رمز إدخال مع احتساب الإخراج بصفر — السعر المنشور من المورّد، يُمرَّر دون هامش ربح بدلًا من إضافة هامش عليه أثناء ذلك. وبالنسبة لقارئ يريد قياس ما إذا كان رأس القرار يساعد على الإطلاق قبل الالتزام بنقطة تحقق بحجم 0.8B ذات مستودع مفقود، فهذه هي التجربة الأولى الرخيصة، كما أن تقييمات Jev الخارجية الخاصة به تمنحه سجلًا موثقًا لا يملكه Intern-Decision-0.8B بعد.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

الإجابة المختصرة

هذان ليسا بديلين. MathForm 8B هو متخصص يمكن لبرنامج التحقق من مخرجاته، ويستهدف مهمة يكون فيها التحقق هو الجزء الصعب، ويأتي مع الورقة البحثية ومجموعة البيانات وأداة التقييم لإثبات الادعاء. Intern-Decision-0.8B هو متخصص لا يمكن إلا لك التحقق من مخرجاته، ويستهدف المهام التي كانت الإجابات فيها مكتوبة بالفعل وكان الجزء الصعب هو الوصول إليها بسرعة وبتكلفة منخفضة، ويأتي مع وحدة استدلال وجدول. إذا كنت بحاجة إلى صياغة رسمية، فهناك واحد فقط من هذين يستحق النظر. إذا كنت بحاجة إلى وسم وكنت مستعدًا لبناء الحقيقة الأرضية للتحقق منه، فإن 0.8B هو التنزيل الأكثر إثارة للاهتمام — سريع، حتمي، Apache 2.0، وصغير بما يكفي بحيث تكون تكلفة اكتشاف ما إذا كان جيدًا هي فترة بعد الظهر بدلاً من بند ميزانية.