
Ember-1 مقابل MathForm-8B: نموذجان بُنيَا عبر تضييق قاعدة مُستعارة
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 177 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
Ember-1 وMathForm-8B يتشاركان استراتيجية لا يعلن أي من المختبرين عنها بهذا الوصف: كلاهما يمثل تضييقًا لنموذج درّبه طرف آخر. Ember-1 هو مشتق متخصص من Fireworks Research لنموذج Kimi K3 من Moonshot AI، نُشر في 23 سبتمبر 2026، وأُعيد تدريبه ليبلغ دقة K3 باستخدام رموز أقل بنحو 40%. أما MathForm-8B فهو نموذج الأتمتة الرسمية (autoformalization) بحجم 8B من OpenBMB، صدر بهدوء في 14 أغسطس 2026 كضبط دقيق Apache-2.0 لنموذج Qwen3-8B من Alibaba، ويحوّل الرياضيات غير الرسمية إلى عبارات مبرهنات Lean 4 يمكن للمترجم التحقق منها. أحد التضييقين أزال التفكير المهدر وأبقى القدرة العامة سليمة. والآخر أزال تقريبًا كل القدرة العامة واشترى القابلية للتحقق بدلًا منها. وضعهما معًا هو أوضح طريقة لرؤية التكلفة الفعلية للتخصص، لأن النموذجين أنفقا ميزانيتيهما التدريبيتين على الجانبين المتقابلين من ذلك الدفتر.
نوعان من التضييق
تدخّل Fireworks Research سلوكي. يُبقي Ember-1 على بنية Kimi K3 واتساعها — فالرياضيات والبرمجة واتباع التعليمات والمحادثة والبحث واستخدام الأدوات والهندسة البرمجية كلها تظهر في مزيج التدريب — ويغيّر فقط المدة التي يتأنى فيها النموذج قبل الإجابة. النتيجة المبلّغ عنها هي أن طول الاستدلال انخفض بنسبة 35–50% دون خسارة في الدقة عبر سبعة معايير واختباري A/B في بيئة إنتاج العملاء، مع انخفاض أحد أعباء العمل البرمجية الإنتاجية من 49.3K إلى 29.9K من رموز الإخراج بينما ظلّت درجته ثابتة عند 0.753 مقابل 0.751. كل رقم مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه.
تدخّل OpenBMB تعاقدي. يأخذ MathForm-8B نموذج Qwen3-8B ويوجّه كامل ميزانية التدريب نحو شكل مخرجات واحد: عبارة Lean 4 مع ترويسة imports ومبرهنة مُسمّاة. وتتألف خط الأنابيب من ضبط دقيق بإشراف على FormalVerse — وهي مجموعة نصوص تضم نحو 367,000 مثال Lean 4 مُتحقَّق منه، بنتها OpenBMB وأصدرتها إلى جانب النموذج — يتبعها تعلّم معزّز يستخدم تجميع Lean والاتساق الدلالي كإشارة مكافأة. لا يحل النموذج البراهين. بل يكتب العبارة التي سيكملها مُبرهِن، ويصف تأطير الورقة البحثية نفسه تقييم المعايير الستة بأنه مقصد التمرين.

ما الذي تخلى عنه كل واحد
لم يتنازل Ember-1 إلا عن القليل جدًا على الورق، وهذا هو جوهر الادعاء بأكمله. تُظهر ورقته المنشورة فوزًا في Terminal Bench 2.1 بنسبة 82.0% مقابل 80.9% لـ Kimi K3 Max، وفي DeepSWE 1.1 بنسبة 75.2% مقابل 66.4%، وخسائر طفيفة في SWE-bench Verified بنسبة 92.2% مقابل 93.2% وفي SWE-Interact بنسبة 20.0% مقابل 21.3%. هذه أرقام مورّد على مجموعات اختارها المورّد، لكن النمط متسق: نموذج لم يفقد قدرته بقدر ما أعاد توجيه موضع بذله للجهد. أما التوفير في التوكنات فيتراوح من 51.9% في Terminal Bench نزولًا إلى 5.9% في τ-2 Bench Airline، لذا فإن «حوالي 40%» متوسط ضمن تفاوت واسع جدًا.
تخلى MathForm-8B عن معظم ما يُعرف به Qwen3-8B. فهو لا يجري محادثة عامة، ولا يغطي اللغات واللهجات الـ119 التي دُرِّب عليها Qwen3-8B، ولا يقبل الصور أو الصوت. ميزانية توليده مُحدَّدة لمخرجات Lean، لا للاستدلال المختلط الموسَّع. ما احتفظ به هو ترخيص متساهل وبصمة صغيرة: أربع شظايا safetensors بصيغة BF16، تعمل تحت Transformers أو vLLM أو SGLang خلف نقطة نهاية متوافقة مع OpenAI، مع مسار تجميع يتوقع وجود Kimina Lean Server على Lean 4.21.0.
الأرقام تقيس أشياء مختلفة، والفجوة هي المغزى
الرقم الرئيسي لـ Ember-1 هو نسبة مئوية من المهام التي أنجزها وكيل بشكل صحيح — Terminal Bench 2.1، 89 عينة، 82.0%. أما الأرقام الرئيسية لـ MathForm-8B فهي متوسط درجات Pass@8 عبر ستة معايير للتشكيل الآلي: 88.06% في ظل فحص نحوي و72.37% في ظل فحص اتساق أكثر صرامة. وهذان ليسا على المحور نفسه. أحدهما يقيس ما إذا كان الوكيل قد أنجز مهمة في الطرفية؛ والآخر يقيس ما إذا كانت عبارة مبرهنة مولّدة تُحلَّل نحويًا، وما إذا كانت تعني الشيء نفسه الذي تعنيه المسألة غير الرسمية التي اشتُقت منها.
إن الفارق بين 88.06 و72.37 داخل نتائج MathForm نفسها هو الرقم الأكثر إفادة. الفجوة بين "هذا يُصرَّف" و"هذا يُصرَّف ويقول ما قصدته" تبلغ نحو ستة عشر نقطة، وهو نمط الفشل الذي يجعل التحويل الآلي إلى صيغ رسمية صعبًا: فعبارة تجتاز فحص الأنواع بينما تُضعِف بصمت الادعاء الأصلي أسوأ من خطأ واضح، لأن لا شيء في المراحل اللاحقة يرصده. في أصعب المجموعات ينخفض فحص الاتساق إلى 63% في FATE-H و37% في FATE-X، بينما تستقر مجموعات سهلة مثل FormalIMATH عند 95.06% وProverBench عند 94.83%. هذا متخصص يتحدث بصدق عن مواضع ضعف المتخصص، وهو أكثر فائدة من متوسط واحد.
التباين، بُعدًا بُعدًا
• النموذج الأساسي — Ember-1: Kimi K3. MathForm-8B: Qwen3-8B.
• ما الذي غيّره التدريب — Ember-1: المدة التي يستغرقها النموذج في الاستدلال، مع الإبقاء على القدرة ثابتة. MathForm-8B: ما الذي يُخرجه النموذج، مع التنازل عن العمومية إلى حد كبير.
• المعاملات — Ember-1: غير معلنة. MathForm-8B: ~8 مليار، كثيفة، BF16.
• عقد المخرجات — Ember-1: نص عادي واستدعاءات أدوات، بجودة مستوى K3. MathForm-8B: عبارة Lean 4 مع ترويسة ونظرية مسماة.
• الترخيص والأوزان — Ember-1: لم يُنشر أي منهما؛ معاينة بحثية عبر منصة المورّد نفسه. MathForm-8B: Apache 2.0، والأوزان ومجموعة البيانات كلاهما قابلان للتنزيل.
• العنوان الرئيسي المُعلن — Ember-1: 82.0% في Terminal Bench 2.1 مع رموز أقل بنسبة 51.9%. MathForm-8B: متوسط Pass@8 بنسبة 88.06% تحت فحص الصياغة، و72.37% تحت فحص الاتساق.
• التحقق المستقل — لا هذا ولا ذاك؛ كلاهما مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه.

بند الترخيص يحسم أكثر مما تحسمه الاختبارات المعيارية
على الرغم من كل الفرق الرقمي، فإن الفرق العملي بين هذين الإصدارين هو التوزيع. MathForm-8B ملف. نشرت OpenBMB الأوزان ومجموعة بيانات FormalVerse والورقة البحثية في اليوم نفسه، تحت رخصة Apache 2.0، دون أي إعلان ودون واجهة برمجة تطبيقات مستضافة — بطاقة النموذج هي الإطلاق. يمكنك تنزيله بعد ظهر اليوم وتشغيله على وحدة معالجة رسوميات واحدة، ولا يمكن لأحد أن يسترجعه. Ember-1 خدمة. لا توجد أوزان، ولا سعر منشور، وتوصف نافذة الوصول بأنها فترة أسبوعين من الخدمة بلا خوادم يتوقف استمرارها على الطلب. يمكنك استدعاؤه اليوم ولا يمكنك التأكد من أنك ستستطيع استدعاءه في نوفمبر.
هذا الفرق أيضاً يحدد الغرض الذي يمكن استخدام كل نموذج فيه. موضع مكوّن الصياغة الرسمية هو داخل خط أنابيب تتحكم فيه أنت، ومثبّت على إصدار، مع وجود سلسلة أدوات Lean على الجهاز نفسه — ولهذا فإن نقطة تحقق Apache-2.0 غير المقيّدة هي الشكل المناسب لمهمة MathForm-8B، ولهذا فإن رابط كود GitHub المفقود في README الخاص به (الذي لا يزال عنصراً نائباً وقت الكتابة) فجوة أكثر إزعاجاً من أي رقم في اختبارات الأداء المعيارية. أما نموذج كلفة الاستدلال فموضعه خلف واجهة برمجة تطبيقات (API)، حيث تكون فاتورة الرموز هي الشيء الذي يُحسَّن، وحيث يتنافس الموردون على السعر وزمن الاستجابة. وشكل Ember-1 يناسب مهمته أيضاً؛ وهو يعني فقط أن الاعتماد تجاري وليس تقنياً.
حيثما قد يستخدم خط الأنابيب كليهما
هذان النموذجان متكاملان لا متنافسان، وتركيبهما سهل الوصف: متخصص في الصياغة الرسمية يحوّل مشكلة إلى عبارة قابلة للتحقق، ونموذج استدلالي يعمل على العبارة أو على الهندسة المحيطة. لا يوجد أي منهما على OrcaRouter — فـ MathForm-8B مستضاف ذاتيًا فقط، وEmber-1 على معاينة البائع الخاصة — لكن التركيب نفسه نمط وُجدت من أجله لغة توجيه DSL الخاصة بنا. تركيب عدة نماذج في نداء واحد هو الطريقة التي يحصل بها خط الأنابيب على متخصص وعمومي دون الحفاظ على مساري تكامل وعقدين، ويمضي اندماج النماذج خطوة أبعد بالسماح لمجموعة من النماذج بالإجابة معًا عندما يكون نمط فشل نموذج واحد مكلفًا.
في ما يخص حزمة الصياغة الرسمية تحديداً، تكون الحجة الداعية إلى التركيب أقوى من المعتاد. نمط الفشل الظاهر هو عبارة تُصرَّف ويعني شيئاً مختلفاً قليلاً، وأرخص وسيلة دفاع ضد خطأ صامت هي نموذج ثانٍ يقرأ المسألة نفسها — وهذا قرار توجيه، لا قرار تدريب.
أيّهما أفضل صفقة؟
إذا كنت بحاجة إلى رياضيات قابلة للتحقق آليًا، فإن MathForm-8B هو الوحيد بين الاثنين الذي ينتج أيًا منها، وتكلفته الأساسية هي العمومية التي لم تكن ستستخدمها لهذه المهمة على أي حال. نزّله، وخصّص ميزانية لخادم Lean، وابنِ تقييمك الخاص — فلن تخبرك ورقة OpenBMB بكيفية أدائه على توزيعك.
إذا كنت بحاجة إلى مُستدِل عام بفاتورة رموز أقل، فإن Ember-1 موجّه إليك، والخطوة التالية الصحيحة هي إجراء حركة ظل في مواجهة أي نظام تشغّله اليوم بدلاً من مقارنة معيارية. تكمن مخاطرته في التوافر، لا في القدرة، وهذا خطر يمكنك التحوط منه عبر إبقاء طبقة التوجيه بين تطبيقك والنموذج.
الخلاصة المزعجة لأي شخص يأمل أن يحسم أحد هذين الأمرين المسألة هي أنه لم يتم تقييم أيٍّ منهما تقييمًا مستقلاً. مضى ستة أسابيع على إتاحة MathForm-8B للعموم، ولم ينشر أي طرف ثالث أي إعادة إنتاج؛ أما Ember-1 فقد أُتيح للعموم منذ يوم واحد. وكلاهما يطلب منك أن تكون المُقيِّم، وهو الوضع الطبيعي عند اختيار نموذج متخصص في 2026.

ما تثبته هذه الأمور فعلاً هو أن استراتيجية التضييق تعمل في كلا الاتجاهين. يمكن جعل نموذج الحدود أرخص دون جعله أسوأ، ويمكن جعل نموذج أساسي صغير صارمًا بتوجيه تدريبه نحو مُصرِّف. السؤال المثير للاهتمام ليس أيّ من هذين النهجين ينتصر، بل كم من الوقت سيظل أيٌّ منهما ضروريًا بعد أن تصبح التقنيات فيهما ممارسة معيارية.
