
Kolibri مقابل MathForm-8B: يمكن لمُصرِّف التحقق من أحد ادعاءات الدقة هذه
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 218 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
Kolibri و MathForm-8B يتشاركان ترخيصًا ولا يكادان يتشاركان أي شيء آخر. كلاهما بترخيص Apache 2.0، وكلاهما مفتوحا الأوزان، وكلاهما صدر خلال الأشهر الثلاثة الماضية — Kolibri من Aleph Alpha في 3 أكتوبر 2026، وMathForm-8B من OpenBMB في 14 أغسطس 2026 — ويخصصان جزءًا كبيرًا من بطاقتَيهما التعريفيتين للرياضيات. وهنا ينتهي التشابه. Kolibri نموذج خليط خبراء ألماني وإنجليزي بـ78.1 مليار معامل، يُنشّط 3.46 مليار معامل لكل رمز، والمقصود منه أن يكون داخل سير عمل وثائقي خاضع للتنظيم. أما MathForm-8B فهو نموذج كثيف بـ8 مليارات معامل، جرى ضبطه الدقيق انطلاقًا من Qwen3-8B، وله مهمة واحدة: أن يأخذ مسألة رياضية مكتوبة بالإنجليزية العادية ويُخرج عبارة Lean 4 صحيحة شكليًا تقابلها. الفرق المهم لأي شخص يقيّم أيًا منهما ليس عدد المعاملات. بل إن ادعاء دقة MathForm-8B قابل للتنفيذ. يمكنك التحقق من مخرجاته باستخدام مُترجِم. أما مخرجات Kolibri فلا يمكن التحقق منها بأي شيء آخر غير تشغيل معيار آخر.
هذا التفاوت هو فحوى المقال بأكمله، وهو يتعمّم إلى ما هو أبعد بكثير من هذين النموذجين. جدول قياسات أداء يقدّمه مورّد ما هو إلا ادّعاء. أما قبول مساعد إثبات لصياغة صورية فهو نتيجة. وعندما يكون فضاء مخرجات النموذج بأكمله شيئًا يمكن لآلة أن تتحقق منه، تختفي طبقة التسويق — فإما أن يقبل مُصرِّف Lean العبارة وإما ألا يقبلها، ولا يغيّر ذلك أيّ قدر من تأطير منشور الإطلاق.
ما الذي ينتجه MathForm-8B فعليًا
التحويل الآلي هو مجال ضيق وغير جذاب وصعب حقًا، وبطاقة النموذج محددة بشكل منعش بشأن الإعداد.
• المدخل والمخرج — عبارة رياضية باللغة الطبيعية كمدخل، وصياغة صورية بـ Lean 4 كمخرج، مكتملة بترويسة مبرهنة.
• النموذج الأساسي — Qwen/Qwen3-8B، مُضبط بدقة؛ Apache 2.0 مع بقية إصدار OpenBMB.
• التدريب — الضبط الدقيق بإشراف متبوعًا بالتعلم المعزز على مجموعة بيانات FormalVerse، مع تغذية راجعة من تجميع Lean والاتساق الدلالي تقود إشارة التعزيز.
• خط أنابيب البيانات — استرجاع معرفة Mathlib، والتجميع والتحقق الدلالي، والتحسين التكراري، ثم إعادة بناء المسار. يُعدّ مخطط خط الأنابيب الموجود على بطاقة النموذج أكثر ما يحفل بالمعلومات في هذا الإصدار.
• التقييم — معدلات نجاح Pass@8 ضمن فحصين منفصلين، هما Syntax Check و Consistency Check، عبر ستة معايير قياس، وتُعرض كمتوسط ماكرو مرجّح بالتساوي في شكل بياني على البطاقة بدلًا من جدول يمكننا اقتباسه صفًا بصف.
• سلسلة الأدوات — خادم Kimina Lean Server قيد التشغيل لفحوصات الترجمة البرمجية، وLean 4.21.0 للتجارب، وتسلسل بحد أقصى 16,384 رمزًا مع درجة الحرارة 0.6 وtop-p 0.95.
• الخدمة — vLLM أو SGLang بسياق يبلغ 16,384 رمزًا، تُتاح عبر واجهة دردشة متوافقة مع OpenAI. هذه التفصيلة الأخيرة أهم مما تبدو عليه، لأنها تعني أن النموذج يندرج في خط أنابيب قائم كنقطة نهاية عادية.
لاحظ الفحصين المنفصلين. الفحص النحوي (Syntax Check) هو ما إذا كانت عبارة Lean تُحلَّل نحويًا وتجتاز التحقق من الأنواع أصلًا. وفحص الاتساق (Consistency Check) هو ما إذا كان البيان الصوري يعني الشيء نفسه الذي تعنيه المسألة باللغة الطبيعية — وهي خاصية أصعب بكثير، لأن عبارة Lean صحيحة نحويًا تُصوغ المبرهنة الخطأ أسوأ من خطأ في التجميع. ويُبلّغ OpenBMB عن كليهما، وهذه بالضبط هي الطريقة الصحيحة لفعل ذلك، وهي السبب في أن لهذه المهمة قصة تحقق لا يمتلكها الاستدلال العام.
ما الذي يفعله Kolibri بالرياضيات، ولماذا هو رقم من نوع مختلف
يتفوق Kolibri في الرياضيات بمعنى الاختبارات المعيارية. على أداة التدريب اللاحق الخاصة بـ Aleph Alpha، عند جهد استدلال مرتفع، يحقق 96.9 في AIME 2025 بالإنجليزية و87.5 بالألمانية، و96.0 و90.0 في AIME 2026، ومتوسط 96.5 بالإنجليزية عبر مجموعة الرياضيات الخاصة به مقابل 88.8 بالألمانية. وللسياق في الجدول نفسه، فإن نتيجة Kolibri البالغة 96.9 في AIME 2025 بالإنجليزية تقع فوق Nemotron 3 Super 120B-A12B عند 91.7 وQwen3.6 35B-A3B عند 84.6، وتحت Qwen3.8 27B بقليل عند 97.9.
كل واحد من هذه الأرقام مُبلَّغ عنه من جهة المورّد، على منصة اختبار المورّد، دون أي إعادة إنتاج مستقلة، ولا توجد صفحة Artificial Analysis خاصة بـ Kolibri يمكن مقارنتها بها للتحقق المتقاطع. هذا ليس انتقادًا للأرقام؛ بل هو بيان عن نوع الشيء الذي تمثله. درجة AIME هي نسبة مئوية من الإجابات النهائية الصحيحة في اختبار متعدد الخيارات. إنها تخبرك بأن النموذج قادر على الوصول إلى عدد صحيح. لكنها لا تخبرك بشيء عن مدى سلامة الاستدلال الذي أنتجها، ولا يتبقى أي أثر يمكن لطرف ثالث فحصه.
ضع بجانب مخرجات MathForm-8B، يصبح هذا الفرق صارخًا. إجابة Kolibri على مسألة AIME هي رقم. أما مخرجات MathForm-8B فهي عبارة عن صياغة مبرهنة في Lean 4 إما أن تُصرَّف مقابل Mathlib أو لا. إذا كنت تبني نظامًا يجب فيه أن يكون الادعاء الرياضي قابلًا للدفاع عنه — مسار تحقق صوري، أو سير عمل مساعد إثبات، أو سجل تدقيق — فإن الأثر الثاني يستحق أكثر بكثير من الأول، ولا يعبّر أي صف في أي معيار قياسي عن ذلك.

حيث سيلتقي الاثنان فعليًا
إذا صُوّر الأمر كمعركة، فإن هذه المواجهة غير مثيرة للاهتمام: متخصص بحجم 8B يتفوق على عامّي بحجم 78B في إضفاء الطابع الرسمي على الرياضيات، ويخسر في كل ما عدا ذلك، بما في ذلك النثر الإداري الألماني، واستدلال المستندات ذات السياق الطويل، واستدعاء الأدوات عبر مسار وكيل من مئة خطوة. لكن الاثنين ليسا بديلين، والسؤال المفيد هو: كيف يبدو خط أنابيب مبنيّ من كليهما؟
التركيب الطبيعي هو تركيب توجيهي. يتولى نموذج عام ذو قدرة قوية على الاستدلال واستدعاء الأدوات مهمة الاستيعاب وإزالة الغموض والاسترجاع؛ ويُستدعى نموذج متخصص لنسبة اثنين في المئة من الحالات التي تحتاج إلى مُخرَج رسمي. القيام بذلك يدويًا يعني مورّدَين، وعقدَين، واثنين من SDK، ومجموعتين من بيانات الاعتماد، وطبقة إرسال يتولى أحدهم صيانتها. وهذه هي الحالة التي تستحق فيها نقطة نهاية واحدة كلفتها: مفتاح واحد متوافق مع OpenAI، وقاعدة توجيه ترسل الطلبات ذات الشكل الرياضي إلى نقطة نهاية الصياغة الرسمية وكل ما عدا ذلك إلى النموذج العام، وتجاوز الفشل عندما يكون أحدهما بطيئًا. هذه مهمة لغة التوجيه DSL — تركيب عدة نماذج في نداء واحد بدل تضمين خيار ثابت في وقت التطوير — وحيثما كان مفيدًا أن تجيب مجموعة من النماذج معًا، يغطي ذلك دمج النماذج. لا Kolibri ولا MathForm-8B موجودان على OrcaRouter اليوم؛ وقد فحصنا الكتالوج بحثًا عن كليهما تحت كل تهجئة للمورّد والنموذج، ولا يوجد أي منهما. إن حجة التركيب تتعلق بشكل المشكلة، لا بنقطتي النهاية المحددتين هاتين.
ما هو موجود في الكتالوج هو النصف العام من ذلك النمط بسعر يمكن قياسه. Qwen3.8-27B مُدرَج بسعر $0.33 لكل مليون توكن إدخال و$2.40 للإخراج مع نافذة من 262,144 توكن، وQwen3.8-Max بسعر $2.00 و$6.00 مع نافذة من مليون توكن. وبالنسبة لفريق يستكشف ما إذا كانت خطوة الصياغة الشكلية تستحق الإضافة إلى خط أنابيب المستندات من الأساس، فإن التجربة الرخيصة هي توجيه العمل العام إلى هناك، وقياس حجم الطلبات التي تحتاج فعلاً إلى مخرج Lean، وعندها فقط تقرر ما إذا كانت نقطة نهاية متخصصة بسعة 16,384 توكن تستحق التجهيز. يُمرَّر سعر القائمة الخاص بالمزوّد كما هو دون إضافة أي شيء لكل توكن، لذا تتحرك الأرقام في اليوم الذي يحرّكها فيه المزوّد.

الترخيص هو السطر الوحيد الذي يكونان فيه متطابقين.
كلاهما بترخيص Apache 2.0، وفي فئةٍ تشيع فيها تراخيص البحث المُصمَّمة خصيصاً وبنود الاستخدام المقبول الملحقة، تُعدّ هذه نقطة تكافؤ حقيقية جديرة بالذكر — فهي تعني أنّه لا يتطلّب أيٌّ من النموذجين مراجعةً قانونية قبل استخدامه تجارياً أو تعديله أو إعادة توزيعه.
تختلف الالتزامات في موضع آخر. يجلب Kolibri بصمة أوزان تبلغ نحو 78 غيغابايت وحدًا أدنى من العتاد يتمثل في بطاقتي A100 بسعة 80 غيغابايت، أو بطاقتي H100 SXM5، أو واحدة H200، أو واحدة B200، أو واحدة B300، بالإضافة إلى حزمة aleph-alpha-inference وإضافة vLLM الخاصة بالمورّد. أما MathForm-8B بدقة bfloat16 فبصمة أوزانه نحو 16 غيغابايت، ويعمل على مسرّع حديث واحد بسياق يبلغ 16,384 رمزًا؛ وتعتمد تبعياته على سلسلة أدوات Lean، ولأجل خط أنابيب التقييم، على خادم Kimina Lean Server قيد التشغيل. أحد هذين النشرين يتسع داخل محطة عمل. أما الآخر فلا.
أرقام السياق تسير في الاتجاه المعاكس وبفارق كبير. نافذة Kolibri الأصلية هي 262,144 رمزًا، وقد تم التحقق منها عند 1,048,576، وهذا ما يجعلها نموذجًا للمستندات: فملف تنظيمي ألماني كامل أو دليل صيانة في مجال الطيران يتسع في نداء واحد. أما MathForm-8B فمحدود عند 16,384 رمزًا بحكم التصميم، لأن طلب الصياغة الرسمية هو بيان مشكلة واحد ولا سبب ليكون أطول. لا يمثل أي من الرقمين نقصًا. إنهما ببساطة يصفان مهام مختلفة.

الاختيار، وسؤال التحقق أدناه
• اختر MathForm-8B إذا كان يجب أن يكون مخرَجك قابلاً للتحقق. إذا كان نظام لاحق يستهلك Lean 4، أو إذا كان الهدف كله هو أن يوقّع مساعد إثبات على النتيجة، فلا يوجد بديل عام يحل محله، وأرقام Pass@8 ضمن Syntax Check وConsistency Check هي التي ينبغي استجوابها بدلاً من أي صف AIME.
• اختر Kolibri إذا كنت تحتاج إلى نموذج واحد يقرأ المستندات الألمانية والإنجليزية عند سياق طويل، ويستنتج عبرهما، ويستدعي الأدوات، ويمتنع عندما لا يدعم السياق إجابة، ويمكن نشره داخل نطاقك الخاص بموجب ترخيص يمكنك ذكره في سطر واحد. الرياضيات قدرة يمتلكها، لا منتج يكونه.
• ضع كليهما في الاعتبار إذا كنت تبني خط أنابيب لإضفاء الطابع الرسمي. ليس كبديلين، بل كنقطتي نهاية خلف قاعدة توجيه واحدة، مع استدعاء المتخصص للشريحة الضيقة من الطلبات التي تحتاج إليه.
وإذا كنت تقيّم أياً منهما استناداً إلى رقم معيار أداء، فطبّق اختباراً واحداً أولاً: ما الأثر الملموس الذي يتركه الرقم خلفه؟ في حالة MathForm-8B يوجد ملف Lean ومترجم إما يقبله أو لا يقبله، ويمكنك تشغيل كليهما بنفسك بعد ظهر هذا اليوم. أما في حالة Kolibri فثمة نسبة مئوية في جدول إطلاق، مُبلَّغ عنها من البائع، غير مُعاد إنتاجها، ولا توجد صفحة فهرس مستقلة للتحقق منها — والسبيل الوحيد لدحضها هو تنزيل 78 GB من الأوزان، واستئجار العتاد، وإعادة تشغيل أداة الاختبار. هذا التفاوت يستحق أكثر من الدرجة نفسها عندما تقرر ما الذي ستضعه في الإنتاج.
