بطاقة عنوان رئيسية تحمل النص "Kolibri vs MiniCPM5 2B" بخط كبير عريض، مع سطر واحد أصغر أسفلها مكتوب عليه "نموذج بمستوى الخوادم في مواجهة وكيل على الجهاز"، وأيقونتان خطيتان مسطحتان صغيرتان جنبًا إلى جنب — طائر الطنان على اليسار ومخطط شريحة جوال صغير على اليمين — يفصل بينهما فاصل رأسي رفيع، على خلفية بيضاء مع لمسات تدرج أزرق وسماوي ناعمة وشعار OrcaRouter في الزاوية اليمنى السفلية.
Guides & Insights

Kolibri مقابل MiniCPM5-2B: 78 مليار معامل مقابل 2.5، ولماذا لا يُعد النموذج الصغير الخيارَ الرخيص

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع Kolibriإلى جانب MiniCPM5-2Bوستميل القراءة البديهية إلى اعتبار هذه مقارنةً في الحجم، وإلى أن النموذج ذا الـ2.5 مليار معلمة هو الخيار الاقتصادي. لكن هذه القراءة خاطئة على نحوٍ مُعلِّم. فـKolibri هو نموذج مزيج الخبراء من Aleph Alpha بعدد 78.1 مليار معلمة، صدر في 3 أكتوبر 2026، ويُنشِّط 3.46 مليار معلمة لكل رمز، ببصمة FP8 تبلغ نحو 78 غيغابايت وتهيئة دنيا من بطاقتَي A100 بسعة 80 غيغابايت. أما MiniCPM5-2B فهو النموذج الكثيف من ModelBest وOpenBMB بعدد 2.52 مليار معلمة، كُشف عنه في المؤتمر العالمي للذكاء الاصطناعي في 19 يوليو 2026، مع وصول الأوزان إلى Hugging Face في 6 سبتمبر. وMiniCPM5-2B أصغر بإحدى وثلاثين مرة من حيث عدد المعلمات. وهو أيضًا النموذج الذي يفرض تخصيص ميزانية تقييم قبل أن تثق به، لأن أكثر أرقامه تداولًا أجراها المورّد ولم يُعِد أحد إنتاجها — وهو بالضبط عكس ما يوحي به «النموذج الصغير» عادةً بشأن المخاطر.

تم شحن كليهما بهدوء؛ تم شحن واحد فقط منهما مؤخرًا.

لديهم قصص نشأة متشابهة وأعمار مختلفة جدًا، والأعمار مهمة. أُنشئ مستودع Aleph Alpha الخاص بـ Kolibri في 2 أكتوبر 2026 مع تاريخ إصدار معلن هو 3 أكتوبر، وصدر إعلان غرفة الأخبار الخاصة بالبائع نفسه ذلك الصباح، في يوم الوحدة الألمانية. ولم تلحظه صحافة الذكاء الاصطناعي العامة إلى حد كبير في ذلك اليوم، ومن هنا جاء توصيف "الإصدار الهادئ"، لكن بطاقة نموذج وتقريرًا تقنيًا ومنشورًا من البائع ليست طرحًا صامتًا. كان MiniCPM5-2B أهدأ حقًا: فقد كان إعلان WAIC في يوليو كشفًا في مؤتمر عن عرض ومواصفات، ولم تظهر الأوزان الفعلية حتى 6 سبتمبر، إذ نُشرت دون حدث إطلاق، إلى جانب GGUF وMLX وGPTQ ونقاط حفظ الأساس وSFT والمسودة ومدونات التدريب الكامنة وراءها.

تلك الفجوة التي دامت خمسة أسابيع بين الإعلان والأوزان جديرة بالتذكّر، لأنها السبب في تداول مجموعتين مختلفتين من الأرقام لهذا الطراز. وقد روّجت مواد يوليو لنافذة سياق بسعة 512K رمزًا. أما الإعداد المشحون فيحدد 131,072. والنسخة الصادرة هي المعوّل عليها.

ما هو الغرض الفعلي من كل نموذج

صُمّم Kolibri للعمل على المستندات بالألمانية والإنجليزية، وشركة Aleph Alpha محدّدة على نحو غير معتاد في سبب تطلّب ذلك هندسة حقيقية. حدّدت تجارب صغيرة على نماذج وكيلة هدفًا يقارب 20 بالمئة من الألمانية في خليط التدريب، وهو ما عنى، في عملية تدريب بحجم 20 تريليون توكن، العثور على 4 تريليونات من التوكنات الألمانية. أسفرت مجموعات البيانات الألمانية المفتوحة بعد إزالة التكرار والتصفية عن 390 مليارًا — أي أقل بمرتبة قدرية كاملة — فأعاد المختبر ضبط مرشّح Common Crawl خصيصًا للألمانية، ما أنتج 1.3 تريليون توكن عضوي فريد، وأعاد صياغة وثائق ألمانية قائمة إلى مدخلات موسوعية وحوارات ومقاطع لتنتج نحو تريليون آخر، وهو ما أصبح أكبر مصدر ألماني منفرد. وقد أُسقطت الترجمة، التي استُخدمت في النموذج السابق Kolibri Origin، في Kolibri. التفصيل المتعلق بالمرشّح هو ما ينبغي التمسك به: فخط أنابيب قياسي لبيانات اللغة يتخلص من المستندات التي تحوي عددًا كبيرًا جدًا من الكلمات الطويلة، والنثر الإداري الألماني يتجاوز على نحو معتاد الحد الإنجليزي لمتوسط طول الكلمة، لذا تحذف الإعدادات الافتراضية بصمت السجل اللغوي الذي تكتب به الإدارة العامة.

تم بناء MiniCPM5-2B للطرف المقابل — وكيل يعمل على الجهاز. وتصف البطاقة نموذجًا محوّلًا كثيفًا بإجمالي 2.52 مليار معامل، و1.98 مليار معامل غير تضمينية، و42 طبقة بحجم مخفي 2048، وانتباه بجماعات الاستعلامات مع 16 رأس استعلام ورأسَي KV، وبنية LlamaForCausalLM قياسية دون نوى مخصّصة. وتميل خط أنابيب التدريب إلى النهج الوكيلي: تدريب وكيلي متوسّط بمقياس 200 مليار، ومجموعة كبيرة من التوليف الدقيق الوكيلي (agent-SFT)، ومواءمة وكيلية عبر التعلم المعزّز (RL)، ومرحلة نهائية من التقطير على السياسة (On-Policy Distillation) تدمج ستة عشر نموذجًا خبيرًا بالتعلم المعزّز في شبكة كثيفة صغيرة واحدة. ويأتي مزوّدًا باستدعاءات أدوات بنمط XML مع محلّل SGLang مدمج، ويحدّد إعداده الصادر نافذة من 131,072 رمزًا.

• المعلمات — Kolibri: 78,103,074,560 الإجمالي، 3,457,573,120 النشطة، تباعد بنسبة 22.6:1. MiniCPM5-2B: 2,516,756,480 الإجمالي، 1.98B غير تضمينية، كثيف.

• صدر — Kolibri: 3 أكتوبر 2026. MiniCPM5-2B: أُعلن في 19 يوليو 2026، والأوزان في 6 سبتمبر 2026.

• السياق — Kolibri: 16,384 مدرَّب، 65,536 مدرَّب تدريبًا متوسطًا، 262,144 أصلي، 1,048,576 مُتحقَّق منه. MiniCPM5-2B: 131,072 في الإعداد المُشحون؛ ادعاء 512K من يوليو لا يتضمنه.

• البصمة — Kolibri: حوالي 78 GB بتنسيق FP8؛ اثنتان من A100 80 GB، واثنتان من H100 SXM5، وواحدة H200، وواحدة B200 أو واحدة B300 كحد أدنى. MiniCPM5-2B: جزء BF16 واحد، من فئة الحواسيب المحمولة.

• اللغات — Kolibri: الألمانية والإنجليزية، بحكم التصميم ولا شيء غير ذلك. MiniCPM5-2B: الإنجليزية والصينية، مع جميع مجموعات التقييم المنشورة بالإنجليزية.

• استدعاء الأدوات — Kolibri: بنمط Hermes مع محلل vLLM مُرفَق. MiniCPM5-2B: بنمط XML مع محلل SGLang.

• الترخيص — كلاهما Apache 2.0، وكلاهما بدون شرط إضافي للاستخدام المقبول.

A two-column comparison scoreboard titled 'Kolibri vs MiniCPM5 2B'. Left column Kolibri: Parameters 78.1B MoE / 3.46B active, Context 262,144 native / 1M validated, Footprint about 78 GB in FP8, Languages German and English, Tool calling Hermes-style with a vLLM parser, Licence Apache 2.0. Right column MiniCPM5 2B: Parameters 2.52B total / 1.98B non-embedding, Context 131,072 in the shipped config, Footprint a single BF16 shard, laptop-class, Languages English and Chinese, Tool calling XML-style with an SGLang parser, Licence Apache 2.0. A footer line reads 'Kolibri figures vendor-reported; MiniCPM5 2B figures per its model card.' with the OrcaRouter logo in the bottom-right corner.

لوحات النتائج، والمصادر التي تقف خلفها

لا يوجد رقم مواجهة مباشرة لهذا الاقتران في أي مكان، في مواد أي من المورّدين، ولن نجمّع رقمًا واحدًا من أداتَي اختبار مختلفتين ونسمّيه مقارنة. ما ينشره كل طرف يستحق الفصل بعناية، لأن مجموعتي الأرقام تحملان مقدارين مختلفين جدًا من الأدلة.

أرقام Kolibri تأتي من جدول المقارنة الخاص بـ Aleph Alpha الذي يضم أربعة عشر نموذجًا، شُغِّل على منصة اختبار واحدة مع Kolibri عند مستوى جهد استدلال مرتفع: 75.5 في المتوسط الإنجليزي، و70.8 في المتوسط الألماني. هذا الجدول لا يُجمّل موضوعه — يسجل Qwen3.8 27B درجتي 80.2 و79.9 في المتوسطين نفسهما، ويتقدم في GPQA Diamond وLiveCodeBench v6 وSWE-Bench Verified وكلا اختباري السياق الطويل، بينما يُفعّل نحو ثُمن معاملات Kolibri. تأطير البائع لتلك الفجوة هو حدود باريتو للجودة مقابل الرموز المفكوكة في الثانية لكل GPU، وهو ما لا يتجاوزه أي من النماذج المقارَنة. إنها حجة اقتصادات خدمة، لا حجة قدرات، ولم يقسها أي طرف ثالث: لا يوجد مُدخل لـ Kolibri في Artificial Analysis ولا إعادة إنتاج لمنصة الاختبار.

أرقام MiniCPM5-2B مستمدة من بطاقته الخاصة: متوسط داخلي قدره 53.9 عبر مجموعة مقارنة اختارها المورّد، وAIME 2025/2026 عند 86.5، وMATH-500 عند 94.6، ونتيجة 46.4 أجراها المورّد على SWE-bench Verified، وهي نتيجة ستكون لافتة لنموذج كثيف بـ2.5 مليار معامل إذا صمدت أمام اختبار مستقل. وعلى تلك البطاقة، يأتي Granite 4.2 3B من IBM عند 42.7 مقابل 53.9 لـ MiniCPM5-2B — مورّد واحد يشغّل كلا النموذجين على مجموعة اختبار واحدة اختارها. مجموعات مختلفة، وأدوات اختبار مختلفة، ومورّدون مختلفون. لا شيء من ذلك يمثل حكماً على هذه الثنائية.

ما هو مفيد حقًا في جانب MiniCPM5-2B هو الإفصاح. أطلقت OpenBMB مجموعات بيانات التدريب UltraData إلى جانب الأوزان — Ultra-FineWeb، وUltraX، وUltraData-Code، وUltraData-Math، ومجموعات SFT وRL للوكيل — جميعها بترخيص Apache 2.0، ما يحوّل الصندوق الأسود إلى وصفة يمكنك فحصها ومواصلة التدريب عليها في مجالك الخاص. يأتي النموذج أيضًا مع تكييف من اليوم الأول عبر تسع عائلات من الشرائح من خلال مجتمع FlagOS التابع لـ ModelBest، من Huawei Ascend إلى NVIDIA وARM، وهو بيان نشر أكثر منه بيان قياس أداء. في المقابل، نشرت IBM أوزان Granite 4.2 3B ووصفًا تقنيًا مفصّلًا لعملية البناء ولكن ليس بيانات تدريبه، ونشرت Aleph Alpha خط أنابيب بيانات Kolibri ومحاسبة الطاقة — 20 تريليون توكن للتدريب المسبق، و9.5×10² ميغاواط ساعة بما يشمل النفقات العامة لمركز البيانات وباستثناء الضبط الدقيق الخاضع للإشراف والتعلم المعزز — ولكن ليس مجموعة البيانات نفسها.

أين يظهر فارق الحجم فعليًا

أكثر طريقة مفيدة لوضع هذين جنبًا إلى جنب هي على المحورين اللذين يحددان عملية نشر فعلية: ما الذي يجب أن يكون موجودًا في القاعة، وما الذي يحدث عندما يكون النموذج مخطئًا.

على صعيد العتاد، يفوز MiniCPM5-2B وليس بفارق ضئيل. فنموذج كثيف بـ2.52 مليار معامل في جزء BF16 واحد يعمل على حاسوب محمول أو جهاز حوسبة طرفي أو وحدة معالجة رسومات استهلاكية واحدة، كما أن دعم FlagOS لتسع عائلات من الشرائح يعني أنه يعمل على عتاد لا يُعد مسرّع NVIDIA على الإطلاق. أما الحد الأدنى لـ Kolibri فهو بطاقتا A100 بسعة 80 GB أو بطاقة B200 واحدة، بنحو 78 GB من أوزان FP8، يُشغَّل عبر إضافة aleph-alpha-inference vLLM أو الحاوية المنشورة. وبالنسبة لعبء عمل خاص بمقصورة قيادة ذكية أو مرتبط بالهاتف، فإن 2B هو الوحيد من بين الاثنين الذي يستوفي المتطلبات، ولم يُصمَّم Kolibri قط لينافس في هذا المجال.

فيما يتعلق بقابلية التحقق، يفوز Kolibri لسبب أكثر خفاءً. أكثر ادعاءاته اقتباسًا — اقتصاديات التشغيل — لم يُختبر، لكن أرقام جودته على الأقل منشورة مقابل ثلاثة عشر منافسًا مُسمّى على أداة تقييم واحدة مع الكشف عن الإعدادات، وجدول البائع نفسه يمنح الفوز في معظم الصفوف إلى منافس. أما الأرقام الرئيسية لـ MiniCPM5-2B فهي أرقام البائع على مجموعة البائع دون الكشف عن أداة مقارنة، ويحمل النموذج عدم يقين إضافيًا بسبب نقطة تحقق عمرها أسابيع لا أيام. لم يخضع أي من النموذجين لتقييم معياري مستقل. الفرق أن أحد البائعين كتب مقارنة تجعل نموذجه يخسر، بينما كتب الآخر مقارنة تجعل نموذجه يفوز بهامش واسع.

عن قصد، لا توجد أي منافسة على الإطلاق. وُجد Kolibri لمعالجة المستندات باللغة الألمانية على الخوادم المحلية، مع مُرمِّز ثنائي اللغة تُفيد Aleph Alpha بأنه يبلغ 4.90 بايت في المتوسط لكل رمز على النصوص الألمانية على الويب، مقابل 4.35 لدى GPT-5 و3.28 لدى Kimi K3 — وكلها قياسات من المورّد، وهي تأثير تكلفة لكل رمز وليست ادعاءً بالجودة. وُجد MiniCPM5-2B لوكلاء استدعاء الأدوات باللغتين الإنجليزية والصينية على عتاد محدود الموارد. والفريق الذي لديه عقود ألمانية ومتطلّب امتثال لا يختار بينهما.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the card header with the OpenBMB organisation and its like count, the TextGeneration, Transformers and Safetensors tags, the English and Chinese language tags, the on-device and tool-calling tags, the Apache 2.0 licence, and the model-size line reading 3B parameters in BF16 tensor type.

واقع التوجيه، والتجربة التي تستحق أن تُجرى

لا يوجد أيٌّ من النموذجين في كتالوج مستضاف اليوم، وقد تحققنا من كليهما بدلًا من الافتراض. لا يملك Kolibri أي SKU لواجهة برمجة تطبيقات من المورّد — فالإصدار عبارة عن أوزان وتقرير تقني وصورة حاوية — وهو غير موجود على OrcaRouter: فحصنا الكتالوج بكل صيغة كتابة ممكنة لبادئة المورّد واسم النموذج، فكانت النتيجة «غير موجود». ولا يملك MiniCPM5-2B أيضًا أي نقطة نهاية مستضافة من ModelBest، وهو غير مُوجَّه معنا. كلا الطرحين قائم على الاستضافة الذاتية، ونفضّل قول ذلك بدلًا من الإيحاء بأننا نقدّم أيًّا منهما.

ما يجعل هذا مثيرًا للاهتمام هو التجربة. فنموذج وكيلي بمعاملات تبلغ 2.5 مليار ونموذج مستندات بـ78 مليار معامل يحلّان مشكلات مختلفة، والسبيل الوحيد لمعرفة أيّهما يحتاجه عبء عملك هو تشغيلهما معًا عليه — وهو بالضبط الموقف الذي تُبنى طبقة توجيه من أجله، حتى وإن لم تكن تحمل أيًا من النموذجين. وجّه مسار اختبار إلى بنية MiniCPM5-2B مستضافة ذاتيًا عبر نقطة نهاية واحدة متوافقة مع OpenAI مع تجاوز فشل تلقائي، مع إبقاء بيئة الإنتاج على نموذج موجّه مُجرَّب، فيمكن للحزمة الجديدة أن تتعطّل أو تُنتج كلامًا بلا معنى دون أن تُسقط أي شيء. وأسعار القوائم المعلنة من المزوّدين للنماذج التي تقارن بها تمرّ بهامش ربح صفري، فيبقى اختبار A/B زهيد الكلفة وقابلًا للتراجع. وإذا كانت التجربة ستكشف في واقع الأمر أن عبء عملك الألماني لا يحتاج أيًا من النموذجين المستضافين ذاتيًا، فإن المفتاح نفسه يصل إلى فئة صغيرة من مزيج الخبراء موجّهة بالفعل — وهي نسخة Gemma 4 26B-A4B بسعر 0.06 دولار لكل مليون رمز إدخال و0.33 دولار لكل مليون رمز إخراج، مع نافذة سياق تبلغ 262,144 رمزًا وإدخال نصي وصوري وفيديو — وهي أرخص طريقة لمعرفة ذلك قبل أن تشتري وحدتي معالجة رسومية.

أي واحد، وما الذي سيغيّر الإجابة؟

شغّل MiniCPM5-2B إذا كان القيد هو الجهاز. عند 2.52 مليار معامل، فهو الوحيد من بين الاثنين الذي يتّسع في حاسوب محمول، أو قمرة قيادة، أو صندوق حوسبة طرفية، وإذا كان عبء عملك وكيلاً تفاعلياً لاستدعاء الأدوات بالإنكليزية أو الصينية، فهذا هو النموذج الموجّه لذلك. خصّص وقتاً لإعادة إنتاج أرقامه أولاً — فمتوسط 53.9 وادعاء 46.4 في SWE-bench هما لـ ModelBest وحده، وكون مجموعات التدريب مفتوحة يجعل إعادة الإنتاج هذه ممكنة فعلاً لا نظرياً.

شغِّل Kolibri إذا كانت المدونة اللغوية بالألمانية، وكان العتاد متوفرًا، ولا يجوز إخراج الأوزان من المبنى. إن نافذة أصلية بسعة 262,144 رمزًا، وذاكرة KV مؤقتة بتنسيق FP8، وأربعة مستويات لجهد الاستدلال، واستدعاء أدوات Hermes هي البنية المناسبة للعمل على المستندات الخاضعة للتنظيم، كما أن شروط Apache 2.0 إضافة إلى خط أنابيب البيانات المنشور هي الجزء الذي يصمد أمام مراجعة المشتريات.

هناك أمران يحسمان هذا الأمر أسرع من أي جدال. إجراء مستقل لاختبار SWE-bench Verified على MiniCPM5-2B سيؤكد أو يدحض الادعاء الأكثر إثارة للدهشة الذي يقدمه أي من البطاقتين. والقياس المستقل للإنتاجية لـ Kolibri في تكوينه الموصى به باثنين من H100 — أو إدخال في Artificial Analysis، وهو غير موجود اليوم — سيحوّل "78 مليار معامل" من مواصفة إلى تكلفة، وهو الرقم الذي يبحث عنه فعليًا أي شخص يوازن هذه المقارنة مع العتاد. وحتى ذلك الحين، فجوة الحجم حقيقية، وفجوة الغرض أكبر، والخيار الذي يبدو رخيصًا هو الذي يحمل الادعاء غير المُثبت.

A screenshot of the OrcaRouter model page for google/gemma-4-26b-a4b-it, showing the model header under Google, the 262K-token context badge, the input line reading text plus image plus video, and the community description noting 25.2B total parameters with 3.8B activated per token during inference.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا