
MiniCPM5-2B-DSpark: OpenBMB تُطلق بهدوء أوزان MiniCPM5-2B مع نموذج مسودة مصمَّم للسرعة
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleجديدGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenجديدQwen: Qwen3.8 Max (0902)2026-09-0240الذكاء72البرمجة
- anthropicجديدAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0340الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2134الذكاء69البرمجة
قبل ستة أسابيع، كان MiniCPM5-2B مجرّد وعد. فقد كُشف عنه في مؤتمر WAIC في شنغهاي بتاريخ 2026-07-19 بصفته نموذجًا بأقل من 4 مليارات معلمة يتصدّر مؤشر Artificial Analysis Index، وجاء مع ملاحظة على خارطة الطريق تفيد بأن الأوزان المفتوحة ستتوفر "قريبًا". وقد وصل ذلك "القريب" هذا الأسبوع، دون أي ضجيج. في 2026-09-06، دفعت OpenBMB المستودع الرئيسي لنموذج MiniCPM5-2B إلى Hugging Face بموجب ترخيص Apache-2.0، وبعد ذلك بواحد وعشرين دقيقة دفعت MiniCPM5-2B-DSpark — وهو checkpoint مسودة يضم 323.8 مليون معلمة، وظيفته الوحيدة جعل MiniCPM5-2B يفك الترميز بشكل أسرع بموجب خوارزمية فك الترميز التخميني DSpark. تبع ذلك إصدار GPTQ في 2026-09-07. وحتى لحظة كتابة هذا النص، لا يوجد أي إعلان ولا منشور إطلاق ولا مدخل سجل تغييرات تمكّنّا من العثور عليه؛ إذ ظهر الإصدار عبر مستودعات أصبحت متاحة للعموم بهدوء على مدى نافذة زمنية من أحد عشر يومًا.
هذه قطعة من نوع "ما نعرفه حتى الآن"، وصياغتها مهمة. MiniCPM5-2B-DSpark ليس روبوت محادثة مستقلًا أو نموذجًا رئيسيًا جديدًا — بل هو مسرّع: نموذج صغير وسريع يقترح الرموز (tokens) قبل MiniCPM5-2B، الذي يتحقق منها بعد ذلك بالتوازي. لا قيمة له بدون نموذجه المستهدف، والنموذج المستهدف هو سبب الاهتمام به. إصدار MiniCPM5-2B مفتوح الأوزان الذي وعدت به OpenBMB في يوليو أصبح الآن متاحًا فعليًا على Hugging Face، ونموذج المسودة الذي صدر بجانبه هو الآلية التي توصي بها الجهة المطوّرة لتشغيله بسرعة مفيدة. كل ما لم يُنسب صراحةً أدناه مقروء مباشرةً من بطاقتَي النموذج ومستودعيهما.
ما الذي تم إصداره، ومتى؟
أصبحت عائلة 2B متاحة للعموم كطرحٍ متدرّج وغير معلن، حيث كانت أحدث الإضافات أولاً:
• 2026-08-27 — تظهر MiniCPM5-2B-Base وMiniCPM5-2B-SFT، نقاط التحقق الخام المدربة مسبقًا والمضبوطة بدقة تحت الإشراف.
• 2026-09-01 — MiniCPM5-2B-Midtrain، مرحلة منتصف التدريب الوكيلية.
• 2026-09-05 — MiniCPM5-2B-MLX وMiniCPM5-2B-GGUF، صيغتا Apple-Silicon وllama.cpp
• 2026-09-06 — مستودع MiniCPM5-2B الرئيسي، ثم MiniCPM5-2B-DSpark بعد واحد وعشرين دقيقة.
• 2026-09-07 — MiniCPM5-2B-GPTQ، صيغة الخدمة المكممة.
جميعها تحمل رخصة Apache-2.0 التي استخدمتها ModelBest لعائلة MiniCPM5-1B في شهر مايو الماضي، وما تزال النقاط الأقدم في التسلسل تُظهر غيابًا شبه كامل لأي إشارة مجتمعية — عدد قليل من التنزيلات والإعجابات لكلٍّ منها. وهذا مؤشّر على طرح أوزان قيد التنفيذ وليس إطلاقًا منسّقًا: فالملفات تظهر بترتيب تبعيّة (النموذج الأساسي وSFT أولًا، ثم النسخ المكمّمة والمسوّدة أخيرًا) دون وجود يوم واحد يُمثّل تاريخ الإصدار.
ما هو MiniCPM5-2B-DSpark في الواقع
يقسم فك الترميز التخميني التوليد إلى مُقترِح رخيص ومُتحقِّق باهظ التكلفة. نموذج مسودة صغير يخمّن الرموز القليلة التالية، بينما يتحقق النموذج الكبير من جميع التخمينات في تمريرة أمامية واحدة ويقبل ما يتفق معه. عندما تكون المسودة معايرة جيدًا، تحصل على مخرجات النموذج الكبير بجزء بسيط من التكلفة، وعندما تكون خاطئة لا تهدر سوى خطوة تحقق واحدة. تُعدّ DSpark وصفة محددة لتلك الفكرة، من ورقة بحثية نُشرت في 2026-07-06 (arXiv 2607.05147، "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation"). اختياران في التصميم يميّزانها: فهي تقرن هيكلًا أساسيًا متوازيًا لنموذج المسودة بوحدة تسلسلية خفيفة الوزن، بحيث تعتمد الرموز داخل الكتلة المقترحة على بعضها البعض بدلًا من أن يتدهور دقتها نحو نهاية الكتلة، وتُحدِّد طول كل عملية تحقق لكل طلب بناءً على تقديرات الثقة وإنتاجية المحرك بدلاً من التحقق دائمًا من كتلة ثابتة الطول.
مسودة DSpark التي أصدرتها OpenBMB هي محوّل من خمس طبقات بمعاملات تبلغ 323.8 مليون معامل بصيغة BF16 (حوالي 648 ميجابايت). وهي تنتمي إلى عائلة معمارية Qwen3 لكنها تحمل إضافات خاصة بـ DSpark: جهاز إسقاط يقرأ الحالات المخفية لـ MiniCPM5-2B من خمس طبقات من طبقات الهدف (1، 10، 20، 30 و39)، ورأس ثقة، ورأس ماركوف صغير يُمثّل توزيع التوكن التالي. يقترح إعدادها كتلة من سبعة توكنات لكل تمرير أمامي. وبما أنها تمثل تقريبًا ثُمن معاملات MiniCPM5-2B البالغة 2.5 مليار معامل، فهي واحدة من أصغر نماذج المسودة المُصدرة لنموذج مفتوح سائد — وهذه هي النقطة في نموذج موجّه للحواف، حيث يجب أن تكون المسودة رخيصة بما يكفي بحيث يكون تشغيل نموذجين على جهاز واحد ما يزال أفضل من تشغيل نموذج واحد.

المستودع أعلاه هو السطح العام الكامل للنموذج الأولي: ملف README، وملف إعدادات، وملف safetensors واحد، وبطاقة نموذج يظهر وصف تدريبه 1,959,525 تسلسلًا (7.05B رمزًا) تم توليدها بواسطة MiniCPM5-2B من مطالبات عامة ورياضيات وبرمجة، وتم تدريبه على ستة عصور (epochs) بهدف مشترك يجمع بين الإنتروبيا المتقاطعة وL1 والثقة. لا يوجد استخدام لنقطة التحقق (checkpoint) كنموذج توليدي بمفرده.
الأرقام التي نشرتها OpenBMB، والموسومة بصدق.
تعرض بطاقة نموذج المسودة رقمًا واحدًا له أهميته — طول القبول، وهو متوسط عدد الرموز المقترحة التي يقبلها النموذج الهدف من كل كتلة من سبعة رموز. أُجري التقييم على مخرجات MiniCPM5-2B عبر ثلاثة مجالات، حتى 4,096 رمزًا مولّدًا:
• الرياضيات — 6.05 رمزًا مقبولًا في المتوسط في الاستدلال الجشع (T=0)؛ و4.61 مع أخذ العينات عند T=1.0.
• الكود — 6.11 بالجشع؛ 4.44 بالمعاينة
• عام — 4.16 جشع؛ 3.10 بالعينات.
الإجمالي — 5.52 بالطريقة الجشعة؛ 4.05 بأخذ العينات، من أصل حد أقصى يبلغ سبعة.
هذه الأرقام مذكورة من البائع في بطاقة النموذج ولم تُستنسخ بشكلٍ مستقل. كما أنها تصف معدل إصابة المسودة، وليس تسارعًا في زمن الحائط: فالسرعة قياس خاص بالخدمة يعتمد على كلفة تمرير التحقق للنموذج المستهدف مقابل تمرير الاقتراح للمسودة، وعلى امتلاء الدُفعات، وعلى قيام مُجدول الثقة لدى DSpark بتقليص طول التحقق. لم تنشر OpenBMB أي رقم لعدد الرموز في الثانية لهذا الثنائي. وللاستشعار بأين يقع سقف الطريقة، يذكر بحث DSpark أن التوليد لكل مستخدم كان أسرع بنسبة 60–85% عند إنتاجية مكافئة مقارنةً بخط الأساس MTP-1 في نظام الخدمة المباشر لدى DeepSeek — وهي نقطة مرجعية مفيدة لما أنجزه الخوارزم في سياقات أخرى، وليست ادعاءً حول MiniCPM5-2B على عتادك.

لوحة النتائج أعلاه هي ورقة المواصفات الخاصة بالإصدار نفسه. اقرأ رقم القبول كمعدل إصابة مبدئي؛ أما المضاعف على الإنتاجية الفعلية فهو ما لا يزال يتعين قياسه عبر تشغيل مستقل لـ SGLang.
النموذج الذي تُسرِّعه المسودة
MiniCPM5-2B هو نموذج Transformer كثيف يضم 2.5 مليار معامل — بإجمالي 2,516,756,480 معاملًا — مع 42 طبقة، و16 رأس استعلام، ورأسي KV، ومفردات من 130,560 رمزًا، ونافذة سياق من 131,072 رمزًا، بدقة BF16 بحجم حوالي 5 غيغابايت. من الناحية المعمارية، هو مملٌّ عمدًا: نموذج LlamaForCausalLM قياسي دون نوى مخصصة ودون تفريع لكود النموذج، وهذا هو بالضبط سبب سهولة نقله عبر العديد من بيئات التشغيل وأهداف الرقائق. في مجموعة المقاييس المعيارية الداخلية الخاصة بـOpenBMB، تمنحه البطاقة متوسطًا يبلغ 53.9 عبر مهام الاستدلال، واتباع التعليمات، والمعرفة، والسياق الطويل، واستخدام الأدوات، والبرمجة، ومهام وكيل البحث — متفوقًا على Qwen3.5-4B الذي سجل 51.1، وgranite-4.2-3B الذي سجل 42.7 في الجدول نفسه، مع الإشارة إلى عدة خلايا (GPQA-Diamond 70.2، وHLE 8.9، وصفوف متنوعة للسياق الطويل والوكيل) على أنها مصدرها Artificial Analysis وليست معاد إنتاجها داخليًا. من أبرز خلايا المهام الفردية: MATH-500 بنتيجة 94.6، وAIME لعامي 2025 و2026 بنتيجة 86.5، وIFEval بنتيجة 86.7، وMMLU-Pro بنتيجة 70.8، وSWE-bench Verified بنتيجة 46.4. هذه أرقام المطوّر على مجموعة مقاييس المطوّر نفسه، والبطاقة توضح صراحةً أن بعض الصفوف مصدرها جهات خارجية؛ لذا يجدر التعامل مع هذا المزيج وفقًا لذلك.

في الكشف الذي جرى في يوليو، استشهدت المواد الإعلانية لشركة ModelBest بمؤشر Artificial Analysis Index بلغ 17 — وهو الأول بين النماذج التي يقل حجمها عن 4 مليارات معامل — كما أشارت التغطية الصحفية في يوليو إلى نافذة سياق تبلغ 512 ألف رمز. أما نقاط التفتيش (checkpoints) التي شُحنت فعليًا فتُهيئ سياقًا يبلغ 131,072 رمزًا. وحيثما يتعارض رقم تسويقي من يوم الإطلاق مع إعداد مُشحَن فعليًا، فإن الإعداد هو الرقم الذي يحدد ما يمكنك تشغيله، والفجوة بينهما جديرة بالمعرفة قبل أن تخطط لعبء عمل طويل السياق بالاستناد إلى الرقم التسويقي.
تشغيل MiniCPM5-2B مع نسخته التجريبية
المسار المقصود هو SGLang، الذي يدعم خوارزمية DSpark في الإصدارات الأحدث منذ v0.5.16 — وهو الحد الأدنى للإصدار الذي تطلبه بطاقة النموذج. أمر التقديم الكامل من البطاقة:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
في ظل فك الترميز الجشع (T=0)، يكون تحقّق DSpark عديمَ الفقد: فالناتج مطابقٌ لتشغيل MiniCPM5-2B وحده، مما يجعل المسودة مجرد كسبٍ خالص في زمن الاستجابة. وعند تفعيل أخذ العينات، يضبط DSpark في SGLang افتراضيًا على أخذ العينات من النموذج الهدف فقط، مع إمكانية أخذ العينات بالرفض كخيار. كما توثّق OpenBMB تحميل Transformers العادي (transformers ≥ 5.6) وتشغيل النموذج الهدف عبر vLLM ≥ 0.21 بمفرده، بالإضافة إلى محلل استدعاء أدوات minicpm5 لأحمال عمل الوكلاء؛ أما مسار DSPARK التخميني فهو خاص بـ SGLang تحديدًا.
حسابات العتاد هي القصة الحقيقية لفئة الحافة: حوالي 5 جيجابايت لنموذج MiniCPM5-2B بصيغة BF16 بالإضافة إلى 0.65 جيجابايت تقريبًا للنموذج المساعد. إن الجمع بين النموذج المساعد والنموذج المستهدف يتسع بشكل مريح أينما كان نموذج 2B وحده مجديًا بالفعل، وهذا هو السبب الكامل لإصدار نموذج مساعد بهذا الحجم الصغير بدلًا من نموذج ثانٍ أكبر.
ما الذي لم يتم تأكيده؟
لا يوجد أي إعلان يمكننا العثور عليه — لا مدوّنة لـ OpenBMB أو ModelBest، ولا منشور على وسائل التواصل الاجتماعي بالإنجليزية أو الصينية. إن وصف "أُطلق بهدوء" هو وصف حرفي، والواجهة العامة الوحيدة هي مجموعة Hugging Face.
لا يوجد تقييم مستقل. أطوال القبول في المسودة ومتوسط مجموعة MiniCPM5-2B البالغ 53.9 هي قيم مقدّمة من البائع وغير معاد إنتاجها؛ الخلايا المميّزة بـ AA هي من جهات خارجية لكنها قيم لقطة، وليست تشغيلًا لهذه الأوزان تحديدًا.
• لا نجد أي واجهة برمجة تطبيقات مستضافة في أي مكان، لذا فإن التبني اليوم يعني تشغيل نقاط التحقق بنفسك. أما مرآة ModelScope التي وُعد بها في تغطية الإعلان خلال يوليو فلم تكن ظاهرة وقت كتابة هذا التقرير.
• لا يوجد رقم لتسريع الوقت الفعلي لزوج DSPARK. طول القبول 5.52 هو معدل نجاح قوي، لكن «كم مرة أسرع» على وحدة معالجة رسومية معينة هو بالضبط الرقم الذي لم تنشره OpenBMB.
• الغموض المتعلق بنافذة السياق أعلاه: المواد التسويقية قالت 512K، بينما الإعداد المُصدَر يقول 131,072، ولا شيء في المستودعات يربط بين الاثنين.
مكان الطرح الهادئ لنموذج مفتوح الأوزان ضمن المكدس التقني
القراءة الصادقة لنموذج MiniCPM5-2B اليوم هي أنه رهان: أرقام مورّد قوية، صفر عمليات تشغيل مستقلة، لا سجل خدمة، ونموذج مسودةٍ لم يُقَس تسريعه في العالم الواقعي. وهذا هو بالضبط الموقف الذي أُنشئت طبقة التوجيه من أجله. أي فريق يريد اختبار ما إذا كانت مخرجات نموذج صغير مفتوح المصدر يمكن أن تحلّ محل نموذج مستضافٍ يستدعيه بالفعل، يستطيع إجراء تلك المقارنة من واجهة API واحدة — إذ تقدّم OrcaRouter أكثر من 200 نموذج مستضاف بسعر المورّد المعلن دون أي زيادة، لذلك فإن أسبوع تقييم لا يكلّف شيئًا لإطلاقه، ويعني تجاوز الأعطال التلقائي أن نقطة تفتيش عمرها أيام لن تضطر أبدًا إلى احتجاز مسار الإنتاج كرهينةٍ بينما تُثبت نفسها. ولا يتطلب أيٌّ من ذلك استضافة MiniCPM5-2B في أي مكان؛ فهو شبكة الأمان حول النماذج التي تعتمد عليها أصلًا بينما تقرر ما إذا كان نموذج 2B المستضاف ذاتيًا يستحق وحدة معالجة الرسوميات.
راقب ما يلي، مرتّبًا بحسب الأهمية: عمليةُ تشغيلٍ مستقلّةٌ عبر SGLang DSPARK تُبلِّغ عن معدّل الرموز الفعلي في الثانية للزوج، لأنّ طول القبول مؤشّرٌ بديلٌ وليس معيارًا حقيقيًّا؛ إعلانٌ رسميٌّ أو مرآةٌ على ModelScope تؤكّد أنّ الإصدار نهائي؛ ومزوّدُ استضافةٍ يتبنّى MiniCPM5-2B — فإن تبنّاه أحدُهم، فالسعر الذي تدفعه من جهتنا هو السعرُ المدرَج لدى المزوّد نفسه في اليوم نفسه، لأنّ هذا هو معنى تمرير التكلفة (pass-through). وفي الوقت الراهن، فإنّ نموذج المسودة (draft model) هو العنصر الأكثر إثارةً للاهتمام بين الاثنين. إنّ نموذجًا مقترِحًا من خمس طبقات، يقبل منه النموذج المستهدف خمسةَ رموز ونصفًا من أصل سبعة، يصنع الفارق بين نموذج حافةٍ صغيرٍ يبدو صغيرًا، ونموذجٍ يبدو وكأنّه نموذجٌ أكبر يعمل على الجهاز نفسه.
