
MiniCPM5-2B مقابل Qwen 3 8B: هل يجب أن تنتقل أعباء عمل 8B إلى 2.5B؟
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
كل مقارنة بين النماذج تخفي سؤالًا متعلقًا بالعتاد، والمقارنة بين MiniCPM5-2B وQwen 3 8B هي ذلك السؤال متخفّيًا في زيٍّ من المعايير. Qwen 3 8B هو نموذج Alibaba مفتوح الأوزان الصادر في أبريل 2025، وهو حصان العمل الفعلي: نحو 8.2 مليار بارامتر كثيف، ويدعم 119 لغة، مع تفكير هجين قابل للتشغيل أو الإيقاف لكل طلب، وستة عشر شهرًا من الأدلة المجتمعية خلفه. أما MiniCPM5-2B فهو النموذج الذي كشفت عنه ModelBest وOpenBMB في مؤتمر الذكاء الاصطناعي العالمي في 19 يوليو بصفته النموذج الأعلى ترتيبًا بين النماذج الأقل من 4 مليارات بارامتر على لوحة صدارة Artificial Analysis، ثم نُشرت أوزانه المفتوحة بهدوء على Hugging Face يومي 6 و7 سبتمبر. والسؤال الذي يجمعهما فعلًا في صفحة واحدة هو ذاته الذي تطرحه معظم الفرق التي تشغّل نموذجًا مفتوحًا بحجم 8B على نفسها في مرحلة ما: هل يمكن لعبء العمل الذي أُشغّله على نموذج 8B أن ينتقل إلى نموذج بحجم 2.5B؟ وإن أمكن ذلك، فما الذي سأضحي به؟
الإجابة المختصرة هي "ليس بعد" بالنسبة لمعظم أعباء العمل، لكن الأسباب أضيق ممّا يوحي به فارق الحجم البالغ أربعة أضعاف، وهناك فئة واحدة من النشر ليس لدى نموذج 8B أي إجابة لها على الإطلاق. كل ما هو كمّي أدناه مُبلَّغ عنه من قِبل البائع ومُصنَّف على هذا النحو: أرقام MiniCPM5-2B هي ادعاءات بطاقة ModelBest الخاصة، عمرها أسبوع واحد ولم يعِد إنتاجها أحد خارج المختبر؛ أمّا أرقام Qwen 3 8B فهي من علي بابا، وقد خضعت منذ فترة طويلة للفحص والقياس الكمّي وإعادة التشغيل من قِبل مجتمع واسع. ذلك التفاوت في الأدلة هو العنوان الحقيقي لهذه المواجهة.
ستة عشر شهرًا من Qwen 3 8B
ينتمي Qwen 3 8B إلى العائلة المعمارية نفسها التي ينتمي إليها منافسه، لكنه أكبر حجمًا بثلاث مرات وأقدم بستة عشر شهرًا. وهو محول سببي كثيف يعتمد انتباه الاستعلامات المجمّعة، ودُرِّب مسبقًا على مجموعة نصوص متعددة اللغات تضم نحو 36 تريليون رمز، وهو مرخَّص بموجب رخصة Apache-2.0، ومن أكثر نماذج 8B شيوعًا في الاستضافة الذاتية والخدمة في عالم النماذج مفتوحة الأوزان. بصمته المميزة هي وضع الاستدلال الهجين في Qwen3 — تشغيل التفكير أو إيقافه عند كل طلب — إذ يسمح لنشرٍ واحد بالإجابة عن الأسئلة البسيطة بسرعة ثم التحوّل إلى سلسلة تفكير متعمّدة لحل مسائل الرياضيات أو البرمجة. ويوفّر دعمًا أصليًا لبروتوكول Model Context Protocol واستدعاء الدوال، وسياقًا أصليًا يبلغ 32 ألف رمز تتحقق Alibaba من تمديده إلى 131 ألف رمز عبر تحجيم YaRN، فضلًا عن تغطية 119 لغة ولهجة. وبعد ستة عشر شهرًا، صارت أنماط فشله موثّقة، وصيغ تكميمه متاحة في كل مكان، وبلغ النظام البرمجي المحيط بخدمته — vLLM وSGLang وllama.cpp وألف نموذج مضبوط بدقة — مرحلة النضج. ومع التكميم العملي، يعمل بحجم لا يتجاوز بضعة غيغابايتات، وبشكل مريح على بطاقة GPU متوسطة المدى واحدة، وليس على الهاتف.

ما الذي تدّعيه MiniCPM5-2B في ذلك العالم
يأتي MiniCPM5-2B من الاتجاه المعاكس: صغيرٌ في تصميمه، ووكيليٌّ في تدريبه. إنه محولٌ كثيفٌ بإجمالي 2.52 مليار معامل (منها 1.98 مليار خارج التضمين)، و42 طبقةً بعرضٍ خفيٍّ 2048، وانتباهٍ مُجمَّعِ الاستعلامات، وبنيّة LlamaForCausalLM قياسيةٍ دون نوى مخصصة، ونافذة سياقٍ تبلغ 131,072 رمزًا في الإعداد المُرفَق (وكانت موادُ إطلاق يوليو تتفاخر بسعة 512 ألف رمز؛ غير أن الإعداد المنشور لا يتضمن ذلك). بينما تحصل Qwen 3 8B على اتساعها من عملية تدريبٍ مسبقٍ متعددة اللغات على 36 تريليون رمز، تكتسب MiniCPM5-2B طابعها من التدريب اللاحق: تدريبٌ موجَّه (SFT) على 400 مليار رمز من بيانات التفكير العميق، ثم تقطيرٌ على السياسة (On-Policy Distillation) يدمج ستة عشر نموذجًا خبيرًا من نماذج التعلم المعزز، خمسةٌ منها وكيلية، في شبكةٍ كثيفةٍ صغيرةٍ واحدة. وقد تمحور طرحُ الإطلاق حول قاعدة وكيلٍ على الجهاز — استدعاءُ أدواتٍ أصليًّا عبر نداءات على غرار XML، وتكيّفٌ من اليوم الأول مع تسع عائلاتٍ من الشرائح بالإضافة إلى ARM، وأوضاعٌ هجينة بين التفكير السريع والتأملي — وتدّعي بطاقةُ النموذج تحقيقَ متوسطٍ داخليٍّ قدره 53.9 على مجموعة مقارنةٍ لموديلاتٍ تتراوح معاملاتها بين 2 و4 مليارات اختارها البائع، ونتيجة 86.5 على AIME 2025/2026، ونتيجة 46.4 بتشغيلٍ من البائع على SWE-bench Verified؛ وهو إنجازٌ سيكون مذهلًا لنموذجٍ بحجم 2.5 مليار معامل إذا اجتاز اختباراتٍ مستقلة.

عدم التطابق، بُعدًا بُعدًا.
• الإصدار — MiniCPM5-2B: أُعلن عنه في 19 يوليو 2026؛ الأوزان متاحة في 6-7 سبتمبر. Qwen 3 8B: أُعلن عنه في أبريل 2025.
• الحجم — MiniCPM5-2B: 2.52 مليار إجمالاً / 1.98 مليار غير تضمينية، كثيف. Qwen 3 8B: ~8.2 مليار كثيف.
• السياق — MiniCPM5-2B: 131,072 توكنًا في الإعداد المُرفق. Qwen 3 8B: 32K أصلي، و131K مُتحقق منها عبر YaRN.
• اللغات — MiniCPM5-2B: يركز على الإنجليزية والصينية. Qwen 3 8B: 119 لغة ولهجة.
الاستدلال — MiniCPM5-2B: أوضاع سريعة/مدروسة هجينة، حسب مواد الإطلاق. Qwen 3 8B: وضع Qwen3 التفكيري قيد التشغيل أو الإيقاف حسب الطلب.
• الأدلة — MiniCPM5-2B: بطاقة البائع، دون تشغيل مستقل. Qwen 3 8B: كما أبلغت Alibaba، ستة عشر شهرًا من إعادة الإنتاج والنشر المجتمعي.

لوحة النتائج أعلاه توضح التباين بصدق: الأعمدة تختلف في كل شيء تقريبًا باستثناء الترخيص المفتوح Apache-2.0، وفئة الجهاز الذي تشحن إليه هي التي تحدد أي عمود يُسمح لك باختياره.
حيث ما زال 8B يتفوق
عندما تنزل فئةً في الحجم، فأنت تتخلى عن ثلاثة أمور ملموسة. أولًا اللغات: Qwen 3 8B يغطي 119 لغة؛ أما بطاقة وبيانات MiniCPM5-2B فمرتكزة على الإنجليزية والصينية، ولا يُدَّعى لها أي اتساع تعددي اللغات. بالنسبة لمنتج يخدم ذيلًا طويلًا من اللغات، فهذا جدار صلب لا حائل لين. ثانيًا، الأدلة: ستة عشر شهرًا من الاختبار المجتمعي تعني أن سلوك Qwen 3 8B معروف ونظامه البيئي منتشر في كل مكان، بينما MiniCPM5-2B مستودع عمره أسبوع واحد وبطاقة غير مُتحقَّق منها — وأرقامه البارزة، إن لم تصمد أمام عمليات تشغيل مستقلة، هي تحديدًا النوع الذي يُعدَّل بهدوء. ثالثًا، حزمة التشغيل (serving stack): كل ما يتواصل حاليًا مع Qwen 3 8B يتواصل مع هدف ناضج، أما نقطة فحص جديدة من فئة 2B فتعني إعادة التحقق من عمليات التكميم (quantizations)، وإعدادات التشغيل، وسلوك استدعاء الأدوات من الصفر. ليس أيٌّ من هذه أسبابًا لعدم قدرة نموذج الـ2B على الفوز في معيار محدد؛ بل هي أسباب تجعل الـ8B هو الخيار الافتراضي الأقل مخاطرة حيثما كان ملائمًا.
حيث أن 2B هو الجواب الوحيد
لا شيء من ذلك يهم في فئة الأجهزة التي لا تتسع لنموذج 8B ببساطة. على الهاتف، أو لوحة القيادة الذكية، أو صندوق الحافة الصغير الذي يمتلك بضعة غيغابايتات من DRAM، فإن Qwen 3 8B لا ينافس MiniCPM5-2B — بل إنه غير قابل للنشر بسرعة مفيدة إطلاقًا. هذا هو السبب الكامل لوجود 2B، ولهذا فإن التأطير الصادق لهذه المقارنة ليس "هل 2B بنفس جودة 8B؟" بل "أي من عمليات النشر الخاصة بي لا يمكن أن يخدمها سوى واحد من هذين الاثنين؟" إذا كنت تُطلق وكلاء على الجهاز حيث قد يختنق ناقل الذاكرة بثمانية مليارات وزن، فإن MiniCPM5-2B هو أحد أكثر الخيارات تدريبًا بعدوانية في فئة 2B المتاحة، والسؤال الوحيد الجدير بالطرح هو ما إذا كانت ادعاءاته الوكيلة تصمد أمام إعادة إنتاجك الخاصة. إذا كان عبء عملك يعمل أصلًا على عتاد يحمل 8B بشكل مريح، فإن فجوة الحجم وحدها ليست سببًا للترحيل — وفجوة الأدلة تشير ضد ذلك.
إذا كنت تفكر في التحول
الطريقة الآمنة لاختبار هذا الانتقال هي التعامل معه كتجربة، لا كترحيل. شغّل MiniCPM5-2B على أجهزتك الخاصة، ووجّه جزءًا من حركة المرور الحقيقية إليه عبر واجهة API واحدة مع تجاوز الفشل التلقائي، وقِس النتائج مقارنةً بنموذج 8B على الطلبات نفسها — وهنا تُثبت طبقة التوجيه قيمتها؛ لأن checkpoint عمره أسبوع واحد قد يتوقف أو يدخل في حلقة تكرار دون أن يُسقط بيئة الإنتاج، وأسعار قوائم المزوّدين للنماذج المستضافة التي تقارن بها تمرّ بهامش ربح 0%. ما تختبره فعلًا ثلاثة أمور: ما إذا كانت دقة نموذج 2B تصمد على بياناتك، وما إذا كان زمن استجابته على فئة أجهزتك يتفوق على زمن استجابة 8B على العتاد الذي كنت ستشتريه لولا ذلك، وما إذا كان الملف اللغوي الإنجليزي-الصيني يغطي المستخدمين الموجودين لديك فعلًا. أعد إنتاج SWE-bench أو جزءًا من مجموعة التقييم الخاصة بك أولًا — فالساعتان اللازمتان لذلك هما أرخص تأمين تقدمه هذه المقارنة.
الحكم
الالتزام بنموذج Qwen 3 8B لكل ما يتعلق بتعدد اللغات، أو أي شيء يحتاج إلى ستة عشر شهرًا من السلوك المعروف، أو أي عبء عمل يعمل بالفعل على أجهزة تستوعب نموذج 8B بشكل مريح. اختبر MiniCPM5-2B بجدية فقط إذا كان جهازك الهدف غير قادر على تشغيل 8B إطلاقًا، أو إذا كان نموذج 2.5B قادرًا على مواكبة الأعمال الوكيلة وسياقات النص الطويلة بما يسمح بتقليص الذاكرة والطاقة على الأجهزة التي تشحنها بالفعل. إن تصدّر نموذج أقل من 4B للترتيبات إنجاز حقيقي، وإصدار أوزانه المفتوحة يجعله قابلًا للاختبار اليوم؛ لكنه ببساطة ليس — بناءً على الأدلة المتاحة — سببًا لإحالة نموذج 8B الموثوق الذي أثبت جدارته إلى التقاعد.
