بطاقة عنوان رئيسية مُولّدة لـ 'MiniCPM-V 4.7 مقابل LFM2.5-VL 3B' مع عنوان فرعي '70 GB من الأوزان مقابل نموذج 3B يمكنك تشغيله على حاسوب محمول'، وبطاقة يسرى تحمل النص 'MiniCPM-V 4.7: 35.2B متناثر، لا ترخيص، ولا بطاقة'، وبطاقة يمنى تحمل النص 'LFM2.5-VL 3B: 3.1B كثيف، رخصة LFM Open License v1.0'، وكبسولة تحمل النص 'أحدهما مُقاس والآخر ليس كذلك'، مع شعار OrcaRouter في الزاوية السفلى اليمنى.
Guides & Insights

MiniCPM 4 مقابل LFM2.5-VL 3B: لغز بحجم 70 جيجابايت في مواجهة نموذج بحجم 3 مليارات يمكنك تشغيله على حاسوب محمول

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يُقدَّم MiniCPM-V 4.7 وLFM2.5-VL 3B على أنهما من الفئة نفسها — نماذج رؤية-لغة مدمجة تشغّلها بنفسك — لكن يصعب أن يكونا أكثر تباعدًا في الممارسة العملية. إن LFM2.5-VL 3B منتج مكتمل: نقطة تحقق موثّقة بـ3.1 مليار معامل من Liquid AI، مع ترخيص، وبطاقة نموذج، ونسخ GGUF مكمّمة منتشرة، وعدد آخذ في التراجع من الأسباب الجيدة لعدم تنزيله وتجربته مباشرة. أما MiniCPM-V 4.7 فهو نقطة تحقق بخليط خبراء متناثر بمعاملات تبلغ 35.2 مليار، رفعتها OpenBMB إلى Hugging Face في 6 أكتوبر 2026 بلا بطاقة نموذج، ولا ترخيص، ولا أي اختبارات معيارية على الإطلاق. مقارنتهما ليست مقارنة بين نموذجين. بل هي مقارنة نموذج بعيّنة يُرجّح أن تصبح نموذجًا.

المواجهة، بصراحة تامة منذ البداية

يمكن أن تمنحك هذه الصفحة صورة كاملة عن LFM2.5-VL 3B، لأن Liquid AI نشرت واحدة. يمكن أن تمنحك صورة كاملة عن MiniCPM-V 4.7من حيث الشكل ولا شيء على الإطلاق عن سلوكه، لأن OpenBMB نشرت config.json وتوقفت. كل ما يلي عن جانب MiniCPM مقروء من ملف التكوين ذلك وفهرس الأوزان؛ كل ما يتعلق بجانب Liquid مأخوذ من بطاقة النموذج، وادعاءات الأداء الخاصة بالبطاقة مُبلّغ عنها من قبل البائع وموسومة على هذا النحو. وحيث يوجد رقم لأحد النموذجين وليس للآخر، فإن الشيء الصادق هو ترك الفجوة ظاهرة بدل التغطية عليها.

ما هو كل واحد

صدر LFM2.5-VL-3B في 11 أغسطس 2026. وهو نسخة متعددة الوسائط من عائلة LFM2.5، صُمم للنشر على الأجهزة، ولا يبدأ من الصفر: إذ يأخذ العمود الفقري اللغوي LFM2.5-2.6B ويقرنه بمشفّر رؤية SigLIP2 NaFlex. إن NaFlex هو الجزء المهم في العمل على المستندات — فهو يحافظ على نسبة العرض إلى الارتفاع والدقة الأصلية بدل إجبار كل صورة على مربع ثابت، ولهذا فإن أبرز التحسينات المذكورة في البطاقة هي الإسناد grounding باستعلامات باللغة الطبيعية والتعرف الضوئي على الحروف OCR لكامل الصفحة مع وسم التخطيط layout annotation. يُطرح بموجب رخصة LFM Open License v1.0 ويغطي ست عشرة لغة من بينها الإنجليزية والصينية واليابانية والكورية والعربية والهندية والفرنسية والألمانية والإسبانية والبرتغالية والإيطالية والبولندية والروسية والتايلاندية والفيتنامية والإندونيسية. ولأنه بحجم 3B، ظهرت إصدارات GGUF خلال يوم من إطلاقه، وتبعها متغير DSpark في سبتمبر، لذا فالنظام البيئي المحيط به حقيقي: يمكنك سحب نسخة مُكمَّمة وتشغيلها على حاسوب محمول اليوم.

MiniCPM-V 4.7 هو نقطة تحقق BF16 بعدد معاملات يبلغ 35,212,875,824، وحجم 70.4 غيغابايت موزعة على ست عشرة شظية، من الفئة MiniCPMV4_7ForConditionalGeneration، تم رفعها إلى openbmb/MiniCPM-V-4.7-35B-A3B في 6 أكتوبر 2026.

A generated two-column comparison scoreboard titled 'MiniCPM-V 4.7 vs LFM2.5-VL 3B — the scoreboard'. Left column 'MiniCPM-V 4.7' lists Parameters 35.2B sparse, On disk 70.4 GB BF16, Licence none declared, Vision 16x downsample, Context 256K, Benchmarks none, Quants none. Right column 'LFM2.5-VL 3B' lists Parameters 3.12B dense, On disk 6 GB BF16, Licence LFM Open v1.0, Vision SigLIP2 NaFlex, Context on-device class, Benchmarks vendor card, Quants GGUF and MLX. The footer reads 'LFM figures vendor-reported; MiniCPM figures read from config.json.'

عموده الفقري اللغوي موسوم بـ qwen3_5_moe_text — وهو MoE متناثر مشتق من Qwen3.5 يضم 256 خبيرًا ويُختار 8 لكل رمز — وتتبع طبقاته الأربعون نمط انتباه ثابتًا من ثلاث طبقات خطية إلى طبقة كاملة واحدة، لذا تستخدم 30 من أصل 40 طبقة مسارًا خطيًا بنمط Mamba بدلًا من الانتباه التقليدي. طول السياق 256K. برج الرؤية خاص بسلالة MiniCPM-V نفسها، وبنية مشابهة تقريبًا لتلك التي استخدمها MiniCPM-V 4.6. لا يوجد ملف README في المستودع، وهذا يعني على Hugging Face أنه لا يوجد ترخيص.

المقارنة الممكنة فعليًا

ستة أبعاد، وكلا الجانبين، وملاحظة على كلٍّ منهما حول مقدار الوزن الذي يحمله الرقم.

• إجمالي المعاملات — LFM2.5-VL 3B: 3.12B، جميعها نشطة لكل رمز. MiniCPM-V 4.7: 35.2B إجمالًا، متناثر، 8 من 256 خبيرًا نشطًا لكل رمز. رقم MiniCPM غير قابل للمقارنة بعدد معاملات كثيف، والميزانية الفعلية للمعاملات النشطة غير منشورة؛ اعتبر "A3B" اسمًا، لا قياسًا.

• الحجم الفعلي على القرص — LFM2.5-VL 3B: ملف safetensors واحد بحجم ~6 جيجابايت بصيغة BF16، أو جزء صغير من ذلك بصيغة GGUF. MiniCPM-V 4.7: 70.4 جيجابايت موزعة على ستة عشر جزءًا، بصيغة BF16 فقط.

• الترخيص — LFM2.5-VL 3B: LFM Open License v1.0، منشور ومُشار إليه من البطاقة. MiniCPM-V 4.7: لم يُعلن عن ترخيص. في غياب license: وسم، فإن الوضع الافتراضي هو جميع الحقوق محفوظة، لذا فهذا عائق وليس حاشية.

• نهج الرؤية — LFM2.5-VL 3B: SigLIP2 NaFlex، بدقة أصلية مع الحفاظ على نسبة الأبعاد، وتدّعي البطاقة إجراء OCR لكامل الصفحة مع وسم التخطيط. MiniCPM-V 4.7: مخصص minicpmv4_7_vision برج مع downsample_mode: "16x" وmax_slice_nums: 9.

• السياق — LFM2.5-VL 3B: أمثلة الخدمة في البطاقة متواضعة مقارنةً بتصميم سياق طويل، وتستهدف العائلة ميزانيات الذاكرة على الجهاز. MiniCPM-V 4.7: max_position_embeddings: 262144، مع tokenizer model_max_length الذي يتوافق عند 256K.

• دليل على الجودة — LFM2.5-VL 3B: بطاقة منشورة تتضمن تحسينات مُبلَّغًا عنها من المورّد مقارنةً بـ LFM2-VL-3B، ونماذج مُكمَّمة من أطراف ثالثة، وسجل على Hugging Face يضم نحو 25,900 تنزيل. MiniCPM-V 4.7: صفر تنزيلات، ثلاثة إعجابات، لا بطاقة، لا معايير قياس، لا تقييم مستقل. لا شيء يمكن الاستشهاد به.

• الأدوات — LFM2.5-VL 3B: إصدارات GGUF وMLX من أطراف ثالثة، إضافةً إلى نسخة DSpark. MiniCPM-V 4.7: لا شيء. لا يوجد أي نوع من التكميم حتى الآن.

A screenshot of the Hugging Face model page for openbmb/MiniCPM-V-4.7-35B-A3B (captured 7 October 2026) showing the model header with three likes, the tags safetensors, minicpmv4_7 and region:us, and the file listing with no README or licence field.

الثلثان المفقودان من هذه الصفحة

كل مقال مقارنة في هذا المجال يأتي مرفقًا بفقرة عن معايير الأداء. أما هذا المقال فلا يمكنه ذلك. لا يوجد MMMU، ولا OCRBench، ولا DocVQA، ولا رقم grounding، ولا قياس زمن استجابة، ولا رقم VRAM خاص بـ MiniCPM-V 4.7 — ليس لأن البحث عنها كان غير عملي، بل لأن لا شيء في المستودع يحتوي عليها، ولم ينتجها أي طرف ثالث. النموذج المرفوع دون بطاقة هو، من منظور التقييم، غير مُقاس. وكل من يقول لك خلاف ذلك إنما يستنتج من اسم العائلة أو من عدد المعاملات، وكلاهما مؤشران سيئان لجودة النماذج متعددة الوسائط.

الأمر نفسه ينطبق على سؤال أكثر دقة: ما إذا كان MoE المتناثر يساعد فعلاً. تصميم 35B-A3B يقايض إجمالي الذاكرة بحساب لكل رمز، وتعتمد جودة اتباع التعليمات في نموذج متناثر كليًا على مدى جودة تدريب الموجّه. يُظهر الإعداد معامل خسارة مساعدة للتوجيه قدره 0.001 وخبيرًا مشتركًا إلى جانب 256 خبيرًا موجّهًا، وهو إعداد تقليدي — لكن الإعداد التقليدي ليس دليلًا على توجيه جيد.

على جانب Liquid، القطعة المفقودة مختلفة: فادعاءات الجودة الخاصة بالبطاقة هي ادعاءات المورّد نفسه.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-VL-3B (captured 7 October 2026) showing the model header, the image-text-to-text pipeline tag, the lfm2_vl architecture tag, the multilingual language tags and the opening of the model card explaining that LFM2.5-VL-3B builds on LFM2-VL-3B with a SigLIP2 NaFlex vision encoder.

يصف تحسينات OCR والإسناد الأشخاصُ الذين درّبوا النموذج، وبينما تُظهر النسخ المكممة من أطراف ثالثة وحجم التنزيلات أن المجتمع وجده مفيدًا بما يكفي لتحويله، فإن ذلك دليل على التبني لا دليل على الجودة. لم ينشر أحد مقارنة مستقلة وجهًا لوجه.

أيّ واحدٍ قد تمدّ يدك إليه فعلاً؟

شجرة القرار هنا واضحة بشكل غير معتاد، لأن النموذجين لا يتنافسان على المهمة نفسها.

إذا كنت بحاجة إلى نموذج بصري-لغوي يعمل على حاسوب محمول، أو هاتف، أو Jetson، أو وحدة معالجة رسومات واحدة متواضعة، فإن LFM2.5-VL 3B هو الوحيد من بين الاثنين الذي يجيب عن السؤال. إنه صغير بما يكفي ليخضع للتكميم، ولديه ترخيص يسمح بهذا العمل، وقد أجرى أحدهم بالفعل أعمال التحويل نيابةً عنك. بالنسبة إلى تخطيط المستندات، وتحليل لقطات الشاشة، ووصف الكائنات المرتكز، على حجم وبصمة لغوية تناسب ميزانية الحوسبة الطرفية، فإن نقاط القوة المذكورة في البطاقة تتوافق مع هدف النشر.

MiniCPM-V 4.7 ليس مرشحًا لتلك المهمة عند 70 غيغابايت بصيغة BF16. إنه مرشح للمهمة المعاكسة: نموذج متعدد الوسائط طويل السياق وعالي الإنتاجية على عتاد الخوادم، في أعباء العمل حيث تكون نافذة 256K ووفورات KV-cache الناتجة عن الانتباه الخطي هي المقصد. أما ما إذا كان يؤدي تلك المهمة جيدًا فذلك غير معروف، ويجب الإجابة عن مسألة الترخيص قبل أن يؤدي تلك المهمة على الإطلاق في أي سياق تجاري.

ثمة خيار ثالث يستحق التسمية، وهو أنك قد لا تحتاج إلى الاختيار أصلًا. إذا كانت المعمارية تقوم على أن "نموذجًا محليًا صغيرًا يتولى الجزء الأكبر من حركة العمل ويحيل الحالات الصعبة إلى شيء مستضاف"، فإن النصف المحلي من ذلك قرار يمكنك اتخاذه اليوم، والنصف المستضاف قرار توجيه. يغطي OrcaRouter بضع مئات من النماذج المستضافة خلف مفتاح واحد بسعر قائمة كل مزوّد دون أي إضافة فوقه، مع التحويل التلقائي عند تدهور أداء أحد المزوّدين — لكن كن واضحًا بشأن ما ليس كذلك: لا LFM2.5-VL 3B ولا MiniCPM-V 4.7 نموذج مستضاف على ذلك الموجّه. كلاهما أوزان تخدمها بنفسك. والموجّه هو ما يقف خلفهما.

أين وصل هذا الأمر، وما الذي ينبغي تحديثه

أطلقت Liquid AI نموذجًا صغيرًا مكتملًا. وأطلقت OpenBMB نموذجًا كبيرًا غير مكتمل. المقارنة التي يريدها القراء — الدقة مقابل زمن الاستجابة، والتعرف الضوئي على الحروف مقابل التعرف الضوئي على الحروف — لا يمكن كتابتها بعد بشأن جانب MiniCPM، والمقال الذي سيكون غير أمين هو ذلك الذي يملأ الفراغ بحساب عدد المعلمات. راقب ملف README في المستودع. وفي اليوم الذي يظهر فيه، سيحمل الترخيص وأول الأرقام الحقيقية، وفي ذلك اليوم يصبح هذا مواجهة مباشرة حقيقية بدلًا من ورقة مواصفات بجانب منتج.

النصف المستضاف من ذلك النمط هو قرار توجيه لا عقد ثانٍ. سعر القائمة لكل مزوّد دون أي هامش مضاف منّا لا يُعد LFM2.5-VL 3B ولا MiniCPM-V 4.7 نموذجًا مستضافًا على OrcaRouter - فكلاهما أوزان تتولى خدمتها بنفسك.