
LFM2.5-VL-3B: نموذج الرؤية واللغة الجديد من Liquid AI بحجم 3B للحوسبة الطرفية
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
أول ما يجب معرفته عن LFM2.5-VL-3B هو أنه صدر على خطوتين نصفيتين. ظهرت الأوزان على Hugging Face في 11 أغسطس 2026 — نقطة فحص كاملة بصيغة bf16، وبطاقة نموذج تحتوي على جدول معايير وملف README بست عشرة لغة، دون أي إعلان مرفق. وأظهرت البطاقة صفر تنزيلات. في اليوم التالي، 12 أغسطس، نشرت Liquid AI المقال الرسمي: "LFM2.5-VL-3B: A Better and Faster Vision-Language Model for the Edge"، فأصبح الإصدار الهادئ إصدارًا حقيقيًا. إذا كنت تقرأ هذا في نفس الأسبوع، فأنت تقرأ واحدًا من أقدم المقالات المستقلة عن نموذج لم يشغّله أي أحد خارج مختبر Liquid تقريبًا حتى الآن — لذا إليك ما يمكن معرفته فعليًا من المستودع، وما لا يمكن.
ما هو LFM2.5-VL-3B؟
LFM2.5-VL-3B هو نموذج رؤية-لغة — صورة ونص داخلاً، نص خارجاً — مبني على العمود الفقري النصي LFM2.5 من Liquid AI. وتحديدًا: نموذج اللغة هو LFM2.5-2.6B مقترنًا بترميز الرؤية SigLIP2 NaFlex 400M، ليبلغ إجمالي المعاملات نحو 3.1 مليار. يحافظ على البنية الهجينة للعائلة المكوّنة من كتل التفاف مُبوّبة قصيرة المدى متخللة بانتباه الاستعلامات المجمّعة، ومفردات من 128,000 رمز، ونافذة سياق من 32,768 رمزًا. يدعم ست عشرة لغة (الإنجليزية، العربية، الصينية، الفرنسية، الألمانية، الهندية، الإندونيسية، الإيطالية، اليابانية، الكورية، البولندية، البرتغالية، الروسية، الإسبانية، التايلاندية، الفيتنامية)، ويُوفَّر بصيغة bfloat16، وهو مرخّص بموجب رخصة lfm1.0 المفتوحة من Liquid.
هذا ليس نموذجًا مبنيًا من الصفر. تصفه البطاقة بأنه نسخة متعددة الوسائط من LFM2.5 مبنية على النموذج السابق LFM2-VL-3B مع مزيد من التدريب في المرحلتين الوسطى واللاحقة. هذا النسب مهم: فمهارات الرؤية مكدسة فوق نموذج نصي مُدرَّب مسبقًا على حوالي 34 تريليون رمز، لذا فإن الجانب اللغوي ليس شيئًا تافهًا — بل هو نفس محرك العائلة الذي تستخدمه النماذج النصية، مع مشفّر رؤية مُدمج وأُعيد تدريبه للعمل البصري.
ما يمكنه فعله
يكتب لايكويد في تقريره عن أربعة تحسينات مقارنة بالإصدار السابق LFM2-VL-3B: فهم الشاشة وواجهة المستخدم، واستدعاء الدوال، والربط، والإدخال متعدد الصور. وبعبارة بسيطة، يعني ذلك:
• التأريض — أشر إلى الكائنات باستعلامات اللغة الطبيعية ("لافتة التوقف"، "عمود السعر") واحصل على موقع معياري في المقابل.
• فهم الشاشة — الإجابة عن أسئلة حول ما يظهر على الشاشة ومكانه، تم قياس أدائه باستخدام ScreenSpot-v2.
• التعرف الضوئي على الحروف مع شرح التخطيط — تعرّف ضوئي على كامل الصفحة يعيد أيضًا بنية المستند، مع 23 تسمية تخطيط (نص، عنوان، قائمة، جدول، تسمية جدول، مخطط، معادلة، كود، ترويسة وتذييل الصفحة، والمزيد) كإحداثيات أعداد صحيحة موحّدة.
استخدام الأدوات — تدفق من أربع خطوات لاستدعاء الدوال يستقبل تعريفات الأدوات بصيغة JSON، ويُصدر استدعاءات بنمط Python بين رموز استدعاء الأدوات، ويعيد إجابة نصية نهائية بسيطة.
• إدخال متعدد الصور — الاستدلال عبر عدة صور في جولة واحدة.
إرشادات Liquid الخاصة حول المواضع التي لا يناسبها محددة بشكل غير معتاد. توصي البطاقة باستخدامه للمهام أحادية الجولة وعالية الإنتاجية ومنخفضة زمن الاستجابة — مثل اكتشاف الأشياء شبه الفوري في مجال السيارات، والتعرف الضوئي على الحروف (OCR) بكميات كبيرة للوثائق الممسوحة ضوئيًا، وترجمة القوائم واللافتات المرورية على الجهاز — وتحذر صراحةً من الأعمال ذات السياق الطويل والمثقلة بالاستدلال، وتصميم الويب المرئي، والأسئلة الفنية عالية التخصص المتعلقة بالمخططات الهندسية.
الأرقام — جميعها مُبلَّغ عنها من البائع
كل شكل في هذا القسم مأخوذ من بطاقة النموذج ومنشور المدونة الخاصين بـ Liquid AI نفسه. لم تتم إعادة إنتاج أي منه بشكل مستقل، وحتى يقوم طرف ثالث بتشغيل نقطة التحقق، ينبغي أن تتعامل مع هذه الأمور كادعاءات لا كحقائق. هذا التصنيف يؤدي عملاً حقيقياً هنا، لأن السجل قوي فعلاً على الورق:
• الإسناد — دقة RefCOCO macro precision@1 بلغت 87.9، مرتفعةً من 57.1 في النموذج السابق LFM2-VL-3B — أي قفزة بنحو ثلاثين نقطة، وتعزوها Liquid إلى ما بعد التدريب على الرؤية.
• فهم الشاشة — متوسط ScreenSpot-v2 هو 80.7، وهو ما تذكره Liquid كتقدّم على 78.5 التي تنسبها إلى Qwen3.5-4B.
• استخدام الأدوات — ToolSandbox 59.5، أي أكثر من ضعف نتيجة 26.4 التي حققها Liquid على LFM2-VL-3B؛ وBFCLv4 32.5، مرتفعًا من 20.5.
• الاستدلال البصري العام — MME 73.1, MMStar 63.3, RealWorldQA 73.1, MMMB 83.0, ChartQA 81.3, MathVista 68.5, POPE 88.7.
• OCR — OCRBenchv2 (المجموعة الفرعية الإنجليزية) 47.5، مرتفعًا من 43.9.
• الاستدلال متعدد الوسائط الصعب — MMMU Pro 30.5, BLINK 61.5, MuirBench 58.3 — الجانب الأضعف، كما هو متوقع لنموذج 3B.
سرعة تشغيل عالية من vendor — 228 رمزًا في الثانية على Apple M5 Max، و116 رمزًا في الثانية على AMD Ryzen AI Max+ 395، و20 رمزًا في الثانية على Galaxy S26 Ultra، وكل ذلك ضمن حوالي 3.3 غيغابايت من الذاكرة. وعلى H100 مع vLLM، تدّعي Liquid حوالي 11 ألف رمز إخراج في الثانية عند التزامن العالي، وزمن استجابة حتى أول رمز يبلغ حوالي 34 مللي ثانية على مقطع من خمس لقطات، وهو ما تعزوه إلى أن النموذج يجيب مباشرة بدلاً من التفكير.

هذه ادعاءات كثيرة لنموذج واحد بحجم 3B، ومن الجدير إعادة ذكر التحذير في تذييل بطاقة النموذج نفسه: هذه أرقام Liquid. الفجوة بين "تحقيق درجات جيدة في تقييم مختبري" و"الثبات عند التطبيق على بياناتك" هي بالضبط المكان الذي تتعثر فيه عادةً النماذج الجديدة بهذا الحداثة.
ما لم يُعرف بعد
القائمة الصادقة للأسئلة المفتوحة:
• لا يوجد معيار تقييم مستقل — حتى وقت كتابة هذه الأسطر، لا يظهر نموذج LFM2.5-VL-3B في أي لوحة صدارة تابعة لجهة خارجية. جميع النتائج أعلاه مُبلغة من قبل المورد.
• لا توجد نقطة نهاية مستضافة — لا يوفّرها أي مزوّد استدلال حتى الآن. هذه قصة استضافة ذاتية، ولا شيء غير ذلك.
• لا توجد بيانات استخدام — صفر تنزيلات في يومها الأول يعني عدم وجود ملاحظات من المجتمع، ولا ضبط دقيق، ولا عبارات "شغّلته على X فتعطّل عند Y". أول تقارير العالم الحقيقي ما زالت أمامنا.
• ميزة تجريبية — تُصنَّف مخرجات التعليقات التوضيحية للتخطيط من قبل Liquid نفسها على أنها "تجريبية" و"قد تتغير، وقد تكون غير موثوقة، وقد لا يكون تحليلها سهلًا." لا تبنِ محللًا خاصًا بك حولها بعد.
• تغطية طرف ثالث ضعيفة — صحافة الأسبوع الأول هي في الغالب ملخصات إخبارية قصيرة. لم يقم أحد بإجراء اختبار مستقل عميق.

لا يعني أيٌّ من ذلك أن النموذج سيئ. إنه يعني أنه غير مُثبت، كما يكون أي نموذج غير مُثبت في الأيام التي تلي إطلاقه.
كيف تشغّله بنفسك
بالنسبة لنموذج بهذا الحداثة، فإن قصة النظام البيئي جيدة بشكل غير عادي. ظهرت متغيرات الصيغ في نفس يوم إصدار الأوزان: GGUF لـ llama.cpp، وONNX، وخمسة تكميمات MLX لأجهزة Apple Silicon، إلى جانب نقطة التحقق الأصلية bf16 لـ Transformers وvLLM وSGLang. تذكر Liquid دعم اليوم الأول عبر llama.cpp وMLX وvLLM وSGLang وONNX، بالإضافة إلى عرض توضيحي للمتصفح عبر WebGPU. معلمات أخذ العينات الموصى بها هي درجة الحرارة 0.2، وtop_k 50، ومعامل تكرار 1.0، مع معالجة الرؤية بواسطة إعدادات معالج النموذج. إذا أردت تجربته على حاسوب محمول الليلة، فإن إصدارات MLX أو GGUF هي المسار الأقصر.
ماذا تشاهد
أمران يحددان ما إذا كانت LFM2.5-VL-3B مهمة خارج دورة الضجيج. أولاً، ما إذا كانت أرقام التأسيس وفهم الشاشة تصمد أمام إعادة الإنتاج المستقلة — 80.7 على ScreenSpot-v2 و87.9 على RefCOCO هما الادعاءان الأجدر بالتحقق، لأنهما اللذان سيجعلان هذا النموذج الطرفي مُحدثًا لاضطراب حقيقي. ثانيًا، ما إذا كانت نقطة نهاية مستضافة ستظهر، لأن ذلك يغير المعادلة من "مشروع استضافة ذاتية مثير للاهتمام" إلى "قابل للإطلاق اليوم". وهنا تحديدًا تبرر طبقة التوجيه وجودها: واجهة برمجية واحدة عبر أكثر من 200 نموذج تعني أنه في اليوم الذي تقيم فيه Liquid أو مزود خدمة نقطة نهاية، تضيف LFM2.5-VL-3B إلى جانب النماذج التي تستدعيها بالفعل دون تغيير تكاملك، بسعر القائمة لدى المزود وبدون أي هامش ربح، ويتيح لك التحويل التلقائي عند الفشل توجيه حركة مرور حقيقية إليه بينما يغطي نموذج مُثبت المكالمات التي يتعثر فيها. وإلى ذلك الحين، فهي قصة استضافة ذاتية واعدة — وبالنسبة لنموذج عمره أسبوع واحد، فهذا بالفعل أكثر مما تحصل عليه معظم الإصدارات.

