بطاقة عنوان رئيسية تحمل عنوان «أحدهما يقرر، والآخر يصف» مع عنوان فرعي «Liquid AI d1-omni-600M مقابل LFM2.5-VL-3B - أوزان مفتوحة، أكتوبر 2026»، وبطاقتان: Liquid AI d1-omni-600M بمعاملات تبلغ 587 مليونًا، يُعيد وسمًا أو درجة مع 0 رموز إخراج، مقابل LFM2.5-VL-3B بمعاملات تبلغ 3.1 مليار، يكتب نصًا ويقرأ الصور ليُعيد نثرًا.
Guides & Insights

Liquid AI d1-omni-600M مقابل LFM2.5-VL-3B: أحدهما يقرر، والآخر يصف

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إنّ Liquid AI d1-omni-600M وLFM2.5-VL-3B كلاهما صغير، وكلاهما متعدد الوسائط، وكلاهما منشور من المختبر نفسه على Hugging Face بموجب الترخيص نفسه lfm1.0 — والجمع بينهما خطأ تصنيفي يتبيّن أنه خطأ مفيد. صدر LFM2.5-VL-3B في 12 أغسطس 2026 بوصفه نموذج الرؤية واللغة الطرفي من Liquid AI: 3.1 مليار معامل، ونافذة من 32,768 رمزًا، ومخرجات نثرية. سلّمه صفحة ممسوحة ضوئيًا، فيعيد لك النسخ النصي، مع التخطيط، كنص. ورُفع Liquid AI d1-omni-600M في 7 أكتوبر 2026 مع بقية عائلة d1 المفتوحة، وهو يفعل الشيء المعاكس بالمُدخلات نفسها. إنه نموذج قرار بـ587 مليون معامل: تُرفق أسئلة مُسمّاة بحالة، فيُبلغ عمّا يعتقده بالفعل — P(yes)، أو تصنيف مختار مع درجة ثقة، أو موضع على مقياس مرتّب من اثنين إلى عشرة — في تمريرة أمامية واحدة، بلا أي رموز مخرجات ولا شيء لاحق لتحليله. إذا كنت قد بحثت عن «نموذج Liquid الصغير متعدد الوسائط»، فها هما شكلان أمامك الآن، والشكل هو القرار.

توضّح هذه الصفحة ما تُثبته فعليًا بطاقتا النموذجين، ومنشور الإصدار الصادر في 7 أكتوبر، والمستودعات نفسها. وهي أيضًا صريحة بشأن النقطة التي تتوقف عندها. لم يُعَد إنتاج أي شيء مما ورد في هذه المقارنة خارج Liquid AI، وبالنسبة لأحد النموذجين، لا يملك المورّد أي معيار دقة خاص بقدرته الرئيسية المعلنة على الإطلاق.

نقطتا التفتيش، جنبًا إلى جنب

تتباين أوراق المواصفات في كل محور تقريبًا، وهو ما تتوقعه من طرازين لم يُكتب لهما يومًا أن يتنافسا على المكانة ذاتها.

• ما هو — LFM2.5-VL-3B هو نموذج رؤية-لغة توليدي يكتب النص؛ Liquid AI d1-omni-600M هو نموذج قرار يُعيد إجابات منظمة ولا يُصدر أي رموز

• المعاملات — 3.1 مليار بصيغة BF16 في LFM2.5-VL-3B مقابل 587 مليون في Liquid AI d1-omni-600M، وهو نفسه جذع مشترك ورأس قرار بحجم 381 مليون بالإضافة إلى مُرمِّز رؤية بحجم 94 مليون ومُرمِّز صوتي بحجم 112 مليون

• العمود الفقري — يقرن LFM2.5-VL-3B نموذجًا لغويًا LFM2.5-2.6B بمرمّز رؤية SigLIP2 NaFlex المُحسَّن للأشكال بحجم 400M؛ وقد دُرِّب Liquid AI d1-omni-600M انطلاقًا من LFM2.5-Encoder-350M، وهو مرمّز ثنائي الاتجاه، مع برج SigLIP2 مأخوذ من LFM2.5-VL-450M وFastConformer من 17 طبقة للصوت

• المُدخلات — نص وصور لـ LFM2.5-VL-3B؛ نص بالإضافة إلى صور أو نص بالإضافة إلى ما يصل إلى 30 ثانية من الكلام لـ Liquid AI d1-omni-600M، الذي يُثير ValueError إذا وصلت الصور والصوت في الطلب نفسه

• السياق — 32,768 توكنًا لـ LFM2.5-VL-3B مقابل 16,384 موضعًا مشتركًا للنص والصورة والصوت لـ Liquid AI d1-omni-600M، التي تضيف بطاقتها أنه عند وجود الصور يتم تقليص نص الحالة والسؤال إلى 896 توكنًا لتتوافق مع التدريب

• المفردات — 128,000 رمز لـ LFM2.5-VL-3B، و65,536 لـ Liquid AI d1-omni-600M

• وقت التشغيل — يعمل LFM2.5-VL-3B في transformers وvLLM، وله نموذج مسودة DSpark منفصل لفك الترميز التخميني؛ ويأتي Liquid AI d1-omni-600M بشيفرة مخصصة، ويحتاج إلى trust_remote_code=True، وتوصي بطاقته باستخدام float16 على GPU مع تحذير من أن bfloat16 غيّر الإجابة الأعلى في بعض الصفوف

• الترخيص — lfm1.0 لكليهما، مما يسمح بالضبط الدقيق والنشر

سطر واحد في تلك القائمة يقوم بعمل أكثر من الباقي. إنّ Liquid AI d1-omni-600M مبنيّ على مُرمِّز ثنائي الاتجاه بدلًا من مُفكِّك. هذا ليس تصغيرًا لحجم LFM2.5-VL-3B؛ إنه سلالة مختلفة، وهو السبب المعماري الذي يجعل النموذجين غير قابلين للاستبدال أحدهما بالآخر مهما كانت طريقة قراءة جداول المقاييس.

عقد المخرجات يحسم أكثر مما تحسمه المعايير

اسأل LFM2.5-VL-3B سؤالاً عن صورة وستحصل على لغة في المقابل. هذا ذو قيمة مالية عندما يجب أن يقرأ شخص الإجابة، أو تُسجَّل كسلسلة نصية، أو تُغذَّى إلى خطوة تتوقع نصاً نثرياً. وهو أيضاً عبء يجب أن تهندس حوله: فقد يشرد المخرَج المولَّد، وقد يعود الطلب ذو الشكل JSON بشكل مختلف عما طلبته، وكل رمز تُحتسب تكلفته ويُنتظر. النموذج محدَّد النطاق صراحةً لأعمال الرؤية أحادية الدور، عالية الإنتاجية، منخفضة الكمون — التعرف الضوئي على الحروف (OCR) على دفعات للمستندات الممسوحة ضوئياً، والكشف في الوقت الفعلي داخل مركبة، وترجمة اللافتات على الجهاز — ومُوجَّه صراحةً بعيداً عن الأسئلة ذات السياق الطويل والثقيلة بالاستدلال مثل "ما الخطأ في هذا المخطط؟"

يجيب Liquid AI d1-omni-600M عن سؤال أضيق نطاقًا بشكل صارم ضمن إطار أكثر موثوقية بشكل صارم. واجهته حالة — نص، أو JSON، أو صورة واحدة أو أكثر، أو ما يصل إلى 30 ثانية من الكلام — بالإضافة إلى مجموعة من الأسئلة المُسمّاة، يحدّد كل منها نوعه الخاص. سؤال noul هو سؤال بنعم/لا ويعود على شكل P(yes) بين 0 و1. سؤال choice يختار تسمية واحدة من مجموعة تُسمّيها أنت، ويعيد التسمية ودرجة ثقة واحتمال كل خيار. سؤال score يضع الحالة على مقياس مرتّب من مستويين إلى عشرة مستويات، ويعيد المستوى المتوقع مع توزيعه. يمكن تعليق عدة أسئلة على حالة واحدة وتُقرأ من تمريرة واحدة، لذا يُبلّغ عدّاد الاستخدام في بطاقة النموذج عن output_tokens: 0. لا توجد خطوة توليد، ما يعني أنه لا وجود لشيء يُسمّى مخرجات تفشل في التحليل.

ما تتخلى عنه هو كل ما تحمله الإجابة المولّدة ولا تحمله التسمية: الاستدلال، والتحوّط، والعبارة التي يمكنك لصقها في تذكرة، والقدرة على طرح سؤال متابعة في المحادثة نفسها. تقول Liquid ذلك بوضوح — فهذا النموذج ليس نموذج محادثة ولا يكتب نصًا. إذا كان خط أنابيبك بحاجة إلى شرح بجانب الحكم، فإن Liquid AI d1-omni-600M هو النصف الخطأ من الزوج، والجواب الصادق هو تشغيل كليهما: LFM2.5-VL-3B لإنتاج قراءة الصورة، وLiquid AI d1-omni-600M لإنتاج القرار بشأنها.

A two-column scoreboard for Liquid AI d1-omni-600M and LFM2.5-VL-3B showing the 600M at 587M parameters, output of label, score and 0 tokens, text plus image or audio input, no published vision benchmark, up to 30 seconds of speech and a 16,384-token context, against the 3B at 3.1B parameters, generated text output, text plus image input, RefCOCO 87.9 and OCRBench v2 47.5 on vision, no audio and a 32,768-token context, footed 'All figures vendor-reported by Liquid AI; none independently reproduced. October 2026.'

لا يوجد رقم رؤية لمقارنة مباشرة وجهاً لوجه، وهذه هي النتيجة.

الخطوة التالية البديهية هي وضع معايير الرؤية جنبًا إلى جنب. لكنك لا تستطيع ذلك. في LFM2.5-VL-3B ينشر المزوّد مجموعة كاملة — RefCOCO Macro Precision@1 عند 87.9، وScreenSpot-v2 عند 80.7، وChartQA عند 81.3، وPOPE عند 88.7، وMMStar عند 63.3، وBLINK عند 61.5، وMuirBench عند 58.3، وToolSandBox عند 59.5، وOCRBench v2 English عند 47.5، وRealWorldQA عند 73.1 الذي يتقدّم بفارق ضئيل على 71.1 الخاص بـ LFM2-VL-3B السابق. كل هذه مُبلَّغ عنها من المزوّد، ولم يُعَد إجراء أيٍّ منها بشكل مستقل، ومع ذلك فهي ادعاءات محددة حول قدرات محددة يمكن للقارئ أن يحاسِب المختبر عليها.

بالنسبة إلى Liquid AI d1-omni-600M، يقول منشور الإصدار إن Decision Index v0.3 يتضمن تقسيمًا خاصًا للرؤية "لا نقدم تقريرًا عنه في هذا الإصدار"، وإن Liquid بدلًا من ذلك تحققت من أن نقطة التحقق 600M "تتعامل مع الأنماط الثلاثة كافة"، مع وضع الأدلة في عروض توضيحية على playground. وهذا هو كل السجل المنشور للرؤية. لا توجد نتيجة معيارية للصور لنقطة التحقق هذه، سواء في بطاقة النموذج الخاصة بها أو في منشور الإطلاق. ويؤكد المنشور نفسه ما هو مفقود في جانب الصوت بشكل أكثر مباشرة: إن اختبارات القياس المخصصة لقرارات الصوت هي، على حد تعبير المورّد نفسه، "مشكلة مفتوحة حاليًا".

إذن، القراءة الصحيحة لهذه المواجهة غير متناظرة، وينبغي أن تُذكر على هذا النحو. لقد أظهر LFM2.5-VL-3B قدرة بصرية مدعومة بأرقام. أما Liquid AI d1-omni-600M فلديه مُرمِّز رؤية مستعار من نموذج شقيق، ومهايئ دُرِّب مقابل عمود فقري مجمّد، وعرض تجريبي، ووعد. إذا كان نشرك يحتاج إلى أن يكون النموذج صحيحًا بشأن الصور هذا الشهر، فإن 3B هو الوحيد بين الاثنين الذي يملك ما يستند إليه.

السرعة: تم قياس واحد فقط من هذه.

لأن نموذج القرار لا يولّد شيئًا، فإن زمن الاستجابة هو الرقم المهم، ومرة أخرى هناك جانب واحد فقط موثّق. يُذكَر أن LFM2.5-VL-3B يبلغ 228 رمزًا في الثانية على Apple M5 Max و116 رمزًا في الثانية على AMD Ryzen AI Max+ 395، وكلاهما ضمن 3.3 غيغابايت من الذاكرة، مع نحو 20 رمزًا في الثانية على Galaxy S26 Ultra ونحو 11,000 رمز في الثانية على بطاقة H100 واحدة ضمن vLLM. تصف هذه الأرقام إنتاجية فك الترميز، وهو القياس الصحيح لنموذج يكتب.

بالنسبة إلى Liquid AI d1-omni-600M، تذكر البطاقة أن أرقام الاستدلال غير مُبلَّغ عنها لأن النموذج إصدار بحثي مبكر وقيد التطوير النشط. النموذج الشقيق d1-3B في العائلة نفسها لديه جداول زمن الاستجابة — 8 مللي ثانية لسؤال واحد على RTX 4090، و16 مللي ثانية على Jetson AGX Thor، و26 مللي ثانية على Jetson AGX Orin 64 GB، و50 مللي ثانية على Orin Nano، مع ثلاثة أسئلة على حالة واحدة تكلّف نحو 1.3 ضعف زمن سؤال واحد. تلك الأرقام تخصّ نموذج القرار 3B ويجب ألا تُعمَّم على 600M. بالنسبة إلى Liquid AI d1-omni-600M، الموقف الصادق هو أن البنية تعني نموذجًا صغيرًا وسريعًا، ولم ينشر أحد خارج المختبر رقمًا بالمللي ثانية.

يمكن على الأقل تقدير بصمة الأوزان. عند دقة float16 التي توصي بها البطاقة، فإن 587 مليون معلمة تعادل تقريبًا 1.2 غيغابايت من الأوزان قبل التنشيطات — وهذا حساب استنادًا إلى عدد المعلمات المنشور، وليس قياسًا من مورّد — مقابل أقل من 3.3 غيغابايت التي تعلنها Liquid لـ LFM2.5-VL-3B. على جهاز تكون فيه الميغابايتات هي القيد، يمثل هذا الفارق الحجة الداعمة لطراز 600M.

A capture of Liquid AI's own blog post 'Open d1: Edge decision models for text, vision, and audio' dated Oct 7, 2026, showing the opening paragraph that announces d1-3B and d1-omni-600M as released that day, d1-3B's 48.57 Decision Index v0.2.1 score, and its 8 ms, 16 ms and 26 ms latencies on an RTX 4090, a Jetson AGX Thor and a Jetson AGX Orin.

كيف تختار بينهما

يتضح القرار بجلاء متى ما تم التعامل مع عقد المخرجات باعتباره ثابتًا غير قابل للتفاوض.

اختر LFM2.5-VL-3Bعندما يكون المُخرَج نصًا: التعرّف الضوئي على الحروف لكامل الصفحة مع تعليق على التخطيط، والإسناد والكشف انطلاقًا من استعلامات باللغة الطبيعية، وترجمة اللافتات على الجهاز، وأي خطوة يستهلك فيها إنسان أو نموذج لغوي لاحق الإجابة. كما يمتلك سياقًا أوسع عند 32,768 رمزًا وتغطية لغوية أعمق عمليًا، لأن إجاباته لغة وليست تصنيفات.

اختر Liquid AI d1-omni-600M عندما يكون المُخرَج قرارًا: توجيه تذكرة، أو فرز إطار، أو الإشراف على مقطع، أو تفعيل بوابة حاجز حماية، أو تقييم استجابة على مقياس من اثنين إلى عشرة — وبشكل فريد بين هذين الاثنين، عندما يكون المُدخَل كلامًا. إنه الوحيد بين الاثنين الذي يقبل الصوت على الإطلاق، حتى 30 ثانية لكل طلب، مع أن بطاقته تذكر أن الصوت دُرِّب على محادثات بين متحدث بالإنجليزية ومساعد، وهو وصف ضيّق للعالم الذي ستأتي منه استدعاءاتك.

لا تلجأ إلى أيٍّ منهما، وابقَ مع نموذج عام للرؤية واللغة، إذا كانت المهمة تتطلب استدلالًا حول الصورة بدلًا من قراءة لها أو إصدار حكم بشأنها. فبطاقتا النموذجين لا تشير أيٌّ منهما إلى حالة الاستخدام تلك، ولا يملك Liquid AI d1-omni-600M أي آلية لمحاولة ذلك.

تجربة نقطة تحقق تجريبية دون المراهنة بخط الأنابيب بالكامل عليها

إن Liquid AI d1-omni-600M، وفقًا لتصنيف المورّد نفسه، إصدار بحثي مبكر، وسلوكه في الرؤية والصوت لم يخضع لاختبارات قياسية. وهذا بالضبط هو النمط الذي يجعلك تريد تقييم نموذج خلف مسار احتياطي بدلًا من وضعه أمام العملاء. يوجّه OrcaRouter أكثر من 200 نموذج عبر مفتاح API واحد مع التبديل الاحتياطي التلقائي بين المزوّدين، وهي الطريقة الرخيصة لوضع نقطة تحقق كهذه على مسار حي: إذا تدهور المسار التجريبي أو تعطّل أحد المزوّدين، ينتقل الطلب إلى المسار الاحتياطي دون تغيير في الشفرة البرمجية. المفتاح نفسه يغطي كل نموذج يحيل إليه خط الأنابيب، بسعر قائمة كل مزوّد مُمرَّرًا بهامش ربح 0%، لذا فإن أي تخفيض سعر من المورّد يصبح سعرك في اليوم نفسه.

تنبيه واحد، أذكره لأنه جوهري: نماذج d1 المفتوحة وعائلة LFM2.5-VL ليست في كتالوجنا اليوم. استضافة الأوزان ذاتيًا هي المسار الذي يوصي به المورّد لكليهما، مع دعم llama.cpp منذ اليوم الأول عبر عتاد Apple وAMD وQualcomm وNVIDIA، أما تشغيلها على نقطة نهاية مستضافة فيعني واجهة برمجة التطبيقات الخاصة بالمورّد أو منصات طرف ثالث. وقراءة هذه الصفحة على أنها إقرار بالتوافر ستكون خطأً.

A capture of Liquid AI's documentation site showing the left navigation (Liquid Foundation Models with Text, Vision, Audio, Decision Models and Liquid Nanos entries, plus Fine-tuning, Edge Inference and llama.cpp), the 'New: Open d1' banner, and the opening description of Liquid Foundation Models as a class of multimodal architectures built for fast inference and on-device deployment.

ماذا تشاهد

السؤال المثير ليس ما إذا كان 600M سيتفوق في النهاية على 3B في أي شيء — لن يفعل ذلك، ولم يُبنَ لهذا الغرض. بل ما إذا كانت Liquid AI تنشر تقسيم الرؤية الخاص الذي حجبته، وما إذا كان أي شخص يبني معيار قرار صوتي تقول المختبر إنه غير موجود بعد. وإلى أن يتحقق أحد هذين، تظل المقارنة بين Liquid AI d1-omni-600M وLFM2.5-VL-3B مقارنة بين نموذج مقيس وآخر معقول. وبالنسبة للعمل غير المقيس — كلام يدخل، وحكم يخرج، وصغير بما يكفي ليستقر على الجهاز — فإن 600M هو نقطة التحقق الوحيدة مفتوحة الأوزان في هذه العائلة التي تحاول ذلك، وأن تكون الأول بلا لوحة نتائج يظل كونه الأول.

يوجّه OrcaRouter أكثر من 200 نموذج عبر مفتاح API واحد، مع سعر القائمة لكل مزوّد يمرّ إليك دون هامش ربح بنسبة 0% لذا فإن أي تخفيض سعر من المورّد يصبح سعرك في اليوم نفسه.