
LFM2.5-VL-3B-DSpark مقابل LFM2.5-VL-3B: لا تختار واحدًا، بل تُرفِق واحدًا
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 181 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
البحث الذي يجلب الناس إلى هنا هو مقارنة، لكن الجواب الصادق هو أن LFM2.5-VL-3B-DSpark وLFM2.5-VL-3B ليسا شيئين تختار بينهما. فالثاني نموذج بصري-لغوي بحجم 3.1B يمكنك تنزيله وتشغيله. أما الأول فهو نموذج مسودة بمعاملات 279.5M، لا يوجد إلا ليجلس أمام الثاني ويجعله يفكّ الترميز أسرع. أخرج نموذج المسودة من المنظومة فلن ينتج شيئًا؛ ولا يمكنك قياس أدائه بمفرده، لأن «بمفرده» ليس إعدادًا يدعمه. المقارنة الحقيقية هي بين تشغيل LFM2.5-VL-3B وحده مقابل تشغيل النموذج نفسه مع نموذج المسودة المرتبط به.
اقرأها بهذه الطريقة وستتقلص المسألة إلى سؤال واحد: هل تمنحك الذاكرة الإضافية وتعقيد وقت التشغيل الإضافي ما يكفي من زمن الاستجابة ليكون مهمًا لعبء العمل لديك؟ أرقام Liquid AI الخاصة تقول نعم للعمل المكثف على فك التشفير، وتقول صراحةً لا عندما تهيمن التعبئة المسبقة. لم يُعَد إنتاج أيٍّ من هذين الجانبين خارج الشركة.
نقطتا التفتيش، جنبًا إلى جنب
ما يختلف بينهما هو القصة كاملة، لذا يجدر وضع المستودعين جنبًا إلى جنب قبل أن يبدأ الجدال حول السرعة.
• الدور — يولّد LFM2.5-VL-3B النصوص ويجيب عن الصور؛ ويقترح LFM2.5-VL-3B-DSpark رموزًا لتتحقق منها، ولا يولّد شيئًا قابلًا للاستخدام بمفرده
• المعاملات — 3.1B للنموذج الهدف، و279.5M بصيغة BF16 لنموذج المسودة، وهو ما تُقدّره Liquid بزيادة نسبتها 8.9% في عدد المعاملات المنشورة.
• البنية المعمارية — الهدف هو نموذج هجين مبني على عمود فقري LFM2.5-2.6B مع مشفّر رؤية SigLIP2 NaFlex؛ أما المُسوِّد فهو 4 طبقات انتباه كامل بحجم خفي 2,048 مع انتباه الاستعلامات المجمّعة بالإضافة إلى رأس ماركوف ورأس ثقة
• نافذة السياق — 32,768 رمزًا للهدف؛ لا يحمل المُصيغ أي سياق خاص به ويرث سياق الهدف
• مُشفِّر الرؤية — SigLIP2 NaFlex 400M على النموذج الهدف؛ لا يمتلك المُسوِّد أيًّا منه ولا يرى الصورة مباشرةً
• المفردات — 128,000، ويُربَط تضمين نموذج المسودة ورأس LM بالنموذج الهدف بدلًا من تكرارهما، ولهذا فإن العبء على الذاكرة أصغر مما قد توحي به 279.5 مليون معلمة
• الترخيص — كلاهما يُصدر بموجب ترخيص LFM1.0 من Liquid، وهو مصنّف كـ"أخرى" على Hugging Face بدلاً من ترخيص OSI، لذا اقرأ الشروط قبل النشر التجاري
• الصيغ — يُتاح النموذج الهدف بصيغ safetensors وGGUF وONNX وتكميمات MLX؛ ويُتاح نموذج المسودة بصيغة safetensors وملف GGUF واحد بصيغة F16 بحجم يقارب 567 ميغابايت

هناك سطر واحد في تلك القائمة يستحق التأكيد لأنه السبب الميكانيكي وراء نجاح هذا الاقتران من الأساس: فالمُسوِّد ليس نموذج رؤية صغيرًا. فهو لا يملك مُرمِّز رؤية ولا يلمس الصورة إطلاقًا. وبحلول الوقت الذي تصل فيه الرموز إلى الطبقات المخفية التي يبني منها مسودته، تكون رقعة الصورة ورمز النص مجرد موترات، لذا يصبح نوع الوسائط غير مرئي لحساب الصياغة. وهذا ما مكّن Liquid من نقل تقنية طُوّرت لنماذج النصوص إلى نموذج VLM دون إعادة تصميمه.
ما الذي يغيّره مُعِدّ المسودة، وما الذي يتركه دون تغيير
لا يتغير النموذج الهدف. هذا ليس تسويقًا — بل هو خاصية الصواب في فك الترميز التخميني. في ظل فك الترميز الجشع، يتحقق النموذج الهدف من كل رمز مسودة، لذا تكون المخرجات تمامًا كما كان النموذج الهدف سينتجه بمفرده. وفي إعدادات أخذ العينات المتطابقة عند درجة حرارة غير صفرية، يتطابق توزيع المخرجات مع توزيع النموذج الهدف. يقايض المُسوِّد الذاكرة بالوقت ولا يمس أي شيء آخر.
مما يعني أن كل رقم جودة يمكنك العثور عليه لـ LFM2.5-VL-3B ينطبق دون تغيير على الإعداد المقرون. وفقًا لتقييم Liquid الخاص، يحقق النموذج الهدف 80.7 على ScreenSpot-v2، و61.5 على BLINK، و58.3 على MuirBench، و73.1 على MME، و63.3 على MMStar، و81.3 على ChartQA و88.7 على POPE — جميعها مُبلَّغ عنها من البائع، ولم يُعِد أحد إنتاجها بشكل مستقل، وكلها صحيحة بالقدر نفسه سواء كان المُسوّد مُرفقًا أم لا. لا توجد هنا مقايضة بين الجودة والسرعة يجب الموازنة بينها، وأي صفحة مقارنة تعرض إحداها فقد أساءت قراءة النموذج.
ما يتغير هو تكلفة التوكن في الزمن الفعلي. تقيس Liquid تسريعات فك التشفير من 2.04× إلى 2.66× على H100 واحدة بدقة BF16 عبر SGLang بحجم كتلة 9، ومن 2.30× إلى 3.13× على Apple M5 Max عبر MLX-VLM بحجم كتلة 8، ومن 1.57× إلى 2.14× على M3 Ultra عبر llama.cpp. من البداية إلى النهاية، تصل التشغيلات نفسها إلى 1.64×–2.27×، و1.56×–2.62×، و1.30×–1.77× على التوالي. هذه الأزواج هي الحجة بأكملها: يتحسن فك التشفير بنحو ضعف ما يتحسنه الأداء من البداية إلى النهاية، والفجوة هي الجزء من عبء العمل الذي لا يستطيع مُعِدّ المسودة لمسه.
مشكلة التعبئة المسبقة كما ذكرها المورّد

الجملة الأكثر فائدة في إعلان Liquid نفسه هي تلك التي تجادل ضد قراءة غير محدودة لعنوانه الرئيسي. يدفع الاستدلال البصري اللغوي تكلفة تعبئة مسبقة لا يدفعها الاستدلال النصي: تمر الصورة عبر مشفّر رؤية، ثم تعالج البنية اللغوية الأساسية مئات الرموز البصرية التي ينتجها ذلك المشفّر. على جهاز طرفي، تشكل تلك التعبئة المسبقة حصة كبيرة من زمن الاستجابة من طرف إلى طرف. لا يسرّع فك التشفير التخميني سوى فك التشفير — أما ترميز الرؤية والتعبئة المسبقة فيبقيان دون تغيير. وحيث تهيمن التعبئة المسبقة، يتحول تسريع فك التشفير بمعامل 3× إلى مكسب أصغر بكثير من طرف إلى طرف.
ذلك هو قانون أمدال مطبَّقًا من المورّد على منتج المورّد نفسه، وينبغي أن يحدّد مَن يقرأ هذه الصفحة. نسخ طويل لصفحة ممسوحة ضوئيًا واحدة، أو تعليق توضيحي، أو محادثة متعددة الأدوار تحمل صورة واحدة إلى الأمام — وهي ثقيلة في فك الترميز، ويستحق نموذج المسودة معاملاته البالغة 279.5 مليون. أما السؤال القصير عن صورة كبيرة عالية الدقة، فهو ثقيل في مرحلة التعبئة المسبقة، ولا يستحق ذلك. ضع الهدف نفسه على خادم عند تزامن مرتفع، فتتغير الصورة مرة أخرى: تقيس Liquid حدودًا بين الإنتاجية والتفاعلية بدلًا من رقم واحد، وتفيد بأن DSpark يحافظ على ميزته عند كل مستوى تزامن جرى اختباره، بينما تضيق الفجوة مع ارتفاع التزامن.
ملاحظتان أصغر بشأن تحديد النطاق من نفس المصدر. تستخدم جميع القياسات معالجة 16-بت لكل من مُرمِّز الرؤية والعمود الفقري اللغوي، كما أن تسريع النماذج المُكمَّمة خارج نطاق الإصدار. إذا كانت خطتك هي إقران تصدير هدف 4-بت بنموذج المسودة لأن كل جاذبية نموذج VLM بحجم 3B تكمن في استيعابه في بضعة غيغابايتات، فإن هذا المزيج ليس ما تم قياسه.
ما الذي يكلّفك إياه إرفاقه فعليًا

الذاكرة هي التكلفة الظاهرة، والبطاقة تقدّم قياسًا كميًا لها: معاملات أكثر بنسبة 8.9% في حزمة النشر. أما تعقيد وقت التشغيل فهو التكلفة غير المرئية. يحتاج SGLang إلى الإصدار v0.5.19 أو أحدث، وإلى سطر تشغيل يحمل --speculative-algorithm DSPARK، ومسار نموذج المسودة وحجم الكتلة؛ كما أن مثال البطاقة نفسه يعطّل ذاكرة التخزين المؤقت الجذرية (radix cache) ويثبّت نسبة ذاكرة ثابتة، وهذه قرارات تقديم خدمة عليك الآن التفكير فيها. يحتاج MLX-VLM إلى الإصدار v0.7.2 أو أحدث، ويستقبل المُسوِّد عبر --draft-model، لكن فك ترميز DSpark هناك يستخدم حاليًا أخذ العينات الجشع، لذا يجب إجبار درجة الحرارة على 0 — وهو قيد حقيقي إذا كان تطبيقك يعتمد على تنوّع أخذ العينات. يعمل llama.cpp عبر مُسوِّد GGUF مقترنًا بهدف GGUF، وليس بنقطة حفظ safetensors الأصلية.
هناك تكلفة أخرى تظهر في بيئة الإنتاج لا في الاختبارات المعيارية: فعلى النموذج المُسوِّد والنموذج الهدف أن ينتقلا معًا. وتباين الإصدارات بينهما نمط فشل لا وجود له في نشر يعتمد على نموذج واحد، كما أن ترقية أيٍّ منهما على حدة أصبحت الآن مشكلة تتعلق بمكوّنين اثنين.
هذا اقتران مستضاف ذاتيًا. لا يوجّه OrcaRouter النموذج LFM2.5-VL-3B أو نموذج المسودة الخاص به — فأنت تنزّل كليهما وتشغّلهما بنفسك — لذا فإن مسألة التوجيه تتعلق بكل ما يسلّمه النموذج الصغير إلى غيره. معظم عمليات النشر التي تقرن نموذج VLM طرفيًا بحجم 3B بنموذج المسودة لا تزال لديها استعلامات لا ينبغي للنموذج الصغير الإجابة عنها، وإرسال تلك إلى نقطة نهاية واحدة تغطي أكثر من 200 نموذج بسعر القائمة لدى كل مزوّد، مع تجاوز فشل تلقائي إذا تدهور أداء أحد المزوّدين، هو تكامل واحد بدلًا من تكامل لكل مزوّد. كما يعني أنه في اللحظة التي يخفض فيها أحد المزوّدين سعرًا، يعكس سعرك ذلك في اليوم نفسه بدلًا من انتظار تجديد العقد التالي.
أي واحد يجب تنزيله؟
إذا كان عبء العمل لديك ثقيلًا على جانب فك التشفير (decode)، وكانت أجهزتك واحدة من الأجهزة الثلاثة التي اختبرتها Liquid، فأرفق نموذج المسوّد (drafter) — فالجانب السلبي محدود، لأن المخرجات يمكن إثبات أنها مخرجات النموذج الهدف، وتكلفة الذاكرة أقل من عُشر نموذج. إذا كان زمن الاستجابة لديك يغلب عليه طور التعبئة المسبقة (prefill)، أو كنت تشغّل هدفًا مُكمَّمًا (quantized)، أو تعتمد على أخذ عينات غير جشع (non-greedy sampling) في بيئة تشغيل لم ترفع هذا القيد، فشغّل LFM2.5-VL-3B وحده. إنه سريع بمقاييسه الخاصة: 228 رمزًا في الثانية على M5 Max، و116 على AMD Ryzen AI Max+ 395، و20 على Galaxy S26 Ultra، وكلها أرقام من الشركة المصنّعة، في نحو 3 غيغابايت من الذاكرة.
ما لا يمكن لأحد أن يخبرك به بعد هو ما إذا كانت أرقام Liquid تصمد على عتادك. كان لنموذج المسودة 37 عملية تنزيل على Hugging Face وقت كتابة هذا، ولم توجد أي إعادة إنتاج مستقلة لأي رقم في جداوله. الهندسة سليمة، وحجة الصحة برهان لا مجرد ادعاء، لكن المقدار قياس — والقياسات الصادرة عن مختبر واحد على مجموعة واحدة من الأجهزة هي بالضبط نوع الأرقام التي ينبغي أن تتحقق منها بنفسك قبل أن تضعها في خطة سعة.
يصل OrcaRouter إلى أكثر من 200 نموذج عبر مفتاح واحد، مع تمرير سعر القائمة لدى كل مزوّد كما هو دون أي هامش ربح بنسبة 0%، والتحويل التلقائي بين المزوّدين عند الفشل. سعر قائمة المزوّد يُمرَّر كما هو دون هامش ربح بنسبة 0% الاقتران في هذه الصفحة مستضاف ذاتيًا في كل الأحوال - فالموجّه مخصّص لكل ما يسلّمه النموذج الصغير، وهو يعني أن أي خفض في سعر المزوّد يظهر في سعرك في اليوم نفسه.
