بطاقة عنوان رئيسية مكتوب عليها «LFM2.5-VL-3B-DSpark» تحت سطر تمهيدي «مُسوّد الرؤية واللغة»، مع عنوان فرعي «مُسوّد بحجم 279.5M لـ LFM2.5-VL-3B من Liquid AI - رفع الأوزان في 18 سبتمبر 2026، قبل ستة أيام من إعلان أي أحد لها». ثلاث بطاقات أدناه تقرأ «معاملات المسودة 279.5M - 4 طبقات، رأس Markov، رأس ثقة»، و«حجم الكتلة 9 - 8 على Apple silicon؛ 3.2-4.5 رمزًا مقبولًا في كل تمريرة»، و«ذاكرة أكثر بنسبة 8.9% - المخرجات هي مخرجات الهدف بشكل قابل للإثبات، دون تغيير». تذييل يقرأ «كل رقم تسريع مُقاس من قبل المورّد Liquid AI؛ لا توجد إعادة إنتاج مستقلة حتى الآن». شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Engineering & Research

LFM2.5-VL-3B-DSpark: درافتر Liquid AI بحجم 279.5 مليون صدر قبل ستة أيام من إعلان أي شخص عنه

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

هناك نسخة من هذه القصة يكون فيها LFM2.5-VL-3B-DSpark نموذجًا جديدًا. لكنه ليس كذلك. إنه نموذج مسودة للفك التخميني بمعاملات تبلغ 279.5 مليون معامل، وُجد لغرض واحد فقط — جعل نموذج الرؤية واللغة الخاص بـ Liquid AI، وهو LFM2.5-VL-3B، يفك ترميزه بشكل أسرع — ولا يمكنه توليد إجابة قابلة للاستخدام بمفرده. السبب الذي يجعله يستحق القراءة عنه على أي حال هو الجدول الزمني: فقد وصلت الأوزان إلى Hugging Face في 18 سبتمبر 2026، دون أي إعلان مصاحب، وظلت هناك ستة أيام، ولم تحصل إلا على منشور مدونة من المورّد في 24 سبتمبر. وقد رصد Radar المستودع في تلك الفجوة.

تلك الفجوة هي أيضًا حدود ما يمكن معرفته الآن. كل شيء في المستودع — تفصيل المعاملات، وحجم الكتلة، وتكاملات الأطر، والترخيص — هو ملف على القرص يمكنك أنت أو أنا فتحه. وكل رقم من أرقام التسريع مقيس من قبل المورّد، من أداة القياس المعيارية الخاصة بـ Liquid، ولم ينشر أحد خارج الشركة إعادة إنتاج. تُبقي هذه المقالة هاتين الكومتين منفصلتين عن قصد.

ما الذي يحتويه المستودع فعليًا

افتح بطاقة النموذج وستجد أن شكل الشيء لا لبس فيه. LFM2.5-VL-3B-DSpark هو نموذج مسودة هدفه مثبّت في بياناته الوصفية: base_model: LiquidAI/LFM2.5-VL-3Bلا توجّهه إلى نموذج مختلف ولا تقدّمه وحده.

• إجمالي معلمات المسودة — 279.5 مليون، BF16، منها 193.0 مليون لمكدس فك الترميز رباعي الطبقات، و65.5 مليون لرأس ماركوف، و21.0 مليون لإسقاط الحالة المخفية، و6.4 ألف لطبقات التطبيع ورأس الثقة

• الهيكل الأساسي — 4 طبقات انتباه كاملة، الحجم المخفي 2,048، الحجم الوسيط 6,144 مع SiLU/SwiGLU، انتباه الاستعلامات المجمَّعة عند 32 رأس انتباه و8 رؤوس مفتاح-قيمة، بُعد الرأس 64

• رؤوس إضافية — رأس ماركوف برتبة 256 ورأس ثقة، وهذا ما يفصل توليد مسودة DSpark عن مُسوّد متوازٍ عادي

• حجم الكتلة — 9 أثناء التدريب؛ 8 أو 9 عند الاستدلال حسب العتاد، و8 تحديدًا على Apple silicon

• المفردات — 128,000، مرتبطة بالهدف بدلاً من أن يحملها المسود

• الوزن في حزمة النشر — تقول Liquid إن نموذج المسودة يزيد عدد المعاملات المنشورة بنسبة 8.9%

A single-column infographic titled 'LFM2.5-VL-3B-DSpark - the numbers' with the subtitle 'Every figure below was measured by Liquid AI, on Liquid AI's hardware'. Six rows read: 'Decode speedup, single H100 80GB - SGLang' at '2.04x - 2.66x'; 'Decode speedup, Apple M5 Max - MLX-VLM' at '2.30x - 3.13x'; 'End-to-end speedup across all three stacks' at '1.30x - 2.62x'; 'Draft tokens accepted per verification pass' at '3.2 - 4.5'; 'Extra memory in the deployed stack' at '8.9%'; and 'Repository interest at time of writing' at '37 downloads, 6 likes'. The footer reads 'Vendor-measured. No third-party reproduction of any figure in this table exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

8.9% هو الرقم الذي ينبغي التمسك به. الطرح الترويجي لهذه الفئة من النماذج ليس أبدًا «الاستدلال الأسرع مجاني»؛ بل هو «الاستدلال الأسرع يكلفك نحو عُشر ذاكرة النموذج». عند 279.5 مليون معامل إضافي فوق نموذج هدف بحجم 3.1 مليار، تكون هذه ضريبة أصغر مما قد يوحي به حجم المُسوِّد وحده، لأن التضمين ورأس LM مرتبطان بالنموذج الهدف ولا يتم تكرارهما.

DSpark هي تقنية DeepSeek قبل أن تكون نموذج Liquid

إن هذه التسمية تثير الارتباك، لذا من الأفضل أن نكون دقيقين. إن DSpark ليست من ابتكار Liquid AI وليست عائلة نماذج. إنها إطار لفك التشفير التخميني من خط بحثي منفصل، وُصف في ورقة بحثية صادرة في يوليو 2026 بأنه فك تشفير تخميني مجدول بالثقة مع توليد شبه ذاتي الانحدار. أفكاره الثلاثة: عمود فقري متوازٍ يُعدّ مسودة كتلة كاملة في تمريرة أمامية واحدة، ووحدة تسلسلية خفيفة الوزن تعيد بعض الاعتماد بين رموز المسودة المتجاورة بحيث لا ينهار القبول في نهاية الكتلة، ومُدقّق يختصر نافذة التحقق لكل طلب عندما توحي ثقة المسودة نفسها بأن الذيل سيكون

ما فعله Liquid هو تطبيق تلك الوصفة على نماذج الرؤية واللغة وإصدار نقطة تحقق. البطاقة صريحة في أن هذا النقل أقل إثارة مما يبدو: فمن وجهة نظر مُعِدّ المسودة، لا يهم النمط، لأنه بحلول الوقت الذي تصل فيه الرموز إلى الطبقات المخفية، تكون رقعة الصورة ورمز النص مجرد موترات. لهذا السبب تنتقل تقنية طُوِّرت على نماذج نصية إلى نموذج رؤية ولغة دون إعادة اختراعها — ولهذا أيضًا لا يمكن تسويق مُعِدّ المسودة كقدرة جديدة.

كانت Liquid قد طرحت بالفعل نماذج DSpark النصية للمسودة — فقد صدرت النماذج المرافقة 2.6B و8B-A1B و1.2B-Instruct في أغسطس 2026، ثم صدرت ملفات GGUF المصدّرة في 19 أغسطس. أما نموذج المسودة البصري فهو الفكرة نفسها موسّعة إلى الفرع متعدد الوسائط، وهو الإصدار الرابع أو الخامس في سلسلة، وليس أول ظهور.

أرقام التسريع، ومن قام بقياسها

كل رقم أدناه صادر عن Liquid نفسها، وقد جُمع على البنية التحتية الخاصة بـ Liquid لقياس الأداء، ولا يوجد لأيٍّ منه تكرار مستقل. تعامل معها على أنها حدّ أقصى معلن من المورّد، لا كنتيجة متوقعة. وتفصل البطاقة بين التسريع في فك الترميز والتسريع من طرف إلى طرف، وهذا أمر يهم أكثر من الرقم الرئيسي.

• أفضل تسريع لفك التشفير — 3.13× على COCO، مقيس باستخدام MLX-VLM على Apple M5 Max عند حجم كتلة 8، FP16، حجم دفعة 1، درجة حرارة 0

• أفضل تسريع لفك الترميز على GPU — 2.66× على COCO، SGLang على بطاقة H100 80GB واحدة، BF16، حجم الكتلة 9

• أفضل تسريع لفك ترميز llama.cpp — 2.14× على COCO، Apple M3 Ultra، حجم الكتلة 8

• نطاق فك التشفير على H100 عبر ست مهام رؤية — من 2.04× إلى 2.66×، مع أداء من طرف إلى طرف يتراوح بين 1.64× و2.27×

• نطاق فك التشفير M5 Max — من 2.30× إلى 3.13×، ومن طرف إلى طرف من 1.56× إلى 2.62×

• نطاق فك الترميز لـ M3 Ultra — من 1.57× إلى 2.14×، ومن طرف إلى طرف من 1.30× إلى 1.77×

• قبول المسودة — نحو 3.2 إلى 4.5 رمزًا مقبولًا لكل تمريرة تحقق للهدف، على المكدسات الثلاثة جميعًا

النمط في تلك النطاقات هو الجزء الصادق. المكاسب من طرف إلى طرف هي باستمرار النصف الأصغر من كل زوج، لأن النموذج المُسوِّد يسرّع فك الترميز ولا شيء آخر. لاحظ أيضًا أن النموذج المُسوِّد نفسه، عند حجم الكتلة نفسه، يبلغ 3.13× على منظومة واحدة و1.57× على أخرى — معدل القبول خاصية للنموذج المُسوِّد وعبء العمل، لكن المكسب في الزمن الفعلي خاصية للعتاد والعبء الإضافي لبيئة التشغيل. إن ادعاء "أسرع بـ 2.66×" دون منظومة مرفقة ليس ادعاءً يمكنك التصرف بناءً عليه.

نقطتان تتعلقان بالصحة في البطاقة يجدر ذكرهما بوضوح، لأنهما ما يجعل مُعِدّ المسودة مقبولًا في الإنتاج أصلًا. في ظل فك الترميز الجشع، يكون فك الترميز التخميني دقيقًا تمامًا: يتحقق النموذج الهدف من كل رمز مقترح، فيكون النص هو ما كان النموذج الهدف سينتجه بمفرده. وفي ظل إعدادات أخذ عينات متطابقة عند درجة حرارة غير صفرية، فإنه يحافظ على توزيع مخرجات النموذج الهدف. صياغة Liquid — تحصل على التسريع، لا على نموذج مختلف — دقيقة في حدود ما تذهب إليه، والبطاقة صادقة في أن رفع درجة الحرارة يخفض القبول، ومن ثمّ يقوّض فائدة الإنتاجية.

ما يقرّ به منشور Liquid نفسه

A screenshot of Liquid AI's own blog post 'LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond', dated SEP 24, 2026, on the company's English-language site. A bar chart above the headline compares 'LFM2.5-VL-3B (Baseline)' with 'LFM2.5-VL-3B-DSpark', labelling the pair '67 tok/s' and '220 tok/s'. The visible opening text reads 'Today, we release an experimental DSpark draft model for our vision-language model (VLM) LFM2.5-VL-3B' and quotes 'decoding throughput improvements of up to 2.66 on GPUs and 3.13x on edge devices, with end-to-end throughput gains of up to 2.27 and 2.62', noting the model 'is available on Hugging Face, with support in llama.cpp, SGLang, and MLX-VLM'.

تدوينة 24 سبتمبر أكثر فائدة من بطاقة النموذج لسبب واحد: أنها تسمّي القيد. يدفع الاستدلال البصري اللغوي تكلفة تعبئة مسبقة لا يدفعها الاستدلال النصي — فعلى الصورة أن تمر عبر مُرمّز رؤية، ثم يتعين على العمود الفقري اللغوي أن يعالج مئات الرموز البصرية التي ينتجها ذلك المُرمّز. وعلى الجهاز، تهيمن هذه التعبئة المسبقة على زمن الاستجابة من البداية إلى النهاية. لا يسرّع الفك التخميني إلا مرحلة الفك. أما الترميز البصري والتعبئة المسبقة فلم يمسهما شيء. يستدعي Liquid قانون أمدال ضد منتجه نفسه، ويشير إلى أنه عندما تشكّل التعبئة المسبقة حصة كبيرة من الزمن الفعلي، فإن تسريعًا كبيرًا لمرحلة الفك لا يحقق إلا تحسنًا متواضعًا من البداية إلى النهاية.

هذا قيد حقيقي على قرار الشراء، وهو يفسّر لماذا لا يكون الزمن حتى أول رمز ضمن قائمة الأشياء التي يحسّنها هذا المُسوِّد. كما يعني ضمناً أن أحمال العمل التي تستفيد أكثر من غيرها هي تلك التي تولّد مخرجات طويلة انطلاقاً من صورة متواضعة — كتعليق توضيحي، أو استخراج نص OCR طويل، أو محادثة متعددة الأدوار مع الاحتفاظ بصورة واحدة عبر الأدوار — بدلاً من تلك التي تجيب عن سؤال قصير حول صورة كبيرة.

يضيف المنشور حدين إضافيين لنطاق التطبيق. تعتمد جميع الأرقام على معالجة بدقة 16 بت لكل من مشفّر الرؤية والعمود الفقري اللغوي، كما أن تسريع النماذج المكمّمة خارج نطاق هذا الإصدار. وبما أن نقطة البيع الأساسية لنموذج VLM طرفي بحجم 3B هي التشغيل ضمن بضعة غيغابايتات، فإن قياس التسريعات عند FP16 يُعد تحذيرًا مهمًا لأي شخص كان يخطط لإقرانه بتصدير 4-بت. وتشير Liquid أيضًا إلى أن نموذج المسودة دُرِّب بالكامل على عتاد AMD.

تشغيله

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-VL-3B-DSpark showing 'Like 6', the license 'lfm1.0' and 'Model size 0.3B params  Tensor type BF16'. The card text specifies 'Target model: LiquidAI/LFM2.5-VL-3B', 'Draft parameters: 279.5M (BF16)', a backbone of 4 full attention layers at hidden_size=2048 with grouped-query attention (32 attention heads, 8 key-value heads, head_dim 64), a Markov head of rank 256 plus a confidence head, 'Block size: 9 during training; 8 or 9 at inference', a vocabulary of 128,000, and the notes 'On Apple silicon the drafter is run at block size 8 rather than 9' and 'Use each drafter checkpoint with its corresponding target model'. A related-papers panel lists 'MMSpec: Benchmarking Speculative Decoding for Vision-Language' (arXiv 2603.14989).

دعم اليوم الأول حقيقي ويغطي ثلاث بيئات تشغيل، وهو أكثر مما تحصل عليه معظم أدوات الصياغة. يتطلب SGLang على NVIDIA الإصدار v0.5.19 أو أحدث ويأخذ أداة الصياغة عبر --speculative-algorithm DSPARK مع مسار الصياغة وحجم كتلة 9. يتطلب MLX-VLM على Apple silicon الإصدار v0.7.2 أو أحدث ويكتشف أداة الصياغة عندما يتم تمريرها مع --draft-model؛ هناك نقطة حساسة واحدة — فك تشفير DSpark في MLX-VLM يستخدم حاليًا أخذ العينات الجشع، لذلك يجب ضبط درجة الحرارة على 0. بالنسبة لـ llama.cpp هناك مستودع GGUF منفصل، مع تصدير F16 واحد بحجم 567 ميغابايت تقريبًا، والبطاقة توضح صراحة أنه يجب عليك إقران أداة الصياغة المُكمّاة بالهدف المُكمّى بدلاً من نقطة التحقق الأصلية safetensors.

حيث تكسب طبقة التوجيه مكانتها هنا ليس على هذا النموذج — فلا يوجّه OrcaRouter النموذجين LFM2.5-VL-3B-DSpark أو LFM2.5-VL-3B، وهذا إقران لنموذج مسودة مستضاف ذاتيًا تقوم بتنزيله وتشغيله بنفسك. بل تكسبها على بقية المنظومة المحيطة به. التطبيق نفسه الذي يشغّل نموذجًا بصريًا صغيرًا مفتوح الأوزان على الجهاز لديه عادةً مسار احتياطي للاستعلامات التي لا يستطيع النموذج الصغير معالجتها، وتوجيه ذلك المسار إلى نقطة نهاية واحدة تغطي أكثر من 200 نموذج — تُفوتر بسعر قائمة كل مزوّد دون إضافة أي هامش، مع تحويل تلقائي عند تدهور أحد المزوّدين — يعد تكاملًا أصغر من إبرام عقد مع مورّد ثانٍ. يحسّن نموذج المسودة أحد جانبي تلك البنية؛ أما الموجّه فهو ما يمنع الجانب الآخر من أن يصبح مشروعًا ثانيًا.

ما لم يُعرف بعد

يحتوي المستودع على 37 عملية تنزيل و6 إعجابات وقت كتابة هذه السطور. لا يوجد أي إدخال لهذا النموذج المسودة لدى أي مُجمِّع عام لاختبارات الأداء المعيارية، ولا أي إعادة إنتاج من طرف ثالث لأي من نطاقات التسريع، ولا أي قياس مستقل لمعدل القبول على عتاد لم تختبره Liquid. ولا توجد أيضاً اختبارات جودة معيارية على البطاقة لأسباب واضحة — فنموذج المسودة يحافظ على المخرجات بحكم بنيته، لذا فإن أرقام الجودة تعود إلى LFM2.5-VL-3B، وتشير البطاقة إلى اختبارات ذلك النموذج المعيارية بدلاً من ابتكار اختباراتها الخاصة.

أحد التفاصيل في البيانات الوصفية يمثّل إشارة صغيرة إلى مدى حداثة هذا الأمر: يحمل النموذج وسم مكتبة SGLang وعَلَم خوارزمية SGLang موجود تحديدًا لاستدعائه. كان لا بد أن يصل دعم إطار العمل قبل الإعلان، وهو ما يتسق مع الفارق البالغ ستة أيام بين المستودع ومنشور المدونة.

إذن: عمل هندسي أصيل ومفيد ومحدود النطاق، أُعلن عنه بعد أسبوع من طرحه، وتكمن فكرة قيمته بأكملها في رقم يقيسه المورّد على عتاد قد لا تملكه. إذا كنت تقدّم LFM2.5-VL-3B على H100 أو جهاز Mac من سلسلة M وكان عبء عملك كثيفًا في فك الترميز، فإن تكلفة الذاكرة تبلغ 8.9% والجانب السلبي يقترب من الصفر لأن المخرجات هي مخرجات الهدف بشكل قابل للإثبات. وإذا كان زمن الاستجابة لديك يهيمن عليه الطور التمهيدي، أو كنت تعوّل على التصدير رباعي البت، فإن منشور Liquid نفسه يخبرك بأنه لن يفيد. أما إعادة الإنتاج، حين تأتي، فهي الشيء الذي ينبغي انتظاره.

يضع OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد بسعر قائمة المزوّد وبهامش ربح 0%، ويعبّر عن مسار الاحتياط على شكل طبقة توجيه بدلًا من كود التطبيق. ونموذج الصياغة مستضاف ذاتيًا على أي حال — والموجّه هو ما يمنع المرحلة التي يحيل إليها نموذجك الصغير من أن تصبح مشروعًا ثانيًا.