
LFM2.5-2.6B-DSpark: نموذج المسودة بحجم 328M الذي يجعل وكيل Liquid المحلي يعمل أسرع بمقدار 2.3×
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
لا أحد خارج Liquid AI قام بتشغيل LFM2.5-2.6B-DSpark على أجهزته الخاصة ونشر رقمًا حتى الآن. هذه هي البداية الصادقة مع هذا النموذج، لأن الأمر برمته يعتمد على ادعاء بالأداء: إنه ليس نموذج 2.6B أفضل، بل هو نموذج مسودة بمعاملات 328M يقع أمام النموذج العاملي 2.6B المسمى LFM2.5-2.6B ويقترح عليه رموزًا (tokens) للتحقق منها، وبذلك يعمل النموذج العاملي بسرعة مضاعفة تقريبًا دون تغيير مخرجاته.
تم إصدار LFM2.5-2.6B-DSpark في 20 أغسطس 2026 مع وصف تقني على Hugging Face ومنشور مصاحب على مدونة Liquid الرسمية. وهو النموذج الرئيسي لعائلة صغيرة من نقاط تفتيش الصياغة لفك الترميز التخميني التي نشرتها Liquid في ذلك اليوم. كل ما يرد أدناه في عمود السرعة تم قياسه من قِبل البائع ولم يتم تأكيده بشكل مستقل بعد؛ وكل ما في المستودع، والتنسيقات، ودعم الأطر البرمجية، هو متاح فقط للتحقق منه.
ما هو DSpark في نَفَس واحد
فك الترميز التخميني هو حيلة تشغيل نموذج مسودة رخيص قبل النموذج الحقيقي: يُخمِّن المُخمِّن الدفعة التالية من الرموز، ويتحقق الهدف من الدفعة كلها في تمرير أمامي واحد، ويحتفظ بالرموز التي يتفق عليها. عندما تكون التخمينات صحيحة، تحرّك عدة رموز مقابل سعر رمز واحد، لذا يرتفع الإنتاجية دون لمس أوزان الهدف. DSpark — التقنية التي اقترحها باحثو DeepSeek في يوليو 2026 وطُبّقت بالفعل في DeepSeek-V4 — هي نسخة من هذه الحيلة مضبوطة للنماذج الصغيرة على الجهاز. تسميها Liquid "فك الترميز التخميني المجدول بالثقة"، ولها ثلاثة أجزاء متحركة: عمود فقري متوازٍ ينتج حالات خفية لجميع رموز المسودة في تمرير واحد، ورأس تسلسلي خفيف الوزن يمثل الاعتماد بين الرموز المتجاورة بحيث لا ينهار معدل القبول في نهاية الكتلة، وجهاز تحقق يقلّص اللواحق منخفضة الثقة عندما يكون فحصها أكثر تكلفة من التوفير الناتج عنه.

ذلك الجزء الأخير هو ما يجعل DSpark مختلفًا عن المُصِيغ العادي: فهو لا يدفع دائمًا كتلة كاملة عبر التحقق. عندما تشير ثقة المُصِيغ نفسه إلى أن لاحقةً من غير المرجح أن تُقبل، فإنه يقطع الكتلة قبل اكتمالها ويوفّر الحساب المُهدر. تتكوّن كتلة المُصِيغ من تسع توكنات، لذا يتحقق الهدف من عشر توكنات كحد أقصى في كل مرة.
المُعدّ، بالأرقام
نقطة تفتيش LFM2.5-2.6B-DSpark هي نموذج مسودة يعتمد على الانتباه فقط بحجم 0.3 مليار معامل: خمس طبقات انتباه كاملة (حجم مخفي 2,048، انتباه استعلام مجمّع بـ 32 رأسًا و8 رؤوس مفاتيح-قيم)، ومفردات من 128 ألف رمز، ورأس ماركوف برتبة 256، ورأس ثقة. درّبته Liquid لمدة 15 حقبة على مزيج من بيانات التعليمات والمحادثة والكود واستدعاء الدوال — على أجهزة AMD — واختارت الحقبة بناءً على أعلى معدل قبول بدلاً من أقل خسارة.
معدل القبول هذا هو الرقم الذي يحدد قيمة المُصمِّم. عبر خمسة معايير قياس بحجم دفعة 1 ودرجة حرارة 0، حقق نموذج LFM2.5-2.6B-DSpark متوسط 4.83 رمزًا مقبولًا لكل خطوة فك ترميز على H100 و4.42 على M4 Max — أي ما يقرب من نصف الكتلة المقبولة، وهذا هو مصدر تسريع السرعة بمقدار الضعفين.
التسريعات، المُعلَّمة
جميع الأرقام التالية مأخوذة من قياسات Liquid AI الخاصة — SGLang على معالج H100 واحد بسعة 80GB بصيغة BF16، وllama.cpp مع الواجهة الخلفية Metal على M4 Max MacBook Pro بصيغة FP16 GGUF، بحجم دفعة 1، ودرجة حرارة 0 — ولم يتم إعادة إنتاج أي منها بواسطة طرف مستقل حتى وقت كتابة هذا التقرير:
• متوسط H100 — 2.67×، من 323 إلى 864 رمزًا/ثانية. حسب المعيار: MATH500 3.06×، HumanEval 2.56×، MBPP 2.64×، GSM8K 2.22×، MT-Bench 2.87×.
• متوسط M4 Max — 2.27×، من 61 إلى 139 توكن/ثانية. وفقًا للمعيار: MATH500 2.25×، HumanEval 2.63×، MBPP 2.11×، GSM8K 2.36×، MT-Bench 1.99×.
• {{1}}استدعاء الأدوات{{/1}} — في سيناريوهات استدعاء الدوال متعددة الأدوات، انخفض متوسط زمن الاستجابة بنسبة 57%.
• سياق العائلة — أكبر نموذج مُصمم في العائلة، LFM2.5-8B-A1B-DSpark، حقق حتى 3.18× على H100، والنموذج 1.2B حتى 2.87× على M4 Max؛ أرقام 2.6B أعلاه هي في منتصف المجموعة.

أمران في هذه الأرقام مهمّان إلى جانب المتوسطات. أولاً، تُقاس عند درجة حرارة 0 وحجم دفعة 1 — الإعداد الذي يفضّل التخمين، والذي تعمل في ظله غالبية مهام الوكلاء التفاعلية على الجهاز. وضمان التطابق ينطبق هنا أيضًا: فك الترميز التخميني يتحقق من كل رمز مقترح، لذا في ظل فك الترميز الجشع يكون النص المُخرَج مطابقًا تمامًا لما كان النموذج الهدف لينتجه وحده. ثانيًا، تضيق الفجوة مع ارتفاع التزامن: على معالج H100 واحد، تُفيد Liquid بأن ميزة DSpark تتقارب عند حجم دفعة 128، لذا فإن المُصيغ يعد مكسبًا في زمن الاستجابة لأحمال العمل التفاعلية والكثيفة الأدوات، وليس حلًا سحريًا للإنتاجية الخام لخادم يعمل بأقصى طاقته.
ما هو المؤكد، وما هو غير المؤكد؟
مؤكد، بمعنى أن المستودع عام ويمكن التحقق منه: المُعدّ يُوفَّر بصيغة Safetensors (BF16) وGGUF؛ وهو يعمل مع نموذج LFM2.5-2.6B المُدرَّب لاحقًا، وليس مع النموذج الأساسي؛ الدعم من اليوم الأول وصل إلى الإصدار الرئيسي في llama.cpp (مع نوى Metal تجريبية) وفي SGLang؛ وهو مرخّص بموجب رخصة LFM Open License v1.0 الخاصة بـLiquid؛ والأهم لأي شخص يخطط للاعتماد عليه — تشير بطاقة النموذج إلى أنه لا يوجد مزود استدلال يقدمه، لذا فهو مكوّن تشغّله بنفسك.
{{1}}لم يُؤكَّد بعد{{/1}}: {{2}}أنّ تسارع الأداء يُعاد إنتاجه على عتاد وتكوينات أخرى{{/2}} {{3}}(لم ينشر أيُّ شخص خارج Liquid قياسًا لذلك){{/3}}، {{4}}وكيف يتصرّف المُصيغ في ظل أخذ العينات بدلًا من فك التشفير الجشع{{/4}}، {{5}}وهل تظلّ قيمة زمن استجابة استدعاء الأدوات البالغة 57% صحيحة عبر بيئات الوكلاء الحقيقية خارج بيئة الاختبار التي استخدمتها Liquid{{/5}}. {{6}}ليست أيٌّ من تلك النقاط اتهامًا{{/6}} — {{7}}فالإصدار لم يتجاوز عمره يومًا واحدًا{{/7}} — {{8}}لكنها الفرق بين رقم واعد ورقم مُتحقَّق منه{{/8}}.

تشغيله
في SGLang، تستخدم إصدارًا يدعم DSpark، وتشغّل الخادم على النموذج المستهدف، وتسمّي المُسوِّدة: الخوارزمية التخمينية هي DSPARK، ومسار نموذج المسودة يشير إلى LiquidAI/LFM2.5-2.6B-DSpark، ويُقرأ حجم الكتلة من ملف config.json الخاص بالمسودة. وفي llama.cpp، تقوم بتحميل GGUF المستهدف مع GGUF المسودة كنموذج مسودة، وتضبط نوع المواصفات إلى draft-dspark، مع قراءة حجم الكتلة من البيانات الوصفية الجانبية (sidecar metadata). كلا التكاملين مدمجان في الإصدار الرئيسي (upstreamed)، لذا لا حاجة إلى تفرعات — فقط إصدار جديد بما يكفي ليشملهما.
عندما يستحق الإضافة
يكسب LFM2.5-2.6B-DSpark ذاكرته الإضافية البالغة حوالي 0.3 غيغابايت عندما تنشر فعليًا وكيل 2.6B حيث صمّمته Liquid ليعمل — على هاتف أو حاسوب محمول أو جهاز طرفي — لأحمال العمل التفاعلية أو لاستدعاء الأدوات التي تكون مقيدة بزمن الاستجابة وتعمل بأسلوب جشع. هذا هو بالضبط السيناريو الذي يحقق فيه الرقم 2.27× للأداء على الجهاز وخفض زمن استجابة استدعاء الأدوات بنسبة 57% تأثيرهما. يصبح الأمر أقل أهمية إذا كنت تقدّم الخدمة بدفعات عالية على خادم (حيث يتقارب تسارع الأداء نحو 1×)، أو إذا كان حمل عملك يعمل عند درجة حرارة أعلى من الصفر، حيث تتوقف الأرقام المذكورة عن الانطباق. وإذا كنت تستخدم متغير 8B-A1B من العائلة، فلاحظ الحالة الخاصة: تسارعه على الجهاز يبلغ حوالي 1.18× فقط اليوم، لأن التحقق من الرموز المسودة ينشّط المزيد من الخبراء في الواجهة الخلفية Metal الخاصة بـ llama.cpp — وتصنّف Liquid هذا كأمر معروف.
لا شيء في DSpark يغيّر مكان تشغيل وكيل 2.6B — فهو بطبيعته مسألة استضافة ذاتية، وسيعمل جنبًا إلى جنب مع النماذج المستضافة التي تستدعيها بالفعل. ذلك المزيج من نموذج مسودة محلي واثنتي عشرة نقطة نهاية API هو بالضبط نوع البنية التحتية الذي توجد طبقة التوجيه لاختزاله: مفتاح API واحد عبر أكثر من 200 نموذج، وتحويل تلقائي عند تدهور أداء مزود الخدمة، وأسعار المزودين المعلنة تُمرَّر بهامش ربح 0%، فتظل مقارنة التكلفة بين تشغيل وكيل من فئة 2.6B محليًا واستضافته واضحة بدلًا من أن تكون حبيسة جدول بيانات.
الطريقة الصحيحة لقراءة LFM2.5-2.6B-DSpark اليوم هي النظر إليه باعتباره ادعاءً واعدًا بالسرعة، وفق قياسات البائع، ولم يُتحقق منه بعد بشكل مستقل، وهو مرتبط بنقطة تحقق حقيقية قابلة للتنزيل والتشغيل. إذا قمت بنشر وكيل 2.6B على الجهاز، فإن نموذج المسودة رخيص في تجربته وسهل في إزالته — أضِف علامتَي فك الترميز التخميني إلى أمر SGLang، وحافظ على فك الترميز الجشع، وقِس الأداء وفق عبء العمل الخاص بك قبل أن تثق في رقم 2.3×. المستودع موجود؛ والتحقق المستقل هو البند المفتوح.
