بطاقة عنوان رئيسية للمقارنة بين LFM2.5-8B-A1B-DSpark وQwen3-8B، بعنوان فرعي «المسودة التي تسرّع النموذج، في مواجهة نموذج 8B الذي يشغّله الجميع بالفعل»، تُظهر على اليسار صندوقًا باسم «Draft 327M» يرسل رقاقات توكن إلى بطاقة MoE مكوّمة من البلاطات باسم «LFM2.5-8B-A1B» مع مؤشر عداد سرعة مرتفع تحت تسمية «SPECULATIVE DECODING»، وعلى اليمين بطاقة فقاعة دردشة تحمل اسم «Qwen3-8B» مع أيقونة شرارة وساعة تحت تسمية «GENERALIST MODEL»، مع علامة تاريخ «أغسطس 2026» وشعار OrcaRouter مدمجًا في الزاوية السفلية اليمنى.
Guides & Insights

LFM2.5-8B-A1B-DSpark مقابل Qwen3-8B: النموذج المساعد الذي يسرّع النموذج، في مواجهة 8B الذي يشغّله الجميع بالفعل

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أصدرت Liquid AI نقطة التحقق المسودة LFM2.5-8B-A1B-DSpark في 20 أغسطس 2026 — وهي أداة مساعدة لفك الترميز التخميني بعدد معاملات يبلغ 327.7 مليونًا، تجعل نموذج LFM2.5-8B-A1B من نوع خليط الخبراء الطرفي (edge MoE) يولّد أسرع بما يصل إلى 3.18× على شريحة H100 واحدة. وقبل أن تكون هذه المقارنة نزيهة، علينا أن نضع حقيقة واحدة على الطاولة: نقطة التحقق DSpark ليست نموذجًا يمكنك استدعاؤه؛ بل تسرّع نموذجًا آخر فقط. لذا فإن سؤال النشر الفعلي الذي يغذّيه هذا الإصدار هو السؤال نفسه الذي ظلّت معظم الفرق تزنه طوال العام — LFM2.5-8B-A1B أم Qwen3-8B، نموذجان مفتوحا الوزن من فئة 8B يمرّان بلحظتين مختلفتين تمامًا في مساريهما.

الإطار مهم هنا أكثر من المعتاد، لأن الجانبين ليسا من النوع نفسه. Qwen3-8B نموذج كامل وقابل للنشر يمكنك استضافته ذاتيًا أو شراء رموز له اليوم. LFM2.5-8B-A1B هو أيضًا نموذج كامل وقابل للنشر — مسودة DSpark هي إضافة إليه، وليست نسخة منه. كل ما تعد به المسودة قياسات من البائع ولم يمضِ عليها سوى يوم واحد؛ وكل ما يتعلق بالمستودعات والتنسيقات موجود ببساطة ليتم التحقق منه. هذا المقال يُبقي هاتين الفئتين منفصلتين.

أولاً، كلمة "DSpark" ليست هي الاسم في هذه الجملة.

يعمل فك التشفير التخميني بتشغيل نموذج مسودة رخيص قبل النموذج الحقيقي: حيث يخمّن نموذج المسودة الدفعة التالية من الرموز، ويتحقق النموذج الهدف من الكتلة بأكملها في تمرير أمامي واحد، ويحتفظ بما يتوافق عليه. عندما تكون التخمينات جيدة، يمكنك التقدم بعدة رموز مقابل تمرير تحميل أوزان واحد، وبالتالي يزداد الإنتاج دون لمس أوزان الهدف — ولأن الهدف يفحص كل رمز مقترح، فإن المخرجات في فك التشفير الجشع تكون مطابقة لتشغيل LFM2.5-8B-A1B بمفرده. تسمي Liquid هذا الأمر "خالٍ من الخسارة بالتصميم"، وهو السبب الكامل الذي يجعل إضافة مسودة آمنة.

نموذج LFM2.5-8B-A1B-DSpark من Liquid هو مُسوِّدة صغيرة بقصد: خمس طبقات انتباه فقط، وكتلة من تسعة رموز مقترحة لكل خطوة، ورأس ماركوف فوق مفردات النموذج المستهدف المكوَّنة من 128,000 رمز، مُدرَّب لمدة 15 عصرًا على مزيج من بيانات الدردشة والبرمجة واستدعاء الدوال، مع اختيار نقاط التوقف حسب معدل القبول بدلاً من الخسارة. وهو واحد من ثلاث مسودات أصدرها البائع في ذلك اليوم، إلى جانب LFM2.5-1.2B-Instruct وLFM2.5-2.6B، وكلٌّ منها بصيغتي Safetensors وGGUF مع دعم من اليوم الأول لكلٍّ من SGLang وllama.cpp. وهو أيضًا — وهذا مهم لأي شخص يقرأ مقارنة مع نموذج من فئة 8B — لا يُقدَّم عبر أي موفّر استدلال وليس له سعر لكل رمز. إنه يعيش فقط داخل حزمة فك الترميز التخميني الخاصة بك.

A screenshot of the Hugging Face model page for LiquidAI/LFM2.5-8B-A1B-DSpark, showing the tags TextGeneration, Safetensors, sglang, qwen3_speculative-decoding, dspark and lfm2_lfm2_moe draft model, the lfm1.0 license, a 0.3B model size, the 'Inference Providers' section, and the card text 'LFM2.5-DSpark is a family of speculative-decoding draft models that adapt DSpark for the LFM2.5 architecture' (captured August 21, 2026).

النموذجان اللذان يتم نشرهما فعليًا

بغضّ النظر عن المسودة، فإن المقارنة الحقيقية تكون بين النموذج الذي تسرّعه والنموذج الحالي. كلاهما مفتوح الأوزان ويصنَّف تقريبًا ضمن فئة 8B، وعند هذه النقطة ينتهي التشابه:

• البنية — LFM2.5-8B-A1B هو نموذج MoE متفرق بإجمالي 8.3 مليار معامل لكن ~1.5 مليار معامل نشط فقط لكل رمز؛ بينما Qwen3-8B هو نموذج كثيف بـ8.2 مليار معامل يُفعّل كل معامل في كل رمز.

• الإصدار — تم إصدار LFM2.5-8B-A1B في 28 مايو 2026؛ بينما تم إصدار Qwen3-8B في أبريل 2025، وهو نموذج يتجاوز عمره عامًا، وقد أصبح مهملاً بالفعل على بعض منصات التشغيل.

• السياق — يوفر LFM2.5-8B-A1B سياقًا أصليًا بسعة 128K مع مفردات من 128K رمزًا؛ بينما يوفر Qwen3-8B سعة أصلية تبلغ 32K، قابلة للتوسيع إلى حوالي 128K عبر YaRN.

• الاستدلال — LFM2.5-8B-A1B هو نموذج استدلال يُصدر سلسلة أفكار صريحة؛ بينما Qwen3-8B يتبدّل بين وضعي التفكير وعدم التفكير حسب كل طلب.

• الذكاء — وفقًا لـ Artificial Analysis، يسجّل LFM2.5-8B-A1B مؤشر ذكاء قدره 8، بينما يسجّل Qwen3-8B 8–8.3، وكلاهما أدنى من الوسيط البالغ 9 للنماذج مفتوحة الوزن المشابهة؛ لا يُعدّ أيٌّ منهما عقلًا طليعيًا، وكلاهما صادق بشأن ذلك.

• السرعة — وفقًا لتحليل Artificial Analysis، يُخرج LFM2.5-8B-A1B ما يقارب 340 رمزًا في الثانية عبر مزودي الخدمة؛ بينما يبلغ أداء Qwen3-8B حوالي 37–40 رمزًا في الثانية، مما يجعله من بين الأبطأ في فئته.

• الترخيص — يخضع LFM2.5-8B-A1B لترخيص LFM المفتوح من Liquid الإصدار 1.0؛ بينما يخضع Qwen3-8B لترخيص Apache-2.0.

A comparison scoreboard for LFM2.5-8B-A1B and Qwen3-8B. The left column shows the Liquid model as an MoE with 8.3B total and 1.5B active parameters, 128K native context, an AA Intelligence Index of 8 (median 9), roughly 340 tokens per second across providers, the DSpark draft adding up to 3.18x on an H100 but only 1.18x on an M4 Max, and self-host-only availability. The right column shows Qwen3-8B as a dense 8.2B model, 32K native context extended to ~128K via YaRN, an AA Intelligence Index of 8-8.3, roughly 37-40 tokens per second, no draft needed, and availability through Alibaba's API plus many open hosts, with a footer reading 'LFM speedups vendor-measured Aug 20 2026, unreproduced; throughput per Artificial Analysis; Qwen3-8B per Alibaba' and the OrcaRouter logo in the bottom-right corner.

السرعة هي حيث يتوقف هذا عن كونه متقاربًا

السبب الأكبر وراء انتقال الحديث عن نماذج الوزن المفتوح من فئة 8B هو السرعة مقابل وحدة الذاكرة. Qwen3-8B نموذج كثيف: كل رمز (token) ينتجه يتدفق عبر جميع أوزانه البالغة 8.2B عبر ناقل الذاكرة، ولهذا فهو بطيء بالنسبة لحجمه ويحتاج إلى ذاكرة VRAM حقيقية. أما LFM2.5-8B-A1B فيوجّه كل رمز عبر حوالي 1.5B معلمة نشطة، وهذه هي نقطة التصميم الأساسية — MoE على الجهاز يبقى سريعًا وصغير الحجم. ادعاءات Liquid نفسها تذهب أبعد: حوالي 253 رمزًا في الثانية على معالج M5 Max CPU مع أقل من 6GB من الذاكرة، وفقًا لتقارير البائع. بالنسبة للإنتاجية الخام للنموذج القابل للنشر، فإن المسودة لا تهم حتى في هذا الجزء من القصة — فـ MoE أسرع بالفعل عدة مرات من نموذج 8B الكثيف قبل إضافة أي تخمين.

فيما يتعلق بالسعر، فكلاهما ذو أوزان مفتوحة، لذا فإن استضافة أيٍّ منهما ذاتيًا تكلفك بقدر تكلفة عتادك. لكن المقارنة من حيث الاستضافة غير متوازنة من ناحية التوافر: إذ تُقدَّم Qwen3-8B عبر واجهة برمجة تطبيقات علي بابا بسعر معلن قدره 0.18 دولار لكل مليون رمز إدخال و2.10 دولار لكل مليون رمز إخراج، كما توفرها مجموعة واسعة من مضيفي النماذج المفتوحة من جهات خارجية؛ بينما لا تمتلك LFM2.5-8B-A1B تسعيرًا ملحوظًا لرموز الاستضافة من الطرف الأول، ولا تمتلك النسخة الأولية أي تسعير على الإطلاق. وهذا يعني أن الطريقة العملية التي ستشغّل بها معظم الفرق نموذج MoE الطرفي من Liquid اليوم هي الاستضافة الذاتية، على حاسوب محمول، أو صندوق طرفي، أو وحدة معالجة رسوميات يمتلكونها — وهذا هو بالضبط الإعداد الذي تصبح فيه النسخة الأولية من DSpark متغيرًا ذا صلة.

ما الذي تغيّره المسودة فعليًا في هذا القرار

المسودة تغيّر محورًا واحدًا فقط: سرعة إنتاج نموذج LFM2.5-8B-A1B للرموز في مكدّس تقديم تتحكم فيه. وهي لا تجعل النموذج أكثر ذكاءً، ولا تغيّر إجاباته — فالمخرجات الجشعة مطابقة بتًّا بتًّا لما ينتجه النموذج الهدف وحده. أما حيث تفيد فعلًا فهو تقديم الخدمة عبر GPU عند إنتاجية طلبٍ واحد: فقد قاس فريق Liquid متوسط تسارع قدره 2.54× على شريحة H100 واحدة عبر خمسة معايير أداء (من 418 إلى 1,074 رمزًا في الثانية)، مع أفضل نتيجة بلغت 3.18× على MATH500، وذلك بحجم دفعة 1 ودرجة حرارة 0. وأما حيث لا تفيد إلا بالكاد فهو أجهزة Apple Silicon: إذ بلغ متوسط تسارع النموذج نفسه 1.18× فقط على M4 Max (من 90 إلى 106 رموز/ثانية)، لأن التحقق من كتلة رموز المسودة ينشّط عددًا أكبر من الخبراء في النهاية الخلفية Metal MoE الحالية في llama.cpp، وينقل المزيد من بيانات الأوزان — وهذه بالضبط التكلفة التي صُمم فك الترميز التخميني لاستيعابها. وهذه كلها أرقام مقدمة من المطوّر في يوم الإصدار، ولم يُعَد إنتاجها بشكل مستقل.

هذا التقسيم يترجم مباشرةً إلى قاعدة قرار. إذا {{1}}كنت تقدّم LFM2.5-8B-A1B على وحدة معالجة رسومية (GPU) تملكها{{/1}}، فإن المسودة تُعدّ رافعة حقيقية للتكلفة — فهي توفّر ما يقرب من 2.5× عدد الرموز في الثانية من نفس الشريحة، دون أي تغيير في المخرجات، ولا تحتاج إلا إلى نسخة تتضمن تكاملات DSpark الصادرة في 20 أغسطس. أما إذا {{2}}استدعيت النموذج عبر واجهة برمجة التطبيقات (API) بدلاً من ذلك{{/2}}، فسيحتفظ مزوّد الخدمة بالتسارع ولن تكون المسودة ذات صلة بك. وإذا كان الجهاز حاسوبًا محمولًا أو هاتفًا، فإن مسودة هذا النموذج تحديدًا تكاد تكون بلا تأثير اليوم؛ فالمسودات الشقيقة للنموذجين الكثيفين LFM2.5-1.2B-Instruct وLFM2.5-2.6B هي التي تحقق المكاسب عند التشغيل على الجهاز، بمعدل 2.54× و2.27× على التوالي. أما Qwen3-8B فلا يحتاج إلى مسودة إطلاقًا — فهو ببساطة نموذج أبطأ وأكثر كثافة لا يتطلب فك الترميز التخميني ليكون قابلًا للنشر.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B, showing the TextGeneration tag, Transformers and Safetensors formats, the qwen3 conversational tag, the apache-2.0 license, and the Qwen3 Highlights describing the ability to switch seamlessly between thinking mode and non-thinking mode (captured August 18, 2026).

الاختيار، بعد عام من عمر Qwen3-8B

Qwen3-8B هو الخيار الافتراضي الممل والصحيح: ناضج، ومرخّص بموجب Apache-2.0، ويدعم 119 لغة، مع أوضاع تفكير وعدم تفكير، ومتاح في كل مكان، ولا يزال عامًا جيدًا تمامًا للدردشة والبرمجة والنصوص المنظمة. مشاكله تكمن في العمر والسرعة — نموذج كثيف عمره 16 شهرًا بحجم 8B، بطيء مقارنة بفئته، وأصبح مهملاً بالفعل على بعض المنصات، وهي إشارة صيانة تستحق أخذها على محمل الجد إذا كنت تبدأ مشروعًا جديدًا من الصفر اليوم.

LFM2.5-8B-A1B هو الرهان الأحدث والأضيق: نموذج MoE يضع الحافة أولاً، مصمم لاستدعاء الأدوات واتباع التعليمات بسرعة على الأجهزة الاستهلاكية، مع مسودة DSpark كتعزيز اختياري للخدمة في حالة الاستضافة الذاتية عبر GPU. إنه ليس نموذجًا أذكى — فكلاهما يقعان تحت متوسط الأوزان المفتوحة على Artificial Analysis — لكنه أسرع بشكل كبير مع جزء صغير من الذاكرة لكل رمز (token)، وهو المقايضة المهمة للوكلاء على الأجهزة. تحذيراته هي الصورة المعكوسة لنموذج Qwen3-8B: إصدار أحدث، لا تسعير استضافة من الطرف الأول، وقصة فك تخميني (speculative decoding) لم يتمكن أحد خارج البائع من إعادة إنتاج أرقامها بعد.

طبقة التوجيه الأساسية تبقى كما هي في كلتا الحالتين. لا LFM2.5-8B-A1B ولا Qwen3-8B موجودة اليوم في الكتالوج المستضاف لدى OrcaRouter، لذا فإن التأطير الصادق هو ما يفعله الموجّه لهذا المزيج: واجهة برمجة تطبيقات واحدة عبر أكثر من 200 نموذج مستضاف، مع تمرير أسعار المزوّدين المعلنة بهامش ربح 0%، بحيث يصبح أي تخفيض من البائع ساريًا على المنصة في اليوم نفسه الذي يُعلَن عنه؛ وتجاوز فشل تلقائي يجعل النموذج الجديد غير المُثبَت شيئًا تجرّبه على حركة مرور حقيقية بدلًا من أن تراهن عليه في مسار إنتاجي؛ ولغة DSL للتوجيه يمكنها أن تُقدّم نموذجًا تخدمه بنفسك، وهي الكيفية التي يتعايش بها مكدّس LFM2.5-8B-A1B المستضاف ذاتيًا مع نقاط نهاية مستضافة خلف مفتاح واحد.

إذا كنت تبني لتطبيق على حاسوب محمول أو جهاز حافة وتهتم بسرعة استدعاء الأدوات، فإن LFM2.5-8B-A1B هو الاتجاه الذي يجب أن تختبره، والمسودة تمنحك تسريعًا مجانيًا بمقدار 2.5× على مسار خدمة GPU عندما يحين الوقت. إذا أردت نموذجًا عامًا لا تحتاج إلى التفكير فيه بعد الآن، فإن Qwen3-8B لا يزال يعمل — فقط اعلم أنه نموذج من أوائل 2025 بدأ النظام البيئي في التحول بعيدًا عنه. الشيء الوحيد الذي لا تغيّره المسودة ولا النموذج المستهدف هو الحالة الصادقة للأدلة: كل ما هو سريع في إصدار DSpark هو قياس من بائع واحد في يوم واحد، والمعايير المستقلة هي البند المفتوح الذي يحدد مقدار ما تثق به فعليًا.